Sistema de arquivos local
Crawl documentos que são armazenados em um sistema de arquivos local.
IBM Cloud Pak for Data IBM Software Hub
Essas informações se aplicam apenas a implementações instaladas.
Quais documentos estão engatinados
- Somente tipos de arquivo que são suportados pelo Discovery em seu caminho de arquivo são submetidos a crawl; todos os outros são ignorados. Para obter mais informações, consulte Tipos de arquivos suportados.
- Apenas arquivos no diretório
/mntou em um de seus subdiretórios podem ser acessadas pelo crawler - Somente os arquivos com extensões de arquivo que correspondem às regras de filtro de extensão de arquivo especificadas são submetidos a crawl. Incluído com a liberação 4.7.0.
- Quando uma fonte é rastreada novamente, novos documentos são adicionados, documentos atualizados são modificados para a versão atual e documentos excluídos são excluídos do índice da coleção.
- Todos os conectores de origem de dados Discovery são de leitura. Independentemente das permissões que são concedidas à conta de crawl, Discovery nunca grava, atualiza ou exclui qualquer conteúdo na origem de dados original.
Etapas de pré-requisito
Antes de conectar-se à fonte de dados do Sistema de Arquivos Local, complete a seguinte etapa:
O serviço usa o armazenamento Portworx por padrão. No entanto, se você estiver usando o armazenamento de Network File System (NFS), consulte Etapas do pré-requisito para o armazenamento NFS em vez disso.
Criando e montando uma solicitação de volume persistente no pod do crawler
Antes de engatinhar um sistema de arquivos local, você deve criar uma reclamação de volume persistente e montá-lo no pod crawler. Você também precisa copiar os arquivos que deseja engatinhar para o cluster Discovery que você está
trabalhando. Se você tiver vários clusters Discovery, você deve copiar os arquivos juntamente com o arquivo crawler-pvc-portworx.yaml que você criará nesta tarefa para cada cluster.
Conclua as etapas a seguir:
-
Insira o comando a seguir para verificar o nome da
storageclassdo fornecedor Portworx:oc get storageclass | grep portworx-gp3-scÉ possível que você veja uma saída semelhante à seguinte:
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE portworx-gp3-sc kubernetes.io/portworx-volume Retain Immediate true 51d -
Crie um arquivo denominado
crawler-pvc-portworx.yamlpara definir a reclamação de volume persistente (PVC) com o seguinte conteúdo:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-portworx-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: portworx-gp3-scSubstitua
<name-of-portworx-pvc>com o nome de sua reclamação de volume persistente Portworx. Por exemplo,jdoe-pvc-portworx -
Digite o seguinte comando para criar a reivindicação de volume persistente:
oc create -f crawler-pvc-portworx.yamlUma mensagem é exibida:
persistentvolumeclaim/jdoe-pvc-portworx created -
Digite o seguinte comando para montar a reivindicação de volume persistente para o pod
crawler:oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-portworx-pvc>" } } } } }'Substitua
<name-of-portworx-pvc>com o nome de sua reclamação de volume persistente Portworx. Por exemplo,jdoe-pvc-portworx. -
Insira o comando a seguir para copiar os arquivos dos quais você deseja executar crawl para a solicitação de volume persistente Portworx dinâmico.
Você só precisa executar esse comando uma vez em um dos pods existentes do
crawler. A reivindicação de volume persistente é compartilhada entre todos os podscrawlereingestion-api. Substitua as variáveis no comando com as informações adequadas.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Você montou a reclamação de volume persistente (PVC) e copiou os arquivos que deseja engatinhar para o PVC.
Como conectar a uma fonte de dados do sistema de arquivos local
Em seu projeto Discovery, conclua as seguintes etapas:
-
A partir da pane de navegação, escolha Gerenciar coleções.
-
Clique em New collection (Nova coleção ).
-
Clique em Sistema de Arquivo Local e, em seguida, clique em Avançar.
-
Nomeia a coleção.
-
Se a linguagem dos documentos que você deseja engatinhar não for o inglês, selecione a linguagem apropriada.
Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.
-
Opcional: Alterar o cronograma de sincronização.
Para obter mais informações, consulte Opções de planejamento de Crawl.
-
Na seção Especifique o que você deseja engatinhar, insira o caminho de arquivo que deseja engatinhar no campo Caminho e, em seguida, clique em Adicionar.
O caminho do arquivo diferencia maiúsculas de minúsculas. Lembre-se, somente os arquivos no diretório
/mntou um de seus subdiretórios podem ser acessadas pelo crawler -
Opcionalmente, inclua mais caminhos de arquivo.
-
Se você desejar limitar os tipos de arquivos a serem incluídos na coleção, será possível listar as extensões de arquivo para os tipos de arquivo a serem incluídos ou excluídos
Para obter uma lista de tipos de arquivos suportados, consulte Tipos de Arquivos Suportados
Suporte para essa opção foi incluído com a liberação 4.7.0.
-
Se você deseja que o crawler extraia texto a partir de imagens em documentos, expanda Mais configurações de processamentoe configure Aplicar reconhecimento de caracteres ópticos (OCR) a
On.Quando o OCR é ativado e seus documentos contêm imagens, o processamento demora mais. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.
-
Clique em Finish.
A coleção é criada rapidamente. É preciso mais tempo para que os dados sejam processados conforme ele é adicionado à coleção.
Se você quiser verificar o progresso, acesse a página Atividade. A partir da pane de navegação, clique em Gerenciar coleções e, em seguida, clique para abrir a coleção.
Etapas de pré-requisito para armazenamento NFS
Escolha um dos métodos a seguir para ativar o pod crawler para acessar o sistema de arquivos:
- Configurar um servidor NFS externo
- Configurar o provisionamento dinâmico com uma classe de armazenamento NFS
Configurando um Servidor NFS externo
Se os arquivos ou as pastas do sistema de arquivos local dos quais você deseja executar crawl forem armazenados em um Network File System (NFS) externo, será possível usar o servidor NFS externo para criar a solicitação de volume persistente.
-
Crie um arquivo chamado
crawler-pv-nfs.yamlcom o seguinte conteúdo:apiVersion: v1 kind: PersistentVolume metadata: name: <persistent-volume-name> labels: pv-name: <persistent-volume-name> spec: capacity: storage: 10Gi accessModes: - ReadWriteMany persistentVolumeReclaimPolicy: Retain nfs: server: <NFS server hostname or IP address> path: <Path of NFS exported folder>Substitua as referências a
<persistent-volume-name>com o nome de seu volume persistente. Por exemplo,jdoe-nfs-pve inclua os detalhes do NFS externo ausente. -
Digite o seguinte comando para criar a reivindicação de volume persistente:
oc create -f crawler-pv-nfs.yamlA mensagem a seguir será exibida:
persistentvolume/jdoe-nfs-pv created -
Crie um arquivo chamado
crawler-pvc-nfs.yamlcom o seguinte conteúdo:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <persistent-volume-claim-name> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi selector: matchLabels: pv-name: <persistent-volume-name>Substitua as variáveis a seguir:
<persistent-volume-claim-name>: Especifique o nome de sua reivindicação de volume persistente. Por exemplo,jdoe-nfs-pvc.<persistent-volume-name>: Especifique o nome do seu volume persistente. Por exemplo,jdoe-nfs-pv.
-
Digite o seguinte comando para criar a reivindicação de volume persistente:
oc create -f crawler-pvc-nfs.yamlA mensagem a seguir será exibida:
persistentvolumeclaim/jdoe-nfs-pvc created -
Digite o seguinte comando para montar a reivindicação de volume persistente para o pod
crawler.Esse comando também monta a reivindicação de volume persistente para todos os pods
ingestion-api. Substitua<persistent-volume-claim-name>com o nome de sua reclamação de volume persistente. Por exemplo,jdoe-nfs-pvc.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<persistent-volume-claim-name>" } } } } }'
Configuração do provisionamento dinâmico com uma classe de armazenamento NFS
Se você quiser rastrear os arquivos ou pastas do sistema de arquivos local, mas não quiser preparar um servidor NFS extra para armazenar esses arquivos ou pastas, poderá configurar o armazenamento dinâmico usando uma classe de armazenamento NFS.
Para obter mais informações sobre os provedores de armazenamento compatíveis com o site Discovery e para comparações de armazenamento, consulte Considerações sobre armazenamento.
Antes de concluir essa tarefa, copie os arquivos que deseja rastrear para o cluster Discovery no qual está trabalhando. Se você tiver vários clusters Discovery, você deve copiar os arquivos juntamente com o arquivo crawler-pvc-dynamic.yaml que você cria nesta tarefa para cada cluster.
Conclua as etapas a seguir:
-
Insira o comando a seguir para verificar o nome da
storageclassdo fornecedor NFS:oc get storageclassUma mensagem é exibida.
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE nfs-client cluster.local/innocence-nfs-client-provisioner Delete Immediate true 177m -
Crie um arquivo que seja nomeado
crawler-pvc-dynamic.yamle adicio o seguinte conteúdo a ele:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-dynamic-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: nfs-clientSubstitua
<name-of-dynamic-pvc>pelo nome de sua reivindicação de volume persistente dinâmico NFS. Por exemplo,jdoe-dynamic-pvc. -
Digite o seguinte comando para criar a reivindicação de volume persistente:
oc create -f crawler-pvc-dynamic.yamlUma mensagem é exibida.
persistentvolumeclaim/jdoe-dynamic-pvc created -
Digite o seguinte comando para montar a reivindicação de volume persistente para o pod
crawler.Esse comando também monta a reivindicação de volume persistente para todos os pods
ingestion-api.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-dynamic-pvc>" } } } } }'Substitua
<name-of-dynamic-pvc>pelo nome de sua reclamação de volume persistente NFS na etapa anterior. Por exemplo,jdoe-dynamic-pvc. -
Insira o comando a seguir para copiar os arquivos dos quais você deseja executar crawl para a solicitação de volume persistente NFS dinâmico.
Você deve executar este comando apenas uma vez contra um dos pods
crawlerexistentes. A reivindicação de volume persistente é compartilhada entre todos os podscrawlereingestion-api. Substitua as variáveis no comando com as informações adequadas.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Você montou a reclamação de volume persistente (PVC) e copiou todos os arquivos que deseja engatinhar para o PVC.