Sistema de arquivos local

Crawl documentos que são armazenados em um sistema de arquivos local.

IBM Cloud Pak for Data IBM Software Hub

Essas informações se aplicam apenas a implementações instaladas.

Quais documentos estão engatinados

  • Somente tipos de arquivo que são suportados pelo Discovery em seu caminho de arquivo são submetidos a crawl; todos os outros são ignorados. Para obter mais informações, consulte Tipos de arquivos suportados.
  • Apenas arquivos no diretório /mnt ou em um de seus subdiretórios podem ser acessadas pelo crawler
  • Somente os arquivos com extensões de arquivo que correspondem às regras de filtro de extensão de arquivo especificadas são submetidos a crawl. Incluído com a liberação 4.7.0.
  • Quando uma fonte é rastreada novamente, novos documentos são adicionados, documentos atualizados são modificados para a versão atual e documentos excluídos são excluídos do índice da coleção.
  • Todos os conectores de origem de dados Discovery são de leitura. Independentemente das permissões que são concedidas à conta de crawl, Discovery nunca grava, atualiza ou exclui qualquer conteúdo na origem de dados original.

Etapas de pré-requisito

Antes de conectar-se à fonte de dados do Sistema de Arquivos Local, complete a seguinte etapa:

O serviço usa o armazenamento Portworx por padrão. No entanto, se você estiver usando o armazenamento de Network File System (NFS), consulte Etapas do pré-requisito para o armazenamento NFS em vez disso.

Criando e montando uma solicitação de volume persistente no pod do crawler

Antes de engatinhar um sistema de arquivos local, você deve criar uma reclamação de volume persistente e montá-lo no pod crawler. Você também precisa copiar os arquivos que deseja engatinhar para o cluster Discovery que você está trabalhando. Se você tiver vários clusters Discovery, você deve copiar os arquivos juntamente com o arquivo crawler-pvc-portworx.yaml que você criará nesta tarefa para cada cluster.

Conclua as etapas a seguir:

  1. Insira o comando a seguir para verificar o nome da storageclass do fornecedor Portworx:

    oc get storageclass | grep portworx-gp3-sc
    

    É possível que você veja uma saída semelhante à seguinte:

    NAME             PROVISIONER                    RECLAIMPOLICY  VOLUMEBINDINGMODE  ALLOWVOLUMEEXPANSION  AGE
    portworx-gp3-sc  kubernetes.io/portworx-volume  Retain         Immediate          true                  51d
    
  2. Crie um arquivo denominado crawler-pvc-portworx.yaml para definir a reclamação de volume persistente (PVC) com o seguinte conteúdo:

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <name-of-portworx-pvc>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      storageClassName: portworx-gp3-sc
    

    Substitua <name-of-portworx-pvc> com o nome de sua reclamação de volume persistente Portworx. Por exemplo, jdoe-pvc-portworx

  3. Digite o seguinte comando para criar a reivindicação de volume persistente:

    oc create -f crawler-pvc-portworx.yaml
    

    Uma mensagem é exibida:

    persistentvolumeclaim/jdoe-pvc-portworx created
    
  4. Digite o seguinte comando para montar a reivindicação de volume persistente para o pod crawler :

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-portworx-pvc>" } } } } }'
    

    Substitua <name-of-portworx-pvc> com o nome de sua reclamação de volume persistente Portworx. Por exemplo, jdoe-pvc-portworx.

  5. Insira o comando a seguir para copiar os arquivos dos quais você deseja executar crawl para a solicitação de volume persistente Portworx dinâmico.

    Você só precisa executar esse comando uma vez em um dos pods existentes do crawler. A reivindicação de volume persistente é compartilhada entre todos os pods crawler e ingestion-api. Substitua as variáveis no comando com as informações adequadas.

    oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
    

Você montou a reclamação de volume persistente (PVC) e copiou os arquivos que deseja engatinhar para o PVC.

Como conectar a uma fonte de dados do sistema de arquivos local

Em seu projeto Discovery, conclua as seguintes etapas:

  1. A partir da pane de navegação, escolha Gerenciar coleções.

  2. Clique em New collection (Nova coleção ).

  3. Clique em Sistema de Arquivo Local e, em seguida, clique em Avançar.

  4. Nomeia a coleção.

  5. Se a linguagem dos documentos que você deseja engatinhar não for o inglês, selecione a linguagem apropriada.

    Para obter uma lista de idiomas suportados, consulte Suporte ao idioma.

  6. Opcional: Alterar o cronograma de sincronização.

    Para obter mais informações, consulte Opções de planejamento de Crawl.

  7. Na seção Especifique o que você deseja engatinhar, insira o caminho de arquivo que deseja engatinhar no campo Caminho e, em seguida, clique em Adicionar.

    O caminho do arquivo diferencia maiúsculas de minúsculas. Lembre-se, somente os arquivos no diretório /mnt ou um de seus subdiretórios podem ser acessadas pelo crawler

  8. Opcionalmente, inclua mais caminhos de arquivo.

  9. Se você desejar limitar os tipos de arquivos a serem incluídos na coleção, será possível listar as extensões de arquivo para os tipos de arquivo a serem incluídos ou excluídos

    Para obter uma lista de tipos de arquivos suportados, consulte Tipos de Arquivos Suportados

    Suporte para essa opção foi incluído com a liberação 4.7.0.

  10. Se você deseja que o crawler extraia texto a partir de imagens em documentos, expanda Mais configurações de processamentoe configure Aplicar reconhecimento de caracteres ópticos (OCR) a On.

    Quando o OCR é ativado e seus documentos contêm imagens, o processamento demora mais. Para obter mais informações, consulte Reconhecimento de caracteres Ópticos.

  11. Clique em Finish.

A coleção é criada rapidamente. É preciso mais tempo para que os dados sejam processados conforme ele é adicionado à coleção.

Se você quiser verificar o progresso, acesse a página Atividade. A partir da pane de navegação, clique em Gerenciar coleções e, em seguida, clique para abrir a coleção.

Etapas de pré-requisito para armazenamento NFS

Escolha um dos métodos a seguir para ativar o pod crawler para acessar o sistema de arquivos:

Configurando um Servidor NFS externo

Se os arquivos ou as pastas do sistema de arquivos local dos quais você deseja executar crawl forem armazenados em um Network File System (NFS) externo, será possível usar o servidor NFS externo para criar a solicitação de volume persistente.

  1. Crie um arquivo chamado crawler-pv-nfs.yaml com o seguinte conteúdo:

    apiVersion: v1
    kind: PersistentVolume
    metadata:
      name: <persistent-volume-name>
      labels:
        pv-name: <persistent-volume-name>
    spec:
      capacity:
        storage: 10Gi
      accessModes:
        - ReadWriteMany
      persistentVolumeReclaimPolicy: Retain
      nfs:
        server: <NFS server hostname or IP address>
        path: <Path of NFS exported folder>
    

    Substitua as referências a <persistent-volume-name> com o nome de seu volume persistente. Por exemplo, jdoe-nfs-pv e inclua os detalhes do NFS externo ausente.

  2. Digite o seguinte comando para criar a reivindicação de volume persistente:

    oc create -f crawler-pv-nfs.yaml
    

    A mensagem a seguir será exibida:

    persistentvolume/jdoe-nfs-pv created
    
  3. Crie um arquivo chamado crawler-pvc-nfs.yaml com o seguinte conteúdo:

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <persistent-volume-claim-name>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      selector:
        matchLabels:
          pv-name: <persistent-volume-name>
    

    Substitua as variáveis a seguir:

    • <persistent-volume-claim-name>: Especifique o nome de sua reivindicação de volume persistente. Por exemplo, jdoe-nfs-pvc.
    • <persistent-volume-name>: Especifique o nome do seu volume persistente. Por exemplo, jdoe-nfs-pv.
  4. Digite o seguinte comando para criar a reivindicação de volume persistente:

    oc create -f crawler-pvc-nfs.yaml
    

    A mensagem a seguir será exibida:

    persistentvolumeclaim/jdoe-nfs-pvc created
    
  5. Digite o seguinte comando para montar a reivindicação de volume persistente para o pod crawler.

    Esse comando também monta a reivindicação de volume persistente para todos os pods ingestion-api. Substitua <persistent-volume-claim-name> com o nome de sua reclamação de volume persistente. Por exemplo, jdoe-nfs-pvc.

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<persistent-volume-claim-name>" } } } } }'
    

Configuração do provisionamento dinâmico com uma classe de armazenamento NFS

Se você quiser rastrear os arquivos ou pastas do sistema de arquivos local, mas não quiser preparar um servidor NFS extra para armazenar esses arquivos ou pastas, poderá configurar o armazenamento dinâmico usando uma classe de armazenamento NFS.

Para obter mais informações sobre os provedores de armazenamento compatíveis com o site Discovery e para comparações de armazenamento, consulte Considerações sobre armazenamento.

Antes de concluir essa tarefa, copie os arquivos que deseja rastrear para o cluster Discovery no qual está trabalhando. Se você tiver vários clusters Discovery, você deve copiar os arquivos juntamente com o arquivo crawler-pvc-dynamic.yaml que você cria nesta tarefa para cada cluster.

Conclua as etapas a seguir:

  1. Insira o comando a seguir para verificar o nome da storageclass do fornecedor NFS:

    oc get storageclass
    

    Uma mensagem é exibida.

    NAME        PROVISIONER                                     RECLAIMPOLICY  VOLUMEBINDINGMODE  ALLOWVOLUMEEXPANSION  AGE
    nfs-client  cluster.local/innocence-nfs-client-provisioner  Delete         Immediate          true                  177m
    
  2. Crie um arquivo que seja nomeado crawler-pvc-dynamic.yaml e adicio o seguinte conteúdo a ele:

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <name-of-dynamic-pvc>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      storageClassName: nfs-client
    

    Substitua <name-of-dynamic-pvc> pelo nome de sua reivindicação de volume persistente dinâmico NFS. Por exemplo, jdoe-dynamic-pvc.

  3. Digite o seguinte comando para criar a reivindicação de volume persistente:

    oc create -f crawler-pvc-dynamic.yaml
    

    Uma mensagem é exibida.

    persistentvolumeclaim/jdoe-dynamic-pvc created
    
  4. Digite o seguinte comando para montar a reivindicação de volume persistente para o pod crawler.

    Esse comando também monta a reivindicação de volume persistente para todos os pods ingestion-api.

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-dynamic-pvc>" } } } } }'
    

    Substitua <name-of-dynamic-pvc> pelo nome de sua reclamação de volume persistente NFS na etapa anterior. Por exemplo, jdoe-dynamic-pvc.

  5. Insira o comando a seguir para copiar os arquivos dos quais você deseja executar crawl para a solicitação de volume persistente NFS dinâmico.

    Você deve executar este comando apenas uma vez contra um dos pods crawler existentes. A reivindicação de volume persistente é compartilhada entre todos os pods crawler e ingestion-api. Substitua as variáveis no comando com as informações adequadas.

    oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
    

Você montou a reclamação de volume persistente (PVC) e copiou todos os arquivos que deseja engatinhar para o PVC.