Système de fichiers local

Explorer les documents stockés dans un système de fichiers local.

IBM Cloud Pak for Data IBM Software Hub

Ces informations s'appliquent uniquement aux déploiements installés.

Quels documents sont explorés

  • Seuls les types de fichier pris en charge par Discovery dans votre chemin de fichier sont explorés ; tous les autres sont ignorés. Pour plus d'informations, voir Types de fichier pris en charge.
  • Seuls les fichiers du répertoire /mnt ou de l'un de ses sous-répertoires sont accessibles par le moteur d'exploration.
  • Seuls les fichiers avec des extensions de fichier qui correspondent aux règles de filtre d'extension de fichier que vous spécifiez sont explorés. Ajouté avec l'édition 4.7.0.
  • Lorsqu'une source est réexplorée, les nouveaux documents sont ajoutés, les documents mis à jour sont modifiés dans leur version actuelle et les documents supprimés sont effacés de l'index de la collection.
  • Tous les connecteurs de source de données Discovery sont en lecture seule. Quels que soient les droits accordés au compte d'exploration, Discovery n'écrit, ne met à jour ou ne supprime jamais de contenu dans la source de données d'origine.

Procédure prérequise

Avant de vous connecter à la source de données du système de fichiers local, procédez comme suit:

Le service utilise le stockage Portworx par défaut. Toutefois, si vous utilisez le stockageNFS(Network File System), voir Etapes prérequises pour le stockage NFS à la place.

Création et montage d'une réservation de volume persistant sur le pod de moteur d'exploration

Avant de pouvoir explorer un système de fichiers local, vous devez créer une réservation de volume persistant et la monter sur le pod crawler. Vous devez également copier les fichiers que vous souhaitez explorer dans le cluster Discovery sur lequel vous travaillez. Si vous disposez de plusieurs clusters Discovery, vous devez copier les fichiers avec le fichier crawler-pvc-portworx.yaml que vous allez créer dans cette tâche sur chaque cluster.

Procédez comme suit :

  1. Entrez la commande suivante pour vérifier le nom storageclass du service de mise à disposition Portworx :

    oc get storageclass | grep portworx-gp3-sc
    

    Le résultat obtenu peut être similaire à celui présenté ci-dessous :

    NAME             PROVISIONER                    RECLAIMPOLICY  VOLUMEBINDINGMODE  ALLOWVOLUMEEXPANSION  AGE
    portworx-gp3-sc  kubernetes.io/portworx-volume  Retain         Immediate          true                  51d
    
  2. Créez un fichier nommé crawler-pvc-portworx.yaml pour définir la réservation de volume persistant (PVC) avec le contenu suivant:

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <name-of-portworx-pvc>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      storageClassName: portworx-gp3-sc
    

    Remplacez <name-of-portworx-pvc> par le nom de votre réservation de volume persistant Portworx dynamique. Exemple : jdoe-pvc-portworx

  3. Entrez la commande suivante pour créer la réclamation de volume persistant :

    oc create -f crawler-pvc-portworx.yaml
    

    Un message s'affiche:

    persistentvolumeclaim/jdoe-pvc-portworx created
    
  4. Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d' crawler :

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-portworx-pvc>" } } } } }'
    

    Remplacez <name-of-portworx-pvc> par le nom de votre réservation de volume persistant Portworx dynamique. Par exemple, jdoe-pvc-portworx.

  5. Entrez la commande ci-après pour copier les fichiers que vous souhaitez explorer sur votre réservation de volume persistant Portworx dynamique.

    Il vous suffit d'exécuter cette commande une seule fois sur l'un des pods d' crawler. La réclamation de volume persistante est partagée entre tous les pods d' crawler s et d' ingestion-api s. Remplacez les variables de la commande par les informations appropriées.

    oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
    

Vous avez monté la réservation de volume persistant (PVC) et copié les fichiers que vous souhaitez explorer dans la PVC.

Connexion à une source de données de système de fichiers local

À partir de votre projet d' Discovery, procédez comme suit :

  1. Dans le panneau de navigation, sélectionnez Gestion des collections.

  2. Cliquez sur Nouvelle collection.

  3. Cliquez sur Système de fichiers local, puis sur Suivant.

  4. Attribuez un nom à la collection.

  5. Si la langue des documents que vous souhaitez explorer n'est pas l'anglais, sélectionnez la langue appropriée.

    Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.

  6. Facultatif: modifiez la planification de synchronisation.

    Pour plus d'informations, voir Options de planification d'exploration.

  7. Dans la section Specify what you want to crawl, entrez le chemin de fichier à explorer dans la zone Path, puis cliquez sur Add.

    Le chemin d'accès au fichier est sensible à la casse. N'oubliez pas que seuls les fichiers du répertoire /mnt ou de l'un de ses sous-répertoires sont accessibles par le moteur d'exploration.

  8. Vous pouvez éventuellement ajouter d'autres chemins d'accès aux fichiers.

  9. Si vous souhaitez limiter les types de fichier à ajouter à la collection, vous pouvez répertorier les extensions de fichier pour les types de fichier à inclure ou à exclure.

    Pour obtenir la liste des types de fichier pris en charge, voir Types de fichier pris en charge.

    La prise en charge de cette option a été ajoutée avec l'édition 4.7.0.

  10. Si vous souhaitez que le moteur d'exploration extrait du texte des images des documents, développez Plus de paramètres de traitementet définissez Appliquer la reconnaissance optique des caractères (OCR) sur On.

    Lorsque la reconnaissance optique des caractères est activée et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.

  11. Cliquez sur Terminer.

La collection est créée rapidement. Le traitement des données à mesure qu'elles sont ajoutées à la collection prend plus de temps.

Si vous souhaitez vérifier la progression, accédez à la page Activité. Dans le panneau de navigation, cliquez sur Gérer les collections, puis cliquez pour ouvrir la collection.

Etapes prérequises pour le stockage NFS

Choisissez l'une des méthodes suivantes pour permettre au pod crawler d'accéder au système de fichiers:

Configuration d'un serveur NFS externe

Si les fichiers ou dossiers de système de fichiers local que vous souhaitez explorer sont stockés dans un système NFS (Network File System) externe, vous pouvez utiliser le serveur NFS externe pour créer la réservation de volume persistant.

  1. Créez un fichier nommé crawler-pv-nfs.yaml avec le contenu suivant :

    apiVersion: v1
    kind: PersistentVolume
    metadata:
      name: <persistent-volume-name>
      labels:
        pv-name: <persistent-volume-name>
    spec:
      capacity:
        storage: 10Gi
      accessModes:
        - ReadWriteMany
      persistentVolumeReclaimPolicy: Retain
      nfs:
        server: <NFS server hostname or IP address>
        path: <Path of NFS exported folder>
    

    Remplacez les références à <persistent-volume-name> par le nom de votre volume persistant. Par exemple, jdoe-nfs-pv et ajoutez les détails NFS externes manquants.

  2. Entrez la commande suivante pour créer la réclamation de volume persistant :

    oc create -f crawler-pv-nfs.yaml
    

    Le message suivant s'affiche :

    persistentvolume/jdoe-nfs-pv created
    
  3. Créez un fichier nommé crawler-pvc-nfs.yaml avec le contenu suivant :

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <persistent-volume-claim-name>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      selector:
        matchLabels:
          pv-name: <persistent-volume-name>
    

    Remplacez les variables suivantes :

    • <persistent-volume-claim-name>: Spécifiez le nom de votre revendication de volume persistant. Par exemple, jdoe-nfs-pvc.
    • <persistent-volume-name>: indiquez le nom de votre volume persistant. Par exemple, jdoe-nfs-pv.
  4. Entrez la commande suivante pour créer la réclamation de volume persistant :

    oc create -f crawler-pvc-nfs.yaml
    

    Le message suivant s'affiche :

    persistentvolumeclaim/jdoe-nfs-pvc created
    
  5. Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d' crawler.

    Cette commande monte également la réclamation de volume persistant sur tous les pods d' ingestion-api. Remplacez <persistent-volume-claim-name> par le nom de votre réservation de volume persistant. Par exemple, jdoe-nfs-pvc.

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<persistent-volume-claim-name>" } } } } }'
    

Configuration de l'approvisionnement dynamique avec une classe de stockage d' NFS

Si vous souhaitez explorer les fichiers ou dossiers de votre système de fichiers local, mais que vous ne souhaitez pas préparer un serveur d' NFS s supplémentaire pour stocker ces fichiers ou dossiers, vous pouvez configurer le stockage dynamique à l'aide d'une classe de stockage d' NFS s.

Pour plus d'informations sur les fournisseurs de stockage pris en charge par l' Discovery, et pour des comparaisons de stockage, consultez la rubrique Considérations relatives au stockage.

Avant de terminer cette tâche, copiez les fichiers que vous souhaitez explorer sur le cluster d' Discovery s sur lequel vous travaillez. Si vous disposez de plusieurs clusters Discovery, vous devez copier les fichiers avec le fichier crawler-pvc-dynamic.yaml que vous créez dans cette tâche sur chaque cluster.

Procédez comme suit :

  1. Entrez la commande suivante pour vérifier le nom storageclass du service de mise à disposition NFS :

    oc get storageclass
    

    Un message apparaît.

    NAME        PROVISIONER                                     RECLAIMPOLICY  VOLUMEBINDINGMODE  ALLOWVOLUMEEXPANSION  AGE
    nfs-client  cluster.local/innocence-nfs-client-provisioner  Delete         Immediate          true                  177m
    
  2. Créez un fichier nommé crawler-pvc-dynamic.yaml et ajoutez-lui le contenu suivant:

    kind: PersistentVolumeClaim
    apiVersion: v1
    metadata:
      name: <name-of-dynamic-pvc>
    spec:
      accessModes:
        - ReadWriteMany
      resources:
        requests:
          storage: 10Gi
      storageClassName: nfs-client
    

    Remplacez <name-of-dynamic-pvc> par le nom de votre réservation de volume persistant NFS dynamique. Par exemple, jdoe-dynamic-pvc.

  3. Entrez la commande suivante pour créer la réclamation de volume persistant :

    oc create -f crawler-pvc-dynamic.yaml
    

    Un message apparaît.

    persistentvolumeclaim/jdoe-dynamic-pvc created
    
  4. Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d' crawler.

    Cette commande monte également la réclamation de volume persistant sur tous les pods d' ingestion-api.

    oc patch wd wd --type=merge \
    --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-dynamic-pvc>" } } } } }'
    

    Remplacez <name-of-dynamic-pvc> par le nom de votre réservation de volume persistant NFS dynamique à l'étape précédente. Par exemple, jdoe-dynamic-pvc.

  5. Entrez la commande ci-après pour copier les fichiers que vous souhaitez explorer sur votre réservation de volume persistant NFS dynamique.

    Vous ne devez exécuter cette commande qu'une seule fois sur l'un des pods crawler existants. La réclamation de volume persistante est partagée entre tous les pods d' crawler s et d' ingestion-api s. Remplacez les variables de la commande par les informations appropriées.

    oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
    

Vous avez monté la réservation de volume persistant (PVC) et copié tous les fichiers que vous souhaitez explorer dans la PVC.