Système de fichiers local
Explorer les documents stockés dans un système de fichiers local.
IBM Cloud Pak for Data IBM Software Hub
Ces informations s'appliquent uniquement aux déploiements installés.
Quels documents sont explorés
- Seuls les types de fichier pris en charge par Discovery dans votre chemin de fichier sont explorés ; tous les autres sont ignorés. Pour plus d'informations, voir Types de fichier pris en charge.
- Seuls les fichiers du répertoire
/mntou de l'un de ses sous-répertoires sont accessibles par le moteur d'exploration. - Seuls les fichiers avec des extensions de fichier qui correspondent aux règles de filtre d'extension de fichier que vous spécifiez sont explorés. Ajouté avec l'édition 4.7.0.
- Lorsqu'une source est réexplorée, les nouveaux documents sont ajoutés, les documents mis à jour sont modifiés dans leur version actuelle et les documents supprimés sont effacés de l'index de la collection.
- Tous les connecteurs de source de données Discovery sont en lecture seule. Quels que soient les droits accordés au compte d'exploration, Discovery n'écrit, ne met à jour ou ne supprime jamais de contenu dans la source de données d'origine.
Procédure prérequise
Avant de vous connecter à la source de données du système de fichiers local, procédez comme suit:
Le service utilise le stockage Portworx par défaut. Toutefois, si vous utilisez le stockageNFS(Network File System), voir Etapes prérequises pour le stockage NFS à la place.
Création et montage d'une réservation de volume persistant sur le pod de moteur d'exploration
Avant de pouvoir explorer un système de fichiers local, vous devez créer une réservation de volume persistant et la monter sur le pod crawler. Vous devez également copier les fichiers que vous souhaitez explorer dans le cluster
Discovery sur lequel vous travaillez. Si vous disposez de plusieurs clusters Discovery, vous devez copier les fichiers avec le fichier crawler-pvc-portworx.yaml que vous allez créer dans cette tâche sur chaque cluster.
Procédez comme suit :
-
Entrez la commande suivante pour vérifier le nom
storageclassdu service de mise à disposition Portworx :oc get storageclass | grep portworx-gp3-scLe résultat obtenu peut être similaire à celui présenté ci-dessous :
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE portworx-gp3-sc kubernetes.io/portworx-volume Retain Immediate true 51d -
Créez un fichier nommé
crawler-pvc-portworx.yamlpour définir la réservation de volume persistant (PVC) avec le contenu suivant:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-portworx-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: portworx-gp3-scRemplacez
<name-of-portworx-pvc>par le nom de votre réservation de volume persistant Portworx dynamique. Exemple :jdoe-pvc-portworx -
Entrez la commande suivante pour créer la réclamation de volume persistant :
oc create -f crawler-pvc-portworx.yamlUn message s'affiche:
persistentvolumeclaim/jdoe-pvc-portworx created -
Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d'
crawler:oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-portworx-pvc>" } } } } }'Remplacez
<name-of-portworx-pvc>par le nom de votre réservation de volume persistant Portworx dynamique. Par exemple,jdoe-pvc-portworx. -
Entrez la commande ci-après pour copier les fichiers que vous souhaitez explorer sur votre réservation de volume persistant Portworx dynamique.
Il vous suffit d'exécuter cette commande une seule fois sur l'un des pods d'
crawler. La réclamation de volume persistante est partagée entre tous les pods d'crawlers et d'ingestion-apis. Remplacez les variables de la commande par les informations appropriées.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Vous avez monté la réservation de volume persistant (PVC) et copié les fichiers que vous souhaitez explorer dans la PVC.
Connexion à une source de données de système de fichiers local
À partir de votre projet d' Discovery, procédez comme suit :
-
Dans le panneau de navigation, sélectionnez Gestion des collections.
-
Cliquez sur Nouvelle collection.
-
Cliquez sur Système de fichiers local, puis sur Suivant.
-
Attribuez un nom à la collection.
-
Si la langue des documents que vous souhaitez explorer n'est pas l'anglais, sélectionnez la langue appropriée.
Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.
-
Facultatif: modifiez la planification de synchronisation.
Pour plus d'informations, voir Options de planification d'exploration.
-
Dans la section Specify what you want to crawl, entrez le chemin de fichier à explorer dans la zone Path, puis cliquez sur Add.
Le chemin d'accès au fichier est sensible à la casse. N'oubliez pas que seuls les fichiers du répertoire
/mntou de l'un de ses sous-répertoires sont accessibles par le moteur d'exploration. -
Vous pouvez éventuellement ajouter d'autres chemins d'accès aux fichiers.
-
Si vous souhaitez limiter les types de fichier à ajouter à la collection, vous pouvez répertorier les extensions de fichier pour les types de fichier à inclure ou à exclure.
Pour obtenir la liste des types de fichier pris en charge, voir Types de fichier pris en charge.
La prise en charge de cette option a été ajoutée avec l'édition 4.7.0.
-
Si vous souhaitez que le moteur d'exploration extrait du texte des images des documents, développez Plus de paramètres de traitementet définissez Appliquer la reconnaissance optique des caractères (OCR) sur
On.Lorsque la reconnaissance optique des caractères est activée et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.
-
Cliquez sur Terminer.
La collection est créée rapidement. Le traitement des données à mesure qu'elles sont ajoutées à la collection prend plus de temps.
Si vous souhaitez vérifier la progression, accédez à la page Activité. Dans le panneau de navigation, cliquez sur Gérer les collections, puis cliquez pour ouvrir la collection.
Etapes prérequises pour le stockage NFS
Choisissez l'une des méthodes suivantes pour permettre au pod crawler d'accéder au système de fichiers:
- Configuration d'un serveur NFS externe
- Configurer l'approvisionnement dynamique avec une classe de stockage d' NFS
Configuration d'un serveur NFS externe
Si les fichiers ou dossiers de système de fichiers local que vous souhaitez explorer sont stockés dans un système NFS (Network File System) externe, vous pouvez utiliser le serveur NFS externe pour créer la réservation de volume persistant.
-
Créez un fichier nommé
crawler-pv-nfs.yamlavec le contenu suivant :apiVersion: v1 kind: PersistentVolume metadata: name: <persistent-volume-name> labels: pv-name: <persistent-volume-name> spec: capacity: storage: 10Gi accessModes: - ReadWriteMany persistentVolumeReclaimPolicy: Retain nfs: server: <NFS server hostname or IP address> path: <Path of NFS exported folder>Remplacez les références à
<persistent-volume-name>par le nom de votre volume persistant. Par exemple,jdoe-nfs-pvet ajoutez les détails NFS externes manquants. -
Entrez la commande suivante pour créer la réclamation de volume persistant :
oc create -f crawler-pv-nfs.yamlLe message suivant s'affiche :
persistentvolume/jdoe-nfs-pv created -
Créez un fichier nommé
crawler-pvc-nfs.yamlavec le contenu suivant :kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <persistent-volume-claim-name> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi selector: matchLabels: pv-name: <persistent-volume-name>Remplacez les variables suivantes :
<persistent-volume-claim-name>: Spécifiez le nom de votre revendication de volume persistant. Par exemple,jdoe-nfs-pvc.<persistent-volume-name>: indiquez le nom de votre volume persistant. Par exemple,jdoe-nfs-pv.
-
Entrez la commande suivante pour créer la réclamation de volume persistant :
oc create -f crawler-pvc-nfs.yamlLe message suivant s'affiche :
persistentvolumeclaim/jdoe-nfs-pvc created -
Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d'
crawler.Cette commande monte également la réclamation de volume persistant sur tous les pods d'
ingestion-api. Remplacez<persistent-volume-claim-name>par le nom de votre réservation de volume persistant. Par exemple,jdoe-nfs-pvc.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<persistent-volume-claim-name>" } } } } }'
Configuration de l'approvisionnement dynamique avec une classe de stockage d' NFS
Si vous souhaitez explorer les fichiers ou dossiers de votre système de fichiers local, mais que vous ne souhaitez pas préparer un serveur d' NFS s supplémentaire pour stocker ces fichiers ou dossiers, vous pouvez configurer le stockage dynamique à l'aide d'une classe de stockage d' NFS s.
Pour plus d'informations sur les fournisseurs de stockage pris en charge par l' Discovery, et pour des comparaisons de stockage, consultez la rubrique Considérations relatives au stockage.
Avant de terminer cette tâche, copiez les fichiers que vous souhaitez explorer sur le cluster d' Discovery s sur lequel vous travaillez. Si vous disposez de plusieurs clusters Discovery, vous devez copier les fichiers avec le fichier crawler-pvc-dynamic.yaml que vous créez dans cette tâche sur chaque cluster.
Procédez comme suit :
-
Entrez la commande suivante pour vérifier le nom
storageclassdu service de mise à disposition NFS :oc get storageclassUn message apparaît.
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE nfs-client cluster.local/innocence-nfs-client-provisioner Delete Immediate true 177m -
Créez un fichier nommé
crawler-pvc-dynamic.yamlet ajoutez-lui le contenu suivant:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-dynamic-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: nfs-clientRemplacez
<name-of-dynamic-pvc>par le nom de votre réservation de volume persistant NFS dynamique. Par exemple,jdoe-dynamic-pvc. -
Entrez la commande suivante pour créer la réclamation de volume persistant :
oc create -f crawler-pvc-dynamic.yamlUn message apparaît.
persistentvolumeclaim/jdoe-dynamic-pvc created -
Entrez la commande suivante pour monter la réclamation de volume persistant sur le pod d'
crawler.Cette commande monte également la réclamation de volume persistant sur tous les pods d'
ingestion-api.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-dynamic-pvc>" } } } } }'Remplacez
<name-of-dynamic-pvc>par le nom de votre réservation de volume persistant NFS dynamique à l'étape précédente. Par exemple,jdoe-dynamic-pvc. -
Entrez la commande ci-après pour copier les fichiers que vous souhaitez explorer sur votre réservation de volume persistant NFS dynamique.
Vous ne devez exécuter cette commande qu'une seule fois sur l'un des pods
crawlerexistants. La réclamation de volume persistante est partagée entre tous les pods d'crawlers et d'ingestion-apis. Remplacez les variables de la commande par les informations appropriées.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Vous avez monté la réservation de volume persistant (PVC) et copié tous les fichiers que vous souhaitez explorer dans la PVC.