Lokales Dateisystem
Durchsuchen Sie Dokumente, die in einem lokalen Dateisystem gespeichert sind.
IBM Cloud Pak for Data IBM Software Hub
Diese Informationen gelten nur für installierte Implementierungen.
Durchsuchte Dokumente
- Nur Dateitypen, die von Discovery in Ihrem Dateipfad unterstützt werden, werden durchsucht. Alle anderen werden ignoriert. Weitere Informationen finden Sie unter Unterstützte Dateitypen.
- Der Crawler kann nur auf Dateien im Verzeichnis
/mntoder in einem seiner Unterverzeichnisse zugreifen. - Nur Dateien mit Dateierweiterungen, die den von Ihnen angegebenen Filterregeln für Dateierweiterungen entsprechen, werden durchsucht. Hinzugefügt mit dem Release 4.7.0.
- Wenn eine Quelle erneut durchsucht wird, werden neue Dokumente hinzugefügt, aktualisierte Dokumente werden auf die aktuelle Version geändert und gelöschte Dokumente werden aus dem Index der Sammlung gelöscht.
- Alle Discovery-Datenquellenconnectors sind schreibgeschützt. Unabhängig von den Berechtigungen, die dem Konto für die Crawlersuche erteilt wurden, schreibt, aktualisiert oder löscht Discovery keinen Inhalt in der ursprünglichen Datenquelle.
Vorausgesetzte Schritte
Führen Sie den folgenden Schritt aus, bevor Sie eine Verbindung zur Datenquelle des lokalen Dateisystems herstellen:
Der Service verwendet standardmäßig Portworx-Speicher. Wenn Sie jedoch Network File System-Speicher (NFS) verwenden, lesen Sie stattdessen Vorausgesetzte Schritte für NFS-Speicher.
Persistent Volume Claim für Crawler-Pod erstellen und anhängen
Bevor Sie ein lokales Dateisystem durchsuchen können, müssen Sie einen Persistent Volume Claim (PVC) erstellen und an den Pod crawler anhängen. Sie müssen auch die Dateien, die Sie durchsuchen wollen, in den Discovery-Cluster
kopieren, an dem Sie arbeiten. Wenn Sie über mehrere Discovery-Cluster verfügen, müssen Sie die Dateien zusammen mit der Datei crawler-pvc-portworx.yaml, die Sie in dieser Task erstellen, in jeden Cluster kopieren.
Führen Sie die folgenden Schritte aus:
-
Geben Sie den folgenden Befehl ein, um den Namen für die Speicherklasse (
storageclass) des Portworx-Bereitstellers zu überprüfen:oc get storageclass | grep portworx-gp3-scDie Ausgabe sieht in etwa wie folgt aus:
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE portworx-gp3-sc kubernetes.io/portworx-volume Retain Immediate true 51d -
Erstellen Sie eine Datei mit dem Namen
crawler-pvc-portworx.yaml, um den Persistent Volume Claim (PVC) mit dem folgenden Inhalt zu definieren:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-portworx-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: portworx-gp3-scErsetzen Sie
<name-of-portworx-pvc>durch den Namen Ihres dynamischen Persistent Volume Claim Portworx. Zum Beispiel,jdoe-pvc-portworx -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch zu erstellen:
oc create -f crawler-pvc-portworx.yamlEine Nachricht wird angezeigt:
persistentvolumeclaim/jdoe-pvc-portworx created -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch auf dem
crawler-Pod zu mounten:oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-portworx-pvc>" } } } } }'Ersetzen Sie
<name-of-portworx-pvc>durch den Namen Ihres dynamischen Persistent Volume Claim Portworx. Beispiel:jdoe-pvc-portworx. -
Geben Sie den folgenden Befehl ein, um die Dateien, für die Sie eine Crawlersuche durchführen möchten, zum dynamischen Portworx-Persistent Volume Claim zu kopieren.
Sie müssen diesen Befehl nur einmal für einen der vorhandenen
crawler-Pods ausführen. Die anhaltende Volumenforderung wird von allencrawler- undingestion-api-Pods geteilt. Ersetzen Sie die Variablen im Befehl durch die entsprechenden Informationen.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Sie haben den Persistent Volume Claim (PVC) angehängt und die Dateien, die Sie durchsuchen wollen, in den PVC kopiert.
Verbindung zu einer Datenquelle des lokalen Dateisystems herstellen
Führen Sie die folgenden Schritte für Ihr Discovery-Projekt aus:
-
Wählen Sie im Navigationsfenster Sammlungen verwalten aus.
-
Klicken Sie auf "Neue Kollektion ".
-
Klicken Sie auf Lokales Dateisystem und anschließend auf Weiter.
-
Benennen Sie die Objektgruppe.
-
Wenn die Sprache der zu durchsuchenden Dokumente nicht Englisch ist, wählen Sie die entsprechende Sprache aus.
Eine Liste der unterstützten Sprachen finden Sie unter Sprachunterstützung.
-
Optional: Ändern Sie den Synchronisationszeitplan.
Weitere Informationen finden Sie unter Zeitplanoptionen für die Crawlersuche.
-
Geben Sie im Abschnitt Zu durchsuchende Elemente angeben den zu durchsuchenden Dateipfad im Feld Pfad ein und klicken Sie anschließend Hinzufügen an.
Beim Dateipfad wird die Groß-/Kleinschreibung beachtet. Beachten Sie, dass der Crawler nur auf Dateien im Verzeichnis
/mntoder in einem seiner Unterverzeichnisse zugreifen kann. -
Fügen Sie optional weitere Dateipfade hinzu.
-
Wenn Sie die Dateitypen begrenzen möchten, die der Objektgruppe hinzugefügt werden sollen, dann können Sie die Dateierweiterungen für einzuschließende oder auszuschließende Dateitypen auflisten.
Eine Liste der unterstützten Dateitypen finden Sie unter Unterstützte Dateitypen.
Unterstützung für diese Option wurde mit dem Release 4.7.0 hinzugefügt.
-
Wenn der Crawler Text aus Bildern in Dokumenten extrahieren soll, erweitern Sie Weitere Verarbeitungseinstellungenund legen Sie Optische Zeichenerkennung anwenden auf
Onfest.Wenn OCR aktiviert ist und Ihre Dokumente Bilder enthalten, dauert die Verarbeitung länger. Weitere Informationen finden Sie unter Optische Zeichenerkennung.
-
Klicken Sie auf Beenden.
Die Objektgruppe wird schnell erstellt. Es dauert länger, bis die Daten verarbeitet werden, wenn sie der Objektgruppe hinzugefügt werden.
Wenn Sie den Fortschritt überprüfen möchten, rufen Sie die Seite 'Aktivität' auf. Klicken Sie im Navigationsfenster auf Sammlungen verwalten und anschließend auf, um die Sammlung zu öffnen.
Vorausgesetzte Schritte für NFS-Speicher
Wählen Sie eine der folgenden Methoden aus, um dem Pod crawler den Zugriff auf das Dateisystem zu ermöglichen:
- Externen NFS-Server konfigurieren
- Konfigurieren Sie die dynamische Bereitstellung mit einer NFS-Speicherklasse
Externen NFS-Server konfigurieren
Wenn die Dateien oder Ordner des lokalen Dateisystems, für die Sie eine Crawlersuche durchführen möchten, in einem externen Network File System (NFS) gespeichert sind, können Sie den externen NFS-Server zum Erstellen des Persistent Volume Claim verwenden.
-
Erstellen Sie eine Datei mit dem Namen
crawler-pv-nfs.yamlmit folgendem Inhalt:apiVersion: v1 kind: PersistentVolume metadata: name: <persistent-volume-name> labels: pv-name: <persistent-volume-name> spec: capacity: storage: 10Gi accessModes: - ReadWriteMany persistentVolumeReclaimPolicy: Retain nfs: server: <NFS server hostname or IP address> path: <Path of NFS exported folder>Ersetzen Sie Verweise auf
<persistent-volume-name>durch den Namen Ihres persistenten Datenträgers. Beispiel:jdoe-nfs-pvund fügen Sie die fehlenden externen NFS-Details hinzu. -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch zu erstellen:
oc create -f crawler-pv-nfs.yamlDie folgende Nachricht wird angezeigt:
persistentvolume/jdoe-nfs-pv created -
Erstellen Sie eine Datei mit dem Namen
crawler-pvc-nfs.yamlmit folgendem Inhalt:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <persistent-volume-claim-name> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi selector: matchLabels: pv-name: <persistent-volume-name>Ersetzen Sie die folgenden Variablen:
<persistent-volume-claim-name>: Geben Sie den Namen Ihres persistenten Volumenanspruchs an. Beispiel:jdoe-nfs-pvc.<persistent-volume-name>: Geben Sie den Namen Ihres persistenten Datenträgers an. Beispiel:jdoe-nfs-pv.
-
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch zu erstellen:
oc create -f crawler-pvc-nfs.yamlDie folgende Nachricht wird angezeigt:
persistentvolumeclaim/jdoe-nfs-pvc created -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch auf dem
crawler-Pod zu mounten.Dieser Befehl bindet auch den persistenten Volume-Anspruch an alle
ingestion-api-Pods. Ersetzen Sie<persistent-volume-claim-name>durch den Namen Ihres Persistent Volume Claim. Zum Beispieljdoe-nfs-pvc.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<persistent-volume-claim-name>" } } } } }'
Konfigurieren der dynamischen Bereitstellung mit einer NFS-Speicherklasse
Wenn Sie die Dateien oder Ordner Ihres lokalen Dateisystems durchsuchen möchten, aber keinen zusätzlichen NFS-Server für die Speicherung dieser Dateien oder Ordner vorbereiten möchten, können Sie den dynamischen Speicher mithilfe einer NFS-Speicherklasse konfigurieren.
Weitere Informationen zu Speicheranbietern, die von Discovery unterstützt werden, und zu Speichervergleichen finden Sie unter Überlegungen zum Speicher.
Bevor Sie diese Aufgabe abschließen, kopieren Sie die Dateien, die Sie durchsuchen möchten, in den Discovery-Cluster, an dem Sie arbeiten. Wenn Sie über mehrere Discovery-Cluster verfügen, müssen Sie die Dateien zusammen mit der Datei crawler-pvc-dynamic.yaml,
die Sie in dieser Task erstellen, in jeden Cluster kopieren.
Führen Sie die folgenden Schritte aus:
-
Geben Sie den folgenden Befehl ein, um den Namen der Speicherklasse (
storageclass) des NFS-Bereitstellers zu überprüfen:oc get storageclassEine Nachricht wird angezeigt.
NAME PROVISIONER RECLAIMPOLICY VOLUMEBINDINGMODE ALLOWVOLUMEEXPANSION AGE nfs-client cluster.local/innocence-nfs-client-provisioner Delete Immediate true 177m -
Erstellen Sie eine Datei mit dem Namen
crawler-pvc-dynamic.yamlund fügen Sie den folgenden Inhalt hinzu:kind: PersistentVolumeClaim apiVersion: v1 metadata: name: <name-of-dynamic-pvc> spec: accessModes: - ReadWriteMany resources: requests: storage: 10Gi storageClassName: nfs-clientErsetzen Sie
<name-of-dynamic-pvc>durch den Namen Ihres dynamischen Persistent Volume Claim NFS. Beispiel:jdoe-dynamic-pvc. -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch zu erstellen:
oc create -f crawler-pvc-dynamic.yamlEine Nachricht wird angezeigt.
persistentvolumeclaim/jdoe-dynamic-pvc created -
Geben Sie den folgenden Befehl ein, um den persistenten Volumenanspruch auf dem
crawler-Pod zu mounten.Dieser Befehl bindet auch den persistenten Volume-Anspruch an alle
ingestion-api-Pods.oc patch wd wd --type=merge \ --patch='{"spec": {"ingestion": {"crawler": {"mount": {"enabled": true, "persistentVolumeClaimName": "<name-of-dynamic-pvc>" } } } } }'Ersetzen Sie
<name-of-dynamic-pvc>durch den Namen Ihres dynamischen Persistent Volume Claim NFS im vorherigen Schritt. Beispiel:jdoe-dynamic-pvc. -
Geben Sie den folgenden Befehl ein, um die Dateien, für die Sie eine Crawlersuche durchführen möchten, zum Persistent Volume Claim des dynamischen NFS zu kopieren.
Sie dürfen diesen Befehl nur einmal für einen der vorhandenen
crawler-Pods ausführen. Die anhaltende Volumenforderung wird von allencrawler- undingestion-api-Pods geteilt. Ersetzen Sie die Variablen im Befehl durch die entsprechenden Informationen.oc rsync <path-to-local-file-system-folder> <crawler-pod>:/mnt
Sie haben den Persistent Volume Claim (PVC) angehängt und alle Dateien, die Sie durchsuchen wollen, in den PVC kopiert.