Dokumente aufteilen, um Abfrageergebnisse prägnanter zu machen
Teilen Sie Ihre Dokumente auf, damit die Suchfunktion präzisere Informationen finden kann, die in Abfrageergebnissen zurückgegeben werden sollen.
Weitere Informationen zu den Vorteilen der Aufteilung von Dokumenten finden Sie im Blogbeitrag Using IBM Watson Discovery' s New Document Segmentation Feature unter Medium.com.
Sie können nur Dokumente aufteilen, auf die ein vom Benutzer trainiertes Smart Document Understanding-Modell angewendet wird.
Wenn Sie ein Dokument aufteilen, wird das Originaldokument in Segmente unterteilt. Jedes Segment enthält eine einheitlichere Gruppe von Informationen. Indem Sie den Inhalt in Ihren Dokumenten in segmentierte Gruppen aufteilen, können Sie Ihre Daten differenzierter aufbereiten und indexieren.
Um zu steuern, wie Ihre Dokumente aufgeteilt werden, geben Sie ein Feld wie subtitle oder question an, das als Seitenumbruchmarkierung verwendet werden soll. Die Seitenumbruchoptionen werden mit Feldern gefüllt, die erstellt
werden, wenn Sie ein vom Benutzer trainiertes SDU-Modell (Smart Document Understanding) auf die Dokumente anwenden. Weitere Informationen finden Sie unter Smart Document Understanding verwenden.
Sie können Dokumente nicht mit Feldern teilen, die von einem vorab trainierten Smart Document Understanding-Modell generiert werden.
Wenn ein Dokument erneut verarbeitet wird, wird es von Anfang bis Ende ausgewertet. Wenn das Markierungsfeld für den Seitenumbruch auftritt, wird das Originaldokument geteilt und ein neues Segment erstellt. Die Aufteilung wird bei jedem Markierungsfeld fortgesetzt, bis das Originaldokument in mehrere Segmente aufgeteilt wird.
Entscheiden Sie zunächst, welches Feld als Markierung für Seitenumbruch verwendet werden soll.
- Sie können alle Felder verwenden, die standardmäßig indexiert sind. Um Ihre Auswahl anzuzeigen, überprüfen Sie die Liste Zu indexierende Felder. Felder mit dem Wert Typ werden im Index gespeichert.
- Die Anzahl der Segmente pro Dokument ist auf
1,000begrenzt. Nachdem die Segmentnummer999erstellt wurde, wird der übrige Dokumentinhalt im Segment1,000gespeichert. - Metadaten aus PDF-und Microsoft Word-Dokumenten sowie benutzerdefinierte Metadaten werden extrahiert und mit jedem Segment in den Index aufgenommen.
Seien Sie vorsichtig mit Dokumenten, die sich wiederholende Abschnitte enthalten, wie z. B. einem Katalog mit einer Beschreibung und Spezifikationen für jeden Produkteintrag. Wenn Sie das Dokument auf einer zu differenzierten Ebene aufteilen, können die Zuordnung der Unterabschnitte, z. B. eines Abschnitts mit Spezifikationsdetails, zu dem Produkt, zu dem es gehört, aufgehoben werden.
Führen Sie die folgenden Schritte aus, um die Dokumente in einer Objektgruppe aufzuteilen:
-
Klicken Sie im Navigationsfenster auf Sammlungen verwalten und klicken Sie anschließend auf eine Sammlung, um sie zu öffnen.
-
Öffnen Sie die Seite Felder verwalten.
Eine Liste der angegebenen Felder wird angezeigt.
-
Klicken Sie im Abschnitt "Verbessern Sie die Abfrageergebnisse, indem Sie Ihre Dokumente aufteilen " auf "Dokument aufteilen ".
-
Wählen Sie in der Dropdown-Liste Feld auswählen das Feld aus, das Sie als Seitenumbruchmarkierung verwenden möchten.
Die Liste, die Sie auswählen können, enthält eine Untergruppe aller identifizierten Felder.
-
Klicken Sie auf Änderungen anwenden und erneut verarbeiten.
Sie können den Status des Aufteilungsprozesses auf der Seite Aktivität überprüfen.
Das Metadatenfeld enthält die ID des übergeordneten Dokuments. Jedes Ergebnissegment des Originaldokuments kann andere Informationen enthalten. Wenn Sie beispielsweise das Dokument basierend auf dem Untertitelfeld aufteilen, enthält das erste Segment möglicherweise nur ein Titelfeld. Das nächste Segment kann einen Untertitel und ein Textfeld enthalten. Die dritte kann ein Untertitelfeld, ein Textfeld und ein Fußzeilenfeld enthalten.
Aufgeteilte Dokumente aktualisieren
Wenn sich ein Dokument, das geteilt wurde, ändert und Sie das Dokument erneut hochladen möchten, arbeiten Sie mit einem Entwickler zusammen, um das Dokument mithilfe der API zu ersetzen. Ein Entwickler kann die Methode Dokument aktualisieren verwenden, um das ursprüngliche übergeordnete Dokument zu ersetzen. Weitere Informationen finden Sie in der API-Referenz. Um die Pfadvariable {document_id} anzugeben, die mit der Anforderung gesendet werden muss, kopieren Sie den Inhalt des Felds parent_document_id eines der Segmente des Dokuments.
Wenn Sie das Originaldokument ersetzen, werden alle Segmente überschrieben, es sei denn, die aktualisierte Version des Dokuments enthält weniger Segmente als das Original. Diese älteren Segmente verbleiben im Index.
Dokumentsegmente aus dem Index löschen
Sie können Dokumente in einer Sammlung auf der Seite Daten verwalten löschen. Um alle Dokumentsegmente zu finden, die aus einem einzelnen Dokument generiert wurden, suchen Sie nach Dokumenten mit demselben Wert im Feld metadata.parent_document_id.
Weitere Informationen finden Sie unter Inhalt aus Abfrageergebnissen ausschließen.
IBM Cloud Pak for Data IBM Cloud Pak for Data vor dem 4.6.5 Release
Die Seite Daten verwalten ist in installierten Implementierungen ab Release 4.6.5 verfügbar. In früheren Releases kann ein Entwickler Dokumentsegmente mithilfe der API löschen. Weitere Informationen finden Sie unter API zum Löschen von Dokumenten.