Wenn die Erfassung von Informationen aus Tabellen für Ihren Anwendungsfall kritisch ist, sollten Sie die Verwendung eines vorab trainierten Modells in Betracht ziehen. Weitere Informationen zum Erstellen eines vortrainierten SDU-Modells enthält
Vortrainiertes SDU-Modell anwenden.
Verwendung von Smart Document Understanding
Das Tool Smart Document Understanding (SDU) funktioniert bei einigen Projekttypen besser.
Das Tool ist am nützlichsten, wenn es mit Dokumentabruf-Projekten verwendet wird. Verwenden Sie das Tool, um Ihre Dokumente in kleinere, besser verwendbare Datenblöcke aufzuteilen. Wenn Sie Discovery beim Indexieren der richtigen
Gruppe von Informationen in Ihren Dokumenten unterstützen, können Sie die Antworten verbessern, die Ihre Anwendung finden und zurückgeben kann.
Ihre Dokumente könnten beispielsweise Tipps enthalten, die in Abschnitten mit der Überschrift H4 angezeigt werden. Wenn Sie die Informationen aus diesen Tipps separat extrahieren wollen, können Sie ein Feld mit dem Namen tips hinzufügen und dem Modell beibringen, es zu erkennen. Nachdem Sie das Modell auf Ihre Objektgruppe angewendet haben, können Sie eine Aufbereitung nur auf das Feld tips anwenden. Später können Sie die Suche so begrenzen, dass
nur Inhalte aus dem Feld tips zurückgegeben werden.
Oder Sie haben besonders große Dokumente, die Unterabschnitte enthalten. Sie können dem SDU-Modell beibringen, diese Unterabschnitte zu erkennen, und dann das große Dokument in mehrere, kleinere und leichter zu verwaltende Dokumente aufteilen,
die mit einem dieser Unterabschnitte beginnen.
Die beste Möglichkeit, eine Objektgruppe für die Verwendung in Conversational Search-Projekten vorzubereiten, besteht darin, diskrete Frage/Antwort-Paare zu identifizieren. Sie können das SDU-Tool verwenden, um sie zu suchen und
zu annotieren. Wenn Sie das Projekt so konfigurieren, dass es Antworten in einem Antwortfeld enthält, dann müssen Sie die Suchkonfiguration in watsonx Assistant aktualisieren, um den Hauptteil der Antwort aus dem angepassten Antwortfeld
abzurufen.
Ein vorab trainiertes SDU-Modell wird automatisch auf Dokumentabruf für Verträge-Projekte angewendet. Das vortrainierte SDU-Modell kennt Begriffe und Konzepte, die für Verträge von Bedeutung sind. Daher können Sie ein benutzertrainiertes
SDU-Modell nicht auf diesen Projekttyp anwenden, aber Sie müssen es auch nicht.
Das SDU-Tool wird selten mit Content-Mining-Projekten verwendet.
Mit dem SDU-Tool können Sie nur die folgenden Dateitypen annotieren:
Bilddateien (PNG, TIFF, JPG)
Microsoft PowerPoint
Microsoft Word
PDF
Eine vollständige Liste der Dateitypen, die Discovery unterstützt, finden Sie unter Unterstützte Dateitypen.
Das Smart Document Understanding-Tool verwendet optische Zeichenerkennung (OCR), um Text aus Bildern in den Dateien zu extrahieren, die es analysiert. Bilder müssen die Mindestqualitätsanforderungen erfüllen, die von OCR unterstützt werden.
Weitere Informationen finden Sie unter Optische Zeichenerkennung.
Das Tool kann keine Dokumente mit den folgenden Merkmalen lesen. Entfernen Sie sie aus Ihrer Sammlung, bevor Sie beginnen:
Dokumente, bei denen der Eindruck entsteht, dass Text über anderen Text gelegt wurde, gelten als doppelt überlagert und können nicht mit Anmerkungen versehen werden.
Dokumente, die mehrere Spalten mit Text auf einer einzelnen Seite enthalten, können nicht annotiert werden.
Wenn Sie ein benutzerdefiniertes Smart Document Understanding-Modell erstellen, kann sich die Konvertierungszeit für Ihre Sammlung aufgrund der Ressourcen, die für die Anwendung des KI-Modells auf Ihre Dokumente erforderlich sind, erhöhen.
Mit repräsentativen Dokumenten beginnen
Dokumente gibt es in allen Formen und Größen. Ihre Sammlung enthält möglicherweise eine Mischung aus verschiedenen Dokumentstrukturen. Smart Document Understanding funktioniert am besten, wenn die Dokumente in einer einzelnen Objektgruppe
ähnliche Stilmerkmale aufweisen. Die Dokumente verwenden beispielsweise konsistente Schriftgrößen und Farben für Titel und Überschriften und Tabellen im Dokument weisen ähnliche Layouts auf. Gehen Sie wie folgt vor, um das beste Modell für
Ihre Sammlung zu erstellen:
Überprüfen Sie Ihre Dokumente, um nach Stil-und Layoutmustern zu suchen, und teilen Sie die Dokumente anschließend je nach Stil in Gruppen auf.
Wenn Ihre Daten beispielsweise Dokumente enthalten, die vier verschiedenen Formatierungsstilen folgen, teilen Sie die Dokumente in vier separate Sammlungen auf, eine für jeden Stil. Fügen Sie jeder Sammlung Dokumente mit einem einheitlichen
Layout und Stil hinzu. Eine gute Zielgröße pro Sammlung beträgt 40 Dokumente.
Verwenden Sie das SDU-Tool zum Annotieren dieser repräsentativen Gruppe von Dokumenten und zum Trainieren von Watson, um angepasste Inhalte in Ihren Daten zu erkennen.
Wenden Sie das angepasste SDU-Modell auf die vollständige Sammlung an. Weitere Informationen finden Sie unter SDU-Modelle wiederverwenden.
Modell erstellen
Führen Sie die folgenden Schritte aus, um ein vom Benutzer trainiertes Smart Document Understanding-Modell auf Ihre Sammlung anzuwenden:
Öffnen Sie die Seite Sammlungen verwalten im Navigationsfenster.
Wenn Ihr Projekt über mehrere Sammlungen verfügt, wählen Sie die Sammlung mit Dokumenten aus, die Sie annotieren möchten.
Öffnen Sie die Seite "Felder identifizieren ".
Wählen Sie Vom Benutzer trainierte Modelle aus.
Standardmäßig wird die Option Nur Textextraktion verwendet. Bei diesem Modell wird jeder Text, der in den Quellendokumenten erkannt wird, im Feld text indexiert.
Klicken Sie auf Übergeben und anschließend auf Änderungen anwenden und erneut verarbeiten.
Eine Untergruppe von Dokumenten steht Ihnen zum Annotieren zur Verfügung. In einer Liste werden 20-50 Dokumente angezeigt. Die Anzahl der verfügbaren Dokumente variiert abhängig von verschiedenen Faktoren, einschließlich der Gesamtzahl der Dokumente
in Ihrer Sammlung und der Anzahl der unterstützten Dateitypen.
Wenn Schulungsunterlagen, die zur Schulung eines SDU-Modells verwendet werden, Layout- oder Strukturänderungen in Discovery erfahren, sind die vorherigen Anmerkungen nicht mehr gültig. Um das SDU-Modell zu aktualisieren, müssen Sie die aktualisierten
Dokumente nach dem Import erneut mit Anmerkungen versehen. Andernfalls werden die vorherigen Anmerkungen falsch mit dem Textinhalt verknüpft und die entsprechenden Anmerkungsseiten in der Benutzeroberfläche werden unübersichtlich.
Video beschriften
Das folgende Video zeigt Ihnen, wie Sie eine Beschriftung auswählen und dann auf eine Darstellung des Textes in Ihrem Dokument anwenden.
Im Video klickt der Benutzer auf die Feldbezeichnung title und anschließend auf den Textblock, der den Titel der Seite Inhaltsverzeichnis darstellt, um den Text als Titel zu kennzeichnen. Als Nächstes klickt der Benutzer
auf die Feldbezeichnung table_of_contents und wählt den Textblock des Inhaltsverzeichnisses aus, um ihn zu beschriften. Anschließend klickt der Benutzer auf die Feldbeschriftung footer und auf den Textblock, der die
Seitenfußzeile darstellt. Nachdem der Text beschriftet wurde, klickt der Benutzer auf die Schaltfläche Seite übergeben.
Dokumente beschriften
Bevor Sie beginnen, erhalten Sie ein Gefühl für die Struktur des Dokuments, das Sie annotieren möchten. Gibt es Untertitelabschnitte, die Discovery pro Antwort zurückgeben soll? Wenn ja, geben Sie alle Untertitel an. Später können Sie das Dokument
in diskrete Unterdokumente aufteilen, die jeweils mit einem Untertitel beginnen. Weitere Informationen finden Sie unter Verwendung von Smart Document Understanding.
Führen Sie die folgenden Schritte durch, um Dokumente zu beschriften:
Überprüfen Sie die Dokumentvorschau.
Eine Ansicht des Originaldokuments wird zusammen mit einer Darstellung des Dokuments angezeigt, wobei der Text durch Blöcke ersetzt wird.
Die Blöcke haben die Farbe der Feldbeschriftung text, da der gesamte aktuelle Text als Standardtext betrachtet wird und im Feld text indexiert wird.
Beschriftungsblöcke, die bestimmte Arten von Informationen darstellen, z. B. Titel oder Seitenfußzeilen, mit anderen Feldbeschriftungen. Wenn Sie beispielsweise die Titelfeldbezeichnung auf einen Dokumenttitel anwenden, der andernfalls als
Text indexiert würde, definieren Sie eine präzisere Darstellung des Dokumentinhalts.
Der Prozess, bei dem Bezeichnungen verwendet werden, um verschiedene Teile der Dokumentstruktur zu identifizieren, wird als Annotieren des Dokuments bezeichnet.
Überprüfen Sie die Feldbezeichnungen, die Sie zum Annotieren des Dokuments verwenden können. Sie werden in der Anzeige Feldbezeichnungen angezeigt.
Eine Liste der Felder und ihrer Beschreibungen finden Sie in der Tabelle Standardfeldbezeichnungen .
Klicken Sie zum Erstellen einer angepassten Feldbezeichnung auf Neu erstellen.
Geben Sie eine Feldbezeichnung ohne Leerzeichen an. Beispielsweise ist complex_task eine gültige Feldbezeichnung.
Vermeiden Sie die Verwendung eines Feldbezeichnungsnamens oder die Verwendung von Zeichen wie einem Nummernzeichen (#) oder einem Punkt (.) im Namen, die eine besondere Bedeutung für Discoveryhaben. Weitere Informationen finden Sie unter
Handhabung von Feldern.
Wenn Sie die Farbe ändern möchten, die zur Darstellung des Felds verwendet wird, klicken Sie wiederholt auf den Farbblock ,
bis er in der Farbe angezeigt wird, die Sie verwenden möchten.
Sie können die Farbe der Feldbezeichnung später nicht ändern.
Klicken Sie auf Erstellen.
Klicken Sie zunächst auf eine Feldbezeichnung, um sie zu aktivieren.
Klicken Sie dann auf den Block, der den Inhalt darstellt, den Sie als Feldtyp beschriften möchten.
Der Block ändert sich in die Farbe der Feldbeschriftung. Sie haben das Feld erfolgreich beschriftet!
Wiederholen Sie diesen Prozess, um weitere Felder im Dokument zu annotieren.
Keine Sorge. Sie müssen nicht jede Seite beschriften. Wenn Sie Beschriftungen anwenden und Seiten übergeben, lernt Watson von dem, was Sie annotieren, und beginnt mit der Vorhersage von Annotationen.
Beachten Sie folgende Richtlinien:
Wenn es an einem Abschnitt nichts Besonderes gibt, behalten Sie die Bezeichnung text bei, die standardmäßig angewendet wird.
Eine Beschriftung kann nicht mehrere Seiten umfassen.
Text wird immer gleich behandelt, ob fett oder kursiv gedruckt oder unterstrichen. Die Beschriftung basiert auf dem Kontext und nicht auf dem Stil.
Verwenden Sie konsistente Bezeichnungen für alle Dokumente.
Arbeiten Sie von der ersten Seite eines mehrseitigen Dokuments bis zur letzten Seite.
Um eine einzelne Anmerkung zu entfernen, wählen Sie eine andere Bezeichnung aus (z. B. text) und wenden Sie sie auf das Element an, um die vorherige Anmerkung zu überschreiben.
Um Anmerkungen zu entfernen, die Sie zu einer ganzen Seite hinzugefügt haben, klicken Sie in der Symbolleiste auf das Symbol Änderungen löschen.
Klicken Sie zum Annotieren einer Tabelle auf den Text am Anfang der Tabelle und ziehen Sie dann den Text in der gesamten Tabelle, um ihn auszuwählen.
Wenn Sie eine oder mehrere Tabellen beschriften, wird die Aufbereitung Table Understanding für die gesamte Objektgruppe automatisch aktiviert. Weitere Informationen finden Sie unter Tabellen verstehen.
Bilder aus den Quellendokumenten werden in der Vorschau nicht wiedergegeben. Wenn die optische Zeichenerkennung (OCR) aktiviert ist, wird jeder Text aus dem Bild oder Diagramm extrahiert und in der Vorschau wiedergegeben.
Beschriften Sie keine Leerzeichen.
Wenn alles, was Sie beschriften möchten, beschriftet ist, übergeben Sie die Seite. Klicken Sie auf Seite übergeben.
Fahren Sie mit dem Annotieren von Dokumenten fort, bis Watson verschiedene Inhaltstypen ordnungsgemäß und konsistent den entsprechenden Feldern zuordnen kann.
Nachdem Sie Watson beigebracht haben, Felder zu identifizieren, klicken Sie auf Änderungen anwenden und erneut verarbeiten.
Angepasste Felder, die Sie mit dem SDU-Tool definieren, werden als Felder auf Stammebene indexiert.
Nächste Schritte
Wenn Sie ein vom Benutzer trainiertes Modell erstellen, ändern Sie die Position, an der Informationen in Ihren Dokumenten gespeichert werden. Ändern Sie anschließend die Konfiguration der Suchergebnisse. Standardmäßig werden Suchergebnisse
aus Passagen oder dem Textfeld abgerufen. Möglicherweise können Sie ein besseres Feld als Quelle des Ergebnishauptteils verwenden. Weitere Informationen finden Sie unter Ergebnisinhalt ändern.
Wenn Ihr Projekt von einem virtuellen Assistenten verwendet wird, aktualisieren Sie die Konfiguration des Suchskills, um den Antworthauptteil aus einem anderen Feld zu extrahieren. Weitere Informationen finden Sie unter Suche konfigurieren.
Sie können Aufbereitungen (benutzerdefinierte oder vordefinierte Aufbereitungen) auf die neuen Stammfelder anwenden, die vom SDU-Modell generiert werden.
Wenn Sie ein kürzeres Textausschnitt mit einem Suchergebnis zurückgeben möchten, können Sie Ihre Dokumente auf der Basis eines der von Ihnen definierten neuen Felder (z. B. Kapitel oder Abschnitt) aufteilen.
Verfügbare Felder
Die folgenden Felder können mit dem Tool Smart Document Understanding auf Dokumente angewendet werden.
Die Felder sind beliebig. Sie können das Feld image bei Bedarf auf jeden Titel im Dokument anwenden. Obwohl es schwierig sein kann, zu wissen, welches Feld später nach Informationen durchsucht werden muss, die Sie benötigen, wenn
die Feldnamen nicht mit dem Inhalt übereinstimmen. Die Standardgruppe sind repräsentative Feldtypen, die Ihnen den Einstieg erleichtern sollen. Nur die Felder text und table haben eine besondere Signifikanz. Verwenden
Sie sie nur zum Identifizieren von Text und Tabellen.
Standardfeldbeschriftungen
Feld
Definition
answer
In einem Frage-und-Antwort-Paar (oft in einer FAQ) die Antwort auf die Frage.
author
Name des Autors oder der Autoren.
footer
Verwenden Sie dieses Tag, um Metainformationen über das Dokument (wie Seitenzahl oder Referenzen) anzugeben, die am Ende der Seite erscheinen.
header
Verwenden Sie dieses Tag, um Metainformationen über das Dokument anzugeben, die am Anfang der Seite angezeigt werden.
question
In einem Frage-und-Antwort-Paar (oft in einer FAQ) steht die Frage.
subtitle
Der sekundäre Titel des Dokuments.
table_of_contents
Verwenden Sie dieses Tag in Listen im Inhaltsverzeichnis des Dokuments.
text
Standardmäßig wird jeder Textblock im Dokument als Text bezeichnet. Wenden Sie unterschiedliche Bezeichnungen nur auf Textblöcke mit besonderer Bedeutung an.
title
Der Haupttitel des Dokuments.
table
Verwenden Sie diesen Tag, um Tabellen in Ihrem Dokument zu annotieren.
image
Bilder werden in der Dokumentvorschau nicht angezeigt. Wenn Sie OCR aktivieren, wird Text aus einem Bild oder Diagramm in der Vorschau angezeigt. Wenn Sie verhindern möchten, dass Text aus einigen Bildern in die Suchergebnisse aufgenommen
wird, kennzeichnen Sie den Bildtext als Bild. Sie können das Bildfeld später aus dem Index ausschließen.
SDU-Modelle wiederverwenden
Nach der Definition eines Modells mit dem SDU-Tool können Sie es speichern und in anderen Objektgruppen wiederverwenden, indem Sie es aus einer Objektgruppe exportieren und in eine andere importieren.
Beim Importieren eines neuen Modells wird das vorhandene Modell in einer Objektgruppe überschrieben. Wenn das vorhandene Modell bereits durch angepasste Feldbeschriftungen und Annotationen trainiert wurde, wirkt sich der Import eines neuen
Modells auf die Objektgruppe aus und kann zu einem Datenverlust führen.
Um ein Modell wiederzuverwenden, führen Sie die folgenden Schritte aus:
Exportieren Sie das Modell, das Sie wiederverwenden möchten. Wählen Sie im SDU-Symbolleistenmenü Modell exportieren aus.
Import und Export "Import und Export" *
Erstellen Sie die Sammlung, in der das Modell wiederverwendet werden soll. Fügen Sie zunächst nur ein Dokument zur Sammlung hinzu.
Importieren Sie das Modell aus der SDU-Symbolleiste. Das exportierte Modell hat die Dateierweiterung .sdumodel.
Fügen Sie die übrigen Dokumente zur Sammlung hinzu. Öffnen Sie die Registerkarte Aktivität der Seite Sammlungen verwalten und klicken Sie dann auf Daten hochladen, um weitere Dateien zur Sammlung
hinzuzufügen.
Verwenden Sie das importierte Modell unverändert. Machen Sie keine weiteren Anmerkungen. Wenn Sie nach dem Import der Datei .sdumodel Anmerkungen machen, wird das importierte Modell überschrieben.
Smart Document Understanding-Grenzwerte
Die Anzahl der angepassten Felder, die Sie pro Smart Document Understanding-Modell erstellen können, hängt vom Plantyp Discovery ab.
Grenzwerte für benutzerdefinierte Felder
Planen
Angepasste Felder pro SDU-Modell
Cloud Pak for Data
Uneingeschränkt
Premium
100
Enterprise
100
Plus (einschließlich Testversion)
40
Die maximale Anzahl Dokumente, die Sie annotieren können, um ein SDU-Modell pro Sammlung zu trainieren, hängt von Ihrem Plantyp Discovery ab.
Grenzwerte für Trainingssets
Planen
Dokumente pro Sammlung
Cloud Pak for Data
40
Premium
40
Enterprise
40
Plus (einschließlich Testversion)
40
Felder verwalten
In der Registerkarte Felder verwalten stehen mehrere Optionen zur Auswahl bereit:
Um auf die Seite "Felder verwalten" zuzugreifen, klicken Sie im Navigationsbereich auf das Symbol "Sammlungen verwalten" und öffnen Sie eine Sammlung. Klicken Sie auf die Registerkarte Felder verwalten.
Weitere Informationen zu Sammlungen finden Sie unter Sammlungen erstellen.