Diese Dokumentation bezieht sich auf IBM Watson® Knowledge Studio on IBM Cloud®. Die Dokumentation für die Vorgängerversion von Knowledge Studio on IBM Marketplace kann über diesen Link aufgerufen werden.

Dokumente zum Annotieren hinzufügen

Zum Trainieren eines Machine Learning-Modells müssen Sie in Ihrem Arbeitsbereich Dokumente hinzufügen, die Wissen aus dem betreffenden Fachgebiet enthalten (z. B. Artikel aus Fachzeitschriften oder andere fachspezifische Texte).

Informationen zu dieser Task

In diesem Abschnitt wird beschrieben, wie Dokumente zum Annotieren hinzugefügt werden. Zum Definieren von Regeln für das regelbasierte Modell fügen Sie Dokumente hinzu oder laden Dokumente hoch, aus denen Muster extrahiert und als Regeln definiert werden können. Siehe Dokumente zum Definieren von Regeln hinzufügen.

Dokumente

Zum Trainieren eines Machine Learning-Modells müssen Sie Dokumente sammeln, die für den Inhalt des Fachgebiets repräsentativ und für Ihre Anwendung wertvoll sind.

Stellen Sie sicher, dass Ihre Trainingsdokumente für die relevanten Inhalte Ihres Fachgebiets repräsentativ sind. Mit anderen Worten: Die Dokumente müssen viele relevante Erwähnungen enthalten, die annotiert werden können. Halten Sie sich an die folgenden Richtlinien, um die besten Dokumente auszuwählen:

  • Stellen Sie möglichst eine Dokumentgruppe zusammen, die insgesamt ca. 300.000 Wörter umfasst. Stellen Sie für ein komplexes Typsystem mehr Wörter bereit und für ein einfaches Typsystem weniger Wörter.
  • Beschränken Sie jedes Dokument auf ein oder zwei Seiten Inhalt; weniger als 2.000 Wörter, am besten weniger als 1.000 Wörter pro Dokument. In der Anfangsphase der Modellentwicklung sollte jedes Dokument möglichst nur wenige Absätze enthalten. Ein Annotatorbenutzer kann zwar Erwähnungen und Beziehungen in einem langen Dokument markieren, doch das Markieren von Koreferenzen in Dokumenten, die mehrere Seiten umfassen, kann sehr mühsam sein.
  • Dokumente sind oft auf 600 Erwähnungen beschränkt
  • Stellen Sie sicher, dass die Daten in den Dokumenten alle möglichen Entitätstypen, Untertypen und Rollen sowie die zwischen ihnen bestehenden Beziehungen abdecken. Eine hilfreiche Zielsetzung besteht darin, am Ende mindestens 50 Annotationen für jeden Entitätstyp und für jeden Beziehungstyp in der Dokumentsammlung zu haben.
  • Noch einmal: Die Dokumente sollten die ganze Bandbreite des Fachgebiets repräsentieren, das von der Anwendung abgedeckt werden soll. Bei tendenziell ungleichmäßiger Häufigkeitsverteilung der Vorkommen von Entitäts- und Beziehungstypen sollten mindestens 50 Exemplare für jeden Typ (oder mehr für Entitätstypen, die meist in Form von Ausdrücken erwähnt werden) vorhanden sein.
  • Die zum Trainieren des Modells erstellte Dokumentgruppe muss mindestens 10 annotierte Dokumente enthalten.

Wenn die Vorbereitungen zum Erstellen und Trainieren des Modells abgeschlossen sind, können Dokumente, die Sie zum Arbeitsbereich hinzufügen, in mehrere Gruppen aufgeteilt werden, die für Trainingsdaten, Testdaten und Blinddaten verwendet werden. Die separaten Datasets sind wichtig für die Bewertung der Leistung des Modells.

Sie können Dokumente mit den folgenden Methoden hinzufügen. Weitere Informationen zu den unterstützten Dokumenttypen und zu Größenbegrenzungen sowie weitere Informationen finden Sie unter Arbeitsbereich erstellen > Zusammenfassung der Eingaben, Ausgaben und Einschränkungen.

  • Zweispaltige CSV-Datei im UTF-8-Format
  • Textdateien im UTF-8-Format
  • HTML-Dateien
  • PDF-Dateien (gescannte und kennwortgeschützte Dateien werden nicht unterstützt)
  • Microsoft Word-Dateien im Format DOC oder DOCX (kennwortgeschützte Dateien werden nicht unterstützt)
  • ZIP-Datei mit Dokumenten, die aus einem Knowledge Studio-Arbeitsbereich heruntergeladen wurden
  • ZIP-Datei mit Dateien im UIMA CAS XMI-Format

CSV-Dateien

Sie können eine CSV-Datei mit zwei Spalten, die Beispieltext enthält, aus Ihrer lokalen Maschine hochladen. Laden Sie jeweils nur eine CSV-Datei hoch. In der ersten Spalte der CSV-Datei ist der Dateiname des Dokuments angegeben. Die zweite Spalte in der Datei enthält den Dokumenttext. Ein Beispiel für das erforderliche Format finden Sie im documents-new.csv Datei Symbol für externen Link in den Beispieldateien des Lernprogramms.

PDF-Dateien

In manchen Fällen kann Text aus PDF-Dateien nicht extrahiert werden (je nachdem, wie die PDF-Datei erstellt wurde). In der Regel kann kein Text aus eingebetteten Schriftarten extrahiert werden, die nicht mit Unicode-Zeichen abgeglichen werden können. Wenn Sie unsicher sind, ob der Text aus einer PDF extrahiert werden kann, kopieren Sie den Text aus der PDF-Datei und fügen Sie ihn probeweise in einen Texteditor ein. Wenn die Zeichendarstellung nicht mit der Darstellung im PDF-Format übereinstimmt, kann der Text wahrscheinlich nicht extrahiert werden.

Formatierte Dokumente

Bei der Konvertierung formatierter Dokumente in einfachen Text kann das Entfernen von Formatierungen zu Fehlern bei der Zerlegung von Wörtern in Tokens führen. Wenn eine Tabellenzeile in einer DOCX-Datei beispielsweise Zellenwerte enthält, die nicht mit einem Punkt enden, werden die Werte möglicherweise in einen zusammenhängenden Satz konvertiert. Ein weiteres Beispiel: Wenn ein PDF-Dokument ein besonders langes Wort mit Trennung am Zeilenende enthält, wird das Wort möglicherweise in zwei Wörter umgewandelt. In solchen Fällen sind die resultierenden Wörter möglicherweise erst für Machine Learning geeignet, nachdem die Formatierungsenschränkungen in den Dateien behoben wurden.

Dokumente aus einem anderen Watson Knowledge Studio-Arbeitsbereich

Wenn Sie zuvor Dokumente aus einem Knowledge Studio-Arbeitsbereich heruntergeladen haben, können Sie die von Ihnen heruntergeladene ZIP-Datei nun hochladen. Über eine Option können Sie angeben, ob die Ground Truth-Annotationen in der importierten Datei enthalten sein sollen.

Nachdem Dokumente mit Annotationen versehen wurden, werden die annotierten Dokumente im JSON-Format gespeichert. Die Formatierungssprache in den Dateien zeigt, wie der ursprüngliche Dokumenttext analysiert und mit Token versehen wurde und enthält Elemente für alle Annotationen, die von einem Annotatorbenutzer hinzugefügt wurden. Um die Modellgenauigkeit im Laufe der Zeit zu verbessern, können Sie diese Dateien in einen anderen Arbeitsbereich hochladen. Dabei bleiben alle vorhandenen Annotationen erhalten. Ein Annotatorbenutzer kann Annotationen in diesen Dokumenten überarbeiten, löschen und hinzufügen. Sie können aber auch auf die Annotierung durch Benutzer verzichten und die Dateien zum Erstellen von Dokumentgruppen für Trainings-, Test- und Blinddaten verwenden, um die Modellleistung zu bewerten und zu verbessern.

UIMA CAS XMI-Dateien

Als Hilfsmittel zum Trainieren eines Modells können Sie Dokumente hochladen, die von einer UIMA-Analyseengine vorannotiert wurden. Die vorannotierten Dateien müssen das XMI-Serialisierungsformat von UIMA Common Analysis Structure (UIMA CAS XMI-Format) aufweisen und als komprimierte ZIP-Datei vorliegen. Sie können beispielsweise Dokumente hochladen, die in einer IBM Watson Explorer-Sammlung annotiert wurden.

Ein Annotatorbenutzer kann Annotationen in diesen Dokumenten überarbeiten, löschen und hinzufügen. Sie können aber auch auf die Annotierung durch Benutzer verzichten und die Dateien zum Erstellen von Dokumentgruppen für Trainings-, Test- und Blinddaten verwenden, um die Modellleistung zu bewerten und zu verbessern. Weitere Informationen zum Erstellen dieser Dateien und Voraussetzungen zum Hochladen der Dateien finden Sie unter Vorannotierte Dokumente hochladen.

Daten anonymisieren

Wenn Sie ein optimiertes Modell für Ihre Daten erstellen möchten, ohne die Daten unverändert in Knowledge Studio zu laden (aus Datenschutzgründen), können Sie alle personenbezogenen Informationen aus den Dokumenten entfernen und anschließend die anonymisierten Dokumente zum Trainieren des Modells verwenden. Verzichten Sie darauf, die Informationen zu redigieren oder global durch Variablen zu ersetzen. Die besten Ergebnisse können Sie erzielen, indem Sie die tatsächlichen Informationen durch fiktive Informationen des gleichen Typs ersetzen.

Beispiel: Wenn die personenbezogenen Daten, die Sie schützen möchten, Kundennamen sind, verzichten Sie darauf, jeden Namen zu redigieren oder durch eine Variable wie BENUTZERNAME zu ersetzen. Ersetzen Sie stattdessen jeden Namen durch einen fiktiven Namen und verwenden Sie dabei verschiedene typische Syntaxformen für Namen (z. B. Lieschen Müller, Herr Schmitt, Dietrich oder Dr. h. c. Meier. Sie können auch ein Script schreiben, das eine Auswahl von Vor- und Nachnamen bzw. von Titeln und Nachnamen miteinander verkettet und nur Nachnamen hinzufügt, um fiktive Namen zu erstellen, die anstelle der realen Benutzernamen in das Dokument eingefügt werden können. Das Ziel besteht darin, echte Werte in den Quellendokumenten so realitätsnah wie möglich zu simulieren. Wenn in den Dokumenten gleichlautender Text (BENUTZERNAME) verwendet oder Text redigiert wird, trainieren Sie damit ein Modell, das identische oder redigierte Namen erwartet. Schließlich soll das Modell bei der Anwendung auf neue Dokumente mit unbekanntem Namen in allen möglichen Varianten in der Lage sein, diese als Namen zu erkennen.

Dokumente zu einem Arbeitsbereich hinzufügen

Zum Trainieren eines Modells müssen Sie in Ihrem Arbeitsbereich Dokumente hinzufügen, die für die Inhalte Ihres Fachgebiets repräsentativ sind.

Informationen zu dieser Task

Ein bewährtes Verfahren besteht darin, eine relativ kleine Sammlung von Dokumenten als Ausgangspunkt zu verwenden. Verwenden Sie diese Dokumente zum Schulen der Annotatorbenutzer (sofern Annotatorbenutzer zum Einsatz kommen) und zum Optimieren der Annotationsrichtlinien. Kleine Dokumente erleichtern den Annotatorbenutzern das Erkennen von Koreferenzketten innerhalb des Dokuments. Wenn die Genauigkeit der Annotationen zunimmt, können Sie weitere Dokumente zum Korpus hinzufügen, um das Training zu vertiefen.

Vorgehensweise

So fügen Sie Dokumente zu einem Arbeitsbereich hinzu:

  1. Melden Sie sich als Knowledge Studio-Administrator oder -Projektleiter an und wählen Sie Ihren Arbeitsbereich aus.

  2. Wählen Sie die Registerkarte Assets > Dokumente > Dokumentgruppen aus.

  3. Klicken Sie auf Dokumentgruppen hochladen, um Dokumente zum Korpus hinzuzufügen.

  4. Laden Sie Dokumente in einem der unterstützten Formate hoch. Weitere Informationen zu den unterstützten Dokumenttypen und zu Größenbegrenzungen sowie weitere Informationen finden Sie unter Arbeitsbereich erstellen > Zusammenfassung der Eingaben, Ausgaben und Einschränkungen.

    Hinweise zu ZIP-Dateien mit Dokumenten, die aus einem anderen Arbeitsbereich heruntergeladen wurden

    Beim Importieren annotierter Dokumente werden die Wörter erneut in Tokens zerlegt. Dieser Prozess kann die Satzgrenzen verändern, die von Knowledge Studio erkannt werden. Da Annotationen innerhalb von Sätzen definiert werden, können bei diesem Vorgang gegebenenfalls einige Annotationen ungültig gemacht werden. Führen Sie nach dem Hochladen von Dokumenten aus einem anderen Arbeitsbereich eine kurze Überprüfung der Annotationen durch, um eventuelle Abweichungen zu beheben.

    • Wenn Sie zuvor Dokumente aus einem Knowledge Studio-Arbeitsbereich heruntergeladen haben, ziehen Sie die ZIP-Datei mit den heruntergeladenen Dokumenten oder lokalisieren Sie die Datei durch Klicken und wählen Sie sie aus. Wenn Sie Annotationen einschließen möchten, die vor dem Herunterladen in den Dokumenten hinzugefügt wurden, stellen Sie sicher, dass die Option zum Einschließen der Ground Truth ausgewählt ist, bevor Sie auf Hochladen klicken. Es werden nur Annotationen importiert, die vor dem Herunterladen der Dokumente in die Ground Truth hochgestuft wurden.
    • Sie müssen das Typsystem aus dem ursprünglichen Arbeitsbereich in den aktuellen Arbeitsbereich hochladen, bevor Sie Ground Truth-Annotationen hochladen können. Weitere Informationen finden Sie unter Ressourcen aus einem anderen Arbeitsbereich hochladen.

    Hinweise zu ZIP-Dateien mit Dokumenten im UIMA CAS XMI-Format

    • Wenn Sie zuvor annotierte Dokumente im UIMA CAS XMI-Format heruntergeladen haben, können Sie die ZIP-Datei mit den analysierten Inhalten hochladen. Geben Sie den gewünschten Inhaltstyp an, den Sie hochladen möchten, bevor Sie auf Hochladen klicken. Weitere Informationen zum Erstellen dieser Dateien und Voraussetzungen zum Hochladen der Dateien finden Sie unter Vorannotierte Dokumente hochladen.

  5. Klicken Sie nach dem Hinzufügen der Dokumente auf die Dokumentnamen, um eine Vorschau anzuzeigen und zu überprüfen, dass der Inhalt OK ist. Überprüfen Sie beispielsweise, dass die Textdateien im UTF-8-Format vorliegen und keine diakritischen Zeichen, Zeichennormalisierungsprobleme oder falschen Satzumbrüche in den Dokumenten zu sehen sind. Falls Probleme vorliegen, müssen Sie die Dateien gegebenenfalls vorverarbeiten, bevor Sie zum Korpus hinzugefügt werden. Die Dokumente sollten möglichst fehlerfrei und korrekt formatiert sein, bevor die Annotierung mithilfe von Wörterverzeichnissen oder durch Annotatorbenutzer beginnt.

Nächste Schritte

Vor Beginn der Annotatorbenutzertasks sollten Sie den Korpus in mehrere Dokumentgruppen aufteilen und Annotatorbenutzer für die Dokumentgruppen zuordnen.

Administratoren und Projektleiter können Dokumentgruppen direkt annotieren, ohne Annotationstasks zu erstellen.

Dokumente löschen

Sie können ein Dokument löschen, wenn Sie feststellen, dass es keinen fachspezifischen Text enthält, der für das Modell relevant ist.

Um ein Dokument zu löschen, wählen Sie die Option aus, die für Ihre Situation gilt:

Löschen eines Dokuments, das keiner Annotationstask zugeordnet wurde

Wenn das Dokument, das Sie löschen möchten, keiner Annotationstask zugeordnet ist, führen Sie die folgenden Schritte aus, um das Dokument zu löschen.

Vorgehensweise

Melden Sie sich als Knowledge Studio-Administrator an und wählen Sie Ihren Arbeitsbereich aus.

  1. Wählen Sie die Registerkarte Assets > Dokumente > Dokumentgruppen aus.
  2. Wählen Sie die Dokumentgruppe aus, die das zu löschende Dokument enthält. Die Dokumentgruppe wird geöffnet.
  3. Lokalisieren Sie das Dokument, das Sie entfernen möchten und klicken Sie dann auf Löschen.

Löschen eines Dokuments, das einer Annotationstask zugeordnet wurde, und wenn die von Annotatorbenutzern erstellte Annotation noch nicht begonnen hat

Wenn das Dokument, das Sie löschen möchten, einer Annotationstask zugeordnet ist und die von Annotatorbenutzern erstellte Annotation noch nicht begonnen hat, führen Sie die folgenden Schritte aus, um das Dokument zu löschen.

Vorgehensweise

  1. Melden Sie sich als Knowledge Studio-Administrator an und wählen Sie Ihren Arbeitsbereich aus.

  2. Löschen Sie die Annotationstask:

    1. Öffnen Sie die Seite Machine Learning-Modell > Annotationen. Klicken Sie auf die Registerkarte Annotationstasks.
    2. Suchen Sie die Annotationstask, der das Dokument zugeordnet ist, klicken Sie auf das Symbol Menü anzeigen in der Task und klicken Sie anschließend auf Löschen.
  3. Löschen Sie das Dokument, wie im Abschnitt Löschen eines Dokuments, das keiner Annotationstask zugeordnet wurde beschrieben.

  4. Nach dem Löschen des Dokuments können Sie die Annotationstask neu erstellen und dieselbe Annotationsgruppe zuordnen, die nun ein Dokument weniger enthält.

Löschen eines Dokuments, das einer Annotationstask zugeordnet wurde, und wenn die von Annotatorbenutzern erstellte Annotation begonnen hat

Wenn das Dokument, das Sie löschen möchten, einer Annotationstask zugeordnet ist und die von Annotatorbenutzern erstellte Annotation begonnen hat, führen Sie die folgenden Schritte aus, um das Dokument zu löschen.

Wenn Sie bei einem aktiven Benutzerannotator eine Task löschen, verlieren Sie Ihre laufende Arbeit.

Vorgehensweise

  1. Bitten Sie die Annotatorbenutzer, dass sie das nicht erwünschte Dokument ignorieren sollen.
  2. Wenn die Annotationsarbeit in den anderen Dokumenten abgeschlossen ist und die Annotatorbenutzer alle Dokumente zum Hinzufügen zur Ground Truth abgeschickt haben prüfen und akzeptieren Sie die abgeschickten Dokumente.
  3. Beheben Sie alle Annotationskonflikte.
  4. Wenn alle Dokumente Teil der Ground Truth sind und die Task abgeschlossen ist, löschen Sie die Task, wie in Löschen eines Dokuments, das einer Annotationstask zugeordnet wurde, und wenn die von Annotatorbenutzern erstellte Annotation noch nicht begonnen hat beschrieben.
  5. Löschen Sie das Dokument, wie im Abschnitt Löschen eines Dokuments, das keiner Annotationstask zugeordnet wurde beschrieben.

Sie können bestätigen, dass die Annotationen zu den verbleibenden Dokumenten nicht verloren gehen, indem Sie die Dokumentgruppen herunterladen und die Dokumente im Ordner gt überprüfen.

Datenmodell

Die Diagramme in diesem Abschnitt geben eine Übersicht über den Dokumentfluss in einem Knowledge Studio-System und veranschaulichten die Unterschiede zwischen Dokumenten im Korpus, in einer Annotationstask und in der Ground Truth.

Der Korpus enthält Dokumente, die in Dokumentgruppen aufgeteilt sind:

  • Ein Dokument ist im Grunde nur eine Ansammlung von Textzeichenfolgen.
  • Eine Dokumentgruppe ist ein Verweis auf eine Reihe von Dokumenten. Die Dokumentgruppe enthält keine Kopien der Dokumente.
  • Manche Dokumentgruppen verweisen möglicherweise auf ein einziges Dokument. Diese Einstellung können Sie mit dem Überschneidungsparameter steuern, den Sie beim Erstellen von Annotationsgruppen angeben.

Diese Abbildung zeigt zwei Dokumentgruppen, die auf drei Dokumente verweisen. Die Dokumente sind auf die Gruppen verteilt. Abbildung 1. Diese Abbildung zeigt zwei Dokumentgruppen, die auf drei Dokumente verweisen. Die Dokumente sind auf die Gruppen verteilt.

Die Ground Truth beinhaltet die Annotationen (Erwähnungen, Beziehungen und koreferenzierte Erwähnungen), die in Dokumenten hinzugefügt wurden. Die Ground Truth ist für jedes Dokument einmalig.

Diese Abbildungen zeigen, dass Ground Truth aus den Anmerkungen besteht, die Dokument 1, Dokument 2, Dokument 3 usw. hinzugefügt wurden. Abbildung 2. Diese Abbildungen zeigen, dass Ground Truth aus den Anmerkungen besteht, die Dokument 1, Dokument 2, Dokument 3 usw. hinzugefügt wurden.

Wenn Sie eine Annotationstask erstellen, werden Kopien der Annotationen für jedes Dokument in der Annotationstask erstellt, das Sie zu dieser Task hinzufügen. Annotatorbenutzer annotieren das Dokument. Die Annotationen sind voneinander und von der Ground Truth getrennt. Eine Annotationstask ist ein zeitbasiertes Konzept, das es Annotatorbenutzern ermöglicht, Text in abgegrenzten Bereichen zu annotieren. Im Gegensatz dazu ist die Ground Truth permanent und einmalig.

Diese Abbildung zeigt, dass der Projektleiter Annotationsgruppen erstellt und sie einer Annotationstask zuordnet. Die Annotatorbenutzer Dave und Phil annotieren Dokumente in den Gruppen, die ihnen zugeordnet sind. Abbildung 2. Diese Abbildung zeigt, dass der Projektleiter Annotationsgruppen erstellt und sie einer Annotationstask zuordnet. Die Annotatorbenutzer Dave und Phil annotieren Dokumente in den Gruppen, die ihnen zugeordnet sind.

Nachdem der Projektleiter Annotationsgruppen in einer Annotationstask genehmigt hat, werden die Annotationen in den Dokumenten, die sich nicht mit anderen Annotationsgruppen überschneiden, als Ground Truth festgelegt. Für Dokumente, die sich mit Annotationsgruppen überschneiden (in diesem Beispiel das Dokument 2), muss der Projektleiter die vorhandenen Konflikte beurteilen und beheben. Die Annotationen in Dokumenten mit Überschneidungen werden erst in die Ground Truth hochgestuft, nachdem Sie in der Beurteilungsphase genehmigt wurden.

Die Ground Truth wird anschließend zum Trainieren und Testen eines Machine Learning-Modells verwendet oder als Basis für den nächsten Schritt der Modellentwicklung. Um Ground Truth in einem neuen Entwicklungsschritt zu verwenden, müssen Sie eine neue Annotationstask erstellen.

Diese Abbildung zeigt, wie Annotationen, die von zwei Annotatorbenutzern hinzugefügt wurden, zu Ground Truth werden. Ein Dokument mit der Bezeichnung 'Dokument 2' wird von beiden Annotatorbenutzern annotiert. Die Annotationen in diesem Dokument mit Überschneidungen müssen beurteilt werden, bevor sie in die Ground Truth aufgenommen werden. Abbildung 3. Diese Abbildung zeigt, wie Annotationen, die von zwei Annotatorbenutzern hinzugefügt wurden, zu Ground Truth werden. Ein Dokument mit der Bezeichnung 'Dokument 2' wird von beiden Annotatorbenutzern annotiert. Die Annotationen in diesem Dokument mit Überschneidungen müssen beurteilt werden, bevor sie in die Ground Truth aufgenommen werden.