Angepasste Entitäten definieren

Bringen Sie Discovery Begriffe bei, die für Ihr Unternehmen von Bedeutung sind, indem Sie einen Entitätsextraktor erstellen.

Ein Entitätsextraktor ist ein Modell für maschinelles Lernen, das Begriffe erkennt und kennzeichnet, die für Ihre Geschäftsanforderung oder Ihren Anwendungsfall von Bedeutung sind. Wenn Sie einen Entitätsextraktor erstellen, können Sie den Inhalt und den Umfang der zu suchenden und zu extrahierenden Informationen festlegen. Ihr Extraktor kann Folgendes extrahieren:

  • Begriffe, die Objekte darstellen, z. B. Gemüsenamen aus Kochrezepten oder die Marke und das Modell von Autos aus Unfallberichten
  • Attribute von Objekten, wie z. B. Farbe und Menge
  • Kurze Ausdrücke, z. B. 107 deaths in France, revenue of $343M

Ein Entitätstyp ist ein 'Ding' -Typ. Um einen Entitätsextraktor zu erstellen, definieren Sie eine Gruppe von Entitätstypen, die Sie interessieren. Anschließend annotieren Sie eine Sammlung Ihrer eigenen Dokumente, indem Sie Begriffe oder Phrasen suchen, die den Typ der Informationen darstellen, die Sie extrahieren und als Entitätsbeispiele kennzeichnen möchten.

Nachdem Sie Entitätstypen definiert und Entitätsbeispiele beschriftet haben, können Sie ein Modell für maschinelles Lernen generieren. Das Modell lernt über die Informationen, die Sie interessieren, basierend darauf, wie die Begriffe oder Ausdrücke, die Sie als Beispiele beschriften, in Sätzen referenziert werden. Das Modell lernt aus dem Kontext und der Sprache, mit denen die Entitätsbeispiele in den Trainingsdaten referenziert werden.

Nachdem das Machine Learning-Modell gut genug trainiert wurde, um Ihre Entitätstypen zu erkennen, können Sie das Modell als Aufbereitung publizieren und die Aufbereitung auf neue Dokumente anwenden. Die Aufbereitung des Extraktors für angepasste Entitäten erkennt und kennzeichnet neue Erwähnungen derselben und ähnlicher Begriffe wie Vorkommen der Entitätstypen, für die Sie sich interessieren.

Weitere Informationen zur Verwendung des Entitätsextraktors zum Hinzufügen von Domänenanpassungen zu Ihren KI-Anwendungen finden Sie im Blogbeitrag Entity Extractor Feature in Watson Discovery v2.

Discovery verfügt auch über eine integrierte Aufbereitung Entities, die direkt auf Ihre Sammlung angewendet werden können. Es erfordert kein Training, um allgemein bekannte Eigennomen zu erkennen. Weitere Informationen zur Aufbereitung von Watson NLP-Entitäten finden Sie unter Entitäten.

Sie haben bereits ein Entitätstypensystem in Knowledge Studioerstellt? Sie können das Korpus, das Ihrem Modell für maschinelles Lernen zugeordnet ist, als Ausgangspunkt für Ihre Trainingsdaten des Entitätsextraktors verwenden. Weitere Informationen finden Sie unter Korpus importieren.

Informationen zu den Sprachen, in denen das Entitätsextraktionsprogramm verwendet wird, finden Sie unter Sprachunterstützung.

Video zur Übersicht über den Entitätsextraktor

Dieses Video bietet einen Überblick darüber, wie benutzerdefinierte Entitätstypen definiert und anschließend verwendet werden, um relevante Begriffe aus Ihren Daten zu extrahieren.

Zum Lesen einer Mitschrift (Transkript) des Videos öffnen Sie das Video auf YouTube.com. Klicken Sie dann auf das Symbol Weitere Aktionen und wählen Sie die Option Transkript öffnen aus.

Beispiel

Wenn Sie mit der integrierten Aufbereitung für Entitäten vertraut sind, wissen Sie, dass die Aufbereitung Begriffe erkennen kann, die verallgemeinerten Kategorien entsprechen, beispielsweise Person und Location. Mit dem Entitätsextraktionsprogramm können Sie steuern, was Begriffe oder Phrasen ausmacht, die aussagekräftig sind.

Die folgende Abbildung zeigt die Begriffe, die von einer Aufbereitung, die Erwähnungen von family members-Entitätstypen erkennt, aus Text extrahiert werden können. Das Beispiel veranschaulicht, wie Erwähnungen von Familienmitgliedern und andere Entitätserwähnungen (die von der integrierten Aufbereitung für Entitäten erkannt werden) vorhergesagt werden können.

Zeigt einen Auszug aus Pride and Vorurteil mit Erwähnungen und Erwähnungen von Familienmitgliedern (Tochter, Schwestern, Mutter) (Mr. Bennett, Mr. Bingley, Netherlands, Longbourn).
Labeled entity examples

Dieser Auszug stammt aus Kapitel 3 von Stolz und Vorurteil von Jane Austen.

Vorbereitende Schritte

Suchen oder erstellen Sie eine Objektgruppe mit Dokumenten, die verschiedene Beispiele der Entitätstypen enthalten, über die Discovery informiert werden soll. Um den Extraktor zu unterrichten, müssen Sie Beispiele für Entitätstypen beschriften. Sie können Beispiele nur kennzeichnen, wenn Ihre Sammlung gültige Beispiele enthält. Versuchen Sie, Dokumente mit vielen und unterschiedlichen Begriffen zu finden, die als Beispiele für jeden Entitätstyp dienen, den Sie definieren möchten.

Entitätsextraktionsprogramm hinzufügen

Um einen Entitätenextraktor hinzuzufügen, führen Sie die folgenden Schritte aus:

  1. Öffnen Sie das Projekt, in dem Sie den Entitätenextraktor erstellen möchten.

    Das Projekt muss mindestens eine Sammlung mit Dokumenten enthalten, die für Ihre Domänendaten repräsentativ sind.

  2. Erweitern Sie in der Anzeige Verbesserungstools auf der Seite Verbessern und anpassen den Eintrag Domänenkonzepte für Teach und klicken Sie dann auf Entitäten extrahieren.

  3. Klicken Sie auf Neu.

    Wenn Sie ein Entitätsextraktionsprogramm erstellen möchten, das auf dem Entitätstypsystem aus einem IBM Watson® Knowledge Studio-Korpus basiert, klicken Sie auf den Pfeil und wählen Sie Knowledge Studio-Korpus importieren aus. Informationen zu den nächsten Schritten finden Sie unter Knowledge Studio-Korpus importieren.

  4. Fügen Sie einen Extraktornamen und optional eine Beschreibung hinzu.

    Dieser Name wird als Modellname und als Name der Aufbereitung verwendet, die beim Publizieren des Modells erstellt wird. Der Name wird als Aufbereitungsname auf der Aufbereitungsseite angezeigt, auf der Sie und andere Benutzer ihn auf Objektgruppen anwenden können. Sie wird auch als Modellname in der JSON-Darstellung von Dokumenten angezeigt, in denen angepasste Entitäten gefunden werden. Der Name wird mit der von Ihnen angegebenen Großschreibung und dem von Ihnen angegebenen Abstand gespeichert.

  5. Wählen Sie eine Sammlung mit Dokumenten aus, die für Ihre Domänendaten repräsentativ sind.

  6. Wählen Sie Felder aus dem Dokument aus, die in der Dokumentansicht angezeigt werden sollen, in der Sie Dokumente aus der Sammlung beschriften.

    • Dokumenttitel wird in der Seitenkopfzeile als Dokumentname angezeigt. Choose a field that has a unique value per document, such as the file name, which is stored in the extracted_metadata.filename field.
    • Dokumenthauptteil ist die Position, an der Sie Entitätsbeispiele beschriften. Wählen Sie ein Feld aus, das den Großteil des Dokumentinhalts enthält, beispielsweise das Feld text.

    Zeigt, dass PP3.docx der Dokumenttitel ist und die Haupttextanzeige das Haupttextfeld anzeigt.
    Label documents page

  7. Klicken Sie auf Erstellen.

Ein Dokument aus der von Ihnen ausgewählten Sammlung wird in der Ansicht Dokumente beschriften angezeigt. Sie beschriften Vorkommen der Entitätstypen, die Discovery aus diesem und anderen Dokumenten in der Objektgruppe erkennen soll.

Wenn im Hauptteil der Seite kein Text angezeigt wird, beginnen Sie jetzt mit der Erstellung eines neuen Entitätsextraktors. Wenn Sie dieses Mal einen Wert für das Feld Dokumenthauptteil auswählen, müssen Sie unbedingt ein Feld aus Ihren verarbeiteten Dokumenten auswählen, das Text enthält.

Entitätstypen definieren

Definieren Sie Entitätstypen, indem Sie die folgenden Schritte ausführen:

  1. Klicken Sie auf Entitätstyp hinzufügen.

  2. Fügen Sie den Namen des Entitätstyps und eine optionale Beschreibung hinzu.

    Verwenden Sie eine Namenskonvention, die für Ihre Daten funktioniert. The built-in Entities enrichment uses initial capitals and no spaces, for example EmailAddress. Um Ihre Entitäten von Entitäten zu unterscheiden, die durch andere Aufbereitungen extrahiert werden, können Sie eine andere Konvention verwenden.

  3. Optional: Wählen Sie die Farbe aus, die zur Hervorhebung von Text in dem Dokument verwendet werden soll, das Sie als Beispiel für diesen Entitätstyp beschriften möchten.

    Sie können auf eine Farbe in der Palette Beschriftungsfarbe klicken und auf das Symbol Farbe erneuern klicken, um von einer Farbe zur nächsten zu navigieren. Wenn Sie eine angepasste Farbe verwenden möchten, geben Sie den hexadezimalen Farbcode (#fff0f7) an.

  4. Klicken Sie auf Erstellen.

  5. Wiederholen Sie diesen Prozess, um alle Entitätstypen hinzuzufügen, die der Extraktor erkennen soll.

    Wenn Sie nicht sicher sind, was für Entitätstypen hinzugefügt werden soll, kann es hilfreich sein, zuerst die Dokumente in der Objektgruppe zu überprüfen. Durch die Überprüfung des Inhalts können Sie ein Gefühl dafür erhalten, welche Begriffe eine wichtige Bedeutung haben, und nach logischen Methoden suchen, um solche Begriffe zu gruppieren.

Signifikante Begriffe beschriften

Suchen Sie in der Ansicht Dokumente beschriften nach Begriffen mit Bedeutung in den Dokumenten aus Ihrer Sammlung und beschriften Sie sie, um ihre Entitätstypen anzugeben.

Bevor Sie mit dem Beschriften von Dokumenten beginnen, entscheiden Sie, ob die Massenbeschriftung aktiviert bleiben soll. Die Massenetikettenfunktion ist eine großartige Möglichkeit, den Prozess der Kennzeichnung Ihrer Dokumente zu beschleunigen. Wenn diese Option aktiviert ist, wird jeder Begriff, den Sie beschriften, automatisch überall dort beschriftet, wo er im Dokument vorkommt. Andernfalls müssen Sie jedes Vorkommen des Begriffs einzeln beschriften.

Wenn Sie Beispiele für Massenbeschriftungen nicht verwenden möchten, setzen Sie die Option Beispiele für Massenbeschriftungsentität auf Aus. Weitere Informationen finden Sie unter Beispiele für Massenbeschriftung.

Tipps zur Beschriftung

Lesen Sie diese Tipps, bevor Sie beginnen:

  • Die Dokumentsammlung, die Sie beschriften, muss eine repräsentative Gruppe von Dokumenten enthalten. Die Dokumente müssen viele unterschiedliche Beispiele für die Entitätstypen enthalten, die der Entitätsextraktor erkennen soll. Wenn die Objektgruppe, die Sie beim Erstellen des Entitätsextraktionsprogramms ausgewählt haben, die Anforderung nicht erfüllt, stoppen Sie jetzt und beginnen Sie erneut mit einer anderen Dokumentobjektgruppe.
  • Definieren Sie Entitätstypen, die sich deutlich voneinander unterscheiden.
  • Ziel ist es, mindestens 40 Beispiele für jeden Entitätstyp zu kennzeichnen.
  • Beschriften Sie jedes gültige Beispiel eines Entitätstyps. Überspringen Sie keine Vorkommen. Verwenden Sie die Massenbeschriftungsfunktion, um den Prozess zu beschleunigen.

Beispiele für Beschriftungsentitäten

Beschriftungsbegriffe im Dokument, die Beispiele für die von Ihnen definierten Entitätstypen darstellen. Wenn Sie mit einem Dokument fertig sind, wechseln Sie den Dokumentstatus von In Bearbeitung in Abgeschlossenund fahren dann mit dem nächsten Dokument fort.

Führen Sie die folgenden Schritte aus, um Entitätsbeispiele zu beschriften:

  1. Überprüfen Sie den Text des Dokuments. Suchen Sie nach Entitätsbeispielen für die Beschriftung.

    Die folgende Tabelle zeigt einige Beispiele.

    Entitätstypen und Beispiele
    Entitätstyp Beispiele für Beschriftungen im Dokument
    Farbe weiß, grün, lila
    car Cabriolet, SUV, Limousine
    AUTO_MODEL Entdecker, Bürger, Sorrent
    auto_hersteller Ford, Honda, Kia
    Kleider Hemd, Bluse, Skort
    Instrumente Anleihen, Aktien, ETFs, Munis

    Wenn ein Entitätstyp, den Sie identifizieren möchten, noch nicht erstellt wurde, fügen Sie ihn hinzu. Klicken Sie in der Anzeige Entitätstypen auf Neu erstellen. Weitere Informationen zum Hinzufügen von Entitätstypen finden Sie unter Entitätstypen definieren.

  2. Klicken Sie zunächst im Fenster Entitätstypen auf den Entitätstyp.

  3. Wählen Sie im Dokumenthauptteil das Wort oder den Ausdruck aus, das bzw. der das Entitätsbeispiel darstellt.

    Der Begriff wird ausgewählt und eine Farbbeschriftung wird auf den Begriff angewendet. Die ersten beiden Zeichen des Entitätstypnamens werden innerhalb der Bezeichnungsgrenze in Großbuchstaben hochgestellt. Sowohl die zweistellige ID als auch die Beschriftungsfarbe helfen Ihnen, das Beispiel dem Entitätstyp zuzuordnen, den es darstellt.

    Zeigt, dass eine Beschriftung auf das Wort 'Frau' in einem Satz angewendet wird.
    A label is applied to an entity example

    Der Beispieltext wird auch zur Anzeige Entitätstypen hinzugefügt. Wenn Sie auf das Winkelzeichen klicken, um Details anzuzeigen, wird das Beispiel aufgelistet. Der Beispieltext wird unabhängig von der Groß-/Kleinschreibung, die im ursprünglichen Text verwendet wird, in Kleinbuchstaben gespeichert.

  4. Wenn die Massenbeschriftung aktiviert ist, wird eine Benachrichtigung angezeigt, um die Anzahl der Vorkommen des Begriffs anzuzeigen, die im aktuellen Dokument gefunden und beschriftet wurden.

  5. Wenn Sie Vorkommen des Begriffs in allen Dokumenten in der Objektgruppe beschriften möchten, klicken Sie auf Auf alle Dokumente anwenden.

    Wenn Sie diese Option aktivieren, werden Vorkommen des Begriffs in allen Dokumenten in der Sammlung beschriftet, einschließlich der Dokumente, die Sie bereits geprüft und als abgeschlossen markiert haben.

    Sie werden aufgefordert, die Aktion zu bestätigen, weil sie nicht rückgängig gemacht werden können. Wenn Sie die Aktion nicht jedes Mal bestätigen müssen, wenn Sie die Massenbeschriftung auf alle Dokumente anwenden möchten, wählen Sie Keine erneute Bestätigung anfordern. Klicken Sie auf Ausführen.

    Zeigt das Dialogfeld zur Bestätigung der Massenbeschriftung an.
    Bulk labeling configuration confirmation

    Weitere Informationen finden Sie unter Beispiele für Massenbeschriftung.

  6. Blättern Sie durch das Dokument, um jedes gültige Beispiel jedes Entitätstyps zu kennzeichnen, den Ihr Extraktor erkennen soll.

    Sie können nach Begriffen suchen, die Sie als Entitätsbeispiele beschriften wollen. Weitere Informationen finden Sie unter Beispiele mithilfe von Schlüsselwörtern suchen.

    Das Modell für maschinelles Lernen lernt genauso viel von den Begriffen, die Sie nicht beschriften, wie von den Begriffen, die Sie bezeichnen.

    Wenn Sie ein gültiges Beispiel nicht beschriften, lernt das Modell, dass es keine gültige Erwähnung des Entitätstyps ist, wenn der Begriff in diesem Kontext verwendet wird. In einigen Fällen ist eine Auslassung angebracht. Einige Begriffe haben beispielsweise unterschiedliche Bedeutungen in verschiedenen Kontexten. Sie möchten den Begriff nicht kennzeichnen, wenn er im falschen Kontext verwendet wird. Wenn der Begriff jedoch im richtigen Kontext verwendet wird und Sie ihn nicht beschriften, weisen Sie dem Modell an, ihn zu ignorieren. Sie verringern die Effektivität des Modells, wenn Ihre Trainingsdaten inkonsistent sind.

    Nachdem Sie viele Beispiele beschriftet haben, werden Vorschläge für Entitätsbeispiele angezeigt. Sie können Entitätsbeispielvorschläge akzeptieren oder ablehnen.

    Zeigt die Eingabeaufforderung an, in der Sie gefragt werden, ob Sie einen Vorschlag akzeptieren möchten.
    Decide whether to accept a suggestion

    Das Akzeptieren von Beispielvorschlägen ist eine weitere Möglichkeit, den Beschriftungsprozess zu beschleunigen. Weitere Informationen finden Sie unter Entitätsbeispielvorschläge. Nachdem Sie einen Vorschlag akzeptiert haben, können Sie den Begriff als Massenzuweisung kennzeichnen.

  7. Wenn Sie einen Fehler machen und das falsche Wort beschriften oder ein Wort vom Massenbezeichnungsprozess falsch beschriftet wurde, können Sie die Beschriftung löschen.

    Bewegen Sie den Mauszeiger über das beschriftete Wort, bis die Option Dieses Beispiel löschen angezeigt wird, und klicken Sie dann darauf. Sie können nur diese Erwähnung oder alle Erwähnungen im Dokument löschen. Treffen Sie eine Auswahl und klicken dann auf Löschen.

  8. Nachdem Sie alle Entitätsbeispiele im aktuellen Dokument beschriftet haben, ändern Sie den Dokumentstatus von In Bearbeitung in Abgeschlossen.

    Ein weiteres Dokument aus der Sammlung wird angezeigt.

  9. Beschriftungsbeispiele für Ihre Entitätstypen in jedem Dokument in der Sammlung.

    Sie können jederzeit während des Bezeichnungsprozesses auf Entitätsextraktionsprogramm speichern klicken, um Ihre Arbeit zu speichern.

  10. Wenn die aktuelle Dokumentgruppe nicht genügend Beispiele enthält, können Sie weitere Dokumente hinzufügen.

    Klicken Sie in der Anzeige Dokumentliste auf Dokumente hinzufügen. Die Option ist nur verfügbar, wenn weitere Dokumente in der Objektgruppe verfügbar sind. Sie können bis zu 20 Dokumente hinzufügen. Wenn die Massenbeschriftung für alle Dokumente aktiviert ist, werden Beschriftungen automatisch auf die neu hinzugefügten Dokumente angewendet.

  11. Nachdem Sie Beispiele in so vielen Dokumenten in der Objektgruppe wie gewünscht beschriftet haben, klicken Sie auf Entitätsextraktor speichern und öffnen dann die Seite Extraktor trainieren.

Beispiele für Massenbeschriftung

Bei den meisten Entitätsbeispielen ist die Aktivierung der Massenbeschriftungsfunktion hilfreich. Sie können ihn überspringen, wenn ein Begriff in verschiedenen Kontexten mehr als eine Bedeutung hat. Werten Sie in diesem Fall jedes Vorkommen einzeln aus. Denken Sie daran: Wenn Sie die Massenbeschriftungsfunktion aktivieren, können Sie die Genauigkeit der Beschriftungen überprüfen, die automatisch hinzugefügt wurden, und bei Bedarf Korrekturen vornehmen, wenn Sie das Dokument überprüfen.

Nachdem Sie die Massenbeschriftungsfunktion aktiviert haben, wird eine Benachrichtigung angezeigt, die angibt, wie viele Vorkommen eines Entitätsbeispiels im aktuellen Dokument gefunden wurden. Von der aktuellen Seite aus kann das Beschriftungstool nicht auf andere Dokumente zugreifen, um zu berichten, wie viele Vorkommen in anderen Dokumenten aus der Objektgruppe vorhanden sind. Die Anzahl der Erwähnungen wird jedoch im Fenster Entitätstypen angezeigt. Wenn Sie zum ersten Mal andere Dokumente öffnen, können Sie die Anzahl der Erwähnungen überprüfen, um festzustellen, wie viele Erwähnungen automatisch beschriftet wurden.

Hat die Massenbeschriftungsfunktion ein Vorkommen verpasst?

Vorkommen des Begriffs werden nicht beschriftet, wenn sie in demselben Ausdruck auftreten, in dem der Begriff bereits beschriftet ist. Beispiel: Das erste Vorkommen des Begriffs husband wird nicht beschriftet, wenn die Massenbeschriftungsfunktion für das zweite Vorkommen des Begriffs im folgenden Satz aktiviert wird.

Wird angezeigt, wenn ein überlappendes Vorkommen keine Bezeichnung durch die Massenbeschriftungsfunktion erhält.
Treatment of overlapping labels

Beispielvorschläge für Entitäten

Nachdem Sie genügend Beispiele beschriftet haben, werden vorgeschlagene Beispiele für Entitätstypen angezeigt. Das System lernt von den Typen von Beispielen, die Sie beschriften, und wendet das Gelernte an, um potenzielle neue Beispiele zu identifizieren. Wenn Sie beispielsweise red, orange, yellow, green und blue als Beispiele für den Entitätstyp color beschriftet haben, werden in der Anzeige Beispielvorschläge möglicherweise indigo und violet als vorgeschlagene Beispiele für die Beschriftung angezeigt. Vorschläge werden erst angezeigt, nachdem Sie viele Beispiele eines Entitätstyps beschriftet haben.

Das folgende Beispiel zeigt Vorschläge für Erwähnungen von Familienmitgliedern.

Zeigt Vorschläge für Familienmitgliederentitäten an
Entity example suggestions

Möglicherweise stellen Sie fest, dass ein Begriff, den Sie für die Massenbeschriftung ausgewählt haben, nicht beschriftet, sondern als Vorschlag angezeigt wird. Ein Begriff wird in den folgenden Situationen übersprungen:

  • Der Begriff kann in verschiedenen Nomen in verschiedenen Abschnitten des Dokuments vorkommen. Der Begriff father kann beispielsweise in den Nomen the kindest *father* und to her *father* vorkommen. Wenn ein Wort in einem Substantivausdruck mit Adjektiven enthalten ist, kann sich die Bedeutung ändern. Daher werden solche Begriffe manchmal vorgeschlagen und nicht automatisch beschriftet.
  • Ein Wort kann ein gültiges Beispiel für sich allein und als Teil einer Erwähnung mit mehreren Wörtern sein. Zum Beispiel kann sich die Erwähnung von IBM auf das Unternehmen International Business Machines, Corp. beziehen oder als Teil eines Produktnamens verwendet werden, wie IBM Cloud Pak for Data. Ein Wort oder Ausdruck kann jedoch nur Teil eines Beispiels sein. Beispielbezeichnungen dürfen sich nicht überlappen. Daher müssen Sie auswählen, welcher Beispielvorschlag am genauesten ist. In diesem Beispiel, in dem der Begriff IBM als Teil eines Produktnamens verwendet wird, ist es genauer, die vollständige Phrase als Beispiel für den Entitätstyp Product zu bezeichnen.
  • Der Service erkennt möglicherweise, dass ein Begriff ein mögliches Beispiel für mehrere Entitätstypen ist. Das Wort top könnte beispielsweise die beste oder Hemdbedeuten.

Um einen Vorschlag genauer zu untersuchen, klicken Sie darauf, um das Wort im Kontext des Dokuments anzuzeigen. Das Anzeigen des Begriffs im Kontext hilft Ihnen zu entscheiden, ob das Vorkommen ein gültiges Entitätsbeispiel ist, das Sie beschriften können.

Beschriftete Daten für einen Entitätsextraktor exportieren

Sie können die beschrifteten Daten für einen Entitätsextraktor aus Discoveryexportieren. Sie können die exportierten beschrifteten Daten zum Trainieren oder Erstellen von Large Language Models (LLMs) in einem Service wie Watson Studio und Natural Language Processing (NLP) verwenden.

Führen Sie die folgenden Schritte aus, um die beschrifteten Daten zu exportieren:

  1. Erweitern Sie in der Anzeige Verbesserungstools der Seite Verbessern und anpassen den Eintrag Domänenkonzepte für Teachund klicken Sie dann auf Entitäten extrahieren.

  2. Klicken Sie für den Entitätsextraktor, aus dem Sie beschriftete Daten exportieren wollen, auf das Symbol Aktionen und wählen Sie dann Beschriftete Daten herunterladen aus.

    Es wird eine komprimierte Datei mit gekennzeichneten Daten heruntergeladen. Die komprimierte Datei enthält die folgenden JSON-Dateien.

    • labeled_data.json: Enthält den Text und die Beschriftungen. Das Datenformat basiert auf dem Eingabedatenformat für die Entitätsextraktion in Watson Natural Language Processing. Weitere Informationen finden Sie unter Eingabedatenformat.
    • metadata.json: Enthält Metadaten für den Arbeitsbereich und beschriftete Daten

Knowledge Studio-Korpus importieren

Für installierte Implementierungen wurde die Importfunktion mit dem Release 4.6.2 hinzugefügt.

Sie können ein Korpus von Dokumenten importieren, die in IBM Watson® Knowledge Studio als Trainingsdaten für einen Entitätsextraktor in Discoveryannotiert wurden.

Entitätstypen, die in Knowledge Studio definiert wurden, werden in Discoveryals neue Entitätstypen angezeigt. Sie können die importierten Dokumente weiterhin annotieren, wenn Sie das Entitätsextraktionsmodell anpassen.

Entitätssubtypen und -beziehungen aus dem Modell für maschinelles Lernen Knowledge Studio werden nicht dargestellt. Außerdem sind dem Modell keine benutzerdefinierten Wörterverzeichnisse zugeordnet.

Bevor Sie ein Korpus importieren können, müssen Sie die Dokumentgruppe aus Knowledge Studio als ZIP-Datei exportieren. Führen Sie die entsprechenden Schritte zum Exportieren basierend auf Ihrem Knowledge Studio-Bereitstellungstyp aus:

Sie müssen zwar sowohl die Dokumentgruppe als auch das Typsystem herunterladen, um Anmerkungen in Dokumente einzuschließen, die Sie in einen anderen Arbeitsbereich von Knowledge Studio hochladen, aber dasselbe gilt in diesem Anwendungsfall nicht. Sie importieren nur die Dokumentgruppe in Discovery. Alle Anmerkungen in den Dokumenten werden in Discoveryneu erstellt. Das Typsystem Knowledge Studio ist nicht erforderlich.

Führen Sie die folgenden Schritte aus, um ein Knowledge Studio-Korpus zu importieren:

  1. Öffnen Sie das Projekt, in das Sie den Korpus importieren möchten.

  2. Erweitern Sie in der Anzeige Verbesserungstools auf der Seite Verbessern und anpassen den Eintrag Domänenkonzepte für Teach und klicken Sie dann auf Entitäten extrahieren.

  3. Klicken Sie auf den Pfeil, der der Schaltfläche Neu zugeordnet ist. Klicken Sie anschließend auf Knowledge Studio-Korpus importieren.

  4. Fügen Sie einen Extraktornamen und optional eine Beschreibung hinzu.

    Dieser Name wird als Modellname und als Name der Aufbereitung verwendet, die beim Publizieren des Modells erstellt wird. Der Name wird als Aufbereitungsname auf der Aufbereitungsseite angezeigt, auf der Sie und andere Benutzer ihn auf Objektgruppen anwenden können. Sie wird auch als Modellname in der JSON-Darstellung von Dokumenten angezeigt, in denen angepasste Entitäten gefunden werden. Der Name wird mit der von Ihnen angegebenen Großschreibung und dem von Ihnen angegebenen Abstand gespeichert.

  5. Klicken Sie auf Hochladen und suchen Sie dann die ZIP-Datei, die Sie aus Knowledge Studioexportiert haben, und wählen Sie sie aus. Klicken Sie auf Erstellen.

    Die annotierten Dokumente, die Sie hochladen, werden im Arbeitsbereich des Entitätsextraktionsprogramms gespeichert und nicht als neue Objektgruppe im Projekt. Sie können mit dem Annotieren der Dokumente fortfahren.

Geben Sie Discovery Zeit für den Import und die Verarbeitung des Modellkorpus für maschinelles Lernen. Nachdem der Entitätsextraktor erstellt wurde, wird er auf der Seite Beschriftungsdokumente geöffnet.

Extraktor trainieren

Nachdem Sie Dokumente beschriftet haben, überprüfen Sie die Trainingsdaten, die zum Trainieren des Entitätsextraktormodells verwendet werden.

Um den Extraktor zu trainieren, führen Sie den folgenden Schritt aus:

  1. Entscheiden Sie, ob Sie eine erweiterte Option anwenden möchten. Die meisten Modelle erfordern keine Änderungen an diesen Optionen.

    Die folgenden Anpassungen sind auf der Seite Prüfen und Fertigstellen verfügbar:

    • Dokumente einschließen, die nicht von einer Person im Schulungsset geprüft wurden.

      Normalerweise können nur Dokumente, die von einer Person als abgeschlossen gekennzeichnet, geprüft und explizit als abgeschlossen markiert wurden, Kandidaten für die Aufnahme in das Trainingsset sein. Wenn Sie jedoch zulassen möchten, dass Dokumente, die nicht als abgeschlossen markiert wurden, in das Trainingsset aufgenommen werden, können Sie dies tun.

    • Ändern Sie das Verhältnis der Dokumente, die in den Dokumentgruppen enthalten sind, aus denen Ihre Trainingsdaten bestehen.

      Die Dokumente aus Ihrer Sammlung werden nach dem Zufallsprinzip in die folgenden Gruppen aufgeteilt:

      • Trainingsset: Die Dokumente, die Sie beschriften und die zum Trainieren des Machine Learning-Modells des Entitätsextraktors verwendet werden. Das Ziel des Trainingssets ist es, dem Modell für maschinelles Lernen die richtigen Beschriftungen beizubringen.
      • Testgruppe: Die Dokumente, die zum Testen des trainierten Modells verwendet werden. Nach der Ausführung eines Tests können Sie die Ergebnisse überprüfen, Bereiche, in denen das Modell fehlerhaft ist, genau analysieren und Wege finden, die Leistung des Modells zu verbessern.
      • Blinde Gruppe: Dokumente, die reserviert und zum regelmäßigen Testen des Modells verwendet werden, nachdem mehrere Test-und Verbesserungsiterationen abgeschlossen wurden. Die Dokumente im Blindset werden absichtlich abgeseilt. Wenn Sie das Modell mit Dokumenten aus dem Testset testen und die Ergebnisse analysieren, werden Sie mit den zugrunde liegenden Testdokumenten vertraut. Da die Testdokumente iterativ zur Verbesserung des Modells verwendet werden, können sie das Modelltraining indirekt beeinflussen. Deshalb ist das Blindenset so wichtig. Das Blindset bietet Ihnen die Möglichkeit, in regelmäßigen Abständen eine unverzerrte Auswertung des Modells zu generieren.

      Die Standardaufteilung wendet ein Verhältnis (70 %-23 %-7%) an, das häufig für maschinelles Lernen verwendet wird.

  2. Klicken Sie auf Extraktor trainieren.

Wenn Sie den Extraktor trainieren, verwendet Discovery Dokumente aus dem Trainingsset zum Erstellen eines Modells für maschinelles Lernen. Nach der Generierung des Modells wird automatisch ein Test für die Dokumente aus der Testgruppe ausgeführt. Die Ergebnisse des Tests werden zur Überprüfung angezeigt.

Fehlerbehebung bei Trainingsproblemen

Hier finden Sie Informationen zu möglichen Fehlernachrichten und deren Behebung.

Die Trainingsdaten sind zu groß

Ihre Trainingsdaten enthalten große Textdokumente oder viele Entitätstypen und Ressourcen, die für die Verarbeitung der Daten erforderlich sind, sind größer als die für Ihre Serviceinstanz verfügbaren Ressourcen. Dieser Fehler kann auch auftreten, wenn Ihr Arbeitsbereich die dokumentierten Grenzwerte des Extraktors für Entitäten nicht überschreitet. Um das Problem zu beheben, können Sie einen der folgenden Ansätze ausprobieren:

  • Entfernen Sie mindestens einen Entitätstyp, um die Größe Ihrer Trainingsdaten zu verringern.
  • Entfernen Sie besonders große Dokumente aus den Trainingsdaten. Wenn beispielsweise eines der gekennzeichneten Dokumente besonders groß ist, ändern Sie den Status von Abgeschlossen in In Bearbeitung, um es aus den Trainingsdaten auszuschließen.
  • Reduzieren Sie die Anzahl der Dokumente, die im Trainingsset enthalten sind. Das Standardteilungsverhältnis (70 %-23 %-7%) für die Trainingsdaten verwendet 70% der Dokumente im Trainingsset. Sie können den Prozentsatz der Dokumente, die im Trainingsset verwendet werden, in einen kleineren Wert ändern. Sie können beispielsweise das Aufteilungsverhältnis in 60 %-33 %-7% ändern.
  • IBM Cloud Pak for DataIBM Software Hub Erhöhen Sie die Kapazität Ihrer eingesetzten Service-Instanz, indem Sie die Service-Pods vergrößern.

Extraktor auswerten

Klicken Sie auf die Registerkarte Extraktor auswerten, um Metriken aus dem Testlauf des erstellten Entitätsextraktormodells zu überprüfen.

In der folgenden Tabelle werden die verfügbaren Bewertungsmetriken beschrieben.

Metrikdetails
Metrik Beschreibung
Wahrheitsmatrix Eine Tabelle, die eine detaillierte numerische Aufgliederung von annotierten Dokumentgruppen bereitstellt. Verwenden Sie sie, um Erwähnungen von Entitätstypen, die vom Modell für maschinelles Lernen beschriftet sind, mit Erwähnungen von Entitätstypen zu vergleichen, die in den Trainingsdaten beschriftet sind.
F1-Score Misst, ob die optimale Balance zwischen Genauigkeit und Trefferquote erreicht wird. Der F1-Wert kann als gewichteter Durchschnitt der Werte für die Genauigkeit und die Trefferquote interpretiert werden. Der beste Wert für einen F1-Wert ist 1 und der schlechteste Wert ist 0. Die Gesamtscores sind niedriger, wenn das Modell nicht über genügend Trainingsdaten verfügt, um daraus zu lernen.
Genauigkeit Misst, wie viele der insgesamt extrahierten Erwähnungen als der richtige Entitätstyp klassifiziert sind Ein falscher positiver Wert liegt vor, wenn eine Entität nicht extrahiert werden sollte, sondern extrahiert wurde (Vorhergesagt = positiv, Tatsächlich = negativ). Falsch-positive Werte bedeuten normalerweise eine geringe Genauigkeit.
Trefferquote Misst, wie oft Entitätstyperwähnungen extrahiert werden, die extrahiert werden sollen. Ein falscher negativer Wert liegt vor, wenn ein Entitätstyp extrahiert werden soll, aber nicht extrahiert wurde (Vorhergesagt = negativ, Tatsächlich = positiv). Falsche negative Werte bedeuten in der Regel eine niedrige Trefferquote.
  1. Überprüfen Sie die Metriken, die zum Testlauf des Extraktormodells bereitgestellt werden, um festzustellen, ob mehr Training erforderlich ist.

  2. Sie können die Testergebnisse genauer untersuchen, indem Sie auf Trainingsergebnisse im Testset prüfen klicken.

    Dokumente aus dem Testset werden mit den vorhergesagten Beschriftungen in der einen Anzeige und der Ground Truth in der anderen Anzeige angezeigt.

    • Vorhergesagte Beschriftungen sind Beispiele, die der Entitätsextraktor als Entitätstypen identifiziert und beschriftet hat.
    • Die Ground Truth enthält Beispiele, die eine Person beschriftet oder massenweise beschriftet und von einer Person geprüft wurden. Etiketten in der Ground Truth gelten als die richtigen Etiketten.

    Die Leistung des Modells wird basierend auf der Übereinstimmung der vorhergesagten Bezeichnungen mit der Ground Truth bewertet.

Extraktor verbessern

Die folgende Tabelle enthält vorgeschlagene Korrekturen für häufig auftretende Probleme.

Verbesserungsaktionen
Problem Aktion zur Behebung des Problems
Niedrige Gesamtscores Möglicherweise sind in Ihrem Trainingsset nicht genügend Dokumente mit gekennzeichneten Beispielen vorhanden. Beschriften Sie weitere Beispiele in weiteren Dokumenten.
Niedriger Score für Vollständigkeit Beschriften Sie weitere Dokumente mit neuen Beispielen der Entitätstypen, die der Extraktor verpasst hat.
Niedriger Score für Genauigkeit Suchen Sie nach Entitätstypen, die häufig verwirrt sind. Suchen und beschriften Sie weitere Beispiele für jeden Entitätstyp, damit der Entitätsextraktor zwischen den Entitätstypen unterscheiden kann.

Dokumente zu Trainingsdaten hinzufügen

Um weitere Dokumente hinzuzufügen, führen Sie die folgenden Schritte aus:

  1. Öffnen Sie die Registerkarte Dokumente beschriften.

  2. Wählen Sie in der Anzeige Dokumentliste die Option Dokumente hinzufügen.

    Diese Schaltfläche ist inaktiviert, wenn keine anderen Dokumente zum Hinzufügen zum Entitätsextraktionsprogramm aus der aktuellen Objektgruppe verfügbar sind. Um der Objektgruppe weitere Dokumente hinzuzufügen, rufen Sie die Seite Aktivität für die Objektgruppe auf und klicken Sie dann auf die Kachel Daten hochladen, um nach weiteren Dateien zu suchen und sie hinzuzufügen.

Sie können die Dokumente aus der Sammlung nicht auswählen, um sie zu Bezeichnungszwecken in der Dokumentliste anzuzeigen. Wenn Sie bestimmte Dokumenttypen beschriften möchten, ziehen Sie in Betracht, repräsentative Dokumente zu einer Objektgruppe hinzuzufügen, die Sie zum Erstellen des Entitätsextraktionsprogramms verwenden können.

Die Anzahl der Dokumente, die in die Trainingsdaten aufgenommen werden können, ist begrenzt. Wenn Ihre Trainingsdaten Dokumente mit einer Kombination von Abschnitten enthalten, die beschriftet sind, und andere, die nicht beschriftet sind, könnte das System einige Beispiele aus nicht beschrifteten Sätzen entnehmen. Subsampling hilft, die Anzahl der positiven und negativen Beispiele auszugleichen, die für das Training verwendet werden. Das Ausgleichen der Beispiele im Trainingsset verbessert die Trainingsleistung.

Entitätsextraktionsprogramm als Aufbereitung veröffentlichen

Wenn Sie denken, dass der Entitätsextraktor bereit ist, veröffentlichen Sie den Entitätsextraktor. Woher weißt du, wann es fertig ist? Wenn sich der Score nach mehreren Testläufen, in denen Sie Verbesserungen vornehmen, nicht ändert, ist das Modell bereit. Sie können nach der Veröffentlichung zum Aktualisieren zurückkehren und das Modell erneut trainieren.

  1. Klicken Sie auf der Seite Extraktor auswerten auf Extraktor veröffentlichen.
  2. Klicken Sie auf "Auf Daten anwenden ".
  3. Wählen Sie eine Sammlung und dann das Dokumentfeld aus, auf das die Aufbereitung des Entitätsextraktors angewendet werden soll.
  4. Klicken Sie auf Anwenden.

Entitätsextraktionsprogramm exportieren

Für installierte Implementierungen wurde die Exportfunktion mit dem Release 4.6.2 hinzugefügt.

Ein Entitätsextraktionsmodell, das Sie in einem Projekt erstellen und implementieren, ist als Aufbereitung verfügbar, die auf eine Objektgruppe aus einem beliebigen Projekt in derselben Serviceinstanz angewendet werden kann.

Wenn Sie das Entitätsextraktionsmodell in einem Projekt aus einer anderen Serviceinstanz verwenden möchten, können Sie den Entitätsextraktor exportieren. Wenn Sie das Modell an anderer Stelle verwenden wollen, führen Sie die Schritte zum Erstellen eines Modells für maschinelles Lernen unter Importierte ML-Modelle zum Suchen nach angepassten Begriffen verwenden aus. Sie können nicht mit der Bearbeitung eines Entitätsextraktors fortfahren, den Sie in ein anderes Projekt importieren.

Der Entitätsextraktor, den Sie exportieren möchten, muss vollständig trainieren.

Führen Sie die folgenden Schritte aus, um einen Entitätenextrakt zu exportieren:

  1. Öffnen Sie das Projekt mit dem Entitätsextraktionsprogramm, das Sie exportieren möchten.

  2. Erweitern Sie in der Anzeige Verbesserungstools auf der Seite Verbessern und anpassen den Eintrag Domänenkonzepte für Teachund klicken Sie dann auf Entitäten extrahieren.

  3. Suchen Sie in der Liste Entitätsextraktoren den Entitätsextraktor, den Sie exportieren wollen.

  4. Klicken Sie auf das Symbol Aktionen für Ihren Extraktor und wählen Sie dann Modell herunterladen aus, um das Modell auf Ihrem System zu speichern.

    Die Option Modell herunterladen ist nur verfügbar, wenn das Modell trainiert wurde.

Das Entitätsextraktionsmodell wird als .ent-Datei gespeichert. Sie können sie als Modell für maschinelles Lernen in ein Projekt in einer anderen Serviceinstanz importieren und dann auf Ihre Sammlungen anwenden. Weitere Informationen zum Importieren des Modells finden Sie unter Importierte ML-Modelle zum Suchen angepasster Terme verwenden.

Anwenden einer Entitätsextraktoraufbereitung

Wenn Sie den Extraktor veröffentlichen, geben Sie das Feld an, in dem der Extraktor angewendet werden soll. Wenn Sie die Aufbereitung später auf andere oder mehr Felder anwenden möchten, können Sie die folgenden Schritte ausführen.

  1. Klicken Sie im Navigationsfenster auf Sammlungen verwalten.
  2. Klicken Sie auf diese Option, um die Objektgruppe zu öffnen, auf die Sie die Aufbereitung anwenden wollen.
  3. Klicken Sie auf Aufbereitungen.
  4. Suchen Sie den Namen des Entitätsextraktors in der Liste und wählen Sie dann ein Feld aus, auf das die Aufbereitung angewendet werden soll.
  5. Klicken Sie auf Änderungen anwenden und erneut verarbeiten.

Weitere Informationen zum Entfernen einer Entitätsextraktoraufbereitung aus einer Sammlung finden Sie unter Aufbereitungen verwalten.

Ausgabe des Entitätsextraktionsprogramms

Wenn die Aufbereitung eine Ihrer angepassten Entitäten in einem Dokument erkennt, wird dem Abschnitt enriched_text.entities der JSON-Darstellung des Dokuments ein Eintrag hinzugefügt. Der Abschnitt enthält Vorkommen von Entitäten, die von Ihrem angepassten Modell erkannt werden, sowie Entitäten, die von der integrierten Entitätsaufbereitung erkannt werden. Die integrierte Aufbereitung verwendet den NLP-Service Watson, um Entitäten zu identifizieren, die Teil des Typsystems Natural Language Understanding sind. Weitere Informationen zur integrierten Aufbereitung von Entitäten finden Sie unter Entitäten.

Die folgende JSON-Ausgabe wird von einem angepassten Modell namens literature erzeugt, das Erwähnungen von Familienmitgliedern erkennt.

Zeigt die JSON-Ausgabe eines Dokuments mit einer angepassten Entitätserwähnung an
JSON representation of a custom entity mention

Leistung im Zeitverlauf überwachen

Sie können Ihr Entitätsextraktionsmodell jederzeit erneut trainieren. Prüfen Sie jedes Mal, wenn Sie das Modell trainieren, die Leistungsmetrikscores, um zu ermitteln, ob Ihre letzten Änderungen die Scores des Modells erhöhen oder verringern.

  1. Um einen Testlauf mit einem anderen zu vergleichen, klicken Sie auf Bewertungsverlauf anzeigen.

    Die Verlaufsansicht zeigt die letzten 5 Trainingsläufe.

    Um die Scoreinformationen für mehr als die letzten 5 Trainingsausführungen beizubehalten, können Sie die Metriken im Format mit durch Kommas getrennten Werten exportieren und die Scores in einer separaten Anwendung verfolgen. Klicken Sie auf das Symbol für die tabellarische Darstellung Symbol für tabellarische Darstellung und anschließend auf Als CSV herunterladen.

Wenn ein nachfolgender Trainingslauf zu niedrigeren Scores führt, veröffentlichen Sie diese Version des Modells nicht.

Entitätsextraktionsprogramm löschen

Sie können einen Entitätsextraktor löschen, wenn er nicht verwendet wird. Dies bedeutet, dass die Aufbereitung, die vom Entitätsextraktor veröffentlicht wird, nicht auf eine Objektgruppe angewendet wird.

Sie können einen Entitätsextraktor löschen, wenn Sie beispielsweise den Grenzwert für die maximale Anzahl an Extraktoren erreichen, die für Ihren Plan zulässig ist.

Beachten Sie, dass Grenzwerte pro Serviceinstanz und nicht pro Projekt definiert werden. Wenn Sie keine neuen Entitätsextraktoren erstellen können, aber nicht die maximale Anzahl von Extraktoren im aktuellen Projekt haben, überprüfen Sie andere Projekte in derselben Serviceinstanz. Möglicherweise sind Entitätsextraktoren vorhanden, die nicht in anderen Projekten verwendet werden, die gelöscht werden können.

  1. Entfernen Sie die Aufbereitung des Entitätsextraktors, die aus dem Entitätsextraktionsprogramm veröffentlicht wurde, das Sie aus allen Objektgruppen löschen möchten, in denen es verwendet wird.

    Weitere Informationen finden Sie unter Aufbereitungen löschen.

  2. Erweitern Sie in der Anzeige Verbesserungstools auf der Seite Verbessern und anpassen den Eintrag Domänenkonzepte für Teach und klicken Sie dann auf Entitäten extrahieren.

  3. Suchen Sie den Entitätsextraktor, den Sie löschen wollen, klicken Sie auf das Aktionssymbol und wählen Sie dann Löschen aus.

Grenzwerte für Entitätsextraktoren

Die Anzahl der Entitätsextraktoren, die Sie pro Serviceinstanz erstellen können, hängt vom Plantyp Discovery ab.

Planbegrenzungen für Entitätsextraktoren
Planen Entitätsextraktoren pro Serviceinstanz[1] Maximale Anzahl Entitätstypen pro Extraktor Maximale Anzahl Dokumente in Trainingsdaten
Cloud Pak for Data Uneingeschränkt
1000
Premium 10
1000
Enterprise 10
1000
Plus (einschließlich Testversion) 3 12 200

  1. Diese Zahl gibt die Anzahl der veröffentlichten Entitätsextraktoraufbereitungen für die Serviceinstanz wieder (auch aus importierten Entitätsextraktormodellen), unabhängig davon, ob sie auf eine Objektgruppe angewendet werden oder nicht. ↩︎