Diese Dokumentation bezieht sich auf IBM Watson® Knowledge Studio on IBM Cloud®. Die Dokumentation für die Vorgängerversion von Knowledge Studio on IBM Marketplace kann über diesen Link aufgerufen werden.
Wörterverzeichnisse erstellen
Wörterverzeichnisse geben den Machine Learning-Modellen in Knowledge Studio Einblick in den Sprachgebrauch des Fachgebiets.
Wörterbücher
Beim Machine Learning werden in einem Wörterverzeichnis Begriffe und Ausdrücke zusammengefasst, die bestimmte Gemeinsamkeiten aufweisen. Die Wörter in einem Eintrag des Wörterverzeichnisses haben nicht alle die gleiche Bedeutung, aber sie werden von einem Machine Learning-Modell gleich behandelt.
In einem Wörterverzeichnis werden Wörter und Ausdrücke aufgelistet, die mit Bezug auf die Informationsextraktion äquivalent sind, d. h. sie sind im Hinblick auf das Identifizieren von Entitäts- und Beziehungserwähnungen austauschbar.
Angenommen, ein Wörterverzeichniseintrag enthält die sieben Tage der Woche. Zum Annotieren eines Dokuments ordnet der Annotatorbenutzer den Entitätstyp DAY_OF_WEEK für Erwähnungen der Wörter Montag und Freitag im Text zu. Da das Wörterverzeichnis die sieben Wochentage als austauschbar einstuft, kann leichter sichergestellt werden, dass ein Machine Learning-Modell das Vorkommen der Wörter Dienstag und Mittwoch sowie der übrigen
Wochentage in neuen Dokumenten während der Laufzeit korrekt annotiert. Außerdem unterstützt die Gleichsetzung dieser Wörter auch das Extrahieren von Informationen aus dem umgebenden Text. Die Erkenntnisse, die das Machine Learning-Modell aus
Trainingsbeispielen des Texts gewinnt, der die Erwähnungen Montag und Freitag umgibt, wird auf Texte angewendet, in deren Umgebung andere Wochentage erwähnt werden, da diese Begriffe laut Wörterverzeichnis bei der Informationsextraktion
als äquivalent eingestuft werden.
Sie müssen kein Wörterverzeichnis erstellen, das Informationen zu Wochentagen enthält. Mehrere solche, vielseitig einsetzbare Wörterverzeichnisse sind in die Anwendung integriert. Weitere integrierte Wörterbücher umfassen Länder, Ortsnamen, Zahlenwörter, Tiere, Pflanzen, Krankheiten, Messwörter (z. B. Unze und Meter ) und Wörter für die Anrede (z. B. Herr und Frau ). Integrierte Wörterverzeichnisse können weder inaktiviert noch bearbeitet werden.
Vermeiden Sie das Hinzufügen von Einträgen mit mehreren Bedeutungen. In einem Fachgebiet für Autorennen sollte der Begriff Pilot für den Fahrer am Steuer des Rennwagens nur eingetragen werden, wenn der Textkorpus in der Regel keine Hinweise auf die Luftfahrt enthält. Wenn beide Wortbedeutungen in den Quellendokumenten häufig vorkommen, sollte der Begriff in beide Wörterverzeichnistypen (für Autorennen und für Luftfahrt) nicht aufgenommen werden.
Sie können Wörterbücher in Knowledge Studio erstellen, indem Sie einzelne Einträge manuell hinzufügen. Knowledge Studio unterstützt auch die Möglichkeit, verschiedene Typen von Wörterbuchdateien hochzuladen.
Wie werden Wörterverzeichnisse verwendet?
Wörterverzeichnisse können (optional) auf zwei verschiedene Arten verwendet werden. Entweder innerhalb des Machine Learning-Modells, um Wörter oder Ausdrücke bereitzustellen, die im Sinne der Informationsextraktion als äquivalent gelten, oder beim Vorannotieren, um den Aufwand für die Vorannotation zu reduzieren.
-
Verwendung beim Machine Learning
Der Entitätstyp, den Sie einem Wörterverzeichnis zuordnen, wird nicht verwendet, um Regeln für das Machine Learning-Modell zu definieren. Beim Machine Learning werden Erwähnungen in Dokumenten unabhängig ausgewertet. Dabei wird nicht vorausgesetzt, dass eine Erwähnung einen bestimmten Entitätstyp aufweist, nur weil sie mit einem Wörterverzeichniseintrag übereinstimmt, der dem betreffenden Entitätstyp zugeordnet ist. Diese Information wird zwar berücksichtigt, aber sie wird als eine von vielen Einzelinformation behandelt, die durch linguistische Analyse gesammelt werden. Tatsächlich gilt: Wenn kein Begriff aus einem Wörterverzeichnis in den Ground Truth-Dokumenten vorkommt, dann wird das betreffende Wörterverzeichnis im Machine Learning-Modell nicht verwendet.
-
Verwendung der Vorannotation
Wörterverzeichnisse sind wichtig für die folgenden Prozesse der Vorannotation.
- Wörterverzeichnisbasierter Vorannotator: Beim Ausführen des wörterverzeichnisbasierten Vorannotators ordnen Sie einem Wörterverzeichnis einen Entitätstyp aus dem Typsystem zu.
- Regelbasiertes Modell: Sie können optional ein Wörterverzeichnis einer Regelklasse zuordnen. Beim Ausführen des regelbasierten Modells zum Vorannotieren von Dokumenten werden dann Klassen den Entitätstypen aus dem Typsystem zugeordnet. Dies führt dazu, dass Begriffe aus dem Wörterverzeichnis im Umlaufverfahren auch Entitätstypen für das regelbasierte Modell zugeordnet werden.
In beiden Fällen stellen die Wörterverzeichnisse Begriffe bereit, die vom System erkannt und als Erwähnungen annotiert werden können. Jeder Erwähnung wird der Entitätstyp zugewiesen, der dem Wörterverzeichnis zugeordnet ist, das diesen Begriff enthält. Wenn ein Annotatorbenutzer mit dem Bearbeiten neuer Dokumente beginnt, die vorannotiert wurden, sind viele Erwähnungen bereits mithilfe der Wörterverzeichniseinträge annotiert. Der Annotatorbenutzer kann sich daher verstärkt auf das Zuweisen von Entitätstypen für Erwähnungen konzentrieren, die eine genauere Analyse erfordern.
Überlegungen zu Sprachen
- Für Portugiesisch (Brasilien), Englisch, Deutsch, Italienisch und Spanisch stellt Knowledge Studio derzeit keine Option zum Aktivieren eines von Groß-/Kleinschreibung unabhängigen Wörterverzeichnisabgleichs bereit. Die Wörterverzeichniseinträge finden jedoch Textübereinstimmungen mit Großschreibung. Beispiel: Für den Eintrag fahrzeug im Wörterverzeichnis werden fahrzeug, Fahrzeug oder FAHRZEUG im Text als Übereinstimmungen erkannt. Für den Wörterverzeichniseintrag Sat werden im Text zwar Sat oder SAT als Übereinstimmungen erkannt, jedoch nicht sat.
- Für Japanisch und Koreanisch wird beim Wörterverzeichnisabgleich während der Vorannotation die Groß-/Kleinschreibung beachtet.
- Für Arabisch setzt Knowledge Studio voraus, dass der arabische Text ungeformt gespeichert ist. Zahlenformen werden als Eigenschaft auf der Speicherebene behandelt. Weitere Informationen zur Verarbeitung arabischer Zeichen- und Zahlenformen in Knowledge Studio, finden Sie unter Unterstützung für Arabisch konfigurieren.
Wörterverzeichnis als CSV-Datei
Ein Wörterverzeichnis in einer CSV-Datei (auch als Standardformat für Wörterverzeichnisse bezeichnet) besteht aus einer Datei, die Sie nach dem Hochladen bearbeiten können. Die maximale Größe einer CSV-Datei, die
Sie hochladen können, beträgt 1 MB. Wenn Ihre Wörterverzeichnisdatei größer ist, teilen Sie sie in mehrere Dateien auf und laden Sie die Dateien einzeln nacheinander in ein einziges Wörterverzeichnis in Ihrem Knowledge Studio-Arbeitsbereich.
Zusammenfassung der Voraussetzungen: Zum Erstellen der CSV-Datei muss ein Texteditor verwendet werden (und keine Software wie Microsoft Excel). In der Datei muss die UTF-8-Codierung ohne Byteanordnungsmarkierung (Byte Order Mark,
BOM) am Anfang des Textstroms verwendet werden. In der ersten Zeile der Datei müssen die folgenden Spaltenüberschriften angegeben werden:
lemma,poscode,surface
In den restlichen Zeilen der Datei werden die Wörterverzeichniseinträge angegeben. Dabei gilt Folgendes:
-
Lemma
Gibt die repräsentativste Wortform (Grundform) für den Eintrag an.
-
poscode (Arabisch, Portugiesisch (Brasilien), Englisch, Französisch, Deutsch, Italienisch und Spanisch)
Gibt einen Code an, der die Wortart identifiziert. Diese Wortartinformationen werden vom wörterverzeichnisbasierten Annotator verwendet, um Sätze in Tokens zu zerlegen.
-
0- UnbekanntDieser Code bietet Unterstützung zum Hochladen eines umfangreichen, maschinengenerierten Wörterverzeichnisses, das nicht in jedem Eintrag Wortartinformationen enthält. Der Code Unbekannt kann standardmäßig allen Einträgen zugeordnet werden. Vermeiden Sie nach Möglichkeit die Verwendung dieses Codes.
-
1- Pronomen -
2- Verb -
3- Substantiv -
4- Adjektiv -
5- Adverb -
6- Adposition -
7- Interjektion -
8- Konjunktion -
9- Determinator -
10- Quantifizierer
In der englischen Sprache sind Substantive (
3), Verb (2) und Adjektiv (4) die häufigsten Wortarten in Wörterverzeichniseinträgen.Durch die Wortart wird nicht automatisch der Typ der Erwähnung festgelegt. Gehen Sie nicht generell davon aus, dass alle Nomen Erwähnungen von Entitätstypen sind und alle Verben Erwähnungen von Beziehungstypen. Beispiel: amerikanisch ist ein Adjektiv, das jedoch als Entitätstyp GPE (geopolitische Entität) oder
PERSONannotiert werden sollte. Das Verb traf sollte mitEVENT_MEETINGannotiert werden.In anderen Sprachen (z. B. Deutsch), die Komposita (zusammengesetzte Wörter) verwenden, sind exakte Wortartinformationen noch wichtiger, um Wortgrenzen zu erkennen.
-
-
poscode (Chinesisch)
Gibt einen Code an, der die Wortart identifiziert. Der Wert für die Wortart ist für die Zerlegung von Text in Tokens und für die Vorannotierung in Sprachen wie Chinesisch (vereinfacht oder traditionell) wichtig, die Wortgrenzen nicht durch Leerzeichen kenntlich machen.
32- Substantiv31- Substantiv (Familienname)35- Substantiv (Organisation)34- Substantiv (Andere)33- Substantiv (Personenname)
-
poscode (Japanisch)
Gibt einen Code an, der die Wortart identifiziert. Der Wert für die Wortart ist für die Zerlegung von Text in Tokens und für die Vorannotierung in Sprachen wie Japanisch wichtig, die Wortgrenzen nicht durch Leerzeichen kenntlich machen.
19- Substantiv23- Allgemeines Präfix24- Allgemeines Suffix140- Eigenname (Nachname)141- Eigenname (Vorname)146- Eigenname (Personenname)142- Eigenname (Organisation)144- Eigenname (Ortsname)143- Eigenname (Region)145- Eigenname (Andere)
-
poscode (Koreanisch)
Gibt einen Code an, der die Wortart identifiziert. Der Wert für die Wortart ist für die Zerlegung von Text in Tokens und für die Vorannotierung in Sprachen wie Koreanisch wichtig, die Wortgrenzen nicht durch Leerzeichen kenntlich machen.
10010- Substantiv10300- Eigenname (Nachname)10310- Eigenname (Vorname)110360- Eigenname (Personenname)10320- Eigenname (Organisation)10340- Eigenname (Ortsname)10330- Eigenname (Region)10350- Eigenname (Andere)
-
Oberfläche
Gibt äquivalente Begriffe an (auch als Oberflächenformen bezeichnet). Wiederholen Sie das Lemma als Oberflächenform und trennen Sie mehrere Oberflächenformen jeweils durch ein Komma. Wenn eine Oberflächenform ein Komma enthält, setzen Sie die Oberflächenform in Anführungszeichen.
Beispiel:
lemma,poscode,surface
IBM,3,IBM Corp.,IBM,"International Business Machines, Inc."
Department of Energy,3,DOE,Department of Energy
premium,4,premium,premium-grade
Zugehörige Konzepte:
Ressourcen aus einem anderen Arbeitsbereich hochladen
Zugehörige Tasks:
Wörterverzeichnisse zu einem Arbeitsbereich hinzufügen
Das Hinzufügen von Wörterverzeichnissen ist ein optionaler Schritt bei der Erstellung eines Modells. Wörterverzeichnisse sind hilfreich, da sie den Einstieg in den Annotationsprozess beschleunigen.
Informationen zu dieser Task
Wenn Sie ein Wörterverzeichnis bereitstellen, können Sie den wörterverzeichnisbasierten Vorannotator auf die Dokumente anwenden. Der Vorannotator erkennt Begriffe, die in Ihrem Wörterverzeichnis enthalten sind, und versieht diese Begriffe automatisch mit Annotationen. Diese vorbereitende Annotation (Vorannotation) erleichtert die Arbeit der Annotatorbenutzer. Die Annotatorbenutzer können die vom Vorannotator hinzugefügten Annotationen überprüfen und gegebenenfalls korrigieren oder weitere Annotationen hinzufügen (d. h. sie müssen den Annotationsprozess nicht völlig neu beginnen).
Für Wörterverzeichnisse gelten die folgenden Einschränkungen:
-
Maximal 15.000 Einträge pro Wörterverzeichnis
Anmerkung: Dieser Grenzwert gilt nicht für Wörterbücher, die Sie als Wörterbuchdatei
CSVhochladen. Schreibgeschützte Wörterverzeichnisse können mehr Einträge enthalten. -
Maximal 64 Wörterverzeichnisse pro Arbeitsbereich
Vorgehensweise
So fügen Sie in Ihrem Arbeitsbereich ein Wörterverzeichnis hinzu:
-
Melden Sie sich als Knowledge Studio-Administrator oder -Projektleiter an und öffnen Sie die Seite Assets > Wörterverzeichnisse.
-
Führen Sie eine der folgenden Tasks aus:
- Klicken Sie neben der Schaltfläche Wörterverzeichnis erstellen auf das Menüsymbol und wählen Sie dann Wörterverzeichnis hochladen aus. Wählen Sie ein Wörterverzeichnis aus und klicken Sie auf Hochladen. Nachdem Sie ein Wörterverzeichnis hochgeladen haben, wählen Sie es aus, um das Wörterverzeichnis anzuzeigen und ordnen es einem Entitätstyp zuzuordnen.
Sie können eine komprimierte Datei hochladen, die ein Wörterverzeichnis enthält und aus einem anderen Knowledge Studio-Arbeitsbereich heruntergeladen wurde. Vor dem Hochladen der Wörterverzeichnisdatei müssen Sie das aus dem anderen Arbeitsbereich heruntergeladene Typsystem im JSON-Format hochladen. In einem Wörterverzeichnis aus einem anderen Knowledge Studio-Arbeitsbereich, das Sie wiederverwenden, können Sie Einträge bearbeiten und hinzufügen. Details hierzu finden Sie unter Ressourcen aus einem anderen Arbeitsbereich hochladen.
Das Hochladen einer CSV-Datei wird ebenfalls unterstützt. Wenn Sie die Datei jedoch direkt als Wörterverzeichnis hochladen, wird eine schreibgeschützte Vorschau des Wörterverzeichnisses erstellt, die Sie weder bearbeiten noch herunterladen können. Um eine CSV-Datei hochzuladen, die bearbeitet und heruntergealden werden kann, klicken Sie auf Wörterverzeichnis erstellen, um zunächst ein leeres Wörterverzeichnis zu erstellen. Laden Sie dann in das neu erstellte Wörterverzeichnis den Inhalt der CSV-Datei als Einträge hoch.
- Klicken Sie auf die Schaltfläche Wörterverzeichnis erstellen, um ein leeres Wörterverzeichnis zu erstellen, in das Sie anschließend Wörterverzeichniseinträge hinzufügen können. Geben Sie einen beschreibenden Namen für das Wörterverzeichnis an und klicken Sie anschließend auf Speichern.
-
Führen Sie eine der folgenden Tasks aus, um Einträge zum Wörterverzeichnis hinzuzufügen:
- Klicken Sie auf Eintrag hinzufügen, um einen Wörterverzeichniseintrag hinzuzufügen. Geben Sie das Lemma (die Grundform des Begriffs) an.
- Klicken Sie auf Hochladen, um eine
CSV-Datei mit Wörterverzeichniseinträgen hochzuladen. Navigieren Sie anschließend zu der Datei und wählen Sie sie aus. DieCSV-Datei muss kleiner als 1 MB sein. - Fügen Sie vorgeschlagene Einträge aus der Liste im Fensterbereich Eintragsempfehlungen hinzu. Knowledge Studio verwendet die Dokumente in Ihrem Arbeitsbereich und die vorhandenen Einträge in Ihrem Wörterverzeichnis, um neue Einträge vorzuschlagen.
-
Nachdem Sie Einträge hochgeladen oder hinzugefügt haben, können Sie die Einträge bearbeiten.
Öffnen Sie einen Eintrag, um äquivalente Begriffe (auch als Oberflächenformen bezeichnet) anzugeben. Jede Oberflächenform darf maximal 258 Zeichen lang sein. Sie können angeben, welche Oberflächenform als Lemma verwendet werden soll. Beispiel: Für das Lemma IBM können Oberflächenformen wie IBM Corp. und International Business Machines, Inc. vorkommen.
-
Wählen Sie die entsprechende Wortart für jedes Lemma und jede Oberflächenform im Wörterverzeichnis aus.
Die Wortartinformationen werden vom Tokenizer und beim Vorannotieren verwendet.
-
Klicken Sie auf Speichern, um Ihre Änderungen zu speichern.
Nächste Schritte
Führen Sie den Vorannotator aus, der die von Ihnen erstellen Wörterverzeichnisse für einen ersten Durchlauf durch die Quellendokumente verwendet und Annotationen hinzufügt.
Wörterverzeichnisvorschläge hinzufügen
Die Wörterbuchvorschläge für die Benutzeroberfläche des Editors enden am 30. Juni 2025. Weitere Einzelheiten finden Sie in den Versionshinweisen.
Wenn Sie Einträge zu Ihrem Wörterverzeichnis hinzufügen, durchsucht Knowledge Studio die Dokumente in Ihrem Arbeitsbereich nach ähnlichen Wörterbucheinträgen, die für Sie nützlich sein können.
- Sie müssen Dokumente auf der Registerkarte
Documentshochladen, um Vorschläge zu erhalten. - Nach dem Hochladen der Dokumente kann das Vorbereiten der Engine für die Generierung von Vorschlägen einige Zeit in Anspruch nehmen.
Die vorgeschlagenen Einträge werden im Fensterbereich Eintragsempfehlungen angezeigt.

Die folgenden Optionen stehen Ihnen im Fenster 'Eintragsempfehlungen' zur Verfügung.
- Wenn Sie auf den Namen eines vorgeschlagenen Eintrags klicken, wird ein Fenster geöffnet, in dem die Vorkommen des Begriffs in Ihren Dokumenten angezeigt werden. Dies kann Ihnen helfen zu entscheiden, ob ein vorgeschlagener Eintrag hinzugefügt oder ausgeschlossen werden soll.
- Diesen Eintrag hinzufügen (
+): Fügt die Eintragsempfehlung zu Ihrem Wörterverzeichnis hinzu. - Diesen Eintrag ausschließen (
-): Entfernt den Eintrag aus der Liste der empfohlenen Einträge und fügt ihn zu Ausgeschlossene Einträge hinzu. - Alle hinzufügen: Fügt die gesamte Liste der empfohlenen Einträge zum Wörterverzeichnis hinzu (die unter Ausgeschlossene Begriffe aufgeführten Begriffe werden dabei nicht hinzugefügt).
- Alle ausschließen: Verschiebt alle aktuellen Eintragsempfehlungen nach Ausgeschlossene Begriffe.
Zugehörige Tasks:
Dokumente mit einem Wörterverzeichnis vorannotieren
Zugehörige Referenzinformationen: