Diese Dokumentation bezieht sich auf IBM Watson® Knowledge Studio on IBM Cloud®. Die Dokumentation für die Vorgängerversion von Knowledge Studio on IBM Marketplace kann über diesen Link aufgerufen werden.

Glossar

Dieses Glossar enthält Begriffe und Definitionen für Knowledge Studio.

In diesem Glossar werden die folgenden Querverweise verwendet:

  • Siehe verweist von einem Begriff auf ein bevorzugtes Synonym oder von einem Akronym bzw. einer Abkürzung auf die definierte Langform.
  • Siehe auch verweist auf einen verwandten oder gegensätzlichen Begriff.

A B C D E F G H I K L M N O P R S T

A

  • Genauigkeit

    Ein Maß für die Richtigkeit von Annotationen, die von einem Machine Learning-Modell erzeugt werden. Siehe auch Genauigkeit und Vollständigkeit.

  • Richtigkeitsanalyse

    Analysieren der Ergebnisse des Machine Learning-Modells, um festzustellen, ob zur Verbesserung der Richtigkeit Änderungen erforderlich sind.

  • Beurteilung

    Ein iterativer Prozess zum Auflösen von Annotationskonflikten, bei dem die dem Dokument von unterschiedlichen Annotatorbenutzern hinzugefügten Annotationen verglichen werden.

  • Analyseengine

    Ein Programm, das Artefakte (beispielsweise Dokumente) analysiert, Informationen zu ihnen ableitet und die Schnittstellenspezifikation der UIMA-Analyseengine implementiert. Analyseengines werden aus Bausteinen erstellt, die als Annotatoren bezeichnet werden. Eine Analyseengine kann einen einzelnen Annotator enthalten und wird dann als einfache Analyseengine bezeichnet oder sie kann mehrere Annotatoren enthalten und wird dann als zusammengefasste Analyseengine bezeichnet.

  • Annotation

    Informationen zu einer Textpassage. Eine Annotation kann beispielsweise angeben, dass eine Textpassage den Namen eines Unternehmens darstellt.

  • Annotationsgruppe

    Bei der von Menschen ausgeführten Annotation ist dies eine aus dem Korpus extrahierte Sammlung von Dokumenten, die es ermöglicht, dass mehrere menschliche Annotatoren (Annotatorbenutzer) die Workload gemeinsam nutzen. Bei der maschinenbasierten Annotation ist dies eine Sammlung von Dokumenten, die als Blinddaten, Trainingsdaten oder Testdaten verwendet werden kann.

  • Prozessmanager für Annotationen

    Eine Rolle, die für die Verwaltung der gesamten Lebenszyklusaktivitäten von Annotationen innerhalb eines Arbeitsbereichs zuständig ist. In der Regel führt der einem Arbeitsbereich hinzugefügte Projektleiter die Aktivitäten des Prozessmanagers für Annotationen aus.

  • Annotator

    Siehe Annotatorbenutzer und Machine Learning-Annotator.

  • Attribut

    Ein Merkmal oder eine Eigenschaft einer Entität, wodurch die Entität beschrieben wird; z. B. ist die Telefonnummer eines Mitarbeiters eines der Mitarbeiterattribute.

B

  • Blinddaten

    Eine Gruppe von Dokumenten, die mit Ground Truth annotiert ist, wie zum Beispiel Frage/Antwort-Paare, semantische Annotation und Textstellenbewertung. Blinddaten werden von Entwicklern nicht veröffentlicht oder angezeigt; sie werden zum regelmäßigen Testen des Systems verwendet, um Leistung hinsichtlich bisher nicht gesehener Daten zu bewerten. Das Testen an Blinddaten verhindert die Beeinträchtigung der Richtigkeit durch Überanpassung an bekannte Fragensets oder Annotationen. Die gemeldeten Ergebnisse sollten nur von Tests stammen, die an Blinddaten ausgeführt wurden. Siehe auch Daten testen und Trainingsdaten.

C

  • Konkordanz

    Mit diesem Verfahren soll sichergestellt werden, dass für dieselbe Erwähnung in einem Dokument und über Annotationsgruppen hinweg stets derselbe Entitätstyp annotiert wird. Die Konkordanz unterstützt die Gewährleistung der Konsistenz über viele Vorkommen einer Erwähnung hinweg, ohne dass der Annotatorbenutzer jedes Vorkommen einzeln beschriften muss.

  • Fehlermatrix

    Eine Tabelle, die eine detaillierte numerische Aufgliederung von annotierten Dokumentgruppen bereitstellt. Die Tabelle wird verwendet, um die von einem Machine Learning-Modell hinzugefügten Annotationen mit den Annotationen in Ground Truth zu vergleichen. In der Tabelle wird die Anzahl der falsch-positiven, falsch-negativen, wahr-positiven und wahr-negativen Befunde angegeben.

  • Koreferenz

    Eine Beziehung zwischen zwei Wörtern oder Ausdrücken, die sich beide auf dieselbe Person oder denselben Gegenstand beziehen, und bei denen beide das linguistische Bezugswort (den Antezedenten) für das jeweils andere Element darstellen. Es gibt beispielsweise zwischen den beiden Pronomen in der Wortfolge "Sie wusch sich" eine Koreferenz, jedoch nicht zwischen den beiden Pronomen in der Wortfolge "Sie wusch sie". Eine Koreferenz verbindet zwei im selben Text stehende äquivalente Entitäten.

  • Koreferenzkette

    Eine Liste mit Entitäten, die als Koreferenzen annotiert wurden. Wenn Sie Erwähnungen als Koreferenzen annotieren, wird vom System eine Koreferenzkette erstellt. Mithilfe dieser Kette können Sie alle Erwähnungen im Kontext anzeigen und überprüfen, dass alle Vorkommen demselben Entitätstyp angehören.

  • Korpus

    Eine Sammlung von Quellendokumenten, die zu einem Arbeitsbereich hinzugefügt und zum Trainieren eines Machine Learning-Modells verwendet wurden.

  • Kuratieren

    Auswählen, Erfassen, Beibehalten und Verwalten von Inhalt, der für ein bestimmtes Thema relevant ist. Kuratieren von Daten bedeutet, dass sie zusätzlichen Wert erhalten, der verwaltet und ihnen hinzugefügt wird; dadurch entstehen aus Daten vertrauenswürdige Informationen und Wissen.

D

  • Wörterbuch

    Eine Sammlung von Wörtern, die zum Vorannotieren von Dokumenten verwendet werden kann. Für jedes Wort im Dokumenttext, das mit einem Begriff im Wörterverzeichnis übereinstimmt, wird eine neue Annotation erstellt. Ein Machine Learning-Modell kann mit mindestens einem unabhängigen Wörterverzeichnis konfiguriert werden; Wörterverzeichnisse sind in der Regel fachspezifisch, wie beispielsweise ein Wörterverzeichnis für Arzneimittel oder ein Wörterverzeichnis für Vermögensverwaltung. Siehe auch Lemma und Oberflächenform.

  • Wörterverzeichnisbasierter Vorannotator

    Eine Komponente, die in einem Text Erwähnungen ermittelt, die mit einer bestimmten Wortgruppe übereinstimmen. Indem für die Vorannotation von Texten fachspezifische Terminologie verwendet wird, können wörterverzeichnisbasierte Vorannotatoren die Geschwindigkeit erhöhen, mit der ein menschlicher Annotator (Annotatorbenutzer) eine Gruppe von Ground Truth-Dokumenten vorbereitet.

  • Dokumentgruppe

    Eine Dokumentsammlung. Dokumente, die zusammen importiert werden, werden zu einer Dokumentgruppe. Aus annotierten Dokumenten, die für Trainingszwecke gruppiert wurden (Test-, Trainings- oder Blinddaten) werden Dokumentgruppen generiert.

E

  • Entität

    1. Eine Erwähnung, die durch einen Entitätstyp annotiert ist.
    2. Eine Person, ein Objekt oder ein Konzept, zu der bzw. dem Informationen gespeichert sind.
    3. Eine Gruppe von Details, die zu einem realen Objekt wie z. B. einer Person, einem Standort oder einem Bankkonto, vorhanden sind. Eine Entität ist eine Art von Element.
  • Entitätstyp

    Der Entitätstyp, den eine Erwähnung ohne Berücksichtigung des Kontextes darstellt. Die Erwähnung IBM kann beispielsweise mit dem Entitätstyp ORGANISATION annotiert sein.

    In einem Modell mit Entitätsbeziehungen ist ein Entitätstyp das Ding, das modelliert wird, oder das Ding, auf das sich eine Erwähnung bezieht, wie beispielsweise der Name einer Person oder eines Orts. Unterschiedliche Entitätstypen haben auch verschiedene Gruppen von Attributen wie beispielsweise "Nachname" oder "Heimatort" und sie sind über Beziehungen wie "wohnt in" verbunden. Ein Entitätstyp ist unabhängig und kann eindeutig identifiziert werden.

F

  • F1-Wert

    Ein Maß für die Genauigkeit eines Tests, bei dem zum Berechnen des Werts sowohl die Genauigkeit als auch die Trefferquote berücksichtigt werden. Der F1-Wert kann als gewichteter Durchschnitt der Werte für die Genauigkeit und die Trefferquote interpretiert werden. Der beste Wert für einen F1-Wert ist 1 und der schlechteste Wert ist 0.

  • fälschlicherweise negativ

    Eine Antwort oder eine Annotation, die richtig ist, aber als falsch vorhergesagt wurde.

  • fälschlicherweise positiv

    Eine Antwort oder eine Annotation, die falsch ist, aber als richtig vorhergesagt wurde.

  • Feature

    Ein Datenelement oder Attribut eines Typs.

  • Fleiss'-Kappa-Wert

    Ein Maß dafür, wie konsistent dieselbe Annotation durch mehrere menschliche Annotatoren bei überlappenden Dokumenten erfolgte. Der beste Fleiss'-Kappa-Wert ist 1 und der schlechteste Wert ist 0.

G

  • Ground Truth

    Die aus Annotationen, die von Annotatorbenutzern hinzugefügt wurden, bestehende Gruppe überprüfter Daten, die zum Anpassen eines Machine Learning-Modells an ein bestimmtes Fachgebiet verwendet wird. Ground Truth wird verwendet, um Machine Learning-Modelle zu trainieren, die Modellleistung (Genauigkeit und Trefferquote) zu messen und um die Verbesserungsmöglichkeiten zu berechnen, damit entschieden werden kann, welchen Fokus der Entwicklungsaufwand für eine Verbesserung der Leistung erhalten soll. Die Genauigkeit von Ground Truth ist wesentlich, da Ungenauigkeiten in Ground Truth mit Ungenauigkeiten in den Komponenten korrelieren, die Ground Truth verwenden.

H

  • Analyse der Verbesserungsmöglichkeit

    Der Prozess, bei dem ermittelt wird, wie viel Verbesserung bei der Richtigkeit, Genauigkeit oder der Trefferquote erwartet werden kann, wenn eine bestimmte Problemklasse behandelt wird, die beim Ausführen der Richtigkeitsanalyse ermittelt wurde.

  • Annotatorbenutzer (menschlicher Annotator)

    Ein Experte, der die Ergebnisse der Vorannotation überprüft, ändert und erweitert, indem er Erwähnungen, Beziehungen zwischen Entitätstypen und Koreferenzen zwischen Erwähnungen ermittelt. Durch die Untersuchung von Text im Kontext hilft ein Annotatorbenutzer, Ground Truth zu bestimmen und die Genauigkeit des Machine Learning-Modells zu verbessern.

I

  • Übereinstimmung der Annotatoren

    Ein Maß für die Ähnlichkeit, mit der ein Dokument in zwei oder mehr Dokumentgruppen annotiert wird.

K

  • Wissensdiagramm

    Ein Modell zur Konsolidierung von typisierten Entitäten, ihren Beziehungen, ihren Eigenschaften und ihren hierarchischen Taxonomien, um Konzepte für ein bestimmtes Fachgebiet organisiert darzustellen. Nach dem Laden von Eingaben aus Quellen mit strukturierten und unstrukturierten Daten in das Wissensdiagramm können Benutzer und Anwendungen auf das Wissensdiagramm zugreifen, um für ein bestimmtes Fachgebiet wichtige Wissenselemente zu untersuchen, Interaktionen zu untersuchen und weitere Beziehungen zu ermitteln.

L

  • Lemma

    Das normalisierte oder kanonische Format eines Worts. In der Regel ist das Lemma die nicht abgeleitete und nicht flektierte Form eines Nomens oder Verbs. Beispiel: Das Lemma der Begriffe 'organisierend' und 'organisiert' lautet 'organisieren'. Siehe auch Wörterverzeichnis und Oberflächenform.

M

  • Maschinelles Lernen

    Eine Methode der Datenanalyse, die iterativ aus bisherigen Daten lernt und sich selbständig anpasst, wenn sie auf neue Daten trifft. Das mathematische Modell, das den Kern von Machine Learning bildet, wird aus Ground Truth-Eingaben erstellt. Durch Training und die Optimierung der Beispieleingabedaten kann das Modell bei der Analyse von neuen Daten genaue, reproduzierbare Ergebnisse liefern.

  • Annotator für maschinelles Lernen

    Siehe Machine Learning-Modell.

  • Modell für maschinelles Lernen

    Eine Komponente, die Entitäten und Entitätsbeziehungen anhand eines statistischen Modells identifiziert, das auf Ground Truth basiert. Das Modell wendet bisherige Erkenntnisse, wie z. B. Trainingsdaten, an, um das korrekte Ergebnis zukünftiger Ereignisse auf der Basis der Merkmale dieser Daten zu bestimmen oder zu prognostizieren. Die bisherigen Erkenntnisse werden in Form eines Modells erfasst. Dabei werden Merkmal-Scores für alle infrage kommenden Antworten oder Belege berechnet und mit vorhandenen Ergebnissen kombiniert. Diese Komponente wird auch als Machine Learning-Annotator bezeichnet.

  • Erwähnung

    Ein Textbereich, den Sie für die Daten in Ihrem Fachgebiet als relevant erachten. Beispielsweise wären in einem Typsystem über Kraftfahrzeuge die Vorkommen von Begriffen wie "Airbag", "Ford Explorer" und "Kinderrückhaltesystem" relevante Erwähnungen.

N

  • Benannte Entität

    Ein Konzept in einem Fachgebiet, das einer klar definierten Kategorie angehört (z. B. Namen von Organisationen, Positionen, Autoren oder Krankheiten).

  • Verarbeitung natürlicher Sprache

    Ein Gebiet der künstlichen Intelligenz und der Linguistik, in dem die Probleme untersucht werden, die bei der Verarbeitung und Bearbeitung der natürlichen Sprache inhärent sind, wobei das Ziel die Verbesserung der Fähigkeit von Computern ist, menschliche Sprache zu verstehen.

O

  • Ontologie

    Eine explizite formale Spezifikation der Darstellung von Objekten, Konzepten und anderen Entitäten, die in einem bestimmten Interessengebiet vorhanden sein können, und die Beziehungen zwischen ihnen.

P

  • Wortart

    Einzelnen lexikalischen Elementen in einem Wörterverzeichnis werden Tags für die Wortart (Part Of Speech, POS) zugeordnet. Beispiel: Das Wort 'Fliegen' kann eine Verbform oder ein Substantiv sein.

  • Leistung

    Ein Messwert für die Richtigkeit, Genauigkeit und Vollständigkeit eines Watson-Systems (z. B. beim Beantworten von Fragen, beim Erkennen von Beziehungen oder beim Annotieren von Text).

  • Vorannotation

    Der Prozess, bei dem vor der Annotation durch Menschen eine Gruppe von Dokumenten mit Annotationen versehen wird. Zum Vorannotierern von Dokumenten kann ein regelbasiertes Modell, ein Machine Learning-Modell, IBM Watson® Natural Language Understanding oder ein Wörterverzeichnis verwendet werden. Die Vorannotation kann menschlichen Annotatoren helfen, schneller eine Gruppe von Ground Truth-Dokumenten vorzubereiten.

  • Genauigkeit

    Ein Maß, das den Anteil der relevanten Ergebnisse angibt. Die Genauigkeit, bei der es sich um einen positiven Vorhersagewert handelt, wird bestimmt durch die Anzahl der korrekten positiven Ergebnisse geteilt durch die Anzahl aller positiven Ergebnisse. Die Richtigkeit wird am besten durch sowohl Genauigkeit als auch Trefferquote gemessen. Siehe auch Richtigkeit und Vollständigkeit.

  • Verarbeitungsenginearchiv (PEAR – Processing Engine Archive)

    Eine Archivdatei .pear, die eine UIMA-Analyseengine (UIMA = Unstructured Information Management Architecture) und alle Ressourcen enthält, die zur Verwendung der Datei für die angepasste Analyse erforderlich sind.

R

  • Trefferquote

    Ein Messwert, der den Prozentsatz der zurückgegebenen relevanten Ergebnisse gemessen an allen verfügbaren relevanten Ergebnissen angibt. Die Trefferquote, bei dem es sich um das Maß der Sensitivität handelt, wird ermittelt durch die Anzahl der richtigen positiven Ergebnisse geteilt durch die Anzahl der positiven Ergebnisse, die hätten zurückgegeben werden müssen. Die Richtigkeit wird am besten durch sowohl Genauigkeit als auch Trefferquote gemessen. Siehe auch Richtigkeit und Genauigkeit.

  • Beziehung

    In der Regel ein Verb, das widerspiegelt, wie Entitäten zueinander in Beziehung stehen. "Wohnt in" ist beispielsweise eine Relation zwischen einer Person und einer Stadt. Eine Relation verbindet zwei verschiedene Entitäten im selben Satz.

  • Beziehungstyp

    Eine binäre, unidirektionale Beziehung zwischen zwei Entitäten. Beispiel: Mary employedBy IBM ist eine gültige Beziehung. IBM employedBy Mary ist keine gültige Beziehung.

  • Rolle

    Ein Attribut, das eine kontextabhängige Bedeutung einer Erwähnung angibt. Beispielsweise ist in der Wortfolge "Ich ging heute zu IBM" das Wort "IBM" die Erwähnung, der Entitätstyp ist "Organisation" und die Rolle des Entitätstyps ist "Funktion".

  • Regelsatz

    Eine Gruppe von Regeln, die Muster für die Annotation von Texten definieren. Wenn ein Muster zutrifft, werden die Aktionen der Regel für die übereinstimmenden Annotationen ausgeführt. Eine Regel gibt üblicherweise Folgendes an: die Bedingung für die Übereinstimmung, einen optionalen Quantor, eine Liste zusätzlicher Bedingungen, die der übereinstimmende Text erfüllen muss, und die Aktionen, die ausgeführt werden müssen, wenn eine Übereinstimmung auftritt, beispielsweise Erstellen einer neuen Annotation oder Ändern einer vorhandenen Annotation.

S

  • Subtyp

    Ein Typ, der einen anderen Typ, den Supertyp, erweitert oder implementiert.

  • Oberflächenform

    Die Form des Worts oder der Mehrworteinheit, wie sie im Korpus gefunden wird. Beispielsweise sind die Begriffe "organisierend" und "organisiert" Oberflächenformen des Lemmas "organisieren". Siehe auch Wörterverzeichnis und Lemma.

T

  • Testdaten

    Eine Gruppe von annotierten Dokumenten, die nach dem Einpflegen und dem Training zum Bewerten der Systemmetrik verwendet werden kann. Siehe auch Blinddaten und Trainingsdaten.

  • Trainieren

    Der Prozess zum Einrichten einer Watson-Instanz mit Komponenten, die ein funktionierendes System für ein bestimmtes Fachgebiet bilden (z. B. Korpusinhalte, Trainingsdaten zum Generieren von Machine Learning-Modellen, programmgesteuerte Algorithmen oder andere Ground Truth-Komponenten) und das anschließende Verbessern und Aktualisieren dieser Komponenten anhand von Richtigkeitsanalysen.

  • Trainingsdaten

    Eine Gruppe von annotierten Dokumenten, die zum Trainieren eines Machine Learning-Modells verwendet werden kann. Siehe auch Blinddaten und Testdaten.

  • Wahr-negativ

    Eine Antwort oder Annotation, die tatsächlich falsch ist und als falsch vorhergesagt wird.

  • Wahr-positiv

    Eine Antwort oder Annotation, die tatsächlich richtig ist und als richtig vorhergesagt wird.

  • Typsystem

    Das Typsystem definiert die Objekttypen, die in einem Dokument erkannt werden können. Das Typsystem definiert alle möglichen Entitätstypen und die Beziehungen zwischen den Entitätstypen. In einem Typsystem kann eine beliebige Anzahl verschiedener Typen definiert werden. Typsysteme sind in der Regel fach- und anwendungsspezifisch.