Klassifizierung von Sätzen

IBM Cloud

Die Satzklassifizierung ist eine Betafunktion, die nur in verwalteten Implementierungen verfügbar ist. Außerdem ist die Funktion nur für englischsprachige Dokumente verfügbar.

Verwenden Sie die Satzklassifizierung, um Sätze in Ihren Dokumenten zu klassifizieren, die von großem geschäftlichen Interesse sind.

Die Satzklassifizierung verwendet ein Modell für maschinelles Lernen, das Sätze auf der Basis benutzerdefinierter Satzklassen klassifiziert. Sie können Beispielsätze in Ihren Dokumenten beschriften, um die Satzklassen zu definieren. Um den Beschriftungsprozess zu beschleunigen, erstellt das System automatisch ein Vorschlagsmodell im Hintergrund und stellt Ihnen weitere Vorschläge für Satzbeschriftung zur Verfügung.

Vorbereitende Schritte

Suchen oder erstellen Sie eine Sammlung mit Dokumenten mit verschiedenen Satzbeispielen, über die Discovery informiert werden soll. Um das Satzklassifikationsmerkmal beizubringen, müssen Sie Beispiele für Satzklassen beschriften. Sie können Beispiele nur kennzeichnen, wenn Ihre Sammlung gültige Beispiele enthält. Versuchen Sie, Dokumente zu finden, die viele unterschiedliche Sätze enthalten, die als Beispiele für jede Satzklasse dienen, die Sie definieren möchten.

Hinzufügen eines Satzklassifikationsmerkmals

Um einen Satzklassifikator hinzuzufügen, führen Sie die folgenden Schritte aus:

  1. Öffnen Sie das Projekt, in dem Sie den Satzklassifikator erstellen möchten.

    Das Projekt muss mindestens eine Sammlung mit Dokumenten enthalten, die repräsentativ für Daten sind, die Sie klassifizieren möchten.

  2. Erweitern Sie in der Anzeige Verbesserungstools der Seite Verbessern und anpassen den Eintrag Konzepte der Teach-Domäne und klicken Sie dann auf Klassifikationsmerkmale für Sätze.

  3. Klicken Sie auf Neu.

  4. Fügen Sie einen Satzklassifikationsmerkmalnamen und optional eine Beschreibung hinzu.

    Dieser Name wird als Modellname und als Name der Aufbereitung verwendet, die beim Publizieren des Modells erstellt wird. Der Name wird als Aufbereitungsname auf der Seite Aufbereitungen angezeigt, auf der Sie und andere Benutzer ihn auf Objektgruppen anwenden können. Sie wird auch als Modellname in der JSON-Darstellung von Dokumenten angezeigt, in denen Satzklassen gefunden werden. Der Name wird mit der von Ihnen angegebenen Großschreibung und dem von Ihnen angegebenen Abstand gespeichert.

  5. Wählen Sie eine Sammlung mit Dokumenten aus, die für Daten repräsentativ sind, die Sie klassifizieren möchten.

  6. Wählen Sie Felder aus dem Dokument aus, die in der Dokumentansicht angezeigt werden sollen, in der Sie Dokumente aus der Sammlung beschriften.

    • Dokumenttitel wird in der Seitenkopfzeile als Dokumentname angezeigt. Wählen Sie ein Feld mit einem eindeutigen Wert pro Dokument aus, z. B. den Dateinamen, der im Feld extracted_metadata.filename gespeichert ist.
    • Dokumenthauptteil ist die Position, an der Sie Satzbeispiele im Inhalt beschriften. Choose a field that contains the bulk of the document content, such as the text field.
  7. Klicken Sie auf Erstellen.

Ein Dokument aus der von Ihnen ausgewählten Sammlung wird in der Ansicht Dokumente beschriften angezeigt. Sie werden Vorkommen der Satzklassen beschriften, die Discovery aus diesem und anderen Dokumenten in der Sammlung erkennen soll.

Wenn im Hauptteil der Seite kein Text angezeigt wird, beginnen Sie jetzt mit der Erstellung eines neuen Satzklassifikationsmerkmals. Wenn Sie dieses Mal einen Wert für das Feld Dokumenthauptteil auswählen, müssen Sie ein Feld aus Ihren verarbeiteten Dokumenten auswählen, das Text enthält.

Satzklassen definieren

Definieren Sie Satzklassen, indem Sie die folgenden Schritte ausführen:

  1. Klicken Sie auf Satzklasse hinzufügen.

  2. Fügen Sie den Satzklassennamen und eine optionale Beschreibung hinzu.

  3. Optional: Wählen Sie die Farbe für die Satzklasse im Dokument aus.

    Sie können auf eine Farbe in der Palette Beschriftungsfarbe klicken und auf das Symbol Farbe erneuern klicken, um von einer Farbe zur nächsten zu navigieren. Wenn Sie eine angepasste Farbe verwenden möchten, geben Sie den hexadezimalen Farbcode (#fff0f7) an.

  4. Klicken Sie auf Erstellen.

  5. Wiederholen Sie diesen Prozess, um alle Satzklassen hinzuzufügen, die das Klassifikationsmerkmal klassifizieren soll.

    Wenn Sie nicht sicher sind, was für Satzklassen hinzugefügt werden soll, kann es hilfreich sein, zuerst die Dokumente in der Sammlung zu überprüfen. Durch die Überprüfung des Inhalts können Sie ein Gefühl erhalten, für das Sätze eine signifikante Bedeutung haben, und nach logischen Methoden suchen, um solche Sätze zu klassifizieren.

Sätze beschriften

Suchen Sie in der Ansicht Beschriftungsdokumente Sätze in den Dokumenten aus Ihrer Sammlung und beschriften Sie sie, um ihre Satzklassen anzugeben. Während Sie beschriften, trainiert das Satzklassifikationsmerkmal automatisch ein Modell im Hintergrund, um Beschriftungsvorschläge darzustellen.

Die Beschriftungsvorschläge beschleunigen den Prozess der Beschriftung Ihrer Dokumente. Anstatt Dokumente durchzugehen und Zeit mit dem Lesen von Text zu verbringen, ermöglichen Ihnen die Beschriftungsvorschläge, relevante Beispiele einfach zu finden und im Kontext zu untersuchen.

Sie können Sätze auf folgende Weise kennzeichnen:

Im Gegensatz zum Entitätsextraktionsprogramm gibt es kein Konzept des Dokumentstatus wie Nicht gestartet, In Bearbeitungund Abgeschlossen für Satzklassifikationsmerkmale. Bei Entitätsextraktoren markieren Sie Dokumente als Abgeschlossen, um anzugeben, dass sie für das Training verwendet werden. Bei Satzklassifikationsmerkmalen werden nur beschriftete Sätze für das Training verwendet und nicht beschriftete Daten in jedem Dokument werden ignoriert.

Für das Training verwendete Daten
Funktion Was wird für das Training verwendet?
Entitätsextraktor Alle Dokumente, die als abgeschlossen markiert sind
Satzklassifikationsmerkmal Alle beschrifteten Sätze (nicht beschriftete Sätze werden nicht verwendet)

Manuelle Kennzeichnung

Um manuell zu beschriften, führen Sie die folgenden Schritte aus:

  1. Lesen Sie die Dokumente auf der Seite Dokumente beschriften, um die entsprechenden Satzbeispiele für die Beschriftung zu finden.

  2. Wählen Sie ein Satzbeispiel aus und klicken Sie auf das Symbol Beschriftungen bearbeiten.

  3. Wählen Sie eine Satzklasse aus der Liste aus, um den Beispielsatz als positive Beschriftung zu kennzeichnen.

    Um den Beispielsatz als negative Beschriftung zu kennzeichnen, drücken Sie die Umschalttaste, wenn Sie die Satzklasse in der Liste auswählen.

    Wenn Sie keine geeigneten Satzbeispiele finden, wählen Sie ein anderes Dokument in der Dokumentlisteaus.

    Zeigt einen Auszug aus einem Dokument mit positiven und negativen Beispielbeschriftungen.
    Labeled sentence examples

  4. Wiederholen Sie die Schritte, um Beispielsätze in anderen Dokumenten der Sammlung als positiv oder negativ zu kennzeichnen.

Klicken Sie bei der Beschriftung auf Satzklassifikationsmerkmal speichern, um Ihre Arbeit zu speichern. Wenn Sie von der Seite Dokumente kennzeichnen zu einer anderen Seite wechseln, speichert das System Ihre Arbeit automatisch.

Verwenden Sie Direktaufrufe für Schnellbeschriftungsoperationen. Drücken Sie die Tasten 1 bis 5, die einer in der Liste angezeigten Satzklasse entsprechen, um den Beispielsatz als positive Beschriftung zu kennzeichnen. Drücken Sie die Tasten 6 bis 0, um eine negative Beschriftung hinzuzufügen. Sie können die Löschtaste oder die Rücktaste drücken, um Beschriftungen aus dem ausgewählten Satz zu entfernen.

Dokumentbeschriftung suchen

Mit der Suchfunktion können Sie Satzbeispiele in einem Dokument finden und einfach beschriften. Sie können die Suche auch verwenden, um Beispiele mit Bezeichnungen und Beispiele ohne Bezeichnungen zu finden und Inkonsistenzen bei Bezeichnungen zu korrigieren.

Führen Sie die folgenden Schritte aus, um Beispiele zu suchen und in einem Dokument zu beschriften:

  1. Klicken Sie in der Ansicht Dokumente kennzeichnen auf das Symbol Suchen.

  2. Geben Sie im Feld Suchen den Text an, nach dem im Dokument gesucht werden soll.

    Die Suchergebnisse aus dem Dokument werden angezeigt, wenn Sie den Text eingeben.

    Zum Durchsuchen der Suchergebnisse können Sie auf die Symbole Nächstes Ergebnis und Vorheriges Ergebnis klicken. Klicken Sie zum Auswählen einer Beschriftung für ein Beispiel ohne Beschriftung im Ergebnis auf das Symbol Beschriftungen bearbeiten und wählen Sie eine Satzklasse aus der Liste aus. Sie können Beschriftungen auch aus einem bereits beschrifteten Beispiel im Ergebnis entfernen, indem Sie das Symbol Beschriftung bearbeiten anklicken und Beschriftungen entfernen auswählen.

    Zeigt die Suchergebnisse an.
    Suchergebnisse

  3. Klicken Sie zum Filtern der Suchergebnisse auf das Symbol Filteroptionen anzeigen.

    In der folgenden Tabelle werden die Filteroptionen beschrieben.

    Filteroptionen in der Suche
    Option Beschreibung
    Alle Alle Beispiele in einem Dokument suchen, die mit dem Text übereinstimmen.
    Beschriftungstext Suche nach vorhandenen beschrifteten Beispielen in einem Dokument, die dem Text entsprechen.
    Text ohne Beschriftung Um Beispiele ohne Bezeichnungen in einem Dokument zu finden, die dem Text entsprechen.
    Groß-/Kleinschreibung beachten Um Beispiele zu finden, die sowohl dem Text als auch seiner Groß-/Kleinschreibung entsprechen.
    Ganze Wörter Um Beispiele zu finden, die den Wortgrenzen des Textes entsprechen. Wenn Sie beispielsweise installing im Text angeben, wird Deinstallation nicht abgeglichen, wenn diese Option ausgewählt wird.
    1. Wiederholen Sie die Schritte, um Beispielsätze in anderen Dokumenten der Objektgruppe zu beschriften.

Intelligente Beschriftung

Die intelligente Beschriftungsfunktion verwendet aktive Lerntechniken, um Satzbeispiele vorzuschlagen, die Sie beschriften können. Die intelligente Kennzeichnung beschleunigt den Beschriftungsprozess, aber Sie müssen mindestens 20 Beispiele für jede Satzklasse zuerst beschriften, damit das System ein Vorschlagsmodell erstellen kann.

Um Smart Labeling zu verwenden, führen Sie die folgenden Schritte aus:

  1. Beschriften Sie mindestens 20 positive Beispiele für mindestens eine Satzklasse.

    Das System beginnt automatisch mit der Vorbereitung eines Vorschlagsmodells im Hintergrund.

    Nachdem eine Version des Vorschlagsmodells fertig ist, stellt das System Vorschläge bereit, welche Sätze als nächstes beschriftet werden. Die Beschriftung der Vorschläge trägt dazu bei, das Modell für Satzklassifikationsmerkmale am meisten zu verbessern.

  2. Klicken Sie auf Intelligente Beschriftung verwenden.

    caption-side=bottom"
    Intelligente

    Das Teilfenster Intelligente Beschriftung wird angezeigt. In diesem Teilfenster können Sie Sätze für eine bestimmte Satzklasse beschriften.

  3. Wählen Sie ein Beispiel aus den vorgeschlagenen Beispielenaus und klicken Sie auf Ja, um den Beispielsatz als positive Beschriftung zu kennzeichnen. Sie können auf Nein klicken, um den Beispielsatz als negative Beschriftung zu beschriften.

    caption-side=bottom"
    Intelligente

  4. Wiederholen Sie den vorherigen Schritt, um weitere vorgeschlagene Beispiele zu beschriften.

    Klicken Sie zum Aktualisieren der vorgeschlagenen Beispiele in der Liste auf Vorschläge aktualisieren. Die Liste wird mit neuen Vorschlägen aktualisiert und die vorhandenen Beispiele mit Bezeichnungen werden nicht in der Liste angezeigt.

  5. Klicken Sie auf Fertig, nachdem Sie die Sätze beschriftet haben.

    Wenn Sie nicht genügend Satzbeispiele in der aktuellen Dokumentgruppe haben, können Sie weitere Dokumente hinzufügen. Diese Option ist nur verfügbar, wenn die Objektgruppe weitere Dokumente enthält. Weitere Informationen finden Sie unter Dokumente zu den Trainingsdaten hinzufügen.

  6. Nachdem Sie die Beispiele in so vielen Dokumenten in der Sammlung beschriftet haben, wie Sie möchten, klicken Sie auf Satzklassifikationsmerkmal speichern und trainieren dann das Klassifikationsmerkmal. Weitere Informationen finden Sie unter Klassifikationsmerkmal trainieren.

Tipps für die intelligente Kennzeichnung

Beachten Sie die folgenden Tipps für die intelligente Kennzeichnung:

  • Verwenden Sie Direktaufrufe für Schnellbeschriftungsoperationen. Sie können die Linkspfeiltaste drücken, um Ja auszuwählen, oder die Rechtspfeiltaste, um Nein auszuwählen. Die Auswahl von Ja oder Nein entspricht der Angabe einer positiven oder negativen Beschriftung für die Satzklasse.

  • Um einen Beispielsatz als positive Beschriftung zu kennzeichnen, drücken Sie die Tasten 1 bis 5, die einer in der Liste angezeigten Satzklasse entsprechen. Drücken Sie die Tasten 6 bis 0, um eine negative Beschriftung hinzuzufügen. Sie können die Löschtaste oder die Rücktaste drücken, um Beschriftungen aus dem ausgewählten Satz zu entfernen.

  • Wenn ein Beispiel für die aktuelle Satzklasse irrelevant ist, kennzeichnen Sie das Beispiel als negativ, anstatt es unbeschriftet zu lassen. Nicht beschriftete Daten werden ignoriert und nicht für das Training verwendet, sodass die Angabe negativer Beschriftungen für die Verbesserung des Klassifikationsmodells wichtig ist.

  • Wenn Sie 20 oder mehr Beispiele (positive oder negative Beschriftungen) beschriften, nachdem das letzte Vorschlagsmodell trainiert wurde, beginnt das System automatisch mit der Erstellung eines neuen Vorschlagsmodells im Hintergrund. Sie werden benachrichtigt, wenn die neuen Vorschläge beschriftet werden können.

Dokumente zu Trainingsdaten hinzufügen

Um weitere Dokumente hinzuzufügen, führen Sie die folgenden Schritte aus:

  1. Navigieren Sie zur Ansicht Dokumente beschriften.
  2. Klicken Sie in der Anzeige Dokumentliste auf Dokumente hinzufügen.

Diese Option ist nicht verfügbar, wenn keine anderen Dokumente in der Objektgruppe zum Hinzufügen zum Arbeitsbereich für Satzklassifikationsmerkmale vorhanden sind. Um weitere Dokumente zur Sammlung hinzuzufügen, navigieren Sie zur Seite Aktivität für die Sammlung und klicken Sie anschließend auf die Kachel Daten hochladen, um weitere Dokumente zu durchsuchen und hinzuzufügen.

Selbst wenn Sie weitere Dokumente aus einer Sammlung hinzufügen, können alle Dokumente zum Trainieren des Modells verwendet werden. Im Gegensatz zum Entitätsextraktor, bei dem alle abgeschlossenen Dokumente für das Training verwendet werden, verwendet das Satzklassifikationsmerkmal nur beschriftete Sätze für das Training und nicht beschriftete Daten werden ignoriert.

Sie können die Dokumente nicht aus der Sammlung auswählen, die in der Anzeige Dokumentliste für die Beschriftung angezeigt werden sollen. Wenn Sie bestimmte Dokumenttypen beschriften möchten, sollten Sie eine neue Objektgruppe erstellen, die nur diese Dokumente enthält.

Klassifikationsmerkmal trainieren

Nachdem Sie Dokumente beschriftet haben, können Sie die Trainingsdaten in der Ansicht Klassifikationsmerkmal trainieren überprüfen. Die Trainingsdaten werden zum Trainieren des Modells für Satzklassifikationsmerkmale verwendet.

Um den Klassifikator zu trainieren, führen Sie die folgenden Schritte aus:

  1. Navigieren Sie zur Ansicht Klassifikationsmerkmal trainieren.

  2. Überprüfen Sie Ihre Beschriftungszusammenfassung, um festzustellen, ob Sie ausreichend beschriftet haben, um das Klassifikationsmerkmal zu trainieren.

    Zum Trainieren des Klassifikationsmerkmals muss jede Satzklasse mindestens 20 positive und zwei negative Beschriftungen aufweisen. Andernfalls ist die Schaltfläche Klassifikationsmerkmal trainieren inaktiviert und Sie können das Training nicht starten. Satzklassen ohne positive oder negative Beschriftungen werden ignoriert.

  3. Überprüfen Sie, ob Sie erweiterte Optionen für das Training anwenden möchten. Die meisten Modelle erfordern keine Änderungen an den erweiterten Optionen.

    Ihre Sätze werden zufällig in Sätze aufgeteilt. Das Trainingsset wird zum Trainieren des Klassifikationsmerkmals verwendet. Das Testset wird verwendet, um das Modell nach dem Training zu testen. Das Blindset hat reservierte Sätze, die Sie während des Trainings nicht sehen. Sie werden verwendet, um in regelmäßigen Abständen eine unverzerrte Auswertung des Modells zu generieren. Die Standardaufteilung verwendet das Standardverhältnis für das Training. Weitere Informationen finden Sie unter Dokumentgruppen für Schulungen.

  4. Klicken Sie auf Klassifikationsmerkmal trainieren.

    Wenn Sie das Klassifikationsmerkmal trainieren, verwendet Discovery Sätze aus dem Trainingsset, um ein Modell für maschinelles Lernen zu erstellen. Die Ergebnisse des Tests werden angezeigt und können in der Ansicht Klassifikationsmerkmal auswerten überprüft werden.

Dokumentgruppen für Schulungen

Sie können das Verhältnis der Sätze ändern, die in den Dokumentgruppen enthalten sind, aus denen Ihre Trainingsdaten bestehen.

Die Sätze, die Sie beschriftet haben, werden zufällig in die folgenden Sätze aufgeteilt:

  • Trainingsset: Die Sätze, die Sie beschriften und die zum Trainieren des Machine Learning-Modells für Satzklassifikationsmerkmale verwendet werden. Das Ziel des Trainingssets ist es, dem Modell korrekte Beschriftungen beizubringen.

  • Testgruppe: Die Sätze, die zum Testen des trainierten Modells verwendet werden. Nachdem das Modell generiert wurde, führt es automatisch einen Test für die Dokumente aus der Testgruppe aus. Sie können die Ergebnisse analysieren, um Bereiche zu ermitteln, in denen das Modell fehlerhaft ist, und um Möglichkeiten zur Verbesserung der Leistung des Modells zu finden.

  • Blinde Sätze: Sätze, die beiseite gelegt und zum regelmäßigen Testen des Modells verwendet werden, nachdem mehrere Test-und Verbesserungsiterationen abgeschlossen sind. Die Sätze im Blindset werden absichtlich abgeseilt. Wenn Sie das Modell mit Sätzen aus der Testgruppe testen und die Ergebnisse analysieren, werden Sie mit den zugrunde liegenden Testsätzen vertraut. Da die Testsätze iterativ zur Verbesserung des Modells verwendet werden, können sie das Modelltraining indirekt beeinflussen. Deshalb möchten Sie vielleicht die blinde Gruppe von Sätzen haben. Das Blindset bietet Ihnen die Möglichkeit, in regelmäßigen Abständen eine unverzerrte Auswertung des Modells zu generieren.

Die Standardaufteilungsquote beträgt 70% für das Trainingsset, 30% für das Testset und 0% für das Blindset. Sie können blinde Sätze verwenden, indem Sie das Verhältnis der blinden Sätze erhöhen. In diesem Fall stimmen die Zahlen in der Klassifikationsmerkmalbewertungstabelle der Ansicht Klassifikationsmerkmal auswerten, wie z. B. Falsch positiv, Falsch negativ usw., nicht mit der Anzahl der Sätze überein, die in der Ansicht Trainingsergebnisse überprüfen angezeigt werden. Dies liegt daran, dass Sätze im Blindset bei der Bewertung berücksichtigt werden, sie jedoch nicht in der Ansicht Trainingsergebnisse überprüfen angezeigt werden.

Klassifikationsmerkmal auswerten

Um Metriken aus dem Testlauf des Satzklassifikationsmerkmalmodells zu überprüfen, das Sie erstellt haben, klicken Sie auf die Registerkarte Klassifikationsmerkmal auswerten.

In der folgenden Tabelle werden die verfügbaren Bewertungsmetriken beschrieben.

Metrikdetails
Metrik Beschreibung
Wahrheitsmatrix Eine Tabelle, die eine detaillierte numerische Aufschlüsselung der markierten Sätze bietet. Verwenden Sie sie, um die Bezeichnungen des Modells für maschinelles Lernen mit den Bezeichnungen in den Trainingsdaten zu vergleichen.
F1-Score Misst, ob das optimale Gleichgewicht zwischen Genauigkeit und Trefferquote erreicht wird. Der F1-Wert kann als gewichteter Durchschnitt der Werte für die Genauigkeit und die Trefferquote interpretiert werden. Der beste Wert für einen F1-Wert ist 1 und der schlechteste Wert ist 0. Die Gesamtscores sind niedriger, wenn das Modell nicht über genügend Trainingsdaten verfügt, um daraus zu lernen.
Genauigkeit Misst, wie viele der Gesamtsätze als korrekte Satzklasse klassifiziert werden. Falsch-positiv ist, wenn ein Satz nicht klassifiziert werden sollte, sondern klassifiziert wurde (Vorhergesagt = positiv, Tatsächlich = negativ). Falsch-positive Werte bedeuten normalerweise eine geringe Genauigkeit.
Trefferquote Misst, wie oft Sätze, die klassifiziert werden sollen, klassifiziert werden. Ein falscher negativer Wert liegt vor, wenn ein Satz klassifiziert werden soll, aber nicht klassifiziert wurde (Vorhergesagt = negativ, Tatsächlich = positiv). Falsche negative Werte bedeuten in der Regel eine niedrige Trefferquote.
  1. Überprüfen Sie die Metriken, die zum Testlauf des Klassifikationsmerkmalmodells bereitgestellt werden, um festzustellen, ob ein weiteres Training erforderlich ist.

  2. Untersuchen Sie die Testergebnisse ausführlicher, indem Sie auf Trainingsergebnisse im Testset prüfen klicken.

    Überprüfung der Trainingsergebnisse im
    der Trainingsergebnisse im

    Sätze aus dem Testset werden mit den tatsächlichen und vorhergesagten Beschriftungen angezeigt, die in der Liste im linken Teilfenster angezeigt werden. Wenn Sie auf einen Satz in der Liste klicken, wird er in der Dokumentansicht im rechten Teilfenster angezeigt.

    • Die tatsächlichen Beschriftungen sind die Beispiele, die eine Person manuell beschriftet hat. Sie werden als die richtigen Bezeichnungen betrachtet.
    • Vorhergesagte Beschriftungen sind Beispiele, die das Satzklassifikationsmerkmal als Satzklassen identifiziert und beschriftet hat.

    Die Leistung des Modells wird anhand der Übereinstimmung der vorhergesagten Beschriftungen mit den tatsächlichen Beschriftungen bewertet.

  3. Klicken Sie zum Filtern der Liste auf das Symbol Filter, wählen Sie die Satzklasse und Vorhersage aus und klicken Sie dann auf Anwenden.

Schulungsergebnisse aus Leistungsaufgliederung überprüfen

Führen Sie die folgenden Schritte aus, um Trainingsergebnisse aus der Leistungsaufgliederung zu überprüfen:

  1. Klicken Sie auf eine Zahl in der Tabelle Leistungsaufgliederung nach Satzklasse.

    Das Dialogfenster Schulungsergebnisse prüfen wird angezeigt.

  2. Überprüfen Sie die relevanten Sätze, die auf der Zahl basieren, auf die Sie geklickt haben.

Klassifikationsmerkmal verbessern

Die folgende Tabelle enthält vorgeschlagene Korrekturen für häufig auftretende Probleme.

Verbesserungsaktionen
Problem Aktion zur Behebung des Problems
Niedrige Gesamtscores Ihr Trainingsset enthält möglicherweise nicht genügend beschriftete Sätze. Beschriften Sie mehr Sätze in mehr Ihrer Dokumente.
Niedriger Score für Vollständigkeit Beschriften Sie weitere Dokumente mit neuen Beispielen der Satzklassen, die vom Klassifikationsmerkmal nicht klassifiziert werden konnten. Überprüfen Sie falsch-negative Sätze, um zu überprüfen, ob es eindeutige Begriffe unter ihnen gibt. Wenn Sie solche eindeutigen Begriffe sehen, suchen Sie nach Sätzen, die solche Begriffe enthalten, und fügen Sie positive Beschriftungen hinzu.
Niedriger Score für Genauigkeit Überprüfen Sie falsch-positive Sätze sorgfältig. Möglicherweise haben Sie einige Sätze nicht beschriftet. Überprüfen Sie insbesondere Sätze mit einer negativen Beschriftung. Wenn ein Satz eine negative Beschriftung für eine bestimmte Satzklasse aufweist (z. B. Klasse A), prüfen Sie, ob eine positive Beschriftung für eine andere Satzklasse erforderlich ist (z. B. Klasse B). Wenn der Satz tatsächlich zur Klasse B gehört, Sie aber keine positive Bezeichnung für Klasse B angegeben haben, kann er die Genauigkeitsbewertung verschlechtern. Wenn Sie außerdem Begriffe finden, die häufig in falsch-positiven Sätzen vorkommen, geben Sie negative Beschriftungen für Sätze mit solchen Begriffen an.

Satzklassifikationsmerkmal als Aufbereitung veröffentlichen

Wenn Sie denken, dass das Satzklassifikationsmerkmal bereit ist, veröffentlichen Sie das Satzklassifikationsmerkmalmodell. Sie können berücksichtigen, dass das Modell bereit ist, wenn sich der Score nach mehreren Testläufen, in denen Sie Verbesserungen vornehmen, nicht ändert. Sie können nach der Veröffentlichung des Modells zur Aktualisierung zurückkehren und das Modell erneut trainieren.

Um einen Satzklassifikator zu veröffentlichen, führen Sie die folgenden Schritte aus:

  1. Navigieren Sie zur Ansicht Klassifikationsmerkmal auswerten und klicken Sie auf Klassifikationsmerkmal veröffentlichen.
  2. Klicken Sie auf Publizieren.
  3. Klicken Sie auf "Auf Daten anwenden ".
  4. Wählen Sie eine Objektgruppe und dann das Textfeld aus, auf das die Aufbereitung des Satzklassifikationsmerkmals angewendet werden soll.
  5. Klicken Sie auf Anwenden.

Satzklassifikationsmerkmalmodell herunterladen

Ein Modell für Satzklassifikationsmerkmale, das Sie in einem Projekt erstellen und implementieren, ist als Aufbereitung verfügbar, die auf eine Objektgruppe aus einem beliebigen Projekt in derselben Serviceinstanz angewendet werden kann.

Wenn Sie das Modell für Satzklassifikationsmerkmale in einem Projekt aus einer anderen Serviceinstanz verwenden wollen, können Sie das Satzklassifikationsmerkmalmodell exportieren oder herunterladen. Um sie an anderer Stelle zu verwenden, führen Sie die Schritte zum Erstellen eines Modells für maschinelles Lernen in Importierte ML-Modelle zum Suchen nach angepassten Begriffen verwenden aus. Sie können nicht mit der Bearbeitung eines Satzklassifikationsmerkmals fortfahren, das Sie in ein anderes Projekt importieren.

Das zu exportierende Satzklassifikationsmerkmal muss vollständig trainiert sein.

Führen Sie die folgenden Schritte aus, um einen Satzklassifikator zu exportieren:

  1. Öffnen Sie das Projekt mit dem Satzklassifikationsmerkmal, das Sie exportieren möchten.

  2. Erweitern Sie in der Anzeige Verbesserungstools der Seite Verbessern und anpassen den Eintrag Konzepte der Teach-Domäneund klicken Sie dann auf Klassifikationsmerkmale für Sätze.

  3. Suchen Sie in der Liste Satzklassifikationsmerkmale das Satzklassifikationsmerkmal, das Sie exportieren wollen.

  4. Klicken Sie auf das Symbol Aktionen für Ihr Klassifikationsmerkmal und wählen Sie dann Modell herunterladen aus, um das Modell auf Ihrem System zu speichern.

    Die Option Modell herunterladen ist nur verfügbar, wenn das Modell trainiert wurde.

Das Modell für Satzklassifikationsmerkmale wird als .sc-Datei gespeichert. Sie können sie als Modell für maschinelles Lernen in ein Projekt in einer anderen Serviceinstanz importieren und dann auf Ihre Sammlungen anwenden.

Beschriftete Daten für ein Satzklassifikationsmerkmal herunterladen

Sie können die gekennzeichneten Daten für ein Satzklassifikationsmerkmal von Discoveryherunterladen oder exportieren. Sie können die exportierten beschrifteten Daten zum Trainieren oder Erstellen von Large Language Models (LLMs) in einem Service wie Watson Studio und Natural Language Processing (NLP) verwenden.

Führen Sie die folgenden Schritte aus, um die beschrifteten Daten zu exportieren:

  1. Erweitern Sie in der Anzeige Verbesserungstools der Seite Verbessern und anpassen den Eintrag Konzepte der Teach-Domäneund klicken Sie dann auf Klassifikationsmerkmale für Sätze.

  2. Klicken Sie für das Satzklassifikationsmerkmal, aus dem Sie beschriftete Daten exportieren wollen, auf das Symbol Aktionen und wählen Sie dann Beschriftete Daten herunterladen aus.

    Es wird eine komprimierte Datei mit gekennzeichneten Daten heruntergeladen. Die komprimierte Datei enthält die folgenden JSON-Dateien.

    • labeled_data.json: Enthält den Text und die Beschriftungen. Das Datenformat basiert auf dem Eingabedatenformat für die Textklassifikation in Watson Natural Language Processing. Weitere Informationen finden Sie unter Eingabedatenformat.
    • metadata.json: Enthält Metadaten für den Arbeitsbereich und beschriftete Daten

labeled_data.json in CSV konvertieren

Geben Sie den folgenden Befehl ein, um labeled_data.json in CSV zu konvertieren:

$ cat labeled_data.json | jq -r '.[] | [.text, .labels[]] | @csv'

Die gekennzeichneten Daten werden in das folgende Format konvertiert:

    "sentence1", class-label1, class-label2
    "sentence2", class-label3
    "sentence3", ...
    ...

Anwenden der Aufbereitung eines Satzklassifikationsmerkmals

Wenn Sie das Satzklassifikationsmerkmal veröffentlichen, geben Sie das Feld an, auf das das Satzklassifikationsmerkmal angewendet werden soll.

Um die Anreicherung später auf andere oder mehrere Felder anzuwenden, führen Sie die folgenden Schritte aus:

  1. Klicken Sie im Navigationsfenster auf Sammlungen verwalten.

  2. Klicken Sie auf diese Option, um die Objektgruppe zu öffnen, auf die Sie die Aufbereitung anwenden wollen.

  3. Klicken Sie auf Aufbereitungen.

  4. Suchen Sie den Namen des Satzklassifikationsmerkmals in der Liste und wählen Sie dann ein Feld aus, auf das die Aufbereitung angewendet werden soll.

    Sie können ein Feld auswählen, das Text oder HTML enthält.

  5. Klicken Sie auf Änderungen anwenden und erneut verarbeiten.

Weitere Informationen zum Anwenden einer Aufbereitung für Satzklassifikationsmerkmale auf eine Sammlung finden Sie unter Aufbereitungen verwalten

Ausgabe des Satzklassifikationsmerkmals

Wenn die Aufbereitung einen Ihrer Sätze in einem Dokument klassifiziert, wird ein Eintrag zum Abschnitt enriched_text.element_classes der JSON-Darstellung des Dokuments hinzugefügt. Der Abschnitt enthält Sätze, die von Ihrem Klassifikationsmerkmalmodell zusammen mit ihren Satzklassen klassifiziert werden.

Ein Satzklassifikationsmerkmal klassifiziert keine Sätze mit Konfidenzscores, die unter 0.5liegen.

Die folgende JSON-Ausgabe ist ein Beispielergebnis der Satzklassifizierung.

Shows the JSON output as an example
JSON representation

Leistung im Zeitverlauf überwachen

Sie können Ihr Satzklassifikationsmerkmalmodell jederzeit erneut trainieren. Prüfen Sie jedes Mal, wenn Sie das Modell trainieren, die Leistungsmetrikscores, um zu ermitteln, ob Ihre letzten Änderungen die Scores des Modells erhöhen oder verringern.

Um einen Testlauf mit einem anderen zu vergleichen, klicken Sie in der Ansicht Klassifikationsmerkmal auswerten auf Bewertungsverlauf anzeigen. Die Verlaufsansicht zeigt die letzten 5 Trainingsläufe.

To retain the score information for more than the most recent 5 training runs, you can export the metrics in comma-separated value format, and track the scores in a separate application. Click the tabular representation icon ![Tabular representation icon](images/table-of-contents.svg), and then click **Download as CSV**.
{: tip}

Wenn ein nachfolgender Trainingslauf zu niedrigeren Scores führt, veröffentlichen Sie diese Version des Modells nicht.

Satzklassifikationsmerkmal löschen

Sie können ein Satzklassifikationsmerkmal löschen, wenn es nicht verwendet wird, z. B. wenn die Aufbereitung, die aus dem Satzklassifikationsmerkmal veröffentlicht wird, nicht auf eine Objektgruppe angewendet wird.

Sie können ein Satzklassifikationsmerkmal löschen, wenn Sie beispielsweise den Grenzwert für die maximale Anzahl von Satzklassifikationsmerkmalen erreichen, die für Ihren Plan zulässig sind.

Es gibt zwei verschiedene Grenzwerte: die maximale Anzahl der Arbeitsbereiche für Satzklassifikationsmerkmale und die maximale Anzahl der Aufbereitungen für Satzklassifikationsmerkmale. Sie erstellen einen Arbeitsbereich für Satzklassifikationsmerkmale, wenn Sie zur Anzeige Verbesserungstools navigieren, *Konzepte der Domäne "Teach"*erweitern, auf Satzklassifikationsmerkmale klicken und anschließend auf die Schaltfläche Neu klicken. Sie erstellen eine Aufbereitung für Satzklassifikationsmerkmale, wenn Sie Ihr Klassifikationsmerkmal für trainierte Sätze veröffentlichen oder ein Modell für Satzklassifikationsmerkmale hochladen. Informationen zu den Grenzwerten finden Sie unter Grenzwerte für Satzklassifikationsmerkmale.

Beachten Sie, dass Grenzwerte pro Serviceinstanz und nicht pro Projekt definiert werden. Wenn Sie im aktuellen Projekt nicht die maximale Anzahl von Satzklassifikationsmerkmalen haben, aber keine neuen Arbeitsbereiche für Satzklassifikationsmerkmale erstellen oder Ihr trainiertes Satzklassifikationsmerkmal publizieren können, überprüfen Sie andere Projekte in derselben Serviceinstanz. Möglicherweise gibt es Arbeitsbereiche für Satzklassifikationsmerkmale oder Aufbereitungen, die nicht in anderen Projekten verwendet werden, die gelöscht werden können.

Aufbereitungen für Satzklassifikationsmerkmale entfernen

Entfernen Sie die Aufbereitung des Satzklassifikationsmerkmals, die aus dem Satzklassifikationsmerkmal veröffentlicht wurde, das Sie löschen möchten, aus allen Sammlungen, in denen sie verwendet wird. Weitere Informationen finden Sie unter Aufbereitungen löschen.

Durch das Entfernen der Aufbereitung eines Satzklassifikationsmerkmals wird dessen Arbeitsbereich nicht entfernt.

Arbeitsbereiche für Satzklassifikationsmerkmale entfernen

Um einen Satzklassifikator-Arbeitsbereich zu entfernen, führen Sie die folgenden Schritte aus:

  1. Erweitern Sie in der Anzeige Verbesserungstools der Seite Verbessern und anpassen den Eintrag Konzepte der Teach-Domäneund klicken Sie dann auf Klassifikationsmerkmale für Sätze.

  2. Suchen Sie den Arbeitsbereich für Satzklassifikationsmerkmale, den Sie löschen möchten, klicken Sie auf das Symbol Aktionen und wählen Sie dann Löschen aus.

Durch das Entfernen eines Arbeitsbereichs für Satzklassifikationsmerkmale wird die im Arbeitsbereich veröffentlichte Aufbereitung nicht entfernt.

APIs für Satzklassifikationsmerkmale verwenden

Die API für Satzklassifikationsmerkmale ist eine Betafunktionalität.

Sie können die APIs verwenden, um die Aufbereitung von Satzklassifikationsmerkmalen auf Ihre Dokumente anzuwenden. Mit den APIs können Sie eine Aufbereitung für Satzklassifikationsmerkmale erstellen und die Aufbereitung verwalten, wie z. B. sie aktualisieren und löschen.

Um die Satzklassifikator-APIs zu verwenden, müssen Sie Folgendes tun:

  1. Erstellen Sie mit der Methode create an enrichment in der API eine Erweiterung für Satzklassifikationsmerkmale.

    Weitere Informationen zum Erstellen der Aufbereitung finden Sie unter Aufbereitung erstellen in der API-Referenz.

    Sie müssen die beschrifteten Daten angeben, um das Modell für Satzklassifikationsmerkmale zu trainieren, wenn Sie die Aufbereitung für Satzklassifikationsmerkmale erstellen. Die gekennzeichneten Daten müssen das folgende CSV-Format aufweisen:

    "sentence1", class-label1, class-label2
    "sentence2", class-label3
    "sentence3", ...
    ...
    

    Jede Zeile ist ein Satz gefolgt von einer durch Kommas getrennten Liste mit null oder mehr Satzklassenbezeichnungen, die dem Satz zugeordnet sind.

    Als bewährtes Verfahren sollte jede Satzklassenbezeichnung in der CSV-Datei durch mindestens 100 Sätze dargestellt werden, um eine angemessene Satzklassifizierung zu erreichen. Sätze, die einer Satzklassenbezeichnung zugeordnet sind, werden als positive Beispiele dieser Satzklasse betrachtet. Sätze, die keiner Satzklassenbeschriftung zugeordnet sind, werden als negative Beispiele dieser Satzklasse betrachtet.

    Nachdem die Aufbereitung für Satzklassifikationsmerkmale erfolgreich erstellt wurde, navigieren Sie zur Seite Sammlungen verwalten, wählen Sie die Sammlung aus und öffnen Sie dann die Registerkarte Aufbereitungen. Sie finden die Aufbereitung für Satzklassifikationsmerkmale in der Liste der verfügbaren Aufbereitungen.

    Nachdem die Aufbereitung für Satzklassifikationsmerkmale Status bereit ist, können Sie die Aufbereitung für Satzklassifikationsmerkmale auf die Dokumente in Ihrer Sammlung anwenden.

  2. Wenden Sie die von Ihnen erstellte Aufbereitung des Satzklassifikationsmerkmals auf die Felder (Text oder HTML) in Ihren Dokumenten an, um Sätze zu klassifizieren. Weitere Informationen zum Anwenden einer Aufbereitung und zum Verwalten der Aufbereitung mit APIs finden Sie unter API zum Verwalten von Aufbereitungen verwenden.

Grenzwerte für Satzklassifikationsmerkmale

Die Anzahl der Satzklassifikationsmerkmale, die Sie pro Serviceinstanz erstellen können, hängt vom Plantyp Discovery ab.

Grenzwerte für Satzklassifikationsmerkmale
Planen Arbeitsbereiche für Satzklassifikationsmerkmale pro Serviceinstanz Aufbereitungen für Satzklassifikationsmerkmale pro Serviceinstanz Maximale Satzklassen pro Klassifikationsmerkmal Maximale Anzahl Dokumente in Trainingsdaten
Premium 10 20 5 1000
Enterprise 10 20 5 1000
Plus (einschließlich Testversion) 3 5 3 200