Text klassifizieren

Definieren Sie Kategorien, nach denen Text in Ihren Dokumenten klassifiziert werden kann.

In diesem Abschnitt wird beschrieben, wie Text klassifiziert wird. Wenn Sie Dokumente klassifizieren möchten, verwenden Sie die Content-Mining-Anwendung. Weitere Informationen finden Sie unter Klassifizierungstypen.

Fügen Sie ein Textklassifikationsmerkmal hinzu, um Text aus Dokumenten in Ihrer Objektgruppe Kategorien zuzuordnen. Discovery verwendet die von Ihnen bereitgestellten Beschriftungen und Textbeispiele, um die Textkategorien in Ihrer Sammlung vorherzusagen.

Um einen Textklassifikator zu erstellen, führen Sie die folgenden Schritte aus:

  1. Erstellen Sie eine CSV-Datei, die Beispieltext gefolgt von der Kategoriebezeichnung pro Zeile enthält.

    Die CSV-Datei muss im UTF-8-Codierungsformat vorliegen und die folgenden Anforderungen erfüllen:

    • Das Format muss text,label sein. " text " ist der Beispieltext und " label " ist der Kategoriename.

      Fügen Sie vollständige Sätze als Texteinträge hinzu. Fügen Sie keine Leerzeilen in die CSV-Datei ein.

      Sie können weitere label-Spalten hinzufügen, wenn Sie mehr als ein Etikett auf den Satz in der text-Spalte anwenden müssen. Zum Beispiel text,label,label.

    • Die Datei muss mindestens zwei Spalten ohne Überschriften enthalten.

    • Fügen Sie 10 oder mehr Einträge für jede Kategorie hinzu, die Sie definieren wollen. Pro Kategorie sind mindestens 3 Einträge erforderlich. Je mehr Beispiele Sie für jede Kategorie bereitstellen, desto besser kann das Klassifikationsmerkmal die Kategorien anderer Inhalte in Ihrer Objektgruppe vorhersagen.

    Das folgende Beispiel zeigt eine CSV-Datei, die zwei Kategorien mit den Namen facility_temperature und catering definiert. Der Beispieltext besteht aus Feedback von Konferenzteilnehmern.

    The rooms were too cold.,facility_temperature
    Breakfast did not include gluten-free options.,catering
    The rooms were too warm.,facility_temperature
    I was very comfortable in the session rooms.,facility_temperature
    The awards dinner was delicious.,catering
    Coffee ran out during one of the breaks.,catering
    The temperature was not comfortable.,facility_temperature
    I was very happy with the selection at lunch.,catering
    It was nice that you provided tea and coffee. Tea drinkers are often ignored.,catering
    Can you turn up the air conditioning? I was very warm.,facility_temperature
    My teeth were chattering because I was so cold.,facility_temperature
    The speaker left the room to find someone to adjust the temperature.,facility_temperature
    Would you consider an all-vegan menu next year?,catering
    I would like lemonade and iced tea to be served during the breaks.,catering
    The lunch staff was excellent.,catering
    Appreciated the fresh blueberry muffins at breakfast.,catering
    The hotel staff adjusted the temperature in my session room as soon as I asked. Excellent service!,facility_temperature
    Every meal was delicious and there was something for everyone.,catering
    The seats under the skylights were not comfortable. Too hot.,facility_temperature
    I was comfortable everywhere in the conference center. I never needed my emergency sweater.,facility_temperature
    
  2. Klicken Sie im Abschnitt Konzepte der Teach-Domäne der Anzeige Verbesserungstools auf Textklassifikationsmerkmale.

  3. Klicken Sie auf Hochladen.

  4. Geben Sie einen Namen für das Klassifikationsmerkmal an und wählen Sie dann die Sprache aus, die in der CSV-Datei verwendet wurde.

  5. Klicken Sie auf Hochladen, um nach der zuvor erstellten CSV-Datei zu suchen.

  6. Klicken Sie auf Erstellen.

    Basierend auf den von Ihnen angegebenen Trainingsdaten wird eine Aufbereitung für Klassifikationsmerkmale erstellt.

  7. Wählen Sie die Objektgruppe und das Feld aus, auf die Sie die Aufbereitung des Textklassifikationsmerkmals anwenden möchten, und klicken Sie anschließend auf Anwenden.

Das folgende Beispiel zeigt, wie eine Aufbereitung, die mit der CSV-Beispieldatei als Trainingsdaten erstellt wird, Text in einem Dokument klassifiziert. In der Ausgabe wendet die Aufbereitung des Klassifikationsmerkmals die Bezeichnung facility_temperature auf den Dokumenttext an. Die label wird im Array enriched_{field_name} im Array classes gespeichert.

{
  "enriched_text": [
    {
      "classes": [
        {
          "confidence": 0.999692440032959,
          "label": "facility_temperature"
        }
      ]
    }
  ],
  "text": [
    "I think more attendees would stay awake in the sessions if the rooms were colder."
  ]
}

Klassifikationsmerkmaltypen

Das Klassifikationsmerkmal, das Sie über die Benutzerschnittstelle von Discovery hinzufügen, ist ein Textklassifikationsmerkmal. Ein Textklassifikationsmerkmal kann Dokumente auf der Basis von Wörtern und Ausdrücken klassifizieren, die aus dem Haupttext extrahiert werden, wobei die zugehörigen Wortartinformationen berücksichtigt werden.

Sie können einen anderen Klassifikationstyp, ein Dokumentklassifikationsmerkmal, nur aus der implementierten Content-Mining-Anwendung erstellen. Ein Dokumentklassifikationsmerkmal kann Dokumente auf der Basis von Wörtern und Ausdrücken klassifizieren, die aus den Textfeldern des Hauptteils extrahiert werden, wobei Informationen aus ihrer Wortart und den anderen Aufbereitungen, die auf den Haupttext angewendet werden, berücksichtigt werden. Die Informationen aus den anderen Nicht-Hauptteilfeldern werden ebenfalls verwendet.

Sie können ein Dokumentklassifikationsmerkmal auf eine Objektgruppe in einem anderen Projekttyp als einem Content-Mining-Projekt anwenden. Dazu müssen Sie das Klassifikationsmerkmal in der implementierten Content-Mining-Anwendung erstellen und exportieren. Anschließend können Sie das Klassifikationsmerkmal importieren und als Aufbereitung auf Ihre Objektgruppe anwenden. Weitere Informationen finden Sie unter Dokumentklassifikationsmerkmal erstellen und anwenden.

Das Textklassifikationsmerkmal verwendet Part of Speech-Informationen unabhängig davon, ob die Part of Speech-Aufbereitung auf das Projekt angewendet wird.

Textklassifikationsmerkmale, die Sie zu einem Projekt hinzufügen, können von anderen Projekten verwendet werden, einschließlich Content-Mining-Projekten.

Ein Textklassifikationsmerkmal klassifiziert das Zieltextfeld nicht mit Konfidenzbewertungen, die niedriger als 0.5sind. Sie können den vom Textklassifikationsmerkmal verwendeten Konfidenzschwellenwert nicht ändern. Wenn Sie erwartet haben, dass bestimmte Typen von Passagen klassifiziert werden, die nicht klassifiziert wurden, können Sie Passagen mit ähnlichen Merkmalen zu Ihren Trainingsdaten hinzufügen und ein weiteres Klassifikationsmerkmal trainieren.

Grenzwerte für Textklassifikationsmerkmale

Die Anzahl der Textklassifikationsmerkmale und Beschriftungen, die pro Serviceinstanz erstellt werden können, hängt vom Plantyp Discovery ab.

Grenzwerte für Textklassifikationspläne
Begrenzung Und Enterprise Premium Cloud Pak for Data
Anzahl der Textklassifikationsmerkmale pro Serviceinstanz 5 20 20 Uneingeschränkt
Anzahl beschrifteter Datenzeilen 2.000 20.000 20.000 20.000
Maximale Größe in MB für Trainingsdaten nach Aufbereitung 16 1.024 1.024 1.024
Anzahl der Beschriftungen 100 1000 1000 1000