Importierte ML-Modelle zum Suchen nach angepassten Termen verwenden
Verwenden Sie angepasste Machine Learning-Modelle, die Regeln oder Kontext verwenden, um Entitäten zu erkennen und zu kennzeichnen.
Fügen Sie Machine Learning-Modelle hinzu, die Sie mit IBM Tools erstellt haben, mit denen Sie Ihr eigenes Typsystem definieren können.
Der Typ der Modelle, die Sie hinzufügen können, hängt von Ihrer Bereitstellung ab:
-
IBM Cloud Pak for DataIBM Software Hub Sie können Modelle hinzufügen, die mit Watson Explorer Content Analytics Studio-Modellen oder mit einer Instanz von IBM Watson® Knowledge Studio erstellt wurden, die auf IBM Cloud Pak® for Data oder IBM Cloud gehostet wird. Ab der Veröffentlichung von 4.6.2 können Sie auch benutzerdefinierte Entitätenextraktionsmodelle hinzufügen, die in einer anderen Instanz von Discovery erstellt und aus dieser exportiert wurden.
-
IBM Cloud Sie können nur Modelle hinzufügen, die mit einer IBM Watson® Knowledge Studio-Instanz erstellt wurden, die in IBM Cloud gehostet wird.
Um ein Knowledge Studio-Modell zu verwenden, das mit Knowledge Studio unter IBM Cloud Pak for Dataerstellt wurde, migrieren Sie die Ground Truth auf eine IBM Cloud-Instanz von Knowledge Studiound trainieren Sie das Modell anschließend erneut.
Die folgenden Modelltypen werden unterstützt:
- In Knowledge Studio erstellte regelbasierte Modelle, die Entitäten in Dokumenten anhand von Regeln finden, die Sie definieren. (Dateiformat: .pear)
- In Knowledge Studio erstellte Modelle für maschinelles Lernen, die die sprachlichen Nuancen, Bedeutungen und Beziehungen verstehen, die für Ihre Branche spezifisch sind (Dateiformat: .zip)
- Angepasste Entitätenextraktoren, die in Discoveryerstellt und exportiert werden. (Dateiformat: .ent)
- Satzklassifikationsmerkmale, die in Discoveryerstellt und exportiert werden. (Dateiformat: .sc)
- IBM Cloud Pak for DataIBM Software Hub Benutzerdefinierte UIMA-Textanalysemodelle, die in Watson Explorer Content Analytics Studio erstellt wurden. (Dateiformat: .pear)
Aus installierten Implementierungen wurde Unterstützung für den Import von Entitätsextraktionsmodellen mit dem Release 4.6.2 hinzugefügt.
Die Erkennung kann keine Entitätssubtypen identifizieren, die durch ein Knowledge Studio-Modell definiert sind.
Um ein Machine Learning-Modell hinzuzufügen, führen Sie die folgenden Schritte aus:
-
Erstellen Sie das Modell und exportieren Sie es aus dem Tool, das Sie zum Erstellen verwenden.
Weitere Informationen finden Sie in der folgenden Dokumentation:
-
Knowledge Studio for IBM Cloud Pak® for Data
-
Knowledge Studio für IBM Cloud
-
Watson Explorer Content Analytics Studio
Sie müssen das Modell aus Watson Explorer Content Analytics Studio als UIMA PEAR-Datei exportieren. Weitere Informationen finden Sie unter Angepasste PEAR-Dateien zur Verwendung mit Streams für lexikalische Analyse erstellen.
-
-
Klicken Sie im Abschnitt Konzepte der Domäne "Teach" der Anzeige Verbesserungstools auf Modelle für maschinelles Lernen importieren.
-
Geben Sie einen Namen für das Modell an und wählen Sie dann die Sprache aus, die zum Definieren des Modells verwendet wurde.
-
Klicken Sie auf Hochladen, um nach der zuvor exportierten Datei zu suchen.
-
Klicken Sie auf Erstellen.
-
Wählen Sie die Sammlung und das Feld aus, auf die Sie die Aufbereitungen aus dem Modell anwenden möchten und klicken Sie dann auf Anwenden.
Wenn das Modell zu groß ist, um von der Produktbenutzerschnittstelle hochgeladen zu werden, können Sie die Datei mit der Methode Aufbereitung erstellen der API importieren.
Beispiel für regelbasiertes Modell
Wenn beispielsweise ein Modell für maschinelles Lernen als Anreicherung für ein Feld angewendet wird, extrahiert es alle Entitätstypen in diesem Feld, die in einem regelbasierten Knowledge Studio-Modell angegeben wurden. Wenn das Modell Entitätstypen
wie person, surname und job title erkennt, werden sie in Ihren Dokumenten erkannt und mit Tags versehen.
In der Ausgabe die Informationen, die durch die Aufbereitung von Machine Learning im Array enriched_{field_name} im Array entities extrahiert werden. In diesem Beispiel ist das für die Aufbereitung ausgewählte Feld
text.
{
"enriched_text": [
{
"entities": [
{
"path": ".wksrule.entities.PERSON",
"text": "George Washington",
"type": "PERSON"
},
{
"path": ".wksrule.entities.GIVENNAME",
"text": "George",
"type": "GIVENNAME"
},
{
"path": ".wksrule.entities.SURNAME",
"text": "Washington",
"type": "SURNAME"
},
{
"path": ".wksrule.entities.POSITION",
"text": "politician",
"type": "POSITION"
},
{
"path": ".wksrule.entities.POSITION",
"text": "soldier",
"type": "POSITION"
},
{
"path": ".wksrule.entities.JOBTITLE",
"text": "President of the United States",
"type": "JOBTITLE"
}
],
"text": [
"George Washington (February 22, 1732‚ December 14, 1799) was an American politician and soldier who served as the first President of the United States from 1789 to 1797 and was one of the Founding Fathers of the United States."
]
}
]
}
Wenn also jemand die API verwendet, um eine Discovery Query Language-Abfrage zu übergeben, um nach Vorkommen der enriched_{field_name}.entities.type:jobtitle-Aufbereitung
zu suchen, werden alle Passagen zurückgegeben, die die Jobbezeichnung einer Person diskutieren.
Beispiel für Modell für maschinelles Lernen
In diesem Beispiel extrahiert ein Modell für maschinelles Lernen Entitätstypen wie person, oranization und date sowie Informationen zu Beziehungen zwischen den Entitäten. Wenn dieses ML-Modell als Bereicherung
für ein Feld angewendet wird, nutzt es maschinelles Lernen, um die sprachlichen Nuancen, Bedeutungen und Beziehungen zu verstehen, die im Dokument erwähnt werden.
In der Ausgabe die Informationen, die durch die Aufbereitung von Machine Learning im Array enriched_{field_name} in den Arrays entities und relations extrahiert werden. In diesem Beispiel ist das für die
Aufbereitung ausgewählte Feld text.
{
"enriched_text": [
{
"entities": [
{
"count": 1,
"text": "Democratic Party",
"type": "ORGANIZATION"
},
{
"count": 1,
"text": "March 15, 1767",
"type": "DATE"
},
{
"count": 1,
"text": "President",
"type": "POSITION"
},
{
"count": 1,
"text": "Andrew Jackson",
"type": "PERSON"
}
],
"relations": [
{
"sentence": "Andrew Jackson (March 15, 1767‚ June 8, 1845) was an American soldier and statesman who served as the seventh President of the United States from 1829 to 1837 and was the founder of the Democratic Party."
}
]
}
]
}
Grenzwerte für Machine Learning-Modelle
Die Anzahl der Machine Learning-Modelle (ML), die Sie pro Serviceinstanz erstellen können, hängt vom Plantyp Discovery ab.
| Planen | ML-Modelle pro Serviceinstanz |
|---|---|
| Cloud Pak for Data | Uneingeschränkt |
| Premium | 10 |
| Enterprise | 10 |
| Plus (einschließlich Testversion) | 3 |
Für jedes Knowledge Studio-Modell für maschinelles Lernen beträgt die maximale Anzahl Entitäten, die erkannt werden können, 50.
Erweiterte Regelmodelle
Fügen Sie ein erweitertes Regelmodell hinzu, um ein Textextraktionsmodell, das im erweiterten Regeleditor von IBM Watson® Knowledge Studio erstellt und exportiert wurde, auf Ihre Objektgruppe anzuwenden.
Ihr Modell muss mit der entsprechenden Knowledge Studio-Bereitstellung erstellt werden:
-
IBM Cloud Pak for DataIBM Software Hub Sie können Modelle hinzufügen, die an folgenden Orten erstellt und exportiert wurden:
- IBM Watson® Knowledge Studio, das mit einer IBM Cloud Pak® for Data-Bereitstellung vor dem Release 4.5 erstellt wurde.
- IBM Watson® Knowledge Studio, gehostet auf IBM Cloud
- NLP Editor, der von Mitwirkenden des Zentrums für Open-Source-Daten-und KI-Technologien erstellt wird
-
IBM Cloud Sie können Modelle hinzufügen, die mit einer IBM Watson® Knowledge Studio-Instanz erstellt wurden, die nur auf IBM Cloud gehostet wird.
Entfernung aus Knowledge Studio
Die Unterstützung für das Erstellen von Modellen mit dem Beta-Editor für erweiterte Regeln in Knowledge Studio wurde beendet. Alle Regelmodelle, die vor dem Ende des Unterstützungszeitraums aus Knowledge Studio exportiert wurden, können in Discoveryweiterhin verwendet werden.
Das Ende des Unterstützungszeitraums variiert je nach Implementierungstyp:
- IBM Cloud 30. Juni 2022
- IBM Cloud Pak for Data IBM Cloud Pak for Data veröffentlicht 4.5.1 am 3. August 2022.
IBM Cloud Als Alternative zur Verwendung eines Modells, das von Knowledge Studio Advanced Rules Editor generiert wird, können Sie eine Regel durchHinzufügen einer Musteranreicherung definieren.
Hinzufügen eines vorhandenen Modells
Gehen Sie wie folgt vor, um ein erweitertes Regelmodell hinzuzufügen:
-
Erstellen Sie das Modell und exportieren Sie die ZIP-Datei, die die Modellressourcen enthält.
Weitere Informationen zum Exportieren des Modells finden Sie in den Anweisungen für Ihre Modellquelle:
-
Wählen Sie im Abschnitt Teach domain concepts der Anzeige Improvement tools die Option Advanced rules model aus.
-
Klicken Sie auf Hochladen.
-
Geben Sie einen Namen für das Modell an und wählen Sie dann die Sprache aus, die zum Definieren des Modells verwendet wurde.
-
Geben Sie einen Namen für das Ergebnisfeld an. Dies ist das Feld im Index, in dem die Ausgabe dieser Aufbereitung gespeichert wird.
-
Klicken Sie auf Hochladen, um nach der ZIP-Datei zu suchen, die Sie zuvor exportiert haben.
-
Klicken Sie auf Erstellen.
-
Wählen Sie die Sammlung und das Feld aus, auf die Sie die Aufbereitungen aus dem Modell anwenden möchten und klicken Sie dann auf Anwenden.
Ausgabeformat für erweiterte Regeln
Knowledge Studio verwendet die AQL (Annotation Query Language), um die Regeln in einem erweiterten Regelmodell zu definieren. Jedes Modell wird durch eine oder mehrere Ansichten definiert. Jede Ansicht ist eine relationale Datenstruktur, die mehrere Datensätze enthält. Jeder Datensatz besteht aus Werten in Spalten, die durch das Schema der Ansicht definiert sind. Zur Vereinfachung der Darstellung dieser Modelle, die angepasst sind und daher über verschiedene Schemas verfügen, wird ein einheitliches JSON-Ausgabeschema verwendet.
- Jedes JSON-Objekt stellt eine AQL-Ansicht (Annotation Query Language) dar.
- Die Name/Wert-Paare in den JSON-Objekten stellen die Namen und Werte der Attribute in der Ansicht dar.
- Die Tupel in einer AQL-Ansicht werden als Array von JSON-Objekten dargestellt, wobei für jedes Tupel in der Ansicht ein Objekt vorhanden ist.
In der folgenden Tabelle wird beschrieben, wie AQL-Datentypen in der JSON-Syntax dargestellt werden.
| AQL-Datentyp | JSON-Syntax | JSON-Beispiel |
|---|---|---|
| Integer | Anzahl | 5 |
| Float | Anzahl | 4.13 |
| Boolesch | boolesch | true |
| Text | Zeichenfolge | "some string" |
| Bereich | Objekt mit dem Format {"text": String, "location": {"begin": Integer, "end": Integer}} |
{ "text": "Jane", location": {"begin": 5, "end": 9} } |
| Sonderfall: Nullwert | null | null |
| Liste der ganzen Zahlen | Array von Zahlenwerten | [ 1, 2, 3, 4, 5] |
| Liste der Gleitkommazahl | Array von Zahlenwerten | [ 4.13, 4.5 ] |
| Liste der booleschen Werte | Array mit booleschen Werten | [ true, true, false] |
| Textliste | Array von Zeichenfolgewerten | [ "some string", "another string" ] |
| Liste der Spanne | Array von Objekten mit dem Format {"text":String, "location": {"begin": Integer, "end": Integer}} |
[{ "text":"Jane", "location": {"begin": 5, "end": 9} }, { "text":"...", "location": {"begin": 15, "end": 40} }] |
| Sonderfall: leere Liste | Array mit 0 Elementen | [ ] |
Modellgrenzwerte für erweiterte Regeln
Die Anzahl der erweiterten Regelmodelle, die Sie pro Serviceinstanz definieren können, hängt vom Plantyp Discovery ab.
| Planen | Erweiterte Regelmodelle pro Serviceinstanz |
|---|---|
| Cloud Pak for Data | Uneingeschränkt |
| Premium | 3 |
| Enterprise | 3 |
| Plus (einschließlich Testversion) | 1 |