Ergebnisrelevanz mit Training verbessern

Die Relevanz der Ergebnisse von Abfragen in natürlicher Sprache kann in IBM Watson® Discovery mit einem Training verbessert werden.

Ein Relevanzmodell bestimmt die relevantesten Dokumente, die in den Suchergebnissen zurückgegeben werden. Ohne Relevanztraining wird ein Standardmechanismus verwendet, um die Relevanz basierend auf allgemeinen Faktoren zu bestimmen. Wenn Sie ein Relevanzmodell trainieren, unterstützen Sie Discovery bei der Verwendung von Features, die für Ihre Dokumente eindeutig sind, da sie die Relevanz bestimmen.

Das einem Projekt zugeordnete Relevanztrainingsmodell wird zur Ausführungszeit nur verwendet, wenn Abfragen in natürlicher Sprache übergeben werden. Das Modell wird nicht auf DQL-Abfragen (Discovery Query Language) angewendet.

Sie können kein Relevanztraining auf Content Mining-Projekttypen anwenden.

Zum Trainieren eines Relevanzmodells stellen Sie Beispielabfragen in natürlicher Sprache bereit, übergeben sie, um Ergebnisse aus Ihren Dokumenten abzurufen, und bewerten diese Ergebnisse anschließend. Wenn Sie weitere Beispiele hinzufügen, werden die Informationen, die Sie zur Ergebnisrelevanz für jede Abfrage angeben, verwendet, um mehr über Ihr Projekt zu erfahren. Das System verwendet Ihre Bewertungen, um verschiedenen Typen von Strukturinformationen in den Dokumenten einen Stellenwert zuzuweisen. Sie lernt beispielsweise, wie wichtig es ist, wenn ein Schlüsselwort aus der Suchabfrage im Titel oder im Header, im Hauptteil oder in den Metadaten des Dokuments erscheint. Es lernt auch von der Bedeutung des Abstands zwischen einem übereinstimmenden Schlüsselwort und einem anderen. Nach einer erfolgreichen Relevanztrainingssitzung wird ein Rankermodell erstellt. Das Modell wird von Discovery automatisch mit der nächsten Abfrage in natürlicher Sprache verwendet. Die Erkennung ordnet die Dokumentergebnisse neu an, sodass die relevantesten Ergebnisse entsprechend dem Relevanztrainingsmodell zuerst angezeigt werden.

Die Schulung gilt für ein ganzes Projekt. Sie kann nicht für eine Sammlung übersprungen und auf andere Sammlungen im selben Projekt angewandt werden. Sie aktivieren die Verwendung des Trainingsmodells nicht durch Angabe eines Abfrageparameters. Falls vorhanden, wird das Modell für jede Abfrage in natürlicher Sprache verwendet, die für das Projekt übergeben wird. Das Modell wird unabhängig davon verwendet, ob Sie die Suche auf eine oder alle Objektgruppen beschränken. Aus diesem Grund ist es wichtig, dass Ihre Trainingsdaten Abfragen darstellen, die wahrscheinlich von allen Sammlungen in Ihrem Projekt beantwortet werden. Um die Verwendung des Relevanztrainingsmodells für ein Projekt zu stoppen, können Sie das Modell mithilfe der API löschen.

Das Relevanztraining wird nicht kontinuierlich ausgeführt. Das Training erfolgt nur, wenn Sie es einleiten. Pro Projekt wird maximal ein trainiertes Relevanzmodell verwendet. Wenn Sie ein Modell erneut trainieren, wird das vorhandene Modell verwendet, bis das neue Modell erfolgreich trainiert wurde. Dann ersetzt das neue Modell das alte Modell.

Die Dokumente, aus denen die Trainingsdaten bestehen, werden nur während des Trainingsprozesses verwendet. Wenn eine nachfolgende Änderung an einem Dokument vorgenommen wird, das zum Trainieren des Modells verwendet wurde, ändert es das trainierte Modell nicht und löst keine neue Trainingssitzung aus. Denken Sie daran: Wenn sich viele Dokumente in Ihrem Projekt ändern, kann es an der Zeit sein, das Modell erneut zu trainieren, um die Funktionen aus den aktualisierten Dokumenten zu nutzen.

Stoppwörter und Abfrageerweiterungen, die Sie einer Sammlung hinzufügen, wirken sich nicht direkt auf das Relevanztrainingsmodell aus. Sie können jedoch ändern, welche Dokumente von einer Suche zurückgegeben werden, was sich auf die Dokumente auswirkt, die nach dem Relevanzmodell eingestuft werden. Das Modell ordnet die obersten 100 Dokumente an, die für eine Abfrage zurückgegeben werden. Änderungen, die Sie an Stoppwörtern oder Abfrageerweiterungen vornehmen, lösen keine Aktualisierung des Relevanztrainings aus. Wenn Sie Artefakte hinzufügen, die die von der Suche zurückgegebenen Dokumente erheblich ändern, sollten Sie das Modell erneut trainieren.

Wenn Dokumente, die zuvor zum Trainieren des Modells verwendet wurden, aus einer Sammlung entfernt werden, müssen Sie alle Verweise auf sie aus den Trainingsdaten entfernen, bevor Sie mit dem erneuten Training des Modells beginnen. Das Modell erwartet, dass die Dokumente und Abfragen von Trainingsdatenpaaren weiterhin vorhanden sind. Um diese Referenzen zu entfernen, löschen Sie die Trainingsabfragen, die die gelöschten Dokumente zurückgegeben haben. Wenn die Abfragen weiterhin relevant sind, können Sie sie den Trainingsdaten wieder hinzufügen und mit anderen Dokumenten koppeln.

Weitere Informationen zur API für Relevanztraining finden Sie in der API-Referenzdokumentation.

Verwendung des Relevanztrainings

Das Relevanztraining ist optional. Testen Sie die Qualität Ihrer Suchergebnisse. Wenn die Ergebnisse Ihrer Abfragen Ihren Anforderungen entsprechen, ist keine weitere Schulung erforderlich.

Das Training verbessert die Relevanz der Dokumente, die in Abfrageantworten zurückgegeben werden. Es verbessert nicht die Passagen oder Antworten, die pro Dokument zurückgegeben werden. Wenn Sie den Passagenabruf verwenden und Ihre Testergebnisse gute Dokumente zurückgeben, aber die falschen Passagen aus den Dokumenten, hilft das Relevanztraining nicht.

Weitere Informationen zur Verwendung des Relevanztrainings finden Sie im Blogbeitrag Relevanztraining für zeitkritische Benutzer unter "Mittel".

Handhabung von Feldern

Wenn Sie ein Projekt über die Produktbenutzerschnittstelle trainieren, werden die Ergebnisse immer dem Feld text der Dokumente entnommen. Wenn Ihre Dokumente kein Feld text enthalten, verwenden Sie stattdessen die API, um Ihr Projekt zu trainieren. Ihre Dokumente verfügen möglicherweise nicht über das Feld text, wenn Sie eine CSV-Datei hochgeladen haben, die keine Spalte mit dem Namen textenthält, oder wenn Sie eine JSON-Datei hochgeladen haben, die kein Objekt mit dem Namen texthat, oder wenn Sie das Tool Smart Document Understanding verwendet haben, um Felder mit anderen Namen zu definieren, in denen der Großteil des Inhalts Ihrer Dokumente jetzt gespeichert ist.

Wenn Sie ein Projekt über die API trainieren, werden die Ergebnisse aus allen Feldern auf Stammebene entnommen und als gleich bedeutsam betrachtet. Im Gegensatz zu Abfragen der Discovery-Abfragesprache können Sie bei Abfragen in natürlicher Sprache nicht angeben, welche Felder aus dem Dokument für Sie von Bedeutung sind oder wie hoch die Bedeutung der einzelnen Felder ist. Wenn Sie Discovery mit Beispielen beibringen, ermittelt der Service für Sie, wie hoch die Gewichtung für jedes Feld ist.

Die Erkennung erstellt ein Modell, das Term-, Bigram-und Skip-Gram-Übereinstimmungen für jedes der Felder auf Stammebene unterschiedliche Gewichtungen zuordnet und sie mit Übereinstimmungen aus allen anderen Dokumentfeldern ausgleicht. Bei genügend Beispielen kann die Erkennung bessere Antworten zurückgeben, da sie weiß, wo die besten Antworten normalerweise gespeichert werden.

Relevanztraining kann nicht verwendet werden, um verschachtelten Feldern mehr Gewicht zu geben. Verschachtelte Felder werden gruppiert und einer Gesamtbewertung zugeordnet. Unabhängig davon, wie viel Sie trainieren, gibt Discovery einem verschachtelten Feld nie mehr Gewicht als einem Feld auf Stammebene. Weitere Informationen zu verschachtelten Feldern finden Sie unter FAQ.

Projekt trainieren

Die Trainingsdaten, die zum Trainieren des Relevanzmodells verwendet werden, umfassen die folgenden Teile:

  • Eine Abfrage in natürlicher Sprache, die für eine Abfrage repräsentativ ist, die Ihre Benutzer möglicherweise übergeben
  • Ergebnisse der Abfrage, die vom Service zurückgegeben werden
  • Die Bewertung, die Sie auf das Ergebnis anwenden, das angibt, ob das Ergebnis relevant oder not relevant ist.

Führen Sie die folgenden Schritte aus, um Relevanztraining auf ein Projekt anzuwenden:

  1. Rufen Sie die Seite Verbessern und anpassen auf. Wählen Sie in der Anzeige Verbesserungstools zunächst Relevanz verbessern und dann Relevanztraining aus.

  2. Geben Sie eine Abfrage in natürlicher Sprache in das Feld "Frage zum Trainieren eingeben " ein.

    Schließen Sie in die Abfrage kein Fragezeichen ein. Verwenden Sie dieselbe Formulierung wie für Ihre Benutzer. Beispiel: IBM Watson in healthcare. Schreiben Sie Abfragen, die einige der in der Zielantwort genannten Begriffe enthalten. Die Überschneidung der Begriffe verbessert die ersten Ergebnisse bei der Auswertung der Abfrage in natürlicher Sprache.

  3. Klicken Sie auf Hinzufügen+.

  4. Klicken Sie auf Ergebnisse bewerten.

  5. Nachdem die Ergebnisse angezeigt werden, bewerten Sie jedes Ergebnis und wählen dann Relevant oder Nicht relevant aus, je nachdem, welche Option für die Qualität des Ergebnisses gilt.

    Wenn Sie in der Benutzerschnittstelle von Discovery ein Dokument als Relevant markieren, wendet der Service die Relevanzbewertung 10 auf das Ergebnis und die Bewertung 0 an, wenn Sie es als Nicht relevant markieren. Die einzigen zwei Scorewerte, die Sie zuweisen können, wenn Sie das Relevanztraining über die Benutzerschnittstelle von Discovery anwenden, sind 0 und 10.

    In der API Discovery können Sie Relevanzbewertungswerte zwischen 0 und jeder Ganzzahl zwischen bis 100 zuweisen. In demselben Projekt können Sie keine Trainingsbeispiele, die in der Benutzerschnittstelle Discovery erstellt wurden (Scores von 0 und 10), mit Beispielen kombinieren, die andere Konfidenzbewertungsstufen als 0 und 10 verwenden. Wenn Sie eine angepasste Scoreskala über die API verwenden, müssen Sie mit dem gesamten Training über die API fortfahren. Sie können die Trainingsbeispiele, die über die API in der Benutzerschnittstelle von Discovery angewendet werden, nur bearbeiten, wenn sie nur die beiden Scores 0 und 10 verwenden.

    Wenn im Ergebnis die Nachricht "Keine Inhaltsvorschau für dieses Dokument verfügbar" angezeigt wird, bedeutet dies, dass das zurückgegebene Dokument kein Feld text enthält oder dass das zugehörige Feld text leer ist. Wenn keines der Dokumente in Ihrer Sammlung über ein Feld text verfügt, verwenden Sie die API, um das Projekt zu trainieren, anstatt es über die Produktbenutzerschnittstelle zu trainieren.

  6. Wenn Sie fertig sind, klicken Sie auf "Zurück zu Anfragen ".

  7. Fügen Sie laufend Abfragen hinzu und setzen Sie die Einstufung der Ergebnisse fort.

    Wenn Sie Ergebnisse bewerten, wird Ihr Fortschritt angezeigt. Überprüfen Sie Ihren Fortschritt, um festzustellen, ob genügend Bewertungsinformationen verfügbar sind, um die Anforderungen des Trainingsschwellenwerts zu erfüllen. Ihr Fortschritt wird in die folgenden Tasks unterteilt:

    • Weitere Abfragen hinzufügen
    • Weitere Ergebnisse einstufen
    • Mehr Vielfalt zu Einstufungen hinzufügen

    Abhängig von der Komplexität Ihrer Daten müssen Sie mindestens 50 eindeutige Abfragen auswerten. Es können maximal 10.000 Trainingsabfragen hinzugefügt werden.

  8. Sie können auch nach Erreichen des Grenzwerts weiterhin Anfragen hinzufügen und Ergebnisse bewerten. Geben Sie alle Abfragen ein, die Ihre Benutzer Ihrer Meinung nach fragen werden.

    Klicken Sie zum Löschen einer Trainingsabfrage auf das Symbol Löschen. Verwenden Sie die API, um alle Trainingsabfragen in Ihrer Sammlung gleichzeitig zu löschen. Weitere Informationen finden Sie unter "Schulungsanfragen löschen ".

Wenn zwei oder mehr Benutzer versuchen, identische Abfragen gleichzeitig zu trainieren, überschreiben die Bewertungen, die von einem der Benutzer übergeben werden, die anderen.

Relevanz der Ergebnisse testen und iterieren

Wenn Sie mit der Bewertung der Ergebnisse fertig sind und das Training abgeschlossen ist, testen Sie, ob Ihre Abfrageergebnisse besser sind. Führen Sie dazu Testabfragen in natürlicher Sprache durch, die mit Ihren Trainingsabfragen verwandt (aber nicht identisch) sind. Prüfen Sie die Ergebnisse.

Wenn Sie die Ergebnisse nach dem Test weiter verbessern möchten, haben Sie folgende Möglichkeiten:

  • Fügen Sie weitere Dokumente zu Ihrer Sammlung hinzu.
  • Fügen Sie weitere Trainingsabfragen hinzu.
  • Stufen Sie weitere Ergebnisse ein; achten Sie hierbei darauf, die beiden Einstellungen Relevant und Not relevant zu verwenden.

Konfidenzbewertungen

Von Discovery wird eine Konfidenzbewertung (confidence) für die Abfragen der trainierten Sammlungen in natürlicher Sprache zurückgegeben. Diese confidence-Bewertung ist nicht mit confidence-Bewertungen austauschbar, die von ungeschulten Sammlern zurückgegeben werden.

Die Werte für confidence bewegen sich zwischen 0.0 und 1.0. Je höher die Zahl, desto relevanter ist das Ergebnis.

Die confidence-Bewertung ist in den Abfrageergebnissen unter result_metadata für jedes Dokument zu finden. Diese Zahl wird danach berechnet, wie relevant das Ergebnis im Vergleich zum trainierten Modell eingeschätzt wird.

{
  "matching_results": 4,
  "retrieval_details": {
    "document_retrieval_strategy": "trained"
  },
  "results": [
    {
	  "id": "eea16dfd5fe6139a25324e7481a32f89_13",
	  "result_metadata": {
	    "confidence": 0.08793
	  }
    }
  ]
}

Den Wert für document_retrieval_strategy finden Sie in retrieval_details. Wenn Sie eine trainierte Sammlung mithilfe der Abfragesprache Discovery abfragen oder das trainierte Modell vorübergehend deaktiviert ist, lautet die E-Mail-Adresse document_retrieval_strategy untrained.

Weitere Informationen zum Abfragen eines Projekts finden Sie in der Abfrageübersicht.

Grenzwerte für Relevanztraining

Für Relevanztrainingsmodelle gelten folgende Einschränkungen:

  • Ein Modell pro Projekt
  • 10.000 Abfragen pro Modell
  • 40 Modelle pro Serviceinstanz für Enterprise-und Premium-Pläne; 20 Modelle für Plus-Planinstanzen

Optimale Trainingssitzungen ausführen

Im folgenden Beispiel wird beschrieben, wie Sitzungen für Relevanztraining in Projekten optimal ausgeführt werden.

Angenommen, Sie haben 100 Trainingsabfragen zu einem neuen Projekt hinzugefügt und Discovery führt 100 Abfragen in einer Trainingssitzung aus, um ein Rankermodell zu erstellen. Wenn Sie später weitere 20 Abfragen hinzufügen, beginnt das Modell mit dem erneuten Training und Discovery führt insgesamt 120 Abfragen aus. Wenn Sie jedoch zum Hinzufügen der letzten 20 Abfragen zuerst 10 Abfragen hinzufügen, eine Stunde warten und dann die nächsten 10 Abfragen hinzufügen, wird das Modell von Discovery zweimal trainiert. In diesem Fall führt die erste Trainingssitzung 110 Abfragen und die zweite Trainingssitzung 120 Abfragen aus. Diese Art des Hinzufügens von Abfragen, die zwischen Zeitspannen liegen, führt zu einer erhöhten Anzahl von Trainingssitzungen und der Gesamtzahl von Abfragen, die von Discoveryausgeführt werden.

Um die Anzahl der Trainingssitzungen zu minimieren, können Sie stattdessen die API zum Aktualisieren einer Trainingsabfrage verwenden. Die API-Methode aktualisiert die Trainingsdaten für mehrere Sammlungen in einem Projekt gleichzeitig. Weitere Informationen finden Sie unter Trainingsabfrage aktualisieren in der API-Referenz.

Zur Reduzierung der Systembelastung für Discoverysollten Sie ein Rankermodell durch Relevanztraining erstellen oder aktualisieren, nachdem alle Sammlungen in einem Projekt die Verarbeitung von Dokumenten abgeschlossen haben. Außerdem sollten Sie während des Trainierungsprozesses für das Rankermodell über eine geringe Anzahl von Abfrageaktivitäten verfügen, damit der Grenzwert für gleichzeitige Anforderungen nicht überschritten wird.

Weitere Möglichkeiten zur Verbesserung der Relevanz

Wenn Sie es vorziehen, die API Discovery zu verwenden, um Discoveryzu trainieren, lesen Sie die API-Referenz.

Sie können die API auch verwenden, um Kurationen hinzuzufügen. Curations ist ein Beta-Feature, das Sie verwenden können, um Discovery beizubringen, ein bestimmtes Dokument jedes Mal zurückzugeben, wenn eine bestimmte Abfrage übergeben wird. Weitere Informationen finden Sie unter Curations.

Durch das Hinzufügen einer angepassten Stoppwortliste kann auch die Relevanz der Ergebnisse für Abfragen in natürlicher Sprache verbessert werden. Weitere Informationen finden Sie unter Zu ignorierende Wörter angeben.

Relevanztraining verstehen

Antworten auf häufig gestellte Fragen zur Schulung eines Projekts.

Wie kann ich herausfinden, ob mein System trainiert ist?

Führen Sie eine Abfrage in natürlicher Sprache aus und überprüfen Sie den Wert für document_retrieval_strategy. Informationen hierzu finden Sie in Konfidenzbewertungen.

Wenn Sie die API verwenden, finden Sie weitere Informationen unter Trainingsabfragen auflisten.

Wie lange dauert es, ein Modell zu trainieren?

Es kann zwischen 45 Minuten und einer Stunde dauern, bis das Training beendet ist. Die Dauer des Trainings variiert je nach Menge und Vielfalt der Daten, die zum Trainieren des Relevanzmodells verwendet werden. Außerdem erfolgt das Training asynchron. Sie kann verzögert werden, falls andere Daten, die sie benötigt, nicht verfügbar sind, da sie auf andere Weise durchsucht oder verarbeitet werden.

Wie kann ich verhindern, dass Relevanztraining auf mein Projekt angewendet wird?

Verwenden Sie die API, um das Relevanzmodell zu löschen, das Ihrem Projekt zugeordnet ist. Zum Löschen des Modells löschen Sie die Trainingsdaten, die dem Rankermodell zugeordnet sind. Weitere Informationen finden Sie unter Trainingsabfragen löschen.

Wirkt sich Relevanztraining auf die Passagensuche aus?

Anzahl Relevanztraining wird nur für die Dokumentsuche verwendet. Sie hat keine Auswirkung auf die Passagensuche.

Wirkt sich das Relevanztraining auf die Antworterfindung aus?

Nicht direkt. Das Relevanztraining wirkt sich indirekt auf die Antwortsuche aus, weil es die Reihenfolge der Dokumente ändert, aus denen Antworten abgerufen werden. Die zurückgegebenen Dokumente werden von den relevantesten zu den am wenigsten relevanten Dokumenten umgeleitet.

Wie prüfe ich, ob Fehler und Warnungen vorliegen?

Öffnen Sie die Seite Sammlungen verwalten. Wählen Sie Ihre Sammlung aus und öffnen Sie dann die Registerkarte Aktivität.

Wie interpretiere ich den Konfidenzwert, der nach dem Training in den Abfrageergebnissen in natürlicher Sprache angezeigt wird?

Informationen hierzu finden Sie in Konfidenzbewertungen.

Relevanztrainingsfehler und -warnungen interpretieren

Die folgende Liste enthält Erläuterungen zu einigen allgemeinen Fehlernachrichten und Warnungen.

Die Meldung, dass Watson bald mit dem Lernen beginnen wird, wird beim Erstellen eines Ranker-Modells lange Zeit angezeigt

Dieses Problem kann auftreten, wenn die Gesamtzahl der vorhandenen Rangermodelle die Grenze von 40 Modellen erreicht hat. In diesem Fall wird kein neues Modell erstellt und die Meldung Watson beginnt bald mit dem Lernen wird lange Zeit auf der Benutzeroberfläche angezeigt.

Um dieses Problem zu beheben, können Sie entweder alte Ranker-Modelle aus ungenutzten Projekten löschen oder sich an den IBM wenden, um ein Upgrade auf eine Premium-Instanz durchzuführen.

Warnung:Invalid training data found: The document was not returned in the top 100 search results for the given query, and will not be used for training

Diese Warnung tritt auf, wenn die document_ids in Ihren Trainingsdaten nicht mit der document_ids in einer Suche übereinstimmen, die für die Objektgruppe ausgeführt wird. Überprüfen Sie Ihre Suchanfragen, um sicherzustellen, dass die document_id des Dokuments, das Sie bewerten, in den Top 100 der Ergebnisse für diese Suchanfrage angezeigt wird. Wenn dies nicht der Fall ist, ist es sinnvoll, die beiden folgenden Punkte zu überprüfen:

  • Wenn das Dokument nicht in den obersten 100 zurückgegeben wird, ist es möglicherweise kein Beispiel für ein hochwertiges Ergebnis. Bewerten Sie erneut, ob das Dokument verwendet werden soll.
  • Wenn das Dokument überhaupt nicht zurückgegeben wird, überprüfen Sie, warum es nicht zurückgegeben wird, und prüfen Sie, ob Text im Dokument mit Teilen der Abfrage übereinstimmt.

Diese Warnung gibt an, dass möglicherweise eine oder mehrere fehlgeschlagene Abfragen vorhanden sind. Es bedeutet nicht, dass das Training nicht abgeschlossen werden kann.

Fehler: Invalid training data found: Syntax error when parsing query

Ein Syntaxfehler bedeutet, dass die Abfrage ungültig ist. Syntaxfehler können auftreten, wenn Sie die Komplexität der Abfrage erhöhen, indem Sie beispielsweise einen Filter zur Abfrage in natürlicher Sprache hinzufügen. Führen Sie die Abfrage für die Sammlung außerhalb des Relevanztrainings aus, indem Sie die API verwenden. Nachdem Sie bestätigt haben, dass die Abfrage gültig ist und Ergebnisse zurückgibt, können Sie sie als Relevanztrainingsabfrage hinzufügen.

Fehler: Training data quality standards not met: You will need additional training queries with labeled examples. (To be considered for training, each example must appear in the top 100 search results for its query.)

Sie müssen weitere Trainingsdaten hinzufügen, um erfolgreich zu trainieren. Sie benötigen mindestens 49 eindeutige Trainingsabfragen und für jede Abfrage muss es mindestens ein eingestuftes Dokument geben. Minimal bedeutet nicht optimal; die Größe der Sammlung und andere Faktoren können die Anzahl der Trainingsbeispiele erhöhen, die erforderlich sind, um das Minimum zu erreichen.

Fehler: Training data quality standards not met: Insufficient number of unique training queries. Expected at least n, but found m.

Um die Mindestanforderungen für die Schulung zu erfüllen, benötigen Sie mindestens 50 eindeutige Schulungsanfragen, und jede Anfrage muss mindestens ein bewertetes Dokument enthalten. Wenn Sie mehr Fragen als das Minimum haben und diese Fehlermeldung weiterhin angezeigt wird, überprüfen Sie Ihre Benachrichtigungen auf andere Fehler.

Fehler: Training data quality standards not met: No documents found with non-zero relevance labels.

Die Trainingsdaten benötigen ausreichend gekennzeichnete Daten, die angeben, welche Dokumente einen hohen Wert besitzen. Daher müssen Sie einige Dokumente mit Werten ungleich Null bewerten. Sie müssen einige Dokumente als Relevant und einige als Not relevant einstufen. Es muss mindestens ein Dokument als Relevant eingestuft werden.

Fehler: Training data quality standards not met: Training examples have no relevance label variety for X queries.

Eine der Voraussetzungen für das Training ist eine ausreichende Diversität der Kennzeichnungen. Mindestens 25% der Trainingsabfragen müssen die Beschriftungen Relevant und Not relevant enthalten. Wenn Sie die API verwenden, müssen mindestens 25% der Abfragen zwei verschiedene numerische Bezeichnungen enthalten.