Migration auf Discovery v2

Die Neugestaltung des Produkts Discovery v2wurde im November 2019 eingeführt. Discovery v2 bietet erhebliche Vorteile gegenüber Discovery v1.

Hier erfahren Sie, wie Sie eine v1 Discovery-Serviceinstanz auf Discovery v2migrieren, einschließlich der Vorgehensweise zum Verschieben von Daten und Aktualisieren Ihrer Anwendungen.

Die wichtigsten strukturellen Unterschiede zwischen Discovery v1 und v2 sind:

  • Es gibt kein Konzept einer Umgebung in v2. Die Implementierungsdetails wie Größe und Indexkapazität werden für Sie verwaltet, wenn Sie den entsprechenden Serviceplan für Ihre Anforderungen auswählen. Für verwaltete Implementierungen können Sie beispielsweise einen Plus-, Enterprise-oder Premium-Plan auswählen. Bei installierten Implementierungen wird die Dimensionierung nach dem Bereitstellungstyp verwaltet, den Sie bei der Installation des Service in Cloud Pak for Dataangeben.

  • Es gibt kein einzelnes Konfigurationsobjekt in v2. Die Steuerung der Aufbereitungen, die auf Dokumente angewendet werden, wird in den Sammlungen und Projektobjekten in v2verwaltet. Andere v1-Konfigurationsfunktionen, wie z. B. die Möglichkeit, den Konvertierungsschritt der Aufnahme anzupassen, sind in v2nicht verfügbar.

  • Für angepasste Aufbereitungen ist in v2eine größere programmgesteuerte Unterstützung verfügbar. Es sind neue Aufbereitungs-API-Methoden verfügbar, die Sie zum Erstellen von Aufbereitungen verwenden können. In v2 werden auch API-Methoden für Dokumentklassifikationsmerkmale eingeführt, mit denen Sie Dokumentklassifikationsmerkmalmodelle programmgesteuert trainieren können. Sie können diese angepassten Aufbereitungen auf eine Sammlung anwenden, indem Sie die API verwenden.

  • Die Funktionalität einer Abfragesuche in natürlicher Sprache wird in v2 erweitert, um die Rückgabe der obersten Passagen pro Dokument und der komprimierten Antworten von Passagen zu ermöglichen. Es wurden weitere erweiterte Suchfunktionen eingeführt, z. B. das Abrufen von Tabellen. In v2ist der Deduplizierungsparameter nicht verfügbar und die Funktionen für kontinuierliches Relevanztraining und Abfrageprotokollierung sind nicht verfügbar.

  • Weitere Informationen zu Featureunterschieden finden Sie in der Featurevergleichstabelle.

  • Weitere Informationen zu detaillierten API-Unterschieden finden Sie unter Vergleich der API-Version.

Discovery v2 ist für alle Benutzer von Plus-oder Enterprise-Plan-Instanzen oder Premium-Plan-Instanzen verfügbar, die nach dem 15. Juli 2020 erstellt wurden. v2 ist auch für Benutzer von IBM Watson® Discovery Cartridge für IBM Cloud Pak® for Data verfügbar.

Übersicht zur Migration

Die Migration von Discovery v1 auf v2 ist ein mehrstufiger Prozess, den Sie unabhängig voneinander ausführen können.

Die beiden Versionen des Discovery-Service weisen viele Unterschiede auf, aber Sie können Verfahren und Dienstprogramme übernehmen, die auf eine v1-Instanz zur Verwendung mit Ihrer neuen v2-Instanz angewendet wurden.

Für die Migration von v1 auf v2müssen Sie die folgenden übergeordneten Schritte ausführen:

  1. Planen Sie die Migration.
  2. Übertragen Sie Ihre Dokumente.
  3. Aktualisieren Sie Ihre Anwendung für die Verwendung der API v2.
  4. Regressionstest und Implementierung der aktualisierten Anwendung.
  5. Löschen Sie Ihre v1-Planserviceinstanz.

Für einige Schritte müssen Sie programmgesteuerte Änderungen über die API vornehmen. Für andere Schritte sind Änderungen erforderlich, die Sie über die Produktbenutzerschnittstelle vornehmen können.

Migration planen

Machen Sie sich mit den Neuerungen in v2 vertraut und machen Sie sich mit den Abweichungen von v1 vertraut, bevor Sie eine v2-Instanz bereitstellen. Ihre erste Testinstanz des v2 Plus-Plans ist 30 Tage kostenlos verfügbar. Informieren Sie sich und planen Sie die Migration, bevor Sie die Instanz bereitstellen, damit Sie Ihre Testversion optimal nutzen können.

Wenn Sie bereit sind, die Migration zu starten, erstellen Sie einen Migrationszeitplan, dem Sie und Ihr Team folgen können, wenn Sie den Prozess abschließen. Stellen Sie sicher, dass Sie die neue v2-Serviceinstanz einrichten und Projekte und Sammlungen in der neuen Serviceinstanz neu erstellen lassen, bevor Sie zur Verwendung des v2-Service wechseln und Ihre v1-Instanz löschen.

Informieren Sie sich über die Discovery v2-Planoptionen, damit Sie den richtigen Plan für Ihre langfristigen Anforderungen auswählen können. Der Plus-Plan, den Sie für den Einstieg verwenden, ist möglicherweise ausreichend. Sie können jedoch auch einen Enterprise-oder Premium-Plan verwenden. Über einen Plus-Plan können Sie ein Inplace-Upgrade auf einen Enterprise-Plan durchführen, jedoch nicht auf einen Premium-Plan.

Planen Sie, wie Ihre Anwendung angepasst werden soll.

Eine der Hauptänderungen zwischen Versionen ist, dass Discovery v2 Projekte einführt. Ein Projekt besteht aus einer oder mehreren Sammlungen. Der Vorteil bei der Verwendung von Projekten besteht darin, dass eine Abfrage für viele Sammlungen gleichzeitig ausgeführt werden kann. Jede Sammlung kann Dokumente enthalten, die Sie hochladen oder die Sie aus einer einzelnen Datenquelle abrufen, z. B. einer Website, Microsoft SharePoint, und anderen.

Beachten Sie Folgendes, wenn Sie Ihre Anwendung für die Verwendung von Projekten anpassen:

  • Obwohl das Konzept einer Umgebung in v2nicht existiert, werden die Daten trotzdem in Sammlungen organisiert. In v2werden Sammlungen in Projekten gruppiert. In den meisten Fällen möchten Sie eine einzelne v1-Sammlung auf eine einzelne v2-Sammlung migrieren.

    Wenn Sie Relevanztrainingsinformationen, die auf eine v1-Sammlung angewendet werden, beibehalten möchten, fügen Sie die Sammlungsdokumente einer einzelnen Sammlung in Ihrem v2-Projekt hinzu.

  • Entscheiden Sie, wie viele Sammlungen Sie jedem v2-Projekt hinzufügen möchten. Alle Projekttypen mit Ausnahme von Content-Mining-Projekten können bis zu 5 Sammlungen enthalten. Wählen Sie den richtigen Projekttyp für Ihre Daten aus

    Zur Optimierung der Suchergebnisse werden verschiedene Aufbereitungen und Konfigurationsoptionen automatisch auf Objektgruppen angewendet, die verschiedenen Projekttypen hinzugefügt werden. Weitere Informationen finden Sie unter den folgenden Themen:

  • Die API Discovery v2 wurde geändert, um neben anderen Erweiterungen Projekte und Sammlungen zu berücksichtigen. Einige API-Aufrufe wurden geändert, um Aktionen auf Projektebene anstelle der Erfassungsebene zu unterstützen, z. B. das Übergeben einer Abfrage und das Ausführen eines Relevanztrainings. Viele andere API-Methoden wurden geändert und einige sind in v2nicht verfügbar. Einen detaillierten Vergleich der API-Methoden v1 und v2 finden Sie unter Vergleich der API-Version.

Serviceplan auswählen

Wählen Sie zwischen den verwalteten Plänen Plus, Enterpriseund Premium aus oder entscheiden Sie sich für eine lokale Installation, indem Sie die Discovery Cartridge für IBM Cloud Pak for Dataerwerben. Prüfen Sie die Vorteile und Grenzwerte jedes Plantyps, bevor Sie einen auswählen.

Die folgende Tabelle zeigt Plantypen für verwaltete Implementierungen, die in v1 und v2im Allgemeinen ähnlich sind.

Ähnliche Pläne
Aktueller v1-Plan Beispiel für v1-Datennutzung Ähnlicher v2-Plan
Lite Nicht zutreffend Plus-Test (nur 30 Tage kostenlos)
Erweitert (geringe Nutzung) 10.000 Dokumente, 10.000 Abfragen pro Monat Und
Erweitert (hohe Nutzung) 100.000 Dokumente, 100.000 Abfragen pro Monat Enterprise
Premium Nicht zutreffend Unternehmen oder Premium

Klicken Sie auf das Symbol Umgebungsdetails im Header der Benutzerschnittstelle des Produkts, um Informationen zum aktuell verwendeten Speicher, zu Dokumenten und zu Objektgruppen abzurufen.

Sie können kein Inplace-Upgrade von einem v1-Plan, wie z. B. Lite oder Advanced, auf einen v2-Plan durchführen. Sie müssen einen neuen v2-Plan erstellen und dann Ihre Daten in die neue Serviceinstanz verschieben. Während Sie Ihre Daten von v1 auf v2migrieren, haben Sie wahrscheinlich sowohl eine Instanz von v1 als auch eine Instanz von v2 gleichzeitig implementiert. Ziehen Sie die Verwendung der kostenlosen 30-Tage-Testversion in Betracht, die während dieser Zeit mit Ihrer ersten Plus-Planinstanz verfügbar ist.

Metriken erfassen

Noieren Sie die folgenden Informationen, damit Sie sie nach der Migration mit Ihren Serviceinstanzdaten vergleichen können:

  • Anzahl der Erfassungen

    Verwenden Sie die API List collections, um die Anzahl der Sammlungen in einer Instanz in v1abzurufen.

  • Anzahl der Dokumente pro Sammlung

    Verwenden Sie die API Get collection details, um die Anzahl der Dokumente in einer Sammlung in v1abzurufen.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}`
    

    Die API gibt Informationen zum Status der Dokumente in der Sammlung zurück, einschließlich der Gesamtzahl der verfügbaren Dokumente.

    "document_counts": {
        "available": 34,
        "{other}":"{values...}"
    }
    

Dokumente aus v1 in v2 übertragen

Wie Sie Ihre Dokumente übertragen, hängt von dem Verfahren ab, das zum Einpflegen der Dokumente in v1verwendet wurde.

Erstellen Sie jeweils eine Sammlung erneut. Wenn Sie mehrere Einpflegeprozesse gleichzeitig starten, können Sie die Systemressourcen steuern und die Gesamtzeit erhöhen, die für die Ausführung der Verarbeitung erforderlich ist. Sie möchten auch auf alle Informationsnachrichten achten, die vom Einpflegeprozess generiert werden. It is easier to troubleshoot an ingestion issue, for example, when you ingest one collection at a time.

Hochgeladene Daten

Wenn Sie die API zum Hochladen von Dokumenten in Discovery v1verwendet haben, ist in v2 eine ähnliche API zum Hochladen von Dokumenten in Sammlungen verfügbar. Sie müssen alle Workflows aktualisieren, die Sie zur Automatisierung des Prozesses verwenden, um die neue Anordnung von Projekten und Sammlungen zu berücksichtigen.

Wenn die Originaldokumente, die Sie in Discovery v1 aufgenommen haben, nicht mehr verfügbar sind, können Sie die Abfrage-API verwenden, um den Dokumenttext aus Discovery v1zu extrahieren. Anschließend können Sie den Text zu einer Sammlung in Discovery v2hinzufügen. Weitere Informationen finden Sie unter Dokumente wiederherstellen.

Durchsuchte Daten

Wenn Sie Daten aus einer externen Datenquelle in v1durchsucht haben, können Sie weiterhin Daten aus derselben externen Datenquelle in v2durchsuchen. Es werden alle dieselben Datenquellen unterstützt.

Wenn Sie Daten aus einer externen Datenquelle verwenden möchten, müssen Sie die Objektgruppen in einem v2-Projekt neu erstellen und konfigurieren, wie die Datenquelle durchsucht wird. Weitere Informationen finden Sie unter Übersicht über Datenquellen.

Der Service benötigt Zeit und Ressourcen zum Durchsuchen und Einpflegen von Dokumenten aus externen Datenquellen. Erstellen Sie die Connectors nacheinander erneut. Berücksichtigen Sie die Zeit, die zum erneuten Durchsuchen der Daten in Ihrem Migrationsplan benötigt wird.

Vordefinierte Datensammlungen

Die folgenden integrierten Datenquellenobjektgruppen sind in v2:

Watson Discovery Nachrichten
Diese vorbereitete Datenquelle wird in v2nicht angeboten. Weitere Informationen zu einer alternativen Methode zum Abrufen von Nachrichtendaten finden Sie unter Nachrichtenservice mit v2.
COVID-19-Kit
Diese vordefinierte Sammlung wurde entwickelt, um Sie bei der Entwicklung eines dynamischen Chatbots zu unterstützen, der mit IBM® watsonx™ Assistant und Discovery erstellt wurde, um die Fragen Ihrer Kunden zu COVID-19zu beantworten. In v2können Sie eine ähnliche Lösung erstellen. Erstellen Sie einen Projekttyp Dialogsuche mit Sammlungen, die vertrauenswürdige Websites nach Antworten auf COVID-19-Fragen durchsuchen.

Einpflegung von Daten

Führen Sie die folgenden Schritte aus, um v1-Daten in eine Discovery v2-Instanz aufzunehmen:

  1. Erstellen Sie eine v2-Serviceinstanz.

  2. Erstellen Sie ein Projekt.

  3. Fügen Sie dem Projekt eine Sammlung hinzu.

    • Hochgeladene Daten:

      Über die API erstellen Sie eine Sammlung und fügen ihr Dokumente mit zwei separaten Verfahren hinzu. Verwenden Sie die Methode Sammlung erstellen, um die Sammlung zu erstellen. Fügen Sie als Nächstes dieselben Quellendokumente hinzu, die Sie Ihrer Sammlung v1 zur Sammlung v2 hinzugefügt haben. Verwenden Sie die Methode Dokument hinzufügen oder Dokument aktualisieren. Wenn Sie dem Dokument dieselbe v1-Dokument-ID zuordnen möchten, während Sie es der Sammlung v2 hinzufügen, hängen Sie die Dokument-ID an den Endpunkt an. Weitere Informationen finden Sie unter Dokument-IDs erhalten.

      Laden Sie über die Produktbenutzerschnittstelle von v2 dieselben Quellendokumente, die Sie Ihrer Sammlung v1 hinzugefügt haben, in die Sammlung v2 hoch.

    • Durchsuchte Daten: Sie können keine Daten aus einer externen Datenquelle programmgesteuert in v2durchsuchen. Erstellen Sie über die Benutzerschnittstelle des Produkts die Verbindung zur externen Datenquelle erneut und durchsuchen Sie anschließend die externe Datenquelle völlig neu.

  4. Über die Produktbenutzerschnittstelle können Sie die Discovery v2-Sammlung konfigurieren. Sie können beispielsweise auswählen, ob die optische Zeichenerkennung aktiviert werden soll. Für eine externe Datenquelle können Sie den Zeitplan für die Crawlersuche festlegen.

  5. Wenden Sie Aufbereitungen auf Ihre Daten an. Sie können vordefinierte Aufbereitungen für die Verarbeitung natürlicher Sprache oder von Ihnen erstellte benutzerdefinierte Aufbereitungen anwenden.

    In v1werden Aufbereitungen der Konfiguration zugeordnet, die beim Erstellen der Umgebung generiert wird. In v2werden Aufbereitungen der Sammlungskonfiguration zugeordnet. Einige Aufbereitungen werden je nach verwendetem Projekttyp standardmäßig auf Ihre Sammlung angewendet. Weitere Informationen finden Sie unter Standardprojekteinstellungen. In v2können Sie die Sammlung so konfigurieren, dass eine Untergruppe verfügbarer Aufbereitungen für die Felder Ihres Dokuments verwendet wird.

Dokument-IDs beibehalten

Dokument-IDs werden den Dokumenten zugewiesen, die Sie einer v2-Sammlung hinzufügen, wenn Sie sie über die Produktbenutzerschnittstelle hochladen oder mit der API-Methode Dokument hinzufügen hinzufügen.

Möglicherweise möchten Sie die IDs Ihrer v1-Dokumente in v2 beibehalten, wenn Sie Prozesse verwenden, die von diesen eindeutigen IDs abhängig sind. Regressionstests für die Anwendung können beispielsweise prüfen, ob bestimmte Dokumente zurückgegeben werden, indem die Dokument-IDs überprüft werden. Beim Relevanztraining werden die Dokument-IDs verwendet, um Dokumente zwischen Trainingsläufen zu verfolgen. Diese Prozesse sind einfacher anzupassen, wenn die Dokument-IDs zwischen Ihren v1-und v2-Instanzen identisch sind. Andernfalls müssen die Prozesse, die mit der Instanz Discovery v1 verwendet werden, den IDs neu zugeordnet werden, die den Dokumenten zugeordnet sind, nachdem sie der Instanz Discovery v2 hinzugefügt wurden.

Wenn Sie beim Hinzufügen von Dokumenten zur v1-Serviceinstanz eigene Dokument-IDs angegeben haben, können Sie die IDs beibehalten, indem Sie die Methode Dokument aktualisieren anstelle der Methode Dokument hinzufügen verwenden. Mit der Aktualisierungsmethode können Sie dem Dokument beim Hinzufügen zur v2-Sammlung eine Dokument-ID zuordnen. Weitere Informationen finden Sie unter Dokument aktualisieren.

Wenn Ihre Daten in einer JSON-Datei gespeichert sind, generiert ein Array im Originaldokument eine Dokument-ID mit einer angehängten Nummer. Beispiel: original_id_n. Um die ursprüngliche Dokument-ID ohne das Nummernsuffix beizubehalten, entfernen Sie das Array aus der JSON-Datei. Ändern Sie beispielsweise [ {"name": "value"} ] in {"name": "value"}.

Wenn Ihre v1-Dokumente systemgenerierte IDs haben, können Sie eine leere Suchabfrage übergeben, um eine Liste der Dokumente und ihrer IDs abzurufen. Anschließend können Sie jedem Dokument dieselbe ID zuordnen, wenn Sie es Ihrer neuen Sammlung in v2hinzufügen.

Dokumente wiederherstellen

In einigen Fällen sind die Originaldokumente, die in Discovery V1 aufgenommen wurden, nicht mehr verfügbar. Sie können die Instanz Discovery v1 verwenden, um Informationen aus dem Dokument abzurufen. Discovery erstellt eine Textkopie jedes Dokuments, das aufgenommen wird. Die Kopie ist nur Text, sodass alle Dokumente in HTML-, PDF-oder anderen Nicht-Text-Formaten in eine reine Textversion konvertiert werden.

Mit dieser Methode können Sie nur die ersten 10.000 Dokumente in einer Sammlung wiederherstellen. Weitere Informationen zu einer Möglichkeit, mehr als 10.000 Dokumente wiederherzustellen, finden Sie unter Mehr als 10.000 Dokumente aus einer Sammlung wiederherstellen.

Führen Sie die folgenden Schritte aus, um Dokumentinformationen von v1 auf v2zu übertragen:

  1. Extrahieren Sie die Dokumente aus v1 mithilfe der API, um eine leere Abfrage zu übergeben.

    Beispiel: GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=.

    Die API gibt die Ergebnisse zurück. Das Feld matching_results gibt die Gesamtzahl der Ergebnisse an. Das Ergebnisobjekt gibt die übereinstimmenden Dokumente zurück. Jedes Dokument wird als separates JSON-Objekt zurückgegeben. Standardmäßig werden maximal 10 Dokumente zurückgegeben.

    {
      "matching_results": 34,
      "session_token": "nnn",
      "results": [
        {"{result objects}":"{maximum of 10 by default}"}
      ]
    }
    
  2. Mit den Parametern count und offset können Sie die Abfrageergebnisse durchblättern und alle Dokumente speichern.

    Um beispielsweise 100 Dokumente gleichzeitig abzurufen, können Sie count auf 100 und offset auf 0 setzen und die Abfrage übergeben.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=0
    

    Als Nächstes können Sie die Anzahl wieder auf 100 setzen, aber dieses Mal den Offset auf 100 setzen, um die nächsten 100 Dokumente abzurufen.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=100`
    

    Wiederholen Sie diesen Prozess und erhöhen Sie den Offset um 100, bis Sie alle Dokumente abrufen.

  3. Bereiten Sie die exportierten Dokumente für die Aufnahme in v2vor.

    Jede JSON-Ergebnisdatei, die Sie von Discovery v1 abrufen, enthält Daten, die aus dem Originaldokument extrahiert wurden, z. B. Text, HTML und andere Felder. Wenn dem Dokument angepasste Metadaten zugeordnet wurden, als es auf v1hochgeladen wurde, ist es auch in der JSON-Datei vorhanden. Darüber hinaus enthält die Datei mehrere Felder, die von der Analyse v1 generiert wurden. Behalten Sie nur einen Teil dieser Daten als Teil des Dokuments bei, das Sie zu Discovery v2hinzufügen.

    Die folgenden Tipps helfen Ihnen bei der Entscheidung, welche Felder beibehalten werden sollen:

    • Schließen Sie das Feld text oder ein anderes Feld mit Textinhalten ein, die Sie aufbereiten oder in Discovery v2durchsuchen können möchten.
    • Schließen Sie alle angepassten Metadaten ein, die im Dokument gespeichert sind. Diese Metadaten sind normalerweise für die Anwendung spezifisch, die Discovery verwendet und zum Filtern von Dokumenten in einer Suche verwendet wird. Beispiel: metadata.customer_id.
    • Schließen Sie keine Aufbereitungen aus Discovery v1ein. Beispiel: enriched_text.entities. Discovery v2 generiert eigene Aufbereitungen.
    • Felder ausschließen, die von Discovery generiert werden, sofern sie nicht von Ihrer Anwendung verwendet werden und Informationen enthalten, die für die v1-Version des Dokuments eindeutig sind. Benennen Sie in diesem Fall das Feld um, sodass es nicht ersetzt wird, wenn das Dokument in Discovery v2aufgenommen wird. Beispiel: extracted_metadata.publicationdate ist ein Feld, das von Discovery generiert wird, wenn ein Dokument aufgenommen wird. Möglicherweise möchten Sie die metadata.parent_document_id Informationen aus v1 beibehalten, um zu verstehen, wie Unterdokumente ursprünglich aus einem einzelnen Quellendokument erstellt wurden.
    • Vermeiden Sie Felder mit reservierten Feldnamen. Weitere Informationen finden Sie unter Handhabung von Feldern.
  4. Nehmen Sie jedes bearbeitete v1-JSON-Dokument in die Instanz Discovery v2 auf. Die Discovery v1-Dokument-ID kann in Discovery v2verwaltet werden. Weitere Informationen zum Beibehalten der Dokument-ID finden Sie unter Dokument-IDs beibehalten.

Wiederherstellen von mehr als 10.000 Dokumenten aus einer Sammlung

Eine Abfrage kann nur bis zu 10.000 Dokumente zurückgeben. Wenn Sie jedoch mehr als 10.000 Dokumente aus Ihrer Sammlung wiederherstellen möchten, benötigen Sie eine Möglichkeit, die Dokumente in nicht überlappende Untergruppen aufzuteilen. Jede Untergruppe sollte weniger als 10.000 Dokumente enthalten, die von einer Abfrage zurückgegeben werden können. Anschließend können Sie die Ergebnisse paginieren, um die Dokumente abzurufen.

Die Paginierung für Ergebnisse ist auf maximal 10.000 Dokumente beschränkt, die von der Abfrage zurückgegeben werden. Insbesondere darf die kombinierte Verwendung der Paginierungsparameter count und offset 10.000 Dokumente nicht überschreiten.

Eine Möglichkeit, die Dokumente in nicht überlappende Untergruppen aufzuteilen, besteht darin, ein Feld zu nutzen, das in jedem Dokument vorhanden ist und einen eindeutigen Wert enthält. Das Feld SHA-1 enthält beispielsweise einen Hashwert der ursprünglichen Quellendatei und ist als hexadezimaler Zeichenfolgewert formatiert. Sie können das erste Zeichen des Felds verwenden, um die Sammlung in Untergruppen aufzuteilen. Da SHA-1 einen Hexadezimalwert enthält, kann das erste Zeichen bis zu 16 mögliche Werte (0-9 oder a-f) haben. Wenn Sie nach first_char_of (SHA-1) == 0 filtern, wird möglicherweise ungefähr 1/16 der gesamten Sammlung zurückgegeben. Anschließend können Sie alle möglichen 16 Werte in einer Schleife durchlaufen, um den Rest der Dokumente abzurufen. Wenn in einer der Untergruppen keine optimale Anzahl von Dokumenten zurückgegeben wird, können Sie stattdessen die ersten 2 Zeichen des Felds SHA-1 verwenden, um die Objektgruppe in 256 Untergruppen aufzuteilen.

Relevanztraining übertragen

Relevanztraining, das in Discovery v1 durchgeführt wurde, kann auf Discovery v2übertragen werden. Die Übertragung des Trainings funktioniert am besten mit einem Discovery v2-Projekt, das über eine Sammlung verfügt, die dieselben Dokumente aus der Discovery v1-Sammlung enthält.

Selbst wenn Sammlungen hinzugefügt oder Dokumente geändert wurden, kann das Relevanztraining übertragen werden. Sie müssen die Schulung jedoch aktualisieren, um die Änderungen zu berücksichtigen.

Führen Sie die folgenden Schritte aus, um das Relevanztraining zu übertragen:

  1. Laden Sie die Dokumente in Discovery v2.

  2. Laden Sie programmgesteuert die Abfragen herunter, die für das Relevanztraining in Discovery v1verwendet wurden. Weitere Informationen finden Sie unter Trainingsdaten auflisten.

  3. Erstellen Sie die Relevanztrainingsdaten in Discovery v2programmgesteuert erneut. Fügen Sie jede Trainingsabfrage mit der Methode Abfrage erstellen separat hinzu. Weitere Informationen finden Sie unter Trainingsabfrage erstellen.

    Geben Sie unbedingt die v2-Sammlungs-ID an. Sie müssen auch die Dokument-ID angeben.

    Wenn Sie die Dokument-IDs zwischen den Objektgruppen v1 und v2 nicht beibehalten haben, müssen Sie die v2-Dokument-ID finden, die der v1-Dokument-ID entspricht, auf die im Beispiel für die heruntergeladene Abfrage verwiesen wird.

Modelle übertragen

Sie können einige der Modelle, die Sie in v1 erstellt haben, mit Ihrem v2-Projekt wiederverwenden.

Smart Document Understading-Modelle (SDU)

Sie können ein mit Discovery v1 erstelltes SDU-Modell in Discovery v2importieren. Die Leistung des Modells kann jedoch je nach Version unterschiedlich sein. Vergleichen Sie die Ergebnisse des SDU-Modells v1 in v2, um sicherzustellen, dass das Verhalten identisch ist. Sie können das importierte v1-SDU-Modell nicht bearbeiten. Wenn das importierte Modell keine Dokumentelemente erkennen kann, die es in v1 erkannt hat und die für Ihren Anwendungsfall wichtig sind, müssen Sie das SDU-Modell in der Produktbenutzerschnittstelle von Discovery v2 neu erstellen. Weitere Informationen finden Sie unter SDU-Modelle exportieren in der Dokumentation zu v1 und unter SDU-Modell importieren in der Dokumentation zu v2.

Modelle für maschinelles Lernen

Sie können Modelle nicht direkt in Discovery v2-Serviceinstanzen von Knowledge Studiobereitstellen. Stattdessen müssen Sie die Modelle für maschinelles Lernen aus Knowledge Studioexportieren und anschließend in Discoveryimportieren. Das Modell muss nach dem 16. Juli 2020 aus Knowledge Studio exportiert worden sein. Wenn Sie über ein Modell verfügen, das vor diesem Datum exportiert wurde, müssen Sie das Modell erneut aus Knowledge Studioexportieren. Nur bezahlte Knowledge Studio-Pläne unterstützen das Exportieren von Modellen.

Weitere Informationen enthalten die folgenden Abschnitte:

Informationen zum Importieren eines Modells in Discovery v2finden Sie unter Machine Learning-Modelle importieren.

Anwendung für die Verwendung der API v2 aktualisieren

Die Watson Developer SDKs unterstützen sowohl Discovery v1 als auch v2.

Diese Anweisungen setzen voraus, dass Ihre Anwendung die neueste Version der v1-API (Version 2019-04-30) verwendet.

Wenn Sie eine Anwendung, die momentan die API Discovery v1 verwendet, für die Verwendung von v2portieren, müssen Sie planen, wie Sie die folgenden allgemeinen Unterschiede zwischen den beiden Versionen beheben.

Zusätzlich zu diesen allgemeinen Änderungen sollten Sie die Unterschiede auf Methodenebene überprüfen, um zu verstehen, was Sie noch ändern müssen. Weitere Informationen finden Sie unter Vergleich der API-Version.

  • v2 organisiert Daten nach Projekten und Sammlungen. Es gibt kein Konzept einer Umgebung. Vergleichen Sie beispielsweise die folgenden Anforderungen, um eine Sammlung abzurufen:

    v1 Sammlung abrufen

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}
    

    v2 Sammlung abrufen

    GET {url}/v2/projects/{project_id}/collections/{collection_id}
    
  • In v1wird das Relevanztraining für eine einzelne Sammlung ausgeführt. In v2wird das Relevanztraining für ein Projekt durchgeführt. Das Projekt kann viele Sammlungen enthalten. Ist dies der Fall, wird das Relevanztraining auf alle Sammlungen angewendet. Informationen zum Übertragen des Relevanztrainings finden Sie unter Relevanztraining übertragen.

    Vergleichen Sie beispielsweise die folgenden Anforderungen, die den Status des Relevanztrainings zurückgeben:

    v1 Sammlung abrufen

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}
    

    v2 Projekt abrufen

    GET {url}/v2/projects/{project_id}
    
  • Das Übergeben einer Abfrage ist bei den beiden Versionen ähnlich. In v2können Sie alle Sammlungen in einem Projekt abfragen oder die Abfrage auf eine oder mehrere Sammlungen beschränken, indem Sie einen Parameter collection_ids angeben. Vergleichen Sie beispielsweise die folgenden Anforderungen, um Daten abzufragen:

    Anforderung v1 Query

    POST {url}/v1/environments/{environment_id}/collections/{collection_id}/query
    

    Daten, die mit der Anforderung übergeben werden:

    {
      "query": "text:IBM"
    }
    

    Anforderung v2 Query

    POST {url}/v2/projects/{project_id}/query
    

    Daten, die mit der Anforderung übergeben werden:

    {
      "collection_ids": [
        "{collection_id_1}",
        "{collection_id_2}"
      ],
      "query": "text:IBM"
    }
    

    Optional können Sie den Parameter collection_ids weglassen, um alle Objektgruppen im Projekt abzufragen.

  • Der Parameter passage für eine Abfrage hat eine neue Option per_document, die die Dokumente nach Dokumentqualität einstuft und dann die am höchsten eingestuften Passagen pro Dokument in einem document_passages-Feld für jeden Dokumenteintrag in der Ergebnisliste der Antwort zurückgibt. Bei ' false' werden die Passagen aus allen Dokumenten unabhängig von der Dokumentqualität nach Passagen sortiert und in einem separaten Passagen-Feld in der Antwort zurückgegeben.

  • Wenn Passagen für eine Abfrage zurückgegeben werden, können Sie auch die Antwortsuche aktivieren. Bei 'true' werden Antwortobjekte als Teil jeder Passage in den Abfrageergebnissen zurückgegeben. Wenn find_answers und per_document beide auf 'true' gesetzt sind, werden die Ergebnisse der Dokumentsuche und die Ergebnisse der Durchgriffssuche in jedem Dokument unter Verwendung der Antwortkonfidenzen neu angeordnet. Ziel dieser Neuordnung ist es, die beste Antwort als erste Antwort auf die erste Passage des ersten Dokuments zu platzieren. Wenn der Parameter find_answers auf 'true' und der Parameter 'per_document' auf ' false' gesetzt ist, werden die Ergebnisse der Durchgriffssuche in absteigender Reihenfolge der Antworten mit der höchsten Konfidenz für jedes Dokument und jeden Durchgang neu angeordnet.

  • Sowohl v1 als auch v2 unterstützen angepasste Stoppwörter. Es gibt jedoch einige Unterschiede bei der Verwendung angepasster Stoppwörter:

    • Es gibt keine benutzerdefinierte Standardstoppwortliste für japanische Objektgruppen in v2.
    • Wenn Sie angepasste Stoppwörter in v1definieren, ersetzt Ihre Stoppwortliste die vorhandene Stoppwortliste. In v2erweitert Ihre Liste die Standardliste. Sie können die Liste nicht ersetzen, d. h., Sie können keine Stoppwörter entfernen, die Teil der Standardliste in v2sind.

Aktualisieren, wie Ihre Anwendung Abfrageergebnisse handhabt

Die Art und Weise, wie Ihre Anwendung Abfrageergebnisse anzeigt, muss möglicherweise aufgrund der folgenden Unterschiede zwischen der Syntax des Abfrageergebnisdokuments zwischen den Abfragen v1 und v2 aktualisiert werden:

  • Auf Entitätsaufbereitungsebene werden die folgenden Informationen in v2:

    • Begriffsklärung
    • Emotion
    • Stimmungsanalyse

    Die Aufbereitung Part of Speech wird automatisch auf Dokumente in den meisten Projekttypen in v2angewendet, aber die von der Aufbereitung generierten Indexfelder werden nicht in der JSON-Darstellung des Dokuments angezeigt.

    Difference in entities data structure
    Entities data structure differences

  • Anstelle von count und relevance in v1enthält v2 die Erwähnungen.

    Jeder Eintrag in der Erwähnung entspricht einem Vorkommen der Entität im Dokumenttext. Im folgenden Beispiel werden sieben Vorkommen gefunden. Für jedes Vorkommen werden ein Konfidenzscore und die Offsets des Erwähnungstexts angezeigt. Sie können die Offsets verwenden, um die Erwähnung im Dokumenttext hervorzuheben, wenn das Ergebnis in einer Benutzerschnittstelle angezeigt wird.

    Mentions in Discovery v2
    Entity mentions in Discovery v2

  • Die JSON-Struktur von Abfrageantworten wird in v2geringfügig neu angeordnet.

  • Die Abfrageantwort v2 enthält keine Deduplizierungsinformationen.

  • In v2ist enriched_text ein Array anstelle eines Objekts.

  • In Discovery v2wird die Aufbereitung für Entitäten v2 verwendet. Entitätstypnamen in v2 werden in Überschrift und nicht nur in Großbuchstaben angegeben. Wenn Sie eine Abfrage oder Aggregation verwenden, die einen Entitätsnamen angibt, müssen Sie die Groß-/Kleinschreibung ändern. Ändern Sie beispielsweise PERSON in Person.

  • Felder aus JSON-Dateien, die einer Sammlung hinzugefügt wurden, werden während der Aufnahme zwischen v1 und v2unterschiedlich konvertiert. Wenn Ihre Anwendung diese Ergebnisse bearbeitet, müssen Sie möglicherweise Anpassungen vornehmen.

    Sie können die Objekte normalizations und conversions in der Methode Sammlung aktualisieren der API angeben, um JSON-Felder zu verschieben oder zusammenzuführen.

    Handhabung von JSON-Quellenfeldern
    Ursprünglicher JSON-Feldinhalt Darstellung von v1 v2-Darstellung Anmerkungen
    "field": null "field": null Nicht zutreffend v1 behält den Nullwert bei. v2 überspringt das Nullfeld vollständig.
    "field": "" "field": "" Nicht zutreffend v1 behält den leeren Textwert bei. v2 überspringt das leere Textfeld vollständig.
    "field": "value2" "field": "value2" "field": "value2" Kein Unterschied.
    "field": [] "field": [] Nicht zutreffend v1 behält das leere Array bei. v2 überspringt das Feld mit dem leeren Array.
    "field": [ "value4" ] "field": [ "value4" ] "field": "value4" v1 behält das Singleton-Array bei. v2 konvertiert das Singleton-Array nur in den Wert; es wird nicht als Teil eines Arrays gespeichert.
    "field": [ 1, 2, 3 ] "field": [ 1, 2, 3 ] "field": [ 1, 2, 3 ] Kein Unterschied.
    "field": [ "v6", "v7", "v8" ] "field": [ "v6", "v7", "v8"] "field": [ "v6", "v7", "v8"] Kein Unterschied.

Erfolgreiche Migration Ihrer Daten überprüfen

Um zu überprüfen, ob die Migration erfolgreich war, vergleichen Sie die folgenden Metriken mit den Metriken, die Sie vor der Migration notiert haben.

  • Anzahl der Erfassungen

    Stellen Sie sicher, dass Sie alle Objektgruppen, die Sie in v1 verwendet haben, erneut erstellen und beibehalten möchten. Mit der API-Methode v2 List collections können Sie eine Liste von Sammlungen abrufen, aber Sie müssen eine Anforderung pro Projekt übergeben. Sie können nicht einen einzigen Aufruf verwenden, um die Gesamtzahl der Erfassungen pro Serviceinstanz abzurufen.

  • Anzahl der Dokumente pro Sammlung

    Überprüfen Sie für Sammlungen mit hochgeladenen Daten die Anzahl der Dokumente in der Sammlung, indem Sie eine leere Abfrage mit der API-Methode Projekt abfragen senden. Geben Sie den Parameter für die Objektgruppen-ID an, um die Ergebnisse auf Dokumente in einer Objektgruppe zu begrenzen. Eine leere Abfrage gibt alle Dokumente zurück. Daher können Sie die Gesamtzahl der Dokumente aus dem Wert matching_results in der Antwort abrufen.

    Die Anzahl der Dokumente pro Objektgruppe sollte nahe an der Anzahl der Dokumente liegen, die in derselben Objektgruppe in v1gespeichert wurden. Die Zahlen sind möglicherweise nicht identisch.

    Bei durchsuchten Daten sollten Sie sich nicht wundern, wenn die Objektgruppe v2 weniger Dokumente enthält. Die v1-Connectors löschen keine Dokumente aus einer Discovery-Sammlung, die aus der externen Datenquelle gelöscht wurden. Ihre v2-Version der Gruppe verfügt über eine frischere Crawlersuche für die Daten, wie sie heute in der externen Datenquelle vorhanden sind.

Erwarten Sie nicht, dass die Suchergebnisse für Abfragen, die Sie in den Instanzen v1 und v2 übergeben, identisch sind.

Nachrichtenservice mit v2 verwenden

Wenn Sie die Datenquelle Watson Discovery News in v1 verwendet haben und eine Datenquelle mit äquivalenter Funktion in v2erstellen möchten, suchen Sie einen Service für den Datenprovider für News und Ereignisse. Suchen Sie nach einem Service, der eine Nachrichten-API bietet, die Nachrichtenartikel im JSON-Format extrahiert. Anschließend können Sie die JSON-Dateien hochladen, um eine News-Sammlung in Ihrem v2-Projekt zu erstellen.

Löschen Sie Ihre v1-Dienstinstanz

Nachdem Ihre Daten migriert und Ihre Anwendungen für die Verwendung der neuen v2-Serviceinstanz aktualisiert wurden, müssen Sie Ihre v1-Serviceinstanz löschen. Die v1-Serviceinstanz wird Ihnen berechnet, bis Sie sie löschen. Weitere Informationen finden Sie unter Verwaltete Serviceinstanz löschen.