Wie Ihre Daten verarbeitet werden

Wenn Sie eine Verbindung zu einer Datenquelle herstellen, verarbeitet Discovery ** die Informationen aus der Datenquelle, um eine Objektgruppezu erstellen.

Das Ziel der Verarbeitung einer Datenquelle besteht darin, aussagekräftige Informationen zu identifizieren und sie zu kennzeichnen, wenn sie der Objektgruppe hinzugefügt werden, damit sie später leichter gefunden und abgerufen werden können.

Die Verarbeitung, die auf alle Datenquellen angewendet wird, umfasst die folgenden Schritte:

  • Einzelne Dokumente in der Datenquelle identifizieren
  • Felder in den Dokumenten suchen
  • Felder indexieren

Auf der Seite Felder verwalten wird eine Liste der Felder angezeigt, die indexiert wurden.

  1. Rufen Sie die Seite Sammlungen verwalten auf und wählen Sie die Sammlung aus.

    Stellen Sie sicher, dass die Verarbeitung der Objektgruppe zuerst abgeschlossen ist. Auf der Seite 'Aktivität' wird der Verarbeitungsstatus angezeigt.

  2. Klicken Sie auf die Registerkarte "Felder verwalten ".

Die angezeigten Felder können abhängig von Ihren Daten variieren. Es wird jedoch immer eine Untergruppe von Feldern aufgelistet. Diese Felder mit Namen wie footer und header werden vom Tool Smart Document Understanding (SDU) abgeleitet und auch dann aufgelistet, wenn Sie nicht explizit ein SDU-Modell auf die Objektgruppe anwenden. (Eine vollständige Liste der SDU-generierten Felder finden Sie unter Verfügbare Felder) Nur die Felder mit einem angegebenen Datentyp werden im Index der Objektgruppe gespeichert.

Eines der SDU-generierten Felder, die im Index gespeichert werden, ist das Feld text. Das Feld text enthält normalerweise den Hauptteil des Textes aus dem Originaldokument. Die meisten Inhalte, die in Suchergebnissen zurückgegeben werden, die Sie auf der Seite Verbessern und anpassen übergeben, stammen aus diesem einen Feld. Wie nur relevante Informationsblöcke aus diesem Feld geparst und zurückgegeben werden, hängt von der Abfrageergebniskonfiguration ab, die vom Projekt verwendet wird. Weitere Informationen finden Sie unter Standardabfrageergebnisse voranzeigen.

Bei einer weiteren Verarbeitung werden weitere Felder hinzugefügt. Und mehr Verarbeitung wird automatisch abhängig vom Projekttyp angewendet. Wenn Prozesse für Dokumente in einer Objektgruppe ausgeführt werden, werden zusätzliche Felder zum Speichern von Informationen hinzugefügt, die dem Prozess zugeordnet sind. Wenn beispielsweise die integrierte Aufbereitung für Entitäten auf eine Objektgruppe angewendet wird, wird ein Prozess gestartet, der Felder, deren Namen mit enriched_{field_name}.entities beginnen, zu den Dokumenten in der Objektgruppe hinzufügt.

Handhabung von Feldern

Bei den meisten unstrukturierten Dateitypen wird der Großteil des Inhalts aus der Datei zu einem Feld namens text hinzugefügt. Bei Dateitypen mit einer inhärenten Datenstruktur, z. B. JSON-Dateien, werden Namen aus der Quellendatei verwendet, um die Felder zu benennen, in denen der Inhalt gespeichert ist. Beachten Sie beim Hochladen von Dateien dieses Typs einige Namenseinschränkungen, die für Felder gelten.

Die folgenden Feldnamen haben eine besondere Bedeutung. Verwenden Sie diese Namen möglichst nicht in Ihren strukturierten Quellendateien.

  • document_id
  • highlight
  • html
  • metadata
  • parent_document_id
  • result_metadata
  • score
  • spans

Vermeiden Sie Feldnamen, die die folgenden Bedingungen erfüllen. Feldnamen mit diesen eingeschränkten Zeichen werden nicht abgefragt.

  • Beginnen Sie mit den Zeichen _, + und -. Zum Beispiel +extracted-content.
  • Enthalten die Zeichen ., ,, #, ?, (, ) oder : oder Leerzeichen. Beispiel: extracted content oder new:extracted-content.
  • Enden Sie mit Zahlen, z. B. extracted-content2.

Damit Dokumente in Discoveryverarbeitet werden können, müssen alle Dokumente in einer Sammlung denselben Datentyp für ein bestimmtes Feld haben. Wenn ein Datentyp eines bestimmten Felds zwischen Dokumenten variiert, schlägt der Feldindexierungsprozess fehl und im Abschnitt Warnungen und Fehler auf einen Blick der Seite Aktivität für die Objektgruppe wird eine Fehlernachricht angezeigt, die angibt, dass die Indexierung fehlgeschlagen ist.

HTML-Felder

Das Feld html im Dokumentindex speichert Strukturinformationen zum Dokument.

  • Wenn Sie das Smart Document Understanding-Tool zum Annotieren einer Objektgruppe verwenden, wird die Dokumentdarstellung im Feld html indexiert.
  • Wenn Sie mit dem Smart Document Understanding-Tool ein vorab trainiertes Modell auf eine Objektgruppe anwenden, wird die Dokumentdarstellung sowohl im Feld html als auch im Feld text indexiert.
  • Das Feld html hat eine Größenbegrenzung. Weitere Informationen finden Sie unter Feldbegrenzungen.

Hinweis zur Erweiterung von Daten:

  • Wenn Sie eine Aufbereitung anwenden möchten, die die Tabellen in einem Dokument verstehen kann, muss das Dokument ein Feld html enthalten.

Handhabung von Datumsangaben

Datumsangaben werden auf unterschiedliche Weise nach verschiedenen Dateitypen erfasst.

Unstrukturierte Dateien

Die beste Methode zum Erfassen von Datumsinformationen aus dem Hauptteil eines Dokuments mit unstrukturierten Daten ist die Verwendung einer Aufbereitung des Modells für die Verarbeitung natürlicher Sprache. Beispielsweise erkennt die vordefinierte Aufbereitung für Entitäten Datumsangaben und annotiert sie im Feld text (oder in anderen Hauptteilfeldern mit dem Datentyp String ). In einem Dokument, auf das die Aufbereitung angewendet wird, können Sie nach Datumsangaben suchen, indem Sie nach Feldern mit der Beschriftung enriched_{fieldname}.entities.type=Date suchen.

Dates from metadata date fields, such as extracted_metadata.publicationdate, are stored in the index as dates as long as the date format matches one of the supported date data type formats. You can't see nested fields from the Manage fields page. And when you view a search result as JSON, date field values are displayed as string values because the JSON editor shows the date as a string. However, values from date fields behave like dates. You can use greater than (>) or less than (<) operators with such fields in Discovery Query Language queries, for example.

Strukturierte Dateien

Strukturdateien, die Sie importieren, z. B. CSV-oder JSON-Dateien, können Datumsfelder enthalten, die Sie als Datumsdatentypen speichern möchten. Discovery kann viele Datumsformate erkennen. Möglicherweise müssen Sie jedoch ein Format zur Liste hinzufügen. Weitere Informationen finden Sie unter Datumsformateinstellungen.

Datumsformateinstellungen

Wenn Ihre Dokumente ein Feld auf Stammebene mit Datumsinformationen enthalten, können Sie das Feld als Date-Datentypfeld im Index festlegen.

Discovery erkennt die folgenden Datumsformate automatisch:

yyyy-MM-dd'T'HH:mm:ssZ
yyyy-MM-dd'T'HH:mm:ssXXX
yyyy-MM-dd'T'HH:mm:ss.SSSZ
yyyy-MM-dd'T'HH:mm:ss.SSSX
yyyy-MM-dd
M/d/yy
yyyyMMdd
yyyy/MM/dd

Wenn Sie Datumsangaben in anderen Formaten speichern, können Sie das Format zur Liste der unterstützten Formate hinzufügen.

Führen Sie die folgenden Schritte aus, um weitere Datumsformat hinzuzufügen:

  1. Fügen Sie auf der Seite Felder verwalten für die Sammlung ein Format als neue Zeile im Feld Datumsformate hinzu.

    Geben Sie ein Datumsformat an, das von der Java SimpleDateFormat Klasse unterstützt wird.

    Wenn Ihre Datensätze beispielsweise nur Jahreswerte für Datumsangaben speichern, fügen Sie yyyy zur Liste der unterstützten Datumsformate hinzu. Anschließend können Sie den Datentyp für das Feld, das einen Jahreswert enthält, auf Datumsetzen und Ihre Sammlung erneut verarbeiten. Daher wird ein Vorkommen von 2019 im Datumsfeld als 2019-01-01T05:00:00Z im Index gespeichert.

    Wenn Sie ein Datumsformat hinzufügen, müssen Sie eine zugeordnete Zeitzone für das Datum angeben.

  2. Geben Sie eine Zeitzone an.

  3. Wählen Sie optional eine Datumsländereinstellung aus.

    Die von Ihnen ausgewählte Ländereinstellung wird verwendet, um einen Zeichenfolgewert zu parsen, der das Datum für die Datasetfelder des Datumstyps darstellt. Wenn Sie beispielsweise das Format EEE, MM dd, yyyy verwenden, kann das englische (US-amerikanische) Gebietsschema den Zeichenfolgenwert "Wednesday, 07 01, 2020" analysieren, und das japanische (japanische) Gebietsschema kann denselben Zeichenfolgenwert "水曜日, 07 01, 2020" analysieren.

  4. Wenn Sie bereits Dokumente mit Datumsangaben in Formaten importiert haben, die nicht erkannt wurden, verarbeiten Sie die Dokumente erneut.

Discovery kann kein Datum speichern, das in einem Textfeld als Feld Datum im Index erwähnt wird. Sie können jedoch eine Aufbereitung wie die Aufbereitung Entitäten verwenden, um Datumsangaben zu ermitteln, die im Text erwähnt werden.

Handhabung von Dateitypen

Wenn Sie ein Dokument hochladen, werden Daten in der Datei indexiert. Die verschiedenen Dateitypen werden von Discoveryunterschiedlich behandelt.

CSV-Dateien

Hinweise zum Hinzufügen von Daten:

  • Jede Zeile, die in der CSV-Datei definiert ist, wird dem Index als separates Dokument mit demselben parent_document_id hinzugefügt.

    Die untergeordneten Dokumente verfügen normalerweise über eine Dokument-ID mit der Syntax {parent-ID}_n, wobei {parent-ID} die Dokument-ID der ursprünglichen Datei ist, die hinzugefügt wurde, und n eine fortlaufende Zahl ist. Wenn Sie beispielsweise eine CSV-Datei mit 5 Zeilen hochladen, werden der Objektgruppe fünf Dokumente mit Dokument-IDs wie f5214225c1e03e25190ffcdfad8e84ff_0 bis f5214225c1e03e25190ffcdfad8e84ff_4 hinzugefügt.

  • Sie können die OCR-Funktion (Optical Character Recognition) für CSV-Dateien nicht aktivieren.

  • Wenn die CSV-Datei Header enthält, werden die Headernamen verwendet, um die Felder zu benennen, in denen der Inhalt aus der entsprechenden Spalte gespeichert wird. Verwenden Sie in Discoverykeine Namen mit besonderer Bedeutung. Stellen Sie sicher, dass die Feldnamen den Namensregeln entsprechen, z. B. ohne Leerzeichen und ohne angehängte Zahlen. Sie können beispielsweise den Header start date in start_date und label1 in label-one umbenennen, bevor Sie die Datei hinzufügen. Weitere Informationen finden Sie unter Handhabung von Feldern.

  • Wenn der Headername einer CSV-Datei eingeschränkte Zeichen enthält, entfernt der Dokumentconverter automatisch die eingeschränkten Zeichen aus dem Feldnamen, wenn er das Ergebnisfeld zum Index hinzufügt.

Hinweis zur Erweiterung von Daten:

  • Sie können keine vordefinierten oder benutzertrainierten Smart Document Understanding-Modelle auf CSV-Dateien anwenden.

HTML-Dateien

Wenn Sie eine HTML-Datei hochladen oder eine Datenquelle mit HTML-Dateien durchsuchen, wie z. B. eine Website, wird zusammen mit dem Feld text ein Feld html generiert. Weitere Informationen finden Sie unter HTML-Felder.

JSON-Dateien

Hinweise zum Hinzufügen von Daten:

  • Objektnamen aus der JSON-Quellendatei werden verwendet, um die Felder zu benennen, in denen der Inhalt gespeichert ist. Verwenden Sie in Discoverykeine Namen mit besonderer Bedeutung. Stellen Sie sicher, dass die Namen den Namensregeln entsprechen, z. B. ohne Leerzeichen und ohne angehängte Zahlen. Sie können das Objekt updated on beispielsweise in updated_on und answer2 in answer-two umbenennen, bevor Sie die Datei hinzufügen. Weitere Informationen finden Sie unter Handhabung von Feldern.

  • Wenn ein Feld auf Stammebene ein Array ist, aber keine Elemente enthält, wird das Feld aus dem Index ausgeschlossen.

  • Wenn ein Feld auf Stammebene ein Array ist und nur ein Element enthält, wird das Array als Datentyp des einen Elements indexiert. Beispiel: Ein Zeichenfolgenarray mit einer Zeichenfolge wird als Zeichenfolge indexiert.

  • Wenn ein verschachteltes Feld ein Array enthält, wird es als Array indexiert, selbst wenn das Array nur einen Wert hat.

  • Wenn ein Feld auf Stammebene ein Array ist und mehr als ein Element enthält, werden die Daten als Array indexiert.

  • Wenn Sie JSON kopieren, die von Discovery generiert wird, und diese dann als JSON-Datei hochladen, entfernen Sie zuerst die folgenden systemgenerierten Felder aus der Datei: document_id, parent_document_id, filename und title.

  • Sie können das Feature Optical Character Recognition (OCR) nicht für JSON-Dateien aktivieren.

  • Wenn Ihr Quellendokument ein Feld namens document_id enthält, wird das Feld übersprungen und nicht dem Index in der Objektgruppe hinzugefügt.

    Wie das Feld document_id in einer JSON-Datei behandelt wird, wird mit der 2023-03-31-Versionsaktualisierung der API geändert. Wenn Sie vor der Aktualisierung eine JSON-Datei über die Produktbenutzerschnittstelle hochgeladen oder die API verwendet haben, um sie mit der Methode Dokument hinzufügen hinzuzufügen, wurde der Wert im Feld document_id der Datei als document_id-Wert in Abfrageergebnissen angezeigt. Es wurde jedoch eine andere Dokument-ID zugeordnet und im Feld parent_document_id gespeichert. Die zugewiesene Dokument-ID ist die ID, die zurückgegeben wurde, als Sie die Methode "List documents" aufgerufen haben, und die als document_id im Endpunkt URL für eine Anforderung der Methode "Delete document" verwendet werden musste. Wenn Sie die Methode Dokument aktualisieren verwendet haben, um eine neue document_id zuzuordnen, wird die ursprüngliche ID weiterhin in den Abfrageergebnissen zurückgegeben. Die zugewiesene ID musste jedoch zum Löschen des Dokuments verwendet werden. Wenn Sie eine Anwendung haben, die auf dem vorherigen Verhalten basiert, können Sie eine Versionsnummer vor 2023-03-31, z. B. 2020-08-30, in Ihren API-Aufrufen angeben.

Hinweise zur Erweiterung von Daten:

  • Sie können vordefinierte oder vom Benutzer trainierte Smart Document Understanding-Modelle nicht auf JSON-Dateien anwenden.

  • Wenn Sie eine Aufbereitung auf ein Feld aus der JSON-Datei anwenden, wird der Felddatentyp in ein Array konvertiert. Das Feld wird in ein Array konvertiert, auch wenn es einen einzelnen Wert enthält. Beispiel: "field1": "Discovery" wird zu "field1": ["Discovery"].

  • Nur die ersten 50.000 Zeichen eines angepassten Felds aus einer JSON-Datei werden aufbereitet.

  • Bei Projekttypen, bei denen die Aufbereitung Part of Speech (POS) automatisch angewendet wird, wird die Aufbereitung auf das Feld angewendet, das den Großteil des Dateiinhalts in der ersten JSON-Datei enthält, die der Sammlung hinzugefügt wird. Dieses Feld wird durch die folgenden Regeln bestimmt:

    • Wenn ein Feld den Namen text hat, wird die Point-of-Sale-Aufbereitung darauf angewendet.
    • Das Feld mit dem längsten Zeichenfolgewert und der höchsten Anzahl unterschiedlicher Werte wird ausgewählt.
    • Wenn mehr als ein Feld die vorherige Bedingung erfüllt, wird eines der Felder zufällig ausgewählt.
  • Wenn Sie eine Aufbereitung auf ein verschachteltes Feld anwenden möchten, müssen Sie ein Content-Mining-Projekt und anschließend die Aufbereitung auf das Feld anwenden. Wenn Sie einen anderen Projekttyp als Content-Mining verwenden möchten, können Sie die Objektgruppe, die Sie mit dem Content-Mining-Projekttyp erstellt haben, an anderer Stelle wiederverwenden. Weitere Informationen finden Sie unter Aufbereitungen anwenden.

Sie können die Objekte normalizations und conversions in der Methode Sammlung aktualisieren der API angeben, um JSON-Felder zu verschieben oder zusammenzuführen.

Ableitung von Passagen

Discovery verwendet hoch entwickelte Algorithmen, um die besten Textpassagen aus allen Dokumenten zu bestimmen, die von einer Abfrage zurückgegeben werden. Passagen werden standardmäßig pro Dokument zurückgegeben. Sie werden als Abschnitt in jedem Dokumentabfrageergebnis angezeigt und nach Passagen-Relevanz sortiert.

Discovery verwendet die Satzgrenzenerkennung, um eine Passage auszuwählen, die einen vollständigen Satz enthält. Er sucht nach Passagen mit einer ungefähren Länge von 200 Zeichen und sucht dann nach Passagen, die vollständige Sätze enthalten, wenn sie doppelt so lang sind. Die Erkennung von Satzgrenzen funktioniert bei allen unterstützten Sprachen und verwendet sprachspezifische Logik.

Für alle Projekttypen mit Ausnahme der Dialogsuchekönnen Sie ändern, wie die Passagen in den Suchergebnissen auf der Seite Anzeige anpassen > Suchergebnisse angezeigt werden. Sie können beispielsweise die Anzahl der Passagen, die pro Dokument angezeigt werden, und die maximale Zeichengröße pro Passage konfigurieren.