Come vengono trattati i vostri dati

Quando ti connetti a un'origine dati, Discovery elabora le informazioni dall'origine dati per creare una raccolta.

L'obiettivo dell'elaborazione di un'origine dati è identificare le informazioni significative e contrassegnarle come vengono aggiunte alla raccolta in modo che sia più semplice trovare e richiamare le informazioni in un secondo momento.

L'elaborazione applicata a tutte le origini dati include i seguenti passi:

  • Identificare singoli documenti nell'origine dati
  • Trova campi nei documenti
  • Indicizza i campi

È possibile visualizzare un elenco dei campi indicizzati dalla pagina Gestisci campi.

  1. Andare alla pagina Gestisci raccolte e scegliere la raccolta.

    Assicurarsi che l'elaborazione della raccolta sia terminata per prima. La pagina Attività mostra lo stato di elaborazione.

  2. Fare clic sulla scheda Gestione campi.

I campi visualizzati possono differire in base ai propri dati. Tuttavia, viene sempre elencato un sottoinsieme di campi. Questi campi, con nomi come footer e header, derivano dallo strumento SDU (Smart Document Understanding) e sono elencati anche quando non si applica esplicitamente un modello SDU alla raccolta. (Per l'elenco completo dei campi generati da SDU, consultare Campi disponibili.) Solo i campi con un tipo di dati specificato vengono memorizzati nell'indice della raccolta.

Uno dei campi generati da SDU memorizzati nell'indice è il campo text. Il campo text generalmente contiene il corpo principale del testo del documento originale. La maggior parte del contenuto restituito nei risultati della ricerca inoltrati dalla pagina Migliora e personalizza proviene da questo campo. Il modo in cui analizzare e restituire solo i blocchi di informazioni pertinenti da questo campo è determinato dalla configurazione dei risultati della query utilizzata dal progetto. Per ulteriori informazioni, consultare Anteprima dei risultati della query predefiniti.

Un'ulteriore elaborazione aggiunge più campi. E più elaborazione viene applicata automaticamente a seconda del tipo di progetto. Quando i processi vengono eseguiti sui documenti in una raccolta, vengono aggiunti ulteriori campi per memorizzare le informazioni associate al processo. Ad esempio, quando l'arricchimento Entità integrato viene applicato a una raccolta, viene avviato un processo che aggiunge i campi con i nomi che iniziano con enriched_{field_name}.entities ai documenti nella raccolta.

Modalità di gestione dei campi

Per la maggior parte dei tipi di file non strutturati, la maggior parte del contenuto del file viene aggiunta a un campo denominato text. Per i tipi di file che hanno una struttura di dati intrinseca, come i file JSON, i nomi del file di origine sono utilizzati per denominare i campi in cui è memorizzato il contenuto. Quando si caricano file di questo tipo, tenere presente alcune limitazioni di denominazione che esistono per i campi.

I seguenti nomi di campo hanno un significato speciale. Se possibile, non utilizzare questi nomi nei propri file di origine strutturati.

  • document_id
  • highlight
  • html
  • metadata
  • parent_document_id
  • result_metadata
  • score
  • spans

Evitare i nomi campo che soddisfano le seguenti condizioni. I nomi campo con questi caratteri limitati non vengono interrogati.

  • Iniziare con i caratteri _, + e -. Ad esempio, +extracted-content.
  • Contenere i caratteri ., ,, #, ?, (, ) o : o gli spazi. Ad esempio, extracted content o new:extracted-content.
  • Terminare con numeri, ad esempio, extracted-content2.

Per elaborare documenti in Discovery, tutti i documenti in una raccolta devono avere lo stesso tipo di dati per uno particolare campo. Quando un tipo di dati di un particolare campo varia tra i documenti, il processo di indicizzazione dei campi ha esito negativo e viene visualizzato un messaggio di errore di indicizzazione non riuscito nella sezione Avvertenze ed errori a colpo d'occhio della pagina Attività per la raccolta.

Campi HTML

Il campo html nell'indice del documento memorizza le informazioni strutturali sul documento.

  • Se si utilizza lo strumento Smart Document Understanding per annotare una raccolta, la rappresentazione del documento viene indicizzata nel campo html.
  • Se si utilizza lo strumento Smart Document Understanding per applicare un modello preformato a una raccolta, la rappresentazione del documento viene indicizzata sia nel campo html che nel campo text.
  • Il campo html ha un limite di dimensioni. Per ulteriori informazioni, vedi Limiti dei campi.

Nota sul miglioramento dei dati:

  • Se vuoi applicare un arricchimento che possa comprendere le tabelle in un documento, il documento deve contenere un campo html.

Modalità di gestione delle date

Le date vengono acquisite in modi diversi da tipi di file differenti.

File non strutturati

Il modo migliore per acquisire informazioni sulla data dal corpo di un documento con dati non strutturati è utilizzare un arricchimento del modello di elaborazione del linguaggio naturale. Ad esempio, l'arricchimento Entità precostruito riconosce le date e le annota nel campo text (o in altri campi del corpo con il tipo di dati String ). In un documento in cui viene applicato l'arricchimento, puoi trovare le date cercando i campi etichettati come enriched_{fieldname}.entities.type=Date.

Dates from metadata date fields, such as extracted_metadata.publicationdate, are stored in the index as dates as long as the date format matches one of the supported date data type formats. You can't see nested fields from the Manage fields page. And when you view a search result as JSON, date field values are displayed as string values because the JSON editor shows the date as a string. However, values from date fields behave like dates. You can use greater than (>) or less than (<) operators with such fields in Discovery Query Language queries, for example.

File strutturati

I file di struttura che si importano, ad esempio i file CSV o JSON, potrebbero contenere campi di data che si desidera archiviare come tipi di dati di data. Discovery può riconoscere molti formati di data. Tuttavia, potrebbe essere necessario aggiungere un formato all'elenco. Per ulteriori informazioni, consultare Impostazioni formato data.

Impostazioni formato data

Se i documenti contengono un campo di livello root con informazioni sulla data, è possibile impostare il campo in modo che sia un campo di tipo di dati Date nell'indice.

Discovery riconosce automaticamente i seguenti formati di data:

yyyy-MM-dd'T'HH:mm:ssZ
yyyy-MM-dd'T'HH:mm:ssXXX
yyyy-MM-dd'T'HH:mm:ss.SSSZ
yyyy-MM-dd'T'HH:mm:ss.SSSX
yyyy-MM-dd
M/d/yy
yyyyMMdd
yyyy/MM/dd

Se si memorizzano le date in altri formati, è possibile aggiungere il formato all'elenco di formati supportati.

Per aggiungere altri formati di data, completare la seguente procedura:

  1. Dalla pagina Gestisci campi per la raccolta, aggiungere un formato come nuova riga nel campo Formati data.

    Specificare un formato di data supportato dalla classe Java SimpleDateFormat.

    Ad esempio, se i record memorizzano solo i valori dell'anno per le date, aggiungere yyyy all'elenco dei formati di data supportati. È quindi possibile impostare il tipo di dati per il campo che contiene un valore anno su Datae rielaborare la raccolta. Di conseguenza, una ricorrenza di 2019 nel campo data viene memorizzata come 2019-01-01T05:00:00Z nell'indice.

    Quando si aggiunge un formato data, è necessario specificare un fuso orario associato per la data.

  2. Specificare un fuso orario.

  3. Facoltativamente, selezionare una locale della data.

    La locale scelta viene utilizzata per analizzare un valore stringa che rappresenta la data per i campi del dataset di tipo data. Ad esempio, utilizzando il formato EEE, MM dd, yyyy, il locale inglese (Stati Uniti) può analizzare il valore della stringa "Wednesday, 07 01, 2020", mentre il locale giapponese (Giappone) può analizzare lo stesso valore della stringa "水曜日, 07 01, 2020".

  4. Se sono già stati importati documenti con date in formati non riconosciuti, rielaborare i documenti.

Discovery non può archiviare una data menzionata in un campo di testo come campo Data nell'indice. Tuttavia, puoi utilizzare un arricchimento come l'arricchimento Entità per identificare le date menzionate nel testo.

Modalità di gestione dei tipi di file

Quando si carica un documento, i dati nel file vengono indicizzati. I diversi tipi di file sono gestiti diversamente da Discovery.

File CSV

Note sull'aggiunta di dati:

  • Ogni riga definita nel file CSV viene aggiunta all'indice come documento separato, ciascuno con lo stesso parent_document_id.

    I documenti secondari in genere hanno un ID documento con la sintassi {parent-ID}_n dove {parent-ID} è l'ID documento del file originale che è stato aggiunto e n è un numero sequenziale. Ad esempio, se carichi un file CSV con 5 righe, vengono aggiunti cinque documenti alla raccolta con ID documento come f5214225c1e03e25190ffcdfad8e84ff_0 tramite f5214225c1e03e25190ffcdfad8e84ff_4.

  • Non è possibile abilitare la funzione OCR (Optical Character Recognition) per file CSV.

  • Se il file CSV ha intestazioni, i nomi intestazione vengono utilizzati per denominare i campi in cui è memorizzato il contenuto della colonna corrispondente. Non utilizzare nomi con significato speciale in Discovery. Assicurarsi che i nomi dei campi siano conformi alle regole di denominazione, ad esempio senza spazi e senza numeri aggiunti. Ad esempio, è possibile rinominare l'intestazione start date in start_date e label1 in label-one prima di aggiungere il file. Per ulteriori informazioni, consultare Modalità di gestione dei campi.

  • Quando un nome di intestazione file CSV contiene caratteri limitati, il convertitore di documenti rimuove automaticamente i caratteri limitati dal nome campo quando aggiunge il campo risultante all'indice.

Nota sul miglioramento dei dati:

  • Non è possibile applicare modelli di Smart Document Understanding precompilati o addestrati dall'utente ai file CSV.

File HTML

Se si carica un file HTML o si esegue la ricerca per indicizzazione in un'origine dati con file HTML, ad esempio un sito Web, viene generato un campo html insieme al campo text. Per ulteriori informazioni, consultare Campi HTML.

File JSON

Note sull'aggiunta di dati:

  • I nomi oggetto dal file JSON di origine vengono usati per denominare i campi in cui è archiviato il contenuto. Non utilizzare nomi con significato speciale in Discovery. Assicurarsi che i nomi siano conformi alle regole di denominazione, ad esempio senza spazi e senza numeri accodati. Ad esempio, è possibile ridenominare l'oggetto updated on in updated_on e answer2 in answer-two prima di aggiungere il file. Per ulteriori informazioni, consultare Modalità di gestione dei campi.

  • Se un campo di livello root è una schiera ma non contiene elementi, il campo viene omesso dall'indice.

  • Se un campo di livello root è un array e contiene solo un elemento, l'array viene indicizzato come tipo di dati di un elemento. Ad esempio, un array di stringhe con una stringa viene indicizzato come stringa.

  • Se un campo nidificato contiene una schiera, anche se la schiera ha un solo valore, viene indicizzata come una schiera.

  • Se un campo di livello root è una schiera e contiene più di una voce, i dati vengono indicizzati come una schiera.

  • Se copi il JSON generato da Discovery e lo carichi quindi come un file JSON, rimuovi prima questi campi generati dal sistema dal file: document_id, parent_document_id, filename e title.

  • Non è possibile abilitare la funzione OCR (Optical Character Recognition) per i file JSON.

  • Se il documento di origine ha un campo con il nome document_id, il campo viene ignorato e non viene aggiunto all'indice nella raccolta.

    Come viene gestito il campo document_id in un file JSON modificato con l'aggiornamento della versione 2023-03-31 dell'API. Prima dell'aggiornamento, quando hai caricato un file JSON dall'interfaccia utente del prodotto o hai utilizzato l'API per aggiungerlo con il metodo Aggiungi documento, il valore nel campo document_id dal file è stato mostrato come il valore document_id nei risultati della query. Tuttavia, un ID documento diverso è stato assegnato ad esso e memorizzato nel campo parent_document_id. L'ID documento assegnato è quello che è stato restituito quando si è chiamato il metodo List documents ed è quello che deve essere usato come document_id nell'endpoint URL per una richiesta del metodo Delete document. Quando si utilizza il metodo Aggiorna documento per assegnare un nuovo document_id, l'ID originale continua a essere restituito nei risultati della query. Tuttavia, l'ID assegnato doveva essere utilizzato per eliminare il documento. Se hai un'applicazione che si basa sul comportamento precedente, puoi specificare un numero di versione precedente a 2023-03-31, come ad esempio 2020-08-30, nelle tue chiamate API.

Note sul miglioramento dei dati:

  • Non è possibile applicare modelli Smart Document Understanding precostruiti o addestrati dall'utente ai file JSON.

  • Quando si applica un arricchimento a un campo dal file JSON, il tipo di dati del campo viene convertito in un array. Il campo viene convertito in un array anche se contiene un singolo valore. Ad esempio, "field1": "Discovery" diventa "field1": ["Discovery"].

  • Solo i primi 50.000 caratteri di un campo personalizzato da un file JSON vengono arricchiti.

  • Nei tipi di progetto in cui l'arricchimento Part of Speech (POS) viene applicato automaticamente, l'arricchimento viene applicato al campo che contiene la maggior parte del contenuto del file nel primo file JSON che viene aggiunto alla raccolta. Questo campo è determinato dalle regole seguenti:

    • Se un campo è denominato text, ad esso viene applicato l'arricchimento POS.
    • Viene scelto il campo con il valore di stringa più lungo e il più alto numero di valori distinti.
    • Se più di un campo soddisfa la condizione precedente, uno dei campi viene scelto in modo casuale.
  • Se si desidera applicare un arricchimento a un campo nidificato, è necessario creare un progetto di estrazione del contenuto e quindi applicare l'arricchimento al campo. Se si desidera utilizzare un tipo di progetto diverso da Content Mining, è possibile riutilizzare la raccolta creata con il tipo di progetto Content Mining altrove. Per ulteriori informazioni, vedi Applicazione degli arricchimenti.

Puoi specificare gli oggetti normalizations e conversions nel metodo Aggiorna una raccolta dell'API per spostare o unire i campi JSON.

Come vengono derivati i passaggi

Discovery utilizza algoritmi sofisticati per stabilire i passaggi migliori di testo da tutti i documenti restituiti da una query. I passaggi vengono restituiti per documento per impostazione predefinita. Vengono visualizzati come una sezione all'interno di ciascun risultato della query del documento e sono ordinati in base alla rilevanza del passaggio.

Discovery utilizza il rilevamento del limite della frase per scegliere un passaggio che include una frase completa. Ricerca i passaggi che hanno una lunghezza approssimativa di 200 caratteri, quindi esamina i blocchi di contenuto che sono il doppio di quella lunghezza per trovare i passaggi che contengono frasi complete. Il rilevamento dei limiti della frase funziona per tutte le lingue supportate e utilizza la logica specifica per la lingua.

Per tutti i tipi di progetto tranne Ricerca conversazionale, è possibile modificare la visualizzazione dei passaggi nei risultati della ricerca dalla pagina Personalizza visualizzazione> Risultati della ricerca. Ad esempio, è possibile configurare il numero di passaggi visualizzati per documento e la dimensione massima dei caratteri per passaggio.