Suddividi documenti per rendere i risultati della query più succinti

Suddividere i documenti in modo che la funzione di ricerca possa trovare informazioni più concise da restituire nei risultati della query.

Per ulteriori informazioni sui vantaggi della suddivisione dei documenti, leggi il post del blog Utilizzo di IBM Watson Discovery's New Document Segmentation Feature su Medium.com.

È possibile suddividere solo i documenti a cui viene applicato un modello Smart Document Understanding preparato dall'utente.

Quando si divide un documento, il documento originale viene suddiviso in segmenti. Ogni segmento contiene una serie di informazioni più uniformi. Suddividendo il contenuto dei tuoi documenti in gruppi segmentati, puoi arricchire e indicizzare i tuoi dati a un livello più granulare.

Per controllare la suddivisione dei documenti, specificare un campo, ad esempio subtitle o question, da utilizzare come contrassegno di interruzione pagina. Le opzioni di interruzione pagina vengono popolate con i campi creati quando si applica un modello SDU (Smart Document Understanding) preparato dall'utente ai documenti. Per ulteriori informazioni, consultare Utilizzo di Smart Document Understanding. Non è possibile suddividere i documenti con campi generati da un modello Smart Document Understanding preaddestrato.

Quando un documento viene rielaborato, viene valutato dall'inizio alla fine. Ogni volta che si verifica il campo contrassegno di interruzione pagina, il documento originale viene suddiviso e viene creato un nuovo segmento. La suddivisione continua ad ogni campo indicatore fino a quando il documento originale non viene suddiviso in più segmenti.

Prima di iniziare, decidere quale campo utilizzare come contrassegno di interruzione pagina.

  • È possibile utilizzare uno qualsiasi dei campi indicizzati per impostazione predefinita. Per visualizzare le scelte, selezionare l'elenco Campi da indicizzare. I campi che hanno un valore Tipo vengono memorizzati nell'indice.
  • Il numero di segmenti per documento è limitato a 1,000. Una volta creato il numero di segmento 999, tutto il contenuto rimanente del documento viene memorizzato nel segmento 1,000.
  • I metadati da documenti PDF e Microsoft Word e tutti i metadati personalizzati vengono estratti e inclusi nell'indice con ciascun segmento.

Prestare attenzione con i documenti che contengono sezioni ripetute, come un catalogo che ha una descrizione e una sezione di specifiche per ogni voce di prodotto. Se si suddivide il documento a un livello troppo granulare, le sottosezioni, ad esempio una sezione con i dettagli della specifica, possono essere dissociate dal prodotto a cui appartengono.

Per suddividere i documenti in una raccolta, completare la seguente procedura:

  1. Fare clic su Gestisci raccolte dal pannello di navigazione e fare clic per aprire una raccolta.

  2. Aprire la pagina Gestisci campi.

    Viene visualizzato un elenco dei campi identificati.

  3. Nella sezione Migliora i risultati della query dividendo i documenti, fare clic su Dividi documento.

  4. Scegliere il campo che si desidera utilizzare come contrassegno di interruzione pagina dall'elenco a discesa Seleziona campo.

    L'elenco da cui è possibile scegliere include un sottoinsieme di tutti i campi identificati.

  5. Fai clic su Apply changes and reprocess.

È possibile controllare lo stato del processo di suddivisione dalla pagina Attività.

Il campo metadati include l'ID documento principale. Ogni segmento risultante del documento originale può contenere informazioni differenti. Ad esempio, se si suddivide il documento in base al campo del sottotitolo, il primo segmento potrebbe contenere solo un campo del titolo. Il segmento successivo potrebbe contenere un sottotitolo e un campo di testo. Il terzo potrebbe contenere un campo sottotitolo, un campo di testo e un campo piè di pagina.

Aggiornamento dei documenti che sono stati suddivisi

Se un documento che era stato suddiviso cambia e si desidera caricare di nuovo il documento, lavorare con uno sviluppatore per sostituire il documento utilizzando l'API. Uno sviluppatore può utilizzare il metodo Aggiorna un documento per sostituire il documento principale originale. Per ulteriori informazioni, consultare il riferimento API. Per fornire la variabile percorso {document_id} che deve essere inviata con la richiesta, copiare il contenuto del campo parent_document_id di uno dei segmenti del documento.

Quando si sostituisce il documento originale, tutti i segmenti vengono sovrascritti, a meno che la versione aggiornata del documento non abbia meno segmenti totali dell'originale. Questi segmenti più vecchi rimangono nell'indice.

Eliminazione di segmenti documento dall'indice

È possibile eliminare i documenti in una raccolta dalla pagina Gestisci dati. Per trovare tutti i segmenti del documento generati da un singolo documento, ricercare i documenti con lo stesso valore del campo metadata.parent_document_id. Per ulteriori informazioni, consultare Esclusione del contenuto dai risultati della query.

IBM Cloud Pak for Data IBM Cloud Pak for Data prima del rilascio 4.6.5

La pagina Gestisci dati è disponibile nelle distribuzioni installate a partire dalla release 4.6.5. Nelle release precedenti, uno sviluppo può eliminare segmenti di documenti utilizzando l'API. Per ulteriori informazioni, vedi delete document API.