Applica un modello SDU preaddestrato

Applica un modello SDU (Smart Document Understanding) precostruito che può estrarre testo e viene addestrato per identificare tabelle, liste e sezioni nei documenti.

Utilizzare il modello preformato se i documenti contengono tabelle con informazioni preziose che si desidera acquisire. Il modello è inoltre in grado di conservare il significato inerente alla struttura di nidificazione di tabelle, elenchi e sezioni. L'utilizzo del modello preformato accelera il processo di acquisizione delle informazioni dalla struttura di un documento.

Se si desidera personalizzare il modo in cui la struttura del documento viene utilizzata per dedurre il significato da un documento o si desidera suddividere i documenti con un campo generato da un modello SDU, creare invece un modello addestrato dall'utente. Per ulteriori informazioni, vedi Definizione di un modello SDU addestrato dall'utente.

Un modello preaddestrato viene applicato automaticamente ai progetti Document Retrieval for Contracts. Invece di annotare il contenuto correlato al contratto nei tuoi documenti, il progetto si applica a un modello che già sa come riconoscere termini e concetti che sono significativi per i contratti.

Preparazione dei documenti

È possibile applicare un modello SDU preaddestrato solo ai tipi di file seguenti:

  • File di immagine (PNG, TIFF, JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

Per un elenco completo dei tipi di file supportati da Discovery, vedi Tipi di file supportati.

Lo strumento Smart Document Understanding utilizza OCR (optical character recognition) per estrarre il testo dalle immagini nei file che analizza. Le immagini devono soddisfare i requisiti minimi di qualità supportati da OCR. Per ulteriori informazioni, consultare Riconoscimento dei caratteri ottici.

Lo strumento non può leggere documenti con le seguenti caratteristiche; rimuoverli dalla raccolta prima di iniziare:

  • I documenti che sembrano avere un testo che si sovrappone ad altro testo sono considerati doppiamente sovrapposti e non possono essere annotati.
  • I documenti che contengono più colonne di testo su una singola pagina non possono essere annotati.

Quando si applica un modello di comprensione intelligente dei documenti, il tempo di conversione della raccolta può aumentare a causa delle risorse necessarie per applicare il modello AI ai documenti.

Applica un modello preaddestrato

Per applicare un modello Smart Document Understanding preaddestrato alla tua raccolta, completa la seguente procedura:

  1. Aprire la pagina Gestisci raccolte dal pannello di navigazione.

  2. Selezionare la raccolta a cui si desidera applicare il modello.

  3. Aprire la pagina Identificare i campi.

  4. Scegliere Modelli pre - addestrati

    L'opzione Solo estrazione testo viene utilizzata per impostazione predefinita. Con questo modello, qualsiasi testo riconosciuto nei documenti di origine viene indicizzato nel campo text.

  5. Fare clic su Inoltra, quindi fare clic su Applica modifiche e rielabora.

Comprensione dell'output

Se il modello SDU trova ed elabora una struttura, come una tabella, nel documento, memorizza una rappresentazione della struttura in un campo denominato enriched_{field}, dove {field} è il campo in cui è stata memorizzata la struttura.

Il seguente estratto mostra la rappresentazione JSON di una tabella dal campo enriched_html di un documento elaborato dal modello SDU preaddestrato.

Mostra un frammento JSON che contiene un campo enriched_html con un oggetto tabella che contiene sezioni come section_title, row_headers, table_headers, location e così via.
JSON table representation

Se si desidera estrarre il testo dalla struttura elaborata, è possibile utilizzare il campo location per trovare i valori di indice che identificano il punto in cui inizia e termina la stringa di testo.

Per ulteriori informazioni sulla struttura delle tabelle indicizzate, consultare Informazioni sulle tabelle.

Risoluzione dei problemi

Seguire queste soluzioni temporanee se si verificano dei problemi quando si utilizza lo strumento Smart Document Understanding.

Risorse insufficienti per elaborare il documento

Errore
Quando si applica un modello preaddestrato alla raccolta, l'elaborazione dei documenti non viene completata correttamente e viene visualizzato un messaggio Insufficient resources to process document.
Causa
L'errore viene visualizzato perché si sono verificati errori di memoria esaurita durante le fasi di analisi, di identificazione della struttura o di assemblaggio del processo che crea il modello di machine learning. Le risorse non sono sufficienti quando uno o più documenti nella raccolta sono troppo grandi o hanno troppe tabelle complesse che lo strumento può gestire.
Soluzione
Esaminare la raccolta per documenti di grandi dimensioni o documenti con molte tabelle e suddividerli in documenti più piccoli prima di applicare il modello preaddestrato alla raccolta. I limiti esatti differiscono in base alla complessità dei documenti. In genere, suddividere i documenti di lunghezza superiore a 400 pagine, evitando di includere più di 20 tabelle complesse in un unico documento.