Questa documentazione è per IBM Watson® Knowledge Studio su IBM Cloud®. Per visualizzare la documentazione della versione precedente di Knowledge Studio nel IBM Marketplace, fai clic su questo link.

Aggiunta di documenti per l'annotazione

Per preparare un modello di machine learning, devi aggiungere i documenti che contengono della conoscenza nella materia, come articoli di giornale o altri testi specifici aziendali, al tuo spazio di lavoro.

Informazioni su quest'attività

Questa sezione descrive come aggiungere i documenti solo per l'annotazione. Per definire le regole per il modello basato sulla regola, aggiungi o carica i documenti da cui vuoi progettare pattern da definire come regole. Consulta Aggiunta di documenti per la definizione delle regole per ulteriori informazioni.

Documenti

Per preparare un modello di machine learning, devi raccogliere i documenti rappresentativi per il tuo contenuto di dominio e di alto valore per la tua applicazione.

Cerca di assicurarti che i tuoi documenti di preparazione rappresentino veramente il contenuto di interesse nel tuo dominio; cioè, che contengano molte citazioni rilevanti che possono essere annotate. Per scegliere i documenti migliori, segui queste linee guida:

  • Sforzati di fornire una serie di documenti che abbiano una dimensione totale di circa 300.000 parole. Fornisci più parole per un sistema tipo complesso e meno per uno più semplice.
  • Limitate ogni documento a una o due pagine di contenuto; è preferibile un numero di parole inferiore a 2.000 e più vicino a 1.000 per documento. Nelle prime fasi di sviluppo del modello, anche il mantenere ogni documento a pochi paragrafi è una procedura consigliata. Un annotatore umano può contrassegnare le citazioni e le relazioni in un documento lungo, ma tentare di contrassegnare le coreferenze tra più pagine potrebbe essere difficile.
  • I documenti sono spesso limitati a 600 menzioni
  • Assicurati che i dati nei documenti siano distribuiti tra tutti i tipi di entità, sottotipi e ruoli possibili e le relazioni tra essi. Un obiettivo per raggiungere ciò è di avere almeno 50 annotazioni per ogni tipo di entità e di relazione nella raccolta di documenti.
  • Inoltre, i documenti dovrebbero rappresentare l'ampiezza della materia che l'applicazione coprirà, ma nel caso di frequenza di ricorrenza distorta dei tipi di entità e di relazione, trova almeno 50 esemplari di ogni tipo, di più per i tipi di entità che hanno citazioni che tendono ad essere frasi.
  • La serie che crei per la preparazione deve contenere almeno 10 documenti annotati.

Quando sei pronto a creare e preparare il modello, i documenti che aggiungi allo spazio di lavoro possono essere divisi in serie che vengono utilizzate come dati di preparazione, di test e senza indicazioni. Le serie di dati suddivise sono importanti per valutare le prestazioni del modello.

Puoi aggiungere i documenti nei seguenti modi. Per ulteriori informazioni sui tipi di documenti supportati, sui limiti di dimensione e altre informazioni, vedi Creazione di uno spazio di lavoro > Riepilogo di input, output e limitazioni.

  • Un file CSV a due colonne nel formato UTF-8
  • File di testo nel formato UTF-8
  • File HTML
  • File PDF (i file scansionati e protetti da password non sono supportati)
  • File Microsoft Word DOC o DOCX (i file protetti da password non sono supportati)
  • Un file .zip che contiene i documenti scaricati da uno spazio di lavoro Knowledge Studio
  • Un file .zip che contiene i file nel formato UIMA CAS XMI

File CSV

Puoi caricare un file CSV a due colonne che contiene il testo di esempio dalla tua macchina locale. Carica un file CSV alla volta. Le prima colonna nel file CSV specifica il nome del file del documento. La seconda colonna nel file contiene il testo del documento. Per un esempio del formato richiesto, si veda il file documents-new.csv Icona del collegamento esterno nei file di esempio del tutorial.

File PDF

In alcuni casi il testo non può essere estratto da un PDF, a seconda di come è stato creato il PDF. Normalmente, il testo non può essere estratto da font incorporati non associati a caratteri unicode. Se non sei sicuro se il testo da un PDF può essere estratto, puoi provare a copiarlo dal PDF e poi incollarlo in un editor di testo. Se non vedi gli stessi caratteri che sono visibili nel PDF stesso, l'estrazione del testo probabilmente non riuscirà.

Documenti formattati

Quando i documenti formattati vengono convertiti in testo semplice, è possibile che la perdita della formattazione causi una scarsa suddivisione in token delle parole. Ad esempio, se una riga di tabella in un file DOCX contiene valori di cella che non terminano con un punto, i valori potrebbero venire convertiti come una frase. Come ulteriore esempio, se un documento PDF contiene una parola molto lunga a cui viene aggiunto un trattino alla fine della riga, tale parola potrebbe venire convertita come due parole. In casi come questi, i documenti potrebbero non essere adatti al machine learning a meno che non pre-elabori i file per correggere le limitazioni di formattazione.

Documenti da un altro spazio di lavoro Watson Knowledge Studio

Se hai precedentemente scaricato i documenti da uno spazio di lavoro Knowledge Studio, puoi caricare il file .zip che hai scaricato. Un'opzione ti permette di specificare se vuoi che le annotazioni ground truth siano incluse nei file importati.

Dopo che i documenti sono stati annotati, vengono archiviati nel formato JSON. La lingua di markup in questi file, che mostra come il testo originale era stato analizzato e suddiviso in token, include gli elementi di tutte le annotazioni aggiunte da un annotatore umano. Per migliorare la precisione del modello nel tempo, puoi caricare questi file in un altro spazio di lavoro, quindi preservando tutte le annotazioni esistenti. Un annotatore umano può revisionare, eliminare e aggiungere le annotazioni a questi documenti o puoi ignorare l'annotazione umana e utilizzarli per creare serie di documenti di preparazione, test e senza indicazioni per valutare e migliorare le prestazioni del modello.

File UIMA CAS XMI

Come aiuto nella preparazione del modello, puoi caricare i documenti che sono stati pre-annotati da un motore di analisi UIMA. I file pre-annotati devono essere nella serializzazione XMI del formato UIMA Common Analysis Structure (UIMA CAS XMI) e combinati in un file ,zip. Ad esempio, puoi caricare i documenti che sono stati annotati in una raccolta IBM Watson Explorer.

Un annotatore umano può revisionare, eliminare e aggiungere le annotazioni a questi documenti o puoi ignorare l'annotazione umana e utilizzarli per creare serie di documenti di preparazione, test e senza indicazioni per valutare e migliorare le prestazioni del modello. Per ulteriori informazioni su come creare questi file e i requisiti per caricarli, vedi Caricamento dei documenti pre-annotati.

Rendere anonimi i dati

Se vuoi creare un modello ottimizzato per i tuoi dati, ma non vuoi caricare i dati come sono in Knowledge Studio per motivi di privacy, puoi prima eliminare dai documenti tutte le informazioni identificabili personalmente (PII) e poi utilizzare questi documenti resi anonimi per preparare il modello. Non censurare le informazioni o sostituirle con le variabili globalmente. Per migliori risultati, sostituisci le informazioni reali con informazioni false dello stesso tipo.

Ad esempio, se il PII che vuoi proteggere sono i nomi dei clienti, invece di censurare ogni nome o sostituirlo con una variabile, come USER_NAME, sostituiscilo con un nome falso che utilizza molti stili di sintassi dei nomi tipici, come Jane Doe, Mr. Smith, Dietrich o Dr. Jones, PhD. Considera di scrivere uno script che concatena molti nomi e cognomi e titoli e cognomi e aggiunge i cognomi solo per creare nomi falsi che possono essere inseriti nel documento per sostituire le istanze di nomi utente reali. L'obiettivo è di simulare il più vicino possibile i valori reali nei documenti di origine. Se lo stesso testo (USER_NAME) viene utilizzato nei documenti o il testo viene censurato, starai sostanzialmente preparando il modello ad aspettarsi che tutti i nomi abbiano lo stesso valore o che siano censurati. Quando il modello viene utilizzato al runtime per i nuovi documenti e incontra nomi mai visti prima in tutta la loro variabilità, vuoi che sia in grado di riconoscerli come nomi.

Aggiunta di documenti a uno spazio di lavoro

Per preparare un modello, devi aggiungere i documenti che rappresentano il tuo contenuto del dominio al tuo spazio di lavoro.

Informazioni su quest'attività

Come procedura consigliata, inizia con una raccolta di documenti relativamente piccola. Utilizza questi documenti per preparare gli annotatori umani (se il tuo spazio di lavoro comporta l'annotazione umana) e per rifinire le linee guida di annotazione. Documenti piccoli possono aiutare gli annotatori umani a identificare le catene di coreferenze attraverso il documento. Come migliora l'accuratezza dell'annotazione, puoi aggiungere ulteriori documenti al corpus per fornire una maggiore profondità al lavoro di preparazione.

Procedura

Per aggiungere i documenti a uno spazio di lavoro:

  1. Accedi come amministratore o gestore del progetto Knowledge Studio e seleziona il tuo spazio di lavoro.

  2. Seleziona la scheda Assets> Documents > Documentation sets.

  3. Fai clic su Upload Document Sets per aggiungere i documenti al corpus.

  4. Carica i documenti in uno dei formati supportati. Per ulteriori informazioni sui tipi di documenti supportati, sui limiti di dimensione e altre informazioni, vedi Creazione di uno spazio di lavoro > Riepilogo di input, output e limitazioni.

    Note sui file .zip di documenti scaricati da un altro spazio di lavoro

    Quando vengono importati i documenti annotati, ne viene rieseguita la tokenizzazione. Questo processo può modificare cosa Knowledge Studio considera essere i limiti della frase. Poiché le annotazioni sono definite per frase, potrebbe essere annullata la validità di alcune di esse durante questo processo. Dopo aver caricato i documenti da un altro spazio di lavoro, dai una rapida controllata alle annotazioni per risolvere eventuali discrepanze.

    • Se hai precedentemente scaricato i documenti da uno spazio di lavoro Knowledge Studio, trascina il file .zip che contiene i documenti scaricati o fai clic per individuare e selezionare il file. Se vuoi includere le annotazioni aggiunte ai documenti prima che sono stati scaricati, assicurati che l'opzione per includere il ground truth sia selezionata prima di fare clic su Upload. Saranno importate solo le annotazioni che sono state promosse a ground truth prima che sono stati scaricati i documenti.
    • Devi caricare il sistema tipo dallo spazio di lavoro originale nel corrente prima di caricare le annotazioni ground truth. Per ulteriori informazioni, vedi Caricamento delle risorse da un altro spazio di lavoro.

    Note sui file .zip di documenti in formato UIMA CAS XMI

    • Se hai precedentemente scaricato i documenti annotati nel formato UIMA CAS XMI, puoi caricare il file .zip che contiene il contenuto analizzato. Specifica che è il tipo di contenuto che vuoi caricare prima di far clic su Upload. Per ulteriori informazioni su come creare questi file e i requisiti per caricarli, vedi Caricamento dei documenti pre-annotati.

  5. Dopo che i documenti sono stati aggiunti, fai clic sui nomi del documento per visualizzarne un'anteprima e verificare che il contenuto sembri OK. Ad esempio, verifica che i file di testo siano nel formato UTF-8 e che non siano visibili problemi di normalizzazione del carattere o segni diacritici nei documenti e controlla le interruzioni della frase. Se è presente un problema, potresti dover pre-elaborare i file prima di aggiungerli al corpus. Vuoi che i documenti siano il più puliti e ben formati possibile prima che il dizionario o l'annotazione umana inizi.

Cosa fare successivamente

Prima di iniziare qualsiasi attività di annotazione umana, dividi il corpus in più serie documenti e assegnale agli annotatori umani.

Gli amministratori e i gestori del progetto possono annotare direttamente le serie di documenti senza creare delle attività di annotazione.

Eliminazione di documenti

Puoi eliminare un documento se determini che non rappresenta del testo di settore standard di cui avrà un beneficio il modello.

Per eliminare un documento, scegli l'opzione che si applica alla tua situazione:

Eliminazione di un documento che non è stato associato a un'attività di annotazione

Se il documento che vuoi eliminare non è associato a un'attività di annotazione, completa la seguente procedura per eliminarlo.

Procedura

Accedi come amministratore Knowledge Studio e seleziona il tuo spazio di lavoro.

  1. Seleziona la scheda Assets> Documents > Document sets.
  2. Seleziona la serie di documenti che contiene il documento che vuoi eliminare. La serie di documenti viene aperta.
  3. Trova il documento che vuoi rimuovere e poi fai clic su Delete.

Eliminazione di un documento associato a un'attività di annotazione e l'annotazione umana non è iniziata

Se il documento che vuoi eliminare è associato a un'attività di annotazione e l'annotazione umana non è ancora iniziata, effettua le seguenti operazioni per eliminarlo.

Procedura

  1. Accedi come amministratore Knowledge Studio e seleziona il tuo spazio di lavoro.

  2. Elimina l'attività di annotazione:

    1. Apri la pagina Machine Learning Model > Annotations. Fai clic sulla scheda Annotation Tasks.
    2. Trova l'attività di annotazione a cui è associato il documento, fai clic sull'icona Show menu sull'attività, quindi fai clic su Delete.
  3. Elimina il documento come illustrato in Eliminazione di un documento che non è stato associato a un'attività di annotazione.

  4. Dopo aver eliminato il documento, ricrea l'attività di annotazione e associa la stessa serie, che ora ha un documento di meno in essa.

Eliminazione di un documento associato a un'attività di annotazione e l'annotazione umana è iniziata

Se il documento che vuoi eliminare è associato a un'attività di annotazione e l'annotazione umana è iniziata, effettua le seguenti operazioni per eliminarlo.

Non eliminare un'attività se è in corso l'annotazione umana altrimenti perderai il lavoro che è in corso.

Procedura

  1. Chiedi agli annotatori umani di ignorare il documento non desiderato nella serie.
  2. Dopo che tutto il lavoro di annotazione è stato completato sugli altri documenti e gli annotatori umani inviano tutti i documenti per aggiungere la serie al ground truth, esamina e accetta i documenti inviati.
  3. Risolvi tutti i conflitti di annotazione.
  4. Quando tutti i documenti fanno parte del ground truth e l'attività è stata completata, eliminala come illustrato in Eliminazione di un documento associato a un'attività di annotazione e l'annotazione umana non è iniziata.
  5. Elimina il documento come illustrato in Eliminazione di un documento che non è stato associato a un'attività di annotazione.

Puoi confermare che le annotazioni nei documenti rimanenti non vadano perse scaricando le serie di documenti ed esaminando i documenti nella cartella gt.

Modello dati

I diagrammi in questo argomento riepilogano il flusso di documenti in un sistema Knowledge Studio e le differenze tra i documenti nel corpus, un'attività di annotazione e il ground truth.

Il corpus contiene i documenti, che sono partizionati in serie di documenti:

  • Un documento non è nulla più che stringhe di testo.
  • Una serie di documenti è un puntatore a un gruppo di documenti. La serie di documenti non contiene copie dei documenti stessi.
  • Alcune serie di documenti possono puntare a un solo documento, una configurazione che puoi controllare tramite il parametro di sovrapposizione che specifichi quando crei le serie di annotazioni.

Questa figura illustra due set di documenti che puntano a tre documenti. I documenti vengono divisi tra le serie. Figura 1. Questa figura illustra due set di documenti che puntano a tre documenti. I documenti vengono divisi tra le serie.

Ground truth comprende le annotazioni (citazioni, relazioni e citazioni di coreferenza) che vengono aggiunte ai documenti. Ground truth è unico per ciascun documento.

Questa figura illustra che la verità di base consiste nelle annotazioni aggiunte al documento 1, al documento 2, al documento 3 e così via. Figura 2. Questa figura illustra che la verità di base consiste nelle annotazioni aggiunte al documento 1, al documento 2, al documento 3 e così via.

Quando crei un'attività di annotazione, vengono create le copie delle annotazioni per ogni documento nella serie di annotazioni che aggiungi all'attività. Gli annotatori umani annotano i documenti. Le annotazioni vengono isolate tra loro e dal ground truth. Un'attività di annotazione è un concetto temporale che esiste per consentire agli annotatori umani di annotare il testo in spazi isolati. Al contrario, ground truth è permanente e unico.

Questa figura illustra che il project manager crea set di annotazioni e li assegna a un compito di annotazione. Dave e Phil, gli annotatori umani, annotano i documenti nelle serie assegnate loro. Figura 2. Questa figura illustra che il project manager crea set di annotazioni e li assegna a un compito di annotazione. Dave e Phil, gli annotatori umani, annotano i documenti nelle serie assegnate loro.

Dopo che il gestore del progetto approva le serie di annotazioni in un'attività di annotazione, le annotazioni nei documenti che non si sovrappongono ad altre serie di annotazioni diventano ground truth. Per i documenti che si sovrappongono tra le serie di annotazioni (rappresentati dal documento 2 in questo esempio), il gestore del progetto deve giudicare e risolvere i conflitti. Le annotazioni nei documenti di sovrapposizione non diventano ground truth finché non vengono approvate tramite il giudizio.

Ground truth viene poi utilizzato per la preparazione e la verifica di un modello di machine learning o può essere utilizzato come base per la prossima iterazione con lo sviluppo del modello. Per utilizzare ground truth in una nuova iterazione, devi creare una nuova attività di annotazione.

Questa figura illustra come le annotazioni aggiunte da due annotatori umani diventino verità di base. Un documento, etichettato documento 2, viene annotato da entrambi gli annotatori umani. Le annotazioni in questo documento di sovrapposizione devono essere giudicate prima di diventare ground truth. Figura 3. Questa figura illustra come le annotazioni aggiunte da due annotatori umani diventino verità di base. Un documento, etichettato documento 2, viene annotato da entrambi gli annotatori umani. Le annotazioni in questo documento di sovrapposizione devono essere giudicate prima di diventare ground truth.