Analisi dei dati con l'applicazione Content Mining

Utilizzare l'applicazione Content Mining Discovery per analizzare i propri dati. L'applicazione mostra sottoinsiemi di informazioni nelle visualizzazioni che possono aiutare a individuare modelli, tendenze e anomalie.

Solo gli utenti delle distribuzioni installate o delle distribuzioni gestite con i piani Enterprise e Premium possono utilizzare l'applicazione Content Mining.

Video introduttivo

Trascrizione del video

Watson Discovery Content Mining Project presentato da Stuart Strolin. (Introduzione musicale) Lo scopo di questo video è quello di familiarizzare con il progetto di content mining in Watson Discovery.

Il content mining è uno dei casi di utilizzo principali per Watson Discovery e viene utilizzato per analizzare ed esplorare dati strutturati e non strutturati per trovare informazioni dettagliate ed estrarre significati nascosti. Viene utilizzato sia dall'analista cittadino che dal data scientist.

Il progetto di estrazione del contenuto può essere utilizzato per tutti i tipi di analisi in quanto l'interfaccia utente non è specifica per un particolare settore o serie di dati.

In questo scenario, l'utente è un analista per una società automobilistica fittizia. I rapporti operativi hanno allertato la società di un insolito tasso di incidenti per una delle loro auto. Il tuo lavoro e'scoprire perche '.

Utilizzando il progetto di estrazione del contenuto, è possibile iniziare l'analisi esaminando i dati non strutturati dai report degli incidenti automobilistici nazionali. Ti viene presentata un'interfaccia che ti consente di selezionare il modello di auto e iniziare la tua analisi (nella pagina Collezioni). In questo caso, sei interessato al Hill Walker. È possibile immettere tali informazioni nella sezione di ricerca all'inizio della pagina. Ma è più semplice fare clic sull'elemento. È possibile aggiungere tutti i termini e le condizioni di ricerca desiderati. Ma in realtà, si desidera lasciare che l'applicazione guida la vostra analisi.

Ora viene visualizzata la vista di navigazione (in modalità guidata). Tiene traccia della tua analisi e fornisce opzioni per i passi successivi. Fornisce anche un conteggio del numero di documenti che corrispondono allo stato corrente dell'analisi. In questa piccola raccolta, il numero di documenti relativi al Hill Walker è solo 51. In un set di dati di produzione, il numero di solito è molto più grande. Analizzare le tendenze e le anomalie è spesso un buon modo per iniziare in quanto consente di vedere se qualcosa sembra fuori dal comune.

Immediatamente, si nota che il Hill Walker ha problemi in dicembre e gennaio. Si decide di indagare ulteriormente restringendo questa esplorazione iniziale solo al mese di dicembre.

Notare che la vista di navigazione in alto ti tiene sempre informato su dove ti trovi nella tua analisi. Successivamente, si seleziona Analizza la causa e le caratteristiche perché si è interessati al motivo per cui le cose stanno accadendo.

Si nota che parole come "neve" e "freno" sono evidenziate insieme (nella sezione Parte del discorso), in modo da aggiungerle alla propria analisi.

Il progetto Content Miner ha ristretto l'indagine a un numero limitato di reclami che possono essere facilmente letti. (clic su Mostra documenti)

Il tema comune qui è che c'è un problema inaspettato con il modo in cui i freni stanno lavorando in condizioni di neve. Ora hai le informazioni necessarie per chiedere al dipartimento di ingegneria di eseguire un'ispezione dettagliata dell'impianto frenante e determinare perché non funziona come previsto in condizioni di neve.

In questa dimostrazione, è stato illustrato in che modo un analista cittadino che utilizza Watson Discovery e il content mining può rilevare facilmente il significato nascosto in un testo non strutturato. (elenco di funzioni, funzionalità e casi di utilizzo)

Cosa farai con un Watson Discovery? (Musica outro)

Come funziona

Per analizzare i dati, utilizzare i facet. I facet forniscono un modo per suddividere i dati e visualizzare un sottoinsieme di informazioni in modo che sia più semplice da comprendere.

Dalla pagina di analisi dei dati per la propria raccolta, è possibile scegliere che i dati vengano mostrati in una delle seguenti viste:

Facet
Mostra i facet derivati dalle annotazioni che vengono aggiunte ai tuoi documenti dagli arricchimenti applicati ai tuoi documenti. Gli arricchimenti possono includere arricchimenti Natural Language Processing integrati, come Parte del discorso o Entità. Possono anche includere arricchimenti personalizzati che aggiungi, come dizionario, modelli di espressione regolare e modelli di machine learning.
Facet metadati
Mostra i facet derivati dai dati. Quando aggiungi i file a una raccolta, Discovery analizza e indicizza i dati. Le annotazioni vengono aggiunte per identificare tipi di contenuto e vengono mostrate come facet di metadati. I migliori facet di metadati si verificano quando si inserisci dati strutturati, come i record da un file CSV. La lunghezza massima di un facet di metadati è 256 caratteri.
Personalizzato
Mostra solo i facet che si sceglie di aggiungere alla vista. È possibile aggiungere una combinazione di facet derivati dall'arricchimento e derivati dal contenuto alla vista personalizzata.

Quando si crea un tipo di progetto Content Mining, il facet Parte di discorso viene applicato automaticamente ai dati. Questo aspetto è un ottimo punto di partenza perché è valido per tutti i dati, indipendentemente dall'oggetto. L'output consente di esaminare rapidamente la terminologia più comune nei dati.

Watson Discovery content mining launch page
Watson Discovery Content Mining application home page

Da questo punto di partenza, è possibile determinare altri modi per filtrare i dati che potrebbero essere utili.

Se i tuoi dati sono costituiti da report sul traffico, ad esempio, il facet Part of Speech potrebbe mostrare che le parole chiave ad alta frequenza includono termini come engine, brake, fire, smokee spark. Data questa terminologia comune, è possibile creare dei dizionari che consentono di categorizzare e filtrare i dati. Le parole chiave dell'esempio potrebbero indurre a creare i seguenti dizionari:

  • Dizionario component per termini come motore e freno
  • Dizionario phenomenon per termini quali fuoco, fumo e scintilla

Quando applichi l'arricchimento del dizionario ai tuoi dati, genera annotazioni. Puoi pensare alle annotazioni come tag che aggiungi a parole o frasi, dove il tag categorizza o identifica il significato della parola o della frase. Le annotazioni risultanti funzionano come nuovi facet che è possibile utilizzare per filtrare e sezionare ulteriormente i dati.

Con i tuoi nuovi facet component e phenomenon, ad esempio, puoi ricercare le correlazioni tra componenti e fenomeni coinvolti in incidenti di traffico.

Informazioni sui modi in cui è possibile analizzare i dati.

Scavare più a fondo

Per approfondire ulteriormente i tuoi dati, applica o crea modelli AI in grado di trovare diversi tipi di informazioni nei tuoi documenti. Puoi applicare i modelli di elaborazione del linguaggio naturale integrati, come l'arricchimento Entità che può riconoscere le citazioni di cose comunemente note, come i nomi di business o di ubicazione e altri tipi di nomi appropriati. In alternativa, puoi applicare un modello personalizzato che riconosca termini e categorie univoci per i tuoi dati.

Estendere l'analisi aggiungendo i propri facet.

Introduzione

Prima di poter utilizzare l'applicazione, devi creare un progetto Content Mining Discovery. Dopo che il progetto è stato creato e i dati sono stati caricati, è possibile aprire l'applicazione Content Mining.

Per ulteriori informazioni, vedi Creazione di progetti.

Naturalmente, non è possibile ottenere informazioni utili se non si inserisce il giusto tipo di informazioni. Assicurarsi di includere dati congruenti. Se si desidera trovare le tendenze nel tempo, i dati devono includere i punti dati che specificano una data.

I dati inoltrati in formato file CSV sono ottimali. Per un esempio di file CSV che fornisce funzioni di analisi interessanti, consultare Analisi dei file CSV.