Scegli arricchimenti
Aggiungi risorse che possono insegnare a Discovery i termini o i pattern che hanno un significato speciale per la tua applicazione.
La seguente tabella descrive le migliori risorse da aggiungere per soddisfare le diverse esigenze.
| Obiettivo | Risorsa | Note |
|---|---|---|
| Definire le categorie in base alle quali il testo nei documenti può essere classificato. | Classificatore | N/D |
| Riconosci termini e sinonimi per termini che sono significativi per te, come ad esempio i nomi dei prodotti che vendi. | Dizionario | N/D |
Definire espressioni regolari che catturino i modelli di significatività, ad esempio AB10045 è la sintassi utilizzata per i numeri di ordine. |
Espressioni regolari | N/D |
| Riconoscere e contrassegnare le entità e le relazioni definite in un modello di machine learning personalizzato. | Modelli di machine learning | Richiede un modello creato ed esportato da un altro strumento IBM. |
| Applica le regole ai campi che si basano su regole che hai definito creando un modello di regole avanzate in IBM Watson® Knowledge Studio. | Modelli di regole avanzate | Richiede un modello di regole avanzate creato ed esportato da IBM Watson® Knowledge Studio o che utilizza una risorsa Pattern esportata. |
| IBM Cloud Riconosci i termini menzionati nelle frasi che corrispondono a un modello sintattico che insegni a riconoscere Discovery. | Modelli(beta) | Disponibile come funzione beta per le raccolte in lingua inglese solo nelle distribuzioni gestite. L'arricchimento derivato dalla definizione dei modelli non può essere applicato ai progetti Content Mining. È possibile esportare la risorsa e utilizzarla come modello di regole avanzate. |
| Riconosce le entità che identifichi come significative eseguendo il training di un modello di machine learning dell'estrattore di entità. | Estrattore entità | Supporta l'avvio da un corpus importato Knowledge Studio. |
| Classificare le frasi nei documenti in classi di frasi definite dall'utente. | Classificatore frase | Supporta l'etichettatura intelligente per velocizzare il processo di etichettatura. |
In alternativa, puoi applicare gli arricchimenti NLP Watson integrati che trovano le seguenti informazioni nella tua raccolta:
È possibile estrarre il significato dai documenti in base alla struttura del documento definendo un modello SDU (Smart Document Understanding). Utilizzare lo strumento Smart Document Understanding per identificare nuovi campi in base ai quali indirizzare gli arricchimenti o suddividere i documenti di grandi dimensioni in blocchi più gestibili. Per ulteriori informazioni, consultare Significato strutturale con SDU.
I dizionari e i classificatori che aggiungi ad un progetto possono essere utilizzati da altri progetti.
Per ulteriori informazioni su come ottenere il massimo dagli arricchimenti, leggi il post del blog Enriching your documents can rendere la ricerca più efficace.
Scelta del tipo di arricchimento corretto
Il seguente diagramma ti aiuta a scegliere l'arricchimento giusto per il tuo caso di utilizzo.
Utilizzo congiunto degli arricchimenti
Puoi utilizzare insieme molti arricchimenti per affrontare varie sfide che potresti incontrare quando sviluppi un'applicazione di ricerca.
Molti team iniziano creando un arricchimento dictionary. I dizionari sono un ottimo strumento per identificare termini importanti e contrassegnarli in modo che possano essere recuperati in un secondo momento. Diciamo che si
sta costruendo un'applicazione di ricerca che ha bisogno di estrarre gli ingredienti dalle ricette. Un arricchimento del dizionario può riconoscere le citazioni della maggior parte degli ingredienti. Tuttavia, l'arricchimento del dizionario
potrebbe corrispondere parzialmente a termini di due parole. Per termini come olive oil o mustard greens, potrebbe riconoscere in modo non corretto solo olive e mustard. Per migliorare l'accuratezza
della ricerca, puoi aumentare l'arricchimento del dizionario con un arricchimento pattern che può riconoscere le citazioni degli ingredienti di due parole. Forse alcune ricette menzionano i codici della colorazione alimentare
in formato europeo (E104). Puoi aggiungere un arricchimento espressione regolare per riconoscere le occorrenze dei codici con la sintassi E1nn. Infine, per rilevare i termini che nessun altro arricchimento
può riconoscere, puoi utilizzare un arricchimento machine learning. L'arricchimento può essere uno che crei in uno strumento esterno e importa in Discovery o uno che crei in Discovery creando un arricchimento entity extractor.
L'arricchimento dell'estrattore di entità è più sofisticato degli altri arricchimenti. Ad esempio, un arricchimento del dizionario riconosce soltanto le corrispondenze esatte dei termini e sinonimi del dizionario che si verificano nei documenti. Un arricchimento dell'espressione regolare riconosce solo modelli specifici. Al contrario, le ricorrenze di un'entità vengono riconosciute in base al contesto in cui un esempio di entità viene citato in una frase.
Ad esempio, è possibile che si desideri riconoscere le ubicazioni e che il documento che si desidera elaborare contenga i seguenti tipi di frasi:
- Vivo in
Massachusetts. - Stiamo viaggiando da
New York CityaParisla prossima settimana.
Per utilizzare un arricchimento del dizionario per riconoscere correttamente i nomi di ubicazione, il dizionario deve elencare tutte le ubicazioni possibili. Tuttavia, se utilizzi un arricchimento dell'estrattore di entità, puoi identificare
quando un'ubicazione viene menzionata in base a come si fa riferimento all'ubicazione in una frase. Con frasi come "Io vivo in x" o "Io vengo da x" o "Sto viaggiando in x"
nei suoi dati di addestramento, l'estrattore di entità può imparare che x è un riferimento a un'ubicazione.
Quando devi scegliere tra l'utilizzo di un dizionario o un arricchimento dell'estrattore di entità, segui queste linee guida:
-
Se l'elenco degli esempi possibili è breve, utilizzare un dizionario.
È più efficiente definire un termine del dizionario
planetcon sinonimi comeEartheSaturnpiuttosto che creare un'entitàplanetperché nel nostro sistema solare esistono solo 8 pianeti. Tuttavia, non è possibile definire un elenco di tutte le possibili posizioni sulla Terra. Un estrattore di entità può riconoscere ulteriori citazioni di ubicazione. -
Se l'elenco di esempi possibili è statico, utilizzare un dizionario.
Polemiche su Plutone a parte, la categoria
planetè un buon esempio anche qui perché la lista dei pianeti nel nostro sistema solare è statica. O forse vuoi monitorare le opinioni generali dei clienti sui tuoi prodotti. Devi essere in grado di riconoscere le citazioni del nome del prodotto, ma potresti non aver bisogno di specifiche. Se si dispone di un'ampia varietà di nomi di prodotti, è possibile creare un'entitàproduct name. Man mano che vengono aggiunti nuovi prodotti al portfolio o che i nomi dei prodotti cambiano nel tempo, non è necessario mantenere un elenco di prodotti complessivo. L'estrattore di entità può continuare a riconoscere il feedback generale sui propri prodotti in base al contesto delle frasi in cui vengono menzionati i prodotti.
Aggiungi una risorsa
Quando aggiungi un arricchimento personalizzato a un progetto, questo è disponibile per qualsiasi raccolta nel progetto.
Per aggiungere una risorsa, completate i seguenti passaggi:
-
Aprire il progetto e passare alla pagina Migliora e personalizza.
-
Nel pannello Strumenti di miglioramento, espandere Teach domain concepts e scegliere la risorsa che si desidera aggiungere.
Dopo che hai creato la risorsa, diventa un nuovo tipo di arricchimento che puoi applicare ai tuoi dati.
-
Specificare la raccolta e il campo in cui applicare l'arricchimento.
Puoi applicare gli arricchimenti ai campi
textehtmle ai campi personalizzati che sono stati aggiunti dai file JSON o CSV caricati o dallo strumento SDU (Smart Document Understanding). Solo i primi 50.000 caratteri di un campo personalizzato da un file JSON vengono arricchiti.Ad esempio, se si aggiunge un dizionario e si sceglie di applicarlo al campo
textdi una raccolta, i documenti nella raccolta vengono rielaborati. Se il terminevehicleviene specificato come sinonimo della voce del dizionariocare ricorre nel testo del documento,vehicleviene contrassegnato come una citazione del tipo di voce del dizionariocar. Se un cliente successivamente cercacar, il passaggio che contiene la citazionevehicleviene incluso nei risultati della ricerca.Se il campo che scegli proviene da un file JSON, dopo aver applicato l'arricchimento, il tipo di dati del campo viene convertito in un array. Il campo viene convertito in un array anche se contiene un singolo valore. Ad esempio,
"field1": "Discovery"diventa"field1": ["Discovery"].
Puoi scegliere di applicare gli arricchimenti derivati dalla risorsa ai tuoi dati in un secondo momento. Gli arricchimenti che aggiungi a un progetto sono disponibili per l'utilizzo da qualsiasi raccolta nel progetto. Vai alla pagina Manage collections, scegli la raccolta in cui vuoi applicare l'arricchimento e apri la scheda Enrichments. Assicurati che lo stato dell'arricchimento mostri che è Prontoe quindi applica l'arricchimento a un campo nella raccolta. Gli arricchimenti che abiliti vengono applicati ai documenti in ordine casuale. Per ulteriori informazioni, vedi Gestione degli arricchimenti.
Dall'applicazione Content Mining distribuita, puoi creare un classificatore o un annotatore personalizzato da un dizionario, un'espressione regolare, un machine learning o un file PEAR e utilizzarlo come un arricchimento nelle raccolte archiviate in altri tipi di progetto. Per ulteriori informazioni, consultare Aggiunta di facet.