Utilizzo combinato dei modelli acustici e di lingua personalizzati
La personalizzazione del modello acustico è disponibile solo per i modelli di generazione precedente. Non è disponibile per modelli vocali di nuova generazione e di grandi dimensioni.
Puoi migliorare l'accuratezza del riconoscimento vocale utilizzando dei modelli acustici e di lingua personalizzati complementari. Puoi utilizzare entrambi i tipi di modello durante l'addestramento del tuo modello acustico e/o durante il riconoscimento vocale. I modelli di lingua e acustici personalizzati devono appartenere alla stessa istanza del servizio ed entrambi devono personalizzare lo stesso modello di lingua di base.
Addestramento di un modello acustico personalizzato con un modello di lingua personalizzato
I seguenti termini differenziano il modo in cui viene addestrato un modello acustico personalizzato, da solo o con un modello di lingua personalizzato:
- Addestramento senza supervisione si riferisce all'addestramento di un modello acustico personalizzato con i soli dati audio. L'addestramento di un modello acustico personalizzato basato solo sull'audio può migliorare la qualità della trascrizione se le caratteristiche dell'audio del modello personalizzato corrispondono a quelle dell'audio che viene trascritto.
- Addestramento con supervisione moderata si riferisce all'addestramento di un modello acustico personalizzato con un modello di lingua personalizzato complementare o "di supporto". L'addestramento con supervisione moderata è più efficace dell'addestramento senza supervisione nel migliorare la qualità del riconoscimento vocale.
Utilizza l'addestramento con supervisione moderata nei seguenti casi:
-
Quando hai un modello di lingua personalizzato che contiene le trascrizioni dei tuoi file audio.
La trascrizione dei tuoi dati audio non è strettamente necessaria. Tuttavia, l'addestramento con un modello di lingua personalizzato i cui corpora si basano sulle trascrizioni dei tuoi file audio può migliorare il riconoscimento vocale. Ciò è particolarmente vero se i dati audio contengono parole OOV (out-of-vocabulary) che non si trovano nel vocabolario di base del servizio. Il servizio può analizzare i contenuti delle trascrizioni nel contesto, estraendo parole OOV e n-grammi che possono consentirgli di fare un uso più efficace dei tuoi dati audio.
-
Quando hai un modello di lingua personalizzato che è basato su corpora o parole rilevanti per il contenuto dei tuoi file audio.
Se non disponi di trascrizioni dei tuoi file audio, puoi eseguire l'addestramento con un modello di lingua personalizzato che includa parole OOV dallo stesso dominio dei tuoi dati audio. L'addestramento con un modello di lingua personalizzato che include le parole OOV utilizzate nell'audio può migliorare il riconoscimento vocale.
Ad esempio, supponiamo che tu stia creando un modello acustico personalizzato basato sull'audio del call center per prodotti specifici. In modo ottimale, puoi addestrare il modello acustico personalizzato con un modello di lingua personalizzato che contiene le trascrizioni delle chiamate correlate. Se le trascrizioni non sono disponibili, puoi comunque eseguire l'addestramento con un modello di lingua personalizzato che includa solo i nomi di prodotti specifici gestiti dal call center.
Linee guida per l'utilizzo dell'addestramento con supervisione moderata
Segui queste linee guida quando hai le trascrizioni dei file audio dal modello acustico personalizzato:
-
Crea un modello di lingua personalizzato dedicato il cui unico scopo è quello di aiutare ad addestrare questo specifico modello acustico personalizzato. Il modello di supporto dedicato può contenere più trascrizioni per più file audio dello stesso modello acustico personalizzato. Può anche includere parole personalizzate rilevanti per i file audio, sebbene le trascrizioni siano più efficaci nell'addestramento del modello acustico personalizzato.
-
Utilizza il modello di lingua personalizzato dedicato esclusivamente per addestrare il modello acustico personalizzato. Una volta che il modello acustico personalizzato è stato addestrato, il modello di lingua personalizzato deve essere utilizzato solo se aggiorni i file audio nel modello acustico.
-
Aggiungi le trascrizioni dei tuoi file audio al modello di lingua personalizzato sotto forma di corpora. Non è strettamente necessario che un corpus includa una sola frase per riga. Ma come avviene con tutti i corpora, il servizio fa un uso notevolmente migliore di un corpus che include ogni frase sulla sua propria riga. In generale, le espressioni più brevi che occupano righe separate del corpus sono più efficaci.
-
Non è né necessario né possibile associare uno specifico corpora a uno specifico file audio. Un modello di lingua personalizzato può contenere più corpora, proprio come un modello acustico personalizzato può includere più file audio. Tutti i contenuti di un modello di lingua personalizzato aiutano a migliorare la trascrizione interna dell'audio che il servizio genera durante il processo di addestramento.
-
Non è necessario che una trascrizione rifletta alla lettera tutte le frasi e le parole dell'audio. Può includere solo frasi e parole dell'audio rilevanti per il dominio. Per la personalizzazione del modello di lingua e del modello acustico, i dati di addestramento devono riflettere l'effettivo caso di utilizzo del parlato che vuoi riconoscere. Se solo il 20 percento dei dati (trascrizione o audio) è specifico per il dominio del caso di utilizzo, utilizza solo quel 20 percento dei dati per l'addestramento.
Tuttavia, se stai utilizzando la personalizzazione del modello acustico per ottenere risultati migliori per il parlato con accento (ad esempio, per il parlato di non madrelingua), mantieni quanto più audio possibile, anche se non è rilevante per il dominio. Lo stesso vale se stai utilizzando la personalizzazione del modello acustico per migliorare l'accuratezza del riconoscimento vocale in condizioni acustiche difficili, come un sottofondo rumoroso.
-
Non è necessario che una trascrizione letterale contenga le disfluenze, i tic verbali e le affermazioni di riempimento che sono comuni nel linguaggio umano. Puoi rimuovere questi elementi dalla trascrizione, dall'audio o da entrambi. (Puoi anche rimuovere l'audio in cui le persone parlano tra loro, poiché ciò non contribuisce all'addestramento.)
Ad esempio, supponiamo che una trascrizione letterale includa la seguente frase:
So that's, uhm, you know, that, as I say, is the is the predominant form today.Puoi modificare queste peculiarità dalla trascrizione, dall'audio o da entrambi per creare la seguente frase:
So that as I say is the predominant form today.
Esecuzione dell'addestramento con supervisione moderata
Per addestrare un modello acustico personalizzato con un modello di lingua personalizzato, utilizza il parametro di query custom_language_model_id facoltativo del metodo POST /v1/acoustic_customizations/{customization_id}/train.
Passa il GUID del modello acustico con il parametro customization_id e il GUID del modello di lingua personalizzato con il parametro custom_language_model_id. Entrambi i modelli devono appartenere alle credenziali
passate con la richiesta.
- Assicurarti che il modello di lingua personalizzato sia completamente addestrato e nello stato
available. L'addestramento ha esito negativo se il modello di lingua personalizzato non è disponibile (available). - Assicurarti che entrambi i modelli personalizzati si basino sulla stessa versione dello stesso modello di base. Se viene resa disponibile una nuova versione del modello di base, devi eseguire l'upgrade di entrambi i modelli alla stessa versione del modello di base per consentire l'addestramento. Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
Esempio di addestramento con supervisione leggera
La seguente richiesta di esempio mostra un modello di lingua personalizzato utilizzato per preparare un modello acustico personalizzato:
IBM Cloud
curl -X POST -u "apikey:{apikey}" \
"{url}/v1/acoustic_customizations/{customization_id}/train?custom_language_model_id={customization_id}"
IBM Cloud Pak for Data IBM Software Hub
curl -X POST \
--header "Authorization: Bearer {token}" \
"{url}/v1/acoustic_customizations/{customization_id}/train?custom_language_model_id={customization_id}"
Utilizzo di modelli acustici e linguistici personalizzati per il riconoscimento vocale
Puoi specificare sia un modello di lingua personalizzato che un modello acustico personalizzato con qualsiasi richiesta di riconoscimento vocale. Se il tuo audio contiene parole OOV specifiche per il dominio, la personalizzazione del modello acustico da sola non può produrre in modo affidabile quelle parole durante il riconoscimento vocale. L'utilizzo di un modello di lingua personalizzato che contiene parole OOV dal dominio dell'audio è l'unico modo per espandere il vocabolario di base del servizio.
L'utilizzo di un modello di lingua personalizzato può migliorare l'accuratezza della trascrizione indipendentemente dal fatto che tu abbia addestrato il modello acustico personalizzato con il modello di lingua personalizzato:
- L'utilizzo dei modelli di lingua e acustici personalizzati durante l'addestramento migliora la qualità del modello acustico personalizzato.
- L'utilizzo di entrambi i tipi di modello durante il riconoscimento vocale migliora la qualità della trascrizione.
Se un modello di lingua personalizzato include delle grammatiche, puoi anche utilizzare tale modello e una delle sue grammatiche con un modello acustico personalizzato durante il riconoscimento vocale.
Per una richiesta di riconoscimento vocale, utilizza i parametri acoustic_customization_id e language_customization_id per passare i GUID dei modelli acustici e di lingua personalizzati per la richiesta. Entrambi i
modelli personalizzati devono appartenere alle credenziali passate con la richiesta, entrambi devono essere basati sullo stesso modello di base (ad esempio, en-US_BroadbandModel) ed entrambi devono essere nello stato available.
Per ulteriori informazioni sugli effetti dell'upgrade del modello personalizzato sul riconoscimento vocale con entrambi i tipi di modelli personalizzati, vedi Considerazioni sull'uso congiunto di modelli acustici e di lingua personalizzati.
Esempio di utilizzo di modelli acustici e di lingua personalizzati
La seguente richiesta di esempio passa sia i modelli acustici personalizzati che quelli linguistici personalizzati al metodo HTTP POST /v1/recognize :
IBM Cloud
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file1.flac \
"{url}/v1/recognize?acoustic_customization_id={customization_id}&language_customization_id={customization_id}"
IBM Cloud Pak for Data IBM Software Hub
curl -X POST \
--header "Authorization: Bearer {token}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file1.flac \
"{url}/v1/recognize?acoustic_customization_id={customization_id}&language_customization_id={customization_id}"
Per una richiesta HTTP asincrona, specifichi i parametri quando crei il lavoro asincrono. Per una richiesta WebSocket, passi i parametri quando stabilisci una connessione. Per ulteriori informazioni, vedi Utilizzo di un modello di lingua personalizzato per il riconoscimento vocale e Utilizzo di un modello acustico personalizzato per il riconoscimento vocale.