Informazioni sulla personalizzazione

Il servizio IBM Watson® Speech to Text offre un'interfaccia di personalizzazione che puoi utilizzare per aumentare le sue funzionalità di riconoscimento vocale. È possibile utilizzare la personalizzazione per migliorare la precisione delle richieste di riconoscimento vocale modificando un modello base per il proprio dominio e audio.

L'interfaccia di personalizzazione supporta sia i modelli di lingua personalizzati che i modelli acustici personalizzati. Le interfacce per entrambi i tipi di modello personalizzato sono simili e semplici da utilizzare. Anche l'uso di entrambi i tipi di modello personalizzato con una richiesta di riconoscimento è semplice: specifichi l'ID di personalizzazione del modello con la richiesta.

Il riconoscimento vocale funziona allo stesso modo con o senza un modello personalizzato. Quando si utilizza un modello personalizzato per il riconoscimento vocale, è possibile utilizzare tutti i parametri normalmente disponibili con una richiesta di riconoscimento. Per ulteriori informazioni su tutti i parametri disponibili, vedi Riepilogo dei parametri.

IBM Cloud Devi disporre del piano dei prezzi Plus, Standard o Premium per utilizzare il modello di lingua o la personalizzazione del modello acustico. Gli utenti del piano Lite non possono utilizzare la personalizzazione, ma possono eseguire l'aggiornamento al piano Plus per ottenere l'accesso alla personalizzazione. Per ulteriori informazioni, vedi le FAQ sui prezzi.

Personalizzazione del modello di lingua

Per ulteriori informazioni sulle lingue e i modelli che supportano la personalizzazione del modello di lingua e il loro livello di supporto (generalmente disponibili o beta), vedi Supporto lingua per la personalizzazione.

Il servizio è stato sviluppato tenendo conto di un vasto pubblico generale. Il vocabolario di base del servizio contiene molte parole usate nelle conversazioni di tutti i giorni. I suoi modelli forniscono un riconoscimento sufficientemente accurato per molte applicazioni. Ma possono avere una scarsa conoscenza di termini specifici associati a particolari domini.

L'interfaccia di personalizzazione del modello di lingua può migliorare l'accuratezza del riconoscimento vocale per domini come medicina, legge, tecnologie dell'informazione (IT) e altri. Utilizzando la personalizzazione del modello di lingua, puoi espandere e adattare il vocabolario di un modello di base per includere la terminologia specifica per il dominio.

Crea un modello di lingua personalizzato e aggiungi corpora e parole specifici per il tuo dominio. Una volta addestrato il modello di lingua personalizzato sul tuo vocabolario migliorato, puoi utilizzarlo per il riconoscimento vocale personalizzato. In genere, il servizio può addestrare qualsiasi modello personalizzato in pochi minuti. Il tempo e l'impegno necessari per creare un modello personalizzato dipendono dai dati disponibili per il modello.

La personalizzazione del modello di linguaggio è disponibile per modelli di voce di grandi dimensioni, modelli di generazione precedente e modelli di nuova generazione, ma la personalizzazione funziona in modo diverso per modelli di voce di grandi dimensioni, modelli di generazione precedente e di nuova generazione. La documentazione descrive le differenze. Per ulteriori informazioni introduttive sulla personalizzazione del modello di lingua, consultare

Personalizzazione migliorata del modello di lingua per modelli di nuova generazione

La personalizzazione del modello di lingua per i modelli di nuova generazione è stata migliorata. I miglioramenti alla personalizzazione del modello di lingua vengono applicati ai modelli di nuova creazione in modo incrementale, a partire dai modelli per alcune lingue. Nel tempo, altri modelli di linguaggio di nuova generazione saranno migrati alla tecnologia migliorata.

  • Per identificare i modelli che utilizzano la tecnologia migliorata, cercare una data nella colonna Personalizzazione del modello di lingua (migliorata) della tabella 2 in Supporto di personalizzazione per i modelli di nuova generazione. Verifica la data della versione del servizio che utilizzi, IBM Cloud, IBM Software Hub o IBM Cloud Pak for Data. Tale data indica quando il modello di nuova generazione è stato migrato alla tecnologia migliorata.
  • Per trarre vantaggio dalla tecnologia migliorata, devi eseguire l'upgrade di qualsiasi modello di lingua personalizzato basato su un modello di nuova generazione migliorato. Una volta che un modello personalizzato si basa su un modello di nuova generazione migliorato, il servizio continua a eseguire tutti gli aggiornamenti necessari quando il modello personalizzato viene riaddestrato. Per ulteriori informazioni, vedi Aggiornamento di un modello di lingua personalizzato basato su un modello di nuova generazione migliorato.

Per i modelli di lingua basati sulla nuova tecnologia, sono stati ottimizzati i seguenti parametri per un migliore riconoscimento vocale:

  • Il valore predefinito customization_weight è stato modificato da 0.2 a 0.1. Un customization_weight non predefinito che avevi precedentemente associato ai tuoi modelli personalizzati viene rimosso. Per ulteriori informazioni, vedi Utilizzo del peso di personalizzazione.
  • Il valore predefinito character_insertion_bias rimane 0.0, ma i modelli sono stati modificati in modo da rendere meno necessario l'utilizzo del parametro per il riconoscimento vocale. Per ulteriori informazioni, vedi Bias di inserimento dei caratteri.

Utilizzare le seguenti linee guida quando si utilizzano questi parametri:

  • Se si utilizzano i valori predefiniti per questi parametri, continuare. I valori predefiniti continueranno probabilmente a offrire i migliori risultati per il riconoscimento vocale.
  • Se si specificano valori non predefiniti per questi parametri, provare con i valori predefiniti. Il tuo modello personalizzato potrebbe funzionare bene per il riconoscimento vocale con i valori predefiniti.
  • Se ritieni che l'utilizzo di valori differenti per questi parametri potrebbe migliorare il riconoscimento vocale con il tuo modello personalizzato, prova le modifiche incrementali per determinare se i parametri sono necessari per migliorare il riconoscimento vocale.

Modelli di lingua di nuova generazione supportati:

  • RNNT_CUSTOMIZATION_SUPPORTED_LANGS =
    • en-US_Multimedia
    • en-GB_Multimedia
    • en-AU_Multimedia
    • en-IN_Multimedia
    • en-US_Telephony
    • en-GB_Telephony
    • en-AU_Telephony
    • en-IN_Telefonia
    • JA - JP_Multimedia
    • ja-JP_Telephony
    • fr - FR_Multimedia
    • fr - FR_Telephony
    • deDE_Multimedia
    • deDE_Telefonia
    • fr-CA_Multimedia
    • pt-BR_Multimedia
    • pt-BR_Telephony

Personalizzazione del modello acustico

La personalizzazione del modello acustico è disponibile solo per i modelli di generazione precedente. Non è disponibile per i modelli vocali di grandi dimensioni e i modelli di nuova generazione.

Il servizio è stato sviluppato con modelli acustici di base che funzionano bene per varie caratteristiche audio. Tuttavia, in casi come quelli che seguono, l'adattamento di un modello di base per adeguarlo al tuo audio può migliorare il riconoscimento vocale:

  • Il tuo ambiente del canale acustico è univoco. Ad esempio, l'ambiente è rumoroso, la qualità o il posizionamento del microfono non sono ottimali oppure l'audio risente di effetti di campo lontano.
  • I discorsi dei parlanti sono atipici. Ad esempio, un parlante parla in modo eccessivamente veloce o l'audio include conversazioni casuali.
  • Gli accenti dei parlanti sono pronunciati. Ad esempio, l'audio include parlanti che parlano in una lingua non nativa o seconda lingua.

L'interfaccia di personalizzazione del modello acustico può adattare un modello di base al tuo ambiente e ai tuoi parlanti. Crea un modello acustico personalizzato e aggiungi dati audio (risorse audio) che corrispondano il più possibile alla firma acustica dell'audio che vuoi trascrivere. Una volta addestrato il modello acustico personalizzato con le tue risorse audio, puoi utilizzarlo per il riconoscimento vocale personalizzato.

Il tempo che impiega il servizio per addestrare il modello personalizzato dipende dalla quantità di dati audio contenuti nel modello. In generale, l'addestramento richiede il doppio della durata dell'audio cumulativo. Il tempo e lo sforzo necessari per creare un modello personalizzato dipendono dai dati audio che si hanno a disposizione per il modello. Dipende anche se si utilizzano le trascrizioni dell'audio.

Per ulteriori informazioni sull'introduzione alla personalizzazione del modello acustico, vedi

Grammatiche

Per ulteriori informazioni sulle lingue e i modelli che supportano le grammatiche e il loro livello di supporto (generalmente disponibile o beta), vedi Supporto della lingua per la personalizzazione.

I modelli di lingua personalizzati ti consentono di espandere il vocabolario di base del servizio. Le grammatiche ti consentono di limitare le parole che il servizio può riconoscere da quel vocabolario. Quando utilizzi una grammatica con un modello di lingua personalizzato per il riconoscimento vocale, il servizio può riconoscere solo le parole, frasi e stringhe che vengono riconosciute dalla grammatica. Poiché la grammatica definisce uno spazio di ricerca limitato per le corrispondenze valide, il servizio può fornire i risultati in modo più veloce e più accurato.

Aggiungi una grammatica a un modello di lingua personalizzato e addestra il modello esattamente come fai per un corpus. Tuttavia, a differenza di un corpus, devi specificare esplicitamente che una grammatica deve essere utilizzata con un modello personalizzato durante il riconoscimento vocale.

Grammars è disponibile solo per i modelli di generazione precedente e successiva. Non è disponibile per modelli vocali di grandi dimensioni.

Per ulteriori informazioni sull'introduzione alle grammatiche, consultare

Utilizzo combinato della personalizzazione acustica e della lingua

L'utilizzo della personalizzazione acustica e della lingua si applica solo ai modelli di generazione precedente. Inoltre, alcuni modelli di generazioni precedenti non supportano sia la personalizzazione della lingua che quella dell'acustica.

L'utilizzo di un modello acustico personalizzato da solo può migliorare le funzionalità di riconoscimento del servizio. Ma se per il tuo audio di esempio sono disponibili trascrizioni o corpora correlati, puoi utilizzare questi dati per migliorare ulteriormente la qualità del riconoscimento vocale sulla base del modello acustico personalizzato.

Creando un modello di lingua personalizzato che complementa il tuo modello acustico personalizzato, puoi migliorare il riconoscimento vocale utilizzando insieme i due modelli. Quando addestri un modello acustico personalizzato, puoi specificare un modello di lingua personalizzato che include le trascrizioni delle risorse audio o un vocabolario di parole specifiche per il dominio dalle risorse. Allo stesso modo, quando trascrivi l'audio, il servizio accetta un modello di lingua personalizzato, un modello acustico personalizzato o entrambi. Inoltre, se il tuo modello di lingua personalizzato include una grammatica, puoi utilizzare quel modello e la grammatica con un modello acustico personalizzato per il riconoscimento vocale.

Per ulteriori informazioni, vedere Utilizzo congiunto di modelli acustici e linguistici personalizzati

Upgrade dei modelli personalizzati

Per migliorare la qualità del riconoscimento vocale, il servizio occasionalmente aggiorna modelli vocali di grandi dimensioni, modelli precedenti e di nuova generazione. Un aggiornamento a un modello base influisce solo su tale modello. L'aggiornamento non influisce su altri modelli della stessa lingua o di lingue diverse.

Un aggiornamento a un modello di base può richiedere l'aggiornamento di qualsiasi modello personalizzato creato su tale modello di base per trarre vantaggio dai miglioramenti. Un aggiornamento a un modello di base che richiede un aggiornamento produce una nuova versione del modello di base. Un aggiornamento che non richiede un aggiornamento non produce una nuova versione.

  • Per i modelli di generazione precedente, tutti gli aggiornamenti a un modello di base producono una nuova versione del modello. Quando viene rilasciata una nuova versione di un modello base, è necessario aggiornare qualsiasi lingua personalizzata e qualsiasi modello acustico personalizzato creato sul modello base aggiornato per sfruttare i miglioramenti.
  • Per i modelli vocali di grandi dimensioni e i modelli di nuova generazione, la maggior parte degli aggiornamenti non produce una nuova versione del modello. Questi aggiornamenti non richiedono l'aggiornamento dei modelli personalizzati. Alcuni aggiornamenti, tuttavia, generano una nuova versione di modello di base. Devi eseguire l'upgrade dei modelli di lingua personalizzati creati sul modello di base aggiornato per sfruttare i miglioramenti.

Tutti gli aggiornamenti ai modelli di base e se richiedono aggiornamenti sono annunciati nelle note sulla release:

Una volta eseguito l'upgrade di un modello personalizzato, il servizio utilizza l'ultima versione del modello personalizzato per impostazione predefinita quando specifichi tale modello con una richiesta di riconoscimento vocale. Ma puoi ancora indirizzare il servizio per utilizzare la vecchia versione del modello. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati e sull'utilizzo di una versione precedente di un modello, vedi