Migrazione a modelli vocali di grandi dimensioni

A partire dal 1 agosto 2023, tutti i modelli di generazione precedente sono ora fuori produzione dal servizio. I nuovi client devono ora utilizzare solo i modelli vocali di grandi dimensioni o i modelli di nuova generazione. Tutti i client esistenti devono ora migrare al modello vocale di grandi dimensioni equivalente o al modello di nuova generazione. Per ulteriori informazioni, vedi Migrazione a modelli vocali di grandi dimensioni.

Devi migrare l'utilizzo di qualsiasi modello di generazione precedente obsoleto ai modelli vocali di grandi dimensioni equivalenti o ai modelli di nuova generazione entro la data di fine del servizio del 31 luglio 2023. I modelli di nuova generazione forniscono una precisione di trascrizione e una velocità di trasmissione notevolmente migliori. Ma attualmente forniscono un numero leggermente inferiore di funzioni rispetto ai modelli di generazione precedente.

Questo argomento fornisce una panoramica della procedura che è necessario eseguire per migrare da modelli precedenti a modelli di nuova generazione. Per ulteriori informazioni sulla migrazione, puoi anche consultare Watson Speech to Text: Come pianificare la tua migrazione ai modelli di prossima generazione.

Passo 1: Identifica il modello vocale di grandi dimensioni o il modello di nuova generazione a cui migrare

I seguenti argomenti descrivono tutti i modelli vocali di grandi dimensioni, i modelli di precedente e di prossima generazione:

Le tabelle in Supported previous-generation language models elencano il modello vocale di grandi dimensioni consigliato o il modello di nuova generazione a cui migrare da un modello di generazione precedente. Utilizza il modello vocale di grandi dimensioni indicato o il modello di nuova generazione nelle tue richieste di riconoscimento vocale.

Il servizio continua a rendere disponibili nuovi modelli vocali di grandi dimensioni. Tutti i nuovi modelli sono identificati nelle note di rilascio e nelle tabelle che descrivono i modelli disponibili.

In modo ottimale, è possibile migrare da un modello a banda stretta / un modello di telefonia a un modello vocale di grandi dimensioni e da un modello a banda larga / un modello multimediale a un modello vocale di grandi dimensioni. Tuttavia, non tutti i modelli a banda larga e i modelli multimediali hanno modelli vocali di grandi dimensioni equivalenti. In questi casi, è possibile eseguire la migrazione da un modello a banda stretta a un modello di telefonia o da un modello a banda larga a un modello multimediale. Il servizio esegue il downsample dell'audio inviato alla frequenza del modello che utilizzi. Pertanto, l'invio di audio a banda larga a un modello di telefonia potrebbe rivelarsi un'alternativa sufficiente nei casi in cui non è attualmente disponibile un modello multimediale equivalente.

Ad esempio, la seguente richiesta di riconoscimento vocale utilizza en-US_NarrowbandModel di generazione precedente:

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel"

Per utilizzare il modello vocale di grandi dimensioni equivalente en-US, devi semplicemente modificare il valore che passi con il parametro di query model :

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US"

Passo 2: Identifica le funzionalità disponibili con modelli vocali di grandi dimensioni

I modelli vocali di grandi dimensioni supportano un numero di funzioni e parametri leggermente inferiore rispetto ai modelli precedenti e di nuova generazione. Tuttavia, anche se non hanno la piena parità, la maggior parte delle funzioni sono disponibili con entrambi i tipi di modelli. E quando una funzionalità è limitata a un sottoinsieme di lingue, le limitazioni si applicano ugualmente a tutti i tipi di modelli.

Per informazioni relative alle funzioni supportate con i diversi tipi di modello, consultare

Il servizio continua a rendere disponibili nuove funzionalità con modelli di nuova generazione. Tutti gli aggiornamenti al supporto funzione sono documentati nelle note sulla release e nella documentazione per i tipi di modelli.

Per migrare a modelli di nuova generazione, devi rimuovere le funzioni che non sono supportate dai modelli di nuova generazione dalle tue richieste di riconoscimento vocale. Puoi anche considerare l'uso di funzioni come la distorsione di inserimento dei caratteri che sono disponibili solo con modelli di voce di grandi dimensioni e modelli di nuova generazione.

Ad esempio, la seguente richiesta di riconoscimento vocale utilizza i parametri profanity_filter, redaction e word_alternatives_threshold con la generazione precedente en-US_NarrowbandModel:

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&profanity_filter=true&redaction=true&word_alternatives_threshold=0.50"

Solo il parametro word_alternatives_threshold non è supportato da modelli vocali di grandi dimensioni. Per utilizzare il modello di discorso di grandi dimensioni equivalente en-US_Telephony, modifica semplicemente il valore che passi con il parametro di interrogazione model ed elimina il parametro word_alternatives_threshold :

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US&profanity_filter=true&redaction=true"

Passo 3: crea nuovamente qualsiasi modello di lingua personalizzato che utilizzi

Devi ricreare tutti i modelli di lingua personalizzati basati sui modelli di generazione precedente o di nuova generazione basandoli sui modelli vocali di grandi dimensioni equivalenti. Ciò richiede la creazione di un nuovo modello di lingua personalizzato e l'aggiunta di corpora e parole personalizzate dal vecchio modello al nuovo modello.

In generale, i modelli vocali di grandi dimensioni non si basano tanto sui modelli di lingua personalizzati. Utilizzano un approccio diverso alla trascrizione che riduce al minimo la necessità di personalizzazione del modello di lingua.

I modelli vocali grandi non supportano i modelli acustici personalizzati. A causa di come i modelli trascrivano l'audio, la personalizzazione del modello acustico non è necessaria.

Ad esempio, la seguente richiesta di riconoscimento vocale utilizza un modello di lingua personalizzato basato su en-US_NarrowbandModel. In questo esempio, il modello personalizzato ha l'identificativo 8acf31fa-0aa2-4ecc-a805-1f527f342dba.

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&language_customization_id=8acf31fa-0aa2-4ecc-a805-1f527f342dba"

Dopo aver ricreato il modello di lingua personalizzato con il modello en-US equivalente, aggiorna semplicemente il nome modello in en-US e il parametro language_customization_ID per utilizzare l'identificativo del nuovo modello personalizzato, 636d8494-7e53-436a-8557-30d6b2a63cd7:

curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US&language_customization_id=636d8494-7e53-436a-8557-30d6b2a63cd7"

Passo 4: Valutazione dei risultati del modello di discorso di grandi dimensioni

Una volta che hai aggiornato le tue richieste di riconoscimento vocale per utilizzare modelli vocali di grandi dimensioni, eliminato i parametri non supportati e ricreato qualsiasi modello di lingua personalizzato, puoi sperimentare il riconoscimento vocale basato su modelli di precedente e di prossima generazione. Confrontare le trascrizioni risultanti per determinare se il modello vocale di grandi dimensioni produce risultati equivalenti o migliori. Considera anche le prestazioni delle richieste che utilizzano un modello vocale di grandi dimensioni per determinare quanto più velocemente ricevi i risultati.

Puoi anche confrontare il tasso di errore delle parole dei modelli di discorso di grandi dimensioni, i risultati di precedente e di prossima generazione. Il programma di utilità open-source WER(Word Error Rate), disponibile in Python, può aiutarti a misurare e confrontare l'accuratezza dei risultati.