Linguaggi e modelli di generazione precedente

A partire dal 1 agosto 2023, tutti i modelli di generazione precedente sono ora fuori produzione dal servizio. I nuovi clienti devono ora utilizzare solo i modelli di prossima generazione. Tutti i client esistenti devono ora migrare al modello di nuova generazione equivalente. Per ulteriori informazioni, vedi Migrazione ai modelli di nuova generazione.

Il servizio IBM Watson® Speech to Text supporta il riconoscimento vocale con modelli di generazione precedente in molte lingue. Il modello indica la lingua in cui viene pronunciato l'audio e la frequenza con la quale viene campionato.

I modelli descritti in questa pagina vengono indicati come modelli di generazione precedente. Il servizio offre anche modelli di nuova generazione con qualità avanzate per un migliore riconoscimento vocale. Per ulteriori informazioni, vedi Next-generation languages and models.

Tipi di modello di generazione precedente

Per la maggior parte delle lingue, il servizio rende disponibili due tipi di modelli di generazione precedente:

  • I modelli a banda stretta sono destinati all'audio che ha una frequenza di campionamento minima di 8 kHz. Utilizza i modelli a banda stretta per la decodifica offline di conversazioni telefoniche, che sono il tipico uso per questa frequenza di campionamento.
  • I modelli a banda larga sono per l'audio previsto che ha una velocità di campionamento minima di 16 kHz. Utilizza i modelli a banda larga per le applicazioni reattive e in tempo reale, ad esempio, per le applicazioni vocali dinamiche.

La scelta del modello corretto per la tua applicazione è importante. Utilizza il modello che corrisponde alla frequenza di campionamento (e alla lingua) del tuo audio. Il servizio regola automaticamente la frequenza di campionamento del tuo audio in modo che corrisponda al modello che specifichi. Per ottenere la migliore accuratezza del riconoscimento, devi anche considerare il contenuto della frequenza del tuo audio. Per ulteriori informazioni, vedi Frequenza di campionamento e Frequenza audio.

Modelli di lingua di generazione precedente supportati

Le seguenti sezioni elencano i modelli di generazione precedente di ciascun tipo disponibili per ciascuna lingua. Le tabelle riportate nelle sezioni forniscono le seguenti informazioni:

  • La colonna Nome modello indica il nome del modello.

  • La colonna Stato indica se il modello è generalmente disponibile (GA) o Beta.

  • Il Modello di nuova generazione consigliato identifica il modello di nuova generazione che può essere utilizzato invece di un modello obsoleto.

    Attualmente, non tutti i modelli a banda larga hanno modelli multimediali equivalenti. In tali casi, considerare l'utilizzo del modello di telefonia per tale lingua. Il servizio esegue il downsample dell'audio alla frequenza del modello che utilizzi. Pertanto, l'invio di audio a banda larga a un modello di telefonia potrebbe rivelarsi un'alternativa sufficiente nei casi in cui non è attualmente disponibile un modello multimediale equivalente.

Tutti i modelli sono disponibili per entrambe le versioni del prodotto, IBM Cloud e IBM Cloud Pak for Data.

Modelli a banda stretta

La tabella 1 elenca i precedenti modelli a banda stretta disponibili.

Modelli a banda stretta di generazione precedente supportati
Lingua Nome modello Condizione Modello di nuova generazione consigliato
Cinese (Mandarino) zh-CN_NarrowbandModel GA
non più disponibile
zh-CN_Telephony
Olandese (Paesi Bassi) nl-NL_NarrowbandModel GA
non più disponibile
nl-NL_Telephony
Inglese (Australiano) en-AU_NarrowbandModel GA
non più disponibile
en-AU_Telephony
Inglese (Regno Unito) en-GB_NarrowbandModel GA
non più disponibile
en-GB_Telephony
Inglese (Stati Uniti) en-US_NarrowbandModel GA
non più disponibile
en-US_Telephony
en-US_ShortForm_NarrowbandModel GA
non più disponibile
en-US_Telephony
Francese (Canadese) fr-CA_NarrowbandModel GA
non più disponibile
fr-CA_Telephony
Francese (Francia) fr-FR_NarrowbandModel GA
non più disponibile
fr-FR_Telephony
Tedesco de-DE_NarrowbandModel GA
non più disponibile
de-DE_Telephony
Italiano it-IT_NarrowbandModel GA
non più disponibile
it-IT_Telephony
Giapponese ja-JP_NarrowbandModel GA
non più disponibile
ja-JP_Telephony
IBM Cloud
Coreano ko-KR_NarrowbandModel GA
non più disponibile
ko-KR_Telephony
Portoghese (brasiliano) pt-BR_NarrowbandModel GA
non più disponibile
pt-BR_Telephony
Spagnolo (Argentino, Beta) es-AR_NarrowbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Castigliano) es-ES_NarrowbandModel GA
non più disponibile
es-ES_Telephony
Spagnolo (Cileno, Beta) es-CL_NarrowbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Colombiano, Beta) es-CO_NarrowbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Messicano, Beta) es-MX_NarrowbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Peruviano, Beta) es-PE_NarrowbandModel Beta
non più disponibile
es-LA_Telephony

Modelli a banda larga

La tabella 2 elenca i modelli a banda larga di precedente generazione disponibili.

Modelli di banda larga di precedente generazione supportati
Lingua Nome modello Condizione Modello di nuova generazione consigliato
Arabo (standard moderno) ar-MS_BroadbandModel GA
non più disponibile
ar-MS_Telephony
Cinese (Mandarino) zh-CN_BroadbandModel GA
non più disponibile
zh-CN_Telephony
Olandese (Paesi Bassi) nl-NL_BroadbandModel GA
non più disponibile
nl-NL_Multimedia
Inglese (Australiano) en-AU_BroadbandModel GA
non più disponibile
en-AU_Multimedia
Inglese (Regno Unito) en-GB_BroadbandModel GA
non più disponibile
en-GB_Multimedia
Inglese (Stati Uniti) en-US_BroadbandModel GA
non più disponibile
en-US_Multimedia
Francese (Canadese) fr-CA_BroadbandModel GA
non più disponibile
fr-CA_Multimedia
Francese (Francia) fr-FR_BroadbandModel GA
non più disponibile
fr-FR_Multimedia
Tedesco de-DE_BroadbandModel GA
non più disponibile
de-DE_Multimedia
Italiano it-IT_BroadbandModel GA
non più disponibile
it-IT_Multimedia
Giapponese ja-JP_BroadbandModel GA
non più disponibile
ja-JP_Multimedia
Coreano ko-KR_BroadbandModel GA
non più disponibile
ko-KR_Multimedia
Portoghese (brasiliano) pt-BR_BroadbandModel GA
non più disponibile
pt-BR_Multimedia
Spagnolo (Argentino, Beta) es-AR_BroadbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Castigliano) es-ES_BroadbandModel GA
non più disponibile
es-ES_Multimedia
Spagnolo (Cileno, Beta) es-CL_BroadbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Colombiano, Beta) es-CO_BroadbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Messicano, Beta) es-MX_BroadbandModel Beta
non più disponibile
es-LA_Telephony
Spagnolo (Peruviano, Beta) es-PE_BroadbandModel Beta
non più disponibile
es-LA_Telephony

Il modello di forma breve dell'inglese statunitense (deprecato)

Il modello di formato breve dell'inglese (Stati Uniti), en-US_ShortForm_NarrowbandModel, può migliorare il riconoscimento vocale per le soluzioni IVR (Interactive Voice Response) e di supporto clienti automatizzato. Il modello di formato breve viene addestrato a riconoscere le espressioni brevi che ricorrono di frequente negli ambienti di supporto clienti come i call center di supporto automatizzati. Inoltre per essere ottimizzato con le espressioni brevi in generale, il modello viene ottimizzato anche per espressioni precise quali le cifre, le ortografie scandendo singoli caratteri di nomi e parole e le risposte sì-no.

Il modello en-US_ShortForm_NarrowbandModel è ottimale per i tipi di risposte che sono comuni negli scambi da uomo a macchina, come il caso di utilizzo di IBM® Voice Agent with Watson. Il modello en-US_NarrowbandModel è generalmente ottimale per le conversazioni da uomo a uomo. Tuttavia, a seconda del caso di utilizzo e della natura dello scambio, alcuni utenti potrebbero trovare il modello di formato breve adatto anche alle conversazioni da uomo a uomo. Data questa flessibilità e sovrapposizione, potresti sperimentare con entrambi i modelli per determinare quale funziona meglio per la tua applicazione. In entrambi i casi, l'applicazione di un modello di lingua personalizzato con una grammatica al modello di formato breve può ulteriormente migliorare i risultati del riconoscimento.

Come con tutti i modelli, gli ambienti rumorosi possono avere un impatto negativo sui risultati. Ad esempio, il rumore acustico di fondo di aeroporti, veicoli in movimento, sale conferenze e più parlanti può ridurre l'accuratezza della trascrizione. Anche l'audio dei dispositivi di registrazione ambientale può ridurre l'accuratezza a causa dell'eco comune in tali dispositivi. L'utilizzo dei parametri disponibili per il rilevamento dell'attività vocale può controbilanciare tali effetti e aiutare a migliorare l'accuratezza della trascrizione vocale. L'applicazione di un modello acustico personalizzato può ulteriormente ottimizzare le acustiche per il riconoscimento vocale ma solo come misura finale.

Funzioni supportate per modelli di generazione precedente

I modelli di generazione precedente sono supportati per l'utilizzo con quasi tutte le funzioni del servizio. La maggior parte delle funzioni e dei modelli sono generalmente disponibili per l'utilizzo in produzione. Dove indicato, alcune funzioni e modelli sono funzionalità beta. Le limitazioni si applicano per alcune funzioni, ad esempio:

  • Le funzioni come le etichette dei parlanti, la redazione numerica e il filtro di volgarità sono limitate a determinate lingue e modelli. Tali restrizioni sono annotate con le descrizioni delle singole caratteristiche. Per ulteriori informazioni su tutti i parametri di riconoscimento vocale disponibili, vedi Riepilogo dei parametri.
  • Il parametro low_latency è supportato solo per modelli di nuova generazione. Per ulteriori informazioni, vedi Bassa latenza.
  • Per ulteriori informazioni sul supporto dei modelli di generazione precedente per la personalizzazione, consultare Supporto della personalizzazione per i modelli di generazione precedente.

In caso contrario, quando una funzione viene descritta come disponibile in generale o per una lingua o lingue specifiche, supporta i modelli di generazione precedente.