Linguaggi e modelli di generazione precedente
A partire dal 1 agosto 2023, tutti i modelli di generazione precedente sono ora fuori produzione dal servizio. I nuovi clienti devono ora utilizzare solo i modelli di prossima generazione. Tutti i client esistenti devono ora migrare al modello di nuova generazione equivalente. Per ulteriori informazioni, vedi Migrazione ai modelli di nuova generazione.
Il servizio IBM Watson® Speech to Text supporta il riconoscimento vocale con modelli di generazione precedente in molte lingue. Il modello indica la lingua in cui viene pronunciato l'audio e la frequenza con la quale viene campionato.
I modelli descritti in questa pagina vengono indicati come modelli di generazione precedente. Il servizio offre anche modelli di nuova generazione con qualità avanzate per un migliore riconoscimento vocale. Per ulteriori informazioni, vedi Next-generation languages and models.
Tipi di modello di generazione precedente
Per la maggior parte delle lingue, il servizio rende disponibili due tipi di modelli di generazione precedente:
- I modelli a banda stretta sono destinati all'audio che ha una frequenza di campionamento minima di 8 kHz. Utilizza i modelli a banda stretta per la decodifica offline di conversazioni telefoniche, che sono il tipico uso per questa frequenza di campionamento.
- I modelli a banda larga sono per l'audio previsto che ha una velocità di campionamento minima di 16 kHz. Utilizza i modelli a banda larga per le applicazioni reattive e in tempo reale, ad esempio, per le applicazioni vocali dinamiche.
La scelta del modello corretto per la tua applicazione è importante. Utilizza il modello che corrisponde alla frequenza di campionamento (e alla lingua) del tuo audio. Il servizio regola automaticamente la frequenza di campionamento del tuo audio in modo che corrisponda al modello che specifichi. Per ottenere la migliore accuratezza del riconoscimento, devi anche considerare il contenuto della frequenza del tuo audio. Per ulteriori informazioni, vedi Frequenza di campionamento e Frequenza audio.
Modelli di lingua di generazione precedente supportati
Le seguenti sezioni elencano i modelli di generazione precedente di ciascun tipo disponibili per ciascuna lingua. Le tabelle riportate nelle sezioni forniscono le seguenti informazioni:
-
La colonna Nome modello indica il nome del modello.
-
La colonna Stato indica se il modello è generalmente disponibile (GA) o Beta.
-
Il Modello di nuova generazione consigliato identifica il modello di nuova generazione che può essere utilizzato invece di un modello obsoleto.
Attualmente, non tutti i modelli a banda larga hanno modelli multimediali equivalenti. In tali casi, considerare l'utilizzo del modello di telefonia per tale lingua. Il servizio esegue il downsample dell'audio alla frequenza del modello che utilizzi. Pertanto, l'invio di audio a banda larga a un modello di telefonia potrebbe rivelarsi un'alternativa sufficiente nei casi in cui non è attualmente disponibile un modello multimediale equivalente.
Tutti i modelli sono disponibili per entrambe le versioni del prodotto, IBM Cloud e IBM Cloud Pak for Data.
Modelli a banda stretta
La tabella 1 elenca i precedenti modelli a banda stretta disponibili.
| Lingua | Nome modello | Condizione | Modello di nuova generazione consigliato |
|---|---|---|---|
| Cinese (Mandarino) | zh-CN_NarrowbandModel |
GA non più disponibile |
zh-CN_Telephony |
| Olandese (Paesi Bassi) | nl-NL_NarrowbandModel |
GA non più disponibile |
nl-NL_Telephony |
| Inglese (Australiano) | en-AU_NarrowbandModel |
GA non più disponibile |
en-AU_Telephony |
| Inglese (Regno Unito) | en-GB_NarrowbandModel |
GA non più disponibile |
en-GB_Telephony |
| Inglese (Stati Uniti) | en-US_NarrowbandModel |
GA non più disponibile |
en-US_Telephony |
en-US_ShortForm_NarrowbandModel |
GA non più disponibile |
en-US_Telephony |
|
| Francese (Canadese) | fr-CA_NarrowbandModel |
GA non più disponibile |
fr-CA_Telephony |
| Francese (Francia) | fr-FR_NarrowbandModel |
GA non più disponibile |
fr-FR_Telephony |
| Tedesco | de-DE_NarrowbandModel |
GA non più disponibile |
de-DE_Telephony |
| Italiano | it-IT_NarrowbandModel |
GA non più disponibile |
it-IT_Telephony |
| Giapponese | ja-JP_NarrowbandModel |
GA non più disponibile |
ja-JP_TelephonyIBM Cloud |
| Coreano | ko-KR_NarrowbandModel |
GA non più disponibile |
ko-KR_Telephony |
| Portoghese (brasiliano) | pt-BR_NarrowbandModel |
GA non più disponibile |
pt-BR_Telephony |
| Spagnolo (Argentino, Beta) | es-AR_NarrowbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Castigliano) | es-ES_NarrowbandModel |
GA non più disponibile |
es-ES_Telephony |
| Spagnolo (Cileno, Beta) | es-CL_NarrowbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Colombiano, Beta) | es-CO_NarrowbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Messicano, Beta) | es-MX_NarrowbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Peruviano, Beta) | es-PE_NarrowbandModel |
Beta non più disponibile |
es-LA_Telephony |
Modelli a banda larga
La tabella 2 elenca i modelli a banda larga di precedente generazione disponibili.
| Lingua | Nome modello | Condizione | Modello di nuova generazione consigliato |
|---|---|---|---|
| Arabo (standard moderno) | ar-MS_BroadbandModel |
GA non più disponibile |
ar-MS_Telephony |
| Cinese (Mandarino) | zh-CN_BroadbandModel |
GA non più disponibile |
zh-CN_Telephony |
| Olandese (Paesi Bassi) | nl-NL_BroadbandModel |
GA non più disponibile |
nl-NL_Multimedia |
| Inglese (Australiano) | en-AU_BroadbandModel |
GA non più disponibile |
en-AU_Multimedia |
| Inglese (Regno Unito) | en-GB_BroadbandModel |
GA non più disponibile |
en-GB_Multimedia |
| Inglese (Stati Uniti) | en-US_BroadbandModel |
GA non più disponibile |
en-US_Multimedia |
| Francese (Canadese) | fr-CA_BroadbandModel |
GA non più disponibile |
fr-CA_Multimedia |
| Francese (Francia) | fr-FR_BroadbandModel |
GA non più disponibile |
fr-FR_Multimedia |
| Tedesco | de-DE_BroadbandModel |
GA non più disponibile |
de-DE_Multimedia |
| Italiano | it-IT_BroadbandModel |
GA non più disponibile |
it-IT_Multimedia |
| Giapponese | ja-JP_BroadbandModel |
GA non più disponibile |
ja-JP_Multimedia |
| Coreano | ko-KR_BroadbandModel |
GA non più disponibile |
ko-KR_Multimedia |
| Portoghese (brasiliano) | pt-BR_BroadbandModel |
GA non più disponibile |
pt-BR_Multimedia |
| Spagnolo (Argentino, Beta) | es-AR_BroadbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Castigliano) | es-ES_BroadbandModel |
GA non più disponibile |
es-ES_Multimedia |
| Spagnolo (Cileno, Beta) | es-CL_BroadbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Colombiano, Beta) | es-CO_BroadbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Messicano, Beta) | es-MX_BroadbandModel |
Beta non più disponibile |
es-LA_Telephony |
| Spagnolo (Peruviano, Beta) | es-PE_BroadbandModel |
Beta non più disponibile |
es-LA_Telephony |
Il modello di forma breve dell'inglese statunitense (deprecato)
Il modello di formato breve dell'inglese (Stati Uniti), en-US_ShortForm_NarrowbandModel, può migliorare il riconoscimento vocale per le soluzioni IVR (Interactive Voice Response) e di supporto clienti automatizzato. Il modello di
formato breve viene addestrato a riconoscere le espressioni brevi che ricorrono di frequente negli ambienti di supporto clienti come i call center di supporto automatizzati. Inoltre per essere ottimizzato con le espressioni brevi in generale,
il modello viene ottimizzato anche per espressioni precise quali le cifre, le ortografie scandendo singoli caratteri di nomi e parole e le risposte sì-no.
Il modello en-US_ShortForm_NarrowbandModel è ottimale per i tipi di risposte che sono comuni negli scambi da uomo a macchina, come il caso di utilizzo di IBM® Voice Agent with Watson. Il modello en-US_NarrowbandModel è generalmente ottimale per le conversazioni da uomo a uomo. Tuttavia, a seconda del caso di utilizzo e della natura dello scambio, alcuni utenti potrebbero trovare il modello di formato breve adatto anche alle conversazioni da uomo a uomo.
Data questa flessibilità e sovrapposizione, potresti sperimentare con entrambi i modelli per determinare quale funziona meglio per la tua applicazione. In entrambi i casi, l'applicazione di un modello di lingua personalizzato con una grammatica
al modello di formato breve può ulteriormente migliorare i risultati del riconoscimento.
Come con tutti i modelli, gli ambienti rumorosi possono avere un impatto negativo sui risultati. Ad esempio, il rumore acustico di fondo di aeroporti, veicoli in movimento, sale conferenze e più parlanti può ridurre l'accuratezza della trascrizione. Anche l'audio dei dispositivi di registrazione ambientale può ridurre l'accuratezza a causa dell'eco comune in tali dispositivi. L'utilizzo dei parametri disponibili per il rilevamento dell'attività vocale può controbilanciare tali effetti e aiutare a migliorare l'accuratezza della trascrizione vocale. L'applicazione di un modello acustico personalizzato può ulteriormente ottimizzare le acustiche per il riconoscimento vocale ma solo come misura finale.
- Per ulteriori informazioni sulla personalizzazione dei modelli linguistici e acustici, vedere Comprendere la personalizzazione.
- Per ulteriori informazioni sulle grammatiche, vedi Utilizzo di grammatiche con modelli di lingua personalizzati.
- Per ulteriori informazioni sui parametri di rilevamento dell'attività vocale, vedi Rilevamento dell'attività vocale.
Funzioni supportate per modelli di generazione precedente
I modelli di generazione precedente sono supportati per l'utilizzo con quasi tutte le funzioni del servizio. La maggior parte delle funzioni e dei modelli sono generalmente disponibili per l'utilizzo in produzione. Dove indicato, alcune funzioni e modelli sono funzionalità beta. Le limitazioni si applicano per alcune funzioni, ad esempio:
- Le funzioni come le etichette dei parlanti, la redazione numerica e il filtro di volgarità sono limitate a determinate lingue e modelli. Tali restrizioni sono annotate con le descrizioni delle singole caratteristiche. Per ulteriori informazioni su tutti i parametri di riconoscimento vocale disponibili, vedi Riepilogo dei parametri.
- Il parametro
low_latencyè supportato solo per modelli di nuova generazione. Per ulteriori informazioni, vedi Bassa latenza. - Per ulteriori informazioni sul supporto dei modelli di generazione precedente per la personalizzazione, consultare Supporto della personalizzazione per i modelli di generazione precedente.
In caso contrario, quando una funzione viene descritta come disponibile in generale o per una lingua o lingue specifiche, supporta i modelli di generazione precedente.