Note sulla release per Speech to Text per IBM Cloud

IBM Cloud

Le seguenti caratteristiche e modifiche sono state incluse in ogni release e aggiornamento delle istanze gestite di IBM Watson® Speech to Text che sono ospitate su IBM Cloud o per le istanze ospitate su IBM Cloud Pak for Data come servizio. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.

Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.

Per informazioni sui rilasci e gli aggiornamenti del servizio per IBM Cloud Pak for Data, vedere le note di rilascio per Speech to Text per IBM Cloud Pak for Data.

29 giugno 2026

Nuovo parametro " parameter_set " per i modelli di sintesi vocale di grandi dimensioni

I modelli di sintesi vocale di grandi dimensioni includono ora un parametro di richiesta denominato " parameter_set " che applica impostazioni ottimizzate in un'unica chiamata. Utilizza la funzione " parameter_set=enhanced " per migliorare la qualità del riconoscimento senza dover configurare manualmente i singoli parametri.

  • Per ulteriori informazioni, consultare [la sezione relativa al parametro di richiesta parameter_set](/docs/speech-to-text?topic=speech-to-text-models-large-speech-languages#models-lsm-parameter-set) .

26 giugno 2026

low_latency La modalità è ora disponibile per il modello vocale Large in inglese (USA)

Il modello di sintesi vocale "US English Large Speech Model" en-US ora include la mod low_latency, che consente un'elaborazione più rapida del parlato.

15 maggio 2026

Il modello vocale di grandi dimensioni per l'italiano è ora generalmente disponibile

Il modello vocale di grandi dimensioni per l'italiano, it-IT, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.

10 aprile 2026

Il modello vocale di grandi dimensioni per l'olandese è ora generalmente disponibile

Il modello vocale di grandi dimensioni per l'olandese, nl-NL, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.

07 aprile 2026

Correzione di un difetto: Corretto un problema per cui il fille viene riconosciuto in modo errato nel riconoscimento della sequenza alfanumerica francese con la funzione di formattazione intelligente.

17 marzo 2026

Miglioramento del modello di lingua francese di grandi dimensioni
Sono ora disponibili miglioramenti nei Large Language Models (LSM) francesi fr-FR e fr-CA per una maggiore precisione nel riconoscimento delle sequenze alfanumeriche.

Correzione di un difetto: È stato risolto un problema nell'identificazione della lingua (LID) in cui si osservano errori intermittenti di 5xx quando una richiesta /v1/recognize?language_identification=true è immediatamente seguita da una richiesta /v1/recognize regolare.

Correzione del difetto: Corretto un problema per cui si osservano errori interni al server con il parametro max_active.

Correzione del difetto: Corretto un problema per cui gli errori interni del server vengono erroneamente restituiti quando include_transparent_words è impostato su true.

04 marzo 2026

Miglioramento dei modelli di parlato in tedesco e olandese

Sono ora disponibili miglioramenti dei modelli di parlato in tedesco e olandese.

  • I miglioramenti del Large Speech Model (LSM) tedesco de-DE sono ora disponibili per il riconoscimento di sequenze alfanumeriche e per casi d'uso generali.
  • Sono ora disponibili miglioramenti della telefonia olandese nl-NL_Telephony per il riconoscimento delle sequenze alfanumeriche e la gestione della salienza.

16 febbraio 2026

Il modello vocale di grandi dimensioni per il tedesco è ora generalmente disponibile

Il modello vocale di grandi dimensioni per il tedesco, de-DE, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.

Miglioramenti dell'arricchimento della trascrizione del discorso

I miglioramenti nell'arricchimento della trascrizione vocale sono ora disponibili per le entità denominate, tra cui date, ora, valuta, numeri e misure. Queste entità sono ora gestite correttamente in base al locale della lingua.

22 gennaio 2026

Correzione del difetto: Corretto un problema per cui l'arricchimento della trascrizione vocale fallisce quando il parametro del modello è assente nelle richieste.

Correzione di un difetto: È stato risolto un problema per cui si osserva un tempo di addestramento della personalizzazione speech-to-text (STT) più lungo a causa di errori interni fuori memoria.

08 gennaio 2026

Correzione di un difetto: Corretto un problema nell'arricchimento della trascrizione vocale nel centro dati di Francoforte.

Correzione di un difetto: Corretto un problema in interim_results per cui le trascrizioni finali del discorso non vengono inviate quando interim_results è impostato su false.

10 dicembre 2025

Convalida del campo di input per la funzione sounds_like

La funzione di convalida dei campi di input per sounds_like è ora abilitata per altre lingue.

  • La convalida del campo di input per sounds_like è abilitata per altre lingue, compresi i modelli di en-US, en-AU, en-GB, en-IN, es-ES, es-AR, es-CL, es-CO, es-MX, es-PE, fr-FR_Telephony, fr-FR_Multimedia, de-DE_Telephony, de-DE_Multimedia, it-IT_Telephony, it-IT_Multimedia e nl-NL_Telephony.

25 novembre 2025

Sono ora disponibili i risultati intermedi per i modelli vocali di grandi dimensioni

I risultati intermedi sono ora disponibili per i modelli vocali di grandi dimensioni (LSM).

  • interim_results il parametro era precedentemente abilitato solo per i modelli di nuova generazione. Ora è abilitata anche per gli LSM. Per ulteriori informazioni, vedi Risultati provvisori.

03 novembre 2025

Il rilevamento degli eventi di inizio parlato è ora disponibile per i modelli STT.

Il rilevamento dell'evento Speech begin è ora disponibile per i modelli STT.

  • Utilizzando il rilevamento dell'evento di inizio del parlato, è ora possibile ricevere una notifica tempestiva con l'API recognize che rileva l'inizio del parlato nel flusso audio in entrata e invia una notifica all'utente. Per ulteriori informazioni, vedere Rilevamento degli eventi di inizio parlato.
Miglioramenti al rilevamento dell'attività vocale per una risposta più rapida, una maggiore precisione e migliori prestazioni in ambienti rumorosi.

Il rilevamento dell'attività vocale (SAD) è stato aggiornato per includere un nuovo metodo migliorato oltre a quello esistente nell'API Speech To Text recognize.

  • Il nuovo metodo aumenta l'accuratezza e le prestazioni nel rilevamento dei confini del parlato all'interno del flusso audio. Può essere utilizzato impostando sad_module:2. Per ulteriori informazioni, consultare la sezione " Rilevamento dell'attività vocale(SAD) ".
L'identificazione della lingua parlata è ora generalmente disponibile

L'identificazione della lingua parlata è ora generalmente disponibile.

  • L'identificazione della lingua (LID) rileva automaticamente la lingua parlata nei flussi audio. Il modello elabora continuamente l'audio in entrata e restituisce la lingua identificata quando raggiunge un livello di confidenza superiore alla soglia specificata ( 0.99 per impostazione predefinita). Per ulteriori informazioni, vedere Identificazione della lingua parlata.

07 ottobre 2025

hints il parametro è ora generalmente disponibile

Il parametro hints è ora generalmente disponibile.

  • hints il parametro migliora la post-elaborazione con Smart Formatter. Questo parametro aiuta il formattatore a interpretare l'intento dell'utente in modo più accurato e a restituire risultati che corrispondono meglio alle aspettative. Per ulteriori informazioni, vedere il parametro Suggerimenti.

26 settembre 2025

L'arricchimento della trascrizione vocale è ora generalmente disponibile

L'arricchimento della trascrizione vocale è ora generalmente disponibile.

  • La funzione Speech Transcript Enrichment migliora la leggibilità e l'usabilità delle trascrizioni grezze del riconoscimento vocale automatico (ASR). Questo servizio di post-elaborazione aggiunge automaticamente la punteggiatura e applica una capitalizzazione intelligente per migliorare la struttura e la chiarezza del contenuto parlato. Per ulteriori informazioni, vedere Arricchimento della trascrizione vocale.

09 settembre 2025

Correzione di un difetto: Corretto un problema in Smart Formatter per il modello linguistico Fr-CA in cui i numeri a 8 cifre venivano formattati in modo errato con zeri in più. Smart Formatter ora restituisce la trascrizione corretta.

19 agosto 2025

Correzione di un difetto: Corretto un problema in Smart Formatter per cui i valori numerici pronunciati nelle transazioni venivano trascritti in modo errato. Ad esempio, one hundred and ninety-nine and twelve cents dovrebbe essere trascritto come $199.12, ma è stato erroneamente visualizzato come 199 e R$ 0,12. Smart Formatter ora restituisce la trascrizione corretta.

Correzione di un difetto: Corretto un problema in Smart Formatter per i modelli linguistici francesi in cui la parola "cent" veniva formattata in modo errato. Ad esempio, quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit è stato trascritto come 89450328 100 1678 invece del previsto 8945032811678. Smart Formatter ora restituisce la trascrizione corretta.

22 luglio 2025

Correzione del difetto: L'errore del modello personalizzato ja-JP, causato dal carattere spazio a tutta larghezza ( U+3000 ), è stato corretto.

Correzione del difetto: Il problema di formattazione delle e-mail portoghesi di Smart Formatter, in cui venivano introdotti spazi extra negli indirizzi e-mail, è stato corretto. Per ulteriori informazioni, vedere Smart Formatter per il portoghese.

08 luglio 2025

Miglioramenti nel riconoscimento delle entità denominate per il Large Speech Model inglese

Include miglioramenti nel riconoscimento di città, indirizzi, nomi di strade, alfanumerici, date e nomi e cognomi.

Correzione di un difetto: Smart Formatter Spanish Large Speech Model (es-ES) formattazione della data

Correzione del difetto: el primero de enero de dos mil-> el 01/01/2000 deve essere formattato come 01/01/2000. Questo problema è stato corretto. Per ulteriori informazioni, vedere Smart Formatter per lo spagnolo.

17 giugno 2025

Correzione del difetto: Assegnazione del valore per Smart Formatter Version, che causava un errore di inserimento, con conseguente mancata elaborazione di richieste specifiche. Il problema è stato risolto. Le richieste di Smart Formatter ora rispondono come previsto.

Correzione del difetto: In Smart Formatter si osservavano spazi indesiderati nei caratteri alfanumerici. Ad esempio, l k k one one five zero zero four two l e-> lkk1 150042le. Questo problema è stato risolto. Le richieste di Smart Formatter ora rispondono come previsto.

28 maggio 2025

Il nuovo modello vocale di grandi dimensioni per il giapponese è ora generalmente disponibile

Il modello vocale di grandi dimensioni per il giapponese è ora generalmente disponibile.

Miglioramento: È stata aggiunta una migliore gestione dello Smart Formatter per le frasi di lettere pronunciate - a as in alpha-> a.

29 aprile 2025

Correzione di un difetto: Sono stati corretti vari problemi di disambiguazione di lettere, cifre o simboli in Smart Formatter

Correzione dei difetti: Sono stati risolti i seguenti problemi:

  • 'O' è stato formattato come la cifra 0
  • 'a real' è stato formattato come ' r1 '
  • 'colonscopia' è stato formattato come ':oscopy'

07 aprile 2025

Correzione del difetto: È stata rilevata una fonte inattesa in OOV
Correzione del difetto: Quando un corpus viene aggiunto a un modello personalizzato, le parole OOV precedentemente eliminate venivano involontariamente ripristinate dalla fonte precedente. Questo problema è stato corretto.

18 marzo 2025

Correzione del difetto: Sono stati corretti i problemi di Smart Formatter con le date e i numeri aggiuntivi nel modello en-us.
Correzione del difetto: La formattazione è disattivata quando il totale delle cifre è superiore alla data formattata richiesta. Ad esempio, five twelve fifteen eleven-> 5 1/2/1511 deve essere: 5121511.

11 febbraio 2025

Correzione del difetto: È stato osservato un gran numero di 503’s, in particolare per ja-JP_NarrowbandModel. Sono stati apportati miglioramenti al servizio per aumentare la disponibilità di questo modello.

Correzione del difetto: È stato riscontrato un errore di allocazione della memoria di personalizzazione STT per il modello en-US_Telephony. Il problema è stato risolto.

Correzione di un difetto: È stato osservato un problema di Smart Formatter con le abbreviazioni nel modello en-us (Dr. è stato corretto in Doctor). Il problema è stato risolto.

14 gennaio 2025

Miglioramento: Sono stati aggiornati gli alfanumerici delle istanze in cui Smart Formatter combinava alcune combinazioni di numeri pronunciati singolarmente - 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203. Questo problema è stato risolto.

Correzione del difetto: Runtime che non riesce a inviare tutte le ipotesi
Correzione di un difetto: Alcune parole mancavano nelle trascrizioni a causa di un problema con i timestamp di trascrizione nei casi in cui le parole chiave avevano punteggi di confidenza diversi dall'ipotesi. Il risultato è che la trascrizione restituisce una sola parola yes, anche se l'audio contiene due parole yes. È stato apportato un miglioramento alla logica di cancellazione dei timestamp per correggere questo problema.

19 novembre 2024

Il nuovo modello di parlato di grandi dimensioni per il tedesco è ora generalmente disponibile

Il modello di parlato di grandi dimensioni per il tedesco è ora generalmente disponibile.

Correzione del difetto: Miglioramento della logica di up-sampling (da 8khz a 16khz ) per il modello di parlato inglese multibanda Large Speech Model

Correzione del difetto: La logica di campionamento in servizio è necessaria affinché il modello possa gestire sia 8khz che 16khz.

05 novembre 2024

Correzione del difetto: Le etichette dei diffusori disabilitano i risultati intermedi per LSM e RNNT
Correzione del difetto: È stato riscontrato un problema per cui i risultati intermedi smettevano di arrivare quando erano abilitate le etichette degli altoparlanti. Il problema è stato risolto e il servizio ora restituisce immediatamente i risultati intermedi quando vengono utilizzate le etichette dei diffusori.

23 agosto 2024

Tutti i modelli Large Speech sono ora generalmente disponibili

I modelli vocali di grandi dimensioni per tutte le lingue sono ora generalmente disponibili (GA). Sono supportati per l'utilizzo in ambienti e applicazioni di produzione.

18 giugno 2024

Nuovi modelli vocali di grandi dimensioni per il portoghese brasiliano e lo spagnolo sono ora in open beta

I grandi modelli di discorso per il portoghese brasiliano e lo spagnolo sono ora in open beta. Lo spagnolo comprende i dialetti castigliano, argentino, cileno, colombiano, messicano e peruviano.

15 maggio 2024

Il modello di discorso di grandi dimensioni per l'inglese è ora generalmente disponibile

Il grande modello di discorso per l'inglese, che include i dialetti degli Stati Uniti, dell'Australia, dell'India e del Regno Unito, è ora generalmente disponibile (GA). È supportato per l'utilizzo in ambienti e applicazioni di produzione.

07 marzo 2024

Grande modello di discorso per l'inglese americano in Open Beta
Il nuovo modello vocale Large per l'inglese statunitense è in open beta. Vedi Modelli e lingue vocali di grandi dimensioni per ulteriori dettagli con le funzioni supportate (beta).

30 novembre 2023

Parametro Speech to Text speech_begin_event

Questo parametro consente all'applicazione client di sapere che sono state rilevate alcune parole o il parlato e che Speech to Text è in fase di decodifica. Per ulteriori dettagli, vedi Utilizzo dei parametri di riconoscimento vocale.

Parametro 'mapping_only' per parole personalizzate

Usando il parametro 'mapping_only', si possono usare parole personalizzate direttamente per mappare 'sounds_like' (o parola) al valore 'display_as' come post-elaborazione invece che come addestramento. Per ulteriori informazioni, vedi La risorsa di parole.

Vedere le linee guida per non giapponese e giapponese.

Supporto per il brasiliano - portoghese e franco - canadese su una nuova personalizzazione migliorata del modello di lingua di prossima generazione

La personalizzazione del modello di lingua per i modelli di nuova generazione brasiliano - portoghese e franco - canadese è stata recentemente aggiunta. Questo aggiornamento del servizio include ulteriori miglioramenti interni.

Nuova funzione di formattazione intelligente

Una nuova funzione di formattazione intelligente per i modelli di prossima generazione è supportata in inglese americano, portoghese brasiliano, francese e tedesco. Consultare Versione di formattazione intelligente per i dettagli.

Supporto per lo spagnolo castigliano e lo spagnolo LATAM sulla nuova personalizzazione del modello linguistico di nuova generazione

Viene aggiunta la personalizzazione del modello di lingua per i modelli di nuova generazione spagnolo castigliano e spagnolo LATAM. Questo aggiornamento del servizio include ulteriori miglioramenti interni.

Modelli vocali di grandi dimensioni per inglese, giapponese e francese - per l'accesso anticipato

Per la funzione di accesso anticipato, i modelli vocali di grandi dimensioni sono disponibili per le lingue inglese, giapponese e francese per te in IBM Watson Speech - to - Text e IBM watsonx Assistant. La serie di funzioni per questi modelli vocali di grandi dimensioni è limitata, ma più accurata rispetto ai modelli di generazione Next-Generation e sono più veloci e più economici da eseguire grazie alle dimensioni più ridotte e alla migliore funzionalità della modalità di streaming.

Se sei interessato a testare questi modelli di base e condividere risultati e feedback, contatta il nostro team di gestione del prodotto compilando questo modulo.

28 luglio 2023

Importante: Tutti i modelli di generazione precedente sono fuori produzione a partire dal 1 ° agosto 2023
Importante: tutti i modelli di generazione precedente sono ora dismessi dal servizio. I nuovi clienti devono ora utilizzare solo i modelli di prossima generazione. Tutti i client esistenti devono ora migrare al modello di nuova generazione equivalente. Per ulteriori informazioni su tutti i modelli di nuova generazione, vedi Lingue e modelli di nuova generazione. Per ulteriori informazioni su come migrare ai modelli di nuova generazione, vedi Migrazione ai modelli di nuova generazione.

9 giugno 2023

Correzione dei defect: la creazione e l'addestramento di un modello di lingua personalizzato è ora ottimale per i modelli di generazione di estensioni standard e a bassa latenza
Correzione del difetto: quando si crea e si esegue l'addestramento di un modello di lingua personalizzato con file di testo corpora e / o parole personalizzate utilizzando un modello a bassa latenza di generazione Next-generation, sta ora funzionando allo stesso modo di un modello standard. In passato, non era ottimale solo quando si utilizzava un modello a bassa latenza di generazione successiva.
Correzione del difetto: le sessioni STT Websockets non hanno più esito negativo a causa del messaggio di errore del tensore
Fix Defect: quando si utilizzano i websocket STT, le sessioni non hanno più esito negativo a causa di un messaggio di errore "STT restituisce l'errore: le dimensioni dei tensori devono corrispondere tranne che nella dimensione 0".

18 maggio 2023

Aggiornamenti al modello di telefonia medica di nuova generazione in inglese

Il modello di telefonia medica di nuova generazione inglese è stato aggiornato per migliorare il riconoscimento vocale:

  • en-WW_Medical_Telephony
Aggiunto il supporto per il francese e il tedesco sulla nuova personalizzazione migliorata del modello di lingua di prossima generazione

Recentemente è stata aggiunta la personalizzazione del modello di lingua per i modelli di nuova generazione in francese e tedesco. Questo aggiornamento del servizio include ulteriori miglioramenti interni.

Per ulteriori informazioni sulle funzionalità avanzate di personalizzazione di nuova generazione, consultare

Correzione dei difetti: le parole personalizzate contenenti caratteri Katakana a metà larghezza ora restituiscono un chiaro messaggio di errore con il modello di telefonia giapponese

Fix Defect: per la documentazione, solo i caratteri Katakana a larghezza intera vengono accettati nelle parole personalizzate e i modelli di prossima generazione ora mostrano un messaggio di errore per spiegare che non sono supportati. In precedenza, durante la creazione di parole personalizzate contenenti caratteri Katakana a mezza larghezza, non veniva fornito alcun messaggio di errore.

Correzione difetto: il modello di lingua telefonica giapponese non ha più esito negativo a causa di un lungo tempo di addestramento

Correzione dei difetti: quando si esegue l'addestramento di un modello di lingua personalizzato con la telefonia giapponese, il servizio ora gestisce effettivamente un numero elevato di parole personalizzate senza errori.

2 maggio 2023

Nuova procedura per l'aggiornamento di un modello personalizzato basato su un modello di nuova generazione migliorato

Sono ora disponibili due approcci per aggiornare un modello di linguaggio personalizzato a un modello di base di nuova generazione migliorato. Puoi ancora modificare e quindi riaddestrare il modello personalizzato, come già documentato. Ma ora, puoi anche aggiornare il modello personalizzato includendo il parametro di query force=true con la richiesta POST /v1/customizations/{customization_id}/train. Il parametro force aggiorna il modello personalizzato indipendentemente dal fatto che contenga modifiche (si trova nello stato ready o available ).

Per ulteriori informazioni, vedi Aggiornamento di un modello di lingua personalizzato basato su un modello di nuova generazione migliorato.

Guida per l'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati

La documentazione ora offre ulteriori indicazioni sull'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati. Per motivi di prestazioni durante la formazione, la guida incoraggia l'uso di corpora piuttosto che l'aggiunta diretta di parole personalizzate quando possibile.

Per ulteriori informazioni, vedi Linee guida per l'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati.

Le parole personalizzate in giapponese per i modelli personalizzati basati su modelli di nuova generazione migliorati vengono gestite in modo diverso

Per i modelli personalizzati giapponesi basati su modelli di nuova generazione, le parole personalizzate sono gestite in modo diverso rispetto ad altre lingue. Per il giapponese, è possibile aggiungere una parola o un suono personalizzati che non superi i 25 caratteri di lunghezza. Se la tua parola personalizzata o il tuo sound - like supera tale limite, il servizio aggiunge la parola al modello personalizzato come se fosse stato aggiunto da un corpus. La parola non viene visualizzata come parola personalizzata per il modello.

Per ulteriori informazioni, vedi Linee guida per l'aggiunta di parole ai modelli giapponesi basati su modelli di nuova generazione migliorati.

12 aprile 2023

Correzione del difetto: l'interfaccia WebSocket ora va in timeout come previsto quando si utilizzano modelli di nuova generazione
Correzione del difetto: quando viene utilizzata per il riconoscimento vocale con modelli di nuova generazione, l'interfaccia WebSocket ora va in timeout come previsto dopo lunghi periodi di silenzio. In precedenza, quando veniva utilizzato per il riconoscimento vocale di file audio brevi, la sessione WebSocket potrebbe non riuscire a raggiungere il timeout. Quando la sessione non è andata in timeout, il servizio non ha restituito un'ipotesi finale all'applicazione client in attesa e il client è invece scaduto durante l'attesa dei risultati.

6 aprile 2023

Correzione dei difetti: limiti per consentire il completamento della formazione per i modelli personalizzati giapponesi di nuova generazione

Correzione dei difetti: il corretto addestramento di un modello di lingua personalizzato giapponese di nuova generazione richiede che le parole e i suoni personalizzati aggiunti al modello non contengano più di 25 caratteri. Per l'addestramento più efficace, si consiglia che le parole e i suoni - like personalizzati non contengano più di 20 caratteri. L'addestramento dei modelli personalizzati giapponesi con parole e suoni personalizzati più lunghi non viene completato dopo più ore di addestramento.

Se hai bisogno di aggiungere l'equivalente di una parola lunga o di un suono simile a un modello personalizzato giapponese di nuova generazione, attieniti alla seguente procedura:

  1. Aggiungere una parola o suoni più brevi - come che cattura l'essenza della parola o dei suoni più lunghi - come al modello personalizzato.
  2. Aggiungere una o più frasi che utilizzano la parola o i suoni più lunghi a un corpus.
  3. Considera l'aggiunta di frasi al corpus che forniscono più contesto per la parola o suoni simili. Un contesto più ampio fornisce al servizio maggiori informazioni con cui riconoscere la parola e applicare i suoni corretti.
  4. Aggiungi il corpus al modello personalizzato.
  5. Riaddestra il modello personalizzato sulla combinazione della parola più breve o del suono simile e il corpus che contiene la stringa più lunga.

I limiti e i passi appena descritti consentono ai modelli personalizzati giapponesi di nuova generazione di completare l'addestramento. Tieni presente che l'aggiunta di un gran numero di nuove parole personalizzate a un modello di lingua personalizzato aumenta il tempo di addestramento del modello. Ma il tempo di addestramento aumentato si verifica solo quando il modello personalizzato viene inizialmente addestrato sulle parole nuove. Una volta che il modello personalizzato è stato addestrato sulle nuove parole, il tempo di addestramento ritorna normale.

For more information, see

Ulteriori miglioramenti alla personalizzazione del modello linguistico di nuova generazione

La personalizzazione del modello di lingua per i modelli di nuova generazione in inglese e giapponese è stata recentemente migliorata. Questo aggiornamento del servizio include ulteriori miglioramenti interni. Per ulteriori informazioni sulle funzionalità avanzate di personalizzazione di nuova generazione, consultare

13 marzo 2023

Correzione difetto: la formattazione intelligente per le date in inglese americano è ora corretta
Correzione del difetto: la formattazione intelligente ora include correttamente i giorni della settimana e le date in cui entrambi sono presenti nell'audio parlato, ad esempio Tuesday February 28. In precedenza, in alcuni casi, il giorno della settimana era omesso e la data era presentata in modo non corretto. Si noti che la formattazione intelligente è funzionalità beta.
Correzione difetto: aggiornare la documentazione per le parole di esitazione vocale per i modelli di nuova generazione
Fix Defect: la documentazione per le parole di esitazione vocale per i modelli di nuova generazione è stata aggiornata. Ulteriori dettagli sono forniti sulle parole di esitazione di inglese americano e giapponese. I modelli di nuova generazione includono le parole di esitazione effettive nei risultati della trascrizione, a differenza dei modelli di generazione precedente, che includono solo indicatori di esitazione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.

27 febbraio 2023

Nuovo modello di telefonia giapponese di nuova generazione

Il servizio offre ora un modello di telefonia di nuova generazione per il giapponese ja-JP_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Personalizzazione migliorata del modello di lingua per modelli inglesi e giapponesi di nuova generazione

Il servizio ora fornisce una migliore personalizzazione del modello di lingua per i modelli di inglese e giapponese di prossima generazione:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Miglioramenti visibili ai modelli: la nuova tecnologia migliora il comportamento predefinito dei nuovi modelli in inglese e in giapponese. Tra le altre modifiche, la nuova tecnologia ottimizza il comportamento predefinito per i parametri seguenti:

  • Il customization_weight predefinito per i modelli personalizzati basati sulle nuove versioni di questi modelli cambia da 0.2 a 0.1.
  • Il valore predefinito character_insertion_bias per i modelli personalizzati basati sulle nuove versioni di questi modelli rimane 0.0, ma i modelli sono stati modificati in un modo che rende meno necessario l'utilizzo del parametro per il riconoscimento vocale.

Aggiornamento ai nuovi modelli: per usufruire della tecnologia migliorata, devi eseguire l'upgrade dei modelli di lingua personalizzati basati sui nuovi modelli. Per eseguire l'aggiornamento alla nuova versione di uno di questi modelli di base, effettuare le seguenti operazioni:

  1. Modifica il tuo modello personalizzato aggiungendo o modificando una parola personalizzata, un corpus o una grammatica che il modello contiene. Qualsiasi modifica apportata sposta il modello nello stato ready.
  2. Utilizzare il metodo POST /v1/customizations/{customization_id}/train per eseguire nuovamente l'addestramento del modello. Il nuovo aggiornamento aggiorna il modello personalizzato alla nuova tecnologia e sposta il modello nello stato available.

Problema noto: in questo momento, non è possibile utilizzare il metodo POST /v1/customizations/{customization_id}/upgrade_model per aggiornare un modello personalizzato a un nuovo modello di base. Questo problema verrà risolto in una versione futura.

Utilizzo dei nuovi modelli: dopo l'upgrade al nuovo modello di base, ti consigliamo di valutare le prestazioni del modello personalizzato aggiornato prestando particolare attenzione ai parametri customization_weight e character_insertion_bias per il riconoscimento vocale. Quando esegui di nuovo l'addestramento del modello personalizzato:

  • Il modello personalizzato utilizza il nuovo customization_weight predefinito di 0.1 per il proprio modello personalizzato. Viene rimosso un customization_weight non predefinito associato al modello personalizzato.
  • Il modello personalizzato potrebbe non richiedere più l'utilizzo del parametro character_insertion_bias per il riconoscimento vocale ottimale.

I miglioramenti alla personalizzazione del modello di lingua rendono questi parametri meno importanti per il riconoscimento vocale di alta qualità:

  • Se si utilizzano i valori predefiniti per questi parametri, continuare a farlo dopo l'aggiornamento. I valori predefiniti continueranno probabilmente a offrire i migliori risultati per il riconoscimento vocale.
  • Se si specificano valori non predefiniti per questi parametri, provare con i valori predefiniti dopo l'aggiornamento. Il tuo modello personalizzato potrebbe funzionare bene per il riconoscimento vocale con i valori predefiniti.

Se ritieni che l'utilizzo di valori differenti per questi parametri potrebbe migliorare il riconoscimento vocale con il tuo modello personalizzato, prova le modifiche incrementali per determinare se i parametri sono necessari per migliorare il riconoscimento vocale.

Nota: a questo punto, i miglioramenti alla personalizzazione del modello di lingua si applicano solo ai modelli personalizzati basati sui modelli di lingua di base di nuova generazione in inglese o giapponese elencati in precedenza. Nel tempo, i miglioramenti saranno resi disponibili per altri modelli linguistici di prossima generazione.

Ulteriori informazioni: per ulteriori informazioni sull'aggiornamento e sul riconoscimento vocale con questi parametri, consultare

Correzione dei difetti: i file di grammatica ora gestiscono correttamente le stringhe di cifre

Fix Defect: quando vengono utilizzate le grammatiche, il servizio ora gestisce correttamente le stringhe di cifre più lunghe. In precedenza, non era in grado di completare il riconoscimento o restituire risultati errati.

15 febbraio 2023

Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio il 31 luglio 2023

Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio a partire dal 31 luglio 2023. A tale data, tutti i modelli di generazione precedente verranno rimossi dal servizio e dalla documentazione. La data di deprecazione precedente era il 3 marzo 2023. La nuova data consente agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati. Ma gli utenti devono migrare al modello equivalente di prossima generazione entro il 31 luglio 2023.

La maggior parte dei modelli di generazione precedente sono stati deprecati il 15 marzo 2022. In precedenza, i modelli arabo e giapponese non erano deprecati. L'obsolescenza ora si applica a tutti modelli di generazione precedente.

Nota: quando la generazione precedente en-US_BroadbandModel viene rimossa dal servizio, il modello en-US_Multimedia di nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

Correzione dei difetti: tempo di formazione migliorato per i modelli di lingua personalizzati di prossima generazione

Correzione del difetto: il tempo di addestramento per i modelli di lingua personalizzati di nuova generazione è ora notevolmente migliorato. In precedenza, il tempo di addestramento era molto più lungo del necessario, come riportato per l'addestramento dei modelli di lingua personalizzati giapponesi. Il problema è stato corretto da una correzione interna.

Correzione dei difetti: i file di grammatica generati dinamicamente ora funzionano correttamente

Fix Defect: i file di grammatica generati dinamicamente ora funzionano correttamente. In precedenza, i file di grammatica dinamici potevano causare errori interni, come riportato per l'integrazione di Speech to Text con IBM® watsonx™ Assistant. Il problema è stato corretto da una correzione interna.

20 gennaio 2023

I nomi dei modelli Arabo e Regno Unito obsoleti non sono più disponibili

I seguenti nomi modello in arabo e nel Regno Unito non sono più accettati dal servizio:

  • ar-AR_BroadbandModel- Utilizzare invece ar-MS_BroadbandModel.
  • en-UK_NarrowbandModel- Utilizzare invece en-GB_NarrowbandModel.
  • en-UK_BroadbandModel- Utilizzare invece en-GB_BroadbandModel.

Il nome del modello arabo è stato dichiarato obsoleto il 2 dicembre 2020. I nomi dei modelli inglesi del Regno Unito sono stati deprecati il 14 luglio 2017.

Obsolescenza e migrazione di Cloud Foundry ai gruppi di risorse

IBM ha annunciato l'abbandono di IBM Cloud Foundry il 31 maggio 2022. A partire dal 30 novembre 2022, non sarà più possibile creare nuove applicazioni 'IBM 'Cloud Foundry e solo gli utenti esistenti potranno distribuire le applicazioni. IBM 'Cloud Foundry raggiungono la fine del supporto il 1° giugno 2023. In quel momento, qualsiasi IBM Istanze runtime di applicazioni Cloud Foundry che eseguono IBM Cloud Foundry verranno disattivate, deprovisionate ed eliminate in modo permanente.

Per continuare a utilizzare le applicazioni IBM Cloud oltre il 1° giugno 2023, è necessario migrare ai gruppi di risorse prima di tale data. I gruppi di risorse sono concettualmente simili agli spazi di Cloud Foundry. Tra questi figurano diversi vantaggi aggiuntivi, quali un controllo degli accessi più granulare grazie all’utilizzo dell’ IBM Cloud Identity and Access Management (IAM), la possibilità di collegare istanze di servizio ad app e servizi in diverse regioni e un modo semplice per visualizzare l’utilizzo per gruppo.

Il parametro max_alternatives è ora disponibile per l'utilizzo con modelli di nuova generazione

Il parametro max_alternatives è ora disponibile per l'utilizzo con tutti i modelli di nuova generazione. Il parametro è generalmente disponibile per tutti i modelli di nuova generazione. Per ulteriori informazioni, vedi Numero massimo di alternative.

Correzione dei difetti: consentire l'utilizzo di entrambi i parametri max_alternatives e end_of_phrase_silence_time con i modelli di nuova generazione

Fix Defect: quando si utilizzano entrambi i parametri max_alternatives e end_of_phrase_silence_time nella stessa richiesta con i modelli di nuova generazione, il servizio ora restituisce più trascrizioni alternative rispettando anche l'intervallo di pausa indicato. In precedenza, l'utilizzo dei due parametri in una singola richiesta ha generato un errore. (L'uso del parametro max_alternatives con modelli di nuova generazione era precedentemente disponibile come funzione sperimentale per un numero limitato di clienti.)

Correzione del difetto: aggiornare il modello di telefonia di nuova generazione francese canadese (aggiornamento richiesto)

Correzione del difetto: il modello di telefonia francese canadese di nuova generazione, fr-CA_Telephony, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale. È necessario aggiornare i modelli personalizzati basati sul modello fr-CA_Telephony. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, consultare

Correzione dei difetti: aggiungere le linee guida per la documentazione per la creazione di suoni giapponesi basati su modelli di nuova generazione

Fix Defect: in sound - like per i modelli di lingua personalizzati giapponesi basati su modelli di nuova generazione, la sequenza di caratteri ウー è ambigua in alcuni contesti di sinistra. Non utilizzare caratteri (sillabe) che terminano con il fonema /o/, come e . In questi casi, utilizzare ウウ o solo invece di ウー. Ad esempio, utilizzare ロウウマン o ロウマン invece di ロウーマン. Per ulteriori informazioni, consultare Linee guida per il giapponese.

L'aggiunta di parole direttamente ai modelli personalizzati basati sui modelli di nuova generazione aumenta il tempo di addestramento

L'aggiungere parole personalizzate direttamente a un modello personalizzato che si basa su un modello di nuova generazione fa sì che l'addestramento di un modello impiega alcuni minuti in più di quanto non farebbe altrimenti. Se stai addestrando un modello con parole personalizzate che hai aggiunto utilizzando il metodo POST /v1/customizations/{customization_id}/words o PUT /v1/customizations/{customization_id}/words/{word_name}, concedi alcuni minuti di tempo di addestramento supplementare per il modello. Per ulteriori informazioni, vedi

Il numero massimo di ore di risorse audio per i modelli acustici personalizzati nell'ubicazione di Tokyo è stato aumentato

Il numero massimo di ore di risorse audio che puoi aggiungere ai modelli acustici personalizzati nell'ubicazione di Tokyo è ancora 200 ore. In precedenza, il massimo era stato ridotto a 50 ore per la regione di Tokyo. Tale riduzione è stata revocata e rinviata al prossimo anno. Per ulteriori informazioni, vedi Numero massimo di ore di audio.

5 dicembre 2022

Nuovo modello multimediale olandese di nuova generazione
Il servizio offre ora un modello multimediale di nuova generazione per l'olandese olandese olandese: nl-NL_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare
Correzione del difetto: correggere il riconoscimento delle parole personalizzato nei risultati della trascrizione per modelli di nuova generazione
Correzione del difetto: per la personalizzazione del modello di lingua con modelli di nuova generazione, le parole personalizzate sono ora riconosciute e utilizzate in tutte le trascrizioni. In precedenza, le parole personalizzate a volte non venivano riconosciute e utilizzate nei risultati della trascrizione.
Correzione difetto: correggere l'utilizzo del campo display_as nei risultati della trascrizione per modelli di nuova generazione
Correzione del difetto: per la personalizzazione del modello di lingua con modelli di nuova generazione, il valore del campo display_as per una parola personalizzata ora viene visualizzato in tutte le trascrizioni. In precedenza, il valore del campo word appariva talvolta nei risultati della trascrizione.
Correzione del difetto: aggiornamento della documentazione di denominazione del modello personalizzato
Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli di lingua personalizzati e dei modelli acustici personalizzati. Per ulteriori informazioni, vedi

20 ottobre 2022

Aggiornamenti ai modelli di telefonia di nuova generazione in inglese

I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Correzione difetto: aggiornare il modello multimediale di nuova generazione giapponese (aggiornamento richiesto)

Fix Defect: il modello multimediale di nuova generazione giapponese, ja-JP_Multimedia, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale con bassa latenza. È necessario aggiornare i modelli personalizzati basati sul modello ja-JP_Multimedia. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, consultare

7 ottobre 2022

Nuovo modello di telefonia svedese di nuova generazione

Il servizio ora offre un modello di telefonia di nuova generazione per lo svedese sv-SE_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamenti ai modelli di telefonia di nuova generazione in inglese

I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

21 settembre 2022

Nuovo evento Activity Tracker per l'eliminazione delle informazioni utente da parte del GDPR

Il servizio ora restituisce un evento Activity Tracker quando utilizzi il metodo DELETE /v1/user_data per eliminare tutte le informazioni su un utente. L'evento è denominato speech-to-text.gdpr-user-data.delete. Per ulteriori informazioni, vedi Eventi Activity Tracker.

Correzione dei difetti: aggiornare alcuni modelli di nuova generazione per migliorare il tempo di risposta a bassa latenza

Correzione dei difetti: i seguenti modelli di nuova generazione sono stati aggiornati per migliorarne il tempo di risposta quando si utilizza il parametro low_latency:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

In precedenza, questi modelli non restituivano i risultati di riconoscimento con la velocità prevista quando veniva utilizzato il parametro low_latency. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

19 agosto 2022

Importante: la data di scadenza per la maggior parte dei modelli di generazione precedente è ora il 3 marzo 2023

Sostituito: questa notifica di obsolescenza viene sostituita dall'aggiornamento del servizio del 15 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.

Il 15 marzo 2022, i modelli di generazione precedente per tutte le lingue tranne l'arabo e il giapponese furono deprecati. A quel tempo, i modelli obsoleti sarebbero rimasti disponibili fino al 15 settembre 2022. Per consentire agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati, i modelli obsoleti rimarranno ora disponibili fino al 3 marzo 2023. Come con l'avviso di deprecazione iniziale, i modelli di generazione precedente in arabo e giapponese non sono obsoleti. Per un elenco completo di tutti i modelli obsoleti, consulta l'aggiornamento del servizio del 15 marzo 2022.

Il 3 marzo 2023, i modelli obsoleti saranno rimossi dal servizio e dalla documentazione. Se si utilizza uno dei modelli obsoleti, è necessario migrare al modello di prossima generazione equivalente entro il 3 marzo 2023.

Nota: quando la generazione precedente en-US_BroadbandModel viene rimossa dal servizio, il modello en-US_Multimedia di nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

15 agosto 2022

Nuovo modello multimediale francese canadese di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per il francese canadese: fr-CA_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamenti ai modelli di telefonia di nuova generazione in inglese

I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Il modello multimediale italiano di nuova generazione ora supporta la bassa latenza

Il modello multimediale italiano di nuova generazione, it-IT_Multimedia, ora supporta la bassa latenza. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Importante: riduzione del numero massimo di ore di dati audio per i modelli acustici personalizzati

Importante: la quantità massima di dati audio che puoi aggiungere a un modello acustico personalizzato viene ridotta da 200 ore a 50 ore. Questo cambiamento è in fase di introduzione in diverse località da agosto a settembre 2022. Per informazioni sulla pianificazione per la riduzione del limite e cosa significa per i modelli acustici personalizzati esistenti che contengono più di cinquanta ore di audio, consulta Numero massimo di ore di audio.

3 agosto 2022

Correzione del difetto: aggiornare la documentazione dei contrassegni di esitazione e delle esitazioni

Fix Defect: la documentazione per le esitazioni del discorso e gli indicatori di esitazione è stata aggiornata. I modelli di generazione precedente includono marcatori di esitazione al posto delle esitazioni del discorso nei risultati della trascrizione per la maggior parte delle lingue; la formattazione intelligente rimuove i marcatori di esitazione dalle trascrizioni finali dell'inglese americano. I modelli di nuova generazione includono le reali esitazioni del discorso nei risultati di trascrizione; la formattazione intelligente non ha alcun effetto sulla loro inclusione nei risultati di trascrizione finali.

Per ulteriori informazioni, consulta:

1 giugno 2022

Aggiornamenti a più modelli di telefonia di nuova generazione

I seguenti modelli di telefoni di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony
  • ko-KR_Telephony

Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

25 maggio 2022

Nuovo parametro beta character_insertion_bias per i modelli di nuova generazione

Tutti i modelli di nuova generazione ora supportano il nuovo parametro beta, character_insertion_bias, disponibile con tutte le interfacce di riconoscimento vocale. Per impostazione predefinita, il servizio è ottimizzato per ogni singolo modello per bilanciarne il riconoscimento delle stringhe candidate di lunghezze differenti. La distorsione specifica del modello equivale a 0.0. La distorsione predefinita di ogni modello è sufficiente per la maggior parte delle richieste di riconoscimento vocale.

Tuttavia, alcuni casi di utilizzo potrebbero trarre vantaggio dalla preferenza di ipotesi con stringhe di caratteri più brevi o più lunghe. Il parametro accetta valori compresi tra -1.0 e 1.0 che rappresentano una modifica rispetto al valore predefinito di un modello. I valori negativi indicano al servizio di favorire le stringhe di caratteri più brevi. I valori positivi indirizzano il servizio a preferire stringhe di caratteri più lunghe. Per ulteriori informazioni, vedi Bias di inserimento dei caratteri.

19 maggio 2022

Nuovo modello italiano it-IT_Multimedia di nuova generazione

Il servizio offre ora un modello multimediale di nuova generazione per l'italiano: it-IT_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta la bassa latenza, ma supporta la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Modelli di telefonia e multimedia coreani aggiornati di prossima generazione

I modelli coreani di nuova generazione sono stati aggiornati:

  • Il modello ko-KR_Telephony è stato aggiornato per migliorare il supporto a bassa latenza per il riconoscimento vocale.
  • Il modello " ko-KR_Multimedia " è stato aggiornato per migliorare il riconoscimento vocale. Il modello ora supporta anche la bassa latenza.

Entrambi i modelli sono generalmente disponibili ed entrambi supportano la personalizzazione del modello di lingua e le grammatiche. Non è necessario aggiornare i modelli di lingua personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Correzione difetto: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione

Correzione dei difetti: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione. In precedenza, quando il servizio restituì più trascrizioni per una singola richiesta di riconoscimento vocale, i punteggi di affidabilità potrebbero non essere restituiti per tutte le trascrizioni.

11 aprile 2022

Nuovo modello portoghese brasiliano pt-BR_Multimedia di nuova generazione

Il servizio offre ora un modello multimediale di nuova generazione per il portoghese brasiliano pt-BR_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamento al modello di nuova generazione tedesco de-DE_Multimedia per supportare la bassa latenza

Il modello tedesco di nuova generazione, de-DE_Multimedia, ora supporta la bassa latenza. Non devi eseguire l'upgrade dei modelli personalizzati basati sul modello di base tedesco aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Il supporto per i suoni simili è ora documentato per i modelli personalizzati basati sui modelli di nuova generazione

Per i modelli di lingua personalizzati che si basano su modelli di nuova generazione, il supporto è ora documentato per le specifiche di suoni simili per le parole personalizzate. Il supporto per i suoni - like è disponibile dalla fine del 2021.

Esistono differenze tra l'utilizzo del campo sounds_like per i modelli personalizzati basati sui modelli di generazione precedente e di nuova generazione. Per ulteriori informazioni sull'utilizzo del campo sounds_like con i modelli personalizzati basati sui modelli di nuova generazione, vedi Gestione delle parole personalizzate per i modelli di nuova generazione.

Importante: parametro customization_id obsoleto rimosso dalla documentazione

Importante: il 9 ottobre 2018, il parametro customization_id di tutte le richieste di riconoscimento vocale è stato obsoleto e sostituito dal parametro language_customization_id. Il parametro customization_id è stato ora rimosso dalla documentazione per i metodi di riconoscimento vocale:

  • /v1/recognize per le richieste WebSocket
  • POST /v1/recognize per le richieste HTTP sincrone (incluse le richieste a più parti)
  • POST /v1/recognitions per le richieste HTTP asincrone

Nota: se utilizzi gli SDK Watson, assicurati di aver aggiornato qualsiasi codice dell'applicazione per utilizzare il parametro language_customization_id invece del parametro customization_id. Il parametro customization_id non sarà più disponibile dai metodi equivalenti degli SDK a partire dalla loro release principale successiva. Per ulteriori informazioni sui metodi di riconoscimento vocale, consulta la Guida di riferimento API & SDK.

17 marzo 2022

Il supporto grammaticale per i modelli di nuova generazione è ora generalmente disponibile

Il supporto grammaticale è ora generalmente disponibile (GA) per i modelli generali successivi che soddisfano le condizioni seguenti:

  • I modelli sono generalmente disponibili.
  • I modelli supportano la personalizzazione del modello di lingua.

Per ulteriori informazioni, vedi i seguenti argomenti:

Nuovo modello multimediale tedesco di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per il tedesco de-DE_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta bassa latenza. Supporta la personalizzazione del modello di lingua (generalmente disponibile) e le grammatiche (beta).

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta la bassa latenza

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta la bassa latenza. Per ulteriori informazioni su tutti i modelli di nuova generazione e bassa latenza, consultare

15 marzo 2022

Importante: Deprecazione della maggior parte dei modelli di generazione precedente

Sostituito: questa notifica di obsolescenza viene sostituita dall'aggiornamento del servizio del 15 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.

A partire dal 15 marzo 2022, i modelli di generazione precedente per tutte le lingue diverse dall'arabo e dal giapponese sono obsoleti. I modelli obsoleti rimangono disponibili fino al 15 settembre 2022, quando saranno rimossi dal servizio e dalla documentazione. I modelli di generazione precedente in arabo e giapponese non sono obsoleti.

I seguenti modelli di generazione precedente sono ora obsoleti:

  • Cinese (mandarino): zh-CN_NarrowbandModel e zh-CN_BroadbandModel
  • Olandese (Paesi Bassi): nl-NL_NarrowbandModel e nl-NL_BroadbandModel
  • Inglese (australiano): en-AU_NarrowbandModel e en-AU_BroadbandModel
  • Inglese (Regno Unito): en-GB_NarrowbandModel e en-GB_BroadbandModel
  • Inglese (Stati Uniti): en-US_NarrowbandModel, en-US_BroadbandModel e en-US_ShortForm_NarrowbandModel
  • Francese (canadese): fr-CA_NarrowbandModel e fr-CA_BroadbandModel
  • Francese (Francia): fr-FR_NarrowbandModel e fr-FR_BroadbandModel
  • Tedesco: de-DE_NarrowbandModel e de-DE_BroadbandModel
  • Italiano: it-IT_NarrowbandModel e it_IT_BroadbandModel
  • Coreano: ko-KR_NarrowbandModel e ko-KR_BroadbandModel
  • Portoghese (brasiliano): pt-BR_NarrowbandModel e pt-BR_BroadbandModel
  • Spagnolo (argentino) es-AR_NarrowbandModel e es-AR_BroadbandModel
  • Spagnolo (castigliano): es-ES_NarrowbandModel e es-ES_BroadbandModel
  • Spagnolo (cileno): es-CL_NarrowbandModel e es-CL_BroadbandModel
  • Spagnolo (colombiano): es-CO_NarrowbandModel e es-CO_BroadbandModel
  • Spagnolo (messicano): es-MX_NarrowbandModel e es-MX_BroadbandModel
  • Spagnolo (peruviano): es-PE_NarrowbandModel e es-PE_BroadbandModel

Se si utilizza uno di questi modelli obsoleti, è necessario migrare al modello di nuova generazione equivalente entro la data di fine del servizio.

Nota: quando la en-US_BroadbandModel di generazione precedente viene rimossa dal servizio il 15 settembre, il modello en-US_Multimedia di prossima generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

I modelli di nuova generazione ora supportano i parametri di analisi audio

Tutti i modelli di nuova generazione ora supportano i seguenti parametri di analisi audio come funzioni generalmente disponibili:

  • end_of_phrase_silence_time specifica la durata dell'intervallo di pausa in base al quale il servizio suddivide una trascrizione in più risultati finali. Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.
  • split_transcript_at_phrase_end indica al servizio di suddividere la trascrizione in più risultati finali in base alle caratteristiche semantiche dell'input. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.
Correzione del difetto: correggere la documentazione delle etichette dell'altoparlante

Fix Defect: la documentazione delle etichette del parlante includeva la seguente istruzione errata in più posizioni: per i modelli di nuova generazione, le etichette del parlante non sono supportate per l'utilizzo con risultati provvisori o bassa latenza. Le etichette dei parlanti sono supportate per l'utilizzo con risultati provvisori e bassa latenza per i modelli di nuova generazione. Per ulteriori informazioni, vedi Etichette del parlante.

28 febbraio 2022

Aggiornamenti ai modelli multimediali di nuova generazione in inglese e francese per supportare la bassa latenza

I seguenti modelli multimediali sono stati aggiornati per supportare la bassa latenza:

  • Inglese australiano: en-AU_Multimedia
  • Inglese britannico: en-GB_Multimedia
  • Inglese americano: en-US_Multimedia
  • Francese: fr-FR_Multimedia

Non è necessario aggiornare i modelli di lingua personalizzati creati su questi modelli di base. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Nuovo modello multimediale castigliano spagnolo di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per lo spagnolo castigliano: es-ES_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua (generalmente disponibile) e le grammatiche (beta).

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare

11 febbraio 2022

Correzione del difetto: correggere l'aggiornamento del modello personalizzato e la documentazione della versione del modello di base

Correzione del difetto: la documentazione che descrive l'aggiornamento dei modelli personalizzati e le stringhe di versione utilizzate per le diverse versioni dei modelli di base è stata aggiornata. La documentazione ora indica che l'aggiornamento per la personalizzazione del modello di linguaggio si applica anche ai modelli di prossima generazione. Inoltre, le stringhe di versione che rappresentano diverse versioni dei modelli di base sono state aggiornate. E il parametro base_model_version può essere utilizzato anche con i modelli di nuova generazione aggiornati.

Per ulteriori informazioni sull'aggiornamento del modello personalizzato, quando è necessario l'aggiornamento e su come utilizzare le versioni precedenti dei modelli personalizzati, vedi

Correzione del difetto: aggiornare la documentazione relativa alle maiuscole / minuscole

Fix Defect: la documentazione che descrive il maiuscolo / minuscolo automatico delle trascrizioni del servizio è stata aggiornata. Il servizio capitalizza i nomi appropriati solo per le lingue e i modelli seguenti:

  • Tutti i modelli di inglese americano di generazione precedente
  • Il modello tedesco di nuova generazione

Per ulteriori informazioni, consultare Capitalizzazione.

2 febbraio 2022

Nuovo modello beta en-WW_Medical_Telephony ora disponibile

È ora disponibile una nuova beta di nuova generazione en-WW_Medical_Telephony. Il nuovo modello comprende i termini dei settori medico e farmacologico. Utilizzare il modello in situazioni in cui è necessario trascrivere la terminologia medica comune, ad esempio nomi di medicinali, marchi di prodotti, procedure mediche, malattie, tipi di medici o terminologia COVID-19-related. I casi d'uso comuni includono le conversazioni tra un paziente e un medico (ad esempio, un medico, un infermiere o un farmacista).

Il nuovo modello è disponibile per tutti i dialetti inglesi supportati: australiano, indiano, britannico e statunitense. Il nuovo modello supporta la personalizzazione del modello di lingua e le grammatiche come funzionalità beta. Supporta la maggior parte degli stessi parametri del modello en-US_Telephony, incluso smart_formatting per l'audio in inglese americano. non supporta i seguenti parametri: low_latency, profanity_filter, redaction e speaker_labels.

Per ulteriori informazioni, vedere Modello di telefonia medica in inglese.

Aggiorna al modello zh-CN_Telephony cinese

Il modello cinese di nuova generazione zh-CN_Telephony è stato aggiornato per migliorare il riconoscimento vocale. Il modello continua a supportare la bassa latenza. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Se disponi di modelli linguistici personalizzati basati sul modello aggiornato, devi aggiornare i tuoi modelli personalizzati esistenti per poter sfruttare gli aggiornamenti utilizzando il metodo POST /v1/customizations/{customization_id}/upgrade_model . Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Aggiornamento al modello di nuova generazione giapponese ja-JP_Multimedia per supportare la bassa latenza

Il modello giapponese di nuova generazione ja-JP_Multimedia ora supporta la bassa latenza. Puoi utilizzare il parametro low_latency con le richieste di riconoscimento vocale che utilizzano il modello. Non è necessario aggiornare i modelli personalizzati basati sul modello di base giapponese aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

3 dicembre 2021

Nuovo modello di telefonia di nuova generazione spagnolo latino americano

Il servizio ora offre un modello di telefonia di nuova generazione per lo spagnolo latino - americano: es-LA_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile.

Il modello es-LA_Telephony si applica a tutti i dialetti latinoamericani. È l'equivalente dei modelli di generazione precedente disponibili per i dialetti argentino, cileno, colombiano, messicano e peruviano. Se è stato utilizzato un modello di generazione precedente per uno di questi dialetti specifici, utilizzare il modello es-LA_Telephony per migrare al modello di nuova generazione equivalente.

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Importante: i modelli di lingua personalizzati basati su determinati modelli di nuova creazione devono essere ricreati

Importante: se hai creato modelli di lingua personalizzati basati su determinati modelli di nuova generazione, devi ricrearli. Finché non si ricreano i modelli linguistici personalizzati, le richieste di riconoscimento vocale che tentano di utilizzare i modelli personalizzati falliscono con il codice di errore 400 di HTTP.

Devi ricreare i modelli di lingua personalizzati che hai creato in base alle versioni seguenti dei modelli di nuova generazione:

  • Per il modello di en-AU_Telephony, i modelli personalizzati che hai creato da en-AU_Telephony.v2021-03-03 a en-AU_Telephony.v2021-10-04.
  • Per il modello di en-GB_Telephony, i modelli personalizzati che hai creato da en-GB_Telephony.v2021-03-03 a en-GB_Telephony.v2021-10-04.
  • Per il modello di en-US_Telephony, i modelli personalizzati che hai creato da en-US_Telephony.v2021-06-17 a en-US_Telephony.v2021-10-04.
  • Per il modello di en-US_Multimedia, i modelli personalizzati che hai creato da en-US_Multimedia.v2021-03-03 a en-US_Multimedia.v2021-10-04.

Per identificare la versione di un modello su cui si basa un modello di lingua personalizzato, utilizzare il metodo GET /v1/customizations per elencare tutti i modelli di lingua personalizzati o il metodo GET /v1/customizations/{customization_id} per elencare uno specifico modello di lingua personalizzato. Il campo versions dell'output mostra il modello base per un modello di lingua personalizzato. Per ulteriori informazioni, vedi Elenco dei modelli di lingua personalizzati.

Per ricreare un modello di lingua personalizzato, creare prima un modello personalizzato. Aggiungi quindi tutti i corpora e le parole personalizzate del precedente modello personalizzato al nuovo modello. Puoi quindi eliminare il precedente modello personalizzato. Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato.

28 ottobre 2021

Nuovo modello di telefonia cinese di nuova generazione

Il servizio offre ora un modello di telefonia di nuova generazione per il cinese mandarino: zh-CN_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Nuovi modelli multimediali in inglese australiano e inglese britannico di nuova generazione

Il servizio offre ora i seguenti modelli multimediali di nuova generazione. I nuovi modelli sono generalmente disponibili e nessuno dei due supporta una bassa latenza.

  • Inglese australiano: en-AU_Multimedia
  • Inglese britannico: en-GB_Multimedia

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Aggiornamenti a più modelli di nuova generazione per il riconoscimento vocale migliorato

I seguenti modelli di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • Modello di telefonia inglese australiano (en-AU_Telephony)
  • Modello di telefonia inglese britannico (en-GB_Telephony)
  • Modello multimediale in inglese USA (en-US_Multimedia)
  • Modello di telefonia inglese (en-US_Telephony)
  • Modello di telefonia spagnola castigliana (es-ES_Telephony)

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Il supporto grammaticale per i modelli di generazione precedente è ora generalmente disponibile

Il supporto grammaticale è ora generalmente disponibile (GA) per i modelli generali precedenti che soddisfano le condizioni seguenti:

  • I modelli sono generalmente disponibili.
  • I modelli supportano la personalizzazione del modello di lingua.

Per ulteriori informazioni, vedi i seguenti argomenti:

Nuovo supporto della grammatica beta per i modelli di nuova generazione

Il supporto grammaticale è ora disponibile come funzionalità beta per tutti i modelli di nuova generazione. Tutti i modelli di nuova generazione sono generalmente disponibili (GA) e supportano la personalizzazione del modello di lingua. Per ulteriori informazioni, vedi i seguenti argomenti:

Nota: il supporto Beta per le grammatiche dai modelli di nuova generazione è disponibile solo per il servizio Speech to Text su IBM Cloud. Le grammatiche non sono ancora supportate per modelli di nuova generazione su IBM Cloud Pak for Data.

Nuovo campo custom_acoustic_model per le funzioni supportate

I metodi GET /v1/models e GET /v1/models/{model_id} ora segnalano se un modello supporta la personalizzazione del modello acustico. L'oggetto SupportedFeatures ora include un altro campo, custom_acoustic_model, un booleano che è true per il modello che supporta la personalizzazione del modello acustico e false in caso contrario. Attualmente, il campo è true per tutti i modelli di generazione precedente e false per tutti i modelli di nuova generazione.

22 ottobre 2021

Correzione del difetto: Risolvere i problemi di HTTP asincrono
Correzione del difetto: L'interfaccia asincrona HTTP non riusciva a trascrivere alcuni audio. Inoltre, il callback per la richiesta ha restituito lo stato recognitions.completed_with_results invece di recognitions.failed. Questo errore è stato risolto.

6 ottobre 2021

Aggiornamenti ai modelli di nuova generazione in ceco e olandese

I seguenti modelli di lingua di nuova generazione sono stati modificati come indicato:

  • Il modello di telefonia ceco, cs-CZ_Telephony, è ora generalmente disponibile (GA). Il modello continua a supportare la bassa latenza.
  • Il modello di telefonia olandese belga, nl-BE_Telephony, è stato aggiornato per migliorare il riconoscimento vocale. Il modello continua a supportare la bassa latenza.
  • Il modello di telefonia olandese, nl-NL_Telephony, è ora GA. Inoltre, il modello ora supporta la bassa latenza.

Per ulteriori informazioni su tutti i modelli di lingua di nuova generazione disponibili, vedi Modelli e lingue di nuova generazione.

Nuovo supporto HIPAA degli Stati Uniti per i piani Premium nella sede di Dallas

Il supporto HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti è ora disponibile per i piani Premium ospitati nell'ubicazione Dallas (us-south). Per ulteriori informazioni, consultare la legge sulla portabilità e la responsabilità in materia di assicurazione sanitaria(HIPAA).

16 settembre 2021

Nuovi modelli beta cechi e olandesi olandesi di prossima generazione

Il servizio ora supporta i nuovi modelli di lingua di nuova generazione. Entrambi i nuovi modelli sono funzionalità beta.

  • Ceco: cs-CZ_Telephony. Il nuovo modello supporta la bassa latenza.
  • Olandese olandese: nl-NL_Telephony. Il nuovo modello non supporta la bassa latenza.

Per ulteriori informazioni su tutti i modelli di lingua di nuova generazione disponibili, vedi Modelli e lingue di nuova generazione.

Aggiornamenti ai modelli di nuova generazione in coreano e portoghese brasiliano

Sono stati aggiornati i seguenti modelli di nuova generazione:

  • Il modello coreano ko-KR_Telephony ora supporta la bassa latenza.
  • Il modello " pt-BR_Telephony " in portoghese brasiliano è stato aggiornato per migliorare il riconoscimento vocale.
Correzione del difetto: correggere i risultati provvisori e la documentazione a bassa latenza

Fix Defect: la documentazione che descrive i risultati provvisori e le funzioni a bassa latenza con modelli di nuova generazione è stata riscritta per chiarezza e correttezza. Per ulteriori informazioni, vedi i seguenti argomenti:

Correzione del difetto: migliorare i risultati delle etichette degli altoparlanti

Fix Defect: quando si utilizzano le etichette degli altoparlanti con i modelli di nuova generazione, il servizio ora identifica l'altoparlante per tutte le parole dell'audio di input, incluse le parole molto brevi che hanno la stessa data / ora di inizio e fine.

31 agosto 2021

Tutti i modelli di nuova generazione sono ora generalmente disponibili

Tutti i modelli linguistici esistenti di nuova generazione sono ora generalmente disponibili (GA). Sono supportati per l'utilizzo in ambienti e applicazioni di produzione.

La personalizzazione del modello di lingua per modelli di nuova generazione è ora generalmente disponibile

La personalizzazione del modello di lingua è ora generalmente disponibile (GA) per tutti i modelli e le lingue di nuova generazione disponibili. La personalizzazione del modello di lingua per modelli di nuova generazione è supportata per l'utilizzo in ambienti e applicazioni di produzione.

Utilizza gli stessi comandi per creare, gestire e utilizzare i modelli di lingua personalizzati, i corpora e le parole personalizzate per i modelli di nuova generazione come fai per i modelli di generazione precedente. Ma la personalizzazione per i modelli di nuova generazione funziona in maniera diversa rispetto alla personalizzazione per modelli di generazione precedente. Per i modelli personalizzati basati su modelli di nuova generazione:

  • I modelli personalizzati non hanno alcun concetto di parole OOV (out - of - vocabulary).
  • Le parole dai corpora non sono aggiunte alla risorsa di parole.
  • Attualmente non è possibile utilizzare la funzione di suono - simile per le parole personalizzate.
  • Non hai bisogno di aggiornare i modelli personalizzati quando vengono aggiornati i modelli di lingua di base.
  • Le grammatiche non sono attualmente supportate.

Per ulteriori informazioni sull'utilizzo della personalizzazione del modello di lingua per i modelli di nuova generazione, consultare

Ulteriori argomenti descrivono la gestione di modelli di lingua, corpora e parole personalizzate. Queste operazioni sono le stesse per i modelli personalizzati basati su modelli di nuova generazione e precedenti.

16 agosto 2021

Nuovi modelli beta Indiano inglese, indiano hindi, giapponese e coreano di nuova generazione

Il servizio ora supporta i nuovi modelli di lingua di nuova generazione. Tutti i nuovi modelli sono funzionalità beta.

  • Inglese indiano: en-IN_Telephony. Il modello supporta una latenza bassa.
  • Hindi indiano: hi-IN_Telephony. Il modello supporta una latenza bassa.
  • Giapponese: ja-JP_Multimedia. Il modello non supporta la bassa latenza.
  • Coreano: ko-KR_Multimedia e ko-KR_Telephony. I modelli non supportano la bassa latenza.

Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, vedi Lingue e modelli di nuova generazione e Bassa latenza.

16 luglio 2021

Nuovo modello beta francese di nuova generazione
Il modello di lingua francese di nuova generazione fr-FR_Multimedia è ora disponibile. Il nuovo modello non supporta la bassa latenza. Il modello è una funzionalità beta.
Aggiornamenti al modello beta di nuova generazione in inglese americano per un migliore riconoscimento vocale
Il modello en-US_Telephony in inglese americano di nuova generazione è stato aggiornato per migliorare il riconoscimento vocale. Il modello aggiornato continua ad essere una funzionalità beta.
Correzione difetto: aggiornare la documentazione per gli indicatori di esitazione
Fix Defect: la documentazione non è riuscita ad affermare che i modelli di nuova generazione non producono indicatori di esitazione. La documentazione è stata aggiornata per tenere presente che solo i modelli di generazione precedente producono indicatori di esitazione. I modelli di prossima generazione includono le reali esitazioni nei risultati della trascrizione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.

15 giugno 2021

Nuovo modello beta belga olandese di prossima generazione

È ora disponibile il modello di lingua belga olandese (fiammingo) di nuova generazione nl-BE_Telephony. Il nuovo modello supporta la bassa latenza. Il modello è una funzionalità beta. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza.

Nuovo supporto beta a bassa latenza per i modelli di nuova generazione in arabo, francese canadese e italiano

I seguenti modelli di linguaggio beta di nuova generazione supportano ora la bassa latenza:

  • Modello ar-MS_Telephony arabo
  • Modello fr-CA_Telephony francese canadese
  • Modello it-IT_Telephony italiano

Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza.

Aggiornamenti ai modelli beta arabo e portoghese brasiliano di nuova generazione per un migliore riconoscimento vocale

I seguenti modelli linguistici di nuova generazione attualmente in versione beta sono stati aggiornati per migliorare il riconoscimento vocale:

  • Modello ar-MS_Telephony arabo
  • Modello pt-BR_Telephony portoghese brasiliano

Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza.

26 maggio 2021

Nuovo supporto beta per il parametro audio_metrics per i modelli di nuova generazione
Il parametro audio_metrics è ora supportato come funzionalità beta per l'utilizzo con tutti i linguaggi e modelli di nuova generazione. Per ulteriori informazioni, vedi Metriche audio.
Nuovo supporto beta per il parametro word_confidence per i modelli di nuova generazione
Il parametro word_confidence è ora supportato come funzionalità beta per l'utilizzo con tutti i linguaggi e modelli di nuova generazione. Per ulteriori informazioni, vedi Attendibilità delle parole.
Correzione difetto: aggiornare la documentazione per i modelli di nuova generazione
Correzione dei difetti: la documentazione è stata aggiornata per correggere le seguenti informazioni:
  • Quando utilizzi un modello di nuova generazione per il riconoscimento vocale, i risultati della trascrizione finale includono ora il campo confidence. Il campo è sempre incluso nei risultati della trascrizione finale quando si utilizza un modello di generazione precedente. Questa correzione si riferisce a una limitazione riportata per la release del 12 aprile 2021 dei modelli di nuova generazione.
  • La documentazione ha dichiarato in modo non corretto che l'uso del parametro smart_formatting fa sì che il servizio rimuova gli indicatori di esitazione dai risultati della trascrizione finale per il giapponese. La formattazione intelligente non rimuove gli indicatori di esitazione dai risultati finali per il giapponese, solo per l'inglese americano. Per ulteriori informazioni, consultare Quali risultati influiscono sulla formattazione intelligente?

27 aprile 2021

Nuovi modelli beta in arabo e portoghese brasiliano di nuova generazione

Il servizio supporta due nuovi modelli beta di nuova generazione:

  • Il modello pt-BR_Telephony portoghese brasiliano, che supporta la bassa latenza.
  • Arabo (Standard moderno) Modello ar-MS_Telephony, che non supporta la bassa latenza.

Per ulteriori informazioni, vedi Next-generation languages and models.

Aggiornamenti al modello beta castigliano di nuova generazione per un migliore riconoscimento vocale

Il modello es-ES_Telephony castigliano di nuova generazione supporta ora il parametro low_latency. Per ulteriori informazioni, vedi Bassa latenza.

Nuovo supporto beta per le etichette dei diffusori con modelli di nuova generazione

Il parametro speaker_labels è ora supportato come funzionalità beta per l'utilizzo con i seguenti modelli di nuova generazione:

  • Modello en-AU_Telephony inglese australiano
  • Modello en-GB_Telephony inglese britannico
  • Modelli en-US_Multimedia e en-US_Telephony in inglese USA
  • Modello de-DE_Telephony tedesco
  • Modello es-ES_Telephony spagnolo castigliano

Con i modelli di generazione successiva, il parametro speaker_labels non è supportato per l'utilizzo con i parametri interim_results o low_latency in questo momento. Per ulteriori informazioni, vedi Etichette del parlante.

Nuovo codice di errore HTTP per l'utilizzo di word_confidence con i modelli di nuova generazione

Il parametro word_confidence non può essere utilizzato con modelli di nuova generazione. Il servizio ora restituisce il seguente codice di errore 400 se utilizzi il parametro word_confidence con un modello di nuova generazione per il riconoscimento vocale:

{
  "error": "word_confidence is not a supported feature for model {model}",
  "code": 400,
  "code_description": "Bad Request"
}

12 aprile 2021

Nuovi modelli di linguaggio beta di nuova generazione e parametri low_latency

Il servizio ora supporta un numero crescente di modelli di linguaggio di nuova generazione. I modelli multimediali e telefonia di nuova generazione migliorano le funzioni di riconoscimento vocale della precedente generazione di modelli a banda larga e a banda stretta del servizio. I nuovi modelli sfruttano le reti neurali profonde e l'analisi bidirezionale per ottenere una maggiore velocità effettiva e una maggiore precisione di trascrizione. In questo momento, i modelli di nuova generazione supportano solo un numero limitato di lingue e funzioni di riconoscimento vocale. Le lingue, i modelli e le funzioni supportati aumenteranno con le release future. I modelli di nuova generazione sono funzionalità beta.

Molti dei modelli di prossima generazione supportano anche un nuovo parametro low_latency che consente di richiedere risultati più rapidi a discapito di una qualità di trascrizione ridotta. Quando è abilitata la bassa latenza, il servizio riduce la sua analisi dell'audio, che può ridurre l'accuratezza della trascrizione. Questo trade-off potrebbe essere accettabile se la tua applicazione richiede un tempo di risposta più basso rispetto alla massima precisione accuracy.The low_latency è una funzione beta.

Il parametro low_latency influisce sull'uso del parametro interim_results con l'interfaccia WebSocket. I risultati provvisori sono disponibili solo per i modelli di nuova generazione che supportano la bassa latenza e solo se i parametri interim_results e low_latency sono impostati su true.

17 marzo 2021

Correzione di un difetto: Correzione della limitazione per l'interfaccia asincrona HTTP
Correzione del difetto: È stata risolta la limitazione segnalata con l'interfaccia asincrona HTTP nella sede di Dallas ( us-south ) il 16 dicembre 2020. In precedenza, una piccola percentuale di lavori stava entrando in loop infiniti che ne impedivano l'esecuzione. Le richieste asincrone di HTTP nel data center di Dallas non presentano più questa limitazione.

2 dicembre 2020

Modello arabo ridenominato come ar-MS_BroadbandModel
Il modello di banda larga in lingua araba è ora denominato ar-MS_BroadbandModel. Il nome precedente, ar-AR_BroadbandModel, è obsoleto. Continuerà a funzionare per almeno un anno, ma potrebbe essere rimosso in una data futura. Si consiglia di migrare al nuovo nome appena possibile.

2 novembre 2020

Modelli francesi canadesi ora disponibili in generale

I modelli francese canadese, fr-CA_BroadbandModel e fr-CA_NarrowbandModel, sono ora generalmente disponibili (GA). In precedenza erano beta. Ora supportano anche il modello di lingua e la personalizzazione del modello acustico.

22 ottobre 2020

I modelli in inglese australiano sono ora generalmente disponibili

I modelli in inglese australiano, en-AU_BroadbandModel e en-AU_NarrowbandModel, sono ora generalmente disponibili (GA). In precedenza erano beta. Ora supportano anche il modello di lingua e la personalizzazione del modello acustico.

Aggiornamenti ai modelli di portoghese brasiliano per un migliore riconoscimento vocale

I modelli portoghese brasiliano, pt-BR_BroadbandModel e pt-BR_NarrowbandModel, sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Il parametro split_transcript_at_phrase_end è ora generalmente disponibile per tutte le lingue

Il parametro di riconoscimento vocale split_transcript_at_phrase_end è ora generalmente disponibile (GA) per tutte le lingue. In precedenza, era generalmente disponibile solo per l'inglese degli Stati Uniti e del Regno Unito. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.

7 ottobre 2020

Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale

Il modello " ja-JP_BroadbandModel " è stato aggiornato per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

30 settembre 2020

Aggiornamenti ai piani dei prezzi per il servizio

I piani dei prezzi per il servizio sono stati modificati:

  • Il servizio continua a offrire un piano Lite che fornisce l'accesso gratuito di base a minuti limitati di riconoscimento vocale al mese.
  • Il servizio offre un nuovo piano Plus che fornisce un modello di prezzi a livelli semplice e l'accesso alle funzionalità di personalizzazione del servizio.
  • Il servizio offre un nuovo piano Premium che fornisce una capacità significativamente maggiore e funzionalità avanzate.

Il piano Plus sostituisce il piano Standard. Il piano Standard continua ad essere disponibile per l'acquisto per un breve periodo. Inoltre, continua ad essere disponibile a tempo indeterminato per gli utenti esistenti del piano, senza alcuna modifica dei loro prezzi. Gli utenti esistenti possono eseguire l'upgrade al piano Plus in qualsiasi momento.

Per ulteriori informazioni sui piani tariffari disponibili, consulta le seguenti risorse:

  • Per informazioni generali sui piani dei prezzi e sulle risposte a domande comuni, vedi le FAQ sui prezzi.
  • Per ulteriori informazioni sui piani dei prezzi o per acquistare un piano, vedi il servizio Speech to Text in IBM Cloud® Catalogo.

20 agosto 2020

Nuovi modelli francesi canadesi

Il servizio ora offre modelli a banda larga e stretta beta per il francese canadese:

  • fr-CA_BroadbandModel
  • fr-CA_NarrowbandModel

I nuovi modelli non supportano la personalizzazione dei modelli di lingua o acustici, le etichette del parlante o la formattazione intelligente. Per ulteriori informazioni su questi e su tutti i modelli supportati, consulta la sezione " Modelli linguistici di generazione precedente supportati ".

5 agosto 2020

Nuovi modelli di inglese australiano

Il servizio ora offre modelli a banda larga e stretta beta per l'inglese australiano:

  • en-AU_BroadbandModel
  • en-AU_NarrowbandModel

I nuovi modelli non supportano la personalizzazione dei modelli di lingua o acustici o la formattazione intelligente. I nuovi modelli supportano le etichette del parlante. Per ulteriori informazioni, vedi

Aggiornamenti a più modelli per un migliore riconoscimento vocale

I seguenti modelli sono stati aggiornati per un migliore riconoscimento vocale:

  • Modello francese a banda larga (fr-FR_BroadbandModel)
  • Modelli a banda larga in Germania (de-DE_BroadbandModel) e a banda stretta (de-DE_NarrowbandModel)
  • Modelli a banda larga inglese britannico (en-GB_BroadbandModel) e a banda stretta (en-GB_NarrowbandModel)
  • Modello a banda stretta in lingua inglese (en-US_ShortForm_NarrowbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Indicatore di esitazione per il tedesco cambiato

Il marcatore di esitazione utilizzato nei modelli tedeschi aggiornati a banda larga e a banda stretta è cambiato da [hesitation] a %HESITATION. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.

4 giungo 2020

Correzione dei difetti: migliorare la latenza per i modelli di lingua personalizzati con molte grammatiche
Correzione del difetto: il problema di latenza per i modelli di lingua personalizzati che contengono un numero elevato di grammatiche è stato risolto. Quando venivano inizialmente utilizzati per il riconoscimento vocale, il caricamento di tali modelli personalizzati poteva richiedere diversi secondi. I modelli personalizzati ora si caricano molto più velocemente, riducendo notevolmente la latenza quando vengono utilizzati per il riconoscimento.

28 aprile 2020

Aggiornamenti ai modelli italiani per un migliore riconoscimento vocale

I modelli a banda larga (it-IT_BroadbandModel) e a banda stretta (it-IT_NarrowbandModel) per l'italiano sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Modelli olandesi e italiani ora disponibili in generale

I modelli di lingua per l'olandese e l'italiano sono ora generalmente disponibili (GA) per il riconoscimento vocale e per la personalizzazione dei modelli di lingua e acustico.

  • Modello a banda larga per l'olandese (nl-NL_BroadbandModel)
  • Modello a banda stretta per l'olandese (nl-NL_NarrowbandModel)
  • Modello a banda larga per l'italiano (it-IT_BroadbandModel)
  • Modello a banda stretta per l'italiano (it-IT_NarrowbandModel)

Per ulteriori informazioni sui modelli di lingua disponibili, vedi

1 aprile 2020

La personalizzazione del modello acustico è ora generalmente disponibile

La personalizzazione del modello acustico è ora generalmente disponibile (GA) per tutte le lingue supportate. Come con i modelli di lingua personalizzati, IBM non addebita alcun costo per la creazione o l'hosting di un modello acustico personalizzato. Ti vengono addebitati dei costi solo per l'utilizzo di un modello personalizzato con una richiesta di riconoscimento vocale.

L'utilizzo di un modello di lingua personalizzato, di un modello acustico personalizzato o di entrambi i tipi per la trascrizione comporta un addebito aggiuntivo di $0,03 (USD) al minuto. Questo addebito è in aggiunta al costo di utilizzo standard di $0,02 (USD) al minuto e si applica a tutte le lingue supportate dall'interfaccia di personalizzazione. Quindi il costo totale per l'utilizzo di uno o più modelli personalizzati per il riconoscimento vocale è di $ 0,05 (USD) al minuto.

16 marzo 2020

Le etichette degli altoparlanti sono ora supportate per il tedesco e il coreano
Il servizio ora supporta le etichette del parlante (il parametro speaker_labels) per i modelli di lingua in tedesco e coreano. Le etichette del parlante identificano gli individui e le parole da essi espresse in uno scambio tra più partecipanti. Per ulteriori informazioni, vedi Etichette del parlante.
Activity Tracker ora supportato per l'interfaccia asincrona HTTP
Il servizio ora supporta l'uso di eventi Activity Tracker per tutte le operazioni dell'interfaccia asincrona HTTP. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud®. Per ulteriori informazioni, vedi Eventi Activity Tracker.

24 febbraio 2020

Aggiornamenti a più modelli per un migliore riconoscimento vocale

I seguenti modelli sono stati aggiornati per un migliore riconoscimento vocale:

  • Modello a banda larga per l'olandese (nl-NL_BroadbandModel)
  • Modello a banda stretta per l'olandese (nl-NL_NarrowbandModel)
  • Modello a banda larga per l'italiano (it-IT_BroadbandModel)
  • Modello a banda stretta per l'italiano (it-IT_NarrowbandModel)
  • Modello a banda stretta per il giapponese (ja-JP_NarrowbandModel)
  • Modello a banda larga per l'inglese (Stati Uniti) (en-US_BroadbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

La personalizzazione del modello linguistico è ora disponibile per l'olandese e l'italiano

La personalizzazione dei modelli linguistici è ora supportata per l'olandese e l'italiano con le nuove versioni dei seguenti modelli:

  • Modello a banda larga per l'olandese (nl-NL_BroadbandModel)
  • Modello a banda stretta per l'olandese (nl-NL_NarrowbandModel)
  • Modello a banda larga per l'italiano (it-IT_BroadbandModel)
  • Modello a banda stretta per l'italiano (it-IT_NarrowbandModel)

Per ulteriori informazioni, vedi

Poiché i modelli per l'olandese e l'italiano sono nella beta, anche il loro supporto per la personalizzazione del modello di lingua è in beta.

Il modello giapponese a banda stretta ora include alcune unità di parole multigrammo

Il modello a banda stretta per il giapponese (ja-JP_NarrowbandModel) ora include alcune unità di parole multigrammaticali per cifre e frazioni decimali. Il servizio restituisce queste unità multigrammaticali indipendentemente dal fatto che hai abilitato la formattazione intelligente. La funzione di formattazione intelligente comprende e restituisce le unità multigrammaticali generate dal modello. Se applichi la tua post-elaborazione ai risultati della trascrizione, devi gestire queste unità in modo appropriato. Per ulteriori informazioni, vedi Giapponese nella documentazione della formattazione intelligente.

Nuovi parametri di rilevamento dell'attività vocale e di soppressione audio in background per il riconoscimento vocale

Il servizio ora offre due nuovi parametri facoltativi per controllare il livello di rilevamento dell'attività vocale. I parametri possono aiutarti a garantire che viene elaborato solo l'audio pertinente al riconoscimento vocale.

  • Il parametro speech_detector_sensitivity regola la sensibilità del rilevamento dell'attività vocale. Puoi utilizzare il parametro per eliminare gli inserimenti di parole da file audio musicali, colpi di tosse e altri eventi non vocali.
  • Il parametro background_audio_suppression elimina l'audio di sottofondo in base al suo volume per evitare che venga trascritto o interferisca in qualche modo con il riconoscimento vocale. Puoi utilizzare il parametro per eliminare conversazioni marginali o rumore di sottofondo.

Puoi utilizzare i parametri individualmente o insieme. Sono disponibili per tutte le interfacce e per la maggior parte dei modelli di lingua. Per ulteriori informazioni sui parametri, i loro valori consentiti e il loro effetto sulla qualità e la latenza del riconoscimento vocale, vedi Rilevamento dell'attività vocale.

Activity Tracker ora supportato per le interfacce di personalizzazione

Il servizio ora supporta l'utilizzo di eventi Activity Tracker per tutte le operazioni di personalizzazione. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud. Puoi utilizzare questo servizio per indagare su attività anomale e azioni critiche e per rispettare i requisiti di controllo normativi. Inoltre, puoi essere avvertito in merito alle azioni non appena si verificano. Per ulteriori informazioni, vedi Eventi Activity Tracker.

Correzione del difetto: correggere la creazione delle metriche di elaborazione con interfaccia WebSocket

Correzione di un bug: l'interfaccia WebSocket ora funziona correttamente durante la generazione delle metriche di elaborazione. In precedenza, le metriche di elaborazione potevano continuare ad essere distribuite dopo che il client aveva inviato un messaggio stop al servizio.

18 dicembre 2019

Nuovi modelli beta italiani disponibili

Il servizio ora offre modelli a banda larga e stretta beta per la lingua italiana:

  • it-IT_BroadbandModel
  • it-IT_NarrowbandModel

Questi modelli di lingua supportano la personalizzazione del modello acustico. Non supportano la personalizzazione del modello di lingua. Poiché sono beta, questi modelli potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.

Per ulteriori informazioni, vedi le seguenti sezioni:

Nuovo parametro end_of_phrase_silence_time per il riconoscimento vocale

Per il riconoscimento vocale, il servizio ora supporta il parametro end_of_phrase_silence_time. Il parametro specifica la durata dell'intervallo di pausa dopo di cui il servizio suddivide una trascrizione in più risultati finali. Ogni risultato finale indica una pausa o un silenzio esteso che supera l'intervallo di pausa. Per la maggior parte delle lingue, l'intervallo di pausa predefinito è 0,8 secondi; per il cinese è 0,6 secondi.

Puoi utilizzare il parametro per trovare un compromesso tra quanto spesso viene prodotto un risultato finale e l'accuratezza della trascrizione. Aumenta l'intervallo quando l'accuratezza è più importante della latenza. Diminuisci l'intervallo quando prevedi che il parlante pronunci frasi brevi o singole parole.

Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.

Nuovo parametro split_transcript_at_phrase_end per il riconoscimento vocale

Per il riconoscimento vocale, il servizio ora supporta il parametro split_transcript_at_phrase_end. Il parametro indica al servizio di suddividere la trascrizione in più risultati finali in base alle funzioni di semantica dell'input, come ad esempio alla conclusione di periodi. Il servizio basa la sua comprensione delle funzioni semantiche sul modello di lingua di base che utilizzi con una richiesta. I modelli di lingua personalizzati e le grammatiche possono influenzare anche come e in quale punto il servizio suddivide una trascrizione.

Il parametro comporta che il servizio aggiunga un campo end_of_utterance ad ogni risultato finale per indicare il motivo della suddivisione: full_stop, silence, end_of_data o reset.

Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.

12 dicembre 2019

Supporto completo per l'IAM di IBM Cloud

Il servizio Speech to Text ora supporta l'implementazione completa di IBM Cloud Identity and Access Management (IAM). Le chiavi API per i servizi IBM Watson® non sono più limitate a una singola istanza del servizio. Puoi creare politiche di accesso e chiavi API che vengono applicate a più di un servizio e puoi concedere l'accesso tra i servizi. Per ulteriori informazioni su IAM, vedi Autenticazione ai servizi Watson.

Per supportare questa modifica, gli endpoint del servizio API utilizzano un dominio diverso e includono l'ID istanza del servizio. Il modello è api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}.

  • URL HTTP di esempio per un'istanza ospitata nell'ubicazione Dallas:

https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • URL WebSocket di esempio per un'istanza ospitata nell'ubicazione Dallas:

wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Per ulteriori informazioni sugli URL, consultare la guida di riferimento API e SDK.

Questi URL non costituiscono una modifica importante. I nuovi URL funzionano sulle tue istanze del servizio esistenti o nuove. Gli URL originali continuano a funzionare sulle tue istanze del servizio esistenti per almeno un anno, fino a dicembre 2020.

Sono disponibili nuove funzionalità di sicurezza della rete e dei dati

È ora disponibile il supporto per la seguente nuova funzione di sicurezza della rete e dei dati:

  • Supporto per gli endpoint di rete privati

    Gli utenti dei piani Premium possono creare endpoint di rete privati per connettersi al servizio Speech to Text tramite una rete privata. Le connessioni agli endpoint di rete privata non richiedono l'accesso alla rete internet pubblica. Per ulteriori informazioni, vedi Endpoint di rete pubblici e privati.

10 dicembre 2019

Nuovi modelli beta olandesi disponibili

Il servizio offre ora modelli beta a banda larga e a banda stretta per i Paesi Bassi in lingua olandese:

  • nl-NL_BroadbandModel
  • nl-NL_NarrowbandModel

Questi modelli di lingua supportano la personalizzazione del modello acustico. Non supportano la personalizzazione del modello di lingua. Poiché sono beta, questi modelli potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.

Per ulteriori informazioni, vedi le seguenti sezioni:

25 novembre 2019

Aggiornamenti alle etichette degli altoparlanti per una migliore identificazione dei singoli altoparlanti
Le etichette del parlante sono state aggiornate per migliorare l'identificazione di singoli parlanti per ulteriori analisi del tuo campione audio. Per ulteriori informazioni sulla funzione di etichette del parlante, vedi Etichette del parlante. Per ulteriori informazioni sui miglioramenti apportati a questa funzionalità, consultare l’articolo “IBM Research AI Advances Speaker Diarization in Real Use Cases ”.

12 novembre 2019

Nuova sede di Seul ora disponibile
Il servizio " Speech to Text " è ora disponibile nella sede di Seul ( kr-seo ) di IBM Cloud. Come per le altre ubicazioni, l'ubicazione IBM Cloud utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.

1 novembre 2019

Nuovi limiti sul numero massimo di modelli personalizzati
Non puoi creare più di 1024 modelli di lingua personalizzati e non più di 1024 modelli acustici personalizzati per credenziali di gestione. Per ulteriori informazioni, vedi Numero massimo di modelli personalizzati.

1 ottobre 2019

Nuovo supporto HIPAA degli Stati Uniti per i piani Premium a Washington, DC, sede
Il supporto HIPAA per gli Stati Uniti è disponibile per i piani Premium ospitati nella sede di Washington, DC ( us-east ) e creati a partire dal 1° aprile 2019. Per ulteriori informazioni, vedi HIPAA (Health Insurance Portability and Accountability Act).

22 agosto 2019

Correzione dei difetti: diversi piccoli miglioramenti
Il servizio è stato aggiornato con piccole correzioni e miglioramenti.

30 luglio 2019

Nuovi modelli per dialetti spagnoli ora disponibili

Il servizio ora offre dei modelli di lingua a banda larga e a banda stretta in sei dialetti spagnoli:

  • Spagnolo argentino (es-AR_BroadbandModel e es-AR_NarrowbandModel)
  • Spagnolo castigliano (es-ES_BroadbandModel e es-ES_NarrowbandModel)
  • Spagnolo cileno (es-CL_BroadbandModel e es-CL_NarrowbandModel)
  • Spagnolo colombiano (es-CO_BroadbandModel e es-CO_NarrowbandModel)
  • Spagnolo messicano (es-MX_BroadbandModel e es-MX_NarrowbandModel)
  • Spagnolo peruviano (es-PE_BroadbandModel e es-PE_NarrowbandModel)

I modelli per lo spagnolo castigliano non sono nuovi. Sono disponibili in versione generale (GA) per il riconoscimento vocale e la personalizzazione dei modelli linguistici, mentre sono in versione beta per la personalizzazione dei modelli acustici.

Gli altri cinque dialetti sono nuovi e sono beta per tutti gli usi. Poiché sono beta, questi dialetti aggiuntivi potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.

Per ulteriori informazioni, vedi le seguenti sezioni:

24 giugno 2019

Aggiornamenti ai modelli portoghese brasiliano e inglese americano per un migliore riconoscimento vocale

I seguenti modelli a banda stretta sono stati aggiornati per un migliore riconoscimento vocale:

  • Modello a banda stretta per il portoghese (Brasile) (pt-BR_NarrowbandModel)
  • Modello a banda stretta per l'inglese (Stati Uniti) (en-US_NarrowbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Nuovo supporto per richieste simultanee per aggiornare diversi modelli acustici personalizzati

Il servizio ora ti consente di inoltrare più richieste simultanee per aggiungere risorse audio diverse a un modello acustico personalizzato. In precedenza, il servizio consentiva solo una richiesta alla volta per aggiungere l'audio a un modello personalizzato.

Nuovo campo updated per i metodi che elencano i modelli personalizzati

L'output dei metodi GET HTTP che elencano le informazioni sui modelli di lingua e acustici personalizzati include ora un campo updated. Il campo indica la data e l'ora in formato UTC (Coordinated Universal Time) in cui è stata apportata l'ultima modifica al modello personalizzato.

Modifica allo schema per le avvertenze associate alla formazione del modello personalizzato

Lo schema è stato modificato per un'avvertenza generata dalla richiesta di addestramento di un modello personalizzato quando il parametro strict è impostato su false. I nomi dei campi sono stati modificati rispettivamente da warning_id e description in code e message. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.

10 giugno 2019

Metriche di elaborazione non disponibili con l'interfaccia sincrona HTTP
Le metriche di elaborazione sono disponibili solo con le interfacce " WebSocket " e " HTTP " asincrona. Non sono supportate con l'interfaccia HTTP sincrona. Per ulteriori informazioni, vedi Metriche di elaborazione.

17 maggio 2019

Nuove metriche di elaborazione e funzioni di metriche audio per il riconoscimento vocale

Il servizio ora offre due tipi di metriche facoltative con le richieste di riconoscimento vocale:

  • Le metriche di elaborazione forniscono informazioni temporali dettagliate sull'analisi dell'audio di input da parte del servizio. Il servizio restituisce le metriche a intervalli specifici e con eventi di trascrizione, come i risultati provvisori e finali. Utilizza le metriche per valutare l'avanzamento del servizio nella trascrizione dell'audio.
  • Le metriche audio forniscono informazioni dettagliate sulle caratteristiche di segnale dell'audio di input. I risultati forniscono metriche aggregate per l'intero audio di input al termine dell'elaborazione vocale. Utilizza le metriche per determinare le caratteristiche e la qualità dell'audio.

Puoi richiedere entrambi i tipi di metriche con qualsiasi richiesta di riconoscimento vocale. Per impostazione predefinita, il servizio non restituisce alcuna metrica per una richiesta.

Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale

Il modello a banda larga per il giapponese (ja-JP_BroadbandModel) è stato aggiornato per un migliore riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Se hai dei modelli di lingua o acustici personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

10 maggio 2019

Aggiornamenti ai modelli di spagnolo per un migliore riconoscimento vocale

I modelli di lingua per lo spagnolo sono stati aggiornati per un migliore riconoscimento vocale:

  • es-ES_BroadbandModel
  • es-ES_NarrowbandModel

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

19 aprile 2019

Nuovo parametro strict per l'addestramento del modello personalizzato ora disponibile
I metodi di addestramento dell'interfaccia di personalizzazione includono ora un parametro di query strict che indica se l'addestramento deve continuare se un modello personalizzato contiene una combinazione di risorse valide e non valide. Per impostazione predefinita, l'addestramento non riesce se un modello personalizzato contiene una o più risorse non valide. Imposta il parametro su false per consentire all'addestramento di continuare finché il modello contiene almeno una risorsa valida. Il servizio esclude le risorse non valide dall'addestramento.
Nuovi limiti sul massimo numero di parole fuori dal vocabolario per modelli di lingua personalizzati
Puoi ora aggiungere un massimo di 90.000 parole OOV (out-of-vocabulary) alla risorsa di parole di un modello di lingua personalizzato. Il valore massimo precedente era di 30.000 parole OOV. Questa figura include parole OOV da tutte le origini (corpora, grammatiche e singole parole personalizzate che aggiungi direttamente). Puoi aggiungere un massimo di 10 milioni di parole in totale a un modello personalizzato da tutte le origini. Per ulteriori informazioni, vedi Di quanti dati ho bisogno?.

3 aprile 2019

Nuovi limiti alla quantità massima di audio per i modelli acustici personalizzati
I modelli acustici personalizzati accettano ora un massimo di 200 ore di audio. Il limite massimo precedente era di 100 ore di audio.

21 marzo 2019

Visibilità delle credenziali del servizio ora limitata dal ruolo

Gli utenti possono ora visualizzare solo le informazioni sulle credenziali del servizio associate al ruolo che è stato assegnato al loro account IBM Cloud. Ad esempio, se ti viene assegnato un ruolo reader, qualsiasi livello writer o superiore delle credenziali del servizio non sarà più visibile.

Questa modifica non influisce sull'accesso API per gli utenti o le applicazioni con credenziali del servizio esistenti. La modifica influisce solo sulla visualizzazione delle credenziali all'interno di IBM Cloud.

15 marzo 2019

Nuovo supporto per il formato audio A - law
Il servizio ora supporta l'audio nel formato A-law (audio/alaw). Per ulteriori informazioni, vedi Formato audio/alaw.

11 marzo 2019

Passare al valore del parametro 0 per max_alternatives
Per il parametro max_alternatives , il servizio accetta nuovamente il valore 0``. Se si specifica 0. il servizio utilizza automaticamente il valore predefinito, 1. Una modifica apportata durante l'aggiornamento del servizio del 4 marzo ha comportato che il valore 0 restituisca un errore. (Il servizio restituisce un errore se specifichi un valore negativo.)
Passare al valore del parametro 0 per word_alternatives_threshold
Per il parametro word_alternatives_threshold, il servizio accetta ancora un valore di 0. Una modifica apportata durante l'aggiornamento del servizio del 4 marzo ha comportato che il valore 0 restituisca un errore. (Il servizio restituisce un errore se specifichi un valore negativo.)
Nuovo limite di precisione massima per i punteggi di confidenza
Il servizio ora restituisce tutti i punteggi di attendibilità con una precisione massima di due posizioni decimali. Questa modifica include i punteggi di attendibilità per trascrizioni, attendibilità delle parole, alternative alle parole, risultati di parole chiave ed etichette del parlante.

4 marzo 2019

Aggiornamenti ai modelli a banda stretta in portoghese, francese e spagnolo per un migliore riconoscimento vocale

I seguenti modelli di lingua a banda stretta sono stati aggiornati per un migliore riconoscimento vocale:

  • Modello a banda stretta per il portoghese (Brasile) (pt-BR_NarrowbandModel)
  • Modello francese (fr-FR_NarrowbandModel)
  • Modello a banda stretta spagnolo (es-ES_NarrowbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

28 gennaio 2019

Nuovo supporto per l'interfaccia IBM Cloud IAM by WebSocket

Ora l'interfaccia WebSocket supporta l'autenticazione IAM (Identity and Access Management) basata sul token dal codice JavaScript basato sul browser. La limitazione al contrario è stata rimossa. Per stabilire una connessione autenticata con il metodo WebSocket /v1/recognize:

  • Se utilizzi l'autenticazione IAM, includi il parametro di query access_token.
  • Se utilizzi le credenziali del servizio Cloud Foundry, includi il parametro di query watson-token.

Per ulteriori informazioni, vedi Apri una connessione.

20 dicembre 2018

Nuova funzione di grammatiche beta per i modelli di lingua personalizzati ora disponibile

Il servizio ora supporta le grammatiche per il riconoscimento vocale. Le grammatiche sono disponibili come una funzionalità beta per tutte le lingue che supportano la personalizzazione del modello di lingua. Puoi aggiungere le grammatiche a un modello di lingua personalizzato e utilizzarle per limitare la serie di frasi che il servizio può riconoscere dall'audio. Puoi definire una grammatica in ABNF (Augmented Backus-Naur Form) o nel formato XML.

I seguenti quattro metodi sono disponibili per utilizzare le grammatiche:

  • POST /v1/customizations/{customization_id}/grammars/{grammar_name} aggiunge un file di grammatica a un modello di lingua personalizzato.
  • GET /v1/customizations/{customization_id}/grammars elenca le informazioni su tutte le grammatiche per un modello personalizzato.
  • GET /v1/customizations/{customization_id}/grammars/{grammar_name} restituisce le informazioni su una grammatica specifica per un modello personalizzato.
  • DELETE /v1/customizations/{customization_id}/grammars/{grammar_name} rimuove una grammatica esistente da un modello personalizzato.

Puoi utilizzare una grammatica per il riconoscimento vocale con le interfacce WebSocket e HTTP. Utilizza i parametri language_customization_id e grammar_name per identificare il modello personalizzato e la grammatica che vuoi utilizzare. Al momento, puoi utilizzare una sola grammatica con una richiesta di riconoscimento vocale.

Per ulteriori informazioni sulle grammatiche, vedi la seguente documentazione:

Per informazioni su tutti i metodi dell'interfaccia, consultare la guida di riferimento API e SDK.

È ora disponibile una nuova funzione di redazione numerica per l'inglese americano, il giapponese e il coreano

È ora disponibile una nuova funzione di oscuramento numerico per mascherare i numeri che hanno tre o più cifre consecutive. L'oscuramento ha lo scopo di rimuovere le informazioni personali sensibili, come i numeri delle carte di credito, dalle trascrizioni. Abilita la funzione impostando il parametro redaction su true in una richiesta di riconoscimento. La funzione è una funzionalità beta disponibile solo per inglese americano, giapponese e coreano. Per ulteriori informazioni, vedi Oscuramento numerico.

Nuovi modelli francesi e tedeschi a banda stretta ora disponibili

I seguenti nuovi modelli di lingua in tedesco e francese sono disponibili con il servizio:

  • Modello a banda stretta francese (fr-FR_NarrowbandModel)
  • Modello a banda stretta tedesco (de-DE_NarrowbandModel)

Entrambi i nuovi modelli supportano la personalizzazione del modello di lingua (GA) e la personalizzazione del modello acustico (beta). Per ulteriori informazioni, vedi Supporto delle lingue per la personalizzazione.

Nuovo inglese americano en-US_ShortForm_NarrowbandModel ora disponibile

Un nuovo modello di lingua in inglese americano, en-US_ShortForm_NarrowbandModel, è ora disponibile. Il nuovo modello è destinato all'uso nelle soluzioni IVR (interactive voice response) e di supporto clienti automatizzato. Il modello supporta la personalizzazione del modello di lingua (GA) e la personalizzazione del modello acustico (beta). Per ulteriori informazioni, vedi Il modello di formato breve dell'inglese (Stati Uniti).

Aggiornamenti ai modelli a banda stretta inglese e spagnolo del Regno Unito per un migliore riconoscimento vocale

I seguenti modelli di lingua sono stati aggiornati per un migliore riconoscimento vocale:

  • Modello a banda stretta inglese britannico (en-GB_NarrowbandModel)
  • Modello a banda stretta spagnolo (es-ES_NarrowbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Nuovo supporto per G.279 formato audio

Il servizio ora supporta l'audio nel formato G.729 (audio/g729). Il servizio supporta solo G.729 Annex D per l'audio a banda stretta. Per ulteriori informazioni, vedi il formato audio/g729.

Le etichette dei diffusori sono ora disponibili per il modello inglese a banda stretta

La funzione delle etichette degli altoparlanti è ora disponibile per il modello a banda stretta per l'inglese britannico (en-GB_NarrowbandModel). La funzione è la funzionalità beta per tutte le lingue supportate. Per ulteriori informazioni, vedi Etichette del parlante.

Nuovi limiti alla quantità massima di audio per i modelli acustici personalizzati

La quantità massima di audio che puoi aggiungere a un modello acustico personalizzato è stata aumentata da 50 a 100 ore.

13 dicembre 2018

Nuova sede di Londra ora disponibile
Il servizio Speech to Text è ora disponibile nell'ubicazione Londra di IBM Cloud (eu-gb). Come tutte le altre ubicazioni, Londra utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.

12 novembre 2018

Nuovo supporto per la formattazione intelligente per il riconoscimento vocale giapponese
Il servizio ora supporta la formattazione intelligente per il riconoscimento vocale per il giapponese. In precedenza, il servizio supportava la formattazione intelligente solo per spagnolo e inglese americano. La funzione è una funzionalità beta per tutti i linguaggi supportati. Per ulteriori informazioni, vedi Formattazione intelligente.

7 novembre 2018

Nuova sede di Tokyo ora disponibile
Il servizio Speech to Text è ora disponibile nell'ubicazione Tokyo di IBM Cloud (jp-tok). Come tutte le altre ubicazioni, Tokyo utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.

30 ottobre 2018

Nuovo supporto per IBM Cloud IAM basato su token

Il servizio Speech to Text ha eseguito la migrazione all'autenticazione IAM basata sui token per tutte le ubicazioni. Tutti i servizi IBM Cloud utilizzano ora l'autenticazione IAM. Il servizio Speech to Text è stato migrato in ogni ubicazione nelle seguenti date:

  • Dallas (us-south): 30 ottobre 2018
  • Francoforte (eu-de): 30 ottobre 2018
  • Washington, DC (us-east): 12 giugno 2018
  • Sydney (au-syd): 15 maggio 2018

La migrazione all'autenticazione IAM riguarda sia le nuove istanze che quelle esistenti indifferentemente:

  • Tutte le nuove istanze del servizio che crei in ogni ubicazione utilizzano ora l'autenticazione IAM per accedere al servizio. Puoi passare un token di connessione o una chiave API: i token supportano le richieste autenticate senza credenziali del servizio incorporate in ogni chiamata; le chiavi API utilizzano l'autenticazione di base HTTP. Quando utilizzi uno degli SDK Watson, puoi passare la chiave API e lasciare che l'SDK gestisca il ciclo di vita dei token.
  • Le istanze del servizio esistenti che hai creato in un'ubicazione prima della data di migrazione indicata continuano ad utilizzare {username} e {password} dalle loro precedenti credenziali del servizio Cloud Foundry per l'autenticazione finché non le migri in modo che utilizzino l'autenticazione IAM.

Per ulteriori informazioni, consulta la seguente documentazione:

9 ottobre 2018

Aggiornamenti importanti ai prezzi per le richieste di riconoscimento vocale

A partire dal 1° ottobre 2018, ti verrà addebitato il costo di tutti i file audio che invii al servizio per il riconoscimento vocale. I primi mille minuti di audio che invii ogni mese non sono più gratuiti. Per ulteriori informazioni sui piani tariffari del servizio, consultare la voce “ Speech to Text ” nel catalogo “ IBM Cloud ”.

L'intestazione " Content-Type " è ora facoltativa per la maggior parte delle richieste di riconoscimento vocale

L'intestazione Content-Type è ora facoltativa per la maggior parte delle richieste di riconoscimento vocale. Il servizio ora rileva automaticamente il formato audio (tipo MIME) della maggior parte dei tipi di audio. Devi continuare a specificare il tipo di contenuto per i seguenti formati:

  • audio/basic
  • audio/l16
  • audio/mulaw

Dove indicato, il tipo di contenuto che specifichi per questi formati deve includere la frequenza di campionamento e può facoltativamente includere il numero di canali e endian dell'audio. Per tutti gli altri formati audio, puoi omettere il tipo di contenuto o specificarne uno del tipo application/octet-stream in modo che il servizio rilevi automaticamente il formato.

Quando utilizzi il comando curl per effettuare una richiesta di riconoscimento vocale con l'interfaccia HTTP, devi specificare il formato audio con l'intestazione Content-Type e specificare "Content-Type: application/octet-stream" o "Content-Type:". Se ometti completamente l'intestazione, curl utilizza il valore predefinito application/x-www-form-urlencoded. La maggior parte degli esempi in questa documentazione continua a specificare il formato per le richieste di riconoscimento vocale indipendentemente dal fatto che sia necessario.

Questa modifica si applica ai seguenti metodi:

  • /v1/recognize per le richieste WebSocket. Il campo content-type del messaggio di testo che invii per avviare una richiesta su una connessione WebSocket aperta è ora facoltativo.
  • POST /v1/recognize per le richieste HTTP sincrone. L'intestazione Content-Type è ora facoltativa. (Per le richieste a più parti, anche il campo part_content_type dei metadati JSON è ora facoltativo.)
  • POST /v1/recognitions per le richieste HTTP asincrone. L'intestazione Content-Type è ora facoltativa.

Per ulteriori informazioni, vedi Formati audio.

Aggiornamenti al modello di banda larga portoghese brasiliano per un migliore riconoscimento vocale

Il modello a banda larga per il portoghese brasiliano, pt-BR_BroadbandModel, è stato aggiornato per fornire un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Il parametro customization_id ridenominato in language_customization_id

Il parametro customization_id dei metodi di riconoscimento vocale è obsoleto e sarà rimosso in una futura release. Per specificare un modello di lingua personalizzato per una richiesta di riconoscimento vocale, utilizza invece il parametro language_customization_id. Questa modifica si applica ai seguenti metodi:

  • /v1/recognize per le richieste WebSocket
  • POST /v1/recognize per le richieste HTTP sincrone (incluse le richieste a più parti)
  • POST /v1/recognitions per le richieste HTTP asincrone

10 settembre 2018

Nuovo modello tedesco di banda larga

Il servizio ora supporta un modello a banda larga in tedesco, de-DE_BroadbandModel. Il nuovo modello in tedesco supporta la personalizzazione del modello di lingua (generalmente disponibile) e la personalizzazione del modello acustico (beta).

La personalizzazione del modello di lingua è ora disponibile per il portoghese brasiliano

I modelli di portoghese brasiliano esistenti, pt-BR_BroadbandModel e pt-BR_NarrowbandModel, supportano ora la personalizzazione del modello di lingua (generalmente disponibile). I modelli sono stati aggiornati per abilitare questo supporto, per cui non è necessario alcun upgrade dei modelli acustici personalizzati esistenti.

Aggiornamenti ai modelli di inglese americano e giapponese per un migliore riconoscimento vocale

Sono disponibili delle nuove versioni dei modelli a banda stretta e a banda larga per l'inglese americano e il giapponese:

  • Modello a banda larga per l'inglese (Stati Uniti) (en-US_BroadbandModel)
  • Modello a banda stretta per l'inglese (Stati Uniti) (en-US_NarrowbandModel)
  • Modello a banda larga giapponese (ja-JP_BroadbandModel)
  • Modello a banda stretta per il giapponese (ja-JP_NarrowbandModel)

I nuovi modelli offrono un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Funzioni di individuazione di parole chiave e alternative di parole ora disponibili in generale

Le funzioni di individuazione di parole chiave e di alternative alle parole sono ora generalmente disponibili (GA) invece che una funzionalità beta per tutte le lingue. Per ulteriori informazioni, vedi

Correzione difetto: migliorare la documentazione per l'interfaccia di personalizzazione

Correzione del difetto: i seguenti problemi noti associati all'interfaccia di personalizzazione sono stati risolti e sono stati risolti in produzione. Le seguenti informazioni sono state conservate per gli utenti che potrebbero aver riscontrato tali problemi in passato.

  • Se aggiungi dei dati a un modello di lingua o acustico personalizzato, devi ripetere l'addestramento del modello prima di utilizzarlo per il riconoscimento vocale. Il problema si presenta nel seguente scenario:

    1. L'utente crea un nuovo modello personalizzato (di lingua o acustico) e addestra il modello.

    2. L'utente aggiunge ulteriori risorse (parole, corpora o audio) al modello personalizzato ma non ripete l'addestramento del modello.

    3. L'utente non può utilizzare il modello personalizzato per il riconoscimento vocale. Il servizio restituisce un errore del seguente formato quando utilizzato con una richiesta di riconoscimento vocale:

      {
        "code_description": "Bad Request",
        "code": 400,
        "error": "Requested custom language model is not available.
                  Please make sure the custom model is trained."
      }
      

    Per evitare questo problema, l'utente deve ripetere l'addestramento del modello personalizzato con i dati più recenti. L'utente può quindi utilizzare il modello personalizzato con il riconoscimento vocale.

  • Prima di addestrare un modello acustico o di lingua personalizzato esistente, devi eseguirne l'upgrade all'ultima versione del suo modello di base. Il problema si presenta nel seguente scenario:

    1. L'utente ha un modello personalizzato esistente (di lingua o acustico) basato su un modello che è stato aggiornato.
    2. L'utente addestra il modello personalizzato esistente con una versione precedente del modello di base senza prima eseguire l'upgrade all'ultima versione del modello di base.
    3. L'utente non può utilizzare il modello personalizzato per il riconoscimento vocale.

    Per evitare questo problema, l'utente deve utilizzare il metodo POST /v1/customizations/{customization_id}/upgrade_model o POST /v1/acoustic_customizations/{customization_id}/upgrade_model per eseguire l'upgrade del modello personalizzato all'ultima versione del suo modello di base. L'utente può quindi utilizzare il modello personalizzato con il riconoscimento vocale.

7 settembre 2018

Interfaccia basata sulla sessione non più disponibile

L'interfaccia REST HTTP basata sulla sessione non è più supportata. Tutte le informazioni relative alle sessioni sono state rimosse dalla documentazione. I seguenti metodi non sono più disponibili:

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Se la tua applicazione utilizza l'interfaccia delle sessioni, devi eseguire la migrazione a una delle interfacce REST HTTP rimanenti o all'interfaccia WebSocket. Per ulteriori informazioni, vedi l'aggiornamento del servizio dell'8 agosto 2018.

8 agosto 2018

Avviso di deprecazione per l'interfaccia di riconoscimento vocale basata sulla sessione

L'interfaccia REST HTTP basata sulla sessione è obsoleta a partire dall'8 agosto 2018. Tutti i metodi dell'API delle sessioni saranno rimossi dal servizio a partire dal 7 settembre 2018, dopodiché non potrai più utilizzare l'interfaccia basata sulla sessione. Questo avviso di deprecazione immediata e di rimozione di 30 giorni si applica ai seguenti metodi:

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Se la tua applicazione utilizza l'interfaccia delle sessioni, devi eseguire la migrazione a una delle seguenti interfacce entro il 7 settembre:

  • Per il riconoscimento vocale basato sul flusso (inclusi i casi di utilizzo dal vivo), utilizza l'interfaccia WebSocket, che fornisce l'accesso a risultati provvisori e latenza più bassa.
  • Per il riconoscimento vocale basato sul file, utilizza una delle seguenti interfacce:
    • Per file brevi, fino a cinque minuti di audio, utilizza l'interfaccia HTTP sincrona (POST /v1/recognize) o l'interfaccia HTTP asincrona (POST /v1/recognitions).
    • Per file più lunghi di pochi minuti di audio, utilizza l'interfaccia HTTP asincrona. L'interfaccia HTTP asincrona accetta fino a 1 GB di dati audio con una sola richiesta.

Le interfacce WebSocket e HTTP forniscono gli stessi risultati dell'interfaccia delle sessioni (solo l'interfaccia WebSocket fornisce dei risultati provvisori). È inoltre possibile utilizzare uno degli SDK di Watson, che semplificano lo sviluppo di applicazioni con qualsiasi interfaccia. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.

13 luglio 2018

Aggiornamenti al modello a banda stretta spagnolo per un migliore riconoscimento vocale

Il modello a banda larga per lo spagnolo, es-ES_NarrowbandModel, è stato aggiornato per fornire un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

A partire da questo aggiornamento, sono disponibili le seguenti due versioni del modello a banda larga per lo spagnolo:

  • es_ES.8kHz.general.lm20180522235959.am20180522235959 (corrente)
  • es_ES.8kHz.general.lm20180308235959.am20180308235959 (precedente)

La seguente versione del modello non è più disponibile:

  • es_ES.8kHz.general.lm20171031235959.am20171031235959

Una richiesta di riconoscimento che tenta di utilizzare un modello personalizzato basato sul modello di base ora non disponibile, utilizza il modello di base più recente senza alcuna personalizzazione. Il servizio restituisce il seguente messaggio di avviso: Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported. Per riprendere a utilizzare un modello personalizzato basato sul modello non disponibile, devi prima aggiornare il modello utilizzando il metodo upgrade_model appropriato descritto in precedenza.

12 giugno 2018

Nuove funzioni per le applicazioni ospitate a Washington, DC, ubicazione

Le seguenti funzioni sono abilitate per le applicazioni ospitate in Washington, DC (us-east):

15 maggio 2018

Nuove funzioni per le applicazioni ospitate nell'ubicazione di Sydney

Le seguenti funzioni sono abilitate per le applicazioni ospitate in Sydney (au-syd):

26 marzo 2018

La personalizzazione del modello di lingua è ora disponibile per il modello a banda larga francese

Il servizio ora supporta la personalizzazione del modello linguistico per il modello linguistico francese a banda larga, fr-FR_BroadbandModel. Il modello francese è disponibile in versione "Generally Available" (GA) per l'uso in produzione con personalizzazione del modello linguistico.

Aggiornamenti ai modelli francese, coreano e spagnolo per un migliore riconoscimento vocale

I seguenti modelli sono stati aggiornati per migliorare il riconoscimento vocale:

  • Modello a banda stretta coreano (ko-KR_NarrowbandModel)
  • Modello a banda stretta spagnolo (es-ES_NarrowbandModel)
  • Modello francese a banda larga (fr-FR_BroadbandModel)

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su entrambi questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Il parametro version ridenominato in base_model_version

Il parametro version dei seguenti metodi è ora denominato base_model_version``:

  • /v1/recognize per le richieste WebSocket
  • POST /v1/recognize per le richieste HTTP senza sessione.
  • POST /v1/sessions per le richieste HTTP basate sulla sessione.
  • POST /v1/recognitions per le richieste HTTP asincrone

Il parametro base_model_version specifica la versione di un modello di base che deve essere utilizzato per il riconoscimento vocale. Per ulteriori informazioni, vedi Utilizzo dei modelli personalizzati di cui è stato eseguito l'upgrade per il riconoscimento vocale e Esecuzione di richieste di riconoscimento vocale con i modelli personalizzati di cui è stato eseguito l'upgrade.

Nuovo supporto per la formattazione intelligente per il riconoscimento vocale in spagnolo

La formattazione intelligente è ora supportata per lo spagnolo nonché per l'inglese americano. Per l'inglese americano, la funzione ora converte anche le stringhe di parole chiave in simboli di punteggiatura per i punti, le virgole, i punti di domanda e i punti esclamativi. Per ulteriori informazioni, vedi Formattazione intelligente.

1 marzo 2018

Aggiornamenti ai modelli a banda larga in francese e spagnolo per un migliore riconoscimento vocale

I modelli di banda larga francesi e spagnoli, fr-FR_BroadbandModel e es-ES_BroadbandModel, sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su entrambi questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati. La sezione presenta le regole per l'upgrade dei modelli personalizzati, gli effetti dell'upgrade e gli approcci per l'utilizzo dei modelli aggiornati.

1 febbraio 2018

Nuovi modelli coreani

Il servizio offre ora modelli linguistici per il coreano: ko-KR_BroadbandModel per file audio con frequenza di campionamento minima di 16 kHz, e ko-KR_NarrowbandModel per file audio con frequenza di campionamento minima di 8 kHz. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.

Per quanto riguarda la personalizzazione dei modelli linguistici, i modelli coreani sono generalmente disponibili (GA) per l'uso in produzione; per quanto riguarda la personalizzazione dei modelli acustici, si tratta di funzionalità in versione beta. Per ulteriori informazioni, vedi Supporto delle lingue per la personalizzazione.

  • Per ulteriori informazioni su come il servizio analizza i corpora per il coreano, vedi Analisi in coreano.
  • Per ulteriori informazioni sulla creazione di pronunce dal suono simile per le parole personalizzate in coreano, vedi Linee guida per il coreano.

14 dicembre 2017

La personalizzazione del modello di lingua è ora generalmente disponibile

La personalizzazione del modello di lingua e tutti i parametri associati sono ora generalmente disponibili (GA) per tutte le lingue supportate: giapponese, spagnolo, inglese britannico e inglese americano.

La personalizzazione del modello Beta acoustic è ora disponibile per tutte le lingue

Il servizio ora supporta la personalizzazione del modello acustico come una funzionalità beta per tutte le lingue disponibili. Puoi creare dei modelli acustici personalizzati per modelli a banda larga e stretta per tutte le lingue. Per un'introduzione alla personalizzazione, compresa quella dei modelli acustici, consultare la sezione " Informazioni sulla personalizzazione ".

Nuovo parametro version per il riconoscimento vocale

I vari metodi per effettuare richieste di riconoscimento includono ora un nuovo parametro version , che è possibile utilizzare per avviare richieste che utilizzano sia la versione precedente sia quella aggiornata dei modelli di base e personalizzati. Sebbene sia destinato principalmente all'uso con modelli personalizzati che sono stati aggiornati, il parametro version può essere utilizzato anche senza modelli personalizzati. Per ulteriori informazioni, vedi Effettuare richieste di riconoscimento vocale con i modelli personalizzati di cui è stato eseguito l'upgrade.

Aggiornamenti ai modelli di inglese americano per un migliore riconoscimento vocale

I modelli per l'inglese americano, en-US_BroadbandModel e en-US_NarrowbandModel, sono stati aggiornati per un migliore riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli per l'inglese americano, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni sulla procedura, vedi Upgrade dei modelli personalizzati. La sezione presenta le regole per l'upgrade dei modelli personalizzati, gli effetti dell'upgrade e gli approcci per l'utilizzo dei modelli aggiornati. Al momento, i metodi si applicano solo ai nuovi modelli di base per l'inglese americano. Ma le stesse informazioni si applicheranno agli upgrade di altri modelli di base come diventano disponibili.

La personalizzazione del modello di lingua è ora disponibile per l'inglese britannico

Ora il servizio supporta la personalizzazione del modello di lingua per i modelli per l'inglese britannico, en-GB_BroadbandModel e en-GB_NarrowbandModel. Sebbene il servizio gestisca le parole personalizzate e i corpora in inglese americano e britannico in modo generalmente simile, esistono alcune importanti differenze:

2 ottobre 2017

Nuova interfaccia di personalizzazione del modello acustico beta per inglese americano, giapponese e spagnolo

L'interfaccia di personalizzazione ora offre la personalizzazione del modello acustico. Puoi creare dei modelli acustici personalizzati che adattano i modelli di base del servizio al tuo ambiente e ai parlanti. Popola e addestra un modello acustico personalizzato sull'audio che più si avvicina alla firma acustica dell'audio che vuoi trascrivere. Utilizza quindi il modello acustico personalizzato con le richieste di riconoscimento per aumentare l'accuratezza del riconoscimento vocale.

I modelli acustici personalizzati integrano i modelli di lingua personalizzati. Puoi addestrare un modello acustico personalizzato con un modello di lingua personalizzato e puoi utilizzarli entrambi durante il riconoscimento vocale. La personalizzazione del modello acustico è un'interfaccia in versione beta disponibile solo in inglese (Stati Uniti), giapponese e spagnolo.

Nuovo parametro beta customization_weight per modelli di lingua personalizzati

Per la personalizzazione del modello di lingua, il servizio ora include una funzione beta che imposta un peso di personalizzazione facoltativo per un modello di lingua personalizzato. Un peso di personalizzazione specifica il peso relativo da dare alle parole da un modello di lingua personalizzato rispetto alle parole dal vocabolario di base del servizio. Puoi impostare un peso di personalizzazione durante il riconoscimento vocale e l'addestramento. Per ulteriori informazioni, vedi Utilizzo del peso di personalizzazione.

Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale

Il modello di lingua ja-JP_BroadbandModel è stato aggiornato per acquisire i miglioramenti nel modello di base. L'upgrade non influisce sui modelli personalizzati esistenti basati sul modello.

Nuovo parametro endianness per il formato audio audio/l16

Il servizio ora include un parametro per specificare l'endian dell'audio inviato nel formato audio/l16 PCM (Pulse-Code Modulation) lineare a 16 bit. Oltre a specificare i parametri rate e channels con il formato, puoi ora specificare anche big-endian o little-endian con il parametro endianness. Per ulteriori informazioni, vedi il formato audio/l16.

14 luglio 2017

Nuovo supporto per il formato audio MP3 (MPEG)

Il servizio ora supporta la trascrizione dell'audio nel formato MP3 o MPEG (Motion Picture Experts Group). Per ulteriori informazioni, consultare audio/mp3 e formati audio / mpeg.

La personalizzazione del modello di lingua beta è ora disponibile per lo spagnolo

L'interfaccia di personalizzazione del modello di lingua ora supporta lo spagnolo come una funzionalità beta. Puoi creare un modello personalizzato basato su entrambi i modelli di lingua per lo spagnolo di base: es-ES_BroadbandModel o es-ES_NarrowbandModel; per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato. I prezzi per le richieste di riconoscimento che utilizzano i modelli di lingua personalizzati per lo spagnolo sono gli stessi di quelli per le richieste che utilizzano i modelli per l'inglese americano e il giapponese.

Nuovo campo dialect per il metodo che crea un modello di lingua personalizzato

L'oggetto CreateLanguageModel JSON che passi al metodo POST /v1/customizations per creare un nuovo modello di lingua personalizzato ora include il campo dialect. Il campo specifica il dialetto della lingua che deve essere utilizzato con il modello personalizzato. Per impostazione predefinita, il dialetto corrisponde alla lingua del modello di base. Il parametro è significativo solo per i modelli per lo spagnolo, per cui il servizio può creare un modello personalizzato adatto per un discorso in uno dei seguenti dialetti:

  • es-ES per lo spagnolo castigliano (valore predefinito)
  • es-LA per lo spagnolo latino americano
  • es-US per lo spagnolo nord americano (messicano)

I metodi GET /v1/customizations e GET /v1/customizations/{customization_id} dell'interfaccia di personalizzazione includono il dialetto di un modello personalizzato nei propri input. Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato e Elenco dei modelli di lingua personalizzati.

Nuovi nomi per i modelli inglesi del Regno Unito

I nomi dei modelli di lingua en-UK_BroadbandModel e en-UK_NarrowbandModel sono diventati obsoleti. I modelli sono ora disponibili con i nomi en-GB_BroadbandModel e en-GB_NarrowbandModel.

I nomi en-UK_{model} obsoleti continuano a funzionare, ma il metodo GET /v1/models non restituisce più i nomi nell'elenco di modelli disponibili. Puoi ancora eseguire la query dei nomi direttamente con il metodo GET /v1/models/{model_id}.

1 luglio 2017

Il modello di lingua personalizzato ora è generalmente disponibile per l'inglese americano e il giapponese

L'interfaccia di personalizzazione del modello di lingua del servizio è ora generalmente disponibile (GA) per entrambe le sue lingue supportate, inglese americano e giapponese. IBM non addebita alcun costo per la creazione, l'hosting o la gestione di modelli di lingue personalizzati. Come descritto al prossimo punto, IBM ora addebita ulteriori $0.03 (USD) per ogni minuto di audio per le richieste di riconoscimento che utilizzano i modelli personalizzati.

Aggiornamenti ai piani dei prezzi per il servizio

IBM ha aggiornato i prezzi per il servizio

  • Eliminando il prezzo del componente aggiuntivo per l'utilizzo dei modelli a banda stretta
  • Fornendo un prezzo a più livelli graduati per gli utenti con grandi volumi
  • Addebitando ulteriori $0.03 (USD) per ogni minuto di audio per le richieste di riconoscimento che utilizzano i modelli di lingua personalizzati per l'inglese americano e il giapponese.

Per ulteriori informazioni sugli aggiornamenti dei prezzi, vedi

Il corpo vuoto non è più richiesto per le richieste POST di HTTP

Non hai più bisogno di passare un oggetto dati vuoto come corpo per le seguenti richieste POST:

  • POST /v1/sessions
  • POST /v1/register_callback
  • POST /v1/customizations/{customization_id}/train
  • POST /v1/customizations/{customization_id}/reset
  • POST /v1/customizations/{customization_id}/upgrade_model

Ad esempio, puoi ora richiamare il metodo POST /v1/sessions con curl nel seguente modo:

curl -X POST -u "{username}:{password}" \
--cookie-jar cookies.txt \
"{url}/v1/sessions"

Non hai più bisogno di passare la seguente opzione curl con la richiesta: --data "{}". Se stai riscontrando dei problemi con una di queste richieste POST, prova a passare un oggetto dati vuoto con il corpo della richiesta. Il passaggio di un oggetto vuoto non modifica la natura o il significato della richiesta in alcun modo.

22 maggio 2017

Il parametro continuous rimosso da tutti i metodi

Il parametro continuous è stato rimosso da tutti i metodi che avviano le richieste di riconoscimento. Il servizio ora trascrive un intero flusso audio finché non termina o va in timeout, a seconda di cosa si verifica prima. Questo comportamento è equivalente all'impostazione del precedente parametro continuous su true. Per impostazione predefinita, il servizio precedentemente arrestava la trascrizione al primo mezzo secondo senza alcun discorso (normalmente del silenzio) se il parametro veniva omesso o impostato su false.

Le applicazioni esistenti che impostano il parametro su true non vedranno alcuna modifica nel comportamento. Le applicazioni che impostano il parametro su false o che si basano sul comportamento predefinito verosimilmente vedranno una modifica. Se una richiesta specifica il parametro, il servizio ora risponde restituendo un messaggio di avvertenza per il parametro sconosciuto:

"warnings": [
  "Unknown arguments: continuous."
]

La richiesta ha esito positivo nonostante l'avvertenza e una connessione WebSocket o una sessione esistente non ne vengono influenzate.

IBM ha rimosso il parametro per rispondere all'enorme quantità di feedback dalla community di sviluppatori che specificando continuous=false viene aggiunto poco valore e si potrebbe ridurre l'accuratezza della trascrizione generale.

Invio dell'audio richiesto per evitare il timeout della sessione

Non è più possibile evitare un timeout di sessione senza inviare dell'audio:

  • Quando utilizzi l'interfaccia WebSocket, il client non può più mantenere una connessione attiva inviando un messaggio di testo JSON con il parametro action impostato su no-op. L'invio del messaggio no-op non genera un errore, ma non ha alcun effetto.
  • Quando utilizzi le sessioni con l'interfaccia HTTP, il client non può più estendere la sessione inviando una richiesta GET /v1/sessions/{session_id}/recognize. Il metodo restituisce ancora lo stato di una sessione attiva, ma non mantiene la sessione attiva.

Puoi ora effettuare le seguenti operazioni per mantenere una sessione attiva:

  • Imposta il parametro inactivity_timeout su -1 per evitare il timeout di inattività di 30 secondi.
  • Invia tutti i dati audio, incluso il silenzio, al servizio per evitare il timeout della sessione di 30 secondi. Ti viene effettuato un addebito per la durata di tutti i dati che invii al servizio, incluso il silenzio che invii per estendere la sessione.

Per ulteriori informazioni, vedi Timeout. Idealmente, vuoi stabilire una sessione appena prima di ottenere l'audio per la trascrizione e mantenere la sessione attiva inviando l'audio a una velocità quanto più possibile in tempo reale. Inoltre, assicurati che la tua applicazione ripristini normalmente le sessioni o le connessioni chiuse.

IBM ha rimosso questa funzionalità per garantire di continuare ad offrire a tutti gli utenti un servizio di riconoscimento vocale a bassa latenza e all'avanguardia.

10 aprile 2017

Le etichette dei parlanti sono ora supportate per l'inglese americano, lo spagnolo e il giapponese

Il servizio ora supporta la funzione di etichette del parlante per i seguenti modelli a banda larga:

  • Modello a banda larga per l'inglese (Stati Uniti) (en-US-BroadbandModel)
  • Modello spagnolo a banda larga (es-ES-BroadbandModel)
  • Modello a banda larga giapponese (ja-JP_BroadbandModel)

Per ulteriori informazioni, vedi Etichette del parlante.

Nuovo supporto per il formato audio Web Media (WebM)

Ora il servizio supporta il formato audio Web Media (WebM) con il codec Opus o Vorbis. Al momento il servizio supporta anche il formato audio Ogg con il codec Vorbis in aggiunta al codec Opus. Per ulteriori informazioni sui formati audio supportati, vedi formato audio / webm.

Nuovo supporto per la condivisione di risorse tra origini

Ora il servizio supporta CORS (Cross-Origin Resource Sharing) per consentire ai client basati sul browser di richiamare direttamente il servizio. Per ulteriori informazioni, vedi Supporto CORS.

Nuovo metodo per disregistrare una callback URL con l'interfaccia asincrona HTTP

L'interfaccia HTTP asincrona ora offre un metodo POST /v1/unregister_callback che rimuove la registrazione per un URL di callback inserito nell'elenco di tipi consentiti. Per ulteriori informazioni, vedi Annullamento della registrazione di un URL di callback.

Correzione difetto: eliminare i timeout per l'audio lungo con l'interfaccia WebSocket

Correzione di un bug: l'interfaccia WebSocket non va più in timeout in caso di richieste di riconoscimento relative a file audio particolarmente lunghi. Non devi più richiedere dei risultati provvisori con il messaggio start JSON per evitare il timeout. (Questo problema è stato descritto nell'aggiornamento del 10 marzo 2016.)

Nuovi codici di errore HTTP

I seguenti metodi di personalizzazione del modello linguistico possono ora restituire i seguenti codici di errore HTTP:

  • Il metodo DELETE /v1/customizations/{customization_id} ora restituisce il codice di risposta HTTP 401 se tenti di eliminare un modello personalizzato non esistente.
  • Il metodo DELETE /v1/customizations/{customization_id}/corpora/{corpus_name} ora restituisce il codice di risposta HTTP 400 se tenti di eliminare un corpus non esistente.

8 marzo 2017

L'interfaccia asincrona HTTP è ora disponibile per tutti
L'interfaccia asincrona HTTP è ora disponibile al pubblico (GA). Prima di questa data, era una funzionalità beta.

1 dicembre 2016

Nuova funzione di etichette di altoparlanti beta

Il servizio ora offre una funzione di etichette del parlante beta per l'audio a banda stretta per inglese americano, spagnolo o giapponese. La funzione identifica quali parole sono state pronunciate da quale parlante in uno scambio tra più persone. I metodi di riconoscimento senza sessione, basati sulla sessione, asincroni e WebSocket includono tutti un parametro speaker_labels che accetta un valore booleano per indicare se le etichette del parlante devono essere incluse nella risposta. Per ulteriori informazioni sulla funzione, vedi Etichette del parlante.

La personalizzazione del modello di lingua beta è ora disponibile per il giapponese

L'interfaccia di personalizzazione del modello di lingua beta è ora supportata per il giapponese in aggiunta all'inglese americano. Tutti i metodi dell'interfaccia supportano il giapponese. Per ulteriori informazioni, vedi le seguenti sezioni:

Nuovo metodo per elencare le informazioni su un corpus

L'interfaccia di personalizzazione del modello di lingua ora include un metodo GET /v1/customizations/{customization_id}/corpora/{corpus_name} che elenca le informazioni su un corpus specificato. Il metodo è utile per il monitoraggio dello stato di una richiesta per aggiungere un corpus a un modello personalizzato. Per ulteriori informazioni, vedi Elenco dei corpora per un modello di lingua personalizzato.

Nuovo campo count per metodi che elencano parole per modelli di lingua personalizzati

La risposta JSON restituita dai metodi GET /v1/customizations/{customization_id}/words e GET /v1/customizations/{customization_id}/words/{word_name} ora include un campo count per ogni parola. Il campo indica il numero di volte in cui viene trovata la parola tra tutti i corpora. Se aggiungi una parola personalizzata a un modello prima che venga aggiunto da qualsiasi corpora, il conteggio inizia da 1. Se la parola viene aggiunta da un corpus prima e successivamente modificato, il conteggio riflette solo il numero di volte che viene trovato nei corpora. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ".

Per i modelli personalizzati creati prima dell'esistenza del campo count, il campo rimane sempre in 0. Per aggiornare il campo per tali modelli, aggiungi di nuovo i corpora del modello e includi il parametro allow_overwrite con il metodo POST /v1/customizations/{customization_id}/corpora/{corpus_name}.

Nuovo parametro sort per metodi che elencano parole per modelli di lingua personalizzati

Il metodo GET /v1/customizations/{customization_id}/words ora include un parametro di query sort che controlla l'ordine in cui le parole devono essere elencate. Il parametro accetta due argomenti, alphabetical o count, per indicare come le parole devono essere ordinate. Puoi anteporre un + o un - facoltativo a un argomento per indicare se i risultati devono essere ordinati in ordine crescente o decrescente. Per impostazione predefinita, il metodo visualizza le parole in ordine alfabetico crescente. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ".

Per i modelli personalizzati creati prima dell'introduzione del campo count, l'utilizzo dell'argomento count con il parametro sort non ha senso. Utilizza l'argomento alphabetical predefinito con tali modelli.

Nuovo formato campo error per i metodi che elencano le parole per modelli di lingua personalizzati

Il campo error che può essere restituito come parte della risposta JSON dai metodi GET /v1/customizations/{customization_id}/words e GET /v1/customizations/{customization_id}/words/{word_name} è ora un array. Se il servizio ha rilevato uno o più problemi con la definizione di una parola personalizzata, il campo elenca ogni elemento del problema dalla definizione e fornisce un messaggio che descrive il problema. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ".

I parametri keywords_threshold e word_alternatives_threshold non accettano più un valore null

I parametri keywords_threshold e word_alternatives_threshold dei metodi di riconoscimento non accettano più un valore null. Per omettere delle parole chiave o delle alternative alle parole dalla risposta, ometti i parametri. Un valore specificato deve essere un valore mobile.

22 settembre 2016

Nuova interfaccia di personalizzazione del modello di lingua beta
Il servizio ora offre una nuova interfaccia di personalizzazione del modello di lingua beta per l'inglese americano. Puoi utilizzare l'interfaccia per personalizzare i modelli di lingua e vocabolario di base del servizio tramite la creazione di modelli di lingua personalizzati che includono la terminologia specifica per il dominio. Puoi aggiungere le parole personalizzate individualmente o lasciare che il servizio le estragga dai corpora. Per utilizzare i tuoi modelli personalizzati con i metodi di riconoscimento vocale offerti da tutte le interfacce del servizio, passa il parametro di query customization_id. Per ulteriori informazioni, vedi
Nuovo supporto per il formato audio audio/mulaw
L'elenco di formati audio supportati ora include audio/mulaw, che fornisce un audio a canale singolo codificato utilizzando l'algoritmo di dati u-law (o mu-law). Quando utilizzi questo formato, devi specificare anche la frequenza di campionamento con cui viene acquisito l'audio. Per ulteriori informazioni, vedi formato audio / mulaw.
Nuovo supported_features identificato durante l'elenco dei modelli
I metodi GET /v1/models e GET /v1/models/{model_id} ora restituiscono un campo supported_features come parte del proprio output per ogni modello di lingua. Le informazioni aggiuntive descrivono se il modello supporta la personalizzazione. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.

30 giugno 2016

L'interfaccia asincrona beta di HTTP ora supporta tutte le lingue disponibili
L'interfaccia HTTP asincrona beta ora supporta tutte le lingue supportate dal servizio. L'interfaccia era precedentemente disponibile solo per l'inglese americano. Per ulteriori informazioni, consultare l'interfaccia asincrona HTTP e il riferimento all'API e all'SDK.

23 giugno 2016

È ora disponibile la nuova interfaccia beta asincrona HTTP
Un'interfaccia HTTP asincrona beta è ora disponibile. L'interfaccia fornisce tutte le funzionalità di riconoscimento per la trascrizione in inglese americano tramite chiamate HTTP non bloccanti. Puoi registrare gli URL di callback e fornire le stringhe segrete specificate dall'utente per fornire l'integrità dei dati e l'autenticazione con le firme digitali. Per ulteriori informazioni, consultare l'interfaccia asincrona HTTP e il riferimento all'API e all'SDK.
Nuovo parametro beta smart_formatting per il riconoscimento vocale
Una funzionalità di formattazione intelligente beta che converte date, ore, serie di cifre e numeri, numeri di telefono, valori valutari e indirizzi internet in rappresentazioni più convenzionali nelle trascrizioni finali. Abilita la funzione impostando il parametro smart_formatting su true in una richiesta di riconoscimento. La funzione è una funzionalità beta disponibile solo per l'inglese americano. Per ulteriori informazioni, vedi Formattazione intelligente.
Nuovo modello francese di banda larga
L'elenco di modelli supportati per il riconoscimento vocale ora include fr-FR_BroadbandModel per l'audio nella lingua francese campionato a un minimo di 16 kHz. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.
Nuovo supporto per il formato audio audio/basic
L'elenco di formati audio supportati ora include audio/basic. Il formato fornisce un audio a canale singolo codificato utilizzando i dati u-law (o mu-law) a 8-bit campionati a 8 hKz. Per ulteriori informazioni, vedi formato audio / base.
I metodi di riconoscimento vocale ora restituiscono avvertenze per parametri non validi
I vari metodi di riconoscimento possono restituire una risposta warnings che include i messaggi sui parametri di query o i campi JSON non validi che vengono inclusi in una richiesta. Il formato delle avvertenze è stato modificato. Ad esempio, "warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." è ora "warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
Corpo vuoto richiesto per i metodi di HTTP POST che non passano alcun dato
Per le richieste POST HTTP che non riescono altrimenti a passare i dati al servizio, devi includere un corpo della richiesta vuoto del formato {}. Con il comando curl, utilizza l'opzione --data per passare i dati vuoti.

10 marzo 2016

Nuovi limiti massimi per l'audio trasmesso per il riconoscimento vocale
Entrambe le forme di trasmissione dei dati (fornitura unica e invio in streaming) ora impongono un limite di 100 MB sui dati audio, come per l'interfaccia WebSocket. Precedentemente, l'approccio di fornitura unica aveva un limite massimo di 4 MB di dati. Per ulteriori informazioni, vedi Trasmissione audio (per tutte le interfacce) e Invia l'audio e ricevi i risultati del riconoscimento (per l'interfaccia WebSocket). La sezione WebSocket parla anche della velocità massima o della dimensione dei messaggi di 4 MB imposta dall'interfaccia WebSocket.
HTTP e le interfacce WebSocket possono ora restituire gli avvertimenti
La risposta JSON per una richiesta di riconoscimento può ora includere un array di messaggi di avvertenza per parametri di query o campi JSON non validi inclusi con una richiesta. Ogni elemento dell'array è una stringa che descrive la natura dell'avvertenza seguita da un array di stringhe di argomenti non valide. Ad esempio, "warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
L'SDK Beta Apple iOS è obsoleto
La versione beta *Watson Kit di sviluppo software (SDK) per la sintesi vocale per il sistema operativo Apple® iOS * è obsoleta. Utilizza invece l'SDK " Watson " per il sistema operativo Apple® iOS. Il nuovo SDK è disponibile nel repository ios-sdk, nello spazio dei nomi watson-developer-cloud, all'indirizzo GitHub.
L'interfaccia WebSocket è in grado di produrre risultati ritardati
L'interfaccia WebSocket può impiegare alcuni minuti per fornire i risultati finali di una richiesta di riconoscimento relativa a un file audio particolarmente lungo. Per l'interfaccia WebSocket, la connessione TCP sottostante rimane inattiva mentre il servizio prepara la risposta. Pertanto, la connessione può venire chiusa a causa del timeout. Per evitare il timeout con l'interfaccia WebSocket, richiedi i risultati provvisori (\"interim_results\": \"true\") nel JSON per il messaggio start per avviare la richiesta. Puoi eliminare i risultati provvisori se non ne hai bisogno. Questo problema sarà risolto in un aggiornamento futuro.

19 gennaio 2016

Nuova funzione di filtro della volgarità
Il servizio è stato aggiornato per includere una nuova funzione di filtro di contenuto volgare il 19 gennaio 2016. Per impostazione predefinita, il servizio censura il contenuto volgare dai propri risultati di trascrizione per l'audio in inglese americano. Per ulteriori informazioni, vedi Filtro di contenuto volgare.

17 dicembre 2015

Nuova funzione di individuazione delle parole chiave
Il servizio ora offre una funzione di individuazione di parole chiave. Puoi specificare un array di stringhe di parole chiave che devono essere soddisfatte nell'audio di input. Devi inoltre specificare un livello di attendibilità definito dall'utente che una parola deve soddisfare per essere considerata una corrispondenza per una parola chiave. Per ulteriori informazioni, vedi Individuazione di parole chiave. La funzione di individuazione di parole chiave è una funzionalità beta.
Nuova funzione di alternative alle parole
Il servizio ora offre una funzione di alternative alle parole. La funzione restituisce delle ipotesi alternative alle parole nell'audio di input che soddisfano un livello di attendibilità definito dall'utente. Per ulteriori informazioni, vedi Alternative alle parole. La funzione di alternative alle parole è una funzionalità beta.
Nuovi modelli inglesi e arabi del Regno Unito
Il servizio supporta più lingue con i propri modelli di trascrizione: en-UK_BroadbandModel e en-UK_NarrowbandModel per l'inglese britannico e ar-AR_BroadbandModel per l'arabo standard moderno. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.
Nuovo campo session_closed per i metodi basati sulla sessione
Nelle risposte JSON che restituiscono degli errori con i metodi basati sulla sessione, il servizio ora include anche un nuovo campo session_closed. Il campo è impostato su true se la sessione viene chiusa a causa dell'errore. Per ulteriori informazioni sui possibili codici di ritorno relativi a qualsiasi metodo, consultare la guida di riferimento API e SDK.
HTTP il timeout della piattaforma non è più valido
Le richieste di riconoscimento HTTP non sono più soggette a un timeout della piattaforma di 10 minuti. Il servizio ora mantiene attiva la connessione inviando un carattere spazio nell'oggetto JSON della risposta ogni 20 secondi mentre il riconoscimento è in corso. Per ulteriori informazioni, vedi Timeout.
La limitazione della velocità con il comando curl non è più necessaria
Quando utilizzi il comando curl per trascrivere dell'audio con il servizio, non devi più utilizzare l'opzione --limit-rate per trasferire i dati a una velocità inferiore a 40.000 byte al secondo.
Modifiche ai codici di errore di HTTP
Il servizio non restituisce più un codice di stato HTTP 490 per i metodi HTTP basati sulla sessione GET /v1/sessions/{session_id}/observe_result e POST /v1/sessions/{session_id}/recognize. Il servizio ora risponde invece con il codice di stato HTTP 400.

21 settembre 2015

Nuovi SDK mobili disponibili

Sono disponibili due nuovi SDK mobili beta per i servizi vocali. Gli SDK consentono alle applicazioni mobili di interagire con i servizi Speech to Text e Text to Speech.

  • L'SDK " Watson " per la piattaforma Android™ " Google " supporta lo streaming audio in tempo reale verso il servizio Speech to Text e la ricezione della trascrizione dell'audio mentre si parla. Il progetto include un'applicazione di esempio che illustra l'interazione con entrambi i servizi vocali. L'SDK è disponibile nel repository speech-android-sdk, nello spazio dei nomi watson-developer-cloud, all'indirizzo GitHub.
  • L'SDK per il riconoscimento vocale di Watson per il sistema operativo Apple® iOS supporta lo streaming audio verso il servizio Speech to Text e la ricezione di una trascrizione dell'audio in risposta. L'SDK è disponibile nel repository speech-ios-sdk, nello spazio dei nomi watson-developer-cloud, all'indirizzo GitHub.

Entrambi gli SDK supportano l'autenticazione con i servizi vocali utilizzando le credenziali del servizio IBM Cloud o un token di autenticazione. Poiché gli SDK sono nella beta, sono soggetti a modifiche future.

Nuovi modelli di portoghese brasiliano e cinese mandarino

Il servizio supporta due nuove lingue, il portoghese brasiliano e il cinese mandarino, con i modelli seguenti:

  • Modello a banda larga per il portoghese brasiliano (pt-BR_BroadbandModel)
  • Modello a banda stretta per il portoghese (Brasile) (pt-BR_NarrowbandModel)
  • Modello a banda larga in cinese mandarino (zh-CN_BroadbandModel)
  • Modello a banda stretta per il cinese mandarino (zh-CN_NarrowbandModel)

Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.

Nuovo supporto per il formato audio audio/ogg;codecs=opus

Le richieste POST HTTP /v1/sessions/{session_id}/recognize e /v1/recognize, nonché la richiesta /v1/recognize WebSocket, supportano la trascrizione di un nuovo tipo di supporto: audio/ogg;codecs=opus per i file di formato Ogg che utilizzano il codec Opus. Inoltre, il formato audio/wav per i metodi ora supporta qualsiasi codifica. La limitazione sull'utilizzo della codifica PCM lineare è stata rimossa. Per ulteriori informazioni, vedi formato audio / ogg.

Nuovo parametro sequence_id per il polling lungo delle sessioni

Il servizio ora supporta il superamento dei timeout quando trascrivi file audio lunghi con l'interfaccia HTTP. Quando utilizzi le sessioni, puoi utilizzare un modello di polling lungo specificando gli ID di sequenza con i metodi GET /v1/sessions/{session_id}/observe_result e POST /v1/sessions/{session_id}/recognize per attività di riconoscimento a lunga esecuzione. Utilizzando il nuovo parametro sequence_id di questi metodi, puoi richiedere i risultati prima, durante o dopo aver inviato una richiesta di riconoscimento.

Nuova funzione di maiuscole / minuscole per la trascrizione in inglese americano

Per i modelli di lingua per l'inglese americano, en_US_BroadbandModel e en_US_NarrowbandModel, il servizio ora converte in maiuscolo molti nomi propri. Ad esempio, il servizio restituirebbe un nuovo testo che recita "Barack Obama si è laureato alla Columbia University" invece di "barack obama si è laureato alla columbia university". Questa modifica potrebbe essere interessante se la tua applicazione è sensibile per un qualsiasi motivo al maiuscolo/minuscolo dei nomi propri.

Nuovo codice di errore " HTTP "

La richiesta HTTP DELETE /v1/sessions/{session_id} non restituisce il codice di stato 415 "Unsupported Media Type". Questo codice di ritorno è stato rimosso dalla documentazione per il metodo.

1 luglio 2015

Il servizio Speech to Text ora è generalmente disponibile

Il servizio è passato dalla beta alla disponibilità generale (GA) il primo luglio 2015. Esistono le seguenti differenze tra le versioni beta e GA delle API Speech to Text. La release GA richiede che gli utenti eseguano l'upgrade alla nuova versione del servizio.

La versione GA dell'API HTTP è compatibile con la versione beta. Devi modificare il tuo codice applicazione esistente solo se hai specificato esplicitamente un nome di modello. Ad esempio, il codice di esempio disponibile per il servizio da GitHub includeva la seguente riga di codice nel file demo.js:

model: 'WatsonModel'

Questa riga specificava il modello predefinito WatsonModel per la versione beta del servizio. Se anche la tua applicazione specificava questo modello, devi modificarla in modo che utilizzi uno dei nuovi modello supportati dalla versione GA. Per ulteriori informazioni, vedi il prossimo punto.

Nuovo modello di programmazione basato su token

Il servizio ora supporta un nuovo modello di programmazione per l'interazione diretta tra un client e il servizio su una connessione WebSocket. Utilizzando questo modello, un client può ottenere un token di autenticazione per comunicare direttamente con il servizio. Il token elude la necessità di un'applicazione proxy lato server in IBM Cloud di richiamare il servizio al posto del client. I token sono i mezzi preferiti per i client per interagire con il servizio.

Il servizio continua a supportare il vecchio modello di programmazione basato su un proxy lato server per trasmettere l'audio e i messaggi tra il client e il servizio. Tuttavia, il nuovo modello è più efficiente e offre una velocità effettiva più elevata.

Nuovo parametro model per il riconoscimento vocale

I metodi POST /v1/sessions e POST /v1/recognize, insieme al metodo /v1/recognize WebSocket, ora supportano un parametro di query model. Utilizza il parametro per specificare le informazioni sull'audio:

  • La lingua: inglese, giapponese o spagnolo
  • La frequenza di campionamento minima: banda larga (16 kHz) o banda stretta (8 kHz)

Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.

Nuovo parametro inactivity_timeout per il riconoscimento vocale

Il parametro inactivity_timeout imposta il valore di timeout in secondi dopo il quale il servizio chiude la connessione se rileva del silenzio (nessun discorso) nella modalità di streaming. Per impostazione predefinita, il servizio termina la sessione dopo 30 secondi di silenzio. I metodi POST /v1/recognize e WebSocket /v1/recognize supportano il parametro. Per ulteriori informazioni, vedi Timeout.

Nuovo parametro max_alternatives per il riconoscimento vocale

Il parametro max_alternatives indica al servizio di restituire le migliori n ipotesi alternative per la trascrizione audio. I metodi POST /v1/recognize e WebSocket /v1/recognize supportano il parametro. Per ulteriori informazioni, vedi Numero massimo di alternative.

Nuovo parametro word_confidence per il riconoscimento vocale

Il parametro word_confidence indica al servizio di restituire un punteggio di attendibilità per ogni parola della trascrizione. I metodi POST /v1/recognize e WebSocket /v1/recognize supportano il parametro. Per ulteriori informazioni, vedi Attendibilità delle parole.

Nuovo parametro timestamps per il riconoscimento vocale

Il parametro timestamps indica al servizio di restituire l'ora di inizio e di fine per ciascuna parola relativamente all'inizio dell'audio. I metodi POST /v1/recognize e WebSocket /v1/recognize supportano il parametro. Per ulteriori informazioni, vedi Date/ore delle parole.

Metodo sessioni rinominate per l'osservazione dei risultati

Il metodo GET /v1/sessions/{session_id}/observeResult è ora denominato GET /v1/sessions/{session_id}/observe_result. Il nome observeResult è ancora supportato per la retrocompatibilità.

Nuovo supporto per il formato audio WAV (Waveform Audio File)

L'intestazione " Content-Type " dei metodi recognize ora supporta audio/wav per i file WAV (Waveform Audio File), oltre a audio/flac e audio/l16. Per ulteriori informazioni, vedi formato audio / wav.

Limiti sulla quantità massima di audio per il riconoscimento vocale

Il servizio ora ha un limite di 100 MB di dati per sessione nella modalità di streaming. È possibile specificare la modalità di streaming indicando il valore “ chunked ” nell’intestazione “ Transfer-Encoding ”. La fornitura unica di un file audio impone ancora un limite di dimensione di 4 MB sui dati che vengono inviati. Per ulteriori informazioni, vedi Trasmissione audio.

Nuova intestazione per rifiutare di contribuire ai miglioramenti del servizio

I metodi GET /v1/sessions/{session_id}/observe_result, POST /v1/sessions/{session_id}/recognize e POST /v1/recognize ora includono il parametro di intestazione X-WDC-PL-OPT-OUT per controllare se il servizio utilizza i dati di trascrizione e audio da una richiesta per migliorare i risultati futuri. L'interfaccia WebSocket include un parametro di query equivalente. Specifica un valore di 1 per evitare che il servizio utilizzi i risultati di trascrizione e audio. Il parametro si applica solo alla richiesta corrente. La nuova intestazione sostituisce l'intestazione X-logging dall'API beta. Vedi Controllo della registrazione delle richieste per i servizi Watson.

Modifiche ai codici di errore di HTTP

Il servizio può ora rispondere con i seguenti codici di errore HTTP:

  • Per i metodi /v1/models, /v1/models/{model_id}, /v1/sessions, /v1/sessions/{session_id}, /v1/sessions/{session_id}/observe_result, /v1/sessions/{session_id}/recognize e /v1/recognize, è stato aggiunto il codice di errore 415 ("Unsupported Media Type").
  • Per le richieste di tipo " POST " e " GET " inviate al metodo " /v1/sessions/{session_id}/recognize ", vengono modificati i seguenti codici di errore:
    • Il codice di errore 404 ("Session_id not found") ha un messaggio più descrittivo (POST e GET).
    • Il codice di errore 503 ("Session is already processing a request. Concurrent requests are not allowed on the same session. La sessione rimane attiva dopo questo errore. ") ha un messaggio più descrittivo (solo POST ).
    • Per le richieste POST HTTP ai metodi /v1/sessions e /v1/recognize, può essere restituito il codice di errore 503 ("Service Unavailable"). Il codice di errore può essere restituito anche quando si crea una connessione di tipo " WebSocket " con il metodo /v1/recognize .