Note sulla release per Speech to Text per IBM Cloud
IBM Cloud
Le seguenti caratteristiche e modifiche sono state incluse in ogni release e aggiornamento delle istanze gestite di IBM Watson® Speech to Text che sono ospitate su IBM Cloud o per le istanze ospitate su IBM Cloud Pak for Data come servizio. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.
Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.
Per informazioni sui rilasci e gli aggiornamenti del servizio per IBM Cloud Pak for Data, vedere le note di rilascio per Speech to Text per IBM Cloud Pak for Data.
29 giugno 2026
- Nuovo parametro "
parameter_set" per i modelli di sintesi vocale di grandi dimensioni -
I modelli di sintesi vocale di grandi dimensioni includono ora un parametro di richiesta denominato "
parameter_set" che applica impostazioni ottimizzate in un'unica chiamata. Utilizza la funzione "parameter_set=enhanced" per migliorare la qualità del riconoscimento senza dover configurare manualmente i singoli parametri.- Per ulteriori informazioni, consultare [la sezione relativa al parametro di richiesta
parameter_set](/docs/speech-to-text?topic=speech-to-text-models-large-speech-languages#models-lsm-parameter-set).
- Per ulteriori informazioni, consultare [la sezione relativa al parametro di richiesta
26 giugno 2026
low_latencyLa modalità è ora disponibile per il modello vocale Large in inglese (USA)-
Il modello di sintesi vocale "US English Large Speech Model"
en-USora include la modlow_latency, che consente un'elaborazione più rapida del parlato.- Per ulteriori informazioni su
low_latency, consultare la sezione " Riepilogo dei parametri ". - Per ulteriori informazioni sui risultati provvisori e sulla bassa latenza, consultare la sezione " Bassa latenza ".
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
- Per ulteriori informazioni su
15 maggio 2026
- Il modello vocale di grandi dimensioni per l'italiano è ora generalmente disponibile
-
Il modello vocale di grandi dimensioni per l'italiano,
it-IT, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
10 aprile 2026
- Il modello vocale di grandi dimensioni per l'olandese è ora generalmente disponibile
-
Il modello vocale di grandi dimensioni per l'olandese,
nl-NL, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
07 aprile 2026
Correzione di un difetto: Corretto un problema per cui il fille viene riconosciuto in modo errato nel riconoscimento della sequenza alfanumerica francese con la funzione di formattazione intelligente.
17 marzo 2026
- Miglioramento del modello di lingua francese di grandi dimensioni
- Sono ora disponibili miglioramenti nei Large Language Models (LSM) francesi
fr-FRefr-CAper una maggiore precisione nel riconoscimento delle sequenze alfanumeriche.
Correzione di un difetto: È stato risolto un problema nell'identificazione della lingua (LID) in cui si osservano errori intermittenti di 5xx quando una richiesta /v1/recognize?language_identification=true è immediatamente
seguita da una richiesta /v1/recognize regolare.
Correzione del difetto: Corretto un problema per cui si osservano errori interni al server con il parametro max_active.
Correzione del difetto: Corretto un problema per cui gli errori interni del server vengono erroneamente restituiti quando include_transparent_words è impostato su true.
04 marzo 2026
- Miglioramento dei modelli di parlato in tedesco e olandese
-
Sono ora disponibili miglioramenti dei modelli di parlato in tedesco e olandese.
- I miglioramenti del Large Speech Model (LSM) tedesco
de-DEsono ora disponibili per il riconoscimento di sequenze alfanumeriche e per casi d'uso generali. - Sono ora disponibili miglioramenti della telefonia olandese
nl-NL_Telephonyper il riconoscimento delle sequenze alfanumeriche e la gestione della salienza.
- I miglioramenti del Large Speech Model (LSM) tedesco
16 febbraio 2026
- Il modello vocale di grandi dimensioni per il tedesco è ora generalmente disponibile
-
Il modello vocale di grandi dimensioni per il tedesco,
de-DE, è ora generalmente disponibile (GA) in tutti i data center e supporta entrambe le frequenze di campionamento audio 8kHz e 16kHz.- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
- Miglioramenti dell'arricchimento della trascrizione del discorso
-
I miglioramenti nell'arricchimento della trascrizione vocale sono ora disponibili per le entità denominate, tra cui date, ora, valuta, numeri e misure. Queste entità sono ora gestite correttamente in base al locale della lingua.
22 gennaio 2026
Correzione del difetto: Corretto un problema per cui l'arricchimento della trascrizione vocale fallisce quando il parametro del modello è assente nelle richieste.
Correzione di un difetto: È stato risolto un problema per cui si osserva un tempo di addestramento della personalizzazione speech-to-text (STT) più lungo a causa di errori interni fuori memoria.
08 gennaio 2026
Correzione di un difetto: Corretto un problema nell'arricchimento della trascrizione vocale nel centro dati di Francoforte.
Correzione di un difetto: Corretto un problema in interim_results per cui le trascrizioni finali del discorso non vengono inviate quando interim_results è impostato su false.
10 dicembre 2025
- Convalida del campo di input per la funzione
sounds_like -
La funzione di convalida dei campi di input per
sounds_likeè ora abilitata per altre lingue.- La convalida del campo di input per
sounds_likeè abilitata per altre lingue, compresi i modelli dien-US,en-AU,en-GB,en-IN,es-ES,es-AR,es-CL,es-CO,es-MX,es-PE,fr-FR_Telephony,fr-FR_Multimedia,de-DE_Telephony,de-DE_Multimedia,it-IT_Telephony,it-IT_Multimediaenl-NL_Telephony.
- La convalida del campo di input per
25 novembre 2025
- Sono ora disponibili i risultati intermedi per i modelli vocali di grandi dimensioni
-
I risultati intermedi sono ora disponibili per i modelli vocali di grandi dimensioni (LSM).
interim_resultsil parametro era precedentemente abilitato solo per i modelli di nuova generazione. Ora è abilitata anche per gli LSM. Per ulteriori informazioni, vedi Risultati provvisori.
03 novembre 2025
- Il rilevamento degli eventi di inizio parlato è ora disponibile per i modelli STT.
-
Il rilevamento dell'evento Speech begin è ora disponibile per i modelli STT.
- Utilizzando il rilevamento dell'evento di inizio del parlato, è ora possibile ricevere una notifica tempestiva con l'API
recognizeche rileva l'inizio del parlato nel flusso audio in entrata e invia una notifica all'utente. Per ulteriori informazioni, vedere Rilevamento degli eventi di inizio parlato.
- Utilizzando il rilevamento dell'evento di inizio del parlato, è ora possibile ricevere una notifica tempestiva con l'API
- Miglioramenti al rilevamento dell'attività vocale per una risposta più rapida, una maggiore precisione e migliori prestazioni in ambienti rumorosi.
-
Il rilevamento dell'attività vocale (SAD) è stato aggiornato per includere un nuovo metodo migliorato oltre a quello esistente nell'API Speech To Text
recognize.- Il nuovo metodo aumenta l'accuratezza e le prestazioni nel rilevamento dei confini del parlato all'interno del flusso audio. Può essere utilizzato impostando
sad_module:2. Per ulteriori informazioni, consultare la sezione " Rilevamento dell'attività vocale(SAD) ".
- Il nuovo metodo aumenta l'accuratezza e le prestazioni nel rilevamento dei confini del parlato all'interno del flusso audio. Può essere utilizzato impostando
- L'identificazione della lingua parlata è ora generalmente disponibile
-
L'identificazione della lingua parlata è ora generalmente disponibile.
- L'identificazione della lingua (LID) rileva automaticamente la lingua parlata nei flussi audio. Il modello elabora continuamente l'audio in entrata e restituisce la lingua identificata quando raggiunge un livello di confidenza superiore alla soglia specificata ( 0.99 per impostazione predefinita). Per ulteriori informazioni, vedere Identificazione della lingua parlata.
07 ottobre 2025
hintsil parametro è ora generalmente disponibile-
Il parametro
hintsè ora generalmente disponibile.hintsil parametro migliora la post-elaborazione con Smart Formatter. Questo parametro aiuta il formattatore a interpretare l'intento dell'utente in modo più accurato e a restituire risultati che corrispondono meglio alle aspettative. Per ulteriori informazioni, vedere il parametro Suggerimenti.
26 settembre 2025
- L'arricchimento della trascrizione vocale è ora generalmente disponibile
-
L'arricchimento della trascrizione vocale è ora generalmente disponibile.
- La funzione Speech Transcript Enrichment migliora la leggibilità e l'usabilità delle trascrizioni grezze del riconoscimento vocale automatico (ASR). Questo servizio di post-elaborazione aggiunge automaticamente la punteggiatura e applica una capitalizzazione intelligente per migliorare la struttura e la chiarezza del contenuto parlato. Per ulteriori informazioni, vedere Arricchimento della trascrizione vocale.
09 settembre 2025
Correzione di un difetto: Corretto un problema in Smart Formatter per il modello linguistico Fr-CA in cui i numeri a 8 cifre venivano formattati in modo errato con zeri in più. Smart Formatter ora restituisce la trascrizione corretta.
19 agosto 2025
Correzione di un difetto: Corretto un problema in Smart Formatter per cui i valori numerici pronunciati nelle transazioni venivano trascritti in modo errato. Ad esempio, one hundred and ninety-nine and twelve cents dovrebbe essere trascritto come $199.12, ma è stato erroneamente visualizzato come 199 e R$ 0,12. Smart Formatter ora restituisce
la trascrizione corretta.
Correzione di un difetto: Corretto un problema in Smart Formatter per i modelli linguistici francesi in cui la parola "cent" veniva formattata in modo errato. Ad esempio, quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit è stato trascritto come 89450328 100 1678 invece del previsto 8945032811678. Smart Formatter ora restituisce la trascrizione corretta.
22 luglio 2025
Correzione del difetto: L'errore del modello personalizzato ja-JP, causato dal carattere spazio a tutta larghezza ( U+3000 ), è stato corretto.
Correzione del difetto: Il problema di formattazione delle e-mail portoghesi di Smart Formatter, in cui venivano introdotti spazi extra negli indirizzi e-mail, è stato corretto. Per ulteriori informazioni, vedere Smart Formatter per il portoghese.
08 luglio 2025
- Miglioramenti nel riconoscimento delle entità denominate per il Large Speech Model inglese
-
Include miglioramenti nel riconoscimento di città, indirizzi, nomi di strade, alfanumerici, date e nomi e cognomi.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
- Correzione di un difetto: Smart Formatter Spanish Large Speech Model (
es-ES) formattazione della data -
Correzione del difetto:
el primero de enero de dos mil->el 01/01/2000deve essere formattato come01/01/2000. Questo problema è stato corretto. Per ulteriori informazioni, vedere Smart Formatter per lo spagnolo.
17 giugno 2025
Correzione del difetto: Assegnazione del valore per Smart Formatter Version, che causava un errore di inserimento, con conseguente mancata elaborazione di richieste specifiche. Il problema è stato risolto. Le richieste di Smart Formatter ora rispondono come previsto.
Correzione del difetto: In Smart Formatter si osservavano spazi indesiderati nei caratteri alfanumerici. Ad esempio, l k k one one five zero zero four two l e-> lkk1 150042le. Questo problema è stato
risolto. Le richieste di Smart Formatter ora rispondono come previsto.
28 maggio 2025
- Il nuovo modello vocale di grandi dimensioni per il giapponese è ora generalmente disponibile
-
Il modello vocale di grandi dimensioni per il giapponese è ora generalmente disponibile.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
Miglioramento: È stata aggiunta una migliore gestione dello Smart Formatter per le frasi di lettere pronunciate - a as in alpha->
a.
29 aprile 2025
- Correzione di un difetto: Sono stati corretti vari problemi di disambiguazione di lettere, cifre o simboli in Smart Formatter
-
Correzione dei difetti: Sono stati risolti i seguenti problemi:
- 'O' è stato formattato come la cifra 0
- 'a real' è stato formattato come ' r1 '
- 'colonscopia' è stato formattato come ':oscopy'
07 aprile 2025
- Correzione del difetto: È stata rilevata una fonte inattesa in OOV
- Correzione del difetto: Quando un corpus viene aggiunto a un modello personalizzato, le parole OOV precedentemente eliminate venivano involontariamente ripristinate dalla fonte precedente. Questo problema è stato corretto.
18 marzo 2025
- Correzione del difetto: Sono stati corretti i problemi di Smart Formatter con le date e i numeri aggiuntivi nel modello
en-us. - Correzione del difetto: La formattazione è disattivata quando il totale delle cifre è superiore alla data formattata richiesta. Ad esempio,
five twelve fifteen eleven->5 1/2/1511deve essere:5121511.
11 febbraio 2025
Correzione del difetto: È stato osservato un gran numero di 503’s, in particolare per ja-JP_NarrowbandModel. Sono stati apportati miglioramenti al servizio per aumentare la disponibilità di questo modello.
Correzione del difetto: È stato riscontrato un errore di allocazione della memoria di personalizzazione STT per il modello en-US_Telephony. Il problema è stato risolto.
Correzione di un difetto: È stato osservato un problema di Smart Formatter con le abbreviazioni nel modello en-us (Dr. è stato corretto in Doctor). Il problema è stato risolto.
14 gennaio 2025
Miglioramento: Sono stati aggiornati gli alfanumerici delle istanze in cui Smart Formatter combinava alcune combinazioni di numeri pronunciati
singolarmente - 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203. Questo problema è stato risolto.
- Correzione del difetto: Runtime che non riesce a inviare tutte le ipotesi
- Correzione di un difetto: Alcune parole mancavano nelle trascrizioni a causa di un problema con i timestamp di trascrizione nei casi in cui le parole chiave avevano punteggi di confidenza diversi dall'ipotesi. Il risultato
è che la trascrizione restituisce una sola parola
yes, anche se l'audio contiene due paroleyes. È stato apportato un miglioramento alla logica di cancellazione dei timestamp per correggere questo problema.
19 novembre 2024
- Il nuovo modello di parlato di grandi dimensioni per il tedesco è ora generalmente disponibile
-
Il modello di parlato di grandi dimensioni per il tedesco è ora generalmente disponibile.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
- Correzione del difetto: Miglioramento della logica di up-sampling (da 8khz a 16khz ) per il modello di parlato inglese multibanda Large Speech Model
-
Correzione del difetto: La logica di campionamento in servizio è necessaria affinché il modello possa gestire sia 8khz che 16khz.
05 novembre 2024
- Correzione del difetto: Le etichette dei diffusori disabilitano i risultati intermedi per LSM e RNNT
- Correzione del difetto: È stato riscontrato un problema per cui i risultati intermedi smettevano di arrivare quando erano abilitate le etichette degli altoparlanti. Il problema è stato risolto e il servizio ora restituisce immediatamente i risultati intermedi quando vengono utilizzate le etichette dei diffusori.
23 agosto 2024
- Tutti i modelli Large Speech sono ora generalmente disponibili
-
I modelli vocali di grandi dimensioni per tutte le lingue sono ora generalmente disponibili (GA). Sono supportati per l'utilizzo in ambienti e applicazioni di produzione.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
18 giugno 2024
- Nuovi modelli vocali di grandi dimensioni per il portoghese brasiliano e lo spagnolo sono ora in open beta
-
I grandi modelli di discorso per il portoghese brasiliano e lo spagnolo sono ora in open beta. Lo spagnolo comprende i dialetti castigliano, argentino, cileno, colombiano, messicano e peruviano.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
15 maggio 2024
- Il modello di discorso di grandi dimensioni per l'inglese è ora generalmente disponibile
-
Il grande modello di discorso per l'inglese, che include i dialetti degli Stati Uniti, dell'Australia, dell'India e del Regno Unito, è ora generalmente disponibile (GA). È supportato per l'utilizzo in ambienti e applicazioni di produzione.
- Per ulteriori informazioni sui modelli vocali di grandi dimensioni, vedi Modelli e lingue vocali di grandi dimensioni.
- Per ulteriori informazioni sulle funzioni supportate per modelli vocali di grandi dimensioni, vedi Funzioni supportate per modelli vocali di grandi dimensioni.
07 marzo 2024
- Grande modello di discorso per l'inglese americano in Open Beta
- Il nuovo modello vocale Large per l'inglese statunitense è in open beta. Vedi Modelli e lingue vocali di grandi dimensioni per ulteriori dettagli con le funzioni supportate (beta).
30 novembre 2023
- Parametro Speech to Text speech_begin_event
-
Questo parametro consente all'applicazione client di sapere che sono state rilevate alcune parole o il parlato e che Speech to Text è in fase di decodifica. Per ulteriori dettagli, vedi Utilizzo dei parametri di riconoscimento vocale.
- Parametro 'mapping_only' per parole personalizzate
-
Usando il parametro 'mapping_only', si possono usare parole personalizzate direttamente per mappare 'sounds_like' (o parola) al valore 'display_as' come post-elaborazione invece che come addestramento. Per ulteriori informazioni, vedi La risorsa di parole.
-
Vedere le linee guida per non giapponese e giapponese.
- Supporto per il brasiliano - portoghese e franco - canadese su una nuova personalizzazione migliorata del modello di lingua di prossima generazione
-
La personalizzazione del modello di lingua per i modelli di nuova generazione brasiliano - portoghese e franco - canadese è stata recentemente aggiunta. Questo aggiornamento del servizio include ulteriori miglioramenti interni.
- Nuova funzione di formattazione intelligente
-
Una nuova funzione di formattazione intelligente per i modelli di prossima generazione è supportata in inglese americano, portoghese brasiliano, francese e tedesco. Consultare Versione di formattazione intelligente per i dettagli.
- Supporto per lo spagnolo castigliano e lo spagnolo LATAM sulla nuova personalizzazione del modello linguistico di nuova generazione
-
Viene aggiunta la personalizzazione del modello di lingua per i modelli di nuova generazione spagnolo castigliano e spagnolo LATAM. Questo aggiornamento del servizio include ulteriori miglioramenti interni.
- Modelli vocali di grandi dimensioni per inglese, giapponese e francese - per l'accesso anticipato
-
Per la funzione di accesso anticipato, i modelli vocali di grandi dimensioni sono disponibili per le lingue inglese, giapponese e francese per te in IBM Watson Speech - to - Text e IBM watsonx Assistant. La serie di funzioni per questi modelli vocali di grandi dimensioni è limitata, ma più accurata rispetto ai modelli di generazione Next-Generation e sono più veloci e più economici da eseguire grazie alle dimensioni più ridotte e alla migliore funzionalità della modalità di streaming.
Se sei interessato a testare questi modelli di base e condividere risultati e feedback, contatta il nostro team di gestione del prodotto compilando questo modulo.
28 luglio 2023
- Importante: Tutti i modelli di generazione precedente sono fuori produzione a partire dal 1 ° agosto 2023
- Importante: tutti i modelli di generazione precedente sono ora dismessi dal servizio. I nuovi clienti devono ora utilizzare solo i modelli di prossima generazione. Tutti i client esistenti devono ora migrare al modello di nuova generazione equivalente. Per ulteriori informazioni su tutti i modelli di nuova generazione, vedi Lingue e modelli di nuova generazione. Per ulteriori informazioni su come migrare ai modelli di nuova generazione, vedi Migrazione ai modelli di nuova generazione.
9 giugno 2023
- Correzione dei defect: la creazione e l'addestramento di un modello di lingua personalizzato è ora ottimale per i modelli di generazione di estensioni standard e a bassa latenza
- Correzione del difetto: quando si crea e si esegue l'addestramento di un modello di lingua personalizzato con file di testo corpora e / o parole personalizzate utilizzando un modello a bassa latenza di generazione Next-generation, sta ora funzionando allo stesso modo di un modello standard. In passato, non era ottimale solo quando si utilizzava un modello a bassa latenza di generazione successiva.
- Correzione del difetto: le sessioni STT Websockets non hanno più esito negativo a causa del messaggio di errore del tensore
- Fix Defect: quando si utilizzano i websocket STT, le sessioni non hanno più esito negativo a causa di un messaggio di errore "STT restituisce l'errore: le dimensioni dei tensori devono corrispondere tranne che nella dimensione 0".
18 maggio 2023
- Aggiornamenti al modello di telefonia medica di nuova generazione in inglese
-
Il modello di telefonia medica di nuova generazione inglese è stato aggiornato per migliorare il riconoscimento vocale:
en-WW_Medical_Telephony
- Aggiunto il supporto per il francese e il tedesco sulla nuova personalizzazione migliorata del modello di lingua di prossima generazione
-
Recentemente è stata aggiunta la personalizzazione del modello di lingua per i modelli di nuova generazione in francese e tedesco. Questo aggiornamento del servizio include ulteriori miglioramenti interni.
Per ulteriori informazioni sulle funzionalità avanzate di personalizzazione di nuova generazione, consultare
- Correzione dei difetti: le parole personalizzate contenenti caratteri Katakana a metà larghezza ora restituiscono un chiaro messaggio di errore con il modello di telefonia giapponese
-
Fix Defect: per la documentazione, solo i caratteri Katakana a larghezza intera vengono accettati nelle parole personalizzate e i modelli di prossima generazione ora mostrano un messaggio di errore per spiegare che non sono supportati. In precedenza, durante la creazione di parole personalizzate contenenti caratteri Katakana a mezza larghezza, non veniva fornito alcun messaggio di errore.
- Correzione difetto: il modello di lingua telefonica giapponese non ha più esito negativo a causa di un lungo tempo di addestramento
-
Correzione dei difetti: quando si esegue l'addestramento di un modello di lingua personalizzato con la telefonia giapponese, il servizio ora gestisce effettivamente un numero elevato di parole personalizzate senza errori.
2 maggio 2023
- Nuova procedura per l'aggiornamento di un modello personalizzato basato su un modello di nuova generazione migliorato
-
Sono ora disponibili due approcci per aggiornare un modello di linguaggio personalizzato a un modello di base di nuova generazione migliorato. Puoi ancora modificare e quindi riaddestrare il modello personalizzato, come già documentato. Ma ora, puoi anche aggiornare il modello personalizzato includendo il parametro di query
force=truecon la richiestaPOST /v1/customizations/{customization_id}/train. Il parametroforceaggiorna il modello personalizzato indipendentemente dal fatto che contenga modifiche (si trova nello statoreadyoavailable).Per ulteriori informazioni, vedi Aggiornamento di un modello di lingua personalizzato basato su un modello di nuova generazione migliorato.
- Guida per l'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati
-
La documentazione ora offre ulteriori indicazioni sull'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati. Per motivi di prestazioni durante la formazione, la guida incoraggia l'uso di corpora piuttosto che l'aggiunta diretta di parole personalizzate quando possibile.
Per ulteriori informazioni, vedi Linee guida per l'aggiunta di parole ai modelli personalizzati basati su modelli di nuova generazione migliorati.
- Le parole personalizzate in giapponese per i modelli personalizzati basati su modelli di nuova generazione migliorati vengono gestite in modo diverso
-
Per i modelli personalizzati giapponesi basati su modelli di nuova generazione, le parole personalizzate sono gestite in modo diverso rispetto ad altre lingue. Per il giapponese, è possibile aggiungere una parola o un suono personalizzati che non superi i 25 caratteri di lunghezza. Se la tua parola personalizzata o il tuo sound - like supera tale limite, il servizio aggiunge la parola al modello personalizzato come se fosse stato aggiunto da un corpus. La parola non viene visualizzata come parola personalizzata per il modello.
Per ulteriori informazioni, vedi Linee guida per l'aggiunta di parole ai modelli giapponesi basati su modelli di nuova generazione migliorati.
12 aprile 2023
- Correzione del difetto: l'interfaccia WebSocket ora va in timeout come previsto quando si utilizzano modelli di nuova generazione
- Correzione del difetto: quando viene utilizzata per il riconoscimento vocale con modelli di nuova generazione, l'interfaccia WebSocket ora va in timeout come previsto dopo lunghi periodi di silenzio. In precedenza, quando veniva utilizzato per il riconoscimento vocale di file audio brevi, la sessione WebSocket potrebbe non riuscire a raggiungere il timeout. Quando la sessione non è andata in timeout, il servizio non ha restituito un'ipotesi finale all'applicazione client in attesa e il client è invece scaduto durante l'attesa dei risultati.
6 aprile 2023
- Correzione dei difetti: limiti per consentire il completamento della formazione per i modelli personalizzati giapponesi di nuova generazione
-
Correzione dei difetti: il corretto addestramento di un modello di lingua personalizzato giapponese di nuova generazione richiede che le parole e i suoni personalizzati aggiunti al modello non contengano più di 25 caratteri. Per l'addestramento più efficace, si consiglia che le parole e i suoni - like personalizzati non contengano più di 20 caratteri. L'addestramento dei modelli personalizzati giapponesi con parole e suoni personalizzati più lunghi non viene completato dopo più ore di addestramento.
Se hai bisogno di aggiungere l'equivalente di una parola lunga o di un suono simile a un modello personalizzato giapponese di nuova generazione, attieniti alla seguente procedura:
- Aggiungere una parola o suoni più brevi - come che cattura l'essenza della parola o dei suoni più lunghi - come al modello personalizzato.
- Aggiungere una o più frasi che utilizzano la parola o i suoni più lunghi a un corpus.
- Considera l'aggiunta di frasi al corpus che forniscono più contesto per la parola o suoni simili. Un contesto più ampio fornisce al servizio maggiori informazioni con cui riconoscere la parola e applicare i suoni corretti.
- Aggiungi il corpus al modello personalizzato.
- Riaddestra il modello personalizzato sulla combinazione della parola più breve o del suono simile e il corpus che contiene la stringa più lunga.
I limiti e i passi appena descritti consentono ai modelli personalizzati giapponesi di nuova generazione di completare l'addestramento. Tieni presente che l'aggiunta di un gran numero di nuove parole personalizzate a un modello di lingua personalizzato aumenta il tempo di addestramento del modello. Ma il tempo di addestramento aumentato si verifica solo quando il modello personalizzato viene inizialmente addestrato sulle parole nuove. Una volta che il modello personalizzato è stato addestrato sulle nuove parole, il tempo di addestramento ritorna normale.
For more information, see
- Ulteriori miglioramenti alla personalizzazione del modello linguistico di nuova generazione
-
La personalizzazione del modello di lingua per i modelli di nuova generazione in inglese e giapponese è stata recentemente migliorata. Questo aggiornamento del servizio include ulteriori miglioramenti interni. Per ulteriori informazioni sulle funzionalità avanzate di personalizzazione di nuova generazione, consultare
13 marzo 2023
- Correzione difetto: la formattazione intelligente per le date in inglese americano è ora corretta
- Correzione del difetto: la formattazione intelligente ora include correttamente i giorni della settimana e le date in cui entrambi sono presenti nell'audio parlato, ad esempio
Tuesday February 28. In precedenza, in alcuni casi, il giorno della settimana era omesso e la data era presentata in modo non corretto. Si noti che la formattazione intelligente è funzionalità beta. - Correzione difetto: aggiornare la documentazione per le parole di esitazione vocale per i modelli di nuova generazione
- Fix Defect: la documentazione per le parole di esitazione vocale per i modelli di nuova generazione è stata aggiornata. Ulteriori dettagli sono forniti sulle parole di esitazione di inglese americano e giapponese. I modelli di nuova generazione includono le parole di esitazione effettive nei risultati della trascrizione, a differenza dei modelli di generazione precedente, che includono solo indicatori di esitazione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.
27 febbraio 2023
- Nuovo modello di telefonia giapponese di nuova generazione
-
Il servizio offre ora un modello di telefonia di nuova generazione per il giapponese
ja-JP_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Personalizzazione migliorata del modello di lingua per modelli inglesi e giapponesi di nuova generazione
-
Il servizio ora fornisce una migliore personalizzazione del modello di lingua per i modelli di inglese e giapponese di prossima generazione:
en-AU_Multimediaen-AU_Telephonyen-IN_Telephonyen-GB_Multimediaen-GB_Telephonyen-US_Multimediaen-US_Telephonyja-JP_Multimediaja-JP_Telephony
Miglioramenti visibili ai modelli: la nuova tecnologia migliora il comportamento predefinito dei nuovi modelli in inglese e in giapponese. Tra le altre modifiche, la nuova tecnologia ottimizza il comportamento predefinito per i parametri seguenti:
- Il
customization_weightpredefinito per i modelli personalizzati basati sulle nuove versioni di questi modelli cambia da0.2a0.1. - Il valore predefinito
character_insertion_biasper i modelli personalizzati basati sulle nuove versioni di questi modelli rimane0.0, ma i modelli sono stati modificati in un modo che rende meno necessario l'utilizzo del parametro per il riconoscimento vocale.
Aggiornamento ai nuovi modelli: per usufruire della tecnologia migliorata, devi eseguire l'upgrade dei modelli di lingua personalizzati basati sui nuovi modelli. Per eseguire l'aggiornamento alla nuova versione di uno di questi modelli di base, effettuare le seguenti operazioni:
- Modifica il tuo modello personalizzato aggiungendo o modificando una parola personalizzata, un corpus o una grammatica che il modello contiene. Qualsiasi modifica apportata sposta il modello nello stato
ready. - Utilizzare il metodo
POST /v1/customizations/{customization_id}/trainper eseguire nuovamente l'addestramento del modello. Il nuovo aggiornamento aggiorna il modello personalizzato alla nuova tecnologia e sposta il modello nello statoavailable.
Problema noto: in questo momento, non è possibile utilizzare il metodo
POST /v1/customizations/{customization_id}/upgrade_modelper aggiornare un modello personalizzato a un nuovo modello di base. Questo problema verrà risolto in una versione futura.Utilizzo dei nuovi modelli: dopo l'upgrade al nuovo modello di base, ti consigliamo di valutare le prestazioni del modello personalizzato aggiornato prestando particolare attenzione ai parametri
customization_weightecharacter_insertion_biasper il riconoscimento vocale. Quando esegui di nuovo l'addestramento del modello personalizzato:- Il modello personalizzato utilizza il nuovo
customization_weightpredefinito di0.1per il proprio modello personalizzato. Viene rimosso uncustomization_weightnon predefinito associato al modello personalizzato. - Il modello personalizzato potrebbe non richiedere più l'utilizzo del parametro
character_insertion_biasper il riconoscimento vocale ottimale.
I miglioramenti alla personalizzazione del modello di lingua rendono questi parametri meno importanti per il riconoscimento vocale di alta qualità:
- Se si utilizzano i valori predefiniti per questi parametri, continuare a farlo dopo l'aggiornamento. I valori predefiniti continueranno probabilmente a offrire i migliori risultati per il riconoscimento vocale.
- Se si specificano valori non predefiniti per questi parametri, provare con i valori predefiniti dopo l'aggiornamento. Il tuo modello personalizzato potrebbe funzionare bene per il riconoscimento vocale con i valori predefiniti.
Se ritieni che l'utilizzo di valori differenti per questi parametri potrebbe migliorare il riconoscimento vocale con il tuo modello personalizzato, prova le modifiche incrementali per determinare se i parametri sono necessari per migliorare il riconoscimento vocale.
Nota: a questo punto, i miglioramenti alla personalizzazione del modello di lingua si applicano solo ai modelli personalizzati basati sui modelli di lingua di base di nuova generazione in inglese o giapponese elencati in precedenza. Nel tempo, i miglioramenti saranno resi disponibili per altri modelli linguistici di prossima generazione.
Ulteriori informazioni: per ulteriori informazioni sull'aggiornamento e sul riconoscimento vocale con questi parametri, consultare
- Correzione dei difetti: i file di grammatica ora gestiscono correttamente le stringhe di cifre
-
Fix Defect: quando vengono utilizzate le grammatiche, il servizio ora gestisce correttamente le stringhe di cifre più lunghe. In precedenza, non era in grado di completare il riconoscimento o restituire risultati errati.
15 febbraio 2023
- Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio il 31 luglio 2023
-
Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio a partire dal 31 luglio 2023. A tale data, tutti i modelli di generazione precedente verranno rimossi dal servizio e dalla documentazione. La data di deprecazione precedente era il 3 marzo 2023. La nuova data consente agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati. Ma gli utenti devono migrare al modello equivalente di prossima generazione entro il 31 luglio 2023.
La maggior parte dei modelli di generazione precedente sono stati deprecati il 15 marzo 2022. In precedenza, i modelli arabo e giapponese non erano deprecati. L'obsolescenza ora si applica a tutti modelli di generazione precedente.
- Per ulteriori informazioni sui modelli di nuova generazione a cui è possibile migrare da ciascuno dei modelli obsoleti, vedi Lingue e modelli di generazione precedente
- Per ulteriori informazioni sulla migrazione da modelli di generazione precedente a modelli di generazione successiva, vedi Migrazione a modelli di generazione successiva.
- Per ulteriori informazioni su tutti i modelli di nuova generazione, vedi Lingue e modelli di nuova generazione
Nota: quando la generazione precedente
en-US_BroadbandModelviene rimossa dal servizio, il modelloen-US_Multimediadi nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale. - Correzione dei difetti: tempo di formazione migliorato per i modelli di lingua personalizzati di prossima generazione
-
Correzione del difetto: il tempo di addestramento per i modelli di lingua personalizzati di nuova generazione è ora notevolmente migliorato. In precedenza, il tempo di addestramento era molto più lungo del necessario, come riportato per l'addestramento dei modelli di lingua personalizzati giapponesi. Il problema è stato corretto da una correzione interna.
- Correzione dei difetti: i file di grammatica generati dinamicamente ora funzionano correttamente
-
Fix Defect: i file di grammatica generati dinamicamente ora funzionano correttamente. In precedenza, i file di grammatica dinamici potevano causare errori interni, come riportato per l'integrazione di Speech to Text con IBM® watsonx™ Assistant. Il problema è stato corretto da una correzione interna.
20 gennaio 2023
- I nomi dei modelli Arabo e Regno Unito obsoleti non sono più disponibili
-
I seguenti nomi modello in arabo e nel Regno Unito non sono più accettati dal servizio:
ar-AR_BroadbandModel- Utilizzare invecear-MS_BroadbandModel.en-UK_NarrowbandModel- Utilizzare inveceen-GB_NarrowbandModel.en-UK_BroadbandModel- Utilizzare inveceen-GB_BroadbandModel.
Il nome del modello arabo è stato dichiarato obsoleto il 2 dicembre 2020. I nomi dei modelli inglesi del Regno Unito sono stati deprecati il 14 luglio 2017.
- Obsolescenza e migrazione di Cloud Foundry ai gruppi di risorse
-
IBM ha annunciato l'abbandono di IBM Cloud Foundry il 31 maggio 2022. A partire dal 30 novembre 2022, non sarà più possibile creare nuove applicazioni 'IBM 'Cloud Foundry e solo gli utenti esistenti potranno distribuire le applicazioni. IBM 'Cloud Foundry raggiungono la fine del supporto il 1° giugno 2023. In quel momento, qualsiasi IBM Istanze runtime di applicazioni Cloud Foundry che eseguono IBM Cloud Foundry verranno disattivate, deprovisionate ed eliminate in modo permanente.
Per continuare a utilizzare le applicazioni IBM Cloud oltre il 1° giugno 2023, è necessario migrare ai gruppi di risorse prima di tale data. I gruppi di risorse sono concettualmente simili agli spazi di Cloud Foundry. Tra questi figurano diversi vantaggi aggiuntivi, quali un controllo degli accessi più granulare grazie all’utilizzo dell’ IBM Cloud Identity and Access Management (IAM), la possibilità di collegare istanze di servizio ad app e servizi in diverse regioni e un modo semplice per visualizzare l’utilizzo per gruppo.
- Il parametro
max_alternativesè ora disponibile per l'utilizzo con modelli di nuova generazione -
Il parametro
max_alternativesè ora disponibile per l'utilizzo con tutti i modelli di nuova generazione. Il parametro è generalmente disponibile per tutti i modelli di nuova generazione. Per ulteriori informazioni, vedi Numero massimo di alternative. - Correzione dei difetti: consentire l'utilizzo di entrambi i parametri
max_alternativeseend_of_phrase_silence_timecon i modelli di nuova generazione -
Fix Defect: quando si utilizzano entrambi i parametri
max_alternativeseend_of_phrase_silence_timenella stessa richiesta con i modelli di nuova generazione, il servizio ora restituisce più trascrizioni alternative rispettando anche l'intervallo di pausa indicato. In precedenza, l'utilizzo dei due parametri in una singola richiesta ha generato un errore. (L'uso del parametromax_alternativescon modelli di nuova generazione era precedentemente disponibile come funzione sperimentale per un numero limitato di clienti.) - Correzione del difetto: aggiornare il modello di telefonia di nuova generazione francese canadese (aggiornamento richiesto)
-
Correzione del difetto: il modello di telefonia francese canadese di nuova generazione,
fr-CA_Telephony, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale. È necessario aggiornare i modelli personalizzati basati sul modellofr-CA_Telephony. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, consultare - Correzione dei difetti: aggiungere le linee guida per la documentazione per la creazione di suoni giapponesi basati su modelli di nuova generazione
-
Fix Defect: in sound - like per i modelli di lingua personalizzati giapponesi basati su modelli di nuova generazione, la sequenza di caratteri
ウーè ambigua in alcuni contesti di sinistra. Non utilizzare caratteri (sillabe) che terminano con il fonema/o/, comeロeト. In questi casi, utilizzareウウo soloウinvece diウー. Ad esempio, utilizzareロウウマンoロウマンinvece diロウーマン. Per ulteriori informazioni, consultare Linee guida per il giapponese. - L'aggiunta di parole direttamente ai modelli personalizzati basati sui modelli di nuova generazione aumenta il tempo di addestramento
-
L'aggiungere parole personalizzate direttamente a un modello personalizzato che si basa su un modello di nuova generazione fa sì che l'addestramento di un modello impiega alcuni minuti in più di quanto non farebbe altrimenti. Se stai addestrando un modello con parole personalizzate che hai aggiunto utilizzando il metodo
POST /v1/customizations/{customization_id}/wordsoPUT /v1/customizations/{customization_id}/words/{word_name}, concedi alcuni minuti di tempo di addestramento supplementare per il modello. Per ulteriori informazioni, vedi - Il numero massimo di ore di risorse audio per i modelli acustici personalizzati nell'ubicazione di Tokyo è stato aumentato
-
Il numero massimo di ore di risorse audio che puoi aggiungere ai modelli acustici personalizzati nell'ubicazione di Tokyo è ancora 200 ore. In precedenza, il massimo era stato ridotto a 50 ore per la regione di Tokyo. Tale riduzione è stata revocata e rinviata al prossimo anno. Per ulteriori informazioni, vedi Numero massimo di ore di audio.
5 dicembre 2022
- Nuovo modello multimediale olandese di nuova generazione
- Il servizio offre ora un modello multimediale di nuova generazione per l'olandese olandese olandese:
nl-NL_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Correzione del difetto: correggere il riconoscimento delle parole personalizzato nei risultati della trascrizione per modelli di nuova generazione
- Correzione del difetto: per la personalizzazione del modello di lingua con modelli di nuova generazione, le parole personalizzate sono ora riconosciute e utilizzate in tutte le trascrizioni. In precedenza, le parole personalizzate a volte non venivano riconosciute e utilizzate nei risultati della trascrizione.
- Correzione difetto: correggere l'utilizzo del campo
display_asnei risultati della trascrizione per modelli di nuova generazione - Correzione del difetto: per la personalizzazione del modello di lingua con modelli di nuova generazione, il valore del campo
display_asper una parola personalizzata ora viene visualizzato in tutte le trascrizioni. In precedenza, il valore del campowordappariva talvolta nei risultati della trascrizione. - Correzione del difetto: aggiornamento della documentazione di denominazione del modello personalizzato
- Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli di lingua personalizzati e dei modelli acustici personalizzati. Per ulteriori informazioni, vedi
20 ottobre 2022
- Aggiornamenti ai modelli di telefonia di nuova generazione in inglese
-
I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Correzione difetto: aggiornare il modello multimediale di nuova generazione giapponese (aggiornamento richiesto)
-
Fix Defect: il modello multimediale di nuova generazione giapponese,
ja-JP_Multimedia, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale con bassa latenza. È necessario aggiornare i modelli personalizzati basati sul modelloja-JP_Multimedia. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, consultare
7 ottobre 2022
- Nuovo modello di telefonia svedese di nuova generazione
-
Il servizio ora offre un modello di telefonia di nuova generazione per lo svedese
sv-SE_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Aggiornamenti ai modelli di telefonia di nuova generazione in inglese
-
I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
21 settembre 2022
- Nuovo evento Activity Tracker per l'eliminazione delle informazioni utente da parte del GDPR
-
Il servizio ora restituisce un evento Activity Tracker quando utilizzi il metodo
DELETE /v1/user_dataper eliminare tutte le informazioni su un utente. L'evento è denominatospeech-to-text.gdpr-user-data.delete. Per ulteriori informazioni, vedi Eventi Activity Tracker. - Correzione dei difetti: aggiornare alcuni modelli di nuova generazione per migliorare il tempo di risposta a bassa latenza
-
Correzione dei difetti: i seguenti modelli di nuova generazione sono stati aggiornati per migliorarne il tempo di risposta quando si utilizza il parametro
low_latency:en-IN_Telephonyhi-IN_Telephonyit-IT_Multimedianl-NL_Telephony
In precedenza, questi modelli non restituivano i risultati di riconoscimento con la velocità prevista quando veniva utilizzato il parametro
low_latency. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
19 agosto 2022
- Importante: la data di scadenza per la maggior parte dei modelli di generazione precedente è ora il 3 marzo 2023
-
Sostituito: questa notifica di obsolescenza viene sostituita dall'aggiornamento del servizio del 15 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.
Il 15 marzo 2022, i modelli di generazione precedente per tutte le lingue tranne l'arabo e il giapponese furono deprecati. A quel tempo, i modelli obsoleti sarebbero rimasti disponibili fino al 15 settembre 2022. Per consentire agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati, i modelli obsoleti rimarranno ora disponibili fino al 3 marzo 2023. Come con l'avviso di deprecazione iniziale, i modelli di generazione precedente in arabo e giapponese non sono obsoleti. Per un elenco completo di tutti i modelli obsoleti, consulta l'aggiornamento del servizio del 15 marzo 2022.
Il 3 marzo 2023, i modelli obsoleti saranno rimossi dal servizio e dalla documentazione. Se si utilizza uno dei modelli obsoleti, è necessario migrare al modello di prossima generazione equivalente entro il 3 marzo 2023.
- Per ulteriori informazioni sui modelli di nuova generazione a cui è possibile migrare da ciascuno dei modelli obsoleti, vedi Lingue e modelli di generazione precedente
- Per ulteriori informazioni sui modelli di nuova generazione, vedi Lingue e modelli di nuova generazione
- Per ulteriori informazioni sulla migrazione da modelli di generazione precedente a modelli di generazione successiva, vedi Migrazione a modelli di generazione successiva.
Nota: quando la generazione precedente
en-US_BroadbandModelviene rimossa dal servizio, il modelloen-US_Multimediadi nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.
15 agosto 2022
- Nuovo modello multimediale francese canadese di nuova generazione
-
Il servizio ora offre un modello multimediale di nuova generazione per il francese canadese:
fr-CA_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Aggiornamenti ai modelli di telefonia di nuova generazione in inglese
-
I modelli di telefonia di nuova generazione inglesi sono stati aggiornati per migliorare il riconoscimento vocale:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Il modello multimediale italiano di nuova generazione ora supporta la bassa latenza
-
Il modello multimediale italiano di nuova generazione,
it-IT_Multimedia, ora supporta la bassa latenza. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Importante: riduzione del numero massimo di ore di dati audio per i modelli acustici personalizzati
-
Importante: la quantità massima di dati audio che puoi aggiungere a un modello acustico personalizzato viene ridotta da 200 ore a 50 ore. Questo cambiamento è in fase di introduzione in diverse località da agosto a settembre 2022. Per informazioni sulla pianificazione per la riduzione del limite e cosa significa per i modelli acustici personalizzati esistenti che contengono più di cinquanta ore di audio, consulta Numero massimo di ore di audio.
3 agosto 2022
- Correzione del difetto: aggiornare la documentazione dei contrassegni di esitazione e delle esitazioni
-
Fix Defect: la documentazione per le esitazioni del discorso e gli indicatori di esitazione è stata aggiornata. I modelli di generazione precedente includono marcatori di esitazione al posto delle esitazioni del discorso nei risultati della trascrizione per la maggior parte delle lingue; la formattazione intelligente rimuove i marcatori di esitazione dalle trascrizioni finali dell'inglese americano. I modelli di nuova generazione includono le reali esitazioni del discorso nei risultati di trascrizione; la formattazione intelligente non ha alcun effetto sulla loro inclusione nei risultati di trascrizione finali.
Per ulteriori informazioni, consulta:
1 giugno 2022
- Aggiornamenti a più modelli di telefonia di nuova generazione
-
I seguenti modelli di telefoni di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephonyko-KR_Telephony
Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
25 maggio 2022
- Nuovo parametro beta
character_insertion_biasper i modelli di nuova generazione -
Tutti i modelli di nuova generazione ora supportano il nuovo parametro beta,
character_insertion_bias, disponibile con tutte le interfacce di riconoscimento vocale. Per impostazione predefinita, il servizio è ottimizzato per ogni singolo modello per bilanciarne il riconoscimento delle stringhe candidate di lunghezze differenti. La distorsione specifica del modello equivale a 0.0. La distorsione predefinita di ogni modello è sufficiente per la maggior parte delle richieste di riconoscimento vocale.Tuttavia, alcuni casi di utilizzo potrebbero trarre vantaggio dalla preferenza di ipotesi con stringhe di caratteri più brevi o più lunghe. Il parametro accetta valori compresi tra -1.0 e 1.0 che rappresentano una modifica rispetto al valore predefinito di un modello. I valori negativi indicano al servizio di favorire le stringhe di caratteri più brevi. I valori positivi indirizzano il servizio a preferire stringhe di caratteri più lunghe. Per ulteriori informazioni, vedi Bias di inserimento dei caratteri.
19 maggio 2022
- Nuovo modello italiano
it-IT_Multimediadi nuova generazione -
Il servizio offre ora un modello multimediale di nuova generazione per l'italiano:
it-IT_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta la bassa latenza, ma supporta la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione. - Modelli di telefonia e multimedia coreani aggiornati di prossima generazione
-
I modelli coreani di nuova generazione sono stati aggiornati:
- Il modello
ko-KR_Telephonyè stato aggiornato per migliorare il supporto a bassa latenza per il riconoscimento vocale. - Il modello "
ko-KR_Multimedia" è stato aggiornato per migliorare il riconoscimento vocale. Il modello ora supporta anche la bassa latenza.
Entrambi i modelli sono generalmente disponibili ed entrambi supportano la personalizzazione del modello di lingua e le grammatiche. Non è necessario aggiornare i modelli di lingua personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Il modello
- Correzione difetto: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione
-
Correzione dei difetti: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione. In precedenza, quando il servizio restituì più trascrizioni per una singola richiesta di riconoscimento vocale, i punteggi di affidabilità potrebbero non essere restituiti per tutte le trascrizioni.
11 aprile 2022
- Nuovo modello portoghese brasiliano
pt-BR_Multimediadi nuova generazione -
Il servizio offre ora un modello multimediale di nuova generazione per il portoghese brasiliano
pt-BR_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Aggiornamento al modello di nuova generazione tedesco
de-DE_Multimediaper supportare la bassa latenza -
Il modello tedesco di nuova generazione,
de-DE_Multimedia, ora supporta la bassa latenza. Non devi eseguire l'upgrade dei modelli personalizzati basati sul modello di base tedesco aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare - Il supporto per i suoni simili è ora documentato per i modelli personalizzati basati sui modelli di nuova generazione
-
Per i modelli di lingua personalizzati che si basano su modelli di nuova generazione, il supporto è ora documentato per le specifiche di suoni simili per le parole personalizzate. Il supporto per i suoni - like è disponibile dalla fine del 2021.
Esistono differenze tra l'utilizzo del campo
sounds_likeper i modelli personalizzati basati sui modelli di generazione precedente e di nuova generazione. Per ulteriori informazioni sull'utilizzo del camposounds_likecon i modelli personalizzati basati sui modelli di nuova generazione, vedi Gestione delle parole personalizzate per i modelli di nuova generazione. - Importante: parametro
customization_idobsoleto rimosso dalla documentazione -
Importante: il 9 ottobre 2018, il parametro
customization_iddi tutte le richieste di riconoscimento vocale è stato obsoleto e sostituito dal parametrolanguage_customization_id. Il parametrocustomization_idè stato ora rimosso dalla documentazione per i metodi di riconoscimento vocale:/v1/recognizeper le richieste WebSocketPOST /v1/recognizeper le richieste HTTP sincrone (incluse le richieste a più parti)POST /v1/recognitionsper le richieste HTTP asincrone
Nota: se utilizzi gli SDK Watson, assicurati di aver aggiornato qualsiasi codice dell'applicazione per utilizzare il parametro
language_customization_idinvece del parametrocustomization_id. Il parametrocustomization_idnon sarà più disponibile dai metodi equivalenti degli SDK a partire dalla loro release principale successiva. Per ulteriori informazioni sui metodi di riconoscimento vocale, consulta la Guida di riferimento API & SDK.
17 marzo 2022
- Il supporto grammaticale per i modelli di nuova generazione è ora generalmente disponibile
-
Il supporto grammaticale è ora generalmente disponibile (GA) per i modelli generali successivi che soddisfano le condizioni seguenti:
- I modelli sono generalmente disponibili.
- I modelli supportano la personalizzazione del modello di lingua.
Per ulteriori informazioni, vedi i seguenti argomenti:
- Per ulteriori informazioni sullo stato del supporto grammaticale per i modelli di nuova generazione, vedi Supporto di personalizzazione per i modelli di nuova generazione.
- Per ulteriori informazioni sulle grammatiche, vedi Grammatiche.
- Nuovo modello multimediale tedesco di nuova generazione
-
Il servizio ora offre un modello multimediale di nuova generazione per il tedesco
de-DE_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta bassa latenza. Supporta la personalizzazione del modello di lingua (generalmente disponibile) e le grammatiche (beta).Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare
- Il modello beta di nuova generazione
en-WW_Medical_Telephonyora supporta la bassa latenza -
Il modello beta di nuova generazione
en-WW_Medical_Telephonyora supporta la bassa latenza. Per ulteriori informazioni su tutti i modelli di nuova generazione e bassa latenza, consultare
15 marzo 2022
- Importante: Deprecazione della maggior parte dei modelli di generazione precedente
-
Sostituito: questa notifica di obsolescenza viene sostituita dall'aggiornamento del servizio del 15 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.
A partire dal 15 marzo 2022, i modelli di generazione precedente per tutte le lingue diverse dall'arabo e dal giapponese sono obsoleti. I modelli obsoleti rimangono disponibili fino al 15 settembre 2022, quando saranno rimossi dal servizio e dalla documentazione. I modelli di generazione precedente in arabo e giapponese non sono obsoleti.
I seguenti modelli di generazione precedente sono ora obsoleti:
- Cinese (mandarino):
zh-CN_NarrowbandModelezh-CN_BroadbandModel - Olandese (Paesi Bassi):
nl-NL_NarrowbandModelenl-NL_BroadbandModel - Inglese (australiano):
en-AU_NarrowbandModeleen-AU_BroadbandModel - Inglese (Regno Unito):
en-GB_NarrowbandModeleen-GB_BroadbandModel - Inglese (Stati Uniti):
en-US_NarrowbandModel,en-US_BroadbandModeleen-US_ShortForm_NarrowbandModel - Francese (canadese):
fr-CA_NarrowbandModelefr-CA_BroadbandModel - Francese (Francia):
fr-FR_NarrowbandModelefr-FR_BroadbandModel - Tedesco:
de-DE_NarrowbandModelede-DE_BroadbandModel - Italiano:
it-IT_NarrowbandModeleit_IT_BroadbandModel - Coreano:
ko-KR_NarrowbandModeleko-KR_BroadbandModel - Portoghese (brasiliano):
pt-BR_NarrowbandModelept-BR_BroadbandModel - Spagnolo (argentino)
es-AR_NarrowbandModelees-AR_BroadbandModel - Spagnolo (castigliano):
es-ES_NarrowbandModelees-ES_BroadbandModel - Spagnolo (cileno):
es-CL_NarrowbandModelees-CL_BroadbandModel - Spagnolo (colombiano):
es-CO_NarrowbandModelees-CO_BroadbandModel - Spagnolo (messicano):
es-MX_NarrowbandModelees-MX_BroadbandModel - Spagnolo (peruviano):
es-PE_NarrowbandModelees-PE_BroadbandModel
Se si utilizza uno di questi modelli obsoleti, è necessario migrare al modello di nuova generazione equivalente entro la data di fine del servizio.
- Per ulteriori informazioni sui modelli di nuova generazione a cui è possibile migrare da ciascuno dei modelli obsoleti, vedi Lingue e modelli di generazione precedente
- Per ulteriori informazioni sui modelli di nuova generazione, vedi Lingue e modelli di nuova generazione
- Per ulteriori informazioni sulla migrazione da modelli di generazione precedente a modelli di generazione successiva, vedi Migrazione a modelli di generazione successiva.
Nota: quando la
en-US_BroadbandModeldi generazione precedente viene rimossa dal servizio il 15 settembre, il modelloen-US_Multimediadi prossima generazione diventerà il modello predefinito per le richieste di riconoscimento vocale. - Cinese (mandarino):
- I modelli di nuova generazione ora supportano i parametri di analisi audio
-
Tutti i modelli di nuova generazione ora supportano i seguenti parametri di analisi audio come funzioni generalmente disponibili:
end_of_phrase_silence_timespecifica la durata dell'intervallo di pausa in base al quale il servizio suddivide una trascrizione in più risultati finali. Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.split_transcript_at_phrase_endindica al servizio di suddividere la trascrizione in più risultati finali in base alle caratteristiche semantiche dell'input. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.
- Correzione del difetto: correggere la documentazione delle etichette dell'altoparlante
-
Fix Defect: la documentazione delle etichette del parlante includeva la seguente istruzione errata in più posizioni: per i modelli di nuova generazione, le etichette del parlante non sono supportate per l'utilizzo con risultati provvisori o bassa latenza. Le etichette dei parlanti sono supportate per l'utilizzo con risultati provvisori e bassa latenza per i modelli di nuova generazione. Per ulteriori informazioni, vedi Etichette del parlante.
28 febbraio 2022
- Aggiornamenti ai modelli multimediali di nuova generazione in inglese e francese per supportare la bassa latenza
-
I seguenti modelli multimediali sono stati aggiornati per supportare la bassa latenza:
- Inglese australiano:
en-AU_Multimedia - Inglese britannico:
en-GB_Multimedia - Inglese americano:
en-US_Multimedia - Francese:
fr-FR_Multimedia
Non è necessario aggiornare i modelli di lingua personalizzati creati su questi modelli di base. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare
- Inglese australiano:
- Nuovo modello multimediale castigliano spagnolo di nuova generazione
-
Il servizio ora offre un modello multimediale di nuova generazione per lo spagnolo castigliano:
es-ES_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua (generalmente disponibile) e le grammatiche (beta).Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare
11 febbraio 2022
- Correzione del difetto: correggere l'aggiornamento del modello personalizzato e la documentazione della versione del modello di base
-
Correzione del difetto: la documentazione che descrive l'aggiornamento dei modelli personalizzati e le stringhe di versione utilizzate per le diverse versioni dei modelli di base è stata aggiornata. La documentazione ora indica che l'aggiornamento per la personalizzazione del modello di linguaggio si applica anche ai modelli di prossima generazione. Inoltre, le stringhe di versione che rappresentano diverse versioni dei modelli di base sono state aggiornate. E il parametro
base_model_versionpuò essere utilizzato anche con i modelli di nuova generazione aggiornati.Per ulteriori informazioni sull'aggiornamento del modello personalizzato, quando è necessario l'aggiornamento e su come utilizzare le versioni precedenti dei modelli personalizzati, vedi
- Correzione del difetto: aggiornare la documentazione relativa alle maiuscole / minuscole
-
Fix Defect: la documentazione che descrive il maiuscolo / minuscolo automatico delle trascrizioni del servizio è stata aggiornata. Il servizio capitalizza i nomi appropriati solo per le lingue e i modelli seguenti:
- Tutti i modelli di inglese americano di generazione precedente
- Il modello tedesco di nuova generazione
Per ulteriori informazioni, consultare Capitalizzazione.
2 febbraio 2022
- Nuovo modello beta
en-WW_Medical_Telephonyora disponibile -
È ora disponibile una nuova beta di nuova generazione
en-WW_Medical_Telephony. Il nuovo modello comprende i termini dei settori medico e farmacologico. Utilizzare il modello in situazioni in cui è necessario trascrivere la terminologia medica comune, ad esempio nomi di medicinali, marchi di prodotti, procedure mediche, malattie, tipi di medici o terminologia COVID-19-related. I casi d'uso comuni includono le conversazioni tra un paziente e un medico (ad esempio, un medico, un infermiere o un farmacista).Il nuovo modello è disponibile per tutti i dialetti inglesi supportati: australiano, indiano, britannico e statunitense. Il nuovo modello supporta la personalizzazione del modello di lingua e le grammatiche come funzionalità beta. Supporta la maggior parte degli stessi parametri del modello
en-US_Telephony, inclusosmart_formattingper l'audio in inglese americano. non supporta i seguenti parametri:low_latency,profanity_filter,redactionespeaker_labels.Per ulteriori informazioni, vedere Modello di telefonia medica in inglese.
- Aggiorna al modello
zh-CN_Telephonycinese -
Il modello cinese di nuova generazione
zh-CN_Telephonyè stato aggiornato per migliorare il riconoscimento vocale. Il modello continua a supportare la bassa latenza. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.Se disponi di modelli linguistici personalizzati basati sul modello aggiornato, devi aggiornare i tuoi modelli personalizzati esistenti per poter sfruttare gli aggiornamenti utilizzando il metodo
POST /v1/customizations/{customization_id}/upgrade_model. Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati. - Aggiornamento al modello di nuova generazione giapponese
ja-JP_Multimediaper supportare la bassa latenza -
Il modello giapponese di nuova generazione
ja-JP_Multimediaora supporta la bassa latenza. Puoi utilizzare il parametrolow_latencycon le richieste di riconoscimento vocale che utilizzano il modello. Non è necessario aggiornare i modelli personalizzati basati sul modello di base giapponese aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare
3 dicembre 2021
- Nuovo modello di telefonia di nuova generazione spagnolo latino americano
-
Il servizio ora offre un modello di telefonia di nuova generazione per lo spagnolo latino - americano:
es-LA_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile.Il modello
es-LA_Telephonysi applica a tutti i dialetti latinoamericani. È l'equivalente dei modelli di generazione precedente disponibili per i dialetti argentino, cileno, colombiano, messicano e peruviano. Se è stato utilizzato un modello di generazione precedente per uno di questi dialetti specifici, utilizzare il modelloes-LA_Telephonyper migrare al modello di nuova generazione equivalente.Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Importante: i modelli di lingua personalizzati basati su determinati modelli di nuova creazione devono essere ricreati
-
Importante: se hai creato modelli di lingua personalizzati basati su determinati modelli di nuova generazione, devi ricrearli. Finché non si ricreano i modelli linguistici personalizzati, le richieste di riconoscimento vocale che tentano di utilizzare i modelli personalizzati falliscono con il codice di errore 400 di HTTP.
Devi ricreare i modelli di lingua personalizzati che hai creato in base alle versioni seguenti dei modelli di nuova generazione:
- Per il modello di
en-AU_Telephony, i modelli personalizzati che hai creato daen-AU_Telephony.v2021-03-03aen-AU_Telephony.v2021-10-04. - Per il modello di
en-GB_Telephony, i modelli personalizzati che hai creato daen-GB_Telephony.v2021-03-03aen-GB_Telephony.v2021-10-04. - Per il modello di
en-US_Telephony, i modelli personalizzati che hai creato daen-US_Telephony.v2021-06-17aen-US_Telephony.v2021-10-04. - Per il modello di
en-US_Multimedia, i modelli personalizzati che hai creato daen-US_Multimedia.v2021-03-03aen-US_Multimedia.v2021-10-04.
Per identificare la versione di un modello su cui si basa un modello di lingua personalizzato, utilizzare il metodo
GET /v1/customizationsper elencare tutti i modelli di lingua personalizzati o il metodoGET /v1/customizations/{customization_id}per elencare uno specifico modello di lingua personalizzato. Il campoversionsdell'output mostra il modello base per un modello di lingua personalizzato. Per ulteriori informazioni, vedi Elenco dei modelli di lingua personalizzati.Per ricreare un modello di lingua personalizzato, creare prima un modello personalizzato. Aggiungi quindi tutti i corpora e le parole personalizzate del precedente modello personalizzato al nuovo modello. Puoi quindi eliminare il precedente modello personalizzato. Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato.
- Per il modello di
28 ottobre 2021
- Nuovo modello di telefonia cinese di nuova generazione
-
Il servizio offre ora un modello di telefonia di nuova generazione per il cinese mandarino:
zh-CN_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione. - Nuovi modelli multimediali in inglese australiano e inglese britannico di nuova generazione
-
Il servizio offre ora i seguenti modelli multimediali di nuova generazione. I nuovi modelli sono generalmente disponibili e nessuno dei due supporta una bassa latenza.
- Inglese australiano:
en-AU_Multimedia - Inglese britannico:
en-GB_Multimedia
Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Inglese australiano:
- Aggiornamenti a più modelli di nuova generazione per il riconoscimento vocale migliorato
-
I seguenti modelli di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:
- Modello di telefonia inglese australiano (
en-AU_Telephony) - Modello di telefonia inglese britannico (
en-GB_Telephony) - Modello multimediale in inglese USA (
en-US_Multimedia) - Modello di telefonia inglese (
en-US_Telephony) - Modello di telefonia spagnola castigliana (
es-ES_Telephony)
Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
- Modello di telefonia inglese australiano (
- Il supporto grammaticale per i modelli di generazione precedente è ora generalmente disponibile
-
Il supporto grammaticale è ora generalmente disponibile (GA) per i modelli generali precedenti che soddisfano le condizioni seguenti:
- I modelli sono generalmente disponibili.
- I modelli supportano la personalizzazione del modello di lingua.
Per ulteriori informazioni, vedi i seguenti argomenti:
- Per ulteriori informazioni sullo stato del supporto grammaticale per i modelli di generazione precedente, vedi Supporto di personalizzazione per i modelli di generazione precedente.
- Per ulteriori informazioni sulle grammatiche, vedi Grammatiche.
- Nuovo supporto della grammatica beta per i modelli di nuova generazione
-
Il supporto grammaticale è ora disponibile come funzionalità beta per tutti i modelli di nuova generazione. Tutti i modelli di nuova generazione sono generalmente disponibili (GA) e supportano la personalizzazione del modello di lingua. Per ulteriori informazioni, vedi i seguenti argomenti:
- Per ulteriori informazioni sullo stato del supporto grammaticale per i modelli di nuova generazione, vedi Supporto di personalizzazione per i modelli di nuova generazione.
- Per ulteriori informazioni sulle grammatiche, vedi Grammatiche.
Nota: il supporto Beta per le grammatiche dai modelli di nuova generazione è disponibile solo per il servizio Speech to Text su IBM Cloud. Le grammatiche non sono ancora supportate per modelli di nuova generazione su IBM Cloud Pak for Data.
- Nuovo campo
custom_acoustic_modelper le funzioni supportate -
I metodi
GET /v1/modelseGET /v1/models/{model_id}ora segnalano se un modello supporta la personalizzazione del modello acustico. L'oggettoSupportedFeaturesora include un altro campo,custom_acoustic_model, un booleano che ètrueper il modello che supporta la personalizzazione del modello acustico efalsein caso contrario. Attualmente, il campo ètrueper tutti i modelli di generazione precedente efalseper tutti i modelli di nuova generazione.- Per ulteriori informazioni su questi metodi, consultare Elenco delle informazioni sui modelli.
- Per ulteriori informazioni sul supporto per la personalizzazione del modello acustico, vedi Supporto della lingua per la personalizzazione.
22 ottobre 2021
- Correzione del difetto: Risolvere i problemi di HTTP asincrono
- Correzione del difetto: L'interfaccia asincrona HTTP non riusciva a trascrivere alcuni audio. Inoltre, il callback per la richiesta ha restituito lo stato
recognitions.completed_with_resultsinvece direcognitions.failed. Questo errore è stato risolto.
6 ottobre 2021
- Aggiornamenti ai modelli di nuova generazione in ceco e olandese
-
I seguenti modelli di lingua di nuova generazione sono stati modificati come indicato:
- Il modello di telefonia ceco,
cs-CZ_Telephony, è ora generalmente disponibile (GA). Il modello continua a supportare la bassa latenza. - Il modello di telefonia olandese belga,
nl-BE_Telephony, è stato aggiornato per migliorare il riconoscimento vocale. Il modello continua a supportare la bassa latenza. - Il modello di telefonia olandese,
nl-NL_Telephony, è ora GA. Inoltre, il modello ora supporta la bassa latenza.
Per ulteriori informazioni su tutti i modelli di lingua di nuova generazione disponibili, vedi Modelli e lingue di nuova generazione.
- Il modello di telefonia ceco,
- Nuovo supporto HIPAA degli Stati Uniti per i piani Premium nella sede di Dallas
-
Il supporto HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti è ora disponibile per i piani Premium ospitati nell'ubicazione Dallas (
us-south). Per ulteriori informazioni, consultare la legge sulla portabilità e la responsabilità in materia di assicurazione sanitaria(HIPAA).
16 settembre 2021
- Nuovi modelli beta cechi e olandesi olandesi di prossima generazione
-
Il servizio ora supporta i nuovi modelli di lingua di nuova generazione. Entrambi i nuovi modelli sono funzionalità beta.
- Ceco:
cs-CZ_Telephony. Il nuovo modello supporta la bassa latenza. - Olandese olandese:
nl-NL_Telephony. Il nuovo modello non supporta la bassa latenza.
Per ulteriori informazioni su tutti i modelli di lingua di nuova generazione disponibili, vedi Modelli e lingue di nuova generazione.
- Ceco:
- Aggiornamenti ai modelli di nuova generazione in coreano e portoghese brasiliano
-
Sono stati aggiornati i seguenti modelli di nuova generazione:
- Il modello coreano
ko-KR_Telephonyora supporta la bassa latenza. - Il modello "
pt-BR_Telephony" in portoghese brasiliano è stato aggiornato per migliorare il riconoscimento vocale.
- Il modello coreano
- Correzione del difetto: correggere i risultati provvisori e la documentazione a bassa latenza
-
Fix Defect: la documentazione che descrive i risultati provvisori e le funzioni a bassa latenza con modelli di nuova generazione è stata riscritta per chiarezza e correttezza. Per ulteriori informazioni, vedi i seguenti argomenti:
- Correzione del difetto: migliorare i risultati delle etichette degli altoparlanti
-
Fix Defect: quando si utilizzano le etichette degli altoparlanti con i modelli di nuova generazione, il servizio ora identifica l'altoparlante per tutte le parole dell'audio di input, incluse le parole molto brevi che hanno la stessa data / ora di inizio e fine.
31 agosto 2021
- Tutti i modelli di nuova generazione sono ora generalmente disponibili
-
Tutti i modelli linguistici esistenti di nuova generazione sono ora generalmente disponibili (GA). Sono supportati per l'utilizzo in ambienti e applicazioni di produzione.
- Per ulteriori informazioni su tutti i modelli di lingua di nuova generazione disponibili, vedi Modelli e lingue di nuova generazione.
- Per ulteriori informazioni sulle funzioni supportate per ogni modello di nuova creazione, vedi Funzioni supportate per i modelli di nuova generazione.
- La personalizzazione del modello di lingua per modelli di nuova generazione è ora generalmente disponibile
-
La personalizzazione del modello di lingua è ora generalmente disponibile (GA) per tutti i modelli e le lingue di nuova generazione disponibili. La personalizzazione del modello di lingua per modelli di nuova generazione è supportata per l'utilizzo in ambienti e applicazioni di produzione.
Utilizza gli stessi comandi per creare, gestire e utilizzare i modelli di lingua personalizzati, i corpora e le parole personalizzate per i modelli di nuova generazione come fai per i modelli di generazione precedente. Ma la personalizzazione per i modelli di nuova generazione funziona in maniera diversa rispetto alla personalizzazione per modelli di generazione precedente. Per i modelli personalizzati basati su modelli di nuova generazione:
- I modelli personalizzati non hanno alcun concetto di parole OOV (out - of - vocabulary).
- Le parole dai corpora non sono aggiunte alla risorsa di parole.
- Attualmente non è possibile utilizzare la funzione di suono - simile per le parole personalizzate.
- Non hai bisogno di aggiornare i modelli personalizzati quando vengono aggiornati i modelli di lingua di base.
- Le grammatiche non sono attualmente supportate.
Per ulteriori informazioni sull'utilizzo della personalizzazione del modello di lingua per i modelli di nuova generazione, consultare
- Informazioni sulla personalizzazione
- Supporto delle lingue per la personalizzazione
- Creazione di un modello di lingua personalizzato
- Utilizzo di un modello di linguaggio personalizzato per il riconoscimento vocale
- Utilizzo di corpora e parole personalizzate per modelli di nuova generazione
Ulteriori argomenti descrivono la gestione di modelli di lingua, corpora e parole personalizzate. Queste operazioni sono le stesse per i modelli personalizzati basati su modelli di nuova generazione e precedenti.
16 agosto 2021
- Nuovi modelli beta Indiano inglese, indiano hindi, giapponese e coreano di nuova generazione
-
Il servizio ora supporta i nuovi modelli di lingua di nuova generazione. Tutti i nuovi modelli sono funzionalità beta.
- Inglese indiano:
en-IN_Telephony. Il modello supporta una latenza bassa. - Hindi indiano:
hi-IN_Telephony. Il modello supporta una latenza bassa. - Giapponese:
ja-JP_Multimedia. Il modello non supporta la bassa latenza. - Coreano:
ko-KR_Multimediaeko-KR_Telephony. I modelli non supportano la bassa latenza.
Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, vedi Lingue e modelli di nuova generazione e Bassa latenza.
- Inglese indiano:
16 luglio 2021
- Nuovo modello beta francese di nuova generazione
- Il modello di lingua francese di nuova generazione
fr-FR_Multimediaè ora disponibile. Il nuovo modello non supporta la bassa latenza. Il modello è una funzionalità beta. - Aggiornamenti al modello beta di nuova generazione in inglese americano per un migliore riconoscimento vocale
- Il modello
en-US_Telephonyin inglese americano di nuova generazione è stato aggiornato per migliorare il riconoscimento vocale. Il modello aggiornato continua ad essere una funzionalità beta. - Correzione difetto: aggiornare la documentazione per gli indicatori di esitazione
- Fix Defect: la documentazione non è riuscita ad affermare che i modelli di nuova generazione non producono indicatori di esitazione. La documentazione è stata aggiornata per tenere presente che solo i modelli di generazione precedente producono indicatori di esitazione. I modelli di prossima generazione includono le reali esitazioni nei risultati della trascrizione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.
15 giugno 2021
- Nuovo modello beta belga olandese di prossima generazione
-
È ora disponibile il modello di lingua belga olandese (fiammingo) di nuova generazione
nl-BE_Telephony. Il nuovo modello supporta la bassa latenza. Il modello è una funzionalità beta. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza. - Nuovo supporto beta a bassa latenza per i modelli di nuova generazione in arabo, francese canadese e italiano
-
I seguenti modelli di linguaggio beta di nuova generazione supportano ora la bassa latenza:
- Modello
ar-MS_Telephonyarabo - Modello
fr-CA_Telephonyfrancese canadese - Modello
it-IT_Telephonyitaliano
Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza.
- Modello
- Aggiornamenti ai modelli beta arabo e portoghese brasiliano di nuova generazione per un migliore riconoscimento vocale
-
I seguenti modelli linguistici di nuova generazione attualmente in versione beta sono stati aggiornati per migliorare il riconoscimento vocale:
- Modello
ar-MS_Telephonyarabo - Modello
pt-BR_Telephonyportoghese brasiliano
Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consulta Modelli e lingue di nuova generazione e Bassa latenza.
- Modello
26 maggio 2021
- Nuovo supporto beta per il parametro
audio_metricsper i modelli di nuova generazione - Il parametro
audio_metricsè ora supportato come funzionalità beta per l'utilizzo con tutti i linguaggi e modelli di nuova generazione. Per ulteriori informazioni, vedi Metriche audio. - Nuovo supporto beta per il parametro
word_confidenceper i modelli di nuova generazione - Il parametro
word_confidenceè ora supportato come funzionalità beta per l'utilizzo con tutti i linguaggi e modelli di nuova generazione. Per ulteriori informazioni, vedi Attendibilità delle parole. - Correzione difetto: aggiornare la documentazione per i modelli di nuova generazione
- Correzione dei difetti: la documentazione è stata aggiornata per correggere le seguenti informazioni:
- Quando utilizzi un modello di nuova generazione per il riconoscimento vocale, i risultati della trascrizione finale includono ora il campo
confidence. Il campo è sempre incluso nei risultati della trascrizione finale quando si utilizza un modello di generazione precedente. Questa correzione si riferisce a una limitazione riportata per la release del 12 aprile 2021 dei modelli di nuova generazione. - La documentazione ha dichiarato in modo non corretto che l'uso del parametro
smart_formattingfa sì che il servizio rimuova gli indicatori di esitazione dai risultati della trascrizione finale per il giapponese. La formattazione intelligente non rimuove gli indicatori di esitazione dai risultati finali per il giapponese, solo per l'inglese americano. Per ulteriori informazioni, consultare Quali risultati influiscono sulla formattazione intelligente?
- Quando utilizzi un modello di nuova generazione per il riconoscimento vocale, i risultati della trascrizione finale includono ora il campo
27 aprile 2021
- Nuovi modelli beta in arabo e portoghese brasiliano di nuova generazione
-
Il servizio supporta due nuovi modelli beta di nuova generazione:
- Il modello
pt-BR_Telephonyportoghese brasiliano, che supporta la bassa latenza. - Arabo (Standard moderno) Modello
ar-MS_Telephony, che non supporta la bassa latenza.
Per ulteriori informazioni, vedi Next-generation languages and models.
- Il modello
- Aggiornamenti al modello beta castigliano di nuova generazione per un migliore riconoscimento vocale
-
Il modello
es-ES_Telephonycastigliano di nuova generazione supporta ora il parametrolow_latency. Per ulteriori informazioni, vedi Bassa latenza. - Nuovo supporto beta per le etichette dei diffusori con modelli di nuova generazione
-
Il parametro
speaker_labelsè ora supportato come funzionalità beta per l'utilizzo con i seguenti modelli di nuova generazione:- Modello
en-AU_Telephonyinglese australiano - Modello
en-GB_Telephonyinglese britannico - Modelli
en-US_Multimediaeen-US_Telephonyin inglese USA - Modello
de-DE_Telephonytedesco - Modello
es-ES_Telephonyspagnolo castigliano
Con i modelli di generazione successiva, il parametro
speaker_labelsnon è supportato per l'utilizzo con i parametriinterim_resultsolow_latencyin questo momento. Per ulteriori informazioni, vedi Etichette del parlante. - Modello
- Nuovo codice di errore HTTP per l'utilizzo di
word_confidencecon i modelli di nuova generazione -
Il parametro
word_confidencenon può essere utilizzato con modelli di nuova generazione. Il servizio ora restituisce il seguente codice di errore 400 se utilizzi il parametroword_confidencecon un modello di nuova generazione per il riconoscimento vocale:{ "error": "word_confidence is not a supported feature for model {model}", "code": 400, "code_description": "Bad Request" }
12 aprile 2021
- Nuovi modelli di linguaggio beta di nuova generazione e parametri
low_latency -
Il servizio ora supporta un numero crescente di modelli di linguaggio di nuova generazione. I modelli multimediali e telefonia di nuova generazione migliorano le funzioni di riconoscimento vocale della precedente generazione di modelli a banda larga e a banda stretta del servizio. I nuovi modelli sfruttano le reti neurali profonde e l'analisi bidirezionale per ottenere una maggiore velocità effettiva e una maggiore precisione di trascrizione. In questo momento, i modelli di nuova generazione supportano solo un numero limitato di lingue e funzioni di riconoscimento vocale. Le lingue, i modelli e le funzioni supportati aumenteranno con le release future. I modelli di nuova generazione sono funzionalità beta.
Molti dei modelli di prossima generazione supportano anche un nuovo parametro
low_latencyche consente di richiedere risultati più rapidi a discapito di una qualità di trascrizione ridotta. Quando è abilitata la bassa latenza, il servizio riduce la sua analisi dell'audio, che può ridurre l'accuratezza della trascrizione. Questo trade-off potrebbe essere accettabile se la tua applicazione richiede un tempo di risposta più basso rispetto alla massima precisione accuracy.Thelow_latencyè una funzione beta.Il parametro
low_latencyinfluisce sull'uso del parametrointerim_resultscon l'interfaccia WebSocket. I risultati provvisori sono disponibili solo per i modelli di nuova generazione che supportano la bassa latenza e solo se i parametriinterim_resultselow_latencysono impostati sutrue.- Per ulteriori informazioni sui modelli di nuova generazione e sulle loro funzionalità, vedi Modelli e linguaggi di generazione precedente.
- Per ulteriori informazioni sul supporto lingua per i modelli di nuova generazione e sui modelli di nuova generazione che supportano la bassa latenza, vedi Modelli di lingua di nuova generazione supportati.
- Per ulteriori informazioni sul supporto delle funzioni per i modelli di nuova generazione, vedere Funzioni supportate per i modelli di nuova generazione.
- Per ulteriori informazioni relative al parametro
low_latency, consultare Bassa latenza.
17 marzo 2021
- Correzione di un difetto: Correzione della limitazione per l'interfaccia asincrona HTTP
- Correzione del difetto: È stata risolta la limitazione segnalata con l'interfaccia asincrona HTTP nella sede di Dallas (
us-south) il 16 dicembre 2020. In precedenza, una piccola percentuale di lavori stava entrando in loop infiniti che ne impedivano l'esecuzione. Le richieste asincrone di HTTP nel data center di Dallas non presentano più questa limitazione.
2 dicembre 2020
- Modello arabo ridenominato come
ar-MS_BroadbandModel - Il modello di banda larga in lingua araba è ora denominato
ar-MS_BroadbandModel. Il nome precedente,ar-AR_BroadbandModel, è obsoleto. Continuerà a funzionare per almeno un anno, ma potrebbe essere rimosso in una data futura. Si consiglia di migrare al nuovo nome appena possibile.
2 novembre 2020
- Modelli francesi canadesi ora disponibili in generale
-
I modelli francese canadese,
fr-CA_BroadbandModelefr-CA_NarrowbandModel, sono ora generalmente disponibili (GA). In precedenza erano beta. Ora supportano anche il modello di lingua e la personalizzazione del modello acustico.- Per ulteriori informazioni sulle lingue e i modelli supportati, vedi Lingue e modelli di generazione precedente.
- Per ulteriori informazioni sul supporto lingua per la personalizzazione, consultare Supporto lingua per la personalizzazione.
22 ottobre 2020
- I modelli in inglese australiano sono ora generalmente disponibili
-
I modelli in inglese australiano,
en-AU_BroadbandModeleen-AU_NarrowbandModel, sono ora generalmente disponibili (GA). In precedenza erano beta. Ora supportano anche il modello di lingua e la personalizzazione del modello acustico.- Per ulteriori informazioni sulle lingue e i modelli supportati, vedi Lingue e modelli di generazione precedente.
- Per ulteriori informazioni sul supporto lingua per la personalizzazione, consultare Supporto lingua per la personalizzazione.
- Aggiornamenti ai modelli di portoghese brasiliano per un migliore riconoscimento vocale
-
I modelli portoghese brasiliano,
pt-BR_BroadbandModelept-BR_NarrowbandModel, sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Il parametro
split_transcript_at_phrase_endè ora generalmente disponibile per tutte le lingue -
Il parametro di riconoscimento vocale
split_transcript_at_phrase_endè ora generalmente disponibile (GA) per tutte le lingue. In precedenza, era generalmente disponibile solo per l'inglese degli Stati Uniti e del Regno Unito. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.
7 ottobre 2020
- Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale
-
Il modello "
ja-JP_BroadbandModel" è stato aggiornato per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
30 settembre 2020
- Aggiornamenti ai piani dei prezzi per il servizio
-
I piani dei prezzi per il servizio sono stati modificati:
- Il servizio continua a offrire un piano Lite che fornisce l'accesso gratuito di base a minuti limitati di riconoscimento vocale al mese.
- Il servizio offre un nuovo piano Plus che fornisce un modello di prezzi a livelli semplice e l'accesso alle funzionalità di personalizzazione del servizio.
- Il servizio offre un nuovo piano Premium che fornisce una capacità significativamente maggiore e funzionalità avanzate.
Il piano Plus sostituisce il piano Standard. Il piano Standard continua ad essere disponibile per l'acquisto per un breve periodo. Inoltre, continua ad essere disponibile a tempo indeterminato per gli utenti esistenti del piano, senza alcuna modifica dei loro prezzi. Gli utenti esistenti possono eseguire l'upgrade al piano Plus in qualsiasi momento.
Per ulteriori informazioni sui piani tariffari disponibili, consulta le seguenti risorse:
- Per informazioni generali sui piani dei prezzi e sulle risposte a domande comuni, vedi le FAQ sui prezzi.
- Per ulteriori informazioni sui piani dei prezzi o per acquistare un piano, vedi il servizio Speech to Text in IBM Cloud® Catalogo.
20 agosto 2020
- Nuovi modelli francesi canadesi
-
Il servizio ora offre modelli a banda larga e stretta beta per il francese canadese:
fr-CA_BroadbandModelfr-CA_NarrowbandModel
I nuovi modelli non supportano la personalizzazione dei modelli di lingua o acustici, le etichette del parlante o la formattazione intelligente. Per ulteriori informazioni su questi e su tutti i modelli supportati, consulta la sezione " Modelli linguistici di generazione precedente supportati ".
5 agosto 2020
- Nuovi modelli di inglese australiano
-
Il servizio ora offre modelli a banda larga e stretta beta per l'inglese australiano:
en-AU_BroadbandModelen-AU_NarrowbandModel
I nuovi modelli non supportano la personalizzazione dei modelli di lingua o acustici o la formattazione intelligente. I nuovi modelli supportano le etichette del parlante. Per ulteriori informazioni, vedi
- Aggiornamenti a più modelli per un migliore riconoscimento vocale
-
I seguenti modelli sono stati aggiornati per un migliore riconoscimento vocale:
- Modello francese a banda larga (
fr-FR_BroadbandModel) - Modelli a banda larga in Germania (
de-DE_BroadbandModel) e a banda stretta (de-DE_NarrowbandModel) - Modelli a banda larga inglese britannico (
en-GB_BroadbandModel) e a banda stretta (en-GB_NarrowbandModel) - Modello a banda stretta in lingua inglese (
en-US_ShortForm_NarrowbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello francese a banda larga (
- Indicatore di esitazione per il tedesco cambiato
-
Il marcatore di esitazione utilizzato nei modelli tedeschi aggiornati a banda larga e a banda stretta è cambiato da
[hesitation]a%HESITATION. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.
4 giungo 2020
- Correzione dei difetti: migliorare la latenza per i modelli di lingua personalizzati con molte grammatiche
- Correzione del difetto: il problema di latenza per i modelli di lingua personalizzati che contengono un numero elevato di grammatiche è stato risolto. Quando venivano inizialmente utilizzati per il riconoscimento vocale, il caricamento di tali modelli personalizzati poteva richiedere diversi secondi. I modelli personalizzati ora si caricano molto più velocemente, riducendo notevolmente la latenza quando vengono utilizzati per il riconoscimento.
28 aprile 2020
- Aggiornamenti ai modelli italiani per un migliore riconoscimento vocale
-
I modelli a banda larga (
it-IT_BroadbandModel) e a banda stretta (it-IT_NarrowbandModel) per l'italiano sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modelli olandesi e italiani ora disponibili in generale
-
I modelli di lingua per l'olandese e l'italiano sono ora generalmente disponibili (GA) per il riconoscimento vocale e per la personalizzazione dei modelli di lingua e acustico.
- Modello a banda larga per l'olandese (
nl-NL_BroadbandModel) - Modello a banda stretta per l'olandese (
nl-NL_NarrowbandModel) - Modello a banda larga per l'italiano (
it-IT_BroadbandModel) - Modello a banda stretta per l'italiano (
it-IT_NarrowbandModel)
Per ulteriori informazioni sui modelli di lingua disponibili, vedi
- Modello a banda larga per l'olandese (
1 aprile 2020
- La personalizzazione del modello acustico è ora generalmente disponibile
-
La personalizzazione del modello acustico è ora generalmente disponibile (GA) per tutte le lingue supportate. Come con i modelli di lingua personalizzati, IBM non addebita alcun costo per la creazione o l'hosting di un modello acustico personalizzato. Ti vengono addebitati dei costi solo per l'utilizzo di un modello personalizzato con una richiesta di riconoscimento vocale.
L'utilizzo di un modello di lingua personalizzato, di un modello acustico personalizzato o di entrambi i tipi per la trascrizione comporta un addebito aggiuntivo di $0,03 (USD) al minuto. Questo addebito è in aggiunta al costo di utilizzo standard di $0,02 (USD) al minuto e si applica a tutte le lingue supportate dall'interfaccia di personalizzazione. Quindi il costo totale per l'utilizzo di uno o più modelli personalizzati per il riconoscimento vocale è di $ 0,05 (USD) al minuto.
- Per ulteriori informazioni sul supporto di singoli modelli di lingua, vedi Supporto delle lingue per la personalizzazione.
- Per ulteriori informazioni sui prezzi, vedi la pagina dei prezzi per il servizio Speech to Text o le FAQ sui prezzi.
16 marzo 2020
- Le etichette degli altoparlanti sono ora supportate per il tedesco e il coreano
- Il servizio ora supporta le etichette del parlante (il parametro
speaker_labels) per i modelli di lingua in tedesco e coreano. Le etichette del parlante identificano gli individui e le parole da essi espresse in uno scambio tra più partecipanti. Per ulteriori informazioni, vedi Etichette del parlante. - Activity Tracker ora supportato per l'interfaccia asincrona HTTP
- Il servizio ora supporta l'uso di eventi Activity Tracker per tutte le operazioni dell'interfaccia asincrona HTTP. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud®. Per ulteriori informazioni, vedi Eventi Activity Tracker.
24 febbraio 2020
- Aggiornamenti a più modelli per un migliore riconoscimento vocale
-
I seguenti modelli sono stati aggiornati per un migliore riconoscimento vocale:
- Modello a banda larga per l'olandese (
nl-NL_BroadbandModel) - Modello a banda stretta per l'olandese (
nl-NL_NarrowbandModel) - Modello a banda larga per l'italiano (
it-IT_BroadbandModel) - Modello a banda stretta per l'italiano (
it-IT_NarrowbandModel) - Modello a banda stretta per il giapponese (
ja-JP_NarrowbandModel) - Modello a banda larga per l'inglese (Stati Uniti) (
en-US_BroadbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda larga per l'olandese (
- La personalizzazione del modello linguistico è ora disponibile per l'olandese e l'italiano
-
La personalizzazione dei modelli linguistici è ora supportata per l'olandese e l'italiano con le nuove versioni dei seguenti modelli:
- Modello a banda larga per l'olandese (
nl-NL_BroadbandModel) - Modello a banda stretta per l'olandese (
nl-NL_NarrowbandModel) - Modello a banda larga per l'italiano (
it-IT_BroadbandModel) - Modello a banda stretta per l'italiano (
it-IT_NarrowbandModel)
Per ulteriori informazioni, vedi
- Analisi di olandese, inglese, francese, tedesco, italiano, portoghese e spagnolo
- Linee guida per olandese, francese, tedesco, italiano, portoghese e spagnolo
Poiché i modelli per l'olandese e l'italiano sono nella beta, anche il loro supporto per la personalizzazione del modello di lingua è in beta.
- Modello a banda larga per l'olandese (
- Il modello giapponese a banda stretta ora include alcune unità di parole multigrammo
-
Il modello a banda stretta per il giapponese (
ja-JP_NarrowbandModel) ora include alcune unità di parole multigrammaticali per cifre e frazioni decimali. Il servizio restituisce queste unità multigrammaticali indipendentemente dal fatto che hai abilitato la formattazione intelligente. La funzione di formattazione intelligente comprende e restituisce le unità multigrammaticali generate dal modello. Se applichi la tua post-elaborazione ai risultati della trascrizione, devi gestire queste unità in modo appropriato. Per ulteriori informazioni, vedi Giapponese nella documentazione della formattazione intelligente. - Nuovi parametri di rilevamento dell'attività vocale e di soppressione audio in background per il riconoscimento vocale
-
Il servizio ora offre due nuovi parametri facoltativi per controllare il livello di rilevamento dell'attività vocale. I parametri possono aiutarti a garantire che viene elaborato solo l'audio pertinente al riconoscimento vocale.
- Il parametro
speech_detector_sensitivityregola la sensibilità del rilevamento dell'attività vocale. Puoi utilizzare il parametro per eliminare gli inserimenti di parole da file audio musicali, colpi di tosse e altri eventi non vocali. - Il parametro
background_audio_suppressionelimina l'audio di sottofondo in base al suo volume per evitare che venga trascritto o interferisca in qualche modo con il riconoscimento vocale. Puoi utilizzare il parametro per eliminare conversazioni marginali o rumore di sottofondo.
Puoi utilizzare i parametri individualmente o insieme. Sono disponibili per tutte le interfacce e per la maggior parte dei modelli di lingua. Per ulteriori informazioni sui parametri, i loro valori consentiti e il loro effetto sulla qualità e la latenza del riconoscimento vocale, vedi Rilevamento dell'attività vocale.
- Il parametro
- Activity Tracker ora supportato per le interfacce di personalizzazione
-
Il servizio ora supporta l'utilizzo di eventi Activity Tracker per tutte le operazioni di personalizzazione. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud. Puoi utilizzare questo servizio per indagare su attività anomale e azioni critiche e per rispettare i requisiti di controllo normativi. Inoltre, puoi essere avvertito in merito alle azioni non appena si verificano. Per ulteriori informazioni, vedi Eventi Activity Tracker.
- Correzione del difetto: correggere la creazione delle metriche di elaborazione con interfaccia WebSocket
-
Correzione di un bug: l'interfaccia WebSocket ora funziona correttamente durante la generazione delle metriche di elaborazione. In precedenza, le metriche di elaborazione potevano continuare ad essere distribuite dopo che il client aveva inviato un messaggio
stopal servizio.
18 dicembre 2019
- Nuovi modelli beta italiani disponibili
-
Il servizio ora offre modelli a banda larga e stretta beta per la lingua italiana:
it-IT_BroadbandModelit-IT_NarrowbandModel
Questi modelli di lingua supportano la personalizzazione del modello acustico. Non supportano la personalizzazione del modello di lingua. Poiché sono beta, questi modelli potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
Per ulteriori informazioni, vedi le seguenti sezioni:
- Nuovo parametro
end_of_phrase_silence_timeper il riconoscimento vocale -
Per il riconoscimento vocale, il servizio ora supporta il parametro
end_of_phrase_silence_time. Il parametro specifica la durata dell'intervallo di pausa dopo di cui il servizio suddivide una trascrizione in più risultati finali. Ogni risultato finale indica una pausa o un silenzio esteso che supera l'intervallo di pausa. Per la maggior parte delle lingue, l'intervallo di pausa predefinito è 0,8 secondi; per il cinese è 0,6 secondi.Puoi utilizzare il parametro per trovare un compromesso tra quanto spesso viene prodotto un risultato finale e l'accuratezza della trascrizione. Aumenta l'intervallo quando l'accuratezza è più importante della latenza. Diminuisci l'intervallo quando prevedi che il parlante pronunci frasi brevi o singole parole.
Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.
- Nuovo parametro
split_transcript_at_phrase_endper il riconoscimento vocale -
Per il riconoscimento vocale, il servizio ora supporta il parametro
split_transcript_at_phrase_end. Il parametro indica al servizio di suddividere la trascrizione in più risultati finali in base alle funzioni di semantica dell'input, come ad esempio alla conclusione di periodi. Il servizio basa la sua comprensione delle funzioni semantiche sul modello di lingua di base che utilizzi con una richiesta. I modelli di lingua personalizzati e le grammatiche possono influenzare anche come e in quale punto il servizio suddivide una trascrizione.Il parametro comporta che il servizio aggiunga un campo
end_of_utterancead ogni risultato finale per indicare il motivo della suddivisione:full_stop,silence,end_of_dataoreset.Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.
12 dicembre 2019
- Supporto completo per l'IAM di IBM Cloud
-
Il servizio Speech to Text ora supporta l'implementazione completa di IBM Cloud Identity and Access Management (IAM). Le chiavi API per i servizi IBM Watson® non sono più limitate a una singola istanza del servizio. Puoi creare politiche di accesso e chiavi API che vengono applicate a più di un servizio e puoi concedere l'accesso tra i servizi. Per ulteriori informazioni su IAM, vedi Autenticazione ai servizi Watson.
Per supportare questa modifica, gli endpoint del servizio API utilizzano un dominio diverso e includono l'ID istanza del servizio. Il modello è
api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}.- URL HTTP di esempio per un'istanza ospitata nell'ubicazione Dallas:
https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2- URL WebSocket di esempio per un'istanza ospitata nell'ubicazione Dallas:
wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2Per ulteriori informazioni sugli URL, consultare la guida di riferimento API e SDK.
Questi URL non costituiscono una modifica importante. I nuovi URL funzionano sulle tue istanze del servizio esistenti o nuove. Gli URL originali continuano a funzionare sulle tue istanze del servizio esistenti per almeno un anno, fino a dicembre 2020.
- Sono disponibili nuove funzionalità di sicurezza della rete e dei dati
-
È ora disponibile il supporto per la seguente nuova funzione di sicurezza della rete e dei dati:
-
Supporto per gli endpoint di rete privati
Gli utenti dei piani Premium possono creare endpoint di rete privati per connettersi al servizio Speech to Text tramite una rete privata. Le connessioni agli endpoint di rete privata non richiedono l'accesso alla rete internet pubblica. Per ulteriori informazioni, vedi Endpoint di rete pubblici e privati.
-
10 dicembre 2019
- Nuovi modelli beta olandesi disponibili
-
Il servizio offre ora modelli beta a banda larga e a banda stretta per i Paesi Bassi in lingua olandese:
nl-NL_BroadbandModelnl-NL_NarrowbandModel
Questi modelli di lingua supportano la personalizzazione del modello acustico. Non supportano la personalizzazione del modello di lingua. Poiché sono beta, questi modelli potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
Per ulteriori informazioni, vedi le seguenti sezioni:
25 novembre 2019
- Aggiornamenti alle etichette degli altoparlanti per una migliore identificazione dei singoli altoparlanti
- Le etichette del parlante sono state aggiornate per migliorare l'identificazione di singoli parlanti per ulteriori analisi del tuo campione audio. Per ulteriori informazioni sulla funzione di etichette del parlante, vedi Etichette del parlante. Per ulteriori informazioni sui miglioramenti apportati a questa funzionalità, consultare l’articolo “IBM Research AI Advances Speaker Diarization in Real Use Cases ”.
12 novembre 2019
- Nuova sede di Seul ora disponibile
- Il servizio " Speech to Text " è ora disponibile nella sede di Seul ( kr-seo ) di IBM Cloud. Come per le altre ubicazioni, l'ubicazione IBM Cloud utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.
1 novembre 2019
- Nuovi limiti sul numero massimo di modelli personalizzati
- Non puoi creare più di 1024 modelli di lingua personalizzati e non più di 1024 modelli acustici personalizzati per credenziali di gestione. Per ulteriori informazioni, vedi Numero massimo di modelli personalizzati.
1 ottobre 2019
- Nuovo supporto HIPAA degli Stati Uniti per i piani Premium a Washington, DC, sede
- Il supporto HIPAA per gli Stati Uniti è disponibile per i piani Premium ospitati nella sede di Washington, DC ( us-east ) e creati a partire dal 1° aprile 2019. Per ulteriori informazioni, vedi HIPAA (Health Insurance Portability and Accountability Act).
22 agosto 2019
- Correzione dei difetti: diversi piccoli miglioramenti
- Il servizio è stato aggiornato con piccole correzioni e miglioramenti.
30 luglio 2019
- Nuovi modelli per dialetti spagnoli ora disponibili
-
Il servizio ora offre dei modelli di lingua a banda larga e a banda stretta in sei dialetti spagnoli:
- Spagnolo argentino (
es-AR_BroadbandModelees-AR_NarrowbandModel) - Spagnolo castigliano (
es-ES_BroadbandModelees-ES_NarrowbandModel) - Spagnolo cileno (
es-CL_BroadbandModelees-CL_NarrowbandModel) - Spagnolo colombiano (
es-CO_BroadbandModelees-CO_NarrowbandModel) - Spagnolo messicano (
es-MX_BroadbandModelees-MX_NarrowbandModel) - Spagnolo peruviano (
es-PE_BroadbandModelees-PE_NarrowbandModel)
I modelli per lo spagnolo castigliano non sono nuovi. Sono disponibili in versione generale (GA) per il riconoscimento vocale e la personalizzazione dei modelli linguistici, mentre sono in versione beta per la personalizzazione dei modelli acustici.
Gli altri cinque dialetti sono nuovi e sono beta per tutti gli usi. Poiché sono beta, questi dialetti aggiuntivi potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
Per ulteriori informazioni, vedi le seguenti sezioni:
- Spagnolo argentino (
24 giugno 2019
- Aggiornamenti ai modelli portoghese brasiliano e inglese americano per un migliore riconoscimento vocale
-
I seguenti modelli a banda stretta sono stati aggiornati per un migliore riconoscimento vocale:
- Modello a banda stretta per il portoghese (Brasile) (
pt-BR_NarrowbandModel) - Modello a banda stretta per l'inglese (Stati Uniti) (
en-US_NarrowbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda stretta per il portoghese (Brasile) (
- Nuovo supporto per richieste simultanee per aggiornare diversi modelli acustici personalizzati
-
Il servizio ora ti consente di inoltrare più richieste simultanee per aggiungere risorse audio diverse a un modello acustico personalizzato. In precedenza, il servizio consentiva solo una richiesta alla volta per aggiungere l'audio a un modello personalizzato.
- Nuovo campo
updatedper i metodi che elencano i modelli personalizzati -
L'output dei metodi
GETHTTP che elencano le informazioni sui modelli di lingua e acustici personalizzati include ora un campoupdated. Il campo indica la data e l'ora in formato UTC (Coordinated Universal Time) in cui è stata apportata l'ultima modifica al modello personalizzato. - Modifica allo schema per le avvertenze associate alla formazione del modello personalizzato
-
Lo schema è stato modificato per un'avvertenza generata dalla richiesta di addestramento di un modello personalizzato quando il parametro
strictè impostato sufalse. I nomi dei campi sono stati modificati rispettivamente dawarning_idedescriptionincodeemessage. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
10 giugno 2019
- Metriche di elaborazione non disponibili con l'interfaccia sincrona HTTP
- Le metriche di elaborazione sono disponibili solo con le interfacce " WebSocket " e " HTTP " asincrona. Non sono supportate con l'interfaccia HTTP sincrona. Per ulteriori informazioni, vedi Metriche di elaborazione.
17 maggio 2019
- Nuove metriche di elaborazione e funzioni di metriche audio per il riconoscimento vocale
-
Il servizio ora offre due tipi di metriche facoltative con le richieste di riconoscimento vocale:
- Le metriche di elaborazione forniscono informazioni temporali dettagliate sull'analisi dell'audio di input da parte del servizio. Il servizio restituisce le metriche a intervalli specifici e con eventi di trascrizione, come i risultati provvisori e finali. Utilizza le metriche per valutare l'avanzamento del servizio nella trascrizione dell'audio.
- Le metriche audio forniscono informazioni dettagliate sulle caratteristiche di segnale dell'audio di input. I risultati forniscono metriche aggregate per l'intero audio di input al termine dell'elaborazione vocale. Utilizza le metriche per determinare le caratteristiche e la qualità dell'audio.
Puoi richiedere entrambi i tipi di metriche con qualsiasi richiesta di riconoscimento vocale. Per impostazione predefinita, il servizio non restituisce alcuna metrica per una richiesta.
- Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale
-
Il modello a banda larga per il giapponese (
ja-JP_BroadbandModel) è stato aggiornato per un migliore riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Se hai dei modelli di lingua o acustici personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
10 maggio 2019
- Aggiornamenti ai modelli di spagnolo per un migliore riconoscimento vocale
-
I modelli di lingua per lo spagnolo sono stati aggiornati per un migliore riconoscimento vocale:
es-ES_BroadbandModeles-ES_NarrowbandModel
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
19 aprile 2019
- Nuovo parametro
strictper l'addestramento del modello personalizzato ora disponibile - I metodi di addestramento dell'interfaccia di personalizzazione includono ora un parametro di query
strictche indica se l'addestramento deve continuare se un modello personalizzato contiene una combinazione di risorse valide e non valide. Per impostazione predefinita, l'addestramento non riesce se un modello personalizzato contiene una o più risorse non valide. Imposta il parametro sufalseper consentire all'addestramento di continuare finché il modello contiene almeno una risorsa valida. Il servizio esclude le risorse non valide dall'addestramento.- Per ulteriori informazioni sull'utilizzo del parametro
strictcon il metodoPOST /v1/customizations/{customization_id}/train, vedi Addestra il modello di lingua personalizzato ed Errori di addestramento. - Per ulteriori informazioni sull'utilizzo del parametro
strictcon il metodoPOST /v1/acoustic_customizations/{customization_id}/train, vedi Addestra il modello acustico personalizzato ed Errori di addestramento.
- Per ulteriori informazioni sull'utilizzo del parametro
- Nuovi limiti sul massimo numero di parole fuori dal vocabolario per modelli di lingua personalizzati
- Puoi ora aggiungere un massimo di 90.000 parole OOV (out-of-vocabulary) alla risorsa di parole di un modello di lingua personalizzato. Il valore massimo precedente era di 30.000 parole OOV. Questa figura include parole OOV da tutte le origini (corpora, grammatiche e singole parole personalizzate che aggiungi direttamente). Puoi aggiungere un massimo di 10 milioni di parole in totale a un modello personalizzato da tutte le origini. Per ulteriori informazioni, vedi Di quanti dati ho bisogno?.
3 aprile 2019
- Nuovi limiti alla quantità massima di audio per i modelli acustici personalizzati
- I modelli acustici personalizzati accettano ora un massimo di 200 ore di audio. Il limite massimo precedente era di 100 ore di audio.
21 marzo 2019
- Visibilità delle credenziali del servizio ora limitata dal ruolo
-
Gli utenti possono ora visualizzare solo le informazioni sulle credenziali del servizio associate al ruolo che è stato assegnato al loro account IBM Cloud. Ad esempio, se ti viene assegnato un ruolo
reader, qualsiasi livellowritero superiore delle credenziali del servizio non sarà più visibile.Questa modifica non influisce sull'accesso API per gli utenti o le applicazioni con credenziali del servizio esistenti. La modifica influisce solo sulla visualizzazione delle credenziali all'interno di IBM Cloud.
15 marzo 2019
- Nuovo supporto per il formato audio A - law
- Il servizio ora supporta l'audio nel formato A-law (
audio/alaw). Per ulteriori informazioni, vedi Formato audio/alaw.
11 marzo 2019
- Passare al valore del parametro
0permax_alternatives - Per il parametro
max_alternatives, il servizio accetta nuovamente il valore0``. Se si specifica0. il servizio utilizza automaticamente il valore predefinito,1. Una modifica apportata durante l'aggiornamento del servizio del 4 marzo ha comportato che il valore0restituisca un errore. (Il servizio restituisce un errore se specifichi un valore negativo.) - Passare al valore del parametro
0perword_alternatives_threshold - Per il parametro
word_alternatives_threshold, il servizio accetta ancora un valore di0. Una modifica apportata durante l'aggiornamento del servizio del 4 marzo ha comportato che il valore0restituisca un errore. (Il servizio restituisce un errore se specifichi un valore negativo.) - Nuovo limite di precisione massima per i punteggi di confidenza
- Il servizio ora restituisce tutti i punteggi di attendibilità con una precisione massima di due posizioni decimali. Questa modifica include i punteggi di attendibilità per trascrizioni, attendibilità delle parole, alternative alle parole, risultati di parole chiave ed etichette del parlante.
4 marzo 2019
- Aggiornamenti ai modelli a banda stretta in portoghese, francese e spagnolo per un migliore riconoscimento vocale
-
I seguenti modelli di lingua a banda stretta sono stati aggiornati per un migliore riconoscimento vocale:
- Modello a banda stretta per il portoghese (Brasile) (
pt-BR_NarrowbandModel) - Modello francese (
fr-FR_NarrowbandModel) - Modello a banda stretta spagnolo (
es-ES_NarrowbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda stretta per il portoghese (Brasile) (
28 gennaio 2019
- Nuovo supporto per l'interfaccia IBM Cloud IAM by WebSocket
-
Ora l'interfaccia WebSocket supporta l'autenticazione IAM (Identity and Access Management) basata sul token dal codice JavaScript basato sul browser. La limitazione al contrario è stata rimossa. Per stabilire una connessione autenticata con il metodo WebSocket
/v1/recognize:- Se utilizzi l'autenticazione IAM, includi il parametro di query
access_token. - Se utilizzi le credenziali del servizio Cloud Foundry, includi il parametro di query
watson-token.
Per ulteriori informazioni, vedi Apri una connessione.
- Se utilizzi l'autenticazione IAM, includi il parametro di query
20 dicembre 2018
- Nuova funzione di grammatiche beta per i modelli di lingua personalizzati ora disponibile
-
Il servizio ora supporta le grammatiche per il riconoscimento vocale. Le grammatiche sono disponibili come una funzionalità beta per tutte le lingue che supportano la personalizzazione del modello di lingua. Puoi aggiungere le grammatiche a un modello di lingua personalizzato e utilizzarle per limitare la serie di frasi che il servizio può riconoscere dall'audio. Puoi definire una grammatica in ABNF (Augmented Backus-Naur Form) o nel formato XML.
I seguenti quattro metodi sono disponibili per utilizzare le grammatiche:
POST /v1/customizations/{customization_id}/grammars/{grammar_name}aggiunge un file di grammatica a un modello di lingua personalizzato.GET /v1/customizations/{customization_id}/grammarselenca le informazioni su tutte le grammatiche per un modello personalizzato.GET /v1/customizations/{customization_id}/grammars/{grammar_name}restituisce le informazioni su una grammatica specifica per un modello personalizzato.DELETE /v1/customizations/{customization_id}/grammars/{grammar_name}rimuove una grammatica esistente da un modello personalizzato.
Puoi utilizzare una grammatica per il riconoscimento vocale con le interfacce WebSocket e HTTP. Utilizza i parametri
language_customization_idegrammar_nameper identificare il modello personalizzato e la grammatica che vuoi utilizzare. Al momento, puoi utilizzare una sola grammatica con una richiesta di riconoscimento vocale.Per ulteriori informazioni sulle grammatiche, vedi la seguente documentazione:
- Utilizzo di grammatiche con i modelli di lingua personalizzati
- Informazioni sulle grammatiche
- Aggiunta di una grammatica a un modello di lingua personalizzato
- Utilizzo di una grammatica per il riconoscimento vocale
- Gestione delle grammatiche
- Grammatiche di esempio
Per informazioni su tutti i metodi dell'interfaccia, consultare la guida di riferimento API e SDK.
- È ora disponibile una nuova funzione di redazione numerica per l'inglese americano, il giapponese e il coreano
-
È ora disponibile una nuova funzione di oscuramento numerico per mascherare i numeri che hanno tre o più cifre consecutive. L'oscuramento ha lo scopo di rimuovere le informazioni personali sensibili, come i numeri delle carte di credito, dalle trascrizioni. Abilita la funzione impostando il parametro
redactionsutruein una richiesta di riconoscimento. La funzione è una funzionalità beta disponibile solo per inglese americano, giapponese e coreano. Per ulteriori informazioni, vedi Oscuramento numerico. - Nuovi modelli francesi e tedeschi a banda stretta ora disponibili
-
I seguenti nuovi modelli di lingua in tedesco e francese sono disponibili con il servizio:
- Modello a banda stretta francese (
fr-FR_NarrowbandModel) - Modello a banda stretta tedesco (
de-DE_NarrowbandModel)
Entrambi i nuovi modelli supportano la personalizzazione del modello di lingua (GA) e la personalizzazione del modello acustico (beta). Per ulteriori informazioni, vedi Supporto delle lingue per la personalizzazione.
- Modello a banda stretta francese (
- Nuovo inglese americano
en-US_ShortForm_NarrowbandModelora disponibile -
Un nuovo modello di lingua in inglese americano,
en-US_ShortForm_NarrowbandModel, è ora disponibile. Il nuovo modello è destinato all'uso nelle soluzioni IVR (interactive voice response) e di supporto clienti automatizzato. Il modello supporta la personalizzazione del modello di lingua (GA) e la personalizzazione del modello acustico (beta). Per ulteriori informazioni, vedi Il modello di formato breve dell'inglese (Stati Uniti). - Aggiornamenti ai modelli a banda stretta inglese e spagnolo del Regno Unito per un migliore riconoscimento vocale
-
I seguenti modelli di lingua sono stati aggiornati per un migliore riconoscimento vocale:
- Modello a banda stretta inglese britannico (
en-GB_NarrowbandModel) - Modello a banda stretta spagnolo (
es-ES_NarrowbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda stretta inglese britannico (
- Nuovo supporto per G.279 formato audio
-
Il servizio ora supporta l'audio nel formato G.729 (
audio/g729). Il servizio supporta solo G.729 Annex D per l'audio a banda stretta. Per ulteriori informazioni, vedi il formato audio/g729. - Le etichette dei diffusori sono ora disponibili per il modello inglese a banda stretta
-
La funzione delle etichette degli altoparlanti è ora disponibile per il modello a banda stretta per l'inglese britannico (
en-GB_NarrowbandModel). La funzione è la funzionalità beta per tutte le lingue supportate. Per ulteriori informazioni, vedi Etichette del parlante. - Nuovi limiti alla quantità massima di audio per i modelli acustici personalizzati
-
La quantità massima di audio che puoi aggiungere a un modello acustico personalizzato è stata aumentata da 50 a 100 ore.
13 dicembre 2018
- Nuova sede di Londra ora disponibile
- Il servizio Speech to Text è ora disponibile nell'ubicazione Londra di IBM Cloud (eu-gb). Come tutte le altre ubicazioni, Londra utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.
12 novembre 2018
- Nuovo supporto per la formattazione intelligente per il riconoscimento vocale giapponese
- Il servizio ora supporta la formattazione intelligente per il riconoscimento vocale per il giapponese. In precedenza, il servizio supportava la formattazione intelligente solo per spagnolo e inglese americano. La funzione è una funzionalità beta per tutti i linguaggi supportati. Per ulteriori informazioni, vedi Formattazione intelligente.
7 novembre 2018
- Nuova sede di Tokyo ora disponibile
- Il servizio Speech to Text è ora disponibile nell'ubicazione Tokyo di IBM Cloud (jp-tok). Come tutte le altre ubicazioni, Tokyo utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze del servizio che crei in questa ubicazione utilizzano l'autenticazione IAM.
30 ottobre 2018
- Nuovo supporto per IBM Cloud IAM basato su token
-
Il servizio Speech to Text ha eseguito la migrazione all'autenticazione IAM basata sui token per tutte le ubicazioni. Tutti i servizi IBM Cloud utilizzano ora l'autenticazione IAM. Il servizio Speech to Text è stato migrato in ogni ubicazione nelle seguenti date:
- Dallas (us-south): 30 ottobre 2018
- Francoforte (eu-de): 30 ottobre 2018
- Washington, DC (us-east): 12 giugno 2018
- Sydney (au-syd): 15 maggio 2018
La migrazione all'autenticazione IAM riguarda sia le nuove istanze che quelle esistenti indifferentemente:
- Tutte le nuove istanze del servizio che crei in ogni ubicazione utilizzano ora l'autenticazione IAM per accedere al servizio. Puoi passare un token di connessione o una chiave API: i token supportano le richieste autenticate senza credenziali del servizio incorporate in ogni chiamata; le chiavi API utilizzano l'autenticazione di base HTTP. Quando utilizzi uno degli SDK Watson, puoi passare la chiave API e lasciare che l'SDK gestisca il ciclo di vita dei token.
- Le istanze del servizio esistenti che hai creato in un'ubicazione prima della data di migrazione indicata continuano ad utilizzare
{username}e{password}dalle loro precedenti credenziali del servizio Cloud Foundry per l'autenticazione finché non le migri in modo che utilizzino l'autenticazione IAM.
Per ulteriori informazioni, consulta la seguente documentazione:
- Per scoprire quale meccanismo di autenticazione utilizza l'istanza del tuo servizio, visualizza le credenziali del servizio facendo clic sull'istanza nella dashboard di IBM Cloud.
- Per ulteriori informazioni sull'utilizzo dei token IAM con i servizi Watson, consultare la sezione " Autenticazione ai servizi Watson ".
- Per esempi che utilizzano l'autenticazione IAM, consultare la guida di riferimento alle API e agli SDK.
9 ottobre 2018
- Aggiornamenti importanti ai prezzi per le richieste di riconoscimento vocale
-
A partire dal 1° ottobre 2018, ti verrà addebitato il costo di tutti i file audio che invii al servizio per il riconoscimento vocale. I primi mille minuti di audio che invii ogni mese non sono più gratuiti. Per ulteriori informazioni sui piani tariffari del servizio, consultare la voce “ Speech to Text ” nel catalogo “ IBM Cloud ”.
- L'intestazione "
Content-Type" è ora facoltativa per la maggior parte delle richieste di riconoscimento vocale -
L'intestazione
Content-Typeè ora facoltativa per la maggior parte delle richieste di riconoscimento vocale. Il servizio ora rileva automaticamente il formato audio (tipo MIME) della maggior parte dei tipi di audio. Devi continuare a specificare il tipo di contenuto per i seguenti formati:audio/basicaudio/l16audio/mulaw
Dove indicato, il tipo di contenuto che specifichi per questi formati deve includere la frequenza di campionamento e può facoltativamente includere il numero di canali e endian dell'audio. Per tutti gli altri formati audio, puoi omettere il tipo di contenuto o specificarne uno del tipo
application/octet-streamin modo che il servizio rilevi automaticamente il formato.Quando utilizzi il comando
curlper effettuare una richiesta di riconoscimento vocale con l'interfaccia HTTP, devi specificare il formato audio con l'intestazioneContent-Typee specificare"Content-Type: application/octet-stream"o"Content-Type:". Se ometti completamente l'intestazione,curlutilizza il valore predefinitoapplication/x-www-form-urlencoded. La maggior parte degli esempi in questa documentazione continua a specificare il formato per le richieste di riconoscimento vocale indipendentemente dal fatto che sia necessario.Questa modifica si applica ai seguenti metodi:
/v1/recognizeper le richieste WebSocket. Il campocontent-typedel messaggio di testo che invii per avviare una richiesta su una connessione WebSocket aperta è ora facoltativo.POST /v1/recognizeper le richieste HTTP sincrone. L'intestazioneContent-Typeè ora facoltativa. (Per le richieste a più parti, anche il campopart_content_typedei metadati JSON è ora facoltativo.)POST /v1/recognitionsper le richieste HTTP asincrone. L'intestazioneContent-Typeè ora facoltativa.
Per ulteriori informazioni, vedi Formati audio.
- Aggiornamenti al modello di banda larga portoghese brasiliano per un migliore riconoscimento vocale
-
Il modello a banda larga per il portoghese brasiliano,
pt-BR_BroadbandModel, è stato aggiornato per fornire un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Il parametro
customization_idridenominato inlanguage_customization_id -
Il parametro
customization_iddei metodi di riconoscimento vocale è obsoleto e sarà rimosso in una futura release. Per specificare un modello di lingua personalizzato per una richiesta di riconoscimento vocale, utilizza invece il parametrolanguage_customization_id. Questa modifica si applica ai seguenti metodi:/v1/recognizeper le richieste WebSocketPOST /v1/recognizeper le richieste HTTP sincrone (incluse le richieste a più parti)POST /v1/recognitionsper le richieste HTTP asincrone
10 settembre 2018
- Nuovo modello tedesco di banda larga
-
Il servizio ora supporta un modello a banda larga in tedesco,
de-DE_BroadbandModel. Il nuovo modello in tedesco supporta la personalizzazione del modello di lingua (generalmente disponibile) e la personalizzazione del modello acustico (beta).- Per informazioni su come il servizio analizza i corpora in lingua tedesca, consultare la sezione " Analisi sintattica dell'olandese, dell'inglese, del francese, del tedesco, dell'italiano, del portoghese e dello spagnolo".
- Per ulteriori informazioni su come creare pronunce approssimative per parole personalizzate in tedesco, consulta le Linee guida per l'olandese, il francese, il tedesco, l'italiano, il portoghese e lo spagnolo.
- La personalizzazione del modello di lingua è ora disponibile per il portoghese brasiliano
-
I modelli di portoghese brasiliano esistenti,
pt-BR_BroadbandModelept-BR_NarrowbandModel, supportano ora la personalizzazione del modello di lingua (generalmente disponibile). I modelli sono stati aggiornati per abilitare questo supporto, per cui non è necessario alcun upgrade dei modelli acustici personalizzati esistenti.- Per informazioni su come il servizio analizza i corpora in portoghese brasiliano, consultare la sezione " Analisi sintattica dell'olandese, dell'inglese, del francese, del tedesco, dell'italiano, del portoghese e dello spagnolo ".
- Per ulteriori informazioni sulla creazione di pronunce approssimative per parole personalizzate in portoghese brasiliano, consultare le Linee guida per l'olandese, il francese, il tedesco, l'italiano, il portoghese e lo spagnolo.
- Aggiornamenti ai modelli di inglese americano e giapponese per un migliore riconoscimento vocale
-
Sono disponibili delle nuove versioni dei modelli a banda stretta e a banda larga per l'inglese americano e il giapponese:
- Modello a banda larga per l'inglese (Stati Uniti) (
en-US_BroadbandModel) - Modello a banda stretta per l'inglese (Stati Uniti) (
en-US_NarrowbandModel) - Modello a banda larga giapponese (
ja-JP_BroadbandModel) - Modello a banda stretta per il giapponese (
ja-JP_NarrowbandModel)
I nuovi modelli offrono un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda larga per l'inglese (Stati Uniti) (
- Funzioni di individuazione di parole chiave e alternative di parole ora disponibili in generale
-
Le funzioni di individuazione di parole chiave e di alternative alle parole sono ora generalmente disponibili (GA) invece che una funzionalità beta per tutte le lingue. Per ulteriori informazioni, vedi
- Correzione difetto: migliorare la documentazione per l'interfaccia di personalizzazione
-
Correzione del difetto: i seguenti problemi noti associati all'interfaccia di personalizzazione sono stati risolti e sono stati risolti in produzione. Le seguenti informazioni sono state conservate per gli utenti che potrebbero aver riscontrato tali problemi in passato.
-
Se aggiungi dei dati a un modello di lingua o acustico personalizzato, devi ripetere l'addestramento del modello prima di utilizzarlo per il riconoscimento vocale. Il problema si presenta nel seguente scenario:
-
L'utente crea un nuovo modello personalizzato (di lingua o acustico) e addestra il modello.
-
L'utente aggiunge ulteriori risorse (parole, corpora o audio) al modello personalizzato ma non ripete l'addestramento del modello.
-
L'utente non può utilizzare il modello personalizzato per il riconoscimento vocale. Il servizio restituisce un errore del seguente formato quando utilizzato con una richiesta di riconoscimento vocale:
{ "code_description": "Bad Request", "code": 400, "error": "Requested custom language model is not available. Please make sure the custom model is trained." }
Per evitare questo problema, l'utente deve ripetere l'addestramento del modello personalizzato con i dati più recenti. L'utente può quindi utilizzare il modello personalizzato con il riconoscimento vocale.
-
-
Prima di addestrare un modello acustico o di lingua personalizzato esistente, devi eseguirne l'upgrade all'ultima versione del suo modello di base. Il problema si presenta nel seguente scenario:
- L'utente ha un modello personalizzato esistente (di lingua o acustico) basato su un modello che è stato aggiornato.
- L'utente addestra il modello personalizzato esistente con una versione precedente del modello di base senza prima eseguire l'upgrade all'ultima versione del modello di base.
- L'utente non può utilizzare il modello personalizzato per il riconoscimento vocale.
Per evitare questo problema, l'utente deve utilizzare il metodo
POST /v1/customizations/{customization_id}/upgrade_modeloPOST /v1/acoustic_customizations/{customization_id}/upgrade_modelper eseguire l'upgrade del modello personalizzato all'ultima versione del suo modello di base. L'utente può quindi utilizzare il modello personalizzato con il riconoscimento vocale.
-
7 settembre 2018
- Interfaccia basata sulla sessione non più disponibile
-
L'interfaccia REST HTTP basata sulla sessione non è più supportata. Tutte le informazioni relative alle sessioni sono state rimosse dalla documentazione. I seguenti metodi non sono più disponibili:
POST /v1/sessionsPOST /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/observe_resultDELETE /v1/sessions/{session_id}
Se la tua applicazione utilizza l'interfaccia delle sessioni, devi eseguire la migrazione a una delle interfacce REST HTTP rimanenti o all'interfaccia WebSocket. Per ulteriori informazioni, vedi l'aggiornamento del servizio dell'8 agosto 2018.
8 agosto 2018
- Avviso di deprecazione per l'interfaccia di riconoscimento vocale basata sulla sessione
-
L'interfaccia REST HTTP basata sulla sessione è obsoleta a partire dall'8 agosto 2018. Tutti i metodi dell'API delle sessioni saranno rimossi dal servizio a partire dal 7 settembre 2018, dopodiché non potrai più utilizzare l'interfaccia basata sulla sessione. Questo avviso di deprecazione immediata e di rimozione di 30 giorni si applica ai seguenti metodi:
POST /v1/sessionsPOST /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/observe_resultDELETE /v1/sessions/{session_id}
Se la tua applicazione utilizza l'interfaccia delle sessioni, devi eseguire la migrazione a una delle seguenti interfacce entro il 7 settembre:
- Per il riconoscimento vocale basato sul flusso (inclusi i casi di utilizzo dal vivo), utilizza l'interfaccia WebSocket, che fornisce l'accesso a risultati provvisori e latenza più bassa.
- Per il riconoscimento vocale basato sul file, utilizza una delle seguenti interfacce:
- Per file brevi, fino a cinque minuti di audio, utilizza l'interfaccia HTTP sincrona
(POST /v1/recognize) o l'interfaccia HTTP asincrona (POST /v1/recognitions). - Per file più lunghi di pochi minuti di audio, utilizza l'interfaccia HTTP asincrona. L'interfaccia HTTP asincrona accetta fino a 1 GB di dati audio con una sola richiesta.
- Per file brevi, fino a cinque minuti di audio, utilizza l'interfaccia HTTP sincrona
Le interfacce WebSocket e HTTP forniscono gli stessi risultati dell'interfaccia delle sessioni (solo l'interfaccia WebSocket fornisce dei risultati provvisori). È inoltre possibile utilizzare uno degli SDK di Watson, che semplificano lo sviluppo di applicazioni con qualsiasi interfaccia. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
13 luglio 2018
- Aggiornamenti al modello a banda stretta spagnolo per un migliore riconoscimento vocale
-
Il modello a banda larga per lo spagnolo,
es-ES_NarrowbandModel, è stato aggiornato per fornire un riconoscimento vocale migliorato. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su questo modello, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
A partire da questo aggiornamento, sono disponibili le seguenti due versioni del modello a banda larga per lo spagnolo:
es_ES.8kHz.general.lm20180522235959.am20180522235959(corrente)es_ES.8kHz.general.lm20180308235959.am20180308235959(precedente)
La seguente versione del modello non è più disponibile:
es_ES.8kHz.general.lm20171031235959.am20171031235959
Una richiesta di riconoscimento che tenta di utilizzare un modello personalizzato basato sul modello di base ora non disponibile, utilizza il modello di base più recente senza alcuna personalizzazione. Il servizio restituisce il seguente messaggio di avviso:
Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported.Per riprendere a utilizzare un modello personalizzato basato sul modello non disponibile, devi prima aggiornare il modello utilizzando il metodoupgrade_modelappropriato descritto in precedenza.
12 giugno 2018
- Nuove funzioni per le applicazioni ospitate a Washington, DC, ubicazione
-
Le seguenti funzioni sono abilitate per le applicazioni ospitate in Washington, DC (us-east):
- Ora il servizio supporta un nuovo processo di autenticazione API. Per ulteriori informazioni, vedi l'aggiornamento del servizio del 30 ottobre 2018.
- Ora il servizio supporta l'intestazione
X-Watson-Metadatae il metodoDELETE /v1/user_data. Per ulteriori informazioni, vedi Sicurezza delle informazioni.
15 maggio 2018
- Nuove funzioni per le applicazioni ospitate nell'ubicazione di Sydney
-
Le seguenti funzioni sono abilitate per le applicazioni ospitate in Sydney (au-syd):
- Ora il servizio supporta un nuovo processo di autenticazione API. Per ulteriori informazioni, vedi l'aggiornamento del servizio del 30 ottobre 2018.
- Ora il servizio supporta l'intestazione
X-Watson-Metadatae il metodoDELETE /v1/user_data. Per ulteriori informazioni, vedi Sicurezza delle informazioni.
26 marzo 2018
- La personalizzazione del modello di lingua è ora disponibile per il modello a banda larga francese
-
Il servizio ora supporta la personalizzazione del modello linguistico per il modello linguistico francese a banda larga,
fr-FR_BroadbandModel. Il modello francese è disponibile in versione "Generally Available" (GA) per l'uso in produzione con personalizzazione del modello linguistico.- Per ulteriori informazioni su come il servizio analizza i corpora in francese, consultare la sezione " Analisi sintattica dell'olandese, dell'inglese, del francese, del tedesco, dell'italiano, del portoghese e dello spagnolo".
- Per ulteriori informazioni sulla creazione di pronunce approssimative per parole personalizzate in francese, consultare le Linee guida per l'olandese, il francese, il tedesco, l'italiano, il portoghese e lo spagnolo.
- Aggiornamenti ai modelli francese, coreano e spagnolo per un migliore riconoscimento vocale
-
I seguenti modelli sono stati aggiornati per migliorare il riconoscimento vocale:
- Modello a banda stretta coreano (
ko-KR_NarrowbandModel) - Modello a banda stretta spagnolo (
es-ES_NarrowbandModel) - Modello francese a banda larga (
fr-FR_BroadbandModel)
Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su entrambi questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.
- Modello a banda stretta coreano (
- Il parametro
versionridenominato inbase_model_version -
Il parametro
versiondei seguenti metodi è ora denominatobase_model_version``:/v1/recognizeper le richieste WebSocketPOST /v1/recognizeper le richieste HTTP senza sessione.POST /v1/sessionsper le richieste HTTP basate sulla sessione.POST /v1/recognitionsper le richieste HTTP asincrone
Il parametro
base_model_versionspecifica la versione di un modello di base che deve essere utilizzato per il riconoscimento vocale. Per ulteriori informazioni, vedi Utilizzo dei modelli personalizzati di cui è stato eseguito l'upgrade per il riconoscimento vocale e Esecuzione di richieste di riconoscimento vocale con i modelli personalizzati di cui è stato eseguito l'upgrade. - Nuovo supporto per la formattazione intelligente per il riconoscimento vocale in spagnolo
-
La formattazione intelligente è ora supportata per lo spagnolo nonché per l'inglese americano. Per l'inglese americano, la funzione ora converte anche le stringhe di parole chiave in simboli di punteggiatura per i punti, le virgole, i punti di domanda e i punti esclamativi. Per ulteriori informazioni, vedi Formattazione intelligente.
1 marzo 2018
- Aggiornamenti ai modelli a banda larga in francese e spagnolo per un migliore riconoscimento vocale
-
I modelli di banda larga francesi e spagnoli,
fr-FR_BroadbandModelees-ES_BroadbandModel, sono stati aggiornati per migliorare il riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati su entrambi questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati. La sezione presenta le regole per l'upgrade dei modelli personalizzati, gli effetti dell'upgrade e gli approcci per l'utilizzo dei modelli aggiornati.
1 febbraio 2018
- Nuovi modelli coreani
-
Il servizio offre ora modelli linguistici per il coreano:
ko-KR_BroadbandModelper file audio con frequenza di campionamento minima di 16 kHz, eko-KR_NarrowbandModelper file audio con frequenza di campionamento minima di 8 kHz. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.Per quanto riguarda la personalizzazione dei modelli linguistici, i modelli coreani sono generalmente disponibili (GA) per l'uso in produzione; per quanto riguarda la personalizzazione dei modelli acustici, si tratta di funzionalità in versione beta. Per ulteriori informazioni, vedi Supporto delle lingue per la personalizzazione.
- Per ulteriori informazioni su come il servizio analizza i corpora per il coreano, vedi Analisi in coreano.
- Per ulteriori informazioni sulla creazione di pronunce dal suono simile per le parole personalizzate in coreano, vedi Linee guida per il coreano.
14 dicembre 2017
- La personalizzazione del modello di lingua è ora generalmente disponibile
-
La personalizzazione del modello di lingua e tutti i parametri associati sono ora generalmente disponibili (GA) per tutte le lingue supportate: giapponese, spagnolo, inglese britannico e inglese americano.
- La personalizzazione del modello Beta acoustic è ora disponibile per tutte le lingue
-
Il servizio ora supporta la personalizzazione del modello acustico come una funzionalità beta per tutte le lingue disponibili. Puoi creare dei modelli acustici personalizzati per modelli a banda larga e stretta per tutte le lingue. Per un'introduzione alla personalizzazione, compresa quella dei modelli acustici, consultare la sezione " Informazioni sulla personalizzazione ".
- Nuovo parametro
versionper il riconoscimento vocale -
I vari metodi per effettuare richieste di riconoscimento includono ora un nuovo parametro
version, che è possibile utilizzare per avviare richieste che utilizzano sia la versione precedente sia quella aggiornata dei modelli di base e personalizzati. Sebbene sia destinato principalmente all'uso con modelli personalizzati che sono stati aggiornati, il parametroversionpuò essere utilizzato anche senza modelli personalizzati. Per ulteriori informazioni, vedi Effettuare richieste di riconoscimento vocale con i modelli personalizzati di cui è stato eseguito l'upgrade. - Aggiornamenti ai modelli di inglese americano per un migliore riconoscimento vocale
-
I modelli per l'inglese americano,
en-US_BroadbandModeleen-US_NarrowbandModel, sono stati aggiornati per un migliore riconoscimento vocale. Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento. Se hai dei modelli acustici o di lingua personalizzati basati sui modelli per l'inglese americano, devi eseguire l'upgrade dei tuoi modelli personalizzati per sfruttare gli aggiornamenti utilizzando i seguenti metodi:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Per ulteriori informazioni sulla procedura, vedi Upgrade dei modelli personalizzati. La sezione presenta le regole per l'upgrade dei modelli personalizzati, gli effetti dell'upgrade e gli approcci per l'utilizzo dei modelli aggiornati. Al momento, i metodi si applicano solo ai nuovi modelli di base per l'inglese americano. Ma le stesse informazioni si applicheranno agli upgrade di altri modelli di base come diventano disponibili.
- La personalizzazione del modello di lingua è ora disponibile per l'inglese britannico
-
Ora il servizio supporta la personalizzazione del modello di lingua per i modelli per l'inglese britannico,
en-GB_BroadbandModeleen-GB_NarrowbandModel. Sebbene il servizio gestisca le parole personalizzate e i corpora in inglese americano e britannico in modo generalmente simile, esistono alcune importanti differenze:- Per ulteriori informazioni su come il servizio analizza i corpora relativi all'inglese britannico, consultare la sezione " Analisi dell'olandese, dell'inglese, del francese, del tedesco, dell'italiano, del portoghese e dello spagnolo".
- Per ulteriori informazioni su come creare pronunce simili per parole personalizzate in inglese britannico, consulta le Linee guida per l'inglese. Nello specifico, per l'inglese britannico, non puoi utilizzare punti o trattini in pronunce dal suono simile.
2 ottobre 2017
- Nuova interfaccia di personalizzazione del modello acustico beta per inglese americano, giapponese e spagnolo
-
L'interfaccia di personalizzazione ora offre la personalizzazione del modello acustico. Puoi creare dei modelli acustici personalizzati che adattano i modelli di base del servizio al tuo ambiente e ai parlanti. Popola e addestra un modello acustico personalizzato sull'audio che più si avvicina alla firma acustica dell'audio che vuoi trascrivere. Utilizza quindi il modello acustico personalizzato con le richieste di riconoscimento per aumentare l'accuratezza del riconoscimento vocale.
I modelli acustici personalizzati integrano i modelli di lingua personalizzati. Puoi addestrare un modello acustico personalizzato con un modello di lingua personalizzato e puoi utilizzarli entrambi durante il riconoscimento vocale. La personalizzazione del modello acustico è un'interfaccia in versione beta disponibile solo in inglese (Stati Uniti), giapponese e spagnolo.
- Per ulteriori informazioni sulle lingue supportate dall'interfaccia di personalizzazione e il livello di supporto disponibile per ogni lingua, vedi Supporto delle lingue per la personalizzazione.
- Per ulteriori informazioni sull'interfaccia di personalizzazione del servizio, consultare la sezione " Informazioni sulla personalizzazione ".
- Per ulteriori informazioni sulla creazione di un modello acustico personalizzato, vedi Creazione di un modello acustico personalizzato.
- Per ulteriori informazioni sull'utilizzo di un modello acustico personalizzato, consultare la sezione " Utilizzo di un modello acustico personalizzato per il riconoscimento vocale ".
- Per ulteriori informazioni su tutti i metodi dell'interfaccia di personalizzazione, consultare la guida di riferimento API e SDK.
- Nuovo parametro beta
customization_weightper modelli di lingua personalizzati -
Per la personalizzazione del modello di lingua, il servizio ora include una funzione beta che imposta un peso di personalizzazione facoltativo per un modello di lingua personalizzato. Un peso di personalizzazione specifica il peso relativo da dare alle parole da un modello di lingua personalizzato rispetto alle parole dal vocabolario di base del servizio. Puoi impostare un peso di personalizzazione durante il riconoscimento vocale e l'addestramento. Per ulteriori informazioni, vedi Utilizzo del peso di personalizzazione.
- Aggiornamenti al modello a banda larga giapponese per un migliore riconoscimento vocale
-
Il modello di lingua
ja-JP_BroadbandModelè stato aggiornato per acquisire i miglioramenti nel modello di base. L'upgrade non influisce sui modelli personalizzati esistenti basati sul modello. - Nuovo parametro
endiannessper il formato audioaudio/l16 -
Il servizio ora include un parametro per specificare l'endian dell'audio inviato nel formato
audio/l16PCM (Pulse-Code Modulation) lineare a 16 bit. Oltre a specificare i parametrirateechannelscon il formato, puoi ora specificare anchebig-endianolittle-endiancon il parametroendianness. Per ulteriori informazioni, vedi il formato audio/l16.
14 luglio 2017
- Nuovo supporto per il formato audio MP3 (MPEG)
-
Il servizio ora supporta la trascrizione dell'audio nel formato MP3 o MPEG (Motion Picture Experts Group). Per ulteriori informazioni, consultare audio/mp3 e formati audio / mpeg.
- La personalizzazione del modello di lingua beta è ora disponibile per lo spagnolo
-
L'interfaccia di personalizzazione del modello di lingua ora supporta lo spagnolo come una funzionalità beta. Puoi creare un modello personalizzato basato su entrambi i modelli di lingua per lo spagnolo di base:
es-ES_BroadbandModeloes-ES_NarrowbandModel; per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato. I prezzi per le richieste di riconoscimento che utilizzano i modelli di lingua personalizzati per lo spagnolo sono gli stessi di quelli per le richieste che utilizzano i modelli per l'inglese americano e il giapponese. - Nuovo campo
dialectper il metodo che crea un modello di lingua personalizzato -
L'oggetto
CreateLanguageModelJSON che passi al metodoPOST /v1/customizationsper creare un nuovo modello di lingua personalizzato ora include il campodialect. Il campo specifica il dialetto della lingua che deve essere utilizzato con il modello personalizzato. Per impostazione predefinita, il dialetto corrisponde alla lingua del modello di base. Il parametro è significativo solo per i modelli per lo spagnolo, per cui il servizio può creare un modello personalizzato adatto per un discorso in uno dei seguenti dialetti:es-ESper lo spagnolo castigliano (valore predefinito)es-LAper lo spagnolo latino americanoes-USper lo spagnolo nord americano (messicano)
I metodi
GET /v1/customizationseGET /v1/customizations/{customization_id}dell'interfaccia di personalizzazione includono il dialetto di un modello personalizzato nei propri input. Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato e Elenco dei modelli di lingua personalizzati. - Nuovi nomi per i modelli inglesi del Regno Unito
-
I nomi dei modelli di lingua
en-UK_BroadbandModeleen-UK_NarrowbandModelsono diventati obsoleti. I modelli sono ora disponibili con i nomien-GB_BroadbandModeleen-GB_NarrowbandModel.I nomi
en-UK_{model}obsoleti continuano a funzionare, ma il metodoGET /v1/modelsnon restituisce più i nomi nell'elenco di modelli disponibili. Puoi ancora eseguire la query dei nomi direttamente con il metodoGET /v1/models/{model_id}.
1 luglio 2017
- Il modello di lingua personalizzato ora è generalmente disponibile per l'inglese americano e il giapponese
-
L'interfaccia di personalizzazione del modello di lingua del servizio è ora generalmente disponibile (GA) per entrambe le sue lingue supportate, inglese americano e giapponese. IBM non addebita alcun costo per la creazione, l'hosting o la gestione di modelli di lingue personalizzati. Come descritto al prossimo punto, IBM ora addebita ulteriori $0.03 (USD) per ogni minuto di audio per le richieste di riconoscimento che utilizzano i modelli personalizzati.
- Aggiornamenti ai piani dei prezzi per il servizio
-
IBM ha aggiornato i prezzi per il servizio
- Eliminando il prezzo del componente aggiuntivo per l'utilizzo dei modelli a banda stretta
- Fornendo un prezzo a più livelli graduati per gli utenti con grandi volumi
- Addebitando ulteriori $0.03 (USD) per ogni minuto di audio per le richieste di riconoscimento che utilizzano i modelli di lingua personalizzati per l'inglese americano e il giapponese.
Per ulteriori informazioni sugli aggiornamenti dei prezzi, vedi
- Il servizio Speech to Text nel catalogo IBM Cloud
- Le Domande frequenti sui prezzi
- Il corpo vuoto non è più richiesto per le richieste POST di HTTP
-
Non hai più bisogno di passare un oggetto dati vuoto come corpo per le seguenti richieste
POST:POST /v1/sessionsPOST /v1/register_callbackPOST /v1/customizations/{customization_id}/trainPOST /v1/customizations/{customization_id}/resetPOST /v1/customizations/{customization_id}/upgrade_model
Ad esempio, puoi ora richiamare il metodo
POST /v1/sessionsconcurlnel seguente modo:curl -X POST -u "{username}:{password}" \ --cookie-jar cookies.txt \ "{url}/v1/sessions"Non hai più bisogno di passare la seguente opzione
curlcon la richiesta:--data "{}". Se stai riscontrando dei problemi con una di queste richiestePOST, prova a passare un oggetto dati vuoto con il corpo della richiesta. Il passaggio di un oggetto vuoto non modifica la natura o il significato della richiesta in alcun modo.
22 maggio 2017
- Il parametro
continuousrimosso da tutti i metodi -
Il parametro
continuousè stato rimosso da tutti i metodi che avviano le richieste di riconoscimento. Il servizio ora trascrive un intero flusso audio finché non termina o va in timeout, a seconda di cosa si verifica prima. Questo comportamento è equivalente all'impostazione del precedente parametrocontinuoussutrue. Per impostazione predefinita, il servizio precedentemente arrestava la trascrizione al primo mezzo secondo senza alcun discorso (normalmente del silenzio) se il parametro veniva omesso o impostato sufalse.Le applicazioni esistenti che impostano il parametro su
truenon vedranno alcuna modifica nel comportamento. Le applicazioni che impostano il parametro sufalseo che si basano sul comportamento predefinito verosimilmente vedranno una modifica. Se una richiesta specifica il parametro, il servizio ora risponde restituendo un messaggio di avvertenza per il parametro sconosciuto:"warnings": [ "Unknown arguments: continuous." ]La richiesta ha esito positivo nonostante l'avvertenza e una connessione WebSocket o una sessione esistente non ne vengono influenzate.
IBM ha rimosso il parametro per rispondere all'enorme quantità di feedback dalla community di sviluppatori che specificando
continuous=falseviene aggiunto poco valore e si potrebbe ridurre l'accuratezza della trascrizione generale. - Invio dell'audio richiesto per evitare il timeout della sessione
-
Non è più possibile evitare un timeout di sessione senza inviare dell'audio:
- Quando utilizzi l'interfaccia WebSocket, il client non può più mantenere una connessione attiva inviando un messaggio di testo JSON con il parametro
actionimpostato suno-op. L'invio del messaggiono-opnon genera un errore, ma non ha alcun effetto. - Quando utilizzi le sessioni con l'interfaccia HTTP, il client non può più estendere la sessione inviando una richiesta
GET /v1/sessions/{session_id}/recognize. Il metodo restituisce ancora lo stato di una sessione attiva, ma non mantiene la sessione attiva.
Puoi ora effettuare le seguenti operazioni per mantenere una sessione attiva:
- Imposta il parametro
inactivity_timeoutsu-1per evitare il timeout di inattività di 30 secondi. - Invia tutti i dati audio, incluso il silenzio, al servizio per evitare il timeout della sessione di 30 secondi. Ti viene effettuato un addebito per la durata di tutti i dati che invii al servizio, incluso il silenzio che invii per estendere la sessione.
Per ulteriori informazioni, vedi Timeout. Idealmente, vuoi stabilire una sessione appena prima di ottenere l'audio per la trascrizione e mantenere la sessione attiva inviando l'audio a una velocità quanto più possibile in tempo reale. Inoltre, assicurati che la tua applicazione ripristini normalmente le sessioni o le connessioni chiuse.
IBM ha rimosso questa funzionalità per garantire di continuare ad offrire a tutti gli utenti un servizio di riconoscimento vocale a bassa latenza e all'avanguardia.
- Quando utilizzi l'interfaccia WebSocket, il client non può più mantenere una connessione attiva inviando un messaggio di testo JSON con il parametro
10 aprile 2017
- Le etichette dei parlanti sono ora supportate per l'inglese americano, lo spagnolo e il giapponese
-
Il servizio ora supporta la funzione di etichette del parlante per i seguenti modelli a banda larga:
- Modello a banda larga per l'inglese (Stati Uniti) (
en-US-BroadbandModel) - Modello spagnolo a banda larga (
es-ES-BroadbandModel) - Modello a banda larga giapponese (
ja-JP_BroadbandModel)
Per ulteriori informazioni, vedi Etichette del parlante.
- Modello a banda larga per l'inglese (Stati Uniti) (
- Nuovo supporto per il formato audio Web Media (WebM)
-
Ora il servizio supporta il formato audio Web Media (WebM) con il codec Opus o Vorbis. Al momento il servizio supporta anche il formato audio Ogg con il codec Vorbis in aggiunta al codec Opus. Per ulteriori informazioni sui formati audio supportati, vedi formato audio / webm.
- Nuovo supporto per la condivisione di risorse tra origini
-
Ora il servizio supporta CORS (Cross-Origin Resource Sharing) per consentire ai client basati sul browser di richiamare direttamente il servizio. Per ulteriori informazioni, vedi Supporto CORS.
- Nuovo metodo per disregistrare una callback URL con l'interfaccia asincrona HTTP
-
L'interfaccia HTTP asincrona ora offre un metodo
POST /v1/unregister_callbackche rimuove la registrazione per un URL di callback inserito nell'elenco di tipi consentiti. Per ulteriori informazioni, vedi Annullamento della registrazione di un URL di callback. - Correzione difetto: eliminare i timeout per l'audio lungo con l'interfaccia WebSocket
-
Correzione di un bug: l'interfaccia WebSocket non va più in timeout in caso di richieste di riconoscimento relative a file audio particolarmente lunghi. Non devi più richiedere dei risultati provvisori con il messaggio
startJSON per evitare il timeout. (Questo problema è stato descritto nell'aggiornamento del 10 marzo 2016.) - Nuovi codici di errore HTTP
-
I seguenti metodi di personalizzazione del modello linguistico possono ora restituire i seguenti codici di errore HTTP:
- Il metodo
DELETE /v1/customizations/{customization_id}ora restituisce il codice di risposta HTTP 401 se tenti di eliminare un modello personalizzato non esistente. - Il metodo
DELETE /v1/customizations/{customization_id}/corpora/{corpus_name}ora restituisce il codice di risposta HTTP 400 se tenti di eliminare un corpus non esistente.
- Il metodo
8 marzo 2017
- L'interfaccia asincrona HTTP è ora disponibile per tutti
- L'interfaccia asincrona HTTP è ora disponibile al pubblico (GA). Prima di questa data, era una funzionalità beta.
1 dicembre 2016
- Nuova funzione di etichette di altoparlanti beta
-
Il servizio ora offre una funzione di etichette del parlante beta per l'audio a banda stretta per inglese americano, spagnolo o giapponese. La funzione identifica quali parole sono state pronunciate da quale parlante in uno scambio tra più persone. I metodi di riconoscimento senza sessione, basati sulla sessione, asincroni e WebSocket includono tutti un parametro
speaker_labelsche accetta un valore booleano per indicare se le etichette del parlante devono essere incluse nella risposta. Per ulteriori informazioni sulla funzione, vedi Etichette del parlante. - La personalizzazione del modello di lingua beta è ora disponibile per il giapponese
-
L'interfaccia di personalizzazione del modello di lingua beta è ora supportata per il giapponese in aggiunta all'inglese americano. Tutti i metodi dell'interfaccia supportano il giapponese. Per ulteriori informazioni, vedi le seguenti sezioni:
- Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato e Utilizzo di un modello di lingua personalizzato per il riconoscimento vocale.
- Per considerazioni generali e specifiche per il giapponese sull'aggiunta di un file di testo di corpus, vedi Preparazione di un file di testo di corpus e Cosa succede quando aggiungo un file di corpus?
- Per considerazioni specifiche per il giapponese quando specifichi il campo
sounds_likeper una parola personalizzata, vedi Linee guida per il giapponese. - Per ulteriori informazioni su tutti i metodi dell'interfaccia di personalizzazione, consultare la guida di riferimento API e SDK.
- Nuovo metodo per elencare le informazioni su un corpus
-
L'interfaccia di personalizzazione del modello di lingua ora include un metodo
GET /v1/customizations/{customization_id}/corpora/{corpus_name}che elenca le informazioni su un corpus specificato. Il metodo è utile per il monitoraggio dello stato di una richiesta per aggiungere un corpus a un modello personalizzato. Per ulteriori informazioni, vedi Elenco dei corpora per un modello di lingua personalizzato. - Nuovo campo
countper metodi che elencano parole per modelli di lingua personalizzati -
La risposta JSON restituita dai metodi
GET /v1/customizations/{customization_id}/wordseGET /v1/customizations/{customization_id}/words/{word_name}ora include un campocountper ogni parola. Il campo indica il numero di volte in cui viene trovata la parola tra tutti i corpora. Se aggiungi una parola personalizzata a un modello prima che venga aggiunto da qualsiasi corpora, il conteggio inizia da1. Se la parola viene aggiunta da un corpus prima e successivamente modificato, il conteggio riflette solo il numero di volte che viene trovato nei corpora. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ".Per i modelli personalizzati creati prima dell'esistenza del campo
count, il campo rimane sempre in0. Per aggiornare il campo per tali modelli, aggiungi di nuovo i corpora del modello e includi il parametroallow_overwritecon il metodoPOST /v1/customizations/{customization_id}/corpora/{corpus_name}. - Nuovo parametro
sortper metodi che elencano parole per modelli di lingua personalizzati -
Il metodo
GET /v1/customizations/{customization_id}/wordsora include un parametro di querysortche controlla l'ordine in cui le parole devono essere elencate. Il parametro accetta due argomenti,alphabeticalocount, per indicare come le parole devono essere ordinate. Puoi anteporre un+o un-facoltativo a un argomento per indicare se i risultati devono essere ordinati in ordine crescente o decrescente. Per impostazione predefinita, il metodo visualizza le parole in ordine alfabetico crescente. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ".Per i modelli personalizzati creati prima dell'introduzione del campo
count, l'utilizzo dell'argomentocountcon il parametrosortnon ha senso. Utilizza l'argomentoalphabeticalpredefinito con tali modelli. - Nuovo formato campo
errorper i metodi che elencano le parole per modelli di lingua personalizzati -
Il campo
errorche può essere restituito come parte della risposta JSON dai metodiGET /v1/customizations/{customization_id}/wordseGET /v1/customizations/{customization_id}/words/{word_name}è ora un array. Se il servizio ha rilevato uno o più problemi con la definizione di una parola personalizzata, il campo elenca ogni elemento del problema dalla definizione e fornisce un messaggio che descrive il problema. Per ulteriori informazioni, consultare la sezione " Elenco di parole personalizzate da un modello linguistico personalizzato ". - I parametri
keywords_thresholdeword_alternatives_thresholdnon accettano più un valore null -
I parametri
keywords_thresholdeword_alternatives_thresholddei metodi di riconoscimento non accettano più un valore null. Per omettere delle parole chiave o delle alternative alle parole dalla risposta, ometti i parametri. Un valore specificato deve essere un valore mobile.
22 settembre 2016
- Nuova interfaccia di personalizzazione del modello di lingua beta
- Il servizio ora offre una nuova interfaccia di personalizzazione del modello di lingua beta per l'inglese americano. Puoi utilizzare l'interfaccia per personalizzare i modelli di lingua e vocabolario di base del servizio tramite la creazione
di modelli di lingua personalizzati che includono la terminologia specifica per il dominio. Puoi aggiungere le parole personalizzate individualmente o lasciare che il servizio le estragga dai corpora. Per utilizzare i tuoi modelli personalizzati
con i metodi di riconoscimento vocale offerti da tutte le interfacce del servizio, passa il parametro di query
customization_id. Per ulteriori informazioni, vedi - Nuovo supporto per il formato audio
audio/mulaw - L'elenco di formati audio supportati ora include
audio/mulaw, che fornisce un audio a canale singolo codificato utilizzando l'algoritmo di dati u-law (o mu-law). Quando utilizzi questo formato, devi specificare anche la frequenza di campionamento con cui viene acquisito l'audio. Per ulteriori informazioni, vedi formato audio / mulaw. - Nuovo
supported_featuresidentificato durante l'elenco dei modelli - I metodi
GET /v1/modelseGET /v1/models/{model_id}ora restituiscono un camposupported_featurescome parte del proprio output per ogni modello di lingua. Le informazioni aggiuntive descrivono se il modello supporta la personalizzazione. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
30 giugno 2016
- L'interfaccia asincrona beta di HTTP ora supporta tutte le lingue disponibili
- L'interfaccia HTTP asincrona beta ora supporta tutte le lingue supportate dal servizio. L'interfaccia era precedentemente disponibile solo per l'inglese americano. Per ulteriori informazioni, consultare l'interfaccia asincrona HTTP e il riferimento all'API e all'SDK.
23 giugno 2016
- È ora disponibile la nuova interfaccia beta asincrona HTTP
- Un'interfaccia HTTP asincrona beta è ora disponibile. L'interfaccia fornisce tutte le funzionalità di riconoscimento per la trascrizione in inglese americano tramite chiamate HTTP non bloccanti. Puoi registrare gli URL di callback e fornire le stringhe segrete specificate dall'utente per fornire l'integrità dei dati e l'autenticazione con le firme digitali. Per ulteriori informazioni, consultare l'interfaccia asincrona HTTP e il riferimento all'API e all'SDK.
- Nuovo parametro beta
smart_formattingper il riconoscimento vocale - Una funzionalità di formattazione intelligente beta che converte date, ore, serie di cifre e numeri, numeri di telefono, valori valutari e indirizzi internet in rappresentazioni più convenzionali nelle trascrizioni finali. Abilita la funzione
impostando il parametro
smart_formattingsutruein una richiesta di riconoscimento. La funzione è una funzionalità beta disponibile solo per l'inglese americano. Per ulteriori informazioni, vedi Formattazione intelligente. - Nuovo modello francese di banda larga
- L'elenco di modelli supportati per il riconoscimento vocale ora include
fr-FR_BroadbandModelper l'audio nella lingua francese campionato a un minimo di 16 kHz. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente. - Nuovo supporto per il formato audio
audio/basic - L'elenco di formati audio supportati ora include
audio/basic. Il formato fornisce un audio a canale singolo codificato utilizzando i dati u-law (o mu-law) a 8-bit campionati a 8 hKz. Per ulteriori informazioni, vedi formato audio / base. - I metodi di riconoscimento vocale ora restituiscono avvertenze per parametri non validi
- I vari metodi di riconoscimento possono restituire una risposta
warningsche include i messaggi sui parametri di query o i campi JSON non validi che vengono inclusi in una richiesta. Il formato delle avvertenze è stato modificato. Ad esempio,"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."è ora"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}." - Corpo vuoto richiesto per i metodi di HTTP
POSTche non passano alcun dato - Per le richieste
POSTHTTP che non riescono altrimenti a passare i dati al servizio, devi includere un corpo della richiesta vuoto del formato{}. Con il comandocurl, utilizza l'opzione--dataper passare i dati vuoti.
10 marzo 2016
- Nuovi limiti massimi per l'audio trasmesso per il riconoscimento vocale
- Entrambe le forme di trasmissione dei dati (fornitura unica e invio in streaming) ora impongono un limite di 100 MB sui dati audio, come per l'interfaccia WebSocket. Precedentemente, l'approccio di fornitura unica aveva un limite massimo di 4 MB di dati. Per ulteriori informazioni, vedi Trasmissione audio (per tutte le interfacce) e Invia l'audio e ricevi i risultati del riconoscimento (per l'interfaccia WebSocket). La sezione WebSocket parla anche della velocità massima o della dimensione dei messaggi di 4 MB imposta dall'interfaccia WebSocket.
- HTTP e le interfacce WebSocket possono ora restituire gli avvertimenti
- La risposta JSON per una richiesta di riconoscimento può ora includere un array di messaggi di avvertenza per parametri di query o campi JSON non validi inclusi con una richiesta. Ogni elemento dell'array è una stringa che descrive la natura
dell'avvertenza seguita da un array di stringhe di argomenti non valide. Ad esempio,
"warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK. - L'SDK Beta Apple iOS è obsoleto
- La versione beta *Watson Kit di sviluppo software (SDK) per la sintesi vocale per il sistema operativo Apple® iOS * è obsoleta. Utilizza invece l'SDK " Watson " per il sistema operativo Apple® iOS. Il nuovo SDK è disponibile
nel repository ios-sdk, nello spazio dei nomi
watson-developer-cloud, all'indirizzo GitHub. - L'interfaccia WebSocket è in grado di produrre risultati ritardati
- L'interfaccia WebSocket può impiegare alcuni minuti per fornire i risultati finali di una richiesta di riconoscimento relativa a un file audio particolarmente lungo. Per l'interfaccia WebSocket, la connessione TCP sottostante rimane inattiva
mentre il servizio prepara la risposta. Pertanto, la connessione può venire chiusa a causa del timeout. Per evitare il timeout con l'interfaccia WebSocket, richiedi i risultati provvisori (
\"interim_results\": \"true\") nel JSON per il messaggiostartper avviare la richiesta. Puoi eliminare i risultati provvisori se non ne hai bisogno. Questo problema sarà risolto in un aggiornamento futuro.
19 gennaio 2016
- Nuova funzione di filtro della volgarità
- Il servizio è stato aggiornato per includere una nuova funzione di filtro di contenuto volgare il 19 gennaio 2016. Per impostazione predefinita, il servizio censura il contenuto volgare dai propri risultati di trascrizione per l'audio in inglese americano. Per ulteriori informazioni, vedi Filtro di contenuto volgare.
17 dicembre 2015
- Nuova funzione di individuazione delle parole chiave
- Il servizio ora offre una funzione di individuazione di parole chiave. Puoi specificare un array di stringhe di parole chiave che devono essere soddisfatte nell'audio di input. Devi inoltre specificare un livello di attendibilità definito dall'utente che una parola deve soddisfare per essere considerata una corrispondenza per una parola chiave. Per ulteriori informazioni, vedi Individuazione di parole chiave. La funzione di individuazione di parole chiave è una funzionalità beta.
- Nuova funzione di alternative alle parole
- Il servizio ora offre una funzione di alternative alle parole. La funzione restituisce delle ipotesi alternative alle parole nell'audio di input che soddisfano un livello di attendibilità definito dall'utente. Per ulteriori informazioni, vedi Alternative alle parole. La funzione di alternative alle parole è una funzionalità beta.
- Nuovi modelli inglesi e arabi del Regno Unito
- Il servizio supporta più lingue con i propri modelli di trascrizione:
en-UK_BroadbandModeleen-UK_NarrowbandModelper l'inglese britannico ear-AR_BroadbandModelper l'arabo standard moderno. Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente. - Nuovo campo
session_closedper i metodi basati sulla sessione - Nelle risposte JSON che restituiscono degli errori con i metodi basati sulla sessione, il servizio ora include anche un nuovo campo
session_closed. Il campo è impostato sutruese la sessione viene chiusa a causa dell'errore. Per ulteriori informazioni sui possibili codici di ritorno relativi a qualsiasi metodo, consultare la guida di riferimento API e SDK. - HTTP il timeout della piattaforma non è più valido
- Le richieste di riconoscimento HTTP non sono più soggette a un timeout della piattaforma di 10 minuti. Il servizio ora mantiene attiva la connessione inviando un carattere spazio nell'oggetto JSON della risposta ogni 20 secondi mentre il riconoscimento è in corso. Per ulteriori informazioni, vedi Timeout.
- La limitazione della velocità con il comando curl non è più necessaria
- Quando utilizzi il comando
curlper trascrivere dell'audio con il servizio, non devi più utilizzare l'opzione--limit-rateper trasferire i dati a una velocità inferiore a 40.000 byte al secondo. - Modifiche ai codici di errore di HTTP
- Il servizio non restituisce più un codice di stato HTTP 490 per i metodi HTTP basati sulla sessione
GET /v1/sessions/{session_id}/observe_resultePOST /v1/sessions/{session_id}/recognize. Il servizio ora risponde invece con il codice di stato HTTP 400.
21 settembre 2015
- Nuovi SDK mobili disponibili
-
Sono disponibili due nuovi SDK mobili beta per i servizi vocali. Gli SDK consentono alle applicazioni mobili di interagire con i servizi Speech to Text e Text to Speech.
- L'SDK " Watson " per la piattaforma Android™ " Google " supporta lo streaming audio in tempo reale verso il servizio Speech to Text e la ricezione della trascrizione dell'audio mentre si parla. Il progetto
include un'applicazione di esempio che illustra l'interazione con entrambi i servizi vocali. L'SDK è disponibile nel repository speech-android-sdk,
nello spazio dei nomi
watson-developer-cloud, all'indirizzo GitHub. - L'SDK per il riconoscimento vocale di Watson per il sistema operativo Apple® iOS supporta lo streaming audio verso il servizio Speech to Text e la ricezione di una trascrizione dell'audio in risposta. L'SDK è disponibile nel
repository speech-ios-sdk, nello spazio dei nomi
watson-developer-cloud, all'indirizzo GitHub.
Entrambi gli SDK supportano l'autenticazione con i servizi vocali utilizzando le credenziali del servizio IBM Cloud o un token di autenticazione. Poiché gli SDK sono nella beta, sono soggetti a modifiche future.
- L'SDK " Watson " per la piattaforma Android™ " Google " supporta lo streaming audio in tempo reale verso il servizio Speech to Text e la ricezione della trascrizione dell'audio mentre si parla. Il progetto
include un'applicazione di esempio che illustra l'interazione con entrambi i servizi vocali. L'SDK è disponibile nel repository speech-android-sdk,
nello spazio dei nomi
- Nuovi modelli di portoghese brasiliano e cinese mandarino
-
Il servizio supporta due nuove lingue, il portoghese brasiliano e il cinese mandarino, con i modelli seguenti:
- Modello a banda larga per il portoghese brasiliano (
pt-BR_BroadbandModel) - Modello a banda stretta per il portoghese (Brasile) (
pt-BR_NarrowbandModel) - Modello a banda larga in cinese mandarino (
zh-CN_BroadbandModel) - Modello a banda stretta per il cinese mandarino (
zh-CN_NarrowbandModel)
Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.
- Modello a banda larga per il portoghese brasiliano (
- Nuovo supporto per il formato audio
audio/ogg;codecs=opus -
Le richieste
POSTHTTP/v1/sessions/{session_id}/recognizee/v1/recognize, nonché la richiesta/v1/recognizeWebSocket, supportano la trascrizione di un nuovo tipo di supporto:audio/ogg;codecs=opusper i file di formato Ogg che utilizzano il codec Opus. Inoltre, il formatoaudio/wavper i metodi ora supporta qualsiasi codifica. La limitazione sull'utilizzo della codifica PCM lineare è stata rimossa. Per ulteriori informazioni, vedi formato audio / ogg. - Nuovo parametro
sequence_idper il polling lungo delle sessioni -
Il servizio ora supporta il superamento dei timeout quando trascrivi file audio lunghi con l'interfaccia HTTP. Quando utilizzi le sessioni, puoi utilizzare un modello di polling lungo specificando gli ID di sequenza con i metodi
GET /v1/sessions/{session_id}/observe_resultePOST /v1/sessions/{session_id}/recognizeper attività di riconoscimento a lunga esecuzione. Utilizzando il nuovo parametrosequence_iddi questi metodi, puoi richiedere i risultati prima, durante o dopo aver inviato una richiesta di riconoscimento. - Nuova funzione di maiuscole / minuscole per la trascrizione in inglese americano
-
Per i modelli di lingua per l'inglese americano,
en_US_BroadbandModeleen_US_NarrowbandModel, il servizio ora converte in maiuscolo molti nomi propri. Ad esempio, il servizio restituirebbe un nuovo testo che recita "Barack Obama si è laureato alla Columbia University" invece di "barack obama si è laureato alla columbia university". Questa modifica potrebbe essere interessante se la tua applicazione è sensibile per un qualsiasi motivo al maiuscolo/minuscolo dei nomi propri. - Nuovo codice di errore " HTTP "
-
La richiesta HTTP
DELETE /v1/sessions/{session_id}non restituisce il codice di stato 415 "Unsupported Media Type". Questo codice di ritorno è stato rimosso dalla documentazione per il metodo.
1 luglio 2015
- Il servizio Speech to Text ora è generalmente disponibile
-
Il servizio è passato dalla beta alla disponibilità generale (GA) il primo luglio 2015. Esistono le seguenti differenze tra le versioni beta e GA delle API Speech to Text. La release GA richiede che gli utenti eseguano l'upgrade alla nuova versione del servizio.
La versione GA dell'API HTTP è compatibile con la versione beta. Devi modificare il tuo codice applicazione esistente solo se hai specificato esplicitamente un nome di modello. Ad esempio, il codice di esempio disponibile per il servizio da GitHub includeva la seguente riga di codice nel file
demo.js:model: 'WatsonModel'Questa riga specificava il modello predefinito
WatsonModelper la versione beta del servizio. Se anche la tua applicazione specificava questo modello, devi modificarla in modo che utilizzi uno dei nuovi modello supportati dalla versione GA. Per ulteriori informazioni, vedi il prossimo punto. - Nuovo modello di programmazione basato su token
-
Il servizio ora supporta un nuovo modello di programmazione per l'interazione diretta tra un client e il servizio su una connessione WebSocket. Utilizzando questo modello, un client può ottenere un token di autenticazione per comunicare direttamente con il servizio. Il token elude la necessità di un'applicazione proxy lato server in IBM Cloud di richiamare il servizio al posto del client. I token sono i mezzi preferiti per i client per interagire con il servizio.
Il servizio continua a supportare il vecchio modello di programmazione basato su un proxy lato server per trasmettere l'audio e i messaggi tra il client e il servizio. Tuttavia, il nuovo modello è più efficiente e offre una velocità effettiva più elevata.
- Nuovo parametro
modelper il riconoscimento vocale -
I metodi
POST /v1/sessionsePOST /v1/recognize, insieme al metodo/v1/recognizeWebSocket, ora supportano un parametro di querymodel. Utilizza il parametro per specificare le informazioni sull'audio:- La lingua: inglese, giapponese o spagnolo
- La frequenza di campionamento minima: banda larga (16 kHz) o banda stretta (8 kHz)
Per ulteriori informazioni, vedi Lingue e modelli di generazione precedente.
- Nuovo parametro
inactivity_timeoutper il riconoscimento vocale -
Il parametro
inactivity_timeoutimposta il valore di timeout in secondi dopo il quale il servizio chiude la connessione se rileva del silenzio (nessun discorso) nella modalità di streaming. Per impostazione predefinita, il servizio termina la sessione dopo 30 secondi di silenzio. I metodiPOST /v1/recognizee WebSocket/v1/recognizesupportano il parametro. Per ulteriori informazioni, vedi Timeout. - Nuovo parametro
max_alternativesper il riconoscimento vocale -
Il parametro
max_alternativesindica al servizio di restituire le migliori n ipotesi alternative per la trascrizione audio. I metodiPOST /v1/recognizee WebSocket/v1/recognizesupportano il parametro. Per ulteriori informazioni, vedi Numero massimo di alternative. - Nuovo parametro
word_confidenceper il riconoscimento vocale -
Il parametro
word_confidenceindica al servizio di restituire un punteggio di attendibilità per ogni parola della trascrizione. I metodiPOST /v1/recognizee WebSocket/v1/recognizesupportano il parametro. Per ulteriori informazioni, vedi Attendibilità delle parole. - Nuovo parametro
timestampsper il riconoscimento vocale -
Il parametro
timestampsindica al servizio di restituire l'ora di inizio e di fine per ciascuna parola relativamente all'inizio dell'audio. I metodiPOST /v1/recognizee WebSocket/v1/recognizesupportano il parametro. Per ulteriori informazioni, vedi Date/ore delle parole. - Metodo sessioni rinominate per l'osservazione dei risultati
-
Il metodo
GET /v1/sessions/{session_id}/observeResultè ora denominatoGET /v1/sessions/{session_id}/observe_result. Il nomeobserveResultè ancora supportato per la retrocompatibilità. - Nuovo supporto per il formato audio WAV (Waveform Audio File)
-
L'intestazione "
Content-Type" dei metodirecognizeora supportaaudio/wavper i file WAV (Waveform Audio File), oltre aaudio/flaceaudio/l16. Per ulteriori informazioni, vedi formato audio / wav. - Limiti sulla quantità massima di audio per il riconoscimento vocale
-
Il servizio ora ha un limite di 100 MB di dati per sessione nella modalità di streaming. È possibile specificare la modalità di streaming indicando il valore “
chunked” nell’intestazione “Transfer-Encoding”. La fornitura unica di un file audio impone ancora un limite di dimensione di 4 MB sui dati che vengono inviati. Per ulteriori informazioni, vedi Trasmissione audio. - Nuova intestazione per rifiutare di contribuire ai miglioramenti del servizio
-
I metodi
GET /v1/sessions/{session_id}/observe_result,POST /v1/sessions/{session_id}/recognizeePOST /v1/recognizeora includono il parametro di intestazioneX-WDC-PL-OPT-OUTper controllare se il servizio utilizza i dati di trascrizione e audio da una richiesta per migliorare i risultati futuri. L'interfaccia WebSocket include un parametro di query equivalente. Specifica un valore di1per evitare che il servizio utilizzi i risultati di trascrizione e audio. Il parametro si applica solo alla richiesta corrente. La nuova intestazione sostituisce l'intestazioneX-loggingdall'API beta. Vedi Controllo della registrazione delle richieste per i servizi Watson. - Modifiche ai codici di errore di HTTP
-
Il servizio può ora rispondere con i seguenti codici di errore HTTP:
- Per i metodi
/v1/models,/v1/models/{model_id},/v1/sessions,/v1/sessions/{session_id},/v1/sessions/{session_id}/observe_result,/v1/sessions/{session_id}/recognizee/v1/recognize, è stato aggiunto il codice di errore 415 ("Unsupported Media Type"). - Per le richieste di tipo "
POST" e "GET" inviate al metodo "/v1/sessions/{session_id}/recognize", vengono modificati i seguenti codici di errore:- Il codice di errore 404 ("Session_id not found") ha un messaggio più descrittivo (
POSTeGET). - Il codice di errore 503 ("Session is already processing a request. Concurrent requests are not allowed on the same session. La sessione rimane attiva dopo questo errore. ") ha un messaggio più descrittivo (solo
POST). - Per le richieste
POSTHTTP ai metodi/v1/sessionse/v1/recognize, può essere restituito il codice di errore 503 ("Service Unavailable"). Il codice di errore può essere restituito anche quando si crea una connessione di tipo " WebSocket " con il metodo/v1/recognize.
- Il codice di errore 404 ("Session_id not found") ha un messaggio più descrittivo (
- Per i metodi