Note sulla release per Text to Speech per IBM Cloud
IBM Cloud
Le seguenti funzionalità e modifiche sono state incluse in ogni versione e aggiornamento delle istanze gestite ospitate IBM Watson® Text to Speech su IBM Cloud o per le istanze ospitate su IBM Cloud Pak for Data as a Service. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.
Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.
Per informazioni sulle versioni e gli aggiornamenti del servizio per IBM Cloud Pak for Data, consultare le Note di rilascio per Text to Speech per IBM Cloud Pak for Data.
15 maggio 2026
- Nuova voce femminile in portoghese brasiliano dal tono naturale
-
Il servizio ora supporta una nuova voce femminile naturale per il portoghese brasiliano:
pt-BR_IsabelaNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi
26 marzo 2026
- Deprecata la transizione vocale da v1 a v3
-
Le voci concatenanti standard ( v1 ) precedentemente deprecate sono ora sostituite dai loro equivalenti neurali ( v3 ) durante la sintesi. Quando una richiesta specifica una di queste voci v1, viene utilizzata la voce v3 corrispondente.
de-DE_BirgitVoice->de-DE_BirgitV3Voicede-DE_DieterVoice->de-DE_DieterV3Voiceen-GB_KateVoice->en-GB_KateV3Voiceen-US_AllisonVoice->en-US_AllisonV3Voiceen-US_LisaVoice->en-US_LisaV3Voiceen-US_MichaelVoice->en-US_MichaelV3Voicees-ES_EnriqueVoice->es-ES_EnriqueV3Voicees-ES_LauraVoice->es-ES_LauraV3Voicees-LA_SofiaVoice->es-LA_SofiaV3Voicees-US_SofiaVoice->es-US_SofiaV3Voicefr-FR_ReneeVoice->fr-FR_ReneeV3Voiceit-IT_FrancescaVoice->it-IT_FrancescaV3Voiceja-JP_EmiVoice->ja-JP_EmiV3Voicept-BR_IsabelaVoice->pt-BR_IsabelaV3Voice
Se si omette il parametro opzionale
voiceda una richiesta di sintesi vocale, il servizio utilizza oraen-US_MichaelV3Voicecome impostazione predefinita. Questa voce neurale ( v3 ) sostituisce la precedente voce concatenante standard predefinita ( v1 ),en-US_MichaelVoice.
11 marzo 2026
- Importante: Deprecazione della funzione Beta "Tune by Example"
-
La funzione beta Tune by Example è deprecata. Le API per la creazione di nuovi prompt o modelli di altoparlanti non sono più supportate.
- Utenti esistenti: Le personalizzazioni esistenti che contengono già prompt o modelli di altoparlanti continueranno a funzionare per la sintesi vocale per un periodo di tempo limitato. Tuttavia, non è possibile creare nuovi prompt o modelli di altoparlanti.
- Nuovi utenti: Le API per la creazione di prompt o modelli di altoparlanti sono disattivate e non possono essere utilizzate.
La funzione Tune by Example sarà completamente rimossa dal servizio in una release futura. Una volta rimossa, la sintesi che utilizza personalizzazioni basate su prompt o modelli di altoparlanti non sarà più supportata.
13 gennaio 2026
- Nuove voci naturali inglesi
-
Il servizio ora supporta due nuove voci naturali, una maschile e una femminile, per l'inglese australiano:
en-AU_JackNaturalen-AU_HeidiNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi
5 dicembre 2025
- Nuove voci naturali in spagnolo latinoamericano
-
Il servizio ora supporta due nuove voci naturali, una maschile e una femminile, per lo spagnolo latinoamericano:
es-LA_AlejandroNaturales-LA_DanielaNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi
31 ottobre 2025
- Nuove voci naturali portoghesi brasiliane
-
Il servizio supporta ora due nuove voci naturali, una maschile e una femminile, per il portoghese brasiliano:
pt-BR_LucasNaturalpt-BR_CamilaNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi
24 luglio 2025
- Nuove voci naturali inglesi
-
Il servizio supporta ora quattro nuove voci naturali, due maschili e due femminili, per l'inglese statunitense:
en-US_EmmaNaturalen-US_EthanNaturalen-US_JacksonNaturalen-US_VictoriaNatural
Il servizio supporta ora due nuove voci naturali, maschile e femminile, per l'inglese britannico:
en-GB_ChloeNaturalen-GB_GeorgeNatural
Il servizio supporta ora una nuova voce femminile naturale per il CA English:
en-CA_HannahNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi
09 luglio 2025
- Deprecazione delle voci di V1
- A partire dal 07 settembre 2025, tutte le voci di V1 saranno deprecate dal servizio. Tutte le voci deprecate di v1 passeranno automaticamente alle voci corrispondenti di v3 entro i prossimi 12 mesi.
19 maggio 2025
- Voci di nuova generazione - Voci naturali
-
Il servizio supporta ora una nuova generazione di voci chiamate Natural Voices, con una nuova voce per l'inglese americano:
en-US_EllieNatural
Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedere Voci naturali.
- Il servizio ora supporta l'attributo opzionale
formatper il tag SSML<say-as interpret-as="letters" format="xx"> -
È ora possibile specificare il valore
grouposinglecon l'attributo opzionaleformat. Questi attributi aiutano a migliorare la leggibilità delle stringhe alfanumeriche, come la conferma di numeri e ID, aggiungendo silenzi strategici.
17 febbraio 2025
- Nuovo portoghese brasiliano maschile espressivo voce neurale
-
Il servizio ora supporta una nuova voce neurale espressiva maschile per il portoghese brasiliano:
pt-BR_LucasExpressive
Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi
09 dicembre 2024
- Nuova voce neurale espressiva maschile inglese UK
-
Il servizio supporta ora una nuova voce neurale maschile espressiva per l'inglese britannico:
en-GB_GeorgeExpressive
Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi
15 maggio 2024
- Nuova voce neurale femminile espressiva latino-americana spagnola
-
Il servizio ora supporta una nuova voce neurale espressiva femminile per lo spagnolo latinoamericano
es-LA_DanielaExpressive
Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi
16 gennaio 2024
- Miglioramenti Text to Speech per le voci espressive in inglese americano
- Quando si utilizzano le voci espressive in inglese americano, la sintesi è più veloce con latenza inferiore.
- Correzione del difetto: Problema di inflessione quando si usa il punto interrogativo (?) in un'espressione breve
- Correzione del difetto: quando alcune brevi espressioni terminavano con un punto interrogativo (?), l'inflessione veniva ignorata. Il problema è stato risolto.
30 novembre 2023
- Motore di sintesi Text to Speech migliorato per le voci della versione 3
- Il motore Text to Speech è migliorato per offrire una sintesi più rapida con latenza inferiore per le voci della versione 3.
- Voce Text to Speech migliorata en-AU_HeidiExpressive
- La voce Text to Speech en-AU_HeidiExpressive è stata migliorata e può regolare l'intonazione e la sintesi.
9 giugno 2023
- Correzione del difetto: Il TTS non fallisce più a causa del messaggio di errore "[Errno 2] No such file or directory"
- Correzione del difetto: Quando si usa il TTS con i websocket, non fallisce più a causa del messaggio di errore "[Errno 2] No such file or directory"
18 maggio 2023
- Correzione difetto: aggiunto il supporto per le funzioni SSML mancanti sulla voce olandese
- Fix Defect: quando si utilizza la voce olandese, tutte le funzionalità SSML supportate ora funzionano come progettato. In precedenza, quando si usava la voce olandese, alcune funzioni SSML non funzionavano.
- Correzione difetto: le virgole sono ora rispettate quando si utilizzano i tag fonemi
- Correzione del difetto: quando si utilizzano tag fonema in SSML, le virgole (pause) ora funzionano come previsto. In precedenza, quando le virgole precedevano o seguivano il testo con i tag fonemi, la pausa veniva ignorata.
6 aprile 2023
- Aggiornamenti alla versione beta olandese della voce neurale migliorata
- Fix dei difetti: la versione beta olandese olandese
nl-NL_MerelV3Voiceè stata aggiornata per correzioni e miglioramenti interni. Le limitazioni descritte per il rilascio iniziale della voce nella sezione aggiornamento del servizio al 31 marzo 2023 sono ancora valide.
31 marzo 2023
- Importante: Fine del servizio per tutte le voci neurali
-
Importante: tutte le voci neurali hanno raggiunto la data di fine del servizio e sono state rimosse dal servizio e dalla documentazione. Non sono interessate le voci neurali potenziate o le voci neurali espressive. Per un elenco completo di tutte le voci neurali obsolete, consultare gli aggiornamenti del servizio del 1° marzo 2023. Il tentativo di utilizzare una voce obsoleta restituisce il codice di risposta HTTP 404 con il messaggio '
Model '{voice}' not found.Nuove voci neurali avanzate ed espressive sono disponibili per l'inglese australiano, il coreano e l'olandese olandese. È necessario migrare a una delle nuove voci per l'inglese australiano, il coreano o l'olandese olandese per continuare a utilizzare le lingue obsolete.
Per ulteriori informazioni, vedi Lingue e voci.
22 marzo 2023
- Nuova versione beta olandese migliorata della voce neurale
-
Il servizio ora supporta una nuova voce femminile neurale migliorata per l'olandese olandese:
nl-NL_MerelV3Voice. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR).La nuova voce è una funzione beta in attesa del completamento del supporto per SSML. Nella versione iniziale, la voce non supporta l'uso delle seguenti funzioni relative a SSML:
- L'elemento
<prosody>con qualsiasi richiesta di sintesi vocale - I parametri
rate_percentageepitch_percentagecon qualsiasi richiesta di sintesi vocale - L'elemento
<mark>con una richiesta di sintesi vocale WebSocket - Il parametro
timingsdel messaggio di testo JSON con una richiesta di sintesi vocale WebSocket
Per ulteriori informazioni sulla nuova voce, il suo supporto per i simboli IPA e SPR e la migrazione alla nuova voce dalle voci neurali olandesi obsolete, vedi
- L'elemento
- Correzione del difetto: aggiornare i simboli fonetici coreani nella documentazione
-
Correzione di un difetto: Nella documentazione dei simboli SPR coreani, i simboli a due caratteri per le consonanti sono ora racchiusi tra virgolette singole, diventando così un unico simbolo. In precedenza, venivano mostrati come due simboli separati, senza virgolette. Per ulteriori informazioni, vedi Consonanti(coreano).
- Aggiornamenti della documentazione per i simboli SPR IBM
-
La documentazione di panoramica per i simboli SPR IBM è stata aggiornata per chiarire l'utilizzo di simboli a più caratteri. Per ulteriori informazioni, vedi Simboli audio vocale).
1 marzo 2023
- Importante: fine del servizio in sospeso per tutte le voci neurali
-
Importante: In vigore 31 marzo 2023, tutte le voci neurali raggiungono la data di fine del servizio e verranno rimosse dal servizio e dalla documentazione. Le voci neurali sono state depredate dal 31 marzo 2022. Nessuna voce neurale o espressiva migliorata viene influenzata.
Le seguenti voci neurali sono state rimosse:
- Arabo:
ar-MS_OmarVoice - Cinese (mandarino):
zh-CN_LiNaVoice,zh-CN_WangWeiVoice, ezh-CN_ZhangJingVoice - Ceco:
cs-CZ_AlenaVoice - Olandese (belga):
nl-BE_AdeleVoiceenl-BE_BramVoice - Olandese (Paesi Bassi):
nl-NL_EmmaVoiceenl-NL_LiamVoice - Inglese (australiano):
en-AU_CraigVoice,en-AU_MadisonVoiceeen-AU_SteveVoice - Coreano:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceeko-KR_YunaVoice - Svedese:
sv-SE_IngridVoice
Nuove voci neurali neurali ed espressive potenziate sono già disponibili per l'inglese australiano e il coreano. Nelle prossime settimane sarà disponibile una nuova voce neurale potenziata per la lingua olandese. È necessario migrare a una delle nuove voci per l'inglese australiano, coreano o olandese prima del 31 marzo 2023.
Per ulteriori informazioni, vedi Lingue e voci.
- Arabo:
27 febbraio 2023
- Nuove voci neurali espressive dell'inglese australiano
-
Il servizio ora supporta due nuove voci neurali espressive, maschile e femminile, per l'inglese australiano:
en-AU_HeidiExpressiveen-AU_JackExpressive
Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove versioni sono ora disponibili per l'uso in produzione. Supportano l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi
Puoi migrare dalle voci neurali dell'inglese australiano che sono obsolete alle nuove voci neurali espressive.
- Nuova voce neurale avanzata coreana
-
Il servizio ora supporta una nuova voce femminile neurale avanzata per il coreano:
ko-KR_JinV3Voice. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vediÈ possibile migrare dalle voci neurali coreane obsolete alla nuova voce neurale avanzata.
- Correzione difetto: la voce francese canadese ora gestisce correttamente gli orari numerici
-
Correzione del difetto: Le voci francese e canadese ora pronunciano correttamente i tempi come
19:41. In precedenza, le voci omettevano elementi del tempo nell'audio sintetizzato. - Correzione difetto: la voce giapponese non inserisce più un audio imprevisto
-
Correzione del difetto: la voce giapponese non inserisce più un audio non previsto nei risultati di sintesi vocale. In precedenza, in alcuni casi veniva inserito altro audio.
20 gennaio 2023
- Obsolescenza e migrazione di Cloud Foundry ai gruppi di risorse
-
IBM ha annunciato l'abbandono di IBM Cloud Foundry il 31 maggio 2022. A partire dal 30 novembre 2022, non sarà più possibile creare nuove applicazioni 'IBM 'Cloud Foundry e solo gli utenti esistenti potranno distribuire le applicazioni. IBM 'Cloud Foundry raggiungono la fine del supporto il 1° giugno 2023. Quindi, qualsiasi IBM Istanze runtime di applicazioni Cloud Foundry che eseguono IBM Cloud Foundry verranno disattivate, deprovisionate ed eliminate in modo permanente.
Per continuare a utilizzare le applicazioni IBM Cloud oltre il 1° giugno 2023, è necessario migrare ai gruppi di risorse prima di tale data. I gruppi di risorse sono concettualmente simili agli spazi di Cloud Foundry. Tra questi figurano diversi vantaggi aggiuntivi, quali un controllo degli accessi più granulare grazie all'utilizzo dell'IAM ( IBM Cloud Identity and Access Management ), la possibilità di collegare le istanze di servizio ad app e servizi in diverse regioni e un modo semplice per visualizzare i dati di utilizzo per gruppo.
- Correzione difetto: la specifica di numeri cardinali grandi con l'elemento
<say-as>non causa più errori per le voci inglesi -
Correzione del difetto: è ora possibile utilizzare l'elemento
<say-as>per pronunciare numeri grandi come numeri cardinali. In precedenza, racchiudere un numero grande nell'elemento<say-as>con l'attributointerpret-as="cardinal"poteva causare il fallimento della sintesi vocale per le voci inglesi. Ad esempio,<say-as interpret-as="cardinal">3,200</say-as>potrebbe far sì che il servizio generi un errore. Per ulteriori informazioni, consultare cardinale nell'argomento Elementi SSML. - Correzione del difetto: gli omonimi e altre parole sono ora pronunciati correttamente dalle voci inglesi
-
Correzione del difetto: il servizio ora pronuncia gli omonimi e altre parole correttamente in base al loro contesto nel testo inglese che deve essere sintetizzato. In precedenza, parole come
advocateewifipotevano essere pronunciate in modo errato dalle voci inglesi.
30 novembre 2022
- Correzione del difetto: aggiungere regole per la documentazione di denominazione del modello personalizzato
- Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli personalizzati. Per ulteriori informazioni, vedi
7 ottobre 2022
- Il servizio ora applica una convalida SSML più rigorosa
- Il servizio ora applica una convalida più rigorosa del testo di input che include gli elementi SSML (Speech Synthesis Markup Language). Gli elementi richiesti degli attributi devono essere specificati con valori validi. Altrimenti, la richiesta ha esito negativo con un codice di errore 400. Per ulteriori informazioni sulla convalida SSML e sui requisiti che il testo contrassegnato deve soddisfare, consultare Convalida SSML.
- Correzione del difetto: Il genere indicato per la voce
en-US_MichaelExpressiveè ora corretto - Correzione del difetto: quando si elencano le informazioni sulle voci disponibili, il
genderdella voceen-US_MichaelExpressiveè oramale. In precedenza, il genere della voce era erroneamente descritto comefemale. Per ulteriori informazioni, vedi Elenco delle informazioni sulle voci.
23 settembre 2022
- Nuove voci neurali espressive in inglese americano
-
Il servizio offre quattro nuove voci neurali espressive per l'inglese americano:
en-US_AllisonExpressiveen-US_EmmaExpressiveen-US_LisaExpressiveen-US_MichaelExpressive
Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove versioni sono ora disponibili per l'uso in produzione. Supportano l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi
- Nuovi stili di conversazione per voci neurali espressive
-
Le voci neurali espressive determinano il sentimento del testo dal contesto delle parole e delle frasi. Il discorso che producono, oltre ad avere uno stile colloquiale, riflette l'umore del testo. Ma puoi abbellire le tendenze naturali delle voci indicando che tutto o parte del testo è quello di enfatizzare uno dei seguenti stili parlanti:
- Allegro- Esprime felicità e buone notizie.
- Empatico- Esprime empatia o simpatia.
- Neutrale- Esprime obiettività e uniformità.
- Incerto- Esprime confusione o incertezza.
Per ulteriori informazioni, consultare Utilizzo degli stili di conversazione.
- Nuova enfasi di interezione con voci neurali espressive
-
Con le voci neurali espressive, il servizio rileva automaticamente un insieme di interiezioni comuni basate sul contesto. Quando sintetizza queste interiezioni, dà loro l'enfasi naturale che un essere umano userebbe nella conversazione normale. Per alcune delle interezioni, è possibile utilizzare SSML per abilitarne o disabilitarne l'enfasi. Per ulteriori informazioni, vedi Enfatizzazione delle interiezioni.
- Enfatizzazione di nuove parole con voci neurali espressive
-
Le voci espressive utilizzano uno stile conversazionale che applica naturalmente l'intonazione corretta dal contesto. Ma si può indicare che una o più parole devono essere date più o meno enfasi. La variazione dello stress può essere indicata da un aumento o una diminuzione dell'altezza, del tempo, del volume o di altri attributi acustici. Per ulteriori informazioni, vedi Sottolineatura delle parole.
21 settembre 2022
- Nuovo evento Activity Tracker per l'eliminazione delle informazioni utente da parte del GDPR
- Il servizio ora restituisce un evento Activity Tracker quando utilizzi il metodo
DELETE /v1/user_dataper eliminare tutte le informazioni su un utente. L'evento è denominatotext-to-speech.gdpr-user-data.delete. Per ulteriori informazioni, vedi Eventi Activity Tracker. - Correzione difetto: le traduzioni di parole personalizzate ora accettano virgole in tutti i casi
- Correzione del difetto: le traduzioni di parole aggiunte ai modelli personalizzati ora accettano le virgole in tutti i casi. In precedenza, una virgola in una traduzione poteva occasionalmente far sì che la traduzione non generasse un audio valido quando veniva utilizzata per le sintesi vocali. Questo problema è stato identificato nei modelli personalizzati in inglese americano.
- Correzione del difetto: la sintesi francese delle date è ora coerente
- Correzione del difetto: la sintesi francese non include più l'articolo "le" prima delle date del formato " ordinale di mese." In precedenza, l'articolo era incluso solo per il primo giorno del mese per il francese (per esempio, "il primo di settembre", "le premier septembre").
- Limitazioni note all'utilizzo del formato audio Ogg con il browser Safari
- Per impostazione predefinita, il servizio restituisce l'audio nel formato audio Ogg con il codec Opus
audio/ogg;codecs=opus). Tuttavia, il formato audio Ogg non è supportato dal browser Safari. Se si utilizza il servizio Text to Speech con il browser Safari, è necessario specificare un formato diverso in cui si desidera che il servizio restituisca l'audio.- Per ulteriori informazioni sui formati disponibili, vedi Formati audio supportati.
- Per ulteriori informazioni su come specificare un formato, vedi Specifica di un formato audio.
31 agosto 2022
- Nuovo parametro di query beta
rate_percentageper il controllo della velocità di conversazione globale - Il servizio offre un nuovo parametro di query
rate_percentageper modificare la frequenza di conversazione per una richiesta di sintesi vocale. La velocità di conversazione è la velocità con cui il servizio pronuncia il testo che sintetizza in voce. Un tasso più elevato fa sì che il testo venga pronunciato più rapidamente; un tasso più basso fa sì che il testo venga pronunciato più lentamente. Il parametro modifica la frequenza predefinita per voce per un'intera richiesta. Per ulteriori informazioni, vedi Modifica della velocità di conversazione. - Nuovo parametro di query beta
pitch_percentageper il controllo del tono di conversazione globale - Il servizio offre un nuovo parametro di interrogazione
pitch_percentageper modificare il tono di conversazione per una richiesta di sintesi. Il tono di conversazione rappresenta il tono del discorso che il servizio sintetizza. Rappresenta quanto alto o basso è il tono della voce percepito dall'ascoltatore. Un tono più alto si traduce in un discorso che è parlato con un tono più alto ed è percepito come una voce più alta; un tono più basso si traduce in un discorso che è parlato con un tono più basso ed è percepito come una voce più bassa. Il parametro modifica il tono predefinito per voce per un'intera richiesta. Per ulteriori informazioni, consultare la sezione Modifica del tono di conversazione. - Correzione dei difetti: la sintesi giapponese è migliorata per gestire lunghe stringhe di testo di input
- Correzione del difetto: il servizio ora sintetizza correttamente le richieste giapponesi che includono lunghe stringhe di caratteri. In precedenza, il servizio non riusciva a sintetizzare correttamente lunghe stringhe di testo giapponese.
- Aggiornamenti della documentazione per l'elemento
<prosody>SSML - La documentazione per l'elemento
<prosody>SSML e i relativi parametripitcherateè stata migliorata e chiarita. Ora include anche una descrizione delle differenze tra il servizio e la versione più recente della specifica SSML. Per ulteriori informazioni, vedere Elemento<prosody>.
3 agosto 2022
- Il servizio non supporta la sintesi vocale multilingue
- Il servizio non supporta attualmente la sintesi vocale multilingue. Tuttavia, è possibile utilizzare la personalizzazione per approssimare la pronuncia delle parole da altre lingue. Per ulteriori informazioni, vedi sintesi vocale multilingue.
27 luglio 2022
- Nuovo parametro beta
spell_out_modeper le voci tedesche - Per indicare come devono essere scritti i singoli caratteri di una stringa, è ora possibile includere il parametro della query beta
spell_out_modecon una richiesta di sintesi per una voce tedesca. Per impostazione predefinita, il servizio espone singoli caratteri alla stessa velocità con cui sintetizza il testo per una lingua. È possibile utilizzare il parametro per indicare al servizio di specificare i singoli caratteri più lentamente, in gruppi di uno, due o tre caratteri. Utilizzare il parametro con l'elemento SSML<say-as>per controllare il modo in cui vengono sintetizzati i caratteri di una stringa. Per ulteriori informazioni, consultare Specifica del modo in cui le stringhe vengono scritte.
25 maggio 2022
- Nuovo supporto per il formato audio
audio/alaw - L'elenco dei formati audio supportati ora include l'
audio/alaw;rate={rate}. Comeaudio/basiceaudio/mulaw, questo formato offre audio monocanale codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio.
19 maggio 2022
- Correzione difetto: più tag SSML
<phoneme>consecutive sono ora analizzate correttamente - Correzione del difetto: il servizio ora sintetizza correttamente il testo che contiene tag
<phoneme>consecutive. In precedenza, se il testo conteneva due o più tag<phoneme>consecutivi, il servizio sintetizzava solo la prima tag, ignorando le altre.
31 marzo 2022
- Importante: Deprecazione di tutte le voci neurali
-
Importante: In vigore 31 marzo 2022, tutte le voci neurali sono obsolete. Le voci obsolete restano disponibili agli utenti esistenti fino al 31 marzo 2023, quando verranno rimosse dal servizio e dalla documentazione. Nessuna voce neurale o voce espressiva migliorata è obsoleta.
Le seguenti voci neurali sono ora obsolete:
- Arabo:
ar-MS_OmarVoice - Cinese (mandarino):
zh-CN_LiNaVoice,zh-CN_WangWeiVoice, ezh-CN_ZhangJingVoice - Ceco:
cs-CZ_AlenaVoice - Olandese (belga):
nl-BE_AdeleVoiceenl-BE_BramVoice - Olandese (Paesi Bassi):
nl-NL_EmmaVoiceenl-NL_LiamVoice - Inglese (australiano):
en-AU_CraigVoice,en-AU_MadisonVoiceeen-AU_SteveVoice - Coreano:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceeko-KR_YunaVoice - Svedese:
sv-SE_IngridVoice
Le voci neurali obsolete continuano ad essere disponibili per gli utenti esistenti ma non sono più disponibili per i nuovi utenti:
- Utenti esistenti: le Istanze del servizio create prima del 31 marzo 2022 possono continuare a utilizzare le voci obsolete per la sintesi vocale. Le istanze possono anche essere usate per creare e lavorare con modelli
personalizzati che si basano sulle voci deprecate. E possono continuare a elencare e interrogare le voci con i metodi
GET /v1/voices/{voice}eGET /v1/voices. - Nuovi utenti: Le istanze del servizio create a partire dal 31 marzo 2022 non possono utilizzare le voci deprecate per la sintesi vocale. Le istanze non possono nemmeno essere usate per creare modelli personalizzati basati
sulle voci deprecate. E non possono elencare o interrogare le voci con i metodi
GET /v1/voiceseGET /v1/voices/{voice}. Qualsiasi chiamata API che includa una delle voci deprecate restituisce un codice di errore HTTP 400 o 404, a seconda della chiamata.
Le nuove voci per l'inglese australiano, l'olandese e il coreano saranno rilasciate entro il 15 febbraio 2023. Se stai utilizzando voci australiane in inglese, olandese o coreano, le tue chiamate API verranno automaticamente reindirizzate alle nuove voci in tale lingua. Le voci in arabo, cinese, ceco, svedese e fiammingo saranno rimosse dal servizio.
Per ulteriori informazioni su tutte le lingue e le voci disponibili, vedi Lingue e voci.
- Arabo:
- Le voci standard obsolete vengono rimosse dalla documentazione
-
Le voci di concatenazione standard sono state deprecate il 2 dicembre 2020. Queste voci standard sono state ora rimosse dalla guida di riferimento API. Anche l'argomento Migrating from standard to neural voices è stato rimosso dalla pagina Languages and voices.
Allo stesso modo, il nome precedente della voce araba,
ar-AR_OmarVoice, era obsoleto allo stesso tempo. Anche questo è stato rimosso dalla documentazione. Utilizzare invece la vocear-MS_OmarVoice.
28 febbraio 2022
- Modifica in risposta di temporizzazione parola per l'interfaccia WebSocket
-
L'oggetto di risposta che il servizio invia quando si richiede la temporizzazione delle parole con l'interfaccia WebSocket è cambiato. Il servizio ora invia i risultati di temporizzazione parola in un singolo array che include una stringa seguita da due float:
{ "words": [ ["Hello", 0.0, 0.259], ["world", 0.259, 0.532] ] }Il servizio ha precedentemente inviato i risultati di temporizzazione come un array che includeva una stringa seguita da un array di due float:
{ "words": [ ["Hello", [0.0629826778195474, 0.2590192737303819]], ["world", [0.2598829173456253, 0.5322130804452672]] ] }Inoltre, il livello di precisione per i tempi e i contrassegni delle parole è ora ridotto a tre posizioni decimali. Per ulteriori informazioni sulle nuove risposte, vedi Generazione degli orari delle parole.
Nota: in passato i risultati per le voci neurali e neurali avanzate erano diversi. Queste incongruenze potrebbero causare errori per gli SDK Watson SDK. I risultati per tutte le voci sono ora coerenti.
26 gennaio 2022
- Correzione difetto: migliorare la documentazione SSML
- Fix Defect: la documentazione SSML è stata aggiornata per correggere i seguenti errori:
- Gli esempi dell'elemento
<break>sono ora corretti. L'elemento è unario, come ora mostrato negli esempi. Gli esempi precedenti includevano tag di apertura e chiusura con testo incorporato. Il testo incorporato non è stato pronunciato dal servizio. Per ulteriori informazioni, vedere Elemento<break>. - Il servizio supporta la versione SSML 1.1. Tutti i riferimenti e gli esempi ora utilizzano la versione corretta. La documentazione si riferiva in precedenza alla versione 1.0.
- Gli esempi dell'elemento
3 dicembre 2021
- Nuova voce neurale ceca:
cs-CZ_AlenaVoice -
Una nuova lingua, il ceco, con una nuova voce femminile,
cs-CZ_AlenaVoice, è ora disponibile. La voce è una voce neurale. - Nuova voce neurale olandese belga:
nl-BE_BramVoice -
Una nuova voce maschile belga olandese (fiammingo),
nl-BE_BramVoice, è ora disponibile. La voce è una voce neurale. - Correzione dei difetti: migliorare la sintesi vocale e SSML
-
Fix Defect: i seguenti difetti per SSML (Speech Synthesis Markup Language) e sintesi vocale sono stati corretti con questa release:
- L'attributo
pitchdell'elemento<prosody>viene ora applicato a tutto il testo specificato. In precedenza, il cambiamento di tono non era sempre applicato alla prima parola del testo interessato. Inoltre, la documentazione ora include maggiori indicazioni su come specificare un valorepitchPer ulteriori informazioni, consultare L'attributopitch. - La sintesi vocale del testo giapponese ora parla l'audio più lentamente. In precedenza, il discorso sintetizzato veniva pronunciato troppo rapidamente. Se si rileva che la sintesi del testo in giapponese è ancora parlata troppo rapidamente
per la propria applicazione, utilizzare l'attributo
ratedell'elemento SSML<prosody>per controllare la frequenza del discorso. Per ulteriori informazioni, consultare L'attributorate. - Le voci neurali ora analizzano correttamente il carattere apostrofo escape (
'). In precedenza, alcune voci neurali non interpretavano correttamente il carattere.
- L'attributo
22 ottobre 2021
- Miglioramenti multipli della voce neurale
- Le voci neurali esistenti per il cinese, l'olandese (belga e olandese), l'inglese australiano e il coreano sono state aggiornate per migliorare la sintesi vocale e migliorare i risultati audio. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.
- Nuova voce neurale inglese australiano:
en-AU_SteveVoice - Una nuova voce maschile australiana inglese,
en-AU_SteveVoice, è ora disponibile. La voce è una voce neurale. - Nuova voce neurale svedese:
sv-SE_IngridVoice - Una nuova lingua, lo svedese, con una nuova voce femminile,
sv-SE_IngridVoice, è ora disponibile. La voce è una voce neurale.
6 ottobre 2021
- Nuovo supporto HIPAA degli Stati Uniti per i piani Premium nella sede di Dallas
- Il supporto HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti è ora disponibile per i piani Premium ospitati nell'ubicazione Dallas (
us-south). Per ulteriori informazioni, consultare la legge sulla portabilità e la responsabilità in materia di assicurazione sanitaria(HIPAA). - Correzione dei difetti: migliorare la voce neurale potenziata dello spagnolo latino americano
- Fix Defect: per la voce spagnola latinoamericana (
es-LA_SofiaV3Voice), le domande di tutti i tipi utilizzano ora l'intonazione corretta.
16 settembre 2021
- Correzione dei difetti: Migliora le voci neurali avanzate spagnole e nordamericane
- Correzione del difetto: per le voci spagnolo castigliano (
es-ES_EnriqueV3Voiceees-ES_LauraV3Voice) e spagnolo nordamericano (es-US_SofiaV3Voice), le domande di tutti i tipi ora utilizzano l'intonazione corretta. Per la voce spagnola latinoamericana (es-LA_SofiaV3Voice), alcune domande non utilizzano l'intonazione corretta e suonano invece come dichiarazioni. La voce spagnola latino-americana sarà presto sistemata.
16 luglio 2021
- Nuova voce neurale olandese belga:
nl-BE_AdeleVoice - Il servizio ora supporta l'olandese belga (fiammingo) con la voce neurale
nl-BE_AdeleVoice. La voce belga olandese supporta la personalizzazione ed è generalmente disponibile (GA) per uso di produzione.
12 aprile 2021
- Nuova voce neurale migliorata in francese canadese:
fr-CA_LouiseV3Voice -
Il servizio ora supporta il francese canadese con la voce neurale avanzata
fr-CA_LouiseV3Voice. La voce francese canadese supporta la personalizzazione ed è generalmente disponibile (GA) per uso di produzione.- Per ascoltare un esempio della nuova voce, vedi Lingue e voci supportate.
- Per ulteriori informazioni sui simboli fonetici e sui valori Unicode disponibili per la lingua francese canadese, vedi Simboli francesi(canadesi).
- Nuova funzione di ottimizzazione per esempio
-
La nuova funzione Tune by Example consente di controllare il modo in cui il servizio pronuncia il testo specificato. Si tratta di una funzione beta supportata solo per i modelli e le voci personalizzate in inglese americano. Ha due componenti:
- I prompt personalizzati includono il testo scritto che deve essere pronunciato e l'audio registrato che parla il testo come vuoi ascoltarlo. L'audio specifica l'intonazione, la cadenza e lo stress del testo sintetizzato. Il prompt può enfatizzare diverse sillabe o parole, introdurre pause e in generale rendere il suono audio sintetizzato più naturale e appropriato per il suo contesto.
- I modelli di altoparlanti forniscono l'audio di registrazione per un utente che parla una o più richieste. Un modello di altoparlante fornisce un esempio audio della voce di un utente. Il servizio si allena sulla voce, che può aiutare a produrre suggerimenti di qualità superiore per quell' altoparlante.
Specifica una richiesta personalizzata con una richiesta di sintesi vocale per indicare come la voce del servizio deve pronunciare il testo. Per specificare una richiesta, utilizzare l'estensione SSML
<ibm:prompt id="{prompt_id}"/>. L'audio sintetizzato duplica la prosodia del prompt. - Nuovi Metodi Tune be Example
-
Il servizio include otto nuovi metodi per lavorare con la funzione Tune by Example. Le descrizioni dei nuovi metodi che seguono forniscono i collegamenti alle rispettive voci nel riferimento dell'API e dell'SDK. Potrebbe essere necessario selezionare la scheda
Curldel riferimento per visualizzare i nuovi metodi.-
Il servizio include quattro metodi per gestire i prompt personalizzati:
- Elenco prompt personalizzati:
GET /v1/customizations/{customization_id}/prompts - Richiama una richiesta personalizzata:
GET /v1/customizations/{customization_id}/prompts/{prompt_id} - Eliminare un prompt personalizzato:
DELETE /v1/customizations/{customization_id}/prompts/{prompt_id}
- Elenco prompt personalizzati:
-
Il servizio include quattro metodi per lavorare con i modelli di altoparlanti:
- Elenca modelli di altoparlanti:
GET /v1/speakers - Scarica un modello di altoparlante:
GET /v1/speakers/{speaker_id} - Eliminare un modello di altoparlante:
DELETE /v1/speakers/{speaker_id}
- Elenca modelli di altoparlanti:
-
- Aggiornamenti alle azioni del Activity Tracker per la personalizzazione
-
I nomi delle azioni per gli eventi Activity Tracker per i metodi di personalizzazione sono cambiati. Le azioni ora includono la stringa
custom-modelinvece dicustom-voice. I vecchi nomi delle azioni sono obsoleti. I vecchi nomi sono ancora disponibili per l'uso ma verranno rimossi in una data futura. Migrare ai nuovi nomi elencati in Eventi di personalizzazione al più presto.Crea eventi Nome azione obsoleto-> Nuovo nome azione
text-to-speech.custom-voice.create->text-to-speech.custom-model.createtext-to-speech.custom-voice-word-list.create->text-to-speech.custom-model-word-list.createtext-to-speech.custom-voice-word.create->text-to-speech.custom-model-word.create
Leggi gli eventi Nome azione obsoleto-> Nuovo nome azione
text-to-speech.custom-voice-list.read->text-to-speech.custom-model-list.readtext-to-speech.custom-voice.read->text-to-speech.custom-model.readtext-to-speech.custom-voice-word-list.read->text-to-speech.custom-model-word-list.readtext-to-speech.custom-voice-word.read->text-to-speech.custom-model-word.read
Aggiorna evento Nome azione obsoleto-> Nuovo nome azione
text-to-speech.custom-voice.update->text-to-speech.custom-model.update
Elimina eventi Nome azione obsoleta-> Nuovo nome azione
text-to-speech.custom-voice.delete->text-to-speech.custom-model.deletetext-to-speech.custom-voice-word.delete->text-to-speech.custom-model-word.delete
2 dicembre 2020
- Miglioramenti multipli della voce
-
Le voci offerte dal servizio hanno subito un cambiamento significativo. Il servizio supporta nuove lingue e voci, ha migliorato la qualità di molte voci e ha deprecato molte voci più vecchie. Inoltre, tutte le voci dei servizi sono ora personalizzabili e generalmente disponibili (GA) per l'uso in produzione.
- Nuove voci neurali neurali e potenziate
-
Per ottimizzare la qualità complessiva della sintesi vocale, tutte le voci disponibili sono ora basate sulla tecnologia neurale. Il servizio offre due tipi di voci basate sulla tecnologia neurale:
- Le voci neurali, che non includono la stringa
V3nei loro nomi, sono ora disponibili per l'arabo, l'inglese australiano, il cinese, l'olandese e il coreano. Le voci neurali supportano l'utilizzo dell'alfabeto fonetico internazionale (IPA) con l'elemento<phoneme>SSML (Speech Synthesis Markup Language). - Le voci neurali avanzate, che includono la stringa
V3nei relativi nomi, sono ora disponibili per il portoghese brasiliano, il Regno Unito e l'inglese degli Stati Uniti, il francese, il tedesco, l'italiano, il giapponese e lo spagnolo (tutti dialetti). Le voci neurali migliorate supportano l'utilizzo di IPA e IBM SPR (Symbolic Phonetic Representation) con l'elemento SSML<phoneme>. Le voci neurali migliorate raggiungono anche un grado leggermente più alto di suono naturale. Nei prossimi mesi sono previste ulteriori possibilità di personalizzazione per migliorare le voci neurali.
Il servizio non offre più voci standard per nessuna lingua. Le voci standard utilizzavano la sintesi concatenata per assemblare segmenti di parlato registrato e generare l'audio richiesto.
Per ulteriori informazioni, vedi Lingue e voci.
- Le voci neurali, che non includono la stringa
- Nuove voci neurali dell'inglese australiano e del coreano
-
Le seguenti voci australiane in inglese e coreano sono nuove:
- Il servizio ora supporta l'inglese australiano con le seguenti due voci neurali:
en-AU_CraigVoiceeen-AU_MadisonVoice. - Il servizio ora supporta due nuove voci neurali coreane:
ko-KR_HyunjunVoiceeko-KR_SiWooVoice.
- Il servizio ora supporta l'inglese australiano con le seguenti due voci neurali:
- Voci neurali migliorate
-
Le voci per le lingue esistenti arabo, cinese, olandese e coreano, che si concatenavano, sono ora neurali:
ar-MS_OmarVoiceko-KR_YoungmiVoiceko-KR_YunaVoicenl-NL_EmmaVoicenl-NL_LiamVoicezh-CN_LiNaVoicezh-CN_WangWeiVoicezh-CN_ZhangJingVoice
Sono state inoltre apportate le seguenti altre modifiche:
- La voce araba è ora denominata
ar-MS_OmarVoice. Il nome precedente,ar-AR_OmarVoice, è obsoleto. Continuerà a funzionare per almeno un anno, ma potrebbe essere rimosso in una data futura. Si consiglia di migrare al nuovo nome appena possibile. - La lingua araba ora supporta l'uso di simboli IPA e valori Unicode con l'elemento
<phoneme>SSML. Per creare un modello personalizzato per l'arabo, devi utilizzare l'ID linguaar-MS. L'identificativoar-ARnon è supportato per la personalizzazione. - I simboli IPA per la lingua araba sono nuovi. I simboli precedentemente documentati sono stati sostituiti.
- I simboli IPA per la lingua olandese sono stati modificati come segue:
- Olandese non supporta più i seguenti simboli IPA:
tʲ(0074+02B2),ɲ(0272),ʦ(02A6) eʔ(0294). - Olandese Paesi Bassi ora supporta il seguente simbolo IPA:
ɣ(0263).
- Olandese non supporta più i seguenti simboli IPA:
- Voci standard obsolete
-
Le seguenti voci di concatenazione standard sono ora deprecate:
de-DE_BirgitVoicede-DE_DieterVoiceen-GB_KateVoiceen-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicees-ES_LauraVoicees-LA_SofiaVoicees-US_SofiaVoicefr-FR_ReneeVoiceit-IT_FrancescaVoiceja-JP_EmiVoicept-BR_IsabelaVoice
Tutte le voci standard che sono state rese obsolete hanno controparti neurali equivalenti, quindi nessuna voce viene portata via. Piuttosto, puoi passare alla versione neurale equivalente della voce (ad esempio, da
de-DE_BirgitVoiceade-DE_BirgitV3Voice) per ottenere risultati di sintesi vocale migliori.Queste voci obsolete vengono rimosse dalla documentazione pubblicata. Essi continueranno a funzionare per almeno un anno, ma potrebbero essere rimossi in una data futura. Si consiglia di migrare alle voci neurali equivalenti appena possibile.
Se si omette il parametro facoltativo
voiceda una richiesta di sintesi vocale, il servizio utilizza per impostazione predefinitaen-US_MichaelV3Voice. Questa voce neurale sostituisce la voce standarden-US_MichaelVoiceora obsoleta che era il valore predefinito precedente. - Funzioni obsolete
-
Le seguenti funzioni erano disponibili solo per le voci concatenate standard. Sono obsoleti e sono stati rimossi dalla documentazione pubblicata. Essi continueranno a funzionare per almeno un anno, ma potrebbero essere rimossi in una data futura. Si consiglia di rimuovere queste funzionalità dalle applicazioni e di migrare alle voci neurali al più presto.
- SSML espressivo. Questa era una estensione IBM per SSML supportata solo per la voce
en-US_AllisonVoice. - Trasformazione della voce SSML. Questa era un'estensione IBM a SSML supportata solo per le voci
en-US_AllisonVoice,en-US_LisaVoiceeen-US_MichaelVoice. - L'attributo
volumedell'elemento Questo attributo era disponibile per tutte le voci standard..
L'inclusione di questi elementi SSML in una richiesta di sintesi per una voce neurale genera un codice di risposta HTTP 400 perché la richiesta non supera la convalida SSML. Per ulteriori informazioni sulla convalida SSML, vedi Convalida SSML.
- SSML espressivo. Questa era una estensione IBM per SSML supportata solo per la voce
- Nuovo supporto per la condivisione di risorse tra origini
-
Il supporto Cross-Origin Resource Sharing ( CORS ) è ora disponibile per tutte le voci dei browser Google Chrome™ e Apple® Safari. Non è disponibile dal browser Mozilla Firefox™ per le voci nelle seguenti lingue: Arabo, inglese australiano, cinese, olandese e coreano. Per ulteriori informazioni, vedere Utilizzo del supporto CORS.
10 settembre 2020
- Correzione difetto: migliorare la voce giapponese
-
Correzione difetto: per la voce
ja-JP_EmiV3Voice, ora il servizio analizza correttamente il testo di input SSML che include una specifica di prosody rate. In precedenza, il seguente utilizzo dell'elementofunzionava correttamente:<speak>成功する/繁栄する</speak>Tuttavia, l'uso successivo dell'attributo
ratecon l'elementoha fatto sì che il servizio leggesse e riproducesse la notazione SSML incorporata:<speak> <prosody rate="fast">成功する/繁栄する</prosody> </speak>Il servizio ora analizza e applica correttamente l'attributo
ratedell'elementoper l'immissione di testo in giapponese.
4 settembre 2020
- L'interfaccia di personalizzazione è ora disponibile per tutti
- L'interfaccia di personalizzazione è ora disponibile al pubblico (GA). La personalizzazione non è più una funzionalità in versione beta. Puoi utilizzare l'interfaccia di personalizzazione per specificare il modo in cui il servizio pronuncia le parole inusuali presenti nel tuo input creando dizionari personalizzati specifici della lingua. Può essere utilizzata con tutte le voci generalmente disponibili e quelle beta. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.
24 giugno 2020
- Nuove voci neurali inglesi e francesi
-
Il servizio offre ora due nuove voci sintetizzate:
- Inglese britannico:
en-GB_CharlotteV3Voice - Francese:
fr-FR_NicolasV3Voice
Offre inoltre una versione migliorata della voce neurale britannica già esistente,
en-GB_KateV3Voice. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci. - Inglese britannico:
- Supporto per l'attributo SSML
digitsdell'elemento<say-as>per il giapponese -
Il servizio ora supporta l'attributo «
digits» dell'elemento «<say-as>» in SSML con la voce in giapponese. Per ulteriori informazioni, vedi L'elemento say-as.
1 aprile 2020
- Nuove voci standard coreane:
ko-KR_YoungmiVoiceeko-KR_YunaVoice -
Il servizio ora supporta due voci femminili in coreano standard:
ko-KR_YoungmiVoiceeko-KR_YunaVoice. Le seguenti informazioni si applicano a entrambe le voci in coreano.- Le voci sono funzioni beta. Potrebbero non essere pronte per l'uso in produzione e sono soggette a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
- Le voci supportano la personalizzazione e il metodo "
/v1/pronunciation". - I comandi vocali supportano l'elemento
e il parametrotimings, disponibili nell'interfacciaWebSocket. - Le voci supportano tutti gli elementi SSML (Speech Synthesis Markup Language) ad eccezione dell'SSML di espressività e dell'SSML per la trasformazione della voce.
- Le voci supportano solo l'Alfabeto Fonetico Internazionale (IPA), non la Rappresentazione Fonetica Simbolic IBM a (SPR), con l'elemento
.
- Nuovo supporto per le voci in arabo, cinese e olandese
-
Le voci in arabo, cinese e olandese (versione beta) ora supportano le seguenti funzionalità:
- Personalizzazione e metodo
/v1/pronunciation. - L'elemento
e il parametrotimings, disponibili nell'interfacciaWebSocket.
Vedi le seguenti sezioni per ulteriori informazioni:
- Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.
- Per ulteriori informazioni sull'utilizzo dell'interfaccia WebSocket per ottenere i tempi delle parole, vedi Generazione dei tempi delle parole.
- Per ulteriori informazioni sulla personalizzazione, vedi Informazioni sulla personalizzazione.
- Per ulteriori informazioni sull'uso dell'IPA e dell'SPR con personalizzazione, consultare la sezione " Introduzione ai simboli fonetici ". (I simboli IPA per l'arabo, il cinese, l'olandese e il coreano non sono ancora stati documentati.) (Questa documentazione sarà presto disponibile.)
- Personalizzazione e metodo
24 febbraio 2020
- Nuove voci neurali in inglese americano e tedesco
-
Il servizio ora supporta cinque nuove voci neurali:
en-US_EmilyV3Voice,en-US_HenryV3Voice,en-US_KevinV3Voiceeen-US_OliviaV3Voice- Tedesco:
de-DE_ErikaV3Voice
Le nuove voci non supportano i seguenti elementi SSML:
- SSML espressivo con l'elemento
- Trasformazione della voce con l'elemento
- L'attributo
volumedell'elemento
Per ulteriori informazioni in merito e su tutte le voci disponibili, vedi Lingue e voci.
- Nuovo supporto per Activity Tracker
-
Il servizio ora supporta l'utilizzo di eventi Activity Tracker per tutte le operazioni di personalizzazione. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud. Puoi utilizzare questo servizio per indagare su attività anomale e azioni critiche e per rispettare i requisiti di controllo normativi. Inoltre, puoi essere avvertito in merito alle azioni non appena si verificano. Per ulteriori informazioni, vedi Eventi Activity Tracker.
18 dicembre 2019
- Nuove voci standard in arabo, cinese e olandese
-
Il servizio ora supporta sei nuove voci standard in tre nuove lingue:
- Arabo
ar-AR_OmarVoice - Cinese (mandarino):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceezh-CN_ZhangJingVoice - Paesi Bassi (olandese):
nl-NL_EmmaVoiceenl-NL_LiamVoice
Le seguenti informazioni si applicano a queste nuove voci standard:
- Le nuove voci sono funzioni beta. Le voci potrebbero non essere pronte per l'uso in produzione e sono soggette a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
- I dispositivi non supportano l'elemento
e il parametrotimings, disponibili nell'interfacciaWebSocket. - Le voci non supportano la personalizzazione né il metodo
/v1/pronunciation. - Le voci non supportano l'SSML di espressività o l'SSML per la trasformazione della voce.
- Le voci non supportano tutti gli altri elementi SSML. Tuttavia, supportano solo l'Alfabeto Fonetico Internazionale (IPA), non la Rappresentazione Fonetica Simbolic IBM a (SPR), con l'elemento
.
Per ulteriori informazioni in merito e su tutte le voci disponibili, vedi Lingue e voci.
- Arabo
12 dicembre 2019
- Supporto completo per IAM IBM Cloud
-
Il servizio Text to Speech ora supporta l'implementazione completa di IBM Cloud Identity and Access Management (IAM). Le chiavi API per i servizi di Watson non sono più limitate a una singola istanza del servizio. Puoi creare politiche di accesso e chiavi API che vengono applicate a più di un servizio e puoi concedere l'accesso tra i servizi. Per ulteriori informazioni su IAM, vedi Autenticazione ai servizi Watson.
Per supportare questa modifica, gli endpoint del servizio API utilizzano un dominio diverso e includono l'ID istanza del servizio. Il modello è
api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.-
URL HTTP di esempio per un'istanza ospitata nell'ubicazione Dallas:
https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2 -
URL WebSocket di esempio per un'istanza ospitata nell'ubicazione Dallas:
wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2
Per ulteriori informazioni sugli URL, consultare la sezione Riferimento API e SDK.
Questi URL non costituiscono una modifica importante. I nuovi URL funzionano sulle tue istanze del servizio esistenti o nuove. Gli URL originali continuano a funzionare sulle tue istanze del servizio esistenti per almeno un anno, fino a dicembre 2020.
-
- Nuove funzionalità per la sicurezza della rete e dei dati
-
Ora è disponibile il supporto per le seguenti nuove funzionalità di sicurezza della rete e dei dati:
-
Supporto per gli endpoint di rete privati
Gli utenti dei piani Premium possono creare endpoint di rete privati per connettersi al servizio Text to Speech tramite una rete privata. Le connessioni agli endpoint di rete privata non richiedono l'accesso alla rete internet pubblica. Per ulteriori informazioni, vedi Endpoint di rete pubblici e privati.
-
12 novembre 2019
- Nuova sede di Seul ora disponibile
- Il servizio " Text to Speech " è ora disponibile nella sede di Seul ( kr-seo ) di IBM Cloud. Come per le altre ubicazioni, l'ubicazione IBM Cloud utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.
1 ottobre 2019
- Nuovo supporto HIPAA degli Stati Uniti per i piani Premium a Washington, DC, sede
- Il supporto HIPAA per gli Stati Uniti è disponibile per i piani Premium ospitati nella sede di Washington, DC e creati a partire dal 1° aprile 2019. Per ulteriori informazioni, vedi HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti.
22 agosto 2019
- Correzione dei difetti: diversi piccoli miglioramenti
- Correzione di un bug: il servizio è stato aggiornato per correggere alcuni piccoli bug e apportare miglioramenti.
30 luglio 2019
- Nuova voce neurale giapponese:
ja-JP_EmiV3Voice - Il servizio ora offre una voce neurale in giapponese:
ja-JP_EmiV3Voice. Sono ora disponibili entrambe le versioni, standard e neurale, di tutte le voci disponibili in tutte le lingue supportate. Per ulteriori informazioni, vedi Lingue e voci.
24 giugno 2019
- Nuovo supporto per voci standard e neurali
-
Il servizio offre ora due versioni della maggior parte delle sue voci disponibili:
- Voci standard che utilizzano la sintesi concatenata per assemblare segmenti di parlato registrato al fine di generare l'audio. Le voci standard non includono una stringa di versione nel loro nome (ad esempio
en-US_AllisonVoice). - Voci neurali che utilizzano reti neurali profonde (DNN) per prevedere le caratteristiche acustiche (spettrali) del parlato. Le voci neurali includono una stringa di versione (
V3) nel loro nome (ad esempioen-US_AllisonV3Voice).
Sono disponibili versioni neurali per tutte le voci standard, ad eccezione della voce "
ja-JP_EmiVoice", che è in fase di sviluppo e sarà disponibile a breve. Non è possibile utilizzare gli elementi SSML<express-as>e<voice-transformation>con le voci neurali, né è possibile utilizzare l'attributovolumedell'elemento<prosody>con le voci neurali. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci. - Voci standard che utilizzano la sintesi concatenata per assemblare segmenti di parlato registrato al fine di generare l'audio. Le voci standard non includono una stringa di versione nel loro nome (ad esempio
- Voci neurali V2 ritirate dal servizio
-
Il servizio non include più le voci di DNN
V2che erano precedentemente disponibili. Se utilizzi una voceV2nella tua applicazione, il servizio utilizza invece, in modo automatico, la voceV3equivalente.
24 marzo 2019
- Nuove voci V2 in tedesco neurale
-
Il servizio ora offre versioni DNN (Deep Neural Network)
V2delle sue voci in tedesco:de-DE_BirgitV2Voicede-DE_DieterV2Voice
Per ulteriori informazioni sulle voci basate su DNN, vedi Lingue e voci.
- Nuovo supporto per attributi
pitcheratedell'elemento<prosody>SSML -
Tutte le voci del servizio basate su DNN ora supportano gli attributi "
pitch" e "rate" dell'elemento "<prosody>" in SSML. Le voci basate su DNN non supportano l'attributovolumedell'elemento. Per ulteriori informazioni, vedi L'elemento prosody.
21 marzo 2019
- Visibilità delle credenziali del servizio ora limitata dal ruolo
-
Gli utenti possono ora visualizzare solo le informazioni sulle credenziali del servizio associate al ruolo che è stato assegnato al loro account IBM Cloud. Ad esempio, se ti viene assegnato un ruolo
reader, qualsiasi livellowritero superiore delle credenziali del servizio non sarà più visibile.Questa modifica non influisce sull'accesso API per gli utenti o le applicazioni con credenziali del servizio esistenti. La modifica influisce solo sulla visualizzazione delle credenziali all'interno di IBM Cloud.
4 marzo 2019
- Nuove voci V2 in inglese neurale e italiano
-
Il servizio ora offre quattro nuove voci
V2che utilizzano la sintesi di apprendimento approfondito per generare l'audio:en-US_AllisonV2Voiceen-US_LisaV2Voiceen-US_MichaelV2Voiceit-IT_FrancescaV2Voice
Queste nuove voci utilizzano il machine learning e una DNN per sintetizzare il testo in voce. La sintesi di apprendimento approfondito o basata su DNN (Deep Neural Network) produce un audio con una prosodia più naturale e una qualità complessiva più coerente.
Tuttavia le nuove voci producono anche un audio con qualità di segnale diverse dalle voci esistenti, quindi potrebbero non essere appropriate per tutte le applicazioni. Inoltre, le nuove voci non supportano gli elementi SSML
<prosody>,<express-as>e<voice-transformation>.Per ulteriori informazioni su queste voci basate su DNN e su come differiscono dalle voci esistenti, vedi Lingue e voci.
28 gennaio 2019
- Nuovo supporto per l'interfaccia IBM Cloud IAM by WebSocket
-
Ora l'interfaccia WebSocket supporta l'autenticazione IAM (Identity and Access Management) basata sul token dal codice JavaScript basato sul browser. La limitazione al contrario è stata rimossa. Per stabilire una connessione autenticata con il metodo WebSocket
/v1/synthesize:- Se utilizzi l'autenticazione IAM, includi il parametro di query
access_token. - Se utilizzi le credenziali del servizio Cloud Foundry, includi il parametro di query
watson-token.
Per ulteriori informazioni, vedi Apri una connessione.
- Se utilizzi l'autenticazione IAM, includi il parametro di query
13 dicembre 2018
- Nuova sede di Londra ora disponibile
- Il servizio Text to Speech è ora disponibile nell'ubicazione Londra di IBM Cloud® (eu-gb). Come tutte le ubicazioni, Londra utilizza l'autenticazione IAM (Identity and Access Management) basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.
7 novembre 2018
- Nuova sede di Tokyo ora disponibile
- Il servizio Text to Speech è ora disponibile nell'ubicazione Tokyo di IBM Cloud® (jp-tok). Come tutte le ubicazioni, Tokyo utilizza l'autenticazione IAM (Identity and Access Management) basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.
30 ottobre 2018
- Nuovo supporto per IAM IBM Cloud basato su token
-
Il servizio Text to Speech è stato migrato all'autenticazione IAM (Identity and Access Management) basata sul token per tutte le ubicazioni. Tutti i servizi IBM Cloud utilizzano ora l'autenticazione IAM. Il servizio Text to Speech ha eseguito la migrazione in ciascuna ubicazione nelle seguenti date:
- Dallas (us-south): 30 ottobre 2018
- Francoforte (eu-de): 30 ottobre 2018
- Washington, DC (us-east): 12 giugno 2018
- Sydney (au-syd): 15 maggio 2018
La migrazione all'autenticazione IAM riguarda sia le nuove istanze che quelle esistenti indifferentemente:
- Tutte le nuove istanze del servizio che crei in ogni ubicazione utilizzano ora l'autenticazione IAM per accedere al servizio. Puoi passare un token di connessione o una chiave API: i token supportano le richieste autenticate senza credenziali del servizio incorporate in ogni chiamata; le chiavi API utilizzano l'autenticazione di base HTTP. Quando utilizzi uno degli SDK Watson, puoi passare la chiave API e lasciare che l'SDK gestisca il ciclo di vita dei token.
- Le istanze del servizio esistenti che hai creato in un'ubicazione prima della data di migrazione indicata continuano ad utilizzare
{username}e{password}dalle loro precedenti credenziali del servizio Cloud Foundry per l'autenticazione finché non le migri in modo che utilizzino l'autenticazione IAM.
Per ulteriori informazioni, consulta la seguente documentazione:
- Per scoprire quale meccanismo di autenticazione utilizza la tua istanza del servizio, visualizza le credenziali del servizio cliccando sull'istanza nella dashboard di IBM Cloud.
- Per ulteriori informazioni sull'utilizzo dei token IAM con i servizi Watson, consultare la sezione " Autenticazione ai servizi Watson ".
- Per esempi che utilizzano l'autenticazione IAM, consultare la guida di riferimento API e SDK.
12 giugno 2018
- Nuove funzioni per le applicazioni ospitate a Washington, DC, ubicazione
-
Le seguenti funzioni sono abilitate per le applicazioni ospitate in Washington, DC (us-east):
- Ora il servizio supporta un nuovo processo di autenticazione API. Per ulteriori informazioni, vedi l'aggiornamento del servizio del 30 ottobre 2018.
- Ora il servizio supporta l'intestazione
X-Watson-Metadatae il metodoDELETE /v1/user_data. Per ulteriori informazioni, vedi Sicurezza delle informazioni.
15 maggio 2018
- Nuove funzioni per le applicazioni ospitate nell'ubicazione di Sydney
-
Le seguenti funzioni sono abilitate per le applicazioni ospitate in Sydney (au-syd):
- Ora il servizio supporta un nuovo processo di autenticazione API. Per ulteriori informazioni, vedi l'aggiornamento del servizio del 30 ottobre 2018.
- Ora il servizio supporta l'intestazione
X-Watson-Metadatae il metodoDELETE /v1/user_data. Per ulteriori informazioni, vedi Sicurezza delle informazioni.
2 ottobre 2017
- Modifiche al formato audio
audio/l16 - Per il formato
audio/l16, ora puoi specificare facoltativamente il tipo di architettura endian (endianness) dell'audio restituito. (Devi aver già specificato la frequenza di campionamento.) Esempi:audio/l16;rate=22050;endianness=big-endianeaudio/l16;rate=22050;endianness=little-endian; l'impostazione predefinita è "significant endian". Per ulteriori informazioni, vedi Utilizzo dei formati audio.
14 luglio 2017
- Nuovo supporto per il formato audio MP3 (MPEG)
- Ora il servizio supporta il formato audio MP3 o MPEG (Motion Picture Experts Group). Per ulteriori informazioni sui formati audio supportati, consultare la sezione " Utilizzo dei formati audio ".
10 aprile 2017
- Nuovo supporto per il formato audio Web Media (WebM)
- Ora il servizio supporta il formato audio Web Media (WebM) con il codec Opus o Vorbis. Al momento il servizio supporta anche il formato audio Ogg con il codec Vorbis in aggiunta al codec Opus. Per ulteriori informazioni sui formati audio supportati, consultare la sezione " Utilizzo dei formati audio ".
- Nuovo supporto per la condivisione di risorse tra origini
- Ora il servizio supporta CORS (Cross-Origin Resource Sharing) per consentire ai client basati sul browser di richiamare direttamente il servizio. Per ulteriori informazioni, vedere Utilizzo del supporto CORS.
- Modifiche ai codici di risposta HTTP di successo
- I codici di risposta HTTP per il completamento riuscito di alcuni metodi dell'interfaccia di personalizzazione sono cambiati:
- Il metodo
POST /v1/customizationsora restituisce 201 (invece di 200). - Il metodo
POST /v1/customizations/{customization_id}ora restituisce 200 (invece di 201). - Il metodo
POST /v1/customizations/{customization_id}/wordsora restituisce 200 (invece di 201). - Il metodo
PUT /v1/customizations/{customization_id}/words/{word}ora restituisce 200 (invece di 201).
- Il metodo
- Nuovi errori per l'uso improprio del parametro
part_of_speechgiapponese - I metodi
POST /v1/customizations/{custom_id}/wordsePUT /v1/customizations/{customization_id}/words/{word}ora restituiscono il codice risposta HTTP 400 con il messaggio di errorePart of speech is supported for ja-JP language onlyse tenti di specificarepart_of_speechper una lingua diversa dal giapponese. - Modifiche al corpo della risposta per l'aggiunta del metodo di parole
- Il metodo
POST /v1/customizations/{custom_id}/wordsora restituisce un corpo della risposta vuoto ({}).
1 dicembre 2016
- Nuova voce spagnola latinoamericana:
es-LA_SofiaVoice -
Il servizio include una nuova voce,
es-LA_SofiaVoice, che è l'equivalente latino americano della vocees-US_SofiaVoice. La differenza più significativa tra le due versioni riguarda il modo in cui interpretano il simbolo del dollaro ($): la versione latinoamericana utilizza il termine «pesos», mentre quella nordamericana utilizza il termine «dolar ». Tra le due voci potrebbero esistere anche altre piccole differenze. - Nuove voci in inglese americano:
en-US_LisaVoiceeen-US_MichaelVoice -
In aggiunta a
en-US_AllisonVoice, ora altre due voci sono trasformabili con la trasformazione della voce SSML:en-US_LisaVoiceeen-US_MichaelVoice. - Modifiche alla personalizzazione per il giapponese
-
Quando si utilizza l'interfaccia di personalizzazione in giapponese, il servizio ora individua la parola più lunga tra le coppie parola/traduzione definite per un modello personalizzato. Ad esempio, si considerino le due voci seguenti relative a un modello personalizzato:
{ "words": [ {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"}, {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"} ] }Se il servizio individua la stringa «
NYC» nel testo di input, la considera una corrispondenza perché è più lunga rispetto a «NY». In precedenza, il servizio avrebbe individuato la stringaNY. Per ulteriori informazioni sull'utilizzo delle voci in giapponese in un modello personalizzato, consultare la sezione " Utilizzo delle voci in giapponese ".
22 settembre 2016
- La personalizzazione è ora disponibile per tutte le lingue
- L'interfaccia di personalizzazione, che include la personalizzazione e i metodi
GET /v1/pronunciation, è ora disponibile per tutte le lingue supportate dal servizio. L'interfaccia rimane a una release beta. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione. - Nuovo supporto giapponese per SSML
- Il servizio ora supporta SSML per il giapponese. Per informazioni generali sul supporto SSML, vedi Understanding SSML. Per informazioni sui simboli SPR e IPA in giapponese, vedi
Simboli per il giapponese. Quando si creano voci per le parole in un modello personalizzato giapponese, occorre tenere conto di ulteriori aspetti e utilizzare il campo "
part_of_speech". Per ulteriori informazioni, vedi Utilizzo di voci in giapponese. - Nuova funzione SSML di trasformazione vocale
- Il servizio offre ora la trasformazione vocale SSML tramite il nuovo elemento
<voice-transformation>. È possibile ampliare la gamma di voci disponibili creando trasformazioni personalizzate che modificano l'intonazione, l'estensione vocale, la tensione glottale, la respirazione, la velocità e il timbro di una voce. Il servizio offre anche due voci virtuali integrate, Young e Soft. Al momento il servizio supporta la trasformazione della voce solo per la voce in inglese (Stati Uniti) Allison. - I tempi delle parole sono ora disponibili con interfaccia WebSocket
- Ora il servizio può restituire le informazioni di temporizzazione per tutte le stringhe del testo di input che passi all'interfaccia WebSocket. Per ricevere il tempo di inizio e di fine di ogni stringa nell'input, specifica un array che include
la stringa
wordsper il parametro facoltativotimingsdell'oggetto JSON che passi al servizio. La funzione non è al momento disponibile per il testo di input in giapponese. Per ulteriori informazioni, vedi Generating word timings. - Nuovo supporto per la convalida SSML
- Ora il servizio convalida tutti gli elementi SSML che inoltri in qualsiasi contesto. Se trova una tag non valida, il servizio riporta un codice di risposta HTTP 400 con un messaggio descrittivo e il metodo ha esito negativo. Nelle versioni precedenti, il servizio gestiva gli errori in modo non uniforme; specificare una pronuncia errata di una parola, ad esempio, poteva causare un comportamento imprevedibile o incoerente. Per ulteriori informazioni, vedi Convalida SSML.
- IBM formato SPR ora specificato con
ibminvece dispr - L'uso di
sprè deprecato come argomento dell'opzioneformatdel metodoGET /v1/pronunciatione per l'utilizzo con l'attributoalphabetdi un elemento SSML. Per utilizzare la notazione IBM SPR, utilizza l'argomentoibminvece disprin tutti i casi. - Nuovo supporto per il formato audio
audio/mulaw - L'elenco dei formati audio supportati ora include l'
audio/mulaw;rate={rate}. Comeaudio/basic, questo formato fornisce un audio a canale singolo che viene codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio. - Nuove funzioni supportate identificate quando si elencano le voci
- Ora i metodi
GET /v1/voiceseGET /v1/voices/{voice}restituiscono un oggettosupported_featurescome parte del loro output per ciascuna voce. L'oggetto indica se la voce supporta la personalizzazione e l'elemento SSML<voice_transformation>. Per ulteriori informazioni, vedi Lingue e voci.
23 giugno 2016
- Nuova interfaccia WebSocket per la sintesi vocale
-
Ora il servizio offre un'interfaccia WebSocket per sintetizzare il testo in voce. L'interfaccia offre le stesse funzioni del metodo
/v1/synthesizedell'interfaccia HTTP. Accetta il testo semplice o il testo contrassegnato con SSML. Inoltre, supporta anche l'uso dell'elemento SSMLper identificare il punto del brano audio in cui termina la sintesi di tutto il testo che precede il segno. Per ulteriori informazioni, vedi L'interfaccia WebSocket. - Supporto lingua esteso per SSML
-
Ora il servizio offre il supporto per il testo annotato con SSML per le lingue spagnolo castigliano e spagnolo nord americano, italiano e portoghese brasiliano. Il servizio supportava già l'uso di SSML per inglese (Stati Uniti) e britannico, francese e tedesco. A partire da questo aggiornamento, il servizio supporta SSML per tutte le lingue ad eccezione del giapponese. Inoltre, è possibile utilizzare sia la notazione SPR che quella IPA ( IBM ) per definire la pronuncia delle parole con l'elemento SSML
. Per ulteriori informazioni, vedi Understanding SSML e Understanding phonetic symbol.Per l'inglese americano, è anche possibile utilizzare l'elemento SSML
per creare voci di parole in un modello personalizzato; la personalizzazione è supportata solo per l'inglese americano. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione. - Voci aggiornate per una migliore sintesi vocale
-
Il servizio offre una migliore espressività e naturalezza per le voci utilizzate più di frequente. I miglioramenti si basano sulla predizione della prosodia basata su RNN (Recursive Neural Network) derivante dal testo di input. Sono resi disponibili come nuovi aggiornamenti al motore di servizio e al modello vocale per le seguenti lingue:
en-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicefr-FR_ReneeVoice
- Nuovo parametro ID personalizzazione per la pronuncia della parola
-
Ora il metodo
GET /v1/pronunciationaccetta un parametro di querycustomization_idfacoltativo. Il parametro ottiene una traduzione di una parola da un modello personalizzato specificato. Se il modello personalizzato non contiene la parola, il metodo restituisce la pronuncia predefinita della parola. Per ulteriori informazioni, consultare la sezione Riferimento API e SDK.Quando utilizzi il metodo
GET /v1/pronunciationsenza un ID di personalizzazione e per una lingua diversa dall'inglese (Stati Uniti), puoi richiedere la pronuncia di una parola solo nella notazione IBM SPR. Per le lingue diverse dall'inglese (Stati Uniti), devi specificaresprcon l'opzioneformatdel metodo. - Nuovo supporto per il formato audio
audio/basic -
Ora l'elenco dei formati audio supportati include
audio/basic, che fornisce un audio a canale singolo che viene codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio. - Le interfacce HTTP e WebSocket possono ora restituire gli avvertimenti
-
I metodi
/v1/synthesizeHTTP e WebSocket possono restituire una rispostawarningsche include messaggi relativi a parametri di query o campi JSON non validi che vengono inclusi in una richiesta. Il formato delle avvertenze è stato modificato. Il seguente esempio mostra il formato precedente:"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."Ora la stessa avvertenza ha il seguente formato:
"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
10 marzo 2016
- I metodi di sintesi possono ora restituire avvertenze
- Ora i metodi
GETePOST /v1/synthesizepossono restituire un'intestazione di rispostaWarningsche include un elenco di messaggi di avvertenza relativi a parametri di query o campi JSON non validi che vengono inclusi nella richiesta. Ogni elemento dell'elenco include una stringa che descrive la natura dell'avvertenza seguita da un array di stringhe di argomenti non validi; ad esempio,Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}'].Per ulteriori informazioni, vedi ilRiferimento API & SDK. - L'SDK Beta Apple iOS è obsoleto
- La versione beta *Watson Kit di sviluppo software (SDK) per la sintesi vocale per il sistema operativo Apple® iOS * è stata dismessa e sostituita da Watson Swift SDK. Il nuovo SDK è disponibile nel repository swift-sdk, nello spazio dei nomi
watson-developer-cloud, all'indirizzo GitHub.
22 febbraio 2016
- Nuova funzione SSML espressiva
- Il servizio è stato aggiornato con una nuova funzione SSML di espressività. Il servizio estende SSML con un elemento
, che è possibile utilizzare per indicare l'espressività in uno dei tre stili di pronuncia:GoodNews, ` `ApologyoUncertainty``. Puoi applicare l'elemento all'intero corpo del testo, a un periodo, a una frase o a una parola. Al momento il servizio supporta l'espressività solo per la voce in inglese (Stati Uniti) Allison (en-US_AllisonVoice).
17 dicembre 2015
- Nuova interfaccia di personalizzazione beta
-
Il servizio offre una nuova interfaccia di personalizzazione che puoi utilizzare per specificare la pronuncia di parole insolite nel tuo input. L'interfaccia include alcuni nuovi metodi che è possibile utilizzare per creare e gestire modelli personalizzati e le coppie parola/traduzione in essi contenute. Puoi quindi utilizzare i tuoi modelli personalizzati per sintetizzare il testo in audio.
Il servizio supporta le traduzioni di suoni simili e le traduzioni fonetiche. Le traduzioni fonetiche possono utilizzare la rappresentazione IPA o IBM SPR proprietaria. Utilizzi SSML per specificare le traduzioni fonetiche.
L'interfaccia di personalizzazione include una raccolta di nuovi metodi HTTP denominati
POST /v1/customizations,POST /v1/customizations/{customization_id},POST /v1/customizations/{customization_id}/wordsePUT /v1/customizations/{customization_id}/words/{word}. Il servizio fornisce anche un nuovo metodoGET /v1/pronunciationche restituisce la pronuncia di qualsiasi parola e un nuovo metodoGET /v1/voices/{voice}che restituisce le informazioni dettagliate su una specifica voce. Inoltre, i metodi esistenti dell'interfaccia del servizio ora accettano parametri di modello personalizzati, se necessario.Per ulteriori informazioni sulla personalizzazione e sulla sua interfaccia, vedere Comprendere la personalizzazione e il riferimento all'API e all'SDK.
L'interfaccia di personalizzazione è una release beta che al momento supporta solo l'inglese (Stati Uniti). Attualmente, tutti i metodi di personalizzazione e il metodo
GET /v1/pronunciationpossono essere utilizzati per creare e modificare modelli personalizzati e traduzioni di parole solo in inglese americano. - Nuova voce portoghese brasiliano:
pt-BR_IsabelaVoice -
Il servizio supporta una nuova voce,
pt-BR_IsabelaVoice, per sintetizzare l'audio in portoghese brasiliano con una voce femminile. Per ulteriori informazioni, vedi Lingue e voci.
21 settembre 2015
- Nuovi SDK mobili disponibili
-
Sono disponibili due nuovi SDK (Software Development Kit) mobili versione beta per i servizi vocali. Gli SDK consentono alle applicazioni mobili di interagire con i servizi Text to Speech e Speech to Text. Puoi utilizzare gli SDK per inviare testo al servizio Text to Speech e ricevere una risposta audio.
- L'SDK di Watson Swift è disponibile nel repository swift-sdk, nello spazio dei nomi
watson-developer-cloudsu GitHub. - L' Watson Speech Android™ SDK è disponibile nel repository speech-android-sdk nello spazio dei nomi
watson-developer-cloudsu GitHub.
Entrambi gli SDK supportano l'autenticazione con i servizi vocali utilizzando le credenziali del servizio IBM Cloud o un token di autenticazione. Poiché gli SDK sono in fase beta, sono soggetti a modifiche future.
- L'SDK di Watson Swift è disponibile nel repository swift-sdk, nello spazio dei nomi
- Nuova voce giapponese:
ja-JP_EmiVoice -
Il servizio supporta una nuova lingua, il giapponese. La voce
ja-JP_EmiVoiceè una voce femminile in giapponese.
1 luglio 2015
- Il servizio Text to Speech è ora generalmente disponibile
-
Il servizio è passato dalla fase beta alla disponibilità generale (GA) il 1° luglio 2015. Di seguito sono riportate le differenze esistenti tra la versione beta e quella definitiva dell'API Text to Speech. La release GA richiede che gli utenti eseguano l'upgrade alla nuova versione del servizio.
- Nuovo modello di programmazione basato su token
-
Un nuovo modello di programmazione supporta l'interazione diretta tra un client e il servizio. Utilizzando questo modello, un client può ottenere un token di autenticazione per comunicare direttamente con il servizio. Utilizzando il token, il client può eludere la necessità di un'applicazione proxy lato server in IBM Cloud che richiami il servizio per suo conto. I token sono i mezzi preferiti per i client per interagire con il servizio.
Il servizio continua a supportare il vecchio modello di programmazione basato su un proxy lato server per trasmettere le comunicazioni e i dati tra il client e il servizio. Tuttavia, il nuovo modello è più efficiente e offre una velocità effettiva più elevata.
- Nuovo supporto per il linguaggio di markup di sintesi vocale
-
Ora puoi passare SSML (Speech Synthesis Markup Language) alle versioni
GETePOSTHTTP del metodo/v1/synthesize. SSML è un linguaggio di markup basato su XML progettato per fornire annotazioni di testo per le applicazioni di sintesi vocale come il servizio Text to Speech. Per ulteriori informazioni sul passaggio dell'input SSML al servizio, vedi Specifica del testo di input.Il servizio supporta inizialmente l'utilizzo di SSML solo per le lingue inglese (Regno Unito) e inglese (Stati Uniti), francese e tedesco. Il servizio non supporta SSML con l'italiano e lo spagnolo. Quando utilizzi SSML, assicurati di non selezionare una delle lingue non supportate per una voce per l'audio. I risultati in questo caso non sono significativi.
- Modifiche alle voci disponibili
-
Le voci supportate per la sintesi vocale modificata e ampliata. Il servizio ora supporta diverse altre voci, lingue e dialetti tramite i metodi
/v1/synthesize. Per ulteriori informazioni sulle voci supportate, vedi Lingue e voci.Tre voci che erano disponibili nella versione beta sono state ridenominate per la GA:
VoiceEnUsMichaelora èen-US_MichaelVoiceVoiceEnUsLisaora èen-US_LisaVoiceVoiceEsEsEnriqueora èes-ES_EnriqueVoice
I nomi precedenti delle voci continuano a funzionare con la versione beta del servizio (tramite gli endpoint API
-beta) mentre tale versione rimane disponibile. Tuttavia, devi utilizzare i nuovi nomi con la versione GA del servizio. - Nuovo supporto per il formato audio FLAC (Free Lossless Audio Codec)
-
Ora puoi richiedere al servizio di restituire l'audio nel formato FLAC (Free Lossless Audio Codec). Il servizio può ancora restituire l'audio nel formato Ogg con il codec Opus (l'impostazione predefinita) e nel formato WAV (Waveform Audio File Format). Per ulteriori informazioni sull'utilizzo dei formati audio con i metodi dell'
/v1/synthesize, consultare la sezione " Utilizzo dei formati audio ". - Nuovi limiti sulla quantità massima di testo sintetizzato
-
Il testo che invii al metodo
/v1/synthesizenell'URL di una richiestaGETHTTP o nel corpo di una richiestaPOSTHTTP è ora limitato a un massimo di 5 KB. Il testo aveva una dimensione massima di 4 MB per la versione beta. - Nuova intestazione per rifiutare di contribuire ai miglioramenti del servizio
-
Ora i metodi
/v1/synthesizeincludono l'intestazioneX-WDC-PL-OPT-OUTper controllare se il servizio utilizza il testo e i risultati audio provenienti da un'operazione per migliorare i risultati futuri. Specifica un valore1affinché l'intestazione impedisca al servizio di utilizzare il testo e i risultati audio. Il parametro si applica solo alla richiesta corrente. La nuova intestazione sostituisce l'intestazioneX-loggingproveniente dai metodi beta. Per ulteriori informazioni, vedi Controllo della registrazione delle richieste per i servizi Watson. - Modifiche ai codici di errore HTTP per la sintesi vocale
-
Per i metodi
/v1/synthesize, sono cambiati i seguenti codici di errore:- Il codice di errore 406 ("Not acceptable. Tipo MIME non supportato. ") viene rimosso.
- Il codice di errore 415 ("Unsupported Media Type") è stato aggiunto.
- Il codice di errore 503 ("Service Unavailable") è stato aggiunto.
- Modifiche ai codici di errore HTTP per le voci di elenco
-
Per il metodo
GET /v1/voices, sono cambiati i seguenti codici di errore:- Il codice di errore 406 ("Not acceptable. Tipo MIME non supportato. ") viene rimosso.
- Il codice di errore 415 ("Unsupported Media Type") è stato aggiunto.