Note sulla release per Text to Speech per IBM Cloud

IBM Cloud

Le seguenti funzionalità e modifiche sono state incluse in ogni versione e aggiornamento delle istanze gestite ospitate IBM Watson® Text to Speech su IBM Cloud o per le istanze ospitate su IBM Cloud Pak for Data as a Service. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.

Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.

Per informazioni sulle versioni e gli aggiornamenti del servizio per IBM Cloud Pak for Data, consultare le Note di rilascio per Text to Speech per IBM Cloud Pak for Data.

15 maggio 2026

Nuova voce femminile in portoghese brasiliano dal tono naturale

Il servizio ora supporta una nuova voce femminile naturale per il portoghese brasiliano:

  • pt-BR_IsabelaNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi

26 marzo 2026

Deprecata la transizione vocale da v1 a v3

Le voci concatenanti standard ( v1 ) precedentemente deprecate sono ora sostituite dai loro equivalenti neurali ( v3 ) durante la sintesi. Quando una richiesta specifica una di queste voci v1, viene utilizzata la voce v3 corrispondente.

  • de-DE_BirgitVoice -> de-DE_BirgitV3Voice
  • de-DE_DieterVoice -> de-DE_DieterV3Voice
  • en-GB_KateVoice -> en-GB_KateV3Voice
  • en-US_AllisonVoice -> en-US_AllisonV3Voice
  • en-US_LisaVoice -> en-US_LisaV3Voice
  • en-US_MichaelVoice -> en-US_MichaelV3Voice
  • es-ES_EnriqueVoice -> es-ES_EnriqueV3Voice
  • es-ES_LauraVoice -> es-ES_LauraV3Voice
  • es-LA_SofiaVoice -> es-LA_SofiaV3Voice
  • es-US_SofiaVoice -> es-US_SofiaV3Voice
  • fr-FR_ReneeVoice -> fr-FR_ReneeV3Voice
  • it-IT_FrancescaVoice -> it-IT_FrancescaV3Voice
  • ja-JP_EmiVoice -> ja-JP_EmiV3Voice
  • pt-BR_IsabelaVoice -> pt-BR_IsabelaV3Voice

Se si omette il parametro opzionale voice da una richiesta di sintesi vocale, il servizio utilizza ora en-US_MichaelV3Voice come impostazione predefinita. Questa voce neurale ( v3 ) sostituisce la precedente voce concatenante standard predefinita ( v1 ), en-US_MichaelVoice.

11 marzo 2026

Importante: Deprecazione della funzione Beta "Tune by Example"

La funzione beta Tune by Example è deprecata. Le API per la creazione di nuovi prompt o modelli di altoparlanti non sono più supportate.

  • Utenti esistenti: Le personalizzazioni esistenti che contengono già prompt o modelli di altoparlanti continueranno a funzionare per la sintesi vocale per un periodo di tempo limitato. Tuttavia, non è possibile creare nuovi prompt o modelli di altoparlanti.
  • Nuovi utenti: Le API per la creazione di prompt o modelli di altoparlanti sono disattivate e non possono essere utilizzate.

La funzione Tune by Example sarà completamente rimossa dal servizio in una release futura. Una volta rimossa, la sintesi che utilizza personalizzazioni basate su prompt o modelli di altoparlanti non sarà più supportata.

13 gennaio 2026

Nuove voci naturali inglesi

Il servizio ora supporta due nuove voci naturali, una maschile e una femminile, per l'inglese australiano:

  • en-AU_JackNatural
  • en-AU_HeidiNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi

5 dicembre 2025

Nuove voci naturali in spagnolo latinoamericano

Il servizio ora supporta due nuove voci naturali, una maschile e una femminile, per lo spagnolo latinoamericano:

  • es-LA_AlejandroNatural
  • es-LA_DanielaNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi

31 ottobre 2025

Nuove voci naturali portoghesi brasiliane

Il servizio supporta ora due nuove voci naturali, una maschile e una femminile, per il portoghese brasiliano:

  • pt-BR_LucasNatural
  • pt-BR_CamilaNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi

24 luglio 2025

Nuove voci naturali inglesi

Il servizio supporta ora quattro nuove voci naturali, due maschili e due femminili, per l'inglese statunitense:

  • en-US_EmmaNatural
  • en-US_EthanNatural
  • en-US_JacksonNatural
  • en-US_VictoriaNatural

Il servizio supporta ora due nuove voci naturali, maschile e femminile, per l'inglese britannico:

  • en-GB_ChloeNatural
  • en-GB_GeorgeNatural

Il servizio supporta ora una nuova voce femminile naturale per il CA English:

  • en-CA_HannahNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedi

09 luglio 2025

Deprecazione delle voci di V1
A partire dal 07 settembre 2025, tutte le voci di V1 saranno deprecate dal servizio. Tutte le voci deprecate di v1 passeranno automaticamente alle voci corrispondenti di v3 entro i prossimi 12 mesi.

19 maggio 2025

Voci di nuova generazione - Voci naturali

Il servizio supporta ora una nuova generazione di voci chiamate Natural Voices, con una nuova voce per l'inglese americano:

  • en-US_EllieNatural

Le voci naturali offrono prestazioni avanzate in termini di naturalezza ed espressività. Queste voci utilizzano varie tecniche per ottenere un vantaggio rispetto alle voci espressive. Per ulteriori informazioni, vedere Voci naturali.

Il servizio ora supporta l'attributo opzionale format per il tag SSML <say-as interpret-as="letters" format="xx">

È ora possibile specificare il valore group o single con l'attributo opzionale format. Questi attributi aiutano a migliorare la leggibilità delle stringhe alfanumeriche, come la conferma di numeri e ID, aggiungendo silenzi strategici.

17 febbraio 2025

Nuovo portoghese brasiliano maschile espressivo voce neurale

Il servizio ora supporta una nuova voce neurale espressiva maschile per il portoghese brasiliano:

  • pt-BR_LucasExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

09 dicembre 2024

Nuova voce neurale espressiva maschile inglese UK

Il servizio supporta ora una nuova voce neurale maschile espressiva per l'inglese britannico:

  • en-GB_GeorgeExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

15 maggio 2024

Nuova voce neurale femminile espressiva latino-americana spagnola

Il servizio ora supporta una nuova voce neurale espressiva femminile per lo spagnolo latinoamericano

  • es-LA_DanielaExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, chiaro, nitido e fluido. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

16 gennaio 2024

Miglioramenti Text to Speech per le voci espressive in inglese americano
Quando si utilizzano le voci espressive in inglese americano, la sintesi è più veloce con latenza inferiore.
Correzione del difetto: Problema di inflessione quando si usa il punto interrogativo (?) in un'espressione breve
Correzione del difetto: quando alcune brevi espressioni terminavano con un punto interrogativo (?), l'inflessione veniva ignorata. Il problema è stato risolto.

30 novembre 2023

Motore di sintesi Text to Speech migliorato per le voci della versione 3
Il motore Text to Speech è migliorato per offrire una sintesi più rapida con latenza inferiore per le voci della versione 3.
Voce Text to Speech migliorata en-AU_HeidiExpressive
La voce Text to Speech en-AU_HeidiExpressive è stata migliorata e può regolare l'intonazione e la sintesi.

9 giugno 2023

Correzione del difetto: Il TTS non fallisce più a causa del messaggio di errore "[Errno 2] No such file or directory"
Correzione del difetto: Quando si usa il TTS con i websocket, non fallisce più a causa del messaggio di errore "[Errno 2] No such file or directory"

18 maggio 2023

Correzione difetto: aggiunto il supporto per le funzioni SSML mancanti sulla voce olandese
Fix Defect: quando si utilizza la voce olandese, tutte le funzionalità SSML supportate ora funzionano come progettato. In precedenza, quando si usava la voce olandese, alcune funzioni SSML non funzionavano.
Correzione difetto: le virgole sono ora rispettate quando si utilizzano i tag fonemi
Correzione del difetto: quando si utilizzano tag fonema in SSML, le virgole (pause) ora funzionano come previsto. In precedenza, quando le virgole precedevano o seguivano il testo con i tag fonemi, la pausa veniva ignorata.

6 aprile 2023

Aggiornamenti alla versione beta olandese della voce neurale migliorata
Fix dei difetti: la versione beta olandese olandese nl-NL_MerelV3Voice è stata aggiornata per correzioni e miglioramenti interni. Le limitazioni descritte per il rilascio iniziale della voce nella sezione aggiornamento del servizio al 31 marzo 2023 sono ancora valide.

31 marzo 2023

Importante: Fine del servizio per tutte le voci neurali

Importante: tutte le voci neurali hanno raggiunto la data di fine del servizio e sono state rimosse dal servizio e dalla documentazione. Non sono interessate le voci neurali potenziate o le voci neurali espressive. Per un elenco completo di tutte le voci neurali obsolete, consultare gli aggiornamenti del servizio del 1° marzo 2023. Il tentativo di utilizzare una voce obsoleta restituisce il codice di risposta HTTP 404 con il messaggio 'Model '{voice}' not found.

Nuove voci neurali avanzate ed espressive sono disponibili per l'inglese australiano, il coreano e l'olandese olandese. È necessario migrare a una delle nuove voci per l'inglese australiano, il coreano o l'olandese olandese per continuare a utilizzare le lingue obsolete.

Per ulteriori informazioni, vedi Lingue e voci.

22 marzo 2023

Nuova versione beta olandese migliorata della voce neurale

Il servizio ora supporta una nuova voce femminile neurale migliorata per l'olandese olandese: nl-NL_MerelV3Voice. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR).

La nuova voce è una funzione beta in attesa del completamento del supporto per SSML. Nella versione iniziale, la voce non supporta l'uso delle seguenti funzioni relative a SSML:

  • L'elemento <prosody> con qualsiasi richiesta di sintesi vocale
  • I parametri rate_percentage e pitch_percentage con qualsiasi richiesta di sintesi vocale
  • L'elemento <mark> con una richiesta di sintesi vocale WebSocket
  • Il parametro timings del messaggio di testo JSON con una richiesta di sintesi vocale WebSocket

Per ulteriori informazioni sulla nuova voce, il suo supporto per i simboli IPA e SPR e la migrazione alla nuova voce dalle voci neurali olandesi obsolete, vedi

Correzione del difetto: aggiornare i simboli fonetici coreani nella documentazione

Correzione di un difetto: Nella documentazione dei simboli SPR coreani, i simboli a due caratteri per le consonanti sono ora racchiusi tra virgolette singole, diventando così un unico simbolo. In precedenza, venivano mostrati come due simboli separati, senza virgolette. Per ulteriori informazioni, vedi Consonanti(coreano).

Aggiornamenti della documentazione per i simboli SPR IBM

La documentazione di panoramica per i simboli SPR IBM è stata aggiornata per chiarire l'utilizzo di simboli a più caratteri. Per ulteriori informazioni, vedi Simboli audio vocale).

1 marzo 2023

Importante: fine del servizio in sospeso per tutte le voci neurali

Importante: In vigore 31 marzo 2023, tutte le voci neurali raggiungono la data di fine del servizio e verranno rimosse dal servizio e dalla documentazione. Le voci neurali sono state depredate dal 31 marzo 2022. Nessuna voce neurale o espressiva migliorata viene influenzata.

Le seguenti voci neurali sono state rimosse:

  • Arabo: ar-MS_OmarVoice
  • Cinese (mandarino): zh-CN_LiNaVoice, zh-CN_WangWeiVoice, e zh-CN_ZhangJingVoice
  • Ceco: cs-CZ_AlenaVoice
  • Olandese (belga): nl-BE_AdeleVoice e nl-BE_BramVoice
  • Olandese (Paesi Bassi): nl-NL_EmmaVoice e nl-NL_LiamVoice
  • Inglese (australiano): en-AU_CraigVoice, en-AU_MadisonVoice e en-AU_SteveVoice
  • Coreano: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice e ko-KR_YunaVoice
  • Svedese: sv-SE_IngridVoice

Nuove voci neurali neurali ed espressive potenziate sono già disponibili per l'inglese australiano e il coreano. Nelle prossime settimane sarà disponibile una nuova voce neurale potenziata per la lingua olandese. È necessario migrare a una delle nuove voci per l'inglese australiano, coreano o olandese prima del 31 marzo 2023.

Per ulteriori informazioni, vedi Lingue e voci.

27 febbraio 2023

Nuove voci neurali espressive dell'inglese australiano

Il servizio ora supporta due nuove voci neurali espressive, maschile e femminile, per l'inglese australiano:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove versioni sono ora disponibili per l'uso in produzione. Supportano l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

Puoi migrare dalle voci neurali dell'inglese australiano che sono obsolete alle nuove voci neurali espressive.

Nuova voce neurale avanzata coreana

Il servizio ora supporta una nuova voce femminile neurale avanzata per il coreano: ko-KR_JinV3Voice. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

È possibile migrare dalle voci neurali coreane obsolete alla nuova voce neurale avanzata.

Correzione difetto: la voce francese canadese ora gestisce correttamente gli orari numerici

Correzione del difetto: Le voci francese e canadese ora pronunciano correttamente i tempi come 19:41. In precedenza, le voci omettevano elementi del tempo nell'audio sintetizzato.

Correzione difetto: la voce giapponese non inserisce più un audio imprevisto

Correzione del difetto: la voce giapponese non inserisce più un audio non previsto nei risultati di sintesi vocale. In precedenza, in alcuni casi veniva inserito altro audio.

20 gennaio 2023

Obsolescenza e migrazione di Cloud Foundry ai gruppi di risorse

IBM ha annunciato l'abbandono di IBM Cloud Foundry il 31 maggio 2022. A partire dal 30 novembre 2022, non sarà più possibile creare nuove applicazioni 'IBM 'Cloud Foundry e solo gli utenti esistenti potranno distribuire le applicazioni. IBM 'Cloud Foundry raggiungono la fine del supporto il 1° giugno 2023. Quindi, qualsiasi IBM Istanze runtime di applicazioni Cloud Foundry che eseguono IBM Cloud Foundry verranno disattivate, deprovisionate ed eliminate in modo permanente.

Per continuare a utilizzare le applicazioni IBM Cloud oltre il 1° giugno 2023, è necessario migrare ai gruppi di risorse prima di tale data. I gruppi di risorse sono concettualmente simili agli spazi di Cloud Foundry. Tra questi figurano diversi vantaggi aggiuntivi, quali un controllo degli accessi più granulare grazie all'utilizzo dell'IAM ( IBM Cloud Identity and Access Management ), la possibilità di collegare le istanze di servizio ad app e servizi in diverse regioni e un modo semplice per visualizzare i dati di utilizzo per gruppo.

Correzione difetto: la specifica di numeri cardinali grandi con l'elemento <say-as> non causa più errori per le voci inglesi

Correzione del difetto: è ora possibile utilizzare l'elemento <say-as> per pronunciare numeri grandi come numeri cardinali. In precedenza, racchiudere un numero grande nell'elemento <say-as> con l'attributo interpret-as="cardinal" poteva causare il fallimento della sintesi vocale per le voci inglesi. Ad esempio, <say-as interpret-as="cardinal">3,200</say-as> potrebbe far sì che il servizio generi un errore. Per ulteriori informazioni, consultare cardinale nell'argomento Elementi SSML.

Correzione del difetto: gli omonimi e altre parole sono ora pronunciati correttamente dalle voci inglesi

Correzione del difetto: il servizio ora pronuncia gli omonimi e altre parole correttamente in base al loro contesto nel testo inglese che deve essere sintetizzato. In precedenza, parole come advocate e wifi potevano essere pronunciate in modo errato dalle voci inglesi.

30 novembre 2022

Correzione del difetto: aggiungere regole per la documentazione di denominazione del modello personalizzato
Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli personalizzati. Per ulteriori informazioni, vedi

7 ottobre 2022

Il servizio ora applica una convalida SSML più rigorosa
Il servizio ora applica una convalida più rigorosa del testo di input che include gli elementi SSML (Speech Synthesis Markup Language). Gli elementi richiesti degli attributi devono essere specificati con valori validi. Altrimenti, la richiesta ha esito negativo con un codice di errore 400. Per ulteriori informazioni sulla convalida SSML e sui requisiti che il testo contrassegnato deve soddisfare, consultare Convalida SSML.
Correzione del difetto: Il genere indicato per la voce en-US_MichaelExpressive è ora corretto
Correzione del difetto: quando si elencano le informazioni sulle voci disponibili, il gender della voce en-US_MichaelExpressive è ora male. In precedenza, il genere della voce era erroneamente descritto come female. Per ulteriori informazioni, vedi Elenco delle informazioni sulle voci.

23 settembre 2022

Nuove voci neurali espressive in inglese americano

Il servizio offre quattro nuove voci neurali espressive per l'inglese americano:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove versioni sono ora disponibili per l'uso in produzione. Supportano l'uso sia dell'Alfabeto Fonetico Internazionale (IPA) standard che di IBM Rappresentazione fonetica simbolica (SPR). Per ulteriori informazioni, vedi

Nuovi stili di conversazione per voci neurali espressive

Le voci neurali espressive determinano il sentimento del testo dal contesto delle parole e delle frasi. Il discorso che producono, oltre ad avere uno stile colloquiale, riflette l'umore del testo. Ma puoi abbellire le tendenze naturali delle voci indicando che tutto o parte del testo è quello di enfatizzare uno dei seguenti stili parlanti:

  • Allegro- Esprime felicità e buone notizie.
  • Empatico- Esprime empatia o simpatia.
  • Neutrale- Esprime obiettività e uniformità.
  • Incerto- Esprime confusione o incertezza.

Per ulteriori informazioni, consultare Utilizzo degli stili di conversazione.

Nuova enfasi di interezione con voci neurali espressive

Con le voci neurali espressive, il servizio rileva automaticamente un insieme di interiezioni comuni basate sul contesto. Quando sintetizza queste interiezioni, dà loro l'enfasi naturale che un essere umano userebbe nella conversazione normale. Per alcune delle interezioni, è possibile utilizzare SSML per abilitarne o disabilitarne l'enfasi. Per ulteriori informazioni, vedi Enfatizzazione delle interiezioni.

Enfatizzazione di nuove parole con voci neurali espressive

Le voci espressive utilizzano uno stile conversazionale che applica naturalmente l'intonazione corretta dal contesto. Ma si può indicare che una o più parole devono essere date più o meno enfasi. La variazione dello stress può essere indicata da un aumento o una diminuzione dell'altezza, del tempo, del volume o di altri attributi acustici. Per ulteriori informazioni, vedi Sottolineatura delle parole.

21 settembre 2022

Nuovo evento Activity Tracker per l'eliminazione delle informazioni utente da parte del GDPR
Il servizio ora restituisce un evento Activity Tracker quando utilizzi il metodo DELETE /v1/user_data per eliminare tutte le informazioni su un utente. L'evento è denominato text-to-speech.gdpr-user-data.delete. Per ulteriori informazioni, vedi Eventi Activity Tracker.
Correzione difetto: le traduzioni di parole personalizzate ora accettano virgole in tutti i casi
Correzione del difetto: le traduzioni di parole aggiunte ai modelli personalizzati ora accettano le virgole in tutti i casi. In precedenza, una virgola in una traduzione poteva occasionalmente far sì che la traduzione non generasse un audio valido quando veniva utilizzata per le sintesi vocali. Questo problema è stato identificato nei modelli personalizzati in inglese americano.
Correzione del difetto: la sintesi francese delle date è ora coerente
Correzione del difetto: la sintesi francese non include più l'articolo "le" prima delle date del formato " ordinale di mese." In precedenza, l'articolo era incluso solo per il primo giorno del mese per il francese (per esempio, "il primo di settembre", "le premier septembre").
Limitazioni note all'utilizzo del formato audio Ogg con il browser Safari
Per impostazione predefinita, il servizio restituisce l'audio nel formato audio Ogg con il codec Opus audio/ogg;codecs=opus). Tuttavia, il formato audio Ogg non è supportato dal browser Safari. Se si utilizza il servizio Text to Speech con il browser Safari, è necessario specificare un formato diverso in cui si desidera che il servizio restituisca l'audio.

31 agosto 2022

Nuovo parametro di query beta rate_percentage per il controllo della velocità di conversazione globale
Il servizio offre un nuovo parametro di query rate_percentage per modificare la frequenza di conversazione per una richiesta di sintesi vocale. La velocità di conversazione è la velocità con cui il servizio pronuncia il testo che sintetizza in voce. Un tasso più elevato fa sì che il testo venga pronunciato più rapidamente; un tasso più basso fa sì che il testo venga pronunciato più lentamente. Il parametro modifica la frequenza predefinita per voce per un'intera richiesta. Per ulteriori informazioni, vedi Modifica della velocità di conversazione.
Nuovo parametro di query beta pitch_percentage per il controllo del tono di conversazione globale
Il servizio offre un nuovo parametro di interrogazione pitch_percentage per modificare il tono di conversazione per una richiesta di sintesi. Il tono di conversazione rappresenta il tono del discorso che il servizio sintetizza. Rappresenta quanto alto o basso è il tono della voce percepito dall'ascoltatore. Un tono più alto si traduce in un discorso che è parlato con un tono più alto ed è percepito come una voce più alta; un tono più basso si traduce in un discorso che è parlato con un tono più basso ed è percepito come una voce più bassa. Il parametro modifica il tono predefinito per voce per un'intera richiesta. Per ulteriori informazioni, consultare la sezione Modifica del tono di conversazione.
Correzione dei difetti: la sintesi giapponese è migliorata per gestire lunghe stringhe di testo di input
Correzione del difetto: il servizio ora sintetizza correttamente le richieste giapponesi che includono lunghe stringhe di caratteri. In precedenza, il servizio non riusciva a sintetizzare correttamente lunghe stringhe di testo giapponese.
Aggiornamenti della documentazione per l'elemento <prosody> SSML
La documentazione per l'elemento <prosody> SSML e i relativi parametri pitch e rate è stata migliorata e chiarita. Ora include anche una descrizione delle differenze tra il servizio e la versione più recente della specifica SSML. Per ulteriori informazioni, vedere Elemento <prosody>.

3 agosto 2022

Il servizio non supporta la sintesi vocale multilingue
Il servizio non supporta attualmente la sintesi vocale multilingue. Tuttavia, è possibile utilizzare la personalizzazione per approssimare la pronuncia delle parole da altre lingue. Per ulteriori informazioni, vedi sintesi vocale multilingue.

27 luglio 2022

Nuovo parametro beta spell_out_mode per le voci tedesche
Per indicare come devono essere scritti i singoli caratteri di una stringa, è ora possibile includere il parametro della query beta spell_out_mode con una richiesta di sintesi per una voce tedesca. Per impostazione predefinita, il servizio espone singoli caratteri alla stessa velocità con cui sintetizza il testo per una lingua. È possibile utilizzare il parametro per indicare al servizio di specificare i singoli caratteri più lentamente, in gruppi di uno, due o tre caratteri. Utilizzare il parametro con l'elemento SSML <say-as> per controllare il modo in cui vengono sintetizzati i caratteri di una stringa. Per ulteriori informazioni, consultare Specifica del modo in cui le stringhe vengono scritte.

25 maggio 2022

Nuovo supporto per il formato audio audio/alaw
L'elenco dei formati audio supportati ora include l' audio/alaw;rate={rate}. Come audio/basic e audio/mulaw, questo formato offre audio monocanale codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio.

19 maggio 2022

Correzione difetto: più tag SSML <phoneme> consecutive sono ora analizzate correttamente
Correzione del difetto: il servizio ora sintetizza correttamente il testo che contiene tag <phoneme> consecutive. In precedenza, se il testo conteneva due o più tag <phoneme> consecutivi, il servizio sintetizzava solo la prima tag, ignorando le altre.

31 marzo 2022

Importante: Deprecazione di tutte le voci neurali

Importante: In vigore 31 marzo 2022, tutte le voci neurali sono obsolete. Le voci obsolete restano disponibili agli utenti esistenti fino al 31 marzo 2023, quando verranno rimosse dal servizio e dalla documentazione. Nessuna voce neurale o voce espressiva migliorata è obsoleta.

Le seguenti voci neurali sono ora obsolete:

  • Arabo: ar-MS_OmarVoice
  • Cinese (mandarino): zh-CN_LiNaVoice, zh-CN_WangWeiVoice, e zh-CN_ZhangJingVoice
  • Ceco: cs-CZ_AlenaVoice
  • Olandese (belga): nl-BE_AdeleVoice e nl-BE_BramVoice
  • Olandese (Paesi Bassi): nl-NL_EmmaVoice e nl-NL_LiamVoice
  • Inglese (australiano): en-AU_CraigVoice, en-AU_MadisonVoice e en-AU_SteveVoice
  • Coreano: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice e ko-KR_YunaVoice
  • Svedese: sv-SE_IngridVoice

Le voci neurali obsolete continuano ad essere disponibili per gli utenti esistenti ma non sono più disponibili per i nuovi utenti:

  • Utenti esistenti: le Istanze del servizio create prima del 31 marzo 2022 possono continuare a utilizzare le voci obsolete per la sintesi vocale. Le istanze possono anche essere usate per creare e lavorare con modelli personalizzati che si basano sulle voci deprecate. E possono continuare a elencare e interrogare le voci con i metodi GET /v1/voices/{voice} e GET /v1/voices.
  • Nuovi utenti: Le istanze del servizio create a partire dal 31 marzo 2022 non possono utilizzare le voci deprecate per la sintesi vocale. Le istanze non possono nemmeno essere usate per creare modelli personalizzati basati sulle voci deprecate. E non possono elencare o interrogare le voci con i metodi GET /v1/voices e GET /v1/voices/{voice}. Qualsiasi chiamata API che includa una delle voci deprecate restituisce un codice di errore HTTP 400 o 404, a seconda della chiamata.

Le nuove voci per l'inglese australiano, l'olandese e il coreano saranno rilasciate entro il 15 febbraio 2023. Se stai utilizzando voci australiane in inglese, olandese o coreano, le tue chiamate API verranno automaticamente reindirizzate alle nuove voci in tale lingua. Le voci in arabo, cinese, ceco, svedese e fiammingo saranno rimosse dal servizio.

Per ulteriori informazioni su tutte le lingue e le voci disponibili, vedi Lingue e voci.

Le voci standard obsolete vengono rimosse dalla documentazione

Le voci di concatenazione standard sono state deprecate il 2 dicembre 2020. Queste voci standard sono state ora rimosse dalla guida di riferimento API. Anche l'argomento Migrating from standard to neural voices è stato rimosso dalla pagina Languages and voices.

Allo stesso modo, il nome precedente della voce araba, ar-AR_OmarVoice, era obsoleto allo stesso tempo. Anche questo è stato rimosso dalla documentazione. Utilizzare invece la voce ar-MS_OmarVoice.

28 febbraio 2022

Modifica in risposta di temporizzazione parola per l'interfaccia WebSocket

L'oggetto di risposta che il servizio invia quando si richiede la temporizzazione delle parole con l'interfaccia WebSocket è cambiato. Il servizio ora invia i risultati di temporizzazione parola in un singolo array che include una stringa seguita da due float:

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Il servizio ha precedentemente inviato i risultati di temporizzazione come un array che includeva una stringa seguita da un array di due float:

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

Inoltre, il livello di precisione per i tempi e i contrassegni delle parole è ora ridotto a tre posizioni decimali. Per ulteriori informazioni sulle nuove risposte, vedi Generazione degli orari delle parole.

Nota: in passato i risultati per le voci neurali e neurali avanzate erano diversi. Queste incongruenze potrebbero causare errori per gli SDK Watson SDK. I risultati per tutte le voci sono ora coerenti.

26 gennaio 2022

Correzione difetto: migliorare la documentazione SSML
Fix Defect: la documentazione SSML è stata aggiornata per correggere i seguenti errori:
  • Gli esempi dell'elemento <break> sono ora corretti. L'elemento è unario, come ora mostrato negli esempi. Gli esempi precedenti includevano tag di apertura e chiusura con testo incorporato. Il testo incorporato non è stato pronunciato dal servizio. Per ulteriori informazioni, vedere Elemento <break>.
  • Il servizio supporta la versione SSML 1.1. Tutti i riferimenti e gli esempi ora utilizzano la versione corretta. La documentazione si riferiva in precedenza alla versione 1.0.

3 dicembre 2021

Nuova voce neurale ceca: cs-CZ_AlenaVoice

Una nuova lingua, il ceco, con una nuova voce femminile, cs-CZ_AlenaVoice, è ora disponibile. La voce è una voce neurale.

Nuova voce neurale olandese belga: nl-BE_BramVoice

Una nuova voce maschile belga olandese (fiammingo), nl-BE_BramVoice, è ora disponibile. La voce è una voce neurale.

Correzione dei difetti: migliorare la sintesi vocale e SSML

Fix Defect: i seguenti difetti per SSML (Speech Synthesis Markup Language) e sintesi vocale sono stati corretti con questa release:

  • L'attributo pitch dell'elemento <prosody> viene ora applicato a tutto il testo specificato. In precedenza, il cambiamento di tono non era sempre applicato alla prima parola del testo interessato. Inoltre, la documentazione ora include maggiori indicazioni su come specificare un valore pitch Per ulteriori informazioni, consultare L'attributo pitch.
  • La sintesi vocale del testo giapponese ora parla l'audio più lentamente. In precedenza, il discorso sintetizzato veniva pronunciato troppo rapidamente. Se si rileva che la sintesi del testo in giapponese è ancora parlata troppo rapidamente per la propria applicazione, utilizzare l'attributo rate dell'elemento SSML <prosody> per controllare la frequenza del discorso. Per ulteriori informazioni, consultare L'attributo rate.
  • Le voci neurali ora analizzano correttamente il carattere apostrofo escape (&apos;). In precedenza, alcune voci neurali non interpretavano correttamente il carattere.

22 ottobre 2021

Miglioramenti multipli della voce neurale
Le voci neurali esistenti per il cinese, l'olandese (belga e olandese), l'inglese australiano e il coreano sono state aggiornate per migliorare la sintesi vocale e migliorare i risultati audio. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.
Nuova voce neurale inglese australiano: en-AU_SteveVoice
Una nuova voce maschile australiana inglese, en-AU_SteveVoice, è ora disponibile. La voce è una voce neurale.
Nuova voce neurale svedese: sv-SE_IngridVoice
Una nuova lingua, lo svedese, con una nuova voce femminile, sv-SE_IngridVoice, è ora disponibile. La voce è una voce neurale.

6 ottobre 2021

Nuovo supporto HIPAA degli Stati Uniti per i piani Premium nella sede di Dallas
Il supporto HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti è ora disponibile per i piani Premium ospitati nell'ubicazione Dallas (us-south). Per ulteriori informazioni, consultare la legge sulla portabilità e la responsabilità in materia di assicurazione sanitaria(HIPAA).
Correzione dei difetti: migliorare la voce neurale potenziata dello spagnolo latino americano
Fix Defect: per la voce spagnola latinoamericana (es-LA_SofiaV3Voice), le domande di tutti i tipi utilizzano ora l'intonazione corretta.

16 settembre 2021

Correzione dei difetti: Migliora le voci neurali avanzate spagnole e nordamericane
Correzione del difetto: per le voci spagnolo castigliano (es-ES_EnriqueV3Voice e es-ES_LauraV3Voice) e spagnolo nordamericano (es-US_SofiaV3Voice), le domande di tutti i tipi ora utilizzano l'intonazione corretta. Per la voce spagnola latinoamericana (es-LA_SofiaV3Voice), alcune domande non utilizzano l'intonazione corretta e suonano invece come dichiarazioni. La voce spagnola latino-americana sarà presto sistemata.

16 luglio 2021

Nuova voce neurale olandese belga: nl-BE_AdeleVoice
Il servizio ora supporta l'olandese belga (fiammingo) con la voce neurale nl-BE_AdeleVoice. La voce belga olandese supporta la personalizzazione ed è generalmente disponibile (GA) per uso di produzione.

12 aprile 2021

Nuova voce neurale migliorata in francese canadese: fr-CA_LouiseV3Voice

Il servizio ora supporta il francese canadese con la voce neurale avanzata fr-CA_LouiseV3Voice. La voce francese canadese supporta la personalizzazione ed è generalmente disponibile (GA) per uso di produzione.

Nuova funzione di ottimizzazione per esempio

La nuova funzione Tune by Example consente di controllare il modo in cui il servizio pronuncia il testo specificato. Si tratta di una funzione beta supportata solo per i modelli e le voci personalizzate in inglese americano. Ha due componenti:

  • I prompt personalizzati includono il testo scritto che deve essere pronunciato e l'audio registrato che parla il testo come vuoi ascoltarlo. L'audio specifica l'intonazione, la cadenza e lo stress del testo sintetizzato. Il prompt può enfatizzare diverse sillabe o parole, introdurre pause e in generale rendere il suono audio sintetizzato più naturale e appropriato per il suo contesto.
  • I modelli di altoparlanti forniscono l'audio di registrazione per un utente che parla una o più richieste. Un modello di altoparlante fornisce un esempio audio della voce di un utente. Il servizio si allena sulla voce, che può aiutare a produrre suggerimenti di qualità superiore per quell' altoparlante.

Specifica una richiesta personalizzata con una richiesta di sintesi vocale per indicare come la voce del servizio deve pronunciare il testo. Per specificare una richiesta, utilizzare l'estensione SSML <ibm:prompt id="{prompt_id}"/>. L'audio sintetizzato duplica la prosodia del prompt.

Nuovi Metodi Tune be Example

Il servizio include otto nuovi metodi per lavorare con la funzione Tune by Example. Le descrizioni dei nuovi metodi che seguono forniscono i collegamenti alle rispettive voci nel riferimento dell'API e dell'SDK. Potrebbe essere necessario selezionare la scheda Curl del riferimento per visualizzare i nuovi metodi.

Aggiornamenti alle azioni del Activity Tracker per la personalizzazione

I nomi delle azioni per gli eventi Activity Tracker per i metodi di personalizzazione sono cambiati. Le azioni ora includono la stringa custom-model invece di custom-voice. I vecchi nomi delle azioni sono obsoleti. I vecchi nomi sono ancora disponibili per l'uso ma verranno rimossi in una data futura. Migrare ai nuovi nomi elencati in Eventi di personalizzazione al più presto.

Crea eventi Nome azione obsoleto-> Nuovo nome azione

  • text-to-speech.custom-voice.create -> text-to-speech.custom-model.create
  • text-to-speech.custom-voice-word-list.create -> text-to-speech.custom-model-word-list.create
  • text-to-speech.custom-voice-word.create -> text-to-speech.custom-model-word.create

Leggi gli eventi Nome azione obsoleto-> Nuovo nome azione

  • text-to-speech.custom-voice-list.read -> text-to-speech.custom-model-list.read
  • text-to-speech.custom-voice.read -> text-to-speech.custom-model.read
  • text-to-speech.custom-voice-word-list.read -> text-to-speech.custom-model-word-list.read
  • text-to-speech.custom-voice-word.read -> text-to-speech.custom-model-word.read

Aggiorna evento Nome azione obsoleto-> Nuovo nome azione

  • text-to-speech.custom-voice.update -> text-to-speech.custom-model.update

Elimina eventi Nome azione obsoleta-> Nuovo nome azione

  • text-to-speech.custom-voice.delete -> text-to-speech.custom-model.delete
  • text-to-speech.custom-voice-word.delete -> text-to-speech.custom-model-word.delete

2 dicembre 2020

Miglioramenti multipli della voce

Le voci offerte dal servizio hanno subito un cambiamento significativo. Il servizio supporta nuove lingue e voci, ha migliorato la qualità di molte voci e ha deprecato molte voci più vecchie. Inoltre, tutte le voci dei servizi sono ora personalizzabili e generalmente disponibili (GA) per l'uso in produzione.

Nuove voci neurali neurali e potenziate

Per ottimizzare la qualità complessiva della sintesi vocale, tutte le voci disponibili sono ora basate sulla tecnologia neurale. Il servizio offre due tipi di voci basate sulla tecnologia neurale:

  • Le voci neurali, che non includono la stringa V3 nei loro nomi, sono ora disponibili per l'arabo, l'inglese australiano, il cinese, l'olandese e il coreano. Le voci neurali supportano l'utilizzo dell'alfabeto fonetico internazionale (IPA) con l'elemento <phoneme> SSML (Speech Synthesis Markup Language).
  • Le voci neurali avanzate, che includono la stringa V3 nei relativi nomi, sono ora disponibili per il portoghese brasiliano, il Regno Unito e l'inglese degli Stati Uniti, il francese, il tedesco, l'italiano, il giapponese e lo spagnolo (tutti dialetti). Le voci neurali migliorate supportano l'utilizzo di IPA e IBM SPR (Symbolic Phonetic Representation) con l'elemento SSML <phoneme>. Le voci neurali migliorate raggiungono anche un grado leggermente più alto di suono naturale. Nei prossimi mesi sono previste ulteriori possibilità di personalizzazione per migliorare le voci neurali.

Il servizio non offre più voci standard per nessuna lingua. Le voci standard utilizzavano la sintesi concatenata per assemblare segmenti di parlato registrato e generare l'audio richiesto.

Per ulteriori informazioni, vedi Lingue e voci.

Nuove voci neurali dell'inglese australiano e del coreano

Le seguenti voci australiane in inglese e coreano sono nuove:

  • Il servizio ora supporta l'inglese australiano con le seguenti due voci neurali: en-AU_CraigVoice e en-AU_MadisonVoice.
  • Il servizio ora supporta due nuove voci neurali coreane: ko-KR_HyunjunVoice e ko-KR_SiWooVoice.
Voci neurali migliorate

Le voci per le lingue esistenti arabo, cinese, olandese e coreano, che si concatenavano, sono ora neurali:

  • ar-MS_OmarVoice
  • ko-KR_YoungmiVoice
  • ko-KR_YunaVoice
  • nl-NL_EmmaVoice
  • nl-NL_LiamVoice
  • zh-CN_LiNaVoice
  • zh-CN_WangWeiVoice
  • zh-CN_ZhangJingVoice

Sono state inoltre apportate le seguenti altre modifiche:

  • La voce araba è ora denominata ar-MS_OmarVoice. Il nome precedente, ar-AR_OmarVoice, è obsoleto. Continuerà a funzionare per almeno un anno, ma potrebbe essere rimosso in una data futura. Si consiglia di migrare al nuovo nome appena possibile.
  • La lingua araba ora supporta l'uso di simboli IPA e valori Unicode con l'elemento <phoneme> SSML. Per creare un modello personalizzato per l'arabo, devi utilizzare l'ID lingua ar-MS. L'identificativo ar-AR non è supportato per la personalizzazione.
  • I simboli IPA per la lingua araba sono nuovi. I simboli precedentemente documentati sono stati sostituiti.
  • I simboli IPA per la lingua olandese sono stati modificati come segue:
    • Olandese non supporta più i seguenti simboli IPA: (0074+02B2), ɲ (0272), ʦ (02A6) e ʔ (0294).
    • Olandese Paesi Bassi ora supporta il seguente simbolo IPA: ɣ (0263).
Voci standard obsolete

Le seguenti voci di concatenazione standard sono ora deprecate:

  • de-DE_BirgitVoice
  • de-DE_DieterVoice
  • en-GB_KateVoice
  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • es-ES_LauraVoice
  • es-LA_SofiaVoice
  • es-US_SofiaVoice
  • fr-FR_ReneeVoice
  • it-IT_FrancescaVoice
  • ja-JP_EmiVoice
  • pt-BR_IsabelaVoice

Tutte le voci standard che sono state rese obsolete hanno controparti neurali equivalenti, quindi nessuna voce viene portata via. Piuttosto, puoi passare alla versione neurale equivalente della voce (ad esempio, da de-DE_BirgitVoice a de-DE_BirgitV3Voice) per ottenere risultati di sintesi vocale migliori.

Queste voci obsolete vengono rimosse dalla documentazione pubblicata. Essi continueranno a funzionare per almeno un anno, ma potrebbero essere rimossi in una data futura. Si consiglia di migrare alle voci neurali equivalenti appena possibile.

Se si omette il parametro facoltativo voice da una richiesta di sintesi vocale, il servizio utilizza per impostazione predefinita en-US_MichaelV3Voice . Questa voce neurale sostituisce la voce standard en-US_MichaelVoice ora obsoleta che era il valore predefinito precedente.

Funzioni obsolete

Le seguenti funzioni erano disponibili solo per le voci concatenate standard. Sono obsoleti e sono stati rimossi dalla documentazione pubblicata. Essi continueranno a funzionare per almeno un anno, ma potrebbero essere rimossi in una data futura. Si consiglia di rimuovere queste funzionalità dalle applicazioni e di migrare alle voci neurali al più presto.

  • SSML espressivo. Questa era una estensione IBM per SSML supportata solo per la voce en-US_AllisonVoice.
  • Trasformazione della voce SSML. Questa era un'estensione IBM a SSML supportata solo per le voci en-US_AllisonVoice, en-US_LisaVoice e en-US_MichaelVoice.
  • L'attributo volume dell'elemento . Questo attributo era disponibile per tutte le voci standard.

L'inclusione di questi elementi SSML in una richiesta di sintesi per una voce neurale genera un codice di risposta HTTP 400 perché la richiesta non supera la convalida SSML. Per ulteriori informazioni sulla convalida SSML, vedi Convalida SSML.

Nuovo supporto per la condivisione di risorse tra origini

Il supporto Cross-Origin Resource Sharing ( CORS ) è ora disponibile per tutte le voci dei browser Google Chrome™ e Apple® Safari. Non è disponibile dal browser Mozilla Firefox™ per le voci nelle seguenti lingue: Arabo, inglese australiano, cinese, olandese e coreano. Per ulteriori informazioni, vedere Utilizzo del supporto CORS.

10 settembre 2020

Correzione difetto: migliorare la voce giapponese

Correzione difetto: per la voce ja-JP_EmiV3Voice, ora il servizio analizza correttamente il testo di input SSML che include una specifica di prosody rate. In precedenza, il seguente utilizzo dell'elemento funzionava correttamente:

<speak>成功する/繁栄する</speak>

Tuttavia, l'uso successivo dell'attributo rate con l'elemento ha fatto sì che il servizio leggesse e riproducesse la notazione SSML incorporata:

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Il servizio ora analizza e applica correttamente l'attributo rate dell'elemento per l'immissione di testo in giapponese.

4 settembre 2020

L'interfaccia di personalizzazione è ora disponibile per tutti
L'interfaccia di personalizzazione è ora disponibile al pubblico (GA). La personalizzazione non è più una funzionalità in versione beta. Puoi utilizzare l'interfaccia di personalizzazione per specificare il modo in cui il servizio pronuncia le parole inusuali presenti nel tuo input creando dizionari personalizzati specifici della lingua. Può essere utilizzata con tutte le voci generalmente disponibili e quelle beta. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.

24 giugno 2020

Nuove voci neurali inglesi e francesi

Il servizio offre ora due nuove voci sintetizzate:

  • Inglese britannico: en-GB_CharlotteV3Voice
  • Francese: fr-FR_NicolasV3Voice

Offre inoltre una versione migliorata della voce neurale britannica già esistente, en-GB_KateV3Voice. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.

Supporto per l'attributo SSML digits dell'elemento <say-as> per il giapponese

Il servizio ora supporta l'attributo « digits » dell'elemento « <say-as> » in SSML con la voce in giapponese. Per ulteriori informazioni, vedi L'elemento say-as.

1 aprile 2020

Nuove voci standard coreane: ko-KR_YoungmiVoice e ko-KR_YunaVoice

Il servizio ora supporta due voci femminili in coreano standard: ko-KR_YoungmiVoice e ko-KR_YunaVoice. Le seguenti informazioni si applicano a entrambe le voci in coreano.

  • Le voci sono funzioni beta. Potrebbero non essere pronte per l'uso in produzione e sono soggette a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
  • Le voci supportano la personalizzazione e il metodo " /v1/pronunciation ".
  • I comandi vocali supportano l'elemento e il parametro timings , disponibili nell'interfaccia WebSocket.
  • Le voci supportano tutti gli elementi SSML (Speech Synthesis Markup Language) ad eccezione dell'SSML di espressività e dell'SSML per la trasformazione della voce.
  • Le voci supportano solo l'Alfabeto Fonetico Internazionale (IPA), non la Rappresentazione Fonetica Simbolic IBM a (SPR), con l'elemento .
Nuovo supporto per le voci in arabo, cinese e olandese

Le voci in arabo, cinese e olandese (versione beta) ora supportano le seguenti funzionalità:

  • Personalizzazione e metodo /v1/pronunciation.
  • L'elemento e il parametro timings , disponibili nell'interfaccia WebSocket.

Vedi le seguenti sezioni per ulteriori informazioni:

  • Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.
  • Per ulteriori informazioni sull'utilizzo dell'interfaccia WebSocket per ottenere i tempi delle parole, vedi Generazione dei tempi delle parole.
  • Per ulteriori informazioni sulla personalizzazione, vedi Informazioni sulla personalizzazione.
  • Per ulteriori informazioni sull'uso dell'IPA e dell'SPR con personalizzazione, consultare la sezione " Introduzione ai simboli fonetici ". (I simboli IPA per l'arabo, il cinese, l'olandese e il coreano non sono ancora stati documentati.) (Questa documentazione sarà presto disponibile.)

24 febbraio 2020

Nuove voci neurali in inglese americano e tedesco

Il servizio ora supporta cinque nuove voci neurali:

  • en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice e en-US_OliviaV3Voice
  • Tedesco: de-DE_ErikaV3Voice

Le nuove voci non supportano i seguenti elementi SSML:

  • SSML espressivo con l'elemento
  • Trasformazione della voce con l'elemento
  • L'attributo volume dell'elemento

Per ulteriori informazioni in merito e su tutte le voci disponibili, vedi Lingue e voci.

Nuovo supporto per Activity Tracker

Il servizio ora supporta l'utilizzo di eventi Activity Tracker per tutte le operazioni di personalizzazione. IBM Cloud Activity Tracker registra le attività avviate dall'utente che modificano lo stato di un servizio in IBM Cloud. Puoi utilizzare questo servizio per indagare su attività anomale e azioni critiche e per rispettare i requisiti di controllo normativi. Inoltre, puoi essere avvertito in merito alle azioni non appena si verificano. Per ulteriori informazioni, vedi Eventi Activity Tracker.

18 dicembre 2019

Nuove voci standard in arabo, cinese e olandese

Il servizio ora supporta sei nuove voci standard in tre nuove lingue:

  • Arabo ar-AR_OmarVoice
  • Cinese (mandarino): zh-CN_LiNaVoice, zh-CN_WangWeiVoice e zh-CN_ZhangJingVoice
  • Paesi Bassi (olandese): nl-NL_EmmaVoice e nl-NL_LiamVoice

Le seguenti informazioni si applicano a queste nuove voci standard:

  • Le nuove voci sono funzioni beta. Le voci potrebbero non essere pronte per l'uso in produzione e sono soggette a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.
  • I dispositivi non supportano l'elemento e il parametro timings , disponibili nell'interfaccia WebSocket.
  • Le voci non supportano la personalizzazione né il metodo /v1/pronunciation .
  • Le voci non supportano l'SSML di espressività o l'SSML per la trasformazione della voce.
  • Le voci non supportano tutti gli altri elementi SSML. Tuttavia, supportano solo l'Alfabeto Fonetico Internazionale (IPA), non la Rappresentazione Fonetica Simbolic IBM a (SPR), con l'elemento .

Per ulteriori informazioni in merito e su tutte le voci disponibili, vedi Lingue e voci.

12 dicembre 2019

Supporto completo per IAM IBM Cloud

Il servizio Text to Speech ora supporta l'implementazione completa di IBM Cloud Identity and Access Management (IAM). Le chiavi API per i servizi di Watson non sono più limitate a una singola istanza del servizio. Puoi creare politiche di accesso e chiavi API che vengono applicate a più di un servizio e puoi concedere l'accesso tra i servizi. Per ulteriori informazioni su IAM, vedi Autenticazione ai servizi Watson.

Per supportare questa modifica, gli endpoint del servizio API utilizzano un dominio diverso e includono l'ID istanza del servizio. Il modello è api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.

  • URL HTTP di esempio per un'istanza ospitata nell'ubicazione Dallas:

    https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • URL WebSocket di esempio per un'istanza ospitata nell'ubicazione Dallas:

    wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Per ulteriori informazioni sugli URL, consultare la sezione Riferimento API e SDK.

Questi URL non costituiscono una modifica importante. I nuovi URL funzionano sulle tue istanze del servizio esistenti o nuove. Gli URL originali continuano a funzionare sulle tue istanze del servizio esistenti per almeno un anno, fino a dicembre 2020.

Nuove funzionalità per la sicurezza della rete e dei dati

Ora è disponibile il supporto per le seguenti nuove funzionalità di sicurezza della rete e dei dati:

  • Supporto per gli endpoint di rete privati

    Gli utenti dei piani Premium possono creare endpoint di rete privati per connettersi al servizio Text to Speech tramite una rete privata. Le connessioni agli endpoint di rete privata non richiedono l'accesso alla rete internet pubblica. Per ulteriori informazioni, vedi Endpoint di rete pubblici e privati.

12 novembre 2019

Nuova sede di Seul ora disponibile
Il servizio " Text to Speech " è ora disponibile nella sede di Seul ( kr-seo ) di IBM Cloud. Come per le altre ubicazioni, l'ubicazione IBM Cloud utilizza l'autenticazione IAM basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.

1 ottobre 2019

Nuovo supporto HIPAA degli Stati Uniti per i piani Premium a Washington, DC, sede
Il supporto HIPAA per gli Stati Uniti è disponibile per i piani Premium ospitati nella sede di Washington, DC e creati a partire dal 1° aprile 2019. Per ulteriori informazioni, vedi HIPAA (Health Insurance Portability and Accountability Act) degli Stati Uniti.

22 agosto 2019

Correzione dei difetti: diversi piccoli miglioramenti
Correzione di un bug: il servizio è stato aggiornato per correggere alcuni piccoli bug e apportare miglioramenti.

30 luglio 2019

Nuova voce neurale giapponese: ja-JP_EmiV3Voice
Il servizio ora offre una voce neurale in giapponese: ja-JP_EmiV3Voice. Sono ora disponibili entrambe le versioni, standard e neurale, di tutte le voci disponibili in tutte le lingue supportate. Per ulteriori informazioni, vedi Lingue e voci.

24 giugno 2019

Nuovo supporto per voci standard e neurali

Il servizio offre ora due versioni della maggior parte delle sue voci disponibili:

  • Voci standard che utilizzano la sintesi concatenata per assemblare segmenti di parlato registrato al fine di generare l'audio. Le voci standard non includono una stringa di versione nel loro nome (ad esempio en-US_AllisonVoice).
  • Voci neurali che utilizzano reti neurali profonde (DNN) per prevedere le caratteristiche acustiche (spettrali) del parlato. Le voci neurali includono una stringa di versione (V3) nel loro nome (ad esempio en-US_AllisonV3Voice).

Sono disponibili versioni neurali per tutte le voci standard, ad eccezione della voce " ja-JP_EmiVoice ", che è in fase di sviluppo e sarà disponibile a breve. Non è possibile utilizzare gli elementi SSML <express-as> e <voice-transformation> con le voci neurali, né è possibile utilizzare l'attributo volume dell'elemento <prosody> con le voci neurali. Per ulteriori informazioni su tutte le voci disponibili, vedi Lingue e voci.

Voci neurali V2 ritirate dal servizio

Il servizio non include più le voci di DNN V2 che erano precedentemente disponibili. Se utilizzi una voce V2 nella tua applicazione, il servizio utilizza invece, in modo automatico, la voce V3 equivalente.

24 marzo 2019

Nuove voci V2 in tedesco neurale

Il servizio ora offre versioni DNN (Deep Neural Network) V2 delle sue voci in tedesco:

  • de-DE_BirgitV2Voice
  • de-DE_DieterV2Voice

Per ulteriori informazioni sulle voci basate su DNN, vedi Lingue e voci.

Nuovo supporto per attributi pitch e rate dell'elemento <prosody> SSML

Tutte le voci del servizio basate su DNN ora supportano gli attributi " pitch " e " rate " dell'elemento " <prosody> " in SSML. Le voci basate su DNN non supportano l'attributo volume dell'elemento . Per ulteriori informazioni, vedi L'elemento prosody.

21 marzo 2019

Visibilità delle credenziali del servizio ora limitata dal ruolo

Gli utenti possono ora visualizzare solo le informazioni sulle credenziali del servizio associate al ruolo che è stato assegnato al loro account IBM Cloud. Ad esempio, se ti viene assegnato un ruolo reader, qualsiasi livello writer o superiore delle credenziali del servizio non sarà più visibile.

Questa modifica non influisce sull'accesso API per gli utenti o le applicazioni con credenziali del servizio esistenti. La modifica influisce solo sulla visualizzazione delle credenziali all'interno di IBM Cloud.

4 marzo 2019

Nuove voci V2 in inglese neurale e italiano

Il servizio ora offre quattro nuove voci V2 che utilizzano la sintesi di apprendimento approfondito per generare l'audio:

  • en-US_AllisonV2Voice
  • en-US_LisaV2Voice
  • en-US_MichaelV2Voice
  • it-IT_FrancescaV2Voice

Queste nuove voci utilizzano il machine learning e una DNN per sintetizzare il testo in voce. La sintesi di apprendimento approfondito o basata su DNN (Deep Neural Network) produce un audio con una prosodia più naturale e una qualità complessiva più coerente.

Tuttavia le nuove voci producono anche un audio con qualità di segnale diverse dalle voci esistenti, quindi potrebbero non essere appropriate per tutte le applicazioni. Inoltre, le nuove voci non supportano gli elementi SSML <prosody>, <express-as> e <voice-transformation>.

Per ulteriori informazioni su queste voci basate su DNN e su come differiscono dalle voci esistenti, vedi Lingue e voci.

28 gennaio 2019

Nuovo supporto per l'interfaccia IBM Cloud IAM by WebSocket

Ora l'interfaccia WebSocket supporta l'autenticazione IAM (Identity and Access Management) basata sul token dal codice JavaScript basato sul browser. La limitazione al contrario è stata rimossa. Per stabilire una connessione autenticata con il metodo WebSocket /v1/synthesize:

  • Se utilizzi l'autenticazione IAM, includi il parametro di query access_token.
  • Se utilizzi le credenziali del servizio Cloud Foundry, includi il parametro di query watson-token.

Per ulteriori informazioni, vedi Apri una connessione.

13 dicembre 2018

Nuova sede di Londra ora disponibile
Il servizio Text to Speech è ora disponibile nell'ubicazione Londra di IBM Cloud® (eu-gb). Come tutte le ubicazioni, Londra utilizza l'autenticazione IAM (Identity and Access Management) basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.

7 novembre 2018

Nuova sede di Tokyo ora disponibile
Il servizio Text to Speech è ora disponibile nell'ubicazione Tokyo di IBM Cloud® (jp-tok). Come tutte le ubicazioni, Tokyo utilizza l'autenticazione IAM (Identity and Access Management) basata sul token. Tutte le nuove istanze di servizio create in questa posizione utilizzano l'autenticazione IAM.

30 ottobre 2018

Nuovo supporto per IAM IBM Cloud basato su token

Il servizio Text to Speech è stato migrato all'autenticazione IAM (Identity and Access Management) basata sul token per tutte le ubicazioni. Tutti i servizi IBM Cloud utilizzano ora l'autenticazione IAM. Il servizio Text to Speech ha eseguito la migrazione in ciascuna ubicazione nelle seguenti date:

  • Dallas (us-south): 30 ottobre 2018
  • Francoforte (eu-de): 30 ottobre 2018
  • Washington, DC (us-east): 12 giugno 2018
  • Sydney (au-syd): 15 maggio 2018

La migrazione all'autenticazione IAM riguarda sia le nuove istanze che quelle esistenti indifferentemente:

  • Tutte le nuove istanze del servizio che crei in ogni ubicazione utilizzano ora l'autenticazione IAM per accedere al servizio. Puoi passare un token di connessione o una chiave API: i token supportano le richieste autenticate senza credenziali del servizio incorporate in ogni chiamata; le chiavi API utilizzano l'autenticazione di base HTTP. Quando utilizzi uno degli SDK Watson, puoi passare la chiave API e lasciare che l'SDK gestisca il ciclo di vita dei token.
  • Le istanze del servizio esistenti che hai creato in un'ubicazione prima della data di migrazione indicata continuano ad utilizzare {username} e {password} dalle loro precedenti credenziali del servizio Cloud Foundry per l'autenticazione finché non le migri in modo che utilizzino l'autenticazione IAM.

Per ulteriori informazioni, consulta la seguente documentazione:

12 giugno 2018

Nuove funzioni per le applicazioni ospitate a Washington, DC, ubicazione

Le seguenti funzioni sono abilitate per le applicazioni ospitate in Washington, DC (us-east):

15 maggio 2018

Nuove funzioni per le applicazioni ospitate nell'ubicazione di Sydney

Le seguenti funzioni sono abilitate per le applicazioni ospitate in Sydney (au-syd):

2 ottobre 2017

Modifiche al formato audio audio/l16
Per il formato audio/l16, ora puoi specificare facoltativamente il tipo di architettura endian (endianness) dell'audio restituito. (Devi aver già specificato la frequenza di campionamento.) Esempi: audio/l16;rate=22050;endianness=big-endian e audio/l16;rate=22050;endianness=little-endian; l'impostazione predefinita è "significant endian". Per ulteriori informazioni, vedi Utilizzo dei formati audio.

14 luglio 2017

Nuovo supporto per il formato audio MP3 (MPEG)
Ora il servizio supporta il formato audio MP3 o MPEG (Motion Picture Experts Group). Per ulteriori informazioni sui formati audio supportati, consultare la sezione " Utilizzo dei formati audio ".

10 aprile 2017

Nuovo supporto per il formato audio Web Media (WebM)
Ora il servizio supporta il formato audio Web Media (WebM) con il codec Opus o Vorbis. Al momento il servizio supporta anche il formato audio Ogg con il codec Vorbis in aggiunta al codec Opus. Per ulteriori informazioni sui formati audio supportati, consultare la sezione " Utilizzo dei formati audio ".
Nuovo supporto per la condivisione di risorse tra origini
Ora il servizio supporta CORS (Cross-Origin Resource Sharing) per consentire ai client basati sul browser di richiamare direttamente il servizio. Per ulteriori informazioni, vedere Utilizzo del supporto CORS.
Modifiche ai codici di risposta HTTP di successo
I codici di risposta HTTP per il completamento riuscito di alcuni metodi dell'interfaccia di personalizzazione sono cambiati:
  • Il metodo POST /v1/customizations ora restituisce 201 (invece di 200).
  • Il metodo POST /v1/customizations/{customization_id} ora restituisce 200 (invece di 201).
  • Il metodo POST /v1/customizations/{customization_id}/words ora restituisce 200 (invece di 201).
  • Il metodo PUT /v1/customizations/{customization_id}/words/{word} ora restituisce 200 (invece di 201).
Nuovi errori per l'uso improprio del parametro part_of_speech giapponese
I metodi POST /v1/customizations/{custom_id}/words e PUT /v1/customizations/{customization_id}/words/{word} ora restituiscono il codice risposta HTTP 400 con il messaggio di errore Part of speech is supported for ja-JP language only se tenti di specificare part_of_speech per una lingua diversa dal giapponese.
Modifiche al corpo della risposta per l'aggiunta del metodo di parole
Il metodo POST /v1/customizations/{custom_id}/words ora restituisce un corpo della risposta vuoto ({}).

1 dicembre 2016

Nuova voce spagnola latinoamericana: es-LA_SofiaVoice

Il servizio include una nuova voce, es-LA_SofiaVoice, che è l'equivalente latino americano della voce es-US_SofiaVoice. La differenza più significativa tra le due versioni riguarda il modo in cui interpretano il simbolo del dollaro ( $ ): la versione latinoamericana utilizza il termine «pesos», mentre quella nordamericana utilizza il termine «dolar ». Tra le due voci potrebbero esistere anche altre piccole differenze.

Nuove voci in inglese americano: en-US_LisaVoice e en-US_MichaelVoice

In aggiunta a en-US_AllisonVoice, ora altre due voci sono trasformabili con la trasformazione della voce SSML: en-US_LisaVoice e en-US_MichaelVoice.

Modifiche alla personalizzazione per il giapponese

Quando si utilizza l'interfaccia di personalizzazione in giapponese, il servizio ora individua la parola più lunga tra le coppie parola/traduzione definite per un modello personalizzato. Ad esempio, si considerino le due voci seguenti relative a un modello personalizzato:

{
  "words": [
    {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"},
    {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"}
  ]
}

Se il servizio individua la stringa « NYC » nel testo di input, la considera una corrispondenza perché è più lunga rispetto a « NY ». In precedenza, il servizio avrebbe individuato la stringa NY. Per ulteriori informazioni sull'utilizzo delle voci in giapponese in un modello personalizzato, consultare la sezione " Utilizzo delle voci in giapponese ".

22 settembre 2016

La personalizzazione è ora disponibile per tutte le lingue
L'interfaccia di personalizzazione, che include la personalizzazione e i metodi GET /v1/pronunciation, è ora disponibile per tutte le lingue supportate dal servizio. L'interfaccia rimane a una release beta. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.
Nuovo supporto giapponese per SSML
Il servizio ora supporta SSML per il giapponese. Per informazioni generali sul supporto SSML, vedi Understanding SSML. Per informazioni sui simboli SPR e IPA in giapponese, vedi Simboli per il giapponese. Quando si creano voci per le parole in un modello personalizzato giapponese, occorre tenere conto di ulteriori aspetti e utilizzare il campo " part_of_speech ". Per ulteriori informazioni, vedi Utilizzo di voci in giapponese.
Nuova funzione SSML di trasformazione vocale
Il servizio offre ora la trasformazione vocale SSML tramite il nuovo elemento <voice-transformation>. È possibile ampliare la gamma di voci disponibili creando trasformazioni personalizzate che modificano l'intonazione, l'estensione vocale, la tensione glottale, la respirazione, la velocità e il timbro di una voce. Il servizio offre anche due voci virtuali integrate, Young e Soft. Al momento il servizio supporta la trasformazione della voce solo per la voce in inglese (Stati Uniti) Allison.
I tempi delle parole sono ora disponibili con interfaccia WebSocket
Ora il servizio può restituire le informazioni di temporizzazione per tutte le stringhe del testo di input che passi all'interfaccia WebSocket. Per ricevere il tempo di inizio e di fine di ogni stringa nell'input, specifica un array che include la stringa words per il parametro facoltativo timings dell'oggetto JSON che passi al servizio. La funzione non è al momento disponibile per il testo di input in giapponese. Per ulteriori informazioni, vedi Generating word timings.
Nuovo supporto per la convalida SSML
Ora il servizio convalida tutti gli elementi SSML che inoltri in qualsiasi contesto. Se trova una tag non valida, il servizio riporta un codice di risposta HTTP 400 con un messaggio descrittivo e il metodo ha esito negativo. Nelle versioni precedenti, il servizio gestiva gli errori in modo non uniforme; specificare una pronuncia errata di una parola, ad esempio, poteva causare un comportamento imprevedibile o incoerente. Per ulteriori informazioni, vedi Convalida SSML.
IBM formato SPR ora specificato con ibm invece di spr
L'uso di spr è deprecato come argomento dell'opzione format del metodo GET /v1/pronunciation e per l'utilizzo con l'attributo alphabet di un elemento SSML . Per utilizzare la notazione IBM SPR, utilizza l'argomento ibm invece di spr in tutti i casi.
Nuovo supporto per il formato audio audio/mulaw
L'elenco dei formati audio supportati ora include l' audio/mulaw;rate={rate}. Come audio/basic, questo formato fornisce un audio a canale singolo che viene codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio.
Nuove funzioni supportate identificate quando si elencano le voci
Ora i metodi GET /v1/voices e GET /v1/voices/{voice} restituiscono un oggetto supported_features come parte del loro output per ciascuna voce. L'oggetto indica se la voce supporta la personalizzazione e l'elemento SSML <voice_transformation> . Per ulteriori informazioni, vedi Lingue e voci.

23 giugno 2016

Nuova interfaccia WebSocket per la sintesi vocale

Ora il servizio offre un'interfaccia WebSocket per sintetizzare il testo in voce. L'interfaccia offre le stesse funzioni del metodo /v1/synthesize dell'interfaccia HTTP. Accetta il testo semplice o il testo contrassegnato con SSML. Inoltre, supporta anche l'uso dell'elemento SSML per identificare il punto del brano audio in cui termina la sintesi di tutto il testo che precede il segno. Per ulteriori informazioni, vedi L'interfaccia WebSocket.

Supporto lingua esteso per SSML

Ora il servizio offre il supporto per il testo annotato con SSML per le lingue spagnolo castigliano e spagnolo nord americano, italiano e portoghese brasiliano. Il servizio supportava già l'uso di SSML per inglese (Stati Uniti) e britannico, francese e tedesco. A partire da questo aggiornamento, il servizio supporta SSML per tutte le lingue ad eccezione del giapponese. Inoltre, è possibile utilizzare sia la notazione SPR che quella IPA ( IBM ) per definire la pronuncia delle parole con l'elemento SSML . Per ulteriori informazioni, vedi Understanding SSML e Understanding phonetic symbol.

Per l'inglese americano, è anche possibile utilizzare l'elemento SSML per creare voci di parole in un modello personalizzato; la personalizzazione è supportata solo per l'inglese americano. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.

Voci aggiornate per una migliore sintesi vocale

Il servizio offre una migliore espressività e naturalezza per le voci utilizzate più di frequente. I miglioramenti si basano sulla predizione della prosodia basata su RNN (Recursive Neural Network) derivante dal testo di input. Sono resi disponibili come nuovi aggiornamenti al motore di servizio e al modello vocale per le seguenti lingue:

  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • fr-FR_ReneeVoice
Nuovo parametro ID personalizzazione per la pronuncia della parola

Ora il metodo GET /v1/pronunciation accetta un parametro di query customization_id facoltativo. Il parametro ottiene una traduzione di una parola da un modello personalizzato specificato. Se il modello personalizzato non contiene la parola, il metodo restituisce la pronuncia predefinita della parola. Per ulteriori informazioni, consultare la sezione Riferimento API e SDK.

Quando utilizzi il metodo GET /v1/pronunciation senza un ID di personalizzazione e per una lingua diversa dall'inglese (Stati Uniti), puoi richiedere la pronuncia di una parola solo nella notazione IBM SPR. Per le lingue diverse dall'inglese (Stati Uniti), devi specificare spr con l'opzione format del metodo.

Nuovo supporto per il formato audio audio/basic

Ora l'elenco dei formati audio supportati include audio/basic, che fornisce un audio a canale singolo che viene codificato utilizzando dati u-law (o mu-law) a 8 bit campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio.

Le interfacce HTTP e WebSocket possono ora restituire gli avvertimenti

I metodi /v1/synthesize HTTP e WebSocket possono restituire una risposta warnings che include messaggi relativi a parametri di query o campi JSON non validi che vengono inclusi in una richiesta. Il formato delle avvertenze è stato modificato. Il seguente esempio mostra il formato precedente:

"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."

Ora la stessa avvertenza ha il seguente formato:

"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."

10 marzo 2016

I metodi di sintesi possono ora restituire avvertenze
Ora i metodi GET e POST /v1/synthesize possono restituire un'intestazione di risposta Warnings che include un elenco di messaggi di avvertenza relativi a parametri di query o campi JSON non validi che vengono inclusi nella richiesta. Ogni elemento dell'elenco include una stringa che descrive la natura dell'avvertenza seguita da un array di stringhe di argomenti non validi; ad esempio, Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']. Per ulteriori informazioni, vedi ilRiferimento API & SDK.
L'SDK Beta Apple iOS è obsoleto
La versione beta *Watson Kit di sviluppo software (SDK) per la sintesi vocale per il sistema operativo Apple® iOS * è stata dismessa e sostituita da Watson Swift SDK. Il nuovo SDK è disponibile nel repository swift-sdk, nello spazio dei nomi watson-developer-cloud, all'indirizzo GitHub.

22 febbraio 2016

Nuova funzione SSML espressiva
Il servizio è stato aggiornato con una nuova funzione SSML di espressività. Il servizio estende SSML con un elemento , che è possibile utilizzare per indicare l'espressività in uno dei tre stili di pronuncia: GoodNews, ` `Apology o Uncertainty``. Puoi applicare l'elemento all'intero corpo del testo, a un periodo, a una frase o a una parola. Al momento il servizio supporta l'espressività solo per la voce in inglese (Stati Uniti) Allison (en-US_AllisonVoice).

17 dicembre 2015

Nuova interfaccia di personalizzazione beta

Il servizio offre una nuova interfaccia di personalizzazione che puoi utilizzare per specificare la pronuncia di parole insolite nel tuo input. L'interfaccia include alcuni nuovi metodi che è possibile utilizzare per creare e gestire modelli personalizzati e le coppie parola/traduzione in essi contenute. Puoi quindi utilizzare i tuoi modelli personalizzati per sintetizzare il testo in audio.

Il servizio supporta le traduzioni di suoni simili e le traduzioni fonetiche. Le traduzioni fonetiche possono utilizzare la rappresentazione IPA o IBM SPR proprietaria. Utilizzi SSML per specificare le traduzioni fonetiche.

L'interfaccia di personalizzazione include una raccolta di nuovi metodi HTTP denominati POST /v1/customizations, POST /v1/customizations/{customization_id}, POST /v1/customizations/{customization_id}/words e PUT /v1/customizations/{customization_id}/words/{word}. Il servizio fornisce anche un nuovo metodo GET /v1/pronunciation che restituisce la pronuncia di qualsiasi parola e un nuovo metodo GET /v1/voices/{voice} che restituisce le informazioni dettagliate su una specifica voce. Inoltre, i metodi esistenti dell'interfaccia del servizio ora accettano parametri di modello personalizzati, se necessario.

Per ulteriori informazioni sulla personalizzazione e sulla sua interfaccia, vedere Comprendere la personalizzazione e il riferimento all'API e all'SDK.

L'interfaccia di personalizzazione è una release beta che al momento supporta solo l'inglese (Stati Uniti). Attualmente, tutti i metodi di personalizzazione e il metodo GET /v1/pronunciation possono essere utilizzati per creare e modificare modelli personalizzati e traduzioni di parole solo in inglese americano.

Nuova voce portoghese brasiliano: pt-BR_IsabelaVoice

Il servizio supporta una nuova voce, pt-BR_IsabelaVoice, per sintetizzare l'audio in portoghese brasiliano con una voce femminile. Per ulteriori informazioni, vedi Lingue e voci.

21 settembre 2015

Nuovi SDK mobili disponibili

Sono disponibili due nuovi SDK (Software Development Kit) mobili versione beta per i servizi vocali. Gli SDK consentono alle applicazioni mobili di interagire con i servizi Text to Speech e Speech to Text. Puoi utilizzare gli SDK per inviare testo al servizio Text to Speech e ricevere una risposta audio.

  • L'SDK di Watson Swift è disponibile nel repository swift-sdk, nello spazio dei nomi watson-developer-cloud su GitHub.
  • L' Watson Speech Android™ SDK è disponibile nel repository speech-android-sdk nello spazio dei nomi watson-developer-cloud su GitHub.

Entrambi gli SDK supportano l'autenticazione con i servizi vocali utilizzando le credenziali del servizio IBM Cloud o un token di autenticazione. Poiché gli SDK sono in fase beta, sono soggetti a modifiche future.

Nuova voce giapponese: ja-JP_EmiVoice

Il servizio supporta una nuova lingua, il giapponese. La voce ja-JP_EmiVoice è una voce femminile in giapponese.

1 luglio 2015

Il servizio Text to Speech è ora generalmente disponibile

Il servizio è passato dalla fase beta alla disponibilità generale (GA) il 1° luglio 2015. Di seguito sono riportate le differenze esistenti tra la versione beta e quella definitiva dell'API Text to Speech. La release GA richiede che gli utenti eseguano l'upgrade alla nuova versione del servizio.

Nuovo modello di programmazione basato su token

Un nuovo modello di programmazione supporta l'interazione diretta tra un client e il servizio. Utilizzando questo modello, un client può ottenere un token di autenticazione per comunicare direttamente con il servizio. Utilizzando il token, il client può eludere la necessità di un'applicazione proxy lato server in IBM Cloud che richiami il servizio per suo conto. I token sono i mezzi preferiti per i client per interagire con il servizio.

Il servizio continua a supportare il vecchio modello di programmazione basato su un proxy lato server per trasmettere le comunicazioni e i dati tra il client e il servizio. Tuttavia, il nuovo modello è più efficiente e offre una velocità effettiva più elevata.

Nuovo supporto per il linguaggio di markup di sintesi vocale

Ora puoi passare SSML (Speech Synthesis Markup Language) alle versioni GET e POST HTTP del metodo /v1/synthesize. SSML è un linguaggio di markup basato su XML progettato per fornire annotazioni di testo per le applicazioni di sintesi vocale come il servizio Text to Speech. Per ulteriori informazioni sul passaggio dell'input SSML al servizio, vedi Specifica del testo di input.

Il servizio supporta inizialmente l'utilizzo di SSML solo per le lingue inglese (Regno Unito) e inglese (Stati Uniti), francese e tedesco. Il servizio non supporta SSML con l'italiano e lo spagnolo. Quando utilizzi SSML, assicurati di non selezionare una delle lingue non supportate per una voce per l'audio. I risultati in questo caso non sono significativi.

Modifiche alle voci disponibili

Le voci supportate per la sintesi vocale modificata e ampliata. Il servizio ora supporta diverse altre voci, lingue e dialetti tramite i metodi /v1/synthesize. Per ulteriori informazioni sulle voci supportate, vedi Lingue e voci.

Tre voci che erano disponibili nella versione beta sono state ridenominate per la GA:

  • VoiceEnUsMichael ora è en-US_MichaelVoice
  • VoiceEnUsLisa ora è en-US_LisaVoice
  • VoiceEsEsEnrique ora è es-ES_EnriqueVoice

I nomi precedenti delle voci continuano a funzionare con la versione beta del servizio (tramite gli endpoint API -beta) mentre tale versione rimane disponibile. Tuttavia, devi utilizzare i nuovi nomi con la versione GA del servizio.

Nuovo supporto per il formato audio FLAC (Free Lossless Audio Codec)

Ora puoi richiedere al servizio di restituire l'audio nel formato FLAC (Free Lossless Audio Codec). Il servizio può ancora restituire l'audio nel formato Ogg con il codec Opus (l'impostazione predefinita) e nel formato WAV (Waveform Audio File Format). Per ulteriori informazioni sull'utilizzo dei formati audio con i metodi dell' /v1/synthesize, consultare la sezione " Utilizzo dei formati audio ".

Nuovi limiti sulla quantità massima di testo sintetizzato

Il testo che invii al metodo /v1/synthesize nell'URL di una richiesta GET HTTP o nel corpo di una richiesta POST HTTP è ora limitato a un massimo di 5 KB. Il testo aveva una dimensione massima di 4 MB per la versione beta.

Nuova intestazione per rifiutare di contribuire ai miglioramenti del servizio

Ora i metodi /v1/synthesize includono l'intestazione X-WDC-PL-OPT-OUT per controllare se il servizio utilizza il testo e i risultati audio provenienti da un'operazione per migliorare i risultati futuri. Specifica un valore 1 affinché l'intestazione impedisca al servizio di utilizzare il testo e i risultati audio. Il parametro si applica solo alla richiesta corrente. La nuova intestazione sostituisce l'intestazione X-logging proveniente dai metodi beta. Per ulteriori informazioni, vedi Controllo della registrazione delle richieste per i servizi Watson.

Modifiche ai codici di errore HTTP per la sintesi vocale

Per i metodi /v1/synthesize, sono cambiati i seguenti codici di errore:

  • Il codice di errore 406 ("Not acceptable. Tipo MIME non supportato. ") viene rimosso.
  • Il codice di errore 415 ("Unsupported Media Type") è stato aggiunto.
  • Il codice di errore 503 ("Service Unavailable") è stato aggiunto.
Modifiche ai codici di errore HTTP per le voci di elenco

Per il metodo GET /v1/voices, sono cambiati i seguenti codici di errore:

  • Il codice di errore 406 ("Not acceptable. Tipo MIME non supportato. ") viene rimosso.
  • Il codice di errore 415 ("Unsupported Media Type") è stato aggiunto.