Note sulla release per Text to Speech per IBM Cloud Pak for Data

IBM Cloud Pak for Data

Le seguenti funzionalità e modifiche sono state incluse in ogni release e aggiornamento delle istanze installate o on-premises di IBM Watson® Text to Speech per IBM Cloud Pak for Data. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.

Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.

Per informazioni sui rilasci e gli aggiornamenti del servizio per IBM Cloud, vedere le note di rilascio per Text to Speech per IBM Cloud.

30 ottobre 2024 (Versione 4.8.7 )

La versione 4.8.7 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.7 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

25 settembre 2024 (Versione 5.0.3 )

La versione 5.0.3 è ora disponibile
è ora disponibile la versione 5.0.3 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 agosto 2024 (Versione 4.8.6 )

La versione 4.8.6 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.6 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 agosto 2024 (Versione 5.0.2 )

La versione 5.0.2 è ora disponibile
è ora disponibile la versione 5.0.2 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

31 luglio 2024 (Versione 5.0.1 )

La versione 5.0.1 è ora disponibile
è ora disponibile la versione 5.0.1 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

19 giugno 2024 (Versione 5.0.0 )

La versione 5.0.0 è ora disponibile
è ora disponibile la versione 5.0.0 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

24 aprile 2024 (Versione 4.8.5 )

La versione 4.8.5 è ora disponibile
è ora disponibile la versione 4.8.5 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

27 marzo 2024 (Versione 4.8.4 )

La versione 4.8.4 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.4 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 febbraio 2024 (Versione 4.8.3 )

La versione 4.8.3 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.3 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

31 gennaio 2024 (Versione 4.8.2 )

La versione 4.8.2 è ora disponibile
è ora disponibile la versione 4.8.2 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

30 novembre 2023 (Versione 4.8.0 )

La versione 4.8.0 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.0 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

27 settembre 2023 (Versione 4.7.3 )

La versione 4.7.3 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.3 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 luglio 2023 (Versione 4.7.1 )

La versione 4.7.1 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.1 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

9 giugno 2023 (Versione 4.7.0 )

La versione 4.7.0 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.0 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

2 maggio 2023 (Versione 4.6.5)

La versione 4.6.5 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.6.5 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.10 e 4.12. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Nuove voci neurali espressive dell'inglese australiano

Il servizio ora supporta due nuove voci neurali espressive per l'inglese australiano:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove voci sono generalmente disponibili (GA) per l'uso in produzione. Supportano l'utilizzo di simboli fonetici standard IPA (International Phonetic Alphabet) e IBM SPR (Symbolic Phonetic Representation). Per ulteriori informazioni, vedi

Nuova voce neurale avanzata coreana

Il servizio ora supporta una nuova voce neurale avanzata per il coreano: ko-KR_JinV3Voice. La nuova voce è generalmente disponibile (GA) per uso di produzione. Supporta l'utilizzo di simboli fonetici IPA (International Phonetic Alphabet) standard e IBM SPR (Symbolic Phonetic Representation). Per ulteriori informazioni, vedi

Nuova versione beta olandese migliorata della voce neurale

Il servizio ora supporta una nuova voce femminile neurale migliorata per l'olandese olandese: nl-NL_MerelV3Voice. Supporta l'utilizzo di simboli fonetici IPA (International Phonetic Alphabet) standard e IBM SPR (Symbolic Phonetic Representation).

La nuova voce è una funzionalità beta in attesa del completamento del supporto per SSML. Al suo rilascio iniziale, la voce non supporta l'uso delle seguenti funzionalità correlate a SSML:

  • L'elemento <prosody> con qualsiasi richiesta di sintesi vocale
  • I parametri rate_percentage e pitch_percentage con qualsiasi richiesta di sintesi vocale
  • L'elemento <mark> con una richiesta di sintesi vocale WebSocket
  • Il parametro timings del messaggio di testo JSON con una richiesta di sintesi vocale WebSocket

Per ulteriori informazioni sulla nuova voce, il suo supporto per i simboli IPA e SPR e la migrazione alla nuova voce dalle voci neurali olandesi obsolete, vedi

Nuova variabile di ambiente per la risorsa personalizzata dei servizi Speech

La documentazione include ora istruzioni per creare una variabile di ambiente denominata ${CUSTOM_RESOURCE_SPEECH}. Si aggiunge la nuova variabile allo script cpd_vars.sh e si crea lo script per utilizzare la variabile nel proprio ambiente. Per ulteriori informazioni, vedi Informazioni necessarie per completare questa attività in Installazione di Watson Speech serviceso fai riferimento a uno degli argomenti di aggiornamento per i servizi Speech.

Correzione difetto: la voce francese canadese ora gestisce correttamente gli orari numerici

Defect fix: le voci franco - canadesi ora pronunciano correttamente tempi come 19:41. In precedenza, le voci omettevano elementi del tempo nell'audio sintetizzato.

Correzione difetto: la voce giapponese non inserisce più un audio imprevisto

Correzione del difetto: la voce giapponese non inserisce più un audio non previsto nei risultati di sintesi vocale. In precedenza, l'audio aggiuntivo era inserito in alcuni casi.

Correzione del difetto: aggiornare i simboli fonetici coreani nella documentazione

Correzione dei difetti: nella documentazione per i simboli SPR coreani, i simboli di due caratteri per le consonanti sono ora racchiusi tra virgolette singole, rendendoli un singolo simbolo. In precedenza, erano mostrati come due simboli separati, senza virgolette. Per ulteriori informazioni, vedi Consonanti(coreano).

Aggiornamenti della documentazione per i simboli IBM SPR

La documentazione di panoramica per i simboli SPR IBM è stata aggiornata per chiarire l'utilizzo di simboli a più caratteri. Per ulteriori informazioni, vedi Simboli audio vocale).

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

29 marzo 2023 (versione 4.6.4)

La versione 4.6.4 è ora disponibile
Text to Speech per IBM Cloud Pak for Data versione 4.6.4 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.10 e 4.12. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.
Importante: eseguire il backup dei dati prima dell'aggiornamento alla versione 4.6.3 o 4.6.4
Importante: prima di eseguire l'upgrade a Watson Speech services version 4.6.3 o 4.6.4, devi eseguire un backup dei tuoi dati. Conservare il backup in una posizione sicura. Per ulteriori informazioni sul backup dei tuoi dati dei servizi Watson Speech, vedi Backup e ripristino dei dati dei servizi Watson Speech in Amministrazione Watson Speech. Tale argomento include anche le informazioni sul ripristino dei dati, se necessario.
Correzione dei difetti: ora è possibile modificare i modelli e le voci installati con opzioni di installazione avanzate
Correzione del difetto: durante l'installazione, è ora possibile specificare diversi modelli o voci con le opzioni di installazione avanzate della CLI (command - line interface). In precedenza, il servizio installava sempre i modelli e le voci predefiniti. La limitazione continua ad applicarsi per i servizi Watson Speech versioni 4.6.0, 4.6.2e 4.6.3. Per informazioni sull'installazione di modelli e voci, vedi Specifica di opzioni di installazione aggiuntive in Installazione di servizi Watson Speech.
Impostazione dei timeout del programma di bilanciamento del carico
I servizi Watson Speech richiedono che tu modifichi le impostazioni di timeout del programma di bilanciamento del carico sia per il server che per il client in 300 secondi. Queste impostazioni assicurano che le richieste di riconoscimento vocale di lunga durata, quelle con audio lungo o difficile, abbiano tempo sufficiente per il completamento. Per ulteriori informazioni, consulta Informazioni necessarie per completare questa attività in Installazione di Watson Speech services.
Aggiornamenti della documentazione per i simboli IBM SPR
La documentazione di panoramica per i simboli SPR IBM è stata aggiornata per chiarire l'utilizzo di simboli a più caratteri. Per ulteriori informazioni, vedi Simboli audio vocale.
Vulnerabilità della sicurezza risolte
Le seguenti vulnerabilità di sicurezza sono state corrette:

23 febbraio 2023 (Versione 4.6.3)

La versione 4.6.3 è ora disponibile

È ora disponibile Text to Speech per IBM Cloud Pak for Data versione 4.6.3. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versione 4.10. Red Hat OpenShift versione 4.8 non è più supportato. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Problema noto: non puoi modificare i modelli e le voci installati con le opzioni di installazione avanzate

Problema noto: attualmente non è possibile specificare diversi modelli o voci con le opzioni di installazione avanzate. Il servizio installa sempre i modelli e le voci predefiniti. Per informazioni sulla modifica dei modelli dopo l'installazione, vedi Aggiornamento di modelli e voci per i tuoi servizi Watson Speech nell'argomento Administration di Watson Speech services on IBM Cloud Pak for Data.

Problema noto: l'aggiornamento alla versione 4.6.3 potrebbe non essere completato

Problema noto: quando si esegue l'aggiornamento alla versione 4.6.3, l'eliminazione del lavoro di backup MinIO potrebbe non riuscire una volta completato. In questo caso, la soluzione consiste nell'eliminare il lavoro, dopo di che l'aggiornamento procede normalmente. Eseguire le seguenti operazioni per risolvere il problema.

  1. Per determinare se il lavoro di backup MinIO rimane non eliminato, immettere il comando riportato di seguito:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    Il lavoro MinIO che non viene eliminato viene identificato da una voce del seguente formato:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Per eliminare il lavoro di backup MinIO, immettere il seguente comando:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Una volta eliminato il processo di backup, l'aggiornamento continua e viene completato.

Ulteriori informazioni sull'utilizzo delle istanze del servizio

La documentazione ora include informazioni sulla creazione di un'istanza del servizio con la CLI (cpl-cli) e sulla gestione delle istanze del servizio. Per ulteriori informazioni, vedi i seguenti argomenti di Watson Speech services on IBM Cloud Pak for Data:

  • Creazione di un'istanza dei servizi Watson Speech in Configurazione post - installazione
  • Gestione delle tue istanze dei servizi Watson Speech in Amministrazione
Correzione difetto: la beta Tune by Example è ora disponibile

Correzione del difetto: La funzione beta Tune by example è ora disponibile per Text to Speech per IBM Cloud Pak for Data. In precedenza, non era possibile creare modelli di altoparlanti.

Correzione difetto: la specifica di numeri cardinali grandi con l'elemento <say-as> non causa più errori per le voci inglesi

Correzione del difetto: è ora possibile utilizzare l'elemento <say-as> per pronunciare numeri grandi come numeri cardinali. In precedenza, racchiudere un numero elevato nell'elemento <say-as> con l'attributo interpret-as="cardinal" potrebbe causare un errore di sintesi vocale per le voci in inglese. Ad esempio, <say-as interpret-as="cardinal">3,200</say-as> potrebbe causare un errore del servizio. Per ulteriori informazioni, consultare cardinale nell'argomento Elementi SSML.

Correzione del difetto: gli omonimi e altre parole sono ora pronunciati correttamente dalle voci inglesi

Correzione del difetto: il servizio ora pronuncia gli omonimi e altre parole correttamente in base al loro contesto nel testo inglese che deve essere sintetizzato. In precedenza, parole come advocate e wifi potevano essere pronunciate in modo non corretto dalle voci inglesi.

Vulnerabilità della sicurezza risolta

La seguente vulnerabilità della sicurezza è stata corretta:

30 gennaio 2023 (Versione 4.6.2)

La versione 4.6.2 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.6.2 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.8 e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

La risorsa personalizzata include ora una nuova proprietà fileStorageClass

La risorsa personalizzata per i servizi Watson Speech ora include una proprietà fileStorageClass in aggiunta alla proprietà blockStorageClass esistente. Specificare le classi di archiviazione blocchi e file quando si installa o si aggiorna un servizio. Durante l'aggiornamento da una versione precedente, la nuova proprietà viene aggiunta automaticamente alla risorsa personalizzata dall'opzione --file_storage_class sul comando cli manage apply-cr.

Per ulteriori informazioni sulle classi di archiviazione blocchi e file disponibili che utilizzi con ciascuna delle soluzioni di archiviazione supportate, consulta la tabella di Requisiti di archiviazione in Informazioni necessarie per completare questa attività nella pagina "Installazione di Watson Speech services" in Watson Speech services on IBM Cloud Pak for Data.

Ulteriori informazioni relative al provisioning di un'istanza del servizio

La documentazione ora include informazioni sulla creazione di un'istanza del servizio in modo programmatico. Include anche esempi di elencazione delle istanze del servizio ed eliminazione di un'istanza del servizio. Per ulteriori informazioni, consulta Creating a Watson Speech services instance nella documentazione Post - installation setup in Watson Speech services on IBM Cloud Pak for Data.

La codifica lato server è abilitata per l'archivio dati MinIO

I servizi vocali hanno ora abilitato la crittografia lato server per l'archiviazione oggetti nell'archivio dati MinIO. Non è richiesta alcuna azione da parte dell'utente.

Modifica in webhook di controllo

I servizi di sintesi vocale hanno ora rimosso la dipendenza webhook di verifica. I servizi ora scrivono gli eventi di verifica direttamente sul server. Dopo l'aggiornamento alla versione 4.6.2, alcune risorse webhook potrebbero rimanere fino a quando tutti i servizi non possono rimuovere la dipendenza. Le risorse rimanenti verranno rimosse in una release futura. Non è richiesta alcuna azione da parte dell'utente.

Nuove voci neurali espressive in inglese americano

Il servizio offre quattro nuove voci neurali espressive per l'inglese americano:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Le voci neurali espressive offrono un linguaggio dal suono naturale, eccezionalmente chiaro, croccante e fluido. Le nuove voci sono generalmente disponibili (GA) per l'uso in produzione. Supportano l'utilizzo di simboli fonetici standard IPA (International Phonetic Alphabet) e IBM SPR (Symbolic Phonetic Representation). Per ulteriori informazioni, vedi

Nuovi stili parlanti con voci neurali espressive

Le voci neurali espressive determinano il sentimento del testo dal contesto delle parole e delle frasi. Il discorso che producono, oltre ad avere uno stile molto colloquiale, riflette l'umore del testo. Ma puoi abbellire le tendenze naturali delle voci indicando che tutto o parte del testo è quello di enfatizzare uno dei seguenti stili parlanti:

  • Allegro- Esprime felicità e buone notizie.
  • Empatico- Esprime empatia o simpatia.
  • Neutrale- Esprime obiettività e uniformità.
  • Incerto- Esprime confusione o incertezza.

Per ulteriori informazioni, consultare Utilizzo degli stili di conversazione.

Nuova enfasi di interezione con voci neurali espressive

Con le voci neurali espressive, il servizio rileva automaticamente un insieme di interiezioni comuni basate sul contesto. Quando sintetizza queste interiezioni, dà loro l'enfasi naturale che un essere umano userebbe nella conversazione normale. Per alcune delle interezioni, è possibile utilizzare SSML per abilitarne o disabilitarne l'enfasi. Per ulteriori informazioni, vedi Enfatizzazione delle interiezioni.

Nuova parola emphais con voci neurali espressive

Le voci espressive utilizzano uno stile conversazionale che applica naturalmente l'intonazione corretta dal contesto. Ma si può indicare che una o più parole devono essere date più o meno enfasi. La variazione dello stress può essere indicata da un aumento o una diminuzione dell'altezza, del tempo, del volume o di altri attributi acustici. Per ulteriori informazioni, vedi Sottolineatura delle parole.

Il servizio ora applica una convalida SSML più rigorosa

Il servizio ora applica una convalida più rigorosa del testo di input che include gli elementi SSML (Speech Synthesis Markup Language). Gli elementi richiesti degli attributi devono essere specificati con valori validi. Altrimenti, la richiesta ha esito negativo con un codice di errore 400. Per ulteriori informazioni sulla convalida SSML e sui requisiti che il testo contrassegnato deve soddisfare, consultare Convalida SSML.

Correzione difetto: il sesso elencato per la voce en-US_MichaelExpressive è ora corretto

Correzione del difetto: quando si elencano le informazioni sulle voci disponibili, il gender della voce en-US_MichaelExpressive è ora male. In precedenza, il genere della voce era erroneamente descritto come female. Per ulteriori informazioni, vedi Elenco delle informazioni sulle voci.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

30 novembre 2022 (Versione 4.6.0)

La versione 4.6.0 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.6.0 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.8 e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Amazon Web Services (AWS) è ora supportato

Watson I servizi di parlare per IBM Cloud Pak for Data sono ora supportati su Amazon Web Services™ (AWS™). I servizi supportano Amazon Elastic Block Store, che specifichi impostando la proprietà blockStorageClass della risorsa personalizzata dei servizi Speech su gp2-csi o gp3-csi.

Le nuove classi di memoria sono ora supportate

Watson Servizi di discorso per IBM Cloud Pak for Data ora supportano due classi di archiviazione aggiuntive:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Specificare la classe di archiviazione con la proprietà blockStorageClass della risorsa personalizzata dei servizi Speech. Per ulteriori informazioni su tutte le classi di archiviazione supportate, vedi i seguenti argomenti in Watson Speech services on IBM Cloud Pak for Data:

  • Prima di iniziare in Installazione dei servizi Watson Speech
  • Specifica di una classe di storage in Utilizzo della risorsa personalizzata dei servizi Watson Speech
Problema noto: alcuni pod dei servizi Watson Speech non contengono annotazioni utilizzate per la pianificazione

problema noto: ad alcuni pod dei servizi Watson Speech manca l'annotazione cloudpakInstanceId. Se utilizzi il servizio di pianificazione IBM Cloud Pak for Data, tutti i pod dei servizi Watson Speech senza l'annotazione cloudpakInstanceId sono

  • Pianificata dal programma di pianificazione predefinito Kubernetes piuttosto che dal servizio di pianificazione
  • Non incluso nell'applicazione della quota
Monitoraggio dell'archivio dati PostgreSQL ora disponibile

Puoi ora abilitare il monitoraggio dell'archivio dati PostgreSQL per ricevere aggiornamenti sul suo utilizzo e stato dai servizi Watson Speech. Gli eventi possono essere utilizzati dal software di controllo Prometheus o da qualsiasi applicazione utilizzata per il monitoraggio. Abilitando il monitoraggio per i progetti definiti dall'utente, oltre al monitoraggio predefinito della piattaforma, è possibile monitorare i propri progetti con lo stack di monitoraggio Red Hat® OpenShift® Container Platform. Questa funzionalità include una proprietà aggiuntiva, spec.global.datastores.postgressql.enablePodMonitor, nella risorsa personalizzata dei servizi Speech.

Per ulteriori informazioni, vedi l'argomento Monitoring the PostgreSQL datastore for Watson Speech services nella sezione Administering di Watson Speech services on IBM Cloud Pak for Data.

Correzione difetto: l'archivio dati PostgreSQL non è più installato se sono abilitati solo i microservizi di runtime

Fix Defect: l'archivio dati PostgreSQL non è più installato se sono abilitati solo i microservizi di runtime. L'archivio dati è ora installato solo se è installato almeno uno dei microservizi sttAsync, sttCustomization o ttsCustomization. PostgreSQL non viene disinstallato se in un secondo momento questi microservizi sono disabilitati.

Prima della versione 4.6.0, PostgreSQL era sempre installato con i servizi Speech. Se sei un cliente esistente che ha utilizzato solo i microservizi di runtime dei servizi Speech precedenti alla versione 4.6.0, PostgreSQL rimane installato ma non viene utilizzato. In questo caso, l'installazione di PostgreSQL persiste negli aggiornamenti.

L'archivio dati MinIO è sempre installato perché i microservizi di runtime dipendono da esso. Il datastore RabbitMQ è installato solo se è installato il microservizio sttAsync.

Per ulteriori informazioni, consultare Proprietà archivio dati in Utilizzo della risorsa personalizzata dei servizi Watson Speech in Watson Servizi vocali su IBM Cloud Pak for Data.

Correzione difetto: la creazione di una politica di rete non è più necessaria per l'operatore PostgreSQL per monitorare i relativi operandi

Fix Defect: per la versione 4.6.0, non è necessario creare una politica di rete per consentire all'operatore PostgreSQL di monitorare i relativi operandi, come descritto nell'aggiornamento del servizio 10 November 2022(Versioni 4.0.x e 4.5.x). A partire dalla versione 4.6.0, il servizio gestisce automaticamente questa situazione.

Nuovo parametro di query beta rate_percentage per il controllo della velocità di conversazione globale

Il servizio offre un nuovo parametro di query rate_percentage per modificare la frequenza di conversazione per una richiesta di sintesi vocale. La velocità di conversazione è la velocità con cui il servizio pronuncia il testo che sintetizza in voce. Un tasso più elevato fa sì che il testo venga pronunciato più rapidamente; un tasso più basso fa sì che il testo venga pronunciato più lentamente. Il parametro modifica la frequenza predefinita per voce per un'intera richiesta. Per ulteriori informazioni, vedi Modifica della velocità di conversazione.

Nuovo parametro di query beta pitch_percentage per il controllo del tono di conversazione globale

Il servizio offre un nuovo parametro di interrogazione pitch_percentage per modificare il tono di conversazione per una richiesta di sintesi. Il tono di conversazione rappresenta il tono del discorso che il servizio sintetizza. Rappresenta quanto alto o basso è il tono della voce percepito dall'ascoltatore. Un tono più alto si traduce in un discorso che è parlato con un tono più alto ed è percepito come una voce più alta; un tono più basso si traduce in un discorso che è parlato con un tono più basso ed è percepito come una voce più bassa. Il parametro modifica il tono predefinito per voce per un'intera richiesta. Per ulteriori informazioni, consultare la sezione Modifica del tono di conversazione.

Correzione difetto: le traduzioni di parole personalizzate ora accettano virgole in tutti i casi

Correzione del difetto: le traduzioni di parole aggiunte ai modelli personalizzati ora accettano le virgole in tutti i casi. In precedenza, una virgola in una traduzione poteva occasionalmente far sì che la traduzione non riuscisse a generare un audio valido quando utilizzato per le sintesi vocali. Questo problema è stato identificato nei modelli personalizzati in inglese americano.

Correzione del difetto: la sintesi francese delle date è ora coerente

Correzione del difetto: la sintesi francese non include più l'articolo "le" prima delle date del formato " ordinale di mese." In precedenza, l'articolo era incluso solo per il primo giorno del mese per il francese (per esempio, "il primo di settembre", "le premier septembre").

Correzione dei difetti: la sintesi giapponese è migliorata per gestire lunghe stringhe di testo di input

Correzione del difetto: il servizio ora sintetizza correttamente le richieste giapponesi che includono lunghe stringhe di caratteri. In precedenza, il servizio non era in grado di sintetizzare correttamente stringhe molto lunghe di testo giapponese.

Correzione del difetto: aggiungere regole per la documentazione di denominazione del modello personalizzato

Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli personalizzati. Per ulteriori informazioni, vedi

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

10 novembre 2022 (versioni 4.0.x e 4.5.x)

Problema noto: la politica di rete aggiornata è necessaria per l'operatore PostgreSQL

Problemi noti: per i servizi Speech versione 4.0.x (senza includere la versione 4.0.0) e 4.5.x, se l'operatore PostgreSQL e i servizi Speech sono installati in spazi dei nomi differenti, l'operatore PostgreSQL non è in grado di monitorare gli operandi PostgreSQL per i servizi Speech. All'operatore viene impedito di monitorare gli operandi dalla politica di rete che è in atto per i servizi Speech.

Questo problema non impedisce al cluster PostgreSQL di funzionare correttamente. Il cluster rimane attivo e completamente funzionante. Tuttavia, l'operatore non è in grado di aggiornare gli operandi quando si esegue l'aggiornamento a nuove versioni dei servizi Speech.

La soluzione al problema consiste nel creare una politica di rete aggiuntiva per l'operatore PostgreSQL, come mostrato nei seguenti passi. Puoi eseguire la procedura indipendentemente dal fatto che l'operatore PostgreSQL sia installato o meno nello stesso spazio dei nomi dei servizi Speech o in uno spazio dei nomi diverso.

  1. Accedere come amministratore del progetto Red Hat® OpenShift® in cui sono installati i servizi Speech.

  2. Immettere il seguente comando per aggiornare la politica di rete per i servizi Speech:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    dove

    • <custom-resource-name> è il nome della risorsa personalizzata dei servizi Speech. Il nome consigliato per la versione 4.0.x è speech-prod-cr; il nome consigliato per la versione 4.5.x è speech-cr.
    • <cpd-instance-name> è il nome del progetto (spazio dei nomi) in cui sono installati i servizi Speech. La documentazione utilizza la variabile di ambiente ${PROJECT_CPD_INSTANCE} per identificare lo spazio nomi.
  3. Per verificare che la politica di rete aggiornata consenta all'operatore di monitorare gli operandi e che lo stato del cluster PostgreSQL sia integro, immettere il seguente comando, dove <custom-resource-name> e <cpd-instance-name> sono i valori utilizzati nel passo precedente:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Se il cluster PostgreSQL funziona correttamente, il comando produce un output simile al seguente:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Questa procedura non fa sì che l'operatore aggiorni gli operandi alle versioni più recenti. Tuttavia, gli operandi vengono aggiornati come previsto al successivo aggiornamento del software dei servizi Speech.

13 ottobre 2022 (Versione 4.5.3)

La versione 4.5.3 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.5.3 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Gli eventi di controllo sono disponibili per i servizi Speech

Il servizio di registrazione di controllo IBM Cloud Pak for Data genera e inoltra eventi di verifica per i servizi Speech to Text e Text to Speech. Gli eventi di verifica corrispondono a quelli disponibili per il Activity Tracker con il servizio pubblico. Per ulteriori informazioni, vedi Eventi di controllo.

Non è possibile disinstallare singoli componenti del servizio Speech

La documentazione ora nota che non è possibile disinstallare singoli componenti del servizio (microservizi) una volta installati. Per rimuovere uno dei seguenti componenti, è necessario disinstallare i servizi Watson Speech nella loro interezza e reinstallare solo i componenti necessari: Speech to Text runtime, Speech to Text HTTP asincrono, Speech to Text personalizzazione, Text to Speech runtime e Text to Speech personalizzazione. Per ulteriori informazioni sull'installazione dei servizi di parlato, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Nuovo parametro beta spell_out_mode per le voci tedesche

Per indicare come devono essere scritti i singoli caratteri di una stringa, è ora possibile includere il parametro della query beta spell_out_mode con una richiesta di sintesi per una voce tedesca. Per impostazione predefinita, il servizio espone singoli caratteri alla stessa velocità con cui sintetizza il testo per una lingua. È possibile utilizzare il parametro per indicare al servizio di specificare i singoli caratteri più lentamente, in gruppi di uno, due o tre caratteri. Utilizzare il parametro con l'elemento SSML <say-as> per controllare il modo in cui vengono sintetizzati i caratteri di una stringa. Per ulteriori informazioni, consultare Specifica del modo in cui le stringhe vengono scritte.

Limitazione nota con l'utilizzo del formato audio Ogg con il browser Safari

Per impostazione predefinita, il servizio restituisce l'audio nel formato audio Og con il codec Opus (audio/ogg;codecs=opus). Tuttavia, il formato audio Ogg non è supportato con il browser Safari. Se stai utilizzando il servizio Text to Speech con il browser Safari, devi specificare un formato diverso in cui desideri che il servizio restituisca l'audio.

Risoluzione dei problemi di aggiornamento dalla versione 4.0.x alla versione 4.5.x

Quando esegui l'upgrade dei servizi Speech dalla versione 4.0.x alla versione 4.5.x, potresti riscontrare un problema in cui i pod PostgreSQL si bloccano nello stato Terminating. Se questo problema si verifica durante l'aggiornamento, effettuare le seguenti operazioni per risolvere il problema. Le informazioni e i passi sono documentati anche in Upgrading Watson Speech services from Version 4.0 to Version 4.5 nell'argomento Upgrading of Watson Speech on IBM Cloud Pak for Data.

  1. Utilizza il seguente comando per identificare i pod che restano nello stato Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Utilizza il seguente comando per impostare la variabile di ambiente pods in modo da includere l'elenco di pod che rimangono nello stato Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
  1. Utilizzare il seguente comando per cancellare i pod bloccati in modo che il processo di aggiornamento possa continuare:
oc delete pod $pods -n ${PROJECT_CPD_INSTANCE} --force=true --grace-period=0
Aggiornamenti della documentazione per l'elemento SSML <prosody>

La documentazione per l'elemento <prosody> SSML e i relativi parametri pitch e rate è stata migliorata e chiarita. Ora include anche una descrizione delle differenze tra il servizio e la versione più recente della specifica SSML. Per ulteriori informazioni, vedere Elemento <prosody>.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

3 agosto 2022 (Versione 4.5.1)

La versione 4.5.1 è ora disponibile
Text to Speech per IBM Cloud Pak for Data versione 4.5.1 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.
Supporto per cluster abilitati a FIPS
Sia Text to Speech per IBM Cloud Pak for Data che Speech to Text per IBM Cloud Pak for Data ora supportano l'esecuzione su cluster abilitati FIPS (Federal Information Processing Standard). Per ulteriori informazioni, vedi Servizi che supportano FIPS.
Correzione dei difetti: calcoli di memoria effimera fissi per impedire occasionali eliminazioni di pod
Fix del difetto: un difetto è stato corretto e il calcolo dei limiti di memoria effimeri è ora più preciso per Text to Speech per IBM Cloud Pak for Data e Speech to Text per i runtime IBM Cloud Pak for Data. Queste modifiche impediscono l'eliminazione occasionale dei pod quando i runtime dei servizi sono sottoposti a un carico elevato.
Il servizio non supporta la sintesi vocale multilingue
Il servizio non supporta la sintesi vocale multilingue in questo momento. Tuttavia, è possibile utilizzare la personalizzazione per approssimare la pronuncia delle parole da altre lingue. Per ulteriori informazioni, vedi sintesi vocale multilingue.
Vulnerabilità della sicurezza risolte
Le seguenti vulnerabilità di sicurezza sono state corrette:

29 giugno 2022 (Versione 4.5.0)

La versione 4.5.0 è ora disponibile
Text to Speech per IBM Cloud Pak for Data versione 4.5.0 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.
Servizi vocali unificati per documentazione IBM Cloud Pak for Data
La documentazione di installazione e amministrazione per Speech to Text e Text to Speech è ora combinata nella documentazione IBM Cloud Pak for Data. Per ulteriori informazioni sull'installazione e la gestione dei servizi Speech, vedi Watson Speech services on IBM Cloud Pak for Data.
Modifiche alla risorsa personalizzata dei servizi Speech
La risorsa personalizzata viene ora creata quando si installano inizialmente i servizi Speech. Il processo è descritto nella documentazione di installazione di IBM Cloud Pak for Data. Il contenuto della risorsa personalizzata è cambiato:
  • Il nome consigliato della risorsa personalizzata è cambiato da speech-prod-cr a speech-cr.
  • Tutti i riferimenti alla classe di archiviazione sono stati modificati da varianti di storageClass a blockStorageClass.
  • Il nome della classe di archiviazione blocchi Portworx è stato modificato da portworx-shared-gp3 a portworx-db-gp3-sc.
  • La proprietà createSecret è stata rimossa per gli archivi dati MinIO e PostgreSQl. La proprietà viene utilizzata solo internamente. I servizi di comunicazione vocale utilizzano sempre un oggetto segreto se ne crei uno e creano sempre automaticamente l'oggetto se non ne viene fornito alcuno.
Oggetto dei segreti fornito dall'utente ora supportato per l'archivio dati RabbitMQ
Puoi ora fornire credenziali di protezione per l'archivio dati RabbitMQ, proprio come puoi per gli archivi dati MinIO e PostgreSQL. Il processo documentato è simile per tutti e tre gli archivi dati.
Correzione difetto: più tag SSML <phoneme> consecutive sono ora analizzate correttamente
Correzione del difetto: il servizio ora sintetizza correttamente il testo che contiene tag <phoneme> consecutive. In precedenza, se il testo conteneva due o più tag <phoneme> consecutivi, il servizio sintetizzava solo la prima tag, ignorando le altre.
Vulnerabilità della sicurezza risolte
Nessuna vulnerabilità di sicurezza è stata corretta per la versione 4.5.0.

25 maggio 2022 (Versione 4.0.9)

La versione 4.0.9 è ora disponibile
Text to Speech per IBM Cloud Pak for Data versione 4.0.9 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.
Nuovo supporto per il formato audio audio/alaw
L'elenco dei formati audio supportati include ora audio/alaw;rate={rate}. Come audio/basic e audio/mulaw, questo formato fornisce audio a canale singolo codificato utilizzando dati u-law (o mu-law) a 8 bit e campionati a 8 kHz. Per ulteriori informazioni, vedi Utilizzo dei formati audio.
I servizi di sintesi vocale non supportano l'utilità di backup e ripristino OADP
Watson Speech services non supporta il programma di utilità di backup e ripristino IBM Cloud Pak for Data OpenShift APIs for Data Protection (OADP). Se i servizi Speech sono installati su un cluster, potresti non essere in grado di utilizzare il programma di utilità di backup e ripristino IBM Cloud Pak for Data OADP per eseguire il backup di altri servizi installati su tale cluster. Questa limitazione si applica alla versione 4.0.0 e alle successive versioni dei servizi Speech.
Vulnerabilità della sicurezza risolte
Le seguenti vulnerabilità di sicurezza sono state corrette:

1 maggio 2022 (Versione 1.2.x)

Importante: fine del servizio per Text to Speech versione 1.2.x su IBM Cloud Pak for Data versione 3.5
Importante Text to Speech versione 1.2.x su IBM Cloud Pak for Data versione 3.5 è fuori servizio dal 1 ° maggio 2022. Text to Speech versione 1.2.x non è più supportato, disponibile o documentato. Per ulteriori informazioni sulla fine del servizio per Text to Speech, che fa parte del Watson Kit API, vedere Interruzione del supporto software: IBM Watson API Kit per IBM Cloud Pak for Data 1.2.x.

27 aprile 2022 (versione 4.0.8)

La versione 4.0.8 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.0.8 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Nuove variabili di ambiente utilizzate nella documentazione IBM Cloud Pak for Data

La maggior parte dei comandi nella documentazione Text to Speech per IBM Cloud Pak for Data sono stati aggiornati per utilizzare una serie comune di variabili di ambiente. La documentazione fornisce uno script per esportare automaticamente le variabili di ambiente prima di eseguire i comandi di installazione, aggiornamento e amministrazione. Dopo aver creato lo script, è possibile copiare la maggior parte dei comandi dalla documentazione ed eseguirli senza apportare alcuna modifica.

Le variabili di ambiente definite dallo script includono:

  • ${PROJECT_CPD_INSTANCE} identifica il progetto in cui intendi installare IBM Cloud Pak for Data e i servizi Speech.
  • ${PROJECT_CPD_OPS} identifica il progetto per l'operatore della piattaforma IBM Cloud Pak for Data.
  • ${PROJECT_CPFS_OPS} identifica il progetto per i servizi di base IBM Cloud Pak for Data.

Per ulteriori informazioni sull'utilizzo delle variabili di ambiente, vedi Procedura ottimale: configurazione delle variabili di installazione.

La proprietà ttsVoiceMarginalCPU non è più documentata

La proprietà ttsVoiceMarginalCPU è stata rimossa dalla documentazione per la risorsa personalizzata dei servizi Speech. La proprietà gestisce il tradeoff tra simultaneità e velocità di sintesi vocale. Il valore predefinito di 400 garantisce un equilibrio ragionevole per la maggior parte dei clienti e mantiene la sintesi in tempo reale.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

30 marzo 2022 (Versione 4.0.7)

La versione 4.0.7 è ora disponibile

Text to Speech per la versione IBM Cloud Pak for Data 4.0.7 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Proprietà della risorsa personalizzata per la specifica di una voce predefinita

La voce predefinita per le richieste di sintesi vocale e pronuncia è en-US_MichaelV3Voice. Se non si installa en-US_MichaelV3Voice, è necessario

  • Utilizza il parametro voice per passare la voce che deve essere utilizzata con ogni richiesta.
  • Specifica una nuova voce predefinita per la tua installazione di Text to Speech per IBM Cloud Pak for Data utilizzando la proprietà defaultTTSVoice nella risorsa personalizzata dei servizi Speech. Per ulteriori informazioni, vedi Installing Watson Text to Speech e Using the default voice.
Modifica in risposta di temporizzazione parola per l'interfaccia WebSocket

L'oggetto di risposta che il servizio invia quando richiedi i tempi delle parole con l'interfaccia WebSocket è stato modificato. Il servizio ora invia i risultati di temporizzazione parola in un singolo array che include una stringa seguita da due float:

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Il servizio ha precedentemente inviato i risultati di temporizzazione come un array che includeva una stringa seguita da un array di due float:

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

Inoltre, il livello di precisione per i tempi e i contrassegni delle parole è ora ridotto a tre posizioni decimali. Per ulteriori informazioni sulle nuove risposte, vedi Generazione degli orari delle parole.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

23 febbraio 2022 (Versione 4.0.6)

La versione 4.0.6 è ora disponibile

Text to Speech per la versione IBM Cloud Pak for Data 4.0.6 ora è disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Tutte le voci neurali sono ora obsolete per IBM Cloud Pak for Data

Le voci neurali che erano disponibili con Text to Speech per IBM Cloud Pak for Data sono ora obsolete. Le voci neurali continuano ad essere a disposizione degli utenti di Text to Speech per IBM Cloud. Solo le voci neurali avanzate continuano ad essere disponibili per gli utenti di Text to Speech per IBM Cloud Pak for Data.

Tutte le voci per le lingue seguenti sono ora obsolete per IBM Cloud Pak for Data:

  • Arabo
  • Cinese (Mandarino)
  • Ceco
  • Olandese (Belgio)
  • Olandese (Paesi Bassi)
  • Inglese (Australiano)
  • Coreano
  • Svedese

Gli utenti esistenti di queste voci possono continuare a utilizzarli per ora, ma le voci verranno completamente rimosse in una release futura. Queste voci non possono più essere installate da nuovi utenti e sono state rimosse dalla documentazione di installazione per IBM Cloud Pak for Data. La proprietà voiceType è stata rimossa dalla risorsa personalizzata dei servizi Speech.

Per ulteriori informazioni, vedi

Aggiornamenti agli script di importazione / esportazione

Gli script import_export.sh e transfer_ownership.sh sono stati aggiornati. Questi script vengono utilizzati per importare ed esportare i dati tra cluster, eseguire il backup e il ripristino dei dati e migrare i dati dalla versione 3.5 alla versione 4.0.x. Gli script sono stati modificati e migliorati come segue:

  • Lo script transfer_ownership.sh ora richiede un'opzione -c da includere sulla riga comandi prima dell'argomento <custom_resource_name>.
  • Lo script transfer_ownership.sh ora richiede un'opzione e un argomento -v <version> per indicare la versione a cui viene trasferita la proprietà delle risorse. Specificare 35 per la versione 3.5 o 40 per la versione 4.0.x.
  • Lo script transfer_ownership.sh ora richiede un'opzione -p da includere sulla riga comandi prima dell'argomento <postgres_auth_secret_name>.
  • L'argomento <postgres_auth_secret_name> fornisce il segreto Kubernetes utilizzato per autenticare l'archivio dati PostgreSQL a cui stai trasferendo la proprietà. È possibile omettere il segreto di autenticazione se è uguale al valore predefinito (<custom-resource-name>-postgres-auth-secret per la versione 4.0.x, user-provided-postgressql per la versione 3.5). È necessario fornire il segreto se è diverso dal valore predefinito.
  • Entrambi gli script ora includono l'opzione -h (--help) per visualizzare le informazioni sullo script e il suo utilizzo.

Per ulteriori informazioni, vedi

Consiglio aggiornato per OpenShift Container Storage

A partire dalla versione 4.0.6dei servizi Speech, la classe di archiviazione consigliata per OpenShift Container Storage è ocs-storagecluster-ceph-rbd.

  • Se si installa Speech services 4.0.6 o si esegue l'aggiornamento a Speech services 4.0.6 da IBM Cloud Pak for Data versione 3.5, specificare la classe di archiviazione ocs-storagecluster-ceph-rbd durante l'installazione o l'aggiornamento.
  • Se stai eseguendo l'aggiornamento ai servizi Speech 4.0.6 da un precedente aggiornamento di Cloud Pak for Data versione 4.0, continua a utilizzare ocs-storagecluster-cephfs. Non è possibile modificare la memoria utilizzata in una distribuzione esistente.

Il valore è specificato con la proprietà storageClass nella risorsa personalizzata dei servizi Speech:

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

I servizi di sintesi vocale funzionano con una versione di OpenShift Container Storage. La versione appena consigliata dispone di autorizzazioni di accesso più restrittive. Per ulteriori informazioni, vedi

31 gennaio 2022 (Versione 4.0.5)

La versione 4.0.5 è stata aggiornata

Text to Speech per IBM Cloud Pak for Data versione 4.0.5 è stato aggiornato per risolvere i problemi di installazione. La versione del package del caso ora è 4.0.6. Utilizzare questo package invece del package della versione 4.0.5. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Importante: i passaggi aggiuntivi per l'installazione con mirroring non sono più necessari

Importante: le note sulla release del 26 gennaio 2022 includevano note importanti per i seguenti passi:

  • Passo aggiuntivo per l'esecuzione di un'installazione di mirroring dell'archivio dati Minio
  • Operazioni aggiuntive per l'esecuzione di un'installazione con mirroring di nuovi modelli di nuova generazione

Questi passi aggiuntivi non sono più necessari. Il package del caso è stato aggiornato per correggere i problemi di installazione.

26 gennaio 2022 (Versione 4.0.5)

La versione 4.0.5 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.0.5 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Importante: passo aggiuntivo per eseguire un'installazione con mirroring del datastore Minio

Importante: questi passi non sono più necessari se si installa il pacchetto del caso 4.0.6. Per ulteriori informazioni, vedere 31 gennaio 2022(versione 4.0.5).

Se si sta eseguendo un'installazione con mirroring (ad esempio, in un ambiente air - gapped), è necessario eseguire un ulteriore passo prima di completare una delle seguenti operazioni:

Questo passo è obbligatorio per copiare le immagini necessarie per l'archivio dati Minio:

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

La mancata esecuzione di questo passo causerà errori di installazione sia per Text to Speech che per Speech to Text.

Il server delle licenze è ora installato automaticamente

L'operatore dei servizi vocali ora installa automaticamente il server delle licenze richiesto quando installa i servizi Speech. Non hai più bisogno di installare il server delle licenze dai servizi di base IBM Cloud Pak for Data e non hai più bisogno di utilizzare del contenuto YAML aggiuntivo per creare una OperandRequest con i bind necessari.

Rimozione delle fasi specifiche del server PostgreSQL EnterpriseDB

La versione precedente della documentazione includeva i passi per il server EnterpriseDB PostgreSQL specifici per i servizi Speech. Questi passi sono stati documentati nell'argomento Upgrading Watson Text to Speech (Version 4.0) e Uninstalling Watson Text to Speech. Queste operazioni aggiuntive non sono più necessarie e sono state rimosse dalla documentazione.

L'archivio dati RabbitMQ è ora utilizzato solo dal componente sttAysnc

L'archivio dati RabbitMQ è stato precedentemente utilizzato dai componenti di entrambi i servizi Speech, Speech to Text e Text to Speech. Ora gestisce l'accodamento dei messaggi non persistenti solo per il componente HTTP asincrono Speech to Text ( sttAsync ). Viene utilizzato solo se il componente sttAsync è installato e abilitato.

Nuove voci neurali belghe olandesi e ceche

Sono ora disponibili due nuove voci neurali:

  • Olandese belga Una nuova voce olandese belga (fiamminga), nl-BE_BramVoice.
  • Ceco: una nuova lingua, il ceco, con una nuova voce femminile, cs-CZ_AlenaVoice.

È possibile installare le nuove voci insieme a tutte le voci neurale impostando la proprietà voiceType della risorsa personalizzata su neuralVoices.

Correzione difetto: aggiornare la documentazione SSML

Fix Defect: la documentazione SSML è stata aggiornata per correggere i seguenti errori:

  • Gli esempi dell'elemento <break> sono ora corretti. L'elemento è unario, come ora mostrato negli esempi. Gli esempi precedenti includevano tag di apertura e chiusura con testo incorporato. Il testo incorporato non è stato pronunciato dal servizio. Per ulteriori informazioni, vedere Elemento <break>.
  • Il servizio supporta SSML (Speech Synthesis Markup Language) versione 1.1. Tutti i riferimenti e gli esempi ora utilizzano la versione corretta. La documentazione si riferiva in precedenza alla versione 1.0.
Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità della sicurezza associate a Apache Log4j sono state corrette:

20 dicembre 2021 (Versione 4.0.4)

La versione 4.0.4 è ora disponibile

Text to Speech per la versione IBM Cloud Pak for Data 4.0.4 è adesso disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Importante: modifiche alle proprietà per disabilitare la memorizzazione e la registrazione dei dati utente

Importante: i nomi delle proprietà della risorsa personalizzata dei servizi Speech che specificano se i dati utente sono archiviati e registrati sono stati modificati. La risorsa personalizzata conteneva in precedenza le seguenti proprietà:

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Queste proprietà sono ora denominate come segue:

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Se hai già impostato queste proprietà nella tua risorsa personalizzata per modificare il valore predefinito di false in true, devi modificare la tua risorsa personalizzata. È possibile modificare manualmente i nomi delle proprietà sui nuovi valori e salvare la risorsa personalizzata aggiornata. Per ulteriori informazioni, vedi Installazione di Watson Text to Speech.

Importante: modifiche alle proprietà dell'oggetto segreti PostgreSQL

Importante: quando si installano i servizi Speech, per impostazione predefinita viene creato un oggetto che contiene una password generata casualmente per l'archivio dati PostgreSQL. È possibile scegliere invece di specificare la password manualmente. In questo caso, le proprietà del file YAML per l'oggetto dei segreti sono state modificate. Per ulteriori informazioni, vedi l'argomento sulla gestione dei tuoi archivi di dati in Amministrazione di Watson Text to Speech.

Importante: i pod PostgreSQL non iniziano con l'operatore EnterpriseDB versione 1.10

Importante: con Text to Speech per IBM Cloud Pak for Data versione 4.0.3, i pod PostgreSQL basati sull'operatore EnterpriseDB versione 1.10 non possono essere avviati. Ciò impedisce l'avvio dei servizi Speech. Esiste una soluzione temporanea per questo problema. Se i tuoi servizi Speech non riescono ad avviarsi, vedi PostgreSQL pods do not start with EnterpriseDB versione 1.10 operator per informazioni sulla diagnostica e la risoluzione del problema.

Questo problema è stato risolto in Text to Speech per IBM Cloud Pak for Data versione 4.0.4.

Nuovo supporto per la classe di archiviazione nativa del contenitore IBM Spectrum Scale

Dalla versione 4.0.3, i servizi Speech supportano la classe di archiviazione nativa del contenitore IBM Spectrum® Scale. Per utilizzare IBM Spectrum Scale, specifica "ibm-spectrum-scale-sc" per la proprietà storageClass della risorsa personalizzata dei servizi Speech. Per ulteriori informazioni, vedi Installazione di Watson Text to Speech.

Interazione dei servizi Speech con l'archivio dati MinIO durante l'installazione

I componenti di runtime dei servizi di sintesi vocale, sttRuntime e ttsRuntime, non possono essere avviati fino a quando i modelli e le voci per i servizi non vengono completamente caricati nell'archivio dati MinIO. Durante l'installazione, i servizi potrebbero non riuscire e riavviarsi automaticamente una o più volte fino al completamento del caricamento dei modelli e delle voci. Quindi si avviano correttamente. Non è richiesta alcuna azione utente.

Correzione difetto: migliorare la documentazione di aggiornamento

Correzione di un difetto: La documentazione per l'aggiornamento dei servizi Speech alle nuove versioni di IBM Cloud Pak for Data versione 4.0.x includeva riferimenti errati in alcuni comandi. Questi riferimenti sono ora corretti:

  • Le stringhe watsonSpeechToTextStatus e watsonTextToSpeechStatus sono state modificate in speechStatus in entrambi i casi.
  • Le stringhe status.watsonSpeechToTextVersion e status.watsonTextToSpeechVersion sono state modificate in .spec.version in entrambi i casi.

Per ulteriori informazioni, vedi Upgrade Watson Text to Speech.

Correzione dei difetti: migliorare la sintesi vocale e SSML

Fix Defect: i seguenti difetti per SSML (Speech Synthesis Markup Language) e sintesi vocale sono stati corretti con questa release:

  • L'attributo pitch dell'elemento <prosody> viene ora applicato a tutto il testo specificato. In precedenza, il cambiamento di tono non era sempre applicato alla prima parola del testo interessato. Inoltre, la documentazione ora include ulteriori indicazioni sulla specifica di un valore pitch. Per ulteriori informazioni, consultare L'attributo pitch.
  • La sintesi vocale del testo giapponese ora parla l'audio più lentamente. In precedenza, il discorso sintetizzato veniva pronunciato troppo rapidamente. Se si rileva che la sintesi del testo in giapponese è ancora parlata troppo rapidamente per la propria applicazione, utilizzare l'attributo rate dell'elemento SSML <prosody> per controllare la frequenza del discorso. Per ulteriori informazioni, consultare L'attributo rate.
  • Le voci neurali ora analizzano correttamente il carattere apostrofo escape (&apos;). In precedenza, alcune voci neurali non interpretavano correttamente il carattere.
Vulnerabilità della sicurezza risolta

La seguente vulnerabilità di sicurezza associata a Apache Log4j è stata corretta:

20 dicembre 2021 (versione 1.2.x)

Importante: non puoi installare più Text to Speech versione 1.2.x su IBM Cloud Pak for Data versione 3.5

Importante: non puoi più effettuare nuove installazioni di Text to Speech versione 1.2.x su IBM Cloud Pak for Data versione 3.5. Puoi installare solo Text to Speech versione 4.0.x su IBM Cloud Pak for Data versione 4.x. Per ulteriori informazioni, vedi Installazione di Watson Text to Speech.

I servizi vocale per IBM Cloud Pak for Data versione 3.5 raggiungono la data di fine del supporto il 30 Aprile 2022. Ti invitiamo ad eseguire l'aggiornamento all'ultimo rilascio della versione 4.0.x dei servizi al più presto. Per ulteriori informazioni, vedi Upgrade Watson Text to Speech.

30 novembre 2021 (Versione 4.0.3)

La versione 4.0.3 è ora disponibile

Text to Speech per IBM Cloud Pak for Data versione 4.0.3 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di Watson Text to Speech.

Il server delle licenze è ora un requisito obbligatorio

Devi ora installare il server delle licenze dai servizi di base IBM Cloud Pak for Data. È necessario installare il server delle licenze utilizzando il contenuto YAML fornito per creare una OperandRequest con i collegamenti necessari. Devi anche installare il License Service nello stesso spazio dei nomi del servizio (operando), che è anche dove è installato IBM Cloud Pak for Data. Per ulteriori informazioni, vedi Installazione di Watson Text to Speech.

Nuovo supporto per l'aggiornamento sul posto

Il servizio ora supporta l'aggiornamento in loco basato sull'operatore dalla versione 4.0.0 alla versione 4.0.3. Lo spostamento da IBM Cloud Pak for Data versione 3.5 alla versione 4.0.3 continua a richiedere l'uso di programmi di utilità di migrazione. Per ulteriori informazioni, vedi Upgrade Watson Text to Speech.

Modifiche all'installazione dell'operatore EDB PostgreSQL e della licenza

L'installazione, l'aggiornamento e la disinstallazione per l'operatore PostgreSQL di Enterprise DB sono stati modificati:

  • Le istruzioni per installare l'operatore e la licenza EDB PostgreSQL sono ora incluse con i servizi fondamentali IBM Cloud Pak for Data. Le istruzioni per l'installazione dei servizi Speech sono state aggiornate di conseguenza. Per ulteriori informazioni, vedi Installazione di Watson Text to Speech.
  • Le istruzioni per l'aggiornamento da Text to Speech versione 4.0.0 a 4.0.3 includono istruzioni per la disinstallazione dell'operatore e della licenza EDB PostgreSQL precedente e la reinstallazione con i servizi di base IBM Cloud Pak for Data. Per ulteriori informazioni, vedi Upgrade Watson Text to Speech.
  • Le istruzioni per la disinstallazione dei servizi Speech ora includono i passaggi per rimuovere l'operatore EDB PostgreSQL e la licenza precedentemente installati con Text to Speech. Per ulteriori informazioni, vedi Disinstallazione di Watson Text to Speech.
Nuova guida per il ridimensionamento dell'installazione

Il servizio ora fornisce una guida aggiornata sul ridimensionamento della tua installazione. Le informazioni includono la specifica del numero di pod e del massimo numero di sessioni simultanee per le voci neurali o neurali avanzate. Per ulteriori informazioni, vedi Amministrazione di Watson Text to Speech.

Aggiornamenti della riga comandi per i programmi di utilità di importazione ed esportazione

I comandi utilizzati con i programmi di importazione ed esportazione per i servizi Speech includono nuove opzioni e argomenti. I programmi di utilità di importazione ed esportazione sono anche la base per il backup e il ripristino dei servizi e per la migrazione dalla IBM Cloud Pak for Data versione 3.5 alla versione 4.0.3. Per ulteriori informazioni sull'uso delle utilità, vedere

Nuova proprietà per la gestione della simultaneità e della sintesi vocale

La nuova proprietà global.ttsVoiceMarginalCPU gestisce il tradeoff tra simultaneità e velocità di sintesi vocale. Il valore predefinito di 400 offre un equilibrio ragionevole per la maggior parte dei clienti e mantiene la sintesi in tempo reale. Per informazioni sulla modifica di questo valore in base alle proprie necessità, contattare il supporto IBM.

Nuovo supporto per le voci neurali

Tutte le voci neurali attualmente disponibili per Text to Speech per IBM Cloud sono ora disponibili anche per l'installazione su Text to Speech per IBM Cloud Pak for Data. Sono ora disponibili le seguenti lingue e voci:

  • Arabo ar-MS_OmarVoice
  • Cinese (mandarino): zh-CN_LiNaVoice, zh-CN_WangWeiVoice e zh-CN_ZhangJingVoice
  • Olandese (belga): nl-BE_AdeleVoice
  • Olandese (Paesi Bassi): nl-NL_EmmaVoice e nl-NL_LiamVoice
  • Inglese (australiano) en-AU_CraigVoice, en-AU_MadisonVoice e en-AU_SteveVoice
  • Coreano ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice e ko-KR_YunaVoice
  • Svedese: sv-SE_IngridVoice

Per ulteriori informazioni su tutte le lingue e le voci disponibili, vedi Lingue e voci.

Installazione di voci

È possibile installare le voci neurali avanzate o le voci neurali. È possibile installare solo uno dei due tipi di voci. Quando installi il servizio, utilizzi la proprietà voiceType della risorsa personalizzata per indicare le voci che devono essere installate:

  • Specificare enhancedNeuralVoices per installare le voci neurali avanzate. È quindi necessario specificare le singole voci neurali avanzate da installare. Per default, sono installati solo en-US_AllisonV3Voice, en-US_LisaV3Voice e en-US_MichaelV3Voice. Puoi scegliere di installare queste voci predefinite, queste e altre voci o solo altre voci. Sono disponibili solo le voci che installi.
  • Specificare neuralVoices per installare le voci neurali. Tutte le voci neurali sono installate e disponibili. Non è possibile perfezionare l'elenco delle voci installate.

Per ulteriori informazioni sull'utilizzo della risorsa personalizzata per installare le voci, consultare Installazione di Watson Text to Speech.

Specifica di una voce per la sintesi vocale

Entrambi i metodi HTTP POST e GET /v1/synthesize, così come il metodo WebSocket /v1/synthesize, accettano un parametro di query opzionale voice che si usa per specificare la voce da usare per la sintesi vocale. Se ometti il parametro voice, il servizio usa una voce predefinita. La voce predefinita dipende dalle voci installate:

  • Se hai installato le voci neurali avanzate, il servizio utilizza l'inglese americano en-US_MichaelV3Voice per impostazione predefinita. Se tale voce non è installata, è necessario specificare una voce.
  • Se hai installato le voci neurali, il servizio utilizza sempre l'inglese australiano en-AU_MadisonVoice per impostazione predefinita.

Per ulteriori informazioni, vedi Utilizzo di una voce per la sintesi vocale.

Specifica di una lingua per un modello personalizzato

Si utilizza il metodo POST /v1/customizations per creare un modello personalizzato. Il metodo include un parametro language che utilizzi per identificare la lingua del nuovo modello personalizzato.

  • Se sono state installate le voci neurali avanzate, il parametro language è facoltativo. Per default, il servizio utilizza l'identificativo en-US per la lingua.
  • Se hai installato le voci neurali, è richiesto il parametro language. È necessario specificare la lingua del modello personalizzato nel formato indicato (ad esempio, en-AU per l'inglese australiano).

Per ulteriori informazioni su come specificare una lingua quando crei un modello personalizzato, vedi Creazione di un modello personalizzato.

Correzione difetto: correggere l'intonazione per le voci neurali migliorate in spagnolo

Fix Defect: per le voci Castilian Spanish (es-ES_EnriqueV3Voice e es-ES_LauraV3Voice), Latin American Spanish (es-LA_SofiaV3Voice) e North American Spanish (es-US_SofiaV3Voice), le domande di tutti i tipi ora utilizzano l'intonazione corretta. Le voci precedentemente non usavano l'intonazione corretta per alcune domande, pronunciandole invece come dichiarazioni.

Correzione del difetto: correggere la documentazione multitenancy

Fix Defect: l'argomento IBM Cloud Pak for Data Supporto multitenancy ha erroneamente dichiarato che i servizi Speech non supportano multitenancy. L'argomento è stato aggiornato per indicare che i servizi Speech supportano le seguenti operazioni:

  • Installare il servizio in progetti separati
  • Installa il servizio più volte nello stesso progetto
  • Installa il servizio una volta e distribuisci più istanze nello stesso progetto

La documentazione specifica per i servizi Speech indicava correttamente il supporto multitenancy.

1 ottobre 2021 (Versione 1.1.x)

La versione 1.1.x è fuori servizio
Text to Speech e Speech to Text per IBM Cloud Pak for Data versione 1.1.x sono usciti servizio il 30 settembre 2021. A partire dal 1 ottobre 2021, la documentazione per la versione 1.1.x non è più disponibile. Per ulteriori informazioni, vedi Ritiro del software e interruzione del supporto.

29 luglio 2021 (Versione 4.0.0)

È disponibile la versione 4.0.0

IBM Watson® Text to Speech per IBM Cloud Pak® for Data versione 4.0.0 ora disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versione 4.6. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedi Installazione di IBM Watson Text to Speech per IBM Cloud Pak for Data.

Voci neurali migliorate

Per ottimizzare la qualità complessiva della sintesi vocale, tutte le voci disponibili sono ora voci neurali migliorate. Le voci neurali migliorate, che includono la stringa V3 nei loro nomi, ora sono disponibili per il portoghese brasiliano, il Regno Unito e l'inglese degli Stati Uniti, il francese, il tedesco, l'italiano, il giapponese e lo spagnolo (tutti i dialetti).

Le voci neurali migliorate supportano l'utilizzo di IPA e IBM SPR (Symbolic Phonetic Representation) con l'elemento SSML <phoneme>. Le voci neurali migliorate raggiungono anche un grado leggermente più alto di suono naturale. Per ulteriori informazioni, vedi Lingue e voci.

Nuova voce francese canadese

Il servizio ora supporta il francese canadese con la voce neurale avanzata fr-CA_LouiseV3Voice. La voce francese canadese supporta la personalizzazione ed è generalmente disponibile (GA) per uso di produzione.

Nuova funzione di ottimizzazione per esempio

La nuova funzione Tune by Example consente di controllare il modo in cui il servizio pronuncia il testo specificato. La funzione è una funzionalità beta supportata solo per voci e modelli personalizzati in inglese americano. La feature ha due componenti:

  • I prompt personalizzati includono il testo scritto che deve essere pronunciato e l'audio registrato che parla il testo come vuoi ascoltarlo. L'audio specifica l'intonazione, la cadenza e lo stress del testo sintetizzato. Il prompt può enfatizzare diverse sillabe o parole, introdurre pause e in generale rendere il suono audio sintetizzato più naturale e appropriato per il suo contesto.
  • I modelli di altoparlanti forniscono l'audio di registrazione per un utente che parla una o più richieste. Un modello di altoparlante fornisce un esempio audio della voce di un utente. Il servizio si allena sulla voce, che può aiutare a produrre suggerimenti di qualità superiore per quell' altoparlante.

Specifica una richiesta personalizzata con una richiesta di sintesi vocale per indicare come la voce del servizio deve pronunciare il testo. Per specificare una richiesta, utilizzare l'estensione SSML <ibm:prompt id="{prompt_id}"/>. L'audio sintetizzato duplica la prosodia del prompt.

Il servizio include otto nuovi metodi per lavorare con la funzione Tune by Example. Le descrizioni dei nuovi metodi che seguono forniscono collegamenti alle loro voci nel riferimento API & SDK.

Documentazione Text to Speech unificata

La documentazione per IBM Watson Text to Speech per IBM Cloud Pak for Data è ora combinata con la documentazione per le istanze gestite del servizio Text to Speech ospitato su IBM Cloud. Ciò vale sia per la guida che per la documentazione di riferimento per le due forme del servizio. Link alla versione precedentemente separata della documentazione IBM Cloud Pak for Data per il reindirizzamento del servizio alla documentazione unificata.

Per ulteriori informazioni sull'identificazione delle informazioni relative ad una sola versione del prodotto, vedi Informazioni su Text to Speech.

La versione 1.1.x sta per essere dismessa

Speech to Text e Text to Speech per IBM Cloud Pak for Data versione 1.1.x escono dal servizio il 30 settembre 2021. Devi eseguire l'upgrade a una versione più recente dei servizi su IBM Cloud Pak for Data prima di quella data. A partire dal 1 ottobre 2021, la documentazione per la versione 1.1.4 non sarà più disponibile.

12 aprile 2021 (Versione 1.2.1)

Aggiunta al file speech-override.yaml

Il file speech-override.yaml minimo include una definizione aggiuntiva, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} è il percorso per il registro Docker interno. Deve essere image-registry.openshift-image-registry.svc:5000/{namespace}, dove {namespace} è lo spazio dei nomi in cui è installato IBM Cloud Pak® for Data, normalmente zen.

9 aprile 2021 (Versione 1.2.1)

Supporto per la modifica dei modelli e delle voci installati
I servizi vocali ti consentono di aggiungere o rimuovere i modelli e le voci installati per la versione 1.2 o 1.2.1 dei servizi.

26 marzo 2021 (Versione 1.2.1)

È disponibile la versione 1.2.1

Text to Speech per la versione IBM Cloud Pak for Data 1.2.1 è adesso disponibile. Le versioni 1.2 e 1.2.1 utilizzano le stesse istruzioni di installazione e la stessa documentazione 1.2. La versione 1.2.1 supporta l'installazione su Red Hat OpenShift versione 4.6 in aggiunta alle versioni 4.5 e 3.11.

Nuove istruzioni di installazione

Per i cluster collegati a Internet e i cluster con air - gapping, le istruzioni di installazione includono le seguenti operazioni:

  • Utilizza il comando oc label per configurare le etichette richieste per lo spazio dei nomi in cui è installato IBM Cloud Pak for Data.
  • Utilizzare il comando oc project per assicurarsi di puntare al progetto OpenShift corretto.
  • Utilizza il comando cpd-cli install per installare un server PostgreSQL Enterprise DB utilizzato dai servizi Speech.

Si eseguono queste operazioni prima di installare i servizi Speech.

Nuove istruzioni di disinstallazione

È stato aggiunto un passo alla procedura per disinstallare i servizi Speech per ripulire tutte le risorse dall'installazione.

Registro autorizzato per archivio dati PostgreSQL

Il percorso del registro autorizzato da cui il servizio estrae immagini per l'archivio dati PostgreSQL è cambiato. L'ubicazione del registro è cambiata da cp.icr.io/cp/watson-speech a cp.icr.io/cp/cpd. Questa modifica è trasparente per gli utenti.

Segreti per archivi dati Minio e PostgreSQL

I datastore Minio e PostgreSQL richiedono i seguenti valori hardcoded per i loro segreti:

  • Per Minio, utilizzare minio.
  • Per PostgreSQL, utilizzare user-provided-postgressql.

Non è possibile utilizzare i propri valori per questi segreti. I segreti devono essere creati prima di installare i servizi Speech.

Eliminazioni dal file speech-override.yaml

Le seguenti voci sono state rimosse dal file speech-override.yaml. Sono stati aggiunti per risolvere un problema che ora è stato risolto.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

Il file abbreviato speech-override.yaml è stato generalmente ridotto ulteriormente ottimizzando il proprio contenuto in base agli elementi essenziali.

9 dicembre 2020 (Versione 1.2)

È disponibile la versione 1.2

Text to Speech per IBM Cloud Pak for Data versione 1.2 ora disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versioni 3.5 e 3.0.1e Red Hat OpenShift versioni 4.5 e 3.11.

Nuove voci

Il servizio offre ora due nuove voci:

  • Inglese britannico: en-GB_CharlotteV3Voice
  • Francese: fr-FR_NicolasV3Voice

Il servizio offre anche una versione migliorata della voce britannica esistente, en-KateV3Voice. Per ulteriori informazioni su tutte le lingue e le voci supportate, vedi Lingue e voci.

Correzione del difetto: elemento <prosody> di correzione per il giapponese

Correzione difetto: per la voce ja-JP_EmiV3Voice, ora il servizio analizza correttamente il testo di input SSML che include una specifica di prosody rate. In precedenza, il seguente uso dell'elemento <prosody> funzionava correttamente:

<speak>成功する/繁栄する</speak>

Ma il seguente uso dell'attributo rate con l'elemento <prosody> ha fatto sì che il servizio leggesse e parlasse la notazione SSML incorporata:

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Il servizio ora analizza e applica correttamente l'attributo rate dell'elemento <prosody> per l'input giapponese.

4 settembre 2020 (Versione 1.1.4)

L'interfaccia di personalizzazione è generalmente disponibile
L'interfaccia di personalizzazione è ora generalmente disponibile. La personalizzazione non è più una funzionalità beta. Puoi utilizzare l'interfaccia di personalizzazione per specificare il modo in cui il servizio pronuncia le parole inusuali presenti nel tuo input creando dizionari personalizzati specifici della lingua. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.

15 luglio 2020 (versione 1.1.4)

Red Hat OpenShift versione 4.3 sta per uscire dal servizio
IBM Cloud Pak for Data 3.0.1 sta deprecando il supporto per Red Hat OpenShift 4.3 il 1 settembre 2020. Red Hat OpenShift 4.3 sta per uscire dal servizio il 22 ottobre 2020. IBM Cloud Pak for Data sta introducendo il supporto per Red Hat OpenShift 4.5. IBM Cloud Pak for Data sta consigliando ai client di eseguire l'aggiornamento a Red Hat OpenShift 4.5 prima del 22 ottobre 2020. Il supporto IBM collaborerà con tutti i clienti che hanno installato IBM Cloud Pak for Data 3.0.1 su Red Hat OpenShift 4.3. Ai nuovi clienti che desiderano eseguire l'installazione su Red Hat OpenShift 4.x viene richiesto di installare Red Hat OpenShift 4.5.

19 giugno 2020 (Versione 1.1.4)

È disponibile la versione 1.1.4

Text to Speech per IBM Cloud Pak for Data versione 1.1.4 è ora disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versioni 2.5 e 3.0.1e Red Hat OpenShift versioni 3.11 e 4.3. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedere Installazione e gestione di Text to Speech per IBM Cloud Pak for Data.

Nuove voci neurali

Il servizio ora supporta cinque nuove voci neurali:

  • Inglese americano: en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice, e en-US_OliviaV3Voice
  • Tedesco: de-DE_ErikaV3Voice

Queste nuove voci hanno le stesse funzionalità di personalizzazione e SSML di tutte le voci esistenti. Per ulteriori informazioni, vedi Lingue e voci supportate.

Supporto per l'attributo SSML digits dell'elemento <say-as> per il giapponese

Il servizio ora supporta l'attributo digits dell'elemento SSML <say-as> con la voce giapponese. Per ulteriori informazioni, vedere Elemento <say-as>.

Procedure di backup e ripristino semplificate

Le procedure di backup e ripristino sono notevolmente semplificate. Ora eseguono il backup dei dati dagli archivi di dati, quindi non è più necessario ricreare le operazioni eseguite. Per ulteriori informazioni, vedere Backup e ripristino dei Watson Dati dei servizi vocali.

28 febbraio 2020 (Versione 1.1.3)

È disponibile la versione 1.1.3
Text to Speech per IBM Cloud Pak for Data versione 1.1.3 è ora disponibile.

27 novembre 2019 (Versione 1.1.2)

È disponibile la versione 1.1.2
Text to Speech per IBM Cloud Pak for Data versione 1.1.2 è ora disponibile.

30 agosto 2019 (Versione 1.0.1)

È disponibile la versione 1.0.1
Text to Speech per IBM Cloud Pak for Data versione 1.0.1 è ora disponibile. Il servizio ora funziona con IBM Cloud Pak for Data 2.1.0.1. Il servizio ora supporta l'installazione di IBM Cloud Pak for Data con Red Hat OpenShift.
Nuova voce neurale giapponese
Il servizio ora offre la voce giapponese neurale ja-JP_EmiV3Voice. Per ulteriori informazioni, vedi Lingue e voci supportate.
Supporto FISMA
Il supporto FISMA (Federal Information Security Management Act) è ora disponibile per Text to Speech per IBM Cloud Pak for Data. Il servizio è ad elevata idoneità per FISMA.

28 giugno 2019 (Versione 1.0.0)

È disponibile la versione 1.0.0

La versione 1.0.0, la release iniziale del servizio, è ora disponibile. Text to Speech per IBM Cloud Pak for Data si basa sul servizio IBM Watson® Text to Speech sul servizio pubblico IBM Cloud. Text to Speech per IBM Cloud Pak for Data differisce dal servizio Text to Speech pubblico nei modi seguenti. Potresti trovare utili queste informazioni se hai già familiarità con il servizio Text to Speech su IBM Cloud pubblico.

  • Text to Speech for IBM Cloud Pak for Data utilizza i token di accesso per l'autenticazione. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
  • Gli endpoint per Text to Speech for IBM Cloud Pak for Data sono specifici per il tuo cluster IBM Cloud Pak for Data. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
  • Text to Speech per IBM Cloud Pak for Data supporta solo voci neurali. Non supporta voci standard (concatenative). Le voci neurali non supportano gli elementi SSML <express-as> e <voice-transformation>.
  • Text to Speech for IBM Cloud Pak for Data non esegue alcuna registrazione della richiesta. Non hai bisogno di utilizzare l'intestazione della richiesta X-Watson-Learning-Opt-Out.
  • Text to Speech for IBM Cloud Pak for Data non supporta i token Watson. Non puoi utilizzare l'intestazione della richiesta X-Watson-Authorization-Token per l'autenticazione con il servizio.