Note sulla release per Speech to Text per IBM Cloud Pak for Data

IBM Cloud Pak for Data

Le seguenti funzioni e modifiche sono state incluse per ogni release e aggiornamento delle istanze installate o in loco di IBM Watson® Speech to Text per IBM Cloud Pak for Data. Salvo diversa indicazione, tutte le modifiche sono compatibili con le release precedenti e sono automaticamente e trasparentemente disponibili per tutte le applicazioni nuove ed esistenti.

Per informazioni sulle limitazioni note del servizio, vedi Limitazioni note.

Per informazioni sulle release e gli aggiornamenti del servizio per IBM Cloud, vedi Note sulla release per Speech to Text per IBM Cloud.

30 ottobre 2024 (Versione 4.8.7 )

La versione 4.8.7 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.7 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

25 settembre 2024 (Versione 5.0.3 )

La versione 5.0.3 è ora disponibile
è ora disponibile la versione 5.0.3 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 agosto 2024 (Versione 4.8.6 )

La versione 4.8.6 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.6 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 agosto 2024 (Versione 5.0.2 )

La versione 5.0.2 è ora disponibile
è ora disponibile la versione 5.0.2 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

31 luglio 2024 (Versione 5.0.1 )

La versione 5.0.1 è ora disponibile
è ora disponibile la versione 5.0.1 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

19 giugno 2024 (Versione 5.0.0 )

La versione 5.0.0 è ora disponibile
è ora disponibile la versione 5.0.0 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

24 aprile 2024 (Versione 4.8.5 )

La versione 4.8.5 è ora disponibile
è ora disponibile la versione 4.8.5 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

27 marzo 2024 (Versione 4.8.4 )

La versione 4.8.4 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.4 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 febbraio 2024 (Versione 4.8.3 )

La versione 4.8.3 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.8.3 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

31 gennaio 2024 (Versione 4.8.2 )

La versione 4.8.2 è ora disponibile
è ora disponibile la versione 4.8.2 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

30 novembre 2023 (Versione 4.8.0 )

La versione 4.8.0 è ora disponibile
è ora disponibile la versione 4.8.0 di Speech to Text per IBM Cloud Pak for Data. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

27 settembre 2023 (Versione 4.7.3 )

La versione 4.7.3 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.3 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

28 luglio 2023 (Versione 4.7.1 )

La versione 4.7.1 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.1 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

9 giugno 2023 (Versione 4.7.0 )

La versione 4.7.0 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.7.0 è ora disponibile. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

2 maggio 2023 (Versione 4.6.5)

La versione 4.6.5 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.6.5 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.10 e 4.12. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Nuovo modello di telefonia giapponese di nuova generazione

Il servizio offre ora un modello di telefonia di nuova generazione per il giapponese ja-JP_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, vedere:

Personalizzazione migliorata del modello di lingua per modelli inglesi e giapponesi di nuova generazione

Il servizio ora fornisce una migliore personalizzazione del modello di lingua per i modelli di inglese e giapponese di prossima generazione:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Miglioramenti visibili ai modelli: la nuova tecnologia migliora il comportamento predefinito dei nuovi modelli in inglese e in giapponese. Tra le altre modifiche, la nuova tecnologia ottimizza il comportamento predefinito per i parametri seguenti:

  • Il customization_weight predefinito per i modelli personalizzati basati sulle nuove versioni di questi modelli cambia da 0.2 a 0.1.
  • L'impostazione predefinita di character_insertion_bias per i modelli personalizzati basati sulle nuove versioni di questi modelli rimane 0.0, ma i modelli sono cambiati, rendendo meno necessario il parametro per il riconoscimento vocale.

Aggiornamento ai nuovi modelli: per usufruire della tecnologia migliorata, devi eseguire l'upgrade dei modelli di lingua personalizzati basati sui nuovi modelli. Per passare alla nuova versione di uno di questi modelli base:

  1. Modifica il tuo modello personalizzato aggiungendo o modificando una parola personalizzata, un corpus o una grammatica che il modello contiene. Qualsiasi modifica apportata sposta il modello nello stato ready.

  2. Utilizzare il metodo POST /v1/customizations/{customization_id}/train per eseguire nuovamente l'addestramento del modello. Il nuovo aggiornamento aggiorna il modello personalizzato alla nuova tecnologia e sposta il modello nello stato available.

    Problema noto: Attualmente non è possibile utilizzare il metodo POST /v1/customizations/{customization_id}/upgrade_model per aggiornare un modello personalizzato a uno dei nuovi modelli di base. Questo problema sarà affrontato in una versione futura.

Utilizzo dei nuovi modelli: dopo l'upgrade al nuovo modello di base, ti consigliamo di valutare le prestazioni del modello personalizzato aggiornato prestando particolare attenzione ai parametri customization_weight e character_insertion_bias per il riconoscimento vocale. Quando esegui di nuovo l'addestramento del modello personalizzato:

  • Il modello personalizzato utilizza il nuovo customization_weight predefinito di 0.1 per il proprio modello personalizzato. Un customization_weight non predefinito che era associato al modello personalizzato viene rimosso.
  • Il modello personalizzato potrebbe non richiedere più l'uso del parametro character_insertion_bias per un riconoscimento vocale ottimale.

I miglioramenti alla personalizzazione del modello di lingua rendono questi parametri meno importanti per il riconoscimento vocale di alta qualità:

  • Se si utilizzano i valori predefiniti per questi parametri, continuare a farlo dopo l'aggiornamento. I valori predefiniti continueranno a offrire i migliori risultati per il riconoscimento vocale.
  • Se si specificano valori non predefiniti per questi parametri, sperimentare i valori predefiniti dopo l'aggiornamento. Il tuo modello personalizzato potrebbe funzionare bene per il riconoscimento vocale con i valori predefiniti.

Se ritieni che l'utilizzo di valori differenti per questi parametri potrebbe migliorare il riconoscimento vocale con il tuo modello personalizzato, prova le modifiche incrementali per determinare se i parametri sono necessari per migliorare il riconoscimento vocale.

Nota: attualmente, i miglioramenti apportati alla personalizzazione dei modelli linguistici si applicano solo ai modelli personalizzati basati sui modelli linguistici di base inglesi o giapponesi di nuova generazione elencati in precedenza. Nel tempo, i miglioramenti saranno resi disponibili per altri modelli linguistici di prossima generazione.

Ulteriori informazioni: Per ulteriori informazioni sull'aggiornamento e sul riconoscimento vocale con questi parametri, vedere:

Nuova variabile di ambiente per la risorsa personalizzata dei servizi Speech

La documentazione include ora istruzioni per creare una variabile di ambiente denominata ${CUSTOM_RESOURCE_SPEECH}. Si aggiunge la nuova variabile allo script cpd_vars.sh e si crea lo script per utilizzare la variabile nel proprio ambiente. Per ulteriori informazioni, vedi Informazioni necessarie per completare questa attività in Installazione di Watson Speech serviceso fai riferimento a uno degli argomenti di aggiornamento per i servizi Speech.

Correzione dei difetti: sono ora disponibili i modelli multimediali svedesi e italiani

Correzione del difetto: i modelli di telefonia svedese (sv-SE_Telephony) e multimediale italiano (it-IT_Multimedia) sono ora disponibili per l'installazione. In precedenza, non erano disponibili.

Correzione dei difetti: tempo di formazione migliorato per i modelli di lingua personalizzati di prossima generazione

Correzione del difetto: il tempo di addestramento per i modelli di lingua personalizzati di nuova generazione è ora notevolmente migliorato. In precedenza, il tempo di addestramento era molto più lungo del necessario, come riportato per l'addestramento dei modelli di lingua personalizzati giapponesi. Il problema è stato corretto da una correzione interna.

Correzione dei difetti: i file di grammatica ora gestiscono correttamente le stringhe di cifre

Fix Defect: quando vengono utilizzate le grammatiche, il servizio ora gestisce correttamente le stringhe di cifre più lunghe. In precedenza, non era in grado di completare il riconoscimento o restituire risultati errati.

Correzione dei difetti: i file di grammatica generati dinamicamente ora funzionano correttamente

Fix Defect: i file di grammatica generati dinamicamente ora funzionano correttamente. In precedenza, i file di grammatica dinamici potevano causare errori interni, come riportato per l'integrazione di Speech to Text con IBM® watsonx™ Assistant. Il problema è stato corretto da una correzione interna.

Correzione difetto: la formattazione intelligente per le date in inglese americano è ora corretta

Correzione del difetto: la formattazione intelligente ora include correttamente i giorni della settimana e le date in cui entrambi sono presenti nell'audio parlato, ad esempio Tuesday February 28. In precedenza, in alcuni casi, il giorno della settimana era omesso e la data era presentata in modo non corretto. La formattazione intelligente è una funzionalità beta.

Correzione difetto: aggiornare la documentazione per le parole di esitazione vocale per i modelli di nuova generazione

Correzione di un difetto: Aggiornata la documentazione relativa alle parole di esitazione vocale per i modelli di nuova generazione. Ulteriori dettagli sono forniti sulle parole di esitazione di inglese americano e giapponese. I modelli di nuova generazione includono le parole di esitazione effettive nei risultati della trascrizione, a differenza dei modelli di generazione precedente, che includono solo indicatori di esitazione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.

Vulnerabilità della sicurezza risolte

Sono state corrette le seguenti vulnerabilità di sicurezza:

29 marzo 2023 (versione 4.6.4)

La versione 4.6.4 è ora disponibile
Speech to Text per IBM Cloud Pak for Data versione 4.6.4 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.10 e 4.12. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.
Importante: eseguire il backup dei dati prima di aggiornare alla versione 4.6.3 o 4.6.4
Importante: prima di eseguire l'aggiornamento alla versione 4.6.3 o 4.6.4 dei servizi Watson Speech, è necessario eseguire un backup dei dati. Conservare il backup in una posizione sicura. Per ulteriori informazioni sul backup dei dati dei servizi Watson Speech, vedere Backup e ripristino dei dati dei servizi Watson Speech in Amministrazione dei servizi Watson Speech. Tale argomento include anche le informazioni sul ripristino dei dati, se necessario.
Numero noto: la telefonia svedese e i modelli multimediali italiani non sono ancora disponibili
Problemi noti: I modelli di telefonia svedese ( sv-SE_Telephony ) e multimediale italiano ( it-IT_Multimedia ) non sono ancora disponibili. Sono disponibili con la versione 4.6.5.
Correzione dei difetti: ora è possibile modificare i modelli e le voci installati con opzioni di installazione avanzate
Correzione del difetto: durante l'installazione, è ora possibile specificare diversi modelli o voci con le opzioni di installazione avanzate della CLI (command - line interface). In precedenza, il servizio installava sempre i modelli e le voci predefiniti. La limitazione continua ad applicarsi per i servizi Watson Speech versioni 4.6.0, 4.6.2e 4.6.3. Per informazioni sull'installazione di modelli e voci, vedi Specifica di opzioni di installazione aggiuntive in Installazione di servizi Watson Speech.
Impostazione dei timeout del programma di bilanciamento del carico
I servizi Watson Speech richiedono che tu modifichi le impostazioni di timeout del programma di bilanciamento del carico sia per il server che per il client in 300 secondi. Queste impostazioni assicurano che le richieste di riconoscimento vocale di lunga durata, quelle con audio lungo o difficile, abbiano tempo sufficiente per il completamento. Per ulteriori informazioni, consulta Informazioni necessarie per completare questa attività in Installazione di Watson Speech services.
Vulnerabilità della sicurezza risolte
Le seguenti vulnerabilità di sicurezza sono state corrette:

23 febbraio 2023 (Versione 4.6.3)

La versione 4.6.3 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.6.3 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versione 4.10. Red Hat OpenShift versione 4.8 non è più supportato. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio il 31 luglio 2023

Importante: tutti i modelli di generazione precedente sono obsoleti e raggiungeranno la fine del servizio a partire dal 31 luglio 2023. A tale data, tutti i modelli di generazione precedente verranno rimossi dal servizio e dalla documentazione. La data di deprecazione precedente era il 3 marzo 2023. La nuova data consente agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati. Ma gli utenti devono migrare al modello equivalente di prossima generazione entro il 31 luglio 2023.

La maggior parte dei modelli di generazione precedente sono stati deprecati il 15 marzo 2022. In precedenza, i modelli arabo e giapponese non erano deprecati. L'obsolescenza ora si applica a tutti modelli di generazione precedente.

Nota: quando la generazione precedente en-US_BroadbandModel viene rimossa dal servizio, il modello en-US_Multimedia di nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

Problema noto: non puoi modificare i modelli e le voci installati con le opzioni di installazione avanzate

Problema noto: attualmente non è possibile specificare diversi modelli o voci con le opzioni di installazione avanzate. Il servizio installa sempre i modelli e le voci predefiniti. Per informazioni sulla modifica dei modelli dopo l'installazione, vedi Aggiornamento di modelli e voci per i tuoi servizi Watson Speech nell'argomento Administration di Watson Speech services on IBM Cloud Pak for Data.

Problema noto: l'aggiornamento alla versione 4.6.3 potrebbe non essere completato

Problema noto: quando si esegue l'aggiornamento alla versione 4.6.3, l'eliminazione del lavoro di backup MinIO potrebbe non riuscire una volta completato. In questo caso, la soluzione consiste nell'eliminare il lavoro, dopo di che l'aggiornamento procede normalmente. Eseguire le seguenti operazioni per risolvere il problema.

  1. Per determinare se il lavoro di backup MinIO rimane non eliminato, immettere il comando riportato di seguito:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    Il lavoro MinIO che non viene eliminato viene identificato da una voce del seguente formato:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Per eliminare il lavoro di backup MinIO, immettere il seguente comando:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Una volta eliminato il processo di backup, l'aggiornamento continua e viene completato.

Correzione del difetto: aggiornare il modello di telefonia di nuova generazione francese canadese (aggiornamento richiesto)

Correzione del difetto: il modello di telefonia francese canadese di nuova generazione, fr-CA_Telephony, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale. È necessario aggiornare i modelli personalizzati basati sul modello fr-CA_Telephony. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, vedere

Correzione dei difetti: il modello multimediale portoghese brasiliano di nuova generazione è ora disponibile

Correzione del difetto: il modello multimediale portoghese brasiliano di nuova generazione ora è disponibile per Speech to Text per IBM Cloud Pak for Data. In precedenza, il modello non era disponibile.

L'aggiunta di parole direttamente ai modelli personalizzati basati sui modelli di nuova generazione aumenta il tempo di addestramento

L'aggiungere parole personalizzate direttamente a un modello personalizzato che si basa su un modello di nuova generazione fa sì che l'addestramento di un modello impiega alcuni minuti in più di quanto non farebbe altrimenti. Se stai addestrando un modello con parole personalizzate che hai aggiunto utilizzando il metodo POST /v1/customizations/{customization_id}/words o PUT /v1/customizations/{customization_id}/words/{word_name}, concedi alcuni minuti di tempo di addestramento supplementare per il modello. Per ulteriori informazioni, vedi

Ulteriori informazioni sull'utilizzo delle istanze del servizio

La documentazione ora include informazioni sulla creazione di un'istanza del servizio con la CLI (cpl-cli) e sulla gestione delle istanze del servizio. Per ulteriori informazioni, vedi i seguenti argomenti di Watson Speech services on IBM Cloud Pak for Data:

  • Creazione di un'istanza dei servizi Watson Speech in Configurazione post - installazione
  • Gestione delle tue istanze dei servizi Watson Speech in Amministrazione
Vulnerabilità della sicurezza risolta

La seguente vulnerabilità della sicurezza è stata corretta:

30 gennaio 2023 (Versione 4.6.2)

La versione 4.6.2 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.6.2 ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.8 e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

La risorsa personalizzata include ora una nuova proprietà fileStorageClass

La risorsa personalizzata per i servizi Watson Speech ora include una proprietà fileStorageClass in aggiunta alla proprietà blockStorageClass esistente. Specificare le classi di archiviazione blocchi e file quando si installa o si aggiorna un servizio. Durante l'aggiornamento da una versione precedente, la nuova proprietà viene aggiunta automaticamente alla risorsa personalizzata dall'opzione --file_storage_class sul comando cli manage apply-cr.

Per ulteriori informazioni sulle classi di archiviazione blocchi e file disponibili che utilizzi con ciascuna delle soluzioni di archiviazione supportate, consulta la tabella di Requisiti di archiviazione in Informazioni necessarie per completare questa attività nella pagina "Installazione di Watson Speech services" in Watson Speech services on IBM Cloud Pak for Data.

Ulteriori informazioni relative al provisioning di un'istanza del servizio

La documentazione ora include informazioni sulla creazione di un'istanza del servizio in modo programmatico. Include anche esempi di elencazione delle istanze del servizio ed eliminazione di un'istanza del servizio. Per ulteriori informazioni, consulta Creating a Watson Speech services instance nella documentazione Post - installation setup in Watson Speech services on IBM Cloud Pak for Data.

La codifica lato server è abilitata per l'archivio dati MinIO

I servizi vocali hanno ora abilitato la crittografia lato server per l'archiviazione oggetti nell'archivio dati MinIO. Non è richiesta alcuna azione da parte dell'utente.

Modifica in webhook di controllo

I servizi di sintesi vocale hanno ora rimosso la dipendenza webhook di verifica. I servizi ora scrivono gli eventi di verifica direttamente sul server. Dopo l'aggiornamento alla versione 4.6.2, alcune risorse webhook potrebbero rimanere fino a quando tutti i servizi non possono rimuovere la dipendenza. Le risorse rimanenti verranno rimosse in una release futura. Non è richiesta alcuna azione da parte dell'utente.

Nuovo modello multimediale olandese di nuova generazione

Il servizio offre ora un modello multimediale di nuova generazione per l'olandese olandese olandese: nl-NL_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Nuovo modello di telefonia svedese di nuova generazione

Il servizio ora offre un modello di telefonia di nuova generazione per lo svedese sv-SE_Telephony. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamenti ai modelli di telefonia di nuova generazione in inglese

I modelli di telefonia inglese di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Il parametro max_alternatives è ora disponibile per l'utilizzo con modelli di nuova generazione

Il parametro max_alternatives è ora disponibile per l'utilizzo con tutti i modelli di nuova generazione. Il parametro è generalmente disponibile per tutti i modelli di nuova generazione. Per ulteriori informazioni, vedi Numero massimo di alternative.

Correzione dei difetti: consentire l'utilizzo di entrambi i parametri max_alternatives e end_of_phrase_silence_time con i modelli di nuova generazione

Fix Defect: quando si utilizzano entrambi i parametri max_alternatives e end_of_phrase_silence_time nella stessa richiesta con i modelli di nuova generazione, il servizio ora restituisce più trascrizioni alternative rispettando anche l'intervallo di pausa indicato. In precedenza, l'utilizzo dei due parametri in una singola richiesta ha generato un errore. (L'uso del parametro max_alternatives con modelli di nuova generazione era precedentemente disponibile come funzione sperimentale per un numero limitato di clienti.)

Correzione difetto: aggiornamento al modello multimediale di nuova generazione giapponese (aggiornamento richiesto)

Fix Defect: il modello multimediale di nuova generazione giapponese, ja-JP_Multimedia, è stato aggiornato per risolvere un'incongruenza interna che potrebbe causare un errore durante il riconoscimento vocale con bassa latenza. È necessario aggiornare i modelli personalizzati basati sul modello ja-JP_Multimedia. Per ulteriori informazioni sull'aggiornamento dei modelli personalizzati, vedere

Correzione dei difetti: aggiungere le linee guida per la documentazione per la creazione di suoni giapponesi basati su modelli di nuova generazione

Fix Defect: in sound - like per i modelli di lingua personalizzati giapponesi basati su modelli di nuova generazione, la sequenza di caratteri ウー è ambigua in alcuni contesti di sinistra. Non utilizzare caratteri (sillabe) che terminano con il fonema /o/, come e . In questi casi, utilizzare ウウ o solo invece di ウー. Ad esempio, utilizzare ロウウマン o ロウマン invece di ロウーマン. Per ulteriori informazioni, consultare Linee guida per il giapponese.

Correzione difetto: correggere l'utilizzo del campo display_as nei risultati della trascrizione

Correzione del difetto: per la personalizzazione del modello di lingua con modelli di nuova generazione, il valore del campo display_as per una parola personalizzata ora viene visualizzato in tutte le trascrizioni. In precedenza, il valore del campo word appariva talvolta nei risultati della trascrizione.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

30 novembre 2022 (Versione 4.6.0)

La versione 4.6.0 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.6.0 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.6.x e Red Hat OpenShift versioni 4.8 e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Amazon Web Services (AWS) è ora supportato

Watson I servizi di parlare per IBM Cloud Pak for Data sono ora supportati su Amazon Web Services™ (AWS™). I servizi supportano Amazon Elastic Block Store, che specifichi impostando la proprietà blockStorageClass della risorsa personalizzata dei servizi Speech su gp2-csi o gp3-csi.

Le nuove classi di memoria sono ora supportate

Watson Servizi di discorso per IBM Cloud Pak for Data ora supportano due classi di archiviazione aggiuntive:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Specificare la classe di archiviazione con la proprietà blockStorageClass della risorsa personalizzata dei servizi Speech. Per ulteriori informazioni su tutte le classi di archiviazione supportate, vedi i seguenti argomenti in Watson Speech services on IBM Cloud Pak for Data:

  • Prima di iniziare in Installazione dei servizi Watson Speech
  • Specifica di una classe di storage in Utilizzo della risorsa personalizzata dei servizi Watson Speech
Problema noto: alcuni pod dei servizi Watson Speech non contengono annotazioni utilizzate per la pianificazione

problema noto: ad alcuni pod dei servizi Watson Speech manca l'annotazione cloudpakInstanceId. Se utilizzi il servizio di pianificazione IBM Cloud Pak for Data, tutti i pod dei servizi Watson Speech senza l'annotazione cloudpakInstanceId sono

  • Pianificata dal programma di pianificazione predefinito Kubernetes piuttosto che dal servizio di pianificazione
  • Non incluso nell'applicazione della quota
Monitoraggio dell'archivio dati PostgreSQL ora disponibile

Puoi ora abilitare il monitoraggio dell'archivio dati PostgreSQL per ricevere aggiornamenti sul suo utilizzo e stato dai servizi Watson Speech. Gli eventi possono essere utilizzati dal software di controllo Prometheus o da qualsiasi applicazione utilizzata per il monitoraggio. Abilitando il monitoraggio per i progetti definiti dall'utente oltre al monitoraggio della piattaforma predefinita, puoi monitorare i tuoi propri progetti con lo stack di monitoraggio Red Hat® OpenShift® Container Platform. Questa funzionalità include una proprietà aggiuntiva, spec.global.datastores.postgressql.enablePodMonitor, nella risorsa personalizzata dei servizi Speech.

Per ulteriori informazioni, vedi l'argomento Monitoring the PostgreSQL datastore for Watson Speech services nella sezione Administering di Watson Speech services on IBM Cloud Pak for Data.

Correzione difetto: l'archivio dati PostgreSQL non è più installato se sono abilitati solo i microservizi di runtime

Fix Defect: l'archivio dati PostgreSQL non è più installato se sono abilitati solo i microservizi di runtime. L'archivio dati è ora installato solo se è installato almeno uno dei microservizi sttAsync, sttCustomization o ttsCustomization. PostgreSQL non viene disinstallato se in un secondo momento questi microservizi sono disabilitati.

Prima della versione 4.6.0, PostgreSQL era sempre installato con i servizi Speech. Se sei un cliente esistente che ha utilizzato solo i microservizi di runtime dei servizi Speech precedenti alla versione 4.6.0, PostgreSQL rimane installato ma non viene utilizzato. In questo caso, l'installazione di PostgreSQL persiste negli aggiornamenti.

L'archivio dati MinIO è sempre installato perché i microservizi di runtime dipendono da esso. Il datastore RabbitMQ è installato solo se è installato il microservizio sttAsync.

Per ulteriori informazioni, consultare Proprietà archivio dati in Utilizzo della risorsa personalizzata dei servizi Watson Speech in Watson Servizi vocali su IBM Cloud Pak for Data.

Correzione difetto: la creazione di una politica di rete non è più necessaria per l'operatore PostgreSQL per monitorare i relativi operandi

Fix Defect: per la versione 4.6.0, non è necessario creare una politica di rete per consentire all'operatore PostgreSQL di monitorare i relativi operandi, come descritto nell'aggiornamento del servizio 10 November 2022(Versioni 4.0.x e 4.5.x). A partire dalla versione 4.6.0, il servizio gestisce automaticamente questa situazione.

Correzione dei difetti: alcuni modelli di nuova generazione sono stati aggiornati per migliorare il tempo di risposta a bassa latenza

Correzione dei difetti: i seguenti modelli di nuova generazione sono stati aggiornati per migliorarne il tempo di risposta quando si utilizza il parametro low_latency:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

In precedenza, questi modelli non restituivano i risultati di riconoscimento con la velocità prevista quando veniva utilizzato il parametro low_latency. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Correzione del difetto: migliorare la documentazione di denominazione del modello personalizzato

Fix Defect: la documentazione ora fornisce regole dettagliate per la denominazione dei modelli di lingua personalizzati e dei modelli acustici personalizzati. Per ulteriori informazioni, vedi

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

10 novembre 2022 (versioni 4.0.x e 4.5.x)

Problema noto: la politica di rete aggiornata è necessaria per l'operatore PostgreSQL

Problemi noti: per i servizi Speech versione 4.0.x (senza includere la versione 4.0.0) e 4.5.x, se l'operatore PostgreSQL e i servizi Speech sono installati in spazi dei nomi differenti, l'operatore PostgreSQL non è in grado di monitorare gli operandi PostgreSQL per i servizi Speech. All'operatore viene impedito di monitorare gli operandi dalla politica di rete che è in atto per i servizi Speech.

Questo problema non impedisce al cluster PostgreSQL di funzionare correttamente. Il cluster rimane attivo e completamente funzionante. Tuttavia, l'operatore non è in grado di aggiornare gli operandi quando si esegue l'aggiornamento a nuove versioni dei servizi Speech.

La soluzione al problema consiste nel creare una politica di rete aggiuntiva per l'operatore PostgreSQL, come mostrato nei seguenti passi. Puoi eseguire la procedura indipendentemente dal fatto che l'operatore PostgreSQL sia installato o meno nello stesso spazio dei nomi dei servizi Speech o in uno spazio dei nomi diverso.

  1. Accedere come amministratore del progetto Red Hat® OpenShift® in cui sono installati i servizi Speech.

  2. Immettere il seguente comando per aggiornare la politica di rete per i servizi Speech:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    dove

    • <custom-resource-name> è il nome della risorsa personalizzata dei servizi Speech. Il nome consigliato per la versione 4.0.x è speech-prod-cr; il nome consigliato per la versione 4.5.x è speech-cr.
    • <cpd-instance-name> è il nome del progetto (spazio dei nomi) in cui sono installati i servizi Speech. La documentazione utilizza la variabile di ambiente ${PROJECT_CPD_INSTANCE} per identificare lo spazio nomi.
  3. Per verificare che la politica di rete aggiornata consenta all'operatore di monitorare gli operandi e che lo stato del cluster PostgreSQL sia integro, immettere il seguente comando, dove <custom-resource-name> e <cpd-instance-name> sono i valori utilizzati nel passo precedente:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Se il cluster PostgreSQL funziona correttamente, il comando produce un output simile al seguente:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Questa procedura non fa sì che l'operatore aggiorni gli operandi alle versioni più recenti. Tuttavia, gli operandi vengono aggiornati come previsto al successivo aggiornamento del software dei servizi Speech.

13 ottobre 2022 (Versione 4.5.3)

La versione 4.5.3 è ora disponibile

È ora disponibile la versione Speech to Text per IBM Cloud Pak for Data 4.5.3. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Gli eventi di controllo sono disponibili per i servizi Speech

Il servizio di registrazione di controllo IBM Cloud Pak for Data genera e inoltra eventi di verifica per i servizi Speech to Text e Text to Speech. Gli eventi di verifica corrispondono a quelli disponibili per il Activity Tracker con il servizio pubblico. Per ulteriori informazioni, vedi Eventi di controllo.

Non è possibile disinstallare singoli componenti del servizio Speech

La documentazione ora nota che non è possibile disinstallare singoli componenti del servizio (microservizi) una volta installati. Per rimuovere uno dei seguenti componenti, è necessario disinstallare i servizi Watson Speech nella loro interezza e reinstallare solo i componenti necessari: Speech to Text runtime, Speech to Text HTTP asincrono, Speech to Text personalizzazione, Text to Speech runtime e Text to Speech personalizzazione. Per ulteriori informazioni sull'installazione dei servizi di parlato, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Nuovo modello multimediale francese canadese di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per il francese canadese: fr-CA_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamenti ai modelli di telefonia di nuova generazione in inglese

I modelli di telefonia inglese di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tutti questi modelli continuano a supportare la bassa latenza. Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Il modello multimediale italiano di nuova generazione ora supporta la bassa latenza

Il modello multimediale italiano di nuova generazione, it-IT_Multimedia, ora supporta la bassa latenza. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Risoluzione dei problemi di aggiornamento dalla versione 4.0.x alla versione 4.5.x

Quando esegui l'upgrade dei servizi Speech dalla versione 4.0.x alla versione 4.5.x, potresti riscontrare un problema in cui i pod PostgreSQL si bloccano nello stato Terminating. Se questo problema si verifica durante l'aggiornamento, effettuare le seguenti operazioni per risolvere il problema. Le informazioni e i passi sono documentati anche in Upgrading Watson Speech services from Version 4.0 to Version 4.5 nell'argomento Upgrading of Watson Speech on IBM Cloud Pak for Data.

  1. Utilizza il seguente comando per identificare i pod che restano nello stato Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Utilizza il seguente comando per impostare la variabile di ambiente pods in modo da includere l'elenco di pod che rimangono nello stato Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'})
  1. Utilizzare il seguente comando per cancellare i pod bloccati in modo che il processo di aggiornamento possa continuare:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
Correzione del difetto: correggere la documentazione delle voci della risorsa personalizzata

Fix Defect: la documentazione per la risorsa personalizzata dei servizi Speech ora include i due punti dopo i nomi dei modelli koKrTelephony e nlNlTelephony. In precedenza, la documentazione per queste due voci ometteva i due punti.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

19 agosto 2022 (Versione 4.5.1)

Importante: la data di scadenza per la maggior parte dei modelli di generazione precedente è ora il 3 marzo 2023

Sostituito: questa notifica di obsolescenza è sostituita dall'aggiornamento del servizio del 23 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.

Il 15 marzo 2022, i modelli di generazione precedente per tutte le lingue tranne l'arabo e il giapponese furono deprecati. A quel tempo, i modelli obsoleti sarebbero rimasti disponibili fino al 15 settembre 2022. Per consentire agli utenti di avere più tempo per migrare ai modelli di nuova generazione appropriati, i modelli obsoleti rimarranno ora disponibili fino al 3 marzo 2023. Come con l'avviso di deprecazione iniziale, i modelli di generazione precedente in arabo e giapponese non sono obsoleti. Per un elenco completo di tutti i modelli obsoleti, consulta l'aggiornamento del servizio 15 marzo 2022(Versione 4.0.6).

Il 3 marzo 2023, i modelli obsoleti saranno rimossi dal servizio e dalla documentazione. Se si utilizza uno dei modelli obsoleti, è necessario migrare al modello di prossima generazione equivalente entro il 3 marzo 2023.

Nota: quando la generazione precedente en-US_BroadbandModel viene rimossa dal servizio, il modello en-US_Multimedia di nuova generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

3 agosto 2022 (Versione 4.5.1)

La versione 4.5.1 è ora disponibile

Ora è disponibile Speech to Text per IBM Cloud Pak for Data versione 4.5.1. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Supporto per cluster abilitati a FIPS

Sia Speech to Text per IBM Cloud Pak for Data che Text to Speech per IBM Cloud Pak for Data ora supportano l'esecuzione su cluster abilitati FIPS (Federal Information Processing Standard). Per ulteriori informazioni, vedi Servizi che supportano FIPS.

Correzione dei difetti: correggere i calcoli di memoria effimera per impedire l'eliminazione occasionale dei pod

Correzione difetto: Un difetto è stato corretto e il calcolo dei limiti di memoria temporanei è ora più preciso per i runtime Speech to Text per IBM Cloud Pak for Data e Text to Speech per i runtime IBM Cloud Pak for Data. Queste modifiche impediscono l'eliminazione occasionale dei pod quando i runtime dei servizi sono sottoposti a un carico elevato.

Correzione del difetto: aggiornare la documentazione dei contrassegni di esitazione e delle esitazioni

Correzione del difetto: È stata aggiornata la documentazione relativa alle esitazioni e ai marcatori di esitazione. I modelli di generazione precedente includono marcatori di esitazione al posto delle esitazioni del discorso nei risultati della trascrizione per la maggior parte delle lingue; la formattazione intelligente rimuove i marcatori di esitazione dalle trascrizioni finali dell'inglese americano. I modelli di nuova generazione includono le reali esitazioni del discorso nei risultati di trascrizione; la formattazione intelligente non ha alcun effetto sulla loro inclusione nei risultati di trascrizione finali.

Per ulteriori informazioni, consulta:

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

29 giugno 2022 (Versione 4.5.0)

La versione 4.5.0 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.5.0 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.5.x e Red Hat OpenShift versioni 4.6, 4.8e 4.10. Per ulteriori informazioni, vedere Watson Servizi vocali su IBM Cloud Pak for Data.

Servizi vocali unificati per documentazione IBM Cloud Pak for Data

La documentazione di installazione e amministrazione per Speech to Text e Text to Speech è ora combinata nella documentazione IBM Cloud Pak for Data. Per ulteriori informazioni sull'installazione e la gestione dei servizi Speech, vedi Watson Speech services on IBM Cloud Pak for Data.

Modifiche alla risorsa personalizzata dei servizi Speech

La risorsa personalizzata viene ora creata quando si installano inizialmente i servizi Speech. Il processo è descritto nella documentazione di installazione di IBM Cloud Pak for Data. Il contenuto della risorsa personalizzata è cambiato:

  • Il nome consigliato della risorsa personalizzata è cambiato da speech-prod-cr a speech-cr.
  • Tutti i riferimenti alla classe di archiviazione sono stati modificati da varianti di storageClass a blockStorageClass.
  • Il nome della classe di archiviazione blocchi Portworx è stato modificato da portworx-shared-gp3 a portworx-db-gp3-sc.
  • La proprietà createSecret è stata rimossa per gli archivi dati MinIO e PostgreSQl. La proprietà viene utilizzata solo internamente. I servizi di comunicazione vocale utilizzano sempre un oggetto segreto se ne crei uno e creano sempre automaticamente l'oggetto se non ne viene fornito alcuno.
Oggetto dei segreti fornito dall'utente ora supportato per l'archivio dati RabbitMQ

Puoi ora fornire credenziali di protezione per l'archivio dati RabbitMQ, proprio come puoi per gli archivi dati MinIO e PostgreSQL. Il processo documentato è simile per tutti e tre gli archivi dati.

Nuovo modello italiano it-IT_Multimedia di nuova generazione

Il servizio offre ora un modello multimediale di nuova generazione per l'italiano: it-IT_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta la bassa latenza, ma supporta la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Modelli di telefonia e multimedia coreani aggiornati di prossima generazione

I modelli coreani di nuova generazione sono stati aggiornati:

  • Il modello ko-KR_Telephony è stato aggiornato per migliorare il supporto a bassa latenza per il riconoscimento vocale.
  • Il modello ko-KR_Multimedia è stato aggiornato per migliorare il riconoscimento vocale. Il modello ora supporta anche la bassa latenza.

Entrambi i modelli sono generalmente disponibili ed entrambi supportano la personalizzazione del modello di lingua e le grammatiche. Non è necessario aggiornare i modelli di lingua personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Aggiornamenti a più modelli di telefonia di nuova generazione

I seguenti modelli di telefonia in lingua inglese di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Non è necessario aggiornare i modelli personalizzati basati su questi modelli. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Correzione difetto: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione

Correzione dei difetti: i punteggi di affidabilità sono ora riportati per tutti i risultati della trascrizione. In precedenza, quando il servizio restituì più trascrizioni per una singola richiesta di riconoscimento vocale, i punteggi di affidabilità potrebbero non essere restituiti per tutte le trascrizioni.

Vulnerabilità della sicurezza risolte

Nessuna vulnerabilità di sicurezza è stata corretta per la versione 4.5.0.

25 maggio 2022 (Versione 4.0.9)

La versione 4.0.9 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.0.9 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Nuovo modello portoghese brasiliano pt-BR_Multimedia di nuova generazione

Il servizio offre ora un modello multimediale di nuova generazione per il portoghese brasiliano pt-BR_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Aggiornamento al modello di nuova generazione tedesco de-DE_Multimedia per supportare la bassa latenza

Il modello tedesco di nuova generazione, de-DE_Multimedia, ora supporta la bassa latenza. Non devi eseguire l'upgrade dei modelli personalizzati basati sul modello di base tedesco aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Nuovo parametro beta character_insertion_bias per i modelli di nuova generazione

Tutti i modelli di nuova generazione ora supportano il nuovo parametro beta, character_insertion_bias, disponibile con tutte le interfacce di riconoscimento vocale. Per impostazione predefinita, il servizio è ottimizzato per ogni singolo modello per bilanciarne il riconoscimento delle stringhe candidate di lunghezze differenti. La distorsione specifica del modello equivale a 0.0. La distorsione predefinita di ogni modello è sufficiente per la maggior parte delle richieste di riconoscimento vocale.

Tuttavia, alcuni casi di utilizzo potrebbero trarre vantaggio dalla preferenza di ipotesi con stringhe di caratteri più brevi o più lunghe. Il parametro accetta valori compresi tra -1.0 e 1.0 che rappresentano una modifica rispetto al valore predefinito di un modello. I valori negativi indicano al servizio di favorire le stringhe di caratteri più brevi. I valori positivi indirizzano il servizio a preferire stringhe di caratteri più lunghe. Per ulteriori informazioni, vedi Bias di inserimento dei caratteri.

I servizi di sintesi vocale non supportano l'utilità di backup e ripristino OADP

Watson Speech services non supporta il programma di utilità di backup e ripristino IBM Cloud Pak for Data OpenShift APIs for Data Protection (OADP). Se i servizi Speech sono installati su un cluster, potresti non essere in grado di utilizzare il programma di utilità di backup e ripristino IBM Cloud Pak for Data OADP per eseguire il backup di altri servizi installati su tale cluster. Questa limitazione si applica alla versione 4.0.0 e alle successive versioni dei servizi Speech.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

1 maggio 2022 (Versione 1.2.x)

Importante: Fine del servizio per Speech to Text versione 1.2.x su IBM Cloud Pak for Data versione 3.5
Importante Speech to Text versione 1.2.x on IBM Cloud Pak for Data versione 3.5 è fuori servizio dal 1 ° maggio 2022. Speech to Text versione 1.2.x non è più supportata, disponibile o documentata. Per ulteriori informazioni sulla fine del servizio per Speech to Text, che fa parte del Watson API Kit, vedere Interruzione del supporto software: IBM Watson API Kit per IBM Cloud Pak for Data 1.2.x.

27 aprile 2022 (versione 4.0.8)

La versione 4.0.8 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.0.8 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Nuove variabili di ambiente utilizzate nella documentazione IBM Cloud Pak for Data

La maggior parte dei comandi nella documentazione Speech to Text per IBM Cloud Pak for Data sono stati aggiornati per utilizzare una serie comune di variabili di ambiente. La documentazione fornisce uno script per esportare automaticamente le variabili di ambiente prima di eseguire i comandi di installazione, aggiornamento e amministrazione. Dopo aver creato lo script, è possibile copiare la maggior parte dei comandi dalla documentazione ed eseguirli senza apportare alcuna modifica.

Le variabili di ambiente definite dallo script includono:

  • ${PROJECT_CPD_INSTANCE} identifica il progetto in cui intendi installare IBM Cloud Pak for Data e i servizi Speech.
  • ${PROJECT_CPD_OPS} identifica il progetto per l'operatore della piattaforma IBM Cloud Pak for Data.
  • ${PROJECT_CPFS_OPS} identifica il progetto per i servizi di base IBM Cloud Pak for Data.

Per ulteriori informazioni sull'utilizzo delle variabili di ambiente, vedi Procedura ottimale: configurazione delle variabili di installazione.

La proprietà ttsVoiceMarginalCPU non è più documentata

La proprietà ttsVoiceMarginalCPU è stata rimossa dalla documentazione per la risorsa personalizzata dei servizi Speech. La proprietà gestisce il tradeoff tra simultaneità e velocità di sintesi vocale. Il valore predefinito di 400 garantisce un equilibrio ragionevole per la maggior parte dei clienti e mantiene la sintesi in tempo reale.

Nuovo modello multimediale tedesco di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per il tedesco de-DE_Multimedia. Il nuovo modello è generalmente disponibile. Non supporta bassa latenza. Supporta la personalizzazione del modello di lingua e le grammatiche come funzionalità generalmente disponibili.

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta la bassa latenza

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta la bassa latenza. Per ulteriori informazioni su tutti i modelli di nuova generazione e bassa latenza, consultare

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

8 aprile 2022 (Versione 4.0.7)

Il supporto per i suoni simili è ora documentato per i modelli personalizzati basati sui modelli di nuova generazione

Per i modelli di lingua personalizzati che si basano su modelli di nuova generazione, il supporto è ora documentato per le specifiche di suoni simili per le parole personalizzate. Il supporto per i suoni - like è disponibile dalla fine del 2021.

Esistono differenze tra l'utilizzo del campo sounds_like per i modelli personalizzati basati sui modelli di generazione precedente e di nuova generazione. Per ulteriori informazioni sull'utilizzo del campo sounds_like con i modelli personalizzati basati sui modelli di nuova generazione, vedi Gestione delle parole personalizzate per i modelli di nuova generazione.

Importante: parametro customization_id obsoleto rimosso dalla documentazione

Importante: il 9 ottobre 2018, il parametro customization_id di tutte le richieste di riconoscimento vocale è stato obsoleto e sostituito dal parametro language_customization_id. Il parametro customization_id è stato ora rimosso dalla documentazione per i metodi di riconoscimento vocale:

  • /v1/recognize per le richieste WebSocket
  • POST /v1/recognize per le richieste HTTP sincrone (incluse le richieste a più parti)
  • POST /v1/recognitions per le richieste HTTP asincrone

Nota: se utilizzi gli SDK Watson, assicurati di aver aggiornato qualsiasi codice dell'applicazione per utilizzare il parametro language_customization_id invece del parametro customization_id. Il parametro customization_id non sarà più disponibile dai metodi equivalenti degli SDK a partire dalla loro release principale successiva. Per ulteriori informazioni sui metodi di riconoscimento vocale, consulta la Guida di riferimento API & SDK.

30 marzo 2022 (Versione 4.0.7)

La versione 4.0.7 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.0.7 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Proprietà della risorsa personalizzata per specificare un modello predefinito

La voce predefinita per le richieste di riconoscimento vocale è en-US_BroadbandModel. Se non si installa en-US_BroadbandModel, è necessario

  • Utilizza il parametro model per passare la voce che deve essere utilizzata con ogni richiesta.
  • Specifica un nuovo modello predefinito per la tua installazione di Speech to Text per IBM Cloud Pak for Data utilizzando la proprietà defaultSTTModel nella risorsa personalizzata dei servizi Speech. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text e Utilizzo del modello predefinito.
Aggiornamenti ai modelli multimediali di nuova generazione in inglese e francese per supportare la bassa latenza

I seguenti modelli multimediali sono stati aggiornati per supportare la bassa latenza:

  • Inglese australiano: en-AU_Multimedia
  • Inglese britannico: en-GB_Multimedia
  • Inglese americano: en-US_Multimedia
  • Francese: fr-FR_Multimedia

Non è necessario aggiornare i modelli di lingua personalizzati creati su questi modelli di base. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, consultare

Nuovo modello multimediale castigliano spagnolo di nuova generazione

Il servizio ora offre un modello multimediale di nuova generazione per lo spagnolo castigliano: es-ES_Multimedia. Il nuovo modello supporta una bassa latenza ed è generalmente disponibile. Supporta anche la personalizzazione del modello di lingua e le grammatiche.

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili e sul loro supporto di personalizzazione, consultare

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta la formattazione intelligente

Il modello beta di nuova generazione en-WW_Medical_Telephony ora supporta il parametro smart_formatting per audio in inglese americano. Per ulteriori informazioni su tutti i modelli di nuova generazione, vedi Lingue e modelli di nuova generazione

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità di sicurezza sono state corrette:

17 marzo 2022 (Versione 4.0.6)

Il supporto grammaticale per i modelli di nuova generazione è ora generalmente disponibile

Il supporto grammaticale è ora generalmente disponibile (GA) per i modelli generali successivi che soddisfano le condizioni seguenti:

  • I modelli sono generalmente disponibili.
  • I modelli supportano la personalizzazione del modello di lingua.

Per ulteriori informazioni, vedi i seguenti argomenti:

15 marzo 2022 (Versione 4.0.6)

Importante: Deprecazione della maggior parte dei modelli di generazione precedente

Sostituito: questa notifica di obsolescenza è sostituita dall'aggiornamento del servizio del 23 febbraio 2023. La data di fine servizio per tutti i modelli di generazione precedente è ora 31 luglio 2023.

A partire dal 15 marzo 2022, i modelli di generazione precedente per tutte le lingue diverse dall'arabo e dal giapponese sono obsoleti. I modelli obsoleti rimangono disponibili fino al 15 settembre 2022, quando saranno rimossi dal servizio e dalla documentazione. I modelli di generazione precedente in arabo e giapponese non sono obsoleti.

I seguenti modelli di generazione precedente sono ora obsoleti:

  • Cinese (mandarino): zh-CN_NarrowbandModel e zh-CN_BroadbandModel
  • Olandese (Paesi Bassi): nl-NL_NarrowbandModel e nl-NL_BroadbandModel
  • Inglese (australiano): en-AU_NarrowbandModel e en-AU_BroadbandModel
  • Inglese (Regno Unito): en-UK_NarrowbandModel e en-UK_BroadbandModel
  • Inglese (Stati Uniti): en-US_NarrowbandModel, en-US_BroadbandModel e en-US_ShortForm_NarrowbandModel
  • Francese (canadese): fr-CA_NarrowbandModel e fr-CA_BroadbandModel
  • Francese (Francia): fr-FR_NarrowbandModel e fr-FR_BroadbandModel
  • Tedesco: de-DE_NarrowbandModel e de-DE_BroadbandModel
  • Italiano: it-IT_NarrowbandModel e it_IT_BroadbandModel
  • Coreano: ko-KR_NarrowbandModel e ko-KR_BroadbandModel
  • Portoghese (brasiliano): pt-BR_NarrowbandModel e pt-BR_BroadbandModel
  • Spagnolo (argentino) es-AR_NarrowbandModel e es-AR_BroadbandModel
  • Spagnolo (castigliano): es-ES_NarrowbandModel e es-ES_BroadbandModel
  • Spagnolo (cileno): es-CL_NarrowbandModel e es-CL_BroadbandModel
  • Spagnolo (colombiano): es-CO_NarrowbandModel e es-CO_BroadbandModel
  • Spagnolo (messicano): es-MX_NarrowbandModel e es-MX_BroadbandModel
  • Spagnolo (peruviano): es-PE_NarrowbandModel e es-PE_BroadbandModel

Se si utilizza uno di questi modelli obsoleti, è necessario migrare al modello di nuova generazione equivalente entro la data di fine del servizio.

Nota: quando la en-US_BroadbandModel di generazione precedente viene rimossa dal servizio il 15 settembre, il modello en-US_Multimedia di prossima generazione diventerà il modello predefinito per le richieste di riconoscimento vocale.

I modelli di nuova generazione ora supportano i parametri di analisi audio

Tutti i modelli di nuova generazione ora supportano i seguenti parametri di analisi audio come funzioni generalmente disponibili:

  • end_of_phrase_silence_time specifica la durata dell'intervallo di pausa in cui il servizio divide una trascrizione in più risultati finali. Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.
  • split_transcript_at_phrase_end indica al servizio di suddividere la trascrizione in più risultati finali in base alle caratteristiche semantiche dell'input. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.
Correzione del difetto: correggere la documentazione delle etichette dell'altoparlante

Correzione del difetto: La documentazione delle etichette dei diffusori includeva la seguente affermazione errata in più punti: Per i modelli di nuova generazione, le etichette dei diffusori non sono supportate per l'uso con risultati intermedi o a bassa latenza. Le etichette dei parlanti sono supportate per l'utilizzo con risultati provvisori e bassa latenza per i modelli di nuova generazione. Per ulteriori informazioni, vedi Etichette del parlante.

23 febbraio 2022 (Versione 4.0.6)

La versione 4.0.6 è ora disponibile

Speech to Text per la versione IBM Cloud Pak for Data 4.0.6 ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Aggiornamenti agli script di importazione / esportazione

Gli script import_export.sh e transfer_ownership.sh sono stati aggiornati. Questi script vengono utilizzati per importare ed esportare i dati tra cluster, eseguire il backup e il ripristino dei dati e migrare i dati dalla versione 3.5 alla versione 4.0.x. Gli script sono stati modificati e migliorati come segue:

  • Lo script transfer_ownership.sh ora richiede un'opzione -c da includere sulla riga comandi prima dell'argomento <custom_resource_name>.
  • Lo script transfer_ownership.sh ora richiede un'opzione e un argomento -v <version> per indicare la versione a cui viene trasferita la proprietà delle risorse. Specificare 35 per la versione 3.5 o 40 per la versione 4.0.x.
  • Lo script transfer_ownership.sh ora richiede un'opzione -p da includere sulla riga comandi prima dell'argomento <postgres_auth_secret_name>.
  • L'argomento <postgres_auth_secret_name> fornisce il segreto Kubernetes utilizzato per autenticare l'archivio dati PostgreSQL a cui stai trasferendo la proprietà. È possibile omettere il segreto di autenticazione se è uguale al valore predefinito (<custom-resource-name>-postgres-auth-secret per la versione 4.0.x, user-provided-postgressql per la versione 3.5). È necessario fornire il segreto se è diverso dal valore predefinito.
  • Entrambi gli script ora includono l'opzione -h (--help) per visualizzare le informazioni sullo script e il suo utilizzo.

Per ulteriori informazioni, vedi

Consiglio aggiornato per OpenShift Container Storage

A partire dalla versione 4.0.6dei servizi Speech, la classe di archiviazione consigliata per OpenShift Container Storage è ocs-storagecluster-ceph-rbd.

  • Se si sta installando Speech services 4.0.6 o si sta effettuando l'aggiornamento a Speech services 4.0.6 da IBM Cloud Pak for Data versione 3.5, specificare la classe di archiviazione ocs-storagecluster-ceph-rbd durante l'installazione o l'aggiornamento.
  • Se stai eseguendo l'aggiornamento ai servizi Speech 4.0.6 da un precedente aggiornamento di Cloud Pak for Data versione 4.0, continua a utilizzare ocs-storagecluster-cephfs. Non è possibile modificare la memoria utilizzata in una distribuzione esistente.

Il valore è specificato con la proprietà storageClass nella risorsa personalizzata dei servizi Speech:

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

I servizi di sintesi vocale funzionano con una versione di OpenShift Container Storage. La versione appena consigliata dispone di autorizzazioni di accesso più restrittive. Per ulteriori informazioni, vedi

Nuovo modello beta en-WW_Medical_Telephony ora disponibile

È ora disponibile una nuova beta di nuova generazione en-WW_Medical_Telephony. Il nuovo modello comprende i termini dei settori medico e farmacologico. Utilizzare il modello in situazioni in cui è necessario trascrivere la terminologia medica comune, ad esempio nomi di medicinali, marchi di prodotti, procedure mediche, malattie, tipi di medici o terminologia COVID-19-related. I casi d'uso comuni includono le conversazioni tra un paziente e un medico (ad esempio, un medico, un infermiere o un farmacista).

Il nuovo modello viene installato dalla risorsa personalizzata dei servizi Speech impostando enWwMedicalTelephony su enabled: true. Il modello è disponibile per tutti i dialetti inglesi supportati: australiano, indiano, britannico e statunitense.

  • Il modello supporta la personalizzazione del modello di lingua e le grammatiche come funzionalità beta.
  • Supporta la maggior parte degli stessi parametri del modello en-US_Telephony.
  • Non supporta i seguenti parametri: low_latency, profanity_filter, redaction e speaker_labels.
  • Al momento, non supporta smart_formatting per IBM Cloud Pak for Data.

Per ulteriori informazioni, vedere Modello di telefonia medica in inglese.

Aggiorna al modello zh-CN_Telephony cinese

Il modello cinese di nuova generazione zh-CN_Telephony è stato aggiornato per migliorare il riconoscimento vocale. Il modello continua a supportare la bassa latenza. Per impostazione predefinita, il servizio utilizza automaticamente il modello aggiornato per tutte le richieste di riconoscimento vocale. Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Se si dispone di modelli linguistici personalizzati basati sul modello aggiornato, è necessario aggiornare i modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando il metodo POST /v1/customizations/{customization_id}/upgrade_model. Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Aggiornamento al modello giapponese ja-JP_Multimedia per supportare la bassa latenza

Il modello giapponese di nuova generazione ja-JP_Multimedia ora supporta la bassa latenza. Puoi utilizzare il parametro low_latency con le richieste di riconoscimento vocale che utilizzano il modello. Non è necessario aggiornare i modelli personalizzati basati sul modello di base giapponese aggiornato. Per ulteriori informazioni sui modelli di nuova generazione e sulla bassa latenza, vedi Lingue e modelli di nuova generazione e Bassa latenza.

11 febbraio 2022 (Versione 4.0.5)

Correzione difetto: migliorare l'aggiornamento del modello personalizzato e la documentazione della versione del modello di base

Correzione del difetto: la documentazione che descrive l'aggiornamento dei modelli personalizzati e le stringhe di versione utilizzate per le diverse versioni dei modelli di base è stata aggiornata. La documentazione ora indica che l'aggiornamento per la personalizzazione del modello di linguaggio si applica anche ai modelli di prossima generazione. Inoltre, le stringhe di versione che rappresentano diverse versioni dei modelli di base sono state aggiornate. E il parametro base_model_version può essere utilizzato anche con i modelli di nuova generazione aggiornati.

Per ulteriori informazioni sull'aggiornamento del modello personalizzato, quando è necessario l'aggiornamento e su come utilizzare le versioni precedenti dei modelli personalizzati, vedi

Correzione del difetto: aggiornare la documentazione relativa alle maiuscole / minuscole

Fix Defect: la documentazione che descrive il maiuscolo / minuscolo automatico delle trascrizioni del servizio è stata aggiornata. Il servizio capitalizza i nomi appropriati solo per le lingue e i modelli seguenti:

  • Tutti i modelli di inglese americano di generazione precedente
  • Il modello tedesco di nuova generazione

Per ulteriori informazioni, consultare Capitalizzazione.

31 gennaio 2022 (Versione 4.0.5)

La versione 4.0.5 è stata aggiornata

Speech to Text per IBM Cloud Pak for Data versione 4.0.5 è stato aggiornato per risolvere i problemi di installazione. La versione del package del caso ora è 4.0.6. Utilizzare questo package invece del package della versione 4.0.5. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Importante: i passaggi aggiuntivi per l'installazione con mirroring non sono più necessari

Importante: le note sulla release del 26 gennaio 2022 includevano note importanti per i seguenti passi:

  • Passo aggiuntivo per l'esecuzione di un'installazione di mirroring dell'archivio dati Minio
  • Operazioni aggiuntive per l'esecuzione di un'installazione con mirroring di nuovi modelli di nuova generazione

Questi passi aggiuntivi non sono più necessari. Il package del caso è stato aggiornato per correggere i problemi di installazione.

26 gennaio 2022 (Versione 4.0.5)

La versione 4.0.5 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.0.5 è ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Importante: passo aggiuntivo per eseguire un'installazione con mirroring del datastore Minio

Importante: questi passi non sono più necessari se si installa il pacchetto del caso 4.0.6. Per ulteriori informazioni, vedere 31 gennaio 2022(versione 4.0.5).

Se si sta eseguendo un'installazione con mirroring (ad esempio, in un ambiente air - gapped), è necessario eseguire un ulteriore passo prima di completare una delle seguenti operazioni:

Questo passo è obbligatorio per copiare le immagini necessarie per l'archivio dati Minio:

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

Se non si esegue questo passo, si verificheranno errori di installazione sia per Speech to Text che per Text to Speech.

Importante: passi aggiuntivi per eseguire un'installazione speculare di nuovi modelli di nuova generazione

Importante: questi passi non sono più necessari se si installa il pacchetto del caso 4.0.6. Per ulteriori informazioni, vedere 31 gennaio 2022(versione 4.0.5).

Se si sta eseguendo un'installazione con mirroring (ad esempio, per un ambiente air - gapped) e si prevede di installare uno dei nuovi modelli di nuova generazione per Speech to Text (per ulteriori informazioni, consultare la nota sulla release successiva), è necessario eseguire un passo aggiuntivo prima di completare una delle seguenti operazioni:

Ogni passo aggiuntivo è univoco per il modello che si sta installando. Se si installa più di uno dei nuovi modelli, immettere il comando indicato per ciascun modello che si sta installando.

  • Per il modello di telefonia cinese (zh-CN_Telephony):

    echo 'cp.icr.io,cp/watson-speech/zh-cn-telephony,2022-01-05-405models,sha256:52af6dfccd64ccd81b409936442a51a71f4ee96d980e1fc6a343a05bd4ed7fbc,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Per il modello di telefonia spagnola latinoamericana (es-LA_Telephony):

    echo 'cp.icr.io,cp/watson-speech/es-la-telephony,2022-01-05-405models,sha256:58e8c04abe9659472e89bf0778b7dc66e0ddceb4ea18d9d3e048a08c72125ea2,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Per il modello multimediale inglese australiano (en-AU_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-au-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Per il modello multimediale inglese del Regno Unito (en-GB_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-gb-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
Il server delle licenze è ora installato automaticamente

L'operatore dei servizi vocali ora installa automaticamente il server delle licenze richiesto quando installa i servizi Speech. Non hai più bisogno di installare il server delle licenze dai servizi di base IBM Cloud Pak for Data e non hai più bisogno di utilizzare del contenuto YAML aggiuntivo per creare una OperandRequest con i bind necessari.

Rimozione delle fasi specifiche del server PostgreSQL EnterpriseDB

La versione precedente della documentazione includeva i passi per il server EnterpriseDB PostgreSQL specifici per i servizi Speech. Questi passaggi sono stati documentati negli argomenti Upgrade Watson Speech to Text (Versione 4.0) e Uninstalling Watson Speech to Text. Queste operazioni aggiuntive non sono più necessarie e sono state rimosse dalla documentazione.

L'archivio dati RabbitMQ è ora utilizzato solo dal componente sttAsync

L'archivio dati RabbitMQ è stato precedentemente utilizzato dai componenti di entrambi i servizi Speech, Speech to Text e Text to Speech. Ora gestisce l'accodamento dei messaggi non persistenti solo per il componente HTTP asincrono Speech to Text ( sttAsync ). Viene utilizzato solo se il componente sttAsync è installato e abilitato.

Nuovi modelli di nuova generazione

Il servizio ora supporta i seguenti modelli di nuova generazione con Speech to Text per IBM Cloud Pak for Data:

  • Modello di telefonia cinese (mandarino) (zh-CN_Telephony). Il nuovo modello supporta la bassa latenza.
  • Modello multimediale inglese (australiano) (en-AU_Multimedia). Il nuovo modello non supporta la bassa latenza.
  • Modello multimediale inglese (UK) (en-GB_Multimedia). Il nuovo modello non supporta la bassa latenza.
  • Modello di telefonia spagnolo (America Latina) (es-LA_Telephony). Il nuovo modello supporta la bassa latenza.

Nota: il modello latino - americano spagnolo, es-LA_Telephony, si applica a tutti i dialetti latinoamericani. È l'equivalente dei modelli di generazione precedente disponibili per i dialetti argentino, cileno, colombiano, messicano e peruviano. Se è stato utilizzato un modello di generazione precedente per uno di questi dialetti specifici, utilizzare il modello es-LA_Telephony per migrare al modello di nuova generazione equivalente.

I nuovi modelli sono generalmente disponibili per il riconoscimento vocale. Sono generalmente disponibili per la personalizzazione del modello di linguaggio e beta per le grammatiche. Non sono supportati per la personalizzazione del modello acustico.

  • Importante: se si sta eseguendo un'installazione con mirroring (ad esempio, in ambiente air - gapped) e si prevede di installare uno dei nuovi modelli di prossima generazione per Speech to Text, è necessario eseguire ulteriori operazioni prima di eseguire il mirroring delle immagini. Per ulteriori informazioni, consultare la nota di rilascio precedente.
  • Per ulteriori informazioni sull'utilizzo della risorsa personalizzata per installare i modelli, vedi Installazione di Watson Speech to Text.
  • Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.
  • Per ulteriori informazioni sul supporto di personalizzazione per i modelli di nuova generazione, vedi Supporto di personalizzazione per i modelli di nuova generazione.
I modelli US English di nuova generazione sono ora installati per impostazione predefinita

I modelli in inglese americano di prossima generazione, en-US_Multimedia e en-US_Telephony, sono ora installati per impostazione predefinita con Speech to Text per IBM Cloud Pak for Data. Questi modelli si uniscono a en-US_BroadbandModel, en-US_NarrowbandModel, en-US_ShortForm_NarrowbandModel come modelli installati per impostazione predefinita. I modelli ora hanno le seguenti voci nella risorsa personalizzata dei servizi Speech:

########################################
# Speech to Text next-generation models
########################################
      enUsMultimedia:    # US English (en-US) Multimedia model
        enabled: true
      enUsTelephony:     # US English (en-US) Telephony model
        enabled: true

For more information about using the custom resource to install models, see Installing Watson Speech to Text.

Vulnerabilità della sicurezza risolte

Le seguenti vulnerabilità della sicurezza associate a Apache Log4j sono state corrette:

20 dicembre 2021 (Versione 4.0.4)

La versione 4.0.4 è ora disponibile

Speech to Text per IBM Cloud Pak for Data versione 4.0.4 ora è disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Importante: modifiche alle proprietà per disabilitare la memorizzazione e la registrazione dei dati utente

Importante: i nomi delle proprietà della risorsa personalizzata dei servizi Speech che specificano se i dati utente sono archiviati e registrati sono stati modificati. La risorsa personalizzata conteneva in precedenza le seguenti proprietà:

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Queste proprietà sono ora denominate come segue:

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Se hai già impostato queste proprietà nella tua risorsa personalizzata per modificare il valore predefinito di false in true, devi modificare la tua risorsa personalizzata. È possibile modificare manualmente i nomi delle proprietà sui nuovi valori e salvare la risorsa personalizzata aggiornata. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.

Importante: modifiche alle proprietà dell'oggetto segreti PostgreSQL

Importante: quando si installano i servizi Speech, per impostazione predefinita viene creato un oggetto che contiene una password generata casualmente per l'archivio dati PostgreSQL. È possibile scegliere invece di specificare la password manualmente. In questo caso, le proprietà del file YAML per l'oggetto dei segreti sono state modificate. Per ulteriori informazioni, vedi l'argomento relativo alla gestione dei tuoi archivi di dati in Amministrazione di Watson Speech to Text.

Importante: i pod PostgreSQL non iniziano con l'operatore EnterpriseDB versione 1.10

Importante: con Speech to Text per IBM Cloud Pak for Data versione 4.0.3, i pod PostgreSQL basati sull'operatore EnterpriseDB versione 1.10 possono non essere avviati. Ciò impedisce l'avvio dei servizi Speech. Esiste una soluzione temporanea per questo problema. Se i tuoi servizi Speech non riescono ad avviarsi, vedi PostgreSQL pods do not start with EnterpriseDB versione 1.10 operator per informazioni sulla diagnostica e la risoluzione del problema.

Questo problema è stato risolto in Speech to Text per IBM Cloud Pak for Data versione 4.0.4.

Nuovo supporto per la classe di archiviazione nativa del contenitore IBM Spectrum Scale

Dalla versione 4.0.3, i servizi Speech supportano la classe di archiviazione nativa del contenitore IBM Spectrum® Scale. Per utilizzare IBM Spectrum Scale, specifica "ibm-spectrum-scale-sc" per la proprietà storageClass della risorsa personalizzata dei servizi Speech. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.

Interazione dei servizi Speech con l'archivio dati MinIO durante l'installazione

I componenti di runtime dei servizi di sintesi vocale, sttRuntime e ttsRuntime, non possono essere avviati fino a quando i modelli e le voci per i servizi non vengono completamente caricati nell'archivio dati MinIO. Durante l'installazione, i servizi potrebbero non riuscire e riavviarsi automaticamente una o più volte fino al completamento del caricamento dei modelli e delle voci. Quindi si avviano correttamente. Non è richiesta alcuna azione utente.

Correzione difetto: correggere la documentazione di aggiornamento

Correzione del difetto: La documentazione per l'aggiornamento dei servizi Speech alle nuove versioni di IBM Cloud Pak for Data versione 4.0.x includeva riferimenti errati in alcuni comandi. Questi riferimenti sono ora corretti:

  • Le stringhe watsonSpeechToTextStatus e watsonTextToSpeechStatus sono state modificate in speechStatus in entrambi i casi.
  • Le stringhe status.watsonSpeechToTextVersion e status.watsonTextToSpeechVersion sono state modificate in .spec.version in entrambi i casi.

Per ulteriori informazioni, vedi Upgrade Watson Speech to Text.

Importante: i modelli di lingua personalizzati basati su determinati modelli di nuova creazione devono essere ricreati

Importante: se hai creato modelli di lingua personalizzati basati su determinati modelli di nuova generazione, devi ricrearli. Finché non si ricreano i modelli linguistici personalizzati, le richieste di riconoscimento vocale che tentano di utilizzare i modelli personalizzati falliscono con un codice di errore HTTP 400.

Devi ricreare i modelli di lingua personalizzati che hai creato in base alle versioni seguenti dei modelli di nuova generazione:

  • Per il modello di en-AU_Telephony, i modelli personalizzati che hai creato da en-AU_Telephony.v2021-03-03 a en-AU_Telephony.v2021-10-04.
  • Per il modello di en-GB_Telephony, i modelli personalizzati che hai creato da en-GB_Telephony.v2021-03-03 a en-GB_Telephony.v2021-10-04.
  • Per il modello di en-US_Telephony, i modelli personalizzati che hai creato da en-US_Telephony.v2021-06-17 a en-US_Telephony.v2021-10-04.
  • Per il modello di en-US_Multimedia, i modelli personalizzati che hai creato da en-US_Multimedia.v2021-03-03 a en-US_Multimedia.v2021-10-04.

Per identificare la versione di un modello su cui si basa un modello di lingua personalizzato, utilizzare il metodo GET /v1/customizations per elencare tutti i modelli di lingua personalizzati o il metodo GET /v1/customizations/{customization_id} per elencare uno specifico modello di lingua personalizzato. Il campo versions dell'output mostra il modello base per un modello di lingua personalizzato. Per ulteriori informazioni, vedi Elenco dei modelli di lingua personalizzati.

Per ricreare un modello di lingua personalizzato, creare prima un modello personalizzato. Aggiungi quindi tutti i corpora e le parole personalizzate del precedente modello personalizzato al nuovo modello. Puoi quindi eliminare il precedente modello personalizzato. Per ulteriori informazioni, vedi Creazione di un modello di lingua personalizzato.

Aggiornamenti a più modelli di nuova generazione per il riconoscimento vocale migliorato

I seguenti modelli di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale:

  • Modello di telefonia inglese australiano (en-AU_Telephony)
  • Modello di telefonia inglese britannico (en-GB_Telephony)
  • Modello multimediale in inglese USA (en-US_Multimedia)
  • Modello di telefonia inglese (en-US_Telephony)
  • Modello di telefonia spagnola castigliana (es-ES_Telephony)

Per ulteriori informazioni su tutti i modelli di nuova generazione disponibili, vedi Modelli e linguaggi di nuova generazione.

Nuovo supporto della grammatica beta per i modelli di nuova generazione

Il supporto grammaticale è ora disponibile come funzionalità beta per tutti i modelli di prossima generazione disponibili. Tutti i modelli di nuova generazione sono generalmente disponibili (GA) e supportano la personalizzazione del modello di lingua. Per ulteriori informazioni, vedi i seguenti argomenti:

Nuovo campo custom_acoustic_model per le funzioni supportate

I metodi GET /v1/models e GET /v1/models/{model_id} ora segnalano se un modello supporta la personalizzazione del modello acustico. L'oggetto SupportedFeatures ora include un altro campo, custom_acoustic_model, un booleano che è true per il modello che supporta la personalizzazione del modello acustico e false in caso contrario. Attualmente, il campo è true per tutti i modelli di generazione precedente e false per tutti i modelli di nuova generazione.

Vulnerabilità della sicurezza risolta

La seguente vulnerabilità di sicurezza associata a Apache Log4j è stata corretta:

20 dicembre 2021 (versione 1.2.x)

Importante: non puoi installare più Speech to Text versione 1.2.x su IBM Cloud Pak for Data versione 3.5

Importante non puoi più eseguire nuove installazioni di Speech to Text versione 1.2.x su IBM Cloud Pak for Data versione 3.5. Puoi installare solo Speech to Text versione 4.0.x su IBM Cloud Pak for Data versione 4.x. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.

I servizi vocale per IBM Cloud Pak for Data versione 3.5 raggiungono la data di fine del supporto il 30 Aprile 2022. Ti invitiamo ad eseguire l'aggiornamento all'ultimo rilascio della versione 4.0.x dei servizi al più presto. Per ulteriori informazioni, vedi Upgrade Watson Speech to Text.

30 novembre 2021 (Versione 4.0.3)

La versione 4.0.3 è ora disponibile

Speech to Text per la versione IBM Cloud Pak for Data 4.0.3 ora disponibile. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versioni 4.6 e 4.8. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di Watson Speech to Text.

Il server delle licenze è ora un requisito obbligatorio

Devi ora installare il server delle licenze dai servizi di base IBM Cloud Pak for Data. È necessario installare il server delle licenze utilizzando il contenuto YAML fornito per creare una OperandRequest con i collegamenti necessari. Devi anche installare il License Service nello stesso spazio dei nomi del servizio (operando), che è anche dove è installato IBM Cloud Pak for Data. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.

Nuovo supporto per l'aggiornamento sul posto

Il servizio ora supporta l'aggiornamento in loco basato sull'operatore dalla versione 4.0.0 alla versione 4.0.3. Lo spostamento da IBM Cloud Pak for Data versione 3.5 alla versione 4.0.3 continua a richiedere l'uso di programmi di utilità di migrazione. Per ulteriori informazioni, vedi Upgrade Watson Speech to Text.

Modifiche all'installazione dell'operatore EDB PostgreSQL e della licenza

L'installazione, l'aggiornamento e la disinstallazione per l'operatore PostgreSQL di Enterprise DB sono stati modificati:

  • Le istruzioni per installare l'operatore e la licenza EDB PostgreSQL sono ora incluse con i servizi fondamentali IBM Cloud Pak for Data. Le istruzioni per l'installazione dei servizi Speech sono state aggiornate di conseguenza. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.
  • Le istruzioni per l'aggiornamento da Speech to Text versione 4.0.0 a 4.0.3 includono istruzioni per la disinstallazione dell'operatore e della licenza EDB PostgreSQL precedente e la loro reinstallazione con i servizi di base IBM Cloud Pak for Data. Per ulteriori informazioni, vedi Upgrade Watson Speech to Text.
  • Le istruzioni per la disinstallazione dei servizi Speech ora includono passi per la rimozione dell'operatore EDB PostgreSQL e della licenza precedentemente installati con Speech to Text. Per ulteriori informazioni, consultare Disinstallazione di Watson Speech to Text.
Nuova guida per il ridimensionamento dell'installazione

Il servizio ora fornisce una guida aggiornata sul ridimensionamento della tua installazione. Le informazioni includono la specifica del numero di pod, il numero di CPU assegnate per pod e il numero massimo di sessioni simultanee con modelli di generazione precedente e successiva. Per ulteriori informazioni, vedi Amministrazione di Watson Speech to Text.

Aggiornamenti della riga comandi per i programmi di utilità di importazione ed esportazione

I comandi utilizzati con i programmi di importazione ed esportazione per i servizi Speech includono nuove opzioni e argomenti. I programmi di utilità di importazione ed esportazione sono anche la base per il backup e il ripristino dei servizi e per la migrazione dalla IBM Cloud Pak for Data versione 3.5 alla versione 4.0.3. Per ulteriori informazioni sull'uso delle utilità, vedere

Nuova proprietà per specificare le CPU per l'addestramento del modello acustico

Il microservizio sttAMPatcher gestisce la personalizzazione del modello acustico per il servizio. AM Patcher utilizza un numero dedicato di CPU per gestire le richieste. Puoi utilizzare la nuova proprietà sttAMPatcher.resources.requestsCPU per aumentare il numero di CPU dedicate alla gestione delle richieste di addestramento del modello acustico da parte di AM Patcher. Ciò può essere necessario se riscontri degli errori di addestramento durante l'addestramento del modello acustico. Per ulteriori informazioni, consultare Installazione di Watson Speech to Text.

Nuovi modelli di nuova generazione

Il servizio ora supporta i nuovi modelli di lingua di nuova generazione. Tutti i nuovi modelli sono generalmente disponibili.

  • Ceco: cs-CZ_Telephony. Il modello supporta una latenza bassa.
  • Olandese belga (fiammingo): nl-BE_Telephony. Il modello supporta una latenza bassa.
  • Francese: fr-FR_Multimedia. Il nuovo modello non supporta la bassa latenza.
  • Inglese indiano: en-IN_Telephony. Il modello supporta una latenza bassa.
  • Hindi indiano: hi-IN_Telephony. Il modello supporta una latenza bassa.
  • Giapponese: ja-JP_Multimedia. Il modello non supporta la bassa latenza.
  • Coreano: ko-KR_Multimedia. Il modello non supporta la bassa latenza.
  • Coreano: ko-KR_Telephony. Il modello supporta una latenza bassa.
  • Olandese olandese: nl-NL_Telephony. Il modello supporta una latenza bassa.

Per ulteriori informazioni su tutti i modelli di nuova generazione e sulla bassa latenza, vedi Lingue e modelli di nuova generazione e Bassa latenza.

Aggiornamenti ai modelli di nuova generazione

I seguenti modelli di nuova generazione sono stati aggiornati per migliorare il riconoscimento vocale. Tutti i modelli sono generalmente disponibili.

  • Arabo: ar-MS_Telephony. Il modello ora supporta la bassa latenza.
  • Portoghese brasiliano: pt-BR_Telephony. Il modello continua a supportare la bassa latenza.
  • Inglese USA: en-US_Telephony. Il modello continua a supportare la bassa latenza.
  • Francese canadese: fr-CA_Telephony. Il modello ora supporta la bassa latenza.
  • Italiano: it-IT_Telephony. Il modello ora supporta la bassa latenza.

Per ulteriori informazioni su tutti i modelli di nuova generazione e sulla bassa latenza, vedi Lingue e modelli di nuova generazione e Bassa latenza.

Correzione del difetto: Risolvere i fallimenti HTTP asincroni

Correzione del difetto: L'interfaccia HTTP asincrona non riusciva a trascrivere alcuni audio. Inoltre, il callback per la richiesta ha restituito lo stato recognitions.completed_with_results invece di recognitions.failed. Questo errore è stato risolto.

Correzione del difetto: migliorare i risultati delle etichette degli altoparlanti

Fix Defect: quando si utilizzano le etichette degli altoparlanti con i modelli di nuova generazione, il servizio ora identifica l'altoparlante per tutte le parole dell'audio di input, incluse le parole molto brevi che hanno la stessa data / ora di inizio e fine.

Correzione del difetto: aggiornare i risultati provvisori e la documentazione a bassa latenza

Correzione del difetto: La documentazione che descrive i risultati intermedi e le funzionalità a bassa latenza con i modelli di nuova generazione è stata riscritta per chiarezza e correttezza. Per ulteriori informazioni, vedi i seguenti argomenti:

Correzione del difetto: correggere la documentazione multitenancy

Fix Defect: l'argomento IBM Cloud Pak for Data Supporto multitenancy ha erroneamente dichiarato che i servizi Speech non supportano multitenancy. L'argomento è stato aggiornato per indicare che i servizi Speech supportano le seguenti operazioni:

  • Installare il servizio in progetti separati
  • Installa il servizio più volte nello stesso progetto
  • Installa il servizio una volta e distribuisci più istanze nello stesso progetto

La documentazione specifica per i servizi Speech indicava correttamente il supporto multitenancy.

1 ottobre 2021 (Versione 1.1.x)

La versione 1.1.x è fuori servizio
Speech to Text e Text to Speech per la versione IBM Cloud Pak for Data 1.1.x sono usciti dal servizio il 30 settembre 2021. A partire dal 1 ottobre 2021, la documentazione per la versione 1.1.x non è più disponibile. Per ulteriori informazioni, vedi Ritiro del software e interruzione del supporto.

31 agosto 2021 (Versione 4.0.0)

Tutti i modelli di nuova generazione sono ora generalmente disponibili

Tutti i modelli di lingua di nuova generazione sono ora generalmente disponibili (GA). Sono supportati per l'utilizzo in ambienti e applicazioni di produzione.

La personalizzazione del modello di lingua per modelli di nuova generazione è ora generalmente disponibile

La personalizzazione del modello di lingua è ora generalmente disponibile (GA) per tutti i modelli e le lingue di nuova generazione disponibili. La personalizzazione del modello di lingua per modelli di nuova generazione è supportata per l'utilizzo in ambienti e applicazioni di produzione.

Utilizza gli stessi comandi per creare, gestire e utilizzare i modelli di lingua personalizzati, i corpora e le parole personalizzate per i modelli di nuova generazione come fai per i modelli di generazione precedente. Ma la personalizzazione per i modelli di nuova generazione funziona in maniera diversa rispetto alla personalizzazione per modelli di generazione precedente. Per i modelli personalizzati basati su modelli di nuova generazione:

  • I modelli personalizzati non hanno alcun concetto di parole OOV (out - of - vocabulary).
  • Le parole dai corpora non sono aggiunte alla risorsa di parole.
  • Attualmente non è possibile utilizzare la funzione di suono - simile per le parole personalizzate.
  • Non hai bisogno di aggiornare i modelli personalizzati quando vengono aggiornati i modelli di lingua di base.
  • Le grammatiche non sono attualmente supportate.

Per ulteriori informazioni sull'utilizzo della personalizzazione del modello di lingua per i modelli di nuova generazione, consultare

Ulteriori argomenti descrivono la gestione di modelli di lingua, corpora e parole personalizzate.

29 luglio 2021 (Versione 4.0.0)

È disponibile la versione 4.0.0

IBM Watson® Speech to Text per la versione IBM Cloud Pak® for Data 4.0.0 è adesso disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versione 4.x e Red Hat OpenShift versione 4.6. Per ulteriori informazioni sull'installazione e la gestione del servizio, consultare Installazione di IBM Watson Speech to Text per IBM Cloud Pak for Data.

Nuovi modelli linguistici di nuova generazione

Il servizio ora supporta un numero crescente di modelli di linguaggio di nuova generazione. I modelli multimediali e telefonia di nuova generazione migliorano le funzioni di riconoscimento vocale della precedente generazione di modelli a banda larga e a banda stretta del servizio. I nuovi modelli sfruttano le reti neurali profonde e l'analisi bidirezionale per ottenere una maggiore velocità effettiva e una maggiore precisione di trascrizione.

In questo momento, i modelli di linguaggio di nuova generazione e il parametro low_latency sono funzionalità beta. I modelli di nuova generazione supportano un numero limitato di lingue e funzioni di riconoscimento vocale. Le lingue, i modelli e le funzioni supportati aumenteranno con le release future.

Molti dei modelli di prossima generazione supportano anche un nuovo parametro low_latency che consente di richiedere risultati più rapidi a discapito di una qualità di trascrizione ridotta. Quando è abilitata la bassa latenza, il servizio riduce la sua analisi dell'audio, che può ridurre l'accuratezza della trascrizione. Questo trade-off può essere accettabile se l'applicazione richiede un tempo di risposta inferiore rispetto alla massima precisione possibile.

Il parametro low_latency influisce sull'uso del parametro interim_results con l'interfaccia WebSocket. I risultati provvisori sono disponibili solo per i modelli di nuova generazione che supportano la bassa latenza e solo se i parametri interim_results e low_latency sono impostati su true.

Modello di banda larga in lingua araba rinominato

Il modello di banda larga in lingua araba è ora denominato ar-MS_BroadbandModel. Il nome precedente, ar-AR_BroadbandModel, è obsoleto. Continuerà a funzionare per almeno un anno, ma potrebbe essere rimosso in una data futura. Si consiglia di migrare al nuovo nome appena possibile.

Documentazione Speech to Text unificata

La documentazione per IBM Watson Speech to Text per IBM Cloud Pak for Data è ora combinata con la documentazione per le istanze gestite del servizio Speech to Text ospitato su IBM Cloud. Ciò vale sia per la guida che per la documentazione di riferimento per le due forme del servizio. Link alla versione precedentemente separata della documentazione IBM Cloud Pak for Data per il reindirizzamento del servizio alla documentazione unificata.

Per ulteriori informazioni sull'identificazione delle informazioni che riguardano solo una versione del prodotto, vedi About Speech to Text.

Correzione difetto: migliorare la documentazione

Correzione dei difetti: la documentazione è stata aggiornata per correggere le seguenti informazioni:

  • La documentazione non è riuscita ad affermare che i modelli di nuova generazione non producono indicatori di esitazione. La documentazione è stata aggiornata per tenere presente che solo i modelli di generazione precedente producono indicatori di esitazione. I modelli di prossima generazione includono le reali esitazioni nei risultati della trascrizione. Per ulteriori informazioni, vedi Speech esitazioni e contrassegni di esitazione.
  • La documentazione ha dichiarato in modo non corretto che l'uso del parametro smart_formatting fa sì che il servizio rimuova gli indicatori di esitazione dai risultati della trascrizione finale per il giapponese. La formattazione intelligente non rimuove gli indicatori di esitazione dai risultati finali per il giapponese, solo per l'inglese americano. Per ulteriori informazioni, consultare Quali risultati influiscono sulla formattazione intelligente?
La versione 1.1.x sta per essere dismessa

Speech to Text e Text to Speech per IBM Cloud Pak for Data versione 1.1.x escono dal servizio il 30 settembre 2021. Devi eseguire l'upgrade a una versione più recente dei servizi su IBM Cloud Pak for Data prima di quella data. A partire dal 1 ottobre 2021, la documentazione per la versione 1.1.4 non sarà più disponibile.

12 aprile 2021 (Versione 1.2.1)

Aggiunta al file speech-override.yaml

Il file speech-override.yaml minimo include una definizione aggiuntiva, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} è il percorso per il registro Docker interno. Deve essere image-registry.openshift-image-registry.svc:5000/{namespace}, dove {namespace} è lo spazio dei nomi in cui è installato IBM Cloud Pak® for Data, normalmente zen.

9 aprile 2021 (Versione 1.2.1)

Supporto per la modifica dei modelli e delle voci installati
I servizi vocali ti consentono di aggiungere o rimuovere i modelli e le voci installati per la versione 1.2 o 1.2.1 dei servizi.

Versione 1.2.1 (26 marzo 2021)

È disponibile la versione 1.2.1

Speech to Text per IBM Cloud Pak for Data versione 1.2.1 è ora disponibile. Le versioni 1.2 e 1.2.1 utilizzano le stesse istruzioni di installazione e la stessa documentazione 1.2. La versione 1.2.1 supporta l'installazione su Red Hat OpenShift versione 4.6 in aggiunta alle versioni 4.5 e 3.11.

Nuove istruzioni di installazione

Per i cluster collegati a Internet e i cluster con air - gapping, le istruzioni di installazione includono le seguenti operazioni:

  • Utilizza il comando oc label per configurare le etichette richieste per lo spazio dei nomi in cui è installato IBM Cloud Pak for Data.
  • Utilizzare il comando oc project per assicurarsi di puntare al progetto OpenShift corretto.
  • Utilizza il comando cpd-cli install per installare un server PostgreSQL Enterprise DB utilizzato dai servizi Speech.

Si eseguono queste operazioni prima di installare i servizi Speech.

Nuove istruzioni di disinstallazione

È stato aggiunto un passo alla procedura per disinstallare i servizi Speech per ripulire tutte le risorse dall'installazione.

Registro autorizzato per archivio dati PostgreSQL

Il percorso del registro autorizzato da cui il servizio estrae immagini per l'archivio dati PostgreSQL è cambiato. L'ubicazione del registro è cambiata da cp.icr.io/cp/watson-speech a cp.icr.io/cp/cpd. Questa modifica è trasparente per gli utenti.

Segreti per archivi dati Minio e PostgreSQL

I datastore Minio e PostgreSQL richiedono i seguenti valori hardcoded per i loro segreti:

  • Per Minio, utilizzare minio.
  • Per PostgreSQL, utilizzare user-provided-postgressql.

Non è possibile utilizzare i propri valori per questi segreti. I segreti devono essere creati prima di installare i servizi Speech.

Eliminazioni dal file speech-override.yaml

Le seguenti voci sono state rimosse dal file speech-override.yaml. Sono stati aggiunti per risolvere un problema che ora è stato risolto.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

Il file abbreviato speech-override.yaml è stato generalmente ridotto ulteriormente ottimizzando il proprio contenuto in base agli elementi essenziali.

Versione 1.2 (9 dicembre 2020)

È disponibile la versione 1.2

Speech to Text per la versione IBM Cloud Pak for Data 1.2 è adesso disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versioni 3.5 e 3.0.1e Red Hat OpenShift versioni 4.5 e 3.11.

Nuovi modelli australiani e francesi canadesi

Il servizio ora offre modelli a banda larga e a banda stretta per l'inglese australiano e il francese canadese:

  • Inglese australiano: en-AU_BroadbandModel e en-AU_NarrowbandModel
  • Francese canadese: fr-CA_BroadbandModel e fr-CA_NarrowbandModel

I nuovi modelli sono generalmente disponibili e supportano sia la personalizzazione del modello di lingua che del modello acustico.

Modelli aggiornati per il riconoscimento vocale migliorato

I seguenti modelli di lingua sono stati aggiornati per un migliore riconoscimento vocale:

  • Portoghese brasiliano: pt-BR_BroadbandModel e pt-BR_NarrowbandModel
  • Francese: fr-FR_BroadbandModel
  • Tedesco: de-DE_BroadbandModel e de-DE_NarrowbandModel
  • Giapponese: ja-JP_BroadbandModel
  • Inglese britannico: en-GB_BroadbandModel e en-GB_NarrowbandModel
  • Inglese americano: en-US_ShortForm_NarrowbandModel

Per impostazione predefinita, il servizio utilizza automaticamente i modelli aggiornati per tutte le richieste di riconoscimento vocale. Se hai dei modelli acustici o di lingua personalizzati basati su questi modelli, devi eseguire l'upgrade dei tuoi modelli personalizzati esistenti per sfruttare gli aggiornamenti utilizzando i seguenti metodi:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Per ulteriori informazioni, vedi Upgrade dei modelli personalizzati.

Il parametro split_transcript_at_phrase_end è ora generalmente disponibile per tutte le lingue

Il parametro di riconoscimento vocale split_transcript_at_phrase_end è ora generalmente disponibile per tutte le lingue. In precedenza, era generalmente disponibile solo per l'inglese degli Stati Uniti e del Regno Unito. Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.

Il marcatore di esitazione per il tedesco è cambiato

L'indicatore di esitazione utilizzato per i modelli tedeschi a banda larga e a banda stretta aggiornati è cambiato da [hesitation] a %HESITATION. Per ulteriori informazioni sugli indicatori di esitazione, vedi Indicatori di esitazione e di esitazione.

Correzione difetto: risolvere il problema di latenza per i modelli con un numero elevato di grammatiche

Correzione del difetto: il servizio non ha più un problema di latenza per modelli di lingua personalizzati che contengono un numero elevato di grammatiche. Quando venivano inizialmente utilizzati per il riconoscimento vocale, il caricamento di tali modelli personalizzati poteva richiedere diversi secondi. I modelli personalizzati ora si caricano molto più velocemente, riducendo notevolmente la latenza quando vengono utilizzati per il riconoscimento.

15 luglio 2020 (versione 1.1.4)

Red Hat OpenShift versione 4.3 sta per uscire dal servizio
IBM Cloud Pak for Data 3.0.1 sta deprecando il supporto per Red Hat OpenShift 4.3 il 1 settembre 2020. Red Hat OpenShift 4.3 sta per uscire dal servizio il 22 ottobre 2020. IBM Cloud Pak for Data sta introducendo il supporto per Red Hat OpenShift 4.5. IBM Cloud Pak for Data sta consigliando ai client di eseguire l'aggiornamento a Red Hat OpenShift 4.5 prima del 22 ottobre 2020. Il supporto IBM collaborerà con tutti i clienti che hanno installato IBM Cloud Pak for Data 3.0.1 su Red Hat OpenShift 4.3. Ai nuovi clienti che desiderano eseguire l'installazione su Red Hat OpenShift 4.x viene richiesto di installare Red Hat OpenShift 4.5.

19 giugno 2020 (Versione 1.1.4)

È disponibile la versione 1.1.4

Speech to Text per IBM Cloud Pak for Data versione 1.1.4 ora è disponibile. L'installazione e la gestione del servizio includono molte modifiche. Questa versione supporta IBM Cloud Pak for Data versioni 2.5 e 3.0.1e Red Hat OpenShift versioni 3.11 e 4.3. Per ulteriori informazioni sull'installazione e la gestione del servizio, vedere Installazione e gestione di Speech to Text per IBM Cloud Pak for Data.

Nuovi parametri per controllare il livello di rilevamento dell'attività vocale

Il servizio ora offre due nuovi parametri facoltativi per controllare il livello di rilevamento dell'attività vocale. I parametri possono aiutarti a garantire che viene elaborato solo l'audio pertinente al riconoscimento vocale.

  • Il parametro speech_detector_sensitivity regola la sensibilità del rilevamento dell'attività vocale. Puoi utilizzare il parametro per eliminare gli inserimenti di parole da file audio musicali, colpi di tosse e altri eventi non vocali.
  • Il parametro background_audio_suppression elimina l'audio di sottofondo in base al suo volume per evitare che venga trascritto o interferisca in qualche modo con il riconoscimento vocale. Puoi utilizzare il parametro per eliminare conversazioni marginali o rumore di sottofondo.

Puoi utilizzare i parametri individualmente o insieme. Sono disponibili per tutte le interfacce e per la maggior parte dei modelli di lingua. Per ulteriori informazioni sui parametri, i loro valori consentiti e il loro effetto sulla qualità e la latenza del riconoscimento vocale, vedi Rilevamento dell'attività vocale.

Nuovi modelli a banda larga e a banda stretta per l'olandese e l'italiano

Il servizio supporta ora modelli a banda larga e a banda stretta per le lingue olandese e italiana:

  • Modello a banda larga per l'olandese (nl-NL_BroadbandModel)
  • Modello a banda stretta per l'olandese (nl-NL_NarrowbandModel)
  • Modello a banda larga per l'italiano (it-IT_BroadbandModel)
  • Modello a banda stretta per l'italiano (it-IT_NarrowbandModel)

I modelli linguistici olandese e italiano sono generalmente disponibili (GA) per il riconoscimento vocale e per la personalizzazione dei modelli linguistici e acustici. Per ulteriori informazioni sui modelli di lingua disponibili, vedi

Supporto per il parametro speaker_labels per il tedesco e il coreano

Il servizio ora supporta le etichette del parlante (il parametro speaker_labels) per i modelli di lingua in tedesco e coreano. Le etichette del parlante identificano gli individui e le parole da essi espresse in uno scambio tra più partecipanti. Per ulteriori informazioni, vedi Etichette del parlante.

Miglioramento del riconoscimento vocale per il modello a banda stretta giapponese

Il modello a banda stretta per il giapponese (ja-JP_NarrowbandModel) ora include alcune unità di parole multigrammaticali per cifre e frazioni decimali. Il servizio restituisce queste unità multigrammaticali indipendentemente dal fatto che hai abilitato la formattazione intelligente. La funzione di formattazione intelligente comprende e restituisce le unità multigrammaticali generate dal modello. Se applichi la tua post-elaborazione ai risultati della trascrizione, devi gestire queste unità in modo appropriato. Per ulteriori informazioni, vedi Giapponese nella documentazione della formattazione intelligente.

Backup e ripristino semplificati

Il servizio ora offre procedure di backup e ripristino notevolmente migliorate. I programmi di utilità sono ora disponibili per eseguire il backup dei dati dagli archivi dati, quindi non è più necessario ricreare tutti i dati in caso di emergenza. Per ulteriori informazioni, " Backup e ripristino dei dati dei servizi vocali " Watson.

1 aprile 2020 (Versione 1.1.3)

La personalizzazione del modello acustico è ora generalmente disponibile
La personalizzazione del modello acustico è ora generalmente disponibile (GA) per tutte le lingue supportate. Per ulteriori informazioni sul supporto di singoli modelli di lingua, vedi Supporto delle lingue per la personalizzazione.

28 febbraio 2020 (Versione 1.1.3)

È disponibile la versione 1.1.3

Speech to Text per IBM Cloud Pak for Data versione 1.1.3 è ora disponibile.

Nuovo parametro end_of_phrase_silence_time

Per il riconoscimento vocale, il servizio ora supporta il parametro end_of_phrase_silence_time. Il parametro specifica la durata dell'intervallo di pausa dopo di cui il servizio suddivide una trascrizione in più risultati finali. Ogni risultato finale indica una pausa o un silenzio esteso che supera l'intervallo di pausa. Per la maggior parte delle lingue, l'intervallo di pausa predefinito è 0,8 secondi; per il cinese è 0,6 secondi.

Puoi utilizzare il parametro per trovare un compromesso tra quanto spesso viene prodotto un risultato finale e l'accuratezza della trascrizione. Aumenta l'intervallo quando l'accuratezza è più importante della latenza. Diminuisci l'intervallo quando prevedi che il parlante pronunci frasi brevi o singole parole.

Per ulteriori informazioni, vedi Periodo di silenzio al termine della frase.

Nuovo parametro split_transcript_at_phrase_end

Per il riconoscimento vocale, il servizio ora supporta il parametro split_transcript_at_phrase_end. Il parametro indica al servizio di suddividere la trascrizione in più risultati finali in base alle funzioni di semantica dell'input, come ad esempio alla conclusione di periodi. Il servizio basa la sua comprensione delle funzioni semantiche sul modello di lingua di base che utilizzi con una richiesta. I modelli di lingua personalizzati e le grammatiche possono influenzare anche come e in quale punto il servizio suddivide una trascrizione.

Il parametro comporta che il servizio aggiunga un campo end_of_utterance ad ogni risultato finale per indicare il motivo della suddivisione: full_stop, silence, end_of_data o reset.

Per ulteriori informazioni, vedi Suddividi la trascrizione al termine della frase.

Parametro speaker_labels migliorato

Per il riconoscimento vocale, il parametro speaker_labels è stato aggiornato per migliorare l'identificazione dei singoli altoparlanti per un'ulteriore analisi del tuo esempio audio. Per ulteriori informazioni sulla funzione di etichette del parlante, vedi Etichette del parlante. Per ulteriori informazioni sui miglioramenti apportati alla funzione, vedere IBM Research AI Advances Speaker Diarization in Real Use Cases.

27 novembre 2019 (Versione 1.1.2)

È disponibile la versione 1.1.2
Speech to Text per IBM Cloud Pak for Data versione 1.1.2 è ora disponibile.
Numero massimo di modelli personalizzati
Non puoi creare più di 1024 modelli di lingua personalizzati e non più di 1024 modelli acustici personalizzati per credenziali di gestione. Per ulteriori informazioni, vedi Numero massimo di modelli personalizzati.

30 agosto 2019 (Versione 1.0.1)

È disponibile la versione 1.0.1

Speech to Text per IBM Cloud Pak for Data versione 1.0.1 è ora disponibile. Il servizio ora funziona con IBM Cloud Pak for Data 2.1.0.1. Il servizio ora supporta l'installazione di IBM Cloud Pak for Data con Red Hat OpenShift.

Nuovi modelli a banda larga e a banda stretta per i dialetti spagnoli

Il servizio ora offre dei modelli di lingua a banda larga e a banda stretta in sei dialetti spagnoli:

  • Spagnolo argentino (es-AR_BroadbandModel e es-AR_NarrowbandModel)
  • Spagnolo castigliano (es-ES_BroadbandModel e es-ES_NarrowbandModel)
  • Spagnolo cileno (es-CL_BroadbandModel e es-CL_NarrowbandModel)
  • Spagnolo colombiano (es-CO_BroadbandModel e es-CO_NarrowbandModel)
  • Spagnolo messicano (es-MX_BroadbandModel e es-MX_NarrowbandModel)
  • Spagnolo peruviano (es-PE_BroadbandModel e es-PE_NarrowbandModel)

I modelli per lo spagnolo castigliano non sono nuovi. Sono generalmente disponibili per il riconoscimento vocale e la personalizzazione del modello di lingua e beta per la personalizzazione del modello acustico.

I modelli per gli altri cinque dialetti sono nuovi e sono beta per tutti gli utilizzi. Poiché sono beta, questi dialetti aggiuntivi potrebbero non essere pronti per l'uso in produzione e sono soggetti a modifiche. Sono delle offerte iniziali che dovrebbero migliorare in termini di qualità con il tempo e l'utilizzo.

Per ulteriori informazioni, vedi le seguenti sezioni:

Supporto FISMA

Il supporto FISMA (Federal Information Security Management Act) è ora disponibile per Speech to Text per IBM Cloud Pak for Data. Il servizio è ad elevata idoneità per FISMA.

28 giugno 2019 (Versione 1.0.0)

È disponibile la versione 1.0.0

La versione 1.0.0, la release iniziale del servizio, è ora disponibile. Speech to Text per IBM Cloud Pak for Data si basa sul servizio IBM Watson® Speech to Text sul servizio pubblico IBM Cloud. Speech to Text per IBM Cloud Pak for Data differisce dal servizio Speech to Text pubblico nei modi seguenti. Potresti trovare utili queste informazioni se hai già familiarità con il servizio Speech to Text su IBM Cloud pubblico.

  • Speech to Text for IBM Cloud Pak for Data utilizza i token di accesso per l'autenticazione. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
  • Gli endpoint per Speech to Text for IBM Cloud Pak for Data sono specifici per il tuo cluster IBM Cloud Pak for Data. Per ulteriori informazioni, vedi la Guida di riferimento API & SDK.
  • Speech to Text for IBM Cloud Pak for Data non esegue alcuna registrazione della richiesta. Non hai bisogno di utilizzare l'intestazione della richiesta X-Watson-Learning-Opt-Out.
  • Speech to Text for IBM Cloud Pak for Data non supporta i token Watson. Non puoi utilizzare l'intestazione della richiesta X-Watson-Authorization-Token per l'autenticazione con il servizio.