Notes sur l'édition de Text to Speech for IBM Cloud Pak for Data

IBM Cloud Pak for Data

Les fonctions et modifications suivantes ont été incluses pour chaque édition et mise à jour des instances installées ou sur site de IBM Watson® Text to Speech for IBM Cloud Pak for Data. Sauf indication contraire, toutes les modifications sont rétrocompatibles et sont disponibles de manière automatique et transparente pour toutes les applications nouvelles et existantes.

Pour plus d'informations sur les limitations connues du service, voir Limitations connues.

Pour plus d'informations sur les mises à jour et les mises à jour du service pour IBM Cloud, voir Notes sur l'édition de Text to Speech for IBM Cloud.

30 octobre 2024 (Version 4.8.7 )

La version 4.8.7 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.7 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

25 septembre 2024 (Version 5.0.3

La version 5.0.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 août 2024 (Version 4.8.6 )

La version 4.8.6 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.6 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 août 2024 (Version 5.0.2

La version 5.0.2 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.2 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

31 juillet 2024 (Version 5.0.1

La version 5.0.1 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.1 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

19 juin 2024 (Version 5.0.0

La version 5.0.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

24 avril 2024 (Version 4.8.5 )

La version 4.8.5 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.5 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

27 mars 2024 (Version 4.8.4 )

La version 4.8.4 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.4 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 février 2024 (Version 4.8.3

La version 4.8.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

31 janvier 2024 (Version 4.8.2

La version 4.8.2 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.2 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

30 novembre 2023 (Version 4.8.0

La version 4.8.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

27 septembre 2023 (Version 4.7.3

La version 4.7.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 juillet 2023 (Version 4.7.1 )

La version 4.7.1 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.1 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

9 juin 2023 (Version 4.7.0

La version 4.7.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

2 mai 2023 (version 4.6.5)

La version 4.6.5 est maintenant disponible

Text to Speech pour IBM Cloud Pak for Data version 4.6.5 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.10 et 4.12. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Nouvelles voix neuronales expressives en anglais australien

Le service prend désormais en charge deux nouvelles voix neuronales expressives pour l'anglais australien:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont généralement disponibles (GA) pour une utilisation en production. Ils prennent en charge l'utilisation des symboles phonétiques standard International Phonetic Alphabet (IPA) et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

Nouvelle voix neuronale coréenne améliorée

Le service prend désormais en charge une nouvelle voix neuronale améliorée pour le coréen: ko-KR_JinV3Voice. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (IPA) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

Nouvelle version bêta Pays-Bas Voix neuronale améliorée néerlandaise

Le service prend désormais en charge une nouvelle voix féminine neuronale améliorée pour le néerlandais: nl-NL_MerelV3Voice. Il prend en charge l'utilisation de l'alphabet phonétique international (IPA) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR).

La nouvelle voix est une fonctionnalité bêta en attendant la fin de la prise en charge de SSML. Dans sa version initiale, la voix ne prend pas en charge l'utilisation des fonctionnalités SSML suivantes:

  • L'élément <prosody> avec n'importe quelle demande de synthèse vocale
  • Les paramètres rate_percentage et pitch_percentage avec toute demande de synthèse vocale
  • L'élément <mark> avec une demande de synthèse vocale WebSocket
  • Paramètre timings du message texte JSON avec une demande de synthèse vocale WebSocket

Pour plus d'informations sur la nouvelle voix, sa prise en charge des symboles IPA et SPR et la migration vers la nouvelle voix à partir des voix neuronales néerlandaises obsolètes, voir

Nouvelle variable d'environnement pour la ressource personnalisée des services vocaux

La documentation inclut désormais des instructions permettant de créer une variable d'environnement nommée ${CUSTOM_RESOURCE_SPEECH}. Vous ajoutez la nouvelle variable au script cpd_vars.sh et vous le sourdez pour utiliser la variable dans votre environnement. Pour plus d'informations, voir Informations dont vous avez besoin pour effectuer cette tâche dans Installation des services vocaux Watsonou reportez-vous à l'une des rubriques de mise à niveau des services vocaux.

Correction du défaut: la voix canadienne-française gère désormais correctement les temps numériques

Correctif d'incident: Les voix canadienne-française prononcent désormais des temps comme 19:41 correctement. Auparavant, les voix omettent des éléments de l'époque dans l'audio synthétisé.

Correction du défaut: la voix japonaise n'insère plus de données audio inattendues

Correctif d'incident: La voix japonaise n'insère plus de données audio inattendues dans les résultats de la synthèse vocale. Auparavant, des fichiers audio supplémentaires étaient insérés dans certains cas.

Correction de l'incident: mise à jour des symboles phonétiques coréens dans la documentation

Correctif d'incident: dans la documentation des symboles SPR coréens, les symboles à deux caractères des consonnes sont désormais placés entre apostrophes, ce qui en fait un symbole unique. Auparavant, ils étaient affichés sous la forme de deux symboles distincts, sans guillemets. Pour plus d'informations, voir Consonants(coréen).

Mise à jour de la documentation sur les symboles IBM SPR

La documentation de présentation des symboles IBM SPR a été mise à jour pour clarifier l'utilisation des symboles multi-caractères. Pour plus d'informations, voir Symboles de son vocaux).

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

29 mars 2023 (version 4.6.4)

La version 4.6.4 est maintenant disponible
Text to Speech pour IBM Cloud Pak for Data version 4.6.4 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.10 et 4.12. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data
Important: Sauvegardez vos données avant d'effectuer une mise à niveau vers la version 4.6.3 ou 4.6.4
Important: Avant d'effectuer une mise à niveau vers Watson Speech services version 4.6.3 ou 4.6.4, vous devez effectuer une sauvegarde de vos données. Conservez la sauvegarde dans un emplacement sûr. Pour plus d'informations sur la sauvegarde de vos données de services vocaux Watson, voir Sauvegarde et restauration des données de services vocaux Watson Speech dans Administration des services vocaux Watson. Cette rubrique inclut également des informations sur la restauration de vos données si nécessaire.
Correction de l'incident: vous pouvez désormais modifier les modèles et les voix installés à l'aide des options d'installation avancées
Correctif d'incident: Lors de l'installation, vous pouvez désormais spécifier des modèles ou des voix différents avec les options d'installation avancées de l'interface de ligne de commande. Auparavant, le service installait toujours les modèles et les voix par défaut. La limitation continue de s'appliquer à Watson Speech services versions 4.6.0, 4.6.2et 4.6.3. Pour plus d'informations sur l'installation de modèles et de voix, voir Spécification d'options d'installation supplémentaires dans Installation des services Watson Speech.
Définition des délais d'attente de l'équilibreur de charge
Les services Watson Speech requièrent que vous modifiez les paramètres de délai d'attente de l'équilibreur de charge pour le serveur et le client à 300 secondes. Ces paramètres garantissent que les demandes de reconnaissance vocale à exécution longue, celles dont l'audio est long ou difficile, ont suffisamment de temps pour se terminer. Pour plus d'informations, voir Informations dont vous avez besoin pour effectuer cette tâche dans Installation des services vocaux Watson.
Mise à jour de la documentation sur les symboles IBM SPR
La documentation de présentation des symboles IBM SPR a été mise à jour pour clarifier l'utilisation des symboles multi-caractères. Pour plus d'informations, voir Speech sound symboles.
Vulnérabilités de sécurité résolues
Les vulnérabilités de sécurité suivantes ont été corrigées:

23 février 2023 (version 4.6.3)

La version 4.6.3 est maintenant disponible

Text to Speech pour IBM Cloud Pak for Data version 4.6.3 est maintenant disponible. Cette version prend en charge la version IBM Cloud Pak for Data 4.6.x et la version Red Hat OpenShift 4.10. Red Hat OpenShift version 4.8 n'est plus pris en charge. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Problème connu: vous ne pouvez pas modifier les modèles et les voix installés avec les options d'installation avancées

Problème connu: Vous ne pouvez actuellement pas spécifier de modèles ou de voix différents avec les options d'installation avancées. Le service installe toujours les modèles et les voix par défaut. Pour plus d'informations sur la modification des modèles après l'installation, voir Mise à jour des modèles et des voix pour vos Watson Speech dans la rubrique Administration des services vocaux Watson sur IBM Cloud Pak for Data.

Problème connu: la mise à niveau vers la version 4.6.3 peut échouer

Problème connu: Lors de la mise à niveau vers la version 4.6.3, le travail de sauvegarde MinIO peut ne pas être supprimé une fois terminé. Si cela se produit, la solution consiste à supprimer le travail, après quoi la mise à niveau se poursuit normalement. Procédez comme suit pour résoudre le problème.

  1. Pour déterminer si le travail de sauvegarde MinIO reste non supprimé, exécutez la commande suivante:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    Le travail MinIO qui n'est pas supprimé est identifié par une entrée de la forme suivante:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Pour supprimer le travail de sauvegarde MinIO, exécutez la commande suivante:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Une fois le travail de sauvegarde supprimé, la mise à niveau se poursuit et se termine.

Informations supplémentaires sur l'utilisation des instances de service

La documentation inclut désormais des informations sur la création d'une instance de service à l'aide de l'interface de ligne de commande (cpl-cli) et sur la gestion des instances de service. Pour plus d'informations, voir les rubriques suivantes des services vocaux Watson sur IBM Cloud Pak for Data:

  • Création d'une instance de services vocaux Watson sous Configuration post-installation
  • Gestion de vos instances de services vocaux Watson sous Administration
Correction de l'incident: la version bêta de Tune by Example est désormais disponible

Correction d'un défaut : La fonctionnalité beta Tune by example est maintenant disponible pour Text to Speech pour IBM Cloud Pak for Data. Auparavant, il n'était pas possible de créer des modèles de haut-parleurs.

Correction de l'incident: la spécification de grands nombres cardinaux avec l'élément <say-as> ne provoque plus d'erreurs pour les voix anglaises

Correctif de défaut: vous pouvez désormais utiliser l'élément <say-as> pour prononcer des nombres élevés en tant que nombres cardinaux. Auparavant, l'inclusion d'un grand nombre dans l'élément <say-as> avec l'attribut interpret-as="cardinal" pouvait entraîner l'échec de la synthèse vocale pour les voix anglaises. Par exemple, <say-as interpret-as="cardinal">3,200</say-as> peut entraîner la génération d'une erreur par le service. Pour plus d'informations, voir cardinal dans la rubrique Eléments SSML.

Correction des défauts: les homonymes et autres mots sont maintenant prononcés correctement par les voix anglaises

Correctif d'incident: Le service prononce désormais correctement les homonymes et les autres mots en fonction de leur contexte dans le texte en anglais à synthétiser. Auparavant, des mots tels que advocate et wifi pouvaient être prononcés de manière incorrecte par des voix anglaises.

Vulnérabilité de sécurité résolue

La vulnérabilité de sécurité suivante a été corrigée:

30 janvier 2023 (version 4.6.2)

La version 4.6.2 est maintenant disponible

Text to Speech pour IBM Cloud Pak for Data version 4.6.2 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

La ressource personnalisée inclut désormais une nouvelle propriété fileStorageClass

La ressource personnalisée pour les services vocaux Watson inclut désormais une propriété fileStorageClass en plus de la propriété blockStorageClass existante. Vous spécifiez des classes de stockage par blocs et de fichiers lorsque vous installez ou mettez à niveau un service. Lors d'une mise à niveau à partir d'une version précédente, la nouvelle propriété est ajoutée automatiquement à la ressource personnalisée par l'option --file_storage_class de la commande cli manage apply-cr.

Pour plus d'informations sur les classes de stockage par blocs et de fichiers disponibles que vous utilisez avec chacune des solutions de stockage prises en charge, voir le tableau Exigences de stockage sous Informations nécessaires à l'exécution de cette tâche sur la page "Installation des services Watson Speech" dans Watson Services vocaux sur IBM Cloud Pak for Data.

Informations supplémentaires sur la mise à disposition d'une instance de service

La documentation inclut désormais des informations sur la création d'une instance de service à l'aide d'un programme. Il inclut également des exemples d'affichage de la liste des instances de service et de suppression d'une instance de service. Pour plus d'informations, voir Création d'une instance de services vocaux Watson dans la documentation Post-installation setup dans les services vocaux Watson sur IBM Cloud Pak for Data.

Le chiffrement côté serveur est activé pour le magasin de données MinIO

Les services vocaux ont désormais activé le chiffrement côté serveur pour le stockage d'objets dans le magasin de données MinIO. Aucune action n'est requise de votre part.

Modification des webhooks d'audit

Les services vocaux ont maintenant supprimé la dépendance de webhook d'audit. Les services écrivent désormais des événements d'audit directement sur le serveur. Après la mise à niveau vers la version 4.6.2, certaines ressources de webhook peuvent rester jusqu'à ce que tous les services puissent supprimer la dépendance. Les ressources restantes seront supprimées dans une édition ultérieure. Aucune action n'est requise de votre part.

Nouvelles voix neuronales expressives en anglais américain

Le service offre quatre nouvelles voix neuronales expressives pour l'anglais américain:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont généralement disponibles (GA) pour une utilisation en production. Ils prennent en charge l'utilisation des symboles phonétiques standard International Phonetic Alphabet (IPA) et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

De nouveaux styles de parole avec des voix neuronales expressives

Les voix neuronales expressives déterminent le sentiment du texte à partir du contexte de ses mots et phrases. Le discours qu'ils produisent, en plus d'avoir un style très conversationnel, reflète l'humeur du texte. Mais vous pouvez embellir les tendances naturelles des voix en indiquant que tout ou partie du texte est de mettre l'accent sur l'un des styles de parole suivants:

  • Cheerful-Exprime le bonheur et les bonnes nouvelles.
  • Empathétique-Exprime l'empathie ou la sympathie.
  • Neutre-Exprime l'objectivité et l'équité.
  • Incertain-Exprime la confusion ou l'incertitude.

Pour plus d'informations, voir Utilisation de styles de parole.

Nouvel accent d'interjection avec des voix neuronales expressives

Avec les voix neuronales expressives, le service détecte automatiquement un ensemble d'interjections communes en fonction du contexte. Quand il synthétise ces interjections, il leur donne l'accent naturel qu'un humain utiliserait dans une conversation normale. Pour certaines des interjections, vous pouvez utiliser SSML pour activer ou désactiver leur mise en évidence. Pour plus d'informations, voir Insister sur les interjections.

Nouveau mot emphais avec des voix neuronales expressives

Les voix expressives utilisent un style conversationnel qui applique naturellement l'intonation correcte du contexte. Mais vous pouvez indiquer qu'un ou plusieurs mots doivent être plus ou moins mis en évidence. Le changement de contrainte peut être indiqué par une augmentation ou une diminution du pas, de la temporisation, du volume ou d'autres attributs acoustiques. Pour plus d'informations, voir Insister sur les mots.

Le service applique désormais une validation SSML plus stricte

Le service applique désormais une validation plus stricte du texte d'entrée qui inclut des éléments SSML (Speech Synthesis Markup Language). Les éléments obligatoires des attributs doivent être spécifiés avec des valeurs valides. Sinon, la demande échoue avec un code d'erreur 400. Pour plus d'informations sur la validation SSML et les exigences que le texte marqué doit remplir, voir Validation SSML.

Correction de l'incident: le sexe indiqué pour la voix en-US_MichaelExpressive est désormais correct

Correctif d'incident: Lorsque vous répertoriez des informations sur les voix disponibles, le gender de la voix en-US_MichaelExpressive est désormais male. Auparavant, le genre de la voix était décrit par erreur comme female. Pour plus d'informations, voir Affichage de la liste des informations sur les voix.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

30 novembre 2022 (version 4.6.0)

La version 4.6.0 est maintenant disponible

Text to Speech pour IBM Cloud Pak for Data version 4.6.0 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Amazon Web Services (AWS) est désormais pris en charge

Watson Les services vocaux pour IBM Cloud Pak for Data sont désormais pris en charge sur Amazon Web Services™ (AWS™). Les services prennent en charge Amazon Elastic Block Store, que vous spécifiez en définissant la propriété blockStorageClass de la ressource personnalisée des services vocaux sur gp2-csi ou gp3-csi.

Les nouvelles classes de stockage sont désormais prises en charge

Watson Les services vocaux pour IBM Cloud Pak for Data prennent désormais en charge deux classes de stockage supplémentaires:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Vous spécifiez la classe de stockage avec la propriété blockStorageClass de la ressource personnalisée des services vocaux. Pour plus d'informations sur toutes les classes de stockage prises en charge, voir les rubriques suivantes dans Watson Services vocaux sur IBM Cloud Pak for Data:

  • Avant de commencer dans Installation des services Watson Speech
  • Spécification d'une classe de stockage dans Utilisation de la ressource personnalisée des services vocaux Watson
Problème connu: Certains pods de services vocaux Watson ne comportent pas d'annotations utilisées pour la planification

Problème connu: Certains pods de services vocaux Watson ne comportent pas l'annotation cloudpakInstanceId. Si vous utilisez le service de planification IBM Cloud Pak for Data, tous les pods de services vocaux Watson sans l'annotation cloudpakInstanceId sont

  • Planifié par le planificateur Kubernetes par défaut plutôt que par le service de planification
  • Non inclus dans l'application des quotas
La surveillance du magasin de données PostgreSQL est désormais disponible

Vous pouvez désormais activer la surveillance du magasin de données PostgreSQL pour recevoir des mises à jour sur son utilisation et son statut par les services vocaux Watson. Les événements peuvent être consommés par le logiciel de surveillance Prometheus ou par toute application que vous utilisez pour la surveillance. En activant la surveillance des projets définis par l'utilisateur en plus de la surveillance de la plate-forme par défaut, vous pouvez surveiller vos propres projets à l'aide de la pile de surveillance Red Hat® OpenShift® Container Platform. Cette fonction inclut une propriété supplémentaire, spec.global.datastores.postgressql.enablePodMonitor, dans la ressource personnalisée des services vocaux.

Pour plus d'informations, voir la rubrique Surveillance du magasin de données PostgreSQL pour Watson Services vocaux dans la section Administration de Watson Services vocaux sur IBM Cloud Pak for Data.

Correctif d'incident: le magasin de données PostgreSQL n'est plus installé si seuls les microservices d'exécution sont activés

Correctif d'incident: Le magasin de données PostgreSQL n'est plus installé si seuls les microservices d'exécution sont activés. Le magasin de données est désormais installé uniquement si au moins l'un des microservices sttAsync, sttCustomization ou ttsCustomization est installé. PostgreSQL n'est pas désinstallé si, à une date ultérieure, ces microservices sont désactivés.

Avant la version 4.6.0, PostgreSQL était toujours installé avec les services vocaux. Si vous êtes un client existant qui a utilisé uniquement les microservices d'exécution des services vocaux antérieurs à la version 4.6.0, PostgreSQL reste installé mais n'est pas utilisé. Dans ce cas, l'installation de PostgreSQL est conservée entre les mises à niveau.

Le magasin de données MinIO est toujours installé car les microservices d'exécution en dépendent. Le magasin de données RabbitMQ est installé uniquement si le microservice sttAsync est installé.

Pour plus d'informations, voir Propriétés du magasin de données dans Utilisation de la ressource personnalisée des services vocaux Watson dans les services vocaux Watson sur IBM Cloud Pak for Data.

Correction d'incident: La création d'une règle réseau n'est plus nécessaire pour que l'opérateur PostgreSQL surveille ses opérandes

Correctif d'incident: Pour la version 4.6.0, il n'est pas nécessaire de créer une règle réseau pour permettre à l'opérateur PostgreSQL de surveiller ses opérandes, comme décrit dans la mise à jour du service 10 novembre 2022(versions 4.0.x et 4.5.x). A partir de la version 4.6.0, le service gère cette situation automatiquement.

Nouveau paramètre de requête rate_percentage bêta pour le contrôle du débit de parole global

Le service offre un nouveau paramètre de requête rate_percentage pour modifier le débit de parole d'une demande de synthèse vocale. Le débit de parole est la vitesse à laquelle le service parle le texte qu'il synthétise en parole. Un taux plus élevé permet de parler plus rapidement le texte ; un taux plus faible permet de le faire plus lentement. Le paramètre modifie le débit par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification du débit de parole.

Nouveau paramètre de requête pitch_percentage bêta pour le contrôle de la hauteur de parole globale

Le service offre un nouveau paramètre de requête pitch_percentage pour modifier la hauteur de parole d'une requête de synthèse. La hauteur de parole représente la tonalité de la parole que le service synthétise. Il représente la hauteur ou la hauteur du ton de la voix perçue par l'auditeur. Un ton plus élevé se traduit par une parole qui est parlée à un ton plus élevé et est perçue comme une voix plus élevée ; un ton plus bas se traduit par une parole qui est parlée à un ton plus bas et est perçue comme une voix plus faible. Le paramètre modifie la hauteur par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification de la hauteur de parole.

Correction d'incident: les traductions de mots personnalisées acceptent désormais les virgules dans tous les cas

Correctif d'incident: Les traductions Word ajoutées aux modèles personnalisés acceptent désormais les virgules dans tous les cas. Auparavant, une virgule dans une traduction pouvait parfois entraîner l'échec de la génération d'un audio valide lorsqu'elle était utilisée pour les synthèses vocales. Ce problème a été identifié dans les modèles personnalisés en anglais américain.

Correction des défauts: la synthèse française des dates est désormais cohérente

Correctif de défaut: la synthèse française n'inclut plus l'article "le" avant les dates de la forme "l' ordinal de mois." Auparavant, l'article n'était inclus que pour le premier jour du mois pour le français (par exemple, "le premier septembre", "le premier septembre").

Correction d'incident: la synthèse japonaise est améliorée pour gérer les longues chaînes de texte d'entrée

Correctif d'incident: Le service synthétise désormais correctement les demandes japonaises qui incluent de longues chaînes de caractères. Auparavant, le service ne synthétisait pas correctement de très longues chaînes de texte japonais.

Correctif d'incident: Ajoutez des règles pour la documentation de dénomination de modèle personnalisé

Correctif d'incident: La documentation fournit désormais des règles détaillées pour l'attribution de noms aux modèles personnalisés. Pour plus d'informations, voir :

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

10 novembre 2022 (versions 4.0.x et 4.5.x)

Problème connu: mise à jour de la règle réseau requise pour l'opérateur PostgreSQL

Problème connu: Pour les services vocaux version 4.0.x (à l'exclusion de la version 4.0.0) et 4.5.x, si l'opérateur PostgreSQL et les services vocaux sont installés dans des espaces de nom différents, l'opérateur PostgreSQL ne peut pas surveiller les opérandes PostgreSQL pour les services vocaux. L'opérateur ne peut pas surveiller les opérandes par la règle réseau en vigueur pour les services vocaux.

Ce problème n'empêche pas le cluster PostgreSQL de fonctionner correctement. Le cluster reste actif et entièrement fonctionnel. Toutefois, l'opérateur ne peut pas mettre à jour les opérandes lors de la mise à niveau vers de nouvelles versions des services vocaux.

La solution à ce problème consiste à créer une règle réseau supplémentaire pour l'opérateur PostgreSQL, comme indiqué dans les étapes suivantes. Vous pouvez effectuer les étapes indépendamment du fait que l'opérateur PostgreSQL soit installé dans le même espace de nom que les services vocaux ou dans un autre espace de nom.

  1. Connectez-vous en tant qu'administrateur du projet Red Hat® OpenShift® dans lequel les services vocaux sont installés.

  2. Entrez la commande suivante pour mettre à jour la règle réseau pour les services vocaux:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    • <custom-resource-name> est le nom de la ressource personnalisée des services vocaux. Le nom recommandé pour la version 4.0.x est speech-prod-cr; le nom recommandé pour la version 4.5.x est speech-cr.
    • <cpd-instance-name> est le nom du projet (espace de noms) dans lequel les services Speech sont installés. La documentation utilise la variable d'environnement ${PROJECT_CPD_INSTANCE} pour identifier l'espace de nom.
  3. Pour vérifier que la règle réseau mise à jour permet à l'opérateur de surveiller les opérandes et que le cluster PostgreSQL est dans un état sain, entrez la commande suivante, où <custom-resource-name> et <cpd-instance-name> sont les valeurs que vous avez utilisées à l'étape précédente:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Si le cluster PostgreSQL fonctionne correctement, la commande génère une sortie similaire à la suivante:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Ces étapes n'entraînent pas la mise à jour des opérandes par l'opérateur vers les versions les plus récentes. Toutefois, les opérandes sont mis à niveau comme prévu lors de la prochaine mise à niveau du logiciel de services vocaux.

13 octobre 2022 (version 4.5.3)

La version 4.5.3 est maintenant disponible

Text to Speech pour IBM Cloud Pak for Data version 4.5.3 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Les événements d'audit sont disponibles pour les services vocaux

Le service de journalisation d'audit IBM Cloud Pak for Data génère et transmet des événements d'audit pour les services Speech to Text et Text to Speech. Les événements d'audit correspondent à ceux disponibles pour Activity Tracker avec le service public. Pour plus d'informations, voir Evénements d'audit.

Vous ne pouvez pas désinstaller des composants de service Speech individuels

La documentation indique désormais que vous ne pouvez pas désinstaller des composants de service individuels (microservices) une fois qu'ils sont installés. Pour supprimer l'un des composants suivants, vous devez désinstaller les services Watson Speech dans leur intégralité et réinstaller uniquement les composants dont vous avez besoin : Speech to Text runtime, Speech to Text asynchronous HTTP, Speech to Text customization, Text to Speech runtime, et Text to Speech customization. Pour plus d'informations sur l'installation des services Speech, voir Watson Les services Speech sur IBM Cloud Pak for Data.

Nouveau paramètre spell_out_mode bêta pour les voix allemandes

Pour indiquer comment les caractères individuels d'une chaîne doivent être orthographiés, vous pouvez désormais inclure le paramètre de requête spell_out_mode bêta avec une demande de synthèse pour une voix allemande. Par défaut, le service affiche des caractères individuels au même rythme qu'il synthétise du texte pour une langue. Vous pouvez utiliser ce paramètre pour demander au service d'épeler les caractères individuels plus lentement, par groupes de un, deux ou trois caractères. Utilisez le paramètre avec l'élément SSML <say-as> pour contrôler la façon dont les caractères d'une chaîne sont synthétisés. Pour plus d'informations, voir Spécification de la manière dont les chaînes sont définies.

Limitation connue liée à l'utilisation du format audio Ogg avec le navigateur Safari

Par défaut, le service renvoie des données audio au format Ogg avec le codec Opus (audio/ogg;codecs=opus). Toutefois, le format audio Ogg n'est pas pris en charge avec le navigateur Safari. Si vous utilisez le service Text to Speech avec le navigateur Safari, vous devez spécifier un format différent dans lequel le service doit renvoyer les données audio.

Traitement des incidents liés à la mise à niveau de la version 4.0.x vers la version 4.5.x

Lorsque vous mettez à niveau les services vocaux de la version 4.0.x vers la version 4.5.x, vous pouvez rencontrer un problème où les pods PostgreSQL sont bloqués à l'état Terminating. Si ce problème se produit lors de la mise à niveau, procédez comme suit pour le résoudre. Les informations et les étapes sont également documentées dans la rubrique Mise à niveau des services vocaux Watson de la version 4.0 à la version 4.5 de la rubrique Mise à niveau des services vocaux Watson sur IBM Cloud Pak for Data.

  1. Utilisez la commande suivante pour identifier les pods qui restent à l'état Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Utilisez la commande suivante pour définir la variable d'environnement pods afin d'inclure la liste des pods qui restent à l'état Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
  1. Utilisez la commande suivante pour supprimer les pods bloqués afin que le processus de mise à niveau puisse continuer:
oc delete pod $pods -n ${PROJECT_CPD_INSTANCE} --force=true --grace-period=0
Mise à jour de la documentation pour l'élément SSML <prosody>

La documentation de l'élément SSML <prosody> et de ses paramètres pitch et rate a été améliorée et clarifiée. Il inclut également une description des différences entre le service et la dernière version de la spécification SSML. Pour plus d'informations, voir L'élément <prosody>.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

3 août 2022 (version 4.5.1)

La version 4.5.1 est maintenant disponible
Text to Speech pour IBM Cloud Pak for Data version 4.5.1 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data
Prise en charge des clusters compatibles FIPS
Text to Speech pour IBM Cloud Pak for Data et Speech to Text pour IBM Cloud Pak for Data prennent désormais en charge l'exécution sur des clusters compatibles FIPS (Federal Information Processing Standard). Pour plus d'informations, voir Services prenant en charge FIPS.
Correction d'incident: correction des calculs de stockage éphémère pour éviter les expulsions occasionnelles de pod
Correctif d'incident: Un incident a été corrigé et le calcul des limites de stockage éphémères est désormais plus précis pour les environnements d'exécution Text to Speech pour IBM Cloud Pak for Data et Speech to Text pour IBM Cloud Pak for Data. Ces modifications empêchent les expulsions de pod occasionnelles lorsque les environnements d'exécution des services sont soumis à une charge importante.
Le service ne prend pas en charge la synthèse vocale multilingue
Le service ne prend pas en charge la synthèse vocale multilingue pour le moment. Cependant, vous pouvez utiliser la personnalisation pour approximer la prononciation des mots d'autres langues. Pour plus d'informations, voir Synthèse vocale multilingue.
Vulnérabilités de sécurité résolues
Les vulnérabilités de sécurité suivantes ont été corrigées:

29 juin 2022 (version 4.5.0)

La version 4.5.0 est maintenant disponible
Text to Speech pour IBM Cloud Pak for Data version 4.5.0 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data
Services Unified Speech pour la documentation IBM Cloud Pak for Data
La documentation d'installation et d'administration pour Speech to Text et Text to Speech est désormais combinée dans la documentation IBM Cloud Pak for Data. Pour plus d'informations sur l'installation et la gestion des services vocaux, voir Watson Services vocaux sur IBM Cloud Pak for Data.
Modifications apportées à la ressource personnalisée des services vocaux
La ressource personnalisée est maintenant créée lorsque vous installez initialement les services vocaux. Le processus est décrit dans la documentation d'installation de IBM Cloud Pak for Data. Le contenu de la ressource personnalisée a changé:
  • Le nom recommandé de la ressource personnalisée est passé de speech-prod-cr à speech-cr.
  • Toutes les références à la classe de stockage ont changé de variantes de storageClass à blockStorageClass.
  • Le nom de la classe de stockage par blocs Portworx est passé de portworx-shared-gp3 à portworx-db-gp3-sc.
  • La propriété createSecret a été supprimée pour les magasins de données MinIO et PostgreSQl. La propriété est utilisée uniquement en interne. Les services vocaux utilisent toujours un objet secrets si vous en créez un, et ils créent toujours automatiquement l'objet si aucun n'est fourni.
L'objet secret fourni par l'utilisateur est désormais pris en charge pour le magasin de données RabbitMQ
Vous pouvez désormais fournir des données d'identification de sécurité pour le magasin de données RabbitMQ, tout comme vous pouvez le faire pour les magasins de données MinIO et PostgreSQL. Le processus documenté est similaire pour les trois magasins de données.
Correction de défaut: Plusieurs balises SSML <phoneme> consécutives sont maintenant analysées correctement
Correction de défaut: Le service synthétise désormais correctement le texte contenant des balises <phoneme> consécutives. Auparavant, si le texte contenait deux balises <phoneme> consécutives ou plus, le service n'a synthétisé que la première balise, en ignorant les autres.
Vulnérabilités de sécurité résolues
Aucune vulnérabilité de sécurité n'a été corrigée pour la version 4.5.0.

25 mai 2022 (version 4.0.9)

La version 4.0.9 est désormais disponible
Text to Speech for IBM Cloud Pak for Data version 4.0.9 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.
Nouvelle prise en charge du format audio audio/alaw
La liste des formats audio pris en charge inclut maintenant audio/alaw;rate={rate}. Comme audio/basic et audio/mulaw, ce format fournit un audio à canal unique codé en utilisant des données u-law (ou mu-law) de 8 bits qui sont échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio.
Les services de parole ne prennent pas en charge l'utilitaire de sauvegarde et de restauration OADP
Les services de parole Watson prennent pas en charge l'utilitaire de sauvegarde et de restauration de IBM Cloud Pak for Data OpenShift API pour la protection des données (OADP). Si les services de parole sont installés sur un cluster, il se peut que vous ne soyez pas en mesure d'utiliser l'utilitaire de sauvegarde et de restauration IBM Cloud Pak for Data OADP pour sauvegarder d'autres services installés sur ce cluster. Cette limitation s'applique à la version 4.0.0 et aux versions ultérieures des services de parole.
Vulnérabilités de sécurité résolues
Les vulnérabilités de sécurité suivantes ont été corrigées:

1 mai 2022 (Version 1.2.x)

Important: Fin de service pour Text to Speech version 1.2.x sur IBM Cloud Pak for Data version 3.5
Important: Text to Speech version 1.2.x on IBM Cloud Pak for Data version 3.5 est hors service depuis le 1 mai 2022. Text to Speech version 1.2.x n'est plus pris en charge, disponible ni documenté. Pour plus d'informations sur la fin de service pour Text to Speech, qui fait partie du kit d'API Watson , voir Projet de suppression de support logiciel: IBM Watson Kit API pour IBM Cloud Pak for Data 1.2.x.

27 avril 2022 (version 4.0.8)

La version 4.0.8 est désormais disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.8 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Nouvelles variables d'environnement utilisées dans la documentation IBM Cloud Pak for Data

La plupart des commandes de la documentation Text to Speech for IBM Cloud Pak for Data ont été mises à jour pour utiliser un ensemble commun de variables d'environnement. La documentation fournit un script permettant d'exporter automatiquement les variables d'environnement exécution des commandes d'installation, de mise à niveau et d'administration. Une fois le sourcing du script effectué, vous pouvez copier la plupart des commandes à partir de la documentation et les exécuter sans apporter de modifications.

Les variables d'environnement définies par le script sont les suivantes:

  • ${PROJECT_CPD_INSTANCE} identifie le projet dans lequel vous prévoyez d'installer IBM Cloud Pak for Data et les services de parole.
  • ${PROJECT_CPD_OPS} identifie le projet pour l'opérateur de plateforme IBM Cloud Pak for Data .
  • ${PROJECT_CPFS_OPS} identifie le projet pour les services de base IBM Cloud Pak for Data .

Pour plus d'informations sur l'utilisation des variables d'environnement, voir Best practice: Setting up install variables.

La propriété ttsVoiceMarginalCPU n'est plus documentée

La propriété ttsVoiceMarginalCPU a été supprimée de la documentation de la ressource personnalisée services de parole. La propriété gère le compromis entre l'accès concurrent et la vitesse de synthèse vocale. La valeur par défaut de 400 garantit un équilibre raisonnable pour la plupart des clients et gère la synthèse en temps réel.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

30 mars 2022 (version 4.0.7)

La version 4.0.7 est désormais disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.7 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Propriété de ressource personnalisée pour la spécification d'une voix par défaut

La voix par défaut pour les demandes de synthèse vocale et de prononciation est en-US_MichaelV3Voice. Si vous n'installez pas en-US_MichaelV3Voice, vous devez :

  • Utiliser le paramètre voice pour transmettre la voix à utiliser avec chaque demande.
  • Indiquer une nouvelle voix par défaut pour votre installation de Text to Speech for IBM Cloud Pak for Data à l'aide de la propriété defaultTTSVoice de la ressource personnalisée des services de parole. Pour plus d'informations, voir Installation de Watson Text to Speech et Utilisation de la voix par défaut.
Modification de la réponse de minutage des mots pour l'interface WebSocket

L'objet de réponse que le service envoie lorsque vous demandez des minutages de mots avec l'interface WebSocket a changé. Le service envoie maintenant les résultats du minutage des mots dans un tableau unique qui comprend une chaîne de caractères suivie de deux valeurs en virgule flottante :

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Le service a déjà envoyé les résultats du minutage sous la forme d'un tableau contenant une chaîne de caractères suivi d'un tableau de deux valeurs en virgule flottante :

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

De plus, le niveau de précision des minutages des mots et des marques est maintenant réduit à trois décimales. Pour plus d'informations sur les nouvelles réponses, voir Génération de minutages de mots.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

23 février 2022 (version 4.0.6)

La version 4.0.6 est maintenant disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.6 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Toutes les voix neuronales sont désormais obsolètes pour IBM Cloud Pak for Data

Les voix neuronales disponibles avec Text to Speech pour IBM Cloud Pak for Data sont désormais obsolètes. Les voix neuronales continuent d'être disponibles pour les utilisateurs de Text to Speech for IBM Cloud. Seules les voix neuronales améliorées continuent d'être disponibles pour les utilisateurs de Text to Speech for IBM Cloud Pak for Data.

Toutes les voix des langues suivantes sont désormais obsolètes pour IBM Cloud Pak for Data:

  • Arabe
  • Chinois (mandarin)
  • Tchèque
  • Néerlandais (belge)
  • Néerlandais (Pays-Bas)
  • Anglais (australien)
  • Coréen
  • Suédois

Les utilisateurs actuels de ces voix peuvent continuer à les utiliser pour l'instant, mais les voix seront entièrement supprimées dans une version ultérieure. Ces voix ne peuvent plus être installées par de nouveaux utilisateurs et ont été supprimées de la documentation d'installation pour IBM Cloud Pak for Data. La propriété voiceType a été supprimée de la ressource personnalisée des services Speech.

Pour plus d'informations, voir :

Mises à jour des scripts d'importation/exportation

Les scripts import_export.sh et transfer_ownership.sh ont été mis à jour. Ces scripts permettent d'importer et d'exporter des données entre les clusters, de sauvegarder et de restaurer des données et de migrer des données de la version 3.5 vers la version 4.0.x. Les scripts ont été modifiés et améliorés comme suit :

  • Le script transfer_ownership.sh nécessite désormais l'inclusion d'une option -c sur la ligne de commande avant l'argument <custom_resource_name>.
  • Le script transfer_ownership.sh requiert désormais une option et un argument -v <version> pour indiquer la version à laquelle la propriété des ressources est transférée. Indiquez 35 pour la version 3.5 ou 40 pour la version 4.0.x.
  • Le script transfer_ownership.sh nécessite désormais l'inclusion d'une option -p sur la ligne de commande avant l'argument <postgres_auth_secret_name>.
  • L'argument <postgres_auth_secret_name> fournit le secret de Kubernetes utilisé pour l'authentification dans le magasin de données PostgreSQL auquel vous transférez la propriété. Vous pouvez omettre le secret d'authentification s'il est identique à la valeur par défaut (<custom-resource-name>-postgres-auth-secret pour la version 4.0.x, user-provided-postgressql pour la version 3.5). Vous devez indiquer le secret s'il est différent de la valeur par défaut.
  • Les deux scripts incluent maintenant une option -h (--help) pour afficher des informations sur le script et son utilisation.

Pour plus d'informations, voir :

Recommandation mise à jour pour OpenShift Container Storage

Depuis la version 4.0.6 des services Speech, la classe de stockage recommandée pour OpenShift Container Storage est ocs-storagecluster-ceph-rbd.

  • Si vous installez les services Speech 4.0.6 ou la mise à niveau vers les services Speech 4.0.6 à partir d'IBM Cloud Pak for Data version 3.5, indiquez la classe de stockage ocs-storagecluster-ceph-rbd lors de l'installation ou de la mise à niveau.
  • Si vous effectuez une mise à niveau vers les services Speech 4.0.6 à partir d'une régénération précédente d'Cloud Pak for Data version 4.0, continuez à utiliser ocs-storagecluster-cephfs. Vous ne pouvez pas modifier le stockage utilisé dans un déploiement existant.

La valeur est spécifiée avec la propriété storageClass dans la ressource personnalisée des services Speech :

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

Les services Speech fonctionnent avec l'une ou l'autre version de OpenShift Container Storage. La nouvelle version recommandée dispose d'autorisations d'accès plus restrictives. Pour plus d'informations, voir :

31 janvier 2022 (version 4.0.5)

La version 4.0.5 a été mise à jour

Text to Speech for IBM Cloud Pak for Data version 4.0.5 a été mis à jour pour traiter les problèmes d'installation. La version du package de cas est à présent 4.0.6. Utilisez ce package à la place de la version 4.0.5. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Important : les étapes supplémentaires pour l'installation en miroir ne sont plus nécessaires

Important : la note sur l'édition du 26 janvier 2022 inclut des notes importantes pour les étapes suivantes :

  • Étape supplémentaire pour effectuer une installation en miroir du magasin de données Minio
  • Étapes supplémentaires pour l'installation en miroir de nouveaux modèles de nouvelle génération

Ces étapes supplémentaires ne sont plus nécessaires. Le package de cas a été mis à jour pour corriger les problèmes d'installation.

26 janvier 2022 (version 4.0.5)

La version 4.0.5 est maintenant disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.5 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Important : étape supplémentaire pour effectuer une installation en miroir du magasin de données Minio

Important : ces étapes ne sont plus nécessaires si vous installez le package de cas 4.0.6. Pour plus d'informations, voir le 31 janvier 2022(version 4.0.5).

Si vous effectuez une installation en miroir (par exemple, dans un environnement isolé), vous devez effectuer une étape supplémentaire Avant en effectuant l'une des opérations suivantes :

Cette étape est obligatoire pour copier les images nécessaires pour le magasin de données Minio :

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

L'échec de cette étape entraîne des erreurs d'installation pour Text to Speech et Speech to Text.

Le serveur de licences est désormais installé automatiquement

L'opérateur des services Speech installe automatiquement le serveur de licences requis lorsqu'il installe les services Speech. Vous n'avez plus besoin d'installer le serveur de licences à partir des services de base IBM Cloud Pak for Data, ni d'utiliser du contenu YAML supplémentaire pour créer une OperandRequest avec les liaisons nécessaires.

Suppression des étapes spécifiques au serveur PostgreSQL EnterpriseDB

La version précédente de la documentation incluait des étapes pour le serveur PostgreSQL EnterpriseDB qui étaient spécifiques aux services Speech Ces étapes ont été documentées dans les rubriques Mise à niveau d' Watson Text to Speech (version 4.0) et Désinstallation de Watson Text to Speech. Ces étapes supplémentaires ne sont plus nécessaires et ont été supprimées de la documentation.

Le magasin de données RabbitMQ est désormais utilisé uniquement par le composant sttAysnc

Le magasin de données RabbitMQ était précédemment utilisé par les composants des services Speech, Speech to Text et Text to Speech. Il gère maintenant la mise en file d'attente des messages non persistants pour le composant HTTP asynchrone Speech to Text (sttAsync) uniquement. Il n'est utilisé que si le composant sttAsync est installé et activé.

Nouvelles voix de neuronales belges et tchèques

Deux nouvelles voix neuronales sont maintenant disponibles :

  • Néerlandais belge : nouvelle voix masculine belge (flamande), nl-BE_BramVoice.
  • Tchèque : nouvelle langue, tchèque, avec une nouvelle voix féminine, cs-CZ_AlenaVoice.

Vous pouvez installer les nouvelles voix ainsi que toutes les voix neuronales en affectant à la propriété voiceType de la ressource personnalisée la valeur neuralVoices.

Correctif d'incident: Mise à jour de la documentation SSML

Correction d'un défaut : La documentation SSML a été mise à jour pour corriger les erreurs suivantes :

  • Les exemples de l'élément <break> sont maintenant corrects. L'élément n'est pas unaire, comme indiqué dans les exemples. Les exemples précédents comprenaient des balises ouvertes et fermées avec du texte incorporé. Le texte intégré n'était pas énoncé par le service. Pour plus d'informations, voir Élément <break>.
  • Le service prend en charge le langage SSML (Speech Synthesis Markup Language) version 1.1. Tous les références et exemples utilisent maintenant la version correcte. La documentation faisait référence précédemment à la version 1.0.
Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes associées à Apache Log4j ont été corrigées:

20 décembre 2021 (version 4.0.4)

La version 4.0.4 est maintenant disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.4 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Important : modifications des propriétés pour la désactivation du stockage et la consignation des données utilisateur

Important : les noms des propriétés de la ressource personnalisée des services Speech qui indiquent si les données utilisateur sont stockées et consignées ont été modifiées. La ressource personnalisée contenait auparavant les propriétés suivantes :

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Ces propriétés sont désormais nommées comme suit :

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Si vous avez déjà défini ces propriétés dans votre ressource personnalisée pour remplacer la valeur par défaut false par true, vous devez modifier votre ressource personnalisée. Vous devez remplacer manuellement les noms des propriétés par les nouvelles valeurs et sauvegarder la ressource personnalisée mise à jour. Pour plus d'informations, voir Installation de Watson Text to Speech.

Important : modifications apportées aux propriétés de l'objet secret PostgreSQL

Important : lorsque vous installez les services Speech, un objet contenant un mot de passe généré de manière aléatoire pour le magasin de données PostgreSQL est créé par défaut. Vous pouvez choisir de spécifier le mot de passe manuellement. Si vous le faites, les propriétés du fichier YAML de l'objet secret ont changé. Pour plus d'informations, voir la rubrique relative à la gestion de vos magasins de données dans Administration de Watson Text to Speech.

Important : les pods PostgreSQL ne démarrent pas avec l'opérateur EnterpriseDB version 1.10

Important : avec Text to Speech for IBM Cloud Pak for Data version 4.0.3, les pods PostgreSQL basés sur l'opérateur EnterpriseDB version 1.10 peuvent ne pas démarrer. Cela empêche le lancement des services Speech. Une solution palliative existe pour ce problème. Si vos services Speech ne démarrent pas, consultez PostgreSQL pods do not start with EnterpriseDB version 1.10 operator pour obtenir des informations sur le diagnostic et la résolution du problème.

Ce problème est résolu dans Text to Speech for IBM Cloud Pak for Data version 4.0.4.

Nouveau support de la classe de stockage Native Container IBM Spectrum Scale

Depuis la version 4.0.3, les services Speech prennent en charge la classe de stockage IBM Spectrum® Scale Container Native Pour utiliser IBM Spectrum Scale, indiquez "ibm-spectrum-scale-sc" pour la propriété storageClass de la ressource personnalisée des services Speech. Pour plus d'informations, voir Installation de Watson Text to Speech.

Interaction des services Speech avec le magasin de données MinIO lors de l'installation

Les composants d'exécution des services Speech, sttRuntime et ttsRuntime, ne peuvent pas démarrer tant que les modèles et les voix des services ne sont pas entièrement téléchargés dans le magasin de données MinIO. Lors de l'installation, les services risquent d'échouer et de redémarrer automatiquement une ou plusieurs fois jusqu'à ce que le téléchargement des modèles et des voix soit terminé. Ensuite, ils démarrent correctement. Aucune action de l'utilisateur n'est requise.

Correction d'un défaut : Amélioration de la documentation relative à la mise à niveau

**Correctif : ** la documentation de la mise à niveau des services Speech vers les nouvelles versions de IBM Cloud Pak for Data version 4.0.x inclut des références incorrectes dans certaines commandes. Ces références sont maintenant correctes :

  • Les chaînes watsonSpeechToTextStatus et watsonTextToSpeechStatus ont été remplacées par speechStatus dans les deux cas.
  • Les chaînes status.watsonSpeechToTextVersion et status.watsonTextToSpeechVersion ont été remplacées par .spec.version dans les deux cas.

Pour plus d'informations, voir Mise à niveau de Watson Text to Speech.

Correction des défauts: Amélioration de la synthèse vocale et SSML

Correction des défauts : Les défauts suivants concernant le langage de balisage de la synthèse vocale (SSML) et la synthèse vocale ont été corrigés avec cette version :

  • L'attribut pitch de l'élément <prosody> est maintenant appliqué à tous les textes spécifiés. Auparavant, le changement de pas n'était pas toujours appliqué au premier mot du texte affecté. De plus, la documentation contient maintenant des instructions supplémentaires sur la spécification d'une valeur pitch. Pour plus d'informations, voir L'attribut pitch.
  • La synthèse vocale du texte japonais parle maintenant plus lentement. Auparavant, la voix synthétisée était trop rapide. Si vous trouvez que la synthèse du texte japonais est encore trop rapide pour votre application, utilisez l'attribut rate de l'élément SSML <prosody> pour contrôler le débit de la voix. Pour plus d'informations, voir L'attribut rate.
  • Les voix neuronales analysent désormais correctement l'apostrophe (&apos;). Auparavant, certaines voix neuronales n'interprétaient pas correctement le caractère.
Vulnérabilité de sécurité résolue

La vulnérabilité de sécurité suivante associée à Apache Log4j a été corrigée:

20 décembre 2021 (Version 1.2.x)

Important : vous ne pouvez plus installer Text to Speech version 1.2.x sur IBM Cloud Pak for Data version 3.5

Important : vous n'effectuez plus de nouvelles installations de Text to Speech version 1.2.x sur IBM Cloud Pak for Data version 3.5. Vous pouvez installer uniquement Text to Speech version 4.0.x sur IBM Cloud Pak for Data version 4.x. Pour plus d'informations, voir Installation de Watson Text to Speech.

Les services Speech pour IBM Cloud Pak for Data version 3.5 atteignent leur date de fin de support le 30 avril 2022. Vous êtes invité à effectuer une mise à niveau vers la version la plus récente de la version 4.0.x des services à votre convenance. Pour plus d'informations, voir Mise à niveau de Watson Text to Speech.

30 novembre 2021 (version 4.0.3)

La version 4.0.3 est maintenant disponible

Text to Speech for IBM Cloud Pak for Data version 4.0.3 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Text to Speech.

Le serveur de licences est désormais un prérequis obligatoire

Vous devez à présent installer le serveur de licences à partir des services de base IBM Cloud Pak for Data . Vous devez installer le serveur de licences en utilisant le contenu YAML fourni pour créer une OperandRequest avec les liaisons nécessaires. Vous devez également installer le service de licence dans le même espace de nom que le service (opérande), qui est également l'emplacement où IBM Cloud Pak for Data est installé. Pour plus d'informations, voir Installation de Watson Text to Speech.

Nouvelle prise en charge de la mise à niveau en place

Le service prend désormais en charge la mise à niveau en place, basée sur l'opérateur, de la version 4.0.0 à la version 4.0.3. Le passage de IBM Cloud Pak for Data version 3.5 à la version 4.0.3 nécessite toujours l'utilisation des utilitaires de migration. Pour plus d'informations, voir Mise à niveau de Watson Text to Speech.

Modifications de l'installation de l'opérateur EDB PostgreSQL et de la licence

L'installation, la mise à niveau et la désinstallation de l'opérateur PostgreSQL Enterprise DB et de la licence ont changé :

  • Les instructions d'installation de l'opérateur et de la licence EDB PostgreSQL sont désormais incluses avec les services de base IBM Cloud Pak for Data. Les instructions d'installation des services Speech ont été mises à jour en conséquence. Pour plus d'informations, voir Installation de Watson Text to Speech.
  • Les instructions de mise à niveau de Text to Speech version 4.0.0 à 4.0.3 incluent des instructions de désinstallation de l'opérateur et de la licence EDB PostgreSQL précédents et de leur réinstallation avec les services de base IBM Cloud Pak for Data. Pour plus d'informations, voir Mise à niveau de Watson Text to Speech.
  • Les instructions de désinstallation des services Speech incluent maintenant les étapes permettant de supprimer l'opérateur EDB PostgreSQL et la licence précédemment installés avec Text to Speech. Pour plus d'informations, voir Désinstallation de Watson Text to Speech.
Nouvelles instructions pour la mise à l'échelle de votre installation

Le service fournit maintenant des conseils à jour sur la mise à l'échelle de votre installation. Les informations incluent la spécification du nombre de pods et le nombre maximal de sessions simultanées pour les voix neuronales ou neuronales améliorées. Pour plus d'informations, voir Administration de Watson Text to Speech.

Mises à jour de ligne de commande pour les utilitaires d'importation et d'exportation

Les commandes utilisées avec les utilitaires d'importation et d'exportation pour les services Speech incluent de nouveaux options et arguments. Les utilitaires d'importation et d'exportation constituent également la base de la sauvegarde et de la restauration des services et de la migration de IBM Cloud Pak for Data version 3.5 vers la version 4.0.3. Pour plus d'informations sur l'utilisation des utilitaires, voir

Nouvelle propriété de gestion des accès concurrents et de la synthèse vocale

La nouvelle propriété global.ttsVoiceMarginalCPU gère le compromis entre la vitesse d'accès concurrent et la vitesse de synthèse vocale. La valeur par défaut 400 offre un équilibre raisonnable pour la plupart des clients et maintient la synthèse en temps réel. Pour plus d'informations à propos de la modification de cette valeur en fonction de vos besoins, contactez le support IBM.

Nouveau support pour les voix neuronales

Toutes les voix neuronales actuellement disponibles pour Text to Speech for IBM Cloud sont également disponibles pour l'installation sous Text to Speech for IBM Cloud Pak for Data. Les langues et les voix suivantes sont maintenant disponibles :

  • Arabe : ar-MS_OmarVoice
  • Chinois (Mandarin) : zh-CN_LiNaVoice, zh-CN_WangWeiVoice et zh-CN_ZhangJingVoice
  • Néerlandais (belge) : nl-BE_AdeleVoice
  • Néerlandais (Pays-Bas) : nl-NL_EmmaVoice et nl-NL_LiamVoice
  • Anglais (Australie) : en-AU_CraigVoice, en-AU_MadisonVoice et en-AU_SteveVoice
  • Coréen : ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoiceet ko-KR_YunaVoice
  • Suédois : sv-SE_IngridVoice

Pour plus d'informations sur les langues et voix disponibles, voir Langues et voix.

Installation des voix

Vous pouvez installer les voix neuronales améliorées ou les voix neuronales. Vous ne pouvez installer qu'un seul des deux types de voix. Lorsque vous installez le service, vous utilisez la propriété voiceType de la ressource personnalisée pour indiquer les voix à installer :

  • Indiquez enhancedNeuralVoices pour installer les voix neurales améliorées. Vous devez ensuite spécifier les voix neuronales améliorées individuelles à installer. Par défaut, seuls en-US_AllisonV3Voice, en-US_LisaV3Voiceet en-US_MichaelV3Voice sont installés. Vous pouvez choisir d'installer ces voix par défaut, ces voix et d'autres voix ou simplement d'autres voix. Seules les voix que vous installez sont disponibles.
  • Indiquez neuralVoices pour installer les voix neuronales. Toutes les voix neurales sont installées et disponibles. Vous ne pouvez pas affiner la liste des voix installées.

Pour plus d'informations sur l'utilisation de la ressource personnalisée pour installer des voix, voir Installation de Watson Text to Speech.

Spécification d'une voix pour la synthèse vocale

Les méthodes HTTP POST et GET /v1/synthesize, ainsi que la méthode WebSocket /v1/synthesize, acceptent un paramètre de requête voice facultatif que vous utilisez pour spécifier la voix à utiliser pour la synthèse vocale. Si vous omettez le paramètre voice, le service utilise une voix par défaut. La voix par défaut dépend des voix que vous avez installées:

  • Si vous avez installé les voix neuronales améliorées, le service utilise l'anglais américain en-US_MichaelV3Voice par défaut . Si cette voix n'est pas installée, vous devez spécifier une voix.
  • Si vous avez installé les voix neuronales, le service utilise toujours l'anglais australien en-AU_MadisonVoice par défaut.

Pour plus d'informations, voir Utilisation d'une voix pour la synthèse vocale.

Spécification d'une langue pour un modèle personnalisé

Utilisez la méthode POST /v1/customizations pour créer un modèle personnalisé. La méthode inclut un paramètre language que vous utilisez pour identifier la langue du nouveau modèle personnalisé.

  • Si vous avez installé les voix neuronales améliorées, le paramètre language est facultatif. Par défaut, le service utilise l'identificateur en-US pour la langue.
  • Si vous avez installé les voix neuronales, le paramètre language est requis. Vous devez spécifier la langue du modèle personnalisé dans le format indiqué (par exemple, en-AU pour l'anglais australien).

Pour plus d'informations sur la spécification d'une langue lors de la création d'un modèle personnalisé, voir Création d'un modèle personnalisé.

Correction d'un défaut : Correction de l'intonation pour les voix neurales améliorées en espagnol

Correctif d'erreur : pour les voix en castillan (es-ES_EnriqueV3Voice et es-ES_LauraV3Voice), en espagnol d'Amérique latine (es-LA_SofiaV3Voice) et en espagnol (es-US_SofiaV3Voice) d'Amérique du Nord, tous les types de questions utilisent désormais l'intonation correcte. Les voix précédentes n'utilisaient pas l'intonation correcte pour certaines questions et les prononçaient comme des affirmations

Correction d'un défaut : Correction de la documentation sur le multitenancy

Correctif d'incident: La rubrique Prise en charge de la multilocation de IBM Cloud Pak for Data indique à tort que les services vocaux ne prennent pas en charge la multilocation. La rubrique a été mise à jour pour indiquer que les services Speech prennent en charge les opérations suivantes :

  • Installer le service dans des projets distincts
  • Installer le service plusieurs fois dans le même projet
  • Installer le service une fois et déployer plusieurs instances dans le même projet

La documentation qui est propre aux services Speech mentionnait correctement le support multilocation.

1 octobre 2021 (Version 1.1.x)

La version 1.1.x est hors service
Text to Speech and Speech to Text for IBM Cloud Pak for Data version 1.1.x n'est plus en service depuis le 30 septembre 2021. Depuis le 1er octobre 2021, la documentation de la version 1.1.x n'est plus disponible. Pour plus d'informations, voir Retrait de logiciels et interruption du support.

29 juillet 2021 (Version 4.0.0)

Version 4.0.0 est disponible

IBM Watson® Text to Speech for IBM Cloud Pak® for Data version 4.0.0 est maintenant disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift version 4.6. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de IBM Watson Text to Speech for IBM Cloud Pak for Data.

Voix neuronales améliorées

Pour optimiser la qualité globale de la synthèse vocale, toutes les voix disponibles sont maintenant des voix neuronales améliorées. Les voix neuronales améliorées, qui incluent la chaîne V3 dans leurs noms, sont désormais disponibles pour le portugais (brésil), l'anglais Royaume-Uni et les États-Unis, le français, l'allemand, l'italien, le japonais et l'espagnol (tous les dialectes).

Les voix neuronales améliorées prennent en charge l'utilisation de l'API et de SPR (Symbolic Phonetic Representation) IBM avec l'élément SSML <phoneme>. Les voix neuronales améliorées atteignent également un degré légèrement plus élevé d'expression naturelle. Pour plus d'informations, voir Langues et voix.

Nouvelle voix en français canadien

Le service prend maintenant en charge le français canadien avec la voix neuronale améliorée fr-CA_LouiseV3Voice. La voix canadienne française prend en charge la personnalisation et est généralement disponible (GA) à des fins de production.

Nouvelle fonction Tune by Example

La nouvelle fonction Tune by Example permet de contrôler l'énoncé du texte spécifié par le service. La fonction est une fonctionnalité bêta qui n'est prise en charge que pour les modèles et les voix personnalisés anglais américain. La fonction comporte deux composants :

  • Invites personnalisées : incluent le texte écrit qui doit être énoncé et audio enregistré qui énonce le texte comme vous voulez l'entendre. L'audio spécifie l'intonation, le rythme et l'emphase du texte synthétisé. L'invite peut mettre l'accent sur des syllabes ou des mots différents, introduire des pauses et, d'une manière générale, rendre le son synthétisé plus naturel et plus approprié à son contexte.
  • Modèles de locuteurs : fournissent un enregistrement audio pour un utilisateur qui énonce une ou plusieurs invites. Un modèle de locuteur fournit un échantillon audio de la voix d'un utilisateur. Le service s'entraîne sur la voix, ce qui peut l'aider à produire des messages de qualité supérieure pour ce locuteur.

Vous spécifiez une invite personnalisée avec une demande de synthèse vocale pour indiquer comment la voix du service doit prononcer le texte. Pour spécifier une invite, utilisez l'extension SSML <ibm:prompt id="{prompt_id}"/>. L'audio synthétisé reproduit la prosodie de l'invite.

Le service comprend huit nouvelles méthodes de travail avec l'option Tune by Example. Les descriptions des nouvelles méthodes qui suivent fournissent des liens vers leurs entrées dans la référence API & SDK.

Documentation Text to Speech unifiée

La documentation for IBM Watson Text to Speech for IBM Cloud Pak for Data est désormais combinée à la documentation des instances gérées du service Text to Speech qui sont hébergées sur IBM Cloud. C'est le cas du guide et de la documentation de référence pour les deux formes de service. Liens vers la version précédente de la documentation IBM Cloud Pak for Data pour la redirection de service vers la documentation unifiée.

Pour plus d'informations sur l'identification des informations relatives à une seule version du produit, voir À propos de Text to Speech.

La version 1.1.x est hors service

Speech to Text et Text to Speech for IBM Cloud Pak for Data version 1.1.x ont été mis hors service le 30 septembre 2021. Vous deviez effectuer une mise à niveau vers une version ultérieure des services sous IBM Cloud Pak for Data avant cette date. Au 1er octobre 2021, la documentation de la version 1.1.4 n'était plus disponible.

12 avril 2021 (version 1.2.1)

Ajout au fichier speech-override.yaml

Le fichier speech-override.yaml minimal inclut une définition supplémentaire, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} est le chemin d'accès au registre Docker interne. Il doit s'agir de image-registry.openshift-image-registry.svc:5000/{namespace}, où {namespace} est l'espace de nom dans lequel IBM Cloud Pak® for Data est installé, normalement zen.

9 avril 2021 (version 1.2.1)

Prise en charge de la modification des modèles et des voix installés
Les services Speech vous permettent d'ajouter ou de supprimer des modèles et des voix installés pour la version 1.2 ou 1.2.1 des services.

26 mars 2021 (Version 1.2.1)

La version 1.2.1 est disponible

Text to Speech for IBM Cloud Pak for Data version 1.2.1 est maintenant disponible. Les versions 1.2 et 1.2.1 utilisent la même documentation et les mêmes instructions d'installation de la version 1.2. La version 1.2.1 prend en charge l'installation sous Red Hat OpenShift version 4.6 en plus des versions 4.5 et 3.11.

Nouvelles instructions d'installation

Pour les deux clusters connectés à Internet et les clusters isolés, les instructions d'installation incluent les étapes suivantes :

  • Utilisez la commande oc label pour configurer les libellés requis pour l'espace de nom où IBM Cloud Pak for Data est installé.
  • Utilisez la commande oc project pour pointez vers le projet OpenShift correct.
  • Utilisez la commande cpd-cli install pour installer un serveur Enterprise DB PostgreSQL utilisé par les services Speech.

Vous effectuez ces étapes avant d'installer les services Speech.

Nouvelles instructions de désinstallation

Une étape a été ajoutée à la procédure de désinstallation des services Speech pour nettoyer toutes les ressources de l'installation.

Registre autorisé pour le magasin de données PostgreSQL

Le chemin de registre autorisé à partir duquel le service extrait des images pour le magasin de données PostgreSQL a été modifié. L'emplacement cp.icr.io/cp/watson-speech du registre a été remplacé par cp.icr.io/cp/cpd. Ce changement est transparent pour les utilisateurs.

Secrets pour les magasins de données Minio et PostgreSQL

Les magasins de données Minio et PostgreSQL requièrent les valeurs codées suivantes pour leurs secrets :

  • Pour Minio, utilisez minio.
  • Pour PostgreSQL, utilisez user-provided-postgressql.

Vous ne pouvez pas utiliser vos propres valeurs pour ces secrets. Les secrets doivent être créés avant d'installer les services Speech.

Suppressions dans le fichier speech-override.yaml

Les entrées suivantes ont été supprimées du fichier speech-override.yaml. Elles ont été ajoutés pour résoudre un problème qui est maintenant résolu.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

Le fichier speech-override.yaml abrégé a généralement été réduit davantage en ajustant son contenu aux éléments essentiels.

9 décembre 2020 (Version 1.2)

Version 1.2 est disponible

Text to Speech for IBM Cloud Pak for Data version 1.2 est désormais disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data versions 3.5 et 3.0.1, et Red Hat OpenShift versions 4.5 et 3.11.

Nouvelles voix

Le service propose désormais deux nouvelles voix :

  • Anglais britannique : en-GB_CharlotteV3Voice
  • Français : fr-FR_NicolasV3Voice

Le service offre également une version améliorée de la voix britannique existante, en-KateV3Voice. Pour plus d'informations sur toutes les langues et voix prises en charge, voir Langues et voix.

Correction d'un défaut : Correction de l'élément <prosody> pour le japonais

Correctif d'incident : Pour la voix ja-JP_EmiV3Voice, le service analyse désormais correctement le texte d'entrée SSML qui inclut une spécification de taux de prosodie. Auparavant, l'utilisation suivante de l'élément <prosody> fonctionnait correctement :

<speak>成功する/繁栄する</speak>

Mais l'utilisation suivante de l'attribut de débit avec l'élément <prosody> amenait le service à lire et à énoncer la notation SSML intégrée :

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Le service analyse maintenant correctement et applique l'attribut rate de l'élément <prosody> pour l'entrée japonaise.

4 septembre 2020 (version 1.1.4)

L'interface de personnalisation est généralement disponible
L'interface de personnalisation est maintenant disponible. La personnalisation n'est plus une fonctionnalité bêta. Vous pouvez utiliser l'interface de personnalisation pour spécifier la façon dont le service prononce les mots inhabituels qui apparaissent dans le texte que vous entrez, en créant des dictionnaires personnalisés spécifiques à la langue. Pour plus d'informations, voir Compréhension de la personnalisation.

15 juillet 2020 (version 1.1.4)

Red Hat OpenShift version 4.3 est hors service
La prise en charge de Red Hat OpenShift 4.3 par IBM Cloud Pak for Data 3.0.1 sera obsolète à compter du 1er septembre 2020. Red Hat OpenShift 4.3 ne fait plus partie du service depuis le 22 octobre 2020. IBM Cloud Pak for Data est en train d'introduire la prise en charge de Red Hat OpenShift 4.5. IBM Cloud Pak for Data recommande la mise à niveau des clients vers Red Hat OpenShift 4.5 avant le 22 octobre 2020. Le support IBM travaillera avec les clients qui disposent déjà d'IBM Cloud Pak for Data 3.0.1 sur Red Hat OpenShift 4.3. Il est demandé aux nouveaux clients qui souhaitent effectuer l'installation sur Red Hat OpenShift 4.x d'installer Red Hat OpenShift 4.5.

19 juin 2020 (version 1.1.4)

La version 1.1.4 est disponible

Text to Speech for IBM Cloud Pak for Data version 1.1.4 est désormais disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data versions 2.5 et 3.0.1, et Red Hat OpenShift versions 3.11 et 4.3. Pour plus d'informations sur l'installation et la gestion du service, voir Installation et gestion de Text to Speech pour IBM Cloud Pak for Data.

Nouvelles voix neuronales

Le service prend désormais en charge cinq nouvelles voix neuronales :

  • Anglais américain : en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice, and en-US_OliviaV3Voice
  • Allemand : de-DE_ErikaV3Voice

Ces nouvelles voix ont les mêmes capacités pour la personnalisation et les éléments SSML que toutes les voix existantes. Pour plus d'informations, voir Langues et voix.

Prise en charge de l'attribut digits SSML de l'élément <say-as> pour le japonais

Le service prend désormais en charge l'attribut digits de l'élément SSML <say-as> avec sa voix japonaise. Pour plus d'informations, voir Élément <say-as>.

Procédures simplifiées de sauvegarde et de restauration

Les procédures de sauvegarde et de restauration ont été grandement simplifiées. Désormais, elles sauvegardent les données à partir des magasins de données, ainsi, vous n'avez plus besoin de recréer les opérations que vous avez exécutées. Pour plus d'informations, voir Sauvegarde et restauration Watson Données des services vocaux.

28 février 2020 (Version 1.1.3)

Version 1.1.3 est disponible
Text to Speech for IBM Cloud Pak for Data version 1.1.3 est désormais disponible.

27 novembre 2019 (Version 1.1.2)

Version 1.1.2 est disponible
Text to Speech for IBM Cloud Pak for Data version 1.1.2 est désormais disponible.

30 août 2019 (Version 1.0.1)

Version 1.0.1 est disponible
Text to Speech for IBM Cloud Pak for Data version 1.0.1 est désormais disponible. Le service fonctionne désormais avec IBM Cloud Pak for Data 2.1.0.1. Le service prend désormais en charge l'installation de IBM Cloud Pak for Data avec Red Hat OpenShift.
Nouvelle voix neuronale japonaise
Le service offre désormais la voix neuronale japonaise ja-JP_EmiV3Voice. Pour plus d'informations, voir Langues et voix.
Support FISMA
Le support FISMA (Federal Information Security Management Act) est désormais disponible pour Text to Speech for IBM Cloud Pak for Data. Le service est prêt pour FISMA High.

28 juin 2019 (Version 1.0.0)

Version 1.0.0 est disponible

Version 1.0.0, la version initiale du service, est maintenant disponible. Text to Speech for IBM Cloud Pak for Data est basé sur le service IBM Watson® Text to Speech le IBM Cloud public. Text to Speech for IBM Cloud Pak for Data diffère du service Text to Speech public des manières suivantes. Ces informations peuvent vous être utiles si vous connaissez déjà le service Text to Speech dans IBM Cloud public.

  • Text to Speech for IBM Cloud Pak for Data utilise des jetons d'accès pour l'authentification. Pour plus d'informations, voir API & SDK reference.
  • Les noeuds finaux de Text to Speech for IBM Cloud Pak for Data sont spécifiques à votre cluster IBM Cloud Pak for Data. Pour plus d'informations, voir API & SDK reference.
  • Text to Speech for IBM Cloud Pak for Data prend uniquement en charge les voix neuronales. Il ne prend pas en charge les voix standard (concaténatives). Les voix neuronales ne prennent pas en charge les éléments SSML <express-as> et <voice-transformation>.
  • Text to Speech for IBM Cloud Pak for Data n'effectue aucune consignation de demande. Vous n'avez pas besoin d'utiliser l'en-tête de demande X-Watson-Learning-Opt-Out.
  • Text to Speech for IBM Cloud Pak for Data ne prend pas en charge les jetons Watson. Vous ne pouvez pas utiliser l'en-tête de demande X-Watson-Authorization-Token pour l'authentification auprès du service.