Notes sur l'édition de Speech to Text for IBM Cloud Pak for Data

IBM Cloud Pak for Data

Les fonctions et modifications suivantes ont été incluses dans chaque édition et mise à jour des instances installées ou sur site de IBM Watson® Speech to Text for IBM Cloud Pak for Data. Sauf indication contraire, toutes les modifications sont rétrocompatibles et sont disponibles de manière automatique et transparente pour toutes les applications nouvelles et existantes.

Pour plus d'informations sur les limitations connues du service, voir Limitations connues.

Pour plus d'informations sur les éditions et les mises à jour du service pour IBM Cloud, voir les notes sur l'édition de Speech to Text for IBM Cloud.

30 octobre 2024 (Version 4.8.7 )

La version 4.8.7 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.7 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

25 septembre 2024 (Version 5.0.3

La version 5.0.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 août 2024 (Version 4.8.6 )

La version 4.8.6 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.6 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 août 2024 (Version 5.0.2

La version 5.0.2 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.2 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

31 juillet 2024 (Version 5.0.1

La version 5.0.1 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.1 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

19 juin 2024 (Version 5.0.0

La version 5.0.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 5.0.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

24 avril 2024 (Version 4.8.5 )

La version 4.8.5 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.5 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

27 mars 2024 (Version 4.8.4 )

La version 4.8.4 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.4 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 février 2024 (Version 4.8.3

La version 4.8.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

31 janvier 2024 (Version 4.8.2

La version 4.8.2 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.2 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

30 novembre 2023 (Version 4.8.0

La version 4.8.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.8.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

27 septembre 2023 (Version 4.7.3

La version 4.7.3 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.3 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

28 juillet 2023 (Version 4.7.1 )

La version 4.7.1 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.1 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

9 juin 2023 (Version 4.7.0

La version 4.7.0 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.7.0 est maintenant disponible. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

2 mai 2023 (version 4.6.5)

La version 4.6.5 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.6.5 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.10 et 4.12. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Nouveau modèle japonais de téléphonie de nouvelle génération

Le service propose désormais un modèle de téléphonie de nouvelle génération pour les Japonais : ja-JP_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, voir :

Amélioration de la personnalisation des modèles de langue pour les modèles anglais et japonais de nouvelle génération

Le service offre désormais une personnalisation améliorée du modèle de langue pour les modèles anglais et japonais de nouvelle génération:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Améliorations visibles des modèles: La nouvelle technologie améliore le comportement par défaut des nouveaux modèles anglais et japonais. Entre autres modifications, la nouvelle technologie optimise le comportement par défaut pour les paramètres suivants:

  • La valeur par défaut customization_weight pour les modèles personnalisés basés sur les nouvelles versions de ces modèles passe de 0.2 à 0.1.
  • Le site par défaut character_insertion_bias pour les modèles personnalisés basés sur les nouvelles versions de ces modèles reste 0.0, mais les modèles ont changé, ce qui rend le paramètre de reconnaissance vocale moins nécessaire.

Mise à niveau vers les nouveaux modèles: Pour tirer parti de la technologie améliorée, vous devez mettre à niveau les modèles de langue personnalisés basés sur les nouveaux modèles. Pour passer à la nouvelle version de l'un de ces modèles de base :

  1. Modifiez votre modèle personnalisé en ajoutant ou en modifiant un mot personnalisé, un corpus ou une grammaire que le modèle contient. Toute modification que vous apportez fait passer le modèle à l'état ready.

  2. Utilisez la méthode POST /v1/customizations/{customization_id}/train pour entraîner à nouveau le modèle. Le réentraînement met à niveau le modèle personnalisé vers la nouvelle technologie et fait passer le modèle à l'état available.

    Problème connu : Actuellement, vous ne pouvez pas utiliser la méthode POST /v1/customizations/{customization_id}/upgrade_model pour mettre à niveau un modèle personnalisé vers l'un des nouveaux modèles de base. Ce problème sera résolu dans une prochaine version.

Utilisation des nouveaux modèles: Après la mise à niveau vers le nouveau modèle de base, il est conseillé d'évaluer les performances du modèle personnalisé mis à niveau en accordant une attention particulière aux paramètres customization_weight et character_insertion_bias pour la reconnaissance vocale. Lorsque vous entraînez à nouveau votre modèle personnalisé:

  • Le modèle personnalisé utilise le nouveau customization_weight par défaut de 0.1 pour votre modèle personnalisé. Une adresse customization_weight qui n'est pas une adresse par défaut et qui était associée à votre modèle personnalisé est supprimée.
  • Le modèle personnalisé pourrait ne plus nécessiter l'utilisation du paramètre character_insertion_bias pour une reconnaissance vocale optimale.

Les améliorations apportées à la personnalisation du modèle de langue rendent ces paramètres moins importants pour la reconnaissance vocale de haute qualité:

  • Si vous utilisez les valeurs par défaut pour ces paramètres, continuez à le faire après la mise à niveau. Les valeurs par défaut continueront à offrir les meilleurs résultats pour la reconnaissance vocale.
  • Si vous spécifiez des valeurs autres que les valeurs par défaut pour ces paramètres, essayez les valeurs par défaut après la mise à niveau. Votre modèle personnalisé peut bien fonctionner pour la reconnaissance vocale avec les valeurs par défaut.

Si vous pensez que l'utilisation de valeurs différentes pour ces paramètres peut améliorer la reconnaissance vocale avec votre modèle personnalisé, testez les modifications incrémentielles afin de déterminer si les paramètres sont nécessaires pour améliorer la reconnaissance vocale.

Remarque : actuellement, les améliorations apportées à la personnalisation des modèles linguistiques ne s'appliquent qu'aux modèles personnalisés basés sur les modèles linguistiques de base anglais ou japonais de nouvelle génération mentionnés plus haut. Au fil du temps, les améliorations seront disponibles pour d'autres modèles de langue de nouvelle génération.

Plus d'informations : Pour plus d'informations sur la mise à niveau et sur la reconnaissance vocale avec ces paramètres, voir :

Nouvelle variable d'environnement pour la ressource personnalisée des services vocaux

La documentation inclut désormais des instructions permettant de créer une variable d'environnement nommée ${CUSTOM_RESOURCE_SPEECH}. Vous ajoutez la nouvelle variable au script cpd_vars.sh et vous le sourdez pour utiliser la variable dans votre environnement. Pour plus d'informations, voir Informations dont vous avez besoin pour effectuer cette tâche dans Installation des services vocaux Watsonou reportez-vous à l'une des rubriques de mise à niveau des services vocaux.

Correction des défauts: La téléphonie suédoise et les modèles multimédias italiens sont désormais disponibles

Correctif d'incident: Les modèles de téléphonie suédois (sv-SE_Telephony) et multimédia italien (it-IT_Multimedia) sont désormais disponibles pour l'installation. Auparavant, ils n'étaient pas disponibles.

Correction d'incident: amélioration du temps d'entraînement pour les modèles de langue personnalisés de nouvelle génération

Correctif d'incident: La durée de formation pour les modèles de langue personnalisés de nouvelle génération a été considérablement améliorée. Auparavant, le temps d'entraînement prenait beaucoup plus de temps que nécessaire, comme indiqué pour l'entraînement des modèles de langue personnalisés japonais. Le problème a été corrigé par un correctif interne.

Correction d'incident: les fichiers de grammaire gèrent désormais correctement les chaînes de chiffres

Correctif d'incident: Lorsque des grammaires sont utilisées, le service traite désormais correctement les chaînes de chiffres plus longues. Auparavant, elle ne parvenait pas à effectuer la reconnaissance ou à renvoyer des résultats incorrects.

Correction de l'incident: les fichiers de grammaire générés de manière dynamique fonctionnent désormais correctement

Correctif d'incident: Les fichiers de grammaire générés de manière dynamique fonctionnent désormais correctement. Auparavant, les fichiers de grammaire dynamique pouvaient provoquer des échecs internes, comme indiqué pour l'intégration de Speech to Text à IBM® watsonx™ Assistant. Le problème a été corrigé par un correctif interne.

Correction d'incident: le formatage intelligent pour les dates en anglais américain est désormais correct

Correctif d'incident: le formatage intelligent inclut désormais correctement les jours de la semaine et les dates où les deux sont présents dans l'audio parlé, par exemple, Tuesday February 28. Auparavant, dans certains cas, le jour de la semaine était omis et la date n'était pas présentée correctement. Le formatage intelligent est une fonctionnalité disponible en version bêta.

Correction d'incident: Mise à jour de la documentation pour les mots d'hésitation de la parole pour les modèles de nouvelle génération

Correction d'un défaut : Mise à jour de la documentation relative aux mots d'hésitation vocale pour les modèles de nouvelle génération. Plus de détails sont fournis sur l'anglais américain et les mots d'hésitation japonais. Les modèles de génération suivante incluent les mots d'hésitation réels dans les résultats de transcription, contrairement aux modèles de génération précédente, qui incluent uniquement des marqueurs d'hésitation. Pour plus d'informations, voir Speech hesitations and hésitation marqueurs.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes sont corrigées :

29 mars 2023 (version 4.6.4)

La version 4.6.4 est maintenant disponible
Speech to Text pour IBM Cloud Pak for Data version 4.6.4 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.10 et 4.12. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data
Important : sauvegardez vos données avant de passer à la version 4.6.3 ou 4.6.4
Important : avant de passer à la version 4.6.3 ou 4.6.4 des services Watson Speech, vous devez effectuer une sauvegarde de vos données. Conservez la sauvegarde dans un emplacement sûr. Pour plus d'informations sur la sauvegarde des données des services Watson Speech, voir Sauvegarde et restauration des données des services Watson Speech dans l'administration des services Watson Speech. Cette rubrique inclut également des informations sur la restauration de vos données si nécessaire.
Problème connu: Les modèles suédois de téléphonie et de multimédia italien ne sont pas encore disponibles
Problèmes connus : Les modèles suédois de téléphonie ( sv-SE_Telephony ) et italien de multimédia ( it-IT_Multimedia ) ne sont pas encore disponibles. Ils sont disponibles à partir de la version 4.6.5
Correction de l'incident: vous pouvez désormais modifier les modèles et les voix installés à l'aide des options d'installation avancées
Correctif d'incident: Lors de l'installation, vous pouvez désormais spécifier des modèles ou des voix différents avec les options d'installation avancées de l'interface de ligne de commande. Auparavant, le service installait toujours les modèles et les voix par défaut. La limitation continue de s'appliquer à Watson Speech services versions 4.6.0, 4.6.2et 4.6.3. Pour plus d'informations sur l'installation de modèles et de voix, voir Spécification d'options d'installation supplémentaires dans Installation des services Watson Speech.
Définition des délais d'attente de l'équilibreur de charge
Les services Watson Speech requièrent que vous modifiez les paramètres de délai d'attente de l'équilibreur de charge pour le serveur et le client à 300 secondes. Ces paramètres garantissent que les demandes de reconnaissance vocale à exécution longue, celles dont l'audio est long ou difficile, ont suffisamment de temps pour se terminer. Pour plus d'informations, voir Informations dont vous avez besoin pour effectuer cette tâche dans Installation des services vocaux Watson.
Vulnérabilités de sécurité résolues
Les vulnérabilités de sécurité suivantes ont été corrigées:

23 février 2023 (version 4.6.3)

La version 4.6.3 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.6.3 est maintenant disponible. Cette version prend en charge la version IBM Cloud Pak for Data 4.6.x et la version Red Hat OpenShift 4.10. Red Hat OpenShift version 4.8 n'est plus pris en charge. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Important: Tous les modèles de la génération précédente sont obsolètes et atteindront la fin de service le 31 juillet 2023

Important: Tous les modèles de génération précédente sont obsolètes et atteindront la fin de service à compter du 31 juillet 2023. A cette date, tous les modèles de génération précédente seront supprimés du service et de la documentation. La date d'obsolescence précédente était le 3 mars 2023. La nouvelle date donne aux utilisateurs plus de temps pour migrer vers les modèles de nouvelle génération appropriés. Mais les utilisateurs doivent migrer vers le modèle équivalent de la prochaine génération d'ici le 31 juillet 2023.

La plupart des modèles de génération précédente ont été dépréciés le 15 mars 2022. Auparavant, les modèles arabe et japonais n'étaient pas obsolètes. La dépréciation s'applique désormais à tous les modèles de génération précédente.

Remarque : lorsque le modèle en-US_BroadbandModel de la génération précédente sera retiré du service, le modèle en-US_Multimedia de la nouvelle génération deviendra le modèle par défaut pour les demandes de reconnaissance vocale.

Problème connu: vous ne pouvez pas modifier les modèles et les voix installés avec les options d'installation avancées

Problème connu: Vous ne pouvez actuellement pas spécifier de modèles ou de voix différents avec les options d'installation avancées. Le service installe toujours les modèles et les voix par défaut. Pour plus d'informations sur la modification des modèles après l'installation, voir Mise à jour des modèles et des voix pour vos Watson Speech dans la rubrique Administration des services vocaux Watson sur IBM Cloud Pak for Data.

Problème connu: la mise à niveau vers la version 4.6.3 peut échouer

Problème connu: Lors de la mise à niveau vers la version 4.6.3, le travail de sauvegarde MinIO peut ne pas être supprimé une fois terminé. Si cela se produit, la solution consiste à supprimer le travail, après quoi la mise à niveau se poursuit normalement. Procédez comme suit pour résoudre le problème.

  1. Pour déterminer si le travail de sauvegarde MinIO reste non supprimé, exécutez la commande suivante:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    Le travail MinIO qui n'est pas supprimé est identifié par une entrée de la forme suivante:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Pour supprimer le travail de sauvegarde MinIO, exécutez la commande suivante:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Une fois le travail de sauvegarde supprimé, la mise à niveau se poursuit et se termine.

Correction de l'incident: Mise à jour du modèle de téléphonie de nouvelle génération pour le Canada français (mise à niveau requise)

Correctif d'incident: Le modèle de téléphonie de nouvelle génération du Canada français, fr-CA_Telephony, a été mis à jour pour remédier à une incohérence interne susceptible de provoquer une erreur lors de la reconnaissance vocale. Vous devez mettre à niveau les modèles personnalisés basés sur le modèle fr-CA_Telephony. Pour plus d'informations sur la mise à niveau des modèles personnalisés, voir

Correction d'incident: le modèle multimédia portugais brésilien de nouvelle génération est désormais disponible

Correctif d'incident: Le modèle multimédia portugais brésilien de nouvelle génération est désormais disponible pour Speech to Text pour IBM Cloud Pak for Data. Auparavant, le modèle n'était pas disponible.

L'ajout de mots directement à des modèles personnalisés basés sur des modèles de nouvelle génération augmente le temps d'entraînement

L'ajout de mots personnalisés directement à un modèle personnalisé basé sur un modèle de nouvelle génération fait que l'entraînement d'un modèle prend quelques minutes de plus qu'il ne le ferait autrement. Si vous formez un modèle avec des mots personnalisés que vous avez ajoutés à l'aide de la méthode POST /v1/customizations/{customization_id}/words ou PUT /v1/customizations/{customization_id}/words/{word_name}, prévoyez quelques minutes d'entraînement supplémentaires pour le modèle. Pour plus d'informations, voir :

Informations supplémentaires sur l'utilisation des instances de service

La documentation inclut désormais des informations sur la création d'une instance de service à l'aide de l'interface de ligne de commande (cpl-cli) et sur la gestion des instances de service. Pour plus d'informations, voir les rubriques suivantes des services vocaux Watson sur IBM Cloud Pak for Data:

  • Création d'une instance de services vocaux Watson sous Configuration post-installation
  • Gestion de vos instances de services vocaux Watson sous Administration
Vulnérabilité de sécurité résolue

La vulnérabilité de sécurité suivante a été corrigée:

30 janvier 2023 (version 4.6.2)

La version 4.6.2 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.6.2 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

La ressource personnalisée inclut désormais une nouvelle propriété fileStorageClass

La ressource personnalisée pour les services vocaux Watson inclut désormais une propriété fileStorageClass en plus de la propriété blockStorageClass existante. Vous spécifiez des classes de stockage par blocs et de fichiers lorsque vous installez ou mettez à niveau un service. Lors d'une mise à niveau à partir d'une version précédente, la nouvelle propriété est ajoutée automatiquement à la ressource personnalisée par l'option --file_storage_class de la commande cli manage apply-cr.

Pour plus d'informations sur les classes de stockage par blocs et de fichiers disponibles que vous utilisez avec chacune des solutions de stockage prises en charge, voir le tableau Exigences de stockage sous Informations nécessaires à l'exécution de cette tâche sur la page "Installation des services Watson Speech" dans Watson Services vocaux sur IBM Cloud Pak for Data.

Informations supplémentaires sur la mise à disposition d'une instance de service

La documentation inclut désormais des informations sur la création d'une instance de service à l'aide d'un programme. Il inclut également des exemples d'affichage de la liste des instances de service et de suppression d'une instance de service. Pour plus d'informations, voir Création d'une instance de services vocaux Watson dans la documentation Post-installation setup dans les services vocaux Watson sur IBM Cloud Pak for Data.

Le chiffrement côté serveur est activé pour le magasin de données MinIO

Les services vocaux ont désormais activé le chiffrement côté serveur pour le stockage d'objets dans le magasin de données MinIO. Aucune action n'est requise de votre part.

Modification des webhooks d'audit

Les services vocaux ont maintenant supprimé la dépendance de webhook d'audit. Les services écrivent désormais des événements d'audit directement sur le serveur. Après la mise à niveau vers la version 4.6.2, certaines ressources de webhook peuvent rester jusqu'à ce que tous les services puissent supprimer la dépendance. Les ressources restantes seront supprimées dans une édition ultérieure. Aucune action n'est requise de votre part.

Nouveau Pays-Bas Modèle multimédia de nouvelle génération néerlandais

Le service propose désormais un modèle multimédia de nouvelle génération pour les Pays-Bas néerlandais : nl-NL_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, voir

Nouveau modèle suédois de téléphonie de nouvelle génération

Le service propose désormais un modèle de téléphonie de nouvelle génération pour les Suédois : sv-SE_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, voir

Mises à jour des modèles de téléphonie de nouvelle génération en anglais

Les modèles anglais de téléphonie de nouvelle génération ont été mis à jour pour améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tous ces modèles continuent de prendre en charge les faibles temps d'attente. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Le paramètre max_alternatives est désormais disponible pour une utilisation avec des modèles de nouvelle génération

Le paramètre max_alternatives est désormais disponible pour être utilisé avec tous les modèles de nouvelle génération. Ce paramètre est généralement disponible pour tous les modèles de la prochaine génération. Pour plus d'informations, voir Nombre maximal d'alternatives.

Correction d'incident: Autoriser l'utilisation des paramètres max_alternatives et end_of_phrase_silence_time avec les modèles de nouvelle génération

Correctif d'incident: Lorsque vous utilisez les paramètres max_alternatives et end_of_phrase_silence_time dans la même demande avec des modèles de nouvelle génération, le service renvoie désormais plusieurs transcriptions alternatives tout en respectant l'intervalle de pause indiqué. Auparavant, l'utilisation des deux paramètres dans une même demande générait un échec. (L'utilisation du paramètre max_alternatives avec des modèles de nouvelle génération était auparavant disponible en tant que fonction expérimentale pour un nombre limité de clients.)

Correction d'incident: mise à jour vers le modèle multimédia de nouvelle génération japonais (mise à niveau requise)

Correctif d'incident: Le modèle multimédia de nouvelle génération japonais, ja-JP_Multimedia, a été mis à jour pour résoudre une incohérence interne qui peut provoquer une erreur lors de la reconnaissance vocale avec un faible temps d'attente. Vous devez mettre à niveau les modèles personnalisés basés sur le modèle ja-JP_Multimedia. Pour plus d'informations sur la mise à niveau des modèles personnalisés, voir

Correction d'incident: Ajoutez des instructions de documentation pour la création de sonorités japonaises basées sur des modèles de nouvelle génération

Correctif d'incident: dans les recommandations sonores pour les modèles de langue personnalisés japonais basés sur des modèles de nouvelle génération, la séquence de caractères ウー est ambiguë dans certains contextes de gauche. N'utilisez pas de caractères (syllabes) qui se terminent par le phonème /o/, tel que et . Dans ce cas, utilisez ウウ ou uniquement à la place de ウー. Par exemple, utilisez ロウウマン ou ロウマン à la place de ロウーマン. Pour plus d'informations, voir Instructions pour le japonais.

Correction d'incident: Utilisation correcte de la zone display_as dans les résultats de transcription

Correctif d'incident: pour la personnalisation de modèle de langue avec des modèles de nouvelle génération, la valeur de la zone display_as pour un mot personnalisé apparaît maintenant dans toutes les retranscriptions. Auparavant, la valeur de la zone word apparaissait parfois dans les résultats de la transcription.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

30 novembre 2022 (version 4.6.0)

La version 4.6.0 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.6.0 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.6.x et Red Hat OpenShift, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Amazon Web Services (AWS) est désormais pris en charge

Watson Les services vocaux pour IBM Cloud Pak for Data sont désormais pris en charge sur Amazon Web Services™ (AWS™). Les services prennent en charge Amazon Elastic Block Store, que vous spécifiez en définissant la propriété blockStorageClass de la ressource personnalisée des services vocaux sur gp2-csi ou gp3-csi.

Les nouvelles classes de stockage sont désormais prises en charge

Watson Les services vocaux pour IBM Cloud Pak for Data prennent désormais en charge deux classes de stockage supplémentaires:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Vous spécifiez la classe de stockage avec la propriété blockStorageClass de la ressource personnalisée des services vocaux. Pour plus d'informations sur toutes les classes de stockage prises en charge, voir les rubriques suivantes dans Watson Services vocaux sur IBM Cloud Pak for Data:

  • Avant de commencer dans Installation des services Watson Speech
  • Spécification d'une classe de stockage dans Utilisation de la ressource personnalisée des services vocaux Watson
Problème connu: Certains pods de services vocaux Watson ne comportent pas d'annotations utilisées pour la planification

Problème connu: Certains pods de services vocaux Watson ne comportent pas l'annotation cloudpakInstanceId. Si vous utilisez le service de planification IBM Cloud Pak for Data, tous les pods de services vocaux Watson sans l'annotation cloudpakInstanceId sont

  • Planifié par le planificateur Kubernetes par défaut plutôt que par le service de planification
  • Non inclus dans l'application des quotas
La surveillance du magasin de données PostgreSQL est désormais disponible

Vous pouvez désormais activer la surveillance du magasin de données PostgreSQL pour recevoir des mises à jour sur son utilisation et son statut par les services vocaux Watson. Les événements peuvent être consommés par le logiciel de surveillance Prometheus ou par toute application que vous utilisez pour la surveillance. En activant la surveillance des projets définis par l'utilisateur en plus de la surveillance de la plateforme par défaut, vous pouvez surveiller vos propres projets avec la pile de surveillance Red Hat® OpenShift® Container Platform. Cette fonction inclut une propriété supplémentaire, spec.global.datastores.postgressql.enablePodMonitor, dans la ressource personnalisée des services vocaux.

Pour plus d'informations, voir la rubrique Surveillance du magasin de données PostgreSQL pour Watson Services vocaux dans la section Administration de Watson Services vocaux sur IBM Cloud Pak for Data.

Correctif d'incident: le magasin de données PostgreSQL n'est plus installé si seuls les microservices d'exécution sont activés

Correctif d'incident: Le magasin de données PostgreSQL n'est plus installé si seuls les microservices d'exécution sont activés. Le magasin de données est désormais installé uniquement si au moins l'un des microservices sttAsync, sttCustomization ou ttsCustomization est installé. PostgreSQL n'est pas désinstallé si, à une date ultérieure, ces microservices sont désactivés.

Avant la version 4.6.0, PostgreSQL était toujours installé avec les services vocaux. Si vous êtes un client existant qui a utilisé uniquement les microservices d'exécution des services vocaux antérieurs à la version 4.6.0, PostgreSQL reste installé mais n'est pas utilisé. Dans ce cas, l'installation de PostgreSQL est conservée entre les mises à niveau.

Le magasin de données MinIO est toujours installé car les microservices d'exécution en dépendent. Le magasin de données RabbitMQ est installé uniquement si le microservice sttAsync est installé.

Pour plus d'informations, voir Propriétés du magasin de données dans Utilisation de la ressource personnalisée des services vocaux Watson dans les services vocaux Watson sur IBM Cloud Pak for Data.

Correction d'incident: La création d'une règle réseau n'est plus nécessaire pour que l'opérateur PostgreSQL surveille ses opérandes

Correctif d'incident: Pour la version 4.6.0, il n'est pas nécessaire de créer une règle réseau pour permettre à l'opérateur PostgreSQL de surveiller ses opérandes, comme décrit dans la mise à jour du service 10 novembre 2022(versions 4.0.x et 4.5.x). A partir de la version 4.6.0, le service gère cette situation automatiquement.

Correction d'incident: Certains modèles de nouvelle génération ont été mis à jour pour améliorer le temps de réponse à faible temps d'attente

Correctif d'incident: les modèles de nouvelle génération suivants ont été mis à jour pour améliorer leur temps de réponse lorsque le paramètre low_latency est utilisé:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

Auparavant, ces modèles ne renvoyaient pas les résultats de la reconnaissance aussi rapidement que prévu lorsque le paramètre low_latency était utilisé. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Correctif d'incident: amélioration de la documentation de dénomination des modèles personnalisés

Correctif d'incident: La documentation fournit désormais des règles détaillées pour l'attribution de noms aux modèles de langue personnalisés et aux modèles acoustiques personnalisés. Pour plus d'informations, voir :

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

10 novembre 2022 (versions 4.0.x et 4.5.x)

Problème connu: mise à jour de la règle réseau requise pour l'opérateur PostgreSQL

Problème connu: Pour les services vocaux version 4.0.x (à l'exclusion de la version 4.0.0) et 4.5.x, si l'opérateur PostgreSQL et les services vocaux sont installés dans des espaces de nom différents, l'opérateur PostgreSQL ne peut pas surveiller les opérandes PostgreSQL pour les services vocaux. L'opérateur ne peut pas surveiller les opérandes par la règle réseau en vigueur pour les services vocaux.

Ce problème n'empêche pas le cluster PostgreSQL de fonctionner correctement. Le cluster reste actif et entièrement fonctionnel. Toutefois, l'opérateur ne peut pas mettre à jour les opérandes lors de la mise à niveau vers de nouvelles versions des services vocaux.

La solution à ce problème consiste à créer une règle réseau supplémentaire pour l'opérateur PostgreSQL, comme indiqué dans les étapes suivantes. Vous pouvez effectuer les étapes indépendamment du fait que l'opérateur PostgreSQL soit installé dans le même espace de nom que les services vocaux ou dans un autre espace de nom.

  1. Connectez-vous en tant qu'administrateur du projet Red Hat® OpenShift® dans lequel les services vocaux sont installés.

  2. Entrez la commande suivante pour mettre à jour la règle réseau pour les services vocaux:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    • <custom-resource-name> est le nom de la ressource personnalisée des services vocaux. Le nom recommandé pour la version 4.0.x est speech-prod-cr; le nom recommandé pour la version 4.5.x est speech-cr.
    • <cpd-instance-name> est le nom du projet (espace de noms) dans lequel les services Speech sont installés. La documentation utilise la variable d'environnement ${PROJECT_CPD_INSTANCE} pour identifier l'espace de nom.
  3. Pour vérifier que la règle réseau mise à jour permet à l'opérateur de surveiller les opérandes et que le cluster PostgreSQL est dans un état sain, entrez la commande suivante, où <custom-resource-name> et <cpd-instance-name> sont les valeurs que vous avez utilisées à l'étape précédente:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Si le cluster PostgreSQL fonctionne correctement, la commande génère une sortie similaire à la suivante:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Ces étapes n'entraînent pas la mise à jour des opérandes par l'opérateur vers les versions les plus récentes. Toutefois, les opérandes sont mis à niveau comme prévu lors de la prochaine mise à niveau du logiciel de services vocaux.

13 octobre 2022 (version 4.5.3)

La version 4.5.3 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.5.3 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Les événements d'audit sont disponibles pour les services vocaux

Le service de journalisation d'audit IBM Cloud Pak for Data génère et transmet des événements d'audit pour les services Speech to Text et Text to Speech. Les événements d'audit correspondent à ceux disponibles pour Activity Tracker avec le service public. Pour plus d'informations, voir Evénements d'audit.

Vous ne pouvez pas désinstaller des composants de service Speech individuels

La documentation indique désormais que vous ne pouvez pas désinstaller des composants de service individuels (microservices) une fois qu'ils sont installés. Pour supprimer l'un des composants suivants, vous devez désinstaller les services Watson Speech dans leur intégralité et réinstaller uniquement les composants dont vous avez besoin : Speech to Text runtime, Speech to Text asynchronous HTTP, Speech to Text customization, Text to Speech runtime, et Text to Speech customization. Pour plus d'informations sur l'installation des services Speech, voir Watson Les services Speech sur IBM Cloud Pak for Data.

Nouveau modèle multimédia de nouvelle génération pour le Canada français

Le service propose désormais un modèle multimédia de nouvelle génération pour les Canadiens français : fr-CA_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, voir

Mises à jour des modèles de téléphonie de nouvelle génération en anglais

Les modèles anglais de téléphonie de nouvelle génération ont été mis à jour pour améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tous ces modèles continuent de prendre en charge les faibles temps d'attente. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Le modèle multimédia italien de nouvelle génération prend désormais en charge une faible latence

Le modèle multimédia de nouvelle génération italien, it-IT_Multimedia, prend désormais en charge les faibles temps d'attente. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, voir

Traitement des incidents liés à la mise à niveau de la version 4.0.x vers la version 4.5.x

Lorsque vous mettez à niveau les services vocaux de la version 4.0.x vers la version 4.5.x, vous pouvez rencontrer un problème où les pods PostgreSQL sont bloqués à l'état Terminating. Si ce problème se produit lors de la mise à niveau, procédez comme suit pour le résoudre. Les informations et les étapes sont également documentées dans la rubrique Mise à niveau des services vocaux Watson de la version 4.0 à la version 4.5 de la rubrique Mise à niveau des services vocaux Watson sur IBM Cloud Pak for Data.

  1. Utilisez la commande suivante pour identifier les pods qui restent à l'état Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Utilisez la commande suivante pour définir la variable d'environnement pods afin d'inclure la liste des pods qui restent à l'état Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'})
  1. Utilisez la commande suivante pour supprimer les pods bloqués afin que le processus de mise à niveau puisse continuer:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
Correctif d'incident: correction de la documentation des entrées de ressource personnalisée

Correctif d'incident: La documentation de la ressource personnalisée des services vocaux inclut désormais des signes deux-points après les noms des modèles koKrTelephony et nlNlTelephony. Auparavant, la documentation de ces deux entrées omettait le signe deux-points.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

19 août 2022 (version 4.5.1)

Important: La date d'obsolescence pour la plupart des modèles de la génération précédente est maintenant le 3 mars 2023

Obsolète: Cet avis d'obsolescence est remplacé par la mise à jour du service du 23 février 2023. La date de fin de service pour tous les modèles de génération précédente est désormais 31 juillet 2023.

Le 15 mars 2022, les modèles de la génération précédente pour toutes les langues autres que l'arabe et le japonais ont été supprimés. À cette époque, les modèles obsolètes devaient rester disponibles jusqu'au 15 septembre 2022. Pour permettre aux utilisateurs de migrer plus longtemps vers les modèles de nouvelle génération appropriés, les modèles obsolètes resteront disponibles jusqu'au 3 mars 2023. Comme pour la notification d'obsolescence initiale, les modèles de génération précédente en arabe et en japonais ne sont pas obsolètes. Pour obtenir la liste complète de tous les modèles obsolètes, voir la mise à jour du service du 15 mars 2022(version 4.0.6).

Le 3 mars 2023, les modèles obsolètes seront supprimés du service et de la documentation. Si vous utilisez l'un des modèles obsolètes, vous devez migrer vers le modèle équivalent de la prochaine génération avant le 3 mars 2023.

Remarque : lorsque le modèle en-US_BroadbandModel de la génération précédente sera retiré du service, le modèle en-US_Multimedia de la nouvelle génération deviendra le modèle par défaut pour les demandes de reconnaissance vocale.

3 août 2022 (version 4.5.1)

La version 4.5.1 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.5.1 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Prise en charge des clusters compatibles FIPS

Speech to Text pour IBM Cloud Pak for Data et Text to Speech pour IBM Cloud Pak for Data prennent désormais en charge l'exécution sur des clusters compatibles FIPS (Federal Information Processing Standard). Pour plus d'informations, voir Services prenant en charge FIPS.

Correction d'incident: correction des calculs de stockage éphémères pour éviter les expulsions de pod occasionnelles

Correctif d'incident: Un incident a été corrigé et le calcul des limites de stockage éphémères est désormais plus précis pour les environnements d'exécution Speech to Text pour IBM Cloud Pak for Data et Text to Speech pour IBM Cloud Pak for Data. Ces modifications empêchent les expulsions de pod occasionnelles lorsque les environnements d'exécution des services sont soumis à une charge importante.

Correction d'incident: mise à jour de la documentation des hésitations et des marqueurs d'hésitation

Réparation du défaut: La documentation sur les hésitations vocales et les marqueurs d'hésitation a été mise à jour. Les modèles de génération précédente incluent des marqueurs d'hésitation à la place des hésitations de la parole dans les résultats de transcription pour la plupart des langues ; le formatage intelligent supprime les marqueurs d'hésitation des transcriptions finales en anglais américain. Les modèles de la prochaine génération incluent les hésitations de la parole dans les résultats de la transcription ; le formatage intelligent n'a aucun effet sur leur inclusion dans les résultats de la transcription finale.

Pour plus d'informations, voir :

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

29 juin 2022 (version 4.5.0)

La version 4.5.0 est maintenant disponible

Speech to Text pour IBM Cloud Pak for Data version 4.5.0 est maintenant disponible. Cette version prend en charge les versions IBM Cloud Pak for Data, 4.5.x et Red Hat OpenShift, 4.6, 4.8 et 4.10. Pour plus d'informations, voir Watson Services vocaux sur IBM Cloud Pak for Data

Services Unified Speech pour la documentation IBM Cloud Pak for Data

La documentation d'installation et d'administration pour Speech to Text et Text to Speech est désormais combinée dans la documentation IBM Cloud Pak for Data. Pour plus d'informations sur l'installation et la gestion des services vocaux, voir Watson Services vocaux sur IBM Cloud Pak for Data.

Modifications apportées à la ressource personnalisée des services vocaux

La ressource personnalisée est maintenant créée lorsque vous installez initialement les services vocaux. Le processus est décrit dans la documentation d'installation de IBM Cloud Pak for Data. Le contenu de la ressource personnalisée a changé:

  • Le nom recommandé de la ressource personnalisée est passé de speech-prod-cr à speech-cr.
  • Toutes les références à la classe de stockage ont changé de variantes de storageClass à blockStorageClass.
  • Le nom de la classe de stockage par blocs Portworx est passé de portworx-shared-gp3 à portworx-db-gp3-sc.
  • La propriété createSecret a été supprimée pour les magasins de données MinIO et PostgreSQl. La propriété est utilisée uniquement en interne. Les services vocaux utilisent toujours un objet secrets si vous en créez un, et ils créent toujours automatiquement l'objet si aucun n'est fourni.
L'objet secret fourni par l'utilisateur est désormais pris en charge pour le magasin de données RabbitMQ

Vous pouvez désormais fournir des données d'identification de sécurité pour le magasin de données RabbitMQ, tout comme vous pouvez le faire pour les magasins de données MinIO et PostgreSQL. Le processus documenté est similaire pour les trois magasins de données.

Nouveau modèle nouvelle génération it-IT_Multimedia italien

Le service propose désormais un modèle multimédia nouvelle génération pour l'italien : it-IT_Multimedia. Le nouveau modèle est en disponibilité générale. Il ne prend pas en charge le faible temps d'attente, mais il prend en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Mise à jour des modèles nouvelle génération de téléphonie et multimédia en coréen

Les modèles nouvelle génération coréens existants ont été mis à jour :

  • Le modèle ko-KR_Telephony a été mis à jour pour améliorer la prise en charge du faible temps d'attente pour la reconnaissance vocale.
  • Le modèle ko-KR_Multimedia a été mis à jour pour améliorer la reconnaissance vocale. Désormais, le modèle prend également en charge le faible temps d'attente.

Les deux modèles sont généralement disponibles et tous deux prennent en charge la personnalisation du modèle de langue et les grammaires. Il n'est pas nécessaire de mettre à niveau des modèles de langue personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Mises à jour de plusieurs modèles de téléphonie nouvelle génération

Les modèles de téléphonie anglaise de nouvelle génération suivants ont été mis à jour pour améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Correctif : Les scores de confiance sont désormais consignés pour tous les résultats de transcription

Correctif : Les scores de confiance sont désormais consignés pour tous les résultats de transcription. Auparavant, lorsque le service renvoyait plusieurs transcriptions pour une seule demande de reconnaissance vocale, les scores de confiance pouvaient ne pas être renvoyés pour toutes les transcriptions.

Vulnérabilités de sécurité résolues

Aucune vulnérabilité de sécurité n'a été corrigée pour la version 4.5.0.

25 mai 2022 (version 4.0.9)

La version 4.0.9 est désormais disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.9 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Nouveau modèle nouvelle génération pt-BR_Multimedia en portugais brésilien

Le service propose désormais un modèle multimédia nouvelle génération pour le portugais brésilien : pt-BR_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

Mise à jour du modèle nouvelle génération de-DE_Multimedia en allemand pour prendre en charge le faible temps d'attente

Le modèle allemand nouvelle génération, de-DE_Multimedia, prend désormais en charge le faible temps d'attente. Il n'est pas nécessaire de mettre à niveau des modèles personnalisés basés sur le modèle de base allemand mis à jour. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

Nouveau paramètre character_insertion_bias bêta pour les modèles nouvelle génération

Tous les modèles nouvelle génération prennent désormais en charge un nouveau paramètre bêta, character_insertion_bias, disponible avec toutes les interfaces de reconnaissance vocale. Par défaut, le service est optimisé pour chaque modèle individuel afin d'équilibrer la reconnaissance des chaînes candidates de différentes longueurs. La pondération spécifique au modèle est équivalente à 0,0. La pondération par défaut de chaque modèle est suffisante pour la plupart des demandes de reconnaissance vocale.

Toutefois, certains cas d'utilisation peuvent tirer parti de la préférence d'hypothèses avec des chaînes de caractères plus courtes ou plus longues. Le paramètre accepte des valeurs comprises entre -1,0 et 1,0 qui représentent une modification par rapport à la valeur par défaut d'un modèle. Des valeurs négatives indiquent au service de favoriser des chaînes de caractères plus courtes. Des valeurs positives indiquent au service pour favoriser des chaînes de caractères plus longues. Pour plus d'informations, voir Pondération d'insertion de caractères.

Les services de parole ne prennent pas en charge l'utilitaire de sauvegarde et de restauration OADP

Les services de parole Watson prennent pas en charge l'utilitaire de sauvegarde et de restauration de IBM Cloud Pak for Data OpenShift API pour la protection des données (OADP). Si les services de parole sont installés sur un cluster, il se peut que vous ne soyez pas en mesure d'utiliser l'utilitaire de sauvegarde et de restauration IBM Cloud Pak for Data OADP pour sauvegarder d'autres services installés sur ce cluster. Cette limitation s'applique à la version 4.0.0 et aux versions ultérieures des services de parole.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

1 mai 2022 (Version 1.2.x)

Important : Fin de service pour Speech to Text version 1.2.x sur IBM Cloud Pak for Data version 3.5
Important : Speech to Text version 1.2.x sur IBM Cloud Pak for Data version 3.5 n'est plus en service depuis le 1er mai 2022. Speech to Text version 1.2.x n'est plus pris en charge, disponible ou documenté. Pour plus d'informations sur la fin de service pour Speech to Text, qui fait partie du kit d'API Watson, voir Interruption de support logiciel : IBM Watson API Kit for IBM Cloud Pak for Data 1.2.x.

27 avril 2022 (version 4.0.8)

La version 4.0.8 est désormais disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.8 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Nouvelles variables d'environnement utilisées dans la documentation IBM Cloud Pak for Data

La plupart des commandes de la documentation Speech to Text for IBM Cloud Pak for Data ont été mises à jour pour permettre d'utiliser un ensemble commun de variables d'environnement. La documentation fournit un script permettant d'exporter automatiquement les variables d'environnement exécution des commandes d'installation, de mise à niveau et d'administration. Une fois le sourcing du script effectué, vous pouvez copier la plupart des commandes à partir de la documentation et les exécuter sans apporter de modifications.

Les variables d'environnement définies par le script sont les suivantes:

  • ${PROJECT_CPD_INSTANCE} identifie le projet dans lequel vous prévoyez d'installer IBM Cloud Pak for Data et les services de parole.
  • ${PROJECT_CPD_OPS} identifie le projet pour l'opérateur de plateforme IBM Cloud Pak for Data .
  • ${PROJECT_CPFS_OPS} identifie le projet pour les services de base IBM Cloud Pak for Data .

Pour plus d'informations sur l'utilisation des variables d'environnement, voir Best practice: Setting up install variables.

La propriété ttsVoiceMarginalCPU n'est plus documentée

La propriété ttsVoiceMarginalCPU a été supprimée de la documentation de la ressource personnalisée services de parole. La propriété gère le compromis entre l'accès concurrent et la vitesse de synthèse vocale. La valeur par défaut de 400 garantit un équilibre raisonnable pour la plupart des clients et gère la synthèse en temps réel.

Nouveau modèle multimédia de nouvelle génération pour l'allemand

Le service propose désormais un modèle multimédia de nouvelle génération pour l'allemand : de-DE_Multimedia. Le nouveau modèle est en disponibilité générale. Il ne prend pas en charge le faible temps d'attente. Il prend en charge la personnalisation des modèles de langue et les grammaires comme fonctionnalités en disponibilité générale.

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles et leur support de personnalisation, voir

Le modèle en-WW_Medical_Telephony de nouvelle génération prend désormais en charge le faible temps d'attente

Le modèle en-WW_Medical_Telephony de nouvelle génération en version bêta prend désormais en charge le faible temps d'attente. Pour plus d'informations sur tous les modèles de nouvelle génération et sur le faible temps d'attente, voir

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

8 avril 2022 (version 4.0.7)

La prise en charge des types sonores est désormais documentée pour les modèles personnalisés basés sur des modèles nouvelle génération

Pour les modèles de langue personnalisés basés sur des modèles nouvelle génération, la prise en charge est désormais documentée pour les spécifications de type sonore pour des mots personnalisés. La prise en charge des types sonores est disponible depuis fin 2021.

Il existe des d'utilisation de la zone sounds_like pour les modèles personnalisés selon qu'ils sont basés sur des modèles nouvelle génération ou de génération précédente. Pour plus d'informations sur l'utilisation de la zone sounds_like avec les modèles personnalisés basés sur des modèles nouvelle génération, voir Utilisation de mots personnalisés pour les modèles nouvelle génération.

Important : Le paramètre obsolète customization_id a été retiré de la documentation

Important : Le 9 octobre 2018, le paramètre customization_id de toutes les demandes de reconnaissance vocale est devenu obsolète et a été remplacé par le paramètre language_customization_id. Le paramètre customization_id a été retiré de la documentation pour les méthodes de reconnaissance vocale :

  • /v1/recognize pour les demandes WebSocket
  • POST /v1/recognize pour les demandes HTTP synchrones (notamment les demandes multiparties)
  • POST /v1/recognitions pour les demandes HTTP asynchrones

Remarque : Si vous utilisez les kits SDK Watson, vérifiez que vous avez mis à jour le code d'application pour utiliser le paramètre language_customization_id à la place du paramètre customization_id. Le paramètre customization_id ne sera plus disponible depuis les méthodes équivalentes des kits SDK à compter de leur prochaine version majeure. Pour plus d'informations sur les méthodes de reconnaissance vocale, voir API & SDK reference.

30 mars 2022 (version 4.0.7)

La version 4.0.7 est désormais disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.7 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Propriété de ressource personnalisée pour la spécification d'un modèle par défaut

La voix par défaut des demandes de reconnaissance vocale est en-US_BroadbandModel. Si vous n'installez pas en-US_BroadbandModel, vous devez :

  • Utiliser le paramètre model pour transmettre la voix à utiliser avec chaque demande.
  • Spécifier un nouveau modèle par défaut pour votre installation de Speech to Text for IBM Cloud Pak for Data en utilisant la propriété defaultSTTModel de la ressource personnalisée des services Speech. Pour plus d'informations, voir Installation de Watson Speech to Text et Utilisation du modèle par défaut.
Mise à jour des modèles multimédias de nouvelle génération en anglais et en français pour prendre en charge le faible temps d'attente

Les modèles multimédias suivants ont été mis à jour pour prendre en charge le faible temps d'attente :

  • Anglais australien : en-AU_Multimedia
  • Anglais britannique : en-GB_Multimedia
  • Anglais américain : en-US_Multimedia
  • Français : fr-FR_Multimedia

Il n'est pas nécessaire de mettre à niveau les modèles de langue personnalisés qui sont générés sur ces modèles de base. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

Nouveau modèle multimédia de nouvelle génération pour l'espagnol (Castillan)

Le service propose désormais un modèle multimédia de nouvelle génération pour l'espagnol (Castillan) : es-ES_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires.

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles et leur support de personnalisation, voir

Le modèle en-WW_Medical_Telephony nouvelle génération prend en charge le formatage intelligent

La version bêta du modèle en-WW_Medical_Telephony nouvelle génération prend désormais en charge le paramètre smart_formatting pour l'audio anglais américain. Pour plus d'informations sur tous les modèles nouvelle génération, voir Langues et modèles nouvelle génération

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes ont été corrigées:

17 mars 2022 (version 4.0.6)

La prise en charge de la grammaire pour les modèles de nouvelle génération est désormais en disponibilité générale

La prise en charge de la grammaire est désormais en disponibilité générale (GA) pour les modèles suivants qui répondent aux conditions suivantes :

  • Les modèles sont en disponibilité générale.
  • Les modèles prennent en charge la personnalisation du modèle de langue.

Pour plus d'informations, consultez les rubriques suivantes :

15 mars 2022 (version 4.0.6)

Important : Obsolescence de la plupart des modèles de génération précédente

Obsolète: Cet avis d'obsolescence est remplacé par la mise à jour du service du 23 février 2023. La date de fin de service pour tous les modèles de génération précédente est désormais 31 juillet 2023.

À compter du 15 mars 2022, les modèles de génération précédente pour toutes les langues autres que l'arabe et le japonais sont obsolètes. Les modèles obsolètes restent disponibles jusqu'au 15 septembre 2022, date à laquelle ils seront retirés du service et de la documentation. Les modèles arabes et japonais de la génération précédente ne sont pas obsolètes.

Les modèles de génération précédente suivants sont désormais obsolètes :

  • Chinois (mandarin) : zh-CN_NarrowbandModel et zh-CN_BroadbandModel
  • Néerlandais (Pays-Bas) : nl-NL_NarrowbandModel et nl-NL_BroadbandModel
  • Anglais (Australien) : en-AU_NarrowbandModel et en-AU_BroadbandModel
  • Anglais (Royaume-Uni) : en-UK_NarrowbandModel et en-UK_BroadbandModel
  • Anglais (États-Unis) : en-US_NarrowbandModel, en-US_BroadbandModel et en-US_ShortForm_NarrowbandModel
  • Français (Canada) : fr-CA_NarrowbandModel et fr-CA_BroadbandModel
  • Français (France) : fr-FR_NarrowbandModel et fr-FR_BroadbandModel
  • Allemand : de-DE_NarrowbandModel et de-DE_BroadbandModel
  • Italien : it-IT_NarrowbandModel et it_IT_BroadbandModel
  • Coréen : ko-KR_NarrowbandModel et ko-KR_BroadbandModel
  • Portugais (Brésil) : pt-BR_NarrowbandModel et pt-BR_BroadbandModel
  • Espagnol (Argentine) : es-AR_NarrowbandModel et es-AR_BroadbandModel
  • Espagnol (Castillan) : es-ES_NarrowbandModel et es-ES_BroadbandModel
  • Espagnol (Chili) : es-CL_NarrowbandModel et es-CL_BroadbandModel
  • Espagnol (Colombie) : es-CO_NarrowbandModel et es-CO_BroadbandModel
  • Espagnol (Mexique) : es-MX_NarrowbandModel et es-MX_BroadbandModel
  • Espagnol (Pérou) : es-PE_NarrowbandModel et es-PE_BroadbandModel

Si vous utilisez l'un de ces modèles obsolètes, vous devez migrer vers le modèle de nouvelle génération équivalent avant la date de fin de service.

Remarque : Lorsque le modèle de génération précédente en-US_BroadbandModel est supprimé du service le 15 septembre, le modèle en-US_Multimedia de nouvelle génération devient le modèle par défaut pour les demandes de reconnaissance vocale.

Les modèles de nouvelle génération prennent désormais en charge les paramètres d'analyse audio

Tous les modèles de nouvelle génération prennent désormais en charge les paramètres d'analyse audio suivants en tant que fonctions en disponibilité générale :

  • end_of_phrase_silence_time indique la durée de l'intervalle de pause auquel le service divise une transcription en plusieurs résultats finaux. Pour plus d'informations, voir Paramètre end_of_phrase_silence_time.
  • split_transcript_at_phrase_end ordonne au service de scinder la transcription en plusieurs résultats finaux en fonction des caractéristiques sémantiques de l'entrée. Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.
Correction d'un défaut : Correction de la documentation sur les étiquettes des haut-parleurs

Correctif : La documentation des étiquettes d'orateur inclut l'instruction erronée suivante dans plusieurs emplacements : Pour les modèles de nouvelle génération, l'utilisation des étiquettes d'orateur n'est pas prise en charge avec des résultats provisoires ou un faible temps d'attente. L'utilisation des étiquettes d'orateur avec des résultats provisoires et un faible temps d'attente est prise en charge pour les modèles de prochaine nouvelle génération. Pour plus d'informations, voir Etiquettes de locuteur.

23 février 2022 (version 4.0.6)

La version 4.0.6 est maintenant disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.6 est maintenant disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Mises à jour des scripts d'importation/exportation

Les scripts import_export.sh et transfer_ownership.sh ont été mis à jour. Ces scripts permettent d'importer et d'exporter des données entre les clusters, de sauvegarder et de restaurer des données et de migrer des données de la version 3.5 vers la version 4.0.x. Les scripts ont été modifiés et améliorés comme suit :

  • Le script transfer_ownership.sh nécessite désormais l'inclusion d'une option -c sur la ligne de commande avant l'argument <custom_resource_name>.
  • Le script transfer_ownership.sh requiert désormais une option et un argument -v <version> pour indiquer la version à laquelle la propriété des ressources est transférée. Indiquez 35 pour la version 3.5 ou 40 pour la version 4.0.x.
  • Le script transfer_ownership.sh nécessite désormais l'inclusion d'une option -p sur la ligne de commande avant l'argument <postgres_auth_secret_name>.
  • L'argument <postgres_auth_secret_name> fournit le secret de Kubernetes utilisé pour l'authentification dans le magasin de données PostgreSQL auquel vous transférez la propriété. Vous pouvez omettre le secret d'authentification s'il est identique à la valeur par défaut (<custom-resource-name>-postgres-auth-secret pour la version 4.0.x, user-provided-postgressql pour la version 3.5). Vous devez indiquer le secret s'il est différent de la valeur par défaut.
  • Les deux scripts incluent maintenant une option -h (--help) pour afficher des informations sur le script et son utilisation.

Pour plus d'informations, voir :

Recommandation mise à jour pour OpenShift Container Storage

Depuis la version 4.0.6 des services Speech, la classe de stockage recommandée pour OpenShift Container Storage est ocs-storagecluster-ceph-rbd.

  • Si vous installez les services Speech 4.0.6 ou la mise à niveau vers les services Speech 4.0.6 à partir d'IBM Cloud Pak for Data version 3.5, indiquez la classe de stockage ocs-storagecluster-ceph-rbd lors de l'installation ou de la mise à niveau.
  • Si vous effectuez une mise à niveau vers les services Speech 4.0.6 à partir d'une régénération précédente d'Cloud Pak for Data version 4.0, continuez à utiliser ocs-storagecluster-cephfs. Vous ne pouvez pas modifier le stockage utilisé dans un déploiement existant.

La valeur est spécifiée avec la propriété storageClass dans la ressource personnalisée des services Speech :

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

Les services Speech fonctionnent avec l'une ou l'autre version de OpenShift Container Storage. La nouvelle version recommandée dispose d'autorisations d'accès plus restrictives. Pour plus d'informations, voir :

Le nouveau modèle bêta en-WW_Medical_Telephony est désormais disponible

Une nouvelle version bêta de nouvelle génération en-WW_Medical_Telephony est désormais disponible. Le nouveau modèle comprend les termes des domaines médical et pharmacologique. Utilisez le modèle dans les situations où vous devez transcrire une terminologie médicale commune, comme les noms de médicaments, les marques de produits, les procédures médicales, les maladies, les types de médecin ou la terminologie liée à la COVID-19. Les cas d'utilisation courants comprennent les conversations entre un patient et un médecin (par exemple, un médecin, une infirmière ou un pharmacien).

Le nouveau modèle est installé à partir de la ressource personnalisée de services d'orthophonie en définissant enWwMedicalTelephony sur enabled: true. Le modèle est disponible pour tous les dialectes anglais pris en charge : australien, indien, britannique et américain.

  • Le modèle prend en charge la personnalisation des modèles de langue et les grammaires comme fonctionnalité bêta.
  • Il prend en charge la plupart des mêmes paramètres que le modèle en-US_Telephony.
  • Il ne prend pas en charge les paramètres suivants : low_latency, profanity_filter, redaction et speaker_labels.
  • À l'étape actuelle, il ne prend pas en charge smart_formatting for IBM Cloud Pak for Data.

Pour plus d'informations, voir Le modèle de téléphonie médical anglais.

Mise à jour du modèle zh-CN_Telephony chinois

Le modèle chinois de nouvelle génération zh-CN_Telephony a été mis à jour pour améliorer la reconnaissance vocale. Le modèle continue de prendre en charge le faible temps d'attente. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance vocale. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Si vous disposez de modèles de langue personnalisés basés sur le modèle mis à jour, vous devez mettre à niveau vos modèles personnalisés existants afin de tirer parti des mises à jour à l'aide de la méthode POST /v1/customizations/{customization_id}/upgrade_model. Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Mise à jour vers le modèle japonais ja-JP_Multimedia pour la prise en charge du faible temps d'attente

Le modèle japonais de nouvelle génération ja-JP_Multimedia prend désormais en charge le faible temps d'attente. Vous pouvez utiliser le paramètre low_latency avec les demandes de reconnaissance vocale qui utilisent le modèle. Il n'est pas nécessaire de mettre à niveau des modèles personnalisés basés sur le modèle de base japonais mis à jour. Pour plus d'informations sur les modèles de nouvelle génération et les faibles temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

11 février 2022 (version 4.0.5)

Correction d'un défaut : Amélioration de la documentation relative à la mise à jour du modèle personnalisé et à la version du modèle de base

Correctif : La documentation décrivant la mise à niveau des modèles personnalisés et des chaînes de version utilisées pour différentes versions des modèles de base a été mise à jour. La documentation indique maintenant que la mise à niveau pour la personnalisation du modèle de langue s'applique également aux modèles de nouvelle génération. De plus, les chaînes de version qui représentent différentes versions des modèles de base ont été mises à jour. Le paramètre base_model_version peut également être utilisé avec des modèles de nouvelle génération mis à niveau.

Pour plus d'informations sur la mise à niveau du modèle personnalisé, lorsque la mise à niveau est nécessaire, et sur l'utilisation des anciennes versions de modèles personnalisés, voir

Correction d'un défaut : Mise à jour de la documentation sur les majuscules

Correctif : La documentation décrivant la mise en majuscules automatique des scripts a été mise à jour. Le service met en majuscules les noms appropriés uniquement pour les langues et modèles suivants :

  • Tous les modèles en anglais américains de génération précédente
  • Le modèle allemand de la nouvelle génération

Pour plus d'informations, voir Capitalisation.

31 janvier 2022 (version 4.0.5)

La version 4.0.5 a été mise à jour

Speech to Text for IBM Cloud Pak for Data version 4.0.5 a été mis à jour pour traiter les problèmes d'installation. La version du package de cas est à présent 4.0.6. Utilisez ce package à la place de la version 4.0.5. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Important : les étapes supplémentaires pour l'installation en miroir ne sont plus nécessaires

Important : la note sur l'édition du 26 janvier 2022 inclut des notes importantes pour les étapes suivantes :

  • Étape supplémentaire pour effectuer une installation en miroir du magasin de données Minio
  • Étapes supplémentaires pour l'installation en miroir de nouveaux modèles de nouvelle génération

Ces étapes supplémentaires ne sont plus nécessaires. Le package de cas a été mis à jour pour corriger les problèmes d'installation.

26 janvier 2022 (version 4.0.5)

La version 4.0.5 est maintenant disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.5 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Important : étape supplémentaire pour effectuer une installation en miroir du magasin de données Minio

Important : ces étapes ne sont plus nécessaires si vous installez le package de cas 4.0.6. Pour plus d'informations, voir 31 janvier 2022(Version 4.0.5).

Si vous effectuez une installation en miroir (par exemple, dans un environnement isolé), vous devez effectuer une étape supplémentaire Avant en effectuant l'une des opérations suivantes :

Cette étape est obligatoire pour copier les images nécessaires pour le magasin de données Minio :

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

Le défaut d'exécution de cette étape entraîne des erreurs d'installation pour Speech to Text et Text to Speech.

Important : étapes supplémentaires pour l'installation en miroir de nouveaux modèles de nouvelle génération

Important : ces étapes ne sont plus nécessaires si vous installez le package de cas 4.0.6. Pour plus d'informations, voir 31 janvier 2022(Version 4.0.5).

Si vous effectuez une installation en miroir (par exemple, pour un environnement isolé) et que vous prévoyez d'installer l'un des nouveaux modèles de nouvelle génération pour Speech to Text (pour plus d'informations, voir la note sur l'édition ultérieure), vous devez effectuer une étape supplémentaire au préalable en effectuant l'une des opérations suivantes :

Chaque étape supplémentaire est unique au modèle en cours d'installation. Si vous installez plusieurs nouveaux modèles, exécutez la commande indiquée pour chaque modèle que vous installez.

  • Pour le modèle de téléphonie chinois (zh-CN_Telephony) :

    echo 'cp.icr.io,cp/watson-speech/zh-cn-telephony,2022-01-05-405models,sha256:52af6dfccd64ccd81b409936442a51a71f4ee96d980e1fc6a343a05bd4ed7fbc,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Pour le modèle de téléphonie espagnol pour l'Amérique latine (es-LA_Telephony) :

    echo 'cp.icr.io,cp/watson-speech/es-la-telephony,2022-01-05-405models,sha256:58e8c04abe9659472e89bf0778b7dc66e0ddceb4ea18d9d3e048a08c72125ea2,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Pour le modèle multimédia en anglais australien (en-AU_Multimedia) :

    echo 'cp.icr.io,cp/watson-speech/en-au-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Pour le modèle multimédia en anglais britannique (en-GB_Multimedia) :

    echo 'cp.icr.io,cp/watson-speech/en-gb-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
Le serveur de licences est désormais installé automatiquement

L'opérateur des services Speech installe automatiquement le serveur de licences requis lorsqu'il installe les services Speech. Vous n'avez plus besoin d'installer le serveur de licences à partir des services de base IBM Cloud Pak for Data, ni d'utiliser du contenu YAML supplémentaire pour créer une OperandRequest avec les liaisons nécessaires.

Suppression des étapes spécifiques au serveur PostgreSQL EnterpriseDB

La version précédente de la documentation incluait des étapes pour le serveur PostgreSQL EnterpriseDB qui étaient spécifiques aux services Speech Ces étapes ont été documentées dans les rubriques Mise à niveau de Watson Speech to Text (version 4.0) et Désinstallation de Watson Speech to Text. Ces étapes supplémentaires ne sont plus nécessaires et ont été supprimées de la documentation.

Le magasin de données RabbitMQ est désormais utilisé uniquement par le composant sttAsync

Le magasin de données RabbitMQ était précédemment utilisé par les composants des services Speech, Speech to Text et Text to Speech. Il gère maintenant la mise en file d'attente des messages non persistants pour le composant HTTP asynchrone Speech to Text (sttAsync) uniquement. Il n'est utilisé que si le composant sttAsync est installé et activé.

Nouveaux modèles de nouvelle génération

Le service prend désormais en charge les modèles de nouvelle génération suivants avec Speech to Text for IBM Cloud Pak for Data :

  • Modèle de téléphonie en chinois (mandarin) (zh-CN_Telephony). Le nouveau modèle prend en charge le faible temps d'attente.
  • Modèle multimédia en anglais (Australian) (en-AU_Multimedia). Le nouveau modèle ne prend pas en charge le faible temps d'attente.
  • Modèle multimédia en anglais (R.-U.) (en-GB_Multimedia). Le nouveau modèle ne prend pas en charge le faible temps d'attente.
  • Modèle de téléphonie en espagnol (Amérique latine) (es-LA_Telephony). Le nouveau modèle prend en charge le faible temps d'attente.

Remarque : Le modèle en espagnol d'Amérique latine, es-LA_Telephony, s'applique à tous les dialectes latino-américains. C'est l'équivalent des modèles de génération précédente disponibles pour les dialectes argentins, chiliens, colombiens, mexicains et péruviens. Si vous avez utilisé un modèle de génération précédente pour l'un de ces dialectes spécifiques, utilisez le modèle es-LA_Telephony pour migrer vers le modèle de nouvelle génération équivalent.

Les nouveaux modèles sont en disponibilité générale pour la reconnaissance vocale. Ils sont en disponibilité générale pour la personnalisation du modèle de langue et la version bêta pour les grammaires. Ils ne sont pas pris en charge pour la personnalisation du modèle acoustique.

  • Important : Si vous effectuez une installation en miroir (par exemple, dans un environnement isolé) et que vous prévoyez d'installer l'un des nouveaux modèles de nouvelle génération pour Speech to Text, vous devez exécuter des étapes supplémentaires au préalable en mettant en miroir les images. Pour plus d'informations, voir la note sur la version précédente.
  • Pour plus d'informations sur l'utilisation de la ressource personnalisée pour installer des modèles, voir Installation de Watson Speech to Text.
  • Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.
  • Pour plus d'informations sur la prise en charge de la personnalisation pour les modèles de nouvelle génération, voir Prise en charge de la personnalisation pour les modèles de nouvelle génération.
Les modèles en anglais américain de nouvelle génération sont désormais installés par défaut

Les modèles en anglais américain de nouvelle génération, en-US_Multimedia et en-US_Telephony, sont désormais installés par défaut avec Speech to Text for IBM Cloud Pak for Data. Ces modèles rejoignent les modèles en-US_BroadbandModel, en-US_NarrowbandModel, en-US_ShortForm_NarrowbandModel, qui sont installés par défaut. Les modèles disposent désormais des entrées suivantes dans la ressource personnalisée Speech services :

########################################
# Speech to Text next-generation models
########################################
      enUsMultimedia:    # US English (en-US) Multimedia model
        enabled: true
      enUsTelephony:     # US English (en-US) Telephony model
        enabled: true

For more information about using the custom resource to install models, see Installing Watson Speech to Text.

Vulnérabilités de sécurité résolues

Les vulnérabilités de sécurité suivantes associées à Apache Log4j ont été corrigées:

20 décembre 2021 (version 4.0.4)

La version 4.0.4 est maintenant disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.4 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Important : modifications des propriétés pour la désactivation du stockage et la consignation des données utilisateur

Important : les noms des propriétés de la ressource personnalisée des services Speech qui indiquent si les données utilisateur sont stockées et consignées ont été modifiées. La ressource personnalisée contenait auparavant les propriétés suivantes :

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Ces propriétés sont désormais nommées comme suit :

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Si vous avez déjà défini ces propriétés dans votre ressource personnalisée pour remplacer la valeur par défaut false par true, vous devez modifier votre ressource personnalisée. Vous devez remplacer manuellement les noms des propriétés par les nouvelles valeurs et sauvegarder la ressource personnalisée mise à jour. Pour plus d'informations, voir Installation de Watson Speech to Text.

Important : modifications apportées aux propriétés de l'objet secret PostgreSQL

Important : lorsque vous installez les services Speech, un objet contenant un mot de passe généré de manière aléatoire pour le magasin de données PostgreSQL est créé par défaut. Vous pouvez choisir de spécifier le mot de passe manuellement. Si vous le faites, les propriétés du fichier YAML de l'objet secret ont changé. Pour plus d'informations, voir la rubrique relative à la gestion de vos magasins de données dans Administration de Watson Speech to Text.

Important : les pods PostgreSQL ne démarrent pas avec l'opérateur EnterpriseDB version 1.10

Important : avec Speech to Text for IBM Cloud Pak for Data version 4.0.3, les pods PostgreSQL basés sur l'opérateur EnterpriseDB version 1.10 peuvent ne pas démarrer. Cela empêche le lancement des services Speech. Une solution palliative existe pour ce problème. Si vos services Speech ne démarrent pas, consultez PostgreSQL pods do not start with EnterpriseDB version 1.10 operator pour obtenir des informations sur le diagnostic et la résolution du problème.

Ce problème est résolu dans Speech to Text for IBM Cloud Pak for Data version 4.0.4.

Nouveau support de la classe de stockage Native Container IBM Spectrum Scale

Depuis la version 4.0.3, les services Speech prennent en charge la classe de stockage IBM Spectrum® Scale Container Native Pour utiliser IBM Spectrum Scale, indiquez "ibm-spectrum-scale-sc" pour la propriété storageClass de la ressource personnalisée des services Speech. Pour plus d'informations, voir Installation de Watson Speech to Text.

Interaction des services Speech avec le magasin de données MinIO lors de l'installation

Les composants d'exécution des services Speech, sttRuntime et ttsRuntime, ne peuvent pas démarrer tant que les modèles et les voix des services ne sont pas entièrement téléchargés dans le magasin de données MinIO. Lors de l'installation, les services risquent d'échouer et de redémarrer automatiquement une ou plusieurs fois jusqu'à ce que le téléchargement des modèles et des voix soit terminé. Ensuite, ils démarrent correctement. Aucune action de l'utilisateur n'est requise.

Correction d'un défaut : Correction de la documentation relative à la mise à niveau

**Correctif : ** la documentation de la mise à niveau des services Speech vers les nouvelles versions de IBM Cloud Pak for Data version 4.0.x inclut des références incorrectes dans certaines commandes. Ces références sont maintenant correctes :

  • Les chaînes watsonSpeechToTextStatus et watsonTextToSpeechStatus ont été remplacées par speechStatus dans les deux cas.
  • Les chaînes status.watsonSpeechToTextVersion et status.watsonTextToSpeechVersion ont été remplacées par .spec.version dans les deux cas.

Pour plus d'informations, voir Mise à niveau de Watson Speech to Text.

Important : les modèles de langue personnalisés basés sur certains modèles de nouvelle génération doivent être recréés

Important : Si vous avez créé des modèles de langue personnalisés basés sur certains modèles de nouvelle génération, vous devez recréer les modèles personnalisés. Tant que vous ne recréez pas les modèles de langue personnalisés, les demandes de reconnaissance vocale qui tentent d'utiliser les modèles personnalisés échouent avec le code d'erreur HTTP 400.

Vous devez recréer des modèles de langue personnalisés que vous avez créés à partir des versions suivantes des modèles de nouvelle génération :

  • Pour le modèle en-AU_Telephony, personnalisez les modèles que vous avez créés de en-AU_Telephony.v2021-03-03 à en-AU_Telephony.v2021-10-04.
  • Pour le modèle en-GB_Telephony, personnalisez les modèles que vous avez créés de en-GB_Telephony.v2021-03-03 à en-GB_Telephony.v2021-10-04.
  • Pour le modèle en-US_Telephony, personnalisez les modèles que vous avez créés de en-US_Telephony.v2021-06-17 à en-US_Telephony.v2021-10-04.
  • Pour le modèle en-US_Multimedia, personnalisez les modèles que vous avez créés de en-US_Multimedia.v2021-03-03 à en-US_Multimedia.v2021-10-04.

Pour identifier la version d'un modèle sur lequel est basé un modèle de langue personnalisé, utilisez la méthode GET /v1/customizations pour répertorier tous vos modèles de langue personnalisés ou la méthode GET /v1/customizations/{customization_id} pour répertorier un modèle de langue personnalisé spécifique. La zone versions de la sortie affiche le modèle de base d'un modèle de langue personnalisé. Pour plus d'informations, voir Affichage de la liste des modèles de langue personnalisés.

Pour recréer un modèle de langue personnalisé, crée d'abord un nouveau modèle personnalisé. Ajoutez ensuite tous les corpus et mots personnalisés du modèle personnalisé précédent au nouveau modèle. Vous pouvez ensuite supprimer le modèle personnalisé précédent. Pour plus d'informations, voir Création d'un modèle de langue personnalisé.

Mises à jour de plusieurs modèles de nouvelle génération pour une meilleure reconnaissance vocale

Les modèles de nouvelle génération suivants ont été mis à jour pour améliorer la reconnaissance vocale :

  • Modèle de téléphonie en anglais australien (en-AU_Telephony)
  • Modèle de téléphonie en anglais britannique (en-GB_Telephony)
  • Modèle multimédia en anglais américain (en-US_Multimedia)
  • Modèle de téléphonie en anglais américain (en-US_Telephony)
  • Modèle de téléphonie en castillan (es-ES_Telephony)

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Nouvelle prise en charge de la grammaire en version bêta pour les modèles de nouvelle génération

La prise en charge de la grammaire est désormais disponible en version bêta pour tous les modèles de nouvelle génération disponibles. Tous les modèles de nouvelle génération sont en disponibilité générale (GA) et prennent en charge la personnalisation du modèle de langue. Pour plus d'informations, consultez les rubriques suivantes :

Nouvelle zone custom_acoustic_model pour les fonctions prises en charge

Les méthodes GET /v1/models et GET /v1/models/{model_id} indiquent désormais si un modèle prend en charge la personnalisation de modèle acoustique. L'objet SupportedFeatures inclut désormais une zone supplémentaire, custom_acoustic_model, une valeur booléenne de true pour un modèle prenant en charge la personnalisation de modèle acoustique et de false dans le cas contraire. Actuellement, la zone a une valeur true pour tous les modèles de génération précédente et false pour tous les modèles de nouvelle génération.

Vulnérabilité de sécurité résolue

La vulnérabilité de sécurité suivante associée à Apache Log4j a été corrigée:

20 décembre 2021 (Version 1.2.x)

Important : vous ne pouvez plus installer Speech to Text version 1.2.x sur IBM Cloud Pak for Data version 3.5

Important : vous ne pouvez plus faire de nouvelles installations de Speech to Text version 1.2.x sur IBM Cloud Pak for Data version 3.5. Vous pouvez installer uniquement Speech to Text version 4.0.x sur IBM Cloud Pak for Data version 4.x. Pour plus d'informations, voir Installation de Watson Speech to Text.

Les services Speech pour IBM Cloud Pak for Data version 3.5 atteignent leur date de fin de support le 30 avril 2022. Vous êtes invité à effectuer une mise à niveau vers la version la plus récente de la version 4.0.x des services à votre convenance. Pour plus d'informations, voir Mise à niveau de Watson Speech to Text.

30 novembre 2021 (version 4.0.3)

La version 4.0.3 est maintenant disponible

Speech to Text for IBM Cloud Pak for Data version 4.0.3 est désormais disponible. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift versions 4.6 et 4.8. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de Watson Speech to Text.

Le serveur de licences est désormais un prérequis obligatoire

Vous devez à présent installer le serveur de licences à partir des services de base IBM Cloud Pak for Data . Vous devez installer le serveur de licences en utilisant le contenu YAML fourni pour créer une OperandRequest avec les liaisons nécessaires. Vous devez également installer le service de licence dans le même espace de nom que le service (opérande), qui est également l'emplacement où IBM Cloud Pak for Data est installé. Pour plus d'informations, voir Installation de Watson Speech to Text.

Nouvelle prise en charge de la mise à niveau en place

Le service prend désormais en charge la mise à niveau en place, basée sur l'opérateur, de la version 4.0.0 à la version 4.0.3. Le passage de IBM Cloud Pak for Data version 3.5 à la version 4.0.3 nécessite toujours l'utilisation des utilitaires de migration. Pour plus d'informations, voir Mise à niveau de Watson Speech to Text.

Modifications de l'installation de l'opérateur EDB PostgreSQL et de la licence

L'installation, la mise à niveau et la désinstallation de l'opérateur PostgreSQL Enterprise DB et de la licence ont changé :

  • Les instructions d'installation de l'opérateur et de la licence EDB PostgreSQL sont désormais incluses avec les services de base IBM Cloud Pak for Data. Les instructions d'installation des services Speech ont été mises à jour en conséquence. Pour plus d'informations, voir Installation de Watson Speech to Text.
  • Les instructions de mise à niveau de Speech to Text de la version 4.0.0 à la version 4.0.3 incluent des instructions de désinstallation de l'opérateur et de la licence EDB PostgreSQL précédents et de réinstallation de ces derniers avec les services de base IBM Cloud Pak for Data. Pour plus d'informations, voir Mise à niveau de Watson Speech to Text.
  • Les instructions de désinstallation des services d'orthophonie incluent désormais les étapes permettant de supprimer l'opérateur et la licence EDB PostgreSQL précédemment installés avec Speech to Text. Pour plus d'informations, voir Désinstallation de Watson Speech to Text.
Nouvelles instructions pour la mise à l'échelle de votre installation

Le service fournit maintenant des conseils à jour sur la mise à l'échelle de votre installation. Les informations incluent la spécification du nombre de pods, le nombre d'UC allouées par pod et le nombre maximal de sessions simultanées avec des modèles de génération précédente et de nouvelle génération. Pour plus d'informations, voir Administration de Watson Speech to Text.

Mises à jour de ligne de commande pour les utilitaires d'importation et d'exportation

Les commandes utilisées avec les utilitaires d'importation et d'exportation pour les services Speech incluent de nouveaux options et arguments. Les utilitaires d'importation et d'exportation constituent également la base de la sauvegarde et de la restauration des services et de la migration de IBM Cloud Pak for Data version 3.5 vers la version 4.0.3. Pour plus d'informations sur l'utilisation des utilitaires, voir

Nouvelle propriété permettant de spécifier des UC pour l'entraînement de modèles acoustiques

Le microservice sttAMPatcher gère la personnalisation des modèles acoustiques pour le service. Le correcteur de modélisation agile utilise un nombre dédié d'unités centrales pour traiter les demandes. Vous pouvez utiliser la nouvelle propriété sttAMPatcher.resources.requestsCPU pour augmenter le nombre d'unités centrales dédiées à la gestion des demandes d'entraînement de modèles acoustiques par l'AM Patcher. Cela peut s'avérer nécessaire si vous rencontrez des échecs d'entraînement lors de l'entraînement d'un modèle acoustique. Pour plus d'informations, voir Installation de Watson Speech to Text.

Nouveaux modèles de nouvelle génération

Le service prend désormais en charge les nouveaux modèles de langue de nouvelle génération suivants. Tous les nouveaux modèles sont en disponibilité générale.

  • Tchèque : cs-CZ_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Belge néerlandais (flamand) : nl-BE_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Français : fr-FR_Multimedia. Le nouveau modèle ne prend pas en charge le faible temps d'attente.
  • Anglais (Inde) : en-IN_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Hindi (Inde) : hi-IN_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Japonais : ja-JP_Multimedia. Le modèle ne prend pas en charge le faible temps d'attente.
  • Coréen : ko-KR_Multimedia. Le modèle ne prend pas en charge le faible temps d'attente.
  • Coréen : ko-KR_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Néerlandais (Pays-Bas) : nl-NL_Telephony. Le modèle prend en charge le faible temps d'attente.

Pour plus d'informations sur tous les modèles de nouvelle génération et sur le faible temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

Mises à jour des modèles de nouvelle génération

Les modèles de nouvelle génération suivants ont été mis à jour pour améliorer la reconnaissance vocale. Tous les modèles sont en disponibilité générale.

  • Arabe : ar-MS_Telephony. Le modèle prend désormais en charge le faible temps d'attente.
  • Portugais (Brésil) : pt-BR_Telephony. Le modèle continue de prendre en charge le faible temps d'attente.
  • Anglais (US) : en-US_Telephony. Le modèle continue de prendre en charge le faible temps d'attente.
  • Français (Canada) : fr-CA_Telephony. Le modèle prend désormais en charge le faible temps d'attente.
  • Italien : it-IT_Telephony. Le modèle prend désormais en charge le faible temps d'attente.

Pour plus d'informations sur tous les modèles de nouvelle génération et sur le faible temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

Correction d'un défaut : Traiter les défaillances asynchrones de HTTP

Correctif : L'interface HTTP asynchrone n'a pas pu transcrire certains fichiers audio. En outre, le rappel de la demande a renvoyé le statut recognitions.completed_with_results au lieu de recognitions.failed. Cette erreur a été résolue.

Correction d'incident: amélioration des résultats de l'étiquetage des haut-parleurs

Correctif : Lorsque vous utilisez des étiquettes d'orateur avec des modèles de nouvelle génération, le service identifie désormais l'orateur pour tous les mots de l'audio en entrée, y compris les mots très courts qui ont les mêmes horodatages de début et de fin.

Correction d'un défaut : Mise à jour des résultats intermédiaires et de la documentation sur la faible latence

Correctif : La documentation qui décrit les résultats provisoires et les caractéristiques de faible temps d'attente avec les modèles de nouvelle génération a été réécrite pour plus de clarté et de correction. Pour plus d'informations, consultez les rubriques suivantes :

Correction d'un défaut : Correction de la documentation sur le multitenancy

Correctif d'incident: La rubrique Prise en charge de la multilocation de IBM Cloud Pak for Data indique à tort que les services vocaux ne prennent pas en charge la multilocation. La rubrique a été mise à jour pour indiquer que les services Speech prennent en charge les opérations suivantes :

  • Installer le service dans des projets distincts
  • Installer le service plusieurs fois dans le même projet
  • Installer le service une fois et déployer plusieurs instances dans le même projet

La documentation qui est propre aux services Speech mentionnait correctement le support multilocation.

1 octobre 2021 (Version 1.1.x)

La version 1.1.x est hors service
Speech to Text et Text to Speech for IBM Cloud Pak for Data version 1.1.x sont hors service depuis le 30 septembre 2021. Depuis le 1er octobre 2021, la documentation de la version 1.1.x n'est plus disponible. Pour plus d'informations, voir Retrait de logiciels et interruption du support.

31 août 2021 (Version 4.0.0)

Tous les modèles de nouvelle génération sont maintenant en disponibilité générale

Tous les modèles de langue de la prochaine génération sont maintenant en disponibilité générale (GA). Leur utilisation dans les environnements de production et les applications est prise en charge.

La personnalisation du modèle de langue pour les modèles de nouvelle génération est maintenant en disponibilité générale

La personnalisation du modèle de langue est désormais en disponibilité générale (GA) pour toutes les langues et tous les modèles de nouvelle génération disponibles. La personnalisation du modèle de langue pour les modèles de nouvelle génération est prise en charge pour l'utilisation dans les environnements de production et les applications.

Vous utilisez les mêmes commandes pour créer, gérer et utiliser des modèles de langue personnalisés, des corpus et des mots personnalisés pour les modèles de nouvelle génération, comme vous le faites pour les modèles de génération précédente. Cependant, la personnalisation des modèles de nouvelle génération fonctionne différemment de la personnalisation des modèles de génération précédente. Pour les modèles personnalisés basés sur des modèles de nouvelle génération :

  • Les modèles personnalisés n'ont pas de concept de mots hors vocabulaire (OOV).
  • Les mots des corpus ne sont pas ajoutés à la ressource de mots.
  • Vous ne pouvez pas utiliser la fonction de consonance pour les mots personnalisés.
  • Il n'est pas nécessaire de mettre à niveau des modèles personnalisés lorsque les modèles de langue de base sont mis à jour.
  • Les grammaires ne sont pas prises en charge actuellement.

Pour plus d'informations sur l'utilisation de la personnalisation du modèle de langue des modèles de nouvelle génération, voir

Les rubriques supplémentaires décrivent la gestion des modèles de langue personnalisés, des corpus et des mots personnalisés.

29 juillet 2021 (Version 4.0.0)

Version 4.0.0 est disponible

IBM Watson® Speech to Text for IBM Cloud Pak® for Data version 4.0.0 est désormais disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data version 4.x et Red Hat OpenShift version 4.6. Pour plus d'informations sur l'installation et la gestion du service, voir Installation de IBM Watson Speech to Text for IBM Cloud Pak for Data.

Nouveaux modèles de langue de nouvelle génération

Le service prend désormais en charge un nombre croissant de modèles de langue de nouvelle génération. Les modèles Multimédia et Téléphonie de nouvelle génération améliorent les capacités de reconnaissance vocale de la génération précédente de modèles à large bande et à bande étroite du service. Les nouveaux modèles exploitent les réseaux neuronaux profonds et l'analyse bidirectionnelle pour atteindre à la fois un débit plus élevé et une plus grande précision de transcription.

À ce stade, les modèles de langue de nouvelle génération et le paramètre low_latency sont des fonctionnalités bêta. Les modèles de nouvelle génération prennent en charge un nombre limité de langues et de fonctions de reconnaissance vocale. Les langues, modèles et fonctionnalités pris en charge augmenteront avec les versions ultérieures.

De nombreux modèles de nouvelle génération prennent également en charge un nouveau paramètre low_latency qui vous permet de demander des résultats plus rapides aux dépens de la qualité de la transcription. Lorsque le faible temps d'attente est activé, le service limite son analyse de l'audio, ce qui peut réduire l'exactitude de la transcription. Ce compromis peut être acceptable si votre application requiert moins de temps de réponse que la plus grande précision possible.

Le paramètre low_latency affecte votre utilisation du paramètre interim_results avec l'interface WebSocket. Les résultats provisoires sont disponibles uniquement pour les modèles de nouvelle génération qui prennent en charge le faible temps d'attente et uniquement si les paramètres interim_results et low_latency sont définis sur true.

Le modèle à large bande en langue arabe a été renommé

Le modèle à large bande en langue arabe est désormais nommé ar-MS_BroadbandModel. L'ancien nom ar-AR_BroadbandModel est obsolète. Il continuera de fonctionner pendant au moins un an, mais pourrait être supprimé à une date ultérieure. Nous vous encourageons à migrer vers le nouveau nom dès que vous le souhaitez.

Documentation unifiée de Speech to Text

La documentation de IBM Watson Speech to Text for IBM Cloud Pak for Data est désormais combinée avec la documentation des instances gérées du service Speech to Text qui sont hébergées sur IBM Cloud. C'est le cas du guide et de la documentation de référence pour les deux formes de service. Liens vers la version précédente de la documentation IBM Cloud Pak for Data pour la redirection de service vers la documentation unifiée.

Pour plus d'informations sur l'identification des informations relatives à une seule version du produit, voir À propos de Speech to Text.

Correctif d'incident: amélioration de la documentation

Correction d'un défaut : La documentation a été mise à jour pour corriger les informations suivantes :

  • La documentation n'a pas indiqué que les modèles de nouvelle génération ne produisent pas de marqueurs d'hésitation. La documentation a été mise à jour pour indiquer que seuls les modèles de génération précédente produisent des marqueurs d'hésitation. Les modèles de la prochaine génération incluent les hésitations réelles dans les résultats de la transcription. Pour plus d'informations, voir Speech hesitations and hésitation marqueurs.
  • La documentation indiquait à tort que l'utilisation du paramètre smart_formatting entraîne la suppression des marqueurs d'hésitation des résultats finaux de la transcription pour le japonais. Le formatage intelligent ne supprime pas les marqueurs d'hésitation des résultats finaux pour le japonais, mais uniquement pour l'anglais américain. Pour plus d'informations, voir Quelles sont les résultats affectés par le formatage intelligent ?
La version 1.1.x est hors service

Speech to Text et Text to Speech for IBM Cloud Pak for Data version 1.1.x ont été mis hors service le 30 septembre 2021. Vous deviez effectuer une mise à niveau vers une version ultérieure des services sous IBM Cloud Pak for Data avant cette date. Au 1er octobre 2021, la documentation de la version 1.1.4 n'était plus disponible.

12 avril 2021 (version 1.2.1)

Ajout au fichier speech-override.yaml

Le fichier speech-override.yaml minimal inclut une définition supplémentaire, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} est le chemin d'accès au registre Docker interne. Il doit s'agir de image-registry.openshift-image-registry.svc:5000/{namespace}, où {namespace} est l'espace de nom dans lequel IBM Cloud Pak® for Data est installé, normalement zen.

9 avril 2021 (version 1.2.1)

Prise en charge de la modification des modèles et des voix installés
Les services Speech vous permettent d'ajouter ou de supprimer des modèles et des voix installés pour la version 1.2 ou 1.2.1 des services.

Version 1.2.1 (26 mars 2021)

La version 1.2.1 est disponible

Speech to Text for IBM Cloud Pak for Data version 1.2.1 est désormais disponible. Les versions 1.2 et 1.2.1 utilisent la même documentation et les mêmes instructions d'installation de la version 1.2. La version 1.2.1 prend en charge l'installation sous Red Hat OpenShift version 4.6 en plus des versions 4.5 et 3.11.

Nouvelles instructions d'installation

Pour les deux clusters connectés à Internet et les clusters isolés, les instructions d'installation incluent les étapes suivantes :

  • Utilisez la commande oc label pour configurer les libellés requis pour l'espace de nom où IBM Cloud Pak for Data est installé.
  • Utilisez la commande oc project pour pointez vers le projet OpenShift correct.
  • Utilisez la commande cpd-cli install pour installer un serveur Enterprise DB PostgreSQL utilisé par les services Speech.

Vous effectuez ces étapes avant d'installer les services Speech.

Nouvelles instructions de désinstallation

Une étape a été ajoutée à la procédure de désinstallation des services Speech pour nettoyer toutes les ressources de l'installation.

Registre autorisé pour le magasin de données PostgreSQL

Le chemin de registre autorisé à partir duquel le service extrait des images pour le magasin de données PostgreSQL a été modifié. L'emplacement cp.icr.io/cp/watson-speech du registre a été remplacé par cp.icr.io/cp/cpd. Ce changement est transparent pour les utilisateurs.

Secrets pour les magasins de données Minio et PostgreSQL

Les magasins de données Minio et PostgreSQL requièrent les valeurs codées suivantes pour leurs secrets :

  • Pour Minio, utilisez minio.
  • Pour PostgreSQL, utilisez user-provided-postgressql.

Vous ne pouvez pas utiliser vos propres valeurs pour ces secrets. Les secrets doivent être créés avant d'installer les services Speech.

Suppressions dans le fichier speech-override.yaml

Les entrées suivantes ont été supprimées du fichier speech-override.yaml. Elles ont été ajoutés pour résoudre un problème qui est maintenant résolu.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

Le fichier speech-override.yaml abrégé a généralement été réduit davantage en ajustant son contenu aux éléments essentiels.

Version 1.2 (9 décembre 2020)

Version 1.2 est disponible

Speech to Text for IBM Cloud Pak for Data version 1.2 est désormais disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data versions 3.5 et 3.0.1, et Red Hat OpenShift versions 4.5 et 3.11.

Nouveaux modèles pour l'australien et le français canadien

Le service fournit désormais des modèles à large bande et à bande étroite pour l'anglais australien et le français canadien :

  • Anglais australien : en-AU_BroadbandModel et en-AU_NarrowbandModel
  • Français canadien : fr-CA_BroadbandModel et fr-CA_NarrowbandModel

Les nouveaux modèles sont généralement disponibles et ils prennent en charge la personnalisation du modèle de langue et du modèle acoustique.

Modèles mis à jour pour une meilleure reconnaissance vocale

Les modèles de langue suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Portugais brésilien : pt-BR_BroadbandModel et pt-BR_NarrowbandModel
  • Français : fr-FR_BroadbandModel
  • Allemand : de-DE_BroadbandModel et de-DE_NarrowbandModel
  • Japonais : ja-JP_BroadbandModel
  • Anglais britannique : en-GB_BroadbandModel et en-GB_NarrowbandModel
  • Anglais américain : en-US_ShortForm_NarrowbandModel

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Le paramètre split_transcript_at_phrase_end est désormais en disponibilité générale pour toutes les langues

Le paramètre de reconnaissance vocale split_transcript_at_phrase_end est désormais généralement disponible pour toutes les langues. Précédemment, il était disponible uniquement pour l'anglais américain et britannique. Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.

Le marqueur d'hésitation pour l'allemand a changé

Le marqueur d'hésitation utilisé pour les modèles allemands à large bande et à bande étroite mis à jour est passé de [hesitation] à %HESITATION. Pour plus d'informations sur les marqueurs d'hésitation, voir Hésitations et marqueurs d'hésitation.

Correction d'un défaut : Résolution du problème de latence pour les modèles comportant un grand nombre de grammaires

Correctif d'incident : Les modèles de langue personnalisés qui contiennent un grand nombre de grammaires ne sont plus affectés par le problème de temps d'attente. Lorsque ces modèles personnalisés sont initialement utilisés pour la reconnaissance vocale, leur chargement peut prendre plusieurs secondes. Désormais, leur chargement est beaucoup plus rapide, ce qui réduit considérablement le temps d'attente observé lorsqu'ils sont utilisés pour la reconnaissance.

15 juillet 2020 (version 1.1.4)

Red Hat OpenShift version 4.3 est hors service
La prise en charge de Red Hat OpenShift 4.3 par IBM Cloud Pak for Data 3.0.1 sera obsolète à compter du 1er septembre 2020. Red Hat OpenShift 4.3 ne fait plus partie du service depuis le 22 octobre 2020. IBM Cloud Pak for Data est en train d'introduire la prise en charge de Red Hat OpenShift 4.5. IBM Cloud Pak for Data recommande la mise à niveau des clients vers Red Hat OpenShift 4.5 avant le 22 octobre 2020. Le support IBM travaillera avec les clients qui disposent déjà d'IBM Cloud Pak for Data 3.0.1 sur Red Hat OpenShift 4.3. Il est demandé aux nouveaux clients qui souhaitent effectuer l'installation sur Red Hat OpenShift 4.x d'installer Red Hat OpenShift 4.5.

19 juin 2020 (version 1.1.4)

La version 1.1.4 est disponible

Speech to Text for IBM Cloud Pak for Data version 1.1.4 est désormais disponible. L'installation et l'administration du service incluent de nombreux changements. Cette version prend en charge IBM Cloud Pak for Data versions 2.5 et 3.0.1, et Red Hat OpenShift versions 3.11 et 4.3. Pour plus d'informations sur l'installation et la gestion du service, voir Installation et gestion de Speech to Text pour IBM Cloud Pak for Data.

Nouveaux paramètres pour contrôler le niveau de détection de l'activité vocale

Le service offre désormais deux nouveaux paramètres facultatifs pour contrôler le niveau de détection d'activité vocale. Les paramètres peuvent vous aider à faire en sorte que seules les données audio pertinentes soient traitées pour la reconnaissance vocale.

  • Le paramètre speech_detector_sensitivity ajuste la sensibilité de la détection d'activité vocale. Vous pouvez utiliser ce paramètre pour supprimer les insertions de mots à partir d'une musique, d'une toux et d'autres événements non vocaux.
  • Le paramètre background_audio_suppression supprime le fond sonore en fonction de son volume pour l'empêcher d'être transcrit ou d'interférer avec la reconnaissance vocale. Vous pouvez utiliser ce paramètre pour supprimer des conversations annexes ou d'autres bruits de fond.

Vous pouvez utiliser ces paramètres individuellement ou conjointement. Ils sont disponibles pour toutes les interfaces et pour la plupart des modèles de langue. Pour plus d'informations sur les paramètres, les valeurs qui peuvent leur être affectées, et leur effet sur la qualité et le temps d'attente de la reconnaissance vocale, voir Détection d'activité vocale.

Nouveaux modèles à large bande et à bande étroite pour le néerlandais et l'italien

Le service prend désormais en charge des modèles à large bande et à bande étroite pour le néerlandais et l'italien :

  • Modèle néerlandais à large bande (nl-NL_BroadbandModel)
  • Modèle néerlandais à bande étroite (nl-NL_NarrowbandModel)
  • Modèle italien à large bande (it-IT_BroadbandModel)
  • Modèle italien à bande étroite (it-IT_NarrowbandModel)

Les modèles de langue néerlandais et italiens sont désormais disponibles en version GA pour la reconnaissance vocale et pour la personnalisation de modèle de langue et de modèle acoustique. Pour plus d'informations sur tous les modèles de langue disponibles, voir :

Prise en charge du paramètre speaker_labels pour l'allemand et le coréen

Le service prend désormais en charge les libellés de locuteur (le paramètre speaker_labels ) pour les modèles de langue allemands et coréens. Les étiquettes de locuteur identifient qui sont les différentes personnes qui parlent et les mots qu'elles prononcent dans un échange à plusieurs participants. Pour plus d'informations, voir Etiquettes de locuteur.

Meilleure reconnaissance vocale pour le modèle à bande étroite en japonais

Le modèle japonais à bande étroite (ja-JP_NarrowbandModel) inclut désormais des unités de mot multigramme pour les chiffres et les fractions décimales. Le service renvoie ces unités multigramme que le formatage intelligent soit activé ou non. La fonction de formatage intelligent comprend et renvoie les unités multigramme générées par le modèle. Si vous appliquez votre propre post-traitement aux résultats de la transcription, vous devez gérer ces unités de manière appropriée. Pour plus d'informations, voir la rubrique Japonais dans la documentation sur le formatage intelligent.

Sauvegarde et restauration simplifiées

Le service offre désormais des procédures de sauvegarde et de restauration nettement améliorées. A présent, des utilitaires sont disponibles pour vous permettre d'effectuer des sauvegardes à partir de vos magasins de données, ainsi, vous n'avez plus besoin de recréer toutes vos données lorsqu'un sinistre se produit. Pour plus d'informations, sauvegarder et restaurer Watson Données des services vocaux.

1er avril 2020 (version 1.1.3)

La personnalisation du modèle acoustique est désormais en disponibilité générale
La personnalisation de modèle acoustique est désormais disponible en version GA pour toutes les langues prises en charge. Pour plus d'informations sur la prise en charge des modèles de langue individuels, voir Support de langue pour la personnalisation.

28 février 2020 (Version 1.1.3)

Version 1.1.3 est disponible

Speech to Text for IBM Cloud Pak for Data version 1.1.3 est désormais disponible.

Nouveau paramètre end_of_phrase_silence_time

Pour la reconnaissance vocale, le service prend désormais en charge le paramètre end_of_phrase_silence_time. Le paramètre indique la durée de l'intervalle de pause auquel le service divise une transcription en plusieurs résultats finaux. Chaque résultat final indique une pause ou un silence prolongé qui dépasse l'intervalle de pause. Pour la plupart des langues, l'intervalle de pause par défaut est de 0,8 seconde. Pour le chinois, il est de 0,6 seconde.

Vous pouvez utiliser ce paramètre pour établir un équilibre entre la fréquence à laquelle un résultat final est produit et la précision de la transcription. Augmentez l'intervalle lorsque la précision est plus importante que le temps d'attente. Réduisez l'intervalle lorsque le locuteur est censé prononcer de courtes expressions ou des mots uniques.

Pour plus d'informations, voir Paramètre end_of_phrase_silence_time.

Nouveau paramètre split_transcript_at_phrase_end

Pour la reconnaissance vocale, le service prend désormais en charge le paramètre split_transcript_at_phrase_end. Ce paramètre demande au service de fractionner la transcription en plusieurs résultats finaux en fonction des caractéristiques sémantiques de l'entrée, par exemple à la fin des phrases. Le service base sa compréhension des caractéristiques sémantiques sur le modèle de langue de base que vous utilisez avec une demande. Les modèles de langue personnalisés et les grammaires peuvent également influencer le mode et l'endroit de la division d'une transcription par le service.

Lorsque ce paramètre est défini, le service ajoute une zone end_of_utterance à chaque résultat final pour indiquer la motivation de la division : full_stop, silence, end_of_data ou reset.

Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.

Paramètre speaker_labels amélioré

En ce qui concerne la reconnaissance vocale, le paramètre speaker_labels a été mis à jour pour améliorer l'identification de chaque intervenant pour une analyse plus approfondie de votre échantillon audio. Pour plus d'informations sur la fonction d'étiquettes de locuteur, voir Etiquettes de locuteur. Pour plus d'informations sur les améliorations apportées à la fonction, voir IBM Research AI Advances Speaker Diarization in Real Use Cases.

27 novembre 2019 (Version 1.1.2)

Version 1.1.2 est disponible
Speech to Text for IBM Cloud Pak for Data version 1.1.2 est désormais disponible.
Nombre maximal de modèles personnalisés
Vous ne pouvez pas créer plus de 1 024 modèles de langue personnalisés et pas plus de 1 024 modèles acoustiques personnalisés par données d'identification propriétaires. Pour plus d'informations, voir Nombre maximal de modèles personnalisés.

30 août 2019 (Version 1.0.1)

Version 1.0.1 est disponible

Speech to Text for IBM Cloud Pak for Data version 1.0.1 est désormais disponible. Le service fonctionne désormais avec IBM Cloud Pak for Data 2.1.0.1. Le service prend désormais en charge l'installation de IBM Cloud Pak for Data avec Red Hat OpenShift.

Nouveaux modèles à large bande et à bande étroite pour les dialectes espagnols

Le service propose désormais des modèles de langue à bande large et à bande étroite dans six dialectes espagnols :

  • Espagnol d'Argentine (es-AR_BroadbandModel et es-AR_NarrowbandModel)
  • Espagnol castillan (es-ES_BroadbandModel et es-ES_NarrowbandModel)
  • Espagnol du Chili (es-CL_BroadbandModel et es-CL_NarrowbandModel)
  • Espagnol de Colombie (es-CO_BroadbandModel et es-CO_NarrowbandModel)
  • Espagnol du Mexique (es-MX_BroadbandModel et es-MX_NarrowbandModel)
  • Espagnol du Pérou (es-PE_BroadbandModel et es-PE_NarrowbandModel)

Les modèles en espagnol castillan ne sont pas nouveaux. Ils sont généralement disponibles pour la reconnaissance vocale et la personnalisation des modèles de langue et en version bêta pour la personnalisation des modèles acoustiques.

Les modèles des cinq autres dialectes sont nouveaux et en version bêta pour toutes les utilisations. Comme ils sont en version bêta, ces dialectes supplémentaires peuvent ne pas être prêts pour une utilisation en production et sont sujets à modification. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.

Pour plus d'informations, voir les sections suivantes :

Support FISMA

Le support FISMA (Federal Information Security Management Act) est désormais disponible pour Speech to Text for IBM Cloud Pak for Data. Le service est prêt pour FISMA High.

28 juin 2019 (Version 1.0.0)

Version 1.0.0 est disponible

La version 1.0.0, l'édition initiale du service, est désormais disponible. Speech to Text for IBM Cloud Pak for Data est basé sur le service IBM Watson® Speech to Text sur le IBM Cloud public. Speech to Text for IBM Cloud Pak for Data diffère du service public Speech to Text des manières suivantes. Ces informations peuvent vous être utiles si vous connaissez déjà le service Speech to Text sur le IBM Cloud public.

  • Speech to Text for IBM Cloud Pak for Data utilise des jetons d'accès pour l'authentification. Pour plus d'informations, voir API & SDK reference.
  • Les noeuds finaux de Speech to Text for IBM Cloud Pak for Data sont spécifiques à votre cluster IBM Cloud Pak for Data. Pour plus d'informations, voir API & SDK reference.
  • Speech to Text for IBM Cloud Pak for Data n'effectue aucune demande de consignation. Vous n'avez pas besoin d'utiliser l'en-tête de demande X-Watson-Learning-Opt-Out.
  • Speech to Text for IBM Cloud Pak for Data ne prend pas en charge les jetons Watson. Vous ne pouvez pas utiliser l'en-tête de demande X-Watson-Authorization-Token pour l'authentification auprès du service.