Notes sur l'édition de Text to Speech for IBM Cloud

IBM Cloud

Les fonctionnalités et modifications suivantes ont été intégrées à chaque version et mise à jour des instances gérées d' IBM Watson® Text to Speech hébergées sur IBM Cloud ou des instances hébergées sur IBM Cloud Pak for Data as a Service. Sauf indication contraire, toutes les modifications sont rétrocompatibles et sont disponibles de manière automatique et transparente pour toutes les applications nouvelles et existantes.

Pour plus d'informations sur les limitations connues du service, voir Limitations connues.

Pour plus d'informations sur les mises à jour et les mises à jour du service pour IBM Cloud Pak for Data, voir Notes sur l'édition de Text to Speech for IBM Cloud Pak for Data.

15 mai 2026

Nouvelle voix féminine naturelle en portugais brésilien

Le service propose désormais une nouvelle voix féminine naturelle pour le portugais du Brésil :

  • pt-BR_IsabelaNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :

26 mars 2026

La transition vocale de v1 à v3 est obsolète

Les voix de concaténation standard ( v1 ) précédemment dépréciées sont désormais remplacées par leurs équivalents neuronaux ( v3 ) lors de la synthèse. Lorsqu'une demande spécifie l'une de ces voix v1, la voix v3 correspondante est utilisée à la place.

  • de-DE_BirgitVoice -> de-DE_BirgitV3Voice
  • de-DE_DieterVoice -> de-DE_DieterV3Voice
  • en-GB_KateVoice -> en-GB_KateV3Voice
  • en-US_AllisonVoice -> en-US_AllisonV3Voice
  • en-US_LisaVoice -> en-US_LisaV3Voice
  • en-US_MichaelVoice -> en-US_MichaelV3Voice
  • es-ES_EnriqueVoice -> es-ES_EnriqueV3Voice
  • es-ES_LauraVoice -> es-ES_LauraV3Voice
  • es-LA_SofiaVoice -> es-LA_SofiaV3Voice
  • es-US_SofiaVoice -> es-US_SofiaV3Voice
  • fr-FR_ReneeVoice -> fr-FR_ReneeV3Voice
  • it-IT_FrancescaVoice -> it-IT_FrancescaV3Voice
  • ja-JP_EmiVoice -> ja-JP_EmiV3Voice
  • pt-BR_IsabelaVoice -> pt-BR_IsabelaV3Voice

Si vous omettez le paramètre facultatif « voice » dans une requête de synthèse vocale, le service utilise désormais « en-US_MichaelV3Voice » par défaut. Cette voix neuronale ( v3 ) remplace la voix de concaténation standard par défaut ( v1 ), en-US_MichaelVoice.

11 mars 2026

Important : Dépréciation de la fonctionnalité Beta Tune by Example

La fonction bêta "Accorder par l'exemple" est obsolète. Les API permettant de créer de nouvelles invites ou de nouveaux modèles de haut-parleurs ne sont plus prises en charge.

  • Utilisateurs existants : Les personnalisations existantes qui contiennent déjà des invites ou des modèles de locuteurs continueront à fonctionner pour la synthèse vocale pendant une période limitée. Cependant, il n'est pas possible de créer de nouvelles invites ou de nouveaux modèles de haut-parleurs.
  • Nouveaux utilisateurs : Les API pour la création d'invites ou de modèles de haut-parleurs sont désactivées et ne peuvent pas être utilisées.

La fonction "Accorder par l'exemple" sera entièrement supprimée du service dans une prochaine version. Une fois supprimée, les synthèses utilisant des personnalisations qui s'appuient sur des invites ou des modèles de haut-parleurs ne seront plus prises en charge.

13 janvier 2026

New English Natural Voices (Voix naturelles en anglais)

Le service prend désormais en charge deux nouvelles voix naturelles, une masculine et une féminine, pour l'anglais australien :

  • en-AU_JackNatural
  • en-AU_HeidiNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :

5 décembre 2025

Nouvelles voix naturelles en espagnol latino-américain

Le service prend désormais en charge deux nouvelles voix naturelles, une masculine et une féminine, pour l'espagnol d'Amérique latine :

  • es-LA_AlejandroNatural
  • es-LA_DanielaNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :

31 octobre 2025

Nouvelles voix naturelles du portugais brésilien

Le service prend désormais en charge deux nouvelles voix naturelles - une masculine et une féminine, pour le portugais brésilien :

  • pt-BR_LucasNatural
  • pt-BR_CamilaNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :

24 juillet 2025

New English Natural Voices (Voix naturelles en anglais)

Le service prend désormais en charge quatre nouvelles voix naturelles - deux masculines et deux féminines, pour l'anglais américain :

  • en-US_EmmaNatural
  • en-US_EthanNatural
  • en-US_JacksonNatural
  • en-US_VictoriaNatural

Le service prend désormais en charge deux nouvelles voix naturelles - masculine et féminine - pour l'anglais britannique :

  • en-GB_ChloeNatural
  • en-GB_GeorgeNatural

Le service prend désormais en charge une nouvelle voix naturelle féminine pour l'anglais CA :

  • en-CA_HannahNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :

09 juillet 2025

Dépréciation des voix V1
À partir du 7 septembre 2025, toutes les voix de V1 seront retirées du service. Toutes les voix v1 devenues obsolètes seront automatiquement remplacées par les voix v3 correspondantes dans les 12 prochains mois.

19 mai 2025

Nouvelle génération de voix - Voix naturelles

Le service prend désormais en charge une nouvelle génération de voix appelées Natural Voices, avec une nouvelle voix pour l'anglais américain :

  • en-US_EllieNatural

Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir Voix naturelles.

Le service prend désormais en charge l'attribut facultatif supplémentaire format pour la balise SSML <say-as interpret-as="letters" format="xx">

Vous pouvez désormais spécifier la valeur group ou single avec l'attribut facultatif format. Ces attributs permettent d'améliorer la lisibilité des chaînes alphanumériques comme la confirmation des chiffres et des identifiants en ajoutant des silences stratégiques.

17 février 2025

Nouvelle voix masculine brésilienne portugaise expressive neurale

Le service prend désormais en charge une nouvelle voix masculine expressive pour le portugais brésilien :

  • pt-BR_LucasExpressive

Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

09 décembre 2024

Nouvelle voix neuronale expressive masculine anglaise du Royaume-Uni

Le service prend désormais en charge une nouvelle voix neuronale expressive masculine pour l'anglais britannique :

  • en-GB_GeorgeExpressive

Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

15 mai 2024

Nouvelle voix neuronale expressive féminine latino-américaine espagnole

Le service prend désormais en charge une nouvelle voix neuronale expressive féminine pour l'espagnol latino-américain

  • es-LA_DanielaExpressive

Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

16 janvier 2024

Text to Speech pour les voix expressives en anglais américain
Lorsque vous utilisez des voix expressives en anglais américain, la synthèse est plus rapide avec une latence plus faible.
Correction d'un défaut : Problème d'inflexion lors de l'utilisation du point d'interrogation ( ?) dans un énoncé court
Correctif d'incident: Lorsque certains énoncés courts étaient terminés par un point d'interrogation (?), l'inflexion était ignorée. Ce problème est désormais résolu.

30 novembre 2023

Amélioration du moteur de synthèse Text to Speech pour les voix de la version 3
Le moteur Text to Speech est amélioré pour fournir une synthèse plus rapide avec un temps d'attente plus faible pour les voix de la version 3.
Amélioration de la Text to Speech en-AU_HeidiExpressive
La voix de Text to Speech vocale en-AU_HeidiExpressive est améliorée et permet d'ajuster la hauteur et la synthèse.

9 juin 2023

Correction d'un défaut : TTS n'échoue plus en raison du message d'erreur "[Errno 2] No such file or directory"
Correction d'un défaut : Lors de l'utilisation de TTS avec des websockets, il n'y a plus d'échec dû au message d'erreur "[Errno 2] No such file or directory"

18 mai 2023

Correction de l'incident: ajout de la prise en charge des fonctions SSML manquantes sur la voix néerlandaise
Correctif d'incident: Lorsque vous utilisez la voix néerlandaise, toutes les fonctions SSML prises en charge fonctionnent désormais comme prévu. Auparavant, lors de l'utilisation de la voix néerlandaise, certaines fonctionnalités de SSML ne fonctionnent pas.
Correction d'incident: les virgules sont désormais respectées lors de l'utilisation des balises phoneme
Correctif d'incident: Lorsque vous utilisez des balises de phonème dans SSML, les virgules (pauses) fonctionnent désormais comme prévu. Auparavant, lorsque les virgules précédaient ou suivaient le texte avec des balises phonèmes, la pause était ignorée.

6 avril 2023

Mises à jour de la version bêta néerlandaise de la voix neuronale améliorée
Correctif d'incident: La version bêta néerlandaise nl-NL_MerelV3Voice a été mise à jour pour les correctifs internes et les améliorations. Les limitations décrites pour la version initiale de la voix dans la mise à jour de service du 31 mars 2023 s'appliquent toujours.

31 mars 2023

Important: fin de service pour toutes les voix neuronales

Important: toutes les voix neuronales ont atteint leur date de fin de service et ont été supprimées du service et de la documentation. Aucune voix neurale améliorée ou expressive n'est affectée. Pour une liste complète de toutes les voix neurales obsolètes, voir les mises à jour de service du 1er mars 2023. Une tentative d'utilisation d'une voix obsolète renvoie le code de réponse HTTP 404 avec le message 'Model '{voice}' not found.

De nouvelles voix neuronales et expressives améliorées sont disponibles pour l'anglais australien, le coréen et le néerlandais néerlandais. Vous devez migrer vers l'une des nouvelles voix pour l'anglais australien, le coréen ou le néerlandais pour continuer à utiliser les langues obsolètes.

Pour plus d'informations, voir Langues et voix.

22 mars 2023

Nouvelle version bêta Pays-Bas Voix neuronale améliorée néerlandaise

Le service prend désormais en charge une nouvelle voix féminine neuronale améliorée pour le néerlandais: nl-NL_MerelV3Voice. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR).

La nouvelle voix est une fonction bêta en attendant l'achèvement de la prise en charge du SSML. Dans sa version initiale, la voix ne prend pas en charge l'utilisation des fonctions suivantes liées à SSML :

  • L'élément <prosody> avec n'importe quelle demande de synthèse vocale
  • Les paramètres rate_percentage et pitch_percentage avec toute demande de synthèse vocale
  • L'élément <mark> avec une demande de synthèse vocale WebSocket
  • Paramètre timings du message texte JSON avec une demande de synthèse vocale WebSocket

Pour plus d'informations sur la nouvelle voix, sa prise en charge des symboles IPA et SPR et la migration vers la nouvelle voix à partir des voix neuronales néerlandaises obsolètes, voir

Correction de l'incident: mise à jour des symboles phonétiques coréens dans la documentation

Correction d'un défaut : Dans la documentation sur les symboles SPR coréens, les symboles à deux caractères pour les consonnes sont désormais placés entre guillemets simples, ce qui en fait un seul symbole. Auparavant, ils étaient représentés par deux symboles distincts, sans guillemets. Pour plus d'informations, voir Consonants(coréen).

Mises à jour de la documentation pour les symboles IBM SPR

La documentation de présentation des symboles IBM SPR a été mise à jour pour clarifier l'utilisation des symboles multi-caractères. Pour plus d'informations, voir Symboles de son vocaux).

1er mars 2023

Important: En attente de fin de service pour toutes les voix neuronales

Important: A compter du 31 mars 2023, toutes les voix neuronales atteignent leur date de fin de service et seront supprimées du service et de la documentation. Les voix neuronales sont obsolètes depuis le 31 mars 2022. Aucune voix neuronale ou expressive améliorée n'est affectée.

Les voix neuronales suivantes sont supprimées :

  • Arabe: ar-MS_OmarVoice
  • Chinois (mandarin): zh-CN_LiNaVoice, zh-CN_WangWeiVoiceet zh-CN_ZhangJingVoice
  • Tchèque: cs-CZ_AlenaVoice
  • Néerlandais (Belge): nl-BE_AdeleVoice et nl-BE_BramVoice
  • Néerlandais (Pays-Bas) : nl-NL_EmmaVoice et nl-NL_LiamVoice
  • Anglais (Australien): en-AU_CraigVoice, en-AU_MadisonVoiceet en-AU_SteveVoice
  • Coréen: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoiceet ko-KR_YunaVoice
  • Suédois: sv-SE_IngridVoice

De nouvelles voix neuronales améliorées et des voix neuronales expressives sont déjà disponibles pour l'anglais australien et les langues coréennes. Dans les semaines à venir, une nouvelle voix neuronale améliorée sera disponible pour le néerlandais. Vous devez migrer vers l'une des nouvelles voix pour l'anglais australien, le coréen ou le néerlandais avant le 31 mars 2023.

Pour plus d'informations, voir Langues et voix.

27 février 2023

Nouvelles voix neuronales expressives en anglais australien

Le service prend désormais en charge deux nouvelles voix neuronales expressives, masculines et féminines, pour l'anglais australien:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont désormais disponibles pour une utilisation en production. Ils permettent d'utiliser à la fois l'alphabet phonétique international (API) standard et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

Vous pouvez migrer à partir des voix neuronales en anglais australien qui sont obsolètes vers les nouvelles voix neuronales expressives.

Nouvelle voix neuronale coréenne améliorée

Le service prend désormais en charge une nouvelle voix féminine neuronale améliorée pour le coréen: ko-KR_JinV3Voice. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

Vous pouvez migrer à partir de voix neuronales coréennes qui sont obsolètes vers la nouvelle voix neuronale améliorée.

Correction du défaut: la voix canadienne-française gère désormais correctement les temps numériques

Correction d'un défaut : Les voix française et canadienne prononcent désormais correctement les temps comme 19:41 Auparavant, les voix omettent des éléments de l'époque dans l'audio synthétisé.

Correction du défaut: la voix japonaise n'insère plus de données audio inattendues

Correctif d'incident: La voix japonaise n'insère plus de données audio inattendues dans les résultats de la synthèse vocale. Auparavant, d'autres sons étaient insérés dans certains cas.

20 janvier 2023

Cloud Foundry-obsolescence et migration vers des groupes de ressources

IBM a annoncé la dépréciation d'IBM Cloud Foundry le 31 mai 2022. A partir du 30 novembre 2022, les nouvelles IBM Cloud Foundry ne pourront pas être créées et seuls les utilisateurs existants pourront déployer des applications. IBM Cloud Foundry arrive en fin de support le 1er juin 2023. Ensuite, toutes les instances d'exécution d'applications IBM Exécutant des applications Cloud Foundry IBM seront définitivement désactivées et supprimées Seront définitivement désactivées, déprovisionnées et supprimées.

Pour continuer à utiliser vos applications IBM Cloud au-delà du 1er juin 2023, vous devez migrer vers des groupes de ressources avant cette date. Les groupes de ressources sont conceptuellement similaires aux espaces Cloud Foundry. Ils offrent plusieurs avantages supplémentaires, tels qu'un contrôle d'accès plus précis grâce à la gestion des identités et des accès ( IBM Cloud Identity and Access Management, IAM), la possibilité de connecter des instances de service à des applications et des services situés dans différentes régions, ainsi qu'un moyen simple de consulter l'utilisation par groupe.

Correction de l'incident: la spécification de grands nombres cardinaux avec l'élément <say-as> ne provoque plus d'erreurs pour les voix anglaises

Correctif de défaut: vous pouvez désormais utiliser l'élément <say-as> pour prononcer des nombres élevés en tant que nombres cardinaux. Auparavant, l'inclusion d'un grand nombre dans l'élément <say-as> avec l'attribut interpret-as="cardinal" pouvait entraîner l'échec de la synthèse vocale pour les voix anglaises. Par exemple, <say-as interpret-as="cardinal">3,200</say-as> peut amener le service à générer une erreur. Pour plus d'informations, voir cardinal dans la rubrique Eléments SSML.

Correction des défauts: les homonymes et autres mots sont maintenant prononcés correctement par les voix anglaises

Correctif d'incident: Le service prononce désormais correctement les homonymes et les autres mots en fonction de leur contexte dans le texte en anglais à synthétiser. Auparavant, des mots tels que advocate et wifi pouvaient être prononcés de manière incorrecte par les voix anglaises.

30 novembre 2022

Correctif d'incident: Ajoutez des règles pour la documentation de dénomination de modèle personnalisé
Correctif d'incident: La documentation fournit désormais des règles détaillées pour l'attribution de noms aux modèles personnalisés. Pour plus d'informations, voir :

7 octobre 2022

Le service applique désormais une validation SSML plus stricte
Le service applique désormais une validation plus stricte du texte d'entrée qui inclut des éléments SSML (Speech Synthesis Markup Language). Les éléments obligatoires des attributs doivent être spécifiés avec des valeurs valides. Sinon, la demande échoue avec un code d'erreur 400. Pour plus d'informations sur la validation SSML et les exigences que le texte marqué doit remplir, voir Validation SSML.
Correction d'un défaut : Le sexe indiqué pour la voix en-US_MichaelExpressive est désormais correct
Correctif d'incident: Lorsque vous répertoriez des informations sur les voix disponibles, le gender de la voix en-US_MichaelExpressive est désormais male. Auparavant, le genre de la voix était décrit par erreur comme female. Pour plus d'informations, voir Affichage de la liste des informations sur les voix.

23 septembre 2022

Nouvelles voix neuronales expressives en anglais américain

Le service offre quatre nouvelles voix neuronales expressives pour l'anglais américain:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont désormais disponibles pour une utilisation en production. Ils permettent d'utiliser à la fois l'alphabet phonétique international (API) standard et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :

Nouveaux styles de parole pour les voix neuronales expressives

Les voix neuronales expressives déterminent le sentiment du texte à partir du contexte de ses mots et phrases. Le discours qu'ils produisent, en plus d'avoir un style conversationnel, reflète l'ambiance du texte. Mais vous pouvez embellir les tendances naturelles des voix en indiquant que tout ou partie du texte est de mettre l'accent sur l'un des styles de parole suivants:

  • Cheerful-Exprime le bonheur et les bonnes nouvelles.
  • Empathétique-Exprime l'empathie ou la sympathie.
  • Neutre-Exprime l'objectivité et l'équité.
  • Incertain-Exprime la confusion ou l'incertitude.

Pour plus d'informations, voir Utilisation de styles de parole.

Nouvel accent d'interjection avec des voix neuronales expressives

Avec les voix neuronales expressives, le service détecte automatiquement un ensemble d'interjections communes en fonction du contexte. Quand il synthétise ces interjections, il leur donne l'accent naturel qu'un humain utiliserait dans une conversation normale. Pour certaines des interjections, vous pouvez utiliser SSML pour activer ou désactiver leur mise en évidence. Pour plus d'informations, voir Insister sur les interjections.

Mise en valeur de nouveaux mots par des voix neuronales expressives

Les voix expressives utilisent un style conversationnel qui applique naturellement l'intonation correcte du contexte. Mais vous pouvez indiquer qu'un ou plusieurs mots doivent être plus ou moins mis en évidence. Le changement de contrainte peut être indiqué par une augmentation ou une diminution du pas, de la temporisation, du volume ou d'autres attributs acoustiques. Pour plus d'informations, voir Insister sur les mots.

21 septembre 2022

Nouvel événement Activity Tracker pour la suppression RGPD des informations utilisateur
Le service renvoie désormais un événement Activity Tracker lorsque vous utilisez la méthode DELETE /v1/user_data pour supprimer toutes les informations relatives à un utilisateur. L'événement est nommé text-to-speech.gdpr-user-data.delete. Pour plus d'informations, voir Evénements Activity Tracker.
Correction d'incident: les traductions de mots personnalisées acceptent désormais les virgules dans tous les cas
Correctif d'incident: Les traductions Word ajoutées aux modèles personnalisés acceptent désormais les virgules dans tous les cas. Auparavant, une virgule dans une traduction pouvait occasionnellement empêcher la traduction de générer un son valide lorsqu'elle était utilisée pour des synthèses vocales. Ce problème a été identifié dans les modèles personnalisés en anglais américain.
Correction des défauts: la synthèse française des dates est désormais cohérente
Correctif de défaut: la synthèse française n'inclut plus l'article "le" avant les dates de la forme "l' ordinal de mois." Auparavant, l'article n'était inclus que pour le premier jour du mois pour le français (par exemple, "le premier septembre", "le premier septembre").
Limites connues de l'utilisation du format audio Ogg avec le navigateur Safari
Par défaut, le service renvoie de l'audio au format Ogg avec le codec Opus audio/ogg;codecs=opus Cependant, le format audio Ogg n'est pas supporté par le navigateur Safari. Si vous utilisez le service Text to Speech avec le navigateur Safari, vous devez spécifier un format différent dans lequel vous souhaitez que le service renvoie l'audio.

31 août 2022

Nouveau paramètre de requête rate_percentage bêta pour le contrôle du débit de parole global
Le service offre un nouveau paramètre de requête rate_percentage pour modifier le débit de parole d'une demande de synthèse vocale. Le débit de parole est la vitesse à laquelle le service parle le texte qu'il synthétise en parole. Un taux plus élevé permet de parler plus rapidement le texte ; un taux plus faible permet de le faire plus lentement. Le paramètre modifie le débit par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification du débit de parole.
Nouveau paramètre de requête pitch_percentage bêta pour le contrôle de la hauteur de parole globale
Le service offre un nouveau paramètre de requête pitch_percentage pour modifier la hauteur de parole d'une requête de synthèse. La hauteur de parole représente la tonalité de la parole que le service synthétise. Il représente la hauteur ou la hauteur du ton de la voix perçue par l'auditeur. Un ton plus élevé se traduit par une parole qui est parlée à un ton plus élevé et est perçue comme une voix plus élevée ; un ton plus bas se traduit par une parole qui est parlée à un ton plus bas et est perçue comme une voix plus faible. Le paramètre modifie la hauteur par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification de la hauteur de parole.
Correction d'incident: la synthèse japonaise est améliorée pour gérer les longues chaînes de texte d'entrée
Correctif d'incident: Le service synthétise désormais correctement les demandes japonaises qui incluent de longues chaînes de caractères. Auparavant, le service ne parvenait pas à synthétiser correctement les longues chaînes de texte en japonais.
Mises à jour de la documentation pour l'élément <prosody> SSML
La documentation de l'élément SSML <prosody> et de ses paramètres pitch et rate a été améliorée et clarifiée. Il inclut également une description des différences entre le service et la dernière version de la spécification SSML. Pour plus d'informations, voir L'élément <prosody>.

3 août 2022

Le service ne prend pas en charge la synthèse vocale multilingue
Le service ne prend pas en charge la synthèse vocale multilingue pour le moment. Cependant, vous pouvez utiliser la personnalisation pour approximer la prononciation des mots d'autres langues. Pour plus d'informations, voir Synthèse vocale multilingue.

27 juillet 2022

Nouveau paramètre spell_out_mode bêta pour les voix allemandes
Pour indiquer comment les caractères individuels d'une chaîne doivent être orthographiés, vous pouvez désormais inclure le paramètre de requête spell_out_mode bêta avec une demande de synthèse pour une voix allemande. Par défaut, le service affiche des caractères individuels au même rythme qu'il synthétise du texte pour une langue. Vous pouvez utiliser ce paramètre pour demander au service d'épeler les caractères individuels plus lentement, par groupes de un, deux ou trois caractères. Utilisez le paramètre avec l'élément SSML <say-as> pour contrôler la façon dont les caractères d'une chaîne sont synthétisés. Pour plus d'informations, voir Spécification de la manière dont les chaînes sont définies.

25 mai 2022

Nouvelle prise en charge du format audio audio/alaw
La liste des formats audio pris en charge inclut maintenant audio/alaw;rate={rate}. Comme audio/basic et audio/mulaw, ce format fournit un audio à canal unique codé en utilisant des données u-law (ou mu-law) de 8 bits qui sont échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio.

19 mai 2022

Correction de défaut: Plusieurs balises SSML <phoneme> consécutives sont maintenant analysées correctement
Correction de défaut: Le service synthétise désormais correctement le texte contenant des balises <phoneme> consécutives. Auparavant, si le texte contenait deux balises <phoneme> consécutives ou plus, le service n'a synthétisé que la première balise, en ignorant les autres.

31 mars 2022

Important: obsolescence de toutes les voix neuronales

Important: A partir du 31 mars 2022, toutes les voix neuronales sont obsolètes. Les voix obsolètes restent disponibles pour les utilisateurs existants jusqu'au 31 mars 2023, lorsqu'elles seront supprimées du service et de la documentation. Aucune voix neuronale améliorée ou voix expressive n'est obsolète.

Les voix neuronales suivantes sont désormais obsolètes:

  • Arabe: ar-MS_OmarVoice
  • Chinois (mandarin): zh-CN_LiNaVoice, zh-CN_WangWeiVoiceet zh-CN_ZhangJingVoice
  • Tchèque: cs-CZ_AlenaVoice
  • Néerlandais (Belge): nl-BE_AdeleVoice et nl-BE_BramVoice
  • Néerlandais (Pays-Bas) : nl-NL_EmmaVoice et nl-NL_LiamVoice
  • Anglais (Australien): en-AU_CraigVoice, en-AU_MadisonVoiceet en-AU_SteveVoice
  • Coréen: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoiceet ko-KR_YunaVoice
  • Suédois: sv-SE_IngridVoice

Les voix neuronales obsolètes continuent d'être disponibles pour les utilisateurs existants mais ne sont plus disponibles pour les nouveaux utilisateurs:

  • Utilisateurs existants: Les instances du service créé avant 31 mars 2022 peuvent continuer à utiliser les voix obsolètes pour la synthèse vocale. Ces instances peuvent également servir à créer et à utiliser des modèles personnalisés basés sur les voix obsolètes. Et ils peuvent continuer à répertorier et interroger les voix avec les méthodes GET /v1/voices et GET /v1/voices/{voice} .
  • Nouveaux utilisateurs : les instances du service créées à compter du 31 mars 2022 ne peuvent plus utiliser les voix obsolètes pour la synthèse vocale. Ces instances ne peuvent pas non plus être utilisées pour créer des modèles personnalisés basés sur les voix obsolètes. Ils ne peuvent pas répertorier ou interroger les voix avec les méthodes GET /v1/voices et GET /v1/voices/{voice} . Tout appel d'API qui inclut l'une des voix obsolètes renvoie un code d'erreur HTTP 400 ou 404, en fonction de l'appel.

De nouvelles voix pour l'anglais australien, le néerlandais et le coréen seront publiées d'ici le 15 février 2023. Si vous utilisez des voix en anglais australien, en néerlandais ou en coréen, vos appels d'API seront automatiquement redirigés vers les nouvelles voix dans cette langue. Les voix en arabe, en chinois, en tchèque, en suédois et en flamand seront retirées du service.

Pour plus d'informations sur toutes les langues et voix disponibles, consultez la section Langues et voix.

Les voix standard obsolètes sont supprimées de la documentation

Les voix de concaténation standard ont été supprimées le 2 décembre 2020. Ces voix standard ont été supprimées de la référence de l'API. Le sujet « Passage des voix standard aux voix neuronales » a également été supprimé de la page « Langues et voix ».

De même, l'ancien nom de la voix arabe, ar-AR_OmarVoice, a été rendu obsolète en même temps. Il a également été supprimé de la documentation. Utilisez la voix ar-MS_OmarVoice à la place.

28 février 2022

Modification de la réponse de minutage des mots pour l'interface WebSocket

L'objet de réponse que le service renvoie lorsque vous demandez les durées des mots via l'interface WebSocket a été modifié. Le service envoie maintenant les résultats du minutage des mots dans un tableau unique qui comprend une chaîne de caractères suivie de deux valeurs en virgule flottante :

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Le service a déjà envoyé les résultats du minutage sous la forme d'un tableau contenant une chaîne de caractères suivi d'un tableau de deux valeurs en virgule flottante :

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

De plus, le niveau de précision des minutages des mots et des marques est maintenant réduit à trois décimales. Pour plus d'informations sur les nouvelles réponses, voir Génération de minutages de mots.

Remarque : les résultats pour les voix neurale et neurale améliorées étaient différents auparavant. Ces incohérences pourraient entraîner des erreurs dans les SDK d' Watson. Les résultats pour toutes les voix sont maintenant cohérents.

26 janvier 2022

Correctif d'incident: amélioration de la documentation SSML
Correction d'erreurs : la documentation SSML a été mise à jour afin de corriger les erreurs suivantes :
  • Les exemples de l'élément <break> sont maintenant corrects. L'élément n'est pas unaire, comme indiqué dans les exemples. Les exemples précédents comprenaient des balises ouvertes et fermées avec du texte incorporé. Le texte intégré n'était pas énoncé par le service. Pour plus d'informations, voir Élément <break>.
  • Le service prend en charge SSML version 1.1. Tous les références et exemples utilisent maintenant la version correcte. La documentation faisait référence précédemment à la version 1.0.

3 décembre 2021

Nouvelle voix neuronale tchèque : cs-CZ_AlenaVoice

Une nouvelle langue, le tchèque, avec une nouvelle voix féminine, cs-CZ_AlenaVoice, est maintenant disponible. La voix est une voix neuronale.

Nouvelle voix neuronale en néerlandais belge : nl-BE_BramVoice

Une nouvelle voix masculine néerlandais belge (flamand), nl-BE_BramVoice, est maintenant disponible. La voix est une voix neuronale.

Correction des défauts: Amélioration de la synthèse vocale et SSML

Correction de bogues : les bogues suivants concernant le langage de balisage pour la synthèse vocale (SSML) et la synthèse vocale ont été corrigés dans cette version :

  • L'attribut pitch de l'élément <prosody> est maintenant appliqué à tous les textes spécifiés. Auparavant, le changement de pas n'était pas toujours appliqué au premier mot du texte affecté. De plus, la documentation contient désormais davantage d'indications sur la manière de définir une valeur pour l'option « pitch ». Pour plus d'informations, voir L'attribut pitch.
  • La synthèse vocale du texte japonais parle maintenant plus lentement. Auparavant, la voix synthétisée était trop rapide. Si vous trouvez que la synthèse du texte japonais est encore trop rapide pour votre application, utilisez l'attribut rate de l'élément SSML <prosody> pour contrôler le débit de la voix. Pour plus d'informations, voir L'attribut rate.
  • Les voix neuronales analysent désormais correctement l'apostrophe (&apos;). Auparavant, certaines voix neuronales n'interprétaient pas correctement le caractère.

22 octobre 2021

Plusieurs améliorations de la voix neuronale
Les voix neurales existantes pour le chinois, le néerlandais (Belgique et Pays-Bas), l'anglais australien et le coréen ont été mises à jour pour améliorer la synthèse vocale et les résultats audio. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix.
Nouvelle voix neuronale en anglais australien : en-AU_SteveVoice
Une nouvelle voix masculine australienne, en-AU_SteveVoice, est maintenant disponible. La voix est une voix neuronale.
Nouvelle voix neuronale suédoise : sv-SE_IngridVoice
Une nouvelle langue, le suédois, avec une nouvelle voix féminine, sv-SE_IngridVoice, est maintenant disponible. La voix est une voix neuronale.

6 octobre 2021

Nouveau support HIPAA américain pour les plans Premium dans l'emplacement de Dallas
Le support de la US Health Insurance Portability and Accountability Act (HIPAA) est maintenant disponible pour les plans Premium hébergés dans l'emplacement de Dallas (us-south). Pour plus d'informations, voir Health Insurance Portability and Accountability Act (HIPAA).
Correction d'un bug : amélioration de la voix neurale optimisée pour l'espagnol d'Amérique latine
Correction d'erreur : pour la voix espagnole d'Amérique latine (es-LA_SofiaV3Voice), les questions de tous les types utilisent désormais l'intonation correcte.

16 septembre 2021

Correction d'un bug : amélioration des voix neuronales optimisées pour l'espagnol castillan et l'espagnol nord-américain
Correction d'erreur : pour les voix castillane espagnole (es-ES_EnriqueV3Voice et es-ES_LauraV3Voice) et en espagnol d'Amérique du Nord (es-US_SofiaV3Voice), les questions de tous les types utilisent désormais l'intonation correcte. Pour la voix latino-américaine en espagnol (es-LA_SofiaV3Voice), certaines questions n'utilisent pas l'intonation et ressemblent plutôt à des instructions. La version en espagnol d'Amérique latine sera bientôt disponible.

16 juillet 2021

Nouvelle voix neuronale en néerlandais belge : nl-BE_AdeleVoice
Le service prend désormais en charge le néerlandais belge (flamand) avec la voix neurale nl-BE_AdeleVoice. La voix en néerlandais belge prend en charge la personnalisation et est généralement disponible (GA) pour l'utilisation en production.

12 avril 2021

Nouvelle voix neuronale améliorée en français : fr-CA_LouiseV3Voice

Le service prend maintenant en charge le français canadien avec la voix neuronale améliorée fr-CA_LouiseV3Voice. La voix canadienne française prend en charge la personnalisation et est généralement disponible (GA) à des fins de production.

Nouvelle fonction Tune by Example

La nouvelle fonction Tune by Example permet de contrôler l'énoncé du texte spécifié par le service. Cette fonctionnalité est en version bêta et n'est prise en charge que pour les modèles et les voix personnalisés en anglais américain. Elle est constituée de deux composants :

  • Invites personnalisées : incluent le texte écrit qui doit être énoncé et audio enregistré qui énonce le texte comme vous voulez l'entendre. L'audio spécifie l'intonation, le rythme et l'emphase du texte synthétisé. L'invite peut mettre l'accent sur des syllabes ou des mots différents, introduire des pauses et, d'une manière générale, rendre le son synthétisé plus naturel et plus approprié à son contexte.
  • Modèles de locuteurs : fournissent un enregistrement audio pour un utilisateur qui énonce une ou plusieurs invites. Un modèle de locuteur fournit un échantillon audio de la voix d'un utilisateur. Le service s'entraîne sur la voix, ce qui peut l'aider à produire des messages de qualité supérieure pour ce locuteur.

Vous spécifiez une invite personnalisée avec une demande de synthèse vocale pour indiquer comment la voix du service doit prononcer le texte. Pour spécifier une invite, utilisez l'extension SSML <ibm:prompt id="{prompt_id}"/>. L'audio synthétisé reproduit la prosodie de l'invite.

Nouvelles méthodes Tune by Example

Le service comprend huit nouvelles méthodes de travail avec l'option Tune by Example. Les descriptions des nouvelles méthodes qui suivent contiennent des liens vers leurs entrées dans la documentation de référence de l'API et du SDK. Vous pouvez avoir besoin de sélectionner l'onglet Curl de la référence pour voir les nouvelles méthodes.

Mises à jour des actions Activity Tracker pour la personnalisation

Les noms des actions pour les événements Activity Tracker pour les méthodes de personnalisation ont été modifiés. Les actions incluent maintenant la chaîne custom-model au lieu de custom-voice. Les anciens noms des actions sont obsolètes. Les anciens noms sont toujours disponibles, mais seront retirés à une date ultérieure. Migrez vers les nouveaux noms répertoriés dans Événements de personnalisation dès que vous le souhaitez.

Créer des événements Nom d'action obsolète-> Nouveau nom d'action

  • text-to-speech.custom-voice.create -> text-to-speech.custom-model.create
  • text-to-speech.custom-voice-word-list.create -> text-to-speech.custom-model-word-list.create
  • text-to-speech.custom-voice-word.create -> text-to-speech.custom-model-word.create

Lire les événements Nom d'action obsolète-> Nouveau nom d'action

  • text-to-speech.custom-voice-list.read -> text-to-speech.custom-model-list.read
  • text-to-speech.custom-voice.read -> text-to-speech.custom-model.read
  • text-to-speech.custom-voice-word-list.read -> text-to-speech.custom-model-word-list.read
  • text-to-speech.custom-voice-word.read -> text-to-speech.custom-model-word.read

Mettre à jour l'événement Nom d'action obsolète-> Nouveau nom d'action

  • text-to-speech.custom-voice.update -> text-to-speech.custom-model.update

Supprimer des événements Nom d'action obsolète-> Nouveau nom d'action

  • text-to-speech.custom-voice.delete -> text-to-speech.custom-model.delete
  • text-to-speech.custom-voice-word.delete -> text-to-speech.custom-model-word.delete

2 décembre 2020

Améliorations multiples de la voix

Les voix proposées par le service ont considérablement évolué. Le service prend en charge de nouvelles langues et voix, a amélioré la qualité de nombreuses voix et a rendu obsolètes de nombreuses anciennes voix. De plus, toutes les voix des services sont désormais personnalisables et disponibles en version générale (GA) pour une utilisation en production.

Nouvelles voix neuronales et neuronales améliorées

Pour optimiser la qualité globale de la synthèse vocale, toutes les voix disponibles sont maintenant basées sur la technologie neuronale. Le service offre deux types de voix basées sur la technologie neuronale :

  • Les voix neuronales, qui n'incluent pas la chaîne V3 dans leurs noms, sont maintenant disponibles pour l'arabe, l'anglais australien, le chinois, le néerlandais belge et le coréen. Les voix neuronales permettent d'utiliser alphabet phonétique international (IAP) avec l'élément Speech Synthesis Markup Language (SSML) <phoneme>.
  • Les voix neuronales améliorées, qui incluent la chaîne V3 dans leurs noms, sont maintenant disponible pour le portugais (Brésil), l'anglais Royaume-Uni, l'anglais États-Unis, le français, l'allemand, l'italien, le japonais et l'espagnol (tous les dialectes). Les voix neuronales améliorées prennent en charge l'utilisation d'IAP et de IBM Symbolic Phonetic Representation (SPR) avec l'élément SSML <phoneme>. Les voix neuronales améliorées atteignent également un degré légèrement plus élevé d'expression naturelle. D'autres options de personnalisation seront mises à disposition pour les voix générées par IA dans les mois à venir.

Le service n'offre plus de voix standard pour aucune des langues. Les voix standard ont utilisé la synthèse par concaténation pour assembler des segments de parole enregistrée afin de générer le fichier audio demandé.

Pour plus d'informations, voir Langues et voix.

Nouvelles voix neuronales anglais australien et coréen

Les voix suivantes en anglais australien et en coréen sont nouvelles :

  • Le service prend désormais en charge l'anglais australien avec les deux voix neuronales suivantes : en-AU_CraigVoice et en-AU_MadisonVoice.
  • Le service prend désormais en charge deux nouvelles voix neuronales coréennes: ko-KR_HyunjunVoice et ko-KR_SiWooVoice.
Amélioration des voix neuronales

Les voix des langues existantes (arabe, chinois, néerlandais et coréen), qui étaient toutes de type concaténatif, sont désormais de type neuronal :

  • ar-MS_OmarVoice
  • ko-KR_YoungmiVoice
  • ko-KR_YunaVoice
  • nl-NL_EmmaVoice
  • nl-NL_LiamVoice
  • zh-CN_LiNaVoice
  • zh-CN_WangWeiVoice
  • zh-CN_ZhangJingVoice

Les modifications suivantes ont également été apportées :

  • La voix arabe s'appelle maintenant ar-MS_OmarVoice. L'ancien nom ar-AR_OmarVoice est obsolète. Il continuera de fonctionner pendant au moins un an, mais pourrait être supprimé à une date ultérieure. Nous vous encourageons à migrer vers le nouveau nom dès que vous le souhaitez.
  • La langue arabe prend désormais en charge l'utilisation des symboles IAP et des valeurs Unicode avec l'élément SSML <phoneme> . Pour créer un modèle personnalisé pour l'arabe, vous devez utiliser l'identificateur de langue ar-MS. L'identificateur ar-AR n'est pas pris en charge pour la personnalisation.
  • Les symboles IPA pour la langue arabe sont nouveaux. Les symboles mentionnés précédemment ont été remplacés.
  • Les symboles de l'IAP pour le néerlandais ont été modifiés comme suit :
    • Le néerlandais ne prend plus en charge les symboles IPA suivants: (0074+02B2), ɲ (0272), ʦ (02A6) et ʔ (0294).
    • Le néerlandais des Pays-Bas prend désormais en charge le symbole IPA suivant : ɣ (0263).
Voix standard obsolètes

Les voix de concaténation standard suivantes sont désormais obsolètes :

  • de-DE_BirgitVoice
  • de-DE_DieterVoice
  • en-GB_KateVoice
  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • es-ES_LauraVoice
  • es-LA_SofiaVoice
  • es-US_SofiaVoice
  • fr-FR_ReneeVoice
  • it-IT_FrancescaVoice
  • ja-JP_EmiVoice
  • pt-BR_IsabelaVoice

Toutes les voix standard qui sont devenues obsolètes ont des équivalents neuronaux, donc aucune voix n'est retirée. Vous pouvez plutôt passer à la version neuronale équivalente de la voix (par exemple, de de-DE_BirgitVoice à de-DE_BirgitV3Voice) pour obtenir de meilleurs résultats de synthèse vocale.

Ces voix obsolètes sont supprimées de la documentation publiée. Elles continueront à fonctionner pendant au moins un an, mais pourraient être retirées à une date ultérieure. Nous vous encourageons à migrer vers les voix neuronales équivalentes dès que possible.

Si vous ne définissez pas le paramètre facultatif voice à partir d'une demande de synthèse vocale, le service utilise par défaut en-US_MichaelV3Voice. Cette voix neuronale remplace la voix standard en-US_MichaelVoice désormais obsolète qui était la voix par défaut.

Fonctions obsolètes

Les fonctionnalités suivantes n'étaient disponibles que pour les voix de concaténation standard. Elles sont obsolètes et ont été supprimées de la documentation publiée. Elles continueront à fonctionner pendant au moins un an, mais pourraient être retirées à une date ultérieure. Nous vous encourageons à supprimer ces fonctions de vos applications et à migrer vers les voix neuronales dès que possible.

  • Expressive SSML. Il s'agit d'une extension IBM de SSML qui n'était prise en charge que pour la voix en-US_AllisonVoice.
  • Voice transformation SSML. Il s'agit d'une extension IBM àde SSML qui n'était prise en charge que pour les voix en-US_AllisonVoice, en-US_LisaVoice et en-US_MichaelVoice
  • L'attribut volume de l'élément <prosody> Cet attribut était disponible pour toutes les voix standard.

L'inclusion de ces éléments SSML avec une demande de synthèse pour une voix neuronale génère le code de réponse HTTP 400, car la validation SSML de la demande échoue. Pour plus d'informations sur la validation SSML, voir Validation SSML.

Nouveau support pour Cross-Origin Resource Sharing

Le support CORS (Cross-Origin Resource Sharing) est désormais disponible pour toutes les voix des navigateurs Google Chrome™ et Apple ® Safari. Il n'est pas disponible dans le navigateur Mozilla Firefox™ pour les voix en arabe, anglais australien, chinois, néerlandais belge et coréen. Pour plus d'informations, voir l'utilisation du support CORS.

10 septembre 2020

Correction d'un bug : amélioration de la voix japonaise

Correctif d'incident : Pour la voix ja-JP_EmiV3Voice, le service analyse désormais correctement le texte d'entrée SSML qui inclut une spécification de taux de prosodie. Auparavant, l'utilisation suivante de l'élément <prosody> fonctionnait correctement :

<speak>成功する/繁栄する</speak>

Mais l'utilisation suivante de l'attribut rate avec l'élément <prosody> amenait le service à lire et énoncer la notation SSML intégrée :

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Le service analyse maintenant correctement et applique l'attribut rate de l'élément <prosody> pour l'entrée japonaise.

4 septembre 2020

Une interface de personnalisation est désormais accessible à tous
L'interface de personnalisation est maintenant généralement disponible (GA). La personnalisation n'est plus une fonctionnalité en version bêta. Vous pouvez utiliser l'interface de personnalisation pour spécifier la façon dont le service prononce les mots inhabituels qui apparaissent dans le texte que vous entrez, en créant des dictionnaires personnalisés spécifiques à la langue. Elle peut être utilisée avec toutes les voix disponibles et bêta. Pour plus d'informations, voir Compréhension de la personnalisation.

24 juin 2020

Nouvelles voix neuronales anglaises britanniques et françaises

Le service propose désormais deux nouvelles voix générées par réseau neuronal :

  • Anglais britannique : en-GB_CharlotteV3Voice
  • Français : fr-FR_NicolasV3Voice

Il offre également une version améliorée de la voix neuronale britannique existante, en-GB_KateV3Voice. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix.

Prise en charge de l'attribut digits SSML de l'élément <say-as> pour le japonais

Le service prend désormais en charge l'attribut digits de l'élément SSML <say-as> avec sa voix japonaise. Pour plus d'informations, voir L'élément say-as.

1er avril 2020

Nouvelles voix standard coréennes : ko-KR_YoungmiVoice et ko-KR_YunaVoice

Le service prend désormais en charge deux voix coréennes féminines standard : ko-KR_YoungmiVoice et ko-KR_YunaVoice. Les informations suivantes s'appliquent aux deux voix coréennes :

  • Les voix sont des fonctions bêta. Il se peut qu'elles ne soient pas prêtes pour une utilisation en production et elles sont susceptibles d'être modifiées. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.
  • Les voix prennent en charge la personnalisation et la méthode./v1/pronunciation
  • Les voix prennent en charge l'élément <mark> et le paramètre timings disponibles avec l'interface WebSocket.
  • Les voix prennent en charge tous les éléments SSML (Speech Synthesis Markup Language) à l'exception des éléments SSML d'expressivité et des éléments SSML de transformation vocale.
  • Les voix prennent en charge l'alphabet phonétique international (IAP), mais pas IBM Symbolic Phonetic Representation (SPR), avec l'élément <phoneme>.
Prise en charge de la nouvelle fonction pour les voix hollandaise, chinoise et néerlandaise

Les voix néerlandaise, arabe, chinoise et néerlandaise belge prennent désormais en charge les fonctions suivantes :

  • Personnalisation et méthode /v1/pronunciation.
  • L'élément <mark> et le paramètre timings disponibles avec l'interface WebSocket.

Pour plus d'informations, reportez-vous aux sections suivantes :

24 février 2020

Nouvelles voix neuronales en anglais et en allemand

Le service prend désormais en charge cinq nouvelles voix neuronales :

  • Anglais américain : en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice, and en-US_OliviaV3Voice
  • Allemand : de-DE_ErikaV3Voice

Les nouvelles voix ne prennent pas en charge les éléments SSML suivants :

  • Expressive SSML avec l'élément <express-as>
  • Transformation vocale avec l'élément <voice-transformation>
  • L'attribut volume de l'élément <prosody>

Pour plus d'informations sur ces voix et sur toutes les voix disponibles, voir Langues et voix.

Nouveau support pour Activity Tracker

Le service prend désormais en charge l'utilisation des événements Activity Tracker pour toutes les opérations de personnalisation. IBM Cloud Activity Tracker enregistre les activités lancées par l'utilisateur qui modifient l'état d'un service dans IBM Cloud. Vous pouvez utiliser ce service pour étudier une activité anormale et des actions critiques, ainsi que pour respecter des exigences en matière de vérification de réglementation. En outre, vous avez la possibilité d'être alerté des actions lors de leur déroulement. Pour plus d'informations, voir Evénements Activity Tracker.

18 décembre 2019

Nouvelles voix standard en arabe, chinois et néerlandais

Le service prend désormais en charge six nouvelles voix standard dans trois nouvelles langues :

  • Arabe : ar-AR_OmarVoice
  • Chinois (Mandarin) : zh-CN_LiNaVoice, zh-CN_WangWeiVoice et zh-CN_ZhangJingVoice
  • Néerlandais Pays-Bas : nl-NL_EmmaVoice et nl-NL_LiamVoice

Les informations suivantes s'appliquent à ces nouvelles voix standard :

  • Les nouvelles voix sont des fonctions bêta. Il se peut qu'elles ne soient pas prêtes pour une utilisation en production et elles sont susceptibles d'être modifiées. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.
  • Les voix ne prennent pas en charge l'élément <mark> et le paramètre timings disponibles avec l'interface WebSocket.
  • Les voix ne prennent pas en charge la personnalisation ou la méthode /v1/pronunciation.
  • Les voix ne prennent pas en charge les éléments SSML d'expressivité ni les éléments SSML de transformation vocale.
  • Les voix prennent en charge tous les autres éléments SSML. Cependant, elles prennent en charge l'alphabet phonétique international (IAP), mais pas IBM Symbolic Phonetic Representation (SPR), avec l'élément <phoneme>.

Pour plus d'informations sur ces voix et sur toutes les voix disponibles, voir Langues et voix.

12 décembre 2019

Prise en charge complète de IBM Cloud IAM

Le service Text to Speech prend désormais en charge l'implémentation totale d'IBM Cloud Identity and Access Management (IAM). Les clés d'API pour les services Watson ne sont plus limitées à une instance de service unique. Vous pouvez créer des règles d'accès et des clés d'API qui s'appliquent à plusieurs services et accorder l'accès entre les services. Pour plus d'informations sur IAM, voir Authentification dans les services Watson.

Pour prendre en charge ce changement, les noeuds finaux de service d'API utilisent un autre domaine et comprennent l'ID d'instance de service. Le modèle est api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.

  • Exemple d'URL HTTP pour une instance hébergée à l'emplacement Dallas :

    https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • Exemple d'URL WebSocket pour une instance hébergée à l'emplacement Dallas :

    wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Pour plus d'informations sur les URL, consultez la documentation de référence de l'API et du SDK.

Ces URL ne constituent pas une modification avec rupture. Les nouvelles URL fonctionnent à la fois pour vos instances de service existantes et pour les nouvelles instances. Les URL d'origine continueront à fonctionner sur vos instances de service existantes pendant au moins un an, jusqu'à décembre 2020.

Nouvelles fonctions de sécurité de réseau et des données

La prise en charge des nouvelles fonctions de sécurité de réseau et des données suivantes est désormais disponible :

  • Prise en charge des nœuds finaux de réseau privé

    Les utilisateurs des plans Premium peuvent créer des points de terminaison de réseau privé pour se connecter au service Text to Speech via un réseau privé. Les connexions aux noeuds finaux de réseau privé ne nécessitent pas d'accès Internet public. Pour plus d'informations, voir Noeuds finaux de réseaux publics et privés.

12 novembre 2019

Nouveau site de Séoul maintenant disponible
Le service Text to Speech est maintenant disponible dans l'emplacement IBM Cloud Séoul (Kr-seo). Comme avec les autres emplacements, l'emplacement IBM Cloud utilise l'authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.

1er octobre 2019

Nouveau support US HIPAA pour les plans Premium dans l'emplacement Washington, DC,
L'assistance HIPAA aux États-Unis est disponible pour les forfaits Premium hébergés dans le centre de données de Washington, DC, et créés à compter du 1er avril 2019. Pour plus d'informations, voir la rubrique sur la loi américaine Health Insurance Portability Accountability Act.

22 août 2019

Correction d'incident: plusieurs petites améliorations
Correction de bugs : le service a été mis à jour afin de corriger quelques bugs et d'apporter des améliorations.

30 juillet 2019

Nouvelle voix neuronale japonaise : ja-JP_EmiV3Voice
Le service offre désormais une voix neuronale en japonais : ja-JP_EmiV3Voice. Les versions standard et neuronale de toutes les voix disponibles dans toutes les langues prises en charge sont désormais proposées. Pour plus d'informations, voir Langues et voix.

24 juin 2019

Nouveau support pour les voix standard et neuronales

Le service offre désormais deux versions de la plupart des voix disponibles :

  • Voix standard qui utilisent la synthèse par concaténation pour assembler des segments de parole enregistrée afin de générer un signal audio. Les voix standard n'incluent pas de chaîne de version dans leur nom (en-US_AllisonVoice, par exemple).
  • Voix neuronales qui utilisent des réseaux de neurones profonds (DNN) pour prédire les caractéristiques acoustiques (spectrales) du discours. Les voix neuronales incluent une chaîne de version (V3) dans leur nom (en-US_AllisonV3Voice, par exemple).

Les versions neuronales sont disponibles pour toutes les voix standard, à l'exception de la voix ja-JP_EmiVoice, qui est en attente et sera bientôt disponible. Vous ne pouvez pas utiliser les éléments SSML <express-as> et <voice-transformation> avec les voix neuronales, ni l'attribut volume de l'élément <prosody> avec les voix neuronales. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix.

V2 voix neuronales retirées du service

Le service n'inclut plus les voix DNN V2 qui étaient disponibles auparavant. Si vous utilisez une voix V2 dans votre application, le service utilise automatiquement la voix V3 équivalente à la place.

24 mars 2019

Nouvelles voix neuronales allemandes V2

Le service propose désormais des versions DNN (Deep Neural Network) V2 de ses voix allemandes :

  • de-DE_BirgitV2Voice
  • de-DE_DieterV2Voice

Pour plus d'informations sur les voix basées sur DNN, voir Langues et voix.

Nouvelle prise en charge des attributs pitch et rate de l'élément SSML <prosody>

Toutes les voix basées sur DNN du service prennent désormais en charge les attributs pitch et rate de l'élément SSML <prosody>. Les voix basées sur DNN ne prennent pas en charge l'attribut volume de l'élément <prosody>. Pour plus d'informations, voir la section L'élément prosody.

21 mars 2019

Visibilité des données d'identification de service maintenant limitées par le rôle

Les utilisateurs ne peuvent désormais voir que les données d'identification du service associées au rôle attribué à leur compte IBM Cloud. Par exemple, si un rôle de lecteur (reader) vous est attribué, vous ne pouvez plus voir les niveaux auteur (writer)ou supérieur de données d'identification de service.

Cette modification n'affecte pas l'accès à l'API des utilisateurs ou des applications avec des données d'identification de service existantes. La modification affecte uniquement l'affichage des données d'identification dans IBM Cloud.

4 mars 2019

Nouvelles voix anglaise et italienne V2

Le service propose désormais quatre nouvelles voix V2 qui utilisent une synthèse d’apprentissage en profondeur pour générer de l’audio :

  • en-US_AllisonV2Voice
  • en-US_LisaV2Voice
  • en-US_MichaelV2Voice
  • it-IT_FrancescaV2Voice

Ces nouvelles voix utilisent l'apprentissage automatique et un DNN pour synthétiser du texte en parole. La synthèse DNN (Deep Neural Network) basée sur l'apprentissage en profondeur produit un audio avec une prosodie plus naturelle et une qualité globale plus uniforme.

Cependant, ces nouvelles voix produisent également un son avec des qualités de signal différentes de celles des voix existantes, de sorte qu'elles pourraient ne pas convenir à toutes les applications. De plus, les nouvelles voix ne prennent pas en charge les éléments SSML <prosody>, <express-as> et <voice-transformation>.

Pour plus d'informations sur les voix basées sur DNN et sur la façon dont elles diffèrent des voix existantes, voir Langues et voix.

28 janvier 2019

Nouvelle prise en charge de IBM Cloud IAM par l'interface WebSocket

L'interface WebSocket prend désormais en charge l'authentification IAM (Identity and Access Management) basée sur un jeton à partir de code JavaScript basé sur un navigateur. La limitation contraire a été supprimée. Pour établir une connexion authentifiée avec la méthode /v1/synthesize WebSocket :

  • Si vous utilisez l'authentification IAM, incluez le paramètre de requête access_token.
  • Si vous utilisez les données d'identification du service Cloud Foundry, incluez le paramètre de requête watson-token.

Pour plus d'informations, voir Ouverture d'une connexion.

13 décembre 2018

Nouveau emplacement Londres maintenant disponible
Le service Text to Speech est maintenant disponible sur le site IBM Cloud® de Londres (eu-gb). Comme tous les sites, Londres utilise une authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.

7 novembre 2018

Nouvel emplacement Tokyo maintenant disponible
Le service Text to Speech est maintenant disponible sur le site IBM Cloud® de Tokyo (jp-tok). Comme tous les sites, Tokyo utilise une authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.

30 octobre 2018

Nouveau support pour IBM Cloud IAM à base de jetons

Le service Text to Speech a migré vers l'authentification IAM (Identity and Access Management) par jeton pour tous les sites. Tous les services IBM Cloud utilisent maintenant l'authentification IAM. Le service Text to Speech a migré sur chaque site aux dates suivantes :

  • Dallas (us-south) : 30 octobre 2018
  • Francfort (eu-de) : 30 octobre 2018
  • Washington, DC (us-east) : 12 juin 2018
  • Sydney (au-syd): 15 mai 2018

La migration vers l'authentification IAM affecte différemment les nouvelles instances de service et celles existantes :

  • Toutes les nouvelles instances de service que vous créez sur n’importe quel site utilisent désormais l’authentification IAM pour accéder au service. Vous pouvez transmettre un jeton bearer ou une clé d'API : les jetons prennent en charge les demandes authentifiées sans incorporer les données d'identification du service dans chaque appel. Les clés d'PI utilisent l'authentification de base HTTP. Lorsque vous utilisez l'un des logiciels SDK de Watson, vous pouvez transmettre la clé d'API et laisser le SDK gérer le cycle de vie des jetons.
  • Les instances de service existantes que vous avez créées sur un site avant la date de migration indiquée continuent à utiliser les {username} et {password} issus de leurs données d'identification précédentes du service Cloud Foundry pour l'authentification jusqu'à ce que vous les migriez pour utiliser l'authentification IAM.

Pour plus d'informations, consultez la documentation suivante :

12 juin 2018

Nouvelles fonctions pour les applications hébergées à l'emplacement Washington, DC

Les fonctionnalités suivantes sont activées pour les applications hébergées à Washington, DC (us-east) :

15 mai 2018

Nouvelles fonctions pour les applications hébergées à l'emplacement Sydney

Les fonctionnalités suivantes sont activées pour les applications hébergées à Sydney, (au-syd) :

2 octobre 2017

Modifications du format audio audio/l16
Pour le format audio/l16, vous pouvez désormais spécifier l'ordre d'octets de l’audio renvoyé. (Vous devez déjà spécifier la fréquence d'échantillonnage.) On peut citer par exemple audio/l16;rate=22050;endianness=big-endian et audio/l16;rate=22050;endianness=little-endian; la valeur par défaut est « significant endian ». Pour plus d'informations, voir Utilisation des formats audio.

14 juillet 2017

Nouvelle prise en charge du format audio MP3 (MPEG)
Le service prend désormais en charge le format audio MP3 ou MPEG (Motion Picture Experts Group). Pour plus d'informations sur les formats audio pris en charge, voir Utilisation des formats audio.

10 avril 2017

Nouvelle prise en charge du format audio Web Media (WebM)
Le service prend désormais en charge le format audio Web Media (WebM) avec le codec Opus ou Vorbis. Le service prend désormais également en charge le format audio Ogg avec le codec Vorbis en plus du codec Opus. Pour plus d'informations sur les formats audio pris en charge, voir Utilisation des formats audio.
Nouveau support pour Cross-Origin Resource Sharing
Le service prend désormais en charge le partage de ressources d'origine croisée (CORS) pour permettre aux clients basés sur le navigateur d'appeler directement le service. Pour plus d'informations, voir l'utilisation du support CORS.
Modifications apportées aux codes de réponse HTTP
Les codes de réponse HTTP permettant de mener à bien certaines méthodes de l'interface de personnalisation ont été modifiés :
  • La méthode POST /v1/customizations renvoie désormais 201 (au lieu de 200).
  • La méthode POST /v1/customizations/{customization_id} renvoie désormais 200 (au lieu de 201).
  • La méthode POST /v1/customizations/{customization_id}/words renvoie désormais 200 (au lieu de 201).
  • La méthode PUT /v1/customizations/{customization_id}/words/{word} renvoie désormais 200 (au lieu de 201).
Nouvelles erreurs pour la mauvaise utilisation du paramètre part_of_speech japonais
Les méthodes POST /v1/customizations/{custom_id}/words et PUT /v1/customizations/{customization_id}/words/{word} renvoient maintenant le code de réponse HTTP 400 avec le message d'erreur Part of speech is supported for ja-JP language only si vous tentez de spécifier une partie part_of_speech dans une langue autre que le japonais.
Modifications apportées au corps de la réponse pour l'ajout d'une méthode de mots
La méthode POST /v1/customizations/{custom_id}/words renvoie désormais un corps de réponse vide ({}).

1er décembre 2016

Nouvelle voix latino-américaine en espagnol: es-LA_SofiaVoice

Le service comprend une nouvelle voix, es-LA_SofiaVoice, qui est l'équivalent latino-américain de la voix es-US_SofiaVoice. La différence la plus significative entre les deux voix concerne la façon dont elles interprètent $ (signe dollar) : la version Amérique latine utilise le terme Pesos et la version nord-américaine utilise le terme dolares. D'autres différences mineures pourraient également exister entre les deux voix.

Nouvelles voix en anglais américain : en-US_LisaVoice et en-US_MichaelVoice

En plus de la voix en-US_AllisonVoice, deux autres voix peuvent désormais être transformées avec la transformation de voix SSML : en-US_LisaVoice et en-US_MichaelVoice.

Modifications apportées à la personnalisation pour le japonais

Lorsque vous utilisez l'interface de personnalisation avec le japonais, le service correspond désormais au mot le plus long des paires mot/traduction qui sont définies pour un modèle personnalisé. Par exemple, considérons les deux entrées suivantes pour un modèle personnalisé :

{
  "words": [
    {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"},
    {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"}
  ]
}

Si le service trouve la chaîne « NYC » dans le texte saisi, il reconnaît ce mot, car il s'agit d'une correspondance plus longue que « NY ». Auparavant, le service aurait trouvé une correspondance avec la chaîne « NY ». Pour plus d'informations sur l'utilisation des entrées en japonais dans un modèle personnalisé, consultez la section « Utilisation des entrées en japonais ».

22 septembre 2016

La personnalisation est désormais disponible pour toutes les langues
L'interface de personnalisation, qui inclut la personnalisation et les méthodes GET /v1/pronunciation , est désormais disponible pour toutes les langues prises en charge par le service. L'interface reste une version bêta. Pour plus d'informations, voir Compréhension de la personnalisation.
Nouveau support japonais pour SSML
Le service prend désormais en charge SSML pour le japonais. Pour obtenir des informations générales sur la prise en charge de SSML, voir Présentation de SSML. Pour plus d'informations sur les symboles japonais SPR et IPA, voir Japanese symbols. Des considérations supplémentaires et une zone part_of_speech s'appliquent lors de la création d'entrées pour des mots dans un modèle personnalisé japonais. Pour plus d'informations, voir Utilisation des entrées en japonais.
Nouvelle fonction SSML de transformation vocale
Le service propose désormais la transformation vocale SSML via le nouvel élément <voice-transformation>. Vous pouvez élargir la gamme de voix possibles en créant des transformations personnalisées qui modifient le pas, la plage de pas, la tension glottale, la respiration, le taux et le timbre d'une voix. Le service propose également deux voix virtuelles intégrées, Young et Soft. Le service prend actuellement en charge la transformation de la voix uniquement pour la voix en anglais américain, Allison.
Minutages des mots maintenant disponibles avec l'interface WebSocket
Le service peut maintenant renvoyer des informations de minutage des mots pour toutes les chaînes du texte saisi que vous transmettez à l'interface WebSocket. Pour recevoir l'heure de début et de fin de chaque chaîne de l'entrée, spécifiez un tableau contenant la chaîne words pour le paramètre facultatif timings de l'objet JSON que vous transmettez au service. La fonctionnalité n'est actuellement pas disponible pour le texte saisi en japonais. Pour plus d'informations, voir Génération de minutages de mots.
Nouvelle prise en charge de la validation SSML
Le service valide maintenant tous les éléments SSML que vous soumettez dans n'importe quel contexte. S'il trouve une balise non valide, le service signale un code de réponse HTTP 400 avec un message descriptif et la méthode échoue. Dans les versions précédentes, le service ne traitait pas les erreurs de manière cohérente; le fait d'indiquer une prononciation incorrecte d'un mot, par exemple, pouvait entraîner un comportement imprévisible ou incohérent. Pour plus d'informations, voir Validation du SSML.
Format IBM SPR maintenant spécifié avec ibm au lieu de spr
L'utilisation de spr est obsolète en tant qu'argument de l'option format de la méthode GET /v1/pronunciation et pour une utilisation avec l'attribut alphabet d'un élément SSML <phoneme>. Pour utiliser la notation IBM SPR, utilisez l'argument ibm au lieu de spr dans tous les cas.
Nouvelle prise en charge du format audio audio/mulaw
La liste des formats audio pris en charge inclut maintenant audio/mulaw;rate={rate}. De même qu'audio/basic, ce format offre un son monocanal codé à l'aide de données u-law (ou mu-law) sur 8 bits, échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio.
Nouvelles fonctions prises en charge identifiées lors de l'établissement de la liste des voix
Les méthodes GET /v1/voices et GET /v1/voices/{voice} renvoient maintenant un objet supported_features dans le cadre de leur sortie pour chaque voix. L'objet décrit si la voix prend en charge la personnalisation et l'élément SSML <voice_transformation>. Pour plus d'informations, voir Langues et voix.

23 juin 2016

Nouvelle interface WebSocket pour la synthèse vocale

Le service offre maintenant une interface WebSocket pour la synthèse vocale. L'interface offre les mêmes fonctionnalités que la méthode /v1/synthesize de l'interface HTTP. Elle accepte le texte brut ou le texte marqué avec SSML. En outre, elle prend en charge l'utilisation de l'élément SSML <mark> pour identifier le temps dans l'audio auquel il finit de synthétiser tout le texte qui précède la marque. Pour plus d'informations, voir Interface WebSocket.

Support de langue étendu pour SSML

Le service prend désormais en charge le texte annoté avec SSML pour le castillan, l'espagnol nord-américain, l'italien et le portugais brésilien. Le service prenait déjà en charge l'utilisation de SSML pour l'anglais américain et britannique, le français et l'allemand. À compter de cette mise à jour, le service prend en charge SSML pour toutes les langues, sauf le japonais. De plus, vous pouvez utiliser les notations IBM SPR et IPA pour définir des prononciations de mot avec l'élément SSML <phoneme>. Pour plus d'informations, voir Présentation de SSML et Comprendre les symboles phonétiques.

Pour l'anglais américain, vous pouvez également utiliser l'élément SSML <phoneme> pour créer des entrées de mot dans un modèle personnalisé ; la personnalisation est uniquement prise en charge pour l'anglais américain. Pour plus d'informations, voir Compréhension de la personnalisation.

Voix mise à jour pour une meilleure synthèse vocale

Le service propose une expressivité et un naturel améliorés pour les voix les plus fréquemment utilisées. Les améliorations reposent sur la prédiction de prosodie basée sur un réseau de neurones récurrents (RNN) à partir du texte saisi. Elles sont mises à disposition en tant que nouveau moteur de service et mises à jour de modèles vocaux dans les langues suivantes :

  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • fr-FR_ReneeVoice
Nouveau paramètre d'ID de personnalisation pour la prononciation des mots

La méthode GET /v1/pronunciation accepte désormais un paramètre de requête facultatif customization_id. Le paramètre obtient un mot de traduction à partir d'un modèle personnalisé spécifié. Si le modèle personnalisé ne contient pas le mot, la méthode renvoie la prononciation par défaut du mot. Pour plus d'informations, voir la référence de l'API et du SDK.

Lorsque vous utilisez la méthode GET /v1/pronunciation sans ID de personnalisation et pour une langue autre que l'anglais américain, vous pouvez demander la prononciation d'un mot uniquement en notation IBM SPR. Pour une langue autre que l'anglais américain, vous devez spécifier spr avec l'option format de la méthode.

Nouvelle prise en charge du format audio audio/basic

La liste des formats audio pris en charge inclut désormais audio/basic, qui fournit un son monocanal codé à l'aide de données u-law (ou mu-law) sur 8 bits, échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio.

Les interfaces HTTP et WebSocket peuvent désormais renvoyer des avertissements

Les méthodes HTTP et WebSocket /v1/synthesize peuvent renvoyer une réponse warnings comprenant des messages relatifs aux paramètres de requête non valides ou des zones JSON incluses dans une demande. Le format des avertissements a changé. L'exemple suivant montre le format précédent :

"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."

Le même avertissement a maintenant le format suivant :

"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."

10 mars 2016

Les méthodes de synthèse peuvent maintenant renvoyer des avertissements
Les méthodes GET et POST /v1/synthesize peuvent désormais renvoyer un en-tête de réponse Warnings comprenant une liste de messages d'avertissement concernant des paramètres de requête non valides ou des zones JSON incluses dans la demande. Chaque élément de la liste inclut une chaîne qui décrit la nature de l'avertissement suivie d'un tableau de chaînes d'argument non valides ; par exemple, Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']. Pour plus d'informations, voir laréférence de l'API et du SDK.
La version bêta Apple iOS SDK est obsolète
La version bêta Watson Speech Software Development Kit (SDK) pour le système d'exploitation Apple ® iOS est obsolète et remplacée par Watson Swift SDK. Le nouveau SDK est disponible dans le référentiel swift-sdk, sous l'espace de noms watson-developer-cloud, à l'adresse GitHub.

22 février 2016

Nouvelle fonction SSML expressive
Le service a été mis à jour avec une nouvelle fonctionnalité SSML d'expressivité. Le service étend SSML avec un élément <express-as> que vous pouvez utiliser pour indiquer l'expressivité dans l'un des trois styles de discours suivants : GoodNews, Apology ou Uncertainty. Vous pouvez appliquer l'élément à l'intégralité du texte, à une phrase, une expression ou un mot. Le service ne prend actuellement en charge l’expressivité que pour la voix en anglais américain Allison (en-US_AllisonVoice).

17 décembre 2015

Nouvelle interface de personnalisation bêta

Le service offre une nouvelle interface de personnalisation que vous pouvez utiliser pour spécifier la façon dont il prononce les mots inhabituels qui apparaissent dans votre saisie. L'interface comprend de nouvelles méthodes qui vous permettent de créer et de gérer des modèles personnalisés ainsi que les paires mot/traduction qu'ils contiennent. Vous pouvez ensuite utiliser vos modèles personnalisés lors de la synthèse de texte en audio.

Le service prend en charge les traductions sous forme de sons et les traductions phonétiques. Les traductions phonétiques peuvent utiliser l'alphabet phonétique international (IAP, International Phonetic Alphabet) standard ou la représentation phonétique symbolique (SPR, Symbolic Phonetic Representation) IBM propriétaire. Vous utilisez SSML pour spécifier des traductions phonétiques.

L'interface de personnalisation comprend un ensemble de nouvelles méthodes HTTP portant les noms POST /v1/customizations, POST /v1/customizations/{customization_id}, POST /v1/customizations/{customization_id}/words et PUT /v1/customizations/{customization_id}/words/{word}. Le service fournit également une nouvelle méthode GET /v1/pronunciation qui renvoie la prononciation de n'importe quel mot et une nouvelle méthode GET /v1/voices/{voice} qui renvoie des informations détaillées sur une voix spécifique. De plus, les méthodes existantes de l'interface du service acceptent désormais les paramètres de modèle personnalisés selon les besoins.

Pour plus d'informations sur la personnalisation et son interface, voir Comprendre la personnalisation et la référence API et SDK.

L'interface de personnalisation est une version bêta qui prend actuellement en charge l'anglais américain uniquement. Toutes les méthodes de personnalisation et la méthode GET /v1/pronunciation peuvent actuellement être utilisées pour créer et manipuler des modèles personnalisés et des traductions de mots uniquement en anglais américain.

Nouvelle voix portugais brésilien : pt-BR_IsabelaVoice

Le service prend en charge une nouvelle voix, pt-BR_IsabelaVoice, permettant de synthétiser de l'audio en portugais brésilien avec une voix féminine. Pour plus d'informations, voir Langues et voix.

21 septembre 2015

Nouveaux kits SDK mobiles disponibles

Deux nouveaux kits de développement logiciel (SDK) bêta mobiles sont disponibles pour les services vocaux. Les SDK permettent aux applications mobiles d’interagir avec les services Text to Speech et Speech to Text. Vous pouvez utiliser les kits de développement logiciel pour envoyer du texte au service Text to Speech et recevoir une réponse audio.

  • Le SDK « Watson » ( Swift ) est disponible dans le référentiel swift-sdk, sous l'espace de noms watson-developer-cloud, sur GitHub.
  • Le SDK Android pour la reconnaissance vocale ( Watson ) Android™ SDK est disponible dans le référentiel « speech-android-sdk » de l'espace de noms « watson-developer-cloud » sur GitHub.

Les deux SDK prennent en charge l'authentification avec les services de conversation en utilisant vos données d'identification du service IBM Cloud ou un jeton d'authentification. Les SDK étant des fonctionnalités en version bêta, ils sont susceptibles d'évoluer à l'avenir.

Nouvelle voix japonaise : ja-JP_EmiVoice

Le service prend en charge une nouvelle langue, le japonais. La voix ja-JP_EmiVoice est une voix féminine japonaise.

1er juillet 2015

Le service Text to Speech est désormais disponible en général

Le service est passé de la version bêta à la disponibilité générale (GA) le 1er juillet 2015. Voici les différences qui existent entre la version bêta et la version finale de l'API Text to Speech. La version GA nécessite que les utilisateurs effectuent une mise à niveau pour passer à la nouvelle version du service.

Nouveau modèle de programmation à base de jetons

Un nouveau modèle de programmation prend en charge les interactions directes entre un client et le service. En utilisant ce modèle, un client peut obtenir un jeton d'authentification pour communiquer directement avec le service. A l'aide de ce jeton, le client peut éviter le recours à une application proxy côté serveur dans IBM Cloud pour appeler le service en son nom. Les jetons sont le moyen privilégié par les clients pour interagir avec le service.

Le service continue à prendre en charge l'ancien modèle de programmation reposant sur un proxy côté serveur pour relayer les communications et les données entre le client et le service. Mais le nouveau modèle est plus efficace et fournit un débit plus élevé.

Nouveau support pour Speech Synthesis Markup Language

Vous pouvez maintenant passer du langage SSML (Speech Synthesis Markup Language) aux versions HTTP GET et POST de la méthode /v1/synthesize. SSML est un langage de balisage basé sur XML conçu pour fournir des annotations de texte aux applications de synthèse vocale telles que le service Text to Speech. Pour plus d'informations sur la transmission d'une entrée SSML au service, voir Spécification du texte d'entrée.

Le service ne prend initialement en charge l'utilisation de SSML que pour l'anglais britannique et américain, le français et l'allemand. Le service ne prend pas en charge SSML pour une utilisation avec l'italien et l'espagnol. Lorsque vous utilisez SSML, veillez à ne pas sélectionner de voix pour l'audio dans l'une des langues non prises en charge. Les résultats dans ce cas ne sont pas significatifs.

Modifications apportées aux voix disponibles

Les voix prises en charge pour la synthèse vocale, qui sont modifiées et enrichies. Le service prend désormais en charge plusieurs autres voix, langues et dialectes grâce aux méthodes /v1/synthesize. Pour plus d'informations sur les voix prises en charge, voir Langues et voix.

Les trois voix disponibles en version bêta sont renommées pour la disponibilité générale (GA) :

  • VoiceEnUsMichael est maintenant en-US_MichaelVoice
  • VoiceEnUsLisa est maintenant en-US_LisaVoice
  • VoiceEsEsEnrique est maintenant es-ES_EnriqueVoice

Les noms précédents de ces voix continuent de fonctionner avec la version bêta du service (via les noeuds finaux de l'API -beta) tant que cette version reste disponible. Cependant, vous devez utiliser les nouveaux noms avec la version GA du service.

Nouvelle prise en charge du format Free Lossless Audio Codec (FLAC)

Vous pouvez maintenant demander au service de renvoyer de l'audio au format FLAC (Free Lossless Audio Codec). Le service peut toujours renvoyer de l'audio au format Ogg avec le codec Opus (par défaut) et au format WAV (Waveform Audio File Format). Pour plus d'informations sur l'utilisation des formats audio avec les méthodes /v1/synthesize; voir Utilisation de formats audio.

Nouvelles limites sur la quantité maximale de texte synthétisé

Le texte que vous envoyez à la méthode /v1/synthesize dans l'URL d'une requête HTTP GET ou dans le corps d'une requête HTTP POST est désormais limité à 5 Ko maximum. Le texte avait une taille maximale de 4 Mo pour la version bêta.

Nouvel en-tête pour ne pas contribuer à l'amélioration des services

Les méthodes /v1/synthesize incluent désormais l’en-tête X-WDC-PL-OPT-OUT pour contrôler si le service utilise les résultats texte et audio d’une opération afin d'améliorer les résultats futurs. Spécifiez la valeur 1 pour l'en-tête afin d'empêcher le service d'utiliser des résultats de texte et audio. Le paramètre s'applique uniquement à la demande en cours. Le nouvel en-tête remplace l'en-tête X-logging provenant des méthodes bêta. Pour plus d'informations, voir Contrôle de la journalisation des demandes pour les services Watson.

Modifications des codes d'erreur HTTP pour la synthèse vocale

Pour les méthodes /v1/synthesize, les codes d'erreur suivants ont été modifiés :

  • Le code d'erreur 406 ("Not acceptable. Type MIME non pris en charge. ") est supprimé.
  • Le code d'erreur 415 ("Unsupported Media Type") est ajouté.
  • Le code d'erreur 503 ("Service Unavailable") est ajouté.
Modifications des codes d'erreur HTTP pour la liste des voix

Pour la méthode GET /v1/voices, les codes d'erreur suivants ont été modifiés :

  • Le code d'erreur 406 ("Not acceptable. Type MIME non pris en charge. ") est supprimé.
  • Le code d'erreur 415 ("Unsupported Media Type") est ajouté.