Notes sur l'édition de Text to Speech for IBM Cloud
IBM Cloud
Les fonctionnalités et modifications suivantes ont été intégrées à chaque version et mise à jour des instances gérées d' IBM Watson® Text to Speech hébergées sur IBM Cloud ou des instances hébergées sur IBM Cloud Pak for Data as a Service. Sauf indication contraire, toutes les modifications sont rétrocompatibles et sont disponibles de manière automatique et transparente pour toutes les applications nouvelles et existantes.
Pour plus d'informations sur les limitations connues du service, voir Limitations connues.
Pour plus d'informations sur les mises à jour et les mises à jour du service pour IBM Cloud Pak for Data, voir Notes sur l'édition de Text to Speech for IBM Cloud Pak for Data.
15 mai 2026
- Nouvelle voix féminine naturelle en portugais brésilien
-
Le service propose désormais une nouvelle voix féminine naturelle pour le portugais du Brésil :
pt-BR_IsabelaNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :
26 mars 2026
- La transition vocale de v1 à v3 est obsolète
-
Les voix de concaténation standard ( v1 ) précédemment dépréciées sont désormais remplacées par leurs équivalents neuronaux ( v3 ) lors de la synthèse. Lorsqu'une demande spécifie l'une de ces voix v1, la voix v3 correspondante est utilisée à la place.
de-DE_BirgitVoice->de-DE_BirgitV3Voicede-DE_DieterVoice->de-DE_DieterV3Voiceen-GB_KateVoice->en-GB_KateV3Voiceen-US_AllisonVoice->en-US_AllisonV3Voiceen-US_LisaVoice->en-US_LisaV3Voiceen-US_MichaelVoice->en-US_MichaelV3Voicees-ES_EnriqueVoice->es-ES_EnriqueV3Voicees-ES_LauraVoice->es-ES_LauraV3Voicees-LA_SofiaVoice->es-LA_SofiaV3Voicees-US_SofiaVoice->es-US_SofiaV3Voicefr-FR_ReneeVoice->fr-FR_ReneeV3Voiceit-IT_FrancescaVoice->it-IT_FrancescaV3Voiceja-JP_EmiVoice->ja-JP_EmiV3Voicept-BR_IsabelaVoice->pt-BR_IsabelaV3Voice
Si vous omettez le paramètre facultatif «
voice» dans une requête de synthèse vocale, le service utilise désormais «en-US_MichaelV3Voice» par défaut. Cette voix neuronale ( v3 ) remplace la voix de concaténation standard par défaut ( v1 ),en-US_MichaelVoice.
11 mars 2026
- Important : Dépréciation de la fonctionnalité Beta Tune by Example
-
La fonction bêta "Accorder par l'exemple" est obsolète. Les API permettant de créer de nouvelles invites ou de nouveaux modèles de haut-parleurs ne sont plus prises en charge.
- Utilisateurs existants : Les personnalisations existantes qui contiennent déjà des invites ou des modèles de locuteurs continueront à fonctionner pour la synthèse vocale pendant une période limitée. Cependant, il n'est pas possible de créer de nouvelles invites ou de nouveaux modèles de haut-parleurs.
- Nouveaux utilisateurs : Les API pour la création d'invites ou de modèles de haut-parleurs sont désactivées et ne peuvent pas être utilisées.
La fonction "Accorder par l'exemple" sera entièrement supprimée du service dans une prochaine version. Une fois supprimée, les synthèses utilisant des personnalisations qui s'appuient sur des invites ou des modèles de haut-parleurs ne seront plus prises en charge.
13 janvier 2026
- New English Natural Voices (Voix naturelles en anglais)
-
Le service prend désormais en charge deux nouvelles voix naturelles, une masculine et une féminine, pour l'anglais australien :
en-AU_JackNaturalen-AU_HeidiNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :
5 décembre 2025
- Nouvelles voix naturelles en espagnol latino-américain
-
Le service prend désormais en charge deux nouvelles voix naturelles, une masculine et une féminine, pour l'espagnol d'Amérique latine :
es-LA_AlejandroNaturales-LA_DanielaNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :
31 octobre 2025
- Nouvelles voix naturelles du portugais brésilien
-
Le service prend désormais en charge deux nouvelles voix naturelles - une masculine et une féminine, pour le portugais brésilien :
pt-BR_LucasNaturalpt-BR_CamilaNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :
24 juillet 2025
- New English Natural Voices (Voix naturelles en anglais)
-
Le service prend désormais en charge quatre nouvelles voix naturelles - deux masculines et deux féminines, pour l'anglais américain :
en-US_EmmaNaturalen-US_EthanNaturalen-US_JacksonNaturalen-US_VictoriaNatural
Le service prend désormais en charge deux nouvelles voix naturelles - masculine et féminine - pour l'anglais britannique :
en-GB_ChloeNaturalen-GB_GeorgeNatural
Le service prend désormais en charge une nouvelle voix naturelle féminine pour l'anglais CA :
en-CA_HannahNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir :
09 juillet 2025
- Dépréciation des voix V1
- À partir du 7 septembre 2025, toutes les voix de V1 seront retirées du service. Toutes les voix v1 devenues obsolètes seront automatiquement remplacées par les voix v3 correspondantes dans les 12 prochains mois.
19 mai 2025
- Nouvelle génération de voix - Voix naturelles
-
Le service prend désormais en charge une nouvelle génération de voix appelées Natural Voices, avec une nouvelle voix pour l'anglais américain :
en-US_EllieNatural
Les voix naturelles offrent des performances avancées en termes de naturel et d'expressivité. Ces voix utilisent diverses techniques pour prendre l'avantage sur les voix expressives. Pour plus d'informations, voir Voix naturelles.
- Le service prend désormais en charge l'attribut facultatif supplémentaire
formatpour la balise SSML<say-as interpret-as="letters" format="xx"> -
Vous pouvez désormais spécifier la valeur
groupousingleavec l'attribut facultatifformat. Ces attributs permettent d'améliorer la lisibilité des chaînes alphanumériques comme la confirmation des chiffres et des identifiants en ajoutant des silences stratégiques.
17 février 2025
- Nouvelle voix masculine brésilienne portugaise expressive neurale
-
Le service prend désormais en charge une nouvelle voix masculine expressive pour le portugais brésilien :
pt-BR_LucasExpressive
Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :
09 décembre 2024
- Nouvelle voix neuronale expressive masculine anglaise du Royaume-Uni
-
Le service prend désormais en charge une nouvelle voix neuronale expressive masculine pour l'anglais britannique :
en-GB_GeorgeExpressive
Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :
15 mai 2024
- Nouvelle voix neuronale expressive féminine latino-américaine espagnole
-
Le service prend désormais en charge une nouvelle voix neuronale expressive féminine pour l'espagnol latino-américain
es-LA_DanielaExpressive
Les voix neuronales expressives offrent un discours naturel qui est clair, net et fluide. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :
16 janvier 2024
- Text to Speech pour les voix expressives en anglais américain
- Lorsque vous utilisez des voix expressives en anglais américain, la synthèse est plus rapide avec une latence plus faible.
- Correction d'un défaut : Problème d'inflexion lors de l'utilisation du point d'interrogation ( ?) dans un énoncé court
- Correctif d'incident: Lorsque certains énoncés courts étaient terminés par un point d'interrogation (?), l'inflexion était ignorée. Ce problème est désormais résolu.
30 novembre 2023
- Amélioration du moteur de synthèse Text to Speech pour les voix de la version 3
- Le moteur Text to Speech est amélioré pour fournir une synthèse plus rapide avec un temps d'attente plus faible pour les voix de la version 3.
- Amélioration de la Text to Speech en-AU_HeidiExpressive
- La voix de Text to Speech vocale en-AU_HeidiExpressive est améliorée et permet d'ajuster la hauteur et la synthèse.
9 juin 2023
- Correction d'un défaut : TTS n'échoue plus en raison du message d'erreur "[Errno 2] No such file or directory"
- Correction d'un défaut : Lors de l'utilisation de TTS avec des websockets, il n'y a plus d'échec dû au message d'erreur "[Errno 2] No such file or directory"
18 mai 2023
- Correction de l'incident: ajout de la prise en charge des fonctions SSML manquantes sur la voix néerlandaise
- Correctif d'incident: Lorsque vous utilisez la voix néerlandaise, toutes les fonctions SSML prises en charge fonctionnent désormais comme prévu. Auparavant, lors de l'utilisation de la voix néerlandaise, certaines fonctionnalités de SSML ne fonctionnent pas.
- Correction d'incident: les virgules sont désormais respectées lors de l'utilisation des balises phoneme
- Correctif d'incident: Lorsque vous utilisez des balises de phonème dans SSML, les virgules (pauses) fonctionnent désormais comme prévu. Auparavant, lorsque les virgules précédaient ou suivaient le texte avec des balises phonèmes, la pause était ignorée.
6 avril 2023
- Mises à jour de la version bêta néerlandaise de la voix neuronale améliorée
- Correctif d'incident: La version bêta néerlandaise
nl-NL_MerelV3Voicea été mise à jour pour les correctifs internes et les améliorations. Les limitations décrites pour la version initiale de la voix dans la mise à jour de service du 31 mars 2023 s'appliquent toujours.
31 mars 2023
- Important: fin de service pour toutes les voix neuronales
-
Important: toutes les voix neuronales ont atteint leur date de fin de service et ont été supprimées du service et de la documentation. Aucune voix neurale améliorée ou expressive n'est affectée. Pour une liste complète de toutes les voix neurales obsolètes, voir les mises à jour de service du 1er mars 2023. Une tentative d'utilisation d'une voix obsolète renvoie le code de réponse HTTP 404 avec le message '
Model '{voice}' not found.De nouvelles voix neuronales et expressives améliorées sont disponibles pour l'anglais australien, le coréen et le néerlandais néerlandais. Vous devez migrer vers l'une des nouvelles voix pour l'anglais australien, le coréen ou le néerlandais pour continuer à utiliser les langues obsolètes.
Pour plus d'informations, voir Langues et voix.
22 mars 2023
- Nouvelle version bêta Pays-Bas Voix neuronale améliorée néerlandaise
-
Le service prend désormais en charge une nouvelle voix féminine neuronale améliorée pour le néerlandais:
nl-NL_MerelV3Voice. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR).La nouvelle voix est une fonction bêta en attendant l'achèvement de la prise en charge du SSML. Dans sa version initiale, la voix ne prend pas en charge l'utilisation des fonctions suivantes liées à SSML :
- L'élément
<prosody>avec n'importe quelle demande de synthèse vocale - Les paramètres
rate_percentageetpitch_percentageavec toute demande de synthèse vocale - L'élément
<mark>avec une demande de synthèse vocale WebSocket - Paramètre
timingsdu message texte JSON avec une demande de synthèse vocale WebSocket
Pour plus d'informations sur la nouvelle voix, sa prise en charge des symboles IPA et SPR et la migration vers la nouvelle voix à partir des voix neuronales néerlandaises obsolètes, voir
- L'élément
- Correction de l'incident: mise à jour des symboles phonétiques coréens dans la documentation
-
Correction d'un défaut : Dans la documentation sur les symboles SPR coréens, les symboles à deux caractères pour les consonnes sont désormais placés entre guillemets simples, ce qui en fait un seul symbole. Auparavant, ils étaient représentés par deux symboles distincts, sans guillemets. Pour plus d'informations, voir Consonants(coréen).
- Mises à jour de la documentation pour les symboles IBM SPR
-
La documentation de présentation des symboles IBM SPR a été mise à jour pour clarifier l'utilisation des symboles multi-caractères. Pour plus d'informations, voir Symboles de son vocaux).
1er mars 2023
- Important: En attente de fin de service pour toutes les voix neuronales
-
Important: A compter du 31 mars 2023, toutes les voix neuronales atteignent leur date de fin de service et seront supprimées du service et de la documentation. Les voix neuronales sont obsolètes depuis le 31 mars 2022. Aucune voix neuronale ou expressive améliorée n'est affectée.
Les voix neuronales suivantes sont supprimées :
- Arabe:
ar-MS_OmarVoice - Chinois (mandarin):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceetzh-CN_ZhangJingVoice - Tchèque:
cs-CZ_AlenaVoice - Néerlandais (Belge):
nl-BE_AdeleVoiceetnl-BE_BramVoice - Néerlandais (Pays-Bas) :
nl-NL_EmmaVoiceetnl-NL_LiamVoice - Anglais (Australien):
en-AU_CraigVoice,en-AU_MadisonVoiceeten-AU_SteveVoice - Coréen:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceetko-KR_YunaVoice - Suédois:
sv-SE_IngridVoice
De nouvelles voix neuronales améliorées et des voix neuronales expressives sont déjà disponibles pour l'anglais australien et les langues coréennes. Dans les semaines à venir, une nouvelle voix neuronale améliorée sera disponible pour le néerlandais. Vous devez migrer vers l'une des nouvelles voix pour l'anglais australien, le coréen ou le néerlandais avant le 31 mars 2023.
Pour plus d'informations, voir Langues et voix.
- Arabe:
27 février 2023
- Nouvelles voix neuronales expressives en anglais australien
-
Le service prend désormais en charge deux nouvelles voix neuronales expressives, masculines et féminines, pour l'anglais australien:
en-AU_HeidiExpressiveen-AU_JackExpressive
Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont désormais disponibles pour une utilisation en production. Ils permettent d'utiliser à la fois l'alphabet phonétique international (API) standard et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :
Vous pouvez migrer à partir des voix neuronales en anglais australien qui sont obsolètes vers les nouvelles voix neuronales expressives.
- Nouvelle voix neuronale coréenne améliorée
-
Le service prend désormais en charge une nouvelle voix féminine neuronale améliorée pour le coréen:
ko-KR_JinV3Voice. La nouvelle voix est généralement disponible (GA) pour une utilisation en production. Il prend en charge l'utilisation de l'alphabet phonétique international (API) standard et des symboles phonétiques IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :Vous pouvez migrer à partir de voix neuronales coréennes qui sont obsolètes vers la nouvelle voix neuronale améliorée.
- Correction du défaut: la voix canadienne-française gère désormais correctement les temps numériques
-
Correction d'un défaut : Les voix française et canadienne prononcent désormais correctement les temps comme
19:41Auparavant, les voix omettent des éléments de l'époque dans l'audio synthétisé. - Correction du défaut: la voix japonaise n'insère plus de données audio inattendues
-
Correctif d'incident: La voix japonaise n'insère plus de données audio inattendues dans les résultats de la synthèse vocale. Auparavant, d'autres sons étaient insérés dans certains cas.
20 janvier 2023
- Cloud Foundry-obsolescence et migration vers des groupes de ressources
-
IBM a annoncé la dépréciation d'IBM Cloud Foundry le 31 mai 2022. A partir du 30 novembre 2022, les nouvelles IBM Cloud Foundry ne pourront pas être créées et seuls les utilisateurs existants pourront déployer des applications. IBM Cloud Foundry arrive en fin de support le 1er juin 2023. Ensuite, toutes les instances d'exécution d'applications IBM Exécutant des applications Cloud Foundry IBM seront définitivement désactivées et supprimées Seront définitivement désactivées, déprovisionnées et supprimées.
Pour continuer à utiliser vos applications IBM Cloud au-delà du 1er juin 2023, vous devez migrer vers des groupes de ressources avant cette date. Les groupes de ressources sont conceptuellement similaires aux espaces Cloud Foundry. Ils offrent plusieurs avantages supplémentaires, tels qu'un contrôle d'accès plus précis grâce à la gestion des identités et des accès ( IBM Cloud Identity and Access Management, IAM), la possibilité de connecter des instances de service à des applications et des services situés dans différentes régions, ainsi qu'un moyen simple de consulter l'utilisation par groupe.
- Correction de l'incident: la spécification de grands nombres cardinaux avec l'élément
<say-as>ne provoque plus d'erreurs pour les voix anglaises -
Correctif de défaut: vous pouvez désormais utiliser l'élément
<say-as>pour prononcer des nombres élevés en tant que nombres cardinaux. Auparavant, l'inclusion d'un grand nombre dans l'élément<say-as>avec l'attributinterpret-as="cardinal"pouvait entraîner l'échec de la synthèse vocale pour les voix anglaises. Par exemple,<say-as interpret-as="cardinal">3,200</say-as>peut amener le service à générer une erreur. Pour plus d'informations, voir cardinal dans la rubrique Eléments SSML. - Correction des défauts: les homonymes et autres mots sont maintenant prononcés correctement par les voix anglaises
-
Correctif d'incident: Le service prononce désormais correctement les homonymes et les autres mots en fonction de leur contexte dans le texte en anglais à synthétiser. Auparavant, des mots tels que
advocateetwifipouvaient être prononcés de manière incorrecte par les voix anglaises.
30 novembre 2022
- Correctif d'incident: Ajoutez des règles pour la documentation de dénomination de modèle personnalisé
- Correctif d'incident: La documentation fournit désormais des règles détaillées pour l'attribution de noms aux modèles personnalisés. Pour plus d'informations, voir :
7 octobre 2022
- Le service applique désormais une validation SSML plus stricte
- Le service applique désormais une validation plus stricte du texte d'entrée qui inclut des éléments SSML (Speech Synthesis Markup Language). Les éléments obligatoires des attributs doivent être spécifiés avec des valeurs valides. Sinon, la demande échoue avec un code d'erreur 400. Pour plus d'informations sur la validation SSML et les exigences que le texte marqué doit remplir, voir Validation SSML.
- Correction d'un défaut : Le sexe indiqué pour la voix
en-US_MichaelExpressiveest désormais correct - Correctif d'incident: Lorsque vous répertoriez des informations sur les voix disponibles, le
genderde la voixen-US_MichaelExpressiveest désormaismale. Auparavant, le genre de la voix était décrit par erreur commefemale. Pour plus d'informations, voir Affichage de la liste des informations sur les voix.
23 septembre 2022
- Nouvelles voix neuronales expressives en anglais américain
-
Le service offre quatre nouvelles voix neuronales expressives pour l'anglais américain:
en-US_AllisonExpressiveen-US_EmmaExpressiveen-US_LisaExpressiveen-US_MichaelExpressive
Les voix neuronales expressives offrent un discours naturel qui est exceptionnellement clair, net et fluide. Les nouvelles voix sont désormais disponibles pour une utilisation en production. Ils permettent d'utiliser à la fois l'alphabet phonétique international (API) standard et IBM Symbolic Phonetic Representation (SPR). Pour plus d'informations, voir :
- Nouveaux styles de parole pour les voix neuronales expressives
-
Les voix neuronales expressives déterminent le sentiment du texte à partir du contexte de ses mots et phrases. Le discours qu'ils produisent, en plus d'avoir un style conversationnel, reflète l'ambiance du texte. Mais vous pouvez embellir les tendances naturelles des voix en indiquant que tout ou partie du texte est de mettre l'accent sur l'un des styles de parole suivants:
- Cheerful-Exprime le bonheur et les bonnes nouvelles.
- Empathétique-Exprime l'empathie ou la sympathie.
- Neutre-Exprime l'objectivité et l'équité.
- Incertain-Exprime la confusion ou l'incertitude.
Pour plus d'informations, voir Utilisation de styles de parole.
- Nouvel accent d'interjection avec des voix neuronales expressives
-
Avec les voix neuronales expressives, le service détecte automatiquement un ensemble d'interjections communes en fonction du contexte. Quand il synthétise ces interjections, il leur donne l'accent naturel qu'un humain utiliserait dans une conversation normale. Pour certaines des interjections, vous pouvez utiliser SSML pour activer ou désactiver leur mise en évidence. Pour plus d'informations, voir Insister sur les interjections.
- Mise en valeur de nouveaux mots par des voix neuronales expressives
-
Les voix expressives utilisent un style conversationnel qui applique naturellement l'intonation correcte du contexte. Mais vous pouvez indiquer qu'un ou plusieurs mots doivent être plus ou moins mis en évidence. Le changement de contrainte peut être indiqué par une augmentation ou une diminution du pas, de la temporisation, du volume ou d'autres attributs acoustiques. Pour plus d'informations, voir Insister sur les mots.
21 septembre 2022
- Nouvel événement Activity Tracker pour la suppression RGPD des informations utilisateur
- Le service renvoie désormais un événement Activity Tracker lorsque vous utilisez la méthode
DELETE /v1/user_datapour supprimer toutes les informations relatives à un utilisateur. L'événement est nommétext-to-speech.gdpr-user-data.delete. Pour plus d'informations, voir Evénements Activity Tracker. - Correction d'incident: les traductions de mots personnalisées acceptent désormais les virgules dans tous les cas
- Correctif d'incident: Les traductions Word ajoutées aux modèles personnalisés acceptent désormais les virgules dans tous les cas. Auparavant, une virgule dans une traduction pouvait occasionnellement empêcher la traduction de générer un son valide lorsqu'elle était utilisée pour des synthèses vocales. Ce problème a été identifié dans les modèles personnalisés en anglais américain.
- Correction des défauts: la synthèse française des dates est désormais cohérente
- Correctif de défaut: la synthèse française n'inclut plus l'article "le" avant les dates de la forme "l' ordinal de mois." Auparavant, l'article n'était inclus que pour le premier jour du mois pour le français (par exemple, "le premier septembre", "le premier septembre").
- Limites connues de l'utilisation du format audio Ogg avec le navigateur Safari
- Par défaut, le service renvoie de l'audio au format Ogg avec le codec Opus
audio/ogg;codecs=opusCependant, le format audio Ogg n'est pas supporté par le navigateur Safari. Si vous utilisez le service Text to Speech avec le navigateur Safari, vous devez spécifier un format différent dans lequel vous souhaitez que le service renvoie l'audio.- Pour plus d'informations sur les formats disponibles, voir Formats audio pris en charge.
- Pour plus d'informations sur la spécification d'un format, voir Spécification d'un format audio.
31 août 2022
- Nouveau paramètre de requête
rate_percentagebêta pour le contrôle du débit de parole global - Le service offre un nouveau paramètre de requête
rate_percentagepour modifier le débit de parole d'une demande de synthèse vocale. Le débit de parole est la vitesse à laquelle le service parle le texte qu'il synthétise en parole. Un taux plus élevé permet de parler plus rapidement le texte ; un taux plus faible permet de le faire plus lentement. Le paramètre modifie le débit par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification du débit de parole. - Nouveau paramètre de requête
pitch_percentagebêta pour le contrôle de la hauteur de parole globale - Le service offre un nouveau paramètre de requête
pitch_percentagepour modifier la hauteur de parole d'une requête de synthèse. La hauteur de parole représente la tonalité de la parole que le service synthétise. Il représente la hauteur ou la hauteur du ton de la voix perçue par l'auditeur. Un ton plus élevé se traduit par une parole qui est parlée à un ton plus élevé et est perçue comme une voix plus élevée ; un ton plus bas se traduit par une parole qui est parlée à un ton plus bas et est perçue comme une voix plus faible. Le paramètre modifie la hauteur par défaut par voix pour une demande entière. Pour plus d'informations, voir Modification de la hauteur de parole. - Correction d'incident: la synthèse japonaise est améliorée pour gérer les longues chaînes de texte d'entrée
- Correctif d'incident: Le service synthétise désormais correctement les demandes japonaises qui incluent de longues chaînes de caractères. Auparavant, le service ne parvenait pas à synthétiser correctement les longues chaînes de texte en japonais.
- Mises à jour de la documentation pour l'élément
<prosody>SSML - La documentation de l'élément SSML
<prosody>et de ses paramètrespitchetratea été améliorée et clarifiée. Il inclut également une description des différences entre le service et la dernière version de la spécification SSML. Pour plus d'informations, voir L'élément<prosody>.
3 août 2022
- Le service ne prend pas en charge la synthèse vocale multilingue
- Le service ne prend pas en charge la synthèse vocale multilingue pour le moment. Cependant, vous pouvez utiliser la personnalisation pour approximer la prononciation des mots d'autres langues. Pour plus d'informations, voir Synthèse vocale multilingue.
27 juillet 2022
- Nouveau paramètre
spell_out_modebêta pour les voix allemandes - Pour indiquer comment les caractères individuels d'une chaîne doivent être orthographiés, vous pouvez désormais inclure le paramètre de requête
spell_out_modebêta avec une demande de synthèse pour une voix allemande. Par défaut, le service affiche des caractères individuels au même rythme qu'il synthétise du texte pour une langue. Vous pouvez utiliser ce paramètre pour demander au service d'épeler les caractères individuels plus lentement, par groupes de un, deux ou trois caractères. Utilisez le paramètre avec l'élément SSML<say-as>pour contrôler la façon dont les caractères d'une chaîne sont synthétisés. Pour plus d'informations, voir Spécification de la manière dont les chaînes sont définies.
25 mai 2022
- Nouvelle prise en charge du format audio
audio/alaw - La liste des formats audio pris en charge inclut maintenant
audio/alaw;rate={rate}. Commeaudio/basicetaudio/mulaw, ce format fournit un audio à canal unique codé en utilisant des données u-law (ou mu-law) de 8 bits qui sont échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio.
19 mai 2022
- Correction de défaut: Plusieurs balises SSML
<phoneme>consécutives sont maintenant analysées correctement - Correction de défaut: Le service synthétise désormais correctement le texte contenant des balises
<phoneme>consécutives. Auparavant, si le texte contenait deux balises<phoneme>consécutives ou plus, le service n'a synthétisé que la première balise, en ignorant les autres.
31 mars 2022
- Important: obsolescence de toutes les voix neuronales
-
Important: A partir du 31 mars 2022, toutes les voix neuronales sont obsolètes. Les voix obsolètes restent disponibles pour les utilisateurs existants jusqu'au 31 mars 2023, lorsqu'elles seront supprimées du service et de la documentation. Aucune voix neuronale améliorée ou voix expressive n'est obsolète.
Les voix neuronales suivantes sont désormais obsolètes:
- Arabe:
ar-MS_OmarVoice - Chinois (mandarin):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceetzh-CN_ZhangJingVoice - Tchèque:
cs-CZ_AlenaVoice - Néerlandais (Belge):
nl-BE_AdeleVoiceetnl-BE_BramVoice - Néerlandais (Pays-Bas) :
nl-NL_EmmaVoiceetnl-NL_LiamVoice - Anglais (Australien):
en-AU_CraigVoice,en-AU_MadisonVoiceeten-AU_SteveVoice - Coréen:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceetko-KR_YunaVoice - Suédois:
sv-SE_IngridVoice
Les voix neuronales obsolètes continuent d'être disponibles pour les utilisateurs existants mais ne sont plus disponibles pour les nouveaux utilisateurs:
- Utilisateurs existants: Les instances du service créé avant 31 mars 2022 peuvent continuer à utiliser les voix obsolètes pour la synthèse vocale. Ces instances peuvent également servir à créer et à utiliser des modèles
personnalisés basés sur les voix obsolètes. Et ils peuvent continuer à répertorier et interroger les voix avec les méthodes
GET /v1/voicesetGET /v1/voices/{voice}. - Nouveaux utilisateurs : les instances du service créées à compter du 31 mars 2022 ne peuvent plus utiliser les voix obsolètes pour la synthèse vocale. Ces instances ne peuvent pas non plus être utilisées pour créer des
modèles personnalisés basés sur les voix obsolètes. Ils ne peuvent pas répertorier ou interroger les voix avec les méthodes
GET /v1/voicesetGET /v1/voices/{voice}. Tout appel d'API qui inclut l'une des voix obsolètes renvoie un code d'erreur HTTP 400 ou 404, en fonction de l'appel.
De nouvelles voix pour l'anglais australien, le néerlandais et le coréen seront publiées d'ici le 15 février 2023. Si vous utilisez des voix en anglais australien, en néerlandais ou en coréen, vos appels d'API seront automatiquement redirigés vers les nouvelles voix dans cette langue. Les voix en arabe, en chinois, en tchèque, en suédois et en flamand seront retirées du service.
Pour plus d'informations sur toutes les langues et voix disponibles, consultez la section Langues et voix.
- Arabe:
- Les voix standard obsolètes sont supprimées de la documentation
-
Les voix de concaténation standard ont été supprimées le 2 décembre 2020. Ces voix standard ont été supprimées de la référence de l'API. Le sujet « Passage des voix standard aux voix neuronales » a également été supprimé de la page « Langues et voix ».
De même, l'ancien nom de la voix arabe,
ar-AR_OmarVoice, a été rendu obsolète en même temps. Il a également été supprimé de la documentation. Utilisez la voixar-MS_OmarVoiceà la place.
28 février 2022
- Modification de la réponse de minutage des mots pour l'interface WebSocket
-
L'objet de réponse que le service renvoie lorsque vous demandez les durées des mots via l'interface WebSocket a été modifié. Le service envoie maintenant les résultats du minutage des mots dans un tableau unique qui comprend une chaîne de caractères suivie de deux valeurs en virgule flottante :
{ "words": [ ["Hello", 0.0, 0.259], ["world", 0.259, 0.532] ] }Le service a déjà envoyé les résultats du minutage sous la forme d'un tableau contenant une chaîne de caractères suivi d'un tableau de deux valeurs en virgule flottante :
{ "words": [ ["Hello", [0.0629826778195474, 0.2590192737303819]], ["world", [0.2598829173456253, 0.5322130804452672]] ] }De plus, le niveau de précision des minutages des mots et des marques est maintenant réduit à trois décimales. Pour plus d'informations sur les nouvelles réponses, voir Génération de minutages de mots.
Remarque : les résultats pour les voix neurale et neurale améliorées étaient différents auparavant. Ces incohérences pourraient entraîner des erreurs dans les SDK d' Watson. Les résultats pour toutes les voix sont maintenant cohérents.
26 janvier 2022
- Correctif d'incident: amélioration de la documentation SSML
- Correction d'erreurs : la documentation SSML a été mise à jour afin de corriger les erreurs suivantes :
- Les exemples de l'élément
<break>sont maintenant corrects. L'élément n'est pas unaire, comme indiqué dans les exemples. Les exemples précédents comprenaient des balises ouvertes et fermées avec du texte incorporé. Le texte intégré n'était pas énoncé par le service. Pour plus d'informations, voir Élément<break>. - Le service prend en charge SSML version 1.1. Tous les références et exemples utilisent maintenant la version correcte. La documentation faisait référence précédemment à la version 1.0.
- Les exemples de l'élément
3 décembre 2021
- Nouvelle voix neuronale tchèque :
cs-CZ_AlenaVoice -
Une nouvelle langue, le tchèque, avec une nouvelle voix féminine,
cs-CZ_AlenaVoice, est maintenant disponible. La voix est une voix neuronale. - Nouvelle voix neuronale en néerlandais belge :
nl-BE_BramVoice -
Une nouvelle voix masculine néerlandais belge (flamand),
nl-BE_BramVoice, est maintenant disponible. La voix est une voix neuronale. - Correction des défauts: Amélioration de la synthèse vocale et SSML
-
Correction de bogues : les bogues suivants concernant le langage de balisage pour la synthèse vocale (SSML) et la synthèse vocale ont été corrigés dans cette version :
- L'attribut
pitchde l'élément<prosody>est maintenant appliqué à tous les textes spécifiés. Auparavant, le changement de pas n'était pas toujours appliqué au premier mot du texte affecté. De plus, la documentation contient désormais davantage d'indications sur la manière de définir une valeur pour l'option «pitch». Pour plus d'informations, voir L'attributpitch. - La synthèse vocale du texte japonais parle maintenant plus lentement. Auparavant, la voix synthétisée était trop rapide. Si vous trouvez que la synthèse du texte japonais est encore trop rapide pour votre application, utilisez l'attribut
ratede l'élément SSML<prosody>pour contrôler le débit de la voix. Pour plus d'informations, voir L'attributrate. - Les voix neuronales analysent désormais correctement l'apostrophe (
'). Auparavant, certaines voix neuronales n'interprétaient pas correctement le caractère.
- L'attribut
22 octobre 2021
- Plusieurs améliorations de la voix neuronale
- Les voix neurales existantes pour le chinois, le néerlandais (Belgique et Pays-Bas), l'anglais australien et le coréen ont été mises à jour pour améliorer la synthèse vocale et les résultats audio. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix.
- Nouvelle voix neuronale en anglais australien :
en-AU_SteveVoice - Une nouvelle voix masculine australienne,
en-AU_SteveVoice, est maintenant disponible. La voix est une voix neuronale. - Nouvelle voix neuronale suédoise :
sv-SE_IngridVoice - Une nouvelle langue, le suédois, avec une nouvelle voix féminine,
sv-SE_IngridVoice, est maintenant disponible. La voix est une voix neuronale.
6 octobre 2021
- Nouveau support HIPAA américain pour les plans Premium dans l'emplacement de Dallas
- Le support de la US Health Insurance Portability and Accountability Act (HIPAA) est maintenant disponible pour les plans Premium hébergés dans l'emplacement de Dallas (
us-south). Pour plus d'informations, voir Health Insurance Portability and Accountability Act (HIPAA). - Correction d'un bug : amélioration de la voix neurale optimisée pour l'espagnol d'Amérique latine
- Correction d'erreur : pour la voix espagnole d'Amérique latine (
es-LA_SofiaV3Voice), les questions de tous les types utilisent désormais l'intonation correcte.
16 septembre 2021
- Correction d'un bug : amélioration des voix neuronales optimisées pour l'espagnol castillan et l'espagnol nord-américain
- Correction d'erreur : pour les voix castillane espagnole (
es-ES_EnriqueV3Voiceetes-ES_LauraV3Voice) et en espagnol d'Amérique du Nord (es-US_SofiaV3Voice), les questions de tous les types utilisent désormais l'intonation correcte. Pour la voix latino-américaine en espagnol (es-LA_SofiaV3Voice), certaines questions n'utilisent pas l'intonation et ressemblent plutôt à des instructions. La version en espagnol d'Amérique latine sera bientôt disponible.
16 juillet 2021
- Nouvelle voix neuronale en néerlandais belge :
nl-BE_AdeleVoice - Le service prend désormais en charge le néerlandais belge (flamand) avec la voix neurale
nl-BE_AdeleVoice. La voix en néerlandais belge prend en charge la personnalisation et est généralement disponible (GA) pour l'utilisation en production.
12 avril 2021
- Nouvelle voix neuronale améliorée en français :
fr-CA_LouiseV3Voice -
Le service prend maintenant en charge le français canadien avec la voix neuronale améliorée
fr-CA_LouiseV3Voice. La voix canadienne française prend en charge la personnalisation et est généralement disponible (GA) à des fins de production.- Pour entendre un exemple de la nouvelle voix, voir Langues et voix prises en charge.
- Pour plus d'informations sur les symboles phonétiques et les valeurs Unicode disponibles pour la langue française, voir Symboles français (canadiens).
- Nouvelle fonction Tune by Example
-
La nouvelle fonction Tune by Example permet de contrôler l'énoncé du texte spécifié par le service. Cette fonctionnalité est en version bêta et n'est prise en charge que pour les modèles et les voix personnalisés en anglais américain. Elle est constituée de deux composants :
- Invites personnalisées : incluent le texte écrit qui doit être énoncé et audio enregistré qui énonce le texte comme vous voulez l'entendre. L'audio spécifie l'intonation, le rythme et l'emphase du texte synthétisé. L'invite peut mettre l'accent sur des syllabes ou des mots différents, introduire des pauses et, d'une manière générale, rendre le son synthétisé plus naturel et plus approprié à son contexte.
- Modèles de locuteurs : fournissent un enregistrement audio pour un utilisateur qui énonce une ou plusieurs invites. Un modèle de locuteur fournit un échantillon audio de la voix d'un utilisateur. Le service s'entraîne sur la voix, ce qui peut l'aider à produire des messages de qualité supérieure pour ce locuteur.
Vous spécifiez une invite personnalisée avec une demande de synthèse vocale pour indiquer comment la voix du service doit prononcer le texte. Pour spécifier une invite, utilisez l'extension SSML
<ibm:prompt id="{prompt_id}"/>. L'audio synthétisé reproduit la prosodie de l'invite. - Nouvelles méthodes Tune by Example
-
Le service comprend huit nouvelles méthodes de travail avec l'option Tune by Example. Les descriptions des nouvelles méthodes qui suivent contiennent des liens vers leurs entrées dans la documentation de référence de l'API et du SDK. Vous pouvez avoir besoin de sélectionner l'onglet
Curlde la référence pour voir les nouvelles méthodes.-
Le service comprend quatre méthodes de travail avec des invites personnalisées :
- Répertorier les invites personnalisées:
GET /v1/customizations/{customization_id}/prompts - Obtenir une invite personnalisée:
GET /v1/customizations/{customization_id}/prompts/{prompt_id} - Supprimer une invite personnalisée:
DELETE /v1/customizations/{customization_id}/prompts/{prompt_id}
- Répertorier les invites personnalisées:
-
Le service comprend quatre méthodes d'utilisation des modèles de locuteurs :
- Répertorier les modèles de locuteur:
GET /v1/speakers - Obtenir un modèle de locuteur:
GET /v1/speakers/{speaker_id} - Supprimer un modèle de locuteur:
DELETE /v1/speakers/{speaker_id}
- Répertorier les modèles de locuteur:
-
- Mises à jour des actions Activity Tracker pour la personnalisation
-
Les noms des actions pour les événements Activity Tracker pour les méthodes de personnalisation ont été modifiés. Les actions incluent maintenant la chaîne
custom-modelau lieu decustom-voice. Les anciens noms des actions sont obsolètes. Les anciens noms sont toujours disponibles, mais seront retirés à une date ultérieure. Migrez vers les nouveaux noms répertoriés dans Événements de personnalisation dès que vous le souhaitez.Créer des événements Nom d'action obsolète-> Nouveau nom d'action
text-to-speech.custom-voice.create->text-to-speech.custom-model.createtext-to-speech.custom-voice-word-list.create->text-to-speech.custom-model-word-list.createtext-to-speech.custom-voice-word.create->text-to-speech.custom-model-word.create
Lire les événements Nom d'action obsolète-> Nouveau nom d'action
text-to-speech.custom-voice-list.read->text-to-speech.custom-model-list.readtext-to-speech.custom-voice.read->text-to-speech.custom-model.readtext-to-speech.custom-voice-word-list.read->text-to-speech.custom-model-word-list.readtext-to-speech.custom-voice-word.read->text-to-speech.custom-model-word.read
Mettre à jour l'événement Nom d'action obsolète-> Nouveau nom d'action
text-to-speech.custom-voice.update->text-to-speech.custom-model.update
Supprimer des événements Nom d'action obsolète-> Nouveau nom d'action
text-to-speech.custom-voice.delete->text-to-speech.custom-model.deletetext-to-speech.custom-voice-word.delete->text-to-speech.custom-model-word.delete
2 décembre 2020
- Améliorations multiples de la voix
-
Les voix proposées par le service ont considérablement évolué. Le service prend en charge de nouvelles langues et voix, a amélioré la qualité de nombreuses voix et a rendu obsolètes de nombreuses anciennes voix. De plus, toutes les voix des services sont désormais personnalisables et disponibles en version générale (GA) pour une utilisation en production.
- Nouvelles voix neuronales et neuronales améliorées
-
Pour optimiser la qualité globale de la synthèse vocale, toutes les voix disponibles sont maintenant basées sur la technologie neuronale. Le service offre deux types de voix basées sur la technologie neuronale :
- Les voix neuronales, qui n'incluent pas la chaîne
V3dans leurs noms, sont maintenant disponibles pour l'arabe, l'anglais australien, le chinois, le néerlandais belge et le coréen. Les voix neuronales permettent d'utiliser alphabet phonétique international (IAP) avec l'élément Speech Synthesis Markup Language (SSML)<phoneme>. - Les voix neuronales améliorées, qui incluent la chaîne
V3dans leurs noms, sont maintenant disponible pour le portugais (Brésil), l'anglais Royaume-Uni, l'anglais États-Unis, le français, l'allemand, l'italien, le japonais et l'espagnol (tous les dialectes). Les voix neuronales améliorées prennent en charge l'utilisation d'IAP et de IBM Symbolic Phonetic Representation (SPR) avec l'élément SSML<phoneme>. Les voix neuronales améliorées atteignent également un degré légèrement plus élevé d'expression naturelle. D'autres options de personnalisation seront mises à disposition pour les voix générées par IA dans les mois à venir.
Le service n'offre plus de voix standard pour aucune des langues. Les voix standard ont utilisé la synthèse par concaténation pour assembler des segments de parole enregistrée afin de générer le fichier audio demandé.
Pour plus d'informations, voir Langues et voix.
- Les voix neuronales, qui n'incluent pas la chaîne
- Nouvelles voix neuronales anglais australien et coréen
-
Les voix suivantes en anglais australien et en coréen sont nouvelles :
- Le service prend désormais en charge l'anglais australien avec les deux voix neuronales suivantes :
en-AU_CraigVoiceeten-AU_MadisonVoice. - Le service prend désormais en charge deux nouvelles voix neuronales coréennes:
ko-KR_HyunjunVoiceetko-KR_SiWooVoice.
- Le service prend désormais en charge l'anglais australien avec les deux voix neuronales suivantes :
- Amélioration des voix neuronales
-
Les voix des langues existantes (arabe, chinois, néerlandais et coréen), qui étaient toutes de type concaténatif, sont désormais de type neuronal :
ar-MS_OmarVoiceko-KR_YoungmiVoiceko-KR_YunaVoicenl-NL_EmmaVoicenl-NL_LiamVoicezh-CN_LiNaVoicezh-CN_WangWeiVoicezh-CN_ZhangJingVoice
Les modifications suivantes ont également été apportées :
- La voix arabe s'appelle maintenant
ar-MS_OmarVoice. L'ancien nomar-AR_OmarVoiceest obsolète. Il continuera de fonctionner pendant au moins un an, mais pourrait être supprimé à une date ultérieure. Nous vous encourageons à migrer vers le nouveau nom dès que vous le souhaitez. - La langue arabe prend désormais en charge l'utilisation des symboles IAP et des valeurs Unicode avec l'élément SSML
<phoneme>. Pour créer un modèle personnalisé pour l'arabe, vous devez utiliser l'identificateur de languear-MS. L'identificateurar-ARn'est pas pris en charge pour la personnalisation. - Les symboles IPA pour la langue arabe sont nouveaux. Les symboles mentionnés précédemment ont été remplacés.
- Les symboles de l'IAP pour le néerlandais ont été modifiés comme suit :
- Le néerlandais ne prend plus en charge les symboles IPA suivants:
tʲ(0074+02B2),ɲ(0272),ʦ(02A6) etʔ(0294). - Le néerlandais des Pays-Bas prend désormais en charge le symbole IPA suivant :
ɣ(0263).
- Le néerlandais ne prend plus en charge les symboles IPA suivants:
- Voix standard obsolètes
-
Les voix de concaténation standard suivantes sont désormais obsolètes :
de-DE_BirgitVoicede-DE_DieterVoiceen-GB_KateVoiceen-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicees-ES_LauraVoicees-LA_SofiaVoicees-US_SofiaVoicefr-FR_ReneeVoiceit-IT_FrancescaVoiceja-JP_EmiVoicept-BR_IsabelaVoice
Toutes les voix standard qui sont devenues obsolètes ont des équivalents neuronaux, donc aucune voix n'est retirée. Vous pouvez plutôt passer à la version neuronale équivalente de la voix (par exemple, de
de-DE_BirgitVoiceàde-DE_BirgitV3Voice) pour obtenir de meilleurs résultats de synthèse vocale.Ces voix obsolètes sont supprimées de la documentation publiée. Elles continueront à fonctionner pendant au moins un an, mais pourraient être retirées à une date ultérieure. Nous vous encourageons à migrer vers les voix neuronales équivalentes dès que possible.
Si vous ne définissez pas le paramètre facultatif
voiceà partir d'une demande de synthèse vocale, le service utilise par défauten-US_MichaelV3Voice. Cette voix neuronale remplace la voix standarden-US_MichaelVoicedésormais obsolète qui était la voix par défaut. - Fonctions obsolètes
-
Les fonctionnalités suivantes n'étaient disponibles que pour les voix de concaténation standard. Elles sont obsolètes et ont été supprimées de la documentation publiée. Elles continueront à fonctionner pendant au moins un an, mais pourraient être retirées à une date ultérieure. Nous vous encourageons à supprimer ces fonctions de vos applications et à migrer vers les voix neuronales dès que possible.
- Expressive SSML. Il s'agit d'une extension IBM de SSML qui n'était prise en charge que pour la voix
en-US_AllisonVoice. - Voice transformation SSML. Il s'agit d'une extension IBM àde SSML qui n'était prise en charge que pour les voix
en-US_AllisonVoice,en-US_LisaVoiceeten-US_MichaelVoice - L'attribut
volumede l'élément<prosody>Cet attribut était disponible pour toutes les voix standard.
L'inclusion de ces éléments SSML avec une demande de synthèse pour une voix neuronale génère le code de réponse HTTP 400, car la validation SSML de la demande échoue. Pour plus d'informations sur la validation SSML, voir Validation SSML.
- Expressive SSML. Il s'agit d'une extension IBM de SSML qui n'était prise en charge que pour la voix
- Nouveau support pour Cross-Origin Resource Sharing
-
Le support CORS (Cross-Origin Resource Sharing) est désormais disponible pour toutes les voix des navigateurs Google Chrome™ et Apple ® Safari. Il n'est pas disponible dans le navigateur Mozilla Firefox™ pour les voix en arabe, anglais australien, chinois, néerlandais belge et coréen. Pour plus d'informations, voir l'utilisation du support CORS.
10 septembre 2020
- Correction d'un bug : amélioration de la voix japonaise
-
Correctif d'incident : Pour la voix
ja-JP_EmiV3Voice, le service analyse désormais correctement le texte d'entrée SSML qui inclut une spécification de taux de prosodie. Auparavant, l'utilisation suivante de l'élément<prosody>fonctionnait correctement :<speak>成功する/繁栄する</speak>Mais l'utilisation suivante de l'attribut
rateavec l'élément<prosody>amenait le service à lire et énoncer la notation SSML intégrée :<speak> <prosody rate="fast">成功する/繁栄する</prosody> </speak>Le service analyse maintenant correctement et applique l'attribut
ratede l'élément<prosody>pour l'entrée japonaise.
4 septembre 2020
- Une interface de personnalisation est désormais accessible à tous
- L'interface de personnalisation est maintenant généralement disponible (GA). La personnalisation n'est plus une fonctionnalité en version bêta. Vous pouvez utiliser l'interface de personnalisation pour spécifier la façon dont le service prononce les mots inhabituels qui apparaissent dans le texte que vous entrez, en créant des dictionnaires personnalisés spécifiques à la langue. Elle peut être utilisée avec toutes les voix disponibles et bêta. Pour plus d'informations, voir Compréhension de la personnalisation.
24 juin 2020
- Nouvelles voix neuronales anglaises britanniques et françaises
-
Le service propose désormais deux nouvelles voix générées par réseau neuronal :
- Anglais britannique :
en-GB_CharlotteV3Voice - Français :
fr-FR_NicolasV3Voice
Il offre également une version améliorée de la voix neuronale britannique existante,
en-GB_KateV3Voice. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix. - Anglais britannique :
- Prise en charge de l'attribut
digitsSSML de l'élément<say-as>pour le japonais -
Le service prend désormais en charge l'attribut
digitsde l'élément SSML<say-as>avec sa voix japonaise. Pour plus d'informations, voir L'élément say-as.
1er avril 2020
- Nouvelles voix standard coréennes :
ko-KR_YoungmiVoiceetko-KR_YunaVoice -
Le service prend désormais en charge deux voix coréennes féminines standard :
ko-KR_YoungmiVoiceetko-KR_YunaVoice. Les informations suivantes s'appliquent aux deux voix coréennes :- Les voix sont des fonctions bêta. Il se peut qu'elles ne soient pas prêtes pour une utilisation en production et elles sont susceptibles d'être modifiées. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.
- Les voix prennent en charge la personnalisation et la méthode.
/v1/pronunciation - Les voix prennent en charge l'élément
<mark>et le paramètretimingsdisponibles avec l'interface WebSocket. - Les voix prennent en charge tous les éléments SSML (Speech Synthesis Markup Language) à l'exception des éléments SSML d'expressivité et des éléments SSML de transformation vocale.
- Les voix prennent en charge l'alphabet phonétique international (IAP), mais pas IBM Symbolic Phonetic Representation (SPR), avec l'élément
<phoneme>.
- Prise en charge de la nouvelle fonction pour les voix hollandaise, chinoise et néerlandaise
-
Les voix néerlandaise, arabe, chinoise et néerlandaise belge prennent désormais en charge les fonctions suivantes :
- Personnalisation et méthode
/v1/pronunciation. - L'élément
<mark>et le paramètretimingsdisponibles avec l'interface WebSocket.
Pour plus d'informations, reportez-vous aux sections suivantes :
- Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix.
- Pour plus d'informations sur l'utilisation de l'interface WebSocket pour obtenir des délais de parole, voir Génération de délais de parole.
- Pour plus d'informations sur la personnalisation, voir Compréhension de la personnalisation.
- Pour plus d'informations sur l'utilisation d'IPA et de SPR avec personnalisation, voir Comprendre les symboles phonétiques. (Les symboles IAP pour les langues arabe, chinoise, néerlandaise et coréenne ne sont pas encore documentés. Cette documentation sera bientôt disponible.)
- Personnalisation et méthode
24 février 2020
- Nouvelles voix neuronales en anglais et en allemand
-
Le service prend désormais en charge cinq nouvelles voix neuronales :
- Anglais américain :
en-US_EmilyV3Voice,en-US_HenryV3Voice,en-US_KevinV3Voice, anden-US_OliviaV3Voice - Allemand :
de-DE_ErikaV3Voice
Les nouvelles voix ne prennent pas en charge les éléments SSML suivants :
- Expressive SSML avec l'élément
<express-as> - Transformation vocale avec l'élément
<voice-transformation> - L'attribut
volumede l'élément<prosody>
Pour plus d'informations sur ces voix et sur toutes les voix disponibles, voir Langues et voix.
- Anglais américain :
- Nouveau support pour Activity Tracker
-
Le service prend désormais en charge l'utilisation des événements Activity Tracker pour toutes les opérations de personnalisation. IBM Cloud Activity Tracker enregistre les activités lancées par l'utilisateur qui modifient l'état d'un service dans IBM Cloud. Vous pouvez utiliser ce service pour étudier une activité anormale et des actions critiques, ainsi que pour respecter des exigences en matière de vérification de réglementation. En outre, vous avez la possibilité d'être alerté des actions lors de leur déroulement. Pour plus d'informations, voir Evénements Activity Tracker.
18 décembre 2019
- Nouvelles voix standard en arabe, chinois et néerlandais
-
Le service prend désormais en charge six nouvelles voix standard dans trois nouvelles langues :
- Arabe :
ar-AR_OmarVoice - Chinois (Mandarin) :
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceetzh-CN_ZhangJingVoice - Néerlandais Pays-Bas :
nl-NL_EmmaVoiceetnl-NL_LiamVoice
Les informations suivantes s'appliquent à ces nouvelles voix standard :
- Les nouvelles voix sont des fonctions bêta. Il se peut qu'elles ne soient pas prêtes pour une utilisation en production et elles sont susceptibles d'être modifiées. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.
- Les voix ne prennent pas en charge l'élément
<mark>et le paramètretimingsdisponibles avec l'interface WebSocket. - Les voix ne prennent pas en charge la personnalisation ou la méthode
/v1/pronunciation. - Les voix ne prennent pas en charge les éléments SSML d'expressivité ni les éléments SSML de transformation vocale.
- Les voix prennent en charge tous les autres éléments SSML. Cependant, elles prennent en charge l'alphabet phonétique international (IAP), mais pas IBM Symbolic Phonetic Representation (SPR), avec l'élément
<phoneme>.
Pour plus d'informations sur ces voix et sur toutes les voix disponibles, voir Langues et voix.
- Arabe :
12 décembre 2019
- Prise en charge complète de IBM Cloud IAM
-
Le service Text to Speech prend désormais en charge l'implémentation totale d'IBM Cloud Identity and Access Management (IAM). Les clés d'API pour les services Watson ne sont plus limitées à une instance de service unique. Vous pouvez créer des règles d'accès et des clés d'API qui s'appliquent à plusieurs services et accorder l'accès entre les services. Pour plus d'informations sur IAM, voir Authentification dans les services Watson.
Pour prendre en charge ce changement, les noeuds finaux de service d'API utilisent un autre domaine et comprennent l'ID d'instance de service. Le modèle est
api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.-
Exemple d'URL HTTP pour une instance hébergée à l'emplacement Dallas :
https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2 -
Exemple d'URL WebSocket pour une instance hébergée à l'emplacement Dallas :
wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2
Pour plus d'informations sur les URL, consultez la documentation de référence de l'API et du SDK.
Ces URL ne constituent pas une modification avec rupture. Les nouvelles URL fonctionnent à la fois pour vos instances de service existantes et pour les nouvelles instances. Les URL d'origine continueront à fonctionner sur vos instances de service existantes pendant au moins un an, jusqu'à décembre 2020.
-
- Nouvelles fonctions de sécurité de réseau et des données
-
La prise en charge des nouvelles fonctions de sécurité de réseau et des données suivantes est désormais disponible :
-
Prise en charge des nœuds finaux de réseau privé
Les utilisateurs des plans Premium peuvent créer des points de terminaison de réseau privé pour se connecter au service Text to Speech via un réseau privé. Les connexions aux noeuds finaux de réseau privé ne nécessitent pas d'accès Internet public. Pour plus d'informations, voir Noeuds finaux de réseaux publics et privés.
-
12 novembre 2019
- Nouveau site de Séoul maintenant disponible
- Le service Text to Speech est maintenant disponible dans l'emplacement IBM Cloud Séoul (Kr-seo). Comme avec les autres emplacements, l'emplacement IBM Cloud utilise l'authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.
1er octobre 2019
- Nouveau support US HIPAA pour les plans Premium dans l'emplacement Washington, DC,
- L'assistance HIPAA aux États-Unis est disponible pour les forfaits Premium hébergés dans le centre de données de Washington, DC, et créés à compter du 1er avril 2019. Pour plus d'informations, voir la rubrique sur la loi américaine Health Insurance Portability Accountability Act.
22 août 2019
- Correction d'incident: plusieurs petites améliorations
- Correction de bugs : le service a été mis à jour afin de corriger quelques bugs et d'apporter des améliorations.
30 juillet 2019
- Nouvelle voix neuronale japonaise :
ja-JP_EmiV3Voice - Le service offre désormais une voix neuronale en japonais :
ja-JP_EmiV3Voice. Les versions standard et neuronale de toutes les voix disponibles dans toutes les langues prises en charge sont désormais proposées. Pour plus d'informations, voir Langues et voix.
24 juin 2019
- Nouveau support pour les voix standard et neuronales
-
Le service offre désormais deux versions de la plupart des voix disponibles :
- Voix standard qui utilisent la synthèse par concaténation pour assembler des segments de parole enregistrée afin de générer un signal audio. Les voix standard n'incluent pas de chaîne de version dans leur nom (
en-US_AllisonVoice, par exemple). - Voix neuronales qui utilisent des réseaux de neurones profonds (DNN) pour prédire les caractéristiques acoustiques (spectrales) du discours. Les voix neuronales incluent une chaîne de version (
V3) dans leur nom (en-US_AllisonV3Voice, par exemple).
Les versions neuronales sont disponibles pour toutes les voix standard, à l'exception de la voix
ja-JP_EmiVoice, qui est en attente et sera bientôt disponible. Vous ne pouvez pas utiliser les éléments SSML<express-as>et<voice-transformation>avec les voix neuronales, ni l'attributvolumede l'élément<prosody>avec les voix neuronales. Pour plus d'informations sur toutes les voix disponibles, voir Langues et voix. - Voix standard qui utilisent la synthèse par concaténation pour assembler des segments de parole enregistrée afin de générer un signal audio. Les voix standard n'incluent pas de chaîne de version dans leur nom (
- V2 voix neuronales retirées du service
-
Le service n'inclut plus les voix DNN
V2qui étaient disponibles auparavant. Si vous utilisez une voixV2dans votre application, le service utilise automatiquement la voixV3équivalente à la place.
24 mars 2019
- Nouvelles voix neuronales allemandes V2
-
Le service propose désormais des versions DNN (Deep Neural Network)
V2de ses voix allemandes :de-DE_BirgitV2Voicede-DE_DieterV2Voice
Pour plus d'informations sur les voix basées sur DNN, voir Langues et voix.
- Nouvelle prise en charge des attributs
pitchetratede l'élément SSML<prosody> -
Toutes les voix basées sur DNN du service prennent désormais en charge les attributs
pitchetratede l'élément SSML<prosody>. Les voix basées sur DNN ne prennent pas en charge l'attributvolumede l'élément<prosody>. Pour plus d'informations, voir la section L'élément prosody.
21 mars 2019
- Visibilité des données d'identification de service maintenant limitées par le rôle
-
Les utilisateurs ne peuvent désormais voir que les données d'identification du service associées au rôle attribué à leur compte IBM Cloud. Par exemple, si un rôle de lecteur (
reader) vous est attribué, vous ne pouvez plus voir les niveaux auteur (writer)ou supérieur de données d'identification de service.Cette modification n'affecte pas l'accès à l'API des utilisateurs ou des applications avec des données d'identification de service existantes. La modification affecte uniquement l'affichage des données d'identification dans IBM Cloud.
4 mars 2019
- Nouvelles voix anglaise et italienne V2
-
Le service propose désormais quatre nouvelles voix
V2qui utilisent une synthèse d’apprentissage en profondeur pour générer de l’audio :en-US_AllisonV2Voiceen-US_LisaV2Voiceen-US_MichaelV2Voiceit-IT_FrancescaV2Voice
Ces nouvelles voix utilisent l'apprentissage automatique et un DNN pour synthétiser du texte en parole. La synthèse DNN (Deep Neural Network) basée sur l'apprentissage en profondeur produit un audio avec une prosodie plus naturelle et une qualité globale plus uniforme.
Cependant, ces nouvelles voix produisent également un son avec des qualités de signal différentes de celles des voix existantes, de sorte qu'elles pourraient ne pas convenir à toutes les applications. De plus, les nouvelles voix ne prennent pas en charge les éléments SSML
<prosody>,<express-as>et<voice-transformation>.Pour plus d'informations sur les voix basées sur DNN et sur la façon dont elles diffèrent des voix existantes, voir Langues et voix.
28 janvier 2019
- Nouvelle prise en charge de IBM Cloud IAM par l'interface WebSocket
-
L'interface WebSocket prend désormais en charge l'authentification IAM (Identity and Access Management) basée sur un jeton à partir de code JavaScript basé sur un navigateur. La limitation contraire a été supprimée. Pour établir une connexion authentifiée avec la méthode
/v1/synthesizeWebSocket :- Si vous utilisez l'authentification IAM, incluez le paramètre de requête
access_token. - Si vous utilisez les données d'identification du service Cloud Foundry, incluez le paramètre de requête
watson-token.
Pour plus d'informations, voir Ouverture d'une connexion.
- Si vous utilisez l'authentification IAM, incluez le paramètre de requête
13 décembre 2018
- Nouveau emplacement Londres maintenant disponible
- Le service Text to Speech est maintenant disponible sur le site IBM Cloud® de Londres (eu-gb). Comme tous les sites, Londres utilise une authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.
7 novembre 2018
- Nouvel emplacement Tokyo maintenant disponible
- Le service Text to Speech est maintenant disponible sur le site IBM Cloud® de Tokyo (jp-tok). Comme tous les sites, Tokyo utilise une authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez dans cet emplacement utilisent l'authentification IAM.
30 octobre 2018
- Nouveau support pour IBM Cloud IAM à base de jetons
-
Le service Text to Speech a migré vers l'authentification IAM (Identity and Access Management) par jeton pour tous les sites. Tous les services IBM Cloud utilisent maintenant l'authentification IAM. Le service Text to Speech a migré sur chaque site aux dates suivantes :
- Dallas (us-south) : 30 octobre 2018
- Francfort (eu-de) : 30 octobre 2018
- Washington, DC (us-east) : 12 juin 2018
- Sydney (au-syd): 15 mai 2018
La migration vers l'authentification IAM affecte différemment les nouvelles instances de service et celles existantes :
- Toutes les nouvelles instances de service que vous créez sur n’importe quel site utilisent désormais l’authentification IAM pour accéder au service. Vous pouvez transmettre un jeton bearer ou une clé d'API : les jetons prennent en charge les demandes authentifiées sans incorporer les données d'identification du service dans chaque appel. Les clés d'PI utilisent l'authentification de base HTTP. Lorsque vous utilisez l'un des logiciels SDK de Watson, vous pouvez transmettre la clé d'API et laisser le SDK gérer le cycle de vie des jetons.
- Les instances de service existantes que vous avez créées sur un site avant la date de migration indiquée continuent à utiliser les
{username}et{password}issus de leurs données d'identification précédentes du service Cloud Foundry pour l'authentification jusqu'à ce que vous les migriez pour utiliser l'authentification IAM.
Pour plus d'informations, consultez la documentation suivante :
- Pour savoir quel mécanisme d'authentification utilise votre instance de service, consultez les informations d'identification de votre service en cliquant sur l'instance dans le tableau de bord d' IBM Cloud.
- Pour plus d'informations sur l'utilisation des jetons IAM avec les services Watson, voir Authentification dans les services Watson.
- Pour des exemples utilisant l'authentification IAM, consultez la documentation de référence sur l'API et le SDK.
12 juin 2018
- Nouvelles fonctions pour les applications hébergées à l'emplacement Washington, DC
-
Les fonctionnalités suivantes sont activées pour les applications hébergées à Washington, DC (us-east) :
- Le service prend désormais en charge un nouveau processus d'authentification par API. Pour plus d'informations, voir la Mise à jour du service du 30 octobre 2018.
- Le service prend désormais en charge l'en-tête
X-Watson-Metadataet la méthodeDELETE /v1/user_data. Pour plus d'informations, voir Sécurité des informations.
15 mai 2018
- Nouvelles fonctions pour les applications hébergées à l'emplacement Sydney
-
Les fonctionnalités suivantes sont activées pour les applications hébergées à Sydney, (au-syd) :
- Le service prend désormais en charge un nouveau processus d'authentification par API. Pour plus d'informations, voir la Mise à jour du service du 30 octobre 2018.
- Le service prend désormais en charge l'en-tête
X-Watson-Metadataet la méthodeDELETE /v1/user_data. Pour plus d'informations, voir Sécurité des informations.
2 octobre 2017
- Modifications du format audio
audio/l16 - Pour le format
audio/l16, vous pouvez désormais spécifier l'ordre d'octets de l’audio renvoyé. (Vous devez déjà spécifier la fréquence d'échantillonnage.) On peut citer par exempleaudio/l16;rate=22050;endianness=big-endianetaudio/l16;rate=22050;endianness=little-endian; la valeur par défaut est « significant endian ». Pour plus d'informations, voir Utilisation des formats audio.
14 juillet 2017
- Nouvelle prise en charge du format audio MP3 (MPEG)
- Le service prend désormais en charge le format audio MP3 ou MPEG (Motion Picture Experts Group). Pour plus d'informations sur les formats audio pris en charge, voir Utilisation des formats audio.
10 avril 2017
- Nouvelle prise en charge du format audio Web Media (WebM)
- Le service prend désormais en charge le format audio Web Media (WebM) avec le codec Opus ou Vorbis. Le service prend désormais également en charge le format audio Ogg avec le codec Vorbis en plus du codec Opus. Pour plus d'informations sur les formats audio pris en charge, voir Utilisation des formats audio.
- Nouveau support pour Cross-Origin Resource Sharing
- Le service prend désormais en charge le partage de ressources d'origine croisée (CORS) pour permettre aux clients basés sur le navigateur d'appeler directement le service. Pour plus d'informations, voir l'utilisation du support CORS.
- Modifications apportées aux codes de réponse HTTP
- Les codes de réponse HTTP permettant de mener à bien certaines méthodes de l'interface de personnalisation ont été modifiés :
- La méthode
POST /v1/customizationsrenvoie désormais 201 (au lieu de 200). - La méthode
POST /v1/customizations/{customization_id}renvoie désormais 200 (au lieu de 201). - La méthode
POST /v1/customizations/{customization_id}/wordsrenvoie désormais 200 (au lieu de 201). - La méthode
PUT /v1/customizations/{customization_id}/words/{word}renvoie désormais 200 (au lieu de 201).
- La méthode
- Nouvelles erreurs pour la mauvaise utilisation du paramètre
part_of_speechjaponais - Les méthodes
POST /v1/customizations/{custom_id}/wordsetPUT /v1/customizations/{customization_id}/words/{word}renvoient maintenant le code de réponse HTTP 400 avec le message d'erreurPart of speech is supported for ja-JP language onlysi vous tentez de spécifier une partiepart_of_speechdans une langue autre que le japonais. - Modifications apportées au corps de la réponse pour l'ajout d'une méthode de mots
- La méthode
POST /v1/customizations/{custom_id}/wordsrenvoie désormais un corps de réponse vide ({}).
1er décembre 2016
- Nouvelle voix latino-américaine en espagnol:
es-LA_SofiaVoice -
Le service comprend une nouvelle voix,
es-LA_SofiaVoice, qui est l'équivalent latino-américain de la voixes-US_SofiaVoice. La différence la plus significative entre les deux voix concerne la façon dont elles interprètent$(signe dollar) : la version Amérique latine utilise le terme Pesos et la version nord-américaine utilise le terme dolares. D'autres différences mineures pourraient également exister entre les deux voix. - Nouvelles voix en anglais américain :
en-US_LisaVoiceeten-US_MichaelVoice -
En plus de la voix
en-US_AllisonVoice, deux autres voix peuvent désormais être transformées avec la transformation de voix SSML :en-US_LisaVoiceeten-US_MichaelVoice. - Modifications apportées à la personnalisation pour le japonais
-
Lorsque vous utilisez l'interface de personnalisation avec le japonais, le service correspond désormais au mot le plus long des paires mot/traduction qui sont définies pour un modèle personnalisé. Par exemple, considérons les deux entrées suivantes pour un modèle personnalisé :
{ "words": [ {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"}, {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"} ] }Si le service trouve la chaîne «
NYC» dans le texte saisi, il reconnaît ce mot, car il s'agit d'une correspondance plus longue que «NY». Auparavant, le service aurait trouvé une correspondance avec la chaîne «NY». Pour plus d'informations sur l'utilisation des entrées en japonais dans un modèle personnalisé, consultez la section « Utilisation des entrées en japonais ».
22 septembre 2016
- La personnalisation est désormais disponible pour toutes les langues
- L'interface de personnalisation, qui inclut la personnalisation et les méthodes
GET /v1/pronunciation, est désormais disponible pour toutes les langues prises en charge par le service. L'interface reste une version bêta. Pour plus d'informations, voir Compréhension de la personnalisation. - Nouveau support japonais pour SSML
- Le service prend désormais en charge SSML pour le japonais. Pour obtenir des informations générales sur la prise en charge de SSML, voir Présentation de SSML. Pour plus d'informations
sur les symboles japonais SPR et IPA, voir Japanese symbols. Des considérations supplémentaires et une zone
part_of_speechs'appliquent lors de la création d'entrées pour des mots dans un modèle personnalisé japonais. Pour plus d'informations, voir Utilisation des entrées en japonais. - Nouvelle fonction SSML de transformation vocale
- Le service propose désormais la transformation vocale SSML via le nouvel élément
<voice-transformation>. Vous pouvez élargir la gamme de voix possibles en créant des transformations personnalisées qui modifient le pas, la plage de pas, la tension glottale, la respiration, le taux et le timbre d'une voix. Le service propose également deux voix virtuelles intégrées, Young et Soft. Le service prend actuellement en charge la transformation de la voix uniquement pour la voix en anglais américain, Allison. - Minutages des mots maintenant disponibles avec l'interface WebSocket
- Le service peut maintenant renvoyer des informations de minutage des mots pour toutes les chaînes du texte saisi que vous transmettez à l'interface WebSocket. Pour recevoir l'heure de début et de fin de chaque chaîne de l'entrée, spécifiez
un tableau contenant la chaîne
wordspour le paramètre facultatiftimingsde l'objet JSON que vous transmettez au service. La fonctionnalité n'est actuellement pas disponible pour le texte saisi en japonais. Pour plus d'informations, voir Génération de minutages de mots. - Nouvelle prise en charge de la validation SSML
- Le service valide maintenant tous les éléments SSML que vous soumettez dans n'importe quel contexte. S'il trouve une balise non valide, le service signale un code de réponse HTTP 400 avec un message descriptif et la méthode échoue. Dans les versions précédentes, le service ne traitait pas les erreurs de manière cohérente; le fait d'indiquer une prononciation incorrecte d'un mot, par exemple, pouvait entraîner un comportement imprévisible ou incohérent. Pour plus d'informations, voir Validation du SSML.
- Format IBM SPR maintenant spécifié avec
ibmau lieu despr - L'utilisation de
sprest obsolète en tant qu'argument de l'optionformatde la méthodeGET /v1/pronunciationet pour une utilisation avec l'attributalphabetd'un élément SSML<phoneme>. Pour utiliser la notation IBM SPR, utilisez l'argumentibmau lieu desprdans tous les cas. - Nouvelle prise en charge du format audio
audio/mulaw - La liste des formats audio pris en charge inclut maintenant
audio/mulaw;rate={rate}. De même qu'audio/basic, ce format offre un son monocanal codé à l'aide de données u-law (ou mu-law) sur 8 bits, échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio. - Nouvelles fonctions prises en charge identifiées lors de l'établissement de la liste des voix
- Les méthodes
GET /v1/voicesetGET /v1/voices/{voice}renvoient maintenant un objetsupported_featuresdans le cadre de leur sortie pour chaque voix. L'objet décrit si la voix prend en charge la personnalisation et l'élément SSML<voice_transformation>. Pour plus d'informations, voir Langues et voix.
23 juin 2016
- Nouvelle interface WebSocket pour la synthèse vocale
-
Le service offre maintenant une interface WebSocket pour la synthèse vocale. L'interface offre les mêmes fonctionnalités que la méthode
/v1/synthesizede l'interface HTTP. Elle accepte le texte brut ou le texte marqué avec SSML. En outre, elle prend en charge l'utilisation de l'élément SSML<mark>pour identifier le temps dans l'audio auquel il finit de synthétiser tout le texte qui précède la marque. Pour plus d'informations, voir Interface WebSocket. - Support de langue étendu pour SSML
-
Le service prend désormais en charge le texte annoté avec SSML pour le castillan, l'espagnol nord-américain, l'italien et le portugais brésilien. Le service prenait déjà en charge l'utilisation de SSML pour l'anglais américain et britannique, le français et l'allemand. À compter de cette mise à jour, le service prend en charge SSML pour toutes les langues, sauf le japonais. De plus, vous pouvez utiliser les notations IBM SPR et IPA pour définir des prononciations de mot avec l'élément SSML
<phoneme>. Pour plus d'informations, voir Présentation de SSML et Comprendre les symboles phonétiques.Pour l'anglais américain, vous pouvez également utiliser l'élément SSML
<phoneme>pour créer des entrées de mot dans un modèle personnalisé ; la personnalisation est uniquement prise en charge pour l'anglais américain. Pour plus d'informations, voir Compréhension de la personnalisation. - Voix mise à jour pour une meilleure synthèse vocale
-
Le service propose une expressivité et un naturel améliorés pour les voix les plus fréquemment utilisées. Les améliorations reposent sur la prédiction de prosodie basée sur un réseau de neurones récurrents (RNN) à partir du texte saisi. Elles sont mises à disposition en tant que nouveau moteur de service et mises à jour de modèles vocaux dans les langues suivantes :
en-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicefr-FR_ReneeVoice
- Nouveau paramètre d'ID de personnalisation pour la prononciation des mots
-
La méthode
GET /v1/pronunciationaccepte désormais un paramètre de requête facultatifcustomization_id. Le paramètre obtient un mot de traduction à partir d'un modèle personnalisé spécifié. Si le modèle personnalisé ne contient pas le mot, la méthode renvoie la prononciation par défaut du mot. Pour plus d'informations, voir la référence de l'API et du SDK.Lorsque vous utilisez la méthode
GET /v1/pronunciationsans ID de personnalisation et pour une langue autre que l'anglais américain, vous pouvez demander la prononciation d'un mot uniquement en notation IBM SPR. Pour une langue autre que l'anglais américain, vous devez spécifierspravec l'optionformatde la méthode. - Nouvelle prise en charge du format audio
audio/basic -
La liste des formats audio pris en charge inclut désormais
audio/basic, qui fournit un son monocanal codé à l'aide de données u-law (ou mu-law) sur 8 bits, échantillonnées à 8 kHz. Pour plus d'informations, voir Utilisation des formats audio. - Les interfaces HTTP et WebSocket peuvent désormais renvoyer des avertissements
-
Les méthodes HTTP et WebSocket
/v1/synthesizepeuvent renvoyer une réponsewarningscomprenant des messages relatifs aux paramètres de requête non valides ou des zones JSON incluses dans une demande. Le format des avertissements a changé. L'exemple suivant montre le format précédent :"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."Le même avertissement a maintenant le format suivant :
"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
10 mars 2016
- Les méthodes de synthèse peuvent maintenant renvoyer des avertissements
- Les méthodes
GETetPOST /v1/synthesizepeuvent désormais renvoyer un en-tête de réponseWarningscomprenant une liste de messages d'avertissement concernant des paramètres de requête non valides ou des zones JSON incluses dans la demande. Chaque élément de la liste inclut une chaîne qui décrit la nature de l'avertissement suivie d'un tableau de chaînes d'argument non valides ; par exemple,Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}'].Pour plus d'informations, voir laréférence de l'API et du SDK. - La version bêta Apple iOS SDK est obsolète
- La version bêta Watson Speech Software Development Kit (SDK) pour le système d'exploitation Apple ® iOS est obsolète et remplacée par Watson Swift SDK. Le nouveau SDK est disponible dans le référentiel swift-sdk, sous l'espace de noms
watson-developer-cloud, à l'adresse GitHub.
22 février 2016
- Nouvelle fonction SSML expressive
- Le service a été mis à jour avec une nouvelle fonctionnalité SSML d'expressivité. Le service étend SSML avec un élément
<express-as>que vous pouvez utiliser pour indiquer l'expressivité dans l'un des trois styles de discours suivants :GoodNews,ApologyouUncertainty. Vous pouvez appliquer l'élément à l'intégralité du texte, à une phrase, une expression ou un mot. Le service ne prend actuellement en charge l’expressivité que pour la voix en anglais américain Allison (en-US_AllisonVoice).
17 décembre 2015
- Nouvelle interface de personnalisation bêta
-
Le service offre une nouvelle interface de personnalisation que vous pouvez utiliser pour spécifier la façon dont il prononce les mots inhabituels qui apparaissent dans votre saisie. L'interface comprend de nouvelles méthodes qui vous permettent de créer et de gérer des modèles personnalisés ainsi que les paires mot/traduction qu'ils contiennent. Vous pouvez ensuite utiliser vos modèles personnalisés lors de la synthèse de texte en audio.
Le service prend en charge les traductions sous forme de sons et les traductions phonétiques. Les traductions phonétiques peuvent utiliser l'alphabet phonétique international (IAP, International Phonetic Alphabet) standard ou la représentation phonétique symbolique (SPR, Symbolic Phonetic Representation) IBM propriétaire. Vous utilisez SSML pour spécifier des traductions phonétiques.
L'interface de personnalisation comprend un ensemble de nouvelles méthodes HTTP portant les noms
POST /v1/customizations,POST /v1/customizations/{customization_id},POST /v1/customizations/{customization_id}/wordsetPUT /v1/customizations/{customization_id}/words/{word}. Le service fournit également une nouvelle méthodeGET /v1/pronunciationqui renvoie la prononciation de n'importe quel mot et une nouvelle méthodeGET /v1/voices/{voice}qui renvoie des informations détaillées sur une voix spécifique. De plus, les méthodes existantes de l'interface du service acceptent désormais les paramètres de modèle personnalisés selon les besoins.Pour plus d'informations sur la personnalisation et son interface, voir Comprendre la personnalisation et la référence API et SDK.
L'interface de personnalisation est une version bêta qui prend actuellement en charge l'anglais américain uniquement. Toutes les méthodes de personnalisation et la méthode
GET /v1/pronunciationpeuvent actuellement être utilisées pour créer et manipuler des modèles personnalisés et des traductions de mots uniquement en anglais américain. - Nouvelle voix portugais brésilien :
pt-BR_IsabelaVoice -
Le service prend en charge une nouvelle voix,
pt-BR_IsabelaVoice, permettant de synthétiser de l'audio en portugais brésilien avec une voix féminine. Pour plus d'informations, voir Langues et voix.
21 septembre 2015
- Nouveaux kits SDK mobiles disponibles
-
Deux nouveaux kits de développement logiciel (SDK) bêta mobiles sont disponibles pour les services vocaux. Les SDK permettent aux applications mobiles d’interagir avec les services Text to Speech et Speech to Text. Vous pouvez utiliser les kits de développement logiciel pour envoyer du texte au service Text to Speech et recevoir une réponse audio.
- Le SDK « Watson » ( Swift ) est disponible dans le référentiel swift-sdk, sous l'espace de noms
watson-developer-cloud, sur GitHub. - Le SDK Android pour la reconnaissance vocale ( Watson ) Android™ SDK est disponible dans le référentiel « speech-android-sdk » de l'espace de noms «
watson-developer-cloud» sur GitHub.
Les deux SDK prennent en charge l'authentification avec les services de conversation en utilisant vos données d'identification du service IBM Cloud ou un jeton d'authentification. Les SDK étant des fonctionnalités en version bêta, ils sont susceptibles d'évoluer à l'avenir.
- Le SDK « Watson » ( Swift ) est disponible dans le référentiel swift-sdk, sous l'espace de noms
- Nouvelle voix japonaise :
ja-JP_EmiVoice -
Le service prend en charge une nouvelle langue, le japonais. La voix
ja-JP_EmiVoiceest une voix féminine japonaise.
1er juillet 2015
- Le service Text to Speech est désormais disponible en général
-
Le service est passé de la version bêta à la disponibilité générale (GA) le 1er juillet 2015. Voici les différences qui existent entre la version bêta et la version finale de l'API Text to Speech. La version GA nécessite que les utilisateurs effectuent une mise à niveau pour passer à la nouvelle version du service.
- Nouveau modèle de programmation à base de jetons
-
Un nouveau modèle de programmation prend en charge les interactions directes entre un client et le service. En utilisant ce modèle, un client peut obtenir un jeton d'authentification pour communiquer directement avec le service. A l'aide de ce jeton, le client peut éviter le recours à une application proxy côté serveur dans IBM Cloud pour appeler le service en son nom. Les jetons sont le moyen privilégié par les clients pour interagir avec le service.
Le service continue à prendre en charge l'ancien modèle de programmation reposant sur un proxy côté serveur pour relayer les communications et les données entre le client et le service. Mais le nouveau modèle est plus efficace et fournit un débit plus élevé.
- Nouveau support pour Speech Synthesis Markup Language
-
Vous pouvez maintenant passer du langage SSML (Speech Synthesis Markup Language) aux versions HTTP
GETetPOSTde la méthode/v1/synthesize. SSML est un langage de balisage basé sur XML conçu pour fournir des annotations de texte aux applications de synthèse vocale telles que le service Text to Speech. Pour plus d'informations sur la transmission d'une entrée SSML au service, voir Spécification du texte d'entrée.Le service ne prend initialement en charge l'utilisation de SSML que pour l'anglais britannique et américain, le français et l'allemand. Le service ne prend pas en charge SSML pour une utilisation avec l'italien et l'espagnol. Lorsque vous utilisez SSML, veillez à ne pas sélectionner de voix pour l'audio dans l'une des langues non prises en charge. Les résultats dans ce cas ne sont pas significatifs.
- Modifications apportées aux voix disponibles
-
Les voix prises en charge pour la synthèse vocale, qui sont modifiées et enrichies. Le service prend désormais en charge plusieurs autres voix, langues et dialectes grâce aux méthodes
/v1/synthesize. Pour plus d'informations sur les voix prises en charge, voir Langues et voix.Les trois voix disponibles en version bêta sont renommées pour la disponibilité générale (GA) :
VoiceEnUsMichaelest maintenanten-US_MichaelVoiceVoiceEnUsLisaest maintenanten-US_LisaVoiceVoiceEsEsEnriqueest maintenantes-ES_EnriqueVoice
Les noms précédents de ces voix continuent de fonctionner avec la version bêta du service (via les noeuds finaux de l'API
-beta) tant que cette version reste disponible. Cependant, vous devez utiliser les nouveaux noms avec la version GA du service. - Nouvelle prise en charge du format Free Lossless Audio Codec (FLAC)
-
Vous pouvez maintenant demander au service de renvoyer de l'audio au format FLAC (Free Lossless Audio Codec). Le service peut toujours renvoyer de l'audio au format Ogg avec le codec Opus (par défaut) et au format WAV (Waveform Audio File Format). Pour plus d'informations sur l'utilisation des formats audio avec les méthodes
/v1/synthesize; voir Utilisation de formats audio. - Nouvelles limites sur la quantité maximale de texte synthétisé
-
Le texte que vous envoyez à la méthode
/v1/synthesizedans l'URL d'une requête HTTPGETou dans le corps d'une requête HTTPPOSTest désormais limité à 5 Ko maximum. Le texte avait une taille maximale de 4 Mo pour la version bêta. - Nouvel en-tête pour ne pas contribuer à l'amélioration des services
-
Les méthodes
/v1/synthesizeincluent désormais l’en-têteX-WDC-PL-OPT-OUTpour contrôler si le service utilise les résultats texte et audio d’une opération afin d'améliorer les résultats futurs. Spécifiez la valeur1pour l'en-tête afin d'empêcher le service d'utiliser des résultats de texte et audio. Le paramètre s'applique uniquement à la demande en cours. Le nouvel en-tête remplace l'en-têteX-loggingprovenant des méthodes bêta. Pour plus d'informations, voir Contrôle de la journalisation des demandes pour les services Watson. - Modifications des codes d'erreur HTTP pour la synthèse vocale
-
Pour les méthodes
/v1/synthesize, les codes d'erreur suivants ont été modifiés :- Le code d'erreur 406 ("Not acceptable. Type MIME non pris en charge. ") est supprimé.
- Le code d'erreur 415 ("Unsupported Media Type") est ajouté.
- Le code d'erreur 503 ("Service Unavailable") est ajouté.
- Modifications des codes d'erreur HTTP pour la liste des voix
-
Pour la méthode
GET /v1/voices, les codes d'erreur suivants ont été modifiés :- Le code d'erreur 406 ("Not acceptable. Type MIME non pris en charge. ") est supprimé.
- Le code d'erreur 415 ("Unsupported Media Type") est ajouté.