Notes sur l'édition de Speech to Text for IBM Cloud

IBM Cloud

Les fonctionnalités et modifications suivantes ont été intégrées à chaque version et mise à jour des instances gérées d' IBM Watson® Speech to Text, hébergées sur IBM Cloud, ainsi qu'aux instances hébergées sur IBM Cloud Pak for Data en tant que service. Sauf indication contraire, toutes les modifications sont rétrocompatibles et sont disponibles de manière automatique et transparente pour toutes les applications nouvelles et existantes.

Pour plus d'informations sur les limitations connues du service, voir Limitations connues.

Pour plus d'informations sur les éditions et les mises à jour du service pour IBM Cloud Pak for Data, voir les notes sur l'édition de Speech to Text for IBM Cloud Pak for Data.

29 juin 2026

Nouveau paramètre « parameter_set » pour les grands modèles de synthèse vocale

Les modèles de reconnaissance vocale de grande envergure intègrent désormais un paramètre de requête « parameter_set » qui permet d'appliquer des paramètres optimisés en un seul appel. Utilisez la fonction « parameter_set=enhanced » pour améliorer la qualité de la reconnaissance sans avoir à configurer manuellement chaque paramètre.

  • Pour plus d'informations, consultez [la section consacrée au paramètre de requête parameter_set](/docs/speech-to-text?topic=speech-to-text-models-large-speech-languages#models-lsm-parameter-set) .

26 juin 2026

low_latency Ce mode est désormais disponible pour le modèle vocal « US English Large »

Le modèle de synthèse vocale « US English Large » en-US intègre désormais le mode « low_latency » pour un traitement vocal plus rapide.

15 mai 2026

Le grand modèle vocal pour l'italien est maintenant disponible

Le grand modèle vocal pour l'italien, it-IT, est désormais généralement disponible (GA) dans tous les centres de données et prend en charge les taux d'échantillonnage audio de 8kHz et 16kHz.

10 avril 2026

Le grand modèle vocal pour le néerlandais est maintenant disponible

Le grand modèle vocal pour le néerlandais, nl-NL, est désormais généralement disponible (GA) dans tous les centres de données et prend en charge les taux d'échantillonnage audio de 8kHz et 16kHz.

07 avril 2026

Correction d'un défaut : Correction d'un problème où fille est incorrectement reconnu dans la reconnaissance des séquences alphanumériques en français avec la fonction de formatage intelligent.

17 mars 2026

Amélioration du modèle de la grande langue française
Des améliorations dans les grands modèles linguistiques (LSM) français fr-FR et fr-CA sont maintenant disponibles pour une meilleure précision dans la reconnaissance de séquences alphanumériques.

Correction d'un défaut : Correction d'un problème dans l'identification de la langue (LID) où des erreurs intermittentes 5xx sont observées lorsqu'une requête /v1/recognize?language_identification=true est immédiatement suivie d'une requête /v1/recognize normale.

Correction d'un défaut : Correction d'un problème où des erreurs de serveur interne sont observées avec le paramètre max_active.

Correction d'un défaut : Correction d'un problème où des erreurs de serveur interne sont renvoyées par erreur lorsque include_transparent_words est défini sur true.

04 mars 2026

Amélioration des modèles de synthèse vocale en allemand et en néerlandais

Des améliorations des modèles de synthèse vocale en allemand et en néerlandais sont désormais disponibles.

  • Des améliorations du Large Speech Model (LSM) allemand de-DE sont désormais disponibles pour la reconnaissance de séquences alphanumériques et les cas d'utilisation généraux.
  • Des améliorations de la téléphonie néerlandaise nl-NL_Telephony sont désormais disponibles pour la reconnaissance des séquences alphanumériques et le traitement de la saillance.

16 février 2026

Le grand modèle vocal pour l'allemand est maintenant disponible

Le grand modèle vocal pour l'allemand, de-DE, est désormais généralement disponible (GA) dans tous les centres de données, prenant en charge les taux d'échantillonnage audio de 8kHz et 16kHz.

Amélioration de l'enrichissement des transcriptions de discours

Les améliorations apportées à l'enrichissement des transcriptions vocales sont désormais disponibles pour les entités nommées, notamment les dates, l'heure, les devises, les nombres et les mesures. Ces entités sont désormais traitées correctement en fonction de la langue locale.

22 janvier 2026

Correction d'un défaut : Correction d'un problème où l'enrichissement des transcriptions vocales échoue lorsque le paramètre du modèle est absent dans les requêtes.

Correction d'un défaut : Correction d'un problème où l'on observe un temps d'apprentissage plus long de la personnalisation de la parole vers le texte (STT) en raison de défaillances internes de la mémoire.

08 janvier 2026

Correction d'un défaut : Correction d'un problème dans l'enrichissement des transcriptions vocales dans le centre de données de Francfort.

Correction d'un défaut : Correction d'un problème dans interim_results où les transcriptions finales des discours ne sont pas envoyées lorsque interim_results est réglé sur false.

10 décembre 2025

Validation des champs d'entrée pour la fonction sounds_like

La fonction de validation des champs de saisie pour sounds_like est désormais activée pour d'autres langues.

  • La fonction de validation des champs de saisie pour sounds_like est activée pour d'autres langues, y compris les modèles de en-US, en-AU, en-GB, en-IN, es-ES, es-AR, es-CL, es-CO, es-MX, es-PE, fr-FR_Telephony, fr-FR_Multimedia, de-DE_Telephony, de-DE_Multimedia, it-IT_Telephony, it-IT_Multimedia et nl-NL_Telephony.

25 novembre 2025

Des résultats provisoires sont maintenant disponibles pour les modèles de discours à grande échelle

Les résultats intermédiaires sont maintenant disponibles pour les grands modèles vocaux (LSM).

  • interim_results n'était auparavant activé que pour les modèles de nouvelle génération. Désormais, elle est également activée pour les LSM. Pour plus d'informations, voir Résultats intermédiaires.

03 novembre 2025

La détection des événements de début de parole est désormais disponible pour les modèles STT.

La détection de l'événement Speech begin est désormais disponible pour les modèles STT.

  • En utilisant la détection d'événements de début de parole, vous pouvez maintenant recevoir une notification précoce avec l'API recognize qui détecte le début de la parole dans le flux audio entrant et envoie une notification à l'utilisateur. Pour plus d'informations, voir Détection d'événements de début de discours.
Amélioration de la détection des activités vocales pour une réactivité plus rapide, une précision accrue et de meilleures performances dans les environnements bruyants.

La détection de l'activité vocale (SAD) a été mise à jour pour inclure une nouvelle méthode améliorée en plus de la méthode existante dans l'API Speech To Text recognize.

  • La nouvelle méthode améliore la précision et la performance de la détection des limites de la parole dans le flux audio. Il peut être utilisé en réglant sad_module:2. Pour plus d'informations, consultez la section « Détection de l'activité vocale(SAD) ».
L'identification de la langue parlée est désormais disponible de manière générale

L'identification de la langue parlée est maintenant disponible pour tous.

  • L'identification de la langue (LID) détecte automatiquement la langue parlée dans les flux audio. Le modèle traite continuellement l'audio entrant et renvoie la langue identifiée lorsqu'il atteint un niveau de confiance supérieur au seuil spécifié ( 0.99 par défaut). Pour plus d'informations, voir Identification de la langue parlée.

07 octobre 2025

hints est désormais disponible de manière générale

Le paramètre hints est désormais disponible pour tous.

  • hints améliore le post-traitement grâce à Smart Formatter. Ce paramètre permet au formateur d'interpréter plus précisément l'intention de l'utilisateur et de renvoyer des résultats qui correspondent mieux à ses attentes. Pour plus d'informations, voir le paramètre Conseils.

26 septembre 2025

L'enrichissement des transcriptions vocales est désormais disponible

L'enrichissement de la transcription de la parole est maintenant disponible de manière générale.

  • La fonction d'enrichissement des transcriptions améliore la lisibilité et l'utilisation des transcriptions brutes de la reconnaissance automatique de la parole (ASR). Ce service de post-traitement ajoute automatiquement la ponctuation et applique une capitalisation intelligente pour améliorer la structure et la clarté du contenu parlé. Pour plus d'informations, voir Enrichissement de la transcription de la parole.

09 septembre 2025

Correction d'un défaut : Correction d'un problème dans Smart Formatter pour le modèle linguistique Fr-CA où les nombres à 8 chiffres étaient incorrectement formatés avec des zéros supplémentaires. Smart Formatter renvoie désormais la transcription correcte.

19 août 2025

Correction d'un défaut : Correction d'un problème dans Smart Formatter où les valeurs numériques parlées dans les transactions étaient transcrites de manière incorrecte. Par exemple, one hundred and ninety-nine and twelve cents devrait être transcrit comme $199.12, mais apparaissait incorrectement comme 199 e R$ 0,12. Smart Formatter renvoie désormais la transcription correcte.

Correction d'un défaut : Correction d'un problème dans Smart Formatter pour les modèles de langue française où le mot "cent" était formaté de manière incorrecte. Par exemple, quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit a été transcrit comme 89450328 100 1678 au lieu de 8945032811678. Smart Formatter renvoie désormais la transcription correcte.

22 juillet 2025

Correction du défaut : L'erreur du modèle personnalisé ja-JP, qui était causée par le caractère espace pleine largeur ( U+3000 ) est maintenant corrigée.

Correction d'un défaut : Le problème de formatage de l'email portugais Smart Formatter, où des espaces supplémentaires étaient introduits dans les adresses email, est maintenant corrigé. Pour plus d'informations, voir Smart Formatter pour le portugais.

08 juillet 2025

Amélioration de la reconnaissance d'entités nommées pour le modèle de discours anglais à grande échelle (Large Speech Model)

Amélioration de la reconnaissance des villes, des adresses, des noms de rue, des caractères alphanumériques, des dates, des noms et des prénoms.

Correction d'un défaut : Formatage de la date par Smart Formatter Spanish Large Speech Model (es-ES)

Correction : el primero de enero de dos mil-> el 01/01/2000 doit être formaté comme 01/01/2000. Ce problème est corrigé. Pour plus d'informations, voir Smart Formatter pour l'espagnol.

17 juin 2025

Correction d'un défaut : L'affectation de la valeur pour la version du formateur intelligent, qui provoquait une erreur d'insertion, entraînant l'échec du traitement de certaines demandes. Ce problème est résolu. Les demandes de formatage intelligent répondent désormais comme prévu.

Correction d'un défaut : Dans Smart Formatter, des espaces non désirés ont été observés dans les caractères alphanumériques. Par exemple, l k k one one five zero zero four two l e-> lkk1 150042le. Ce problème est corrigé. Les demandes de formatage intelligent répondent désormais comme prévu.

28 mai 2025

Le nouveau modèle de discours à grande échelle pour le japonais est maintenant généralement disponible

Le modèle de parole large pour le japonais est maintenant disponible.

Amélioration : Une meilleure gestion du formateur intelligent est ajoutée pour les phrases de lettres parlées - a as in alpha-> a.

29 avril 2025

Correction d'un défaut : Correction de plusieurs problèmes de désambiguïsation de lettres, de chiffres ou de symboles dans Smart Formatter

Correction des défauts : Les problèmes suivants sont corrigés :

  • o" a été formaté comme le chiffre 0
  • 'a real' a été formaté comme ' r1 '
  • l'expression "colonoscopie" a été formatée comme suit : "oscopie"

07 avril 2025

Correction d'un défaut : Une source inattendue a été détectée dans l'OOV
Correction d'un défaut : Lorsqu'un corpus est ajouté à un modèle personnalisé, les mots OOV précédemment supprimés sont involontairement restaurés à partir de la source précédente. Ce problème est corrigé.

18 mars 2025

Correction du défaut : Les problèmes de formatage intelligent avec les dates et les numéros supplémentaires dans le modèle en-us sont corrigés.
Correction d'un défaut : Le formatage est désactivé lorsque le nombre total de chiffres est supérieur à la date formatée requise. Par exemple, five twelve fifteen eleven-> 5 1/2/1511 doit être : 5121511.

11 février 2025

Correction d'un défaut : Un grand nombre de 503’s ont été observés, en particulier pour le ja-JP_NarrowbandModel. Des améliorations ont été apportées au service afin d'accroître la disponibilité de ce modèle.

Correction du défaut : Une erreur d'allocation de mémoire de personnalisation STT a été détectée pour le modèle en-US_Telephony. Ce problème est résolu.

Correction d'un défaut : Un problème de formatage intelligent a été observé avec les abréviations dans le modèle en-us (Dr. a été corrigé en Doctor). Ce problème est résolu.

14 janvier 2025

Amélioration : Les caractères alphanumériques des instances ont été mis à jour lorsque Smart Formatter combinait certaines combinaisons de chiffres prononcés individuellement - 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203. Ce problème est corrigé.

Correction d'un défaut : L'exécution ne parvient pas à envoyer toutes les hypothèses
Correction d'un défaut : Certains mots manquaient dans les transcriptions en raison d'un problème lié à l'horodatage des transcriptions dans les cas où les mots-clés ont des scores de confiance différents de ceux de l'hypothèse. Le résultat était que la transcription renvoyait un seul mot yes, même si l'audio contenait deux mots yes. Une amélioration de la logique de suppression de l'horodatage a été apportée pour corriger ce problème.

19 novembre 2024

Le nouveau modèle de discours à grande échelle pour l'allemand est désormais disponible

Le modèle de discours large pour l'allemand est maintenant disponible.

Correction d'un défaut : Amélioration de la logique d'échantillonnage ( 8khz à 16khz ) pour le modèle multibande de la parole anglaise à grande échelle

Correction d'un défaut : La logique d'échantillonnage en amont dans le service est nécessaire pour que le modèle puisse gérer à la fois 8khz et 16khz.

05 novembre 2024

Correction d'un défaut : Les étiquettes de l'orateur désactivent les résultats intermédiaires pour les LSM et les RNNT
Correction d'un défaut : Un problème a été détecté dans le cas où les résultats intermédiaires n'arrivaient plus lorsque les étiquettes de haut-parleur étaient activées. Le problème est corrigé et le service renvoie désormais immédiatement les résultats intermédiaires lorsque des étiquettes de haut-parleur sont utilisées.

23 août 2024

Tous les grands modèles de synthèse vocale sont désormais disponibles pour le grand public

Les grands modèles vocaux pour toutes les langues sont maintenant généralement disponibles (GA). Leur utilisation dans les environnements de production et les applications est prise en charge.

18 juin 2024

De nouveaux grands modèles de discours pour le portugais brésilien et l'espagnol sont maintenant en version bêta ouverte

Les grands modèles de discours pour le portugais brésilien et l'espagnol sont maintenant en version bêta ouverte. L'espagnol comprend les dialectes castillan, argentin, chilien, colombien, mexicain et péruvien.

15 mai 2024

Le modèle Large Speech pour l'anglais est désormais disponible en version GA

Le grand modèle de discours pour l'anglais, qui comprend les dialectes des États-Unis, de l'Australie, de l'Inde et du Royaume-Uni, est maintenant disponible en général (GA). Son utilisation est prise en charge dans les environnements de production et les applications.

07 mars 2024

Modèle de grand discours pour l'anglais américain en version bêta ouverte
Le nouveau modèle de discours large pour l'anglais américain est en version bêta ouverte. Voir Langues et modèles vocaux de grande taille pour plus de détails avec les fonctions prises en charge (bêta).

30 novembre 2023

Paramètre Speech to Text speech_begin_event

Ce paramètre permet à l'application cliente de savoir que certains mots ou paroles sont détectés et que la Speech to Text est en cours de décodage. Pour plus de détails, voir Utilisation des paramètres de reconnaissance vocale.

Paramètre'mapping_only'pour les mots personnalisés

En utilisant le paramètre "mapping_only", vous pouvez utiliser des mots personnalisés directement pour faire correspondre "sounds_like" (ou un mot) à la valeur "display_as" en tant que post-traitement au lieu de l'entraînement. Pour plus d'informations, voir The words resource.

Voir les lignes directrices pour non japonais et japonais.

Prise en charge du Brésil, du portugais et du canadien-français pour une nouvelle personnalisation améliorée du modèle de langue de la prochaine génération

La personnalisation des modèles de langue pour les modèles de prochaine génération brésiliens-portugais et canadiens-français a récemment été ajoutée. Cette mise à jour de service inclut d'autres améliorations internes.

Nouvelle fonction de formatage intelligent

Une nouvelle fonction de formatage intelligent pour les modèles de nouvelle génération est prise en charge en anglais américain, en portugais brésilien, en français et en allemand. Voir Version de formatage intelligent pour plus de détails.

Prise en charge de l'espagnol castillan et de l'espagnol LATAM sur la nouvelle personnalisation améliorée du modèle de langue de nouvelle génération

La personnalisation du modèle de langue pour les modèles espagnol castillan et espagnol LATAM de la prochaine génération est ajoutée. Cette mise à jour de service inclut d'autres améliorations internes.

Grands modèles vocaux pour l'anglais, le japonais et le français - en accès anticipé

Pour la fonction d'accès anticipé, les modèles vocaux de grande taille sont disponibles pour l'anglais, le japonais et le français dans IBM Watson Speech-to-Text et IBM watsonx Assistant. L'ensemble de fonctions de ces modèles de grande parole est limité, mais plus précis que les modèles de nouvelle génération et est plus rapide et moins coûteux à exécuter en raison de la taille plus petite et de la meilleure capacité du mode de diffusion en flux.

Si vous souhaitez tester ces modèles de base et partager les résultats et les commentaires, contactez notre équipe de gestion des produits en remplissant ce formulaire.

28 juillet 2023

Important: Tous les modèles de la génération précédente sont arrêtés à partir du 1er août 2023
Important: Tous les modèles de la génération précédente sont désormais retirés du service. Les nouveaux clients ne doivent désormais utiliser que les modèles de nouvelle génération. Tous les clients existants doivent maintenant migrer vers le modèle de nouvelle génération équivalent. Pour plus d'informations sur tous les modèles de nouvelle génération, voir Langues et modèles de nouvelle génération. Pour plus d'informations sur la migration vers les modèles de nouvelle génération, voir Migration vers les modèles de nouvelle génération.

9 juin 2023

Correction d'incident: la création et l'entraînement d'un modèle de langue personnalisé sont désormais optimaux pour les modèles de nouvelle génération standard et à faible temps d'attente
Correctif d'incident: Lors de la création et de l'entraînement d'un modèle de langue personnalisé avec des fichiers texte de corpus et / ou des mots personnalisés à l'aide d'un modèle à faible temps d'attente de la génération suivante, il fonctionne désormais de la même manière qu'avec un modèle standard. Auparavant, il n'était pas optimal uniquement lors de l'utilisation d'un modèle à faible temps d'attente de la prochaine génération.
Correction de l'incident: les sessions Websockets STT n'échouent plus en raison d'un message d'erreur tensor
Correction d'incident: Lorsque vous utilisez des sockets Web STT, les sessions n'échouent plus en raison d'un message d'erreur " STT renvoie l'erreur: les tailles des tenseurs doivent correspondre sauf dans la dimension 0.

18 mai 2023

Mises à jour du modèle de téléphonie médicale de nouvelle génération en anglais

Le modèle de téléphonie médicale de nouvelle génération en anglais a été mis à jour afin d'améliorer la reconnaissance vocale :

  • en-WW_Medical_Telephony
Ajout de la prise en charge du français et de l'allemand sur la nouvelle personnalisation du modèle de langue de nouvelle génération

La personnalisation des modèles de langue pour les modèles de nouvelle génération français et allemand a récemment été ajoutée. Cette mise à jour de service inclut d'autres améliorations internes.

Pour plus d'informations sur les nouvelles fonctionnalités de personnalisation de nouvelle génération, consultez

Correction de l'incident: les mots personnalisés contenant des caractères Katakana demi-largeur renvoient désormais un message d'erreur clair avec le modèle de téléphonie japonais

Correctif d'incident: Selon la documentation , seuls les caractères Katakana pleine largeur sont acceptés dans les mots personnalisés et les modèles de la prochaine génération affichent désormais un message d'erreur indiquant qu'ils ne sont pas pris en charge. Auparavant, lors de la création de mots personnalisés contenant des caractères Katakana demi-largeur, aucun message d'erreur n'était fourni.

Correction de l'incident: le modèle de langue de la téléphonie japonaise n'échoue plus en raison d'une longue durée d'apprentissage

Correctif de défaut: Lors de l'entraînement d'un modèle de langue personnalisé avec la téléphonie japonaise, le service gère désormais efficacement un grand nombre de mots personnalisés sans échec.

2 mai 2023

Nouvelle procédure de mise à niveau d'un modèle personnalisé basé sur un modèle de nouvelle génération amélioré

Deux approches sont désormais disponibles pour mettre à niveau un modèle de langue personnalisé vers un modèle de base de nouvelle génération amélioré. Vous pouvez toujours modifier, puis entraîner à nouveau le modèle personnalisé, comme déjà documenté. A présent, vous pouvez également mettre à niveau le modèle personnalisé en incluant le paramètre de requête force=true dans la demande POST /v1/customizations/{customization_id}/train. Le paramètre force met à niveau le modèle personnalisé, qu'il contienne ou non des modifications (à l'état ready ou available ).

Pour plus d'informations, voir Mise à niveau d'un modèle de langue personnalisé basé sur un modèle de nouvelle génération amélioré.

Conseils pour l'ajout de mots à des modèles personnalisés basés sur des modèles de nouvelle génération améliorés

La documentation offre désormais des conseils supplémentaires sur l'ajout de mots à des modèles personnalisés basés sur des modèles de nouvelle génération améliorés. Pour des raisons de performance au cours de la formation, les conseils encouragent l'utilisation de corpus plutôt que l'ajout direct de mots personnalisés dans la mesure du possible.

Pour plus d'informations, voir Instructions pour l'ajout de mots à des modèles personnalisés basés sur des modèles de nouvelle génération améliorés.

Les mots personnalisés japonais pour les modèles personnalisés basés sur des modèles de nouvelle génération améliorés sont traités différemment

Pour les modèles personnalisés japonais basés sur des modèles de nouvelle génération, les mots personnalisés sont traités différemment des autres langues. Pour le japonais, vous pouvez ajouter un mot personnalisé ou des sons dont la longueur ne dépasse pas 25 caractères. Si votre mot personnalisé ou son dépasse cette limite, le service ajoute le mot au modèle personnalisé comme s'il avait été ajouté par un corpus. Le mot n'apparaît pas comme un mot personnalisé pour le modèle.

Pour plus d'informations, voir Instructions pour l'ajout de mots à des modèles japonais basés sur des modèles de nouvelle génération améliorés.

12 avril 2023

Correction de l'incident: l'interface WebSocket arrive à expiration comme prévu lors de l'utilisation de modèles de nouvelle génération
Correction d'incident: lorsqu'elle est utilisée pour la reconnaissance vocale avec des modèles de nouvelle génération, l'interface WebSocket expire maintenant comme prévu après de longues périodes de silence. Auparavant, lorsqu'elle était utilisée pour la reconnaissance vocale de fichiers audio courts, la session WebSocket pouvait ne pas parvenir à un délai d'attente. Lorsque le délai d'attente de la session a échoué, le service n'a pas renvoyé d'hypothèse finale à l'application client en attente et le client est arrivé à expiration lors de l'attente des résultats.

6 avril 2023

Correction d'incident: Limites pour permettre l'exécution de l'entraînement pour les modèles personnalisés japonais de nouvelle génération

Correctif d'incident: L'entraînement réussi d'un modèle de langue personnalisé japonais de nouvelle génération nécessite que les mots et les sonorités personnalisés ajoutés au modèle ne contiennent pas plus de 25 caractères. Pour l'entraînement le plus efficace, il est recommandé que les mots personnalisés et les sonorités ne contiennent pas plus de 20 caractères. L'entraînement des modèles personnalisés japonais avec des mots et des sons personnalisés plus longs échoue après plusieurs heures d'entraînement.

Si vous devez ajouter l'équivalent d'un mot long ou d'un son à un modèle personnalisé japonais de nouvelle génération, procédez comme suit:

  1. Ajoutez un mot plus court ou des sons similaires qui capturent l'essence du mot plus long ou des sons similaires au modèle personnalisé.
  2. Ajoutez une ou plusieurs phrases qui utilisent le mot le plus long ou des sons à un corpus.
  3. Envisagez d'ajouter des phrases au corpus qui fournissent plus de contexte pour le mot ou les sons. Un plus grand contexte donne au service plus d'informations permettant de reconnaître le mot et d'appliquer les sons corrects.
  4. Ajoutez le corpus au modèle personnalisé.
  5. Entraînez à nouveau le modèle personnalisé sur la combinaison du mot plus court ou des sons et du corpus qui contient la chaîne la plus longue.

Les limites et les étapes qui viennent d'être décrites permettent aux modèles personnalisés japonais de nouvelle génération de terminer l'entraînement. N'oubliez pas que l'ajout d'un grand nombre de nouveaux mots personnalisés à un modèle de langue personnalisé augmente le temps d'apprentissage du modèle. Mais l'augmentation du temps d'apprentissage se produit uniquement lorsque le modèle personnalisé est initialement entraîné sur les nouveaux mots. Une fois que le modèle personnalisé a été entraîné sur les nouveaux mots, le temps d'entraînement revient à la normale.

For more information, see

Autres améliorations apportées à la mise à jour de la personnalisation du modèle de langue de nouvelle génération

La personnalisation des modèles de langue pour les modèles de prochaine génération en anglais et en japonais a été récemment améliorée. Cette mise à jour de service inclut d'autres améliorations internes. Pour plus d'informations sur les nouvelles fonctionnalités de personnalisation de nouvelle génération, consultez

13 mars 2023

Correction d'incident: le formatage intelligent pour les dates en anglais américain est désormais correct
Correctif d'incident: le formatage intelligent inclut désormais correctement les jours de la semaine et les dates où les deux sont présents dans l'audio parlé, par exemple, Tuesday February 28. Auparavant, dans certains cas, le jour de la semaine était omis et la date n'était pas présentée correctement. Notez que le formatage intelligent est une fonctionnalité bêta.
Correction d'incident: Mise à jour de la documentation pour les mots d'hésitation de la parole pour les modèles de nouvelle génération
Correctif d'incident: La documentation des mots d'hésitation de la parole pour les modèles de nouvelle génération a été mise à jour. Plus de détails sont fournis sur l'anglais américain et les mots d'hésitation japonais. Les modèles de génération suivante incluent les mots d'hésitation réels dans les résultats de transcription, contrairement aux modèles de génération précédente, qui incluent uniquement des marqueurs d'hésitation. Pour plus d'informations, voir Speech hesitations and hésitation marqueurs.

27 février 2023

Nouveau modèle japonais de téléphonie de nouvelle génération

Ce service propose désormais un modèle de téléphonie de nouvelle génération destiné au marché japonais : ja-JP_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez

Amélioration de la personnalisation des modèles de langue pour les modèles anglais et japonais de nouvelle génération

Le service offre désormais une personnalisation améliorée du modèle de langue pour les modèles anglais et japonais de nouvelle génération:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Améliorations visibles des modèles: La nouvelle technologie améliore le comportement par défaut des nouveaux modèles anglais et japonais. Entre autres modifications, la nouvelle technologie optimise le comportement par défaut pour les paramètres suivants:

  • La valeur par défaut customization_weight pour les modèles personnalisés basés sur les nouvelles versions de ces modèles passe de 0.2 à 0.1.
  • Le character_insertion_bias par défaut pour les modèles personnalisés basés sur les nouvelles versions de ces modèles reste 0.0, mais les modèles ont été modifiés d'une manière qui rend moins nécessaire l'utilisation du paramètre pour la reconnaissance vocale.

Mise à niveau vers les nouveaux modèles: Pour tirer parti de la technologie améliorée, vous devez mettre à niveau les modèles de langue personnalisés basés sur les nouveaux modèles. Pour effectuer une mise à niveau vers la nouvelle version de l'un de ces modèles de base, procédez comme suit:

  1. Modifiez votre modèle personnalisé en ajoutant ou en modifiant un mot personnalisé, un corpus ou une grammaire que le modèle contient. Toute modification que vous apportez fait passer le modèle à l'état ready.
  2. Utilisez la méthode POST /v1/customizations/{customization_id}/train pour entraîner à nouveau le modèle. Le réentraînement met à niveau le modèle personnalisé vers la nouvelle technologie et fait passer le modèle à l'état available.

Problème connu: Pour l'instant, vous ne pouvez pas utiliser la méthode POST /v1/customizations/{customization_id}/upgrade_model pour mettre à niveau un modèle personnalisé vers l'un des nouveaux modèles de base. Ce problème sera résolu dans une prochaine version.

Utilisation des nouveaux modèles: Après la mise à niveau vers le nouveau modèle de base, il est conseillé d'évaluer les performances du modèle personnalisé mis à niveau en accordant une attention particulière aux paramètres customization_weight et character_insertion_bias pour la reconnaissance vocale. Lorsque vous entraînez à nouveau votre modèle personnalisé:

  • Le modèle personnalisé utilise le nouveau customization_weight par défaut de 0.1 pour votre modèle personnalisé. Un customization_weight autre que celui par défaut que vous aviez associé à votre modèle personnalisé est supprimé.
  • Il se peut que le modèle personnalisé ne nécessite plus l'utilisation du paramètre character_insertion_bias pour une reconnaissance vocale optimale.

Les améliorations apportées à la personnalisation du modèle de langue rendent ces paramètres moins importants pour la reconnaissance vocale de haute qualité:

  • Si vous utilisez les valeurs par défaut pour ces paramètres, continuez à le faire après la mise à niveau. Les valeurs par défaut continueront probablement à offrir les meilleurs résultats pour la reconnaissance vocale.
  • Si vous spécifiez des valeurs autres que les valeurs par défaut pour ces paramètres, testez les valeurs par défaut après la mise à niveau. Votre modèle personnalisé peut bien fonctionner pour la reconnaissance vocale avec les valeurs par défaut.

Si vous pensez que l'utilisation de valeurs différentes pour ces paramètres peut améliorer la reconnaissance vocale avec votre modèle personnalisé, testez les modifications incrémentielles afin de déterminer si les paramètres sont nécessaires pour améliorer la reconnaissance vocale.

Remarque: Pour le moment, les améliorations apportées à la personnalisation des modèles de langue s'appliquent uniquement aux modèles personnalisés basés sur les modèles de langue de base anglais ou japonais de nouvelle génération répertoriés précédemment. Au fil du temps, les améliorations seront disponibles pour d'autres modèles de langue de nouvelle génération.

Plus d'informations: Pour plus d'informations sur la mise à niveau et la reconnaissance vocale avec ces paramètres, voir

Correction d'incident: les fichiers de grammaire gèrent désormais correctement les chaînes de chiffres

Correctif d'incident: Lorsque des grammaires sont utilisées, le service traite désormais correctement les chaînes de chiffres plus longues. Auparavant, elle ne parvenait pas à effectuer la reconnaissance ou à renvoyer des résultats incorrects.

15 février 2023

Important: Tous les modèles de la génération précédente sont obsolètes et atteindront la fin de service le 31 juillet 2023

Important: Tous les modèles de génération précédente sont obsolètes et atteindront la fin de service à compter du 31 juillet 2023. A cette date, tous les modèles de génération précédente seront supprimés du service et de la documentation. La date d'obsolescence précédente était le 3 mars 2023. La nouvelle date donne aux utilisateurs plus de temps pour migrer vers les modèles de nouvelle génération appropriés. Mais les utilisateurs doivent migrer vers le modèle équivalent de la prochaine génération d'ici le 31 juillet 2023.

La plupart des modèles de génération précédente ont été dépréciés le 15 mars 2022. Auparavant, les modèles arabe et japonais n'étaient pas obsolètes. La dépréciation s'applique désormais à tous les modèles de génération précédente.

Remarque : lorsque la génération précédente ( en-US_BroadbandModel ) sera retirée du service, le modèle de nouvelle génération ( en-US_Multimedia ) deviendra le modèle par défaut pour les requêtes de reconnaissance vocale.

Correction d'incident: amélioration du temps d'entraînement pour les modèles de langue personnalisés de nouvelle génération

Correctif d'incident: La durée de formation pour les modèles de langue personnalisés de nouvelle génération a été considérablement améliorée. Auparavant, le temps d'entraînement prenait beaucoup plus de temps que nécessaire, comme indiqué pour l'entraînement des modèles de langue personnalisés japonais. Le problème a été corrigé par un correctif interne.

Correction de l'incident: les fichiers de grammaire générés de manière dynamique fonctionnent désormais correctement

Correctif d'incident: Les fichiers de grammaire générés de manière dynamique fonctionnent désormais correctement. Auparavant, les fichiers de grammaire dynamique pouvaient provoquer des échecs internes, comme indiqué pour l'intégration de Speech to Text à IBM® watsonx™ Assistant. Le problème a été corrigé par un correctif interne.

20 janvier 2023

Les noms de modèles obsolètes en arabe et au Royaume-Uni ne sont plus disponibles

Les noms de modèles arabes et britanniques suivants ne sont plus acceptés par le service:

  • ar-AR_BroadbandModel-Utilisez ar-MS_BroadbandModel à la place.
  • en-UK_NarrowbandModel-Utilisez en-GB_NarrowbandModel à la place.
  • en-UK_BroadbandModel-Utilisez en-GB_BroadbandModel à la place.

Le nom de modèle arabe a été déprécié le 2 décembre 2020. Les noms de modèles anglais au Royaume-Uni ont été dépréciés le 14 juillet 2017.

Cloud Foundry-obsolescence et migration vers des groupes de ressources

IBM a annoncé la dépréciation d'IBM Cloud Foundry le 31 mai 2022. A partir du 30 novembre 2022, les nouvelles IBM Cloud Foundry ne pourront pas être créées et seuls les utilisateurs existants pourront déployer des applications. IBM Cloud Foundry arrive en fin de support le 1er juin 2023. À ce moment-là, toutes les instances d'exécution d'applications IBM Exécutant des applications Cloud Foundry IBM seront définitivement désactivées, déprovisionnées et supprimées Cloud Foundry seront définitivement désactivées, déprovisionnées et supprimées.

Pour continuer à utiliser vos applications IBM Cloud au-delà du 1er juin 2023, vous devez migrer vers des groupes de ressources avant cette date. Les groupes de ressources sont conceptuellement similaires aux espaces Cloud Foundry. Ils offrent plusieurs avantages supplémentaires, tels qu’un contrôle d’accès plus précis grâce à la gestion des identités et des accès ( IBM Cloud Identity and Access Management, IAM), la possibilité de connecter des instances de service à des applications et à des services dans différentes régions, ainsi qu’un moyen simple de consulter l’utilisation par groupe.

Le paramètre max_alternatives est désormais disponible pour une utilisation avec des modèles de nouvelle génération

Le paramètre max_alternatives est désormais disponible pour être utilisé avec tous les modèles de nouvelle génération. Ce paramètre est généralement disponible sur tous les modèles de nouvelle génération. Pour plus d'informations, voir Nombre maximal d'alternatives.

Correction d'incident: Autoriser l'utilisation des paramètres max_alternatives et end_of_phrase_silence_time avec les modèles de nouvelle génération

Correctif d'incident: Lorsque vous utilisez les paramètres max_alternatives et end_of_phrase_silence_time dans la même demande avec des modèles de nouvelle génération, le service renvoie désormais plusieurs transcriptions alternatives tout en respectant l'intervalle de pause indiqué. Auparavant, l'utilisation des deux paramètres dans une même demande générait un échec. (L'utilisation du paramètre max_alternatives avec des modèles de nouvelle génération était auparavant disponible en tant que fonction expérimentale pour un nombre limité de clients.)

Correction de l'incident: Mise à jour du modèle de téléphonie de nouvelle génération pour le Canada français (mise à niveau requise)

Correctif d'incident: Le modèle de téléphonie de nouvelle génération du Canada français, fr-CA_Telephony, a été mis à jour pour remédier à une incohérence interne susceptible de provoquer une erreur lors de la reconnaissance vocale. Vous devez mettre à niveau les modèles personnalisés basés sur le modèle fr-CA_Telephony. Pour plus d'informations sur la mise à niveau des modèles personnalisés, consultez

Correction d'incident: Ajoutez des instructions de documentation pour la création de sonorités japonaises basées sur des modèles de nouvelle génération

Correctif d'incident: dans les recommandations sonores pour les modèles de langue personnalisés japonais basés sur des modèles de nouvelle génération, la séquence de caractères ウー est ambiguë dans certains contextes de gauche. N'utilisez pas de caractères (syllabes) qui se terminent par le phonème /o/, tel que et . Dans ce cas, utilisez ウウ ou uniquement à la place de ウー. Par exemple, utilisez ロウウマン ou ロウマン à la place de ロウーマン. Pour plus d'informations, voir Instructions pour le japonais.

L'ajout de mots directement à des modèles personnalisés basés sur des modèles de nouvelle génération augmente le temps d'entraînement

L'ajout de mots personnalisés directement à un modèle personnalisé basé sur un modèle de nouvelle génération fait que l'entraînement d'un modèle prend quelques minutes de plus qu'il ne le ferait autrement. Si vous formez un modèle avec des mots personnalisés que vous avez ajoutés à l'aide de la méthode POST /v1/customizations/{customization_id}/words ou PUT /v1/customizations/{customization_id}/words/{word_name}, prévoyez quelques minutes d'entraînement supplémentaires pour le modèle. Pour plus d'informations, voir :

Le nombre maximal d'heures de ressources audio pour les modèles acoustiques personnalisés dans l'emplacement de Tokyo a été augmenté

Le nombre maximal d'heures de ressources audio que vous pouvez ajouter aux modèles acoustiques personnalisés dans l'emplacement de Tokyo est de nouveau de 200 heures. Auparavant, le maximum était réduit à 50 heures pour la région de Tokyo. Cette réduction a été annulée et reportée à l'année prochaine. Pour plus d'informations, voir Maximum hours of audio.

5 décembre 2022

Nouveau Pays-Bas Modèle multimédia de nouvelle génération néerlandais
Le service propose désormais un modèle multimédia de nouvelle génération pour le néerlandais des Pays-Bas : nl-NL_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez
Correction d'incident: correction de la reconnaissance de mot personnalisée dans les résultats de transcription pour les modèles de nouvelle génération
Correctif d'incident: pour la personnalisation de modèle de langue avec des modèles de nouvelle génération, les mots personnalisés sont désormais reconnus et utilisés dans toutes les retranscriptions. Auparavant, les mots personnalisés n'étaient parfois pas reconnus et utilisés dans les résultats de la transcription.
Correction d'incident: Utilisation correcte de la zone display_as dans les résultats de transcription pour les modèles de nouvelle génération
Correctif d'incident: pour la personnalisation de modèle de langue avec des modèles de nouvelle génération, la valeur de la zone display_as pour un mot personnalisé apparaît maintenant dans toutes les retranscriptions. Auparavant, la valeur de la zone word apparaissait parfois dans les résultats de la transcription.
Correctif d'incident: Mise à jour de la documentation de dénomination de modèle personnalisé
Correctif d'incident: La documentation fournit désormais des règles détaillées pour l'attribution de noms aux modèles de langue personnalisés et aux modèles acoustiques personnalisés. Pour plus d'informations, voir :

20 octobre 2022

Mises à jour des modèles de téléphonie de nouvelle génération en anglais

Les modèles de téléphonie de nouvelle génération en anglais ont été mis à jour afin d'améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tous ces modèles continuent de prendre en charge les faibles temps d'attente. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Correctif d'incident: Mise à jour du modèle multimédia de nouvelle génération japonais (mise à niveau requise)

Correctif d'incident: Le modèle multimédia de nouvelle génération japonais, ja-JP_Multimedia, a été mis à jour pour résoudre une incohérence interne qui peut provoquer une erreur lors de la reconnaissance vocale avec un faible temps d'attente. Vous devez mettre à niveau les modèles personnalisés basés sur le modèle ja-JP_Multimedia. Pour plus d'informations sur la mise à niveau des modèles personnalisés, consultez

7 octobre 2022

Nouveau modèle suédois de téléphonie de nouvelle génération

Le service propose désormais un modèle de téléphonie de nouvelle génération pour la Suède : sv-SE_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez

Mises à jour des modèles de téléphonie de nouvelle génération en anglais

Les modèles de téléphonie de nouvelle génération en anglais ont été mis à jour afin d'améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tous ces modèles continuent de prendre en charge les faibles temps d'attente. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

21 septembre 2022

Nouvel événement Activity Tracker pour la suppression RGPD des informations utilisateur

Le service renvoie désormais un événement Activity Tracker lorsque vous utilisez la méthode DELETE /v1/user_data pour supprimer toutes les informations relatives à un utilisateur. L'événement est nommé speech-to-text.gdpr-user-data.delete. Pour plus d'informations, voir Evénements Activity Tracker.

Correction d'incident: Mise à jour de modèles de nouvelle génération pour améliorer le temps de réponse à faible temps d'attente

Correctif d'incident: les modèles de nouvelle génération suivants ont été mis à jour pour améliorer leur temps de réponse lorsque le paramètre low_latency est utilisé:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

Auparavant, ces modèles ne renvoyaient pas les résultats de la reconnaissance aussi rapidement que prévu lorsque le paramètre low_latency était utilisé. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

19 août 2022

Important: La date d'obsolescence pour la plupart des modèles de la génération précédente est maintenant le 3 mars 2023

Obsolète: Cet avis d'obsolescence est remplacé par la mise à jour du service du 15 février 2023. La date de fin de service pour tous les modèles de génération précédente est désormais 31 juillet 2023.

Le 15 mars 2022, les modèles de la génération précédente pour toutes les langues, à l'exception de l'arabe et du japonais, ont été abandonnés. À cette époque, les modèles obsolètes devaient rester disponibles jusqu'au 15 septembre 2022. Pour permettre aux utilisateurs de migrer plus longtemps vers les modèles de nouvelle génération appropriés, les modèles obsolètes resteront disponibles jusqu'au 3 mars 2023. Comme pour la notification d'obsolescence initiale, les modèles de génération précédente en arabe et en japonais ne sont pas obsolètes. Pour obtenir la liste complète de tous les modèles obsolètes, voir la mise à jour du service 15 mars 2022.

Le 3 mars 2023, les modèles obsolètes seront supprimés du service et de la documentation. Si vous utilisez l'un des modèles obsolètes, vous devez migrer vers le modèle équivalent de nouvelle génération avant le 3 mars 2023.

Remarque : lorsque la génération précédente ( en-US_BroadbandModel ) sera retirée du service, le modèle de nouvelle génération ( en-US_Multimedia ) deviendra le modèle par défaut pour les requêtes de reconnaissance vocale.

15 août 2022

Nouveau modèle multimédia de nouvelle génération pour le Canada français

Le service propose désormais un modèle multimédia de nouvelle génération destiné aux Canadiens francophones : fr-CA_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez

Mises à jour des modèles de téléphonie de nouvelle génération en anglais

Les modèles de téléphonie de nouvelle génération en anglais ont été mis à jour afin d'améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Tous ces modèles continuent de prendre en charge les faibles temps d'attente. Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Le modèle multimédia italien de nouvelle génération prend désormais en charge la faible latence

Le modèle multimédia de nouvelle génération italien, it-IT_Multimedia, prend désormais en charge les faibles temps d'attente. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez

Important: Nombre maximal d'heures de réduction des données audio pour les modèles acoustiques personnalisés

Important: La quantité maximale de données audio que vous pouvez ajouter à un modèle acoustique personnalisé est réduite de 200 heures à 50 heures. Ce changement est en cours de mise en place à différents endroits d'août à septembre 2022. Pour plus d'informations sur la planification de la réduction de limite et sur ce qu'elle signifie pour les modèles acoustiques personnalisés existants qui contiennent plus de 50 heures de données audio, voir Nombre maximal d'heures de données audio.

3 août 2022

Correction d'incident: mise à jour de la documentation des hésitations et des marqueurs d'hésitation

Correctif d'incident: La documentation des hésitations et des marqueurs d'hésitation a été mise à jour. Les modèles de génération précédente incluent des marqueurs d'hésitation à la place des hésitations de la parole dans les résultats de transcription pour la plupart des langues ; le formatage intelligent supprime les marqueurs d'hésitation des transcriptions finales en anglais américain. Les modèles de la prochaine génération incluent les hésitations de la parole dans les résultats de la transcription ; le formatage intelligent n'a aucun effet sur leur inclusion dans les résultats de la transcription finale.

Pour plus d'informations, voir :

1er juin 2022

Mises à jour de plusieurs modèles de téléphonie nouvelle génération

Les modèles de téléphonie nouvelle génération suivants ont été mis à jour pour améliorer la reconnaissance vocale :

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony
  • ko-KR_Telephony

Il n'est pas nécessaire de mettre à niveau les modèles personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

25 mai 2022

Nouveau paramètre character_insertion_bias bêta pour les modèles nouvelle génération

Tous les modèles nouvelle génération prennent désormais en charge un nouveau paramètre bêta, character_insertion_bias, disponible avec toutes les interfaces de reconnaissance vocale. Par défaut, le service est optimisé pour chaque modèle individuel afin d'équilibrer la reconnaissance des chaînes candidates de différentes longueurs. La pondération spécifique au modèle est équivalente à 0,0. La pondération par défaut de chaque modèle est suffisante pour la plupart des demandes de reconnaissance vocale.

Toutefois, certains cas d'utilisation peuvent tirer parti de la préférence d'hypothèses avec des chaînes de caractères plus courtes ou plus longues. Le paramètre accepte des valeurs comprises entre -1,0 et 1,0 qui représentent une modification par rapport à la valeur par défaut d'un modèle. Des valeurs négatives indiquent au service de favoriser des chaînes de caractères plus courtes. Des valeurs positives indiquent au service pour favoriser des chaînes de caractères plus longues. Pour plus d'informations, voir Pondération d'insertion de caractères.

19 mai 2022

Nouveau modèle nouvelle génération it-IT_Multimedia italien

Le service propose désormais un modèle multimédia nouvelle génération pour l'italien : it-IT_Multimedia. Le nouveau modèle est en disponibilité générale. Il ne prend pas en charge le faible temps d'attente, mais il prend en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Mise à jour des modèles nouvelle génération de téléphonie et multimédia en coréen

Les modèles nouvelle génération coréens existants ont été mis à jour :

  • Le modèle ko-KR_Telephony a été mis à jour pour améliorer la prise en charge du faible temps d'attente pour la reconnaissance vocale.
  • Le modèle ko-KR_Multimedia a été mis à jour pour améliorer la reconnaissance vocale. Désormais, le modèle prend également en charge le faible temps d'attente.

Les deux modèles sont généralement disponibles et tous deux prennent en charge la personnalisation du modèle de langue et les grammaires. Il n'est pas nécessaire de mettre à niveau des modèles de langue personnalisés basés sur ces modèles. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Correctif : Les scores de confiance sont désormais consignés pour tous les résultats de transcription

Correctif : Les scores de confiance sont désormais consignés pour tous les résultats de transcription. Auparavant, lorsque le service renvoyait plusieurs transcriptions pour une seule demande de reconnaissance vocale, les scores de confiance pouvaient ne pas être renvoyés pour toutes les transcriptions.

11 avril 2022

Nouveau modèle nouvelle génération pt-BR_Multimedia en portugais brésilien

Le service propose désormais un modèle multimédia nouvelle génération pour le portugais brésilien : pt-BR_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue et les grammaires. Pour plus d'informations sur les modèles de nouvelle génération et la faible latence, consultez

Mise à jour du modèle nouvelle génération de-DE_Multimedia en allemand pour prendre en charge le faible temps d'attente

Le modèle allemand nouvelle génération, de-DE_Multimedia, prend désormais en charge le faible temps d'attente. Il n'est pas nécessaire de mettre à niveau des modèles personnalisés basés sur le modèle de base allemand mis à jour. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

La prise en charge des types sonores est désormais documentée pour les modèles personnalisés basés sur des modèles nouvelle génération

Pour les modèles de langue personnalisés basés sur des modèles nouvelle génération, la prise en charge est désormais documentée pour les spécifications de type sonore pour des mots personnalisés. La prise en charge des types sonores est disponible depuis fin 2021.

Il existe des d'utilisation de la zone sounds_like pour les modèles personnalisés selon qu'ils sont basés sur des modèles nouvelle génération ou de génération précédente. Pour plus d'informations sur l'utilisation de la zone sounds_like avec les modèles personnalisés basés sur des modèles nouvelle génération, voir Utilisation de mots personnalisés pour les modèles nouvelle génération.

Important : Le paramètre obsolète customization_id a été retiré de la documentation

Important : Le 9 octobre 2018, le paramètre customization_id de toutes les demandes de reconnaissance vocale est devenu obsolète et a été remplacé par le paramètre language_customization_id. Le paramètre customization_id a été retiré de la documentation pour les méthodes de reconnaissance vocale :

  • /v1/recognize pour les demandes WebSocket
  • POST /v1/recognize pour les demandes HTTP synchrones (notamment les demandes multiparties)
  • POST /v1/recognitions pour les demandes HTTP asynchrones

Remarque : Si vous utilisez les kits SDK Watson, vérifiez que vous avez mis à jour le code d'application pour utiliser le paramètre language_customization_id à la place du paramètre customization_id. Le paramètre customization_id ne sera plus disponible depuis les méthodes équivalentes des kits SDK à compter de leur prochaine version majeure. Pour plus d'informations sur les méthodes de reconnaissance vocale, voir API & SDK reference.

17 mars 2022

La prise en charge de la grammaire pour les modèles de nouvelle génération est désormais en disponibilité générale

La prise en charge de la grammaire est désormais en disponibilité générale (GA) pour les modèles suivants qui répondent aux conditions suivantes :

  • Les modèles sont en disponibilité générale.
  • Les modèles prennent en charge la personnalisation du modèle de langue.

Pour plus d'informations, consultez les rubriques suivantes :

Nouveau modèle multimédia de nouvelle génération pour l'allemand

Le service propose désormais un modèle multimédia de nouvelle génération pour l'allemand : de-DE_Multimedia. Le nouveau modèle est en disponibilité générale. Il ne prend pas en charge le faible temps d'attente. Il prend en charge la personnalisation du modèle de langue (en disponibilité générale) et les grammaires (bêta).

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles et leur support de personnalisation, voir

Le modèle en-WW_Medical_Telephony de nouvelle génération prend désormais en charge le faible temps d'attente

Le modèle en-WW_Medical_Telephony de nouvelle génération en version bêta prend désormais en charge le faible temps d'attente. Pour plus d'informations sur tous les modèles de nouvelle génération et sur le faible temps d'attente, voir

15 mars 2022

Important : Obsolescence de la plupart des modèles de génération précédente

Obsolète: Cet avis d'obsolescence est remplacé par la mise à jour du service du 15 février 2023. La date de fin de service pour tous les modèles de génération précédente est désormais 31 juillet 2023.

À compter du 15 mars 2022, les modèles de génération précédente pour toutes les langues autres que l'arabe et le japonais sont obsolètes. Les modèles obsolètes restent disponibles jusqu'au 15 septembre 2022, date à laquelle ils seront retirés du service et de la documentation. Les modèles de la génération précédente en arabe et en japonais sont obsolètes ( pas ).

Les modèles de génération précédente suivants sont désormais obsolètes :

  • Chinois (mandarin) : zh-CN_NarrowbandModel et zh-CN_BroadbandModel
  • Néerlandais (Pays-Bas) : nl-NL_NarrowbandModel et nl-NL_BroadbandModel
  • Anglais (Australien) : en-AU_NarrowbandModel et en-AU_BroadbandModel
  • Anglais (Royaume-Uni) : en-GB_NarrowbandModel et en-GB_BroadbandModel
  • Anglais (États-Unis) : en-US_NarrowbandModel, en-US_BroadbandModel et en-US_ShortForm_NarrowbandModel
  • Français (Canada) : fr-CA_NarrowbandModel et fr-CA_BroadbandModel
  • Français (France) : fr-FR_NarrowbandModel et fr-FR_BroadbandModel
  • Allemand : de-DE_NarrowbandModel et de-DE_BroadbandModel
  • Italien : it-IT_NarrowbandModel et it_IT_BroadbandModel
  • Coréen : ko-KR_NarrowbandModel et ko-KR_BroadbandModel
  • Portugais (Brésil) : pt-BR_NarrowbandModel et pt-BR_BroadbandModel
  • Espagnol (Argentine) : es-AR_NarrowbandModel et es-AR_BroadbandModel
  • Espagnol (Castillan) : es-ES_NarrowbandModel et es-ES_BroadbandModel
  • Espagnol (Chili) : es-CL_NarrowbandModel et es-CL_BroadbandModel
  • Espagnol (Colombie) : es-CO_NarrowbandModel et es-CO_BroadbandModel
  • Espagnol (Mexique) : es-MX_NarrowbandModel et es-MX_BroadbandModel
  • Espagnol (Pérou) : es-PE_NarrowbandModel et es-PE_BroadbandModel

Si vous utilisez l'un de ces modèles obsolètes, vous devez migrer vers le modèle de nouvelle génération équivalent avant la date de fin de service.

Remarque : Lorsque le modèle de génération précédente en-US_BroadbandModel est supprimé du service le 15 septembre, le modèle en-US_Multimedia de nouvelle génération devient le modèle par défaut pour les demandes de reconnaissance vocale.

Les modèles de nouvelle génération prennent désormais en charge les paramètres d'analyse audio

Tous les modèles de nouvelle génération prennent désormais en charge les paramètres d'analyse audio suivants en tant que fonctions en disponibilité générale :

  • end_of_phrase_silence_time indique la durée de l'intervalle de pause auquel le service divise une transcription en plusieurs résultats finaux. Pour plus d'informations, voir Paramètre end_of_phrase_silence_time.
  • split_transcript_at_phrase_end ordonne au service de scinder la transcription en plusieurs résultats finaux en fonction des caractéristiques sémantiques de l'entrée. Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.
Correction d'un bug : correction de la documentation relative aux libellés des haut-parleurs

Correctif : La documentation des étiquettes d'orateur inclut l'instruction erronée suivante dans plusieurs emplacements : Pour les modèles de nouvelle génération, l'utilisation des étiquettes d'orateur n'est pas prise en charge avec des résultats provisoires ou un faible temps d'attente. L'utilisation des étiquettes d'orateur avec des résultats provisoires et un faible temps d'attente est prise en charge pour les modèles de prochaine nouvelle génération. Pour plus d'informations, voir Etiquettes de locuteur.

28 février 2022

Mise à jour des modèles multimédias de nouvelle génération en anglais et en français pour prendre en charge le faible temps d'attente

Les modèles multimédias suivants ont été mis à jour pour prendre en charge le faible temps d'attente :

  • Anglais australien : en-AU_Multimedia
  • Anglais britannique : en-GB_Multimedia
  • Anglais américain : en-US_Multimedia
  • Français : fr-FR_Multimedia

Il n'est pas nécessaire de mettre à niveau les modèles de langue personnalisés qui sont générés sur ces modèles de base. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

Nouveau modèle multimédia de nouvelle génération pour l'espagnol (Castillan)

Le service propose désormais un modèle multimédia de nouvelle génération pour l'espagnol (Castillan) : es-ES_Multimedia. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Il prend également en charge la personnalisation du modèle de langue (en disponibilité générale) et les grammaires (bêta).

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles et leur support de personnalisation, voir

11 février 2022

Correction d'un bug : mise à jour de la documentation relative à la mise à niveau des modèles personnalisés et à la version des modèles de base

Correctif : La documentation décrivant la mise à niveau des modèles personnalisés et des chaînes de version utilisées pour différentes versions des modèles de base a été mise à jour. La documentation indique maintenant que la mise à niveau pour la personnalisation du modèle de langue s'applique également aux modèles de nouvelle génération. De plus, les chaînes de version qui représentent différentes versions des modèles de base ont été mises à jour. Le paramètre base_model_version peut également être utilisé avec des modèles de nouvelle génération mis à niveau.

Pour plus d'informations sur la mise à niveau du modèle personnalisé, lorsque la mise à niveau est nécessaire, et sur l'utilisation des anciennes versions de modèles personnalisés, voir

Correction d'un bug : mise à jour de la documentation relative à la mise en majuscules

Correctif : La documentation décrivant la mise en majuscules automatique des scripts a été mise à jour. Le service met en majuscules les noms appropriés uniquement pour les langues et modèles suivants :

  • Tous les modèles en anglais américains de génération précédente
  • Le modèle allemand de la nouvelle génération

Pour plus d'informations, voir Capitalisation.

2 février 2022

Le nouveau modèle bêta en-WW_Medical_Telephony est désormais disponible

Une nouvelle version bêta de nouvelle génération en-WW_Medical_Telephony est désormais disponible. Le nouveau modèle comprend les termes des domaines médical et pharmacologique. Utilisez le modèle dans les situations où vous devez transcrire une terminologie médicale commune, comme les noms de médicaments, les marques de produits, les procédures médicales, les maladies, les types de médecin ou la terminologie liée à la COVID-19. Les cas d'utilisation courants comprennent les conversations entre un patient et un médecin (par exemple, un médecin, une infirmière ou un pharmacien).

Le nouveau modèle est disponible pour tous les dialectes anglais pris en charge : australien, indien, britannique et américain. Le nouveau modèle prend en charge la personnalisation des modèles de langue et les grammaires en tant que fonctionnalité bêta. Il prend en charge la plupart des paramètres du modèle en-US_Telephony, y compris smart_formatting pour l'anglais américain. Il ne prend pas en charge les paramètres suivants : low_latency, profanity_filter, redaction et speaker_labels.

Pour plus d'informations, voir Le modèle de téléphonie médical anglais.

Mise à jour du modèle zh-CN_Telephony chinois

Le modèle chinois de nouvelle génération zh-CN_Telephony a été mis à jour pour améliorer la reconnaissance vocale. Le modèle continue de prendre en charge le faible temps d'attente. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance vocale. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Si vous disposez de modèles de langue personnalisés basés sur le modèle mis à jour, vous devez mettre à niveau vos modèles personnalisés existants afin de tirer parti des mises à jour à l'aide de la méthode POST /v1/customizations/{customization_id}/upgrade_model. Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Mise à jour du modèle nouvelle génération ja-JP_Multimedia en japonais pour prendre en charge le faible temps d'attente

Le modèle japonais de nouvelle génération ja-JP_Multimedia prend désormais en charge le faible temps d'attente. Vous pouvez utiliser le paramètre low_latency avec les demandes de reconnaissance vocale qui utilisent le modèle. Il n'est pas nécessaire de mettre à niveau des modèles personnalisés basés sur le modèle de base japonais mis à jour. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir

3 décembre 2021

Nouveau modèle de téléphonie de nouvelle génération pour l'espagnol (Amérique latine)

Le service propose désormais un modèle de téléphonie de nouvelle génération pour l'espagnol (Amérique latine) : es-LA_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale.

Le modèle es-LA_Telephony s'applique à tous les dialectes d'Amérique latine. C'est l'équivalent des modèles de génération précédente disponibles pour les dialectes argentins, chiliens, colombiens, mexicains et péruviens. Si vous avez utilisé un modèle de génération précédente pour l'un de ces dialectes spécifiques, utilisez le modèle es-LA_Telephony pour migrer vers le modèle de nouvelle génération équivalent.

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Important : les modèles de langue personnalisés basés sur certains modèles de nouvelle génération doivent être recréés

Important : Si vous avez créé des modèles de langue personnalisés basés sur certains modèles de nouvelle génération, vous devez recréer les modèles personnalisés. Tant que vous ne recréez pas les modèles de langue personnalisés, les demandes de reconnaissance vocale qui tentent d'utiliser les modèles personnalisés échouent avec le code d'erreur HTTP 400.

Vous devez recréer des modèles de langue personnalisés que vous avez créés à partir des versions suivantes des modèles de nouvelle génération :

  • Pour le modèle en-AU_Telephony, personnalisez les modèles que vous avez créés de en-AU_Telephony.v2021-03-03 à en-AU_Telephony.v2021-10-04.
  • Pour le modèle en-GB_Telephony, personnalisez les modèles que vous avez créés de en-GB_Telephony.v2021-03-03 à en-GB_Telephony.v2021-10-04.
  • Pour le modèle en-US_Telephony, personnalisez les modèles que vous avez créés de en-US_Telephony.v2021-06-17 à en-US_Telephony.v2021-10-04.
  • Pour le modèle en-US_Multimedia, personnalisez les modèles que vous avez créés de en-US_Multimedia.v2021-03-03 à en-US_Multimedia.v2021-10-04.

Pour identifier la version d'un modèle sur lequel est basé un modèle de langue personnalisé, utilisez la méthode GET /v1/customizations pour répertorier tous vos modèles de langue personnalisés ou la méthode GET /v1/customizations/{customization_id} pour répertorier un modèle de langue personnalisé spécifique. La zone versions de la sortie affiche le modèle de base d'un modèle de langue personnalisé. Pour plus d'informations, voir Affichage de la liste des modèles de langue personnalisés.

Pour recréer un modèle de langue personnalisé, crée d'abord un nouveau modèle personnalisé. Ajoutez ensuite tous les corpus et mots personnalisés du modèle personnalisé précédent au nouveau modèle. Vous pouvez ensuite supprimer le modèle personnalisé précédent. Pour plus d'informations, voir Création d'un modèle de langue personnalisé.

28 octobre 2021

Nouveau modèle de téléphonie de nouvelle génération pour le chinois

Le service propose désormais un modèle de téléphonie de nouvelle génération pour le chinois (mandarin) : zh-CN_Telephony. Le nouveau modèle prend en charge le faible temps d'attente et est en disponibilité générale. Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Nouveaux modèles multimédia de nouvelle génération pour l'anglais australien et l'anglais britannique

Le service propose désormais les modèles multimédias de nouvelle génération suivants. Les nouveaux modèles sont en disponibilité générale et aucun des deux modèles ne prend en charge le faible temps d'attente.

  • Anglais australien : en-AU_Multimedia
  • Anglais britannique : en-GB_Multimedia

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Mises à jour de plusieurs modèles de nouvelle génération pour une meilleure reconnaissance vocale

Les modèles de nouvelle génération suivants ont été mis à jour pour améliorer la reconnaissance vocale :

  • Modèle de téléphonie en anglais australien (en-AU_Telephony)
  • Modèle de téléphonie en anglais britannique (en-GB_Telephony)
  • Modèle multimédia en anglais américain (en-US_Multimedia)
  • Modèle de téléphonie en anglais américain (en-US_Telephony)
  • Modèle de téléphonie en castillan (es-ES_Telephony)

Pour plus d'informations sur tous les modèles de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

La prise en charge de la grammaire pour les modèles de génération précédente est désormais en disponibilité générale

La prise en charge de la grammaire est désormais en disponibilité générale (GA) pour les modèles de génération précédente qui répondent aux conditions suivantes :

  • Les modèles sont en disponibilité générale.
  • Les modèles prennent en charge la personnalisation du modèle de langue.

Pour plus d'informations, consultez les rubriques suivantes :

Nouvelle prise en charge de la grammaire en version bêta pour les modèles de nouvelle génération

La prise en charge de la grammaire est désormais disponible en version bêta pour tous les modèles de nouvelle génération. Tous les modèles de nouvelle génération sont en disponibilité générale (GA) et prennent en charge la personnalisation du modèle de langue. Pour plus d'informations, consultez les rubriques suivantes :

Remarque : La prise en charge de la version bêta des grammaires par les modèles de nouvelle génération est disponible pour le service Speech to Text sur IBM Cloud uniquement. Les grammaires ne sont pas encore prises en charge pour les modèles de nouvelle génération sous IBM Cloud Pak for Data.

Nouvelle zone custom_acoustic_model pour les fonctions prises en charge

Les méthodes GET /v1/models et GET /v1/models/{model_id} indiquent désormais si un modèle prend en charge la personnalisation de modèle acoustique. L'objet SupportedFeatures inclut désormais une zone supplémentaire, custom_acoustic_model, une valeur booléenne de true pour un modèle prenant en charge la personnalisation de modèle acoustique et de false dans le cas contraire. Actuellement, la zone a une valeur true pour tous les modèles de génération précédente et false pour tous les modèles de nouvelle génération.

22 octobre 2021

Correction d'un bug : résolution des échecs d' HTTP s asynchrones
Correctif : L'interface HTTP asynchrone n'a pas pu transcrire certains fichiers audio. En outre, le rappel de la demande a renvoyé le statut recognitions.completed_with_results au lieu de recognitions.failed. Cette erreur a été résolue.

6 octobre 2021

Mise à jour des modèles de nouvelle génération pour le tchèque et le néerlandais

Les modèles de langue de nouvelle génération suivants ont changé comme indiqué :

  • Le modèle de téléphonie tchèque, cs-CZ_Telephony, est désormais en disponibilité générale (GA). Le modèle continue de prendre en charge le faible temps d'attente.
  • Le modèle de téléphonie néerlandais (Belge), nl-BE_Telephony, a été mis à jour pour une meilleure reconnaissance vocale. Le modèle continue de prendre en charge le faible temps d'attente.
  • Le modèle de téléphonie pour le néerlandais (Pays-Bas), nl-NL_Telephony, est désormais en GA. En outre, le modèle prend désormais en charge le faible temps d'attente.

Pour plus d'informations sur tous les modèles de langue de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Nouveau support HIPAA américain pour les plans Premium dans l'emplacement de Dallas

Le support de la US Health Insurance Portability and Accountability Act (HIPAA) est maintenant disponible pour les plans Premium hébergés dans l'emplacement de Dallas (us-south). Pour plus d'informations, voir Health Insurance Portability and Accountability Act (HIPAA).

16 septembre 2021

Nouvelles versions bêta des modèles de nouvelle génération tchèque et néerlandais

Le service prend désormais en charge les nouveaux modèles de langue de nouvelle génération suivants. Les deux nouveaux modèles sont des fonctionnalités bêta.

  • Tchèque : cs-CZ_Telephony. Le nouveau modèle prend en charge le faible temps d'attente.
  • Néerlandais (Pays-Bas) : nl-NL_Telephony. Le nouveau modèle ne prend pas en charge le faible temps d'attente.

Pour plus d'informations sur tous les modèles de langue de nouvelle génération disponibles, voir Langues et modèles de nouvelle génération.

Mise à jour des modèles coréens et brésiliens de nouvelle génération

Les modèles de nouvelle génération suivants ont été mis à jour :

  • Le modèle coréen ko-KR_Telephony prend désormais en charge le faible temps d'attente.
  • Le modèle portugais pt-BR_Telephony a été mis à jour pour améliorer la reconnaissance vocale.
Correction d'un bug : correction des résultats intermédiaires et de la documentation relative à la faible latence

Correctif : La documentation qui décrit les résultats provisoires et les caractéristiques de faible temps d'attente avec les modèles de nouvelle génération a été réécrite pour plus de clarté et de correction. Pour plus d'informations, consultez les rubriques suivantes :

Correction d'incident: amélioration des résultats de l'étiquetage des haut-parleurs

Correctif : Lorsque vous utilisez des étiquettes d'orateur avec des modèles de nouvelle génération, le service identifie désormais l'orateur pour tous les mots de l'audio en entrée, y compris les mots très courts qui ont les mêmes horodatages de début et de fin.

31 août 2021

Tous les modèles de nouvelle génération sont maintenant en disponibilité générale

Tous les modèles de langue de nouvelle génération sont désormais en disponibilité générale (GA). Leur utilisation dans les environnements de production et les applications est prise en charge.

La personnalisation du modèle de langue pour les modèles de nouvelle génération est maintenant en disponibilité générale

La personnalisation du modèle de langue est désormais en disponibilité générale (GA) pour toutes les langues et tous les modèles de nouvelle génération disponibles. La personnalisation du modèle de langue pour les modèles de nouvelle génération est prise en charge pour l'utilisation dans les environnements de production et les applications.

Vous utilisez les mêmes commandes pour créer, gérer et utiliser des modèles de langue personnalisés, des corpus et des mots personnalisés pour les modèles de nouvelle génération, comme vous le faites pour les modèles de génération précédente. Cependant, la personnalisation des modèles de nouvelle génération fonctionne différemment de la personnalisation des modèles de génération précédente. Pour les modèles personnalisés basés sur des modèles de nouvelle génération :

  • Les modèles personnalisés n'ont pas de concept de mots hors vocabulaire (OOV).
  • Les mots des corpus ne sont pas ajoutés à la ressource de mots.
  • Vous ne pouvez pas utiliser la fonction de consonance pour les mots personnalisés.
  • Il n'est pas nécessaire de mettre à niveau des modèles personnalisés lorsque les modèles de langue de base sont mis à jour.
  • Les grammaires ne sont pas prises en charge actuellement.

Pour plus d'informations sur l'utilisation de la personnalisation du modèle de langue des modèles de nouvelle génération, voir

Les rubriques supplémentaires décrivent la gestion des modèles de langue personnalisés, des corpus et des mots personnalisés. Ces opérations sont les mêmes pour les modèles personnalisés basés sur des modèles antérieurs et de nouvelle génération.

16 août 2021

Nouveaux modèles de nouvelle génération pour l'anglais (Inde), le hindi (Inde), le japonais et le coréen

Le service prend désormais en charge les nouveaux modèles de langue de nouvelle génération suivants. Tous les nouveaux modèles sont des fonctionnalités bêta.

  • Anglais (Inde) : en-IN_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Hindi (Inde) : hi-IN_Telephony. Le modèle prend en charge le faible temps d'attente.
  • Japonais : ja-JP_Multimedia. Le modèle ne prend pas en charge le faible temps d'attente.
  • Coréen : ko-KR_Multimedia et ko-KR_Telephony. Les modèles ne prennent pas en charge les faibles temps d'attente.

Pour plus d'informations sur les modèles de nouvelle génération et les faibles temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

16 juillet 2021

Nouveau modèle de nouvelle génération pour le français
Le modèle de langue de nouvelle génération pour le française fr-FR_Multimedia est désormais disponible. Le nouveau modèle ne prend pas en charge le faible temps d'attente. Le modèle est une fonctionnalité bêta.
Mise à jour du modèle de nouvelle génération pour l'anglais en version bêta pour améliorer la reconnaissance vocale
Le modèle américain en-US_Telephony de nouvelle génération a été mis à jour pour améliorer la reconnaissance vocale. Le modèle mis à jour continue d'être une fonctionnalité bêta.
Correction de l'incident: mise à jour de la documentation pour les marqueurs d'hésitation
Correctif : La documentation n'a pas indiqué que les modèles de nouvelle génération ne produisent pas de marqueurs d'hésitation. La documentation a été mise à jour pour indiquer que seuls les modèles de génération précédente produisent des marqueurs d'hésitation. Les modèles de la prochaine génération incluent les hésitations réelles dans les résultats de la transcription. Pour plus d'informations, voir Speech hesitations and hésitation marqueurs.

15 juin 2021

Nouveau modèle de nouvelle génération pour le néerlandais (Belge) en version bêta

Le modèle de langue de nouvelle génération en néerlandais belge (flamand) nl-BE_Telephony est désormais disponible. Le nouveau modèle prend en charge le faible temps d'attente. Le modèle est une fonctionnalité bêta. Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

Nouvelle prise en charge du faible temps d'attente en version bêta pour les modèles de nouvelle génération en arabe, français et italien

Les modèles de langue de nouvelle génération en version bêta suivants prennent désormais en charge le faible temps d'attente :

  • Modèle en arabe ar-MS_Telephony
  • Modèle en français canadien fr-CA_Telephony
  • Modèle en italien it-IT_Telephony

Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

Mise à jour des modèles de nouvelle génération pour l'arabe et le portugais (Brésil) en version bêta pour une meilleure reconnaissance vocale

Les modèles de langue de nouvelle génération en version bêta suivants ont été mis à jour pour améliorer la reconnaissance vocale :

  • Modèle en arabe ar-MS_Telephony
  • Modèle en portugais (Brésil)pt-BR_Telephony

Pour plus d'informations sur les modèles de nouvelle génération et sur le faible temps d'attente, voir Langues et modèles de nouvelle génération et Faible temps d'attente.

26 mai 2021

Nouvelle prise en charge de la version bêta du paramètre audio_metrics pour les modèles de nouvelle génération
Le paramètre audio_metrics est désormais pris en charge en tant que fonctionnalité bêta à utiliser avec toutes les langues et modèles de nouvelle génération. Pour plus d'informations, voir Métriques audio.
Nouvelle prise en charge de la version bêta du paramètre word_confidence pour les modèles de nouvelle génération
Le paramètre word_confidence est désormais pris en charge en tant que fonctionnalité bêta à utiliser avec toutes les langues et modèles de nouvelle génération. Pour plus d'informations, voir Confiance des mots.
Correctif d'incident: Mise à jour de la documentation pour les modèles de nouvelle génération
Correction d'un problème : la documentation a été mise à jour afin de corriger les informations suivantes :
  • Lorsque vous utilisez un modèle de nouvelle génération pour la reconnaissance vocale, les résultats de la transcription finale incluent désormais la zone confidence. Le champ était toujours inclus dans les résultats finaux de la transcription lorsqu'on utilise un modèle de génération précédente. Ce correctif corrige une limitation qui a été rapportée pour la version du 12 avril 2021 des modèles de nouvelle génération.
  • La documentation indiquait à tort que l'utilisation du paramètre smart_formatting entraîne la suppression des marqueurs d'hésitation des résultats finaux de la transcription pour le japonais. Le formatage intelligent ne supprime pas les marqueurs d'hésitation des résultats finaux pour le japonais, mais uniquement pour l'anglais américain. Pour plus d'informations, voir Quelles sont les résultats affectés par le formatage intelligent ?

27 avril 2021

Nouveaux modèles de nouvelle génération en version bêta pour l'arabe et le portugais (Brésil)

Le service prend en charge deux nouveaux modèles de nouvelle génération en version bêta :

  • Le modèle en portugais (Brésil) pt-BR_Telephony, qui prend en charge le faible temps d'attente.
  • Le modèle en arabe (moderne standard) ar-MS_Telephony, qui ne prend pas en charge le faible temps d'attente.

Pour plus d'informations, voir Langues et modèles de nouvelle génération.

Mise à jour du modèle de nouvelle génération pour l'espagnol (castillan) en version bêta pour une meilleure reconnaissance vocale

Le modèle de nouvelle génération en version bêta pour l'espagnol (castillan) es-ES_Telephony prend désormais en charge le paramètre low_latency. Pour plus d'informations, voir Faible temps d'attente.

Nouvelle prise en charge de la version bêta des étiquettes d'orateur avec les modèles de nouvelle génération

Le paramètre speaker_labels est désormais pris en charge en tant que fonctionnalité bêta à utiliser avec les modèles de nouvelle génération suivants :

  • Modèle en anglais australien en-AU_Telephony
  • Modèle en anglais britannique en-GB_Telephony
  • Modèles en anglais américain en-US_Multimedia et en-US_Telephony
  • Modèle en allemand de-DE_Telephony
  • Modèle en espagnol (castillan) es-ES_Telephony

Avec les modèles de nouvelle génération, l'utilisation du paramètre speaker_labels avec les paramètres interim_results ou low_latency n'est pas prise en charge pour le moment. Pour plus d'informations, voir Etiquettes de locuteur.

Nouveau code d'erreur HTTP pour l'utilisation de word_confidence avec les modèles de nouvelle génération

L'utilisation du paramètre word_confidence avec les modèles de nouvelle génération n'est pas prise en charge. Le service renvoie désormais le code d'erreur 400 suivant si vous utilisez le paramètre word_confidence avec un modèle de nouvelle génération pour la reconnaissance vocale :

{
  "error": "word_confidence is not a supported feature for model {model}",
  "code": 400,
  "code_description": "Bad Request"
}

12 avril 2021

Nouveaux modèles de langue de nouvelle génération en version bêta et paramètre low_latency

Le service prend désormais en charge un nombre croissant de modèles de langue de nouvelle génération. Les modèles Multimédia et Téléphonie de nouvelle génération améliorent les capacités de reconnaissance vocale de la génération précédente de modèles à large bande et à bande étroite du service. Les nouveaux modèles exploitent les réseaux neuronaux profonds et l'analyse bidirectionnelle pour atteindre à la fois un débit plus élevé et une plus grande précision de transcription. À l'heure actuelle, les modèles de nouvelle génération prennent en charge un nombre limité de langues et de fonctions de reconnaissance vocale. Les langues, modèles et fonctionnalités pris en charge augmenteront avec les versions ultérieures. Les modèles de nouvelle génération sont des fonctionnalités bêta.

De nombreux modèles de nouvelle génération prennent également en charge un nouveau paramètre low_latency qui vous permet de demander des résultats plus rapides aux dépens de la qualité de la transcription. Lorsque le faible temps d'attente est activé, le service limite son analyse de l'audio, ce qui peut réduire l'exactitude de la transcription. Ce compromis peut être acceptable si votre application requiert moins de temps de réponse que la plus grande précision possible. Le paramètre low_latency est une fonctionnalité bêta.

Le paramètre low_latency affecte votre utilisation du paramètre interim_results avec l'interface WebSocket. Les résultats provisoires sont disponibles uniquement pour les modèles de nouvelle génération qui prennent en charge le faible temps d'attente et uniquement si les paramètres interim_results et low_latency sont définis sur true.

17 mars 2021

Correction d'un bug : correction d'une limitation concernant l'interface d' HTTP s asynchrones
Correctif : le problème de limitation qui a été signalée avec l'interface HTTP asynchrone dans l'emplacement de Dallas (us-south) le 16 décembre 2020 a été résolu. Auparavant, un faible pourcentage de tâches entraient dans des boucles infinies qui empêchaient leur exécution. Les requêtes HTTP asynchrones du centre de données de Dallas ne sont plus concernées par cette limitation.

2 décembre 2020

Modèle en arabe renommé ar-MS_BroadbandModel
Le modèle à large bande en langue arabe est désormais nommé ar-MS_BroadbandModel. L'ancien nom ar-AR_BroadbandModel est obsolète. Il continuera de fonctionner pendant au moins un an, mais pourrait être supprimé à une date ultérieure. Nous vous encourageons à migrer vers le nouveau nom dès que vous le souhaitez.

2 novembre 2020

Les modèles en français canadiens sont maintenant en disponibilité générale

Les modèles en français canadien, fr-CA_BroadbandModel et fr-CA_NarrowbandModel, sont désormais en disponibilité générale (GA). Ils étaient auparavant des fonctionnalités bêta. Désormais, ils prennent également en charge la personnalisation des modèles de langue et des modèles acoustiques.

22 octobre 2020

Les modèles en anglais australiens sont désormais disponibles

Les modèles en anglais australien, en-AU_BroadbandModel et en-AU_NarrowbandModel, sont désormais en disponibilité générale (GA). Ils étaient auparavant des fonctionnalités bêta. Désormais, ils prennent également en charge la personnalisation des modèles de langue et des modèles acoustiques.

Mise à jour des modèles en portugais (Brésil) pour une meilleure reconnaissance vocale

Les modèles en portugais (Brésil), pt-BR_BroadbandModel et pt-BR_NarrowbandModel, ont été mis à jour pour améliorer la reconnaissance vocale. Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Le paramètre split_transcript_at_phrase_end est désormais en disponibilité générale pour toutes les langues

Le paramètre de reconnaissance vocale split_transcript_at_phrase_end est désormais en disponibilité générale (GA) pour toutes les langues. Précédemment, il était disponible uniquement pour l'anglais américain et britannique. Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.

7 octobre 2020

Mises à jour du modèle à large bande en japonais pour une meilleure reconnaissance vocale

Le modèle ja-JP_BroadbandModel a été mis à jour pour améliorer la reconnaissance vocale. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ce modèle, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

30 septembre 2020

Mise à jour des plans de tarification du service

Les plans de tarification du service ont changé :

  • Le service continue d'offrir un plan Lite qui fournit un accès de base sans frais à la reconnaissance vocale d'un nombre limité de minutes mois.
  • Le service offre un nouveau plan Plus qui offre un modèle de tarification différenciée simple et un accès aux fonctions de personnalisation du service.
  • Le service offre un nouveau plan Premium qui offre une plus grande capacité et des fonctionnalités améliorées.

Le plan Plus remplace le plan standard. Le plan standard continue d'être disponible à l'achat pendant une courte période. Il continue également d'être disponible pour une durée indéterminée aux utilisateurs actuels du plan, sans modification de leur tarification. Les utilisateurs existants peuvent effectuer une mise à niveau vers le plan Plus à tout moment.

Pour plus d'informations sur les plans de tarification disponibles, voir les ressources suivantes :

  • Pour obtenir des informations générales sur les plans de tarification et les réponses aux questions courantes, consultez la rubrique Tarification de la FAQ.
  • Pour plus d'informations sur les formules tarifaires ou pour souscrire à une formule, consultez la rubrique « Service Speech to Text » dans le catalogue IBM Cloud®.

20 août 2020

Nouveaux modèles en français canadien

Le service offre désormais des modèles à large bande et à bande étroite en version bêta pour le français canadien :

  • fr-CA_BroadbandModel
  • fr-CA_NarrowbandModel

Les nouveaux modèles ne prennent pas en charge la personnalisation de modèle de langue ou de modèle acoustique, les étiquettes de locuteur ou le formatage intelligent. Pour plus d'informations sur ces modèles et sur tous les modèles pris en charge, voir Modèles de langue de génération précédente pris en charge.

5 août 2020

Nouveaux modèles en anglais australien

Le service offre désormais des modèles à large bande et à bande étroite en version bêta pour l'anglais australien :

  • en-AU_BroadbandModel
  • en-AU_NarrowbandModel

Les nouveaux modèles ne prennent pas en charge la personnalisation de modèle de langue ou de modèle acoustique ou le formatage intelligent. Les nouveaux modèles prennent en charge les étiquettes de locuteur. Pour plus d'informations, voir :

Mises à jour de plusieurs modèles pour une meilleure reconnaissance vocale

Les modèles suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle à large bande en français (fr-FR_BroadbandModel)
  • Modèles à large bande (de-DE_BroadbandModel) et à bande étroite (de-DE_NarrowbandModel) en allemand
  • Modèles anglais à large bande (en-GB_BroadbandModel) et à bande étroite (en-GB_NarrowbandModel) en anglais britannique
  • Modèle à bande étroite de formulaire court (en-US_ShortForm_NarrowbandModel) en anglais américain

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Le marqueur d'hésitation pour l'allemand a changé

Le marqueur d'hésitation utilisé pour les modèles allemands à large bande et à bande étroite mis à jour est passé de [hesitation] à %HESITATION. Pour plus d'informations, voir Speech hesitations and hésitation marqueurs.

4 juin 2020

Correction d'un bug : amélioration de la latence pour les modèles linguistiques personnalisés comportant de nombreuses grammaires
Correctif : Le problème de temps d'attente des modèles de langue personnalisés contenant un grand nombre de grammaires a été résolu. Lorsque ces modèles personnalisés sont initialement utilisés pour la reconnaissance vocale, leur chargement peut prendre plusieurs secondes. Désormais, leur chargement est beaucoup plus rapide, ce qui réduit considérablement le temps d'attente observé lorsqu'ils sont utilisés pour la reconnaissance.

28 avril 2020

Mises à jour des modèles en italien pour une meilleure reconnaissance vocale

Les modèles italiens à large bande (it-IT_BroadbandModel) et à bande étroite (it-IT_NarrowbandModel) ont été mis à jour pour une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Les modèles en néerlandais et italien sont désormais disponibles

Les modèles de langue néerlandais et italiens sont désormais disponibles en version GA pour la reconnaissance vocale et pour la personnalisation de modèle de langue et de modèle acoustique :

  • Modèle néerlandais à large bande (nl-NL_BroadbandModel)
  • Modèle néerlandais à bande étroite (nl-NL_NarrowbandModel)
  • Modèle italien à large bande (it-IT_BroadbandModel)
  • Modèle italien à bande étroite (it-IT_NarrowbandModel)

Pour plus d'informations sur tous les modèles de langue disponibles, voir :

1er avril 2020

La personnalisation du modèle acoustique est désormais en disponibilité générale

La personnalisation de modèle acoustique est désormais disponible en version GA pour toutes les langues prises en charge. Comme avec les modèles de langue personnalisés, IBM ne facture pas la création ou l'hébergement d'un modèle acoustique personnalisé. Vous êtes facturé uniquement pour l'utilisation d'un modèle personnalisé avec une demande de reconnaissance vocale.

L'utilisation d'un modèle de langue personnalisé et/ou d'un modèle acoustique personnalisé dans le cadre d'une transcription induit un coût supplémentaire de 0,03 $ (USD) par minute. Ce coût s'ajoute aux frais d'utilisation standard de 0,02 $ (USD) par minute et s'applique à toutes les langues prises en charge par l'interface de personnalisation. Par conséquent, le coût total d'utilisation d'un ou de plusieurs modèles personnalisés pour la reconnaissance vocale s'élève à 0,05 $ (USD) par minute.

16 mars 2020

Les étiquettes d'orateur sont désormais prises en charge pour l'allemand et le coréen
Le service prend désormais en charge les libellés de locuteur (le paramètre speaker_labels ) pour les modèles de langue allemands et coréens. Les étiquettes de locuteur identifient qui sont les différentes personnes qui parlent et les mots qu'elles prononcent dans un échange à plusieurs participants. Pour plus d'informations, voir Etiquettes de locuteur.
Activity Tracker est désormais pris en charge avec l'interface HTTP asynchrone
Le service prend désormais en charge l'utilisation des événements Activity Tracker pour toutes les opérations de l'interface HTTP asynchrone. IBM Cloud Activity Tracker enregistre les activités lancées par l'utilisateur qui modifient l'état d'un service dans IBM Cloud®. Pour plus d'informations, voir Evénements Activity Tracker.

24 février 2020

Mises à jour de plusieurs modèles pour une meilleure reconnaissance vocale

Les modèles suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle néerlandais à large bande (nl-NL_BroadbandModel)
  • Modèle néerlandais à bande étroite (nl-NL_NarrowbandModel)
  • Modèle italien à large bande (it-IT_BroadbandModel)
  • Modèle italien à bande étroite (it-IT_NarrowbandModel)
  • Modèle japonais à bande étroite (ja-JP_NarrowbandModel)
  • Modèle anglais américain à large bande (en-US_BroadbandModel)

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

La personnalisation des modèles de langue est désormais disponible pour le néerlandais et l'italien

La personnalisation du modèle de langue est désormais prise en charge pour le néerlandais et l'italien avec les nouvelles versions des modèles suivants :

  • Modèle néerlandais à large bande (nl-NL_BroadbandModel)
  • Modèle néerlandais à bande étroite (nl-NL_NarrowbandModel)
  • Modèle italien à large bande (it-IT_BroadbandModel)
  • Modèle italien à bande étroite (it-IT_NarrowbandModel)

Pour plus d'informations, voir :

Etant donné que les modèles néerlandais et italien sont en version bêta, leur prise en charge pour la personnalisation de modèle de langue est également en version bêta.

Le modèle à bande étroite pour le japonais comprend désormais quelques unités de mots multigrammaires

Le modèle japonais à bande étroite (ja-JP_NarrowbandModel) inclut désormais des unités de mot multigramme pour les chiffres et les fractions décimales. Le service renvoie ces unités multigramme que le formatage intelligent soit activé ou non. La fonction de formatage intelligent comprend et renvoie les unités multigramme générées par le modèle. Si vous appliquez votre propre post-traitement aux résultats de la transcription, vous devez gérer ces unités de manière appropriée. Pour plus d'informations, voir la rubrique Japonais dans la documentation sur le formatage intelligent.

Nouveaux paramètres de détection d'activité vocale et de suppression de l'audio de fond pour la reconnaissance vocale

Le service offre désormais deux nouveaux paramètres facultatifs pour contrôler le niveau de détection d'activité vocale. Les paramètres peuvent vous aider à faire en sorte que seules les données audio pertinentes soient traitées pour la reconnaissance vocale.

  • Le paramètre speech_detector_sensitivity ajuste la sensibilité de la détection d'activité vocale. Vous pouvez utiliser ce paramètre pour supprimer les insertions de mots à partir d'une musique, d'une toux et d'autres événements non vocaux.
  • Le paramètre background_audio_suppression supprime le fond sonore en fonction de son volume pour l'empêcher d'être transcrit ou d'interférer avec la reconnaissance vocale. Vous pouvez utiliser ce paramètre pour supprimer des conversations annexes ou d'autres bruits de fond.

Vous pouvez utiliser ces paramètres individuellement ou conjointement. Ils sont disponibles pour toutes les interfaces et pour la plupart des modèles de langue. Pour plus d'informations sur les paramètres, les valeurs qui peuvent leur être affectées, et leur effet sur la qualité et le temps d'attente de la reconnaissance vocale, voir Détection d'activité vocale.

Activity Tracker désormais pris en charge avec les interfaces de personnalisation

Le service prend désormais en charge l'utilisation des événements Activity Tracker pour toutes les opérations de personnalisation. IBM Cloud Activity Tracker enregistre les activités lancées par l'utilisateur qui modifient l'état d'un service dans IBM Cloud. Vous pouvez utiliser ce service pour étudier une activité anormale et des actions critiques, ainsi que pour respecter des exigences en matière de vérification de réglementation. En outre, vous avez la possibilité d'être alerté des actions lors de leur déroulement. Pour plus d'informations, voir Evénements Activity Tracker.

Correctif d'incident: Génération correcte des métriques de traitement avec l'interface WebSocket

Correctif : L'interface WebSocket fonctionne désormais de manière harmonieuse lors de la génération de mesures de traitement. Auparavant, les mesures de traitement pouvaient continuer à être distribuées après l'envoi par le client du message stop au service.

18 décembre 2019

Nouveaux modèles beta disponibles pour l'italien

Le service offre désormais des modèles à large bande et à bande étroite en version bêta pour l'italien.

  • it-IT_BroadbandModel
  • it-IT_NarrowbandModel

Ces modèles de langue prennent en charge la personnalisation de modèle acoustique. Ils ne prennent pas en charge la personnalisation de modèle de langue. Comme ils sont en version bêta, il se peut que ces modèles ne soient pas prêts pour une utilisation en production et ils sont susceptibles d'être modifiés. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.

Pour plus d'informations, voir les sections suivantes :

Nouveau paramètre end_of_phrase_silence_time pour la reconnaissance vocale

Pour la reconnaissance vocale, le service prend désormais en charge le paramètre end_of_phrase_silence_time. Le paramètre indique la durée de l'intervalle de pause auquel le service divise une transcription en plusieurs résultats finaux. Chaque résultat final indique une pause ou un silence prolongé qui dépasse l'intervalle de pause. Pour la plupart des langues, l'intervalle de pause par défaut est de 0,8 seconde. Pour le chinois, il est de 0,6 seconde.

Vous pouvez utiliser ce paramètre pour établir un équilibre entre la fréquence à laquelle un résultat final est produit et la précision de la transcription. Augmentez l'intervalle lorsque la précision est plus importante que le temps d'attente. Réduisez l'intervalle lorsque le locuteur est censé prononcer de courtes expressions ou des mots uniques.

Pour plus d'informations, voir Paramètre end_of_phrase_silence_time.

Nouveau paramètre split_transcript_at_phrase_end pour la reconnaissance vocale

Pour la reconnaissance vocale, le service prend désormais en charge le paramètre split_transcript_at_phrase_end. Ce paramètre demande au service de fractionner la transcription en plusieurs résultats finaux en fonction des caractéristiques sémantiques de l'entrée, par exemple à la fin des phrases. Le service base sa compréhension des caractéristiques sémantiques sur le modèle de langue de base que vous utilisez avec une demande. Les modèles de langue personnalisés et les grammaires peuvent également influencer le mode et l'endroit de la division d'une transcription par le service.

Lorsque ce paramètre est défini, le service ajoute une zone end_of_utterance à chaque résultat final pour indiquer la motivation de la division : full_stop, silence, end_of_data ou reset.

Pour plus d'informations, voir Paramètre split_transcript_at_phrase_end.

12 décembre 2019

Prise en charge complète de IBM Cloud IAM

Le service Speech to Text prend désormais en charge l'implémentation totale d'IBM Cloud Identity and Access Management (IAM). Les clés d'API des services IBM Watson® ne sont plus limitées à une instance de service unique. Vous pouvez créer des règles d'accès et des clés d'API qui s'appliquent à plusieurs services et accorder l'accès entre les services. Pour plus d'informations sur IAM, voir Authentification dans les services Watson.

Pour prendre en charge ce changement, les noeuds finaux de service d'API utilisent un autre domaine et comprennent l'ID d'instance de service. Le modèle est api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}.

  • Exemple d'URL HTTP pour une instance hébergée à l'emplacement Dallas :

https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • Exemple d'URL WebSocket pour une instance hébergée à l'emplacement Dallas :

wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Pour plus d'informations sur les URL, consultez la documentation de référence de l'API et du SDK.

Ces URL ne constituent pas une modification avec rupture. Les nouvelles URL fonctionnent à la fois pour vos instances de service existantes et pour les nouvelles instances. Les URL d'origine continueront à fonctionner sur vos instances de service existantes pendant au moins un an, jusqu'à décembre 2020.

Nouveaux fonction de sécurité de réseau et de données disponibles

La prise en charge de la nouvelle fonctionnalité de sécurité réseau et des données suivante est désormais disponible :

  • Prise en charge des nœuds finaux de réseau privé

    Les utilisateurs de plans Premium peuvent créer des nœuds finaux de réseau privé pour se connecter au service Speech to Text via un réseau privé. Les connexions aux noeuds finaux de réseau privé ne nécessitent pas d'accès Internet public. Pour plus d'informations, voir Noeuds finaux de réseaux publics et privés.

10 décembre 2019

Nouveaux modèles bêta en néerlandais (Pays-Bas) disponibles

Le service propose désormais des modèles bêta à large bande et à bande étroite pour le néerlandais (Pays-Bas) :

  • nl-NL_BroadbandModel
  • nl-NL_NarrowbandModel

Ces modèles de langue prennent en charge la personnalisation de modèle acoustique. Ils ne prennent pas en charge la personnalisation de modèle de langue. Comme ils sont en version bêta, il se peut que ces modèles ne soient pas prêts pour une utilisation en production et ils sont susceptibles d'être modifiés. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.

Pour plus d'informations, voir les sections suivantes :

25 novembre 2019

Mises à jour des étiquettes d'orateur pour une meilleure identification de chaque intervenant
Les étiquettes de locuteur sont mises à jour pour améliorer l'identification de locuteurs individuels pour une analyse plus approfondie de votre échantillon audio. Pour plus d'informations sur la fonction d'étiquettes de locuteur, voir Etiquettes de locuteur. Pour plus d'informations sur les améliorations apportées à cette fonctionnalité, consultez l'article « IBM Research AI Advances Speaker Diarization in Real Use Cases ».

12 novembre 2019

Nouveau site de Séoul maintenant disponible
Le service Speech to Text est désormais disponible dans l'emplacement IBM Cloud de Séoul (kr-seo). Comme avec les autres emplacements, l'emplacement IBM Cloud utilise l'authentification IAM basée sur des jetons. Toutes les nouvelles instances de service que vous créez à cet emplacement utilisent l'authentification IAM.

1er novembre 2019

Nouvelles limites sur le nombre maximal de modèles personnalisés
Vous ne pouvez pas créer plus de 1 024 modèles de langue personnalisés et pas plus de 1 024 modèles acoustiques personnalisés par données d'identification propriétaires. Pour plus d'informations, voir Nombre maximal de modèles personnalisés.

1er octobre 2019

Nouveau support US HIPAA pour les plans Premium dans l'emplacement Washington, DC,
La prise en charge de la loi HIPAA des États-Unis est désormais pour les plans Premium hébergés dans l'emplacement de Washington, DC (us-east) et créés le ou 1er avril 2019 ou ultérieurement. Pour plus d'informations, voir la rubrique sur la loi américaine Health Insurance Portability Accountability Act.

22 août 2019

Correction d'incident: plusieurs petites améliorations
Le service a été mis à jour pour intégrer des petits correctifs d'incident et des améliorations.

30 juillet 2019

Nouveaux modèles pour les dialectes espagnols désormais disponibles

Le service propose désormais des modèles de langue à bande large et à bande étroite dans six dialectes espagnols :

  • Espagnol d'Argentine (es-AR_BroadbandModel et es-AR_NarrowbandModel)
  • Espagnol castillan (es-ES_BroadbandModel et es-ES_NarrowbandModel)
  • Espagnol du Chili (es-CL_BroadbandModel et es-CL_NarrowbandModel)
  • Espagnol de Colombie (es-CO_BroadbandModel et es-CO_NarrowbandModel)
  • Espagnol du Mexique (es-MX_BroadbandModel et es-MX_NarrowbandModel)
  • Espagnol du Pérou (es-PE_BroadbandModel et es-PE_NarrowbandModel)

Les modèles en espagnol castillan ne sont pas nouveaux. Ils sont en disponibilité générale (GA) pour la reconnaissance vocale et la personnalisation du modèle de langue, et en version bêta pour la personnalisation du modèle acoustique.

Les cinq autres dialectes sont nouveaux et en version bêta pour toutes les utilisations. Comme ils sont en version bêta, ces dialectes supplémentaires peuvent ne pas être prêts pour une utilisation en production et sont sujets à modification. Ce sont des offres initiales dont la qualité est prévue pour s'améliorer avec le temps et l'utilisation.

Pour plus d'informations, voir les sections suivantes :

24 juin 2019

Mise à jour des modèles en portugais (Brésil) et en anglais américain pour une meilleure reconnaissance vocale

Les modèles à bande étroite suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle à bande étroite en portugais brésilien (pt-BR_NarrowbandModel)
  • Modèle à bande étroite en anglais américain (en-US_NarrowbandModel)

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Nouvelle prise en charge des demandes simultanées de mise à jour de différents modèles acoustiques personnalisés

Ce service vous permet désormais de soumettre simultanément plusieurs demandes pour ajouter différentes ressources audio à un modèle acoustique personnalisé. Auparavant, le service n'autorisait qu'une seule demande à la fois pour l'ajout de contenu audio à un modèle personnalisé.

Nouvelle zone updated pour les méthodes qui répertorient les modèles personnalisés

Les sorties des méthodes HTTP GET qui répertorient des informations sur les modèles de langue personnalisés et les modèles acoustiques personnalisés comprennent désormais une zone updated. La zone indique la date et l'heure de la dernière modification du modèle personnalisé en temps universel coordonné (UTC).

Modification du schéma des avertissements associés à l'entraînement des modèles personnalisés

Le schéma a été modifié pour un avertissement qui a été généré par une demande d'entraînement de modèle personnalisé lorsque le paramètre strict est défini sur false. Les noms des zones sont passés respectivement de warning_id et description à code et message. Pour plus d'informations, voir API & SDK reference.

10 juin 2019

Mesures de traitement non disponibles avec l'interface HTTP synchrone
Les mesures de traitement ne sont disponibles qu'avec les interfaces WebSocket et les interfaces HTTP asynchrones. Elles ne sont pas prises en charge avec l'interface HTTP synchrone. Pour plus d'informations, voir Traitement des métriques.

17 mai 2019

Nouvelles fonctions de mesures de traitement et d'audio pour la reconnaissance vocale

Le service offre désormais deux types de mesures facultatives avec des demandes de reconnaissance vocale :

  • Les mesures de traitement fournissent des informations de minutage détaillées sur l'analyse de l'audio d'entrée par le service. Le service renvoie les métriques à des intervalles spécifiés et avec des événements de transcription, tels que des résultats intermédiaires et finaux. Utilisez ces métriques pour évaluer la progression du service de transcription du contenu audio.
  • Les métriques audio fournissent des informations détaillées sur les caractéristiques de signal de l'entrée audio. Les résultats fournissent des métriques globales pour l'ensemble des données audio en entrée à la fin du traitement de la parole. Utilisez ces métriques pour déterminer les caractéristique et la qualité du contenu audio.

Vous pouvez demander deux types de mesures avec n'importe quelle demande de reconnaissance vocale. Par défaut, le service ne renvoie aucune mesure pour une demande.

Mises à jour du modèle à large bande en japonais pour une meilleure reconnaissance vocale

Le modèle japonais à large bande (ja-JP_BroadbandModel) a été mis à jour pour une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ce modèle, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

10 mai 2019

Mises à jour des modèles en espagnol pour une meilleure reconnaissance vocale

Les modèles de langue espagnols ont été mis à jour pour une meilleure reconnaissance vocale :

  • es-ES_BroadbandModel
  • es-ES_NarrowbandModel

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

19 avril 2019

Nouveau paramètre strict pour l'entraînement des modèles personnalisés désormais disponible
Les méthodes d'entraînement de l'interface de personnalisation contiennent désormais un paramètre de requête strict qui indique si l'entraînement doit se poursuivre si un modèle personnalisé contient à la fois des ressources valides et non valides. Par défaut, l'entraînement échoue si un modèle personnalisé contient une ou plusieurs ressources non valides. Définissez le paramètre sur false pour permettre la poursuite de l'entraînement tant que le modèle contient au moins une ressource valide. Le service exclut les ressources non valides de l'entraînement.
Nouvelles limites sur le nombre maximal de mots hors vocabulaire pour les modèles de langue personnalisés
Vous pouvez désormais ajouter 90 mille mots OOV (Out-of-vocabulary) maximum à la ressource de mots d'un modèle de langue personnalisé. La limite maximale précédente était de 30 mille mots OOV. Ce nombre inclut les mots OOV de toutes les sources (corpus, grammaires et mots personnalisés individuels que vous ajoutez directement). Vous pouvez ajouter un total de 10 millions maximum à un modèle personnalisé à partir de toutes les sources. Pour plus d'informations, voir De quelle quantité de données ai-je besoin ?.

3 avril 2019

Nouvelles limites sur la quantité maximale d'audio des modèles acoustiques personnalisés
Les modèles acoustiques personnalisés acceptent désormais 200 heures d'audio maximum. La limite maximale précédente était de 100 heures d'audio.

21 mars 2019

Visibilité des données d'identification de service maintenant limitées par le rôle

Les utilisateurs ne peuvent désormais voir que les données d'identification du service associées au rôle attribué à leur compte IBM Cloud. Par exemple, si un rôle de lecteur (reader) vous est attribué, vous ne pouvez plus voir les niveaux auteur (writer)ou supérieur de données d'identification de service.

Cette modification n'affecte pas l'accès à l'API des utilisateurs ou des applications avec des données d'identification de service existantes. La modification affecte uniquement l'affichage des données d'identification dans IBM Cloud.

15 mars 2019

Nouvelle prise en charge du format audio A-law
Le service prend désormais en charge le format audio A-law (audio/alaw). Pour plus d'informations, voir format audio/alaw.

11 mars 2019

Modification de la valeur de transmission du paramètre 0 pour max_alternatives
En ce qui concerne le paramètre max_alternatives, le service accepte à nouveau une valeur de 0. Si vous spécifiez 0, le service utilise automatiquement la valeur par défaut de 1. Une modification effectuée à l'occasion de la mise à jour du service publiée le 4 mars provoquait une erreur lorsque la valeur 0 était utilisée. (Le service renvoie une erreur si vous spécifiez une valeur négative.)
Modification de la valeur de transmission du paramètre 0 pour word_alternatives_threshold
Pour le paramètre word_alternatives_threshold, le service accepte à nouveau la valeur 0 . Une modification effectuée à l'occasion de la mise à jour du service publiée le 4 mars provoquait une erreur lorsque la valeur 0 était utilisée. (Le service renvoie une erreur si vous spécifiez une valeur négative.)
Nouvelle limite de précision maximale pour les scores de confiance
Le service renvoie désormais toutes les cotes de confiance avec une précision maximale de deux décimales, ce qui inclut les cotes de confiance pour les fonctions de transcriptions (transcripts), la confiance des mots (word confidence), les autres propositions de mots (word alternatives), les résultats par mot-clé (keyword results) et les étiquettes de locuteurs (speaker labels).

4 mars 2019

Mises à jour des modèles à bande étroite en portugais (Brésil), en français et en espagnol pour une meilleure reconnaissance vocale

Les modèles de langue à bande étroite ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle à bande étroite en portugais brésilien (pt-BR_NarrowbandModel)
  • Modèle en français (France) (fr-FR_NarrowbandModel)
  • Modèle à bande étroite en espagnol (es-ES_NarrowbandModel)

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

28 janvier 2019

Nouvelle prise en charge de IBM Cloud IAM par l'interface WebSocket

L'interface WebSocket prend désormais en charge l'authentification IAM (Identity and Access Management) basée sur un jeton à partir de code JavaScript basé sur un navigateur. La limitation contraire a été supprimée. Afin d'établir une connexion authentifiée avec la méthode de l'interface WebSocket /v1/recognize :

  • Si vous utilisez l'authentification IAM, incluez le paramètre de requête access_token.
  • Si vous utilisez les données d'identification du service Cloud Foundry, incluez le paramètre de requête watson-token.

Pour plus d'informations, voir Ouverture d'une connexion.

20 décembre 2018

Nouvelle fonctionnalité de grammaires bêta pour les modèles de langue personnalisés désormais disponibles

Le service fournit désormais des grammaires pour la reconnaissance vocale. Ces grammaires sont disponibles en fonctionnalité bêta pour toutes les langues qui prennent en charge la personnalisation des modèles de langue. Vous pouvez les ajouter à un modèle de langue personnalisé et les utiliser pour limiter la série d'expressions reconnaissables par le service à partir d'une source audio. Vous pouvez définir une grammaire au format ABNF (Augmented Backus-Naur Form) ou XML.

Les quatre méthodes suivantes sont disponibles pour utiliser des grammaires :

  • POST /v1/customizations/{customization_id}/grammars/{grammar_name} ajoute un fichier de grammaire à un modèle de langue personnalisé.
  • GET /v1/customizations/{customization_id}/grammars répertorie les informations sur toutes les grammaires d'un modèle personnalisé.
  • GET /v1/customizations/{customization_id}/grammars/{grammar_name} renvoie des informations sur une grammaire spécifiée d'un modèle personnalisé.
  • DELETE /v1/customizations/{customization_id}/grammars/{grammar_name} retire une grammaire existante d'un modèle personnalisé.

Vous pouvez utiliser une grammaire pour la reconnaissance vocale avec les interfaces WebSocket et HTTP. Utilisez les paramètres language_customization_id et grammar_name pour identifier le modèle personnalisé et la grammaire que vous désirez utiliser. Actuellement, vous ne pouvez utiliser qu'une seule grammaire avec une demande de reconnaissance vocale.

Pour plus d'informations sur les grammaires, voir la documentation suivante :

Pour plus d'informations sur toutes les méthodes de l'interface, consultez la documentation de référence de l'API et du SDK.

Nouvelle fonction d'occultation numérique désormais disponible pour l'anglais américain, le japonais et le coréen

Une nouvelle fonction d'occultation numérique est maintenant disponible pour masquer les numéros à trois chiffres successifs ou plus. L'occultation est conçue pour supprimer des informations personnelles sensibles, comme les numéros de carte de crédit, dans les transcriptions. Vous activez cette fonction en définissant le paramètre redaction avec la valeur true lors d'une demande de reconnaissance. Cette fonction est une fonctionnalité bêta disponible uniquement pour l'anglais américain, le japonais et le coréen. Pour plus d'informations, voir Occultation numérique.

Nouveaux modèles à bande étroite en français et en allemand désormais disponibles

Les nouveaux modèles de langue allemand et français suivants sont désormais disponibles avec le service :

  • Modèle à bande étroite en français (fr-FR_NarrowbandModel)
  • Modèle à bande étroite en allemand (de-DE_NarrowbandModel)

Ces deux nouveaux modèles prennent en charge la personnalisation des modèles de langue (GA) et la personnalisation des modèles acoustiques (bêta). Pour plus d'informations, voir Support de langue pour la personnalisation.

Nouveau en-US_ShortForm_NarrowbandModel en anglais américain désormais disponible

Un nouveau modèle de langue anglais-américain, en-US_ShortForm_NarrowbandModel, est actuellement disponible. Le nouveau modèle est conçu pour être utilisé avec les solutions de serveur vocal interactif et d'automatisation du service clients. Le modèle prend en charge la personnalisation des modèles de langue (GA) et la personnalisation des modèles acoustiques (bêta). Pour plus d'informations, voir Le modèle anglais américain simplifié.

Mises à jour des modèles à bande étroite en anglais britannique et en espagnol pour une meilleure reconnaissance vocale

Les modèles de langue suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle à bande étroite en anglais britannique (en-GB_NarrowbandModel)
  • Modèle à bande étroite en espagnol (es-ES_NarrowbandModel)

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance vocale. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Nouvelle prise en charge du format audio G.279

Le service prend en charge actuellement l'audio au format G.729 (audio/g729). Il prend en charge uniquement le format G.729 Annex D pour l'audio à bande étroite. Pour plus d'informations, voir Format audio/g729.

Les étiquettes d'orateur sont désormais disponibles pour le modèle à bande étroite en anglais britannique

La fonction des étiquettes d'orateur est désormais disponible pour le modèle à bande étroite en anglais britannique (en-GB_NarrowbandModel). La fonction est une fonctionnalité bêta pour toutes les langues prises en charge. Pour plus d'informations, voir Etiquettes de locuteur.

Nouvelles limites sur la quantité maximale d'audio des modèles acoustiques personnalisés

La durée audio maximale que vous pouvez ajouter à un modèle acoustique personnalisé a augmenté pour passer de 50 à 100 heures.

13 décembre 2018

Nouveau emplacement Londres maintenant disponible
Le service Speech to Text est maintenant disponible sur le site IBM Cloud de Londres (eu-gb). Comme tous les emplacements, Londres a recours à l'authentification IAM à base de jeton. Toutes les nouvelles instances de service que vous créez à cet emplacement utilisent l'authentification IAM.

12 novembre 2018

Nouvelle prise en charge du formatage intelligent pour la reconnaissance vocale en japonais
Le service prend désormais en charge le formatage intelligent pour la reconnaissance vocale en japonais. Auparavant, seuls l'anglais américain et l'espagnol étaient pris en charge pour ce type de formatage. Cette fonction est une fonctionnalité bêta pour toutes les langues prises en charge. Pour plus d'informations, voir Formatage intelligent.

7 novembre 2018

Nouvel emplacement Tokyo maintenant disponible
Le service Speech to Text est maintenant disponible sur le site Tokyo IBM Cloud de Londres (jp-tok). Comme tous les emplacements, Tokyo a recours à l'authentification IAM à base de jeton. Toutes les nouvelles instances de service que vous créez à cet emplacement utilisent l'authentification IAM.

30 octobre 2018

Nouvelle prise en charge de IBM Cloud IAM à base de jetons

Le service Speech to Text a migré vers une authentification IAM basée sur des jetons pour tous les sites. Tous les services IBM Cloud utilisent maintenant l'authentification IAM. Le service Speech to Text a migré aux dates suivantes pour chaque emplacement :

  • Dallas (us-south) : 30 octobre 2018
  • Francfort (eu-de) : 30 octobre 2018
  • Washington, DC (us-east) : 12 juin 2018
  • Sydney (au-syd): 15 mai 2018

La migration vers l'authentification IAM affecte différemment les nouvelles instances de service et celles existantes :

  • Toutes les nouvelles instances de service que vous créez sur n’importe quel site utilisent désormais l’authentification IAM pour accéder au service. Vous pouvez transmettre un jeton bearer ou une clé d'API : les jetons prennent en charge les demandes authentifiées sans incorporer les données d'identification du service dans chaque appel. Les clés d'PI utilisent l'authentification de base HTTP. Lorsque vous utilisez l'un des logiciels SDK de Watson, vous pouvez transmettre la clé d'API et laisser le SDK gérer le cycle de vie des jetons.
  • Les instances de service existantes que vous avez créées sur un site avant la date de migration indiquée continuent à utiliser les {username} et {password} issus de leurs données d'identification précédentes du service Cloud Foundry pour l'authentification jusqu'à ce que vous les migriez pour utiliser l'authentification IAM.

Pour plus d'informations, consultez la documentation suivante :

9 octobre 2018

Mises à jour importantes de la tarification des demandes de reconnaissance vocale

Depuis le 1er octobre 2018, vous êtes maintenant facturé pour tous les enregistrements audio que vous transmettez au service à des fins de reconnaissance vocale. Les mille premières minutes d'audio que vous envoyez chaque mois ne sont plus gratuites. Pour plus d'informations sur les formules tarifaires de ce service, consultez la page consacrée au service « Speech to Text » dans le catalogue « IBM Cloud ».

L'en-tête Content-Type est désormais facultatif pour la plupart des demandes de reconnaissance vocale

L'en-tête Content-Type est désormais facultatif pour la plupart des demandes de reconnaissance vocale. Le service détecte automatiquement le format audio (type MIME) de la plupart des sources audio. Vous devez continuer à indiquer le type de contenu pour les formats suivants :

  • audio/basic
  • audio/l16
  • audio/mulaw

Dans les cas indiqués, le type de contenu que vous spécifiez pour ces formats doit inclure la fréquence d'échantillonnage et peut éventuellement inclure le nombre de canaux et l'ordre d'octets de l'audio. Pour tous les autres formats audio, vous pouvez omettre le type de contenu ou indiquer le type de contenu application/octet-stream pour que le service détecte automatiquement le format.

Lorsque vous utilisez la commande curl pour effectuer une demande de reconnaissance vocale avec l'interface HTTP, vous devez spécifier le format audio avec l'en-tête Content-Type, indiquer "Content-Type: application/octet-stream" ou "Content-Type:". Si vous omettez complètement l'en-tête, la commande curl utilise la valeur par défaut application/x-www-form-urlencoded. La plupart des exemples dans cette documentation continuent à spécifier le format des demandes de reconnaissance vocale même si ce n'est pas obligatoire.

Cette modification s'applique aux méthodes suivantes :

  • /v1/recognize pour les demandes WebSocket. La zone content-type du message texte que vous envoyez pour initier une demande sur une connexion WebSocket ouverte est désormais facultative.
  • POST /v1/recognize pour les demandes HTTP synchrones. L'en-tête Content-Type est désormais facultatif. (Pour les demandes multiparties, la zone part_content_type des métadonnées JSON est désormais également facultative.)
  • POST /v1/recognitions pour les demandes HTTP asynchrones. L'en-tête Content-Type est désormais facultatif.

Pour plus d'informations, voir Formats audio.

Mise à jour du modèle à large bande en portugais (Brésil) pour une meilleure reconnaissance vocale

Le modèle à large bande portugais brésilien, pt-BR_BroadbandModel, a été mis à jour pour une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ce modèle, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Le paramètre customization_id a été renommé language_customization_id

Le paramètre customization_id des méthodes de reconnaissance vocale est obsolète et sera retiré dans une édition ultérieure. Pour spécifier un modèle de langue personnalisé pour une demande de reconnaissance vocale, utilisez à la place le paramètre language_customization_id. Cette modification s'applique aux méthodes suivantes :

  • /v1/recognize pour les demandes WebSocket
  • POST /v1/recognize pour les demandes HTTP synchrones (notamment les demandes multiparties)
  • POST /v1/recognitions pour les demandes HTTP asynchrones

10 septembre 2018

Nouveau modèle à large bande pour l'allemand

Le service prend désormais en charge un modèle à large bande allemand, de-DE_BroadbandModel. Ce nouveau modèle allemand prend en charge la personnalisation des modèles de langue (GA) et la personnalisation des modèles acoustiques (bêta).

Personnalisation de modèle de langue désormais disponible pour le portugais (Brésil)

Les modèles portugais brésiliens, pt-BR_BroadbandModel et pt-BR_NarrowbandModel, prennent désormais en charge la personnalisation des modèles de langue (GA). Les modèles n'ayant pas été mis à jour pour activer cette prise en charge, aucune mise à niveau de modèles acoustiques personnalisés n'est requise.

Mises à jour des modèles en anglais américain et en japonais pour une meilleure reconnaissance vocale

Les nouvelles versions des modèles à large bande et à bande étroite anglais américains et japonais sont disponibles :

  • Modèle anglais américain à large bande (en-US_BroadbandModel)
  • Modèle à bande étroite en anglais américain (en-US_NarrowbandModel)
  • Modèle à large bande en japonais (ja-JP_BroadbandModel)
  • Modèle japonais à bande étroite (ja-JP_NarrowbandModel)

Les nouveaux modèles offrent une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Les fonctions de repérage de mots clés et d'alternatives de mots sont en disponibilité générale

Les fonctions de détection de mots clés et d'autres propositions de mots sont désormais disponibles en version GA et non plus en fonctionnalité bêta pour toutes les langues. Pour plus d'informations, voir :

Correctif d'incident: amélioration de la documentation de l'interface de personnalisation

Correction de bogues : les problèmes connus suivants, liés à l'interface de personnalisation, ont été résolus et sont désormais corrigés dans l'environnement de production. Les informations suivantes sont conservées pour les utilisateurs qui auraient été confronté à ces problèmes par le passé.

  • Si vous ajoutez des données à un modèle de langue personnalisé ou un modèle acoustique personnalisé, vous devez entraîner à nouveau ce modèle avant de l'utiliser pour la reconnaissance vocale. Le problème survient dans le scénario suivant :

    1. L'utilisateur crée un nouveau modèle personnalisé (de langue ou acoustique) et entraîne le modèle.

    2. L'utilisateur ajoute des ressources supplémentaires (mots, corpus ou audio) au modèle personnalisé mais n'entraîne pas le modèle.

    3. L'utilisateur ne peut pas utiliser le modèle personnalisé pour la reconnaissance vocale. Le service renvoie une erreur au format suivant lorsqu'il est utilisé avec une demande de reconnaissance vocale :

      {
        "code_description": "Bad Request",
        "code": 400,
        "error": "Requested custom language model is not available.
                  Please make sure the custom model is trained."
      }
      

    Pour contourner le problème, l'utilisateur doit à nouveau entraîner le modèle personnalisé sur ses données les plus récentes. Il peut alors utiliser le modèle personnalisé avec la reconnaissance vocale.

  • Avant d'entraîner un modèle de langue personnalisé ou un modèle acoustique personnalisé, vous devez le mettre à niveau à la dernière version du modèle de base correspondant. Le problème survient dans le scénario suivant :

    1. L'utilisateur dispose d'un modèle personnalisé existant (langue ou acoustique) basé sur un modèle qui a été mis à jour.
    2. L'utilisateur entraîne le modèle personnalisé existant avec l'ancienne version du modèle de base sans avoir préalablement effectué la migration vers la dernière version du modèle de base.
    3. L'utilisateur ne peut pas utiliser le modèle personnalisé pour la reconnaissance vocale.

    Pour contourner ce problème, l'utilisateur doit utiliser la méthode POST /v1/customizations/{customization_id}/upgrade_model ou POST /v1/acoustic_customizations/{customization_id}/upgrade_model pour mettre à niveau le modèle personnalisé à la dernière version du modèle de base associé. Il peut alors utiliser le modèle personnalisé avec la reconnaissance vocale.

7 septembre 2018

L'interface par session n'est plus disponible

L'interface REST HTTP basée sur une session n'est plus prise en charge. Toutes les informations relatives aux sessions sont retirées de la documentation. Les méthodes suivantes ne sont plus disponibles :

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Si votre application utilise l'interface à base de sessions, vous devez migrer vers l'une des interfaces REST HTTP restantes ou vers l'interface WebSocket. Pour plus d'informations, voir la mise à jour de service du 8 août 2018.

8 août 2018

Avis sur l'obsolescence de l'interface de reconnaissance vocale basée sur les sessions

L'interface REST HTTP basée sur une session est obsolète depuis le 8 août 2018. Toutes les méthodes d'API des sessions sont retirées du service à compter du 7 septembre 2018, après cette date vous n'aurez plus la possibilité d'utiliser l'interface basée sur les sessions. Cette notification de dépréciation immédiate et de retrait sous 30 jours s'appliquent aux méthodes suivantes :

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Si votre application utilise l'interface de session, vous devez effectuer la migration vers l'une des interfaces suivantes au plus tard le 7 septembre :

  • Pour la reconnaissance vocale basée sur les flux (y compris les cas d'utilisation réels), utilisez l'interface WebSocket, qui fournit l'accès aux résultats intermédiaires et aux temps d'attente les plus faibles.
  • Pour la reconnaissance vocale à base de fichiers, utilisez l'une des interfaces suivantes :
    • Pour les fichiers plus courts jusqu'à quelques minutes d'audio, utilisez l'interface HTTP synchrone (POST /v1/recognize) ou l'interface HTTP asynchrone (POST /v1/recognitions).
    • Pour les fichiers plus longs de plus de quelques minutes d'audio, utilisez l'interface HTTP asynchrone. Cette interface accepte jusqu'à 1 Go de données audio avec une seule demande.

Les interfaces WebSocket et HTTP produisent les mêmes résultats que l'interface de session (seule l'interface WebSocket fournit des résultats intermédiaires). Vous pouvez également utiliser l'un des SDK Watson, qui simplifient le développement d'applications avec n'importe laquelle des interfaces. Pour plus d'informations, voir API & SDK reference.

13 juillet 2018

Mises à jour du modèle à bande étroite en espagnol pour une meilleure reconnaissance vocale

Le modèle espagnol à bande étroite, es-ES_NarrowbandModel, a été mis à jour pour une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement le modèle mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur ce modèle, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Depuis cette mise à jour, les deux versions suivantes du modèle espagnol à bande étroite sont disponibles :

  • es_ES.8kHz.general.lm20180522235959.am20180522235959 (en cours)
  • es_ES.8kHz.general.lm20180308235959.am20180308235959 (précédent)

La version suivante du modèle n'est plus disponible :

  • es_ES.8kHz.general.lm20171031235959.am20171031235959

Une demande de reconnaissance qui tente d'utiliser un modèle personnalisé basé sur le modèle de base qui n'est désormais plus disponible, utilise le dernier modèle de base disponible sans aucune personnalisation. Le service renvoie le message d'avertissement suivant : Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported. Pour continuer à utiliser un modèle personnalisé basé sur le modèle non disponible, vous devez d'abord mettre à niveau le modèle à l'aide de la méthode upgrade_model appropriée décrite précédemment.

12 juin 2018

Nouvelles fonctions pour les applications hébergées à l'emplacement Washington, DC

Les fonctionnalités suivantes sont activées pour les applications hébergées à Washington, DC (us-east) :

15 mai 2018

Nouvelles fonctions pour les applications hébergées à l'emplacement Sydney

Les fonctionnalités suivantes sont activées pour les applications hébergées à Sydney, (au-syd) :

26 mars 2018

Personnalisation de modèle de langue désormais disponible pour le modèle à large bande en français

Le service prend désormais en charge la personnalisation du modèle de langue à large bande en français, fr-FR_BroadbandModel. Le modèle français est en disponibilité générale (GA) pour une utilisation dans la production avec la personnalisation du modèle de langue.

Mises à jour des modèles en français, coréen et espagnol pour une meilleure reconnaissance vocale

Les modèles suivants ont été mis à jour pour une meilleure reconnaissance vocale :

  • Modèle à bande étroite en coréen (ko-KR_NarrowbandModel)
  • Modèle à bande étroite en espagnol (es-ES_NarrowbandModel)
  • Modèle à large bande en français (fr-FR_BroadbandModel)

Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur l'un de ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés.

Le paramètre version a été renommé base_model_version

Le paramètre version des méthodes suivantes s'appelle désormais base_model_version :

  • /v1/recognize pour les demandes WebSocket
  • POST /v1/recognize pour les demandes HTTP sans session
  • POST /v1/sessions pour les demandes HTTP avec session
  • POST /v1/recognitions pour les demandes HTTP asynchrones

Le paramètre base_model_version indique la version d'un modèle de base à utiliser pour la reconnaissance vocale. Pour plus d'informations, voir Utilisation de modèles personnalisés mis à niveau pour la reconnaissance vocale et Faire des demandes de reconnaissance vocale avec des modèles personnalisés mis à niveau.

Nouvelle prise en charge du formatage intelligent pour la reconnaissance vocale en espagnol

Le formatage intelligent est désormais pris en charge pour l'espagnol et l'anglais américain. Pour l'anglais américain, cette fonction convertit désormais les chaînes de mots clés en signes de ponctuation pour les points, les virgules, les points d'interrogation et les points d'exclamation. Pour plus d'informations, voir Formatage intelligent.

1er mars 2018

Mises à jour des modèles à bande étroite en français et en espagnol pour une meilleure reconnaissance vocale

Les modèles à large bande en français et en espagnol, fr-FR_BroadbandModel et es-ES_BroadbandModel, ont été mis à jour pour améliorer la reconnaissance vocale. Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur l'un de ces modèles, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations, voir Mise à niveau des modèles personnalisés. La section présente les règles de mise à niveau des modèles personnalisés, les effets de la mise à niveau ainsi que les approches possibles pour utiliser les modèles mis à niveau.

1er février 2018

Nouveaux modèles coréens

Le service propose désormais des modèles de langue pour le coréen : ko-KR_BroadbandModel pour l'audio qui est échantillonné à un taux minimum de 16 kHz, et ko-KR_NarrowbandModel pour l'audio qui est échantillonné à un taux minimum de 8 kHz. Pour plus d'informations, voir Langues et modèles de génération antérieure.

En ce qui concerne la personnalisation des modèles de langue, les modèles coréens sont en disponibilité générale (GA) pour la production ; en ce qui concerne la personnalisation des modèles acoustiques, ce sont des fonctionnalités bêta. Pour plus d'informations, voir Support de langue pour la personnalisation.

  • Pour plus d'informations sur le mode d'analyse des corpus pour le coréen, voir Analyse du coréen.
  • Pour plus d'informations sur la création de prononciations possibles pour les mots personnalisés en coréen, voir Instructions pour le coréen.

14 décembre 2017

Personnalisation de modèle de langue en disponibilité générale

La personnalisation de modèle de langue et tous les paramètres associés sont à présent disponibles en version GA pour toutes les langues prises en charge : japonais, espagnol, anglais britannique et anglais américain.

Personnalisation du modèle acoustique bêta désormais disponible pour toutes les langues

Le service prend désormais en charge la personnalisation de modèle acoustique en tant que fonctionnalité bêta pour toutes les langues disponibles. Vous pouvez créer des modèles acoustiques personnalisés pour des modèles à bande étroite ou à large bande pour toutes les langues. Pour une introduction à la personnalisation, y compris la personnalisation du modèle acoustique, voir Comprendre la personnalisation.

Nouveau paramètre version pour la reconnaissance vocale

Les différentes méthodes de demande de reconnaissance incluent désormais un nouveau paramètre version que vous pouvez utiliser pour lancer des demandes qui utilisent les versions anciennes ou mises à niveau des modèles de base et personnalisés. Bien qu'il soit principalement destiné à être utilisé avec des modèles personnalisés mis à niveau, le paramètre version peut également être utilisé sans modèles personnalisés. Pour plus d'informations, voir Faire des demandes de reconnaissance vocale avec des modèles personnalisés mis à niveau.

Mises à jour des modèles en anglais américain pour une meilleure reconnaissance vocale

Les modèles anglais américains, en-US_BroadbandModel et en-US_NarrowbandModel, ont été mis à jour pour une meilleure reconnaissance vocale. Par défaut, le service utilise automatiquement les modèles mis à jour pour toutes les demandes de reconnaissance. Si vous disposez de modèles de langue personnalisés ou de modèles acoustiques personnalisés basés sur les modèles anglais américains, vous devez mettre à niveau vos modèles personnalisés pour tirer parti de ces mises à jour à l'aide des méthodes suivantes :

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Pour plus d'informations sur cette procédure, voir Mise à niveau des modèles personnalisés. La section présente les règles de mise à niveau des modèles personnalisés, les effets de la mise à niveau ainsi que les approches possibles pour utiliser les modèles mis à niveau. Actuellement, les méthodes s'appliquent uniquement aux nouveaux modèles de base anglais américains. Mais les mêmes informations s'appliqueront aux mises à niveau d'autres modèles de base dès qu'elles seront disponibles.

Personnalisation du modèle de langue désormais disponible pour l'anglais britannique

Le service prend désormais en charge la personnalisation de modèle de langue pour les modèles anglais britanniques, en-GB_BroadbandModel et en-GB_NarrowbandModel. Bien que le service traite les corpus et les mots personnalisés en anglais américain et en anglais britannique de manière généralement similaire, il existe des différences importantes :

2 octobre 2017

Nouvelle interface de personnalisation du modèle acoustique bêta pour l'anglais américain, le japonais et l'espagnol

L'interface de personnalisation offre désormais la personnalisation de modèle acoustique. Vous pouvez créer des modèles acoustiques personnalisés qui adaptent les modèles de base du service à votre environnement et à vos locuteurs. Vous alimentez et entraînez un modèle acoustique personnalisé à l'audio qui correspond le plus à la signature acoustique de l'audio que vous voulez transcrire. Vous utilisez ensuite ce modèle acoustique personnalisé avec des demandes de reconnaissance pour augmenter la précision de la reconnaissance vocale.

Les modèles acoustiques personnalisés sont complémentaires des modèles de langue personnalisés. Vous pouvez entraîner un modèle acoustique personnalisé avec un modèle de langue personnalisé, et vous pouvez utiliser ces deux types de modèle lors de la reconnaissance vocale. La personnalisation de modèle acoustique est une interface bêta disponible uniquement pour l'anglais américain, le japonais et l'espagnol.

Nouveau paramètre bêta customization_weight pour les modèles de langue personnalisés

Pour la personnalisation de modèle de langue, le service comprend désormais une fonction bêta qui définit un poids de personnalisation facultatif pour un modèle de langue personnalisé. Un poids de personnalisation indique le poids relatif à attribuer aux mots d'un modèle de langue personnalisé par rapport aux mots du vocabulaire de base du service. Vous pouvez définir un poids de personnalisation lors de l'entraînement et de la reconnaissance vocale. Pour plus d'informations, voir Utilisation d'un poids de personnalisation.

Mises à jour du modèle à large bande en japonais pour une meilleure reconnaissance vocale

Le modèle de langue ja-JP_BroadbandModel a été mis à jour pour capturer les améliorations apportées au modèle de base. La mise à niveau n'affecte pas les modèles personnalisés existants basés sur le modèle.

Nouveau paramètre endianness pour le format audio audio/l16

Le service comprend désormais un paramètre pour indiquer l'ordre d'octets (endianness) de l'audio soumis au format audio/l16 (PCM (Pulse-Code Modulation) linéaire 16 bits). En plus des paramètres rate et channels avec ce format, vous pouvez également indiquer big-endian ou little-endian avec le paramètre endianness. Pour plus d'informations, voir Format audio/l16.

14 juillet 2017

Nouvelle prise en charge du format audio MP3 (MPEG)

Le service prend désormais en charge la transcription audio au format MP3 ou MPEG (Motion Picture Experts Group). Pour plus d'informations, voir Formats audio/mp3 et audio/mpeg.

Personnalisation de modèle de langue bêta désormais disponible pour l'espagnol

L'interface de personnalisation de modèle de langue prend désormais en charge l'espagnol en tant que fonctionnalité bêta. Vous pouvez créer un modèle personnalisé basé sur l'un des modèles de langue espagnols : es-ES_BroadbandModel ou es-ES_NarrowbandModel. Pour plus d'informations, voir Création d'un modèle de langue personnalisé. La tarification des demandes de reconnaissance utilisant des modèles de langue personnalisés espagnols est identique à celle des demandes utilisant les modèles anglais américain et japonais.

Nouvelle zone dialect pour la méthode qui crée un modèle de langue personnalisé

L'objet JSON CreateLanguageModel que vous transmettez à la méthode POST /v1/customizations pour créer un modèle de langue personnalisé comprend désormais une zone dialect. Cette zone indique le dialecte de la langue à utiliser avec le modèle personnalisé. Par défaut, le dialecte correspond à la langue du modèle de base. Le paramètre est parlant uniquement pour les modèles espagnols pour lesquels le service peut créer un modèle personnalisé qui convient au discours dans l'un des dialectes suivants :

  • es-ES pour l'espagnol castillan (valeur par défaut)
  • es-LA pour l'espagnol latino-américain
  • es-US pour l'espagnol d'Amérique du Nord (mexicain)

Les méthodes GET /v1/customizations et GET /v1/customizations/{customization_id} de l'interface de personnalisation comprennent le dialecte d'un modèle personnalisé dans leur sortie. Pour plus d'informations, voir Création d'un modèle de langue personnalisé et Affichage de la liste des modèles de langue personnalisés.

Nouveaux noms pour les modèles en anglais britannique

Les noms des modèles de langue en-UK_BroadbandModel et en-UK_NarrowbandModel sont désormais obsolètes. Ces modèles sont désormais disponibles sous les noms en-GB_BroadbandModel et en-GB_NarrowbandModel.

Les noms en-UK_{model} obsolètes fonctionnent toujours, mais la méthode GET /v1/models ne renvoie plus ces noms dans la liste des modèles disponibles. Vous pouvez toujours interroger les noms directement avec la méthode GET /v1/models/{model_id}.

1er juillet 2017

La personnalisation des modèles de langue est désormais en disponibilité générale pour l'anglais américain et le japonais

L'interface de personnalisation du modèle de langue du service est désormais en disponibilité générale (GA) pour les deux langues prises en charge, l'anglais américain et le japonais. IBM ne facture pas la création, l'hébergement ou la gestion des modèles de langue personnalisés. Comme indiqué dans la section suivante, IBM facture désormais un supplément de 0,03 $ par minute audio pour les demandes de reconnaissance utilisant des modèles personnalisés.

Mise à jour des plans de tarification du service

IBM a mis à jour la tarification du service ainsi :

  • Elimination d'un coût supplémentaire pour l'utilisation des modèles à bande étroite
  • Application d'une tarification différenciée progressive pour les clients importants en termes de volume
  • Facturation d'un supplément de 0,03 $ par minute audio pour les demandes de reconnaissance qui utilisent des modèles de langue personnalisés anglais américain et japonais.

Pour plus d'informations sur les mises à jour de tarification, voir

Les corps vides ne sont plus requis pour les requêtes HTTP POST

Vous n'avez plus besoin de transmettre un objet de données vide en tant que corps pour les demandes POST suivantes :

  • POST /v1/sessions
  • POST /v1/register_callback
  • POST /v1/customizations/{customization_id}/train
  • POST /v1/customizations/{customization_id}/reset
  • POST /v1/customizations/{customization_id}/upgrade_model

Par exemple, vous pouvez désormais appeler la méthode POST /v1/sessions avec curl comme suit :

curl -X POST -u "{username}:{password}" \
--cookie-jar cookies.txt \
"{url}/v1/sessions"

Vous n'avez plus besoin de transmettre l'option curl suivante avec la demande : --data "{}". Si vous rencontrez des problèmes avec l'une de ces demandes POST, essayez de transmettre un objet de données vide avec le corps de la demande. Cette opération ne change en aucune manière la nature ou la signification de la demande.

22 mai 2017

Le paramètre continuous a été supprimé de toutes les méthodes

Le paramètre continuous est retiré de toutes les méthodes qui initient des demandes de reconnaissance. Le service transcrit désormais un flux audio complet jusqu'à la fin ou expire, selon ce qui intervient en premier lieu. Ce comportement équivaut à définir l'ancien paramètre continuous avec la valeur true. Par défaut, le service interrompait la transcription dès la première demi-seconde sans parole (silence) si le paramètre était omis ou défini avec la valeur false.

Les applications existantes qui définissaient ce paramètre avec la valeur true ne verront aucun changement de comportement. Les applications qui définissaient ce paramètre avec la valeur false ou qui s'appuyaient sur le comportement par défaut verront sans doute un changement. Si ce paramètre est spécifié dans la demande, le service répond désormais en renvoyant un message d'avertissement pour le paramètre inconnu :

"warnings": [
  "Unknown arguments: continuous."
]

La demande aboutit malgré cet avertissement et il n'y a aucune incidence sur une session existante ou une connexion WebSocket.

IBM a supprimé ce paramètre pour répondre au nombre impressionnant de commentaires de la communauté de développeurs selon lesquels indiquer continuous=false n'ajoutait pas grand chose et pouvait réduire l'exactitude de la transcription globale.

Envoi d'audio requis pour éviter le délai d'attente de session

Il n'est plus possible d'empêcher un délai d'attente de session sans envoyer de données audio :

  • Lorsque vous utilisez l'interface WebSocket, le client ne peut plus conserver une connexion active en envoyant un message texte en JSON avec le paramètre action défini avec no-op. L'envoi d'un message no-op ne génère pas d'erreur, mais est sans effet.
  • Lorsque vous utilisez des sessions avec l'interface HTTP, le client ne peut plus étendre la session en envoyant une demande GET /v1/sessions/{session_id}/recognize. La méthode renvoie toujours le statut d'une session active mais ne permet pas de conserver la session active.

Vous pouvez désormais effectuer les opérations suivantes pour conserver une session active :

  • Définir le paramètre inactivity_timeout avec la valeur -1 pour éviter l'expiration du délai au bout de 30 secondes d'inactivité.
  • Envoyer des données audio, constituées uniquement de silence, au service pour éviter une expiration du délai d'attente de session au bout de 30 secondes d'inactivité. Vous êtes facturé pour toutes les données que vous envoyez au service, notamment le silence que vous envoyez pour étendre une session.

Pour plus d'informations, voir Délais d'attente. Dans l'idéal, vous établirez une session juste avant d'obtenir l'audio pour la transcription et conserverez la session par l'envoi audio à un débit proche du temps réel. Veillez également à ce que votre application soit rétablie normalement après une fermeture de session ou de connexion.

IBM a retiré cette fonctionnalité pour garantir une offre de service de reconnaissance vocale de première qualité et à faible temps d'attente à tous les utilisateurs.

10 avril 2017

Les étiquettes d'orateur sont désormais prises en charge pour l'anglais américain, l'espagnol et le japonais

Le service prend désormais en charge la fonction d'étiquettes de locuteur (speaker labels) pour les modèles à large bande suivants :

  • Modèle anglais américain à large bande (en-US-BroadbandModel)
  • Modèle à large bande en espagnol (es-ES-BroadbandModel)
  • Modèle à large bande en japonais (ja-JP_BroadbandModel)

Pour plus d'informations, voir Etiquettes de locuteur.

Nouvelle prise en charge du format audio Web Media (WebM)

Le service prend désormais en charge le format audio Web Media (WebM) avec le codec Opus ou Vorbis. Le service prend désormais également en charge le format audio Ogg avec le codec Vorbis en plus du codec Opus. Pour plus d'informations sur les formats audio pris en charge, voir Format audio/webm.

Nouveau support pour Cross-Origin Resource Sharing

Le service prend désormais en charge le partage de ressources d'origine croisée (CORS) pour permettre aux clients basés sur le navigateur d'appeler directement le service. Pour plus d'informations, voir Prise en charge de CORS.

Nouvelle méthode pour annuler l'enregistrement d'une URL de rappel avec une interface HTTP asynchrone

L'interface HTTP asynchrone offre désormais une méthode POST /v1/unregister_callback qui retire l'enregistrement d'une URL de rappel sur liste autorisée. Pour plus d'informations, voir Désenregistrement d'une URL de rappel.

Correction d'un bug : suppression des délais d'expiration pour les fichiers audio volumineux avec l'interface « WebSocket »

Correctif : L'interface WebSocket ne dépasse plus le délai d'attente des demandes de reconnaissance des fichiers audio particulièrement longs. Vous n'avez plus besoin de demander des résultats intermédiaires avec le message JSON start pour empêcher l'expiration du délai d'attente. (Ce problème a été décrit dans la Mise à jour du 10 mars 2016.)

Nouveaux codes d'erreur HTTP

Les méthodes de personnalisation de modèle de langue suivantes peuvent désormais renvoyer les codes d'erreur HTTP suivants :

  • La méthode DELETE /v1/customizations/{customization_id} renvoie à présent le code de réponse HTTP 401 si vous essayez de supprimer un modèle personnalisé inexistant.
  • La méthode DELETE /v1/customizations/{customization_id}/corpora/{corpus_name} renvoie à présent le code de réponse HTTP 400 si vous essayez de supprimer un corpus inexistant.

8 mars 2017

L'interface HTTP asynchrone est désormais en disponibilité générale
L'interface HTTP asynchrone est désormais en disponibilité générale (GA). Avant cette date, il s'agissait d'une fonctionnalité bêta.

1er décembre 2016

Nouvelle fonction d'étiquettes d'orateur en version bêta

Le service offre désormais une fonction d'étiquettes de locuteur (speaker labels) bêta pour l'audio à bande étroite en anglais américain, en espagnol ou en japonais. Cette fonction identifie quels sont les mots qui ont été prononcés et par qui dans un échange entre plusieurs personnes. Les méthodes de reconnaissance sans session, avec session, asynchrones et WebSocket comprennent chacune un paramètre speaker_labels qui accepte une valeur booléenne pour indiquer s'il faut inclure les étiquettes des locuteurs (speaker labels) dans la réponse. Pour plus d'informations sur cette fonction, voir Etiquettes de locuteur.

Personnalisation de modèle de langue bêta désormais disponible pour le japonais

L'interface de personnalisation de modèle de langue bêta est désormais prise en charge pour le japonais en plus de l'anglais américain. Toutes les méthodes de l'interface prennent en charge le japonais. Pour plus d'informations, voir les sections suivantes :

Nouvelle méthode de listage des informations sur un corpus

L'interface de personnalisation de modèle de langue comprend désormais une méthode GET /v1/customizations/{customization_id}/corpora/{corpus_name} qui recense les informations sur un corpus spécifié. Cette méthode est pratique pour la gestion du statut d'une demande d'ajout d'un corpus à un modèle personnalisé. Pour plus d'informations, voir Affichage de la liste des corpus d'un modèle de langue personnalisé.

Nouvelle zone count pour les méthodes qui répertorient les mots pour les modèles de langue personnalisés

La réponse JSON renvoyée par les méthodes GET /v1/customizations/{customization_id}/words et GET /v1/customizations/{customization_id}/words/{word_name} inclut désormais un champ count pour chaque mot. Cette zone indique le nombre de fois que le mot est détecté sur l'ensemble des corpus. Si vous ajoutez un mot personnalisé à un modèle avant que celui-ci soit ajouté par un corpus, le comptage commence à 1. Si le mot est d'abord ajouté à partir d'un corpus, puis modifié par la suite, le comptage reflète seulement le nombre de fois qu'il se trouve dans les corpus. Pour plus d'informations, voir Liste de mots personnalisés à partir d'un modèle de langue personnalisé.

Pour les modèles personnalisés qui ont été créés avant l'existence de la zone count, la zone reste toujours à 0. Pour mettre à jour la zone de ces modèles, ajoutez à nouveau les corpus du modèle et ajoutez le paramètre allow_overwrite à la méthode POST /v1/customizations/{customization_id}/corpora/{corpus_name}.

Nouveau paramètre sort pour les méthodes qui répertorient les mots pour les modèles de langue personnalisés

La méthode GET /v1/customizations/{customization_id}/words comprend désormais le paramètre de requête sort qui contrôle l'ordre d'apparition des mots dans la liste. Le paramètre accepte deux arguments, alphabetical ou count, pour indiquer comment les mots doivent être triés. Vous pouvez ajouter en option au début, le signe + ou - dans un argument pour indiquer si les résultats doivent être triés par ordre croissant ou décroissant. Par défaut, la méthode affiche les mots par ordre alphabétique croissant. Pour plus d'informations, voir Liste de mots personnalisés à partir d'un modèle de langue personnalisé.

Pour les modèles personnalisés créés avant l'introduction de la zone count, l'utilisation de l'argument count avec le paramètre sort est sans fondement. Utilisez l'argument par défaut alphabetical avec les modèles de ce type.

Nouveau format de zone error pour les méthodes qui répertorient les mots pour les modèles de langue personnalisés

La zone error qui peut être renvoyée dans la réponse JSON des méthodes GET /v1/customizations/{customization_id}/words et GET /v1/customizations/{customization_id}/words/{word_name} est désormais un tableau. Si le service découvre un ou plusieurs problèmes avec la définition d'un mot personnalisé, la zone répertorie chaque élément du problème dans la définition et fournit un message avec la description du problème. Pour plus d'informations, voir Liste de mots personnalisés à partir d'un modèle de langue personnalisé.

Les paramètres keywords_threshold et word_alternatives_threshold n'acceptent plus une valeur nulle

Les paramètres keywords_threshold et word_alternatives_threshold des méthodes de reconnaissance n'acceptent plus de valeur NULL. Pour ignorer des mots clés ou d'autres propositions de mots dans la réponse, omettez ces paramètres. Une valeur spécifiée doit être une variable flottante.

22 septembre 2016

Nouvelle interface bêta de personnalisation des modèles de langue
Le service offre à présent une nouvelle interface de personnalisation de modèle de langue bêta pour l'anglais américain. Vous pouvez utiliser cette interface pour personnaliser le vocabulaire de base et les modèles de langue du service via la création de modèles de langue personnalisés qui intègrent la terminologie spécifique à un domaine. Vous pouvez ajouter des mots personnalisés individuellement ou les faire extraire des corpus par le service. Pour utiliser vos modèles personnalisés avec les méthodes de reconnaissance vocale proposées par l'une des interfaces du service, transmettez le paramètre de requête customization_id. Pour plus d'informations, voir :
Nouvelle prise en charge du format audio audio/mulaw
La liste des formats audio pris en charge comprend désormais le format audio/mulaw, qui fournit un seul canal audio codé avec l'algorithme de données u-law (ou mu-law). Lorsque vous utilisez ce format, vous devez également indiquer la fréquence d'échantillonnage de capture audio. Pour plus d'informations, voir Format audio/mulaw.
Nouveau supported_features identifié lors de l'affichage des modèles
Les méthodes GET /v1/models et GET /v1/models/{model_id} renvoient désormais une zone supported_features dans leur sortie pour chaque modèle de langue. Des informations complémentaires indiquent si la personnalisation est prise en charge par le modèle. Pour plus d'informations, voir API & SDK reference.

30 juin 2016

L'interface HTTP asynchrone bêta prend désormais en charge toutes les langues disponibles
L'interface HTTP asynchrone bêta est désormais compatible avec toutes les langues prises en charge par le service. L'interface était disponible uniquement en anglais américain auparavant. Pour plus d'informations, voir l'interface asynchrone HTTP et la référence API & SDK.

23 juin 2016

Nouvelle interface HTTP asynchrone bêta désormais disponible
Une interface HTTP asynchrone bêta est à présent disponible. Cette interface fournit les fonctions de reconnaissance complètes pour la transcription de l'anglais américain via des appels HTTP non bloquants. Vous pouvez enregistrer des URL de rappel et fournir des chaînes secrètes pour assurer l'authentification et l'intégrité des données avec des signatures numériques. Pour plus d'informations, voir l'interface asynchrone HTTP et la référence API & SDK.
Nouveau paramètre bêta smart_formatting pour la reconnaissance vocale
Une fonction de formatage intelligent bêta convertit désormais les dates, les heures, une série de chiffres et de nombres, des numéros de téléphone, des valeurs de devise et des adresses Internet en représentations plus conventionnelles dans les transcriptions finales. Vous activez cette fonction en définissant le paramètre smart_formatting avec la valeur true lors d'une demande de reconnaissance. Il s'agit d'une fonctionnalité bêta disponible uniquement pour l'anglais américain. Pour plus d'informations, voir Formatage intelligent.
Nouveau modèle à large bande en français
La liste des modèles pris en charge pour la reconnaissance vocale comprend à présent le modèle audio fr-FR_BroadbandModel en langue française échantillonné à 16 kHz minimum. Pour plus d'informations, voir Langues et modèles de génération antérieure.
Nouvelle prise en charge du format audio audio/basic
La liste des formats audio pris en charge inclut maintenant audio/basic. Ce format fournit un canal audio unique codé à l'aide de données au format u-law (ou mu-law) sur 8 bits échantillonnées à 8 kHz. Pour plus d'informations, voir Format audio/de base.
Les méthodes de reconnaissance vocale renvoient désormais des avertissements pour les paramètres non valides
Les différentes méthodes de reconnaissance peuvent renvoyer une réponse warnings contenant des messages sur les paramètres de requête ou les zones JSON non valides inclus dans une demande. Le format des avertissements a changé. Par exemple, "warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." est devenu "warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
Corps vide requis pour les méthodes HTTP POST qui ne transmettent aucune donnée
Pour les demandes HTTP POST qui ne transmettent généralement pas de données au service, vous devez inclure un corps de demande vide sous la forme {}. Avec la commande curl, utilisez l'option --data pour transmettre les données vides.

10 mars 2016

Nouvelles limites maximales sur les enregistrements audio pour la reconnaissance vocale
Les deux formes de transmission de données (diffusion ponctuelle et diffusion en continu) imposent désormais une taille limite de 100 Mo pour les données audio, à l'instar de l'interface WebSocket. Auparavant, la taille limite des données pour une diffusion ponctuelle était fixée 4 Mo. Pour plus d'informations, voir Transmission audio (pour toutes les interfaces) et Envoi audio et réception des résultats de la reconnaissance (pour l'interface WebSocket). La section WebSocket évoque également la taille maximale de trame ou de message de 4 Mo imposée par l'interface WebSocket.
Les interfaces HTTP et WebSocket peuvent désormais renvoyer des avertissements
La réponse JSON d'une demande de reconnaissance peut désormais inclure un tableau de messages d'avertissement pour des paramètres de requête ou des zones JSON non valides inclus dans une demande. Chaque élément du tableau est une chaîne qui décrit la nature de l'avertissement, suivie d'un tableau de chaînes d'arguments non valides. Par exemple, "warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]. Pour plus d'informations, voir API & SDK reference.
La version bêta Apple iOS SDK est obsolète
La version bêta du logiciel SDK Watson Speech du système d'exploitation Apple® iOS est obsolète. Utilisez plutôt le logiciel SDK Watson du système d'exploitation Apple® iOS. Le nouveau SDK est disponible dans le dépôt « ios-sdk » de l'espace de noms « watson-developer-cloud » sur GitHub.
L'interface WebSocket peut produire des résultats retardés
L'interface WebSocket peut prendre quelques minutes pour obtenir les résultats finaux d'une demande de reconnaissance pour un fichier audio particulièrement long. Pour l'interface WebSocket, la connexion TCP sous-jacente reste en veille pendant que le service prépare la réponse. Par conséquent, la connexion peut s'interrompre en raison d'un dépassement du délai d'attente. Pour éviter cela avec l'interface WebSocket, demandez des résultats intermédiaires (\"interim_results\": \"true\") dans le fichier JSON pour le message start pour initier la demande. Vous pouvez supprimer ces résultats intermédiaires si vous n'en avez pas besoin. Ce problème sera résolu dans une prochaine mise à jour.

19 janvier 2016

Nouvelle fonction de filtrage des grossièretés
Le service a été mis à jour pour inclure une nouvelle fonction de filtrage des grossièretés le 19 janvier 2016. Par défaut, le service censure les grossièretés et ne les retranscrit pas dans les résultats pour l'audio anglais américain. Pour plus d'informations, voir Filtrage des grossièretés.

17 décembre 2015

Nouvelle fonction d'identification des mots clés
Le service offre à présent une fonction de détection de mots clés. Vous pouvez spécifier un tableau de chaînes de mots clés à faire correspondre dans l'entrée audio. Vous devez également indiquer le niveau de confiance défini par l'utilisateur qu'un mot doit avoir pour être considéré comme correspondance d'un mot clé. Pour plus d'informations, voir Détection de mots clés. La fonction de détection de mots clés est une fonctionnalité bêta.
Nouvelle fonction de remplacement de mots
Le service offre désormais une fonction permettant d'obtenir d'autres propositions de mots (word alternatives). Cette fonction renvoie des hypothèses de mots possibles dans l'entrée audio en accord avec un niveau de confiance défini par l'utilisateur. Pour plus d'informations, voir Autres propositions de mots. La fonction d'autres proposition de mots (word alternatives) est une fonctionnalité bêta.
Nouveaux modèles en anglais britannique et en arabe
Le service prend en charge plus de langues avec ses modèles de transcription : en-UK_BroadbandModel et en-UK_NarrowbandModel pour l'anglais britannique et ar-AR_BroadbandModel pour l'arabe standard moderne. Pour plus d'informations, voir Langues et modèles de génération antérieure.
Nouvelle zone session_closed pour les méthodes basées sur une session
Dans les réponses JSON qu'il renvoie en cas d'erreurs avec des méthodes avec session, le service comprend désormais une nouvelle zone session_closed. Cette zone est définie avec la valeur true si la session est fermée suite à une erreur. Pour plus d'informations sur les codes de retour possibles pour chaque méthode, consultez la documentation de référence de l'API et du SDK.
Le délai d'attente de la plateforme HTTP n'est plus applicable
Les demandes de reconnaissance HTTP ne sont plus tributaires d'un dépassement de délai de plateforme fixé à 10 minutes. Le service maintient désormais la connexion active en envoyant un espace dans l'objet JSON de la réponse toutes les 20 secondes, tant que la reconnaissance est en cours. Pour plus d'informations, voir Délais d'attente.
La limitation du débit avec la commande curl n'est plus nécessaire
Lorsque vous utilisez la commande curl pour transcrire de l'audio avec le service, vous n'avez plus besoin d'utiliser l'option --limit-rate pour transférer des données à un débit inférieur à 40 000 octets par seconde.
Modifications des codes d'erreur HTTP
Le service ne renvoie plus le code de statut HTTP 490 pour les méthodes HTTP avec session GET /v1/sessions/{session_id}/observe_result et POST /v1/sessions/{session_id}/recognize. Le service répond désormais avec le code de statut HTTP 400 à la place.

21 septembre 2015

Nouveaux kits SDK mobiles disponibles

Les nouveaux logiciels SDK pour applications mobiles bêta sont disponibles pour les services vocaux. Ces logiciels SDK permettent aux applications mobiles d'interagir avec les services Speech to Text et Text to Speech.

  • Le SDK Watson Speech de la plateforme Google Android™ prend en charge le flux audio vers le service Speech to Text en temps réel et reçoit une transcription de l'audio au fur et à mesure que vous parlez. Le projet comprend un modèle d'application qui présente l'interaction avec les deux services de reconnaissance vocale. Le SDK est disponible dans le référentiel « speech-android-sdk » de l'espace de noms « watson-developer-cloud » sur GitHub.
  • Le SDK Watson Speech du système d'exploitation Apple® iOS prend en charge le flux audio vers le service Speech to Text et reçoit une transcription de l'audio en réponse. Le SDK est disponible dans le dépôt « speech-ios-sdk » de l'espace de noms « watson-developer-cloud » sur GitHub.

Les deux SDK prennent en charge l'authentification avec les services de conversation en utilisant vos données d'identification du service IBM Cloud ou un jeton d'authentification. Comme ces SDK sont en version bêta, ils sont susceptibles de changer par la suite.

Nouveaux modèles en chinois (mandarin) et portugais (Brésil)

Le service prend en charge deux nouvelles langues, le portugais (Brésil) et le chinois (mandarin), avec les modèles suivants :

  • Modèle portugais brésilien à large bande (pt-BR_BroadbandModel)
  • Modèle à bande étroite en portugais brésilien (pt-BR_NarrowbandModel)
  • Modèle à large bande en chinois (mandarin) (zh-CN_BroadbandModel)
  • Modèle à bande étroite en chinois (mandarin) (zh-CN_NarrowbandModel)

Pour plus d'informations, voir Langues et modèles de génération antérieure.

Nouvelle prise en charge du format audio audio/ogg;codecs=opus

Les demandes HTTP POST /v1/sessions/{session_id}/recognize et /v1/recognize, ainsi que la demande WebSocket /v1/recognize, prennent en charge la transcription d'un nouveau type de support : audio/ogg;codecs=opus pour les fichiers au format Ogg utilisant le codec Opus. Par ailleurs, le format audio/wav format pour ces méthodes est désormais compatible avec tout type de codage. La restriction relative à l'utilisation du codage PCM linéaire n'existe plus. Pour plus d'informations, voir Format audio/ogg.

Nouveau paramètre sequence_id pour l'interrogation longue des sessions

Le service prend désormais en charge les dépassements de délai d'attente lorsque vous transcrivez des fichiers audio longs avec l'interface HTTP. Lorsque vous utilisez des sessions, vous pouvez employer un masque d'interrogation long en spécifiant des ID de séquence avec les méthodes GET /v1/sessions/{session_id}/observe_result et POST /v1/sessions/{session_id}/recognize pour les tâches de reconnaissance à exécution longue. En utilisant le nouveau paramètre sequence_id de ces méthodes, vous pouvez demander des résultats, avant, pendant ou après la soumission d'une demande de reconnaissance.

Nouvelle fonction de mise en majuscule pour la transcription en anglais américain

Pour les modèles anglais américains, en_US_BroadbandModel et en_US_NarrowbandModel, le service met correctement en majuscules de nombreux noms propres. Par exemple, le service renverrait un nouveau texte se lisant « Barack Obama est diplômé de l'université Columbia » au lieu de « barack obama est diplômé de l'université columbia ». Cette modification vous sera utile si votre application est sensible à la casse des noms propres.

Nouveau code d'erreur HTTP

La requête HTTP DELETE /v1/sessions/{session_id} ne renvoie pas le code d'état 415 « Type de média non pris en charge ». Ce code de retour est supprimé de la documentation relative à cette méthode.

1er juillet 2015

Le service Speech to Text est désormais en disponibilité générale

Le service est passé de la version bêta à la disponibilité générale le 1er juillet 2015. Il existe les différences suivantes entre les versions bêta et GA des API Speech to Text. La version GA nécessite que les utilisateurs effectuent une mise à niveau pour passer à la nouvelle version du service.

La version GA de l'API HTTP est compatible avec la version bêta. Vous devez modifier votre code d'application uniquement si vous avez spécifié explicitement un nom de modèle. Par exemple, le code exemple disponible pour le service dans GitHub comprend la ligne de code suivante dans le fichier demo.js :

model: 'WatsonModel'

Cette ligne spécifiait le modèle par défaut WatsonModel pour la version bêta du service. Si votre application spécifie également ce modèle, vous devez le remplacer pour utiliser l'un des nouveaux modèles pris en charge par la version GA. Pour plus d'informations, voir la section suivante.

Nouveau modèle de programmation à base de jetons

Le service prend désormais en charge un nouveau modèle de programmation pour l'interaction directe entre un client et le service au moyen d'une connexion WebSocket. En utilisant ce modèle, un client peut obtenir un jeton d'authentification pour communiquer directement avec le service. Le jeton évite la nécessité d'avoir recours à une application proxy côté serveur dans IBM Cloud pour appeler le service pour le compte du client. Les jetons sont le moyen privilégié par les clients pour interagir avec le service.

Le service prend toujours en charge l'ancien modèle de programmation qui s'appuyait sur un proxy côté serveur pour transmettre l'audio et les messages entre le client et le service. Mais le nouveau modèle est plus efficace et fournit un débit plus élevé.

Nouveau paramètre model pour la reconnaissance vocale

Les méthodes POST /v1/sessions et POST /v1/recognize, ainsi que la méthode WebSocket /v1/recognize, prennent désormais en charge le paramètre de requête model. Ce paramètre vous permet d'indiquer des informations sur l'audio :

  • La langue : Anglais, Japonais ou Espagnol
  • La fréquence d'échantillonnage minimale : large bande (16 kHz) ou bande étroite (8 kHz)

Pour plus d'informations, voir Langues et modèles de génération antérieure.

Nouveau paramètre inactivity_timeout pour la reconnaissance vocale

Le paramètre inactivity_timeout définit, en secondes, la valeur du délai au bout duquel le service ferme la connexion s'il détecte du silence (aucune parole) en mode diffusion en continu. Par défaut, le service met fin à la session au bout de 30 secondes de silence. Les méthodes POST /v1/recognize et WebSocket /v1/recognize prennent en charge le paramètre. Pour plus d'informations, voir Délais d'attente.

Nouveau paramètre max_alternatives pour la reconnaissance vocale

Le paramètre max_alternatives demande au service de renvoyer les n meilleures hypothèses de substitution pour la transcription audio. Les méthodes POST /v1/recognize et WebSocket /v1/recognize prennent en charge le paramètre. Pour plus d'informations, voir Nombre maximal d'alternatives.

Nouveau paramètre word_confidence pour la reconnaissance vocale

Le paramètre word_confidence demande au service de renvoyer une cote de confiance pour chaque mot de la transcription. Les méthodes POST /v1/recognize et WebSocket /v1/recognize prennent en charge le paramètre. Pour plus d'informations, voir Confiance des mots.

Nouveau paramètre timestamps pour la reconnaissance vocale

Le paramètre timestamps demande au service de renvoyer le moment de début et de fin par rapport au début audio de chaque mot de la transcription. Les méthodes POST /v1/recognize et WebSocket /v1/recognize prennent en charge le paramètre. Pour plus d'informations, voir Horodatage des mots.

Méthode de session renommée pour l'observation des résultats

La méthode GET /v1/sessions/{session_id}/observeResult est désormais nommée GET /v1/sessions/{session_id}/observe_result. Le nom observeResult est toujours pris en charge pour la compatibilité avec les versions antérieures.

Nouvelle prise en charge du format audio Waveform Audio File (WAV)

L'en-tête Content-Type des méthodes recognize prend désormais en charge audio/wav pour les fichiers Waveform Audio File (WAV), en plus des fichiers audio/flac et audio/l16. Pour plus d'informations, voir Format audio/wav.

Limites de quantité maximale d'audio pour la reconnaissance vocale

Le service a désormais une limite de 100 Mo de données par session en mode diffusion en continu. Vous pouvez définir le mode de diffusion en spécifiant la valeur « chunked » dans l'en-tête « Transfer-Encoding ». La diffusion ponctuelle d'un fichier audio impose toujours une taille limite de 4 Mo pour les données envoyées. Pour plus d'informations, voir Transmission audio.

Nouvel en-tête pour ne pas contribuer à l'amélioration des services

Les méthodes GET /v1/sessions/{session_id}/observe_result, POST /v1/sessions/{session_id}/recognize et POST /v1/recognize comprennent désormais le paramètre d'en-tête X-WDC-PL-OPT-OUT pour contrôler si le service utilise des données audio et de transcription d'une demande afin d'améliorer les futurs résultats. L'interface WebSocket comprend un paramètre de requête équivalent. Indiquez la valeur 1 pour empêcher le service d'utiliser des résultats d'audio et de transcription. Le paramètre s'applique uniquement à la demande en cours. Le nouvel en-tête remplace l'en-tête X-logging utilisé dans la version d'API bêta. Voir Contrôle de la journalisation des demandes pour les services Watson.

Modifications des codes d'erreur HTTP

Le service peut désormais répondre avec les codes d'erreur HTTP suivants :

  • Pour les méthodes /v1/models, /v1/models/{model_id}, /v1/sessions, /v1/sessions/{session_id}, /v1/sessions/{session_id}/observe_result, /v1/sessions/{session_id}/recognize et /v1/recognize, le code 415 ("Unsupported Media Type") est ajouté.
  • Pour les requêtes de type « POST » et « GET » adressées à la méthode « /v1/sessions/{session_id}/recognize », les codes d'erreur suivants ont été modifiés :
    • Code d'erreur 404 ("Session_id not found") a un message plus descriptif (POST et GET).
    • Code d'erreur 503 ("Session is already processing a request. Concurrent requests are not allowed on the same session. La session reste active après cette erreur. ") A un message plus descriptif (POST uniquement).
    • Pour les demandes HTTP POST vers les méthodes /v1/sessions et /v1/recognize, le code d'erreur 503 ("Service Unavailable") peut être renvoyé. Ce code d'erreur peut également être renvoyé lorsque vous créez une connexion de type « WebSocket » à l'aide de la méthode /v1/recognize.