Langues et modèles de génération antérieure

A partir du 1er août 2023, tous les modèles de génération précédente sont désormais déréférencés du service. Les nouveaux clients ne doivent désormais utiliser que les modèles de nouvelle génération. Tous les clients existants doivent maintenant migrer vers le modèle de nouvelle génération équivalent. Pour plus d'informations, voir Migration vers les modèles nouvelle génération.

Le service IBM Watson® Speech to Text prend en charge la reconnaissance vocale avec des modèles de génération précédente dans de nombreuses langues. Le modèle indique la langue correspondant aux données audio et la fréquence d'échantillonnage de ces données.

Les modèles décrits sur cette page sont appelés Modèles de génération précédente. Le service offre également des modèles de nouvelle génération avec des qualités améliorées pour une meilleure reconnaissance vocale. Pour plus d'informations, voir Langues et modèles de nouvelle génération.

Types de modèles de génération précédente

Pour la plupart des langues, le service met à disposition deux types de modèles de génération précédente :

  • Les modèles à bande étroite sont destinés aux enregistrements audio dont le taux d'échantillonnage minimum est de 8 kHz. Utilisez ces modèles pour le décodage hors ligne d'une conversation téléphonique, qui est l'utilisation classique pour cette fréquence d'échantillonnage.
  • Les modèles à large bande sont destinés aux enregistrements audio dont le taux d'échantillonnage minimum est de 16 kHz. Utilisez ces modèles pour les applications réactives en temps réel, par exemple, pour les applications de conversation en direct.

Le choix du modèle adapté à votre application est important. Utilisez le modèle qui correspond à la fréquence d'échantillonnage (et à la langue) de vos données audio. Le service ajuste automatiquement la fréquence d'échantillonnage de vos données audio pour correspondre au modèle que vous spécifiez. Pour obtenir la meilleure précision de reconnaissance possible, vous devez également considérer le contenu de vos données audio en termes de fréquence. Pour plus d'informations, voir Taux d'échantillonnage et Audiofréquence.

Modèles de langue de génération précédente pris en charge

Les sections suivantes répertorient les modèles de génération précédente de chaque type disponibles pour chaque langue. Les tableaux des sections fournissent les renseignements suivants :

  • La colonne Nom du modèle indique le nom du modèle.

  • La colonne Statut indique si le modèle est en disponibilité générale (GA) ou en version bêta.

  • Modèle de nouvelle génération recommandé identifie le modèle de nouvelle génération que vous pouvez utiliser à la place d'un modèle obsolète.

    À l'heure actuelle, tous les modèles à large bande n'ont pas de modèles multimédias équivalents. Dans ces cas, envisagez d'utiliser le modèle de téléphonie pour cette langue. Le service fait un sous-échantillonnage de l'audio au débit du modèle que vous utilisez. Ainsi, l'envoi d'un audio à large bande à un modèle de téléphonie pourrait s'avérer une solution de rechange suffisante dans les cas où aucun modèle multimédia équivalent n'est disponible.

Tous les modèles sont disponibles pour les deux versions de produit, IBM Cloud et IBM Cloud Pak for Data.

Modèles à bande étroite

Le tableau 1 répertorie les modèles à bande étroite de génération précédente disponibles.

Modèles à bande étroite de la génération précédente pris en charge
Langue Nom du modèle Statut Modèle de nouvelle génération recommandé
Chinois (mandarin) zh-CN_NarrowbandModel Disponibilité générale
obsolète
zh-CN_Telephony
Néerlandais (Pays-Bas) nl-NL_NarrowbandModel Disponibilité générale
obsolète
nl-NL_Telephony
Anglais (australien) en-AU_NarrowbandModel Disponibilité générale
obsolète
en-AU_Telephony
Anglais (Royaume-Uni) en-GB_NarrowbandModel Disponibilité générale
obsolète
en-GB_Telephony
Anglais (États-Unis) en-US_NarrowbandModel Disponibilité générale
obsolète
en-US_Telephony
en-US_ShortForm_NarrowbandModel Disponibilité générale
obsolète
en-US_Telephony
Français (Canada) fr-CA_NarrowbandModel Disponibilité générale
obsolète
fr-CA_Telephony
Français (France) fr-FR_NarrowbandModel Disponibilité générale
obsolète
fr-FR_Telephony
Allemand de-DE_NarrowbandModel Disponibilité générale
obsolète
de-DE_Telephony
Italien it-IT_NarrowbandModel Disponibilité générale
obsolète
it-IT_Telephony
Japonais ja-JP_NarrowbandModel Disponibilité générale
obsolète
ja-JP_Telephony
IBM Cloud
Coréen ko-KR_NarrowbandModel Disponibilité générale
obsolète
ko-KR_Telephony
Portugais (Brésil) pt-BR_NarrowbandModel Disponibilité générale
obsolète
pt-BR_Telephony
Espagnol (Argentine, bêta) es-AR_NarrowbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Castillan) es-ES_NarrowbandModel Disponibilité générale
obsolète
es-ES_Telephony
Espagnol (Chili, bêta) es-CL_NarrowbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Colombie, bêta) es-CO_NarrowbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Mexique, bêta) es-MX_NarrowbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Pérou, bêta) es-PE_NarrowbandModel Bêta
Discontinué
es-LA_Telephony

Modèles à large bande

Le tableau 2 répertorie les modèles à large bande de génération précédente disponibles.

Modèles à large bande de la génération précédente pris en charge
Langue Nom du modèle Statut Modèle de nouvelle génération recommandé
Arabe (moderne standard) ar-MS_BroadbandModel Disponibilité générale
obsolète
ar-MS_Telephony
Chinois (mandarin) zh-CN_BroadbandModel Disponibilité générale
obsolète
zh-CN_Telephony
Néerlandais (Pays-Bas) nl-NL_BroadbandModel Disponibilité générale
obsolète
nl-NL_Multimedia
Anglais (australien) en-AU_BroadbandModel Disponibilité générale
obsolète
en-AU_Multimedia
Anglais (Royaume-Uni) en-GB_BroadbandModel Disponibilité générale
obsolète
en-GB_Multimedia
Anglais (États-Unis) en-US_BroadbandModel Disponibilité générale
obsolète
en-US_Multimedia
Français (Canada) fr-CA_BroadbandModel Disponibilité générale
obsolète
fr-CA_Multimedia
Français (France) fr-FR_BroadbandModel Disponibilité générale
obsolète
fr-FR_Multimedia
Allemand de-DE_BroadbandModel Disponibilité générale
obsolète
de-DE_Multimedia
Italien it-IT_BroadbandModel Disponibilité générale
obsolète
it-IT_Multimedia
Japonais ja-JP_BroadbandModel Disponibilité générale
obsolète
ja-JP_Multimedia
Coréen ko-KR_BroadbandModel Disponibilité générale
obsolète
ko-KR_Multimedia
Portugais (Brésil) pt-BR_BroadbandModel Disponibilité générale
obsolète
pt-BR_Multimedia
Espagnol (Argentine, bêta) es-AR_BroadbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Castillan) es-ES_BroadbandModel Disponibilité générale
obsolète
es-ES_Multimedia
Espagnol (Chili, bêta) es-CL_BroadbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Colombie, bêta) es-CO_BroadbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Mexique, bêta) es-MX_BroadbandModel Bêta
Discontinué
es-LA_Telephony
Espagnol (Pérou, bêta) es-PE_BroadbandModel Bêta
Discontinué
es-LA_Telephony

Le modèle de formulaire court en anglais américain (obsolète)

Le modèle anglais américain simplifié, en-US_ShortForm_NarrowbandModel, peut améliorer la reconnaissance vocale pour les solutions de serveur vocal interactif et d'automatisation du service clients. Le modèle simplifié est entraîné pour la reconnaissance d'énoncés courts qui reviennent fréquemment dans les paramètres de support technique comme les centres d'appel d'assistance technique automatique. En plus d'être réglé pour des énoncés courts en général, le modèle est également réglé pour des énoncés précis, tels que des chiffres, l'épellation de noms et de mots à un seul caractère, et les réponses de type oui-non.

Le modèle en-US_ShortForm_NarrowbandModel est optimal pour les types de réponse communs aux échanges homme-machine, tels que le cas d'utilisation d'IBM® Voice Agent with Watson. Le modèle en-US_NarrowbandModel est généralement optimal pour les conversations entre humains. Toutefois, en fonction du cas d'utilisation et de la nature de l'échange, certains utilisateurs trouveront que le modèle simplifié convient également aux conversations entre humains. Etant donné cette flexibilité et ce chevauchement, vous pouvez expérimenter les deux modèles afin de déterminer celui qui est le plus adapté à votre application. Dans les deux cas, l'application d'un modèle de langue personnalisé avec une grammaire au modèle simplifié peut améliorer davantage les résultats de la reconnaissance.

Comme pour tous les modèles, les environnements bruyants peuvent avoir un effet négatif sur les résultats. Par exemple, les bruits de fonds des aéroports, des véhicules en mouvement, des salles de conférence et de plusieurs locuteurs peuvent entraîner des transcriptions moins précises. Les données audio des haut-parleurs peuvent également réduire la précision en raison de l'écho obtenu avec des appareils de ce type. L'utilisation des paramètres disponibles pour la détection d'activité vocale peut contrer ces effets et permettre d'améliorer la précision de la transcription vocale. L'application d'un modèle acoustique personnalisé peut affiner davantage l'acoustique pour la reconnaissance vocale, mais seulement en tant que mesure finale.

Fonctions prises en charge pour les modèles de génération précédente

L'utilisation des modèles de génération précédente avec la quasi-totalité des fonctions du service est prise en charge. La plupart des caractéristiques et des modèles sont en disponibilité générale à des fins de production. Lorsque cela est indiqué, certaines fonctions et certains modèles sont des fonctionnalités bêta. Des restrictions s'appliquent à certaines fonctions, par exemple :

  • Les fonctions telles que les étiquettes d'orateur, l'occultation numérique et le filtrage des grossièretés sont limitées à certaines langues et à certains modèles. Ces restrictions sont notées avec les descriptions des caractéristiques individuelles. Pour plus d'informations sur tous les paramètres de reconnaissance vocale disponibles, voir le Récapitulatif des paramètres.
  • Le paramètre low_latency n'est pris en charge que pour les modèles de nouvelle génération. Pour plus d'informations, voir Faible temps d'attente.
  • Pour plus d'informations sur la prise en charge de la personnalisation par les modèles de génération précédente, voir Prise en charge de la personnalisation par les modèles de génération précédente.

Sinon, lorsqu'une fonction est décrite comme étant disponible en général ou disponible pour une ou plusieurs langues spécifiques, elle prend en charge les modèles de génération précédente.