Langues et modèles de génération antérieure
A partir du 1er août 2023, tous les modèles de génération précédente sont désormais déréférencés du service. Les nouveaux clients ne doivent désormais utiliser que les modèles de nouvelle génération. Tous les clients existants doivent maintenant migrer vers le modèle de nouvelle génération équivalent. Pour plus d'informations, voir Migration vers les modèles nouvelle génération.
Le service IBM Watson® Speech to Text prend en charge la reconnaissance vocale avec des modèles de génération précédente dans de nombreuses langues. Le modèle indique la langue correspondant aux données audio et la fréquence d'échantillonnage de ces données.
Les modèles décrits sur cette page sont appelés Modèles de génération précédente. Le service offre également des modèles de nouvelle génération avec des qualités améliorées pour une meilleure reconnaissance vocale. Pour plus d'informations, voir Langues et modèles de nouvelle génération.
Types de modèles de génération précédente
Pour la plupart des langues, le service met à disposition deux types de modèles de génération précédente :
- Les modèles à bande étroite sont destinés aux enregistrements audio dont le taux d'échantillonnage minimum est de 8 kHz. Utilisez ces modèles pour le décodage hors ligne d'une conversation téléphonique, qui est l'utilisation classique pour cette fréquence d'échantillonnage.
- Les modèles à large bande sont destinés aux enregistrements audio dont le taux d'échantillonnage minimum est de 16 kHz. Utilisez ces modèles pour les applications réactives en temps réel, par exemple, pour les applications de conversation en direct.
Le choix du modèle adapté à votre application est important. Utilisez le modèle qui correspond à la fréquence d'échantillonnage (et à la langue) de vos données audio. Le service ajuste automatiquement la fréquence d'échantillonnage de vos données audio pour correspondre au modèle que vous spécifiez. Pour obtenir la meilleure précision de reconnaissance possible, vous devez également considérer le contenu de vos données audio en termes de fréquence. Pour plus d'informations, voir Taux d'échantillonnage et Audiofréquence.
Modèles de langue de génération précédente pris en charge
Les sections suivantes répertorient les modèles de génération précédente de chaque type disponibles pour chaque langue. Les tableaux des sections fournissent les renseignements suivants :
-
La colonne Nom du modèle indique le nom du modèle.
-
La colonne Statut indique si le modèle est en disponibilité générale (GA) ou en version bêta.
-
Modèle de nouvelle génération recommandé identifie le modèle de nouvelle génération que vous pouvez utiliser à la place d'un modèle obsolète.
À l'heure actuelle, tous les modèles à large bande n'ont pas de modèles multimédias équivalents. Dans ces cas, envisagez d'utiliser le modèle de téléphonie pour cette langue. Le service fait un sous-échantillonnage de l'audio au débit du modèle que vous utilisez. Ainsi, l'envoi d'un audio à large bande à un modèle de téléphonie pourrait s'avérer une solution de rechange suffisante dans les cas où aucun modèle multimédia équivalent n'est disponible.
Tous les modèles sont disponibles pour les deux versions de produit, IBM Cloud et IBM Cloud Pak for Data.
Modèles à bande étroite
Le tableau 1 répertorie les modèles à bande étroite de génération précédente disponibles.
| Langue | Nom du modèle | Statut | Modèle de nouvelle génération recommandé |
|---|---|---|---|
| Chinois (mandarin) | zh-CN_NarrowbandModel |
Disponibilité générale obsolète |
zh-CN_Telephony |
| Néerlandais (Pays-Bas) | nl-NL_NarrowbandModel |
Disponibilité générale obsolète |
nl-NL_Telephony |
| Anglais (australien) | en-AU_NarrowbandModel |
Disponibilité générale obsolète |
en-AU_Telephony |
| Anglais (Royaume-Uni) | en-GB_NarrowbandModel |
Disponibilité générale obsolète |
en-GB_Telephony |
| Anglais (États-Unis) | en-US_NarrowbandModel |
Disponibilité générale obsolète |
en-US_Telephony |
en-US_ShortForm_NarrowbandModel |
Disponibilité générale obsolète |
en-US_Telephony |
|
| Français (Canada) | fr-CA_NarrowbandModel |
Disponibilité générale obsolète |
fr-CA_Telephony |
| Français (France) | fr-FR_NarrowbandModel |
Disponibilité générale obsolète |
fr-FR_Telephony |
| Allemand | de-DE_NarrowbandModel |
Disponibilité générale obsolète |
de-DE_Telephony |
| Italien | it-IT_NarrowbandModel |
Disponibilité générale obsolète |
it-IT_Telephony |
| Japonais | ja-JP_NarrowbandModel |
Disponibilité générale obsolète |
ja-JP_TelephonyIBM Cloud |
| Coréen | ko-KR_NarrowbandModel |
Disponibilité générale obsolète |
ko-KR_Telephony |
| Portugais (Brésil) | pt-BR_NarrowbandModel |
Disponibilité générale obsolète |
pt-BR_Telephony |
| Espagnol (Argentine, bêta) | es-AR_NarrowbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Castillan) | es-ES_NarrowbandModel |
Disponibilité générale obsolète |
es-ES_Telephony |
| Espagnol (Chili, bêta) | es-CL_NarrowbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Colombie, bêta) | es-CO_NarrowbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Mexique, bêta) | es-MX_NarrowbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Pérou, bêta) | es-PE_NarrowbandModel |
Bêta Discontinué |
es-LA_Telephony |
Modèles à large bande
Le tableau 2 répertorie les modèles à large bande de génération précédente disponibles.
| Langue | Nom du modèle | Statut | Modèle de nouvelle génération recommandé |
|---|---|---|---|
| Arabe (moderne standard) | ar-MS_BroadbandModel |
Disponibilité générale obsolète |
ar-MS_Telephony |
| Chinois (mandarin) | zh-CN_BroadbandModel |
Disponibilité générale obsolète |
zh-CN_Telephony |
| Néerlandais (Pays-Bas) | nl-NL_BroadbandModel |
Disponibilité générale obsolète |
nl-NL_Multimedia |
| Anglais (australien) | en-AU_BroadbandModel |
Disponibilité générale obsolète |
en-AU_Multimedia |
| Anglais (Royaume-Uni) | en-GB_BroadbandModel |
Disponibilité générale obsolète |
en-GB_Multimedia |
| Anglais (États-Unis) | en-US_BroadbandModel |
Disponibilité générale obsolète |
en-US_Multimedia |
| Français (Canada) | fr-CA_BroadbandModel |
Disponibilité générale obsolète |
fr-CA_Multimedia |
| Français (France) | fr-FR_BroadbandModel |
Disponibilité générale obsolète |
fr-FR_Multimedia |
| Allemand | de-DE_BroadbandModel |
Disponibilité générale obsolète |
de-DE_Multimedia |
| Italien | it-IT_BroadbandModel |
Disponibilité générale obsolète |
it-IT_Multimedia |
| Japonais | ja-JP_BroadbandModel |
Disponibilité générale obsolète |
ja-JP_Multimedia |
| Coréen | ko-KR_BroadbandModel |
Disponibilité générale obsolète |
ko-KR_Multimedia |
| Portugais (Brésil) | pt-BR_BroadbandModel |
Disponibilité générale obsolète |
pt-BR_Multimedia |
| Espagnol (Argentine, bêta) | es-AR_BroadbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Castillan) | es-ES_BroadbandModel |
Disponibilité générale obsolète |
es-ES_Multimedia |
| Espagnol (Chili, bêta) | es-CL_BroadbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Colombie, bêta) | es-CO_BroadbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Mexique, bêta) | es-MX_BroadbandModel |
Bêta Discontinué |
es-LA_Telephony |
| Espagnol (Pérou, bêta) | es-PE_BroadbandModel |
Bêta Discontinué |
es-LA_Telephony |
Le modèle de formulaire court en anglais américain (obsolète)
Le modèle anglais américain simplifié, en-US_ShortForm_NarrowbandModel, peut améliorer la reconnaissance vocale pour les solutions de serveur vocal interactif et d'automatisation du service clients. Le modèle simplifié est entraîné
pour la reconnaissance d'énoncés courts qui reviennent fréquemment dans les paramètres de support technique comme les centres d'appel d'assistance technique automatique. En plus d'être réglé pour des énoncés courts en général, le modèle est
également réglé pour des énoncés précis, tels que des chiffres, l'épellation de noms et de mots à un seul caractère, et les réponses de type oui-non.
Le modèle en-US_ShortForm_NarrowbandModel est optimal pour les types de réponse communs aux échanges homme-machine, tels que le cas d'utilisation d'IBM® Voice Agent with Watson. Le modèle en-US_NarrowbandModel est généralement
optimal pour les conversations entre humains. Toutefois, en fonction du cas d'utilisation et de la nature de l'échange, certains utilisateurs trouveront que le modèle simplifié convient également aux conversations entre humains. Etant donné
cette flexibilité et ce chevauchement, vous pouvez expérimenter les deux modèles afin de déterminer celui qui est le plus adapté à votre application. Dans les deux cas, l'application d'un modèle de langue personnalisé avec une grammaire au
modèle simplifié peut améliorer davantage les résultats de la reconnaissance.
Comme pour tous les modèles, les environnements bruyants peuvent avoir un effet négatif sur les résultats. Par exemple, les bruits de fonds des aéroports, des véhicules en mouvement, des salles de conférence et de plusieurs locuteurs peuvent entraîner des transcriptions moins précises. Les données audio des haut-parleurs peuvent également réduire la précision en raison de l'écho obtenu avec des appareils de ce type. L'utilisation des paramètres disponibles pour la détection d'activité vocale peut contrer ces effets et permettre d'améliorer la précision de la transcription vocale. L'application d'un modèle acoustique personnalisé peut affiner davantage l'acoustique pour la reconnaissance vocale, mais seulement en tant que mesure finale.
- Pour plus d'informations sur la personnalisation du modèle de langue et du modèle acoustique, voir Présentation de la personnalisation.
- Pour plus d'informations sur les grammaires, voir Utilisation de grammaires avec des modèles de langue personnalisés.
- Pour plus d'informations sur les paramètres de détection d'activité vocale, voir Détection d'activité vocale.
Fonctions prises en charge pour les modèles de génération précédente
L'utilisation des modèles de génération précédente avec la quasi-totalité des fonctions du service est prise en charge. La plupart des caractéristiques et des modèles sont en disponibilité générale à des fins de production. Lorsque cela est indiqué, certaines fonctions et certains modèles sont des fonctionnalités bêta. Des restrictions s'appliquent à certaines fonctions, par exemple :
- Les fonctions telles que les étiquettes d'orateur, l'occultation numérique et le filtrage des grossièretés sont limitées à certaines langues et à certains modèles. Ces restrictions sont notées avec les descriptions des caractéristiques individuelles. Pour plus d'informations sur tous les paramètres de reconnaissance vocale disponibles, voir le Récapitulatif des paramètres.
- Le paramètre
low_latencyn'est pris en charge que pour les modèles de nouvelle génération. Pour plus d'informations, voir Faible temps d'attente. - Pour plus d'informations sur la prise en charge de la personnalisation par les modèles de génération précédente, voir Prise en charge de la personnalisation par les modèles de génération précédente.
Sinon, lorsqu'une fonction est décrite comme étant disponible en général ou disponible pour une ou plusieurs langues spécifiques, elle prend en charge les modèles de génération précédente.