Migration vers des modèles vocaux de grande taille
A partir du 1er août 2023, tous les modèles de génération précédente sont désormais déréférencés du service. Les nouveaux clients ne doivent désormais utiliser que les grands modèles vocaux ou les modèles de nouvelle génération. Tous les clients existants doivent désormais migrer vers le modèle vocal équivalent de grande taille ou vers le modèle de nouvelle génération. Pour plus d'informations, voir Migration vers des modèles vocaux volumineux.
Vous devez migrer votre utilisation de tout modèle obsolète de la génération précédente vers les modèles équivalents pour la grande voix ou les modèles de la génération suivante avant la date de fin de service du 31 juillet 2023. Les modèles de nouvelle génération fournissent une précision et un débit de transcription sensiblement meilleurs. Cependant, ils offrent actuellement un peu moins de fonctionnalités que les modèles de génération précédente.
Cette rubrique présente les étapes à suivre pour migrer des modèles de génération précédente vers les modèles de nouvelle génération. Pour plus d'informations sur la migration, vous pouvez également consulter Watson Speech to Text: Comment planifier votre migration vers les modèles de nouvelle génération.
Etape 1: Identifiez le modèle de parole de grande taille ou le modèle de nouvelle génération vers lequel effectuer la migration
Les rubriques suivantes décrivent tous les grands modèles vocaux, ceux de la génération précédente et ceux de la génération suivante :
- Langues et modèles de génération antérieure
- Langues et modèles de nouvelle génération
- Langues et modèles vocaux de grande taille
Les tableaux des modèles linguistiques de la génération précédente répertorient les modèles vocaux de grande taille recommandés ou les modèles de la génération suivante vers lesquels migrer à partir d'un modèle de la génération précédente. Utilisez le modèle de parole de grande taille indiqué ou le modèle de nouvelle génération dans vos demandes de reconnaissance vocale.
Le service continue de mettre à disposition de nouveaux modèles de grands discours. Tous les nouveaux modèles sont identifiés dans les notes sur l'édition et dans les tableaux qui décrivent les modèles disponibles.
De manière optimale, vous migrez d'un modèle à bande étroite / modèle de téléphonie vers un modèle de parole de grande taille, et d'un modèle à large bande / modèle multimédia vers un modèle de parole de grande taille. Cependant, tous les modèles à large bande et les modèles multimédias n'ont pas des modèles de parole de grande taille équivalents. Dans de tels cas, vous pouvez migrer d'un modèle à bande étroite vers un modèle de téléphonie ou d'un modèle à large bande vers un modèle multimédia. Le service fait un sous-échantillonnage de l'audio que vous envoyez au débit du modèle que vous utilisez. Ainsi, l'envoi d'un audio à large bande à un modèle de téléphonie pourrait s'avérer une solution de rechange suffisante dans les cas où aucun modèle multimédia équivalent n'est disponible.
Par exemple, la demande de reconnaissance vocale suivante utilise la génération précédente en-US_NarrowbandModel :
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel"
Pour utiliser l'équivalent du grand modèle vocal en-US, il vous suffit de modifier la valeur que vous transmettez avec le paramètre de requête model
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US"
Étape 2 : Identifier les fonctionnalités disponibles avec les grands modèles vocaux
Les grands modèles vocaux prennent en charge un peu moins de caractéristiques et de paramètres que les modèles de génération précédente et suivante. Cependant, bien qu'ils manquent de la parité totale, la plupart des fonctions sont disponibles avec les deux types de modèles. Et lorsqu'une fonctionnalité est limitée à un sous-ensemble de langues, les limitations s'appliquent également à tous les types de modèles.
Pour plus d'informations sur les fonctions prises en charge avec les différents types de modèle, voir
- Fonctions prises en charge pour les modèles de génération précédente
- Fonctions prises en charge pour les modèles de nouvelle génération
- Fonctions prises en charge pour les modèles vocaux de grande taille
- Récapitulatif des paramètres
Le service continue d'offrir de nouvelles fonctionnalités avec les modèles de nouvelle génération. Toutes les mises à jour de la prise en charge des fonctions sont documentées dans les notes sur l'édition et dans la documentation des types de modèle.
Pour migrer vers des modèles de nouvelle génération, vous devez supprimer les fonctions qui ne sont pas prises en charge par les modèles de nouvelle génération de vos demandes de reconnaissance vocale. Vous pouvez également envisager d'utiliser des fonctions telles que le biais d'insertion de caractères qui sont disponibles uniquement avec des modèles vocaux de grande taille et des modèles de nouvelle génération.
Par exemple, la demande de reconnaissance vocale suivante utilise les paramètres profanity_filter, redaction, et word_alternatives_threshold avec la génération précédente en-US_NarrowbandModel :
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&profanity_filter=true&redaction=true&word_alternatives_threshold=0.50"
Seul le paramètre word_alternatives_threshold n'est pas pris en charge par les grands modèles vocaux. Pour utiliser l'équivalent du grand modèle vocal en-US_Telephony, il suffit de modifier la valeur que vous transmettez
avec le model paramètre de requête et d'éliminer le word_alternatives_threshold paramètre :
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US&profanity_filter=true&redaction=true"
Étape 3 : Recréer tous les modèles de langue personnalisés que vous utilisez
Vous devez recréer tous les modèles linguistiques personnalisés qui sont basés sur des modèles de génération précédente ou suivante en les basant sur les grands modèles vocaux équivalents. Pour ce faire, vous devez créer un nouveau modèle linguistique personnalisé et ajouter vos corpus et vos mots personnalisés de l'ancien modèle au nouveau modèle.
En général, les grands modèles vocaux ne s'appuient pas autant sur des modèles de langage personnalisés. Ils utilisent une approche différente de la transcription qui minimise le besoin de personnalisation du modèle de langue.
Les grands modèles vocaux ne prennent pas en charge les modèles acoustiques personnalisés. En raison de la façon dont les modèles transcrivent l'audio, la personnalisation du modèle acoustique n'est pas nécessaire.
Par exemple, la demande de reconnaissance vocale suivante utilise un modèle de langue personnalisé basé sur en-US_NarrowbandModel. Dans cet exemple, le modèle personnalisé a l'identificateur 8acf31fa-0aa2-4ecc-a805-1f527f342dba.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&language_customization_id=8acf31fa-0aa2-4ecc-a805-1f527f342dba"
Après avoir recréé le modèle de langue personnalisé avec le modèle en-US équivalent, mettez simplement à jour le nom du modèle en en-US, de même que le paramètre language_customization_ID pour utiliser
l'identificateur du nouveau modèle personnalisé, 636d8494-7e53-436a-8557-30d6b2a63cd7 :
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US&language_customization_id=636d8494-7e53-436a-8557-30d6b2a63cd7"
Étape 4 : Évaluer les résultats du grand modèle vocal
Une fois que vous avez mis à jour vos demandes de reconnaissance vocale pour utiliser des modèles vocaux de grande taille, éliminé les paramètres non pris en charge et recréé les modèles linguistiques personnalisés, vous pouvez expérimenter la reconnaissance vocale basée sur les modèles de la génération précédente et de la génération suivante. Comparez les transcriptions obtenues afin de déterminer si le grand modèle vocal produit des résultats équivalents ou meilleurs. Tenez également compte des performances des requêtes qui utilisent un modèle vocal de grande taille pour déterminer la rapidité avec laquelle vous obtenez des résultats.
Vous pouvez également comparer le taux d'erreur sur les mots des grands modèles vocaux, les résultats de la génération précédente et ceux de la génération suivante. L'utilitaire Word Error Rate(WER), disponible en Python, peut vous aider à mesurer et à comparer la précision de vos résultats.