Compréhension de la personnalisation

Le service IBM Watson® Speech to Text offre une interface de personnalisation que vous pouvez utiliser pour étendre ses fonctions de reconnaissance vocale. Vous pouvez utiliser la personnalisation pour améliorer la précision des demandes de reconnaissance vocale en personnalisant un modèle de base pour votre domaine et vos données audio.

L'interface de personnalisation prend en charge les modèles de langue personnalisés et les modèles acoustiques personnalisés. Les interfaces correspondant à ces deux types de modèle sont semblables et simples à utiliser. L'utilisation des deux types de modèle personnalisé avec une demande de reconnaissance est également simple : il vous suffit d'indiquer l'ID de personnalisation du modèle avec la demande.

La reconnaissance vocale fonctionne de la même manière avec ou sans modèle personnalisé. Lorsque vous utilisez un modèle personnalisé pour la reconnaissance vocale, vous pouvez utiliser tous les paramètres normalement disponibles avec une demande de reconnaissance. Pour plus d'informations sur tous les paramètres disponibles, voir Récapitulatif des paramètres.

IBM Cloud Vous devez disposer du plan tarifaire Plus, Standard ou Premium pour utiliser la personnalisation des modèles de langage ou des modèles acoustiques. Les utilisateurs du plan Lite ne peuvent pas utiliser l'interface de personnalisation, mais ils peuvent effectuer une mise à niveau vers le plan Plus pour accéder à la personnalisation. Pour plus d'informations, voir FAQ sur la tarification.

Personnalisation de modèle de langue

Pour plus d'informations sur les langues et les modèles qui prennent en charge la personnalisation des modèles de langue et leur degré de prise en charge (généralement disponible ou bêta), voir Prise en charge des langues pour la personnalisation.

Le service a été développé à l'intention du grand public. Le vocabulaire de base du service contient de nombreux mots utilisés dans la conversation de tous les jours. Ses modèles offrent une reconnaissance suffisamment précise pour convenir à de nombreuses applications. Mais il leur manque parfois la connaissance de termes spécifiques associés à des domaines particuliers.

L'interface de personnalisation de modèle de langue peut améliorer la précision de la reconnaissance vocale dans des domaines tels que la médecine, le droit, les technologies de l'information, etc. En utilisant la personnalisation de modèle de langue, vous pouvez étendre et personnaliser le vocabulaire d'un modèle de base pour inclure une terminologie spécifique à un domaine.

Vous créez un modèle de langue personnalisé et ajoutez des corpus et des mots spécifiques à votre domaine. Lorsque vous avez entraîné le modèle de langue personnalisé avec votre vocabulaire enrichi, vous pouvez l'utiliser dans le cadre d'une reconnaissance vocale personnalisée. Le service peut en principe entraîner un modèle personnalisé en l'espace de quelques minutes. Le temps et l'effort requis pour créer un modèle personnalisé dépendent des données dont vous disposez pour le modèle.

La personnalisation du modèle linguistique est disponible pour les grands modèles de parole, les modèles de la génération précédente et ceux de la génération suivante, mais la personnalisation fonctionne différemment pour les grands modèles de parole, les modèles de la génération précédente et ceux de la génération suivante. La documentation décrit les différences. Pour plus d'informations sur l'utilisation de la personnalisation du modèle de langue, voir

Amélioration de la personnalisation des modèles de langue pour les modèles de nouvelle génération

La personnalisation des modèles de langue pour les modèles de nouvelle génération est en cours d'amélioration. Les améliorations apportées à la personnalisation des modèles de langue sont appliquées aux modèles de la prochaine génération de manière incrémentielle, en commençant par les modèles de quelques langues. Au fil du temps, d'autres modèles de langue de nouvelle génération seront migrés vers la technologie améliorée.

  • Pour identifier les modèles qui utilisent la technologie améliorée, recherchez une date dans la colonne Personnalisation du modèle de langue (améliorée) du tableau 2 dans Prise en charge de la personnalisation pour les modèles de nouvelle génération. Vérifiez la date de la version du service que vous utilisez, IBM Cloud, ou IBM Software Hub ou IBM Cloud Pak for Data. Cette date indique quand le modèle de la prochaine génération a été migré vers la technologie améliorée.
  • Pour tirer parti de la technologie améliorée, vous devez mettre à niveau les modèles de langue personnalisés basés sur un modèle de nouvelle génération amélioré. Une fois qu'un modèle personnalisé est basé sur un modèle de nouvelle génération amélioré, le service continue d'effectuer les mises à niveau nécessaires lorsque le modèle personnalisé est réentraîné. Pour plus d'informations, voir Mise à niveau d'un modèle de langue personnalisé basé sur un modèle de nouvelle génération amélioré.

Pour les modèles de langue basés sur la nouvelle technologie, les paramètres suivants ont été optimisés pour améliorer la reconnaissance vocale:

  • La valeur par défaut de customization_weight est passée de 0.2 à 0.1. Un customization_weight autre que celui par défaut que vous aviez précédemment associé à vos modèles personnalisés est supprimé. Pour plus d'informations, voir Utilisation d'un poids de personnalisation.
  • La valeur par défaut character_insertion_bias reste 0.0, mais les modèles ont changé d'une manière qui rend moins nécessaire l'utilisation du paramètre pour la reconnaissance vocale. Pour plus d'informations, voir biais d'insertion de caractères.

Utilisez les instructions suivantes lorsque vous utilisez ces paramètres:

  • Si vous utilisez les valeurs par défaut pour ces paramètres, continuez à le faire. Les valeurs par défaut continueront probablement à offrir les meilleurs résultats pour la reconnaissance vocale.
  • Si vous spécifiez des valeurs autres que les valeurs par défaut pour ces paramètres, testez les valeurs par défaut. Votre modèle personnalisé peut bien fonctionner pour la reconnaissance vocale avec les valeurs par défaut.
  • Si vous pensez que l'utilisation de valeurs différentes pour ces paramètres peut améliorer la reconnaissance vocale avec votre modèle personnalisé, testez les modifications incrémentielles afin de déterminer si les paramètres sont nécessaires pour améliorer la reconnaissance vocale.

Modèles de langue de nouvelle génération pris en charge:

  • RNNT_CUSTOMIZATION_SUPPORTED_LANGS =
    • en-US_Multimédia
    • en-GB_Multimédia
    • en-AU_Multimédia
    • en-IN_Multimédia
    • en-US_Téléphonie
    • en-GB_Téléphonie
    • en-AU_Téléphonie
    • en-IN_Téléphonie
    • ja-JP_Multimédia
    • ja-JP_Téléphonie
    • fr-FR_Multimédia
    • fr-FR_Téléphonie
    • dé-DE_Multimédia
    • dé_DE_Téléphonie
    • fr-CA_Multimédia
    • pt-BR_Multimédia
    • pt-BR_Téléphonie

Personnalisation de modèle acoustique

La personnalisation du modèle acoustique n'est disponible que pour les modèles de génération antérieure. Il n'est pas disponible pour les grands modèles vocaux et les modèles de nouvelle génération.

Le service a été développé avec des modèles acoustiques de base qui fonctionnent bien pour diverses caractéristiques audio. Mais dans certains cas, l'adaptation d'un modèle de base à vos données audio peut améliorer la reconnaissance vocale :

  • Votre environnement de canal acoustique est unique. Par exemple, l'environnement peut être bruyant, la qualité du micro ou son réglage peuvent laisser à désirer ou la qualité audio peut souffrir d'effets indirects.
  • Le langage parlé de vos locuteurs est atypique. Par exemple, un locuteur parle beaucoup trop vite ou la source audio comprend des conversations informelles.
  • Les accents de vos locuteurs sont marqués. Par exemple, votre source audio comprend des locuteurs qui ne parlent pas dans leur langue maternelle ou s'expriment dans une autre langue.

L'interface de personnalisation de modèle acoustique peut adapter un modèle de base à votre environnement et à vos locuteurs. Vous créez un modèle acoustique personnalisé et ajoutez des données audio (ressources audio) qui correspondent le plus à la signature acoustique des données audio que vous souhaitez transcrire. Lorsque vous avez entraîné le modèle acoustique personnalisé avec vos ressources audio, vous pouvez l'utiliser dans le cadre d'une reconnaissance vocale personnalisée.

La durée d'entraînement du modèle personnalisé par le service dépend de la quantité de données que contient le modèle. En général, l'entraînement dure deux fois plus longtemps que les données audio cumulées. Le temps et l'effort requis pour créer un modèle personnalisé dépendent des données audio dont vous disposez pour le modèle. Ils dépendent également du fait que vous utilisiez des transcriptions de l'audio.

Pour plus d'informations sur l'utilisation de la personnalisation du modèle de acoustique, voir

Grammaires

Pour plus d'informations sur les langues et les modèles qui prennent en charge les grammaires et leur niveau de prise en charge (généralement disponible ou bêta), voir Prise en charge de langue pour la personnalisation.

Les modèles de langue personnalisés vous permettent d'enrichir le vocabulaire de base du service. Les grammaires vous permettent de limiter les mots que le service peut reconnaître à partir de ce vocabulaire. Lorsque vous utilisez une grammaire avec un modèle de langue personnalisé pour la reconnaissance vocale, le service ne reconnaît que les mots, les expressions et les chaînes reconnus par la grammaire. Comme la grammaire définit un espace de recherche limité pour les correspondances valides, le service peut délivrer des résultats plus rapides et plus précis.

Vous ajoutez une grammaire à un modèle de langue personnalisé et entraînez le modèle de la même manière que pour un corpus. Contrairement à un corpus, vous devez spécifier explicitement qu'une grammaire doit être utilisée avec un modèle personnalisé lors de la reconnaissance vocale.

Les grammaires sont disponibles uniquement pour les modèles de génération précédente et suivante. Il n'est pas disponible pour les grands modèles de parole.

Pour plus d'informations sur l'utilisation des grammaires, voir

Utilisation conjointe de la personnalisation acoustique et linguistique

L'utilisation de la personnalisation acoustique et linguistique ne s'applique qu'aux modèles de génération antérieure. De plus, certains modèles de génération antérieure ne prennent pas en charge la personnalisation linguistique et acoustique.

L'utilisation d'un modèle acoustique personnalisé uniquement peut améliorer les fonctions de la reconnaissance du service. Mais si des transcriptions ou des corpus associés sont disponibles pour vos échantillons de données audio, vous pouvez utiliser ces données pour obtenir une meilleure qualité de reconnaissance vocale en fonction du modèle acoustique personnalisé.

En créant un modèle de langue personnalisé qui vient compléter votre modèle acoustique personnalisé, vous pouvez améliorer la reconnaissance vocale en utilisant les deux modèles à la fois. Lorsque vous entraînez un modèle acoustique personnalisé, vous pouvez spécifier un modèle de langue personnalisé qui comprend les transcriptions des ressources audio ou un vocabulaire de mots spécifiques à un domaine à partir de ces ressources. De même, lorsque vous transcrivez des données audio, le service accepte un modèle de langue personnalisé, un modèle acoustique personnalisé ou ces deux types de modèle. Et si votre modèle de langue personnalisé comprend une grammaire, vous pouvez utiliser ce modèle et cette grammaire avec un modèle acoustique personnalisé pour la reconnaissance vocale.

Pour plus d'informations, voir Utilisation conjointe de modèles acoustiques et de modèles de langage personnalisés

Mise à niveau des modèles personnalisés

Pour améliorer la qualité de la reconnaissance vocale, le service met occasionnellement à jour les grands modèles de parole de base, les modèles de la génération précédente et de la génération suivante. Une mise à jour d'un modèle de base n'affecte que ce modèle. La mise à jour n'affecte pas d'autres modèles de langues identiques ou différentes.

Une mise à jour d'un modèle de base peut nécessiter la mise à niveau de tous les modèles personnalisés qui sont générés sur ce modèle de base pour tirer parti des améliorations. Une mise à jour d'un modèle de base nécessitant une mise à niveau génère une nouvelle version du modèle de base. Une mise à jour ne nécessitant pas de mise à niveau ne produit pas une nouvelle version.

  • Pour les modèles de génération antérieure, toutes les mises à jour d'un modèle de base génèrent une nouvelle version du modèle. Lorsqu'une nouvelle version d'un modèle de base est publiée, vous devez mettre à niveau toutes les langues personnalisées et les modèles acoustiques personnalisés qui sont générés sur le modèle de base mis à jour pour tirer parti des améliorations.
  • Pour les grands modèles de parole et les modèles de nouvelle génération, la plupart des mises à jour ne produisent pas de nouvelle version du modèle. Ces mises à jour ne nécessitent pas la mise à niveau de vos modèles personnalisés. Certaines mises à jour génèrent toutefois une nouvelle version d'un modèle de base. Vous devez mettre à niveau tous les modèles de langage personnalisés qui sont générés sur le modèle de base mis à jour pour tirer parti des améliorations.

Toutes les mises à jour des modèles de base et si elles nécessitent des mises à niveau sont annoncées dans les notes sur l'édition :

Après avoir mis à niveau un modèle personnalisé, le service utilise la dernière version du modèle personnalisé par défaut lorsque vous spécifiez ce modèle avec une demande de reconnaissance vocale. Cependant, vous pouvez toujours instruire le service d'utiliser l'ancienne version du modèle. Pour plus d'informations sur la mise à niveau des modèles personnalisés et sur l'utilisation d'une ancienne version d'un modèle, voir