Comprender la personalización

El servicio IBM Watson® Speech to Text ofrece una interfaz de personalización que se puede utilizar para aumentar su capacidad de reconocimiento de voz. Puede utilizar la personalización para mejorar la precisión de las solicitudes de reconocimiento de voz personalizadas mediante la personalización de un modelo base para el dominio y el audio.

La interfaz de personalización da soporte al modelo de lenguaje personalizado y al modelo acústico personalizado. Las interfaces para ambos tipos de modelo personalizado son similares y resultan fáciles de utilizar. La utilización de cualquiera de los tipos de modelo personalizado con una solicitud de reconocimiento también es sencilla: debe especificar el ID de personalización del modelo con la solicitud.

El reconocimiento de voz funciona de la misma manera con o sin un modelo personalizado. Cuando utiliza un modelo personalizado para el reconocimiento de voz, puede utilizar todos los parámetros que normalmente están disponibles con una solicitud de reconocimiento. Para obtener más información acerca de todos los parámetros disponibles, consulte el Resumen de parámetros.

IBM Cloud Debe tener el plan de precios Plus, Standard o Premium para utilizar la personalización del modelo de lenguaje o del modelo acústico. Los usuarios del plan Lite no pueden utilizar la interfaz de personalización, pero pueden actualizar al plan Plus para obtener acceso a la personalización. Para obtener más información, consulte el apartado Preguntas frecuentes de precios.

Personalización del modelo de lenguaje

Para obtener más información sobre los idiomas y modelos que soportan la personalización del modelo de idioma y su nivel de soporte (generalmente disponible o beta), consulte Soporte de idiomas para la personalización.

El servicio ha sido desarrollado pensando en una audiencia amplia y general. El vocabulario base del servicio contiene muchas palabras que se utilizan en conversaciones diarias. Sus modelos ofrecen un reconocimiento lo suficientemente preciso para muchas aplicaciones. Pero les puede faltar un conocimiento de términos específicos asociados a dominios particulares.

La interfaz de personalización del modelo de lenguaje puede mejorar la precisión del reconocimiento de voz para dominios como la medicina, el ámbito legal, la tecnología de la información y otros. Mediante la personalización del modelo de lenguaje, puede ampliar y adaptar el vocabulario de un modelo base para que incluya terminología específica del dominio.

Para crear un modelo de lenguaje personalizado, añada un corpus y palabras específicas del dominio. Cuando haya entrenado el modelo de lenguaje personalizado con su vocabulario ampliado, puede utilizarlo para el reconocimiento de voz personalizado. Normalmente, el servicio puede entrenar cualquier modelo personalizado en cuestión de minutos. El tiempo y el esfuerzo necesarios para crear un modelo personalizado dependen de los datos que tenga disponibles para el modelo.

La personalización de modelos de lenguaje está disponible para modelos de voz grandes, modelos de generaciones anteriores y modelos de generaciones posteriores, pero la personalización funciona de manera diferente para modelos de voz grandes, modelos de generaciones anteriores y modelos de generaciones posteriores. La documentación describe las diferencias. Para obtener más información sobre cómo empezar con la personalización del modelo de idioma, consulte

Personalización mejorada del modelo de lenguaje para modelos de próxima generación

Se está mejorando la personalización del modelo de lenguaje para los modelos de próxima generación. Las mejoras en la personalización del modelo de lenguaje se están aplicando a los modelos de próxima generación de forma incremental, empezando por los modelos para unos pocos idiomas. Con el tiempo, otros modelos de lenguaje de próxima generación se migrarán a la tecnología mejorada.

  • Para identificar modelos que utilizan la tecnología mejorada, busque una fecha en la columna Personalización de modelo de lenguaje (mejorada) de la tabla 2 en Soporte de personalización para modelos de próxima generación. Compruebe la fecha de la versión del servicio que utiliza, IBM Cloud, o IBM Software Hub o IBM Cloud Pak for Data. Esa fecha indica cuándo se migró el modelo de próxima generación a la tecnología mejorada.
  • Para aprovechar la tecnología mejorada, debe actualizar los modelos de lenguaje personalizados que se basan en un modelo de próxima generación mejorado. Una vez que un modelo personalizado se basa en un modelo de próxima generación mejorado, el servicio continúa realizando las actualizaciones necesarias cuando se vuelve a entrenar el modelo personalizado. Para obtener más información, consulte Actualización de un modelo de lenguaje personalizado basado en un modelo de próxima generación mejorado.

Para los modelos de lenguaje basados en la nueva tecnología, se han optimizado los siguientes parámetros para mejorar el reconocimiento de voz:

  • El customization_weight predeterminado ha cambiado de 0.2 a 0.1. Se elimina un customization_weight no predeterminado que había asociado anteriormente con los modelos personalizados. Para obtener más información, consulte Utilización de ponderaciones de personalización.
  • El valor predeterminado character_insertion_bias sigue siendo 0.0, pero los modelos han cambiado de una forma que hace que el uso del parámetro para el reconocimiento de voz sea menos necesario. Para obtener más información, consulte Sesgo de inserción de caracteres.

Utilice las directrices siguientes cuando trabaje con estos parámetros:

  • Si utiliza los valores predeterminados para estos parámetros, continúe haciéndolo. Los valores predeterminados probablemente seguirán ofreciendo los mejores resultados para el reconocimiento de voz.
  • Si especifica valores no predeterminados para estos parámetros, experimente con los valores predeterminados. El modelo personalizado puede funcionar bien para el reconocimiento de voz con los valores predeterminados.
  • Si cree que el uso de valores diferentes para estos parámetros puede mejorar el reconocimiento de voz con el modelo personalizado, experimente con cambios incrementales para determinar si los parámetros son necesarios para mejorar el reconocimiento de voz.

Modelos de lenguaje de próxima generación soportados:

  • RNNT_CUSTOMIZATION_SUPPORTED_LANGS =
    • en-US_Multimedia
    • en-GB_Multimedia
    • en-AU_Multimedia
    • en-IN_Multimedia
    • en-US_Telefonía
    • en-GB_Telefonía
    • en-AU_Telefonía
    • en-IN_Telefonía
    • ja-JP_Multimedia
    • ja-JP_Telephony
    • fr-FR_Multimedia
    • fr-FR_Telefonía
    • de-DE_Multimedia
    • de-DE_Telefonía
    • fr-CA_Multimedia
    • pt-BR_Multimedia
    • pt-BR_Telefonía

Personalización de modelos acústicos

La personalización de modelos acústicos sólo está disponible para modelos de la generación anterior. No está disponible para modelos de voz grandes y modelos de próxima generación.

El servicio se desarrolló con modelos acústicos de base que funcionan bien para diversas características de audio. Pero, en casos como los siguientes, el hecho de adaptar un modelo base para que se ajuste a su audio puede mejorar el reconocimiento de voz:

  • El entorno de canal acústico es exclusivo. Por ejemplo, el entorno es ruidoso, la calidad del micrófono o el posicionamiento no son los óptimos, o el audio sufre de efectos de campo lejano.
  • Los patrones de voz de los oradores son atípicos. Por ejemplo, un orador habla muy rápido o el audio incluye conversaciones informales.
  • Los oradores tienen acentos muy pronunciados. Por ejemplo, el audio incluye oradores que hablan en un idioma que no es el nativo.

La interfaz de personalización del modelo acústico puede adaptar un modelo base a su entorno y a los oradores. Debe crear un modelo acústico personalizado y añadir datos de audio (recursos de audio) que se ajusten a la firma acústica del audio que desea transcribir. Cuando haya entrenado el modelo acústico personalizado con sus recursos de audio, puede utilizarlo para el reconocimiento de voz personalizado.

El tiempo que tarda el servicio en entrenar el modelo personalizado depende de la cantidad de datos de audio que contiene el modelo. En general, el entrenamiento tarda el doble de lo que dura el audio acumulado. El tiempo y el esfuerzo necesarios para crear un modelo personalizado dependen de los datos de audio que tenga disponibles para el modelo. También sobre si se utilizan las transcripciones del audio.

Para obtener más información sobre cómo empezar con la personalización de modelos acústicos, consulte

Gramáticas

Para obtener más información sobre los idiomas y modelos que soportan gramáticas y su nivel de soporte (generalmente disponible o beta), consulte Soporte de idiomas para la personalización.

Los modelos de lenguaje personalizado le permiten ampliar el vocabulario base del servicio. Las gramáticas le permiten restringir las palabras que el servicio puede reconocer de ese vocabulario. Cuando se utiliza una gramática con un modelo de lenguaje personalizado para el reconocimiento de voz, el servicio solo puede reconocer las palabras, frases y series que reconoce la gramática. Puesto que la gramática define un espacio de búsqueda limitado de coincidencias válidas, el servicio puede ofrecer resultados más rápido y con mayor precisión.

La tarea de añadir una gramática a un modelo de lenguaje personalizado y de entrenar el modelo es igual que para un corpus. No obstante, a diferencia de lo que sucede con el corpus, debe especificar de forma explícita que se va a utilizar una gramática con un modelo personalizado durante el reconocimiento de voz.

Grammars sólo está disponible para modelos de generación anterior y siguiente. No está disponible para modelos de voz grandes.

Para obtener más información sobre cómo empezar con las gramáticas, consulte

Utilización conjunta de la personalización acústica y de lenguaje

La utilización conjunta de la personalización de idioma y de acústica sólo se aplica a los modelos de la generación anterior. Además, algunos modelos de la generación anterior no soportan la personalización del idioma y de la acústica.

El uso de un modelo acústico personalizado puede mejorar las prestaciones de reconocimiento del servicio. Pero, si las transcripciones o el corpus relacionado están disponibles para el audio de ejemplo, puede utilizar dichos datos para mejorar aún más la calidad del reconocimiento de voz basado en el modelo acústico personalizado.

Mediante la creación de un modelo de lenguaje personalizado que complemente el modelo acústico personalizado, puede mejorar el reconocimiento de voz utilizando los dos modelos juntos. Cuando entrena un modelo acústico personalizado, puede especificar un modelo de lenguaje personalizado que incluya transcripciones de los recursos de audio o un vocabulario de palabras específicas del dominio procedentes de los recursos. De forma similar, cuando transcribe el audio, el servicio acepta un modelo de lenguaje personalizado, un modelo acústico personalizado, o ambos. Y, si su modelo de lenguaje personalizado incluye una gramática, puede utilizar este modelo y esta gramática con un modelo acústico personalizado para el reconocimiento de voz.

Para obtener más información, consulte Uso conjunto de modelos acústicos y de lenguaje personalizados

Actualización de modelos personalizados

Para mejorar la calidad del reconocimiento de voz, el servicio actualiza ocasionalmente los modelos de voz grandes de base, los modelos de la generación anterior y los de la siguiente generación. Una actualización de un modelo base sólo afecta a ese modelo. La actualización no afecta a ningún otro modelo de los mismos o diferentes idiomas.

Una actualización de un modelo base puede requerir que actualice los modelos personalizados que se basan en ese modelo base para aprovechar las mejoras. Una actualización de un modelo base que requiere una actualización produce una nueva versión del modelo base. Una actualización que no requiere una actualización no produce una nueva versión.

  • Para modelos de la generación anterior, todas las actualizaciones de un modelo base producen una nueva versión del modelo. Cuando se publica una nueva versión de un modelo base, debe actualizar cualquier idioma personalizado y modelos acústicos personalizados que se crean en el modelo base actualizado para aprovechar las mejoras.
  • Para los modelos de voz grandes y los modelos de próxima generación, la mayoría de las actualizaciones no producen una nueva versión del modelo. Estas actualizaciones no requieren que actualice los modelos personalizados. Sin embargo, algunas actualizaciones generan una nueva versión de un modelo base. Debe actualizar los modelos de idioma personalizados que se crean en el modelo base actualizado para aprovechar las mejoras.

Todas las actualizaciones de los modelos base y si requieren actualizaciones se anuncia en las notas del release:

Una vez que se actualiza un modelo personalizado, el servicio utiliza la última versión del modelo personalizado de forma predeterminada cuando se especifica ese modelo con una solicitud de reconocimiento de voz. Pero todavía puede indicar al servicio que utilice la versión anterior del modelo. Para obtener más información sobre cómo actualizar modelos personalizados y sobre cómo utilizar una versión anterior de un modelo, consulte