Migración a modelos de voz de gran tamaño
A partir del 1 de agosto de 2023, todos los modelos de generación anterior se han dejado del servicio. Los nuevos clientes ahora solo deben utilizar los modelos de voz grandes o los modelos de próxima generación. Ahora todos los clientes existentes deben migrar al modelo de voz grande equivalente o al modelo de próxima generación. Para obtener más información, consulte Migración a modelos de voz grandes.
Debe migrar su uso de cualquier modelo obsoleto de la generación anterior a los modelos equivalentes de gran voz o a los modelos de próxima generación antes del 31 de julio de 2023, fecha de fin de servicio. Los modelos de próxima generación proporcionan una precisión y un rendimiento de transcripción notablemente mejor. Pero actualmente proporcionan ligeramente menos características que los modelos de la generación anterior.
En este tema se proporciona una visión general de los pasos que debe realizar para migrar de modelos anteriores a los de la próxima generación. Para obtener más información sobre la migración, también puede consultar Watson Speech to Text: Cómo planificar su migración a los modelos de próxima generación.
Paso 1: Identificar el modelo de voz grande o el modelo de próxima generación al que migrar
En los siguientes temas se describen todos los modelos de gran voz, los anteriores y los de nueva generación:
- Idiomas y modelos de la generación anterior
- Idiomas y modelos de próxima generación
- Modelos y lenguajes de voz grandes
En las tablas de Modelos lingüísticos de generaciones anteriores soportados se enumera el modelo de voz de gran tamaño recomendado o el modelo de próxima generación al que migrar desde un modelo de generación anterior. Utilice el modelo de voz grande indicado o el modelo de próxima generación en las solicitudes de reconocimiento de voz.
El servicio sigue poniendo a disposición nuevos modelos de grandes discursos. Todos los modelos nuevos se identifican en las notas del release y en las tablas que describen los modelos disponibles.
De forma óptima, migra de un modelo de banda estrecha/modelo de telefonía a un modelo de voz grande, y de un modelo de banda ancha/modelo multimedia a un modelo de voz grande. Sin embargo, no todos los modelos de banda ancha y los modelos multimedia tienen modelos de voz grandes equivalentes. En tales casos, puede migrar de un modelo de banda estrecha a un modelo de telefonía, o de un modelo de banda ancha a un modelo multimedia. El servicio reduce la resolución del audio que envía a la frecuencia del modelo que utiliza. Por lo tanto, el envío de audio de banda ancha a un modelo de telefonía podría resultar una alternativa suficiente en los casos en que no exista actualmente ningún modelo multimedia equivalente.
Por ejemplo, la siguiente solicitud de reconocimiento de voz utiliza el en-US_NarrowbandModel de la generación anterior:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel"
Para utilizar el modelo equivalente de habla grande en-US, basta con cambiar el valor que se pasa con el model parámetro de consulta:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US"
Paso 2: Identificar las funciones disponibles en los modelos de voz de gran tamaño
Los modelos de voz grandes admiten ligeramente menos características y parámetros que los modelos anteriores y de próxima generación. Sin embargo, aunque carecen de paridad total, la mayoría de las características están disponibles con ambos tipos de modelos. Y cuando una característica se limita a un subconjunto de lenguas, las limitaciones se aplican por igual a todos los tipos de modelos.
Para obtener información sobre las características soportadas con los distintos tipos de modelo, consulte
- Características soportadas para modelos de la generación anterior
- Características soportadas para modelos de próxima generación
- Características soportadas para modelos de voz grandes
- Resumen de parámetros
El servicio continúa poniendo a disposición nuevas funciones con los modelos de próxima generación. Todas las actualizaciones del soporte de características se documentan en las notas del release y en la documentación de los tipos de modelo.
Para migrar a modelos de próxima generación, debe eliminar las características que no están soportadas por estos modelos de las solicitudes de reconocimiento de voz. También puede considerar la posibilidad de utilizar características como el sesgo de inserción de caracteres que sólo están disponibles con modelos de voz de gran tamaño y modelos de próxima generación.
Por ejemplo, la siguiente solicitud de reconocimiento de voz utiliza los parámetros profanity_filter, redaction y word_alternatives_threshold con el en-US_NarrowbandModel de la generación anterior:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&profanity_filter=true&redaction=true&word_alternatives_threshold=0.50"
Sólo el parámetro word_alternatives_threshold no está soportado por modelos de voz grandes. Para utilizar el modelo equivalente de habla grande en-US_Telephony modelo, sólo tiene que cambiar el valor que se pasa con
el model parámetro de consulta y eliminar el word_alternatives_threshold parámetro:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US&profanity_filter=true&redaction=true"
Paso 3: Volver a crear los modelos de idioma personalizados que utilice
Debe volver a crear los modelos lingüísticos personalizados que se basen en modelos de la generación anterior o de la siguiente, basándolos en los modelos equivalentes de gran voz. Para ello, deberá crear un nuevo modelo lingüístico personalizado y añadir sus corpus y palabras personalizadas del modelo antiguo al nuevo modelo.
En general, los grandes modelos del habla no dependen tanto de modelos lingüísticos personalizados. Utilizan un enfoque diferente para la transcripción que minimiza la necesidad de personalización del modelo de idioma.
Los grandes modelos del habla no admiten modelos acústicos personalizados. Debido a cómo los modelos transcriben audio, la personalización del modelo acústico no es necesaria.
Por ejemplo, la siguiente solicitud de reconocimiento de voz utiliza un modelo de idioma personalizado basado en en-US_NarrowbandModel. En este ejemplo, el modelo personalizado tiene el identificador 8acf31fa-0aa2-4ecc-a805-1f527f342dba.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&language_customization_id=8acf31fa-0aa2-4ecc-a805-1f527f342dba"
Después de volver a crear el modelo de idioma personalizado con el modelo en-US equivalente, simplemente actualice el nombre del modelo a en-US y el parámetro language_customization_ID para utilizar el
identificador del nuevo modelo personalizado, 636d8494-7e53-436a-8557-30d6b2a63cd7:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US&language_customization_id=636d8494-7e53-436a-8557-30d6b2a63cd7"
Paso 4: Evaluar los resultados del modelo de voz grande
Una vez que haya actualizado sus solicitudes de reconocimiento de voz para utilizar modelos de voz de gran tamaño, eliminado los parámetros no compatibles y vuelto a crear cualquier modelo de lenguaje personalizado, podrá experimentar con el reconocimiento de voz basado en modelos anteriores y de nueva generación. Compare las transcripciones resultantes para determinar si el modelo de habla grande produce resultados equivalentes o mejores. Tenga en cuenta también el rendimiento de las solicitudes que utilizan un modelo de voz de gran tamaño para determinar la rapidez con la que recibe los resultados.
También puede comparar la tasa de error de palabra de los grandes modelos de habla, los resultados anteriores y los de la próxima generación. El código abierto Utilidad de tasa de error de palabra(WER), disponible en Python, puede ayudarle a medir y comparar la precisión de sus resultados.