Notas del release de Speech to Text para IBM Cloud

IBM Cloud

Se han incluido las siguientes características y cambios en cada versión y actualización de las instancias gestionadas de IBM Watson® Speech to Text alojadas en IBM Cloud, así como en las instancias alojadas en IBM Cloud Pak for Data como servicio. A menos que se indique lo contrario, todos los cambios son compatibles con releases anteriores y están disponibles de forma automática y transparente para todas las aplicaciones nuevas y existentes.

Para obtener información sobre las limitaciones conocidas del servicio, consulte Limitaciones conocidas.

Para obtener información sobre releases y actualizaciones del servicio para IBM Cloud Pak for Data, consulte Notas del release de Speech to Text for IBM Cloud Pak for Data.

29 de junio de 2026

Nuevo parámetro « parameter_set » para modelos de voz de gran tamaño

Los modelos de voz de gran tamaño incluyen ahora un parámetro de solicitud « parameter_set » que aplica ajustes optimizados en una sola llamada. Utiliza « parameter_set=enhanced » para mejorar la calidad del reconocimiento sin tener que configurar manualmente cada parámetro por separado.

26 de junio de 2026

low_latency El modo ya está disponible para el modelo de voz grande en inglés de EE. UU

El modelo de voz grande en inglés de EE. UU. « en-US » incluye ahora el mod low_latency, que permite un procesamiento de voz más rápido.

15 de mayo de 2026

Ya está disponible el modelo de voz grande para italiano

El gran modelo de habla para el italiano, it-IT, ya está disponible de forma generalizada (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.

10 de abril de 2026

Ya está disponible el modelo de voz grande para neerlandés

El gran modelo de habla para neerlandés, nl-NL, ya está disponible de forma general (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.

07 de abril de 2026

Corrección de defectos: Se ha corregido un problema por el que fille se reconoce incorrectamente en el reconocimiento de secuencias alfanuméricas en francés con la función de formato inteligente.

17 de marzo de 2026

Mejora del modelo de gran lengua francesa
Ya están disponibles las mejoras de los Large Language Models (LSM) franceses fr-FR y fr-CA para aumentar la precisión en el reconocimiento de secuencias alfanuméricas.

Corrección de defectos: Se ha corregido un problema en la identificación de idiomas (LID) por el que se observaban errores intermitentes en 5xx cuando a una solicitud /v1/recognize?language_identification=true le seguía inmediatamente una solicitud normal /v1/recognize.

Corrección de defectos: Se ha corregido un problema por el que se observaban errores internos del servidor con el parámetro max_active.

Corrección de defectos: Se ha corregido un problema por el que se devolvían erróneamente errores internos del servidor cuando include_transparent_words estaba configurado como true.

04 de marzo de 2026

Mejoras de los modelos alemán y neerlandés de voz a texto

Ya están disponibles las mejoras de los modelos de voz a texto en alemán y neerlandés.

  • Ya están disponibles las mejoras del Large Speech Model (LSM) alemán de-DE para el reconocimiento de secuencias alfanuméricas y casos de uso general.
  • Ya están disponibles las mejoras de la telefonía holandesa nl-NL_Telephony para el reconocimiento de secuencias alfanuméricas y el tratamiento de la saliencia.

16 de febrero de 2026

Ya está disponible el modelo de voz grande para alemán

El gran modelo de habla para alemán, de-DE, ya está disponible de forma generalizada (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.

Mejoras del enriquecimiento de las transcripciones orales

Las mejoras en el enriquecimiento de transcripciones de voz están ahora disponibles para entidades con nombre, incluidas fechas, hora, moneda, números y medidas. Estas entidades se gestionan ahora correctamente según la configuración regional del idioma.

22 de enero de 2026

Corrección de defectos: Se ha corregido un problema por el que el enriquecimiento de la transcripción del habla falla cuando el parámetro del modelo está ausente en las solicitudes.

Corrección de defectos: Se ha corregido un problema por el que se observaba un mayor tiempo de entrenamiento de la personalización de voz a texto (STT) debido a fallos internos por falta de memoria.

08 de enero de 2026

Corrección de defectos: Se ha corregido un problema en el enriquecimiento de transcripciones de voz en el centro de datos de Fráncfort.

Corrección de defectos: Se ha corregido un problema en interim_results por el que no se enviaban las transcripciones finales de los discursos cuando interim_results se establecía en false.

10 de diciembre de 2025

Validación de campos de entrada para la función sounds_like

La función de validación de campos de entrada para sounds_like ahora está habilitada para idiomas adicionales.

  • La validación de campos de entrada para la función sounds_like está habilitada para idiomas adicionales, incluidos los modelos de en-US, en-AU, en-GB, en-IN, es-ES, es-AR, es-CL, es-CO, es-MX, es-PE, fr-FR_Telephony, fr-FR_Multimedia, de-DE_Telephony, de-DE_Multimedia, it-IT_Telephony, it-IT_Multimedia y nl-NL_Telephony.

25 de noviembre de 2025

Ya están disponibles los resultados provisionales de Large Speech Models

Ya están disponibles los resultados provisionales de los grandes modelos del habla (LSM).

  • interim_results antes sólo estaba habilitado para los modelos de nueva generación. Ahora, también está habilitado para los LSM. Para obtener más información, consulte Resultados provisionales.

03 de noviembre de 2025

La detección de eventos de inicio de habla ya está disponible para los modelos STT.

La detección de eventos de inicio de habla ya está disponible para los modelos STT.

  • Mediante la detección de eventos de inicio de habla, ahora puede recibir una notificación anticipada con la API recognize que detecta el inicio del habla en el flujo de audio entrante y envía una notificación al usuario. Para obtener más información, consulte Detección de eventos de inicio de habla.
Mejoras en la detección de la actividad del habla para una respuesta más rápida, una mayor precisión y un mejor rendimiento en entornos ruidosos.

La detección de actividad del habla (SAD) se ha actualizado para incluir un nuevo método mejorado además del método existente en la API Speech To Text recognize.

  • El nuevo método aumenta la precisión y el rendimiento en la detección de los límites del habla dentro del flujo de audio. Puede utilizarse configurando sad_module:2. Para obtener más información, consulta « Detección de actividad del habla(SAD) ».
La identificación de la lengua hablada ya está disponible de forma generalizada

La identificación de la lengua hablada ya está disponible de forma generalizada.

  • La identificación lingüística (LID) detecta automáticamente la lengua hablada en los flujos de audio. El modelo procesa continuamente el audio entrante y devuelve la lengua identificada cuando alcanza un nivel de confianza superior al umbral especificado ( 0.99 por defecto). Para más información, consulte Identificación de la lengua hablada.

07 de octubre de 2025

hints ya está disponible de forma general

El parámetro hints ya está disponible de forma generalizada.

  • hints mejora el posprocesamiento con Smart Formatter. Este parámetro ayuda al formateador a interpretar la intención del usuario con mayor precisión y a devolver resultados que se ajusten mejor a las expectativas. Para más información, consulte el parámetro Consejos.

26 de septiembre de 2025

El enriquecimiento de las transcripciones orales ya está disponible de forma generalizada

El enriquecimiento de la transcripción de discursos ya está disponible de forma generalizada.

  • La función de enriquecimiento de transcripciones de voz mejora la legibilidad y facilidad de uso de las transcripciones sin procesar del reconocimiento automático de voz (ASR). Este servicio de posprocesamiento añade automáticamente signos de puntuación y aplica mayúsculas inteligentes para mejorar la estructura y claridad del contenido hablado. Para más información, consulte Enriquecimiento de la transcripción oral.

09 de septiembre de 2025

Corrección de defectos: Se ha corregido un problema en Smart Formatter para el modelo de idioma Fr-CA por el que los números de 8 dígitos se formateaban incorrectamente con ceros adicionales. El formateador inteligente devuelve ahora la transcripción correcta.

19 de agosto de 2025

Corrección de defectos: Se ha corregido un problema en Smart Formatter por el que los valores numéricos hablados en las transacciones se transcribían incorrectamente. Por ejemplo, one hundred and ninety-nine and twelve cents debería transcribirse como $199.12, pero aparecía incorrectamente como 199 e R$ 0,12. El formateador inteligente devuelve ahora la transcripción correcta.

Corrección de defectos: Se ha corregido un problema en el formateador inteligente para los modelos en francés por el que la palabra "cent" se formateaba incorrectamente. Por ejemplo, quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit se transcribió como 89450328 100 1678 en lugar del esperado 8945032811678. El formateador inteligente devuelve ahora la transcripción correcta.

22 de julio de 2025

Corrección de defectos: Se ha corregido el error del modelo personalizado ja-JP, provocado por el carácter de espacio completo ( U+3000 ).

Corrección de defectos: Se ha corregido el problema de formato del correo electrónico portugués del formateador inteligente, por el que se introducían espacios de más en las direcciones de correo electrónico. Para más información, véase Formateador inteligente para portugués.

08 de julio de 2025

Mejoras en el reconocimiento de entidades con nombre para el modelo de gran voz inglés

Incluye mejoras en el reconocimiento de ciudades, direcciones, nombres de calles, caracteres alfanuméricos, fechas y nombres y apellidos.

Corrección de defectos: Formateador Inteligente Español Modelo de Gran Voz (es-ES) formato de fecha

Corrección de defectos: el primero de enero de dos mil-> el 01/01/2000 debe formatearse como 01/01/2000. Este problema se ha corregido. Para más información, consulte Formateador inteligente para español.

17 de junio de 2025

Corrección de defectos: La asignación de valor para la Versión del Formateador Inteligente, que estaba provocando un error de inserción, resultando en el procesamiento fallido de solicitudes específicas. Este problema está solucionado. Las solicitudes del formateador inteligente ahora responden como se espera.

Corrección de defectos: En el formateador inteligente, se observaban espacios no deseados en caracteres alfanuméricos. Por ejemplo, l k k one one five zero zero four two l e-> lkk1 150042le. Este problema está solucionado. Las solicitudes del formateador inteligente ahora responden como se espera.

28 de mayo de 2025

Ya está disponible el nuevo modelo de gran voz para japonés

Ya está disponible el modelo de habla grande para japonés.

Mejora: Se añade un mejor manejo del Formateador Inteligente para frases de letras habladas - a as in alpha-> a.

29 de abril de 2025

Corrección de defectos: Se corrigen varios problemas de desambiguación de letras, dígitos o símbolos en el formateador inteligente

Corrección de defectos: Se solucionan los siguientes problemas:

  • 'O' se formateó como el dígito 0
  • 'a real' se formateó como ' r1 '
  • 'colonoscopia' se formateó como ':oscopia'

07 de abril de 2025

Corrección de defectos: Se ha detectado una fuente inesperada en OOV
Corrección de defectos: Cuando se añadía un corpus a un modelo personalizado, las palabras OOV eliminadas anteriormente se restauraban sin querer desde la fuente anterior. Este problema se ha corregido.

18 de marzo de 2025

Corrección de defectos: Se corrigen los problemas del formateador inteligente con fechas y números adicionales en el modelo en-us.
Corrección de defectos: El formateo se desactiva cuando el total de dígitos es superior a la fecha formateada requerida. Por ejemplo, five twelve fifteen eleven-> 5 1/2/1511 debe ser: 5121511.

11 de febrero de 2025

Corrección de defectos: Se ha observado un gran número de 503’s, concretamente para el ja-JP_NarrowbandModel. Se han introducido mejoras en el servicio para aumentar la disponibilidad de este modelo.

Corrección de defectos: Se ha encontrado un error de asignación de memoria de personalización STT para el modelo en-US_Telephony. Este problema está solucionado.

Corrección de defectos: Se observó un problema del formateador inteligente con las abreviaturas en el modelo en-us (Dr. se corrigió a Doctor). Este problema está solucionado.

14 de enero de 2025

Mejora: Se han actualizado los alfanuméricos de las instancias en las que el formateador inteligente combinaba algunas combinaciones de números pronunciados individualmente - 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203. Este problema se ha solucionado.

Corrección de defectos: El tiempo de ejecución no envía todas las hipótesis
Corrección de defectos: Algunas palabras faltaban en las transcripciones debido a un problema con las marcas de tiempo de transcripción en los casos en los que las palabras clave tenían puntuaciones de confianza diferentes a las de la hipótesis. El resultado era que la transcripción devolvía una sola palabra yes, aunque el audio contuviera dos palabras yes. Se ha introducido una mejora en la lógica de eliminación de marcas de tiempo para corregir este problema.

19 de noviembre de 2024

Ya está disponible el nuevo modelo de grandes discursos en alemán

El modelo de gran discurso para alemán ya está disponible de forma generalizada.

Corrección de defectos: Mejora de la lógica de muestreo ascendente ( 8khz a 16khz ) para el modelo de gran voz inglesa multibanda

Corrección de defectos: La lógica de muestreo ascendente en el servicio es necesaria para que el modelo gestione tanto 8khz como 16khz.

05 de noviembre de 2024

Corrección de defectos: Las etiquetas de los altavoces desactivan los resultados provisionales de los LSM y los RNNT
Corrección de defectos: Se ha detectado un problema por el que los resultados provisionales dejaban de llegar cuando se activaban las etiquetas de altavoz. El problema se ha solucionado y ahora el servicio devuelve resultados provisionales inmediatamente cuando se utilizan etiquetas de altavoz.

23 de agosto de 2024

Todos los modelos de voz de gran tamaño ya están disponibles para el público en general

Los grandes modelos del habla para todas las lenguas ya están generalmente disponibles (GA). Están soportados para su uso en entornos de producción y aplicaciones.

18 de junio de 2024

Los nuevos modelos de voz grandes para portugués y español de Brasil están ahora en fase beta abierta

Los grandes modelos de habla para portugués brasileño y español están ahora en beta abierta. El español incluye los dialectos castellano, argentino, chileno, colombiano, mexicano y peruano.

15 de mayo de 2024

El modelo de voz grande para inglés está ahora disponible de forma general

El modelo de gran habla para el inglés, que incluye los dialectos de Estados Unidos, Australia, India y Reino Unido, ahora está disponible en general (GA). Se recomienda su uso en entornos de producción y aplicaciones.

07 de marzo de 2024

Modelo de voz grande para inglés de EE.UU. en Open Beta
El nuevo modelo Large speech para el inglés de EE.UU. está en beta abierta. Consulte Idiomas y modelos de voz grandes para obtener más detalles con las características soportadas (beta).

30 de noviembre de 2023

Parámetro Speech to Text speech_begin_event

Este parámetro permitiría a la aplicación cliente saber que se han detectado algunas palabras o habla y que Speech to Text está en proceso de descodificación. Para obtener más detalles, consulte Utilización de parámetros de reconocimiento de voz.

Parámetro 'mapping_only' para palabras personalizadas

Utilizando el parámetro 'mapping_only', puede utilizar palabras personalizadas directamente para mapear 'sounds_like' (o palabra) a valor 'display_as' como post-procesamiento en lugar de entrenamiento. Para obtener más información, consulte El recurso de palabras.

Consulte las directrices para No japonés y Japonés.

Soporte para el portugués de Brasil y el francés de Canadá en la nueva personalización del modelo de idioma de próxima generación mejorada

Recientemente se ha añadido la personalización del modelo de idioma para los modelos de próxima generación de Brasil-Portugués y Francés-Canadiense. Esta actualización de servicio incluye mejoras internas adicionales.

Nueva característica de formato inteligente

Se da soporte a una nueva característica de formato inteligente para los modelos de próxima generación en inglés de Estados Unidos, portugués de Brasil, francés y alemán. Consulte Versión de formato inteligente para obtener más detalles.

Soporte para español castellano y español LATAM en la nueva personalización del modelo de idioma de próxima generación mejorada

Se añade la personalización del modelo de idioma para los modelos castellano español y LATAM español de próxima generación. Esta actualización de servicio incluye mejoras internas adicionales.

Modelos de voz de gran tamaño para inglés, japonés y francés - para acceso anticipado

Para la característica de acceso anticipado, los modelos de voz grandes están disponibles para los idiomas inglés, japonés y francés en IBM Watson Speech-to-Text e IBM watsonx Assistant. El conjunto de características para estos modelos de habla grande es limitado, pero más preciso que los modelos de próxima generación y es más rápido y más barato de ejecutar debido a un tamaño más pequeño y una mejor capacidad de modo de transmisión.

Si está interesado en probar estos modelos base y en compartir resultados y comentarios, póngase en contacto con nuestro equipo de gestión de productos rellenando este formulario.

28 de julio de 2023

Importante: Todos los modelos de generación anterior se han dejado de mantener a partir del 1 de agosto de 2023
Importante: Todos los modelos de generación anterior ahora se han dejado de mantener del servicio. Los nuevos clientes ahora sólo deben utilizar los modelos de próxima generación. Ahora todos los clientes existentes deben migrar al modelo de próxima generación equivalente. Para obtener más información sobre todos los modelos de próxima generación, consulte Idiomas y modelos de próxima generación. Para obtener más información sobre cómo migrar a los modelos de próxima generación, consulte Migración a modelos de próxima generación.

9 de junio de 2023

Arreglo de defectos: la creación y el entrenamiento de un modelo de lenguaje personalizado ahora es óptimo para los modelos estándar y de baja latencia de próxima generación
Arreglo de defectos: al crear y entrenar un modelo de lenguaje personalizado con archivos de texto corpus y/o palabras personalizadas utilizando un modelo de baja latencia de próxima generación, ahora está funcionando de la misma forma que con un modelo estándar. Anteriormente, no era óptimo sólo cuando se utilizaba un modelo de baja latencia de Next-Generation.
Arreglo de defecto: las sesiones de sockets web STT ya no fallan debido a un mensaje de error de tensor
Arreglo de defectos: Cuando se utilizan websockets STT, las sesiones ya no fallan debido a un mensaje de error "STT devuelve el error: los tamaños de tensores deben coincidir excepto en la dimensión 0".

18 de mayo de 2023

Actualizaciones del modelo de telefonía médica de próxima generación en inglés

El modelo de telefonía médica de última generación en inglés se ha actualizado para mejorar el reconocimiento de voz:

  • en-WW_Medical_Telephony
Se ha añadido soporte para francés y alemán en la nueva personalización de modelo de lenguaje de próxima generación mejorada

Recientemente se ha añadido la personalización del modelo de idioma para los modelos de próxima generación en francés y alemán. Esta actualización de servicio incluye mejoras internas adicionales.

Para obtener más información sobre las mejoras en la personalización de última generación, consulta

Arreglo de defecto: las palabras personalizadas que contienen caracteres Katakana de media anchura ahora devuelven un mensaje de error claro con el modelo de telefonía japonés

Arreglo de defectos: En la documentación, sólo se aceptan caracteres Katakana de ancho completo en palabras personalizadas y los modelos de la siguiente generación ahora muestran un mensaje de error para explicar que no está soportado. Anteriormente, al crear palabras personalizadas que contenían caracteres Katakana de media anchura, no se proporcionaba ningún mensaje de error.

Arreglo de defectos: el modelo de idioma de telefonía japonés ya no falla debido a un largo tiempo de entrenamiento

Arreglo de defectos: Cuando se entrena un modelo de lenguaje personalizado con la telefonía japonesa, el servicio maneja ahora de forma eficaz un gran número de palabras personalizadas sin fallar.

2 de mayo de 2023

Nuevo procedimiento para actualizar un modelo personalizado que se basa en un modelo de próxima generación mejorado

Ahora hay dos enfoques disponibles para actualizar un modelo de lenguaje personalizado a un modelo base de próxima generación mejorado. Todavía puede modificar y, a continuación, volver a entrenar el modelo personalizado, como ya se ha documentado. Pero ahora, también puede actualizar el modelo personalizado incluyendo el parámetro de consulta force=true con la solicitud POST /v1/customizations/{customization_id}/train. El parámetro force actualiza el modelo personalizado independientemente de si contiene cambios (está en el estado ready o available ).

Para obtener más información, consulte Actualización de un modelo de lenguaje personalizado basado en un modelo de próxima generación mejorado.

Guía para añadir palabras a modelos personalizados que se basan en modelos de próxima generación mejorados

La documentación ahora ofrece más orientación sobre la adición de palabras a modelos personalizados que se basan en modelos de próxima generación mejorados. Por razones de rendimiento durante el entrenamiento, la guía fomenta el uso de corpus en lugar de la adición directa de palabras personalizadas siempre que sea posible.

Para obtener más información, consulte Directrices para añadir palabras a modelos personalizados basados en modelos de próxima generación mejorados.

Las palabras personalizadas en japonés para modelos personalizados que se basan en modelos de próxima generación mejorados se manejan de forma diferente

Para los modelos personalizados en japonés que se basan en modelos de próxima generación, las palabras personalizadas se manejan de forma diferente a otros idiomas. Para el japonés, puede añadir una palabra o sonidos personalizados que no superen los 25 caracteres de longitud. Si la palabra o los sonidos personalizados superan ese límite, el servicio añade la palabra al modelo personalizado como si se añadiera mediante un corpus. La palabra no aparece como una palabra personalizada para el modelo.

Para obtener más información, consulte Directrices para añadir palabras a modelos en japonés basados en modelos de próxima generación mejorados.

12 de abril de 2023

Arreglo de defecto: la interfaz WebSocket ahora excede el tiempo de espera como se esperaba cuando se utilizan modelos de próxima generación
Arreglo de defectos: cuando se utiliza para el reconocimiento de voz con modelos de próxima generación, la interfaz WebSocket ahora excede el tiempo de espera como se esperaba después de largos periodos de silencio. Anteriormente, cuando se utilizaba para el reconocimiento de voz de archivos de audio cortos, la sesión WebSocket no podía agotar el tiempo de espera. Cuando la sesión no ha podido agotar el tiempo de espera, el servicio no ha devuelto una hipótesis final a la aplicación cliente en espera y, en su lugar, el cliente ha excedido el tiempo de espera mientras esperaba los resultados.

6 de abril de 2023

Arreglo de defectos: límites para permitir la finalización del entrenamiento para modelos personalizados japoneses de próxima generación

Arreglo de defectos: el entrenamiento satisfactorio de un modelo de idioma personalizado japonés de próxima generación requiere que las palabras y los sonidos personalizados añadidos al modelo no contengan más de 25 caracteres cada uno. Para el entrenamiento más efectivo, se recomienda que las palabras personalizadas y los sonidos-me gusta no contengan más de 20 caracteres. El entrenamiento de modelos personalizados japoneses con palabras y sonidos personalizados más largos-me gusta no se completa después de varias horas de entrenamiento.

Si necesita añadir el equivalente de una palabra larga o sonidos similares a un modelo personalizado japonés de próxima generación, siga estos pasos:

  1. Añada una palabra o sonidos más cortos-como que captura la esencia de la palabra o sonidos más largos-como al modelo personalizado.
  2. Añada una o más frases que utilicen la palabra o sonidos más largos a un corpus.
  3. Considere la posibilidad de añadir frases al corpus que proporcionen más contexto para la palabra o los sonidos. Un mayor contexto proporciona al servicio más información con la que reconocer la palabra y aplicar los sonidos correctos.
  4. Añade el corpus al modelo personalizado.
  5. Vuelva a entrenar el modelo personalizado en la combinación de la palabra o los sonidos más cortos y el corpus que contiene la serie más larga.

Los límites y pasos que se acaban de describir permiten que los modelos personalizados japoneses de próxima generación completen el entrenamiento. Tenga en cuenta que la adición de un gran número de nuevas palabras personalizadas a un modelo de lenguaje personalizado aumenta el tiempo de entrenamiento del modelo. Pero el aumento del tiempo de entrenamiento sólo se produce cuando el modelo personalizado se entrena inicialmente en las nuevas palabras. Una vez que el modelo personalizado se ha entrenado en las nuevas palabras, el tiempo de entrenamiento vuelve a la normalidad.

For more information, see

Mejoras adicionales en la personalización del modelo de lenguaje de próxima generación actualizada

La personalización del modelo de idioma para los modelos de próxima generación en inglés y japonés se ha mejorado recientemente. Esta actualización de servicio incluye mejoras internas adicionales. Para obtener más información sobre las mejoras en la personalización de última generación, consulta

13 de marzo de 2023

Arreglo de defectos: el formato inteligente para las fechas en inglés de EE.UU. ahora es correcto
Arreglo de defectos: el formato inteligente ahora incluye correctamente los días de la semana y las fechas en las que ambos están presentes en el audio hablado, por ejemplo, Tuesday February 28. Anteriormente, en algunos casos se omitía el día de la semana y la fecha se presentaba de forma incorrecta. Tenga en cuenta que el formateo inteligente es funcionalidad beta.
Arreglo de defectos: actualizar documentación para palabras de vacilación de voz para modelos de próxima generación
Arreglo de defectos: se ha actualizado la documentación de las palabras de vacilación de voz para los modelos de próxima generación. Se proporcionan más detalles sobre las palabras de vacilación en inglés y japonés de Estados Unidos. Los modelos de próxima generación incluyen las palabras de duda reales en los resultados de transcripción, a diferencia de los modelos de generación anterior, que incluyen sólo marcadores de duda. Para obtener más información, consulte Titubeos y marcadores de duda.

27 de febrero de 2023

Nuevo modelo japonés de telefonía de última generación

El servicio ofrece ahora un modelo de telefonía de última generación para los japoneses: ja-JP_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta

Personalización mejorada del modelo de idioma para modelos en inglés y japonés de próxima generación

El servicio ahora proporciona una personalización mejorada del modelo de idioma para los modelos en inglés y japonés de próxima generación:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Mejoras visibles en los modelos: la nueva tecnología mejora el comportamiento predeterminado de los nuevos modelos en inglés y japonés. Entre otros cambios, la nueva tecnología optimiza el comportamiento predeterminado para los siguientes parámetros:

  • El customization_weight predeterminado para los modelos personalizados que se basan en las nuevas versiones de estos modelos cambia de 0.2 a 0.1.
  • El character_insertion_bias predeterminado para los modelos personalizados que se basan en las nuevas versiones de estos modelos sigue siendo 0.0, pero los modelos han cambiado de una forma que hace que el uso del parámetro para el reconocimiento de voz sea menos necesario.

Actualización a los nuevos modelos: Para aprovechar la tecnología mejorada, debe actualizar los modelos de lenguaje personalizados que se basan en los nuevos modelos. Para actualizar a la nueva versión de uno de estos modelos base, haga lo siguiente:

  1. Cambie el modelo personalizado añadiendo o modificando una palabra, corpus o gramática personalizada que contenga el modelo. Cualquier cambio que realice mueve el modelo al estado ready.
  2. Utilice el método POST /v1/customizations/{customization_id}/train para volver a entrenar el modelo. Volver a entrenar actualiza el modelo personalizado a la nueva tecnología y mueve el modelo al estado available.

Problema conocido: En este momento, no puede utilizar el método POST /v1/customizations/{customization_id}/upgrade_model para actualizar un modelo personalizado a uno de los nuevos modelos base. Este problema se solucionará en una próxima versión.

Utilización de los nuevos modelos: Después de la actualización al nuevo modelo base, se le recomienda que evalúe el rendimiento del modelo personalizado actualizado prestando especial atención a los parámetros customization_weight y character_insertion_bias para el reconocimiento de voz. Cuando vuelva a entrenar el modelo personalizado:

  • El modelo personalizado utiliza el nuevo customization_weight predeterminado de 0.1 para el modelo personalizado. Se elimina un customization_weight no predeterminado que tenía asociado con el modelo personalizado.
  • Es posible que el modelo personalizado ya no requiera el uso del parámetro character_insertion_bias para un reconocimiento de voz óptimo.

Las mejoras en la personalización del modelo de lenguaje hacen que estos parámetros sean menos importantes para el reconocimiento de voz de alta calidad:

  • Si utiliza los valores predeterminados para estos parámetros, continúe haciéndolo después de la actualización. Los valores predeterminados probablemente seguirán ofreciendo los mejores resultados para el reconocimiento de voz.
  • Si especifica valores no predeterminados para estos parámetros, experimente con los valores predeterminados después de la actualización. El modelo personalizado puede funcionar bien para el reconocimiento de voz con los valores predeterminados.

Si cree que el uso de valores diferentes para estos parámetros puede mejorar el reconocimiento de voz con el modelo personalizado, experimente con cambios incrementales para determinar si los parámetros son necesarios para mejorar el reconocimiento de voz.

Nota: En este momento, las mejoras en la personalización del modelo de lenguaje sólo se aplican a los modelos personalizados que se basan en los modelos de idioma base en inglés o japonés de próxima generación listados anteriormente. Con el tiempo, las mejoras estarán disponibles para otros modelos de lenguaje de próxima generación.

Más información: Para obtener más información sobre la actualización y el reconocimiento de voz con estos parámetros, consulte

Arreglo de defecto: los archivos de gramática ahora manejan series de dígitos correctamente

Arreglo de defectos: cuando se utilizan gramáticas, el servicio ahora maneja correctamente series más largas de dígitos. Anteriormente, no se podía completar el reconocimiento o devolver resultados incorrectos.

15 de febrero de 2023

Importante: Todos los modelos de generación anterior están en desuso y llegarán al final del servicio el 31 de julio de 2023

Importante: Todos los modelos de generación anterior están en desuso y llegarán al final del servicio a partir del 31 de julio de 2023. En esa fecha, todos los modelos de generación anterior se eliminarán del servicio y de la documentación. La fecha de desuso anterior era el 3 de marzo de 2023. La nueva fecha permite a los usuarios más tiempo para migrar a los modelos de próxima generación adecuados. Pero los usuarios deben migrar al modelo de próxima generación equivalente antes del 31 de julio de 2023.

La mayoría de los modelos de generación anterior quedaron en desuso el 15 de marzo de 2022. Anteriormente, los modelos árabe y japonés no estaban en desuso. Ahora la característica en desuso se aplica a todos los modelos de generación anterior.

Nota: Cuando el modelo de la generación anterior en-US_BroadbandModel deje de estar disponible, el modelo de la próxima generación en-US_Multimedia pasará a ser el modelo predeterminado para las solicitudes de reconocimiento de voz.

Arreglo de defectos: Tiempo de entrenamiento mejorado para modelos de lenguaje personalizado de próxima generación

Arreglo de defectos: El tiempo de entrenamiento para los modelos de lenguaje personalizado de próxima generación ahora ha mejorado significativamente. Anteriormente, el tiempo de entrenamiento tardaba mucho más de lo necesario, como se informó para el entrenamiento de modelos de lenguaje personalizado japonés. El problema se ha corregido mediante un arreglo interno.

Arreglo de defectos: los archivos de gramática generados dinámicamente ahora funcionan correctamente

Arreglo de defectos: Los archivos de gramática generados dinámicamente ahora funcionan correctamente. Anteriormente, los archivos de gramática dinámica podían provocar anomalías internas, tal como se notificaba para la integración de Speech to Text con IBM® watsonx™ Assistant. El problema se ha corregido mediante un arreglo interno.

20 de enero de 2023

Los nombres de modelo en desuso en árabe y Reino Unido ya no están disponibles

El servicio ya no acepta los siguientes nombres de modelo en árabe y en el Reino Unido:

  • ar-AR_BroadbandModel-En su lugar, utilice ar-MS_BroadbandModel.
  • en-UK_NarrowbandModel-En su lugar, utilice en-GB_NarrowbandModel.
  • en-UK_BroadbandModel-En su lugar, utilice en-GB_BroadbandModel.

El nombre de modelo árabe quedó en desuso el 2 de diciembre de 2020. Los nombres de modelo en inglés del Reino Unido quedaron en desuso el 14 de julio de 2017.

Cloud Foundry en desuso y migración a grupos de recursos

IBM ha anunciado la desaparición de IBM Cloud Foundry el 31 de mayo de 2022. A partir del 30 de noviembre de 2022, las nuevas IBM Cloud Foundry no se podrán crear y solo los usuarios existentes podrán desplegar aplicaciones. IBM Cloud Foundry ry alcanza el fin de soporte el 1 de junio de 2023. En ese momento, cualquier IBM Cloud Foundry que ejecute aplicaciones IBM Cloud Foundry se deshabilitará, desaprovisionará y eliminará permanentemente.

Para seguir utilizando sus aplicaciones IBM Cloud más allá del 1 de junio de 2023, debe migrar a grupos de recursos antes de esa fecha. Los grupos de recursos son conceptualmente similares a los espacios de Cloud Foundry. Entre ellas se incluyen varias ventajas adicionales, como un control de acceso más detallado mediante el uso de la gestión de identidades y acceso ( IBM Cloud Identity and Access Management, IAM), la posibilidad de conectar instancias de servicio a aplicaciones y servicios en diferentes regiones, y una forma sencilla de consultar el uso por grupo.

El parámetro max_alternatives ahora está disponible para su uso con modelos de próxima generación

El parámetro max_alternatives ahora está disponible para su uso con todos los modelos de próxima generación. Por lo general, este parámetro está disponible en todos los modelos de nueva generación. Para obtener más información, consulte Número máximo de alternativas.

Arreglo de defecto: permitir el uso de los parámetros max_alternatives y end_of_phrase_silence_time con modelos de próxima generación

Arreglo de defectos: cuando se utilizan los parámetros max_alternatives y end_of_phrase_silence_time en la misma solicitud con modelos de próxima generación, el servicio ahora devuelve varias transcripciones alternativas respetando también el intervalo de pausa indicado. Anteriormente, el uso de los dos parámetros en una sola solicitud generaba una anomalía. (El uso del parámetro max_alternatives con modelos de próxima generación estaba disponible anteriormente como una característica experimental para un número limitado de clientes.)

Arreglo de defecto: Actualizar modelo de telefonía de próxima generación francés canadiense (se requiere actualización)

Arreglo de defectos: el modelo de telefonía de próxima generación de Canadá, fr-CA_Telephony, se ha actualizado para abordar una incoherencia interna que podría provocar un error durante el reconocimiento de voz. Es necesario actualizar los modelos personalizados que se basan en el modelo fr-CA_Telephony. Para obtener más información sobre cómo actualizar modelos personalizados, consulta

Arreglo de defectos: añadir directrices de documentación para crear suenes-me gusta en japonés basándose en modelos de próxima generación

Arreglo de defectos: en sonidos-me gusta para modelos de lenguaje personalizado en japonés que se basan en modelos de próxima generación, la secuencia de caracteres ウー es ambigua en algunos contextos de la izquierda. No utilice caracteres (sílabas) que terminen con el fonema /o/, como por ejemplo y . En estos casos, utilice ウウ o simplemente en lugar de ウー. Por ejemplo, utilice ロウウマン o ロウマン en lugar de ロウーマン. Para obtener más información, consulte Directrices para japonés.

La adición de palabras directamente a modelos personalizados que se basan en modelos de próxima generación aumenta el tiempo de entrenamiento

La adición de palabras personalizadas directamente a un modelo personalizado que se basa en un modelo de próxima generación hace que el entrenamiento de un modelo tarde unos minutos más de lo que lo haría de otro modo. Si está entrenando un modelo con palabras personalizadas que ha añadido utilizando el método POST /v1/customizations/{customization_id}/words o PUT /v1/customizations/{customization_id}/words/{word_name}, espere unos minutos de tiempo de entrenamiento adicional para el modelo. Para obtener más información, consulte

Se ha aumentado el número máximo de horas de recursos de audio para modelos acústicos personalizados en la ubicación de Tokio

El número máximo de horas de recursos de audio que puede añadir a los modelos acústicos personalizados en la ubicación de Tokio es de nuevo de 200 horas. Anteriormente, el máximo se reducía a 50 horas para la región de Tokio. Esa reducción ha sido rescindida y pospuesta hasta el próximo año. Para obtener más información, consulte Número máximo de horas de audio.

5 de diciembre de 2022

Nuevo modelo multimedia holandés de próxima generación
El servicio ofrece ahora un modelo multimedia de última generación para el neerlandés de los Países Bajos: nl-NL_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta
Arreglo de defectos: corrija el reconocimiento de palabras personalizado en los resultados de transcripción para los modelos de próxima generación
Arreglo de defectos: Para la personalización de modelos de lenguaje con modelos de próxima generación, ahora las palabras personalizadas se reconocen y se utilizan en todas las transcripciones. Anteriormente, las palabras personalizadas a veces no se reconocían ni se utilizaban en los resultados de transcripción.
Arreglo de defectos: uso correcto del campo display_as en los resultados de transcripción para modelos de próxima generación
Arreglo de defectos: para la personalización del modelo de lenguaje con modelos de próxima generación, el valor del campo display_as para una palabra personalizada aparece ahora en todas las transcripciones. Anteriormente, el valor del campo word a veces aparecía en los resultados de la transcripción.
Arreglo de defectos: actualizar la documentación de denominación de modelos personalizados
Arreglo de defectos: la documentación ahora proporciona reglas detalladas para denominar modelos de lenguaje personalizado y modelos acústicos personalizados. Para obtener más información, consulte

20 de octubre de 2022

Actualizaciones de los modelos de telefonía de última generación en inglés

Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Arreglo de defectos: actualizar el modelo multimedia de próxima generación en japonés (es necesaria una actualización)

Arreglo de defectos: El modelo multimedia de próxima generación en japonés, ja-JP_Multimedia, se ha actualizado para abordar una incoherencia interna que podría provocar un error durante el reconocimiento de voz con baja latencia. Es necesario actualizar los modelos personalizados que se basan en el modelo ja-JP_Multimedia. Para obtener más información sobre cómo actualizar modelos personalizados, consulta

7 de octubre de 2022

Nuevo modelo sueco de telefonía de última generación

El servicio ofrece ahora un modelo de telefonía de última generación para Suecia: sv-SE_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta

Actualizaciones de los modelos de telefonía de última generación en inglés

Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

21 de septiembre de 2022

Nuevo suceso de Activity Tracker para la supresión del GDPR de la información de usuario

El servicio ahora devuelve un suceso Activity Tracker cuando utiliza el método DELETE /v1/user_data para suprimir toda la información sobre un usuario. El suceso se denomina speech-to-text.gdpr-user-data.delete. Para obtener más información, consulte Sucesos de Activity Tracker.

Arreglo de defectos: actualice algunos modelos de próxima generación para mejorar el tiempo de respuesta de baja latencia

Arreglo de defectos: Los siguientes modelos de próxima generación se han actualizado para mejorar su tiempo de respuesta cuando se utiliza el parámetro low_latency:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

Anteriormente, estos modelos no devolvían los resultados de reconocimiento tan rápidamente como se esperaba cuando se utilizaba el parámetro low_latency. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

19 de agosto de 2022

Importante: La fecha de desuso para la mayoría de los modelos de generación anterior es ahora el 3 de marzo de 2023

Reemplazado: este aviso de desuso ha sido reemplazado por la actualización de servicio del 15 de febrero de 2023. La fecha de fin de servicio para todos los modelos de generación anterior es ahora 31 de julio de 2023.

El 15 de marzo de 2022, se dejaron de utilizar los modelos de la generación anterior para todos los idiomas, excepto el árabe y el japonés. En ese momento, los modelos en desuso iban a permanecer disponibles hasta el 15 de septiembre de 2022. Para permitir a los usuarios más tiempo para migrar a los modelos de próxima generación adecuados, los modelos en desuso ahora permanecerán disponibles hasta el 3 de marzo de 2023. Al igual que con el aviso de desuso inicial, los modelos de generación anterior en árabe y japonés no están en desuso. Para obtener una lista completa de todos los modelos en desuso, consulte la actualización del servicio 15 de marzo de 2022.

El 3 de marzo de 2023, los modelos en desuso se eliminarán del servicio y de la documentación. Si utiliza alguno de los modelos obsoletos, deberá migrar al modelo equivalente de nueva generación antes del 3 de marzo de 2023.

Nota: Cuando el modelo de la generación anterior en-US_BroadbandModel deje de estar disponible, el modelo de la próxima generación en-US_Multimedia pasará a ser el modelo predeterminado para las solicitudes de reconocimiento de voz.

15 de agosto de 2022

Nuevo modelo multimedia francés canadiense de próxima generación

El servicio ofrece ahora un modelo multimedia de última generación para el francés de Canadá: fr-CA_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta

Actualizaciones de los modelos de telefonía de última generación en inglés

Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

El modelo multimedia italiano de última generación ya es compatible con la baja latencia

El modelo multimedia de próxima generación italiano, it-IT_Multimedia, ahora admite una latencia baja. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta

Importante: Se reduce el número máximo de horas de datos de audio para modelos acústicos personalizados

Importante: La cantidad máxima de datos de audio que puede añadir a un modelo acústico personalizado se está reduciendo de 200 horas a 50 horas. Este cambio se está escalonando en diferentes lugares de agosto a septiembre de 2022. Para obtener información sobre la planificación para la reducción de límite y lo que significa para los modelos acústicos personalizados existentes que contienen más de 50 horas de audio, consulte Máximo de horas de audio.

3 de agosto de 2022

Arreglo de defectos: actualizar la documentación de vacilaciones de voz y marcadores de vacilación

Arreglo de defectos: se ha actualizado la documentación para las vacilaciones de voz y los marcadores de duda. Los modelos de generación anterior incluyen marcadores de vacilación en lugar de vacilaciones de voz en los resultados de transcripción para la mayoría de los idiomas; el formateo inteligente elimina los marcadores de vacilación de las transcripciones finales en inglés de EE.UU. Los modelos de próxima generación incluyen las vacilaciones reales del habla en los resultados de la transcripción; el formato inteligente no tiene ningún efecto en su inclusión en los resultados finales de la transcripción.

Para obtener más información, consulte:

1 Junio 2022

Actualizaciones de varios modelos de telefonía de próxima generación

Los siguientes modelos de telefonía de próxima generación se han actualizado para mejorar el reconocimiento de voz:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony
  • ko-KR_Telephony

No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

25 de mayo de 2022

Nuevo parámetro beta character_insertion_bias para modelos de próxima generación

Todos los modelos de próxima generación admiten ahora un nuevo parámetro beta, character_insertion_bias, que está disponible con todas las interfaces de reconocimiento de voz. De forma predeterminada, el servicio está optimizado para que cada modelo individual equilibre su reconocimiento de series candidatas de diferentes longitudes. El sesgo específico del modelo es equivalente a 0.0. El sesgo predeterminado de cada modelo es suficiente para la mayoría de las solicitudes de reconocimiento de voz.

Sin embargo, ciertos casos de uso pueden beneficiarse de hipótesis a favor con series de caracteres más cortas o más largas. El parámetro acepta valores entre -1.0 y 1.0 que representan un cambio del valor predeterminado de un modelo. Los valores negativos indican al servicio que favorezca las series más cortas de caracteres. Los valores positivos indican al servicio que favorezca las series de caracteres más largas. Para obtener más información, consulte Sesgo de inserción de caracteres.

19 de mayo de 2022

Nuevo modelo de próxima generación it-IT_Multimedia de italiano

El servicio ahora ofrece un modelo multimedia de próxima generación para italiano: it-IT_Multimedia. El nuevo modelo está disponible de forma general. No admite la latencia baja, pero sí las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Modelos actualizados de próxima generación de telefonía y multimedia en coreano

Se han actualizado los modelos actuales de próxima generación de coreano:

  • El modelo ko-KR_Telephony se ha actualizado para mejorar el soporte de baja latencia para el reconocimiento de voz.
  • El modelo ko-KR_Multimedia se ha actualizado para mejorar el reconocimiento de voz. El modelo ahora también da soporte a la baja latencia.

Ambos modelos están disponibles a nivel general y ambos admiten las gramáticas y la personalización del modelo de idioma. No es necesario actualizar los modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Arreglo de defectos: ahora se notifican las puntuaciones de confianza para todos los resultados de transcripción

Arreglo de defectos: ahora se notifican las puntuaciones de confianza para todos los resultados de transcripción. Anteriormente, cuando el servicio devolvía varias transcripciones para una única solicitud de reconocimiento de voz única, las puntuaciones de confianza podían no devolverse para todas las transcripciones.

11 de abril de 2022

Nuevo modelo de próxima generación pt-BR_Multimedia de portugués de Brasil

El servicio ahora ofrece un modelo multimedia de próxima generación para portugués de Brasil: pt-BR_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta

Actualización para que el modelo de próxima generación de-DE_Multimedia de alemán admita la baja latencia

El modelo de alemán de próxima generación, de-DE_Multimedia, ahora admite la baja latencia. No es necesario actualizar los modelos personalizados basados en el modelo base actualizado para alemán. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte

El soporte para pronunciaciones similares está ahora documentado para los modelos personalizados basados en modelos de próxima generación

Para los modelos de idioma personalizados basados en modelos de próxima generación, el soporte está ahora documentado para las especificaciones de pronunciaciones parecidas para palabras personalizadas. El soporte para pronunciaciones parecidas ha estado disponible desde finales de 2021.

Existen diferencias entre el uso del campo sounds_like para modelos personalizados basados en modelos de generación anterior y de próxima generación. Para obtener más información sobre la utilización del campo sounds_like con modelos personalizados basados en modelos de próxima generación, consulte Trabajar con palabras personalizadas para modelos de próxima generación.

Importante: se ha eliminado el parámetro customization_id en desuso de la documentación

Importante: el 9 de octubre de 2018, el parámetro customization_id de todas las solicitudes de reconocimiento de voz quedó en desuso y ha sido sustituido por el parámetro language_customization_id. El parámetro customization_id se ha eliminado de la documentación para los métodos de reconocimiento de voz:

  • /v1/recognize para solicitudes WebSocket
  • POST /v1/recognize para solicitudes HTTP síncronas (incluidas las solicitudes de varias partes)
  • POST /v1/recognitions para solicitudes HTTP asíncronas

Nota: si utiliza los SDK de Watson, asegúrese de haber actualizado cualquier código de aplicación para utilizar el parámetro language_customization_id en lugar del parámetro customization_id. El parámetro customization_id ya no estará disponible en los métodos equivalentes de los SDK a partir de su próximo release principal. Para obtener más información sobre los métodos de reconocimiento de voz, consulte la Referencia de API y SDK.

17 de marzo de 2022

El soporte de gramática para los modelos de próxima generación ahora está disponible de forma general

Ahora el soporte de gramática está disponible de forma general (GA) para los modelos de próxima generación que cumplen las siguientes condiciones:

  • Los modelos están generalmente disponibles.
  • Los modelos soportan la personalización del modelo de idioma.

Para obtener más información, consulte los temas siguientes:

Nuevo modelo multimedia de próxima generación para alemán

El servicio ahora ofrece un modelo multimedia de próxima generación para alemán: de-DE_Multimedia. El nuevo modelo está disponible de forma general. No admite la baja latencia. Es compatible con la personalización del modelo de idioma (generalmente disponible) y gramáticas (beta).

Para obtener más información sobre todos los modelos de próxima generación disponibles y su soporte de personalización, consulte

El modelo beta en-WW_Medical_Telephony de próxima generación ahora admite la baja latencia

El modelo beta en-WW_Medical_Telephony de próxima generación ahora admite la baja latencia. Para obtener más información sobre todos los modelos de próxima generación y baja latencia, consulte

15 de marzo de 2022

Importante: desuso de la mayoría de modelos de la generación anterior

Reemplazado: este aviso de desuso ha sido reemplazado por la actualización de servicio del 15 de febrero de 2023. La fecha de fin de servicio para todos los modelos de generación anterior es ahora 31 de julio de 2023.

A partir del 15 de marzo de 2022, los modelos de generación anterior para todos los idiomas que no sean árabe y japonés están en desuso. Los modelos en desuso permanecen disponibles hasta el 15 de septiembre de 2022, cuando serán retirados del servicio y de la documentación. Los modelos de la generación anterior en árabe y japonés no han quedado obsoletos.

Los siguientes modelos de la generación anterior ahora están en desuso:

  • Chino (mandarín): zh-CN_NarrowbandModel y zh-CN_BroadbandModel
  • Holandés (Países Bajos): nl-NL_NarrowbandModel y nl-NL_BroadbandModel
  • Inglés (australiano): en-AU_NarrowbandModel y en-AU_BroadbandModel
  • Inglés (Reino Unido): en-GB_NarrowbandModel y en-GB_BroadbandModel
  • Inglés (Estados Unidos): en-US_NarrowbandModel, en-US_BroadbandModel y en-US_ShortForm_NarrowbandModel
  • Francés (canadiense): fr-CA_NarrowbandModel y fr-CA_BroadbandModel
  • Francés (Francia): fr-FR_NarrowbandModel y fr-FR_BroadbandModel
  • Alemán: de-DE_NarrowbandModel y de-DE_BroadbandModel
  • Italiano: it-IT_NarrowbandModel y it_IT_BroadbandModel
  • Coreano: ko-KR_NarrowbandModel y ko-KR_BroadbandModel
  • Portugués (brasileño): pt-BR_NarrowbandModel y pt-BR_BroadbandModel
  • Español (argentino): es-AR_NarrowbandModel y es-AR_BroadbandModel
  • Español (castellano): es-ES_NarrowbandModel y es-ES_BroadbandModel
  • Español (chileno): es-CL_NarrowbandModel y es-CL_BroadbandModel
  • Español (colombiano): es-CO_NarrowbandModel y es-CO_BroadbandModel
  • Español (mexicano): es-MX_NarrowbandModel y es-MX_BroadbandModel
  • Español (peruano): es-PE_NarrowbandModel y es-PE_BroadbandModel

Si utiliza cualquiera de estos modelos en desuso, debe migrar al modelo de próxima generación equivalente antes de la fecha de fin de servicio.

Nota: cuando el en-US_BroadbandModel de la generación anterior se elimina del servicio el 15 de septiembre, el modelo en-US_Multimedia de próxima generación se convertirá en el modelo predeterminado para las solicitudes de reconocimiento de voz.

Los modelos de próxima generación ahora dan soporte a parámetros de análisis de audio

Todos los modelos de próxima generación ahora dan soporte a los siguientes parámetros de análisis de audio como características de disponibilidad general:

  • end_of_phrase_silence_time especifica la duración del intervalo de pausa en el que el servicio divide una transcripción en varios resultados finales. Para obtener más información, consulte Tiempo de silencio de fin de frase.
  • split_transcript_at_phrase_end indica al servicio que divida la transcripción en varios resultados finales basándose en las características semánticas de la entrada. Para obtener más información, consulte División de la transcripción al final de la frase.
Corrección de un error: corrección de la documentación sobre las etiquetas de los altavoces

Corrección de defecto: la documentación de las etiquetas de orador incluye la siguiente declaración errónea en varios lugares: Para los modelos de próxima generación, las etiquetas de orador no están soportadas para su uso con resultados provisionales o la baja latencia. Las etiquetas de orador están soportadas para su uso con resultados provisionales y la baja latencia para los modelos de próxima generación. Para obtener más información, consulte Etiquetas de orador.

28 de febrero de 2022

Actualizaciones de modelos multimedia de próxima generación para inglés y francés para dar soporte a la baja latencia

Se han actualizado los siguientes modelos multimedia para dar soporte a la baja latencia:

  • Inglés de Australia: en-AU_Multimedia
  • Inglés de Reino Unido: en-GB_Multimedia
  • Inglés de Estados Unidos: en-US_Multimedia
  • Francés: fr-FR_Multimedia

No es necesario actualizar los modelos de idioma personalizados que se basan en estos modelos base. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte

Nuevo modelo multimedia de próxima generación para castellano

El servicio ofrece ahora un modelo multimedia de próxima generación para castellano: es-ES_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con la personalización del modelo de idioma (de disposición general) y gramáticas (beta).

Para obtener más información sobre todos los modelos de próxima generación disponibles y su soporte de personalización, consulte

11 de febrero de 2022

Corrección de un error: Se ha corregido la documentación relativa a la actualización de modelos personalizados y a la versión del modelo base

Arreglo de defecto: la documentación que describe la actualización de modelos personalizados y las series de versión que se utilizan para diferentes versiones de modelos base se ha actualizado. La documentación ahora indica que la actualización para la personalización del modelo de idioma también se aplica a los modelos de próxima generación. Además, se han actualizado las series de versión que representan versiones distintas de modelos base. Además, el parámetro base_model_version también se puede utilizar con modelos de próxima generación actualizados.

Para obtener más información sobre la actualización del modelo personalizado, cuándo es necesario actualizar y cómo utilizar versiones anteriores de modelos personalizados, consulte

Corrección de un error: Actualización de la documentación sobre el uso de mayúsculas

Arreglo de defecto: la documentación que describe la capitalización automática del servicio de transcripciones se ha actualizado. El servicio capitaliza los nombres adecuados sólo para los siguientes idiomas y modelos:

  • Todos los modelos para inglés de EE.UU. de la generación anterior
  • El modelo de próxima generación para alemán

Para obtener más información, consulte Capitalización.

2 de febrero de 2022

El nuevo modelo beta en-WW_Medical_Telephony ya está disponible

Ya está disponible una nueva versión beta de en-WW_Medical_Telephony de la próxima generación. El nuevo modelo entiende los términos de los dominios médico y farmacológico. Utilice el modelo en situaciones en las que necesite transcribir terminología médica común, como nombres de medicamentos, marcas de productos, procedimientos médicos, enfermedades, tipos de médicos o terminología relacionada con el COVID-19. Los casos de uso común incluyen conversaciones entre un paciente y un proveedor médico (por ejemplo, un médico, una enfermera o un farmacéutico).

El nuevo modelo está disponible para todos los dialectos ingleses admitidos: de Australia, India, Reino Unido y Estados Unidos. El nuevo modelo soporta la personalización del modelo de idioma y las gramáticas como funcionalidad beta. Soporta la mayoría de los mismos parámetros que el modelo en-US_Telephony, incluido smart_formatting para el audio en inglés de EE.UU. No da soporte a los parámetros siguientes: low_latency, profanity_filter, redaction y speaker_labels.

Para obtener más información, consulte El modelo de telefonía médica en inglés.

Actualizar al modelo zh-CN_Telephony para chino

El modelo de próxima generación zh-CN_Telephony para chino se ha actualizado para mejorar el reconocimiento de voz. El modelo sigue dando soporte a la baja latencia. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Si tiene modelos de idioma personalizados basados en el modelo actualizado, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones utilizando el método POST /v1/customizations/{customization_id}/upgrade_model. Para obtener más información, consulte Actualización de modelos personalizados.

Actualización para que el modelo de próxima generación ja-JP_Multimedia de japonés admita la baja latencia

El modelo de próxima generación ja-JP_Multimedia para japonés ahora da soporte a la baja latencia. Puede utilizar el parámetro low_latency con las solicitudes de reconocimiento de voz que utilizan el modelo. No es necesario actualizar modelos personalizados basados en el modelo base actualizado para japonés. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte

3 de diciembre de 2021

Nuevo modelo de telefonía de próxima generación para español de Latinoamérica

El servicio ahora ofrece un modelo de telefonía de próxima generación para el español de Latinoamérica: es-LA_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general.

El modelo es-LA_Telephony se aplica a todos los dialectos de Latinoamérica. Es el equivalente a los modelos de la generación anterior que están disponibles para los dialectos argentino, chileno, colombiano, mexicano y peruano. Si ha utilizado un modelo de la generación anterior para cualquiera de estos dialectos específicos, utilice el modelo es-LA_Telephony para migrar al modelo de próxima generación equivalente.

Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Importante: los modelos de idioma personalizados basados en determinados modelos de próxima generación deben volver a crearse

Importante: si ha creado modelos de idioma personalizados basados en determinados modelos de próxima generación, debe volver a crear los modelos personalizados. Hasta que vuelva a crear los modelos de idioma personalizados, las solicitudes de reconocimiento de voz que intentan utilizar los modelos personalizados fallan con el código de error HTTP 400.

Debe volver a crear los modelos de idioma personalizados que ha creado basándose en las siguientes versiones de los modelos de próxima generación:

  • Para el modelo en-AU_Telephony, los modelos personalizados que ha creado de en-AU_Telephony.v2021-03-03 a en-AU_Telephony.v2021-10-04.
  • Para el modelo en-GB_Telephony, los modelos personalizados que ha creado de en-GB_Telephony.v2021-03-03 a en-GB_Telephony.v2021-10-04.
  • Para el modelo en-US_Telephony, los modelos personalizados que ha creado de en-US_Telephony.v2021-06-17 a en-US_Telephony.v2021-10-04.
  • Para el modelo en-US_Multimedia, los modelos personalizados que ha creado de en-US_Multimedia.v2021-03-03 a en-US_Multimedia.v2021-10-04.

Para identificar la versión de un modelo en el que se basa un modelo de idioma personalizado, utilice el método GET /v1/customizations para listar todos los modelos de idioma personalizados o el método GET /v1/customizations/{customization_id} para listar un modelo de idioma personalizado específico. El campo versions de la salida muestra el modelo base para un modelo de idioma personalizado. Para obtener más información, consulte Listado de modelos de lenguaje personalizado.

Para volver a crear un modelo de idioma personalizado, primero cree un nuevo modelo personalizado. A continuación, añada todos los corpus y palabras personalizadas del modelo personalizado anterior al nuevo modelo. A continuación, puede suprimir el modelo personalizado anterior. Para obtener más información, consulte Creación de un modelo de idioma personalizado.

28 de octubre de 2021

Nuevo modelo de telefonía de próxima generación para chino

El servicio ahora ofrece un modelo de telefonía de próxima generación para chino mandarín: zh-CN_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Nuevos modelos multimedia de próxima generación para inglés de Reino Unido e inglés de Australia

El servicio ahora ofrece los siguientes modelos multimedia de próxima generación. Los nuevos modelos son de disposición general y ninguno de los modelos admite la baja latencia.

  • Inglés de Australia: en-AU_Multimedia
  • Inglés de Reino Unido: en-GB_Multimedia

Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Actualizaciones para varios modelos de próxima generación para mejorar el reconocimiento de voz

Los siguientes modelos de próxima generación se han actualizado para mejorar el reconocimiento de voz:

  • Modelo de telefonía para inglés de Australia (en-AU_Telephony)
  • Modelo de telefonía para inglés del Reino Unido (en-GB_Telephony)
  • Modelo multimedia para inglés de EE.UU. (en-US_Multimedia)
  • Modelo de telefonía para inglés de EE.UU. (en-US_Telephony)
  • Modelo de telefonía para español de España (es-ES_Telephony)

Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

El soporte de gramática para modelos de la generación anterior está ahora disponible de forma general

El soporte de gramática ahora está disponible de forma general (GA) para los modelos de la generación anterior que cumplen las siguientes condiciones:

  • Los modelos están generalmente disponibles.
  • Los modelos soportan la personalización del modelo de idioma.

Para obtener más información, consulte los temas siguientes:

Nuevo soporte de gramática beta para modelos de próxima generación

El soporte de gramática ahora está disponible como una funcionalidad beta para todos los modelos de próxima generación. Todos los modelos de próxima generación están generalmente disponibles (GA) y soportan la personalización del modelo de idioma. Para obtener más información, consulte los temas siguientes:

Nota: el soporte beta para las gramáticas mediante modelos de próxima generación solo está disponible para el servicio Speech to Text en IBM Cloud. Las gramáticas aún no están soportadas para los modelos de próxima generación en IBM Cloud Pak for Data.

Nuevo campo custom_acoustic_model para las características soportadas

Los métodos GET /v1/models y GET /v1/models/{model_id} ahora informan si un modelo da soporte a la personalización del modelo acústico. El objeto SupportedFeatures ahora incluye un campo adicional, custom_acoustic_model, un booleano que es true para un modelo que da soporte a la personalización de modelos acústicos y false para lo demás. Actualmente, el campo es true para todos los modelos de generación anterior y false para todos los modelos de próxima generación.

22 de octubre de 2021

Corrección de un error: Solución de los fallos asíncronos de HTTP
Arreglo de defecto: la interfaz HTTP asíncrona no ha podido transcribir algún audio. Además, la devolución de llamada para la solicitud ha devuelto el estado recognitions.completed_with_results en lugar de recognitions.failed. Este error se ha resuelto.

6 de octubre de 2021

Actualizaciones para modelos de próxima generación para checo y holandés

Los siguientes modelos de idioma de próxima generación han cambiado como se indica:

  • El modelo de telefonía para checo, cs-CZ_Telephony, ahora está disponible de forma general (GA). El modelo sigue dando soporte a la baja latencia.
  • El modelo de telefonía para el holandés de Bélgica, nl-BE_Telephony, se ha actualizado para mejorar el reconocimiento de voz. El modelo sigue dando soporte a la baja latencia.
  • El modelo de telefonía para el holandés los Países Bajos, nl-NL_Telephony, ahora es de disponibilidad general (GA). Además, el modelo ahora admite la baja latencia.

Para obtener más información sobre todos los modelos de idioma de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Nuevo soporte de HIPAA de EE.UU. para los planes Premium en la ubicación de Dallas

El soporte para la Ley de portabilidad y responsabilidad de seguros médicos de EE.UU. (HIPAA) ya está disponible para los planes Premium que se alojan en la ubicación de Dallas (us-south). Para obtener más información, consulte la Ley de portabilidad y responsabilidad de seguros médicos (HIPAA).

16 de septiembre de 2021

Nuevos modelos beta de próxima generación para checo y holandés de los Países Bajos

El servicio ahora da soporte a los siguientes nuevos modelos de idioma de próxima generación. Ambos nuevos modelos son una funcionalidad beta.

  • Checo: cs-CZ_Telephony. El nuevo modelo soporta la baja latencia.
  • Holandés de los Países Bajos: nl-NL_Telephony. El nuevo modelo no da soporte a la baja latencia.

Para obtener más información sobre todos los modelos de idioma de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.

Actualizaciones de modelos de próxima generación para coreano y portugués de Brasil

Se han actualizado los siguientes modelos de próxima generación:

  • El modelo ko-KR_Telephony para coreano ahora admite la baja latencia.
  • El modelo pt-BR_Telephony para portugués de Brasil se ha actualizado para mejorar el reconocimiento de voz.
Corrección de un error: corrección de los resultados provisionales y de la documentación sobre baja latencia

Arreglo de defecto: la documentación que describe las características de resultados provisionales y de baja latencia con los modelos de próxima generación se ha reescrito para obtener una mayor claridad y corrección. Para obtener más información, consulte los temas siguientes:

Arreglo de defectos: Mejorar los resultados de las etiquetas de los altavoces

Arreglo de defecto: cuando utiliza etiquetas de orador con modelos de próxima generación, el servicio ahora identifica el orador para todas las palabras del audio de entrada, incluidas palabras muy cortas que tienen las mismas indicaciones de fecha y hora de inicio y final.

31 de agosto de 2021

Todos los modelos de próxima generación están ahora disponibles de forma general

Todos los modelos de idioma de próxima generación existentes ya están disponibles de forma general (GA). Están soportados para su uso en entornos de producción y aplicaciones.

La personalización del modelo de idioma para los modelos de próxima generación ahora está disponible de forma general

La personalización del modelo de idioma ahora está disponible de forma general (GA) para todos los modelos e idiomas disponibles de la próxima generación. La personalización del modelo de idioma para los modelos de próxima generación está soportada para su uso en entornos de producción y aplicaciones.

Puede utilizar los mismos mandatos para crear, gestionar y utilizar modelos de idioma personalizado, corpus y palabras personalizadas para modelos de próxima generación como lo hace para los modelos de la generación anterior. Pero la personalización para los modelos de próxima generación funciona de forma diferente a la personalización para los modelos de la generación anterior. Para los modelos personalizados basados en modelos de próxima generación:

  • Los modelos personalizados no tienen ningún concepto de las palabras fuera del vocabulario (OOV).
  • Las palabras del corpus no se añaden al recurso de palabras.
  • Actualmente no puede utilizar la característica de pronunciación para las palabras personalizadas.
  • No es necesario actualizar los modelos personalizados cuando se actualizan los modelos de idioma base.
  • Actualmente, las gramáticas no están soportadas.

Para obtener más información sobre cómo utilizar la personalización del modelo de idioma para modelos de próxima generación, consulte

Los temas adicionales describen la gestión de modelos de idioma personalizado, corpus y palabras personalizadas. Estas operaciones son las mismas para los modelos personalizados basados en modelos anteriores y de próxima generación.

16 de agosto de 2021

Nuevos modelos beta de la próxima generación para inglés, hindi de la India, japonés y coreano

El servicio ahora da soporte a los siguientes nuevos modelos de idioma de próxima generación. Todos los nuevos modelos son de funcionalidad beta.

  • Inglés de la India: en-IN_Telephony. El modelo soporta la baja latencia.
  • Hindi de la India: hi-IN_Telephony. El modelo soporta la baja latencia.
  • Japonés: ja-JP_Multimedia. El modelo no da soporte a la baja latencia.
  • Coreano: ko-KR_Multimedia y ko-KR_Telephony. Los modelos no dan soporte a la baja latencia.

Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.

16 de julio de 2021

Nuevo modelo de próxima generación beta para francés
El modelo de idioma de fr-FR_Multimedia de próxima generación para francés ya está disponible. El nuevo modelo no da soporte a la baja latencia. El modelo es de funcionalidad beta.
Actualizaciones del modelo de próxima generación beta para inglés de EE.UU. para un mejor reconocimiento de voz
El modelo en-US_Telephony de próxima generación para inglés de EE.UU. se ha actualizado para mejorar el reconocimiento de voz. El modelo actualizado sigue siendo una funcionalidad beta.
Arreglo de defectos: actualizar documentación para marcadores de duda
Arreglo de defecto: La documentación no indica que los modelos de próxima generación no producen marcadores de duda. La documentación se ha actualizado para señalar que solo los modelos de la generación anterior producen marcadores de duda. Los modelos de próxima generación incluyen las vacilaciones reales en los resultados de la transcripción. Para obtener más información, consulte Titubeos y marcadores de duda.

15 de junio de 2021

Nuevo modelo de próxima generación beta para holandés de Bélgica

Ahora está disponible el modelo de idioma de próxima generación nl-BE_Telephony para holandés de Bélgica (Flamenco). El nuevo modelo soporta la baja latencia. El modelo es de funcionalidad beta. Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.

Nuevo soporte beta de baja latencia para modelos de próxima generación para árabe, francés de Canadá e italiano

Los siguientes modelos de idioma beta de próxima generación ya soportan la baja latencia:

  • Modelo ar-MS_Telephony para árabe
  • Modelo fr-CA_Telephony para francés de Canadá
  • Modelo it-IT_Telephony para italiano

Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.

Actualizaciones de modelos de próxima generación beta para árabe y portugués de Brasil para mejorar el reconocimiento de voz

Los siguientes modelos de idioma beta de próxima generación se han actualizado para mejorar el reconocimiento de voz:

  • Modelo ar-MS_Telephony para árabe
  • Modelo pt-BR_Telephony para portugués de Brasil

Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.

26 de mayo de 2021

Nuevo parámetro de soporte beta para audio_metrics para modelos de próxima generación
El parámetro audio_metrics ahora está soportado como funcionalidad beta para su uso con todos los idiomas y modelos de próxima generación. Para obtener más información, consulte Métricas de audio.
Nuevo parámetro de soporte beta para word_confidence para modelos de próxima generación
El parámetro word_confidence ahora está soportado como funcionalidad beta para su uso con todos los idiomas y modelos de próxima generación. Para obtener más información, consulte Confianza de palabras.
Arreglo de defectos: documentación de actualización para modelos de próxima generación
Corrección de un error: Se ha actualizado la documentación para corregir la siguiente información:
  • Cuando utiliza un modelo de próxima generación para el reconocimiento de voz, los resultados finales de la transcripción ahora incluyen el campo confidence. El campo siempre se incluía en los resultados finales de la transcripción cuando se utiliza un modelo de generación anterior. Este arreglo soluciona una limitación que se informó para el lanzamiento del 12 de abril de 2021 de los modelos de próxima generación.
  • La documentación indicaba incorrectamente que el uso del parámetro smart_formatting hace que el servicio elimine los marcadores de duda de los resultados finales de la transcripción para japonés. El formateo inteligente no elimina los marcadores de duda de los resultados finales para el japonés, sólo para el inglés de EE.UU. Para obtener más información, consulte ¿A qué resultados afecta el formateo inteligente?

27 de abril de 2021

Nuevos modelos beta de próxima generación para árabe y portugués de Brasil

El servicio da soporte a dos nuevos modelos beta de próxima generación:

  • El modelo pt-BR_Telephony para portugués de Brasil, que soporta la baja latencia.
  • El modelo ar-MS_Telephony para árabe (estándar moderno), que no da soporte a la baja latencia.

Para obtener más información, consulte Idiomas y modelos de próxima generación.

Actualizaciones del modelo beta de próxima generación para español de España para mejorar el reconocimiento de voz

El modelo beta de siguiente generación es-ES_Telephony para español de España ahora es compatible con el parámetro low_latency. Para obtener más información, consulte Baja latencia.

Nuevo soporte beta para etiquetas de orador con modelos de próxima generación

El parámetro speaker_labels ahora está soportado como funcionalidad beta para su uso con los siguientes modelos de próxima generación:

  • Modelo en-AU_Telephony para inglés de Australia
  • Modelo en-GB_Telephony para inglés del Reino Unido
  • Modelos en-US_Multimedia y en-US_Telephony para inglés de EE.UU.
  • Modelo de-DE_Telephony para alemán
  • Modelo es-ES_Telephony para español de España

Con los modelos de próxima generación, en este momento, el parámetro speaker_labels no está soportado para su uso con los parámetros interim_results o low_latency. Para obtener más información, consulte Etiquetas de orador.

Nuevo código de error HTTP para utilizar word_confidence con modelos de próxima generación

El parámetro word_confidence no está soportado para su uso con modelos de próxima generación. El servicio ahora devuelve el siguiente código de error 400 si utiliza el parámetro word_confidence con un modelo de próxima generación para el reconocimiento de voz:

{
  "error": "word_confidence is not a supported feature for model {model}",
  "code": 400,
  "code_description": "Bad Request"
}

12 de abril de 2021

Nuevos modelos de lenguaje idioma beta de próxima generación y el parámetro low_latency

El servicio ahora da soporte a un número creciente de modelos de idioma de próxima generación. Los modelos multimedia y de telefonía de próxima generación mejoran las capacidades de reconocimiento de voz de la generación anterior de modelos de servicio de banda ancha y banda estrecha. Los nuevos modelos aprovechan las redes neuronales profundas y el análisis bidireccional para lograr un mayor rendimiento y una mayor precisión de la transcripción. En este momento, los modelos de próxima generación sólo dan soporte a un número limitado de idiomas y características de reconocimiento de voz. Los idiomas, modelos y características soportados aumentarán con futuros releases. Los modelos de próxima generación son una funcionalidad beta.

Muchos de los modelos de próxima generación también dan soporte a un nuevo parámetro low_latency que le permite solicitar resultados más rápidamente en detrimento posiblemente de reducir la calidad de la transcripción. Cuando la baja latencia está habilitada, el servicio restringe su análisis del audio, lo que puede reducir la precisión de la transcripción. Esta compensación puede ser aceptable si su aplicación requiere un tiempo de respuesta más bajo que la precisión más alta posible. El parámetro low_latency es una funcionalidad beta.

El parámetro low_latency afecta al uso del parámetro interim_results con la interfaz WebSocket. Los resultados provisionales sólo están disponibles para los modelos de próxima generación que dan soporte a una baja latencia y sólo si los parámetros interim_results y low_latency están establecidos en true.

17 de marzo de 2021

Corrección de un error: Se ha solucionado la limitación de la interfaz asíncrona HTTP
Arreglo de defecto: se ha solucionado la limitación que se notificó con la interfaz HTTP asíncrona en la ubicación de Dallas (us-south) el 16 de diciembre de 2020. Anteriormente, un pequeño porcentaje de trabajos entraban en bucles infinitos que impedían su ejecución. Las solicitudes HTTP asíncronas en el centro de datos de Dallas ya no experimentan esta limitación.

2 de diciembre de 2020

Modelo para árabe renombrado a ar-MS_BroadbandModel
El modelo de banda ancha para árabe ahora se llama ar-MS_BroadbandModel. El nombre anterior, ar-AR_BroadbandModel, está en desuso. Continuará funcionando durante al menos un año, pero podría ser eliminado en una fecha futura. Se le anima a migrar al nuevo nombre a la mayor brevedad posible.

2 de noviembre de 2020

Los modelos para francés de Canadá están ahora disponibles de forma general

Los modelos para francés de Canadá, fr-CA_BroadbandModel y fr-CA_NarrowbandModel, ya están disponibles de forma general (GA). Antes eran beta. Ahora también admiten la personalización del modelo de idioma y del modelo acústico.

22 de octubre de 2020

Los modelos para inglés de Australia ya están disponibles de forma general

Los modelos para inglés de Australia, en-AU_BroadbandModel y en-AU_NarrowbandModel, ya están disponibles de forma general (GA). Antes eran beta. Ahora también admiten la personalización del modelo de idioma y del modelo acústico.

Actualizaciones de modelos para portugués de Brasil para mejorar el reconocimiento de voz

Los modelos para portugués de Brasil, pt-BR_BroadbandModel y pt-BR_NarrowbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

El parámetro split_transcript_at_phrase_end ya está disponible de forma general para todos los idiomas

El parámetro de reconocimiento de voz split_transcript_at_phrase_end ya está disponible de forma general (GA) para todos los idiomas. Anteriormente, solo estaba disponible a nivel general para inglés de EE.UU. y del Reino Unido. Para obtener más información, consulte División de la transcripción al final de la frase.

7 de octubre de 2020

Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz

El modelo ja-JP_BroadbandModel se ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

30 de septiembre de 2020

Actualizaciones de los planes de precios para el servicio

Los planes de precios del servicio han cambiado:

  • El servicio sigue ofreciendo un plan Lite que proporciona acceso básico sin cargos a unos minutos limitados de reconocimiento de voz por mes.
  • El servicio ofrece un nuevo plan Plus que proporciona un modelo de precios por niveles simple y acceso a las prestaciones de personalización del servicio.
  • El servicio ofrece un nuevo plan Premium que proporciona una capacidad significativamente mayor y mejores características.

El plan Plus sustituye al plan estándar. El plan estándar sigue estando disponible para la compra por un corto periodo de tiempo. También sigue estando disponible indefinidamente para los usuarios existentes del plan sin ningún cambio en sus precios. Los usuarios existentes pueden actualizar al plan Plus cuando lo deseen.

Para obtener más información sobre los planes de precios disponibles, consulte los siguientes recursos:

  • Para obtener información general sobre los planes de precios y ver respuestas a preguntas comunes, consulte el apartado Preguntas frecuentes.
  • Para obtener más información sobre los planes de precios o para adquirir un plan, consulta el servicio « Speech to Text » en el catálogo de IBM Cloud®.

20 de agosto de 2020

Nuevos modelos para francés de Canadá

Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma francés de Canadá:

  • fr-CA_BroadbandModel
  • fr-CA_NarrowbandModel

Los nuevos modelos no dan soporte al modelo de lenguaje a la personalización de modelos acústicos, a las etiquetas de orador ni al formateo inteligente. Para obtener más información sobre estos y todos los modelos soportados, consulte Modelos de idioma de la generación anterior soportados.

5 de agosto de 2020

Nuevos modelos para inglés de Australia

Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma inglés de Australia:

  • en-AU_BroadbandModel
  • en-AU_NarrowbandModel

Los nuevos modelos no dan soporte al modelo de lenguaje ni a la personalización de modelos acústicos ni al formateo inteligente. Los nuevos modelos no dan soporte a etiquetas de orador. Para obtener más información, consulte

Actualizaciones de varios modelos para mejorar el reconocimiento de voz

Los siguientes modelos se han actualizado para mejorar el reconocimiento de voz:

  • Modelo de banda ancha para francés (fr-FR_BroadbandModel)
  • Modelos de banda ancha (de-DE_BroadbandModel) y banda estrecha (de-DE_NarrowbandModel) para alemán
  • Modelos de banda ancha (en-GB_BroadbandModel) y banda estrecha (en-GB_NarrowbandModel) para inglés del Reino Unido
  • Modelo de banda estrecha de formato abreviado para inglés de EE.UU. (en-US_ShortForm_NarrowbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

El marcador de duda para el alemán ha cambiado

El marcador de duda que se utiliza para la banda ancha para el alemán se ha actualizado y los modelos de banda estrecha han cambiado de [hesitation] a %HESITATION. Para obtener más información, consulte Titubeos y marcadores de duda.

4 de junio de 2020

Corrección de un error: mejora de la latencia en los modelos de lenguaje personalizados con numerosas gramáticas
Arreglo de defecto: se ha resuelto el problema de latencia para los modelos de idioma personalizados que contienen un gran número de gramáticas. Cuando se utilizan inicialmente para el reconocimiento de voz, estos modelos personalizados pueden tardar varios segundos en cargarse. Ahora los modelos personalizados se cargan mucho más rápido, reduciendo significativamente la latencia cuando se utilizan para el reconocimiento.

28 de abril de 2020

Actualizaciones de modelos para italiano para mejorar el reconocimiento de voz

Los modelos italianos de banda ancha (it-IT_BroadbandModel) y de banda estrecha (it-IT_NarrowbandModel) se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

Los modelos para holandés e italiano ya están disponibles de forma general

Los modelos de los idiomas holandés e italiano ahora están actualmente disponibles a nivel general (GA) para el reconocimiento de voz y para la personalización del modelo de lenguaje y del modelo acústico:

  • Modelo de banda ancha holandés (nl-NL_BroadbandModel)
  • Modelo de banda estrecha holandés (nl-NL_NarrowbandModel)
  • Modelo de banda ancha italiano (it-IT_BroadbandModel)
  • Modelo de banda estrecha italiano (it-IT_NarrowbandModel)

Para obtener más información sobre todos los modelos de lenguaje disponibles, consulte

1 de abril de 2020

La personalización del modelo acústico ya está disponible de forma general

La personalización del modelo acústico ahora está disponible a nivel general (GA) para todos los idiomas soportados. Al igual que sucede con los modelos de lenguaje personalizado, IBM no cobra por crear o alojar un modelo acústico personalizado. Solo se le facturará por utilizar un modelo personalizado con una solicitud de reconocimiento de voz.

El uso de un modelo de lenguaje personalizado, de un modelo acústico personalizado o de ambos tipos de modelo para una transcripción supone un cargo adicional de 0,03 $ (dólares americanos) por minuto. Este cargo se suma al cargo de uso estándar de 0,02 $ (dólares americanos) por minuto y se aplica a todos los idiomas que reciben soporte de la interfaz de personalización. De modo que el coste total de utilizar uno o varios modelos personalizados para el reconocimiento de voz es de 0,05 $ (dólares americanos) por minuto.

16 de marzo de 2020

Las etiquetas de orador ya están soportadas para alemán y coreano
Ahora el servicio da soporte a las etiquetas de orador (el parámetro speaker_labels) para los modelos en los idiomas alemán y coreano. Las etiquetas de orador identifican qué persona ha pronunciado cada palabra en un intercambio con varios participantes. Para obtener más información, consulte Etiquetas de orador.
Ahora Activity Tracker ya está soportado para la interfaz HTTP asíncrona
El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de la interfaz HTTP asíncrona. IBM Cloud Activity Tracker registra las actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud®. Para obtener más información, consulte Sucesos de Activity Tracker.

24 de febrero de 2020

Actualizaciones de varios modelos para mejorar el reconocimiento de voz

Los siguientes modelos se han actualizado para mejorar el reconocimiento de voz:

  • Modelo de banda ancha holandés (nl-NL_BroadbandModel)
  • Modelo de banda estrecha holandés (nl-NL_NarrowbandModel)
  • Modelo de banda ancha italiano (it-IT_BroadbandModel)
  • Modelo de banda estrecha italiano (it-IT_NarrowbandModel)
  • Modelo de banda estrecha japonés (ja-JP_NarrowbandModel)
  • Modelo de banda ancha inglés de EE. UU. (en-US_BroadbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

Ahora la personalización del modelo de idioma ya está disponible para holandés e italiano

Ahora se da soporte a la personalización del modelo de idioma para holandés e italiano con las nuevas versiones de los siguientes modelos:

  • Modelo de banda ancha holandés (nl-NL_BroadbandModel)
  • Modelo de banda estrecha holandés (nl-NL_NarrowbandModel)
  • Modelo de banda ancha italiano (it-IT_BroadbandModel)
  • Modelo de banda estrecha italiano (it-IT_NarrowbandModel)

Para obtener más información, consulte

Debido a que los modelos holandés e italiano son versiones beta, su soporte para la personalización del modelo de lenguaje es también beta.

El modelo de banda estrecha para japonés ahora incluye algunas unidades de palabras multigramo

El modelo de banda estrecha japonés (ja-JP_NarrowbandModel) ahora incluye algunas unidades de palabras multigramo para dígitos y fracciones decimales. El servicio devuelve estas unidades multigramo independientemente de si ha habilitado el formateo inteligente. La característica de formateo inteligente entiende y devuelve las unidades multigramo que genera el modelo. Si aplica su propio postproceso a los resultados de la transcripción, deberá manejar estas unidades adecuadamente. Para obtener más información, consulte Japonés en la documentación de formateo inteligente.

Nuevos parámetros de detección de actividad del habla y de supresión de audio de fondo para reconocimiento de voz

Ahora el servicio ofrece dos nuevos parámetros opcionales para controlar el nivel de detección de actividad de voz. Los parámetros pueden ayudar a garantizar que solo se procese el audio relevante para el reconocimiento de voz.

  • El parámetro speech_detector_sensitivity ajusta la sensibilidad de la detección de actividad de voz. Puede utilizar el parámetro para suprimir las inserciones de palabras procedentes de música, tos y otros sucesos que no sean de voz.
  • El parámetro background_audio_suppression suprime el audio de fondo en función de su volumen para evitar que se transcriba o que interfiera de algún modo en el reconocimiento de voz. Puede utilizar el parámetro para suprimir las conversaciones secundarias o el ruido de fondo.

Puede utilizar los parámetros de forma individual o conjunta. Están disponibles para todas las interfaces y para la mayoría de los modelos de lenguaje. Para obtener más información acerca de los parámetros, sus valores permitidos y su efecto sobre la calidad y la latencia del reconocimiento de voz, consulte Detección de actividad de voz.

Activity Tracker ya está soportado para interfaces de personalización

El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de personalización. IBM Cloud Activity Tracker registra actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud. Puede utilizar este servicio para investigar una actividad anormal y acciones críticas, así como para cumplir con los requisitos de auditoría de la normativa. Además, puede recibir alertas sobre las acciones a medida que se ocurren. Para obtener más información, consulte Sucesos de Activity Tracker.

Arreglo de defectos: generación correcta de métricas de proceso con la interfaz WebSocket

Arreglo de defecto: la interfaz WebSocket ahora funciona sin problemas al generar métricas de proceso. Anteriormente, las métricas de proceso se podían seguir entregando después de que el cliente enviaría un mensaje stop al servicio.

18 de diciembre de 2019

Nuevos modelos beta para italiano disponibles

Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma italiano:

  • it-IT_BroadbandModel
  • it-IT_NarrowbandModel

Estos modelos de lenguaje dan soporte a la personalización del modelo acústico. No dan soporte a la personalización del modelo de lenguaje. Puesto que son versiones beta, estos modelos pueden no estar preparados para su uso en producción y pueden estar sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.

Para obtener más información, consulte las secciones siguientes:

Nuevo parámetro end_of_phrase_silence_time para el reconocimiento de voz

Para el reconocimiento de voz, ahora el servicio da soporte al parámetro end_of_phrase_silence_time. El parámetro especifica la duración del intervalo de pausa en el que el servicio divide una transcripción en varios resultados finales. Cada resultado final indica una pausa o un silencio largo que supera el intervalo de pausa. En el caso de la mayoría de los idiomas, el intervalo de pausa predeterminado es de 0,8 segundos; en el caso del chino, el intervalo es de 0,6 segundos.

Puede utilizar el parámetro establecer un equilibrio entre la frecuencia con la que se genera un resultado final y la precisión de la transcripción. Aumente el intervalo cuando la precisión sea más importante que la latencia. Reduzca el intervalo cuando se espere que el orador pronuncie frases cortas o respuestas de una sola palabra.

Para obtener más información, consulte Tiempo de silencio de fin de frase.

Nuevo parámetro split_transcript_at_phrase_end para el reconocimiento de voz

Para el reconocimiento de voz, ahora el servicio da soporte al parámetro split_transcript_at_phrase_end. El parámetro indica al servicio que divida la transcripción en varios resultados finales en función de las características semánticas de la entrada. El servicio basa su comprensión de las características semánticas en el modelo de lenguaje base que utilice con una solicitud. Los modelos de lenguaje personalizado y las gramáticas también afectan a la forma en que el servicio divide una transcripción.

El parámetro hace que el servicio añada un campo end_of_utterance a cada resultado final para indicar el objetivo de la división: full_stop, silence, end_of_data o reset.

Para obtener más información, consulte División de la transcripción al final de la frase.

12 de diciembre de 2019

Soporte completo para IBM Cloud IAM

Ahora el servicio Speech to Text da soporte a la implementación completa de IBM Cloud Identity and Access Management (IAM). Las claves de API para los servicios de IBM Watson® ya no están limitadas a una única instancia de servicio. Puede crear políticas de acceso y claves de API que se apliquen a más de un servicio, y puede otorgar acceso entre los servicios. Para obtener más información sobre IAM, consulte Autenticación en servicios de Watson.

Para dar soporte a este cambio, los puntos finales de servicio de API utilizan un dominio diferente e incluyen el ID de la instancia de servicio. El patrón es api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}.

  • URL de HTTP de ejemplo para una instancia alojada en la ubicación de Dallas:

https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • URL de WebSocket de ejemplo para una instancia alojada en la ubicación de Dallas:

wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Para obtener más información sobre las URL, consulta la referencia de la API y el SDK.

Estos URL no constituyen un cambio de última hora. Los nuevos URL funcionan tanto para las instancias de servicio existentes como para las nuevas instancias. Los URL originales siguen trabajando en las instancias de servicio existentes durante al menos un año, hasta diciembre de 2020.

Nuevas funciones de seguridad de red y de datos disponibles

Ya está disponible la compatibilidad con la siguiente nueva función de seguridad de red y datos:

  • Soporte de puntos finales de red privada

    Los usuarios de planes Premium pueden crear puntos finales de red privados para conectarse al servicio de Speech to Text a través de una red privada. Las conexiones a puntos finales de red privada no requieren acceso a la Internet pública. Para obtener más información, consulte Puntos finales de red públicos y privados.

10 de diciembre de 2019

Nuevos modelos beta para holandés de los Países Bajos disponibles

El servicio ofrece ahora modelos beta de banda ancha y banda estrecha para el idioma holandés de los Países Bajos:

  • nl-NL_BroadbandModel
  • nl-NL_NarrowbandModel

Estos modelos de lenguaje dan soporte a la personalización del modelo acústico. No dan soporte a la personalización del modelo de lenguaje. Puesto que son versiones beta, estos modelos pueden no estar preparados para su uso en producción y pueden estar sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.

Para obtener más información, consulte las secciones siguientes:

25 de noviembre de 2019

Actualizaciones de las etiquetas de orador para una mejor identificación de los oradores individuales
Las etiquetas de orador se han actualizado para mejorar la identificación de oradores individuales para realizar un análisis más detallado de su muestra de audio. Para obtener más información acerca de la característica de etiquetas de orador, consulte Etiquetas de orador. Para obtener más información sobre las mejoras introducidas en esta función, consulta « IBM Research AI Advances Speaker Diarization in Real Use Cases ».

12 de noviembre de 2019

Ahora ya está disponible un nueva ubicación de Seúl
El servicio Speech to Text ya está disponible en la ubicación de Seúl IBM Cloud (kr-seo). Al igual que con otras ubicaciones, la ubicación de IBM Cloud utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.

1 de noviembre de 2019

Nuevos límites en el número máximo de modelos personalizados
No puede crear más de 1024 modelos de lenguaje personalizado y no más de 1024 modelos acústicos personalizados por credencial de propietario. Para obtener más información, consulte Número máximo de modelos personalizados.

1 de octubre de 2019

Nuevo soporte de HIPAA de EE.UU. para planes Premium en la ubicación Washington, DC
El soporte de HIPAA de EE.UU. está disponible para los planes Premium que se alojan en la ubicación Washington, DC (ee.uu) y que se crean a partir del 1 de abril de 2019. Para obtener más información, consulte la Ley de Responsabilidad y Portabilidad de Seguro Médico (HIPAA).

22 de agosto de 2019

Arreglo de defectos: varias mejoras pequeñas
El servicio se ha actualizado para arreglos de defectos pequeños y para mejoras.

30 de julio de 2019

Ahora ya están disponibles nuevos modelos para dialectos del español

El servicio ahora ofrece modelos de lenguajes de banda ancha y banda estrecha en seis dialectos del español:

  • Español argentino (es-AR_BroadbandModel y es-AR_NarrowbandModel)
  • Español castellano (es-ES_BroadbandModel y es-ES_NarrowbandModel)
  • Español chileno (es-CL_BroadbandModel y es-CL_NarrowbandModel)
  • Español colombiano (es-CO_BroadbandModel y es-CO_NarrowbandModel)
  • Español mexicano (es-MX_BroadbandModel y es-MX_NarrowbandModel)
  • Español peruano (es-PE_BroadbandModel y es-PE_NarrowbandModel)

Los modelos de español castellano no son nuevos. Están disponibles de forma general (GA) para el reconocimiento del habla y la personalización del modelo de idioma de forma beta para la personalización del modelo acústico.

Los otros cinco dialectos son nuevos y son versiones beta para todos los usos. Puesto que son versiones beta, puede que estos dialectos adicionales no estén listos para su uso en producción y sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.

Para obtener más información, consulte las secciones siguientes:

24 de junio de 2019

Actualizaciones de modelos para portugués de Brasil e inglés de EE.UU. para mejorar el reconocimiento de voz

Los siguientes modelos de banda estrecha se han actualizado para conseguir un reconocimiento de voz mejorado:

  • Modelo de banda estrecha en portugués de Brasil (pt-BR_NarrowbandModel)
  • Modelo de banda estrecha en inglés americano (en-US_NarrowbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

Nuevo soporte para solicitudes simultáneas para actualizar diferentes modelos acústicos personalizados

El servicio ahora le permite enviar varias solicitudes simultáneas para añadir diversos recursos de audio a un modelo acústico personalizado. Anteriormente, el servicio permitía solamente una solicitud cada vez para añadir audio a un modelo personalizado.

Nuevo campo updated para métodos que listan modelos personalizados

La salida de los métodos HTTP GET que ofrecen información sobre los modelos acústicas y de lenguaje personalizados ahora incluyen un campo updated. El campo indica la fecha y hora en formato de hora universal coordinada (UTC) en que se ha modificado el modelo personalizado por última vez.

Cambiar a esquema para avisos asociados con entrenamiento de modelo personalizado

El esquema se ha cambiado por un aviso que ha generado una solicitud de entrenamiento cuando el parámetro strict se establece en false. Los nombres de los campos se han cambiado de warning_id y description a code y message, respectivamente. Para obtener más información, consulte la Referencia de API y SDK.

10 de junio de 2019

Las métricas de proceso no están disponibles con la interfaz HTTP síncrona
Las métricas de proceso sólo están disponibles con las interfaces WebSocket y HTTP asíncrona. No reciben soporte con la interfaz HTTP síncrona. Para obtener más información, consulte Métricas de proceso.

17 de mayo de 2019

Nuevas características de métricas de proceso y métricas de audio para el reconocimiento de voz

El servicio ahora ofrece dos tipos de métricas opcionales con solicitudes de reconocimiento de voz:

  • Las métricas de proceso proporcionan información de temporización detallada sobre el análisis del servicio del audio de entrada. El servicio devuelve las métricas a intervalos específicos y con sucesos de transcripción como, por ejemplo, resultados provisionales y finales. Utilice las métricas para medir el progreso de servicio transcribiendo el audio.
  • Las métricas de audio proporcionan información detallada sobre las características de señal del audio de entrada. Los resultados proporcionan métricas de agregación para todo el audio de entrada en la conclusión del proceso de habla. Utilice las métricas para determinar las características y la calidad del audio.

Puede solicitar ambos tipos de métricas con cualquier solicitud de reconocimiento de voz. De forma predeterminada, el servicio no devuelve métricas para una solicitud.

Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz

El modelo de banda ancha del japonés (ja-JP_BroadbandModel) se ha actualizado para el reconocimiento de voz mejorado. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en el modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

10 de mayo de 2019

Actualizaciones de modelos para español para mejorar el reconocimiento de voz

Los modelos del idioma español se han actualizado para el reconocimiento de voz mejorado:

  • es-ES_BroadbandModel
  • es-ES_NarrowbandModel

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

19 de abril de 2019

Ahora está disponible un nuevo parámetro strict para el entrenamiento de modelos personalizados
Los métodos de entrenamiento de la interfaz de personalización incluyen ahora un parámetro de consulta strict que indica si el entrenamiento debe continuar si un modelo personalizado contiene una mezcla de recursos válidos y no válidos. De forma predeterminada, el entrenamiento falla si un modelo personalizado contiene uno o más recursos no válidos. Establezca el parámetro false para permitir que el entrenamiento continúe siempre que el modelo contenga como mínimo un recurso válido. El servicio excluye del entrenamiento los recursos que no son válidos.
Nuevos límites en el número máximo de palabras fuera de vocabulario para modelos de idioma personalizados
Ahora puede añadir un máximo de 90.000 palabras OOV (no definidas en el vocabulario) al registro de palabras de un modelo de lenguaje personalizado. El máximo anterior era de 30.000 palabras OOV. Esta cifra incluye las palabras de OOV de todas las fuentes (corpus, gramáticas y palabras personalizadas individuales que se añaden directamente). Puede añadir un máximo de 10 millones de palabras en total a un modelo personalizado de todas las fuentes combinadas. Para obtener más información, consulte ¿Cuántos datos necesito?.

3 de abril de 2019

Nuevos límites en la cantidad máxima de audio para modelos acústicos personalizados
Ahora los modelos acústicos personalizados aceptan un máximo de 200 horas de audio. El límite máximo anterior era de 100 horas de audio.

21 de marzo de 2019

Ahora la visibilidad de las credenciales de servicio están restringidas por rol

Ahora los usuarios sólo pueden ver la información de credenciales de servicio que está asociada al rol que se ha asignado a su cuenta de IBM Cloud. Por ejemplo, si se le asigna un rol de reader, las credenciales de servicio de writer o de otros niveles superiores ya no son visibles.

Este cambio no afecta al acceso de API para usuarios o aplicaciones con credenciales de servicio existentes. El cambio sólo afecta a la visualización de credenciales dentro de IBM Cloud.

15 de marzo de 2019

Nuevo soporte para el formato de audio A-law
Ahora el servicio da soporte al audio en formato de A-law (audio/alaw). Para obtener más información, consulte Formato audio/alaw.

11 de marzo de 2019

Cambiar al valor de paso del parámetro 0 para max_alternatives
Para el parámetro max_alternatives, el servicio acepta de nuevo un valor de 0. Si especifica 0, el servicio utiliza automáticamente el valor predeterminado, 1. Un cambio realizado para la actualización del servicio del 4 de marzo hizo que el valor 0 devolviera un error. (El servicio devuelve un error si especifica un valor negativo.)
Cambiar al valor de paso del parámetro 0 para word_alternatives_threshold
Para el parámetro word_alternatives_threshold, el servicio acepta de nuevo el valor 0. Un cambio realizado para la actualización del servicio del 4 de marzo hizo que el valor 0 devolviera un error. (El servicio devuelve un error si especifica un valor negativo.)
Nuevo límite en la precisión máxima para puntuaciones de confianza
Ahora el servicio devuelve todas las puntuaciones de confianza con una precisión máxima de dos posiciones decimales. Este cambio incluye las puntuaciones de confianza correspondientes a transcripciones, confianza de palabras, alternativas a palabras, resultados de palabra clave y las etiquetas de orador.

4 de marzo de 2019

Actualizaciones de modelos de banda estrecha para portugués de Brasil, francés y español para mejorar el reconocimiento de voz

Los siguientes modelos de lenguaje de banda estrecha se han actualizado para mejorar el reconocimiento de voz:

  • Modelo de banda estrecha en portugués de Brasil (pt-BR_NarrowbandModel)
  • Modelo para francés (fr-FR_NarrowbandModel)
  • Modelo de banda estrecha para español (es-ES_NarrowbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

28 de enero de 2019

Nuevo soporte para IBM Cloud IAM mediante la interfaz WebSocket

La interfaz WebSocket ahora admite la autenticación de IAM (Identity and Access Management) basada en señales (IAM) a partir de código JavaScript basado en navegador. Se ha eliminado la limitación de lo contrario. Para establecer una conexión autenticada con el método WebSocket /v1/recognize:

  • Si utiliza la autenticación de IAM, incluya el parámetro de consulta access_token.
  • Si utiliza las credenciales de servicio de Cloud Foundry, incluya el parámetro de consulta watson-token.

Para obtener más información, consulte el apartado sobre cómo Abrir una conexión.

20 de diciembre de 2018

Ahora está disponible una nueva función de beta de gramáticas para modelos de idiomas personalizados

Ahora el servicio da soporte a gramáticas para el reconocimiento de voz. Las gramáticas están disponibles como funciones beta para todos los idiomas que dan soporte a la personalización del modelo de lenguaje. Puede añadir gramáticas a un modelo de lenguaje personalizado y utilizarlas para restringir el conjunto de frases que el servicio puede reconocer del audio. Puede definir una gramática en formato Augmented Backus-Naur Form (ABNF) o en formato XML.

Están disponibles los cuatro métodos siguientes para trabajar con gramáticas:

  • POST /v1/customizations/{customization_id}/grammars/{grammar_name} añade un archivo de gramática a un modelo de lenguaje personalizado.
  • GET /v1/customizations/{customization_id}/grammars muestra información sobre todas las gramáticas correspondientes a un modelo personalizado.
  • GET /v1/customizations/{customization_id}/grammars/{grammar_name} devuelve información sobre la gramática especificada para un modelo personalizado.
  • DELETE /v1/customizations/{customization_id}/grammars/{grammar_name} elimina una gramática existente de un modelo personalizado.

Puede utilizar una gramática para el reconocimiento de voz con las interfaces de WebSocket y HTTP. Utilice los parámetros language_customization_id y grammar_name para identificar el modelo personalizado y la gramática que desea utilizar. Actualmente, solo puede utilizar una gramática con una solicitud de reconocimiento de voz.

Para obtener más información sobre gramáticas, consulte la documentación siguiente:

Para obtener información sobre todos los métodos de la interfaz, consulta la referencia de la API y el SDK.

Ahora está disponible una nueva función de redacción numérica para inglés de EE.UU., japonés y coreano

Ahora dispone de una nueva característica de ocultación numérica para enmascarar números que tienen tres o más dígitos consecutivos. La ocultación sirve para eliminar la información personal confidencial, como números de tarjetas de crédito, de las transcripciones. Para habilitar esta característica, establezca el parámetro redaction en true en una solicitud de reconocimiento. La característica es una funcionalidad beta que solo está disponible en inglés de EE. UU., japonés y coreano. Para obtener más información, consulte Ocultación numérica.

Ahora están disponibles nuevos modelos de banda estrecha para francés y alemán

Los siguientes nuevos modelos de alemán y francés están ahora disponibles con el servicio:

  • Modelo de banda estrecha para francés (fr-FR_NarrowbandModel)
  • Modelo de banda estrecha para alemán (de-DE_NarrowbandModel)

Los dos nuevos modelos dan soporte a la personalización de modelos de lenguaje (GA) y a la personalización de modelos acústicos (beta). Para obtener más información, consulte Soporte de idiomas para la personalización.

Ahora está disponible el nuevo en-US_ShortForm_NarrowbandModel para inglés de EE.UU.

Ya está disponible un nuevo modelo de lenguaje inglés de Estados Unidos, en-US_ShortForm_NarrowbandModel. El nuevo modelo está pensado para que se utilice en soluciones de respuesta de voz interactivas y de soporte automatizado al cliente. El modelo da soporte a la personalización de modelos de lenguaje (GA) y a la personalización de modelos acústicos (beta). Para obtener más información, consulte El modelo de formato abreviado en inglés de EE. UU..

Actualizaciones de modelos de banda estrecha para inglés de EE.UU. y español para mejorar el reconocimiento de voz

Los siguientes modelos de lenguaje se han actualizado para mejorar el reconocimiento de voz:

  • Modelo de banda estrecha para inglés del Reino Unido (en-GB_NarrowbandModel)
  • Modelo de banda estrecha para español (es-ES_NarrowbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

Nuevo soporte para el formato de audio G.279

Ahora el servicio da soporte a audio en el formato G.729 (audio/g729). El servicio solo da soporte a G.729 Anexo D para audio de banda estrecha. Para obtener más información, consulte Formato audio/g729.

La característica de etiquetas de orador ahora está disponible para el modelo de banda estrecha para inglés del Reino Unido

La característica de etiquetas de orador ahora está disponible para el modelo de banda estrecha para inglés del Reino Unido (en-GB_NarrowbandModel). La característica es una funcionalidad beta para todos los idiomas soportados. Para obtener más información, consulte Etiquetas de orador.

Nuevos límites en la cantidad máxima de audio para modelos acústicos personalizados

La duración máxima de audio que se puede añadir a un modelo acústico personalizado ha aumentado de 50 horas a 100 horas.

13 de diciembre de 2018

Ahora está disponible una nueva ubicación de Londres
El servicio Speech to Text está ahora disponible en la IBM Cloud ubicación de Londres (eu-gb). Al igual que todas las ubicaciones, Londres utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.

12 de noviembre de 2018

Nuevo soporte para el formato inteligente para el reconocimiento de voz en japonés
Ahora el servicio da soporte al formateo inteligente para el reconocimiento de voz en japonés. Anteriormente, el servicio solo daba soporte al formateo inteligente en inglés de Estados Unidos y español. La característica es una funcionalidad beta para todos los idiomas soportados. Para obtener más información, consulte Formateo inteligente.

7 de noviembre de 2018

Ya disponible una nueva ubicación de Tokio
El servicio Speech to Text está ahora disponible en la IBM Cloud ubicación de Tokio(jp-tok). Al igual que todas las ubicaciones, Tokio utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.

30 de octubre de 2018

Nuevo soporte para IBM Cloud IAM basado en señales

El servicio Speech to Text se ha migrado a la autenticación de IAM basada en señales para todas las ubicaciones. Todos los servicios de IBM Cloud ahora utilizan la autenticación de IAM. El servicio Speech to Text se ha migrado en cada ubicación en las fechas siguientes:

  • Dallas (us-south): 30 de octubre de 2018
  • Frankfurt (eu-de): 30 de octubre de 2018
  • Washington, DC (us-east): 12 de junio de 2018
  • Sídney (au-syd): 15 de mayo de 2018

La migración a la autenticación de IAM afecta de forma distinta a las instancias de servicio nuevas y existentes:

  • Todas las instancias de servicio nuevas que se crean en cualquier ubicación ahora utilizan la autenticación de IAM para acceder al servicio. Puede pasar una señal portadora o una clave de API: las señales admiten solicitudes autenticadas sin incluir credenciales de servicio en cada llamada; las claves de API utilizan la autenticación básica HTTP. Cuando se utiliza cualquier SDK de Watson, se puede pasar la clave de API y dejar que SDK gestione el ciclo de vida de las señales.
  • Las instancias de servicio existentes que ha creado en una ubicación antes de la fecha de migración indicada siguen utilizando el {username} y la {password} de sus credenciales de servicio de Cloud Foundry para la autenticación hasta que las migre para que utilicen la autenticación de IAM.

Para obtener más información, consulte la siguiente documentación:

9 de octubre de 2018

Actualizaciones importantes en los cargos de precios para solicitudes de reconocimiento de voz

A partir del 1 de octubre de 2018, ahora se le cobra por todo el audio que pase al servicio para el reconocimiento de voz. Los mil primeros minutos de audio que envíe cada mes ya no son gratuitos. Para obtener más información sobre los planes de precios del servicio, consulta el servicio « Speech to Text » en el catálogo de IBM Cloud.

La cabecera Content-Type ahora es opcional para la mayoría de solicitudes de reconocimiento de voz

La cabecera Content-Type es ahora opcional para la mayoría de solicitudes de reconocimiento de voz. Ahora el servicio detecta automáticamente el formato de audio (tipo de MIME) de la mayoría de audio. Debe continuar especificando el tipo de contenido para los formatos siguientes:

  • audio/basic
  • audio/l16
  • audio/mulaw

Donde se indique, el tipo de contenido que especifique para estos formatos debe incluir la frecuencia de muestreo y puede incluir opcionalmente el número de canales y el valor endianness del audio. Para los demás formatos de audio, puede omitir el tipo de contenido o puede especificar un tipo de contenido application/octet-stream para que el servicio detecte automáticamente el formato.

Cuando utilice el mandato curl para realizar una solicitud de reconocimiento de voz con la interfaz HTTP, debe especificar el formato de audio con la cabecera Content-Type, especificar "Content-Type: application/octet-stream" o especificar "Content-Type:". Si omite la cabecera por completo, curl utiliza el valor predeterminado application/x-www-form-urlencoded. En la mayoría de los ejemplos de esta documentación se sigue especificando el formato de las solicitudes de reconocimiento de voz, independientemente de si es o no necesario.

Este cambio se aplica a los métodos siguientes:

  • /v1/recognize para solicitudes WebSocket. El campo content-type del mensaje de texto que se envía para iniciar una solicitud a través de una conexión WebSocket abierto es ahora opcional.
  • POST /v1/recognize para solicitudes HTTP síncronas. La cabecera Content-Type es ahora opcional. (Para las solicitudes de varias partes, el campo part_content_type de los metadatos JSON también es ahora opcional.)
  • POST /v1/recognitions para solicitudes HTTP asíncronas. La cabecera Content-Type es ahora opcional.

Para obtener más información, consulte Formatos de audio.

Actualizaciones del modelo de banda ancha para portugués de Brasil para mejorar el reconocimiento de voz

El modelo de banda ancha en portugués de Brasil, pt-BR_BroadbandModel, se ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

El parámetro customization_id se ha renombrado a language_customization_id

El parámetro customization_id de los métodos de reconocimiento de voz ha quedado en desuso y se eliminará en futuros releases. Para especificar un modelo de lenguaje personalizado para una solicitud de reconocimiento de voz, utilice en su lugar el parámetro language_customization_id. Este cambio se aplica a los métodos siguientes:

  • /v1/recognize para solicitudes WebSocket
  • POST /v1/recognize para solicitudes HTTP síncronas (incluidas las solicitudes de varias partes)
  • POST /v1/recognitions para solicitudes HTTP asíncronas

10 de septiembre de 2018

Nuevo modelo de banda ancha para alemán

Ahora el servicio da soporte a un modelo de banda ancha en alemán, de-DE_BroadbandModel. El nuevo modelo en alemán da soporte a la personalización de modelos de lenguaje (disponible a nivel general) y a la personalización de modelos acústicos (beta).

Personalización del modelo de idioma ahora disponible para portugués de Brasil

Los modelos existentes en portugués de Brasil, pt-BR_BroadbandModel y pt-BR_NarrowbandModel, ahora dan soporte a la personalización del modelo de lenguaje (disponible a nivel general). Los modelos no se actualizaron para habilitar este soporte, por lo que no es necesario actualizar los modelos acústicos personalizados existentes.

Actualizaciones de modelos para inglés de EE.UU. y japonés para mejorar el reconocimiento de voz

Hay nuevas versiones de los modelos de banda ancha y banda ancha en inglés y japonés disponibles:

  • Modelo de banda ancha inglés de EE. UU. (en-US_BroadbandModel)
  • Modelo de banda estrecha en inglés americano (en-US_NarrowbandModel)
  • Modelo de banda ancha para japonés (ja-JP_BroadbandModel)
  • Modelo de banda estrecha japonés (ja-JP_NarrowbandModel)

Los nuevos modelos ofrecen un mejor reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

Ahora las funciones de detección de palabras clave y alternativas a palabras ya están disponibles a nivel general

Las características de detección de palabras clave y alternativas a palabras están actualmente disponibles a nivel general (GA) en lugar de ser una funcionalidad beta para todos los idiomas. Para obtener más información, consulte

Arreglo de defecto: Mejorar la documentación para la interfaz de personalización

Corrección de errores: Se han resuelto los siguientes problemas conocidos relacionados con la interfaz de personalización, que ya están corregidos en el entorno de producción. Se conserva la siguiente información para los usuarios que pueden haber encontrado los problemas en el pasado.

  • Si añade datos a un modelo de lenguaje personalizado o a un modelo acústico personalizado, debe volver a entrenar el modelo antes de utilizarlo para el reconocimiento de voz. El problema se produce en el siguiente caso:

    1. El usuario crea un nuevo modelo personalizado (de lenguaje o acústico) y entrena el modelo.

    2. El usuario añade recursos adicionales (palabras, corpus o audio) al modelo personalizado, pero no vuelve a entrenar el modelo.

    3. El usuario no puede utilizar el modelo personalizado para el reconocimiento de voz. El servicio devuelve un error con el siguiente formato cuando se utiliza con una solicitud de reconocimiento de voz:

      {
        "code_description": "Bad Request",
        "code": 400,
        "error": "Requested custom language model is not available.
                  Please make sure the custom model is trained."
      }
      

    Para solucionar temporalmente este problema, el usuario debe volver a entrenar el modelo personalizado con sus datos más recientes. A continuación, el usuario puede utilizar el modelo personalizado con el reconocimiento de voz.

  • Antes de entrenar un modelo de lenguaje personalizado o un modelo acústico personalizado, debe actualizarlo a la versión más reciente de su modelo base. El problema se produce en el siguiente caso:

    1. El usuario tiene un modelo personalizado existente (de lenguaje o acústico) que se basa en un modelo que se ha actualizado.
    2. El usuario entrena el modelo personalizado existente con la versión antigua del modelo base sin actualizar primero a la versión más reciente del modelo base.
    3. El usuario no puede utilizar el modelo personalizado para el reconocimiento de voz.

    Para solucionar temporalmente este problema, el usuario debe utilizar el método POST /v1/customizations/{customization_id}/upgrade_model o POST /v1/acoustic_customizations/{customization_id}/upgrade_model para actualizar el modelo personalizado a la versión más reciente de su modelo base. A continuación, el usuario puede utilizar el modelo personalizado con el reconocimiento de voz.

7 de septiembre de 2018

La interfaz basada en sesiones ya no está disponible

La interfaz REST de HTTP basada en sesión ya no recibe soporte. Toda la información relacionada con las sesiones se ha eliminado de la documentación. Los métodos siguientes ya no están disponibles:

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Si la aplicación utiliza la interfaz de sesiones, debe migrar a una de las restantes interfaces REST de HTTP o a la interfaz WebSocket. Para obtener más información, consulte la actualización del servicio del 8 de agosto de 2018.

8 de agosto de 2018

Aviso de desuso para la interfaz de reconocimiento de voz basada en sesiones

La interfaz REST de HTTP basada en sesión ha quedado en desuso desde el 8 de agosto de 2018. Todos los métodos de la API de sesiones se eliminarán del servicio a partir del 7 de septiembre de 2018, después de lo cual ya no podrá utilizar la interfaz basada en sesión. Este aviso de desuso y de eliminación en 30 días se aplica a los métodos siguientes:

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

Si la aplicación utiliza la interfaz de sesiones, debe migrar a una de las siguientes interfaces antes del 7 de septiembre:

  • Para el reconocimiento de voz basado en secuencia (incluidos los casos de retransmisión en directo), utilice la interfaz WebSocket, que proporciona acceso a resultados provisionales y la latencia más baja.
  • Para el reconocimiento de voz basado en archivos, utilice una de las interfaces siguientes:
    • Para archivos cortos de unos pocos minutos de audio, utilice la interfaz HTTP síncrona (POST /v1/recognize) o la interfaz HTTP asíncrona (POST /v1/recognitions).
    • Para archivos más largos de más de unos pocos minutos de audio, utilice la interfaz HTTP asíncrona. La interfaz HTTP asíncrona acepta hasta 1 GB de datos de audio con una sola solicitud.

Las interfaces WebSocket y HTTP proporcionan los mismos resultados que la interfaz de sesiones (solo la interfaz WebSocket proporciona resultados provisionales). También puede utilizar uno de los SDK de Watson, que simplifican el desarrollo de aplicaciones con cualquiera de las interfaces. Para obtener más información, consulte la Referencia de API y SDK.

13 de julio de 2018

Actualizaciones del modelo de banda estrecha para español para mejorar el reconocimiento de voz

El modelo en español de banda estrecha, es-ES_NarrowbandModel, se ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

A partir de esta actualización, se encuentran disponibles las dos versiones siguientes del modelo en español de banda estrecha:

  • es_ES.8kHz.general.lm20180522235959.am20180522235959 (actual)
  • es_ES.8kHz.general.lm20180308235959.am20180308235959 (anterior)

La versión siguiente del modelo ya no está disponible:

  • es_ES.8kHz.general.lm20171031235959.am20171031235959

Una solicitud de reconocimiento que intenta utilizar un modelo personalizado basado en el modelo base que ahora no está disponible utiliza el modelo base más reciente sin ninguna personalización. El servicio devuelve el siguiente mensaje de aviso: Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported. Para reanudar el uso de un modelo personalizado basado en el modelo no disponible, primero debe actualizar el modelo utilizando el método upgrade_model adecuado descrito anteriormente.

12 de junio de 2018

Nuevas funciones para aplicaciones alojadas en la ubicación Washington, DC

Hay las siguientes características habilitadas para las aplicaciones alojadas en Washington, DC (us-east):

15 de mayo de 2018

Nuevas funciones para aplicaciones alojadas en la ubicación de Sídney

Hay las siguientes características habilitadas para las aplicaciones alojadas en Sídney (au-syd):

26 de marzo de 2018

La personalización del modelo de idioma ahora ya está disponible para el modelo de banda ancha para francés

El servicio ahora da soporte a la personalización del modelo de idioma para el modelo de idioma de banda ancha para francés fr-FR_BroadbandModel. El modelo para francés está a disposición general (GA) para el uso de producción con la personalización del modelo de idioma.

Actualizaciones de modelos para francés, coreano y español para mejorar el reconocimiento de voz

Se han actualizado los siguientes modelos para mejorar el reconocimiento de voz:

  • Modelo de banda estrecha para coreano (ko-KR_NarrowbandModel)
  • Modelo de banda estrecha para español (es-ES_NarrowbandModel)
  • Modelo de banda ancha para francés (fr-FR_BroadbandModel)

De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en alguno de estos modelos, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados.

El parámetro version se ha renombrado a base_model_version

El parámetro version de los métodos siguientes se denomina ahora base_model_version:

  • /v1/recognize para solicitudes WebSocket
  • POST /v1/recognize para solicitudes HTTP sin sesión
  • POST /v1/sessions para solicitudes HTTP basadas en sesión
  • POST /v1/recognitions para solicitudes HTTP asíncronas

El parámetro base_model_version especifica la versión de un modelo base que se va a utilizar para el reconocimiento de voz. Para obtener más información, consulte Utilización de modelos personalizados actualizados para el reconocimiento de voz y Realización de solicitudes de reconocimiento de voz con modelos personalizados actualizados.

Nuevo soporte para el formateo inteligente para el reconocimiento de voz en español

El formateo inteligente ahora recibe soporte para español, así como para inglés de EE. UU. Para inglés de EE. UU., la característica ahora también convierte series de palabras clave en signos de puntuación para puntos, comas, signos de interrogación y signos de exclamación. Para obtener más información, consulte Formateo inteligente.

1 de marzo de 2018

Actualizaciones de modelos de banda ancha para francés y español para mejorar el reconocimiento de voz

Los modelos de banda ancha para francés y español, fr-FR_BroadbandModel y es-ES_BroadbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en alguno de estos modelos, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información, consulte Actualización de modelos personalizados. En la sección se muestran las reglas para actualizar modelos personalizados, los efectos de la actualización y los métodos para utilizar modelos actualizados.

1 de febrero de 2018

Nuevos modelos para coreano

El servicio ahora ofrece modelos de idioma para el coreano: ko-KR_BroadbandModel para el audio que se muestrea a un mínimo de 16 kHz y ko-KR_NarrowbandModel para el audio que se muestrea a un mínimo de 8 kHz. Para obtener más información, consulte Idiomas y modelos de la generación anterior.

Para la personalización del modelo de idioma, los modelos para coreano están disponibles de forma general (GA) para el uso de producción; para la personalización del modelo acústico, son una funcionalidad beta. Para obtener más información, consulte Soporte de idiomas para la personalización.

  • Para obtener más información sobre la forma en que el servicio analiza el corpus en coreano, consulte Análisis de coreano.
  • Para obtener más información sobre cómo crear pronunciaciones de palabras personalizadas en coreano, consulte Directrices para coreano.

14 de diciembre de 2017

La personalización del modelo de idioma ahora está disponible de forma general

La personalización del modelo de lenguaje y todos los parámetros asociados están disponibles a nivel general (GA) para todos los idiomas a los que se da soporte: japonés, español, inglés del Reino Unido e inglés de EE. UU.

La personalización del modelo acústico beta ahora ya está disponible para todos los idiomas

Ahora el servicio da soporte a la personalización del modelo acústico como funcionalidad beta para todos los idiomas disponibles. Puede crear modelos acústicos personalizados para los modelos de banda ancha o de banda estrecha para todos los idiomas. Para obtener una introducción a la personalización, incluida la personalización del modelo acústico, consulte Descripción de la personalización.

Nuevo parámetro version para el reconocimiento de voz

Los diversos métodos para realizar solicitudes de reconocimiento ahora incluyen un nuevo parámetro version que puede utilizar para iniciar solicitudes que utilizan las versiones más antiguas o actualizadas de los modelos base y personalizados. Aunque se ha diseñado principalmente para su uso con modelos personalizados que se han actualizado, el parámetro version también se puede utilizar sin modelos personalizados. Para obtener más información, consulte Realización de solicitudes de reconocimiento de voz con modelos personalizados actualizados.

Actualizaciones de modelos para inglés de EE.UU. para mejorar el reconocimiento de voz

Los modelos en inglés de EE. UU., en-US_BroadbandModel y en-US_NarrowbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos en inglés de EE. UU., debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obtener más información sobre el procedimiento, consulte Actualización de modelos personalizados. En la sección se muestran las reglas para actualizar modelos personalizados, los efectos de la actualización y los métodos para utilizar modelos actualizados. Actualmente, los métodos solo se aplican a los nuevos modelos base en inglés de Estados Unidos. Sin embargo, la misma información se aplicará a las actualizaciones de otros modelos base a medida que estén disponibles.

La personalización del modelo de idioma ahora disponible para inglés del Reino Unido

Ahora el servicio da soporte a la personalización del modelo de lenguaje para los modelos en inglés del Reino Unido, en-GB_BroadbandModel y en-GB_NarrowbandModel. Aunque el servicio maneja las palabras del corpus y las personalizadas de inglés del Reino Unido y de Estados Unidos de forma similar, existen algunas diferencias importantes:

2 de octubre de 2017

Nueva interfaz beta de personalización de modelos acústicos para inglés de EE.UU., japonés y español

La interfaz de personalización ofrece ahora personalización del modelo acústico. Puede crear modelos acústicos personalizados que adapten los modelos base del servicio a su entorno y a los oradores. Puede cumplimentar y entrenar un modelo acústico personalizado con el audio que mejor se ajuste a la firma acústica del audio que se desea transcribir. Luego puede utilizar el modelo acústico personalizado con las solicitudes de reconocimiento para aumentar la precisión del reconocimiento de voz.

Los modelos acústicos personalizados complementan los modelos de lenguaje personalizado. Puede entrenar un modelo acústico personalizado con un modelo de lenguaje personalizado, y puede utilizar ambos tipos de modelos durante el reconocimiento de voz. La personalización del modelo acústico es una interfaz beta que sólo está disponible para inglés de EE.UU., japonés y español.

Nuevo parámetro beta customization_weight para modelos de idioma personalizados

Para la personalización del modelo de lenguaje, ahora el servicio incluye una característica beta que establece una ponderación de personalización opcional para un modelo de lenguaje personalizado. Una ponderación de personalización especifica la ponderación relativa que se debe dar a las palabras de un modelo de lenguaje personalizado frente a las palabras del vocabulario base del servicio. Puede establecer una ponderación de personalización durante el entrenamiento y durante el reconocimiento de voz. Para obtener más información, consulte Utilización de ponderaciones de personalización.

Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz

El modelo de lenguaje ja-JP_BroadbandModel se ha actualizado para que capture las mejoras del modelo base. La actualización no afecta a los modelos personalizados existentes que se basan en el modelo.

Nuevo parámetro endianness para el formato de audio audio/l16

Ahora el servicio incluye un parámetro para especificar el valor endianness del audio que se envía en formato audio/l16 (modulación de código de pulsos de 16 bits (PCM)). Además de especificar los parámetros rate y channels con el formato, ahora también puede especificar big-endian o little-endian con el parámetro endianness. Para obtener más información, consulte Formato audio/l16.

14 de julio de 2017

Nuevo soporte para el formato de audio de MP3 (MPEG)

Ahora el servicio da soporte a la transcripción de audio en formato MP3 o Motion Picture Experts Group (MPEG). Para obtener más información, consulte Formatos audio/mp3 y audio/mpeg.

La personalización del modelo de idioma beta ahora está disponible para español

La interfaz de personalización del modelo de lenguaje ahora da soporte al español como funcionalidad beta. Puede crear un modelo personalizado basado en cualquiera de los modelos de lenguaje base en español: es-ES_BroadbandModel o es-ES_NarrowbandModel; para obtener más información, consulte Creación de un modelo de lenguaje personalizado. Los precios de las solicitudes de reconocimiento que utilizan modelos de lenguaje personalizado en español son los mismos que los de las solicitudes que utilizan modelos en inglés de EE. UU. y en japonés.

Nuevo campo dialect para el método que crea un modelo de idioma personalizado

El objeto JSON CreateLanguageModel que se pasa al método POST /v1/customizations para crear un nuevo modelo de lenguaje personalizado ahora incluye un campo dialect. El campo especifica el dialecto del idioma que se va a utilizar con el modelo personalizado. De forma predeterminada, el dialecto coincide con el idioma del modelo base. El parámetro solo tiene sentido para los modelos en español, para los que el servicio crea un modelo personalizado que se adapta al habla de uno de los siguientes dialectos:

  • es-ES para español castellano (valor predeterminado)
  • es-LA para español de Latinoamérica
  • es-US para español de Norteamérica (México)

Los métodos GET /v1/customizations y GET /v1/customizations/{customization_id} de la interfaz de personalización incluyen el dialecto de un modelo personalizado en su salida. Para obtener más información, consulte Creación de un modelo de lenguaje personalizado y Listado de modelos de lenguaje personalizado.

Nuevos nombres para modelos para inglés del Reino Unido

Los nombres de los modelos de lenguaje en-UK_BroadbandModel y en-UK_NarrowbandModel han quedado en desuso. Ahora los modelos están disponibles con los nombres en-GB_BroadbandModel y en-GB_NarrowbandModel.

Los nombres en desuso en-UK_{model} siguen funcionando, pero el método GET /v1/models ya no devuelve los nombres en la lista de modelos disponibles. Todavía puede consultar los nombres directamente con el método GET /v1/models/{model_id}.

1 de julio de 2017

El modelo de idioma personalizado ahora está disponible a nivel general para inglés de EE.UU. y japonés

La interfaz de personalización del modelo de idioma del servicio está ahora disponible a nivel general (GA) para su dos idiomas soportados, inglés de EE.UU. y japonés. IBM no factura por crear, alojar o gestionar modelos de idioma personalizados. Como se describe en el siguiente punto, IBM ahora cobra 0,03 $ (dólares americanos) adicionales por minuto de audio para las solicitudes de reconocimiento que utilizan modelos personalizados.

Actualizaciones de los planes de precios para el servicio

IBM ha actualizado los precios del servicio

  • Eliminando el precio adicional por utilizar modelos de banda estrecha
  • Proporcionando un sistema de precio adicional por niveles para clientes con gran volumen
  • Facturando 0,03 $ (dólares americanos) adicionales por minuto de audio para las solicitudes de reconocimiento que utilizan los modelos de lenguaje personalizado en inglés de EE. UU. o en japonés

Para obtener más información acerca de las actualizaciones de los precios, consulte

El cuerpo vacío ya no es necesario para las solicitudes HTTP POST

Ya no tiene que pasar un objeto de datos vacío como cuerpo para las siguientes solicitudes POST:

  • POST /v1/sessions
  • POST /v1/register_callback
  • POST /v1/customizations/{customization_id}/train
  • POST /v1/customizations/{customization_id}/reset
  • POST /v1/customizations/{customization_id}/upgrade_model

Por ejemplo, ahora se llama al método POST /v1/sessions con curl del siguiente modo:

curl -X POST -u "{username}:{password}" \
--cookie-jar cookies.txt \
"{url}/v1/sessions"

Ya no tiene que pasar la siguiente opción curl con la solicitud: --data "{}". Si tiene algún problema con una de estas solicitudes POST, intente pasar un objeto de datos vacío con el cuerpo de la solicitud. El hecho de pasar un objeto vacío no modifica de ningún modo la naturaleza ni el significado de la solicitud.

22 de mayo de 2017

El parámetro continuous se ha eliminado de todos los métodos

El parámetro continuous se ha eliminado de todos los métodos que inician solicitudes de reconocimiento. Ahora el servicio transcribe una secuencia de audio completa hasta que termina o hasta que se excede el tiempo de espera, lo que ocurra primero. Este comportamiento es equivalente a establecer el anterior parámetro continuous en true. De forma predeterminada, anteriormente el servicio detenía la transcripción tras el primer medio segundo sin habla (normalmente silencio) si se omitía el parámetro o se si se establecía en false.

Las aplicaciones existentes que establezcan el parámetro en true no verán ningún cambio en el comportamiento. Es probable que las aplicaciones que establezcan el parámetro en false o que se basen en el comportamiento predeterminado vean un cambio. Si una solicitud especifica el parámetro, ahora el servicio responde devolviendo un mensaje de aviso para el parámetro desconocido:

"warnings": [
  "Unknown arguments: continuous."
]

La solicitud se ejecuta correctamente a pesar del aviso, y una sesión existente o una conexión WebSocket no se ven afectadas.

IBM ha eliminado el parámetro en respuesta a los muchos comentarios de la comunidad de desarrolladores según los que especificar continuous=false añadía poco valor y podía reducir la precisión global de la transcripción.

Envío de audio necesario para evitar el tiempo de espera de sesión

Ya no se puede evitar un tiempo de espera excedido de sesión sin enviar audio:

  • Cuando se utiliza la interfaz WebSocket, el cliente ya no puede mantener activa una conexión mediante el envío de un mensaje de texto JSON con el parámetro action establecido en no-op. El envío de un mensaje no-op no genera un error, pero no tiene ningún efecto.
  • Cuando se utilizan sesiones con la interfaz HTTP, el cliente ya no puede ampliar la sesión mediante el envío de una solicitud GET /v1/sessions/{session_id}/recognize. El método sigue devolviendo el estado de una sesión activa, pero no mantiene activa la sesión.

Ahora puede hacer lo siguiente para mantener activa una sesión:

  • Establezca el parámetro inactivity_timeout en -1 para evitar el tiempo de espera excedido de inactividad de 30 segundos.
  • Envíe cualquier dato de audio, incluido silencio, al servicio para evitar el tiempo de espera excedido de la sesión de 30 segundos. Se le factura por la duración de los datos que envía al servicio, incluido el silencio que envíe para ampliar una sesión.

Para obtener más información, consulte Tiempos de espera excedidos. Lo ideal es establecer una sesión justo antes de obtener el audio para la transcripción y mantener la sesión enviando audio a una velocidad cercana al tiempo real. Además, asegúrese de que la aplicación se recupera correctamente de las sesiones o las conexiones cerradas.

IBM ha eliminado esta funcionalidad para asegurarse de que continúa ofreciendo a todos los usuarios un servicio de reconocimiento de voz óptimo de baja latencia.

10 de abril de 2017

Las etiquetas de orador ahora están soportadas para inglés de EE.UU., español y japonés

Ahora el servicio da soporte a la característica de etiquetas de orador para los siguientes modelos de banda ancha:

  • Modelo de banda ancha inglés de EE. UU. (en-US-BroadbandModel)
  • Modelo de banda ancha para español (es-ES-BroadbandModel)
  • Modelo de banda ancha para japonés (ja-JP_BroadbandModel)

Para obtener más información, consulte Etiquetas de orador.

Nuevo soporte para el formato de audio de Web Media (WebM)

El servicio ahora admite el formato de audio WebM (Web Media) con el códec Opus o Vorbis. El servicio ahora también admite el formato de audio Ogg con el códec Vorbis además del códec Opus. Para obtener más información sobre los formatos de audio soportados, consulte Formato audio/webm.

Nuevo soporte para el uso compartido de recursos entre orígenes

El servicio ahora da soporte a CORS (Cross-Origin Resource Sharing) para permitir que los clientes basados en navegador llamen al servicio directamente. Para obtener más información, consulte Soporte de CORS.

Nuevo método para anular el registro de un URL de devolución de llamada con la interfaz HTTP asíncrona

Ahora la interfaz HTTP asíncrona ofrece un método POST /v1/unregister_callback que elimina el registro de un URL de devolución de llamada de la lista de elementos permitidos. Para obtener más información, consulte Anulación del registro de un URL de devolución de llamada.

Corrección de un error: Se han eliminado los tiempos de espera en archivos de audio largos con la inter WebSocket

Arreglo de defecto: la interfaz WebSocket ya no excede el tiempo de espera para solicitudes de reconocimiento para archivos de audio especialmente largos. Ya no es necesario solicitar resultados provisionales con el mensaje start de JSON para evitar el tiempo de espera excedido. (Este problema se había descrito en la actualización del 10 de marzo de 2016.)

Nuevos códigos de error HTTP

Los siguientes métodos de personalización del modelo de idioma ahora pueden devolver los siguientes códigos de error HTTP:

  • El método DELETE /v1/customizations/{customization_id} devuelve ahora el código de respuesta HTTP 401 si se intenta suprimir un modelo personalizado que no existe.
  • Ahora el método DELETE /v1/customizations/{customization_id}/corpora/{corpus_name} devuelve el código de respuesta HTTP 400 si se intenta suprimir un corpus que no existe.

8 de marzo de 2017

La interfaz HTTP asíncrona ahora está disponible a nivel general
La interfaz HTTP asíncrona ahora está disponible a nivel general (GA). Antes de esta fecha, era una funcionalidad beta.

1 de diciembre de 2016

Nueva característica beta de etiquetas de orador

Ahora el servicio ahora ofrece una característica de etiquetas de orador beta para audio de banda estrecha en inglés de EE. UU., español o japonés. La característica identifica las palabras que pronuncia cada orador en un intercambio con varias personas. Cada uno de los métodos de reconocimiento sin sesión, basado en sesión, asíncrono y WebSocket incluye un parámetro speaker_labels que acepta un valor booleano que indica si se deben incluir etiquetas de orador en la respuesta. Para obtener más información acerca de la característica, consulte Etiquetas de orador.

Ahora la personalización del modelo de idioma beta ya disponible para japonés

La interfaz de personalización del modelo de lenguaje beta ahora recibe soporte para el japonés además del inglés de EE. UU. Todos los métodos de la interfaz dan soporte al japonés. Para obtener más información, consulte las secciones siguientes:

Nuevo método para listar información sobre un corpus

La interfaz de personalización del modelo de lenguaje incluye ahora un método GET /v1/customizations/{customization_id}/corpora/{corpus_name} que muestra una lista con información acerca de un corpus especificado. El método resulta útil para supervisar el estado de una solicitud para añadir un corpus a un modelo personalizado. Para obtener más información, consulte Listado de los corpus de un modelo de lenguaje personalizado.

Nuevo campo count para métodos que listan palabras para modelos de idioma personalizados

La respuesta JSON que devuelven los métodos GET /v1/customizations/{customization_id}/words y GET /v1/customizations/{customization_id}/words/{word_name} ahora incluye un campo count para cada palabra. El campo indica el número de veces que se encuentra la palabra en todos los corpus. Si añade una palabra personalizada a un modelo antes de que se añada mediante cualquier corpus, el recuento empieza en 1. Si la palabra se añade desde un corpus primero y después se modifica, el recuento refleja sólo el número de veces que se encuentra en el corpus. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado.

Para los modelos personalizados que se crearon antes de la existencia del campo count, el campo siempre permanece en 0. Para actualizar el campo para dichos modelos, vuelva a añadir el corpus del modelo e incluya el parámetro allow_overwrite con el método POST /v1/customizations/{customization_id}/corpora/{corpus_name}.

Nuevo parámetro sort para métodos que listan palabras para modelos de idioma personalizados

El método GET /v1/customizations/{customization_id}/words incluye ahora un parámetro de consulta sort que controla el orden en el que se muestran las palabras en una lista. El parámetro acepta dos argumentos, alphabetical o count, que indican cómo se deben clasificar las palabras. Puede añadir un + o un - opcional antes de un argumento para indicar si los resultados se van a clasificar en orden ascendente o descendente. De forma predeterminada, el método muestra las palabras en orden alfabético ascendente. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado.

Para los modelos personalizados creados antes de la introducción del campo count, el uso del argumento count con el parámetro sort no tiene sentido. Utilice el argumento alphabetical predeterminado con dichos modelos.

Nuevo formato de campo de error para métodos que listan palabras para modelos de idioma personalizados

El campo error que se puede devolver como parte de una respuesta JSON de los métodos GET /v1/customizations/{customization_id}/words y GET /v1/customizations/{customization_id}/words/{word_name} ahora es una matriz. Si el servicio ha descubierto uno o varios problemas con la definición de una palabra personalizada, el campo lista cada elemento de problema de la definición y proporciona un mensaje que describe el problema. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado.

Los parámetros keywords_threshold y word_alternatives_threshold ya no aceptan un valor nulo

Los parámetros keywords_threshold y word_alternatives_threshold de los métodos de reconocimiento ya no aceptan un valor nulo. Para omitir alternativas de palabras clave y de palabras en la respuesta, omita los parámetros. El valor especificado debe ser un valor flotante.

22 de septiembre de 2016

Nueva interfaz beta de personalización de modelo de idioma
Ahora el servicio ofrece una nueva interfaz de personalización de modelo de lenguaje beta para inglés de Estados Unidos. Puede utilizar la interfaz para adaptar el vocabulario base y los modelos de lenguaje del servicio mediante la creación de modelos de lenguaje personalizado que incluyan terminología específica del dominio. Puede añadir palabras personalizadas individualmente o hacer que el servicio las extraiga del corpus. Para utilizar sus modelos personalizados con los métodos de reconocimiento de voz que ofrece cualquiera de las interfaces del servicio, pase el parámetro de consulta customization_id. Para obtener más información, consulte
Nuevo soporte para el formato de audio de audio/mulaw
La lista de formatos de audio admitidos ahora incluye audio/mulaw, que proporciona audio de un solo canal codificado mediante el algoritmo de datos u-law (o mu-law). Cuando utilice este formato, también debe especificar la frecuencia de muestreo a la que se captura el audio. Para obtener más información, consulte formato audio/mullaw.
Nuevo supported_features identificado al listar modelos
Los métodos GET /v1/models y GET /v1/models/{model_id} ahora devuelven un campo supported_features como parte de su salida para cada modelo de lenguaje. La información adicional describe si el modelo da soporte a la personalización. Para obtener más información, consulte la Referencia de API y SDK.

30 de junio de 2016

La interfaz HTTP asíncrona beta ahora da soporte a todos los idiomas disponibles
La interfaz HTTP asíncrona de la versión beta ahora da soporte a todos los idiomas soportados por el servicio. Anteriormente la interfaz solo estaba disponible para inglés de Estados Unidos. Para obtener más información, consulte La interfaz asíncrona de HTTP y la referencia de API y SDK.

23 de junio de 2016

Ya está disponible la nueva interfaz HTTP asíncrona beta
Ahora hay una interfaz HTTP asíncrona disponible. La interfaz proporciona funciones completas de reconocimiento para la transcripción en inglés de EE. UU. a través de llamadas HTTP de no bloqueo. Puede registrar URL de devolución de llamada y proporcionar series de secretos especificados por el usuario para conseguir la autenticación y la integridad de los datos con firmas digitales. Para obtener más información, consulte La interfaz asíncrona de HTTP y la referencia de API y SDK.
Nuevo parámetro beta smart_formatting para el reconocimiento de voz
Una característica de formateo inteligente beta que convierte fechas, horas, series de dígitos y números, números de teléfono, valores de moneda y direcciones de Internet en representaciones más convencionales en las transcripciones finales. Para habilitar esta característica, establezca el parámetro smart_formatting en true en una solicitud de reconocimiento. La característica es una funcionalidad beta que solo está disponible en inglés de EE. UU. Para obtener más información, consulte Formateo inteligente.
Nuevo modelo de banda ancha para francés
La lista de modelos que reciben soporte para el reconocimiento de voz ahora incluye fr-FR_BroadbandModel para el audio en el idioma francés que se muestrea a un mínimo de 16 kHz. Para obtener más información, consulte Idiomas y modelos de la generación anterior.
Nuevo soporte para el formato de audio de audio/basic
La lista de formatos de audio soportados ahora incluye audio/basic. El formato proporciona audio de un solo canal que se codifica mediante datos de 8 bits u-law (o mu-law) que se muestrean a 8 kHz. Para obtener más información, consulte formato de audio/básico.
Los métodos de reconocimiento de voz ahora devuelven avisos para parámetros no válidos
Los diversos métodos de reconocimiento pueden devolver una respuesta warnings que incluye mensajes sobre parámetros de consulta o campos JSON no válidos incluidos en una solicitud. El formato de los avisos ha cambiado. Por ejemplo, "warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ahora es "warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
El cuerpo vacío necesario para los métodos HTTP POST que no pasan datos
Para las solicitudes HTTP POST que de lo contrario no pasan datos al servicio, debe incluir un cuerpo de solicitud vacío con el formato {}. Con el mandato curl, puede utilizar la opción --data para pasar datos vacíos.

10 de marzo de 2016

Nuevos límites máximos sobre el audio transmitido para el reconocimiento de voz
Ambas formas de transmisión de datos (entrega única o en secuencia) ahora imponen un límite de 100 MB en datos de audio, al igual que la interfaz WebSocket. Anteriormente, el enfoque de entrega única tenía un límite máximo de 4 MB de datos. Para obtener más información, consulte Transmisión de audio (para todas las interfaces) y Envío de audio y recepción de resultados de reconocimiento (para la interfaz WebSocket). En la sección sobre WebSocket también se trata la trama máxima o el tamaño de mensaje de 4 MB impuesto por la interfaz WebSocket.
Las interfaces HTTP y WebSocket ahora pueden devolver avisos
La respuesta JSON a una solicitud de reconocimiento ahora puede incluir una matriz de mensajes de aviso correspondientes a parámetros de consulta o campos JSON no válidos incluidos con una solicitud. Cada elemento de la matriz es una serie que describe la naturaleza del aviso seguida de una matriz de series de argumentos no válidos. Por ejemplo, "warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]. Para obtener más información, consulte la Referencia de API y SDK.
El SDK iOS de Apple iOS beta está en desuso
El Watson Speech Software Development Kit (SDK) para el sistema operativo Apple® iOS beta está en desuso. En su lugar, utilice el Watson SDK para el sistema operativo iOS de Apple®. El nuevo SDK está disponible en el repositorio «ios-sdk», dentro del espacio de nombres « watson-developer-cloud », en GitHub.
La interfaz WebSocket puede producir resultados retardados
La interfaz WebSocket puede tardar unos minutos en producir los resultados finales para una solicitud de reconocimiento para un archivo de audio especialmente largo. En el caso de la interfaz WebSocket, la conexión TCP subyacente permanece inactiva mientras el servicio prepara la respuesta. Por lo tanto, la conexión se puede cerrar debido a un tiempo de espera excedido. Para evitar el tiempo de espera excedido con la interfaz WebSocket, solicite resultados provisionales (\"interim_results\": \"true\") en JSON para que el mensaje start inicie la solicitud. Puede descartar los resultados provisionales si no los necesita. Este problema se resolverá en una futura actualización.

19 de enero de 2016

Nueva característica de filtrado de lenguaje obsceno
El servicio se ha actualizado para incluir una nueva función de filtrado de lenguaje obsceno el 19 de enero de 2016. De forma predeterminada, el servicio censura el lenguaje obsceno de sus resultados de transcripción para el audio en inglés de Estados Unidos. Para obtener más información, consulte Filtrado de lenguaje obsceno.

17 de diciembre de 2015

Nueva característica de detección de palabras clave
Ahora el servicio ofrece una característica de detección de palabras clave. Puede especificar una matriz de series de palabras clave que se van a comparar con el audio de entrada. También debe especificar un nivel de confianza definido por el usuario que debe tener una palabra para que se considere que coincide con una palabra clave. Para obtener más información, consulte Detección de palabras clave. La característica de detección de palabras clave es una funcionalidad beta.
Nueva función de alternativas a palabras
Ahora el servicio ofrece una característica de alternativas a palabras. La característica devuelve hipótesis alternativas para palabras del audio de entrada que cumplen un nivel de confianza definido por el usuario. Para obtener más información, consulte Alternativas a palabras. La característica de alternativas a palabras es una funcionalidad beta.
Nuevos modelos para inglés de EE.UU. y árabe
El servicio da soporte a más idiomas con sus modelos de transcripción: en-UK_BroadbandModel y en-UK_NarrowbandModel para inglés del Reino Unido y ar-AR_BroadbandModel para árabe estándar moderno. Para obtener más información, consulte Idiomas y modelos de la generación anterior.
Nuevo campo session_closed para métodos basados en sesiones
En las respuestas JSON que devuelve para los errores con métodos basados en sesión, el servicio ahora también incluye un nuevo campo session_closed. El campo se establece en true si la sesión se cierra como resultado del error. Para obtener más información sobre los posibles códigos de respuesta de cualquier método, consulta la referencia de la API y el SDK.
El tiempo de espera de plataforma HTTP ya no se aplica
Las solicitudes de reconocimiento HTTP ya no están sujetas a un tiempo de espera de la plataforma de 10 minutos. Ahora, el servicio mantiene activa la conexión enviando un carácter de espacio en el objeto JSON de la respuesta cada 20 segundos mientras se lleva a cabo el reconocimiento. Para obtener más información, consulte Tiempos de espera excedidos.
Ya no es necesario limitar la velocidad con comando curl
Cuando se utiliza el mandato curl para transcribir audio con el servicio, ya no es necesario utilizar la opción --limit-rate para transferir datos a una velocidad no superior a 40.000 bytes por segundo.
Cambios en los códigos de error HTTP
El servicio ya no devuelve el código de estado de HTTP 490 para los métodos HTTP basados en sesión GET /v1/sessions/{session_id}/observe_result y POST /v1/sessions/{session_id}/recognize. El servicio ahora responde con el código de estado de HTTP 400 en su lugar.

21 de septiembre de 2015

Nuevos SDK móviles disponibles

Hay dos nuevos SDK móviles beta disponibles para los servicios de voz. Los SDK permiten a las aplicaciones móviles interactuar tanto con el servicio Speech to Text como con el servicio Text to Speech.

  • El Watson Speech SDK para la plataforma Google Android™ da soporte a la transmisión de audio al servicio Speech to Text en tiempo real y recibe una transcripción del audio mientras habla. El proyecto incluye una aplicación de ejemplo que muestra la interacción con ambos servicios de voz. El SDK está disponible en el repositorio «speech-android-sdk», dentro del espacio de nombres « watson-developer-cloud », en GitHub.
  • Watson Speech SDK para el sistema operativo iOS de Apple® da soporte a la transmisión de audio al servicio Speech to Text y recibe una transcripción del audio en respuesta. El SDK está disponible en el repositorio «speech-ios-sdk», dentro del espacio de nombres « watson-developer-cloud », en GitHub.

Los dos SDK admiten la autenticación con servicios de voz utilizando las credenciales de servicio de IBM Cloud o bien una señal de autenticación. Debido a que los SDK son beta, están sujetos a cambios en el futuro.

Nuevos modelos para portugués de Brasil y chino mandarín

El servicio da soporte a dos nuevos idiomas, el portugués de Brasil y el chino mandarín, con los siguientes modelos:

  • Modelo de banda ancha en portugués de Brasil (pt-BR_BroadbandModel)
  • Modelo de banda estrecha en portugués de Brasil (pt-BR_NarrowbandModel)
  • Modelo de banda ancha para chino mandarín (zh-CN_BroadbandModel)
  • Modelo de banda estrecha para chino mandarín (zh-CN_NarrowbandModel)

Para obtener más información, consulte Idiomas y modelos de la generación anterior.

Nuevo soporte para el formato de audio de audio/ogg;codecs=opus

Las solicitudes HTTP POST /v1/sessions/{session_id}/recognize y /v1/recognize, al igual que la solicitud WebSocket /v1/recognize, dan soporte a la transcripción de un nuevo tipo de soporte: audio/ogg;codecs=opus para archivos en formato Ogg que utilizan el codec Opus. Además, el formato audio/wav para los métodos ahora da soporte a cualquier codificación. La restricción sobre el uso de codificación PCM lineal se ha eliminado. Para obtener más información, consulte formato audio/ogg.

Nuevo parámetro sequence_id para el sondeo largo de sesiones

Ahora el servicio da soporte a la eliminación de tiempos de espera excedidos cuando se transcriben archivos de audio largos con la interfaz HTTP. Cuando utilice sesiones, puede utilizar un patrón de sondeo largo especificando los ID de secuencia con los métodos GET /v1/sessions/{session_id}/observe_result y POST /v1/sessions/{session_id}/recognize para tareas de reconocimiento de larga ejecución. Mediante el nuevo parámetro sequence_id de estos métodos, puede solicitar resultados antes, durante o después de enviar una solicitud de reconocimiento.

Nueva característica de capitalización para la transcripción en inglés de EE.UU.

Para los modelos de lenguaje en inglés de Estados Unidos, en_US_BroadbandModel y en_US_NarrowbandModel, el servicio ahora coloca correctamente mayúsculas en muchos nombres propios. Por ejemplo, el servicio devolvería un nuevo texto que dijera «Barack Obama se graduó en la Universidad de Columbia» en lugar de «barack obama se graduó en la universidad de columbia». Este cambio puede resultar especialmente interesante si es importante para la aplicación la colocación de mayúsculas en los nombres propios.

Nuevo código de error HTTP

La solicitud HTTP DELETE /v1/sessions/{session_id} no devuelve el código de estado 415 «Tipo de medio no admitido». Este código de retorno se ha eliminado de la documentación del método.

1 de julio de 2015

El servicio Speech to Text ahora está disponible a nivel general

El servicio ha pasado de beta a disponibilidad general (GA - General Availability) el 1 de julio de 2015. Existen las siguientes diferencias entre las versiones beta y GA de las API de Speech to Text. El release GA requiere que los usuarios actualicen a la nueva versión del servicio.

La versión GA de la API HTTP es compatible con la versión beta. Solo tiene que cambiar el código de aplicación existente si ha especificado de forma explícita un nombre de modelo. Por ejemplo, el código de ejemplo disponible para el servicio de GitHub incluía la siguiente línea de código en el archivo demo.js:

model: 'WatsonModel'

Esta línea especificaba el modelo predeterminado WatsonModel para la versión beta del servicio. Si la aplicación también especificaba este modelo, tiene que cambiarlo para que utilice uno de los nuevos modelos que reciben soporte de la versión GA. Para obtener más información, consulte el siguiente punto.

Nuevo modelo de programación basado en señales

Ahora el servicio da soporte a un nuevo modelo de programación para la interacción directa entre un cliente y el servicio a través de una conexión WebSocket. Utilizando este modelo, un cliente puede obtener una señal de autenticación para comunicarse directamente con el servicio. La señal elimina la necesidad de que una aplicación de proxy del lado del servidor de IBM Cloud llame al servicio en nombre del cliente. Las señales son el medio preferido para que los clientes interactúen con el servicio.

El servicio sigue dando soporte al modelo de programación antiguo que se basaba en un proxy del lado del servidor para retransmitir audio y mensajes entre el cliente y el servicio. Pero el nuevo modelo es más eficiente y proporciona un mayor rendimiento.

Nuevo parámetro model para el reconocimiento de voz

Los métodos POST /v1/sessions y POST /v1/recognize, junto con el método WebSocket /v1/recognize, ahora dan soporte a un parámetro de consulta model. El parámetro sirve para especificar información sobre el audio:

  • El idioma: inglés (English), japonés (Japanese) o español (Spanish)
  • La frecuencia mínima de muestreo: banda ancha (bradband, 16 kHz) o banda estrecha (narrowband, 8 kHz)

Para obtener más información, consulte Idiomas y modelos de la generación anterior.

Nuevo parámetro inactivity_timeout para el reconocimiento de voz

El parámetro inactivity_timeout establece el valor de tiempo de espera en segundos transcurrido el cual el servicio cierra la conexión si detecta silencio (ausencia de voz) en modalidad continua. De forma predeterminada, el servicio finaliza la sesión después de 30 segundos de silencio. Los métodos POST /v1/recognize y WebSocket /v1/recognize dan soporte al parámetro. Para obtener más información, consulte Tiempos de espera excedidos.

Nuevo parámetro max_alternatives para el reconocimiento de voz

El parámetro max_alternatives indica al servicio que devuelva las n mejores hipótesis alternativas para la transcripción de audio. Los métodos POST /v1/recognize y WebSocket /v1/recognize dan soporte al parámetro. Para obtener más información, consulte Número máximo de alternativas.

Nuevo parámetro word_confidence para el reconocimiento de voz

El parámetro word_confidence indica al servicio que devuelva una puntuación de confianza para cada palabra de la transcripción. Los métodos POST /v1/recognize y WebSocket /v1/recognize dan soporte al parámetro. Para obtener más información, consulte Confianza de palabras.

Nuevo parámetro timestamps para el reconocimiento de voz

El parámetro timestamps indica al servicio que devuelva la hora inicial y final con relación al inicio del audio para cada palabra de la transcripción. Los métodos POST /v1/recognize y WebSocket /v1/recognize dan soporte al parámetro. Para obtener más información, consulte Indicaciones de fecha y hora de palabras.

Método de sesiones renombrado para observar resultados

El método GET /v1/sessions/{session_id}/observeResult ahora se denomina GET /v1/sessions/{session_id}/observe_result. El nombre observeResult sigue recibiendo soporte por motivos de compatibilidad con versiones anteriores.

Nuevo soporte para formato de audio Waveform Audio File (WAV)

La cabecera Content-Type de los métodos recognize ahora da soporte a archivos de audio/wav para Waveform Audio File (WAV), además de audio/flac y audio/l16. Para obtener más información, consulte formato audio/wav.

Límites sobre la cantidad máxima de audio para el reconocimiento de voz

Ahora el servicio tiene un límite de 100 MB de datos por sesión en modalidad continua. Puedes especificar el modo de transmisión indicando el valor « chunked » en el encabezado « Transfer-Encoding ». Una entrega única de un archivo de audio sigue imponiendo un límite de tamaño de 4 MB en los datos que se envían. Para obtener más información, consulte Transmisión de audio.

Nueva cabecera para renunciar a las mejoras de servicio

Los métodos GET /v1/sessions/{session_id}/observe_result, POST /v1/sessions/{session_id}/recognize y POST /v1/recognize ahora incluyen el parámetro de cabecera X-WDC-PL-OPT-OUT para controlar si el servicio utiliza los datos de audio y de transcripción de una solicitud para mejorar resultados futuros. La interfaz WebSocket incluye un parámetro de consulta equivalente. Especifique el valor 1 para impedir que el servicio utilice resultados de audio y de transcripción. El parámetro se aplica sólo a la solicitud actual. La nueva cabecera sustituye la cabecera X-logging de la API beta. Consulte Control del registro de solicitudes para servicios de Watson.

Cambios en los códigos de error HTTP

El servicio ahora puede responder con los siguientes códigos de error HTTP:

  • Para los métodos /v1/models, /v1/models/{model_id}, /v1/sessions, /v1/sessions/{session_id}, /v1/sessions/{session_id}/observe_result, /v1/sessions/{session_id}/recognize y /v1/recognize, se ha añadido el código de error 415 ("Unsupported Media Type").
  • En el caso de las solicitudes de tipo « POST » y « GET » realizadas al método « /v1/sessions/{session_id}/recognize », se modifican los siguientes códigos de error:
    • El código de error 404 ("Session_id not found") tiene un mensaje más descriptivo (POST y GET).
    • El código de error 503 ("Session is already processing a request. Concurrent requests are not allowed on the same session. La sesión sigue activa después de este error.") tiene un mensaje más descriptivo (sólo POST).
    • Para solicitudes HTTP POST destinadas a los métodos /v1/sessions y /v1/recognize, se puede devolver el código de error 503 ("Service Unavailable"). El código de error también puede aparecer al crear una conexión de tipo « WebSocket » con el método « /v1/recognize ».