Notas del release de Speech to Text para IBM Cloud
IBM Cloud
Se han incluido las siguientes características y cambios en cada versión y actualización de las instancias gestionadas de IBM Watson® Speech to Text alojadas en IBM Cloud, así como en las instancias alojadas en IBM Cloud Pak for Data como servicio. A menos que se indique lo contrario, todos los cambios son compatibles con releases anteriores y están disponibles de forma automática y transparente para todas las aplicaciones nuevas y existentes.
Para obtener información sobre las limitaciones conocidas del servicio, consulte Limitaciones conocidas.
Para obtener información sobre releases y actualizaciones del servicio para IBM Cloud Pak for Data, consulte Notas del release de Speech to Text for IBM Cloud Pak for Data.
29 de junio de 2026
- Nuevo parámetro «
parameter_set» para modelos de voz de gran tamaño -
Los modelos de voz de gran tamaño incluyen ahora un parámetro de solicitud «
parameter_set» que aplica ajustes optimizados en una sola llamada. Utiliza «parameter_set=enhanced» para mejorar la calidad del reconocimiento sin tener que configurar manualmente cada parámetro por separado.- Para obtener más información, consulta el parámetro de solicitud «parameter_set ».
26 de junio de 2026
low_latencyEl modo ya está disponible para el modelo de voz grande en inglés de EE. UU-
El modelo de voz grande en inglés de EE. UU. «
en-US» incluye ahora el modlow_latency, que permite un procesamiento de voz más rápido.- Para obtener más información sobre «
low_latency», consulta el resumen de parámetros. - Para obtener más información sobre los resultados provisionales y la baja latencia, consulta « Baja latencia ».
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
- Para obtener más información sobre «
15 de mayo de 2026
- Ya está disponible el modelo de voz grande para italiano
-
El gran modelo de habla para el italiano,
it-IT, ya está disponible de forma generalizada (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
10 de abril de 2026
- Ya está disponible el modelo de voz grande para neerlandés
-
El gran modelo de habla para neerlandés,
nl-NL, ya está disponible de forma general (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
07 de abril de 2026
Corrección de defectos: Se ha corregido un problema por el que fille se reconoce incorrectamente en el reconocimiento de secuencias alfanuméricas en francés con la función de formato inteligente.
17 de marzo de 2026
- Mejora del modelo de gran lengua francesa
- Ya están disponibles las mejoras de los Large Language Models (LSM) franceses
fr-FRyfr-CApara aumentar la precisión en el reconocimiento de secuencias alfanuméricas.
Corrección de defectos: Se ha corregido un problema en la identificación de idiomas (LID) por el que se observaban errores intermitentes en 5xx cuando a una solicitud /v1/recognize?language_identification=true le
seguía inmediatamente una solicitud normal /v1/recognize.
Corrección de defectos: Se ha corregido un problema por el que se observaban errores internos del servidor con el parámetro max_active.
Corrección de defectos: Se ha corregido un problema por el que se devolvían erróneamente errores internos del servidor cuando include_transparent_words estaba configurado como true.
04 de marzo de 2026
- Mejoras de los modelos alemán y neerlandés de voz a texto
-
Ya están disponibles las mejoras de los modelos de voz a texto en alemán y neerlandés.
- Ya están disponibles las mejoras del Large Speech Model (LSM) alemán
de-DEpara el reconocimiento de secuencias alfanuméricas y casos de uso general. - Ya están disponibles las mejoras de la telefonía holandesa
nl-NL_Telephonypara el reconocimiento de secuencias alfanuméricas y el tratamiento de la saliencia.
- Ya están disponibles las mejoras del Large Speech Model (LSM) alemán
16 de febrero de 2026
- Ya está disponible el modelo de voz grande para alemán
-
El gran modelo de habla para alemán,
de-DE, ya está disponible de forma generalizada (GA) en todos los centros de datos y admite las frecuencias de muestreo de audio 8kHz y 16kHz.- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
- Mejoras del enriquecimiento de las transcripciones orales
-
Las mejoras en el enriquecimiento de transcripciones de voz están ahora disponibles para entidades con nombre, incluidas fechas, hora, moneda, números y medidas. Estas entidades se gestionan ahora correctamente según la configuración regional del idioma.
22 de enero de 2026
Corrección de defectos: Se ha corregido un problema por el que el enriquecimiento de la transcripción del habla falla cuando el parámetro del modelo está ausente en las solicitudes.
Corrección de defectos: Se ha corregido un problema por el que se observaba un mayor tiempo de entrenamiento de la personalización de voz a texto (STT) debido a fallos internos por falta de memoria.
08 de enero de 2026
Corrección de defectos: Se ha corregido un problema en el enriquecimiento de transcripciones de voz en el centro de datos de Fráncfort.
Corrección de defectos: Se ha corregido un problema en interim_results por el que no se enviaban las transcripciones finales de los discursos cuando interim_results se establecía en false.
10 de diciembre de 2025
- Validación de campos de entrada para la función
sounds_like -
La función de validación de campos de entrada para
sounds_likeahora está habilitada para idiomas adicionales.- La validación de campos de entrada para la función
sounds_likeestá habilitada para idiomas adicionales, incluidos los modelos deen-US,en-AU,en-GB,en-IN,es-ES,es-AR,es-CL,es-CO,es-MX,es-PE,fr-FR_Telephony,fr-FR_Multimedia,de-DE_Telephony,de-DE_Multimedia,it-IT_Telephony,it-IT_Multimediaynl-NL_Telephony.
- La validación de campos de entrada para la función
25 de noviembre de 2025
- Ya están disponibles los resultados provisionales de Large Speech Models
-
Ya están disponibles los resultados provisionales de los grandes modelos del habla (LSM).
interim_resultsantes sólo estaba habilitado para los modelos de nueva generación. Ahora, también está habilitado para los LSM. Para obtener más información, consulte Resultados provisionales.
03 de noviembre de 2025
- La detección de eventos de inicio de habla ya está disponible para los modelos STT.
-
La detección de eventos de inicio de habla ya está disponible para los modelos STT.
- Mediante la detección de eventos de inicio de habla, ahora puede recibir una notificación anticipada con la API
recognizeque detecta el inicio del habla en el flujo de audio entrante y envía una notificación al usuario. Para obtener más información, consulte Detección de eventos de inicio de habla.
- Mediante la detección de eventos de inicio de habla, ahora puede recibir una notificación anticipada con la API
- Mejoras en la detección de la actividad del habla para una respuesta más rápida, una mayor precisión y un mejor rendimiento en entornos ruidosos.
-
La detección de actividad del habla (SAD) se ha actualizado para incluir un nuevo método mejorado además del método existente en la API Speech To Text
recognize.- El nuevo método aumenta la precisión y el rendimiento en la detección de los límites del habla dentro del flujo de audio. Puede utilizarse configurando
sad_module:2. Para obtener más información, consulta « Detección de actividad del habla(SAD) ».
- El nuevo método aumenta la precisión y el rendimiento en la detección de los límites del habla dentro del flujo de audio. Puede utilizarse configurando
- La identificación de la lengua hablada ya está disponible de forma generalizada
-
La identificación de la lengua hablada ya está disponible de forma generalizada.
- La identificación lingüística (LID) detecta automáticamente la lengua hablada en los flujos de audio. El modelo procesa continuamente el audio entrante y devuelve la lengua identificada cuando alcanza un nivel de confianza superior al umbral especificado ( 0.99 por defecto). Para más información, consulte Identificación de la lengua hablada.
07 de octubre de 2025
hintsya está disponible de forma general-
El parámetro
hintsya está disponible de forma generalizada.hintsmejora el posprocesamiento con Smart Formatter. Este parámetro ayuda al formateador a interpretar la intención del usuario con mayor precisión y a devolver resultados que se ajusten mejor a las expectativas. Para más información, consulte el parámetro Consejos.
26 de septiembre de 2025
- El enriquecimiento de las transcripciones orales ya está disponible de forma generalizada
-
El enriquecimiento de la transcripción de discursos ya está disponible de forma generalizada.
- La función de enriquecimiento de transcripciones de voz mejora la legibilidad y facilidad de uso de las transcripciones sin procesar del reconocimiento automático de voz (ASR). Este servicio de posprocesamiento añade automáticamente signos de puntuación y aplica mayúsculas inteligentes para mejorar la estructura y claridad del contenido hablado. Para más información, consulte Enriquecimiento de la transcripción oral.
09 de septiembre de 2025
Corrección de defectos: Se ha corregido un problema en Smart Formatter para el modelo de idioma Fr-CA por el que los números de 8 dígitos se formateaban incorrectamente con ceros adicionales. El formateador inteligente devuelve ahora la transcripción correcta.
19 de agosto de 2025
Corrección de defectos: Se ha corregido un problema en Smart Formatter por el que los valores numéricos hablados en las transacciones se transcribían incorrectamente. Por ejemplo, one hundred and ninety-nine and twelve cents debería transcribirse como $199.12, pero aparecía incorrectamente como 199 e R$ 0,12. El formateador inteligente devuelve ahora la
transcripción correcta.
Corrección de defectos: Se ha corregido un problema en el formateador inteligente para los modelos en francés por el que la palabra "cent" se formateaba incorrectamente. Por ejemplo, quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit se transcribió como 89450328 100 1678 en lugar del esperado 8945032811678. El formateador inteligente devuelve ahora la transcripción
correcta.
22 de julio de 2025
Corrección de defectos: Se ha corregido el error del modelo personalizado ja-JP, provocado por el carácter de espacio completo ( U+3000 ).
Corrección de defectos: Se ha corregido el problema de formato del correo electrónico portugués del formateador inteligente, por el que se introducían espacios de más en las direcciones de correo electrónico. Para más información, véase Formateador inteligente para portugués.
08 de julio de 2025
- Mejoras en el reconocimiento de entidades con nombre para el modelo de gran voz inglés
-
Incluye mejoras en el reconocimiento de ciudades, direcciones, nombres de calles, caracteres alfanuméricos, fechas y nombres y apellidos.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
- Corrección de defectos: Formateador Inteligente Español Modelo de Gran Voz (
es-ES) formato de fecha -
Corrección de defectos:
el primero de enero de dos mil->el 01/01/2000debe formatearse como01/01/2000. Este problema se ha corregido. Para más información, consulte Formateador inteligente para español.
17 de junio de 2025
Corrección de defectos: La asignación de valor para la Versión del Formateador Inteligente, que estaba provocando un error de inserción, resultando en el procesamiento fallido de solicitudes específicas. Este problema está solucionado. Las solicitudes del formateador inteligente ahora responden como se espera.
Corrección de defectos: En el formateador inteligente, se observaban espacios no deseados en caracteres alfanuméricos. Por ejemplo, l k k one one five zero zero four two l e-> lkk1 150042le. Este
problema está solucionado. Las solicitudes del formateador inteligente ahora responden como se espera.
28 de mayo de 2025
- Ya está disponible el nuevo modelo de gran voz para japonés
-
Ya está disponible el modelo de habla grande para japonés.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
Mejora: Se añade un mejor manejo del Formateador Inteligente para frases de letras habladas - a as in alpha-> a.
29 de abril de 2025
- Corrección de defectos: Se corrigen varios problemas de desambiguación de letras, dígitos o símbolos en el formateador inteligente
-
Corrección de defectos: Se solucionan los siguientes problemas:
- 'O' se formateó como el dígito 0
- 'a real' se formateó como ' r1 '
- 'colonoscopia' se formateó como ':oscopia'
07 de abril de 2025
- Corrección de defectos: Se ha detectado una fuente inesperada en OOV
- Corrección de defectos: Cuando se añadía un corpus a un modelo personalizado, las palabras OOV eliminadas anteriormente se restauraban sin querer desde la fuente anterior. Este problema se ha corregido.
18 de marzo de 2025
- Corrección de defectos: Se corrigen los problemas del formateador inteligente con fechas y números adicionales en el modelo
en-us. - Corrección de defectos: El formateo se desactiva cuando el total de dígitos es superior a la fecha formateada requerida. Por ejemplo,
five twelve fifteen eleven->5 1/2/1511debe ser:5121511.
11 de febrero de 2025
Corrección de defectos: Se ha observado un gran número de 503’s, concretamente para el ja-JP_NarrowbandModel. Se han introducido mejoras en el servicio para aumentar la disponibilidad de este modelo.
Corrección de defectos: Se ha encontrado un error de asignación de memoria de personalización STT para el modelo en-US_Telephony. Este problema está solucionado.
Corrección de defectos: Se observó un problema del formateador inteligente con las abreviaturas en el modelo en-us (Dr. se corrigió a Doctor). Este problema está solucionado.
14 de enero de 2025
Mejora: Se han actualizado los alfanuméricos de las instancias en las que el formateador inteligente combinaba algunas combinaciones de números
pronunciados individualmente - 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203. Este problema se ha solucionado.
- Corrección de defectos: El tiempo de ejecución no envía todas las hipótesis
- Corrección de defectos: Algunas palabras faltaban en las transcripciones debido a un problema con las marcas de tiempo de transcripción en los casos en los que las palabras clave tenían puntuaciones de confianza diferentes
a las de la hipótesis. El resultado era que la transcripción devolvía una sola palabra
yes, aunque el audio contuviera dos palabrasyes. Se ha introducido una mejora en la lógica de eliminación de marcas de tiempo para corregir este problema.
19 de noviembre de 2024
- Ya está disponible el nuevo modelo de grandes discursos en alemán
-
El modelo de gran discurso para alemán ya está disponible de forma generalizada.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
- Corrección de defectos: Mejora de la lógica de muestreo ascendente ( 8khz a 16khz ) para el modelo de gran voz inglesa multibanda
-
Corrección de defectos: La lógica de muestreo ascendente en el servicio es necesaria para que el modelo gestione tanto 8khz como 16khz.
05 de noviembre de 2024
- Corrección de defectos: Las etiquetas de los altavoces desactivan los resultados provisionales de los LSM y los RNNT
- Corrección de defectos: Se ha detectado un problema por el que los resultados provisionales dejaban de llegar cuando se activaban las etiquetas de altavoz. El problema se ha solucionado y ahora el servicio devuelve resultados provisionales inmediatamente cuando se utilizan etiquetas de altavoz.
23 de agosto de 2024
- Todos los modelos de voz de gran tamaño ya están disponibles para el público en general
-
Los grandes modelos del habla para todas las lenguas ya están generalmente disponibles (GA). Están soportados para su uso en entornos de producción y aplicaciones.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
18 de junio de 2024
- Los nuevos modelos de voz grandes para portugués y español de Brasil están ahora en fase beta abierta
-
Los grandes modelos de habla para portugués brasileño y español están ahora en beta abierta. El español incluye los dialectos castellano, argentino, chileno, colombiano, mexicano y peruano.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
15 de mayo de 2024
- El modelo de voz grande para inglés está ahora disponible de forma general
-
El modelo de gran habla para el inglés, que incluye los dialectos de Estados Unidos, Australia, India y Reino Unido, ahora está disponible en general (GA). Se recomienda su uso en entornos de producción y aplicaciones.
- Para obtener más información sobre los modelos de voz grandes, consulte Modelos y lenguajes de voz grandes.
- Para obtener más información sobre las características soportadas para los modelos de voz de gran tamaño, consulte Características soportadas para modelos de voz de gran tamaño.
07 de marzo de 2024
- Modelo de voz grande para inglés de EE.UU. en Open Beta
- El nuevo modelo Large speech para el inglés de EE.UU. está en beta abierta. Consulte Idiomas y modelos de voz grandes para obtener más detalles con las características soportadas (beta).
30 de noviembre de 2023
- Parámetro Speech to Text speech_begin_event
-
Este parámetro permitiría a la aplicación cliente saber que se han detectado algunas palabras o habla y que Speech to Text está en proceso de descodificación. Para obtener más detalles, consulte Utilización de parámetros de reconocimiento de voz.
- Parámetro 'mapping_only' para palabras personalizadas
-
Utilizando el parámetro 'mapping_only', puede utilizar palabras personalizadas directamente para mapear 'sounds_like' (o palabra) a valor 'display_as' como post-procesamiento en lugar de entrenamiento. Para obtener más información, consulte El recurso de palabras.
-
Consulte las directrices para No japonés y Japonés.
- Soporte para el portugués de Brasil y el francés de Canadá en la nueva personalización del modelo de idioma de próxima generación mejorada
-
Recientemente se ha añadido la personalización del modelo de idioma para los modelos de próxima generación de Brasil-Portugués y Francés-Canadiense. Esta actualización de servicio incluye mejoras internas adicionales.
- Nueva característica de formato inteligente
-
Se da soporte a una nueva característica de formato inteligente para los modelos de próxima generación en inglés de Estados Unidos, portugués de Brasil, francés y alemán. Consulte Versión de formato inteligente para obtener más detalles.
- Soporte para español castellano y español LATAM en la nueva personalización del modelo de idioma de próxima generación mejorada
-
Se añade la personalización del modelo de idioma para los modelos castellano español y LATAM español de próxima generación. Esta actualización de servicio incluye mejoras internas adicionales.
- Modelos de voz de gran tamaño para inglés, japonés y francés - para acceso anticipado
-
Para la característica de acceso anticipado, los modelos de voz grandes están disponibles para los idiomas inglés, japonés y francés en IBM Watson Speech-to-Text e IBM watsonx Assistant. El conjunto de características para estos modelos de habla grande es limitado, pero más preciso que los modelos de próxima generación y es más rápido y más barato de ejecutar debido a un tamaño más pequeño y una mejor capacidad de modo de transmisión.
Si está interesado en probar estos modelos base y en compartir resultados y comentarios, póngase en contacto con nuestro equipo de gestión de productos rellenando este formulario.
28 de julio de 2023
- Importante: Todos los modelos de generación anterior se han dejado de mantener a partir del 1 de agosto de 2023
- Importante: Todos los modelos de generación anterior ahora se han dejado de mantener del servicio. Los nuevos clientes ahora sólo deben utilizar los modelos de próxima generación. Ahora todos los clientes existentes deben migrar al modelo de próxima generación equivalente. Para obtener más información sobre todos los modelos de próxima generación, consulte Idiomas y modelos de próxima generación. Para obtener más información sobre cómo migrar a los modelos de próxima generación, consulte Migración a modelos de próxima generación.
9 de junio de 2023
- Arreglo de defectos: la creación y el entrenamiento de un modelo de lenguaje personalizado ahora es óptimo para los modelos estándar y de baja latencia de próxima generación
- Arreglo de defectos: al crear y entrenar un modelo de lenguaje personalizado con archivos de texto corpus y/o palabras personalizadas utilizando un modelo de baja latencia de próxima generación, ahora está funcionando de la misma forma que con un modelo estándar. Anteriormente, no era óptimo sólo cuando se utilizaba un modelo de baja latencia de Next-Generation.
- Arreglo de defecto: las sesiones de sockets web STT ya no fallan debido a un mensaje de error de tensor
- Arreglo de defectos: Cuando se utilizan websockets STT, las sesiones ya no fallan debido a un mensaje de error "STT devuelve el error: los tamaños de tensores deben coincidir excepto en la dimensión 0".
18 de mayo de 2023
- Actualizaciones del modelo de telefonía médica de próxima generación en inglés
-
El modelo de telefonía médica de última generación en inglés se ha actualizado para mejorar el reconocimiento de voz:
en-WW_Medical_Telephony
- Se ha añadido soporte para francés y alemán en la nueva personalización de modelo de lenguaje de próxima generación mejorada
-
Recientemente se ha añadido la personalización del modelo de idioma para los modelos de próxima generación en francés y alemán. Esta actualización de servicio incluye mejoras internas adicionales.
Para obtener más información sobre las mejoras en la personalización de última generación, consulta
- Arreglo de defecto: las palabras personalizadas que contienen caracteres Katakana de media anchura ahora devuelven un mensaje de error claro con el modelo de telefonía japonés
-
Arreglo de defectos: En la documentación, sólo se aceptan caracteres Katakana de ancho completo en palabras personalizadas y los modelos de la siguiente generación ahora muestran un mensaje de error para explicar que no está soportado. Anteriormente, al crear palabras personalizadas que contenían caracteres Katakana de media anchura, no se proporcionaba ningún mensaje de error.
- Arreglo de defectos: el modelo de idioma de telefonía japonés ya no falla debido a un largo tiempo de entrenamiento
-
Arreglo de defectos: Cuando se entrena un modelo de lenguaje personalizado con la telefonía japonesa, el servicio maneja ahora de forma eficaz un gran número de palabras personalizadas sin fallar.
2 de mayo de 2023
- Nuevo procedimiento para actualizar un modelo personalizado que se basa en un modelo de próxima generación mejorado
-
Ahora hay dos enfoques disponibles para actualizar un modelo de lenguaje personalizado a un modelo base de próxima generación mejorado. Todavía puede modificar y, a continuación, volver a entrenar el modelo personalizado, como ya se ha documentado. Pero ahora, también puede actualizar el modelo personalizado incluyendo el parámetro de consulta
force=truecon la solicitudPOST /v1/customizations/{customization_id}/train. El parámetroforceactualiza el modelo personalizado independientemente de si contiene cambios (está en el estadoreadyoavailable).Para obtener más información, consulte Actualización de un modelo de lenguaje personalizado basado en un modelo de próxima generación mejorado.
- Guía para añadir palabras a modelos personalizados que se basan en modelos de próxima generación mejorados
-
La documentación ahora ofrece más orientación sobre la adición de palabras a modelos personalizados que se basan en modelos de próxima generación mejorados. Por razones de rendimiento durante el entrenamiento, la guía fomenta el uso de corpus en lugar de la adición directa de palabras personalizadas siempre que sea posible.
Para obtener más información, consulte Directrices para añadir palabras a modelos personalizados basados en modelos de próxima generación mejorados.
- Las palabras personalizadas en japonés para modelos personalizados que se basan en modelos de próxima generación mejorados se manejan de forma diferente
-
Para los modelos personalizados en japonés que se basan en modelos de próxima generación, las palabras personalizadas se manejan de forma diferente a otros idiomas. Para el japonés, puede añadir una palabra o sonidos personalizados que no superen los 25 caracteres de longitud. Si la palabra o los sonidos personalizados superan ese límite, el servicio añade la palabra al modelo personalizado como si se añadiera mediante un corpus. La palabra no aparece como una palabra personalizada para el modelo.
Para obtener más información, consulte Directrices para añadir palabras a modelos en japonés basados en modelos de próxima generación mejorados.
12 de abril de 2023
- Arreglo de defecto: la interfaz WebSocket ahora excede el tiempo de espera como se esperaba cuando se utilizan modelos de próxima generación
- Arreglo de defectos: cuando se utiliza para el reconocimiento de voz con modelos de próxima generación, la interfaz WebSocket ahora excede el tiempo de espera como se esperaba después de largos periodos de silencio. Anteriormente, cuando se utilizaba para el reconocimiento de voz de archivos de audio cortos, la sesión WebSocket no podía agotar el tiempo de espera. Cuando la sesión no ha podido agotar el tiempo de espera, el servicio no ha devuelto una hipótesis final a la aplicación cliente en espera y, en su lugar, el cliente ha excedido el tiempo de espera mientras esperaba los resultados.
6 de abril de 2023
- Arreglo de defectos: límites para permitir la finalización del entrenamiento para modelos personalizados japoneses de próxima generación
-
Arreglo de defectos: el entrenamiento satisfactorio de un modelo de idioma personalizado japonés de próxima generación requiere que las palabras y los sonidos personalizados añadidos al modelo no contengan más de 25 caracteres cada uno. Para el entrenamiento más efectivo, se recomienda que las palabras personalizadas y los sonidos-me gusta no contengan más de 20 caracteres. El entrenamiento de modelos personalizados japoneses con palabras y sonidos personalizados más largos-me gusta no se completa después de varias horas de entrenamiento.
Si necesita añadir el equivalente de una palabra larga o sonidos similares a un modelo personalizado japonés de próxima generación, siga estos pasos:
- Añada una palabra o sonidos más cortos-como que captura la esencia de la palabra o sonidos más largos-como al modelo personalizado.
- Añada una o más frases que utilicen la palabra o sonidos más largos a un corpus.
- Considere la posibilidad de añadir frases al corpus que proporcionen más contexto para la palabra o los sonidos. Un mayor contexto proporciona al servicio más información con la que reconocer la palabra y aplicar los sonidos correctos.
- Añade el corpus al modelo personalizado.
- Vuelva a entrenar el modelo personalizado en la combinación de la palabra o los sonidos más cortos y el corpus que contiene la serie más larga.
Los límites y pasos que se acaban de describir permiten que los modelos personalizados japoneses de próxima generación completen el entrenamiento. Tenga en cuenta que la adición de un gran número de nuevas palabras personalizadas a un modelo de lenguaje personalizado aumenta el tiempo de entrenamiento del modelo. Pero el aumento del tiempo de entrenamiento sólo se produce cuando el modelo personalizado se entrena inicialmente en las nuevas palabras. Una vez que el modelo personalizado se ha entrenado en las nuevas palabras, el tiempo de entrenamiento vuelve a la normalidad.
For more information, see
- Mejoras adicionales en la personalización del modelo de lenguaje de próxima generación actualizada
-
La personalización del modelo de idioma para los modelos de próxima generación en inglés y japonés se ha mejorado recientemente. Esta actualización de servicio incluye mejoras internas adicionales. Para obtener más información sobre las mejoras en la personalización de última generación, consulta
13 de marzo de 2023
- Arreglo de defectos: el formato inteligente para las fechas en inglés de EE.UU. ahora es correcto
- Arreglo de defectos: el formato inteligente ahora incluye correctamente los días de la semana y las fechas en las que ambos están presentes en el audio hablado, por ejemplo,
Tuesday February 28. Anteriormente, en algunos casos se omitía el día de la semana y la fecha se presentaba de forma incorrecta. Tenga en cuenta que el formateo inteligente es funcionalidad beta. - Arreglo de defectos: actualizar documentación para palabras de vacilación de voz para modelos de próxima generación
- Arreglo de defectos: se ha actualizado la documentación de las palabras de vacilación de voz para los modelos de próxima generación. Se proporcionan más detalles sobre las palabras de vacilación en inglés y japonés de Estados Unidos. Los modelos de próxima generación incluyen las palabras de duda reales en los resultados de transcripción, a diferencia de los modelos de generación anterior, que incluyen sólo marcadores de duda. Para obtener más información, consulte Titubeos y marcadores de duda.
27 de febrero de 2023
- Nuevo modelo japonés de telefonía de última generación
-
El servicio ofrece ahora un modelo de telefonía de última generación para los japoneses:
ja-JP_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Personalización mejorada del modelo de idioma para modelos en inglés y japonés de próxima generación
-
El servicio ahora proporciona una personalización mejorada del modelo de idioma para los modelos en inglés y japonés de próxima generación:
en-AU_Multimediaen-AU_Telephonyen-IN_Telephonyen-GB_Multimediaen-GB_Telephonyen-US_Multimediaen-US_Telephonyja-JP_Multimediaja-JP_Telephony
Mejoras visibles en los modelos: la nueva tecnología mejora el comportamiento predeterminado de los nuevos modelos en inglés y japonés. Entre otros cambios, la nueva tecnología optimiza el comportamiento predeterminado para los siguientes parámetros:
- El
customization_weightpredeterminado para los modelos personalizados que se basan en las nuevas versiones de estos modelos cambia de0.2a0.1. - El
character_insertion_biaspredeterminado para los modelos personalizados que se basan en las nuevas versiones de estos modelos sigue siendo0.0, pero los modelos han cambiado de una forma que hace que el uso del parámetro para el reconocimiento de voz sea menos necesario.
Actualización a los nuevos modelos: Para aprovechar la tecnología mejorada, debe actualizar los modelos de lenguaje personalizados que se basan en los nuevos modelos. Para actualizar a la nueva versión de uno de estos modelos base, haga lo siguiente:
- Cambie el modelo personalizado añadiendo o modificando una palabra, corpus o gramática personalizada que contenga el modelo. Cualquier cambio que realice mueve el modelo al estado
ready. - Utilice el método
POST /v1/customizations/{customization_id}/trainpara volver a entrenar el modelo. Volver a entrenar actualiza el modelo personalizado a la nueva tecnología y mueve el modelo al estadoavailable.
Problema conocido: En este momento, no puede utilizar el método
POST /v1/customizations/{customization_id}/upgrade_modelpara actualizar un modelo personalizado a uno de los nuevos modelos base. Este problema se solucionará en una próxima versión.Utilización de los nuevos modelos: Después de la actualización al nuevo modelo base, se le recomienda que evalúe el rendimiento del modelo personalizado actualizado prestando especial atención a los parámetros
customization_weightycharacter_insertion_biaspara el reconocimiento de voz. Cuando vuelva a entrenar el modelo personalizado:- El modelo personalizado utiliza el nuevo
customization_weightpredeterminado de0.1para el modelo personalizado. Se elimina uncustomization_weightno predeterminado que tenía asociado con el modelo personalizado. - Es posible que el modelo personalizado ya no requiera el uso del parámetro
character_insertion_biaspara un reconocimiento de voz óptimo.
Las mejoras en la personalización del modelo de lenguaje hacen que estos parámetros sean menos importantes para el reconocimiento de voz de alta calidad:
- Si utiliza los valores predeterminados para estos parámetros, continúe haciéndolo después de la actualización. Los valores predeterminados probablemente seguirán ofreciendo los mejores resultados para el reconocimiento de voz.
- Si especifica valores no predeterminados para estos parámetros, experimente con los valores predeterminados después de la actualización. El modelo personalizado puede funcionar bien para el reconocimiento de voz con los valores predeterminados.
Si cree que el uso de valores diferentes para estos parámetros puede mejorar el reconocimiento de voz con el modelo personalizado, experimente con cambios incrementales para determinar si los parámetros son necesarios para mejorar el reconocimiento de voz.
Nota: En este momento, las mejoras en la personalización del modelo de lenguaje sólo se aplican a los modelos personalizados que se basan en los modelos de idioma base en inglés o japonés de próxima generación listados anteriormente. Con el tiempo, las mejoras estarán disponibles para otros modelos de lenguaje de próxima generación.
Más información: Para obtener más información sobre la actualización y el reconocimiento de voz con estos parámetros, consulte
- Arreglo de defecto: los archivos de gramática ahora manejan series de dígitos correctamente
-
Arreglo de defectos: cuando se utilizan gramáticas, el servicio ahora maneja correctamente series más largas de dígitos. Anteriormente, no se podía completar el reconocimiento o devolver resultados incorrectos.
15 de febrero de 2023
- Importante: Todos los modelos de generación anterior están en desuso y llegarán al final del servicio el 31 de julio de 2023
-
Importante: Todos los modelos de generación anterior están en desuso y llegarán al final del servicio a partir del 31 de julio de 2023. En esa fecha, todos los modelos de generación anterior se eliminarán del servicio y de la documentación. La fecha de desuso anterior era el 3 de marzo de 2023. La nueva fecha permite a los usuarios más tiempo para migrar a los modelos de próxima generación adecuados. Pero los usuarios deben migrar al modelo de próxima generación equivalente antes del 31 de julio de 2023.
La mayoría de los modelos de generación anterior quedaron en desuso el 15 de marzo de 2022. Anteriormente, los modelos árabe y japonés no estaban en desuso. Ahora la característica en desuso se aplica a todos los modelos de generación anterior.
- Para obtener más información sobre los modelos de próxima generación a los que puede migrar desde cada uno de los modelos en desuso, consulte Idiomas y modelos de la generación anterior
- Para obtener más información sobre la migración de modelos de la generación anterior a modelos de la próxima generación, consulte Migración a modelos de próxima generación.
- Para obtener más información sobre todos los modelos de próxima generación, consulte Idiomas y modelos de próxima generación
Nota: Cuando el modelo de la generación anterior
en-US_BroadbandModeldeje de estar disponible, el modelo de la próxima generaciónen-US_Multimediapasará a ser el modelo predeterminado para las solicitudes de reconocimiento de voz. - Arreglo de defectos: Tiempo de entrenamiento mejorado para modelos de lenguaje personalizado de próxima generación
-
Arreglo de defectos: El tiempo de entrenamiento para los modelos de lenguaje personalizado de próxima generación ahora ha mejorado significativamente. Anteriormente, el tiempo de entrenamiento tardaba mucho más de lo necesario, como se informó para el entrenamiento de modelos de lenguaje personalizado japonés. El problema se ha corregido mediante un arreglo interno.
- Arreglo de defectos: los archivos de gramática generados dinámicamente ahora funcionan correctamente
-
Arreglo de defectos: Los archivos de gramática generados dinámicamente ahora funcionan correctamente. Anteriormente, los archivos de gramática dinámica podían provocar anomalías internas, tal como se notificaba para la integración de Speech to Text con IBM® watsonx™ Assistant. El problema se ha corregido mediante un arreglo interno.
20 de enero de 2023
- Los nombres de modelo en desuso en árabe y Reino Unido ya no están disponibles
-
El servicio ya no acepta los siguientes nombres de modelo en árabe y en el Reino Unido:
ar-AR_BroadbandModel-En su lugar, utilicear-MS_BroadbandModel.en-UK_NarrowbandModel-En su lugar, utiliceen-GB_NarrowbandModel.en-UK_BroadbandModel-En su lugar, utiliceen-GB_BroadbandModel.
El nombre de modelo árabe quedó en desuso el 2 de diciembre de 2020. Los nombres de modelo en inglés del Reino Unido quedaron en desuso el 14 de julio de 2017.
- Cloud Foundry en desuso y migración a grupos de recursos
-
IBM ha anunciado la desaparición de IBM Cloud Foundry el 31 de mayo de 2022. A partir del 30 de noviembre de 2022, las nuevas IBM Cloud Foundry no se podrán crear y solo los usuarios existentes podrán desplegar aplicaciones. IBM Cloud Foundry ry alcanza el fin de soporte el 1 de junio de 2023. En ese momento, cualquier IBM Cloud Foundry que ejecute aplicaciones IBM Cloud Foundry se deshabilitará, desaprovisionará y eliminará permanentemente.
Para seguir utilizando sus aplicaciones IBM Cloud más allá del 1 de junio de 2023, debe migrar a grupos de recursos antes de esa fecha. Los grupos de recursos son conceptualmente similares a los espacios de Cloud Foundry. Entre ellas se incluyen varias ventajas adicionales, como un control de acceso más detallado mediante el uso de la gestión de identidades y acceso ( IBM Cloud Identity and Access Management, IAM), la posibilidad de conectar instancias de servicio a aplicaciones y servicios en diferentes regiones, y una forma sencilla de consultar el uso por grupo.
- El parámetro
max_alternativesahora está disponible para su uso con modelos de próxima generación -
El parámetro
max_alternativesahora está disponible para su uso con todos los modelos de próxima generación. Por lo general, este parámetro está disponible en todos los modelos de nueva generación. Para obtener más información, consulte Número máximo de alternativas. - Arreglo de defecto: permitir el uso de los parámetros
max_alternativesyend_of_phrase_silence_timecon modelos de próxima generación -
Arreglo de defectos: cuando se utilizan los parámetros
max_alternativesyend_of_phrase_silence_timeen la misma solicitud con modelos de próxima generación, el servicio ahora devuelve varias transcripciones alternativas respetando también el intervalo de pausa indicado. Anteriormente, el uso de los dos parámetros en una sola solicitud generaba una anomalía. (El uso del parámetromax_alternativescon modelos de próxima generación estaba disponible anteriormente como una característica experimental para un número limitado de clientes.) - Arreglo de defecto: Actualizar modelo de telefonía de próxima generación francés canadiense (se requiere actualización)
-
Arreglo de defectos: el modelo de telefonía de próxima generación de Canadá,
fr-CA_Telephony, se ha actualizado para abordar una incoherencia interna que podría provocar un error durante el reconocimiento de voz. Es necesario actualizar los modelos personalizados que se basan en el modelofr-CA_Telephony. Para obtener más información sobre cómo actualizar modelos personalizados, consulta - Arreglo de defectos: añadir directrices de documentación para crear suenes-me gusta en japonés basándose en modelos de próxima generación
-
Arreglo de defectos: en sonidos-me gusta para modelos de lenguaje personalizado en japonés que se basan en modelos de próxima generación, la secuencia de caracteres
ウーes ambigua en algunos contextos de la izquierda. No utilice caracteres (sílabas) que terminen con el fonema/o/, como por ejemploロyト. En estos casos, utiliceウウo simplementeウen lugar deウー. Por ejemplo, utiliceロウウマンoロウマンen lugar deロウーマン. Para obtener más información, consulte Directrices para japonés. - La adición de palabras directamente a modelos personalizados que se basan en modelos de próxima generación aumenta el tiempo de entrenamiento
-
La adición de palabras personalizadas directamente a un modelo personalizado que se basa en un modelo de próxima generación hace que el entrenamiento de un modelo tarde unos minutos más de lo que lo haría de otro modo. Si está entrenando un modelo con palabras personalizadas que ha añadido utilizando el método
POST /v1/customizations/{customization_id}/wordsoPUT /v1/customizations/{customization_id}/words/{word_name}, espere unos minutos de tiempo de entrenamiento adicional para el modelo. Para obtener más información, consulte - Se ha aumentado el número máximo de horas de recursos de audio para modelos acústicos personalizados en la ubicación de Tokio
-
El número máximo de horas de recursos de audio que puede añadir a los modelos acústicos personalizados en la ubicación de Tokio es de nuevo de 200 horas. Anteriormente, el máximo se reducía a 50 horas para la región de Tokio. Esa reducción ha sido rescindida y pospuesta hasta el próximo año. Para obtener más información, consulte Número máximo de horas de audio.
5 de diciembre de 2022
- Nuevo modelo multimedia holandés de próxima generación
- El servicio ofrece ahora un modelo multimedia de última generación para el neerlandés de los Países Bajos:
nl-NL_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Arreglo de defectos: corrija el reconocimiento de palabras personalizado en los resultados de transcripción para los modelos de próxima generación
- Arreglo de defectos: Para la personalización de modelos de lenguaje con modelos de próxima generación, ahora las palabras personalizadas se reconocen y se utilizan en todas las transcripciones. Anteriormente, las palabras personalizadas a veces no se reconocían ni se utilizaban en los resultados de transcripción.
- Arreglo de defectos: uso correcto del campo
display_asen los resultados de transcripción para modelos de próxima generación - Arreglo de defectos: para la personalización del modelo de lenguaje con modelos de próxima generación, el valor del campo
display_aspara una palabra personalizada aparece ahora en todas las transcripciones. Anteriormente, el valor del campoworda veces aparecía en los resultados de la transcripción. - Arreglo de defectos: actualizar la documentación de denominación de modelos personalizados
- Arreglo de defectos: la documentación ahora proporciona reglas detalladas para denominar modelos de lenguaje personalizado y modelos acústicos personalizados. Para obtener más información, consulte
20 de octubre de 2022
- Actualizaciones de los modelos de telefonía de última generación en inglés
-
Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Arreglo de defectos: actualizar el modelo multimedia de próxima generación en japonés (es necesaria una actualización)
-
Arreglo de defectos: El modelo multimedia de próxima generación en japonés,
ja-JP_Multimedia, se ha actualizado para abordar una incoherencia interna que podría provocar un error durante el reconocimiento de voz con baja latencia. Es necesario actualizar los modelos personalizados que se basan en el modeloja-JP_Multimedia. Para obtener más información sobre cómo actualizar modelos personalizados, consulta
7 de octubre de 2022
- Nuevo modelo sueco de telefonía de última generación
-
El servicio ofrece ahora un modelo de telefonía de última generación para Suecia:
sv-SE_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Actualizaciones de los modelos de telefonía de última generación en inglés
-
Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
21 de septiembre de 2022
- Nuevo suceso de Activity Tracker para la supresión del GDPR de la información de usuario
-
El servicio ahora devuelve un suceso Activity Tracker cuando utiliza el método
DELETE /v1/user_datapara suprimir toda la información sobre un usuario. El suceso se denominaspeech-to-text.gdpr-user-data.delete. Para obtener más información, consulte Sucesos de Activity Tracker. - Arreglo de defectos: actualice algunos modelos de próxima generación para mejorar el tiempo de respuesta de baja latencia
-
Arreglo de defectos: Los siguientes modelos de próxima generación se han actualizado para mejorar su tiempo de respuesta cuando se utiliza el parámetro
low_latency:en-IN_Telephonyhi-IN_Telephonyit-IT_Multimedianl-NL_Telephony
Anteriormente, estos modelos no devolvían los resultados de reconocimiento tan rápidamente como se esperaba cuando se utilizaba el parámetro
low_latency. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
19 de agosto de 2022
- Importante: La fecha de desuso para la mayoría de los modelos de generación anterior es ahora el 3 de marzo de 2023
-
Reemplazado: este aviso de desuso ha sido reemplazado por la actualización de servicio del 15 de febrero de 2023. La fecha de fin de servicio para todos los modelos de generación anterior es ahora 31 de julio de 2023.
El 15 de marzo de 2022, se dejaron de utilizar los modelos de la generación anterior para todos los idiomas, excepto el árabe y el japonés. En ese momento, los modelos en desuso iban a permanecer disponibles hasta el 15 de septiembre de 2022. Para permitir a los usuarios más tiempo para migrar a los modelos de próxima generación adecuados, los modelos en desuso ahora permanecerán disponibles hasta el 3 de marzo de 2023. Al igual que con el aviso de desuso inicial, los modelos de generación anterior en árabe y japonés no están en desuso. Para obtener una lista completa de todos los modelos en desuso, consulte la actualización del servicio 15 de marzo de 2022.
El 3 de marzo de 2023, los modelos en desuso se eliminarán del servicio y de la documentación. Si utiliza alguno de los modelos obsoletos, deberá migrar al modelo equivalente de nueva generación antes del 3 de marzo de 2023.
- Para obtener más información sobre los modelos de próxima generación a los que puede migrar desde cada uno de los modelos en desuso, consulte Idiomas y modelos de la generación anterior
- Para obtener más información sobre los modelos de próxima generación, consulte Idiomas y modelos de próxima generación
- Para obtener más información sobre la migración de modelos de la generación anterior a modelos de la próxima generación, consulte Migración a modelos de próxima generación.
Nota: Cuando el modelo de la generación anterior
en-US_BroadbandModeldeje de estar disponible, el modelo de la próxima generaciónen-US_Multimediapasará a ser el modelo predeterminado para las solicitudes de reconocimiento de voz.
15 de agosto de 2022
- Nuevo modelo multimedia francés canadiense de próxima generación
-
El servicio ofrece ahora un modelo multimedia de última generación para el francés de Canadá:
fr-CA_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Actualizaciones de los modelos de telefonía de última generación en inglés
-
Los modelos de telefonía de última generación en inglés se han actualizado para mejorar el reconocimiento de voz:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephony
Todos estos modelos siguen soportando una baja latencia. No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- El modelo multimedia italiano de última generación ya es compatible con la baja latencia
-
El modelo multimedia de próxima generación italiano,
it-IT_Multimedia, ahora admite una latencia baja. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Importante: Se reduce el número máximo de horas de datos de audio para modelos acústicos personalizados
-
Importante: La cantidad máxima de datos de audio que puede añadir a un modelo acústico personalizado se está reduciendo de 200 horas a 50 horas. Este cambio se está escalonando en diferentes lugares de agosto a septiembre de 2022. Para obtener información sobre la planificación para la reducción de límite y lo que significa para los modelos acústicos personalizados existentes que contienen más de 50 horas de audio, consulte Máximo de horas de audio.
3 de agosto de 2022
- Arreglo de defectos: actualizar la documentación de vacilaciones de voz y marcadores de vacilación
-
Arreglo de defectos: se ha actualizado la documentación para las vacilaciones de voz y los marcadores de duda. Los modelos de generación anterior incluyen marcadores de vacilación en lugar de vacilaciones de voz en los resultados de transcripción para la mayoría de los idiomas; el formateo inteligente elimina los marcadores de vacilación de las transcripciones finales en inglés de EE.UU. Los modelos de próxima generación incluyen las vacilaciones reales del habla en los resultados de la transcripción; el formato inteligente no tiene ningún efecto en su inclusión en los resultados finales de la transcripción.
Para obtener más información, consulte:
1 Junio 2022
- Actualizaciones de varios modelos de telefonía de próxima generación
-
Los siguientes modelos de telefonía de próxima generación se han actualizado para mejorar el reconocimiento de voz:
en-AU_Telephonyen-GB_Telephonyen-IN_Telephonyen-US_Telephonyko-KR_Telephony
No es necesario actualizar modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
25 de mayo de 2022
- Nuevo parámetro beta
character_insertion_biaspara modelos de próxima generación -
Todos los modelos de próxima generación admiten ahora un nuevo parámetro beta,
character_insertion_bias, que está disponible con todas las interfaces de reconocimiento de voz. De forma predeterminada, el servicio está optimizado para que cada modelo individual equilibre su reconocimiento de series candidatas de diferentes longitudes. El sesgo específico del modelo es equivalente a 0.0. El sesgo predeterminado de cada modelo es suficiente para la mayoría de las solicitudes de reconocimiento de voz.Sin embargo, ciertos casos de uso pueden beneficiarse de hipótesis a favor con series de caracteres más cortas o más largas. El parámetro acepta valores entre -1.0 y 1.0 que representan un cambio del valor predeterminado de un modelo. Los valores negativos indican al servicio que favorezca las series más cortas de caracteres. Los valores positivos indican al servicio que favorezca las series de caracteres más largas. Para obtener más información, consulte Sesgo de inserción de caracteres.
19 de mayo de 2022
- Nuevo modelo de próxima generación
it-IT_Multimediade italiano -
El servicio ahora ofrece un modelo multimedia de próxima generación para italiano:
it-IT_Multimedia. El nuevo modelo está disponible de forma general. No admite la latencia baja, pero sí las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación. - Modelos actualizados de próxima generación de telefonía y multimedia en coreano
-
Se han actualizado los modelos actuales de próxima generación de coreano:
- El modelo
ko-KR_Telephonyse ha actualizado para mejorar el soporte de baja latencia para el reconocimiento de voz. - El modelo
ko-KR_Multimediase ha actualizado para mejorar el reconocimiento de voz. El modelo ahora también da soporte a la baja latencia.
Ambos modelos están disponibles a nivel general y ambos admiten las gramáticas y la personalización del modelo de idioma. No es necesario actualizar los modelos personalizados basados en estos modelos. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- El modelo
- Arreglo de defectos: ahora se notifican las puntuaciones de confianza para todos los resultados de transcripción
-
Arreglo de defectos: ahora se notifican las puntuaciones de confianza para todos los resultados de transcripción. Anteriormente, cuando el servicio devolvía varias transcripciones para una única solicitud de reconocimiento de voz única, las puntuaciones de confianza podían no devolverse para todas las transcripciones.
11 de abril de 2022
- Nuevo modelo de próxima generación
pt-BR_Multimediade portugués de Brasil -
El servicio ahora ofrece un modelo multimedia de próxima generación para portugués de Brasil:
pt-BR_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con las gramáticas y la personalización del modelo de idioma. Para obtener más información sobre los modelos de última generación y la baja latencia, consulta - Actualización para que el modelo de próxima generación
de-DE_Multimediade alemán admita la baja latencia -
El modelo de alemán de próxima generación,
de-DE_Multimedia, ahora admite la baja latencia. No es necesario actualizar los modelos personalizados basados en el modelo base actualizado para alemán. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte - El soporte para pronunciaciones similares está ahora documentado para los modelos personalizados basados en modelos de próxima generación
-
Para los modelos de idioma personalizados basados en modelos de próxima generación, el soporte está ahora documentado para las especificaciones de pronunciaciones parecidas para palabras personalizadas. El soporte para pronunciaciones parecidas ha estado disponible desde finales de 2021.
Existen diferencias entre el uso del campo
sounds_likepara modelos personalizados basados en modelos de generación anterior y de próxima generación. Para obtener más información sobre la utilización del camposounds_likecon modelos personalizados basados en modelos de próxima generación, consulte Trabajar con palabras personalizadas para modelos de próxima generación. - Importante: se ha eliminado el parámetro
customization_iden desuso de la documentación -
Importante: el 9 de octubre de 2018, el parámetro
customization_idde todas las solicitudes de reconocimiento de voz quedó en desuso y ha sido sustituido por el parámetrolanguage_customization_id. El parámetrocustomization_idse ha eliminado de la documentación para los métodos de reconocimiento de voz:/v1/recognizepara solicitudes WebSocketPOST /v1/recognizepara solicitudes HTTP síncronas (incluidas las solicitudes de varias partes)POST /v1/recognitionspara solicitudes HTTP asíncronas
Nota: si utiliza los SDK de Watson, asegúrese de haber actualizado cualquier código de aplicación para utilizar el parámetro
language_customization_iden lugar del parámetrocustomization_id. El parámetrocustomization_idya no estará disponible en los métodos equivalentes de los SDK a partir de su próximo release principal. Para obtener más información sobre los métodos de reconocimiento de voz, consulte la Referencia de API y SDK.
17 de marzo de 2022
- El soporte de gramática para los modelos de próxima generación ahora está disponible de forma general
-
Ahora el soporte de gramática está disponible de forma general (GA) para los modelos de próxima generación que cumplen las siguientes condiciones:
- Los modelos están generalmente disponibles.
- Los modelos soportan la personalización del modelo de idioma.
Para obtener más información, consulte los temas siguientes:
- Para obtener más información sobre el estado del soporte de gramática para modelos de próxima generación, consulte Soporte de personalización para modelos de próxima generación.
- Para obtener más información sobre gramáticas, consulte Gramáticas.
- Nuevo modelo multimedia de próxima generación para alemán
-
El servicio ahora ofrece un modelo multimedia de próxima generación para alemán:
de-DE_Multimedia. El nuevo modelo está disponible de forma general. No admite la baja latencia. Es compatible con la personalización del modelo de idioma (generalmente disponible) y gramáticas (beta).Para obtener más información sobre todos los modelos de próxima generación disponibles y su soporte de personalización, consulte
- El modelo beta
en-WW_Medical_Telephonyde próxima generación ahora admite la baja latencia -
El modelo beta
en-WW_Medical_Telephonyde próxima generación ahora admite la baja latencia. Para obtener más información sobre todos los modelos de próxima generación y baja latencia, consulte
15 de marzo de 2022
- Importante: desuso de la mayoría de modelos de la generación anterior
-
Reemplazado: este aviso de desuso ha sido reemplazado por la actualización de servicio del 15 de febrero de 2023. La fecha de fin de servicio para todos los modelos de generación anterior es ahora 31 de julio de 2023.
A partir del 15 de marzo de 2022, los modelos de generación anterior para todos los idiomas que no sean árabe y japonés están en desuso. Los modelos en desuso permanecen disponibles hasta el 15 de septiembre de 2022, cuando serán retirados del servicio y de la documentación. Los modelos de la generación anterior en árabe y japonés no han quedado obsoletos.
Los siguientes modelos de la generación anterior ahora están en desuso:
- Chino (mandarín):
zh-CN_NarrowbandModelyzh-CN_BroadbandModel - Holandés (Países Bajos):
nl-NL_NarrowbandModelynl-NL_BroadbandModel - Inglés (australiano):
en-AU_NarrowbandModelyen-AU_BroadbandModel - Inglés (Reino Unido):
en-GB_NarrowbandModelyen-GB_BroadbandModel - Inglés (Estados Unidos):
en-US_NarrowbandModel,en-US_BroadbandModelyen-US_ShortForm_NarrowbandModel - Francés (canadiense):
fr-CA_NarrowbandModelyfr-CA_BroadbandModel - Francés (Francia):
fr-FR_NarrowbandModelyfr-FR_BroadbandModel - Alemán:
de-DE_NarrowbandModelyde-DE_BroadbandModel - Italiano:
it-IT_NarrowbandModelyit_IT_BroadbandModel - Coreano:
ko-KR_NarrowbandModelyko-KR_BroadbandModel - Portugués (brasileño):
pt-BR_NarrowbandModelypt-BR_BroadbandModel - Español (argentino):
es-AR_NarrowbandModelyes-AR_BroadbandModel - Español (castellano):
es-ES_NarrowbandModelyes-ES_BroadbandModel - Español (chileno):
es-CL_NarrowbandModelyes-CL_BroadbandModel - Español (colombiano):
es-CO_NarrowbandModelyes-CO_BroadbandModel - Español (mexicano):
es-MX_NarrowbandModelyes-MX_BroadbandModel - Español (peruano):
es-PE_NarrowbandModelyes-PE_BroadbandModel
Si utiliza cualquiera de estos modelos en desuso, debe migrar al modelo de próxima generación equivalente antes de la fecha de fin de servicio.
- Para obtener más información sobre los modelos de próxima generación a los que puede migrar desde cada uno de los modelos en desuso, consulte Idiomas y modelos de la generación anterior
- Para obtener más información sobre los modelos de próxima generación, consulte Idiomas y modelos de próxima generación
- Para obtener más información sobre la migración de modelos de la generación anterior a modelos de la próxima generación, consulte Migración a modelos de próxima generación.
Nota: cuando el
en-US_BroadbandModelde la generación anterior se elimina del servicio el 15 de septiembre, el modeloen-US_Multimediade próxima generación se convertirá en el modelo predeterminado para las solicitudes de reconocimiento de voz. - Chino (mandarín):
- Los modelos de próxima generación ahora dan soporte a parámetros de análisis de audio
-
Todos los modelos de próxima generación ahora dan soporte a los siguientes parámetros de análisis de audio como características de disponibilidad general:
end_of_phrase_silence_timeespecifica la duración del intervalo de pausa en el que el servicio divide una transcripción en varios resultados finales. Para obtener más información, consulte Tiempo de silencio de fin de frase.split_transcript_at_phrase_endindica al servicio que divida la transcripción en varios resultados finales basándose en las características semánticas de la entrada. Para obtener más información, consulte División de la transcripción al final de la frase.
- Corrección de un error: corrección de la documentación sobre las etiquetas de los altavoces
-
Corrección de defecto: la documentación de las etiquetas de orador incluye la siguiente declaración errónea en varios lugares: Para los modelos de próxima generación, las etiquetas de orador no están soportadas para su uso con resultados provisionales o la baja latencia. Las etiquetas de orador están soportadas para su uso con resultados provisionales y la baja latencia para los modelos de próxima generación. Para obtener más información, consulte Etiquetas de orador.
28 de febrero de 2022
- Actualizaciones de modelos multimedia de próxima generación para inglés y francés para dar soporte a la baja latencia
-
Se han actualizado los siguientes modelos multimedia para dar soporte a la baja latencia:
- Inglés de Australia:
en-AU_Multimedia - Inglés de Reino Unido:
en-GB_Multimedia - Inglés de Estados Unidos:
en-US_Multimedia - Francés:
fr-FR_Multimedia
No es necesario actualizar los modelos de idioma personalizados que se basan en estos modelos base. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte
- Inglés de Australia:
- Nuevo modelo multimedia de próxima generación para castellano
-
El servicio ofrece ahora un modelo multimedia de próxima generación para castellano:
es-ES_Multimedia. El nuevo modelo soporta la baja latencia y está a disposición general. También es compatible con la personalización del modelo de idioma (de disposición general) y gramáticas (beta).Para obtener más información sobre todos los modelos de próxima generación disponibles y su soporte de personalización, consulte
11 de febrero de 2022
- Corrección de un error: Se ha corregido la documentación relativa a la actualización de modelos personalizados y a la versión del modelo base
-
Arreglo de defecto: la documentación que describe la actualización de modelos personalizados y las series de versión que se utilizan para diferentes versiones de modelos base se ha actualizado. La documentación ahora indica que la actualización para la personalización del modelo de idioma también se aplica a los modelos de próxima generación. Además, se han actualizado las series de versión que representan versiones distintas de modelos base. Además, el parámetro
base_model_versiontambién se puede utilizar con modelos de próxima generación actualizados.Para obtener más información sobre la actualización del modelo personalizado, cuándo es necesario actualizar y cómo utilizar versiones anteriores de modelos personalizados, consulte
- Corrección de un error: Actualización de la documentación sobre el uso de mayúsculas
-
Arreglo de defecto: la documentación que describe la capitalización automática del servicio de transcripciones se ha actualizado. El servicio capitaliza los nombres adecuados sólo para los siguientes idiomas y modelos:
- Todos los modelos para inglés de EE.UU. de la generación anterior
- El modelo de próxima generación para alemán
Para obtener más información, consulte Capitalización.
2 de febrero de 2022
- El nuevo modelo beta
en-WW_Medical_Telephonyya está disponible -
Ya está disponible una nueva versión beta de
en-WW_Medical_Telephonyde la próxima generación. El nuevo modelo entiende los términos de los dominios médico y farmacológico. Utilice el modelo en situaciones en las que necesite transcribir terminología médica común, como nombres de medicamentos, marcas de productos, procedimientos médicos, enfermedades, tipos de médicos o terminología relacionada con el COVID-19. Los casos de uso común incluyen conversaciones entre un paciente y un proveedor médico (por ejemplo, un médico, una enfermera o un farmacéutico).El nuevo modelo está disponible para todos los dialectos ingleses admitidos: de Australia, India, Reino Unido y Estados Unidos. El nuevo modelo soporta la personalización del modelo de idioma y las gramáticas como funcionalidad beta. Soporta la mayoría de los mismos parámetros que el modelo
en-US_Telephony, incluidosmart_formattingpara el audio en inglés de EE.UU. No da soporte a los parámetros siguientes:low_latency,profanity_filter,redactionyspeaker_labels.Para obtener más información, consulte El modelo de telefonía médica en inglés.
- Actualizar al modelo
zh-CN_Telephonypara chino -
El modelo de próxima generación
zh-CN_Telephonypara chino se ha actualizado para mejorar el reconocimiento de voz. El modelo sigue dando soporte a la baja latencia. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.Si tiene modelos de idioma personalizados basados en el modelo actualizado, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones utilizando el método
POST /v1/customizations/{customization_id}/upgrade_model. Para obtener más información, consulte Actualización de modelos personalizados. - Actualización para que el modelo de próxima generación
ja-JP_Multimediade japonés admita la baja latencia -
El modelo de próxima generación
ja-JP_Multimediapara japonés ahora da soporte a la baja latencia. Puede utilizar el parámetrolow_latencycon las solicitudes de reconocimiento de voz que utilizan el modelo. No es necesario actualizar modelos personalizados basados en el modelo base actualizado para japonés. Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte
3 de diciembre de 2021
- Nuevo modelo de telefonía de próxima generación para español de Latinoamérica
-
El servicio ahora ofrece un modelo de telefonía de próxima generación para el español de Latinoamérica:
es-LA_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general.El modelo
es-LA_Telephonyse aplica a todos los dialectos de Latinoamérica. Es el equivalente a los modelos de la generación anterior que están disponibles para los dialectos argentino, chileno, colombiano, mexicano y peruano. Si ha utilizado un modelo de la generación anterior para cualquiera de estos dialectos específicos, utilice el modeloes-LA_Telephonypara migrar al modelo de próxima generación equivalente.Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Importante: los modelos de idioma personalizados basados en determinados modelos de próxima generación deben volver a crearse
-
Importante: si ha creado modelos de idioma personalizados basados en determinados modelos de próxima generación, debe volver a crear los modelos personalizados. Hasta que vuelva a crear los modelos de idioma personalizados, las solicitudes de reconocimiento de voz que intentan utilizar los modelos personalizados fallan con el código de error HTTP 400.
Debe volver a crear los modelos de idioma personalizados que ha creado basándose en las siguientes versiones de los modelos de próxima generación:
- Para el modelo
en-AU_Telephony, los modelos personalizados que ha creado deen-AU_Telephony.v2021-03-03aen-AU_Telephony.v2021-10-04. - Para el modelo
en-GB_Telephony, los modelos personalizados que ha creado deen-GB_Telephony.v2021-03-03aen-GB_Telephony.v2021-10-04. - Para el modelo
en-US_Telephony, los modelos personalizados que ha creado deen-US_Telephony.v2021-06-17aen-US_Telephony.v2021-10-04. - Para el modelo
en-US_Multimedia, los modelos personalizados que ha creado deen-US_Multimedia.v2021-03-03aen-US_Multimedia.v2021-10-04.
Para identificar la versión de un modelo en el que se basa un modelo de idioma personalizado, utilice el método
GET /v1/customizationspara listar todos los modelos de idioma personalizados o el métodoGET /v1/customizations/{customization_id}para listar un modelo de idioma personalizado específico. El campoversionsde la salida muestra el modelo base para un modelo de idioma personalizado. Para obtener más información, consulte Listado de modelos de lenguaje personalizado.Para volver a crear un modelo de idioma personalizado, primero cree un nuevo modelo personalizado. A continuación, añada todos los corpus y palabras personalizadas del modelo personalizado anterior al nuevo modelo. A continuación, puede suprimir el modelo personalizado anterior. Para obtener más información, consulte Creación de un modelo de idioma personalizado.
- Para el modelo
28 de octubre de 2021
- Nuevo modelo de telefonía de próxima generación para chino
-
El servicio ahora ofrece un modelo de telefonía de próxima generación para chino mandarín:
zh-CN_Telephony. El nuevo modelo soporta la baja latencia y está a disposición general. Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación. - Nuevos modelos multimedia de próxima generación para inglés de Reino Unido e inglés de Australia
-
El servicio ahora ofrece los siguientes modelos multimedia de próxima generación. Los nuevos modelos son de disposición general y ninguno de los modelos admite la baja latencia.
- Inglés de Australia:
en-AU_Multimedia - Inglés de Reino Unido:
en-GB_Multimedia
Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Inglés de Australia:
- Actualizaciones para varios modelos de próxima generación para mejorar el reconocimiento de voz
-
Los siguientes modelos de próxima generación se han actualizado para mejorar el reconocimiento de voz:
- Modelo de telefonía para inglés de Australia (
en-AU_Telephony) - Modelo de telefonía para inglés del Reino Unido (
en-GB_Telephony) - Modelo multimedia para inglés de EE.UU. (
en-US_Multimedia) - Modelo de telefonía para inglés de EE.UU. (
en-US_Telephony) - Modelo de telefonía para español de España (
es-ES_Telephony)
Para obtener más información sobre todos los modelos de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Modelo de telefonía para inglés de Australia (
- El soporte de gramática para modelos de la generación anterior está ahora disponible de forma general
-
El soporte de gramática ahora está disponible de forma general (GA) para los modelos de la generación anterior que cumplen las siguientes condiciones:
- Los modelos están generalmente disponibles.
- Los modelos soportan la personalización del modelo de idioma.
Para obtener más información, consulte los temas siguientes:
- Para obtener más información sobre el estado del soporte de gramática para modelos de generación anterior, consulte Soporte de personalización para modelos de generación anterior.
- Para obtener más información sobre gramáticas, consulte Gramáticas.
- Nuevo soporte de gramática beta para modelos de próxima generación
-
El soporte de gramática ahora está disponible como una funcionalidad beta para todos los modelos de próxima generación. Todos los modelos de próxima generación están generalmente disponibles (GA) y soportan la personalización del modelo de idioma. Para obtener más información, consulte los temas siguientes:
- Para obtener más información sobre el estado del soporte de gramática para modelos de próxima generación, consulte Soporte de personalización para modelos de próxima generación.
- Para obtener más información sobre gramáticas, consulte Gramáticas.
Nota: el soporte beta para las gramáticas mediante modelos de próxima generación solo está disponible para el servicio Speech to Text en IBM Cloud. Las gramáticas aún no están soportadas para los modelos de próxima generación en IBM Cloud Pak for Data.
- Nuevo campo
custom_acoustic_modelpara las características soportadas -
Los métodos
GET /v1/modelsyGET /v1/models/{model_id}ahora informan si un modelo da soporte a la personalización del modelo acústico. El objetoSupportedFeaturesahora incluye un campo adicional,custom_acoustic_model, un booleano que estruepara un modelo que da soporte a la personalización de modelos acústicos yfalsepara lo demás. Actualmente, el campo estruepara todos los modelos de generación anterior yfalsepara todos los modelos de próxima generación.- Para obtener más información sobre estos métodos, consulte Listado de información sobre modelos.
- Para obtener más información sobre el soporte para la personalización de modelos acústicos, consulte Soporte de idiomas para la personalización.
22 de octubre de 2021
- Corrección de un error: Solución de los fallos asíncronos de HTTP
- Arreglo de defecto: la interfaz HTTP asíncrona no ha podido transcribir algún audio. Además, la devolución de llamada para la solicitud ha devuelto el estado
recognitions.completed_with_resultsen lugar derecognitions.failed. Este error se ha resuelto.
6 de octubre de 2021
- Actualizaciones para modelos de próxima generación para checo y holandés
-
Los siguientes modelos de idioma de próxima generación han cambiado como se indica:
- El modelo de telefonía para checo,
cs-CZ_Telephony, ahora está disponible de forma general (GA). El modelo sigue dando soporte a la baja latencia. - El modelo de telefonía para el holandés de Bélgica,
nl-BE_Telephony, se ha actualizado para mejorar el reconocimiento de voz. El modelo sigue dando soporte a la baja latencia. - El modelo de telefonía para el holandés los Países Bajos,
nl-NL_Telephony, ahora es de disponibilidad general (GA). Además, el modelo ahora admite la baja latencia.
Para obtener más información sobre todos los modelos de idioma de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- El modelo de telefonía para checo,
- Nuevo soporte de HIPAA de EE.UU. para los planes Premium en la ubicación de Dallas
-
El soporte para la Ley de portabilidad y responsabilidad de seguros médicos de EE.UU. (HIPAA) ya está disponible para los planes Premium que se alojan en la ubicación de Dallas (
us-south). Para obtener más información, consulte la Ley de portabilidad y responsabilidad de seguros médicos (HIPAA).
16 de septiembre de 2021
- Nuevos modelos beta de próxima generación para checo y holandés de los Países Bajos
-
El servicio ahora da soporte a los siguientes nuevos modelos de idioma de próxima generación. Ambos nuevos modelos son una funcionalidad beta.
- Checo:
cs-CZ_Telephony. El nuevo modelo soporta la baja latencia. - Holandés de los Países Bajos:
nl-NL_Telephony. El nuevo modelo no da soporte a la baja latencia.
Para obtener más información sobre todos los modelos de idioma de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Checo:
- Actualizaciones de modelos de próxima generación para coreano y portugués de Brasil
-
Se han actualizado los siguientes modelos de próxima generación:
- El modelo
ko-KR_Telephonypara coreano ahora admite la baja latencia. - El modelo
pt-BR_Telephonypara portugués de Brasil se ha actualizado para mejorar el reconocimiento de voz.
- El modelo
- Corrección de un error: corrección de los resultados provisionales y de la documentación sobre baja latencia
-
Arreglo de defecto: la documentación que describe las características de resultados provisionales y de baja latencia con los modelos de próxima generación se ha reescrito para obtener una mayor claridad y corrección. Para obtener más información, consulte los temas siguientes:
- Arreglo de defectos: Mejorar los resultados de las etiquetas de los altavoces
-
Arreglo de defecto: cuando utiliza etiquetas de orador con modelos de próxima generación, el servicio ahora identifica el orador para todas las palabras del audio de entrada, incluidas palabras muy cortas que tienen las mismas indicaciones de fecha y hora de inicio y final.
31 de agosto de 2021
- Todos los modelos de próxima generación están ahora disponibles de forma general
-
Todos los modelos de idioma de próxima generación existentes ya están disponibles de forma general (GA). Están soportados para su uso en entornos de producción y aplicaciones.
- Para obtener más información sobre todos los modelos de idioma de próxima generación disponibles, consulte Idiomas y modelos de próxima generación.
- Para obtener más información sobre las características soportadas para cada modelo de próxima generación, consulte Características soportadas para modelos de próxima generación.
- La personalización del modelo de idioma para los modelos de próxima generación ahora está disponible de forma general
-
La personalización del modelo de idioma ahora está disponible de forma general (GA) para todos los modelos e idiomas disponibles de la próxima generación. La personalización del modelo de idioma para los modelos de próxima generación está soportada para su uso en entornos de producción y aplicaciones.
Puede utilizar los mismos mandatos para crear, gestionar y utilizar modelos de idioma personalizado, corpus y palabras personalizadas para modelos de próxima generación como lo hace para los modelos de la generación anterior. Pero la personalización para los modelos de próxima generación funciona de forma diferente a la personalización para los modelos de la generación anterior. Para los modelos personalizados basados en modelos de próxima generación:
- Los modelos personalizados no tienen ningún concepto de las palabras fuera del vocabulario (OOV).
- Las palabras del corpus no se añaden al recurso de palabras.
- Actualmente no puede utilizar la característica de pronunciación para las palabras personalizadas.
- No es necesario actualizar los modelos personalizados cuando se actualizan los modelos de idioma base.
- Actualmente, las gramáticas no están soportadas.
Para obtener más información sobre cómo utilizar la personalización del modelo de idioma para modelos de próxima generación, consulte
- Comprender la personalización
- Soporte de idiomas para la personalización
- Creación de un modelo de lenguaje personalizado
- Utilización de un modelo de idioma personalizado para el reconocimiento de voz
- Trabajar con corpus y palabras personalizadas para modelos de próxima generación
Los temas adicionales describen la gestión de modelos de idioma personalizado, corpus y palabras personalizadas. Estas operaciones son las mismas para los modelos personalizados basados en modelos anteriores y de próxima generación.
16 de agosto de 2021
- Nuevos modelos beta de la próxima generación para inglés, hindi de la India, japonés y coreano
-
El servicio ahora da soporte a los siguientes nuevos modelos de idioma de próxima generación. Todos los nuevos modelos son de funcionalidad beta.
- Inglés de la India:
en-IN_Telephony. El modelo soporta la baja latencia. - Hindi de la India:
hi-IN_Telephony. El modelo soporta la baja latencia. - Japonés:
ja-JP_Multimedia. El modelo no da soporte a la baja latencia. - Coreano:
ko-KR_Multimediayko-KR_Telephony. Los modelos no dan soporte a la baja latencia.
Para obtener más información sobre los modelos de próxima generación y la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.
- Inglés de la India:
16 de julio de 2021
- Nuevo modelo de próxima generación beta para francés
- El modelo de idioma de
fr-FR_Multimediade próxima generación para francés ya está disponible. El nuevo modelo no da soporte a la baja latencia. El modelo es de funcionalidad beta. - Actualizaciones del modelo de próxima generación beta para inglés de EE.UU. para un mejor reconocimiento de voz
- El modelo
en-US_Telephonyde próxima generación para inglés de EE.UU. se ha actualizado para mejorar el reconocimiento de voz. El modelo actualizado sigue siendo una funcionalidad beta. - Arreglo de defectos: actualizar documentación para marcadores de duda
- Arreglo de defecto: La documentación no indica que los modelos de próxima generación no producen marcadores de duda. La documentación se ha actualizado para señalar que solo los modelos de la generación anterior producen marcadores de duda. Los modelos de próxima generación incluyen las vacilaciones reales en los resultados de la transcripción. Para obtener más información, consulte Titubeos y marcadores de duda.
15 de junio de 2021
- Nuevo modelo de próxima generación beta para holandés de Bélgica
-
Ahora está disponible el modelo de idioma de próxima generación
nl-BE_Telephonypara holandés de Bélgica (Flamenco). El nuevo modelo soporta la baja latencia. El modelo es de funcionalidad beta. Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia. - Nuevo soporte beta de baja latencia para modelos de próxima generación para árabe, francés de Canadá e italiano
-
Los siguientes modelos de idioma beta de próxima generación ya soportan la baja latencia:
- Modelo
ar-MS_Telephonypara árabe - Modelo
fr-CA_Telephonypara francés de Canadá - Modelo
it-IT_Telephonypara italiano
Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.
- Modelo
- Actualizaciones de modelos de próxima generación beta para árabe y portugués de Brasil para mejorar el reconocimiento de voz
-
Los siguientes modelos de idioma beta de próxima generación se han actualizado para mejorar el reconocimiento de voz:
- Modelo
ar-MS_Telephonypara árabe - Modelo
pt-BR_Telephonypara portugués de Brasil
Para obtener más información sobre los modelos de próxima generación y sobre la baja latencia, consulte Idiomas y modelos de próxima generación y Baja latencia.
- Modelo
26 de mayo de 2021
- Nuevo parámetro de soporte beta para
audio_metricspara modelos de próxima generación - El parámetro
audio_metricsahora está soportado como funcionalidad beta para su uso con todos los idiomas y modelos de próxima generación. Para obtener más información, consulte Métricas de audio. - Nuevo parámetro de soporte beta para
word_confidencepara modelos de próxima generación - El parámetro
word_confidenceahora está soportado como funcionalidad beta para su uso con todos los idiomas y modelos de próxima generación. Para obtener más información, consulte Confianza de palabras. - Arreglo de defectos: documentación de actualización para modelos de próxima generación
- Corrección de un error: Se ha actualizado la documentación para corregir la siguiente información:
- Cuando utiliza un modelo de próxima generación para el reconocimiento de voz, los resultados finales de la transcripción ahora incluyen el campo
confidence. El campo siempre se incluía en los resultados finales de la transcripción cuando se utiliza un modelo de generación anterior. Este arreglo soluciona una limitación que se informó para el lanzamiento del 12 de abril de 2021 de los modelos de próxima generación. - La documentación indicaba incorrectamente que el uso del parámetro
smart_formattinghace que el servicio elimine los marcadores de duda de los resultados finales de la transcripción para japonés. El formateo inteligente no elimina los marcadores de duda de los resultados finales para el japonés, sólo para el inglés de EE.UU. Para obtener más información, consulte ¿A qué resultados afecta el formateo inteligente?
- Cuando utiliza un modelo de próxima generación para el reconocimiento de voz, los resultados finales de la transcripción ahora incluyen el campo
27 de abril de 2021
- Nuevos modelos beta de próxima generación para árabe y portugués de Brasil
-
El servicio da soporte a dos nuevos modelos beta de próxima generación:
- El modelo
pt-BR_Telephonypara portugués de Brasil, que soporta la baja latencia. - El modelo
ar-MS_Telephonypara árabe (estándar moderno), que no da soporte a la baja latencia.
Para obtener más información, consulte Idiomas y modelos de próxima generación.
- El modelo
- Actualizaciones del modelo beta de próxima generación para español de España para mejorar el reconocimiento de voz
-
El modelo beta de siguiente generación
es-ES_Telephonypara español de España ahora es compatible con el parámetrolow_latency. Para obtener más información, consulte Baja latencia. - Nuevo soporte beta para etiquetas de orador con modelos de próxima generación
-
El parámetro
speaker_labelsahora está soportado como funcionalidad beta para su uso con los siguientes modelos de próxima generación:- Modelo
en-AU_Telephonypara inglés de Australia - Modelo
en-GB_Telephonypara inglés del Reino Unido - Modelos
en-US_Multimediayen-US_Telephonypara inglés de EE.UU. - Modelo
de-DE_Telephonypara alemán - Modelo
es-ES_Telephonypara español de España
Con los modelos de próxima generación, en este momento, el parámetro
speaker_labelsno está soportado para su uso con los parámetrosinterim_resultsolow_latency. Para obtener más información, consulte Etiquetas de orador. - Modelo
- Nuevo código de error HTTP para utilizar
word_confidencecon modelos de próxima generación -
El parámetro
word_confidenceno está soportado para su uso con modelos de próxima generación. El servicio ahora devuelve el siguiente código de error 400 si utiliza el parámetroword_confidencecon un modelo de próxima generación para el reconocimiento de voz:{ "error": "word_confidence is not a supported feature for model {model}", "code": 400, "code_description": "Bad Request" }
12 de abril de 2021
- Nuevos modelos de lenguaje idioma beta de próxima generación y el parámetro
low_latency -
El servicio ahora da soporte a un número creciente de modelos de idioma de próxima generación. Los modelos multimedia y de telefonía de próxima generación mejoran las capacidades de reconocimiento de voz de la generación anterior de modelos de servicio de banda ancha y banda estrecha. Los nuevos modelos aprovechan las redes neuronales profundas y el análisis bidireccional para lograr un mayor rendimiento y una mayor precisión de la transcripción. En este momento, los modelos de próxima generación sólo dan soporte a un número limitado de idiomas y características de reconocimiento de voz. Los idiomas, modelos y características soportados aumentarán con futuros releases. Los modelos de próxima generación son una funcionalidad beta.
Muchos de los modelos de próxima generación también dan soporte a un nuevo parámetro
low_latencyque le permite solicitar resultados más rápidamente en detrimento posiblemente de reducir la calidad de la transcripción. Cuando la baja latencia está habilitada, el servicio restringe su análisis del audio, lo que puede reducir la precisión de la transcripción. Esta compensación puede ser aceptable si su aplicación requiere un tiempo de respuesta más bajo que la precisión más alta posible. El parámetrolow_latencyes una funcionalidad beta.El parámetro
low_latencyafecta al uso del parámetrointerim_resultscon la interfaz WebSocket. Los resultados provisionales sólo están disponibles para los modelos de próxima generación que dan soporte a una baja latencia y sólo si los parámetrosinterim_resultsylow_latencyestán establecidos entrue.- Para obtener más información sobre los modelos de próxima generación y sus posibilidades, consulte Idiomas y modelos de próxima generación.
- Para obtener más información sobre el soporte de idiomas para modelos de próxima generación y sobre qué modelos de próxima generación soportan la baja latencia, consulte Modelos de idioma de próxima generación.
- Para obtener más información sobre la compatibilidad de funciones con los modelos de nueva generación, consulte Funciones compatibles con los modelos de nueva generación.
- Para obtener más información sobre el parámetro
low_latency, consulte Baja latencia.
17 de marzo de 2021
- Corrección de un error: Se ha solucionado la limitación de la interfaz asíncrona HTTP
- Arreglo de defecto: se ha solucionado la limitación que se notificó con la interfaz HTTP asíncrona en la ubicación de Dallas (
us-south) el 16 de diciembre de 2020. Anteriormente, un pequeño porcentaje de trabajos entraban en bucles infinitos que impedían su ejecución. Las solicitudes HTTP asíncronas en el centro de datos de Dallas ya no experimentan esta limitación.
2 de diciembre de 2020
- Modelo para árabe renombrado a
ar-MS_BroadbandModel - El modelo de banda ancha para árabe ahora se llama
ar-MS_BroadbandModel. El nombre anterior,ar-AR_BroadbandModel, está en desuso. Continuará funcionando durante al menos un año, pero podría ser eliminado en una fecha futura. Se le anima a migrar al nuevo nombre a la mayor brevedad posible.
2 de noviembre de 2020
- Los modelos para francés de Canadá están ahora disponibles de forma general
-
Los modelos para francés de Canadá,
fr-CA_BroadbandModelyfr-CA_NarrowbandModel, ya están disponibles de forma general (GA). Antes eran beta. Ahora también admiten la personalización del modelo de idioma y del modelo acústico.- Para obtener más información sobre los idiomas y modelos soportados, consulte Idiomas y modelos de la generación anterior.
- Para obtener más información sobre el soporte de idiomas para la personalización, consulte Soporte de idiomas para la personalización.
22 de octubre de 2020
- Los modelos para inglés de Australia ya están disponibles de forma general
-
Los modelos para inglés de Australia,
en-AU_BroadbandModelyen-AU_NarrowbandModel, ya están disponibles de forma general (GA). Antes eran beta. Ahora también admiten la personalización del modelo de idioma y del modelo acústico.- Para obtener más información sobre los idiomas y modelos soportados, consulte Idiomas y modelos de la generación anterior.
- Para obtener más información sobre el soporte de idiomas para la personalización, consulte Soporte de idiomas para la personalización.
- Actualizaciones de modelos para portugués de Brasil para mejorar el reconocimiento de voz
-
Los modelos para portugués de Brasil,
pt-BR_BroadbandModelypt-BR_NarrowbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- El parámetro
split_transcript_at_phrase_endya está disponible de forma general para todos los idiomas -
El parámetro de reconocimiento de voz
split_transcript_at_phrase_endya está disponible de forma general (GA) para todos los idiomas. Anteriormente, solo estaba disponible a nivel general para inglés de EE.UU. y del Reino Unido. Para obtener más información, consulte División de la transcripción al final de la frase.
7 de octubre de 2020
- Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz
-
El modelo
ja-JP_BroadbandModelse ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
30 de septiembre de 2020
- Actualizaciones de los planes de precios para el servicio
-
Los planes de precios del servicio han cambiado:
- El servicio sigue ofreciendo un plan Lite que proporciona acceso básico sin cargos a unos minutos limitados de reconocimiento de voz por mes.
- El servicio ofrece un nuevo plan Plus que proporciona un modelo de precios por niveles simple y acceso a las prestaciones de personalización del servicio.
- El servicio ofrece un nuevo plan Premium que proporciona una capacidad significativamente mayor y mejores características.
El plan Plus sustituye al plan estándar. El plan estándar sigue estando disponible para la compra por un corto periodo de tiempo. También sigue estando disponible indefinidamente para los usuarios existentes del plan sin ningún cambio en sus precios. Los usuarios existentes pueden actualizar al plan Plus cuando lo deseen.
Para obtener más información sobre los planes de precios disponibles, consulte los siguientes recursos:
- Para obtener información general sobre los planes de precios y ver respuestas a preguntas comunes, consulte el apartado Preguntas frecuentes.
- Para obtener más información sobre los planes de precios o para adquirir un plan, consulta el servicio « Speech to Text » en el catálogo de IBM Cloud®.
20 de agosto de 2020
- Nuevos modelos para francés de Canadá
-
Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma francés de Canadá:
fr-CA_BroadbandModelfr-CA_NarrowbandModel
Los nuevos modelos no dan soporte al modelo de lenguaje a la personalización de modelos acústicos, a las etiquetas de orador ni al formateo inteligente. Para obtener más información sobre estos y todos los modelos soportados, consulte Modelos de idioma de la generación anterior soportados.
5 de agosto de 2020
- Nuevos modelos para inglés de Australia
-
Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma inglés de Australia:
en-AU_BroadbandModelen-AU_NarrowbandModel
Los nuevos modelos no dan soporte al modelo de lenguaje ni a la personalización de modelos acústicos ni al formateo inteligente. Los nuevos modelos no dan soporte a etiquetas de orador. Para obtener más información, consulte
- Actualizaciones de varios modelos para mejorar el reconocimiento de voz
-
Los siguientes modelos se han actualizado para mejorar el reconocimiento de voz:
- Modelo de banda ancha para francés (
fr-FR_BroadbandModel) - Modelos de banda ancha (
de-DE_BroadbandModel) y banda estrecha (de-DE_NarrowbandModel) para alemán - Modelos de banda ancha (
en-GB_BroadbandModel) y banda estrecha (en-GB_NarrowbandModel) para inglés del Reino Unido - Modelo de banda estrecha de formato abreviado para inglés de EE.UU. (
en-US_ShortForm_NarrowbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda ancha para francés (
- El marcador de duda para el alemán ha cambiado
-
El marcador de duda que se utiliza para la banda ancha para el alemán se ha actualizado y los modelos de banda estrecha han cambiado de
[hesitation]a%HESITATION. Para obtener más información, consulte Titubeos y marcadores de duda.
4 de junio de 2020
- Corrección de un error: mejora de la latencia en los modelos de lenguaje personalizados con numerosas gramáticas
- Arreglo de defecto: se ha resuelto el problema de latencia para los modelos de idioma personalizados que contienen un gran número de gramáticas. Cuando se utilizan inicialmente para el reconocimiento de voz, estos modelos personalizados pueden tardar varios segundos en cargarse. Ahora los modelos personalizados se cargan mucho más rápido, reduciendo significativamente la latencia cuando se utilizan para el reconocimiento.
28 de abril de 2020
- Actualizaciones de modelos para italiano para mejorar el reconocimiento de voz
-
Los modelos italianos de banda ancha (
it-IT_BroadbandModel) y de banda estrecha (it-IT_NarrowbandModel) se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Los modelos para holandés e italiano ya están disponibles de forma general
-
Los modelos de los idiomas holandés e italiano ahora están actualmente disponibles a nivel general (GA) para el reconocimiento de voz y para la personalización del modelo de lenguaje y del modelo acústico:
- Modelo de banda ancha holandés (
nl-NL_BroadbandModel) - Modelo de banda estrecha holandés (
nl-NL_NarrowbandModel) - Modelo de banda ancha italiano (
it-IT_BroadbandModel) - Modelo de banda estrecha italiano (
it-IT_NarrowbandModel)
Para obtener más información sobre todos los modelos de lenguaje disponibles, consulte
- Modelo de banda ancha holandés (
1 de abril de 2020
- La personalización del modelo acústico ya está disponible de forma general
-
La personalización del modelo acústico ahora está disponible a nivel general (GA) para todos los idiomas soportados. Al igual que sucede con los modelos de lenguaje personalizado, IBM no cobra por crear o alojar un modelo acústico personalizado. Solo se le facturará por utilizar un modelo personalizado con una solicitud de reconocimiento de voz.
El uso de un modelo de lenguaje personalizado, de un modelo acústico personalizado o de ambos tipos de modelo para una transcripción supone un cargo adicional de 0,03 $ (dólares americanos) por minuto. Este cargo se suma al cargo de uso estándar de 0,02 $ (dólares americanos) por minuto y se aplica a todos los idiomas que reciben soporte de la interfaz de personalización. De modo que el coste total de utilizar uno o varios modelos personalizados para el reconocimiento de voz es de 0,05 $ (dólares americanos) por minuto.
- Para obtener más información sobre el soporte de modelos de lenguaje individuales, consulte Soporte de idiomas para la personalización.
- Para obtener más información sobre los precios, consulte la página de precios para el servicio Speech to Text o las Preguntas más frecuentes sobre precios.
16 de marzo de 2020
- Las etiquetas de orador ya están soportadas para alemán y coreano
- Ahora el servicio da soporte a las etiquetas de orador (el parámetro
speaker_labels) para los modelos en los idiomas alemán y coreano. Las etiquetas de orador identifican qué persona ha pronunciado cada palabra en un intercambio con varios participantes. Para obtener más información, consulte Etiquetas de orador. - Ahora Activity Tracker ya está soportado para la interfaz HTTP asíncrona
- El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de la interfaz HTTP asíncrona. IBM Cloud Activity Tracker registra las actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud®. Para obtener más información, consulte Sucesos de Activity Tracker.
24 de febrero de 2020
- Actualizaciones de varios modelos para mejorar el reconocimiento de voz
-
Los siguientes modelos se han actualizado para mejorar el reconocimiento de voz:
- Modelo de banda ancha holandés (
nl-NL_BroadbandModel) - Modelo de banda estrecha holandés (
nl-NL_NarrowbandModel) - Modelo de banda ancha italiano (
it-IT_BroadbandModel) - Modelo de banda estrecha italiano (
it-IT_NarrowbandModel) - Modelo de banda estrecha japonés (
ja-JP_NarrowbandModel) - Modelo de banda ancha inglés de EE. UU. (
en-US_BroadbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda ancha holandés (
- Ahora la personalización del modelo de idioma ya está disponible para holandés e italiano
-
Ahora se da soporte a la personalización del modelo de idioma para holandés e italiano con las nuevas versiones de los siguientes modelos:
- Modelo de banda ancha holandés (
nl-NL_BroadbandModel) - Modelo de banda estrecha holandés (
nl-NL_NarrowbandModel) - Modelo de banda ancha italiano (
it-IT_BroadbandModel) - Modelo de banda estrecha italiano (
it-IT_NarrowbandModel)
Para obtener más información, consulte
- Análisis de holandés, inglés, francés, alemán, italiano, portugués y español
- Directrices para holandés, francés, alemán, italiano, portugués y español
Debido a que los modelos holandés e italiano son versiones beta, su soporte para la personalización del modelo de lenguaje es también beta.
- Modelo de banda ancha holandés (
- El modelo de banda estrecha para japonés ahora incluye algunas unidades de palabras multigramo
-
El modelo de banda estrecha japonés (
ja-JP_NarrowbandModel) ahora incluye algunas unidades de palabras multigramo para dígitos y fracciones decimales. El servicio devuelve estas unidades multigramo independientemente de si ha habilitado el formateo inteligente. La característica de formateo inteligente entiende y devuelve las unidades multigramo que genera el modelo. Si aplica su propio postproceso a los resultados de la transcripción, deberá manejar estas unidades adecuadamente. Para obtener más información, consulte Japonés en la documentación de formateo inteligente. - Nuevos parámetros de detección de actividad del habla y de supresión de audio de fondo para reconocimiento de voz
-
Ahora el servicio ofrece dos nuevos parámetros opcionales para controlar el nivel de detección de actividad de voz. Los parámetros pueden ayudar a garantizar que solo se procese el audio relevante para el reconocimiento de voz.
- El parámetro
speech_detector_sensitivityajusta la sensibilidad de la detección de actividad de voz. Puede utilizar el parámetro para suprimir las inserciones de palabras procedentes de música, tos y otros sucesos que no sean de voz. - El parámetro
background_audio_suppressionsuprime el audio de fondo en función de su volumen para evitar que se transcriba o que interfiera de algún modo en el reconocimiento de voz. Puede utilizar el parámetro para suprimir las conversaciones secundarias o el ruido de fondo.
Puede utilizar los parámetros de forma individual o conjunta. Están disponibles para todas las interfaces y para la mayoría de los modelos de lenguaje. Para obtener más información acerca de los parámetros, sus valores permitidos y su efecto sobre la calidad y la latencia del reconocimiento de voz, consulte Detección de actividad de voz.
- El parámetro
- Activity Tracker ya está soportado para interfaces de personalización
-
El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de personalización. IBM Cloud Activity Tracker registra actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud. Puede utilizar este servicio para investigar una actividad anormal y acciones críticas, así como para cumplir con los requisitos de auditoría de la normativa. Además, puede recibir alertas sobre las acciones a medida que se ocurren. Para obtener más información, consulte Sucesos de Activity Tracker.
- Arreglo de defectos: generación correcta de métricas de proceso con la interfaz WebSocket
-
Arreglo de defecto: la interfaz WebSocket ahora funciona sin problemas al generar métricas de proceso. Anteriormente, las métricas de proceso se podían seguir entregando después de que el cliente enviaría un mensaje
stopal servicio.
18 de diciembre de 2019
- Nuevos modelos beta para italiano disponibles
-
Ahora el servicio ofrece modelos beta de banda ancha y de banda estrecha para el idioma italiano:
it-IT_BroadbandModelit-IT_NarrowbandModel
Estos modelos de lenguaje dan soporte a la personalización del modelo acústico. No dan soporte a la personalización del modelo de lenguaje. Puesto que son versiones beta, estos modelos pueden no estar preparados para su uso en producción y pueden estar sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
Para obtener más información, consulte las secciones siguientes:
- Nuevo parámetro
end_of_phrase_silence_timepara el reconocimiento de voz -
Para el reconocimiento de voz, ahora el servicio da soporte al parámetro
end_of_phrase_silence_time. El parámetro especifica la duración del intervalo de pausa en el que el servicio divide una transcripción en varios resultados finales. Cada resultado final indica una pausa o un silencio largo que supera el intervalo de pausa. En el caso de la mayoría de los idiomas, el intervalo de pausa predeterminado es de 0,8 segundos; en el caso del chino, el intervalo es de 0,6 segundos.Puede utilizar el parámetro establecer un equilibrio entre la frecuencia con la que se genera un resultado final y la precisión de la transcripción. Aumente el intervalo cuando la precisión sea más importante que la latencia. Reduzca el intervalo cuando se espere que el orador pronuncie frases cortas o respuestas de una sola palabra.
Para obtener más información, consulte Tiempo de silencio de fin de frase.
- Nuevo parámetro
split_transcript_at_phrase_endpara el reconocimiento de voz -
Para el reconocimiento de voz, ahora el servicio da soporte al parámetro
split_transcript_at_phrase_end. El parámetro indica al servicio que divida la transcripción en varios resultados finales en función de las características semánticas de la entrada. El servicio basa su comprensión de las características semánticas en el modelo de lenguaje base que utilice con una solicitud. Los modelos de lenguaje personalizado y las gramáticas también afectan a la forma en que el servicio divide una transcripción.El parámetro hace que el servicio añada un campo
end_of_utterancea cada resultado final para indicar el objetivo de la división:full_stop,silence,end_of_dataoreset.Para obtener más información, consulte División de la transcripción al final de la frase.
12 de diciembre de 2019
- Soporte completo para IBM Cloud IAM
-
Ahora el servicio Speech to Text da soporte a la implementación completa de IBM Cloud Identity and Access Management (IAM). Las claves de API para los servicios de IBM Watson® ya no están limitadas a una única instancia de servicio. Puede crear políticas de acceso y claves de API que se apliquen a más de un servicio, y puede otorgar acceso entre los servicios. Para obtener más información sobre IAM, consulte Autenticación en servicios de Watson.
Para dar soporte a este cambio, los puntos finales de servicio de API utilizan un dominio diferente e incluyen el ID de la instancia de servicio. El patrón es
api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}.- URL de HTTP de ejemplo para una instancia alojada en la ubicación de Dallas:
https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2- URL de WebSocket de ejemplo para una instancia alojada en la ubicación de Dallas:
wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2Para obtener más información sobre las URL, consulta la referencia de la API y el SDK.
Estos URL no constituyen un cambio de última hora. Los nuevos URL funcionan tanto para las instancias de servicio existentes como para las nuevas instancias. Los URL originales siguen trabajando en las instancias de servicio existentes durante al menos un año, hasta diciembre de 2020.
- Nuevas funciones de seguridad de red y de datos disponibles
-
Ya está disponible la compatibilidad con la siguiente nueva función de seguridad de red y datos:
-
Soporte de puntos finales de red privada
Los usuarios de planes Premium pueden crear puntos finales de red privados para conectarse al servicio de Speech to Text a través de una red privada. Las conexiones a puntos finales de red privada no requieren acceso a la Internet pública. Para obtener más información, consulte Puntos finales de red públicos y privados.
-
10 de diciembre de 2019
- Nuevos modelos beta para holandés de los Países Bajos disponibles
-
El servicio ofrece ahora modelos beta de banda ancha y banda estrecha para el idioma holandés de los Países Bajos:
nl-NL_BroadbandModelnl-NL_NarrowbandModel
Estos modelos de lenguaje dan soporte a la personalización del modelo acústico. No dan soporte a la personalización del modelo de lenguaje. Puesto que son versiones beta, estos modelos pueden no estar preparados para su uso en producción y pueden estar sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
Para obtener más información, consulte las secciones siguientes:
25 de noviembre de 2019
- Actualizaciones de las etiquetas de orador para una mejor identificación de los oradores individuales
- Las etiquetas de orador se han actualizado para mejorar la identificación de oradores individuales para realizar un análisis más detallado de su muestra de audio. Para obtener más información acerca de la característica de etiquetas de orador, consulte Etiquetas de orador. Para obtener más información sobre las mejoras introducidas en esta función, consulta « IBM Research AI Advances Speaker Diarization in Real Use Cases ».
12 de noviembre de 2019
- Ahora ya está disponible un nueva ubicación de Seúl
- El servicio Speech to Text ya está disponible en la ubicación de Seúl IBM Cloud (kr-seo). Al igual que con otras ubicaciones, la ubicación de IBM Cloud utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.
1 de noviembre de 2019
- Nuevos límites en el número máximo de modelos personalizados
- No puede crear más de 1024 modelos de lenguaje personalizado y no más de 1024 modelos acústicos personalizados por credencial de propietario. Para obtener más información, consulte Número máximo de modelos personalizados.
1 de octubre de 2019
- Nuevo soporte de HIPAA de EE.UU. para planes Premium en la ubicación Washington, DC
- El soporte de HIPAA de EE.UU. está disponible para los planes Premium que se alojan en la ubicación Washington, DC (ee.uu) y que se crean a partir del 1 de abril de 2019. Para obtener más información, consulte la Ley de Responsabilidad y Portabilidad de Seguro Médico (HIPAA).
22 de agosto de 2019
- Arreglo de defectos: varias mejoras pequeñas
- El servicio se ha actualizado para arreglos de defectos pequeños y para mejoras.
30 de julio de 2019
- Ahora ya están disponibles nuevos modelos para dialectos del español
-
El servicio ahora ofrece modelos de lenguajes de banda ancha y banda estrecha en seis dialectos del español:
- Español argentino (
es-AR_BroadbandModelyes-AR_NarrowbandModel) - Español castellano (
es-ES_BroadbandModelyes-ES_NarrowbandModel) - Español chileno (
es-CL_BroadbandModelyes-CL_NarrowbandModel) - Español colombiano (
es-CO_BroadbandModelyes-CO_NarrowbandModel) - Español mexicano (
es-MX_BroadbandModelyes-MX_NarrowbandModel) - Español peruano (
es-PE_BroadbandModelyes-PE_NarrowbandModel)
Los modelos de español castellano no son nuevos. Están disponibles de forma general (GA) para el reconocimiento del habla y la personalización del modelo de idioma de forma beta para la personalización del modelo acústico.
Los otros cinco dialectos son nuevos y son versiones beta para todos los usos. Puesto que son versiones beta, puede que estos dialectos adicionales no estén listos para su uso en producción y sujetos a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
Para obtener más información, consulte las secciones siguientes:
- Español argentino (
24 de junio de 2019
- Actualizaciones de modelos para portugués de Brasil e inglés de EE.UU. para mejorar el reconocimiento de voz
-
Los siguientes modelos de banda estrecha se han actualizado para conseguir un reconocimiento de voz mejorado:
- Modelo de banda estrecha en portugués de Brasil (
pt-BR_NarrowbandModel) - Modelo de banda estrecha en inglés americano (
en-US_NarrowbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda estrecha en portugués de Brasil (
- Nuevo soporte para solicitudes simultáneas para actualizar diferentes modelos acústicos personalizados
-
El servicio ahora le permite enviar varias solicitudes simultáneas para añadir diversos recursos de audio a un modelo acústico personalizado. Anteriormente, el servicio permitía solamente una solicitud cada vez para añadir audio a un modelo personalizado.
- Nuevo campo
updatedpara métodos que listan modelos personalizados -
La salida de los métodos HTTP
GETque ofrecen información sobre los modelos acústicas y de lenguaje personalizados ahora incluyen un campoupdated. El campo indica la fecha y hora en formato de hora universal coordinada (UTC) en que se ha modificado el modelo personalizado por última vez. - Cambiar a esquema para avisos asociados con entrenamiento de modelo personalizado
-
El esquema se ha cambiado por un aviso que ha generado una solicitud de entrenamiento cuando el parámetro
strictse establece enfalse. Los nombres de los campos se han cambiado dewarning_idydescriptionacodeymessage, respectivamente. Para obtener más información, consulte la Referencia de API y SDK.
10 de junio de 2019
- Las métricas de proceso no están disponibles con la interfaz HTTP síncrona
- Las métricas de proceso sólo están disponibles con las interfaces WebSocket y HTTP asíncrona. No reciben soporte con la interfaz HTTP síncrona. Para obtener más información, consulte Métricas de proceso.
17 de mayo de 2019
- Nuevas características de métricas de proceso y métricas de audio para el reconocimiento de voz
-
El servicio ahora ofrece dos tipos de métricas opcionales con solicitudes de reconocimiento de voz:
- Las métricas de proceso proporcionan información de temporización detallada sobre el análisis del servicio del audio de entrada. El servicio devuelve las métricas a intervalos específicos y con sucesos de transcripción como, por ejemplo, resultados provisionales y finales. Utilice las métricas para medir el progreso de servicio transcribiendo el audio.
- Las métricas de audio proporcionan información detallada sobre las características de señal del audio de entrada. Los resultados proporcionan métricas de agregación para todo el audio de entrada en la conclusión del proceso de habla. Utilice las métricas para determinar las características y la calidad del audio.
Puede solicitar ambos tipos de métricas con cualquier solicitud de reconocimiento de voz. De forma predeterminada, el servicio no devuelve métricas para una solicitud.
- Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz
-
El modelo de banda ancha del japonés (
ja-JP_BroadbandModel) se ha actualizado para el reconocimiento de voz mejorado. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en el modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
10 de mayo de 2019
- Actualizaciones de modelos para español para mejorar el reconocimiento de voz
-
Los modelos del idioma español se han actualizado para el reconocimiento de voz mejorado:
es-ES_BroadbandModeles-ES_NarrowbandModel
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
19 de abril de 2019
- Ahora está disponible un nuevo parámetro
strictpara el entrenamiento de modelos personalizados - Los métodos de entrenamiento de la interfaz de personalización incluyen ahora un parámetro de consulta
strictque indica si el entrenamiento debe continuar si un modelo personalizado contiene una mezcla de recursos válidos y no válidos. De forma predeterminada, el entrenamiento falla si un modelo personalizado contiene uno o más recursos no válidos. Establezca el parámetrofalsepara permitir que el entrenamiento continúe siempre que el modelo contenga como mínimo un recurso válido. El servicio excluye del entrenamiento los recursos que no son válidos.- Para obtener más información sobre cómo utilizar el parámetro
strictcon el métodoPOST /v1/customizations/{customization_id}/train, consulte Entrenamiento del modelo de lenguaje personalizado y Errores de entrenamiento. - Para obtener más información sobre cómo utilizar el parámetro
strictcon el métodoPOST /v1/acoustic_customizations/{customization_id}/train, consulte Entrenamiento del modelo acústico personalizado y Errores de entrenamiento.
- Para obtener más información sobre cómo utilizar el parámetro
- Nuevos límites en el número máximo de palabras fuera de vocabulario para modelos de idioma personalizados
- Ahora puede añadir un máximo de 90.000 palabras OOV (no definidas en el vocabulario) al registro de palabras de un modelo de lenguaje personalizado. El máximo anterior era de 30.000 palabras OOV. Esta cifra incluye las palabras de OOV de todas las fuentes (corpus, gramáticas y palabras personalizadas individuales que se añaden directamente). Puede añadir un máximo de 10 millones de palabras en total a un modelo personalizado de todas las fuentes combinadas. Para obtener más información, consulte ¿Cuántos datos necesito?.
3 de abril de 2019
- Nuevos límites en la cantidad máxima de audio para modelos acústicos personalizados
- Ahora los modelos acústicos personalizados aceptan un máximo de 200 horas de audio. El límite máximo anterior era de 100 horas de audio.
21 de marzo de 2019
- Ahora la visibilidad de las credenciales de servicio están restringidas por rol
-
Ahora los usuarios sólo pueden ver la información de credenciales de servicio que está asociada al rol que se ha asignado a su cuenta de IBM Cloud. Por ejemplo, si se le asigna un rol de
reader, las credenciales de servicio dewritero de otros niveles superiores ya no son visibles.Este cambio no afecta al acceso de API para usuarios o aplicaciones con credenciales de servicio existentes. El cambio sólo afecta a la visualización de credenciales dentro de IBM Cloud.
15 de marzo de 2019
- Nuevo soporte para el formato de audio A-law
- Ahora el servicio da soporte al audio en formato de A-law (
audio/alaw). Para obtener más información, consulte Formato audio/alaw.
11 de marzo de 2019
- Cambiar al valor de paso del parámetro
0paramax_alternatives - Para el parámetro
max_alternatives, el servicio acepta de nuevo un valor de0. Si especifica0, el servicio utiliza automáticamente el valor predeterminado,1. Un cambio realizado para la actualización del servicio del 4 de marzo hizo que el valor0devolviera un error. (El servicio devuelve un error si especifica un valor negativo.) - Cambiar al valor de paso del parámetro
0paraword_alternatives_threshold - Para el parámetro
word_alternatives_threshold, el servicio acepta de nuevo el valor0. Un cambio realizado para la actualización del servicio del 4 de marzo hizo que el valor0devolviera un error. (El servicio devuelve un error si especifica un valor negativo.) - Nuevo límite en la precisión máxima para puntuaciones de confianza
- Ahora el servicio devuelve todas las puntuaciones de confianza con una precisión máxima de dos posiciones decimales. Este cambio incluye las puntuaciones de confianza correspondientes a transcripciones, confianza de palabras, alternativas a palabras, resultados de palabra clave y las etiquetas de orador.
4 de marzo de 2019
- Actualizaciones de modelos de banda estrecha para portugués de Brasil, francés y español para mejorar el reconocimiento de voz
-
Los siguientes modelos de lenguaje de banda estrecha se han actualizado para mejorar el reconocimiento de voz:
- Modelo de banda estrecha en portugués de Brasil (
pt-BR_NarrowbandModel) - Modelo para francés (
fr-FR_NarrowbandModel) - Modelo de banda estrecha para español (
es-ES_NarrowbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda estrecha en portugués de Brasil (
28 de enero de 2019
- Nuevo soporte para IBM Cloud IAM mediante la interfaz WebSocket
-
La interfaz WebSocket ahora admite la autenticación de IAM (Identity and Access Management) basada en señales (IAM) a partir de código JavaScript basado en navegador. Se ha eliminado la limitación de lo contrario. Para establecer una conexión autenticada con el método WebSocket
/v1/recognize:- Si utiliza la autenticación de IAM, incluya el parámetro de consulta
access_token. - Si utiliza las credenciales de servicio de Cloud Foundry, incluya el parámetro de consulta
watson-token.
Para obtener más información, consulte el apartado sobre cómo Abrir una conexión.
- Si utiliza la autenticación de IAM, incluya el parámetro de consulta
20 de diciembre de 2018
- Ahora está disponible una nueva función de beta de gramáticas para modelos de idiomas personalizados
-
Ahora el servicio da soporte a gramáticas para el reconocimiento de voz. Las gramáticas están disponibles como funciones beta para todos los idiomas que dan soporte a la personalización del modelo de lenguaje. Puede añadir gramáticas a un modelo de lenguaje personalizado y utilizarlas para restringir el conjunto de frases que el servicio puede reconocer del audio. Puede definir una gramática en formato Augmented Backus-Naur Form (ABNF) o en formato XML.
Están disponibles los cuatro métodos siguientes para trabajar con gramáticas:
POST /v1/customizations/{customization_id}/grammars/{grammar_name}añade un archivo de gramática a un modelo de lenguaje personalizado.GET /v1/customizations/{customization_id}/grammarsmuestra información sobre todas las gramáticas correspondientes a un modelo personalizado.GET /v1/customizations/{customization_id}/grammars/{grammar_name}devuelve información sobre la gramática especificada para un modelo personalizado.DELETE /v1/customizations/{customization_id}/grammars/{grammar_name}elimina una gramática existente de un modelo personalizado.
Puede utilizar una gramática para el reconocimiento de voz con las interfaces de WebSocket y HTTP. Utilice los parámetros
language_customization_idygrammar_namepara identificar el modelo personalizado y la gramática que desea utilizar. Actualmente, solo puede utilizar una gramática con una solicitud de reconocimiento de voz.Para obtener más información sobre gramáticas, consulte la documentación siguiente:
- Utilización de gramáticas con modelos de lenguaje personalizado
- Visión general de las gramáticas
- Adición de una gramática a un modelo de lenguaje personalizado
- Utilización de una gramática para el reconocimiento de voz
- Gestión de gramáticas
- Gramáticas de ejemplo
Para obtener información sobre todos los métodos de la interfaz, consulta la referencia de la API y el SDK.
- Ahora está disponible una nueva función de redacción numérica para inglés de EE.UU., japonés y coreano
-
Ahora dispone de una nueva característica de ocultación numérica para enmascarar números que tienen tres o más dígitos consecutivos. La ocultación sirve para eliminar la información personal confidencial, como números de tarjetas de crédito, de las transcripciones. Para habilitar esta característica, establezca el parámetro
redactionentrueen una solicitud de reconocimiento. La característica es una funcionalidad beta que solo está disponible en inglés de EE. UU., japonés y coreano. Para obtener más información, consulte Ocultación numérica. - Ahora están disponibles nuevos modelos de banda estrecha para francés y alemán
-
Los siguientes nuevos modelos de alemán y francés están ahora disponibles con el servicio:
- Modelo de banda estrecha para francés (
fr-FR_NarrowbandModel) - Modelo de banda estrecha para alemán (
de-DE_NarrowbandModel)
Los dos nuevos modelos dan soporte a la personalización de modelos de lenguaje (GA) y a la personalización de modelos acústicos (beta). Para obtener más información, consulte Soporte de idiomas para la personalización.
- Modelo de banda estrecha para francés (
- Ahora está disponible el nuevo
en-US_ShortForm_NarrowbandModelpara inglés de EE.UU. -
Ya está disponible un nuevo modelo de lenguaje inglés de Estados Unidos,
en-US_ShortForm_NarrowbandModel. El nuevo modelo está pensado para que se utilice en soluciones de respuesta de voz interactivas y de soporte automatizado al cliente. El modelo da soporte a la personalización de modelos de lenguaje (GA) y a la personalización de modelos acústicos (beta). Para obtener más información, consulte El modelo de formato abreviado en inglés de EE. UU.. - Actualizaciones de modelos de banda estrecha para inglés de EE.UU. y español para mejorar el reconocimiento de voz
-
Los siguientes modelos de lenguaje se han actualizado para mejorar el reconocimiento de voz:
- Modelo de banda estrecha para inglés del Reino Unido (
en-GB_NarrowbandModel) - Modelo de banda estrecha para español (
es-ES_NarrowbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento de voz. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda estrecha para inglés del Reino Unido (
- Nuevo soporte para el formato de audio G.279
-
Ahora el servicio da soporte a audio en el formato G.729 (
audio/g729). El servicio solo da soporte a G.729 Anexo D para audio de banda estrecha. Para obtener más información, consulte Formato audio/g729. - La característica de etiquetas de orador ahora está disponible para el modelo de banda estrecha para inglés del Reino Unido
-
La característica de etiquetas de orador ahora está disponible para el modelo de banda estrecha para inglés del Reino Unido (
en-GB_NarrowbandModel). La característica es una funcionalidad beta para todos los idiomas soportados. Para obtener más información, consulte Etiquetas de orador. - Nuevos límites en la cantidad máxima de audio para modelos acústicos personalizados
-
La duración máxima de audio que se puede añadir a un modelo acústico personalizado ha aumentado de 50 horas a 100 horas.
13 de diciembre de 2018
- Ahora está disponible una nueva ubicación de Londres
- El servicio Speech to Text está ahora disponible en la IBM Cloud ubicación de Londres (eu-gb). Al igual que todas las ubicaciones, Londres utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.
12 de noviembre de 2018
- Nuevo soporte para el formato inteligente para el reconocimiento de voz en japonés
- Ahora el servicio da soporte al formateo inteligente para el reconocimiento de voz en japonés. Anteriormente, el servicio solo daba soporte al formateo inteligente en inglés de Estados Unidos y español. La característica es una funcionalidad beta para todos los idiomas soportados. Para obtener más información, consulte Formateo inteligente.
7 de noviembre de 2018
- Ya disponible una nueva ubicación de Tokio
- El servicio Speech to Text está ahora disponible en la IBM Cloud ubicación de Tokio(jp-tok). Al igual que todas las ubicaciones, Tokio utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación de IAM.
30 de octubre de 2018
- Nuevo soporte para IBM Cloud IAM basado en señales
-
El servicio Speech to Text se ha migrado a la autenticación de IAM basada en señales para todas las ubicaciones. Todos los servicios de IBM Cloud ahora utilizan la autenticación de IAM. El servicio Speech to Text se ha migrado en cada ubicación en las fechas siguientes:
- Dallas (us-south): 30 de octubre de 2018
- Frankfurt (eu-de): 30 de octubre de 2018
- Washington, DC (us-east): 12 de junio de 2018
- Sídney (au-syd): 15 de mayo de 2018
La migración a la autenticación de IAM afecta de forma distinta a las instancias de servicio nuevas y existentes:
- Todas las instancias de servicio nuevas que se crean en cualquier ubicación ahora utilizan la autenticación de IAM para acceder al servicio. Puede pasar una señal portadora o una clave de API: las señales admiten solicitudes autenticadas sin incluir credenciales de servicio en cada llamada; las claves de API utilizan la autenticación básica HTTP. Cuando se utiliza cualquier SDK de Watson, se puede pasar la clave de API y dejar que SDK gestione el ciclo de vida de las señales.
- Las instancias de servicio existentes que ha creado en una ubicación antes de la fecha de migración indicada siguen utilizando el
{username}y la{password}de sus credenciales de servicio de Cloud Foundry para la autenticación hasta que las migre para que utilicen la autenticación de IAM.
Para obtener más información, consulte la siguiente documentación:
- Para saber qué mecanismo de autenticación utiliza tu instancia de servicio, consulta las credenciales del servicio haciendo clic en la instancia en el panel de control de IBM Cloud.
- Para obtener más información sobre la utilización de señales IAM con servicios Watson, consulte Autenticación en servicios de Watson.
- Para ver ejemplos que utilizan la autenticación de IAM, consulta la referencia de la API y el SDK.
9 de octubre de 2018
- Actualizaciones importantes en los cargos de precios para solicitudes de reconocimiento de voz
-
A partir del 1 de octubre de 2018, ahora se le cobra por todo el audio que pase al servicio para el reconocimiento de voz. Los mil primeros minutos de audio que envíe cada mes ya no son gratuitos. Para obtener más información sobre los planes de precios del servicio, consulta el servicio « Speech to Text » en el catálogo de IBM Cloud.
- La cabecera
Content-Typeahora es opcional para la mayoría de solicitudes de reconocimiento de voz -
La cabecera
Content-Typees ahora opcional para la mayoría de solicitudes de reconocimiento de voz. Ahora el servicio detecta automáticamente el formato de audio (tipo de MIME) de la mayoría de audio. Debe continuar especificando el tipo de contenido para los formatos siguientes:audio/basicaudio/l16audio/mulaw
Donde se indique, el tipo de contenido que especifique para estos formatos debe incluir la frecuencia de muestreo y puede incluir opcionalmente el número de canales y el valor endianness del audio. Para los demás formatos de audio, puede omitir el tipo de contenido o puede especificar un tipo de contenido
application/octet-streampara que el servicio detecte automáticamente el formato.Cuando utilice el mandato
curlpara realizar una solicitud de reconocimiento de voz con la interfaz HTTP, debe especificar el formato de audio con la cabeceraContent-Type, especificar"Content-Type: application/octet-stream"o especificar"Content-Type:". Si omite la cabecera por completo,curlutiliza el valor predeterminadoapplication/x-www-form-urlencoded. En la mayoría de los ejemplos de esta documentación se sigue especificando el formato de las solicitudes de reconocimiento de voz, independientemente de si es o no necesario.Este cambio se aplica a los métodos siguientes:
/v1/recognizepara solicitudes WebSocket. El campocontent-typedel mensaje de texto que se envía para iniciar una solicitud a través de una conexión WebSocket abierto es ahora opcional.POST /v1/recognizepara solicitudes HTTP síncronas. La cabeceraContent-Typees ahora opcional. (Para las solicitudes de varias partes, el campopart_content_typede los metadatos JSON también es ahora opcional.)POST /v1/recognitionspara solicitudes HTTP asíncronas. La cabeceraContent-Typees ahora opcional.
Para obtener más información, consulte Formatos de audio.
- Actualizaciones del modelo de banda ancha para portugués de Brasil para mejorar el reconocimiento de voz
-
El modelo de banda ancha en portugués de Brasil,
pt-BR_BroadbandModel, se ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- El parámetro
customization_idse ha renombrado alanguage_customization_id -
El parámetro
customization_idde los métodos de reconocimiento de voz ha quedado en desuso y se eliminará en futuros releases. Para especificar un modelo de lenguaje personalizado para una solicitud de reconocimiento de voz, utilice en su lugar el parámetrolanguage_customization_id. Este cambio se aplica a los métodos siguientes:/v1/recognizepara solicitudes WebSocketPOST /v1/recognizepara solicitudes HTTP síncronas (incluidas las solicitudes de varias partes)POST /v1/recognitionspara solicitudes HTTP asíncronas
10 de septiembre de 2018
- Nuevo modelo de banda ancha para alemán
-
Ahora el servicio da soporte a un modelo de banda ancha en alemán,
de-DE_BroadbandModel. El nuevo modelo en alemán da soporte a la personalización de modelos de lenguaje (disponible a nivel general) y a la personalización de modelos acústicos (beta).- Para obtener información sobre cómo el servicio analiza el corpus para alemán, consulte Análisis de holandés, inglés, francés, alemán, italiano, portugués y español.
- Para obtener más información sobre la creación de pronunciaciones parecidas para palabras personalizadas en alemán, consulte Directrices para holandés, francés, alemán, italiano, portugués y español.
- Personalización del modelo de idioma ahora disponible para portugués de Brasil
-
Los modelos existentes en portugués de Brasil,
pt-BR_BroadbandModelypt-BR_NarrowbandModel, ahora dan soporte a la personalización del modelo de lenguaje (disponible a nivel general). Los modelos no se actualizaron para habilitar este soporte, por lo que no es necesario actualizar los modelos acústicos personalizados existentes.- Para obtener información sobre cómo el servicio analiza los corpus para portugués de Brasil, consulte Análisis de holandés, inglés, francés, alemán, italiano, portugués y español.
- Para obtener más información sobre la creación de pronunciaciones parecidas para palabras personalizadas en portugués de Brasil, consulte Directrices para holandés, francés, alemán, italiano, portugués y español.
- Actualizaciones de modelos para inglés de EE.UU. y japonés para mejorar el reconocimiento de voz
-
Hay nuevas versiones de los modelos de banda ancha y banda ancha en inglés y japonés disponibles:
- Modelo de banda ancha inglés de EE. UU. (
en-US_BroadbandModel) - Modelo de banda estrecha en inglés americano (
en-US_NarrowbandModel) - Modelo de banda ancha para japonés (
ja-JP_BroadbandModel) - Modelo de banda estrecha japonés (
ja-JP_NarrowbandModel)
Los nuevos modelos ofrecen un mejor reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en estos modelos, debe actualizar los modelos personalizados existentes para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda ancha inglés de EE. UU. (
- Ahora las funciones de detección de palabras clave y alternativas a palabras ya están disponibles a nivel general
-
Las características de detección de palabras clave y alternativas a palabras están actualmente disponibles a nivel general (GA) en lugar de ser una funcionalidad beta para todos los idiomas. Para obtener más información, consulte
- Arreglo de defecto: Mejorar la documentación para la interfaz de personalización
-
Corrección de errores: Se han resuelto los siguientes problemas conocidos relacionados con la interfaz de personalización, que ya están corregidos en el entorno de producción. Se conserva la siguiente información para los usuarios que pueden haber encontrado los problemas en el pasado.
-
Si añade datos a un modelo de lenguaje personalizado o a un modelo acústico personalizado, debe volver a entrenar el modelo antes de utilizarlo para el reconocimiento de voz. El problema se produce en el siguiente caso:
-
El usuario crea un nuevo modelo personalizado (de lenguaje o acústico) y entrena el modelo.
-
El usuario añade recursos adicionales (palabras, corpus o audio) al modelo personalizado, pero no vuelve a entrenar el modelo.
-
El usuario no puede utilizar el modelo personalizado para el reconocimiento de voz. El servicio devuelve un error con el siguiente formato cuando se utiliza con una solicitud de reconocimiento de voz:
{ "code_description": "Bad Request", "code": 400, "error": "Requested custom language model is not available. Please make sure the custom model is trained." }
Para solucionar temporalmente este problema, el usuario debe volver a entrenar el modelo personalizado con sus datos más recientes. A continuación, el usuario puede utilizar el modelo personalizado con el reconocimiento de voz.
-
-
Antes de entrenar un modelo de lenguaje personalizado o un modelo acústico personalizado, debe actualizarlo a la versión más reciente de su modelo base. El problema se produce en el siguiente caso:
- El usuario tiene un modelo personalizado existente (de lenguaje o acústico) que se basa en un modelo que se ha actualizado.
- El usuario entrena el modelo personalizado existente con la versión antigua del modelo base sin actualizar primero a la versión más reciente del modelo base.
- El usuario no puede utilizar el modelo personalizado para el reconocimiento de voz.
Para solucionar temporalmente este problema, el usuario debe utilizar el método
POST /v1/customizations/{customization_id}/upgrade_modeloPOST /v1/acoustic_customizations/{customization_id}/upgrade_modelpara actualizar el modelo personalizado a la versión más reciente de su modelo base. A continuación, el usuario puede utilizar el modelo personalizado con el reconocimiento de voz.
-
7 de septiembre de 2018
- La interfaz basada en sesiones ya no está disponible
-
La interfaz REST de HTTP basada en sesión ya no recibe soporte. Toda la información relacionada con las sesiones se ha eliminado de la documentación. Los métodos siguientes ya no están disponibles:
POST /v1/sessionsPOST /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/observe_resultDELETE /v1/sessions/{session_id}
Si la aplicación utiliza la interfaz de sesiones, debe migrar a una de las restantes interfaces REST de HTTP o a la interfaz WebSocket. Para obtener más información, consulte la actualización del servicio del 8 de agosto de 2018.
8 de agosto de 2018
- Aviso de desuso para la interfaz de reconocimiento de voz basada en sesiones
-
La interfaz REST de HTTP basada en sesión ha quedado en desuso desde el 8 de agosto de 2018. Todos los métodos de la API de sesiones se eliminarán del servicio a partir del 7 de septiembre de 2018, después de lo cual ya no podrá utilizar la interfaz basada en sesión. Este aviso de desuso y de eliminación en 30 días se aplica a los métodos siguientes:
POST /v1/sessionsPOST /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/recognizeGET /v1/sessions/{session_id}/observe_resultDELETE /v1/sessions/{session_id}
Si la aplicación utiliza la interfaz de sesiones, debe migrar a una de las siguientes interfaces antes del 7 de septiembre:
- Para el reconocimiento de voz basado en secuencia (incluidos los casos de retransmisión en directo), utilice la interfaz WebSocket, que proporciona acceso a resultados provisionales y la latencia más baja.
- Para el reconocimiento de voz basado en archivos, utilice una de las interfaces siguientes:
- Para archivos cortos de unos pocos minutos de audio, utilice la interfaz HTTP síncrona
(POST /v1/recognize) o la interfaz HTTP asíncrona (POST /v1/recognitions). - Para archivos más largos de más de unos pocos minutos de audio, utilice la interfaz HTTP asíncrona. La interfaz HTTP asíncrona acepta hasta 1 GB de datos de audio con una sola solicitud.
- Para archivos cortos de unos pocos minutos de audio, utilice la interfaz HTTP síncrona
Las interfaces WebSocket y HTTP proporcionan los mismos resultados que la interfaz de sesiones (solo la interfaz WebSocket proporciona resultados provisionales). También puede utilizar uno de los SDK de Watson, que simplifican el desarrollo de aplicaciones con cualquiera de las interfaces. Para obtener más información, consulte la Referencia de API y SDK.
13 de julio de 2018
- Actualizaciones del modelo de banda estrecha para español para mejorar el reconocimiento de voz
-
El modelo en español de banda estrecha,
es-ES_NarrowbandModel, se ha actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente el modelo actualizado para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en este modelo, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
A partir de esta actualización, se encuentran disponibles las dos versiones siguientes del modelo en español de banda estrecha:
es_ES.8kHz.general.lm20180522235959.am20180522235959(actual)es_ES.8kHz.general.lm20180308235959.am20180308235959(anterior)
La versión siguiente del modelo ya no está disponible:
es_ES.8kHz.general.lm20171031235959.am20171031235959
Una solicitud de reconocimiento que intenta utilizar un modelo personalizado basado en el modelo base que ahora no está disponible utiliza el modelo base más reciente sin ninguna personalización. El servicio devuelve el siguiente mensaje de aviso:
Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported.Para reanudar el uso de un modelo personalizado basado en el modelo no disponible, primero debe actualizar el modelo utilizando el métodoupgrade_modeladecuado descrito anteriormente.
12 de junio de 2018
- Nuevas funciones para aplicaciones alojadas en la ubicación Washington, DC
-
Hay las siguientes características habilitadas para las aplicaciones alojadas en Washington, DC (us-east):
- El servicio ahora admite un nuevo proceso de autenticación de API. Para obtener más información, consulte la actualización de servicio del 30 de octubre de 2018.
- El servicio ahora admite la cabecera
X-Watson-Metadatay el métodoDELETE /v1/user_data. Para obtener más información, consulte Seguridad de la información.
15 de mayo de 2018
- Nuevas funciones para aplicaciones alojadas en la ubicación de Sídney
-
Hay las siguientes características habilitadas para las aplicaciones alojadas en Sídney (au-syd):
- El servicio ahora admite un nuevo proceso de autenticación de API. Para obtener más información, consulte la actualización de servicio del 30 de octubre de 2018.
- El servicio ahora admite la cabecera
X-Watson-Metadatay el métodoDELETE /v1/user_data. Para obtener más información, consulte Seguridad de la información.
26 de marzo de 2018
- La personalización del modelo de idioma ahora ya está disponible para el modelo de banda ancha para francés
-
El servicio ahora da soporte a la personalización del modelo de idioma para el modelo de idioma de banda ancha para francés
fr-FR_BroadbandModel. El modelo para francés está a disposición general (GA) para el uso de producción con la personalización del modelo de idioma.- Para obtener más información sobre cómo el servicio analiza los corpus para francés, consulte Análisis de holandés, inglés, francés, alemán, italiano, portugués y español.
- Para obtener más información sobre la creación de pronunciaciones parecidas para palabras personalizadas en francés, consulte Directrices para holandés, francés, alemán, italiano, portugués y español.
- Actualizaciones de modelos para francés, coreano y español para mejorar el reconocimiento de voz
-
Se han actualizado los siguientes modelos para mejorar el reconocimiento de voz:
- Modelo de banda estrecha para coreano (
ko-KR_NarrowbandModel) - Modelo de banda estrecha para español (
es-ES_NarrowbandModel) - Modelo de banda ancha para francés (
fr-FR_BroadbandModel)
De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en alguno de estos modelos, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:
POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados.
- Modelo de banda estrecha para coreano (
- El parámetro
versionse ha renombrado abase_model_version -
El parámetro
versionde los métodos siguientes se denomina ahorabase_model_version:/v1/recognizepara solicitudes WebSocketPOST /v1/recognizepara solicitudes HTTP sin sesiónPOST /v1/sessionspara solicitudes HTTP basadas en sesiónPOST /v1/recognitionspara solicitudes HTTP asíncronas
El parámetro
base_model_versionespecifica la versión de un modelo base que se va a utilizar para el reconocimiento de voz. Para obtener más información, consulte Utilización de modelos personalizados actualizados para el reconocimiento de voz y Realización de solicitudes de reconocimiento de voz con modelos personalizados actualizados. - Nuevo soporte para el formateo inteligente para el reconocimiento de voz en español
-
El formateo inteligente ahora recibe soporte para español, así como para inglés de EE. UU. Para inglés de EE. UU., la característica ahora también convierte series de palabras clave en signos de puntuación para puntos, comas, signos de interrogación y signos de exclamación. Para obtener más información, consulte Formateo inteligente.
1 de marzo de 2018
- Actualizaciones de modelos de banda ancha para francés y español para mejorar el reconocimiento de voz
-
Los modelos de banda ancha para francés y español,
fr-FR_BroadbandModelyes-ES_BroadbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en alguno de estos modelos, debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información, consulte Actualización de modelos personalizados. En la sección se muestran las reglas para actualizar modelos personalizados, los efectos de la actualización y los métodos para utilizar modelos actualizados.
1 de febrero de 2018
- Nuevos modelos para coreano
-
El servicio ahora ofrece modelos de idioma para el coreano:
ko-KR_BroadbandModelpara el audio que se muestrea a un mínimo de 16 kHz yko-KR_NarrowbandModelpara el audio que se muestrea a un mínimo de 8 kHz. Para obtener más información, consulte Idiomas y modelos de la generación anterior.Para la personalización del modelo de idioma, los modelos para coreano están disponibles de forma general (GA) para el uso de producción; para la personalización del modelo acústico, son una funcionalidad beta. Para obtener más información, consulte Soporte de idiomas para la personalización.
- Para obtener más información sobre la forma en que el servicio analiza el corpus en coreano, consulte Análisis de coreano.
- Para obtener más información sobre cómo crear pronunciaciones de palabras personalizadas en coreano, consulte Directrices para coreano.
14 de diciembre de 2017
- La personalización del modelo de idioma ahora está disponible de forma general
-
La personalización del modelo de lenguaje y todos los parámetros asociados están disponibles a nivel general (GA) para todos los idiomas a los que se da soporte: japonés, español, inglés del Reino Unido e inglés de EE. UU.
- La personalización del modelo acústico beta ahora ya está disponible para todos los idiomas
-
Ahora el servicio da soporte a la personalización del modelo acústico como funcionalidad beta para todos los idiomas disponibles. Puede crear modelos acústicos personalizados para los modelos de banda ancha o de banda estrecha para todos los idiomas. Para obtener una introducción a la personalización, incluida la personalización del modelo acústico, consulte Descripción de la personalización.
- Nuevo parámetro
versionpara el reconocimiento de voz -
Los diversos métodos para realizar solicitudes de reconocimiento ahora incluyen un nuevo parámetro
versionque puede utilizar para iniciar solicitudes que utilizan las versiones más antiguas o actualizadas de los modelos base y personalizados. Aunque se ha diseñado principalmente para su uso con modelos personalizados que se han actualizado, el parámetroversiontambién se puede utilizar sin modelos personalizados. Para obtener más información, consulte Realización de solicitudes de reconocimiento de voz con modelos personalizados actualizados. - Actualizaciones de modelos para inglés de EE.UU. para mejorar el reconocimiento de voz
-
Los modelos en inglés de EE. UU.,
en-US_BroadbandModelyen-US_NarrowbandModel, se han actualizado para mejorar el reconocimiento de voz. De forma predeterminada, el servicio utiliza automáticamente los modelos actualizados para todas las solicitudes de reconocimiento. Si tiene modelos de lenguaje personalizado o acústico personalizado que se basan en los modelos en inglés de EE. UU., debe actualizar los modelos personalizados para aprovechar las actualizaciones mediante los métodos siguientes:POST /v1/customizations/{customization_id}/upgrade_modelPOST /v1/acoustic_customizations/{customization_id}/upgrade_model
Para obtener más información sobre el procedimiento, consulte Actualización de modelos personalizados. En la sección se muestran las reglas para actualizar modelos personalizados, los efectos de la actualización y los métodos para utilizar modelos actualizados. Actualmente, los métodos solo se aplican a los nuevos modelos base en inglés de Estados Unidos. Sin embargo, la misma información se aplicará a las actualizaciones de otros modelos base a medida que estén disponibles.
- La personalización del modelo de idioma ahora disponible para inglés del Reino Unido
-
Ahora el servicio da soporte a la personalización del modelo de lenguaje para los modelos en inglés del Reino Unido,
en-GB_BroadbandModelyen-GB_NarrowbandModel. Aunque el servicio maneja las palabras del corpus y las personalizadas de inglés del Reino Unido y de Estados Unidos de forma similar, existen algunas diferencias importantes:- Para obtener más información sobre cómo el servicio analiza los corpus para el inglés del Reino Unido, consulte Análisis de holandés, inglés, francés, alemán, italiano, portugués y español.
- Para obtener más información sobre la creación de pronunciaciones parecidas para palabras personalizadas en inglés de Reino Unido, consulte Directrices para inglés. Específicamente, para inglés del Reino Unido no se pueden utilizar puntos ni guiones en las pronunciaciones.
2 de octubre de 2017
- Nueva interfaz beta de personalización de modelos acústicos para inglés de EE.UU., japonés y español
-
La interfaz de personalización ofrece ahora personalización del modelo acústico. Puede crear modelos acústicos personalizados que adapten los modelos base del servicio a su entorno y a los oradores. Puede cumplimentar y entrenar un modelo acústico personalizado con el audio que mejor se ajuste a la firma acústica del audio que se desea transcribir. Luego puede utilizar el modelo acústico personalizado con las solicitudes de reconocimiento para aumentar la precisión del reconocimiento de voz.
Los modelos acústicos personalizados complementan los modelos de lenguaje personalizado. Puede entrenar un modelo acústico personalizado con un modelo de lenguaje personalizado, y puede utilizar ambos tipos de modelos durante el reconocimiento de voz. La personalización del modelo acústico es una interfaz beta que sólo está disponible para inglés de EE.UU., japonés y español.
- Para obtener más información sobre los idiomas que reciben soporte de la interfaz de personalización y el nivel de soporte que está disponible para cada idioma, consulte Soporte de idiomas para la personalización.
- Para obtener más información sobre la interfaz de personalización del servicio, consulte Descripción de la personalización.
- Para obtener más información sobre cómo crear un modelo acústico personalizado, consulte Creación de un modelo acústico personalizado.
- Para obtener más información sobre la utilización de un modelo acústico personalizado, consulte Utilización de un modelo acústico personalizado para el reconocimiento de voz.
- Para obtener más información sobre todos los métodos de la interfaz de personalización, consulta la referencia de la API y el SDK.
- Nuevo parámetro beta
customization_weightpara modelos de idioma personalizados -
Para la personalización del modelo de lenguaje, ahora el servicio incluye una característica beta que establece una ponderación de personalización opcional para un modelo de lenguaje personalizado. Una ponderación de personalización especifica la ponderación relativa que se debe dar a las palabras de un modelo de lenguaje personalizado frente a las palabras del vocabulario base del servicio. Puede establecer una ponderación de personalización durante el entrenamiento y durante el reconocimiento de voz. Para obtener más información, consulte Utilización de ponderaciones de personalización.
- Actualizaciones del modelo de banda ancha para japonés para mejorar el reconocimiento de voz
-
El modelo de lenguaje
ja-JP_BroadbandModelse ha actualizado para que capture las mejoras del modelo base. La actualización no afecta a los modelos personalizados existentes que se basan en el modelo. - Nuevo parámetro
endiannesspara el formato de audioaudio/l16 -
Ahora el servicio incluye un parámetro para especificar el valor endianness del audio que se envía en formato
audio/l16(modulación de código de pulsos de 16 bits (PCM)). Además de especificar los parámetrosrateychannelscon el formato, ahora también puede especificarbig-endianolittle-endiancon el parámetroendianness. Para obtener más información, consulte Formato audio/l16.
14 de julio de 2017
- Nuevo soporte para el formato de audio de MP3 (MPEG)
-
Ahora el servicio da soporte a la transcripción de audio en formato MP3 o Motion Picture Experts Group (MPEG). Para obtener más información, consulte Formatos audio/mp3 y audio/mpeg.
- La personalización del modelo de idioma beta ahora está disponible para español
-
La interfaz de personalización del modelo de lenguaje ahora da soporte al español como funcionalidad beta. Puede crear un modelo personalizado basado en cualquiera de los modelos de lenguaje base en español:
es-ES_BroadbandModeloes-ES_NarrowbandModel; para obtener más información, consulte Creación de un modelo de lenguaje personalizado. Los precios de las solicitudes de reconocimiento que utilizan modelos de lenguaje personalizado en español son los mismos que los de las solicitudes que utilizan modelos en inglés de EE. UU. y en japonés. - Nuevo campo
dialectpara el método que crea un modelo de idioma personalizado -
El objeto JSON
CreateLanguageModelque se pasa al métodoPOST /v1/customizationspara crear un nuevo modelo de lenguaje personalizado ahora incluye un campodialect. El campo especifica el dialecto del idioma que se va a utilizar con el modelo personalizado. De forma predeterminada, el dialecto coincide con el idioma del modelo base. El parámetro solo tiene sentido para los modelos en español, para los que el servicio crea un modelo personalizado que se adapta al habla de uno de los siguientes dialectos:es-ESpara español castellano (valor predeterminado)es-LApara español de Latinoaméricaes-USpara español de Norteamérica (México)
Los métodos
GET /v1/customizationsyGET /v1/customizations/{customization_id}de la interfaz de personalización incluyen el dialecto de un modelo personalizado en su salida. Para obtener más información, consulte Creación de un modelo de lenguaje personalizado y Listado de modelos de lenguaje personalizado. - Nuevos nombres para modelos para inglés del Reino Unido
-
Los nombres de los modelos de lenguaje
en-UK_BroadbandModelyen-UK_NarrowbandModelhan quedado en desuso. Ahora los modelos están disponibles con los nombresen-GB_BroadbandModelyen-GB_NarrowbandModel.Los nombres en desuso
en-UK_{model}siguen funcionando, pero el métodoGET /v1/modelsya no devuelve los nombres en la lista de modelos disponibles. Todavía puede consultar los nombres directamente con el métodoGET /v1/models/{model_id}.
1 de julio de 2017
- El modelo de idioma personalizado ahora está disponible a nivel general para inglés de EE.UU. y japonés
-
La interfaz de personalización del modelo de idioma del servicio está ahora disponible a nivel general (GA) para su dos idiomas soportados, inglés de EE.UU. y japonés. IBM no factura por crear, alojar o gestionar modelos de idioma personalizados. Como se describe en el siguiente punto, IBM ahora cobra 0,03 $ (dólares americanos) adicionales por minuto de audio para las solicitudes de reconocimiento que utilizan modelos personalizados.
- Actualizaciones de los planes de precios para el servicio
-
IBM ha actualizado los precios del servicio
- Eliminando el precio adicional por utilizar modelos de banda estrecha
- Proporcionando un sistema de precio adicional por niveles para clientes con gran volumen
- Facturando 0,03 $ (dólares americanos) adicionales por minuto de audio para las solicitudes de reconocimiento que utilizan los modelos de lenguaje personalizado en inglés de EE. UU. o en japonés
Para obtener más información acerca de las actualizaciones de los precios, consulte
- El servicio Speech to Text en el catálogo IBM Cloud
- Las preguntas frecuentes sobre precios
- El cuerpo vacío ya no es necesario para las solicitudes HTTP POST
-
Ya no tiene que pasar un objeto de datos vacío como cuerpo para las siguientes solicitudes
POST:POST /v1/sessionsPOST /v1/register_callbackPOST /v1/customizations/{customization_id}/trainPOST /v1/customizations/{customization_id}/resetPOST /v1/customizations/{customization_id}/upgrade_model
Por ejemplo, ahora se llama al método
POST /v1/sessionsconcurldel siguiente modo:curl -X POST -u "{username}:{password}" \ --cookie-jar cookies.txt \ "{url}/v1/sessions"Ya no tiene que pasar la siguiente opción
curlcon la solicitud:--data "{}". Si tiene algún problema con una de estas solicitudesPOST, intente pasar un objeto de datos vacío con el cuerpo de la solicitud. El hecho de pasar un objeto vacío no modifica de ningún modo la naturaleza ni el significado de la solicitud.
22 de mayo de 2017
- El parámetro
continuousse ha eliminado de todos los métodos -
El parámetro
continuousse ha eliminado de todos los métodos que inician solicitudes de reconocimiento. Ahora el servicio transcribe una secuencia de audio completa hasta que termina o hasta que se excede el tiempo de espera, lo que ocurra primero. Este comportamiento es equivalente a establecer el anterior parámetrocontinuousentrue. De forma predeterminada, anteriormente el servicio detenía la transcripción tras el primer medio segundo sin habla (normalmente silencio) si se omitía el parámetro o se si se establecía enfalse.Las aplicaciones existentes que establezcan el parámetro en
trueno verán ningún cambio en el comportamiento. Es probable que las aplicaciones que establezcan el parámetro enfalseo que se basen en el comportamiento predeterminado vean un cambio. Si una solicitud especifica el parámetro, ahora el servicio responde devolviendo un mensaje de aviso para el parámetro desconocido:"warnings": [ "Unknown arguments: continuous." ]La solicitud se ejecuta correctamente a pesar del aviso, y una sesión existente o una conexión WebSocket no se ven afectadas.
IBM ha eliminado el parámetro en respuesta a los muchos comentarios de la comunidad de desarrolladores según los que especificar
continuous=falseañadía poco valor y podía reducir la precisión global de la transcripción. - Envío de audio necesario para evitar el tiempo de espera de sesión
-
Ya no se puede evitar un tiempo de espera excedido de sesión sin enviar audio:
- Cuando se utiliza la interfaz WebSocket, el cliente ya no puede mantener activa una conexión mediante el envío de un mensaje de texto JSON con el parámetro
actionestablecido enno-op. El envío de un mensajeno-opno genera un error, pero no tiene ningún efecto. - Cuando se utilizan sesiones con la interfaz HTTP, el cliente ya no puede ampliar la sesión mediante el envío de una solicitud
GET /v1/sessions/{session_id}/recognize. El método sigue devolviendo el estado de una sesión activa, pero no mantiene activa la sesión.
Ahora puede hacer lo siguiente para mantener activa una sesión:
- Establezca el parámetro
inactivity_timeouten-1para evitar el tiempo de espera excedido de inactividad de 30 segundos. - Envíe cualquier dato de audio, incluido silencio, al servicio para evitar el tiempo de espera excedido de la sesión de 30 segundos. Se le factura por la duración de los datos que envía al servicio, incluido el silencio que envíe para ampliar una sesión.
Para obtener más información, consulte Tiempos de espera excedidos. Lo ideal es establecer una sesión justo antes de obtener el audio para la transcripción y mantener la sesión enviando audio a una velocidad cercana al tiempo real. Además, asegúrese de que la aplicación se recupera correctamente de las sesiones o las conexiones cerradas.
IBM ha eliminado esta funcionalidad para asegurarse de que continúa ofreciendo a todos los usuarios un servicio de reconocimiento de voz óptimo de baja latencia.
- Cuando se utiliza la interfaz WebSocket, el cliente ya no puede mantener activa una conexión mediante el envío de un mensaje de texto JSON con el parámetro
10 de abril de 2017
- Las etiquetas de orador ahora están soportadas para inglés de EE.UU., español y japonés
-
Ahora el servicio da soporte a la característica de etiquetas de orador para los siguientes modelos de banda ancha:
- Modelo de banda ancha inglés de EE. UU. (
en-US-BroadbandModel) - Modelo de banda ancha para español (
es-ES-BroadbandModel) - Modelo de banda ancha para japonés (
ja-JP_BroadbandModel)
Para obtener más información, consulte Etiquetas de orador.
- Modelo de banda ancha inglés de EE. UU. (
- Nuevo soporte para el formato de audio de Web Media (WebM)
-
El servicio ahora admite el formato de audio WebM (Web Media) con el códec Opus o Vorbis. El servicio ahora también admite el formato de audio Ogg con el códec Vorbis además del códec Opus. Para obtener más información sobre los formatos de audio soportados, consulte Formato audio/webm.
- Nuevo soporte para el uso compartido de recursos entre orígenes
-
El servicio ahora da soporte a CORS (Cross-Origin Resource Sharing) para permitir que los clientes basados en navegador llamen al servicio directamente. Para obtener más información, consulte Soporte de CORS.
- Nuevo método para anular el registro de un URL de devolución de llamada con la interfaz HTTP asíncrona
-
Ahora la interfaz HTTP asíncrona ofrece un método
POST /v1/unregister_callbackque elimina el registro de un URL de devolución de llamada de la lista de elementos permitidos. Para obtener más información, consulte Anulación del registro de un URL de devolución de llamada. - Corrección de un error: Se han eliminado los tiempos de espera en archivos de audio largos con la inter WebSocket
-
Arreglo de defecto: la interfaz WebSocket ya no excede el tiempo de espera para solicitudes de reconocimiento para archivos de audio especialmente largos. Ya no es necesario solicitar resultados provisionales con el mensaje
startde JSON para evitar el tiempo de espera excedido. (Este problema se había descrito en la actualización del 10 de marzo de 2016.) - Nuevos códigos de error HTTP
-
Los siguientes métodos de personalización del modelo de idioma ahora pueden devolver los siguientes códigos de error HTTP:
- El método
DELETE /v1/customizations/{customization_id}devuelve ahora el código de respuesta HTTP 401 si se intenta suprimir un modelo personalizado que no existe. - Ahora el método
DELETE /v1/customizations/{customization_id}/corpora/{corpus_name}devuelve el código de respuesta HTTP 400 si se intenta suprimir un corpus que no existe.
- El método
8 de marzo de 2017
- La interfaz HTTP asíncrona ahora está disponible a nivel general
- La interfaz HTTP asíncrona ahora está disponible a nivel general (GA). Antes de esta fecha, era una funcionalidad beta.
1 de diciembre de 2016
- Nueva característica beta de etiquetas de orador
-
Ahora el servicio ahora ofrece una característica de etiquetas de orador beta para audio de banda estrecha en inglés de EE. UU., español o japonés. La característica identifica las palabras que pronuncia cada orador en un intercambio con varias personas. Cada uno de los métodos de reconocimiento sin sesión, basado en sesión, asíncrono y WebSocket incluye un parámetro
speaker_labelsque acepta un valor booleano que indica si se deben incluir etiquetas de orador en la respuesta. Para obtener más información acerca de la característica, consulte Etiquetas de orador. - Ahora la personalización del modelo de idioma beta ya disponible para japonés
-
La interfaz de personalización del modelo de lenguaje beta ahora recibe soporte para el japonés además del inglés de EE. UU. Todos los métodos de la interfaz dan soporte al japonés. Para obtener más información, consulte las secciones siguientes:
- Para obtener más información, consulte Creación de un modelo de idioma personalizado y Utilización de un modelo de idioma personalizado para el reconocimiento de voz.
- Para ver consideraciones generales y específicas del japonés sobre la adición de un archivo de texto de corpus, consulte Preparación de un archivo de texto de corpus y ¿Qué ocurre cuando añado un archivo de corpus?
- Para ver consideraciones específicas del japonés cuando se especifica el campo
sounds_likepara una palabra personalizada, consulte Directrices para el japonés. - Para obtener más información sobre todos los métodos de la interfaz de personalización, consulta la referencia de la API y el SDK.
- Nuevo método para listar información sobre un corpus
-
La interfaz de personalización del modelo de lenguaje incluye ahora un método
GET /v1/customizations/{customization_id}/corpora/{corpus_name}que muestra una lista con información acerca de un corpus especificado. El método resulta útil para supervisar el estado de una solicitud para añadir un corpus a un modelo personalizado. Para obtener más información, consulte Listado de los corpus de un modelo de lenguaje personalizado. - Nuevo campo
countpara métodos que listan palabras para modelos de idioma personalizados -
La respuesta JSON que devuelven los métodos
GET /v1/customizations/{customization_id}/wordsyGET /v1/customizations/{customization_id}/words/{word_name}ahora incluye un campocountpara cada palabra. El campo indica el número de veces que se encuentra la palabra en todos los corpus. Si añade una palabra personalizada a un modelo antes de que se añada mediante cualquier corpus, el recuento empieza en1. Si la palabra se añade desde un corpus primero y después se modifica, el recuento refleja sólo el número de veces que se encuentra en el corpus. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado.Para los modelos personalizados que se crearon antes de la existencia del campo
count, el campo siempre permanece en0. Para actualizar el campo para dichos modelos, vuelva a añadir el corpus del modelo e incluya el parámetroallow_overwritecon el métodoPOST /v1/customizations/{customization_id}/corpora/{corpus_name}. - Nuevo parámetro
sortpara métodos que listan palabras para modelos de idioma personalizados -
El método
GET /v1/customizations/{customization_id}/wordsincluye ahora un parámetro de consultasortque controla el orden en el que se muestran las palabras en una lista. El parámetro acepta dos argumentos,alphabeticalocount, que indican cómo se deben clasificar las palabras. Puede añadir un+o un-opcional antes de un argumento para indicar si los resultados se van a clasificar en orden ascendente o descendente. De forma predeterminada, el método muestra las palabras en orden alfabético ascendente. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado.Para los modelos personalizados creados antes de la introducción del campo
count, el uso del argumentocountcon el parámetrosortno tiene sentido. Utilice el argumentoalphabeticalpredeterminado con dichos modelos. - Nuevo formato de campo de
errorpara métodos que listan palabras para modelos de idioma personalizados -
El campo
errorque se puede devolver como parte de una respuesta JSON de los métodosGET /v1/customizations/{customization_id}/wordsyGET /v1/customizations/{customization_id}/words/{word_name}ahora es una matriz. Si el servicio ha descubierto uno o varios problemas con la definición de una palabra personalizada, el campo lista cada elemento de problema de la definición y proporciona un mensaje que describe el problema. Para obtener más información, consulte Listado de palabras personalizadas de un modelo de idioma personalizado. - Los parámetros
keywords_thresholdyword_alternatives_thresholdya no aceptan un valor nulo -
Los parámetros
keywords_thresholdyword_alternatives_thresholdde los métodos de reconocimiento ya no aceptan un valor nulo. Para omitir alternativas de palabras clave y de palabras en la respuesta, omita los parámetros. El valor especificado debe ser un valor flotante.
22 de septiembre de 2016
- Nueva interfaz beta de personalización de modelo de idioma
- Ahora el servicio ofrece una nueva interfaz de personalización de modelo de lenguaje beta para inglés de Estados Unidos. Puede utilizar la interfaz para adaptar el vocabulario base y los modelos de lenguaje del servicio mediante la creación
de modelos de lenguaje personalizado que incluyan terminología específica del dominio. Puede añadir palabras personalizadas individualmente o hacer que el servicio las extraiga del corpus. Para utilizar sus modelos personalizados con los
métodos de reconocimiento de voz que ofrece cualquiera de las interfaces del servicio, pase el parámetro de consulta
customization_id. Para obtener más información, consulte - Nuevo soporte para el formato de audio de
audio/mulaw - La lista de formatos de audio admitidos ahora incluye
audio/mulaw, que proporciona audio de un solo canal codificado mediante el algoritmo de datos u-law (o mu-law). Cuando utilice este formato, también debe especificar la frecuencia de muestreo a la que se captura el audio. Para obtener más información, consulte formato audio/mullaw. - Nuevo
supported_featuresidentificado al listar modelos - Los métodos
GET /v1/modelsyGET /v1/models/{model_id}ahora devuelven un camposupported_featurescomo parte de su salida para cada modelo de lenguaje. La información adicional describe si el modelo da soporte a la personalización. Para obtener más información, consulte la Referencia de API y SDK.
30 de junio de 2016
- La interfaz HTTP asíncrona beta ahora da soporte a todos los idiomas disponibles
- La interfaz HTTP asíncrona de la versión beta ahora da soporte a todos los idiomas soportados por el servicio. Anteriormente la interfaz solo estaba disponible para inglés de Estados Unidos. Para obtener más información, consulte La interfaz asíncrona de HTTP y la referencia de API y SDK.
23 de junio de 2016
- Ya está disponible la nueva interfaz HTTP asíncrona beta
- Ahora hay una interfaz HTTP asíncrona disponible. La interfaz proporciona funciones completas de reconocimiento para la transcripción en inglés de EE. UU. a través de llamadas HTTP de no bloqueo. Puede registrar URL de devolución de llamada y proporcionar series de secretos especificados por el usuario para conseguir la autenticación y la integridad de los datos con firmas digitales. Para obtener más información, consulte La interfaz asíncrona de HTTP y la referencia de API y SDK.
- Nuevo parámetro beta
smart_formattingpara el reconocimiento de voz - Una característica de formateo inteligente beta que convierte fechas, horas, series de dígitos y números, números de teléfono, valores de moneda y direcciones de Internet en representaciones más convencionales en las transcripciones finales.
Para habilitar esta característica, establezca el parámetro
smart_formattingentrueen una solicitud de reconocimiento. La característica es una funcionalidad beta que solo está disponible en inglés de EE. UU. Para obtener más información, consulte Formateo inteligente. - Nuevo modelo de banda ancha para francés
- La lista de modelos que reciben soporte para el reconocimiento de voz ahora incluye
fr-FR_BroadbandModelpara el audio en el idioma francés que se muestrea a un mínimo de 16 kHz. Para obtener más información, consulte Idiomas y modelos de la generación anterior. - Nuevo soporte para el formato de audio de
audio/basic - La lista de formatos de audio soportados ahora incluye
audio/basic. El formato proporciona audio de un solo canal que se codifica mediante datos de 8 bits u-law (o mu-law) que se muestrean a 8 kHz. Para obtener más información, consulte formato de audio/básico. - Los métodos de reconocimiento de voz ahora devuelven avisos para parámetros no válidos
- Los diversos métodos de reconocimiento pueden devolver una respuesta
warningsque incluye mensajes sobre parámetros de consulta o campos JSON no válidos incluidos en una solicitud. El formato de los avisos ha cambiado. Por ejemplo,"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."ahora es"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}." - El cuerpo vacío necesario para los métodos HTTP
POSTque no pasan datos - Para las solicitudes HTTP
POSTque de lo contrario no pasan datos al servicio, debe incluir un cuerpo de solicitud vacío con el formato{}. Con el mandatocurl, puede utilizar la opción--datapara pasar datos vacíos.
10 de marzo de 2016
- Nuevos límites máximos sobre el audio transmitido para el reconocimiento de voz
- Ambas formas de transmisión de datos (entrega única o en secuencia) ahora imponen un límite de 100 MB en datos de audio, al igual que la interfaz WebSocket. Anteriormente, el enfoque de entrega única tenía un límite máximo de 4 MB de datos. Para obtener más información, consulte Transmisión de audio (para todas las interfaces) y Envío de audio y recepción de resultados de reconocimiento (para la interfaz WebSocket). En la sección sobre WebSocket también se trata la trama máxima o el tamaño de mensaje de 4 MB impuesto por la interfaz WebSocket.
- Las interfaces HTTP y WebSocket ahora pueden devolver avisos
- La respuesta JSON a una solicitud de reconocimiento ahora puede incluir una matriz de mensajes de aviso correspondientes a parámetros de consulta o campos JSON no válidos incluidos con una solicitud. Cada elemento de la matriz es una serie
que describe la naturaleza del aviso seguida de una matriz de series de argumentos no válidos. Por ejemplo,
"warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]. Para obtener más información, consulte la Referencia de API y SDK. - El SDK iOS de Apple iOS beta está en desuso
- El Watson Speech Software Development Kit (SDK) para el sistema operativo Apple® iOS beta está en desuso. En su lugar, utilice el Watson SDK para el sistema operativo iOS de Apple®. El nuevo SDK está disponible en el repositorio «ios-sdk», dentro del espacio de nombres «
watson-developer-cloud», en GitHub. - La interfaz WebSocket puede producir resultados retardados
- La interfaz WebSocket puede tardar unos minutos en producir los resultados finales para una solicitud de reconocimiento para un archivo de audio especialmente largo. En el caso de la interfaz WebSocket, la conexión TCP subyacente permanece
inactiva mientras el servicio prepara la respuesta. Por lo tanto, la conexión se puede cerrar debido a un tiempo de espera excedido. Para evitar el tiempo de espera excedido con la interfaz WebSocket, solicite resultados provisionales (
\"interim_results\": \"true\") en JSON para que el mensajestartinicie la solicitud. Puede descartar los resultados provisionales si no los necesita. Este problema se resolverá en una futura actualización.
19 de enero de 2016
- Nueva característica de filtrado de lenguaje obsceno
- El servicio se ha actualizado para incluir una nueva función de filtrado de lenguaje obsceno el 19 de enero de 2016. De forma predeterminada, el servicio censura el lenguaje obsceno de sus resultados de transcripción para el audio en inglés de Estados Unidos. Para obtener más información, consulte Filtrado de lenguaje obsceno.
17 de diciembre de 2015
- Nueva característica de detección de palabras clave
- Ahora el servicio ofrece una característica de detección de palabras clave. Puede especificar una matriz de series de palabras clave que se van a comparar con el audio de entrada. También debe especificar un nivel de confianza definido por el usuario que debe tener una palabra para que se considere que coincide con una palabra clave. Para obtener más información, consulte Detección de palabras clave. La característica de detección de palabras clave es una funcionalidad beta.
- Nueva función de alternativas a palabras
- Ahora el servicio ofrece una característica de alternativas a palabras. La característica devuelve hipótesis alternativas para palabras del audio de entrada que cumplen un nivel de confianza definido por el usuario. Para obtener más información, consulte Alternativas a palabras. La característica de alternativas a palabras es una funcionalidad beta.
- Nuevos modelos para inglés de EE.UU. y árabe
- El servicio da soporte a más idiomas con sus modelos de transcripción:
en-UK_BroadbandModelyen-UK_NarrowbandModelpara inglés del Reino Unido yar-AR_BroadbandModelpara árabe estándar moderno. Para obtener más información, consulte Idiomas y modelos de la generación anterior. - Nuevo campo
session_closedpara métodos basados en sesiones - En las respuestas JSON que devuelve para los errores con métodos basados en sesión, el servicio ahora también incluye un nuevo campo
session_closed. El campo se establece entruesi la sesión se cierra como resultado del error. Para obtener más información sobre los posibles códigos de respuesta de cualquier método, consulta la referencia de la API y el SDK. - El tiempo de espera de plataforma HTTP ya no se aplica
- Las solicitudes de reconocimiento HTTP ya no están sujetas a un tiempo de espera de la plataforma de 10 minutos. Ahora, el servicio mantiene activa la conexión enviando un carácter de espacio en el objeto JSON de la respuesta cada 20 segundos mientras se lleva a cabo el reconocimiento. Para obtener más información, consulte Tiempos de espera excedidos.
- Ya no es necesario limitar la velocidad con comando curl
- Cuando se utiliza el mandato
curlpara transcribir audio con el servicio, ya no es necesario utilizar la opción--limit-ratepara transferir datos a una velocidad no superior a 40.000 bytes por segundo. - Cambios en los códigos de error HTTP
- El servicio ya no devuelve el código de estado de HTTP 490 para los métodos HTTP basados en sesión
GET /v1/sessions/{session_id}/observe_resultyPOST /v1/sessions/{session_id}/recognize. El servicio ahora responde con el código de estado de HTTP 400 en su lugar.
21 de septiembre de 2015
- Nuevos SDK móviles disponibles
-
Hay dos nuevos SDK móviles beta disponibles para los servicios de voz. Los SDK permiten a las aplicaciones móviles interactuar tanto con el servicio Speech to Text como con el servicio Text to Speech.
- El Watson Speech SDK para la plataforma Google Android™ da soporte a la transmisión de audio al servicio Speech to Text en tiempo real y recibe una transcripción del audio mientras habla. El proyecto incluye una aplicación de
ejemplo que muestra la interacción con ambos servicios de voz. El SDK está disponible en el repositorio «speech-android-sdk»,
dentro del espacio de nombres «
watson-developer-cloud», en GitHub. - Watson Speech SDK para el sistema operativo iOS de Apple® da soporte a la transmisión de audio al servicio Speech to Text y recibe una transcripción del audio en respuesta. El SDK está disponible en el repositorio «speech-ios-sdk», dentro del espacio de nombres «
watson-developer-cloud», en GitHub.
Los dos SDK admiten la autenticación con servicios de voz utilizando las credenciales de servicio de IBM Cloud o bien una señal de autenticación. Debido a que los SDK son beta, están sujetos a cambios en el futuro.
- El Watson Speech SDK para la plataforma Google Android™ da soporte a la transmisión de audio al servicio Speech to Text en tiempo real y recibe una transcripción del audio mientras habla. El proyecto incluye una aplicación de
ejemplo que muestra la interacción con ambos servicios de voz. El SDK está disponible en el repositorio «speech-android-sdk»,
dentro del espacio de nombres «
- Nuevos modelos para portugués de Brasil y chino mandarín
-
El servicio da soporte a dos nuevos idiomas, el portugués de Brasil y el chino mandarín, con los siguientes modelos:
- Modelo de banda ancha en portugués de Brasil (
pt-BR_BroadbandModel) - Modelo de banda estrecha en portugués de Brasil (
pt-BR_NarrowbandModel) - Modelo de banda ancha para chino mandarín (
zh-CN_BroadbandModel) - Modelo de banda estrecha para chino mandarín (
zh-CN_NarrowbandModel)
Para obtener más información, consulte Idiomas y modelos de la generación anterior.
- Modelo de banda ancha en portugués de Brasil (
- Nuevo soporte para el formato de audio de
audio/ogg;codecs=opus -
Las solicitudes HTTP
POST/v1/sessions/{session_id}/recognizey/v1/recognize, al igual que la solicitud WebSocket/v1/recognize, dan soporte a la transcripción de un nuevo tipo de soporte:audio/ogg;codecs=opuspara archivos en formato Ogg que utilizan el codec Opus. Además, el formatoaudio/wavpara los métodos ahora da soporte a cualquier codificación. La restricción sobre el uso de codificación PCM lineal se ha eliminado. Para obtener más información, consulte formato audio/ogg. - Nuevo parámetro
sequence_idpara el sondeo largo de sesiones -
Ahora el servicio da soporte a la eliminación de tiempos de espera excedidos cuando se transcriben archivos de audio largos con la interfaz HTTP. Cuando utilice sesiones, puede utilizar un patrón de sondeo largo especificando los ID de secuencia con los métodos
GET /v1/sessions/{session_id}/observe_resultyPOST /v1/sessions/{session_id}/recognizepara tareas de reconocimiento de larga ejecución. Mediante el nuevo parámetrosequence_idde estos métodos, puede solicitar resultados antes, durante o después de enviar una solicitud de reconocimiento. - Nueva característica de capitalización para la transcripción en inglés de EE.UU.
-
Para los modelos de lenguaje en inglés de Estados Unidos,
en_US_BroadbandModelyen_US_NarrowbandModel, el servicio ahora coloca correctamente mayúsculas en muchos nombres propios. Por ejemplo, el servicio devolvería un nuevo texto que dijera «Barack Obama se graduó en la Universidad de Columbia» en lugar de «barack obama se graduó en la universidad de columbia». Este cambio puede resultar especialmente interesante si es importante para la aplicación la colocación de mayúsculas en los nombres propios. - Nuevo código de error HTTP
-
La solicitud HTTP
DELETE /v1/sessions/{session_id}no devuelve el código de estado 415 «Tipo de medio no admitido». Este código de retorno se ha eliminado de la documentación del método.
1 de julio de 2015
- El servicio Speech to Text ahora está disponible a nivel general
-
El servicio ha pasado de beta a disponibilidad general (GA - General Availability) el 1 de julio de 2015. Existen las siguientes diferencias entre las versiones beta y GA de las API de Speech to Text. El release GA requiere que los usuarios actualicen a la nueva versión del servicio.
La versión GA de la API HTTP es compatible con la versión beta. Solo tiene que cambiar el código de aplicación existente si ha especificado de forma explícita un nombre de modelo. Por ejemplo, el código de ejemplo disponible para el servicio de GitHub incluía la siguiente línea de código en el archivo
demo.js:model: 'WatsonModel'Esta línea especificaba el modelo predeterminado
WatsonModelpara la versión beta del servicio. Si la aplicación también especificaba este modelo, tiene que cambiarlo para que utilice uno de los nuevos modelos que reciben soporte de la versión GA. Para obtener más información, consulte el siguiente punto. - Nuevo modelo de programación basado en señales
-
Ahora el servicio da soporte a un nuevo modelo de programación para la interacción directa entre un cliente y el servicio a través de una conexión WebSocket. Utilizando este modelo, un cliente puede obtener una señal de autenticación para comunicarse directamente con el servicio. La señal elimina la necesidad de que una aplicación de proxy del lado del servidor de IBM Cloud llame al servicio en nombre del cliente. Las señales son el medio preferido para que los clientes interactúen con el servicio.
El servicio sigue dando soporte al modelo de programación antiguo que se basaba en un proxy del lado del servidor para retransmitir audio y mensajes entre el cliente y el servicio. Pero el nuevo modelo es más eficiente y proporciona un mayor rendimiento.
- Nuevo parámetro
modelpara el reconocimiento de voz -
Los métodos
POST /v1/sessionsyPOST /v1/recognize, junto con el método WebSocket/v1/recognize, ahora dan soporte a un parámetro de consultamodel. El parámetro sirve para especificar información sobre el audio:- El idioma: inglés (English), japonés (Japanese) o español (Spanish)
- La frecuencia mínima de muestreo: banda ancha (bradband, 16 kHz) o banda estrecha (narrowband, 8 kHz)
Para obtener más información, consulte Idiomas y modelos de la generación anterior.
- Nuevo parámetro
inactivity_timeoutpara el reconocimiento de voz -
El parámetro
inactivity_timeoutestablece el valor de tiempo de espera en segundos transcurrido el cual el servicio cierra la conexión si detecta silencio (ausencia de voz) en modalidad continua. De forma predeterminada, el servicio finaliza la sesión después de 30 segundos de silencio. Los métodosPOST /v1/recognizey WebSocket/v1/recognizedan soporte al parámetro. Para obtener más información, consulte Tiempos de espera excedidos. - Nuevo parámetro
max_alternativespara el reconocimiento de voz -
El parámetro
max_alternativesindica al servicio que devuelva las n mejores hipótesis alternativas para la transcripción de audio. Los métodosPOST /v1/recognizey WebSocket/v1/recognizedan soporte al parámetro. Para obtener más información, consulte Número máximo de alternativas. - Nuevo parámetro
word_confidencepara el reconocimiento de voz -
El parámetro
word_confidenceindica al servicio que devuelva una puntuación de confianza para cada palabra de la transcripción. Los métodosPOST /v1/recognizey WebSocket/v1/recognizedan soporte al parámetro. Para obtener más información, consulte Confianza de palabras. - Nuevo parámetro
timestampspara el reconocimiento de voz -
El parámetro
timestampsindica al servicio que devuelva la hora inicial y final con relación al inicio del audio para cada palabra de la transcripción. Los métodosPOST /v1/recognizey WebSocket/v1/recognizedan soporte al parámetro. Para obtener más información, consulte Indicaciones de fecha y hora de palabras. - Método de sesiones renombrado para observar resultados
-
El método
GET /v1/sessions/{session_id}/observeResultahora se denominaGET /v1/sessions/{session_id}/observe_result. El nombreobserveResultsigue recibiendo soporte por motivos de compatibilidad con versiones anteriores. - Nuevo soporte para formato de audio Waveform Audio File (WAV)
-
La cabecera
Content-Typede los métodosrecognizeahora da soporte a archivos deaudio/wavpara Waveform Audio File (WAV), además deaudio/flacyaudio/l16. Para obtener más información, consulte formato audio/wav. - Límites sobre la cantidad máxima de audio para el reconocimiento de voz
-
Ahora el servicio tiene un límite de 100 MB de datos por sesión en modalidad continua. Puedes especificar el modo de transmisión indicando el valor «
chunked» en el encabezado «Transfer-Encoding». Una entrega única de un archivo de audio sigue imponiendo un límite de tamaño de 4 MB en los datos que se envían. Para obtener más información, consulte Transmisión de audio. - Nueva cabecera para renunciar a las mejoras de servicio
-
Los métodos
GET /v1/sessions/{session_id}/observe_result,POST /v1/sessions/{session_id}/recognizeyPOST /v1/recognizeahora incluyen el parámetro de cabeceraX-WDC-PL-OPT-OUTpara controlar si el servicio utiliza los datos de audio y de transcripción de una solicitud para mejorar resultados futuros. La interfaz WebSocket incluye un parámetro de consulta equivalente. Especifique el valor1para impedir que el servicio utilice resultados de audio y de transcripción. El parámetro se aplica sólo a la solicitud actual. La nueva cabecera sustituye la cabeceraX-loggingde la API beta. Consulte Control del registro de solicitudes para servicios de Watson. - Cambios en los códigos de error HTTP
-
El servicio ahora puede responder con los siguientes códigos de error HTTP:
- Para los métodos
/v1/models,/v1/models/{model_id},/v1/sessions,/v1/sessions/{session_id},/v1/sessions/{session_id}/observe_result,/v1/sessions/{session_id}/recognizey/v1/recognize, se ha añadido el código de error 415 ("Unsupported Media Type"). - En el caso de las solicitudes de tipo «
POST» y «GET» realizadas al método «/v1/sessions/{session_id}/recognize», se modifican los siguientes códigos de error:- El código de error 404 ("Session_id not found") tiene un mensaje más descriptivo (
POSTyGET). - El código de error 503 ("Session is already processing a request. Concurrent requests are not allowed on the same session. La sesión sigue activa después de este error.") tiene un mensaje más descriptivo (sólo
POST). - Para solicitudes HTTP
POSTdestinadas a los métodos/v1/sessionsy/v1/recognize, se puede devolver el código de error 503 ("Service Unavailable"). El código de error también puede aparecer al crear una conexión de tipo « WebSocket » con el método «/v1/recognize».
- El código de error 404 ("Session_id not found") tiene un mensaje más descriptivo (
- Para los métodos