Notas del release para Text to Speech for IBM Cloud

IBM Cloud

Se han incluido las siguientes características y cambios en cada versión y actualización de las instancias gestionadas de IBM Watson® Text to Speech alojadas en IBM Cloud, así como en las instancias alojadas en IBM Cloud Pak for Data as a Service. A menos que se indique lo contrario, todos los cambios son compatibles con releases anteriores y están disponibles de forma automática y transparente para todas las aplicaciones nuevas y existentes.

Para obtener información sobre las limitaciones conocidas del servicio, consulte Limitaciones conocidas.

Para obtener información sobre releases y actualizaciones del servicio para IBM Cloud Pak for Data, consulte las Notas del release de Text to Speech for IBM Cloud Pak for Data.

15 de mayo de 2026

Nueva voz femenina natural en portugués de Brasil

El servicio ya ofrece una nueva voz femenina natural para el portugués de Brasil:

  • pt-BR_IsabelaNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte

26 de marzo de 2026

Transición de voz obsoleta de v1 a v3

Las voces de concatenación estándar ( v1 ), anteriormente obsoletas, se sustituyen ahora por sus equivalentes neurales ( v3 ) durante la síntesis. Cuando una solicitud especifica una de estas voces v1, se utiliza en su lugar la voz v3 correspondiente.

  • de-DE_BirgitVoice -> de-DE_BirgitV3Voice
  • de-DE_DieterVoice -> de-DE_DieterV3Voice
  • en-GB_KateVoice -> en-GB_KateV3Voice
  • en-US_AllisonVoice -> en-US_AllisonV3Voice
  • en-US_LisaVoice -> en-US_LisaV3Voice
  • en-US_MichaelVoice -> en-US_MichaelV3Voice
  • es-ES_EnriqueVoice -> es-ES_EnriqueV3Voice
  • es-ES_LauraVoice -> es-ES_LauraV3Voice
  • es-LA_SofiaVoice -> es-LA_SofiaV3Voice
  • es-US_SofiaVoice -> es-US_SofiaV3Voice
  • fr-FR_ReneeVoice -> fr-FR_ReneeV3Voice
  • it-IT_FrancescaVoice -> it-IT_FrancescaV3Voice
  • ja-JP_EmiVoice -> ja-JP_EmiV3Voice
  • pt-BR_IsabelaVoice -> pt-BR_IsabelaV3Voice

Si se omite el parámetro opcional « voice » en una solicitud de síntesis de voz, el servicio utiliza ahora « en-US_MichaelV3Voice » de forma predeterminada. Esta voz neural ( v3 ) sustituye a la anterior voz concatenada estándar por defecto ( v1 ), en-US_MichaelVoice.

11 de marzo de 2026

Importante: Supresión de la función Beta Tune by Example

La función beta Tune by Example ha quedado obsoleta. Las API para crear nuevos avisos o modelos de altavoces ya no son compatibles.

  • Usuarios existentes: Las personalizaciones existentes que ya contengan avisos o modelos de locutor seguirán funcionando para la síntesis de voz durante un periodo de tiempo limitado. Sin embargo, no se pueden crear nuevos avisos o modelos de altavoz.
  • Nuevos usuarios: Las API para crear avisos o modelos de altavoces están desactivadas y no se pueden utilizar.

La función Tune by Example se eliminará por completo del servicio en una próxima versión. Una vez eliminada, la síntesis que utilice personalizaciones que dependan de avisos o modelos de altavoces dejará de ser compatible.

13 de enero de 2026

Nuevas voces naturales inglesas

El servicio ahora admite dos nuevas voces naturales, una masculina y otra femenina, para el inglés australiano:

  • en-AU_JackNatural
  • en-AU_HeidiNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte

5 de diciembre de 2025

Nuevo español latinoamericano Voces naturales

El servicio ahora admite dos nuevas voces naturales, una masculina y otra femenina, para el español latinoamericano:

  • es-LA_AlejandroNatural
  • es-LA_DanielaNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte

31 de octubre de 2025

Nuevas voces naturales en portugués de Brasil

El servicio admite ahora dos nuevas voces naturales, una masculina y otra femenina, para el portugués de Brasil:

  • pt-BR_LucasNatural
  • pt-BR_CamilaNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte

24 de julio de 2025

Nuevas voces naturales inglesas

El servicio admite ahora cuatro nuevas voces naturales, dos masculinas y dos femeninas, para el inglés de Estados Unidos:

  • en-US_EmmaNatural
  • en-US_EthanNatural
  • en-US_JacksonNatural
  • en-US_VictoriaNatural

El servicio admite ahora dos nuevas voces naturales, masculina y femenina, para el inglés del Reino Unido:

  • en-GB_ChloeNatural
  • en-GB_GeorgeNatural

El servicio admite ahora una nueva voz natural femenina para el inglés de CA:

  • en-CA_HannahNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte

09 de julio de 2025

Supresión de las voces V1
A partir del 7 de septiembre de 2025, todas las voces de V1 serán eliminadas del servicio. Todas las voces obsoletas de v1 cambiarán automáticamente a sus correspondientes voces de v3 en los próximos 12 meses.

19 de mayo de 2025

Nueva generación de voces - Voces naturales

El servicio es ahora compatible con una nueva generación de voces denominada Natural Voices, con una nueva voz para el inglés estadounidense:

  • en-US_EllieNatural

Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para más información, véase Voces naturales.

El servicio admite ahora el atributo opcional adicional format para la etiqueta <say-as interpret-as="letters" format="xx"> SSML

Ahora puede especificar el valor group o single con el atributo opcional format. Estos atributos ayudan a mejorar la legibilidad de las cadenas alfanuméricas, como la confirmación de números e ID, añadiendo silencios estratégicos.

17 de febrero de 2025

Nuevo portugués brasileño masculino voz neural expresiva

El servicio ahora admite una nueva voz neural expresiva masculina para el portugués brasileño:

  • pt-BR_LucasExpressive

Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte

09 de diciembre de 2024

Nueva voz neural expresiva masculina en inglés del Reino Unido

El servicio admite ahora una nueva voz neural expresiva masculina para el inglés del Reino Unido:

  • en-GB_GeorgeExpressive

Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte

15 de mayo de 2024

Nueva voz neural expresiva femenina española latinoamericana

El servicio ahora soporta una nueva voz neuronal expresiva femenina para el español latinoamericano

  • es-LA_DanielaExpressive

Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte

16 de enero de 2024

Mejoras de Text to Speech para voces expresas en inglés de EE.UU.
Cuando se utilizan voces expresas en inglés de Estados Unidos, la síntesis es más rápida con una latencia menor.
Corrección de defectos: Problema de inflexión al utilizar el signo de interrogación (?) en un enunciado corto
Arreglo de defecto: Cuando algunas expresiones cortas han finalizado con un signo de interrogación (?), se ignora la inflexión. Este problema ya se ha solucionado.

30 de noviembre de 2023

Se ha mejorado el motor de síntesis de Text to Speech para voces de la versión 3
El motor de Text to Speech se ha mejorado para ofrecer una síntesis más rápida con una latencia inferior para las voces de la versión 3.
Text to Speech voz mejorado en-AU_HeidiExpressive
Se ha mejorado la voz Text to Speech en-AU_HeidiExpressive, que puede ajustar el tono y la síntesis.

9 de junio de 2023

Corrección de defectos: TTS ya no falla debido al mensaje de error "[Errno 2] No such file or directory"
Corrección de defectos: Al utilizar TTS con websockets, ya no falla debido al mensaje de error "[Errno 2] No such file or directory"

18 de mayo de 2023

Arreglo de defectos: se ha añadido soporte para las características SSML que faltan en la voz holandesa
Arreglo de defectos: cuando se utiliza la voz holandesa, todas las características SSML soportadas ahora funcionan tal como se han diseñado. Anteriormente, cuando se utilizaba la voz holandesa, algunas características de SSML no funcionaban.
Arreglo de defectos: Ahora se respetan las comas cuando se utilizan etiquetas de fonemas
Arreglo de defectos: cuando se utilizan etiquetas de fonemas en SSML, las comas (pausas) ahora funcionan como se esperaba. Anteriormente, cuando las comas precedían o seguían texto con etiquetas de fonemas, la pausa se ignoraba.

6 de abril de 2023

Actualizaciones de la voz neuronal mejorada holandesa beta
Arreglo de defectos: el neerlandés beta nl-NL_MerelV3Voice se ha actualizado para arreglos internos y mejoras. Las limitaciones que se describen para la versión inicial de la voz en la actualización del servicio del 31 de marzo de 2023 siguen siendo aplicables.

31 de marzo de 2023

Importante: Fin del servicio para todas las voces neuronales

Importante: Todas las voces neuronales han alcanzado su fecha de fin de servicio y se han eliminado del servicio y de la documentación. No se ven afectadas las voces neurales realzadas ni las voces neurales expresivas. Para obtener una lista completa de todas las voces neuronales obsoletas, consulte las actualizaciones de servicio del 1 de marzo de 2023. Un intento de utilizar una voz obsoleta devuelve el código de respuesta HTTP 404 con el mensaje ' Model '{voice}' not found.

Las nuevas voces neuronales mejoradas y expresivas están disponibles para los idiomas inglés australiano, coreano y holandés. Debe migrar a una de las nuevas voces para el inglés australiano, el coreano o el neerlandés de los Países Bajos para continuar utilizando los idiomas obsoletos.

Para obtener más información, consulte Idiomas y voces.

22 de marzo de 2023

Nueva beta Países Bajos Países Bajos voz neuronal mejorada

El servicio ahora da soporte a una nueva voz femenina neuronal mejorada para Holanda: nl-NL_MerelV3Voice. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ".

La nueva voz es una función beta a la espera de que se complete la compatibilidad con SSML. En su versión inicial, la voz no admite el uso de las siguientes funciones relacionadas con SSML:

  • El elemento <prosody> con cualquier solicitud de síntesis de voz
  • Los parámetros rate_percentage y pitch_percentage con cualquier solicitud de síntesis de voz
  • El elemento <mark> con una solicitud de síntesis de voz WebSocket
  • El parámetro timings del mensaje de texto JSON con una solicitud de síntesis de voz WebSocket

Para obtener más información sobre la nueva voz, su soporte para los símbolos IPA y SPR, y migrar a la nueva voz desde las voces neuronales holandesas en desuso, consulte

Arreglo de defectos: actualizar símbolos fonéticos coreanos en la documentación

Corrección de defectos: En la documentación de los símbolos SPR coreanos, los símbolos de dos caracteres para las consonantes aparecen ahora entre comillas simples, lo que los convierte en un único símbolo. Antes se mostraban como dos símbolos separados, sin comillas. Para obtener más información, consulte Consonantes(coreano).

Actualizaciones de documentación para símbolos SPR de IBM

La documentación de visión general para los símbolos SPR de IBM se ha actualizado para aclarar el uso de los símbolos de varios caracteres. Para obtener más información, consulte Símbolos de sonido de voz).

1 de marzo de 2023

Importante: Pendiente de fin de servicio para todas las voces neuronales

Importante: Efectivo 31 de marzo de 2023, todas las voces neuronales alcanzan su fecha de fin de servicio y se eliminarán del servicio y de la documentación. Las voces neuronales están en desuso desde el 31 de marzo de 2022. No se efectúan voces neuronales o neuronales expresivas mejoradas.

Se eliminan las siguientes voces neuronales:

  • Árabe: ar-MS_OmarVoice
  • Chino (Mandarín): zh-CN_LiNaVoice, zh-CN_WangWeiVoice y zh-CN_ZhangJingVoice
  • Checo: cs-CZ_AlenaVoice
  • Holandés (Bélgica): nl-BE_AdeleVoice y nl-BE_BramVoice
  • Holandés (Países Bajos): nl-NL_EmmaVoice y nl-NL_LiamVoice
  • Inglés (Australia): en-AU_CraigVoice, en-AU_MadisonVoice y en-AU_SteveVoice
  • Coreano: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice y ko-KR_YunaVoice
  • Sueco: sv-SE_IngridVoice

Las nuevas voces neuronales mejoradas y expresivas ya están disponibles para los idiomas inglés y coreano de Australia. En las próximas semanas estará disponible una nueva voz neural mejorada para el neerlandés de los Países Bajos. Debe migrar a una de las nuevas voces para el inglés australiano, el coreano o el holandés antes del 31 de marzo de 2023.

Para obtener más información, consulte Idiomas y voces.

27 de febrero de 2023

Nuevas voces neuronales expresivas en inglés de Australia

El servicio ahora soporta dos nuevas voces neuronales expresivas, masculinas y femeninas, para el inglés australiano:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Las voces neuronales expresivas ofrecen un discurso que suena natural que es excepcionalmente claro, nítido y fluido. Las nuevas voces ya están disponibles de forma generalizada (GA) para su uso en entornos de producción. Admiten el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de IBM símbolos fonéticos de Representación Fonética Simbólica (RPS). Para obtener más información, consulte

Puede migrar de las voces neuronales en inglés australiano que están en desuso a las nuevas voces neuronales expresivas.

Nueva voz neuronal mejorada en coreano

El servicio ahora da soporte a una nueva voz femenina neuronal mejorada para el coreano: ko-KR_JinV3Voice. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte

Puede migrar de las voces neuronales coreanas que están en desuso a la nueva voz neuronal mejorada.

Arreglo de defecto: la voz canadiense francesa ahora maneja correctamente los tiempos numéricos

Corrección de defectos: Las voces francesa y canadiense pronuncian ahora correctamente los tiempos como 19:41. Anteriormente, las voces estaban omitiendo elementos de la época en el audio sintetizado.

Arreglo de defecto: la voz japonesa ya no inserta audio inesperado

Arreglo de defectos: la voz japonesa ya no inserta audio inesperado en los resultados de síntesis de voz. Anteriormente, se insertaba otro audio en determinados casos.

20 de enero de 2023

Cloud Foundry en desuso y migración a grupos de recursos

IBM ha anunciado la desaparición de IBM Cloud Foundry el 31 de mayo de 2022. A partir del 30 de noviembre de 2022, las nuevas IBM Cloud Foundry no se podrán crear y solo los usuarios existentes podrán desplegar aplicaciones. IBM Cloud Foundry ry alcanza el fin de soporte el 1 de junio de 2023. Entonces, cualquier IBM Cloud Foundry que ejecute aplicaciones IBM Cloud Foundry se deshabilitará, desaprovisionará y eliminará permanentemente.

Para seguir utilizando sus aplicaciones IBM Cloud más allá del 1 de junio de 2023, debe migrar a grupos de recursos antes de esa fecha. Los grupos de recursos son conceptualmente similares a los espacios de Cloud Foundry. Entre ellas se incluyen varias ventajas adicionales, como un control de acceso más preciso mediante el uso de la gestión de identidades y acceso ( IBM Cloud Identity and Access Management, IAM), la posibilidad de conectar instancias de servicio a aplicaciones y servicios en diferentes regiones, y una forma sencilla de consultar el uso por grupo.

Arreglo de defecto: la especificación de números cardinales grandes con el elemento <say-as> ya no provoca errores para las voces en inglés

Arreglo de defectos: Ahora puede utilizar el elemento <say-as> para pronunciar números grandes como números cardinales. Antes, encerrar un número grande en el elemento <say-as> con el atributo interpret-as="cardinal" podía hacer que fallara la síntesis de voz para las voces inglesas. Por ejemplo, <say-as interpret-as="cardinal">3,200</say-as> puede hacer que el servicio genere un error. Para obtener más información, consulte cardinal en el tema Elementos SSML.

Arreglo de defectos: Los homónimos y otras palabras son ahora pronunciadas correctamente por las voces en inglés

Arreglo de defectos: el servicio ahora pronuncia los homónimos y otras palabras correctamente basándose en su contexto en texto en inglés que se va a sintetizar. Antes, palabras como advocate y wifi podían ser pronunciadas incorrectamente por las voces inglesas.

30 de noviembre de 2022

Arreglo de defectos: Añadir reglas para la documentación de denominación de modelos personalizados
Arreglo de defectos: La documentación ahora proporciona reglas detalladas para denominar modelos personalizados. Para obtener más información, consulte

7 de octubre de 2022

El servicio ahora aplica una validación SSML más estricta
El servicio ahora aplica una validación más estricta del texto de entrada que incluye elementos SSML (Speech Síntesis Markup Language). Los elementos necesarios de los atributos deben especificarse con valores válidos. De lo contrario, la solicitud falla con un código de error 400. Para obtener más información sobre la validación de SSML y los requisitos que debe cumplir el texto marcado, consulte Validación de SSML.
Corrección de defectos: El género que aparece para la voz en-US_MichaelExpressive es ahora correcto
Arreglo de defectos: Cuando lista información sobre las voces disponibles, el gender de la voz de en-US_MichaelExpressive es ahora male. Anteriormente, el género de la voz se describía erróneamente como female. Para obtener más información, consulte Listado de información sobre voces.

23 de septiembre de 2022

Nuevas voces neuronales expresivas en inglés de EE.UU.

El servicio ofrece cuatro nuevas voces neuronales expresivas para el inglés de Estados Unidos:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Las voces neuronales expresivas ofrecen un discurso que suena natural que es excepcionalmente claro, nítido y fluido. Las nuevas voces ya están disponibles de forma generalizada (GA) para su uso en entornos de producción. Admiten el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de IBM símbolos fonéticos de Representación Fonética Simbólica (RPS). Para obtener más información, consulte

Nuevos estilos de habla para voces neuronales expresivas

Las voces neuronales expresivas determinan el sentimiento del texto a partir del contexto de sus palabras y frases. El discurso que producen, además de tener un estilo conversacional, refleja el estado de ánimo del texto. Pero usted puede embellecer las tendencias naturales de las voces indicando que todo o parte del texto es para enfatizar uno de los siguientes estilos de habla:

  • Alegre-Expresa felicidad y buenas noticias.
  • Empático-Expresa empatía o simpatía.
  • Neutral-Expresa objetividad y equidad.
  • Incierto: expresa confusión o incertidumbre.

Para obtener más información, consulte Utilización de estilos de habla.

Nuevo énfasis de interjección con voces neuronales expresivas

Con voces neuronales expresivas, el servicio detecta automáticamente un conjunto de interjecciones comunes basadas en el contexto. Cuando sintetiza estas interjecciones, les da el énfasis natural que un humano usaría en la conversación normal. Para algunas de las interjecciones, puede utilizar SSML para habilitar o inhabilitar su énfasis. Para obtener más información, consulte Énfasis en las interjecciones.

Nuevo énfasis de palabras con voces neurales expresivas

Las voces expresivas utilizan un estilo conversacional que aplica naturalmente la entonación correcta desde el contexto. Pero usted puede indicar que una o más palabras deben ser dadas más o menos énfasis. El cambio en la tensión puede ser indicado por un aumento o disminución en el paso, la temporización, el volumen, u otros atributos acústicos. Para obtener más información, consulte Cómo resaltar palabras.

21 de septiembre de 2022

Nuevo suceso de Activity Tracker para la supresión del GDPR de la información de usuario
El servicio ahora devuelve un suceso Activity Tracker cuando utiliza el método DELETE /v1/user_data para suprimir toda la información sobre un usuario. El suceso se denomina text-to-speech.gdpr-user-data.delete. Para obtener más información, consulte Sucesos de Activity Tracker.
Arreglo de defectos: las traducciones de palabras personalizadas ahora aceptan comas en todos los casos
Arreglo de defectos: las traducciones de palabras añadidas a los modelos personalizados ahora aceptan comas en todos los casos. Anteriormente, una coma en una traducción podía provocar ocasionalmente que la traducción no generara audio válido cuando se utilizaba para síntesis de voz. Este problema se ha identificado en modelos personalizados en inglés de EE.UU.
Arreglo de defectos: la síntesis francesa de fechas es ahora coherente
Arreglo de defectos: La síntesis en francés ya no incluye el artículo "le" antes de las fechas con el formato "el ordinal de mes." Anteriormente, el artículo se incluía sólo para el primer día del mes para los franceses (por ejemplo, "el primero de septiembre", "le premier septembre").
Limitaciones conocidas del uso del formato de audio Ogg con el navegador Safari
Por defecto, el servicio devuelve audio en el formato de audio Ogg con el códec Opus audio/ogg;codecs=opus). Sin embargo, el formato de audio Ogg no es compatible con el navegador Safari. Si utiliza el servicio Text to Speech con el navegador Safari, deberá especificar un formato diferente en el que desea que el servicio devuelva el audio.

31 de agosto de 2022

Nuevo parámetro de consulta beta rate_percentage para controlar la velocidad de habla global
El servicio ofrece un nuevo parámetro de consulta rate_percentage para modificar la velocidad de habla para una solicitud de síntesis de voz. La tasa de habla es la velocidad a la que el servicio habla el texto que sintetiza en voz. Una tasa más alta hace que el texto se hable más rápidamente; una tasa más baja hace que el texto se hable más despacio. El parámetro cambia la velocidad predeterminada por voz para una solicitud completa. Para obtener más información, consulte Modificación de la velocidad de habla.
Nuevo parámetro de consulta beta pitch_percentage para controlar el tono de conversación global
El servicio ofrece un nuevo parámetro de consulta pitch_percentage para modificar el tono de conversación para una solicitud de síntesis. El tono de voz representa el tono del discurso que el servicio sintetiza. Representa lo alto o bajo que el tono de la voz es percibido por el oyente. Un tono más alto resulta en el habla que se habla en un tono más alto y se percibe como una voz más alta; un tono más bajo resulta en el habla que se habla en un tono más bajo y se percibe como una voz más baja. El parámetro cambia el tono predeterminado por voz para una solicitud completa. Para obtener más información, consulte Modificación del tono de voz.
Arreglo de defectos: se ha mejorado la síntesis en japonés para manejar series largas de texto de entrada
Arreglo de defectos: ahora el servicio sintetiza correctamente las solicitudes japonesas que incluyen series largas de caracteres. Antes, el servicio no sintetizaba correctamente cadenas largas de texto en japonés.
Actualizaciones de documentación para el elemento SSML <prosody>
La documentación para el elemento SSML <prosody> y sus parámetros pitch y rate se ha mejorado y aclarado. Ahora también incluye una descripción de las diferencias entre el servicio y la última versión de la especificación SSML. Para obtener más información, consulte Elemento <prosody>.

3 de agosto de 2022

El servicio no da soporte a la síntesis de voz multilingüe
Actualmente, el servicio no admite la síntesis de voz multilingüe. Sin embargo, puede utilizar la personalización para aproximar la pronunciación de las palabras de otros idiomas. Para obtener más información, consulte Síntesis de voz multilingüe.

27 de julio de 2022

Nuevo parámetro beta spell_out_mode para voces en alemán
Para indicar cómo deben escribirse los caracteres individuales de una serie, ahora puede incluir el parámetro de consulta beta spell_out_mode con una solicitud de síntesis para una voz en alemán. De forma predeterminada, el servicio especifica los caracteres individuales a la misma velocidad a la que sintetiza el texto para un idioma. Puede utilizar el parámetro para indicar al servicio que deletree los caracteres individuales más lentamente, en grupos de uno, dos o tres caracteres. Utilice el parámetro con el elemento SSML <say-as> para controlar cómo se sintetizan los caracteres de una serie. Para obtener más información, consulte Especificación de cómo se escriben las series.

25 de mayo de 2022

Nuevo soporte para el formato de audio de audio/alaw
La lista de formatos de audio soportados ahora incluye audio/alaw;rate={rate}. Al igual que audio/basic y audio/mulaw, este formato proporciona audio de un solo canal que se codifica utilizando datos de u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio.

19 de mayo de 2022

Arreglo de defectos: ahora se analizan correctamente varias etiquetas <phoneme> de SSML consecutivas
Arreglo de defecto: El servicio ahora sintetiza correctamente el texto que contiene etiquetas <phoneme> consecutivas. Anteriormente, si el texto contenía dos o más etiquetas <phoneme> consecutivas, el servicio solo sintetizaba la primera etiqueta e ignoraba las demás.

31 de marzo de 2022

Importante: todas las voces neuronales están en desuso

Importante: a partir del 31 de marzo de 2022, todas las voces neuronales están en desuso. Las voces en desuso siguen estando disponibles para los usuarios existentes hasta el 31 de marzo de 2023, cuando se eliminarán del servicio y la documentación. No hay voces neuronales mejoradas ni voces expresivas en desuso.

Las siguientes voces neuronales están ahora en desuso:

  • Árabe: ar-MS_OmarVoice
  • Chino (Mandarín): zh-CN_LiNaVoice, zh-CN_WangWeiVoice y zh-CN_ZhangJingVoice
  • Checo: cs-CZ_AlenaVoice
  • Holandés (Bélgica): nl-BE_AdeleVoice y nl-BE_BramVoice
  • Holandés (Países Bajos): nl-NL_EmmaVoice y nl-NL_LiamVoice
  • Inglés (Australia): en-AU_CraigVoice, en-AU_MadisonVoice y en-AU_SteveVoice
  • Coreano: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice y ko-KR_YunaVoice
  • Sueco: sv-SE_IngridVoice

Las voces neuronales en desuso continúan estando disponibles para los usuarios existentes, pero ya no estarán disponibles para los nuevos usuarios:

  • Usuarios existentes: Las instancias del servicio creadas antes del 31 de marzo de 2022 pueden seguir utilizando las voces en desuso para la síntesis de voz. Las instancias también se pueden utilizar para crear y trabajar con modelos personalizados basados en las voces obsoletas. También pueden seguir enumerando y consultando las voces con los métodos GET /v1/voices y GET /v1/voices/{voice}.
  • Nuevos usuarios: Las instancias del servicio creadas a partir del 31 de marzo de 2022 no podrán utilizar las voces obsoletas para la síntesis de voz. Las instancias tampoco pueden utilizarse para crear modelos personalizados basados en las voces obsoletas. Tampoco pueden enumerar ni consultar las voces con los métodos GET /v1/voices y GET /v1/voices/{voice}. Una llamada de API que incluya una de las voces en desuso devolverá un código de error HTTP 400 o 404, en función de la llamada.

Para el 15 de febrero de 2023 se lanzarán nuevas voces para el inglés, el holandés y el coreano de Australia. Si utiliza voces en inglés, holandés o coreano de Australia, las llamadas de API se redirigirán automáticamente a las nuevas voces en ese idioma. Las voces en árabe, chino, checo, sueco y flamenco serán eliminadas del servicio.

Para obtener más información sobre todos los idiomas y voces disponibles, consulta la sección « Idiomas y voces ».

Las voces estándares en desuso se han eliminado de la documentación

Las voces concatenadoras estándar quedaron obsoletas el 2 de diciembre de 2020. Estas voces estándares ahora se han eliminado de la referencia de API. El tema «Migración de las voces estándar a las voces neuronales » también se ha eliminado de la página « Idiomas y voces ».

Igualmente, el nombre anterior de la voz en árabe, ar-AR_OmarVoice, estaba en desuso al mismo tiempo. También se ha eliminado de la documentación. Utilice la voz ar-MS_OmarVoice en su lugar.

28 de febrero de 2022

Cambio en la respuesta de temporización de palabras para la interfaz de WebSocket

El objeto de respuesta que envía el servicio cuando se solicitan los tiempos de las palabras mediante la interfaz WebSocket ha cambiado. Ahora el servicio envía resultados de temporización de palabras en una única matriz que incluye una serie seguida de dos flotantes:

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Anteriormente, el servicio enviaba los resultados de temporización como una matriz que incluía una serie de caracteres seguidos de una matriz de dos flotantes:

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

Además, el nivel de precisión para las temporizaciones y las marcas de las palabras se reduce ahora a tres posiciones decimales. Para obtener más información sobre las nuevas respuestas, consulte Generación de temporizaciones de palabras.

Nota: Los resultados de las voces neuronales y neuronales mejoradas eran distintos antes. Estas inconsistencias podrían provocar errores en los SDK de Watson. Los resultados para todas las voces son ahora consistentes.

26 de enero de 2022

Arreglo de defectos: Mejorar la documentación de SSML
Corrección de errores: Se ha actualizado la documentación de SSML para corregir los siguientes errores:
  • Los ejemplos del elemento <break> ahora son correctos. El elemento es unario, como se muestra ahora en los ejemplos. Los ejemplos anteriores incluían etiquetas de apertura y de cierre con texto incorporado. El servicio no decía el texto incorporado. Para obtener más información, consulte El elemento <break>.
  • El servicio da soporte a SSML versión 1.1. Todas las referencias y ejemplos utilizan ahora la versión correcta. La documentación antes hacía referencia a la versión 1.0.

3 de diciembre de 2021

Nueva voz neuronal en checo: cs-CZ_AlenaVoice

Un nuevo idioma, checo, con una nueva voz femenina, cs-CZ_AlenaVoice, ya está disponible. La voz es una voz neuronal.

Nueva voz en neerlandés de Bélgica: nl-BE_BramVoice

Ya está disponible una nueva voz en neerlandés de Bélgica (flamenco), nl-BE_BramVoice. La voz es una voz neuronal.

Arreglo de defectos: Mejorar SSML y síntesis de voz

Corrección de errores: En esta versión se han corregido los siguientes errores relacionados con el lenguaje de marcado para la síntesis de voz (SSML) y la síntesis de voz:

  • El atributo pitch del elemento <prosody> se aplica ahora a todo el texto especificado. Anteriormente, el cambio de tono no siempre se aplicaba a la primera palabra del texto afectado. Además, la documentación incluye ahora más indicaciones sobre cómo especificar un valor de « pitch ». Para obtener más información, consulte El atributo pitch.
  • La síntesis de habla del texto japonés ahora dice el audio más lentamente. Anteriormente, el discurso sintetizado era demasiado rápido. Si encuentra que la síntesis del texto japonés todavía es demasiado rápido para su aplicación, utilice el atributo rate del elemento SSML <prosody> para controlar la velocidad del habla. Para obtener más información, consulte El atributo rate.
  • Las voces neuronales ahora analizan correctamente el carácter de apóstrofo (&apos;). Anteriormente, algunas voces neuronales no interpretaban correctamente este carácter.

22 de octubre de 2021

Varias mejoras en voces neuronales
Las voces neuronales existentes para chino, neerlandés (de Bélgica y de Países Bajos), inglés australiano y coreano se han actualizado para mejorar la síntesis del habla y mejorar los resultados de audio. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.
Nueva voz neuronal en inglés australiano: en-AU_SteveVoice
Una nueva voz masculina en australiano, en-AU_SteveVoice, ya está disponible. La voz es una voz neuronal.
Nueva voz neuronal en sueco: sv-SE_IngridVoice
Un nuevo idioma, sueco, con una nueva voz femenina, sv-SE_IngridVoice, ya está disponible. La voz es una voz neuronal.

6 de octubre de 2021

Nuevo soporte de HIPAA de EE.UU. para los planes Premium en la ubicación de Dallas
El soporte para la Ley de portabilidad y responsabilidad de seguros médicos de EE.UU. (HIPAA) ya está disponible para los planes Premium que se alojan en la ubicación de Dallas (us-south). Para obtener más información, consulte la Ley de portabilidad y responsabilidad de seguros médicos (HIPAA).
Corrección de un error: mejora de la voz neuronal optimizada para el español de América Latina
Arreglo de defecto: Para la voz en español de Latinoamérica (es-LA_SofiaV3Voice), las preguntas de todos los tipos ahora utilizan la entonación correcta.

16 de septiembre de 2021

Corrección de un error: mejora de las voces neuronales mejoradas en español de España y español de Estados Unidos
Arreglo de defecto: Para las voces en español de España (es-ES_EnriqueV3Voice y es-ES_LauraV3Voice) y de América del Norte (es-US_SofiaV3Voice), las preguntas de todos los tipos utilizan ahora la entonación correcta. Para la voz en español de Latinoamérica (es-LA_SofiaV3Voice), algunas preguntas no utilizan la entonación correcta y suenan como afirmaciones. La voz en español latinoamericano estará lista en breve.

16 de julio de 2021

Nueva voz en neerlandés de Bélgica: nl-BE_AdeleVoice
El servicio ahora es admite el neerlandés de Bélgica (flamenco) con la voz neuronal nl-BE_AdeleVoice. La voz en neerlandés de Bélgica permite la personalización y está disponible a nivel general (GA) para su uso en producción.

12 de abril de 2021

Nueva voz neuronal mejorada en francés canadiense: fr-CA_LouiseV3Voice

El servicio ahora admite francés canadiense con la voz neuronal mejorada fr-CA_LouiseV3Voice. La voz en francés canadiense admite la personalización y está disponible a nivel general (GA) para utilizarla en producción.

Nueva función Ajustar por ejemplo

La nueva característica Ajustar por ejemplo le permite controlar la forma en que el servicio dice el texto especificado. Esta función se encuentra en fase beta y solo es compatible con modelos y voces personalizados en inglés de EE. UU. Tiene dos componentes:

  • Solicitudes personalizadas incluye el texto escrito que se va a decir y el audio grabado que dice el texto como usted quiere escucharlo. El audio especifica la entonación, la cadencia y la acentuación del texto sintetizado. La solicitud puede enfatizar distintas sílabas o palabras, introducir pausas y, en general, hacer que el sonido de audio sintetizado sea más natural y apropiado a su contexto.
  • Modelos de hablante proporcionan audio de inscripción para un usuario que dice una o más solicitudes. Un modelo de hablante proporciona una muestra de audio de la voz de un usuario. El servicio se entrena en esa voz, lo que puede ayudar a producir solicitudes de mayor calidad para ese hablante.

Puede especificar una solicitud personalizada con una solicitud de síntesis de voz para indicar cómo la voz del servicio puede pronunciar el texto. Para especificar una solicitud, utilice la extensión SSML <ibm:prompt id="{prompt_id}"/>. El audio sintetizado duplica la prosodia de la solicitud.

Nuevos métodos para Ajustar por ejemplo

El servicio incluye ocho nuevos métodos para trabajar con la característica Ajustar por ejemplo. Las descripciones de los nuevos métodos que figuran a continuación incluyen enlaces a sus entradas en la referencia de la API y el SDK. Es posible que tenga que seleccionar la pestaña Curl de la referencia para ver los nuevos métodos.

Actualizaciones de las acciones de Activity Tracker para la personalización

Los nombres de las acciones de los sucesos de Activity Tracker para los métodos de personalización han cambiado. Las acciones ahora incluyen la serie custom-model en lugar de custom-voice. Los nombres antiguos de las acciones están en desuso. Los nombres antiguos siguen estando disponibles para su uso, pero se eliminarán en una fecha futura. Migre a los nuevos nombres que se listan en Sucesos de personalización en cuanto le sea posible.

Crear sucesos Nombre de acción en desuso-> Nombre de acción nuevo

  • text-to-speech.custom-voice.create -> text-to-speech.custom-model.create
  • text-to-speech.custom-voice-word-list.create -> text-to-speech.custom-model-word-list.create
  • text-to-speech.custom-voice-word.create -> text-to-speech.custom-model-word.create

Leer sucesos Nombre de acción en desuso-> Nombre de acción nueva

  • text-to-speech.custom-voice-list.read -> text-to-speech.custom-model-list.read
  • text-to-speech.custom-voice.read -> text-to-speech.custom-model.read
  • text-to-speech.custom-voice-word-list.read -> text-to-speech.custom-model-word-list.read
  • text-to-speech.custom-voice-word.read -> text-to-speech.custom-model-word.read

Actualizar suceso Nombre de acción en desuso-> Nombre de acción nuevo

  • text-to-speech.custom-voice.update -> text-to-speech.custom-model.update

Suprimir sucesos Nombre de acción en desuso-> Nombre de acción nuevo

  • text-to-speech.custom-voice.delete -> text-to-speech.custom-model.delete
  • text-to-speech.custom-voice-word.delete -> text-to-speech.custom-model-word.delete

2 de diciembre de 2020

Varias mejoras en las voces

Las voces que ofrece el servicio han experimentado cambios significativos. El servicio admite nuevos idiomas y voces, ha mejorado la calidad de muchas voces y ha dejado en desuso muchas voces antiguas. Además, todas las voces de los servicios ya se pueden personalizar y están disponibles de forma generalizada (GA) para su uso en producción.

Nuevas voces neuronales y neuronales mejoradas

Para optimizar la calidad general de la síntesis de voz, todas las voces disponibles se basan ahora en la tecnología neuronal. El servicio ofrece dos tipos de voces que se basan en la tecnología neuronal:

  • Voces neuronales, que no incluyen la serie V3 en sus nombres, ya están disponibles para árabe, inglés australiano, chino, neerlandés de Países Bajos y coreano. Las voces neuronales admiten el uso del Alfabeto Fonético Internacional (IPA) con el elemento <phoneme> de SSML (Speech Synthesis Markup Language).
  • Voces neuronales mejoradas, que incluyen la cadena V3 en sus nombres, ya están disponibles para portugués de Brasil, inglés del Reino Unido y los Estados Unidos, francés, alemán, italiano, japonés y español (todos los dialectos). Las voces neuronales mejoradas admiten el uso tanto de IPA como de SPR (Symbolic Phonetic Representation) de IBM con el elemento SSML <phoneme>. Las voces neuronales mejoradas también consiguen que el habla suene mucho más natural. En los próximos meses se ofrecerán más opciones de personalización para mejorar las voces generadas por redes neuronales.

El servicio ya no ofrece voces estándar para ningún idioma. Las voces estándar utilizaban la síntesis por concatenación para ensamblar segmentos de voz grabada y generar el audio solicitado.

Para obtener más información, consulte Idiomas y voces.

Nuevas voces neuronales en inglés australiano y coreano

Las siguientes voces en inglés australiano y coreano son nuevas:

  • El servicio ahora admite el inglés australiano con las siguientes dos voces neuronales: en-AU_CraigVoice y en-AU_MadisonVoice.
  • El servicio ahora da soporte a dos nuevas voces neuronales en coreano: ko-KR_HyunjunVoice y ko-KR_SiWooVoice.
Voces neuronales mejoradas

Las voces de los idiomas ya disponibles —árabe, chino, neerlandés y coreano—, que antes eran de concatenación, ahora son neuronales:

  • ar-MS_OmarVoice
  • ko-KR_YoungmiVoice
  • ko-KR_YunaVoice
  • nl-NL_EmmaVoice
  • nl-NL_LiamVoice
  • zh-CN_LiNaVoice
  • zh-CN_WangWeiVoice
  • zh-CN_ZhangJingVoice

Además, se han introducido los siguientes cambios:

  • La voz árabe se denomina ahora ar-MS_OmarVoice. El nombre anterior, ar-AR_OmarVoice, está en desuso. Continuará funcionando durante al menos un año, pero podría ser eliminado en una fecha futura. Se le anima a migrar al nuevo nombre a la mayor brevedad posible.
  • El idioma árabe ahora admite el uso de símbolos IPA y valores Unicode con el elemento SSML <phoneme>. Para crear un modelo personalizado para árabe, debe utilizar el identificador de idioma ar-MS. El identificador ar-AR no está soportado para la personalización.
  • Los símbolos IPA para el idioma árabe son nuevos. Se han sustituido los símbolos que figuraban anteriormente.
  • Los símbolos del IPA para el idioma neerlandés de Países Bajos se han modificado como se indica a continuación:
    • El holandés holandés ya no da soporte a los siguientes símbolos IPA: (0074+02B2), ɲ (0272), ʦ (02A6) y ʔ (0294).
    • El neerlandés de los Países Bajos ahora admite el siguiente símbolo IPA: ɣ (0263).
Voces estándar en desuso

Las siguientes voces de concatenación estándar han quedado obsoletas:

  • de-DE_BirgitVoice
  • de-DE_DieterVoice
  • en-GB_KateVoice
  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • es-ES_LauraVoice
  • es-LA_SofiaVoice
  • es-US_SofiaVoice
  • fr-FR_ReneeVoice
  • it-IT_FrancescaVoice
  • ja-JP_EmiVoice
  • pt-BR_IsabelaVoice

Todas las voces estándar que han quedado en desuso tienen contrapartes neuronales equivalentes, por lo que no se está eliminando ninguna voz. Más bien, puede cambiar a la versión neuronal equivalente de la voz (por ejemplo, de de-DE_BirgitVoice a de-DE_BirgitV3Voice) para obtener mejores resultados de síntesis de voz.

Estas voces en desuso se han eliminado de la documentación publicada. Continuarán funcionando durante al menos un año, pero podrían ser eliminadas en una fecha futura. Se recomienda migrar a las voces neuronales equivalentes en cuanto le sea posible.

Si omite el parámetro opcional voice de una solicitud de síntesis de voz, el servicio utiliza en-US_MichaelV3Voice de forma predeterminada. Esta voz neuronal sustituye a la ya obsoleta voz estándar de en-US_MichaelVoice que era la predeterminada anterior.

Funciones en desuso

Las siguientes funciones solo estaban disponibles para las voces de concatenación estándar. Están en desuso y se han eliminado de la documentación publicada. Continuarán funcionando durante al menos un año, pero podrían ser eliminadas en una fecha futura. Se recomienda eliminar estas características de sus aplicaciones y migrar a las voces neuronales tan pronto como le sea posible

  • SSML expresivo. Esta fue una ampliación de IBM a SSML que solo se admitía para la voz en-US_AllisonVoice.
  • SSML de transformación de voz. Esta fue una ampliación de IBM a SSML que solo se admitía para para las voces en-US_AllisonVoice, en-US_LisaVoice y en-US_MichaelVoice.
  • El atributo volume del elemento <prosody>. Este atributo estaba disponible para todas las voces estándar.

Al incluir estos elementos SSML con una solicitud de síntesis para una voz neuronal se genera un código de respuesta HTTP 400 porque la solicitud falla la validación SSML. Para obtener más información sobre la validación de SSML, consulte Validación de SSML.

Nuevo soporte para el uso compartido de recursos entre orígenes

El soporte de CORS (Cross-Origin Resource Sharing) ya está disponible para todas las voces desde los navegadores Google Chrome™ y Apple® Safari. No está disponible en el navegador Mozilla Firefox™ para las voces en los siguientes idiomas: árabe, inglés australiano, chino, holandés y coreano. Para más información, consulte la página CORS support.

10 de septiembre de 2020

Corrección de un error: mejora de las voces en japonés

Arreglos de defectos: para la voz ja-JP_EmiV3Voice, el servicio ahora analiza correctamente el texto de entrada SSML que incluye una especificación de velocidad de prosodia. Anteriormente, el siguiente uso del elemento <prosody> funcionaba correctamente:

<speak>成功する/繁栄する</speak>

Pero el siguiente uso del atributo rate con el elemento <prosody> provocaba que el servicio leyera y dijera la notación SSML incorporada:

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Ahora, el servicio analiza correctamente y aplica el atributo rate del elemento <prosody> a la entrada en japonés.

4 de septiembre de 2020

La interfaz de personalización ya está disponible para todos
La interfaz de personalización está ahora disponible a nivel general (GA). La personalización ya no es una función en fase beta. Puede utilizar la interfaz de personalización para especificar cómo debe pronunciar el servicio las palabras inusuales que aparecen en la entrada creando diccionarios personalizados específicos de idioma. Puede utilizarse con todas las voces beta y disponibles a nivel general. Para obtener más información, consulte Comprender la personalización.

24 de junio de 2020

Nuevas voces neuronales en inglés del Reino Unido y en francés

El servicio ofrece ahora dos nuevas voces generadas por redes neuronales:

  • Inglés de Reino Unido: en-GB_CharlotteV3Voice
  • Francés: fr-FR_NicolasV3Voice

También ofrece una versión mejorada de la voz neuronal en inglés del Reino Unido existente, en-GB_KateV3Voice. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.

Soporte para el atributo SSML digits del elemento <say-as> para el japonés

El servicio ahora admite el atributo digits del elemento SSML <say-as> con su voz en japonés. Para obtener más información, consulte Elemento say-as.

1 de abril de 2020

Nuevas voces estándar en coreano: ko-KR_YoungmiVoice y ko-KR_YunaVoice

Ahora el servicio da soporte a dos voces coreanas femeninas estándar: ko-KR_YoungmiVoice y ko-KR_YunaVoice. La siguiente información se aplica a ambas voces coreanas:

  • Las voces son funciones beta. Es posible que las voces no estén preparadas para el uso en producción y que estén sujetas a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
  • Las voces admiten la personalización y el método /v1/pronunciation.
  • Las voces admiten el elemento <mark> y el parámetro timings que están disponibles con la interfaz de WebSocket.
  • Las voces admiten todos los elementos SSML (Speech Synthesis Markup Language), excepto SSML expresivo y SSML de transformación de voz.
  • Las voces solo admiten el Alfabeto Fonético Internacional (IPA), no admiten SPR (Symbolic Phonetic Representation) de IBM, con el elemento <phoneme>.
Nuevo soporte de características para las voces en árabe, chino y neerlandés de Países Bajos

Las voces beta en árabe, chino y neerlandés de Países Bajos ahora admiten las siguientes características:

  • Personalización y el método /v1/pronunciation.
  • El elemento <mark> y el parámetro timings que están disponibles con la interfaz de WebSocket.

Para obtener más información, consulte los apartados siguientes:

  • Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.
  • Para obtener más información sobre cómo utilizar la interfaz WebSocket para obtener tiempos de palabra, consulte Generación de tiempos de palabra.
  • Para obtener más información sobre la personalización, consulte Comprender la personalización.
  • Para obtener más información sobre el uso de IPA y SPR con la personalización, consulte Información sobre los símbolos fonéticos. (Los símbolos IPA para los idiomas árabe, chino, neerlandés de Países Bajos y coreano aún no están documentados. Esta documentación se publicará próximamente).

24 de febrero de 2020

Nuevas voces neuronales en inglés de EE.UU. y alemán

El servicio ahora admite cinco voces neuronales nuevas:

  • US English: en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice y en-US_OliviaV3Voice
  • Alemán: de-DE_ErikaV3Voice

Las nuevas voces no admiten los siguientes elementos SSML:

  • SSML expresivo con el elemento <express-as>
  • Transformación de voz con el elemento <voice-transformation>
  • El atributo volume del elemento <prosody>.

Para obtener más información sobre éstas voces y todas las voces disponibles, consulte Idiomas y voces.

Nuevo soporte para Activity Tracker

El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de personalización. IBM Cloud Activity Tracker registra actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud. Puede utilizar este servicio para investigar una actividad anormal y acciones críticas, así como para cumplir con los requisitos de auditoría de la normativa. Además, puede recibir alertas sobre las acciones a medida que se ocurren. Para obtener más información, consulte Sucesos de Activity Tracker.

18 de diciembre de 2019

Nuevas voces en árabe, chino y neerlandés de Países Bajos

El servicio ahora admite seis nuevas voces estándar en tres nuevos idiomas:

  • Árabe: ar-AR_OmarVoice
  • Chino (mandarín): zh-CN_LiNaVoice, zh-CN_WangWeiVoice y zh-CN_ZhangJingVoice
  • Neerlandés de Países Bajos: nl-NL_EmmaVoice y nl-NL_LiamVoice

La siguiente información se aplica a estas nuevas voces estándar:

  • Las nuevas funciones son funciones beta. Es posible que las voces no estén listas para el uso de producción y que estén sujetas a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
  • Las voces no admiten el elemento <mark> ni el parámetro timings que están disponibles con la interfaz de WebSocket.
  • Las voces no admiten la personalización ni el método /v1/pronunciation.
  • Las voces no dan soporte al SSML expresivo o al SSML de transformación de voz.
  • Las voces admiten todos los demás elementos SSML. No obstante, las voces solo admiten el Alfabeto Fonético Internacional (IPA), no admiten SPR (Symbolic Phonetic Representation) de IBM, con el elemento <phoneme>.

Para obtener más información sobre éstas voces y todas las voces disponibles, consulte Idiomas y voces.

12 de diciembre de 2019

Soporte completo para IBM Cloud IAM

El servicio Text to Speech ahora admite la implementación completa de la gestión de identidad y acceso (IAM - Identity and Access Management) de IBM Cloud. Las claves de API para los servicios de Watson ya no están limitadas a una sola instancia de servicio. Puede crear políticas de acceso y claves de API que se apliquen a más de un servicio, y puede otorgar acceso entre los servicios. Para obtener más información sobre IAM, consulte Autenticación en servicios de Watson.

Para dar soporte a este cambio, los puntos finales de servicio de API utilizan un dominio diferente e incluyen el ID de la instancia de servicio. El patrón es api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.

  • URL de HTTP de ejemplo para una instancia alojada en la ubicación de Dallas:

    https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • URL de WebSocket de ejemplo para una instancia alojada en la ubicación de Dallas:

    wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Para obtener más información sobre las URL, consulta la referencia de la API y el SDK.

Estos URL no constituyen un cambio de última hora. Los nuevos URL funcionan tanto para las instancias de servicio existentes como para las nuevas instancias. Los URL originales siguen trabajando en las instancias de servicio existentes durante al menos un año, hasta diciembre de 2020.

Nuevas características de seguridad de datos y de red

Ahora está disponible el soporte para las siguientes funciones nuevas de seguridad de datos y redes:

  • Soporte de puntos finales de red privada

    Los usuarios de planes Premium pueden crear puntos finales de red privados para conectarse al servicio de Text to Speech a través de una red privada. Las conexiones a puntos finales de red privada no requieren acceso a la Internet pública. Para obtener más información, consulte Puntos finales de red públicos y privados.

12 de noviembre de 2019

Ahora ya está disponible un nueva ubicación de Seúl
El servicio Text to Speech ya está disponible en la ubicación de Seúl IBM Cloud (kr-seo). Al igual que con otras ubicaciones, la ubicación de IBM Cloud utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.

1 de octubre de 2019

Nuevo soporte de HIPAA de EE.UU. para planes Premium en la ubicación Washington, DC
La compatibilidad con la HIPAA de EE. UU. está disponible para los planes Premium alojados en el centro de Washington D. C. y creados a partir del 1 de abril de 2019. Para obtener más información, consulte Ley Health Insurance Portability and Accountability Act (HIPAA).

22 de agosto de 2019

Arreglo de defectos: varias mejoras pequeñas
Corrección de errores: Se ha actualizado el servicio para corregir pequeños errores y realizar mejoras.

30 de julio de 2019

Nueva voz neuronal en japonés: ja-JP_EmiV3Voice
El servicio ofrece ahora una voz neuronal en japonés: ja-JP_EmiV3Voice. Ahora dispone de ambas versiones, la estándar y la neuronal, de todas las voces disponibles en todos los idiomas admitidos. Para obtener más información, consulte Idiomas y voces.

24 de junio de 2019

Nuevo soporte para voces estándar y neuronales

El servicio ofrece ahora dos versiones de la mayoría de las voces disponibles:

  • Voces estándar que utilizan la síntesis por concatenación para ensamblar segmentos de voz grabada con el fin de generar audio. Las voces estándar no incluyen una cadena de la versión en sus nombres (por ejemplo, en-US_AllisonVoice).
  • Voces neuronales que utilizan las Redes NeuronalesProfundas (DNN - Deep Neural Networks) para predecir las características acústicas (espectrales) del discurso. Las voces neuronales incluyen una cadena de la versión (V3) en sus nombres (por ejemplo, en-US_AllisonV3Voice).

Las versiones neuronales están disponibles para todas las voces estándar excepto para la voz ja-JP_EmiVoice, que está pendiente y estará disponible pronto. No se pueden utilizar los elementos SSML <express-as> y <voice-transformation> con las voces neuronales y no se puede utilizar el atributo volume del elemento <prosody> con las voces neuronales. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.

V2 voces neuronales retiradas del servicio

El servicio ya no incluye las voces de DNN de V2 que antes estaban disponibles. Si utiliza una voz de V2 en su aplicación, el servicio automáticamente utiliza la voz equivalente de V3.

24 de marzo de 2019

Nuevas voces neuronales en alemán V2

Ahora el servicio ofrece las versiones de DNN (Deep Neural Network) de V2 de sus voces en alemán:

  • de-DE_BirgitV2Voice
  • de-DE_DieterV2Voice

Para obtener más información sobre las voces basadas en DNN, consulte Idiomas y voces.

Nuevo soporte para los atributos pitch y rate del elemento SSML <prosody>

Todas las voces basadas en DNN del servicio admiten ahora los atributos pitch y rate del elemento SSML <prosody>. Las voces basadas en DNN no admiten el atributo volume del elemento <prosody>. Para obtener más información, consulte Elemento prosody.

21 de marzo de 2019

Ahora la visibilidad de las credenciales de servicio están restringidas por rol

Ahora los usuarios sólo pueden ver la información de credenciales de servicio que está asociada al rol que se ha asignado a su cuenta de IBM Cloud. Por ejemplo, si se le asigna un rol de reader, las credenciales de servicio de writer o de otros niveles superiores ya no son visibles.

Este cambio no afecta al acceso de API para usuarios o aplicaciones con credenciales de servicio existentes. El cambio sólo afecta a la visualización de credenciales dentro de IBM Cloud.

4 de marzo de 2019

Nuevas voces neuronales en inglés e italiano V2

El servicio ahora ofrece cuatro nuevas voces de V2 que utilizan la síntesis de aprendizaje profundo para generar audio:

  • en-US_AllisonV2Voice
  • en-US_LisaV2Voice
  • en-US_MichaelV2Voice
  • it-IT_FrancescaV2Voice

Estas nuevas voces utilizan el aprendizaje automático y un DNN para sintetizar texto a voz. La síntesis de aprendizaje profundo o basada en DNN (Deep Neural Network, red neuronal profunda) genera audio con una prosodia más natural y una calidad general más coherente.

Pero las nuevas voces también producen audio con diferentes calidades de señal a partir de las voces existentes, por lo que podrían no ser apropiadas para todas las aplicaciones. Además, las nuevas voces no admiten los elementos SSML <prosody>, <express-as> y <voice-transformation>.

Para obtener más información sobre estas voces basadas en DNN y cómo difieren de las voces existentes, consulte Idiomas y voces.

28 de enero de 2019

Nuevo soporte para IAM de IBM Cloud por la interfaz de WebSocket

La interfaz WebSocket ahora admite la autenticación de IAM (Identity and Access Management) basada en señales (IAM) a partir de código JavaScript basado en navegador. Se ha eliminado la limitación de lo contrario. Para establecer una conexión autenticada con el método WebSocket /v1/synthesize:

  • Si utiliza la autenticación de IAM, incluya el parámetro de consulta access_token.
  • Si utiliza las credenciales de servicio de Cloud Foundry, incluya el parámetro de consulta watson-token.

Para obtener más información, consulte Abrir una conexión.

13 de diciembre de 2018

Ahora está disponible una nueva ubicación de Londres
El servicio Text to Speech está ahora disponible en la ubicación de Londres (eu-gb) de IBM Cloud®. Al igual que todas las ubicaciones, Londres utiliza la autenticación de Identity and Access Management (IAM) basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.

7 de noviembre de 2018

Ya disponible una nueva ubicación de Tokio
El servicio Text to Speech está ahora disponible en la ubicación de Tokio (jp-tok) de IBM Cloud®. Al igual que todas las ubicaciones, Tokio utiliza la autenticación de Identity and Access Management (IAM) basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.

30 de octubre de 2018

Nuevo soporte para IAM de IBM Cloud basado en señales

El servicio Text to Speech se ha migrado a la autenticación de IAM (Identity and Access Management) basada en señales para todas las ubicaciones. Todos los servicios de IBM Cloud ahora utilizan la autenticación de IAM. El servicio Text to Speech se ha migrado en cada ubicación en las fechas siguientes:

  • Dallas (us-south): 30 de octubre de 2018
  • Frankfurt (eu-de): 30 de octubre de 2018
  • Washington, DC (us-east): 12 de junio de 2018
  • Sídney (au-syd): 15 de mayo de 2018

La migración a la autenticación de IAM afecta de forma distinta a las instancias de servicio nuevas y existentes:

  • Todas las instancias de servicio nuevas que se crean en cualquier ubicación ahora utilizan la autenticación de IAM para acceder al servicio. Puede pasar una señal portadora o una clave de API: las señales admiten solicitudes autenticadas sin incluir credenciales de servicio en cada llamada; las claves de API utilizan la autenticación básica HTTP. Cuando se utiliza cualquier SDK de Watson, se puede pasar la clave de API y dejar que SDK gestione el ciclo de vida de las señales.
  • Las instancias de servicio existentes que ha creado en una ubicación antes de la fecha de migración indicada siguen utilizando el {username} y la {password} de sus credenciales de servicio de Cloud Foundry para la autenticación hasta que las migre para que utilicen la autenticación de IAM.

Para obtener más información, consulte la siguiente documentación:

12 de junio de 2018

Nuevas funciones para aplicaciones alojadas en la ubicación Washington, DC

Hay las siguientes características habilitadas para las aplicaciones alojadas en Washington, DC (us-east):

15 de mayo de 2018

Nuevas funciones para aplicaciones alojadas en la ubicación de Sídney

Hay las siguientes características habilitadas para las aplicaciones alojadas en Sídney (au-syd):

2 de octubre de 2017

Cambios en el formato de audio de audio/l16
Para el formato audio/l16, ahora tiene la opción de especificar la endianness del audio que se devuelve. (Debe especificar a la frecuencia de muestreo). Algunos ejemplos son audio/l16;rate=22050;endianness=big-endian y audio/l16;rate=22050;endianness=little-endian; el valor predeterminado es «significant endian». Para obtener más información, consulte Utilización de formatos de audio.

14 de julio de 2017

Nuevo soporte para el formato de audio de MP3 (MPEG)
El servicio ahora admite el formato de audio MP3 o MPEG (Motion Picture Experts Group). Para obtener más información sobre los formatos de audio admitidos, consulte Utilización de formatos de audio.

10 de abril de 2017

Nuevo soporte para el formato de audio de Web Media (WebM)
El servicio ahora admite el formato de audio WebM (Web Media) con el códec Opus o Vorbis. El servicio ahora también admite el formato de audio Ogg con el códec Vorbis además del códec Opus. Para obtener más información sobre los formatos de audio admitidos, consulte Utilización de formatos de audio.
Nuevo soporte para el uso compartido de recursos entre orígenes
El servicio ahora da soporte a CORS (Cross-Origin Resource Sharing) para permitir que los clientes basados en navegador llamen al servicio directamente. Para más información, consulte la página CORS support.
Cambios en los códigos de respuesta HTTP correctos
Los códigos de respuesta HTTP para la finalización satisfactoria de algunos métodos de la interfaz de personalización han cambiado:
  • El método POST /v1/customizations ahora devuelve 201 (en lugar de 200).
  • El método POST /v1/customizations/{customization_id} ahora devuelve 200 (en lugar de 201).
  • El método POST /v1/customizations/{customization_id}/words ahora devuelve 200 (en lugar de 201).
  • El método PUT /v1/customizations/{customization_id}/words/{word} ahora devuelve 200 (en lugar de 201).
Nuevos errores para el uso incorrecto del parámetro part_of_speech en japonés
Los métodos POST /v1/customizations/{custom_id}/words y PUT /v1/customizations/{customization_id}/words/{word} ahora devuelven el código de respuesta HTTP 400 con el mensaje de error Part of speech is supported for ja-JP language only si se intenta especificar part_of_speech para un idioma distinto del japonés.
Cambios en el cuerpo de respuesta para el método añadir palabras
El método POST /v1/customizations/{custom_id}/words ahora devuelve un cuerpo de respuesta vacío ({}).

1 de diciembre de 2016

Nueva voz en español de Latinoamérica: es-LA_SofiaVoice

El servicio incluye una nueva voz, es-LA_SofiaVoice, que es el equivalente latinoamericano de la voz de es-US_SofiaVoice. La diferencia más significativa entre las dos voces se refiere a cómo interpretan un $ (signo del dólar): La versión latinoamericana utiliza el término pesos; la versión norteamericana utiliza el término dólares. También puede haber otras diferencias menores entre las dos voces.

Nuevas voces en inglés de EE.UU.: en-US_LisaVoice y en-US_MichaelVoice

Además de la voz en-US_AllisonVoice, ahora hay dos voces más transformables con el SSML de transformación de voz: en-US_LisaVoice y en-US_MichaelVoice.

Cambios en la personalización para japonés

Cuando se utiliza la interfaz de personalización con japonés, el servicio ahora coincide con la palabra más larga de los pares palabra/traducción definidos para un modelo personalizado. Por ejemplo, tenga en cuenta las dos entradas siguientes para un modelo personalizado:

{
  "words": [
    {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"},
    {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"}
  ]
}

Si el servicio encuentra la cadena « NYC » en el texto de entrada, la considera una coincidencia porque es una coincidencia más larga que « NY ». Anteriormente, el servicio habría encontrado coincidencias con la cadena « NY ». Para obtener más información sobre cómo trabajar con entradas en japonés en un modelo personalizado, consulta «Trabajar con entradas en japonés ».

22 de septiembre de 2016

La personalización ya está disponible para todos los idiomas
La interfaz de personalización, que incluye los métodos de personalización y GET /v1/pronunciation, está ahora disponible para todos los idiomas que admite el servicio. La interfaz sigue siendo un release beta. Para obtener más información, consulte Comprender la personalización.
Nuevo soporte en japonés para SSML
El servicio ahora admite el SSML para el japonés. Para obtener información general sobre el soporte de SSML, consulte Información sobre SSML. Para obtener información sobre los símbolos SPR e IPA japoneses, consulte Símbolos para el japonés. Se aplican consideraciones adicionales y un campo part_of_speech al crear entradas para palabras en un modelo personalizado en japonés. Para obtener más información, consulte Trabajar con entradas en japonés.
Nueva función SSML de transformación de voz
El servicio ahora ofrece la transformación de voz SSML a través del nuevo elemento <voice-transformation>. Puede expandir el rango de voces posibles creando transformaciones personalizadas que modifiquen el tono, el rango de tonos, la tensión glotal, la aspiración, la velocidad y el timbre de una voz. El servicio también ofrece dos voces virtuales integradas, Young y Soft. El servicio actualmente da soporte a la transformación de voz sólo para la voz de Allison en inglés de Estados Unidos.
Las temporizaciones de palabras están ahora disponibles con la interfaz de WebSocket
Ahora el servicio puede devolver información de temporización de palabras para todas las series del texto de entrada que pase a la interfaz WebSocket. Para recibir la hora de inicio y finalización de cada serie de caracteres de la entrada, especifique una matriz que incluya la serie words para el parámetro opcional timings del objeto JSON que pase al servicio. Esta característica no está disponible actualmente para texto de entrada en japonés. Para obtener más información, consulte Generación de temporizaciones de palabras.
Nuevo soporte para la validación de SSML
El servicio ahora valida todos los elementos SSML que se envían en cualquier contexto. Si encuentra una etiqueta no válida, el servicio notifica un código de respuesta HTTP 400 con un mensaje descriptivo, y el método falla. En versiones anteriores, el servicio gestionaba los errores de forma inconsistente; por ejemplo, indicar una pronunciación incorrecta de una palabra podía provocar un comportamiento impredecible o inconsistente. Para obtener más información, consulte Validación de SSML.
Ahora se especifica el formato IBM SPR con ibm en lugar de spr
El uso de spr está en desuso como argumento para la opción format del método GET /v1/pronunciation y para su uso con el atributo alphabet de un elemento SSML <phoneme>. Para utilizar la notación de la SPR de IBM, utilice el argumento ibm en lugar de spr en todos los casos.
Nuevo soporte para el formato de audio de audio/mulaw
La lista de formatos de audio soportados ahora incluye audio/mulaw;rate={rate}. Al igual que audio/basic, este formato proporciona audio de un solo canal que se codifica utilizando datos u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio.
Nuevas características soportadas identificadas al listar voces
Los métodos GET /v1/voices y GET /v1/voices/{voice} ahora devuelven un objeto supported_features como parte de su salida para cada voz. El objeto describe si la voz admite la personalización y el elemento SSML <voice_transformation>. Para obtener más información, consulte Idiomas y voces.

23 de junio de 2016

Nueva interfaz de WebSocket para la síntesis de voz

El servicio ahora ofrece una interfaz WebSocket para sintetizar texto a voz. La interfaz ofrece las mismas características que el método /v1/synthesize de la interfaz HTTP. Acepta texto sin formato o texto con marcaje SSML. Además, también da admite el uso del elemento SSML <mark> para identificar el tiempo en el audio en que termina de sintetizar todo el texto que precede a la marca. Para obtener más información, consulte La interfaz WebSocket.

Soporte de lenguaje ampliado para SSML

El servicio ahora ofrece soporte para texto anotado con SSML para los idiomas español de España y de América del Norte, italiano y portugués de Brasil. El servicio ya admitía el uso de SSML para inglés del Reino Unido y de EE.UU., francés y alemán. A partir de esta actualización, el servicio admite SSML para todos los idiomas excepto el japonés. Además, puede utilizar las notaciones IPA y SPR de IBM para definir pronunciaciones de palabras con el elemento SSML <phoneme>. Para obtener más información, consulte Información sobre SSML y Información sobre los símbolos fonéticos.

Para el inglés de EE.UU. también puede utilizar el elemento SSML <phoneme> para crear entradas de palabras en un modelo personalizado; la personalización sólo está soportada para el inglés de EE.UU. Para obtener más información, consulte Comprender la personalización.

Voces actualizadas para una mejor síntesis del habla

El servicio ha mejorado la expresividad y la naturalidad de las voces más utilizadas. Estas mejoras se basan en la predicción de prosodia basada en RNN (Recursive Neural Network) a partir del texto de entrada. Están disponibles como un nuevo motor de servicio y actualizaciones de modelos de voz para los idiomas siguientes:

  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • fr-FR_ReneeVoice
Nuevo parámetro de ID de personalización para la pronunciación de palabras

El método GET /v1/pronunciation ahora acepta un parámetro de consulta opcional customization_id. El parámetro obtiene una traducción de una palabra de un modelo personalizado especificado. Si el modelo personalizado no contiene la palabra, el método devuelve la pronunciación predeterminada de la palabra. Para más información, consulte la referencia API y SDK.

Al utilizar el método GET /v1/pronunciation sin un ID de personalización y para un idioma distinto del inglés de EE.UU., puede solicitar la pronunciación de una palabra sólo en la notación IBM SPR. Para un idioma distinto del inglés de EE.UU., debe especificar spr con la opción format del método.

Nuevo soporte para el formato de audio de audio/basic

La lista de formatos de audio admitidos incluye ahora audio/basic, que proporciona un audio de un solo canal que se codifica utilizando datos u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio.

Las interfaces HTTP y WebSocket ahora pueden devolver avisos

Los métodos HTTP y WebSocket /v1/synthesize pueden devolver una respuesta de warnings que incluye mensajes sobre parámetros de consulta no válidos o campos JSON que se incluyen en una solicitud. El formato de los avisos ha cambiado. En el ejemplo siguiente se muestra el formato anterior:

"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."

Ahora, el mismo aviso tiene el formato siguiente:

"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."

10 de marzo de 2016

Los métodos de síntesis ahora pueden devolver avisos
Los métodos GET y POST /v1/synthesize ahora pueden devolver una cabecera de respuesta Warnings que incluye una lista de mensajes de aviso acerca de parámetros de consulta no válidos o campos JSON que se incluyen en la solicitud. Cada elemento de la lista incluye una serie que describe la naturaleza del aviso seguido de una matriz de series de argumentos no válidas; por ejemplo, Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']. Para obtener más información, consulte laReferencia de API & SDK.
El SDK iOS de Apple iOS beta está en desuso
La versión beta de Watson Speech Software Development Kit (SDK) para el sistema operativo Apple® iOS está en desuso y se ha sustituido por Watson Swift SDK. El nuevo SDK está disponible en el repositorio swift-sdk, dentro del espacio de nombres watson-developer-cloud, en GitHub.

22 de febrero de 2016

Nueva característica SSML expresivo
El servicio se ha actualizado con una nueva característica de expresión de SSML. El servicio amplía SSML con un elemento <express-as> que puede utilizar para indicar la expresividad en uno de los tres estilos de habla: GoodNews, Apology o Uncertainty. Puede aplicar el elemento a todo el cuerpo del texto, a una frase o a una palabra. Actualmente, el servicio da soporte a la expresividad sólo para la voz de Allison en inglés de EE.UU. (en-US_AllisonVoice).

17 de diciembre de 2015

Nueva interfaz de personalización beta

El servicio ofrece una nueva interfaz de personalización que se puede utilizar para especificar cómo se pronuncian las palabras inusuales que aparecen en la entrada. La interfaz incluye algunos métodos nuevos que puedes utilizar para crear y gestionar modelos personalizados y los pares de palabras y traducciones que contienen. Puede utilizar los modelos personalizados al sintetizar texto a audio.

El servicio admite conversiones de tipo 'suena como' y transcripciones fonéticas. Las transcripciones fonéticas pueden utilizar la representación estándar IPA (International Phonetic Alphabet) o la representación SPR (Symbolic Phonetic Representation), propiedad de IBM. Se utiliza el SSML para especificar conversiones fonéticas.

La interfaz de personalización incluye una colección de nuevos métodos HTTP denominados POST /v1/customizations, POST /v1/customizations/{customization_id}, POST /v1/customizations/{customization_id}/words y PUT /v1/customizations/{customization_id}/words/{word}. El servicio también proporciona el nuevo método GET /v1/pronunciation que devuelve la pronunciación de cualquier palabra y el nuevo método GET /v1/voices/{voice} que devuelve información detallada acerca de una voz específica. Además, los métodos existentes de la interfaz del servicio ahora aceptan parámetros de modelo personalizados según sea necesario.

Para obtener más información sobre la personalización y su interfaz, consulte Comprender la personalización y la referencia API y SDK.

La interfaz de personalización es un release beta que actualmente sólo da soporte al inglés de Estados Unidos. Todos los métodos de personalización y el método GET /v1/pronunciation se pueden utilizar actualmente para crear y manipular modelos personalizados y traducciones de palabras sólo en inglés de EE.UU.

Nueva voz en portugués: pt-BR_IsabelaVoice

El servicio admite una nueva voz, pt-BR_IsabelaVoice, para sintetizar audio en portugués de Brasil con una voz femenina. Para obtener más información, consulte Idiomas y voces.

21 de septiembre de 2015

Nuevos SDK móviles disponibles

Hay dos nuevos SDK (Software Development Kits) beta para móviles disponibles para los servicios de voz. Estos SDK permiten a las aplicaciones móviles interaccionar con los servicios Text to Speech y Speech to Text. Puede utilizar los SDK para enviar texto al servicio Text to Speech y recibir una respuesta de audio.

  • El documento « Watson Swift SDK » está disponible en el repositorio « Repositorio de Swift SDK », dentro del espacio de nombres « watson-developer-cloud », en GitHub.
  • El kit de desarrollo de aplicaciones de voz de Android ( Watson ) Android™ SDK está disponible en el repositorio «speech-android-sdk» del espacio de nombres watson-developer-cloud en GitHub.

Los dos SDK admiten la autenticación con servicios de voz utilizando las credenciales de servicio de IBM Cloud o bien una señal de autenticación. Dado que los SDK son funciones en fase beta, están sujetos a cambios en el futuro.

Nueva voz en japonés: ja-JP_EmiVoice

El servicio admite un nuevo idioma, el japonés. La voz ja-JP_EmiVoice es una voz japonesa femenina.

1 de julio de 2015

El servicio Speech to Text ahora está disponible a nivel general

El servicio pasó de beta a disponibilidad general (GA - General Availability) el 1 de julio de 2015. Las siguientes diferencias existen entre las versiones beta y GA de la API de Text to Speech. El release GA requiere que los usuarios actualicen a la nueva versión del servicio.

Nuevo modelo de programación basado en señales

Un nuevo modelo de programación da soporte a la interacción directa entre un cliente y el servicio. Utilizando este modelo, un cliente puede obtener una señal de autenticación para comunicarse directamente con el servicio. Utilizando la señal, el cliente puede eludir la necesidad de una aplicación proxy del lado del servidor en IBM Cloud para llamar al servicio en su nombre. Las señales son el medio preferido para que los clientes interactúen con el servicio.

El servicio continúa admitiendo el modelo de programación antiguo que utilizaba un proxy del lado del servidor para retransmitir comunicaciones y datos entre el cliente y el servicio. Pero el nuevo modelo es más eficiente y proporciona un mayor rendimiento.

Nuevo soporte para Speech Synthesis Markup Language

Ahora, se puede pasar SSML (Speech Synthesis Markup Language) a las versiones HTTP GET y POST del método /v1/synthesize. SSML es un lenguaje de códigos basado en XML, diseñado para proporcionar anotaciones de texto para aplicaciones de síntesis de voz, como por ejemplo el servicio Text to Speech. Para obtener más información sobre cómo pasar la entrada SSML al servicio, consulte Especificar el texto de entrada.

Inicialmente, el servicio admite el uso de SSML sólo para los idiomas inglés del Reino Unido y de EE.UU., francés y alemán. El servicio no admite SSML para italiano o español. Al utilizar SSML, asegúrese de que no seleccionar una voz para el audio en uno de los idiomas no soportados. Los resultados en tal caso no serían significativos.

Cambios en las voces disponibles

Las voces compatibles con el habla sintetizada que se modifica y amplía. El servicio ahora admite otras voces, idiomas y dialectos mediante los métodos /v1/synthesize. Para obtener más información sobre las voces soportadas, consulte Idiomas y voces.

Las tres voces que había disponibles en beta se han renombrado para GA:

  • VoiceEnUsMichaeles ahoraen-US_MichaelVoice
  • VoiceEnUsLisaes ahoraen-US_LisaVoice
  • VoiceEsEsEnriquees ahoraes-ES_EnriqueVoice

Los nombres anteriores de las voces seguirán funcionando con la versión beta del servicio (a través de los puntos finales de la API -beta) mientras esa versión siga disponible. Sin embargo, debe utilizar los nuevos nombres con la versión GA del servicio.

Nuevo soporte para el formato de audio FLAC (Free Lossless Audio Codec)

Ahora puede solicitar al servicio que devuelva el audio en formato FLAC (Free Lossless Audio). El servicio todavía puede devolver el audio en formato Ogg con el códec Opus (el predeterminado) y en formato WAV (Waveform Audio File Format). Para obtener más información sobre la utilización de formatos de audio con los métodos /v1/synthesize, consulte Utilización de formatos de audio.

Nuevos límites en la cantidad máxima de texto sintetizado

El texto que se envía al método /v1/synthesize en el URL de una solicitud HTTP GET o en el cuerpo de una solicitud HTTP POST está ahora limitado a un máximo de 5 KB. En la versión beta, el texto tenía un tamaño máximo de 4 MB.

Nueva cabecera para renunciar a las mejoras de servicio

Los métodos /v1/synthesize ahora incluyen la cabecera X-WDC-PL-OPT-OUT para controlar si el servicio utiliza los resultados de texto y audio de una operación para mejorar los resultados futuros. Especifique el valor 1 para impedir que el servicio utilice los resultados de texto y de audio. El parámetro se aplica sólo a la solicitud actual. La nueva cabecera sustituye a la cabecera X-logging de los métodos beta. Para obtener más información, consulte Control del registro de solicitudes para servicios Watson.

Cambios en los códigos de error HTTP para la síntesis de voz

Para los métodos /v1/synthesize, se han modificado los siguientes códigos de error:

  • Se ha eliminado el código de error 406 ("No aceptable. El tipo MIME no admitido.") se ha eliminado.
  • Se ha añadido el código de error 415 ("Tipo de soporte no soportado").
  • Se ha añadido el código de error 503 ("Servicio no disponible").
Cambios en los códigos de error HTTP para listar las voces

Para el método GET /v1/voices, se han modificado los códigos de error siguientes:

  • Se ha eliminado el código de error 406 ("No aceptable. El tipo MIME no admitido.") se ha eliminado.
  • Se ha añadido el código de error 415 ("Tipo de soporte no soportado").