Notas del release para Text to Speech for IBM Cloud
IBM Cloud
Se han incluido las siguientes características y cambios en cada versión y actualización de las instancias gestionadas de IBM Watson® Text to Speech alojadas en IBM Cloud, así como en las instancias alojadas en IBM Cloud Pak for Data as a Service. A menos que se indique lo contrario, todos los cambios son compatibles con releases anteriores y están disponibles de forma automática y transparente para todas las aplicaciones nuevas y existentes.
Para obtener información sobre las limitaciones conocidas del servicio, consulte Limitaciones conocidas.
Para obtener información sobre releases y actualizaciones del servicio para IBM Cloud Pak for Data, consulte las Notas del release de Text to Speech for IBM Cloud Pak for Data.
15 de mayo de 2026
- Nueva voz femenina natural en portugués de Brasil
-
El servicio ya ofrece una nueva voz femenina natural para el portugués de Brasil:
pt-BR_IsabelaNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte
26 de marzo de 2026
- Transición de voz obsoleta de v1 a v3
-
Las voces de concatenación estándar ( v1 ), anteriormente obsoletas, se sustituyen ahora por sus equivalentes neurales ( v3 ) durante la síntesis. Cuando una solicitud especifica una de estas voces v1, se utiliza en su lugar la voz v3 correspondiente.
de-DE_BirgitVoice->de-DE_BirgitV3Voicede-DE_DieterVoice->de-DE_DieterV3Voiceen-GB_KateVoice->en-GB_KateV3Voiceen-US_AllisonVoice->en-US_AllisonV3Voiceen-US_LisaVoice->en-US_LisaV3Voiceen-US_MichaelVoice->en-US_MichaelV3Voicees-ES_EnriqueVoice->es-ES_EnriqueV3Voicees-ES_LauraVoice->es-ES_LauraV3Voicees-LA_SofiaVoice->es-LA_SofiaV3Voicees-US_SofiaVoice->es-US_SofiaV3Voicefr-FR_ReneeVoice->fr-FR_ReneeV3Voiceit-IT_FrancescaVoice->it-IT_FrancescaV3Voiceja-JP_EmiVoice->ja-JP_EmiV3Voicept-BR_IsabelaVoice->pt-BR_IsabelaV3Voice
Si se omite el parámetro opcional «
voice» en una solicitud de síntesis de voz, el servicio utiliza ahora «en-US_MichaelV3Voice» de forma predeterminada. Esta voz neural ( v3 ) sustituye a la anterior voz concatenada estándar por defecto ( v1 ),en-US_MichaelVoice.
11 de marzo de 2026
- Importante: Supresión de la función Beta Tune by Example
-
La función beta Tune by Example ha quedado obsoleta. Las API para crear nuevos avisos o modelos de altavoces ya no son compatibles.
- Usuarios existentes: Las personalizaciones existentes que ya contengan avisos o modelos de locutor seguirán funcionando para la síntesis de voz durante un periodo de tiempo limitado. Sin embargo, no se pueden crear nuevos avisos o modelos de altavoz.
- Nuevos usuarios: Las API para crear avisos o modelos de altavoces están desactivadas y no se pueden utilizar.
La función Tune by Example se eliminará por completo del servicio en una próxima versión. Una vez eliminada, la síntesis que utilice personalizaciones que dependan de avisos o modelos de altavoces dejará de ser compatible.
13 de enero de 2026
- Nuevas voces naturales inglesas
-
El servicio ahora admite dos nuevas voces naturales, una masculina y otra femenina, para el inglés australiano:
en-AU_JackNaturalen-AU_HeidiNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte
5 de diciembre de 2025
- Nuevo español latinoamericano Voces naturales
-
El servicio ahora admite dos nuevas voces naturales, una masculina y otra femenina, para el español latinoamericano:
es-LA_AlejandroNaturales-LA_DanielaNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte
31 de octubre de 2025
- Nuevas voces naturales en portugués de Brasil
-
El servicio admite ahora dos nuevas voces naturales, una masculina y otra femenina, para el portugués de Brasil:
pt-BR_LucasNaturalpt-BR_CamilaNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte
24 de julio de 2025
- Nuevas voces naturales inglesas
-
El servicio admite ahora cuatro nuevas voces naturales, dos masculinas y dos femeninas, para el inglés de Estados Unidos:
en-US_EmmaNaturalen-US_EthanNaturalen-US_JacksonNaturalen-US_VictoriaNatural
El servicio admite ahora dos nuevas voces naturales, masculina y femenina, para el inglés del Reino Unido:
en-GB_ChloeNaturalen-GB_GeorgeNatural
El servicio admite ahora una nueva voz natural femenina para el inglés de CA:
en-CA_HannahNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para obtener más información, consulte
09 de julio de 2025
- Supresión de las voces V1
- A partir del 7 de septiembre de 2025, todas las voces de V1 serán eliminadas del servicio. Todas las voces obsoletas de v1 cambiarán automáticamente a sus correspondientes voces de v3 en los próximos 12 meses.
19 de mayo de 2025
- Nueva generación de voces - Voces naturales
-
El servicio es ahora compatible con una nueva generación de voces denominada Natural Voices, con una nueva voz para el inglés estadounidense:
en-US_EllieNatural
Las voces naturales ofrecen un rendimiento avanzado en términos de naturalidad y expresividad. Estas voces utilizan diversas técnicas para proporcionar una ventaja sobre las voces expresivas. Para más información, véase Voces naturales.
- El servicio admite ahora el atributo opcional adicional
formatpara la etiqueta<say-as interpret-as="letters" format="xx">SSML -
Ahora puede especificar el valor
grouposinglecon el atributo opcionalformat. Estos atributos ayudan a mejorar la legibilidad de las cadenas alfanuméricas, como la confirmación de números e ID, añadiendo silencios estratégicos.
17 de febrero de 2025
- Nuevo portugués brasileño masculino voz neural expresiva
-
El servicio ahora admite una nueva voz neural expresiva masculina para el portugués brasileño:
pt-BR_LucasExpressive
Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte
09 de diciembre de 2024
- Nueva voz neural expresiva masculina en inglés del Reino Unido
-
El servicio admite ahora una nueva voz neural expresiva masculina para el inglés del Reino Unido:
en-GB_GeorgeExpressive
Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte
15 de mayo de 2024
- Nueva voz neural expresiva femenina española latinoamericana
-
El servicio ahora soporta una nueva voz neuronal expresiva femenina para el español latinoamericano
es-LA_DanielaExpressive
Las voces neuronales expresivas ofrecen un discurso que suena natural que es claro, nítido y fluido. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consulte
16 de enero de 2024
- Mejoras de Text to Speech para voces expresas en inglés de EE.UU.
- Cuando se utilizan voces expresas en inglés de Estados Unidos, la síntesis es más rápida con una latencia menor.
- Corrección de defectos: Problema de inflexión al utilizar el signo de interrogación (?) en un enunciado corto
- Arreglo de defecto: Cuando algunas expresiones cortas han finalizado con un signo de interrogación (?), se ignora la inflexión. Este problema ya se ha solucionado.
30 de noviembre de 2023
- Se ha mejorado el motor de síntesis de Text to Speech para voces de la versión 3
- El motor de Text to Speech se ha mejorado para ofrecer una síntesis más rápida con una latencia inferior para las voces de la versión 3.
- Text to Speech voz mejorado en-AU_HeidiExpressive
- Se ha mejorado la voz Text to Speech en-AU_HeidiExpressive, que puede ajustar el tono y la síntesis.
9 de junio de 2023
- Corrección de defectos: TTS ya no falla debido al mensaje de error "[Errno 2] No such file or directory"
- Corrección de defectos: Al utilizar TTS con websockets, ya no falla debido al mensaje de error "[Errno 2] No such file or directory"
18 de mayo de 2023
- Arreglo de defectos: se ha añadido soporte para las características SSML que faltan en la voz holandesa
- Arreglo de defectos: cuando se utiliza la voz holandesa, todas las características SSML soportadas ahora funcionan tal como se han diseñado. Anteriormente, cuando se utilizaba la voz holandesa, algunas características de SSML no funcionaban.
- Arreglo de defectos: Ahora se respetan las comas cuando se utilizan etiquetas de fonemas
- Arreglo de defectos: cuando se utilizan etiquetas de fonemas en SSML, las comas (pausas) ahora funcionan como se esperaba. Anteriormente, cuando las comas precedían o seguían texto con etiquetas de fonemas, la pausa se ignoraba.
6 de abril de 2023
- Actualizaciones de la voz neuronal mejorada holandesa beta
- Arreglo de defectos: el neerlandés beta
nl-NL_MerelV3Voicese ha actualizado para arreglos internos y mejoras. Las limitaciones que se describen para la versión inicial de la voz en la actualización del servicio del 31 de marzo de 2023 siguen siendo aplicables.
31 de marzo de 2023
- Importante: Fin del servicio para todas las voces neuronales
-
Importante: Todas las voces neuronales han alcanzado su fecha de fin de servicio y se han eliminado del servicio y de la documentación. No se ven afectadas las voces neurales realzadas ni las voces neurales expresivas. Para obtener una lista completa de todas las voces neuronales obsoletas, consulte las actualizaciones de servicio del 1 de marzo de 2023. Un intento de utilizar una voz obsoleta devuelve el código de respuesta HTTP 404 con el mensaje '
Model '{voice}' not found.Las nuevas voces neuronales mejoradas y expresivas están disponibles para los idiomas inglés australiano, coreano y holandés. Debe migrar a una de las nuevas voces para el inglés australiano, el coreano o el neerlandés de los Países Bajos para continuar utilizando los idiomas obsoletos.
Para obtener más información, consulte Idiomas y voces.
22 de marzo de 2023
- Nueva beta Países Bajos Países Bajos voz neuronal mejorada
-
El servicio ahora da soporte a una nueva voz femenina neuronal mejorada para Holanda:
nl-NL_MerelV3Voice. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ".La nueva voz es una función beta a la espera de que se complete la compatibilidad con SSML. En su versión inicial, la voz no admite el uso de las siguientes funciones relacionadas con SSML:
- El elemento
<prosody>con cualquier solicitud de síntesis de voz - Los parámetros
rate_percentageypitch_percentagecon cualquier solicitud de síntesis de voz - El elemento
<mark>con una solicitud de síntesis de voz WebSocket - El parámetro
timingsdel mensaje de texto JSON con una solicitud de síntesis de voz WebSocket
Para obtener más información sobre la nueva voz, su soporte para los símbolos IPA y SPR, y migrar a la nueva voz desde las voces neuronales holandesas en desuso, consulte
- El elemento
- Arreglo de defectos: actualizar símbolos fonéticos coreanos en la documentación
-
Corrección de defectos: En la documentación de los símbolos SPR coreanos, los símbolos de dos caracteres para las consonantes aparecen ahora entre comillas simples, lo que los convierte en un único símbolo. Antes se mostraban como dos símbolos separados, sin comillas. Para obtener más información, consulte Consonantes(coreano).
- Actualizaciones de documentación para símbolos SPR de IBM
-
La documentación de visión general para los símbolos SPR de IBM se ha actualizado para aclarar el uso de los símbolos de varios caracteres. Para obtener más información, consulte Símbolos de sonido de voz).
1 de marzo de 2023
- Importante: Pendiente de fin de servicio para todas las voces neuronales
-
Importante: Efectivo 31 de marzo de 2023, todas las voces neuronales alcanzan su fecha de fin de servicio y se eliminarán del servicio y de la documentación. Las voces neuronales están en desuso desde el 31 de marzo de 2022. No se efectúan voces neuronales o neuronales expresivas mejoradas.
Se eliminan las siguientes voces neuronales:
- Árabe:
ar-MS_OmarVoice - Chino (Mandarín):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceyzh-CN_ZhangJingVoice - Checo:
cs-CZ_AlenaVoice - Holandés (Bélgica):
nl-BE_AdeleVoiceynl-BE_BramVoice - Holandés (Países Bajos):
nl-NL_EmmaVoiceynl-NL_LiamVoice - Inglés (Australia):
en-AU_CraigVoice,en-AU_MadisonVoiceyen-AU_SteveVoice - Coreano:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceyko-KR_YunaVoice - Sueco:
sv-SE_IngridVoice
Las nuevas voces neuronales mejoradas y expresivas ya están disponibles para los idiomas inglés y coreano de Australia. En las próximas semanas estará disponible una nueva voz neural mejorada para el neerlandés de los Países Bajos. Debe migrar a una de las nuevas voces para el inglés australiano, el coreano o el holandés antes del 31 de marzo de 2023.
Para obtener más información, consulte Idiomas y voces.
- Árabe:
27 de febrero de 2023
- Nuevas voces neuronales expresivas en inglés de Australia
-
El servicio ahora soporta dos nuevas voces neuronales expresivas, masculinas y femeninas, para el inglés australiano:
en-AU_HeidiExpressiveen-AU_JackExpressive
Las voces neuronales expresivas ofrecen un discurso que suena natural que es excepcionalmente claro, nítido y fluido. Las nuevas voces ya están disponibles de forma generalizada (GA) para su uso en entornos de producción. Admiten el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de IBM símbolos fonéticos de Representación Fonética Simbólica (RPS). Para obtener más información, consulte
Puede migrar de las voces neuronales en inglés australiano que están en desuso a las nuevas voces neuronales expresivas.
- Nueva voz neuronal mejorada en coreano
-
El servicio ahora da soporte a una nueva voz femenina neuronal mejorada para el coreano:
ko-KR_JinV3Voice. La nueva voz está disponible a nivel general (GA) para uso de producción. Admite el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de los símbolos fonéticos de la Representación Fonética Simbólica (RPS) " IBM ". Para obtener más información, consultePuede migrar de las voces neuronales coreanas que están en desuso a la nueva voz neuronal mejorada.
- Arreglo de defecto: la voz canadiense francesa ahora maneja correctamente los tiempos numéricos
-
Corrección de defectos: Las voces francesa y canadiense pronuncian ahora correctamente los tiempos como
19:41. Anteriormente, las voces estaban omitiendo elementos de la época en el audio sintetizado. - Arreglo de defecto: la voz japonesa ya no inserta audio inesperado
-
Arreglo de defectos: la voz japonesa ya no inserta audio inesperado en los resultados de síntesis de voz. Anteriormente, se insertaba otro audio en determinados casos.
20 de enero de 2023
- Cloud Foundry en desuso y migración a grupos de recursos
-
IBM ha anunciado la desaparición de IBM Cloud Foundry el 31 de mayo de 2022. A partir del 30 de noviembre de 2022, las nuevas IBM Cloud Foundry no se podrán crear y solo los usuarios existentes podrán desplegar aplicaciones. IBM Cloud Foundry ry alcanza el fin de soporte el 1 de junio de 2023. Entonces, cualquier IBM Cloud Foundry que ejecute aplicaciones IBM Cloud Foundry se deshabilitará, desaprovisionará y eliminará permanentemente.
Para seguir utilizando sus aplicaciones IBM Cloud más allá del 1 de junio de 2023, debe migrar a grupos de recursos antes de esa fecha. Los grupos de recursos son conceptualmente similares a los espacios de Cloud Foundry. Entre ellas se incluyen varias ventajas adicionales, como un control de acceso más preciso mediante el uso de la gestión de identidades y acceso ( IBM Cloud Identity and Access Management, IAM), la posibilidad de conectar instancias de servicio a aplicaciones y servicios en diferentes regiones, y una forma sencilla de consultar el uso por grupo.
- Arreglo de defecto: la especificación de números cardinales grandes con el elemento
<say-as>ya no provoca errores para las voces en inglés -
Arreglo de defectos: Ahora puede utilizar el elemento
<say-as>para pronunciar números grandes como números cardinales. Antes, encerrar un número grande en el elemento<say-as>con el atributointerpret-as="cardinal"podía hacer que fallara la síntesis de voz para las voces inglesas. Por ejemplo,<say-as interpret-as="cardinal">3,200</say-as>puede hacer que el servicio genere un error. Para obtener más información, consulte cardinal en el tema Elementos SSML. - Arreglo de defectos: Los homónimos y otras palabras son ahora pronunciadas correctamente por las voces en inglés
-
Arreglo de defectos: el servicio ahora pronuncia los homónimos y otras palabras correctamente basándose en su contexto en texto en inglés que se va a sintetizar. Antes, palabras como
advocateywifipodían ser pronunciadas incorrectamente por las voces inglesas.
30 de noviembre de 2022
- Arreglo de defectos: Añadir reglas para la documentación de denominación de modelos personalizados
- Arreglo de defectos: La documentación ahora proporciona reglas detalladas para denominar modelos personalizados. Para obtener más información, consulte
7 de octubre de 2022
- El servicio ahora aplica una validación SSML más estricta
- El servicio ahora aplica una validación más estricta del texto de entrada que incluye elementos SSML (Speech Síntesis Markup Language). Los elementos necesarios de los atributos deben especificarse con valores válidos. De lo contrario, la solicitud falla con un código de error 400. Para obtener más información sobre la validación de SSML y los requisitos que debe cumplir el texto marcado, consulte Validación de SSML.
- Corrección de defectos: El género que aparece para la voz
en-US_MichaelExpressivees ahora correcto - Arreglo de defectos: Cuando lista información sobre las voces disponibles, el
genderde la voz deen-US_MichaelExpressivees ahoramale. Anteriormente, el género de la voz se describía erróneamente comofemale. Para obtener más información, consulte Listado de información sobre voces.
23 de septiembre de 2022
- Nuevas voces neuronales expresivas en inglés de EE.UU.
-
El servicio ofrece cuatro nuevas voces neuronales expresivas para el inglés de Estados Unidos:
en-US_AllisonExpressiveen-US_EmmaExpressiveen-US_LisaExpressiveen-US_MichaelExpressive
Las voces neuronales expresivas ofrecen un discurso que suena natural que es excepcionalmente claro, nítido y fluido. Las nuevas voces ya están disponibles de forma generalizada (GA) para su uso en entornos de producción. Admiten el uso tanto del Alfabeto Fonético Internacional (AFI) estándar como de IBM símbolos fonéticos de Representación Fonética Simbólica (RPS). Para obtener más información, consulte
- Nuevos estilos de habla para voces neuronales expresivas
-
Las voces neuronales expresivas determinan el sentimiento del texto a partir del contexto de sus palabras y frases. El discurso que producen, además de tener un estilo conversacional, refleja el estado de ánimo del texto. Pero usted puede embellecer las tendencias naturales de las voces indicando que todo o parte del texto es para enfatizar uno de los siguientes estilos de habla:
- Alegre-Expresa felicidad y buenas noticias.
- Empático-Expresa empatía o simpatía.
- Neutral-Expresa objetividad y equidad.
- Incierto: expresa confusión o incertidumbre.
Para obtener más información, consulte Utilización de estilos de habla.
- Nuevo énfasis de interjección con voces neuronales expresivas
-
Con voces neuronales expresivas, el servicio detecta automáticamente un conjunto de interjecciones comunes basadas en el contexto. Cuando sintetiza estas interjecciones, les da el énfasis natural que un humano usaría en la conversación normal. Para algunas de las interjecciones, puede utilizar SSML para habilitar o inhabilitar su énfasis. Para obtener más información, consulte Énfasis en las interjecciones.
- Nuevo énfasis de palabras con voces neurales expresivas
-
Las voces expresivas utilizan un estilo conversacional que aplica naturalmente la entonación correcta desde el contexto. Pero usted puede indicar que una o más palabras deben ser dadas más o menos énfasis. El cambio en la tensión puede ser indicado por un aumento o disminución en el paso, la temporización, el volumen, u otros atributos acústicos. Para obtener más información, consulte Cómo resaltar palabras.
21 de septiembre de 2022
- Nuevo suceso de Activity Tracker para la supresión del GDPR de la información de usuario
- El servicio ahora devuelve un suceso Activity Tracker cuando utiliza el método
DELETE /v1/user_datapara suprimir toda la información sobre un usuario. El suceso se denominatext-to-speech.gdpr-user-data.delete. Para obtener más información, consulte Sucesos de Activity Tracker. - Arreglo de defectos: las traducciones de palabras personalizadas ahora aceptan comas en todos los casos
- Arreglo de defectos: las traducciones de palabras añadidas a los modelos personalizados ahora aceptan comas en todos los casos. Anteriormente, una coma en una traducción podía provocar ocasionalmente que la traducción no generara audio válido cuando se utilizaba para síntesis de voz. Este problema se ha identificado en modelos personalizados en inglés de EE.UU.
- Arreglo de defectos: la síntesis francesa de fechas es ahora coherente
- Arreglo de defectos: La síntesis en francés ya no incluye el artículo "le" antes de las fechas con el formato "el ordinal de mes." Anteriormente, el artículo se incluía sólo para el primer día del mes para los franceses (por ejemplo, "el primero de septiembre", "le premier septembre").
- Limitaciones conocidas del uso del formato de audio Ogg con el navegador Safari
- Por defecto, el servicio devuelve audio en el formato de audio Ogg con el códec Opus
audio/ogg;codecs=opus). Sin embargo, el formato de audio Ogg no es compatible con el navegador Safari. Si utiliza el servicio Text to Speech con el navegador Safari, deberá especificar un formato diferente en el que desea que el servicio devuelva el audio.- Para obtener más información sobre los formatos disponibles, consulte Formatos de audio soportados.
- Para obtener más información sobre cómo especificar un formato, consulte Especificación de un formato de audio.
31 de agosto de 2022
- Nuevo parámetro de consulta beta
rate_percentagepara controlar la velocidad de habla global - El servicio ofrece un nuevo parámetro de consulta
rate_percentagepara modificar la velocidad de habla para una solicitud de síntesis de voz. La tasa de habla es la velocidad a la que el servicio habla el texto que sintetiza en voz. Una tasa más alta hace que el texto se hable más rápidamente; una tasa más baja hace que el texto se hable más despacio. El parámetro cambia la velocidad predeterminada por voz para una solicitud completa. Para obtener más información, consulte Modificación de la velocidad de habla. - Nuevo parámetro de consulta beta
pitch_percentagepara controlar el tono de conversación global - El servicio ofrece un nuevo parámetro de consulta
pitch_percentagepara modificar el tono de conversación para una solicitud de síntesis. El tono de voz representa el tono del discurso que el servicio sintetiza. Representa lo alto o bajo que el tono de la voz es percibido por el oyente. Un tono más alto resulta en el habla que se habla en un tono más alto y se percibe como una voz más alta; un tono más bajo resulta en el habla que se habla en un tono más bajo y se percibe como una voz más baja. El parámetro cambia el tono predeterminado por voz para una solicitud completa. Para obtener más información, consulte Modificación del tono de voz. - Arreglo de defectos: se ha mejorado la síntesis en japonés para manejar series largas de texto de entrada
- Arreglo de defectos: ahora el servicio sintetiza correctamente las solicitudes japonesas que incluyen series largas de caracteres. Antes, el servicio no sintetizaba correctamente cadenas largas de texto en japonés.
- Actualizaciones de documentación para el elemento SSML
<prosody> - La documentación para el elemento SSML
<prosody>y sus parámetrospitchyratese ha mejorado y aclarado. Ahora también incluye una descripción de las diferencias entre el servicio y la última versión de la especificación SSML. Para obtener más información, consulte Elemento<prosody>.
3 de agosto de 2022
- El servicio no da soporte a la síntesis de voz multilingüe
- Actualmente, el servicio no admite la síntesis de voz multilingüe. Sin embargo, puede utilizar la personalización para aproximar la pronunciación de las palabras de otros idiomas. Para obtener más información, consulte Síntesis de voz multilingüe.
27 de julio de 2022
- Nuevo parámetro beta
spell_out_modepara voces en alemán - Para indicar cómo deben escribirse los caracteres individuales de una serie, ahora puede incluir el parámetro de consulta beta
spell_out_modecon una solicitud de síntesis para una voz en alemán. De forma predeterminada, el servicio especifica los caracteres individuales a la misma velocidad a la que sintetiza el texto para un idioma. Puede utilizar el parámetro para indicar al servicio que deletree los caracteres individuales más lentamente, en grupos de uno, dos o tres caracteres. Utilice el parámetro con el elemento SSML<say-as>para controlar cómo se sintetizan los caracteres de una serie. Para obtener más información, consulte Especificación de cómo se escriben las series.
25 de mayo de 2022
- Nuevo soporte para el formato de audio de
audio/alaw - La lista de formatos de audio soportados ahora incluye
audio/alaw;rate={rate}. Al igual queaudio/basicyaudio/mulaw, este formato proporciona audio de un solo canal que se codifica utilizando datos de u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio.
19 de mayo de 2022
- Arreglo de defectos: ahora se analizan correctamente varias etiquetas
<phoneme>de SSML consecutivas - Arreglo de defecto: El servicio ahora sintetiza correctamente el texto que contiene etiquetas
<phoneme>consecutivas. Anteriormente, si el texto contenía dos o más etiquetas<phoneme>consecutivas, el servicio solo sintetizaba la primera etiqueta e ignoraba las demás.
31 de marzo de 2022
- Importante: todas las voces neuronales están en desuso
-
Importante: a partir del 31 de marzo de 2022, todas las voces neuronales están en desuso. Las voces en desuso siguen estando disponibles para los usuarios existentes hasta el 31 de marzo de 2023, cuando se eliminarán del servicio y la documentación. No hay voces neuronales mejoradas ni voces expresivas en desuso.
Las siguientes voces neuronales están ahora en desuso:
- Árabe:
ar-MS_OmarVoice - Chino (Mandarín):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceyzh-CN_ZhangJingVoice - Checo:
cs-CZ_AlenaVoice - Holandés (Bélgica):
nl-BE_AdeleVoiceynl-BE_BramVoice - Holandés (Países Bajos):
nl-NL_EmmaVoiceynl-NL_LiamVoice - Inglés (Australia):
en-AU_CraigVoice,en-AU_MadisonVoiceyen-AU_SteveVoice - Coreano:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceyko-KR_YunaVoice - Sueco:
sv-SE_IngridVoice
Las voces neuronales en desuso continúan estando disponibles para los usuarios existentes, pero ya no estarán disponibles para los nuevos usuarios:
- Usuarios existentes: Las instancias del servicio creadas antes del 31 de marzo de 2022 pueden seguir utilizando las voces en desuso para la síntesis de voz. Las instancias también se pueden utilizar para crear y trabajar
con modelos personalizados basados en las voces obsoletas. También pueden seguir enumerando y consultando las voces con los métodos
GET /v1/voicesyGET /v1/voices/{voice}. - Nuevos usuarios: Las instancias del servicio creadas a partir del 31 de marzo de 2022 no podrán utilizar las voces obsoletas para la síntesis de voz. Las instancias tampoco pueden utilizarse para crear modelos personalizados
basados en las voces obsoletas. Tampoco pueden enumerar ni consultar las voces con los métodos
GET /v1/voicesyGET /v1/voices/{voice}. Una llamada de API que incluya una de las voces en desuso devolverá un código de error HTTP 400 o 404, en función de la llamada.
Para el 15 de febrero de 2023 se lanzarán nuevas voces para el inglés, el holandés y el coreano de Australia. Si utiliza voces en inglés, holandés o coreano de Australia, las llamadas de API se redirigirán automáticamente a las nuevas voces en ese idioma. Las voces en árabe, chino, checo, sueco y flamenco serán eliminadas del servicio.
Para obtener más información sobre todos los idiomas y voces disponibles, consulta la sección « Idiomas y voces ».
- Árabe:
- Las voces estándares en desuso se han eliminado de la documentación
-
Las voces concatenadoras estándar quedaron obsoletas el 2 de diciembre de 2020. Estas voces estándares ahora se han eliminado de la referencia de API. El tema «Migración de las voces estándar a las voces neuronales » también se ha eliminado de la página « Idiomas y voces ».
Igualmente, el nombre anterior de la voz en árabe,
ar-AR_OmarVoice, estaba en desuso al mismo tiempo. También se ha eliminado de la documentación. Utilice la vozar-MS_OmarVoiceen su lugar.
28 de febrero de 2022
- Cambio en la respuesta de temporización de palabras para la interfaz de WebSocket
-
El objeto de respuesta que envía el servicio cuando se solicitan los tiempos de las palabras mediante la interfaz WebSocket ha cambiado. Ahora el servicio envía resultados de temporización de palabras en una única matriz que incluye una serie seguida de dos flotantes:
{ "words": [ ["Hello", 0.0, 0.259], ["world", 0.259, 0.532] ] }Anteriormente, el servicio enviaba los resultados de temporización como una matriz que incluía una serie de caracteres seguidos de una matriz de dos flotantes:
{ "words": [ ["Hello", [0.0629826778195474, 0.2590192737303819]], ["world", [0.2598829173456253, 0.5322130804452672]] ] }Además, el nivel de precisión para las temporizaciones y las marcas de las palabras se reduce ahora a tres posiciones decimales. Para obtener más información sobre las nuevas respuestas, consulte Generación de temporizaciones de palabras.
Nota: Los resultados de las voces neuronales y neuronales mejoradas eran distintos antes. Estas inconsistencias podrían provocar errores en los SDK de Watson. Los resultados para todas las voces son ahora consistentes.
26 de enero de 2022
- Arreglo de defectos: Mejorar la documentación de SSML
- Corrección de errores: Se ha actualizado la documentación de SSML para corregir los siguientes errores:
- Los ejemplos del elemento
<break>ahora son correctos. El elemento es unario, como se muestra ahora en los ejemplos. Los ejemplos anteriores incluían etiquetas de apertura y de cierre con texto incorporado. El servicio no decía el texto incorporado. Para obtener más información, consulte El elemento<break>. - El servicio da soporte a SSML versión 1.1. Todas las referencias y ejemplos utilizan ahora la versión correcta. La documentación antes hacía referencia a la versión 1.0.
- Los ejemplos del elemento
3 de diciembre de 2021
- Nueva voz neuronal en checo:
cs-CZ_AlenaVoice -
Un nuevo idioma, checo, con una nueva voz femenina,
cs-CZ_AlenaVoice, ya está disponible. La voz es una voz neuronal. - Nueva voz en neerlandés de Bélgica:
nl-BE_BramVoice -
Ya está disponible una nueva voz en neerlandés de Bélgica (flamenco),
nl-BE_BramVoice. La voz es una voz neuronal. - Arreglo de defectos: Mejorar SSML y síntesis de voz
-
Corrección de errores: En esta versión se han corregido los siguientes errores relacionados con el lenguaje de marcado para la síntesis de voz (SSML) y la síntesis de voz:
- El atributo
pitchdel elemento<prosody>se aplica ahora a todo el texto especificado. Anteriormente, el cambio de tono no siempre se aplicaba a la primera palabra del texto afectado. Además, la documentación incluye ahora más indicaciones sobre cómo especificar un valor de «pitch». Para obtener más información, consulte El atributopitch. - La síntesis de habla del texto japonés ahora dice el audio más lentamente. Anteriormente, el discurso sintetizado era demasiado rápido. Si encuentra que la síntesis del texto japonés todavía es demasiado rápido para su aplicación, utilice
el atributo
ratedel elemento SSML<prosody>para controlar la velocidad del habla. Para obtener más información, consulte El atributorate. - Las voces neuronales ahora analizan correctamente el carácter de apóstrofo (
'). Anteriormente, algunas voces neuronales no interpretaban correctamente este carácter.
- El atributo
22 de octubre de 2021
- Varias mejoras en voces neuronales
- Las voces neuronales existentes para chino, neerlandés (de Bélgica y de Países Bajos), inglés australiano y coreano se han actualizado para mejorar la síntesis del habla y mejorar los resultados de audio. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.
- Nueva voz neuronal en inglés australiano:
en-AU_SteveVoice - Una nueva voz masculina en australiano,
en-AU_SteveVoice, ya está disponible. La voz es una voz neuronal. - Nueva voz neuronal en sueco:
sv-SE_IngridVoice - Un nuevo idioma, sueco, con una nueva voz femenina,
sv-SE_IngridVoice, ya está disponible. La voz es una voz neuronal.
6 de octubre de 2021
- Nuevo soporte de HIPAA de EE.UU. para los planes Premium en la ubicación de Dallas
- El soporte para la Ley de portabilidad y responsabilidad de seguros médicos de EE.UU. (HIPAA) ya está disponible para los planes Premium que se alojan en la ubicación de Dallas (
us-south). Para obtener más información, consulte la Ley de portabilidad y responsabilidad de seguros médicos (HIPAA). - Corrección de un error: mejora de la voz neuronal optimizada para el español de América Latina
- Arreglo de defecto: Para la voz en español de Latinoamérica (
es-LA_SofiaV3Voice), las preguntas de todos los tipos ahora utilizan la entonación correcta.
16 de septiembre de 2021
- Corrección de un error: mejora de las voces neuronales mejoradas en español de España y español de Estados Unidos
- Arreglo de defecto: Para las voces en español de España (
es-ES_EnriqueV3Voiceyes-ES_LauraV3Voice) y de América del Norte (es-US_SofiaV3Voice), las preguntas de todos los tipos utilizan ahora la entonación correcta. Para la voz en español de Latinoamérica (es-LA_SofiaV3Voice), algunas preguntas no utilizan la entonación correcta y suenan como afirmaciones. La voz en español latinoamericano estará lista en breve.
16 de julio de 2021
- Nueva voz en neerlandés de Bélgica:
nl-BE_AdeleVoice - El servicio ahora es admite el neerlandés de Bélgica (flamenco) con la voz neuronal
nl-BE_AdeleVoice. La voz en neerlandés de Bélgica permite la personalización y está disponible a nivel general (GA) para su uso en producción.
12 de abril de 2021
- Nueva voz neuronal mejorada en francés canadiense:
fr-CA_LouiseV3Voice -
El servicio ahora admite francés canadiense con la voz neuronal mejorada
fr-CA_LouiseV3Voice. La voz en francés canadiense admite la personalización y está disponible a nivel general (GA) para utilizarla en producción.- Para escuchar una muestra de la nueva voz, consulte Idiomas y voces soportados.
- Para obtener más información sobre los símbolos fonéticos y los valores Unicode que están disponibles para el idioma francés canadiense, consulte Símbolos en francés (canadiense).
- Nueva función Ajustar por ejemplo
-
La nueva característica Ajustar por ejemplo le permite controlar la forma en que el servicio dice el texto especificado. Esta función se encuentra en fase beta y solo es compatible con modelos y voces personalizados en inglés de EE. UU. Tiene dos componentes:
- Solicitudes personalizadas incluye el texto escrito que se va a decir y el audio grabado que dice el texto como usted quiere escucharlo. El audio especifica la entonación, la cadencia y la acentuación del texto sintetizado. La solicitud puede enfatizar distintas sílabas o palabras, introducir pausas y, en general, hacer que el sonido de audio sintetizado sea más natural y apropiado a su contexto.
- Modelos de hablante proporcionan audio de inscripción para un usuario que dice una o más solicitudes. Un modelo de hablante proporciona una muestra de audio de la voz de un usuario. El servicio se entrena en esa voz, lo que puede ayudar a producir solicitudes de mayor calidad para ese hablante.
Puede especificar una solicitud personalizada con una solicitud de síntesis de voz para indicar cómo la voz del servicio puede pronunciar el texto. Para especificar una solicitud, utilice la extensión SSML
<ibm:prompt id="{prompt_id}"/>. El audio sintetizado duplica la prosodia de la solicitud. - Nuevos métodos para Ajustar por ejemplo
-
El servicio incluye ocho nuevos métodos para trabajar con la característica Ajustar por ejemplo. Las descripciones de los nuevos métodos que figuran a continuación incluyen enlaces a sus entradas en la referencia de la API y el SDK. Es posible que tenga que seleccionar la pestaña
Curlde la referencia para ver los nuevos métodos.-
El servicio incluye cuatro métodos para trabajar con solicitudes personalizadas:
- Listar solicitudes personalizadas:
GET /v1/customizations/{customization_id}/prompts - Obtener una solicitud personalizada:
GET /v1/customizations/{customization_id}/prompts/{prompt_id} - Suprimir una solicitud personalizada:
DELETE /v1/customizations/{customization_id}/prompts/{prompt_id}
- Listar solicitudes personalizadas:
-
El servicio incluye cuatro métodos para trabajar con modelos de hablante:
- Listar modelos de altavoz:
GET /v1/speakers - Obtener un modelo de orador:
GET /v1/speakers/{speaker_id} - Suprimir un modelo de altavoz:
DELETE /v1/speakers/{speaker_id}
- Listar modelos de altavoz:
-
- Actualizaciones de las acciones de Activity Tracker para la personalización
-
Los nombres de las acciones de los sucesos de Activity Tracker para los métodos de personalización han cambiado. Las acciones ahora incluyen la serie
custom-modelen lugar decustom-voice. Los nombres antiguos de las acciones están en desuso. Los nombres antiguos siguen estando disponibles para su uso, pero se eliminarán en una fecha futura. Migre a los nuevos nombres que se listan en Sucesos de personalización en cuanto le sea posible.Crear sucesos Nombre de acción en desuso-> Nombre de acción nuevo
text-to-speech.custom-voice.create->text-to-speech.custom-model.createtext-to-speech.custom-voice-word-list.create->text-to-speech.custom-model-word-list.createtext-to-speech.custom-voice-word.create->text-to-speech.custom-model-word.create
Leer sucesos Nombre de acción en desuso-> Nombre de acción nueva
text-to-speech.custom-voice-list.read->text-to-speech.custom-model-list.readtext-to-speech.custom-voice.read->text-to-speech.custom-model.readtext-to-speech.custom-voice-word-list.read->text-to-speech.custom-model-word-list.readtext-to-speech.custom-voice-word.read->text-to-speech.custom-model-word.read
Actualizar suceso Nombre de acción en desuso-> Nombre de acción nuevo
text-to-speech.custom-voice.update->text-to-speech.custom-model.update
Suprimir sucesos Nombre de acción en desuso-> Nombre de acción nuevo
text-to-speech.custom-voice.delete->text-to-speech.custom-model.deletetext-to-speech.custom-voice-word.delete->text-to-speech.custom-model-word.delete
2 de diciembre de 2020
- Varias mejoras en las voces
-
Las voces que ofrece el servicio han experimentado cambios significativos. El servicio admite nuevos idiomas y voces, ha mejorado la calidad de muchas voces y ha dejado en desuso muchas voces antiguas. Además, todas las voces de los servicios ya se pueden personalizar y están disponibles de forma generalizada (GA) para su uso en producción.
- Nuevas voces neuronales y neuronales mejoradas
-
Para optimizar la calidad general de la síntesis de voz, todas las voces disponibles se basan ahora en la tecnología neuronal. El servicio ofrece dos tipos de voces que se basan en la tecnología neuronal:
- Voces neuronales, que no incluyen la serie
V3en sus nombres, ya están disponibles para árabe, inglés australiano, chino, neerlandés de Países Bajos y coreano. Las voces neuronales admiten el uso del Alfabeto Fonético Internacional (IPA) con el elemento<phoneme>de SSML (Speech Synthesis Markup Language). - Voces neuronales mejoradas, que incluyen la cadena
V3en sus nombres, ya están disponibles para portugués de Brasil, inglés del Reino Unido y los Estados Unidos, francés, alemán, italiano, japonés y español (todos los dialectos). Las voces neuronales mejoradas admiten el uso tanto de IPA como de SPR (Symbolic Phonetic Representation) de IBM con el elemento SSML<phoneme>. Las voces neuronales mejoradas también consiguen que el habla suene mucho más natural. En los próximos meses se ofrecerán más opciones de personalización para mejorar las voces generadas por redes neuronales.
El servicio ya no ofrece voces estándar para ningún idioma. Las voces estándar utilizaban la síntesis por concatenación para ensamblar segmentos de voz grabada y generar el audio solicitado.
Para obtener más información, consulte Idiomas y voces.
- Voces neuronales, que no incluyen la serie
- Nuevas voces neuronales en inglés australiano y coreano
-
Las siguientes voces en inglés australiano y coreano son nuevas:
- El servicio ahora admite el inglés australiano con las siguientes dos voces neuronales:
en-AU_CraigVoiceyen-AU_MadisonVoice. - El servicio ahora da soporte a dos nuevas voces neuronales en coreano:
ko-KR_HyunjunVoiceyko-KR_SiWooVoice.
- El servicio ahora admite el inglés australiano con las siguientes dos voces neuronales:
- Voces neuronales mejoradas
-
Las voces de los idiomas ya disponibles —árabe, chino, neerlandés y coreano—, que antes eran de concatenación, ahora son neuronales:
ar-MS_OmarVoiceko-KR_YoungmiVoiceko-KR_YunaVoicenl-NL_EmmaVoicenl-NL_LiamVoicezh-CN_LiNaVoicezh-CN_WangWeiVoicezh-CN_ZhangJingVoice
Además, se han introducido los siguientes cambios:
- La voz árabe se denomina ahora
ar-MS_OmarVoice. El nombre anterior,ar-AR_OmarVoice, está en desuso. Continuará funcionando durante al menos un año, pero podría ser eliminado en una fecha futura. Se le anima a migrar al nuevo nombre a la mayor brevedad posible. - El idioma árabe ahora admite el uso de símbolos IPA y valores Unicode con el elemento SSML
<phoneme>. Para crear un modelo personalizado para árabe, debe utilizar el identificador de idiomaar-MS. El identificadorar-ARno está soportado para la personalización. - Los símbolos IPA para el idioma árabe son nuevos. Se han sustituido los símbolos que figuraban anteriormente.
- Los símbolos del IPA para el idioma neerlandés de Países Bajos se han modificado como se indica a continuación:
- El holandés holandés ya no da soporte a los siguientes símbolos IPA:
tʲ(0074+02B2),ɲ(0272),ʦ(02A6) yʔ(0294). - El neerlandés de los Países Bajos ahora admite el siguiente símbolo IPA:
ɣ(0263).
- El holandés holandés ya no da soporte a los siguientes símbolos IPA:
- Voces estándar en desuso
-
Las siguientes voces de concatenación estándar han quedado obsoletas:
de-DE_BirgitVoicede-DE_DieterVoiceen-GB_KateVoiceen-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicees-ES_LauraVoicees-LA_SofiaVoicees-US_SofiaVoicefr-FR_ReneeVoiceit-IT_FrancescaVoiceja-JP_EmiVoicept-BR_IsabelaVoice
Todas las voces estándar que han quedado en desuso tienen contrapartes neuronales equivalentes, por lo que no se está eliminando ninguna voz. Más bien, puede cambiar a la versión neuronal equivalente de la voz (por ejemplo, de
de-DE_BirgitVoiceade-DE_BirgitV3Voice) para obtener mejores resultados de síntesis de voz.Estas voces en desuso se han eliminado de la documentación publicada. Continuarán funcionando durante al menos un año, pero podrían ser eliminadas en una fecha futura. Se recomienda migrar a las voces neuronales equivalentes en cuanto le sea posible.
Si omite el parámetro opcional
voicede una solicitud de síntesis de voz, el servicio utilizaen-US_MichaelV3Voicede forma predeterminada. Esta voz neuronal sustituye a la ya obsoleta voz estándar deen-US_MichaelVoiceque era la predeterminada anterior. - Funciones en desuso
-
Las siguientes funciones solo estaban disponibles para las voces de concatenación estándar. Están en desuso y se han eliminado de la documentación publicada. Continuarán funcionando durante al menos un año, pero podrían ser eliminadas en una fecha futura. Se recomienda eliminar estas características de sus aplicaciones y migrar a las voces neuronales tan pronto como le sea posible
- SSML expresivo. Esta fue una ampliación de IBM a SSML que solo se admitía para la voz
en-US_AllisonVoice. - SSML de transformación de voz. Esta fue una ampliación de IBM a SSML que solo se admitía para para las voces
en-US_AllisonVoice,en-US_LisaVoiceyen-US_MichaelVoice. - El atributo
volumedel elemento<prosody>. Este atributo estaba disponible para todas las voces estándar.
Al incluir estos elementos SSML con una solicitud de síntesis para una voz neuronal se genera un código de respuesta HTTP 400 porque la solicitud falla la validación SSML. Para obtener más información sobre la validación de SSML, consulte Validación de SSML.
- SSML expresivo. Esta fue una ampliación de IBM a SSML que solo se admitía para la voz
- Nuevo soporte para el uso compartido de recursos entre orígenes
-
El soporte de CORS (Cross-Origin Resource Sharing) ya está disponible para todas las voces desde los navegadores Google Chrome™ y Apple® Safari. No está disponible en el navegador Mozilla Firefox™ para las voces en los siguientes idiomas: árabe, inglés australiano, chino, holandés y coreano. Para más información, consulte la página CORS support.
10 de septiembre de 2020
- Corrección de un error: mejora de las voces en japonés
-
Arreglos de defectos: para la voz
ja-JP_EmiV3Voice, el servicio ahora analiza correctamente el texto de entrada SSML que incluye una especificación de velocidad de prosodia. Anteriormente, el siguiente uso del elemento<prosody>funcionaba correctamente:<speak>成功する/繁栄する</speak>Pero el siguiente uso del atributo
ratecon el elemento<prosody>provocaba que el servicio leyera y dijera la notación SSML incorporada:<speak> <prosody rate="fast">成功する/繁栄する</prosody> </speak>Ahora, el servicio analiza correctamente y aplica el atributo
ratedel elemento<prosody>a la entrada en japonés.
4 de septiembre de 2020
- La interfaz de personalización ya está disponible para todos
- La interfaz de personalización está ahora disponible a nivel general (GA). La personalización ya no es una función en fase beta. Puede utilizar la interfaz de personalización para especificar cómo debe pronunciar el servicio las palabras inusuales que aparecen en la entrada creando diccionarios personalizados específicos de idioma. Puede utilizarse con todas las voces beta y disponibles a nivel general. Para obtener más información, consulte Comprender la personalización.
24 de junio de 2020
- Nuevas voces neuronales en inglés del Reino Unido y en francés
-
El servicio ofrece ahora dos nuevas voces generadas por redes neuronales:
- Inglés de Reino Unido:
en-GB_CharlotteV3Voice - Francés:
fr-FR_NicolasV3Voice
También ofrece una versión mejorada de la voz neuronal en inglés del Reino Unido existente,
en-GB_KateV3Voice. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces. - Inglés de Reino Unido:
- Soporte para el atributo SSML
digitsdel elemento<say-as>para el japonés -
El servicio ahora admite el atributo
digitsdel elemento SSML<say-as>con su voz en japonés. Para obtener más información, consulte Elemento say-as.
1 de abril de 2020
- Nuevas voces estándar en coreano:
ko-KR_YoungmiVoiceyko-KR_YunaVoice -
Ahora el servicio da soporte a dos voces coreanas femeninas estándar:
ko-KR_YoungmiVoiceyko-KR_YunaVoice. La siguiente información se aplica a ambas voces coreanas:- Las voces son funciones beta. Es posible que las voces no estén preparadas para el uso en producción y que estén sujetas a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
- Las voces admiten la personalización y el método
/v1/pronunciation. - Las voces admiten el elemento
<mark>y el parámetrotimingsque están disponibles con la interfaz de WebSocket. - Las voces admiten todos los elementos SSML (Speech Synthesis Markup Language), excepto SSML expresivo y SSML de transformación de voz.
- Las voces solo admiten el Alfabeto Fonético Internacional (IPA), no admiten SPR (Symbolic Phonetic Representation) de IBM, con el elemento
<phoneme>.
- Nuevo soporte de características para las voces en árabe, chino y neerlandés de Países Bajos
-
Las voces beta en árabe, chino y neerlandés de Países Bajos ahora admiten las siguientes características:
- Personalización y el método
/v1/pronunciation. - El elemento
<mark>y el parámetrotimingsque están disponibles con la interfaz de WebSocket.
Para obtener más información, consulte los apartados siguientes:
- Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces.
- Para obtener más información sobre cómo utilizar la interfaz WebSocket para obtener tiempos de palabra, consulte Generación de tiempos de palabra.
- Para obtener más información sobre la personalización, consulte Comprender la personalización.
- Para obtener más información sobre el uso de IPA y SPR con la personalización, consulte Información sobre los símbolos fonéticos. (Los símbolos IPA para los idiomas árabe, chino, neerlandés de Países Bajos y coreano aún no están documentados. Esta documentación se publicará próximamente).
- Personalización y el método
24 de febrero de 2020
- Nuevas voces neuronales en inglés de EE.UU. y alemán
-
El servicio ahora admite cinco voces neuronales nuevas:
- US English:
en-US_EmilyV3Voice,en-US_HenryV3Voice,en-US_KevinV3Voiceyen-US_OliviaV3Voice - Alemán:
de-DE_ErikaV3Voice
Las nuevas voces no admiten los siguientes elementos SSML:
- SSML expresivo con el elemento
<express-as> - Transformación de voz con el elemento
<voice-transformation> - El atributo
volumedel elemento<prosody>.
Para obtener más información sobre éstas voces y todas las voces disponibles, consulte Idiomas y voces.
- US English:
- Nuevo soporte para Activity Tracker
-
El servicio ahora da soporte al uso de sucesos de Activity Tracker para todas las operaciones de personalización. IBM Cloud Activity Tracker registra actividades iniciadas por el usuario que cambian el estado de un servicio en IBM Cloud. Puede utilizar este servicio para investigar una actividad anormal y acciones críticas, así como para cumplir con los requisitos de auditoría de la normativa. Además, puede recibir alertas sobre las acciones a medida que se ocurren. Para obtener más información, consulte Sucesos de Activity Tracker.
18 de diciembre de 2019
- Nuevas voces en árabe, chino y neerlandés de Países Bajos
-
El servicio ahora admite seis nuevas voces estándar en tres nuevos idiomas:
- Árabe:
ar-AR_OmarVoice - Chino (mandarín):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceyzh-CN_ZhangJingVoice - Neerlandés de Países Bajos:
nl-NL_EmmaVoiceynl-NL_LiamVoice
La siguiente información se aplica a estas nuevas voces estándar:
- Las nuevas funciones son funciones beta. Es posible que las voces no estén listas para el uso de producción y que estén sujetas a cambios. Se trata de ofertas iniciales que se espera que mejoren la calidad por lo que hace al tiempo y al uso.
- Las voces no admiten el elemento
<mark>ni el parámetrotimingsque están disponibles con la interfaz de WebSocket. - Las voces no admiten la personalización ni el método
/v1/pronunciation. - Las voces no dan soporte al SSML expresivo o al SSML de transformación de voz.
- Las voces admiten todos los demás elementos SSML. No obstante, las voces solo admiten el Alfabeto Fonético Internacional (IPA), no admiten SPR (Symbolic Phonetic Representation) de IBM, con el elemento
<phoneme>.
Para obtener más información sobre éstas voces y todas las voces disponibles, consulte Idiomas y voces.
- Árabe:
12 de diciembre de 2019
- Soporte completo para IBM Cloud IAM
-
El servicio Text to Speech ahora admite la implementación completa de la gestión de identidad y acceso (IAM - Identity and Access Management) de IBM Cloud. Las claves de API para los servicios de Watson ya no están limitadas a una sola instancia de servicio. Puede crear políticas de acceso y claves de API que se apliquen a más de un servicio, y puede otorgar acceso entre los servicios. Para obtener más información sobre IAM, consulte Autenticación en servicios de Watson.
Para dar soporte a este cambio, los puntos finales de servicio de API utilizan un dominio diferente e incluyen el ID de la instancia de servicio. El patrón es
api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.-
URL de HTTP de ejemplo para una instancia alojada en la ubicación de Dallas:
https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2 -
URL de WebSocket de ejemplo para una instancia alojada en la ubicación de Dallas:
wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2
Para obtener más información sobre las URL, consulta la referencia de la API y el SDK.
Estos URL no constituyen un cambio de última hora. Los nuevos URL funcionan tanto para las instancias de servicio existentes como para las nuevas instancias. Los URL originales siguen trabajando en las instancias de servicio existentes durante al menos un año, hasta diciembre de 2020.
-
- Nuevas características de seguridad de datos y de red
-
Ahora está disponible el soporte para las siguientes funciones nuevas de seguridad de datos y redes:
-
Soporte de puntos finales de red privada
Los usuarios de planes Premium pueden crear puntos finales de red privados para conectarse al servicio de Text to Speech a través de una red privada. Las conexiones a puntos finales de red privada no requieren acceso a la Internet pública. Para obtener más información, consulte Puntos finales de red públicos y privados.
-
12 de noviembre de 2019
- Ahora ya está disponible un nueva ubicación de Seúl
- El servicio Text to Speech ya está disponible en la ubicación de Seúl IBM Cloud (kr-seo). Al igual que con otras ubicaciones, la ubicación de IBM Cloud utiliza la autenticación de IAM basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.
1 de octubre de 2019
- Nuevo soporte de HIPAA de EE.UU. para planes Premium en la ubicación Washington, DC
- La compatibilidad con la HIPAA de EE. UU. está disponible para los planes Premium alojados en el centro de Washington D. C. y creados a partir del 1 de abril de 2019. Para obtener más información, consulte Ley Health Insurance Portability and Accountability Act (HIPAA).
22 de agosto de 2019
- Arreglo de defectos: varias mejoras pequeñas
- Corrección de errores: Se ha actualizado el servicio para corregir pequeños errores y realizar mejoras.
30 de julio de 2019
- Nueva voz neuronal en japonés:
ja-JP_EmiV3Voice - El servicio ofrece ahora una voz neuronal en japonés:
ja-JP_EmiV3Voice. Ahora dispone de ambas versiones, la estándar y la neuronal, de todas las voces disponibles en todos los idiomas admitidos. Para obtener más información, consulte Idiomas y voces.
24 de junio de 2019
- Nuevo soporte para voces estándar y neuronales
-
El servicio ofrece ahora dos versiones de la mayoría de las voces disponibles:
- Voces estándar que utilizan la síntesis por concatenación para ensamblar segmentos de voz grabada con el fin de generar audio. Las voces estándar no incluyen una cadena de la versión en sus nombres (por ejemplo,
en-US_AllisonVoice). - Voces neuronales que utilizan las Redes NeuronalesProfundas (DNN - Deep Neural Networks) para predecir las características acústicas (espectrales) del discurso. Las voces neuronales incluyen una cadena de la versión (
V3) en sus nombres (por ejemplo,en-US_AllisonV3Voice).
Las versiones neuronales están disponibles para todas las voces estándar excepto para la voz
ja-JP_EmiVoice, que está pendiente y estará disponible pronto. No se pueden utilizar los elementos SSML<express-as>y<voice-transformation>con las voces neuronales y no se puede utilizar el atributovolumedel elemento<prosody>con las voces neuronales. Para obtener más información sobre todas las voces disponibles, consulte Idiomas y voces. - Voces estándar que utilizan la síntesis por concatenación para ensamblar segmentos de voz grabada con el fin de generar audio. Las voces estándar no incluyen una cadena de la versión en sus nombres (por ejemplo,
- V2 voces neuronales retiradas del servicio
-
El servicio ya no incluye las voces de DNN de
V2que antes estaban disponibles. Si utiliza una voz deV2en su aplicación, el servicio automáticamente utiliza la voz equivalente deV3.
24 de marzo de 2019
- Nuevas voces neuronales en alemán V2
-
Ahora el servicio ofrece las versiones de DNN (Deep Neural Network) de
V2de sus voces en alemán:de-DE_BirgitV2Voicede-DE_DieterV2Voice
Para obtener más información sobre las voces basadas en DNN, consulte Idiomas y voces.
- Nuevo soporte para los atributos
pitchyratedel elemento SSML<prosody> -
Todas las voces basadas en DNN del servicio admiten ahora los atributos
pitchyratedel elemento SSML<prosody>. Las voces basadas en DNN no admiten el atributovolumedel elemento<prosody>. Para obtener más información, consulte Elemento prosody.
21 de marzo de 2019
- Ahora la visibilidad de las credenciales de servicio están restringidas por rol
-
Ahora los usuarios sólo pueden ver la información de credenciales de servicio que está asociada al rol que se ha asignado a su cuenta de IBM Cloud. Por ejemplo, si se le asigna un rol de
reader, las credenciales de servicio dewritero de otros niveles superiores ya no son visibles.Este cambio no afecta al acceso de API para usuarios o aplicaciones con credenciales de servicio existentes. El cambio sólo afecta a la visualización de credenciales dentro de IBM Cloud.
4 de marzo de 2019
- Nuevas voces neuronales en inglés e italiano V2
-
El servicio ahora ofrece cuatro nuevas voces de
V2que utilizan la síntesis de aprendizaje profundo para generar audio:en-US_AllisonV2Voiceen-US_LisaV2Voiceen-US_MichaelV2Voiceit-IT_FrancescaV2Voice
Estas nuevas voces utilizan el aprendizaje automático y un DNN para sintetizar texto a voz. La síntesis de aprendizaje profundo o basada en DNN (Deep Neural Network, red neuronal profunda) genera audio con una prosodia más natural y una calidad general más coherente.
Pero las nuevas voces también producen audio con diferentes calidades de señal a partir de las voces existentes, por lo que podrían no ser apropiadas para todas las aplicaciones. Además, las nuevas voces no admiten los elementos SSML
<prosody>,<express-as>y<voice-transformation>.Para obtener más información sobre estas voces basadas en DNN y cómo difieren de las voces existentes, consulte Idiomas y voces.
28 de enero de 2019
- Nuevo soporte para IAM de IBM Cloud por la interfaz de WebSocket
-
La interfaz WebSocket ahora admite la autenticación de IAM (Identity and Access Management) basada en señales (IAM) a partir de código JavaScript basado en navegador. Se ha eliminado la limitación de lo contrario. Para establecer una conexión autenticada con el método WebSocket
/v1/synthesize:- Si utiliza la autenticación de IAM, incluya el parámetro de consulta
access_token. - Si utiliza las credenciales de servicio de Cloud Foundry, incluya el parámetro de consulta
watson-token.
Para obtener más información, consulte Abrir una conexión.
- Si utiliza la autenticación de IAM, incluya el parámetro de consulta
13 de diciembre de 2018
- Ahora está disponible una nueva ubicación de Londres
- El servicio Text to Speech está ahora disponible en la ubicación de Londres (eu-gb) de IBM Cloud®. Al igual que todas las ubicaciones, Londres utiliza la autenticación de Identity and Access Management (IAM) basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.
7 de noviembre de 2018
- Ya disponible una nueva ubicación de Tokio
- El servicio Text to Speech está ahora disponible en la ubicación de Tokio (jp-tok) de IBM Cloud®. Al igual que todas las ubicaciones, Tokio utiliza la autenticación de Identity and Access Management (IAM) basada en señales. Todas las nuevas instancias de servicios que cree en esta ubicación utilizarán la autenticación IAM.
30 de octubre de 2018
- Nuevo soporte para IAM de IBM Cloud basado en señales
-
El servicio Text to Speech se ha migrado a la autenticación de IAM (Identity and Access Management) basada en señales para todas las ubicaciones. Todos los servicios de IBM Cloud ahora utilizan la autenticación de IAM. El servicio Text to Speech se ha migrado en cada ubicación en las fechas siguientes:
- Dallas (us-south): 30 de octubre de 2018
- Frankfurt (eu-de): 30 de octubre de 2018
- Washington, DC (us-east): 12 de junio de 2018
- Sídney (au-syd): 15 de mayo de 2018
La migración a la autenticación de IAM afecta de forma distinta a las instancias de servicio nuevas y existentes:
- Todas las instancias de servicio nuevas que se crean en cualquier ubicación ahora utilizan la autenticación de IAM para acceder al servicio. Puede pasar una señal portadora o una clave de API: las señales admiten solicitudes autenticadas sin incluir credenciales de servicio en cada llamada; las claves de API utilizan la autenticación básica HTTP. Cuando se utiliza cualquier SDK de Watson, se puede pasar la clave de API y dejar que SDK gestione el ciclo de vida de las señales.
- Las instancias de servicio existentes que ha creado en una ubicación antes de la fecha de migración indicada siguen utilizando el
{username}y la{password}de sus credenciales de servicio de Cloud Foundry para la autenticación hasta que las migre para que utilicen la autenticación de IAM.
Para obtener más información, consulte la siguiente documentación:
- Para saber qué mecanismo de autenticación utiliza tu instancia de servicio, consulta las credenciales del servicio haciendo clic en la instancia en el panel de control de IBM Cloud.
- Para obtener más información sobre la utilización de señales IAM con servicios Watson, consulte Autenticación en servicios de Watson.
- Para ver ejemplos que utilizan la autenticación de IAM, consulta la referencia de la API y el SDK.
12 de junio de 2018
- Nuevas funciones para aplicaciones alojadas en la ubicación Washington, DC
-
Hay las siguientes características habilitadas para las aplicaciones alojadas en Washington, DC (us-east):
- El servicio ahora admite un nuevo proceso de autenticación de API. Para obtener más información, consulte la actualización de servicio del 30 de octubre de 2018.
- El servicio ahora admite la cabecera
X-Watson-Metadatay el métodoDELETE /v1/user_data. Para obtener más información, consulte Seguridad de la información.
15 de mayo de 2018
- Nuevas funciones para aplicaciones alojadas en la ubicación de Sídney
-
Hay las siguientes características habilitadas para las aplicaciones alojadas en Sídney (au-syd):
- El servicio ahora admite un nuevo proceso de autenticación de API. Para obtener más información, consulte la actualización de servicio del 30 de octubre de 2018.
- El servicio ahora admite la cabecera
X-Watson-Metadatay el métodoDELETE /v1/user_data. Para obtener más información, consulte Seguridad de la información.
2 de octubre de 2017
- Cambios en el formato de audio de
audio/l16 - Para el formato
audio/l16, ahora tiene la opción de especificar la endianness del audio que se devuelve. (Debe especificar a la frecuencia de muestreo). Algunos ejemplos sonaudio/l16;rate=22050;endianness=big-endianyaudio/l16;rate=22050;endianness=little-endian; el valor predeterminado es «significant endian». Para obtener más información, consulte Utilización de formatos de audio.
14 de julio de 2017
- Nuevo soporte para el formato de audio de MP3 (MPEG)
- El servicio ahora admite el formato de audio MP3 o MPEG (Motion Picture Experts Group). Para obtener más información sobre los formatos de audio admitidos, consulte Utilización de formatos de audio.
10 de abril de 2017
- Nuevo soporte para el formato de audio de Web Media (WebM)
- El servicio ahora admite el formato de audio WebM (Web Media) con el códec Opus o Vorbis. El servicio ahora también admite el formato de audio Ogg con el códec Vorbis además del códec Opus. Para obtener más información sobre los formatos de audio admitidos, consulte Utilización de formatos de audio.
- Nuevo soporte para el uso compartido de recursos entre orígenes
- El servicio ahora da soporte a CORS (Cross-Origin Resource Sharing) para permitir que los clientes basados en navegador llamen al servicio directamente. Para más información, consulte la página CORS support.
- Cambios en los códigos de respuesta HTTP correctos
- Los códigos de respuesta HTTP para la finalización satisfactoria de algunos métodos de la interfaz de personalización han cambiado:
- El método
POST /v1/customizationsahora devuelve 201 (en lugar de 200). - El método
POST /v1/customizations/{customization_id}ahora devuelve 200 (en lugar de 201). - El método
POST /v1/customizations/{customization_id}/wordsahora devuelve 200 (en lugar de 201). - El método
PUT /v1/customizations/{customization_id}/words/{word}ahora devuelve 200 (en lugar de 201).
- El método
- Nuevos errores para el uso incorrecto del parámetro
part_of_speechen japonés - Los métodos
POST /v1/customizations/{custom_id}/wordsyPUT /v1/customizations/{customization_id}/words/{word}ahora devuelven el código de respuesta HTTP 400 con el mensaje de errorPart of speech is supported for ja-JP language onlysi se intenta especificarpart_of_speechpara un idioma distinto del japonés. - Cambios en el cuerpo de respuesta para el método añadir palabras
- El método
POST /v1/customizations/{custom_id}/wordsahora devuelve un cuerpo de respuesta vacío ({}).
1 de diciembre de 2016
- Nueva voz en español de Latinoamérica:
es-LA_SofiaVoice -
El servicio incluye una nueva voz,
es-LA_SofiaVoice, que es el equivalente latinoamericano de la voz dees-US_SofiaVoice. La diferencia más significativa entre las dos voces se refiere a cómo interpretan un$(signo del dólar): La versión latinoamericana utiliza el término pesos; la versión norteamericana utiliza el término dólares. También puede haber otras diferencias menores entre las dos voces. - Nuevas voces en inglés de EE.UU.:
en-US_LisaVoiceyen-US_MichaelVoice -
Además de la voz
en-US_AllisonVoice, ahora hay dos voces más transformables con el SSML de transformación de voz:en-US_LisaVoiceyen-US_MichaelVoice. - Cambios en la personalización para japonés
-
Cuando se utiliza la interfaz de personalización con japonés, el servicio ahora coincide con la palabra más larga de los pares palabra/traducción definidos para un modelo personalizado. Por ejemplo, tenga en cuenta las dos entradas siguientes para un modelo personalizado:
{ "words": [ {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"}, {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"} ] }Si el servicio encuentra la cadena «
NYC» en el texto de entrada, la considera una coincidencia porque es una coincidencia más larga que «NY». Anteriormente, el servicio habría encontrado coincidencias con la cadena «NY». Para obtener más información sobre cómo trabajar con entradas en japonés en un modelo personalizado, consulta «Trabajar con entradas en japonés ».
22 de septiembre de 2016
- La personalización ya está disponible para todos los idiomas
- La interfaz de personalización, que incluye los métodos de personalización y
GET /v1/pronunciation, está ahora disponible para todos los idiomas que admite el servicio. La interfaz sigue siendo un release beta. Para obtener más información, consulte Comprender la personalización. - Nuevo soporte en japonés para SSML
- El servicio ahora admite el SSML para el japonés. Para obtener información general sobre el soporte de SSML, consulte Información sobre SSML. Para obtener información sobre los símbolos
SPR e IPA japoneses, consulte Símbolos para el japonés. Se aplican consideraciones adicionales y un campo
part_of_speechal crear entradas para palabras en un modelo personalizado en japonés. Para obtener más información, consulte Trabajar con entradas en japonés. - Nueva función SSML de transformación de voz
- El servicio ahora ofrece la transformación de voz SSML a través del nuevo elemento
<voice-transformation>. Puede expandir el rango de voces posibles creando transformaciones personalizadas que modifiquen el tono, el rango de tonos, la tensión glotal, la aspiración, la velocidad y el timbre de una voz. El servicio también ofrece dos voces virtuales integradas, Young y Soft. El servicio actualmente da soporte a la transformación de voz sólo para la voz de Allison en inglés de Estados Unidos. - Las temporizaciones de palabras están ahora disponibles con la interfaz de WebSocket
- Ahora el servicio puede devolver información de temporización de palabras para todas las series del texto de entrada que pase a la interfaz WebSocket. Para recibir la hora de inicio y finalización de cada serie de caracteres de la entrada,
especifique una matriz que incluya la serie
wordspara el parámetro opcionaltimingsdel objeto JSON que pase al servicio. Esta característica no está disponible actualmente para texto de entrada en japonés. Para obtener más información, consulte Generación de temporizaciones de palabras. - Nuevo soporte para la validación de SSML
- El servicio ahora valida todos los elementos SSML que se envían en cualquier contexto. Si encuentra una etiqueta no válida, el servicio notifica un código de respuesta HTTP 400 con un mensaje descriptivo, y el método falla. En versiones anteriores, el servicio gestionaba los errores de forma inconsistente; por ejemplo, indicar una pronunciación incorrecta de una palabra podía provocar un comportamiento impredecible o inconsistente. Para obtener más información, consulte Validación de SSML.
- Ahora se especifica el formato IBM SPR con
ibmen lugar despr - El uso de
sprestá en desuso como argumento para la opciónformatdel métodoGET /v1/pronunciationy para su uso con el atributoalphabetde un elemento SSML<phoneme>. Para utilizar la notación de la SPR de IBM, utilice el argumentoibmen lugar despren todos los casos. - Nuevo soporte para el formato de audio de
audio/mulaw - La lista de formatos de audio soportados ahora incluye
audio/mulaw;rate={rate}. Al igual queaudio/basic, este formato proporciona audio de un solo canal que se codifica utilizando datos u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio. - Nuevas características soportadas identificadas al listar voces
- Los métodos
GET /v1/voicesyGET /v1/voices/{voice}ahora devuelven un objetosupported_featurescomo parte de su salida para cada voz. El objeto describe si la voz admite la personalización y el elemento SSML<voice_transformation>. Para obtener más información, consulte Idiomas y voces.
23 de junio de 2016
- Nueva interfaz de WebSocket para la síntesis de voz
-
El servicio ahora ofrece una interfaz WebSocket para sintetizar texto a voz. La interfaz ofrece las mismas características que el método
/v1/synthesizede la interfaz HTTP. Acepta texto sin formato o texto con marcaje SSML. Además, también da admite el uso del elemento SSML<mark>para identificar el tiempo en el audio en que termina de sintetizar todo el texto que precede a la marca. Para obtener más información, consulte La interfaz WebSocket. - Soporte de lenguaje ampliado para SSML
-
El servicio ahora ofrece soporte para texto anotado con SSML para los idiomas español de España y de América del Norte, italiano y portugués de Brasil. El servicio ya admitía el uso de SSML para inglés del Reino Unido y de EE.UU., francés y alemán. A partir de esta actualización, el servicio admite SSML para todos los idiomas excepto el japonés. Además, puede utilizar las notaciones IPA y SPR de IBM para definir pronunciaciones de palabras con el elemento SSML
<phoneme>. Para obtener más información, consulte Información sobre SSML y Información sobre los símbolos fonéticos.Para el inglés de EE.UU. también puede utilizar el elemento SSML
<phoneme>para crear entradas de palabras en un modelo personalizado; la personalización sólo está soportada para el inglés de EE.UU. Para obtener más información, consulte Comprender la personalización. - Voces actualizadas para una mejor síntesis del habla
-
El servicio ha mejorado la expresividad y la naturalidad de las voces más utilizadas. Estas mejoras se basan en la predicción de prosodia basada en RNN (Recursive Neural Network) a partir del texto de entrada. Están disponibles como un nuevo motor de servicio y actualizaciones de modelos de voz para los idiomas siguientes:
en-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicefr-FR_ReneeVoice
- Nuevo parámetro de ID de personalización para la pronunciación de palabras
-
El método
GET /v1/pronunciationahora acepta un parámetro de consulta opcionalcustomization_id. El parámetro obtiene una traducción de una palabra de un modelo personalizado especificado. Si el modelo personalizado no contiene la palabra, el método devuelve la pronunciación predeterminada de la palabra. Para más información, consulte la referencia API y SDK.Al utilizar el método
GET /v1/pronunciationsin un ID de personalización y para un idioma distinto del inglés de EE.UU., puede solicitar la pronunciación de una palabra sólo en la notación IBM SPR. Para un idioma distinto del inglés de EE.UU., debe especificarsprcon la opciónformatdel método. - Nuevo soporte para el formato de audio de
audio/basic -
La lista de formatos de audio admitidos incluye ahora
audio/basic, que proporciona un audio de un solo canal que se codifica utilizando datos u-law (o mu-law) de 8 bits que se muestrean a 8 kHz. Para obtener más información, consulte Utilización de formatos de audio. - Las interfaces HTTP y WebSocket ahora pueden devolver avisos
-
Los métodos HTTP y WebSocket
/v1/synthesizepueden devolver una respuesta dewarningsque incluye mensajes sobre parámetros de consulta no válidos o campos JSON que se incluyen en una solicitud. El formato de los avisos ha cambiado. En el ejemplo siguiente se muestra el formato anterior:"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."Ahora, el mismo aviso tiene el formato siguiente:
"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
10 de marzo de 2016
- Los métodos de síntesis ahora pueden devolver avisos
- Los métodos
GETyPOST /v1/synthesizeahora pueden devolver una cabecera de respuestaWarningsque incluye una lista de mensajes de aviso acerca de parámetros de consulta no válidos o campos JSON que se incluyen en la solicitud. Cada elemento de la lista incluye una serie que describe la naturaleza del aviso seguido de una matriz de series de argumentos no válidas; por ejemplo,Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}'].Para obtener más información, consulte laReferencia de API & SDK. - El SDK iOS de Apple iOS beta está en desuso
- La versión beta de Watson Speech Software Development Kit (SDK) para el sistema operativo Apple® iOS está en desuso y se ha sustituido por Watson Swift SDK. El nuevo SDK está disponible en el repositorio swift-sdk, dentro del espacio de nombres
watson-developer-cloud, en GitHub.
22 de febrero de 2016
- Nueva característica SSML expresivo
- El servicio se ha actualizado con una nueva característica de expresión de SSML. El servicio amplía SSML con un elemento
<express-as>que puede utilizar para indicar la expresividad en uno de los tres estilos de habla:GoodNews,ApologyoUncertainty. Puede aplicar el elemento a todo el cuerpo del texto, a una frase o a una palabra. Actualmente, el servicio da soporte a la expresividad sólo para la voz de Allison en inglés de EE.UU. (en-US_AllisonVoice).
17 de diciembre de 2015
- Nueva interfaz de personalización beta
-
El servicio ofrece una nueva interfaz de personalización que se puede utilizar para especificar cómo se pronuncian las palabras inusuales que aparecen en la entrada. La interfaz incluye algunos métodos nuevos que puedes utilizar para crear y gestionar modelos personalizados y los pares de palabras y traducciones que contienen. Puede utilizar los modelos personalizados al sintetizar texto a audio.
El servicio admite conversiones de tipo 'suena como' y transcripciones fonéticas. Las transcripciones fonéticas pueden utilizar la representación estándar IPA (International Phonetic Alphabet) o la representación SPR (Symbolic Phonetic Representation), propiedad de IBM. Se utiliza el SSML para especificar conversiones fonéticas.
La interfaz de personalización incluye una colección de nuevos métodos HTTP denominados
POST /v1/customizations,POST /v1/customizations/{customization_id},POST /v1/customizations/{customization_id}/wordsyPUT /v1/customizations/{customization_id}/words/{word}. El servicio también proporciona el nuevo métodoGET /v1/pronunciationque devuelve la pronunciación de cualquier palabra y el nuevo métodoGET /v1/voices/{voice}que devuelve información detallada acerca de una voz específica. Además, los métodos existentes de la interfaz del servicio ahora aceptan parámetros de modelo personalizados según sea necesario.Para obtener más información sobre la personalización y su interfaz, consulte Comprender la personalización y la referencia API y SDK.
La interfaz de personalización es un release beta que actualmente sólo da soporte al inglés de Estados Unidos. Todos los métodos de personalización y el método
GET /v1/pronunciationse pueden utilizar actualmente para crear y manipular modelos personalizados y traducciones de palabras sólo en inglés de EE.UU. - Nueva voz en portugués:
pt-BR_IsabelaVoice -
El servicio admite una nueva voz,
pt-BR_IsabelaVoice, para sintetizar audio en portugués de Brasil con una voz femenina. Para obtener más información, consulte Idiomas y voces.
21 de septiembre de 2015
- Nuevos SDK móviles disponibles
-
Hay dos nuevos SDK (Software Development Kits) beta para móviles disponibles para los servicios de voz. Estos SDK permiten a las aplicaciones móviles interaccionar con los servicios Text to Speech y Speech to Text. Puede utilizar los SDK para enviar texto al servicio Text to Speech y recibir una respuesta de audio.
- El documento « Watson Swift SDK » está disponible en el repositorio « Repositorio de Swift SDK », dentro del espacio de nombres
«
watson-developer-cloud», en GitHub. - El kit de desarrollo de aplicaciones de voz de Android ( Watson ) Android™ SDK está disponible en el repositorio «speech-android-sdk» del espacio de nombres
watson-developer-clouden GitHub.
Los dos SDK admiten la autenticación con servicios de voz utilizando las credenciales de servicio de IBM Cloud o bien una señal de autenticación. Dado que los SDK son funciones en fase beta, están sujetos a cambios en el futuro.
- El documento « Watson Swift SDK » está disponible en el repositorio « Repositorio de Swift SDK », dentro del espacio de nombres
«
- Nueva voz en japonés:
ja-JP_EmiVoice -
El servicio admite un nuevo idioma, el japonés. La voz
ja-JP_EmiVoicees una voz japonesa femenina.
1 de julio de 2015
- El servicio Speech to Text ahora está disponible a nivel general
-
El servicio pasó de beta a disponibilidad general (GA - General Availability) el 1 de julio de 2015. Las siguientes diferencias existen entre las versiones beta y GA de la API de Text to Speech. El release GA requiere que los usuarios actualicen a la nueva versión del servicio.
- Nuevo modelo de programación basado en señales
-
Un nuevo modelo de programación da soporte a la interacción directa entre un cliente y el servicio. Utilizando este modelo, un cliente puede obtener una señal de autenticación para comunicarse directamente con el servicio. Utilizando la señal, el cliente puede eludir la necesidad de una aplicación proxy del lado del servidor en IBM Cloud para llamar al servicio en su nombre. Las señales son el medio preferido para que los clientes interactúen con el servicio.
El servicio continúa admitiendo el modelo de programación antiguo que utilizaba un proxy del lado del servidor para retransmitir comunicaciones y datos entre el cliente y el servicio. Pero el nuevo modelo es más eficiente y proporciona un mayor rendimiento.
- Nuevo soporte para Speech Synthesis Markup Language
-
Ahora, se puede pasar SSML (Speech Synthesis Markup Language) a las versiones HTTP
GETyPOSTdel método/v1/synthesize. SSML es un lenguaje de códigos basado en XML, diseñado para proporcionar anotaciones de texto para aplicaciones de síntesis de voz, como por ejemplo el servicio Text to Speech. Para obtener más información sobre cómo pasar la entrada SSML al servicio, consulte Especificar el texto de entrada.Inicialmente, el servicio admite el uso de SSML sólo para los idiomas inglés del Reino Unido y de EE.UU., francés y alemán. El servicio no admite SSML para italiano o español. Al utilizar SSML, asegúrese de que no seleccionar una voz para el audio en uno de los idiomas no soportados. Los resultados en tal caso no serían significativos.
- Cambios en las voces disponibles
-
Las voces compatibles con el habla sintetizada que se modifica y amplía. El servicio ahora admite otras voces, idiomas y dialectos mediante los métodos
/v1/synthesize. Para obtener más información sobre las voces soportadas, consulte Idiomas y voces.Las tres voces que había disponibles en beta se han renombrado para GA:
VoiceEnUsMichaeles ahoraen-US_MichaelVoiceVoiceEnUsLisaes ahoraen-US_LisaVoiceVoiceEsEsEnriquees ahoraes-ES_EnriqueVoice
Los nombres anteriores de las voces seguirán funcionando con la versión beta del servicio (a través de los puntos finales de la API
-beta) mientras esa versión siga disponible. Sin embargo, debe utilizar los nuevos nombres con la versión GA del servicio. - Nuevo soporte para el formato de audio FLAC (Free Lossless Audio Codec)
-
Ahora puede solicitar al servicio que devuelva el audio en formato FLAC (Free Lossless Audio). El servicio todavía puede devolver el audio en formato Ogg con el códec Opus (el predeterminado) y en formato WAV (Waveform Audio File Format). Para obtener más información sobre la utilización de formatos de audio con los métodos
/v1/synthesize, consulte Utilización de formatos de audio. - Nuevos límites en la cantidad máxima de texto sintetizado
-
El texto que se envía al método
/v1/synthesizeen el URL de una solicitud HTTPGETo en el cuerpo de una solicitud HTTPPOSTestá ahora limitado a un máximo de 5 KB. En la versión beta, el texto tenía un tamaño máximo de 4 MB. - Nueva cabecera para renunciar a las mejoras de servicio
-
Los métodos
/v1/synthesizeahora incluyen la cabeceraX-WDC-PL-OPT-OUTpara controlar si el servicio utiliza los resultados de texto y audio de una operación para mejorar los resultados futuros. Especifique el valor1para impedir que el servicio utilice los resultados de texto y de audio. El parámetro se aplica sólo a la solicitud actual. La nueva cabecera sustituye a la cabeceraX-loggingde los métodos beta. Para obtener más información, consulte Control del registro de solicitudes para servicios Watson. - Cambios en los códigos de error HTTP para la síntesis de voz
-
Para los métodos
/v1/synthesize, se han modificado los siguientes códigos de error:- Se ha eliminado el código de error 406 ("No aceptable. El tipo MIME no admitido.") se ha eliminado.
- Se ha añadido el código de error 415 ("Tipo de soporte no soportado").
- Se ha añadido el código de error 503 ("Servicio no disponible").
- Cambios en los códigos de error HTTP para listar las voces
-
Para el método
GET /v1/voices, se han modificado los códigos de error siguientes:- Se ha eliminado el código de error 406 ("No aceptable. El tipo MIME no admitido.") se ha eliminado.
- Se ha añadido el código de error 415 ("Tipo de soporte no soportado").