Preguntas frecuentes sobre uso

Las preguntas frecuentes de IBM Watson® Text to Speech incluyen preguntas sobre la síntesis de voz, los idiomas soportados, los formatos de audio y otros temas. Para consultar todas las preguntas frecuentes de IBM Cloud®, consulte la página Biblioteca preguntas más frecuentes.

¿Cómo puedo acceder a mis credenciales de servicio?

La forma de acceder a las credenciales de servicio depende de si utiliza Text to Speech con IBM Cloud® o IBM Cloud Pak® for Data. Para obtener más información sobre cómo obtener sus credenciales para ambas versiones, consulte Antes de empezar en la guía de aprendizaje de iniciación.

Una vez que tenga sus credenciales de servicio, consulte los temas siguientes para obtener información sobre la autenticación en el servicio:

¿Qué idiomas admite el servicio?

El servicio Text to Speech da soporte a voces masculinas y femeninas en varios idiomas:

  • El servicio ofrece voces neuronales expresivas para inglés (Australia y Estados Unidos).
  • Los servicios ofrecen voces neurales mejoradas para holandés neerlandés, inglés (Reino Unido y Estados Unidos), francés (Canadá y Francia), alemán, italiano, japonés, coreano, portugués (Brasil) y español (castellano, latinoamericano y norteamericano).

Algunos idiomas y voces solo están disponibles para IBM Cloud®, no para IBM Cloud Pak® for Data. Para obtener más información sobre las voces disponibles para todos los idiomas, consulte Idiomas y voces.

¿Cómo sintetiza el servicio el audio?

El servicio Text to Speech ofrece voces que dependen de la tecnología neuronal para sintetizar texto en habla. El tema de sintetizar el texto a habla es inherentemente complejo. Para obtener más información, consulte

¿Cuáles son los formatos de audio de salida?

De forma predeterminada, el servicio Text to Speech devuelve audio en formato Ogg con el códec Opus (audio/ogg;codecs=opus). El servicio da soprte a muchos otros formatos de audio para adaptarse a sus necesidades de aplicaciones. Para obtener más información, consulte Formatos de audio soportados.

¿Cómo puedo convertir mi texto en voz?

Para enviar texto al servicio para la salida de audio sintetizada, realice una solicitud HTTP o WebSocket. Puede utilizar la API directamente o utilizar uno de los SDK de Watson. Iniciación ofrece ejemplos de los métodos HTTP POST /v1/synthesize y GET /v1/synthesize. La referencia API & SDK muestra ejemplos de todas las interfaces y métodos.

No hay ninguna interfaz gráfica de usuario para enviar texto. Visite la demo Text to Speech para probar un ejemplo del servicio en acción. La demostración acepta una pequeña cantidad de su texto como entrada para generar habla con distintas voces.

¿Puedo cambiar la forma en que el servicio interpreta el texto introducido y produce el audio sintetizado?

Puede utilizar SSML (Speech Synthesis Markup Language) para controlar aspectos del proceso de síntesis como la pronunciación, el volumen, el tono, la velocidad y otros atributos.

¿Qué lenguajes de programación puedo utilizar?

El servicio da soporte a los SDK en muchas plataformas y muchos lenguajes de programación populares.

  • Para obtener más información sobre los SDK y los enlaces a los mismos en GitHub, consulte SDK de Watson.
  • Para obtener más información sobre todos los métodos de los SDK para el servicio Text to Speech, consulte la referencia API & SDK.

¿Cuál es la cantidad máxima de texto que puedo enviar para la síntesis?

Puede enviar la siguiente cantidad máxima de texto para una solicitud de síntesis de voz con cada uno de los métodos del servicio:

  • Método HTTP GET /v1/synthesize: máximo de 8 KB en entrada total, que incluye el texto de entrada, SSML y el URL y las cabeceras.
  • Método HTTP POST /v1/synthesize: máximo de 8 KB para el URL y las cabeceras. Máximo de 5 KB para el texto de entrada, incluido SSML.
  • Método WebSocket /v1/synthesize: máximo de 5 KB de texto de entrada, incluido SSML.

Todos los caracteres de la entrada, incluidos los espacios en blanco y los que forman parte de los elementos SSML, se cuentan con el máximo de datos. Para fines de facturación, los caracteres de espacio en blanco no se cuentan. Para obtener más información, consulte Límites de datos.

¿Cómo funciona la personalización?

La interfaz de personalización del servicio Text to Speech crea un diccionario de palabras y sus traducciones para un idioma específico. Este diccionario se conoce como un modelo personalizado. Para obtener más información, consulte Comprender la personalización.

¿Cómo puedo crear un modelo personalizado?

Revise las directrices para trabajar con la interfaz de personalización antes de empezar. A continuación, consulte los pasos y ejemplos para crear, consultar, actualizar y suprimir modelos personalizados en Creación y gestión de modelos personalizados. Revise también Creación y gestión de entradas personalizadas para obtener ejemplos y orientación sobre la adición de datos de entrenamientos relevantes.

¿Puedo crear una voz personalizada?

IBM Cloud

Como cliente premium, puede trabajar con IBM para entrenar una nueva voz personalizada para su caso de uso específico y su mercado objetivo. Crear una voz personalizada es distinto de personalizar una de las voces existentes del servicio. Una voz personalizada es una nueva voz única basada en datos de entrenamiento de audio que proporciona el cliente. IBM puede entrenar una voz personalizada con tan solo una hora de datos de entrenamiento.

Para solicitar una voz personalizada o para obtener más información, complete y envíe este Formulario de solicitud deIBM.

¿Qué límites existen para un modelo personalizado?

Los siguientes límites se aplican a todos los modelos personalizados:

  • Una palabra de una entrada personalizada puede contener un máximo de 49 caracteres.
  • Una conversión de una entrada personalizada puede contener un máximo de 499 caracteres.
  • Un modelo personalizado puede incluir un máximo de 20.000 entradas personalizadas.

Para obtener más información, consulte Reglas para crear entradas personalizadas.

¿Dónde puedo encontrar planes e información de precios?

IBM Cloud

El servicio Text to Speech ofrece varios planes de precios. Para más información sobre precios, consulte el servicio Text to Speech en el catálogo IBM Cloud.