Foire aux questions sur l'utilisation
Les questions fréquentes pour IBM Watson® Text to Speech incluent des questions sur la synthèse vocale, les langues prises en charge, les formats audio et d'autres sujets. Pour trouver toutes les FAQ pour IBM Cloud®, voir le site Bibliothèque Questions fréquemment posées.
Comment accéder à mes données d'identification de service ?
La manière dont vous accédez à vos informations d'identification de service varie selon que vous utilisez Text to Speech avec IBM Cloud® ou IBM Cloud Pak® for Data. Pour plus d'informations sur l'obtention de vos données d'identification pour les deux versions, voir Avant de commencer dans le tutoriel de mise en route.
Une fois vos données d'identification de service, consultez les rubriques suivantes pour plus d'informations sur l'authentification dans le service :
Quelles langues sont-elles prises en charge par le service ?
Le service Text to Speech prend en charge les voix des hommes et des femmes dans diverses langues parlées:
- Le service offre des voix neuronales expressives pour l'anglais (Australie et États-Unis).
- Les services offrent des voix neurales améliorées pour les Pays-Bas, l'anglais (Royaume-Uni et États-Unis), le français (canadien et français), l'allemand, l'italien, le japonais, le coréen, le portugais (brésilien) et l'espagnol (castillan, latino-américain et nord-américain).
Certaines langues et voix sont disponibles pour IBM Cloud®, mais pas pour IBM Cloud Pak® for Data. Pour plus d'informations sur les voix disponibles pour toutes les langues, voir Langues et voix.
Comment le service synthétise-il l'audio ?
Le service Text to Speech propose des voix qui utilisent la technologie neuronale pour synthétiser du texte en parole. Le sujet de la synthèse vocale est par nature complexe. Pour plus d'informations, voir :
Quels sont les formats audio de sortie ?
Par défaut, le service Text to Speech renvoie le son au format Ogg avec le codec Opus (audio/ogg;codecs=opus). Le service prend en charge de nombreux autres formats audio adaptés à vos besoins d'application. Pour plus d'informations,
voir Formats audio pris en charge.
Comment convertir du texte en parole ?
Pour soumettre du texte au service pour une sortie audio synthétisée, émettez une demande HTTP ou WebSocket. Vous pouvez utiliser l'API directement ou l'un des logiciels SDK Watson. La rubrique Mise en route présente des exemples des méthodes HTTP POST /v1/synthesize et GET /v1/synthesize. La référence API & SDK présente des exemples de toutes
les interfaces et méthodes.
Il n'existe pas d'interface graphique pour la soumission de texte. Consultez la démo Text to Speech pour essayer un exemple du service en action. Cette démonstration utilise une petite partie de votre texte comme entrée pour générer la parole avec différentes voix.
Est-il possible de modifier la façon dont le service interprète le texte d'entrée et produit l'audio synthétisé ?
Vous pouvez utiliser SSML (Speech Synthesis Markup Language) pour contrôler certains aspects du processus de synthèse comme la prononciation, le volume, la tonalité, la vitesse et d'autres attributs.
- Pour des informations générales sur SSML, voir Présentation de SSML.
- Pour plus d'informations sur les éléments SSML pris en charge, voir Eléments SSML.
Quels langages de programmation peut-on utiliser ?
Le service prend en charge des logiciels SDK dans un grand nombre de langages de programmation et de plateformes populaires.
- Pour plus d'informations sur les logiciels SDK et obtenir des liens vers les logiciels SDK de GitHub, voir Logiciels SDK Watson.
- Pour plus d'informations sur toutes les méthodes des SDK pour le service Text to Speech, voir la référence API & SDK.
Quelle est la quantité maximale de texte qu'il est possible de soumettre pour la synthèse ?
La quantité maximale de texte pouvant être soumise lors d'une demande de synthèse vocale pour chaque méthode de service est présentée ci-dessous :
- Méthode HTTP
GET /v1/synthesize- 8 ko d'entrée totale au maximum, ce qui inclut le texte en entrée, le langage SSML, l'URL et les en-têtes. - Méthode HTTP
POST /v1/synthesize- 8 ko maximum pour l'URL et les en-têtes. 5 ko maximum pour le texte en entrée, ce qui comprend le langage SSML. - Méthode WebSocket
/v1/synthesize- 5 ko de texte en entrée maximum, ce qui comprend le langage SSML.
Tous les caractères de l'entrée, y compris les espaces et les caractères des éléments SSML, sont comptabilisés pour définir la quantité maximale de données. Aux fins de facturation, les espaces ne sont pas comptés. Pour plus d'informations, voir Limites de données.
Comment fonctionne la personnalisation ?
L'interface de personnalisation du service Text to Speech crée un dictionnaire de mots et leurs traductions pour une langue spécifique. Ce dictionnaire est appelé modèle personnalisé. Pour plus d'informations, voir Compréhension de la personnalisation.
Comment créer un modèle personnalisé ?
Avant de commencer, lisez les instructions fournies concernant l'interface de personnalisation. Consultez ensuite les étapes et les exemples fournis pour la création, l'interrogation, la mise à jour et la suppression de modèles personnalisés dans Création et gestion de modèles personnalisés. Consultez également la rubrique Création et gestion d'entrées personnalisées pour obtenir des exemples et des conseils sur l'ajout de données d'entraînement pertinentes.
Puis-je créer une voix personnalisée?
IBM Cloud
En tant que client premium, vous pouvez travailler avec IBM pour former une nouvelle voix personnalisée pour votre cas d'utilisation spécifique et votre marché cible. La création d'une voix personnalisée est différente de la personnalisation de l'une des voix existantes du service. Une voix personnalisée est une nouvelle voix unique basée sur les données de formation audio que le client fournit. IBM peut entraîner une voix personnalisée avec seulement une heure de données de formation.
Pour demander une voix personnalisée ou pour plus d'informations, complétez et soumettez ce formulaire de demandeIBM.
Quelles sont les limites d'un modèle personnalisé ?
Les limites suivantes s'appliquent à tous les modèles personnalisés :
- Un mot dans une entrée personnalisée peut contenir un maximum de 49 caractères.
- Une traduction dans une entrée personnalisée peut contenir un maximum de 499 caractères.
- Un modèle personnalisé peut inclure un maximum de 20 000 entrées personnalisées.
Pour plus d'informations, voir Règles de création d'entrées personnalisées.
Où puis-je trouver des plans et des informations sur les prix ?
IBM Cloud
Le service Text to Speech propose plusieurs plans de tarification. Pour plus d'informations sur la tarification, voir le service Text to Speech dans le catalogue IBM Cloud.