Domande frequenti sull'utilizzo
Le FAQ per IBM Watson® Text to Speech includono domande sulla sintesi vocale, le lingue supportate, i formati audio e altri argomenti. Per trovare tutte le FAQ per IBM Cloud®, consultare il sito Biblioteca Domande frequenti.
Come accedo alle mie credenziali del servizio?
Il modo in cui accedi alle tue credenziali del servizio dipende dal fatto che stai utilizzando Text to Speech con IBM Cloud® o IBM Cloud Pak® for Data. Per ulteriori informazioni su come ottenere le credenziali per entrambe le versioni, vedi Prima di iniziare nell'esercitazione introduttiva.
Una volta che hai le tue credenziali del servizio, vedi i seguenti argomenti per informazioni sull'autenticazione al servizio:
Quali lingue supporta il servizio?
Il servizio Text to Speech supporta le voci maschili e femminili in diverse lingue parlate:
- Il servizio offre voci neurali espressive per l'inglese (Australia e Stati Uniti).
- I servizi offrono voci neurali avanzate per olandese, inglese (Regno Unito e Stati Uniti), francese (Canada e Francia), tedesco, italiano, giapponese, coreano, portoghese (brasiliano) e spagnolo (castigliano, latino americano e nordamericano).
Alcune lingue e voci sono disponibili solo per IBM Cloud®, non per IBM Cloud Pak® for Data. Per ulteriori informazioni sulle voci disponibili per tutte le lingue, vedi Lingue e voci.
In che modo il servizio sintetizza l'audio?
Il servizio Text to Speech offre voci che si basano sulla tecnologia neurale per sintetizzare il testo in voce. L'argomento della sintetizzazione del testo in voce è intrinsecamente complesso. Per ulteriori informazioni, vedi
Quali sono i formati audio di output?
Per impostazione predefinita, il servizio Text to Speech restituisce audio in formato Ogg con il codec Opus (audio/ogg;codecs=opus). Il servizio supporta molti altri formati audio per soddisfare le tue esigenze di applicazione.
Per ulteriori informazioni, vedi Formati audio supportati.
Come faccio a convertire il mio testo in voce?
Per inviare un testo al servizio per l'output audio sintetizzato, si effettua una richiesta a HTTP o WebSocket. È possibile utilizzare l'API direttamente o uno degli SDK Watson. Per iniziare,
sono disponibili esempi di entrambi i metodi HTTP POST /v1/synthesize e GET /v1/synthesize. La guida di riferimento API & SDK mostra esempi
di tutte le interfacce e metodi.
Non esiste una GUI (graphical user interface) per inoltrare il testo. Vedi la demoText to Speech per provare un esempio del servizio in azione. La demo accetta una piccola quantità del tuo testo come input per generare un discorso con voci differenti.
Posso modificare il modo in cui il servizio interpreta il testo di input e produce l'audio sintetizzato?
È possibile utilizzare il linguaggio SSML (Speech Synthesis Markup Language) per controllare aspetti del processo di sintesi come pronuncia, volume, passo, velocità e altri attributi.
- Per informazioni generali su SSML, vedi Understanding SSML.
- Per informazioni sugli elementi SSML supportati, consultare Elementi SSML.
Quali linguaggi di programmazione posso utilizzare?
Il servizio supporta gli SDK in molti linguaggi di programmazione e piattaforme popolari.
- Per ulteriori informazioni sugli SDK e per i link ad essi su GitHub, vedere Watson SDK.
- Per ulteriori informazioni su tutti i metodi degli SDK per il servizio Text to Speech, consultare il riferimento API e SDK.
Qual è la quantità massima di testo che posso inviare per la sintesi?
Puoi inviare la seguente quantità massima di testo per una richiesta di sintesi vocale con ciascuno dei metodi del servizio:
- HTTP
GET /v1/synthesizemetodo - Massimo 8 KB di input totale, che comprende il testo di input, l'SSML, URL e le intestazioni. - HTTP
POST /v1/synthesizemetodo - Massimo 8 KB per il sito URL e le intestazioni. Massimo 5 KB per il testo di input, incluso SSML. - Metodo WebSocket
/v1/synthesize- massimo 5 KB di testo di input, incluso SSML.
Tutti i caratteri dell'input, inclusi gli spazi e quelli che fanno parte di elementi SSML, vengono conteggiati per il massimo dei dati. A scopo di fatturazione, gli spazi vuoti non vengono conteggiati. Per ulteriori informazioni, vedi Limiti dei dati.
Come funziona la personalizzazione?
L'interfaccia di personalizzazione del servizio Text to Speech crea un dizionario di parole e delle relative traduzioni per una lingua specifica. A questo dizionario si fa riferimento come modello personalizzato. Per ulteriori informazioni, vedi Informazioni sulla personalizzazione.
Come posso creare un modello personalizzato?
Rivedere le linee guida per l'utilizzo dell'interfaccia di personalizzazione prima di iniziare. Quindi, vedi i passaggi e gli esempi per creare, eseguire query, aggiornare ed eliminare i modelli personalizzati in Creazione e gestione di modelli personalizzati. Esamina anche Creazione e gestione di voci personalizzate per esempi e istruzioni sull'aggiunta di dati di formazione pertinenti.
Posso creare una voce personalizzata?
IBM Cloud
Come cliente premium, puoi lavorare con IBM per addestrare una nuova voce personalizzata per il tuo caso di uso specifico e il mercato di destinazione. La creazione di una voce personalizzata è diversa dalla personalizzazione di una delle voci esistenti del servizio. Una voce personalizzata è una nuova voce unica che si basa sui dati di formazione audio forniti dal cliente. IBM può addestrare una voce personalizzata con almeno un'ora di dati di addestramento.
Per richiedere una voce personalizzata o per ulteriori informazioni, completa e inoltra questo IBM Modulo di richiesta.
Quali limiti esistono per un modello personalizzato?
I seguenti limiti si applicano a tutti i modelli personalizzati:
- Una parola in una voce personalizzata può contenere un massimo di 49 caratteri.
- Una traduzione in una voce personalizzata può contenere un massimo di 499 caratteri.
- Un modello personalizzato può includere un massimo di 20.000 voci personalizzate.
Per ulteriori informazioni, vedi Regole per la creazione di voci personalizzate.
Dove posso trovare informazioni sui piani e sui prezzi?
IBM Cloud
Il servizio Text to Speech offre più piani dei prezzi. Per ulteriori informazioni sui prezzi, consulta Text to Speech nel CatalogoIBM Cloud.