Informazioni sulla personalizzazione
Quando sintetizzi il testo con IBM Watson® Text to Speech, il servizio applica regole di pronuncia dipendenti dalla lingua. Il servizio applica le regole per convertire l'ortografia ordinaria (ortografica) di ogni parola in una forma fonetica. La forma fonetica di una parola utilizza i simboli fonemi per definire come viene pronunciata la parola. Questi simboli sono le unità distinte del suono che distinguono le parole in una lingua, le sillabazioni e i segni di accento delle sillabe.
Le regole di pronuncia regolare del servizio funzionano bene per le parole comuni. Tuttavia, possono produrre risultati imperfetti per parole inusuali. Tali parole includono termini specifici del dominio, parole con origini straniere, nomi personali o geografici e abbreviazioni o acronimi. Se il lessico della tua applicazione include parole come queste, puoi utilizzare l'interfaccia di personalizzazione per specificare in che modo il servizio pronuncia le parole.
Stato e supporto
Le seguenti informazioni sullo stato e sull'assistenza si applicano alla personalizzazione:
- La personalizzazione è disponibile per tutte le lingue.
- IBM Cloud È necessario disporre del piano dei prezzi Standard o Premium per utilizzare la personalizzazione. Gli utenti del piano Lite non possono utilizzare l'interfaccia di personalizzazione. Per ulteriori informazioni, vedi il servizio Text to Speech nel catalogo IBM Cloud®.
- I clienti IBM Cloud Premium possono lavorare con IBM per formare una nuova voce personalizzata per le loro specifiche esigenze applicative. Per richiedere una voce personalizzata o per maggiori informazioni, compilare e inviare questo IBM Modulo di richiesta.
Come funziona la personalizzazione
L'interfaccia di personalizzazione del servizio Text to Speech crea un dizionario di parole e delle relative traduzioni per una lingua specifica. A questo dizionario si fa riferimento come a un modello personalizzato ( custom model). Ogni voce personalizzata in un modello personalizzato è costituita da una coppia parola/traduzione. La traduzione di una parola indica al servizio come pronunciare la parola quando si presenta nel testo di input.
L'interfaccia di personalizzazione fornisce metodi per creare e gestire i modelli personalizzati, che il servizio memorizza in modo permanente. Dopo aver creato un modello personalizzato, puoi utilizzarlo durante la sintesi con qualsiasi versione
del metodo /v1/synthesize. Quando il servizio sintetizza il testo di input, determina la pronuncia delle parole presenti nel modello personalizzato applicando le loro traduzioni direttamente o indirettamente. Poiché si crea un
modello personalizzato per una lingua specifica, un modello personalizzato può essere utilizzato con qualsiasi voce disponibile in quella lingua.
La traduzione di una parola in un modello personalizzato può essere specificata come una traduzione di tipo sonoro o una traduzione fonetica. Puoi utilizzare entrambi i metodi per le voci nello stesso modello personalizzato e puoi combinare i due metodi all'interno della stessa traduzione. Alle voci personalizzate si applicano una serie di regole e linee guida. Per ulteriori informazioni, vedi Regole per la creazione di voci personalizzate.
Traduzione di suoni simili
La traduzione di suoni simili utilizza le regole di pronuncia regolare del servizio per rappresentare indirettamente la pronuncia di una parola di destinazione. Una traduzione di suoni simili è formata dalle pronunce regolari di una o più parole. Il servizio sostituisce innanzitutto la traduzione specificata per qualsiasi ricorrenza della parola riportata nel testo di input. Quindi applica le regole di pronuncia regolare alla traduzione, convertendola nella sua rappresentazione fonetica per ottenere la pronuncia.
Ad esempio, le regole di pronuncia regolare del servizio traducono correttamente molte abbreviazioni e acronimi comuni. Il servizio pronuncia l'abbreviazione cm come centimeter. Le abbreviazioni meno comuni vengono pronunciate lettera per lettera. Ad esempio, il servizio pronuncia la stringa Str (un'abbreviazione di street) come S T R, con ogni lettera pronunciata singolarmente. Puoi utilizzare il metodo di suoni simili per specificare la traduzione street per la stringa Str.
Un altro esempio di acronimo è la parola IEEE, che sta per Institute of Electrical and Electronic Engineers. Per impostazione predefinita, il servizio pronuncia questo acronimo come I E E E. Ma l'acronimo è comunemente pronunciato I triple E, che puoi facilmente definire utilizzando la semplice traduzione di suoni simili I triple E. Se la parola IEEE viene visualizzata nel modello personalizzato con questa traduzione, il servizio sostituisce ogni ricorrenza della parola con la conversione. Quindi, applica le regole di pronuncia regolare alle singole parole I, triple e E per fornire le pronuncia comune.
Puoi applicare il metodo di suoni simili a più di semplici abbreviazioni e acronimi. Funziona altrettanto bene per parole complesse o inusuali. Ad esempio, la seguente coppia di traduzioni di suoni simili fornisce pronunce corrette per le parole inusuali che vengono gestite in modo imperfetto dalle regole di pronuncia regolare del servizio. Trovare traduzioni appropriate per tali parole può essere più impegnativo rispetto alle semplici abbreviazioni. I seguenti esempi utilizzano le regole di pronuncia regolare per modificare l'ortografia delle parole per la traduzione:
- Parola:
ayurvedic, Traduzione:aayervedic - Parola:
gastroenteritis, Traduzione:gastro enteritis
Come mostrano questi esempi, lo sviluppo di traduzioni di suoni simili può essere più un processo di prova ed errore anziché un processo costituito da formule prestabilite. In tale processo, crei una traduzione candidata in base alla tua intuizione ed esperienza con il servizio. Quindi sintetizzi la parola per la traduzione candidata come testo di input e ascolti l'audio risultante. Se sei soddisfatto con la pronuncia, puoi utilizzare la traduzione nel tuo modello personalizzato; altrimenti modifichi la traduzione e la verifichi di nuovo.
Traduzione fonetica
Il metodo di suoni simili è un modo relativamente semplice e utile per ottenere una pronuncia. Tuttavia, non è sempre possibile sviluppare traduzioni di suoni simili. L'alternativa diretta, il metodo fonetico, potrebbe sembrare più complicata e dispendiosa in termini di tempo, ma può ottenere la pronuncia di qualsiasi parola.
La traduzione fonetica specifica una pronuncia in termini di simboli fonemi, segni di accento delle sillabe e sillabazioni facoltative che sovrascrivono le regole di pronuncia regolare del servizio. Puoi specificare la traduzione fonetica in uno dei seguenti formati:
- La rappresentazione IPA (International Phonetic Alphabet) standard
- La rappresentazione IBM SPR (Symbolic Phonetic Representation) proprietaria
In entrambi i casi, specifica una traduzione utilizzando uno specifico formato di fonemi basato sul linguaggio SSML (Speech Synthesis Markup Language). SSML è un linguaggio di markup basato su XML che fornisce annotazioni di testo per le applicazioni
di sintesi vocale. Per specificare la traduzione fonetica di una parola si utilizza l'elemento SSML <phoneme>:
<phoneme alphabet="{ipa | ibm}" ph="{translation}"></phoneme>
L'attributo alphabet specifica il tipo di rappresentazione fonetica: ipa o ibm. L'attributo ph specifica la stringa di traduzione fonetica.
Ad esempio, considera la parola trinitroglycerin. Le regole di pronuncia regolare del servizio producono una pronuncia che differisce da quella comunemente usata da chimici e medici. La pronuncia corretta può essere ottenuta con
una traduzione fonetica:
- IPA:
tɹaɪnˈaɪtɹəglɪsəɹɨn - SPR:
trYn1YtrxglIsxrXn
In questi esempi, la stringa di traduzione fonetica è composta da simboli fonemi e da un singolo segno di accento principale. Il segno di stress primario è rappresentato da ˈ in IPA e da 1 in SPR. In entrambi i casi,
è posizionato appena prima del simbolo per la vocale accentata. Sebbene gli esempi non lo mostrino, in una traduzione fonetica puoi anche specificare sillabazioni e posizioni di accento secondario. Questi elementi non sono obbligatori e normalmente
non sono necessari per ottenere una pronuncia. Come con le traduzioni di suoni simili, puoi comporre una traduzione fonetica da più stringhe delimitate da spazi.
Puoi anche specificare le traduzioni IPA come valori Unicode IPA. Per ulteriori informazioni, vedi Understanding phonetic symbol e le tabelle specifiche della lingua nelle pagine a cui si fa riferimento da Simboli fonetici per le lingue supportate. Per una traduzione di esempio che utilizza i valori Unicode IPA, vedi L'elemento phoneme.
Utilizzo di una traduzione fonetica esistente
A meno che tu non sia un esperto di fonologia, la composizione di traduzioni fonetiche non è un'attività semplice. È sempre più facile modificare una traduzione fonetica esistente piuttosto che comporla da zero. Per aiutarti a creare traduzioni
fonetiche, l'API del servizio include un metodo GET /v1/pronunciation. Il metodo restituisce la rappresentazione IPA o SPR generata dalle regole di pronuncia regolare del servizio per una parola in una lingua specificata. È
anche possibile richiedere la pronuncia di una parola da un modello personalizzato specificato per vedere la traduzione nella lingua di quel modello.
Puoi utilizzare il metodo /GET v/1/pronunciation per ottenere una traduzione fonetica iniziale per una parola. Puoi quindi modificare la traduzione per ottenere la pronuncia che desideri. Con il metodo di suoni simili, segui un
processo di prova ed errore. Inoltri la tua traduzione candidata al servizio, sintetizzi la parola come testo di input, ascolti l'audio risultante e modifichi la traduzione candidata. Puoi ripetere il processo finché non sei soddisfatto
della pronuncia.
Per ulteriori informazioni, vedi Esecuzione di query di una parola da una lingua.
Ulteriori informazioni sulla traduzione fonetica
Le seguenti risorse forniscono informazioni sulla traduzione fonetica:
- Per ulteriori informazioni sull'uso di SSML e del suo elemento
<phoneme>, vedere Comprendere SSML. - Per ulteriori informazioni su come specificare i simboli e le traduzioni SPR e IPA, vedere Comprensione dei simboli fonetici.
Traduzione combinata di suoni simili e fonetica
Puoi combinare i metodi di suoni simili e fonetico nella stessa traduzione. Questa funzione può ridurre il lavoro che è coinvolto nella composizione di una traduzione.
Ad esempio, supponiamo che tu abbia utilizzato il metodo di suoni simili per ottenere una parte di una parola pronunciata in modo soddisfacente. Ma ora devi ottimizzare i restanti elementi della parola. Puoi utilizzare il metodo fonetico per
specificare gli aspetti difficili della parola. Il seguente esempio applica la traduzione combinata alla parola trinitroglycerin:
try<phoneme alphabet="ipa" ph="nˈaɪtɹəglɪsəɹɨn"></phoneme>