Regole per la creazione di voci personalizzate
Per popolare un modello personalizzato con voci personalizzate (coppie di parole/traduzioni), si applicano le seguenti regole e linee guida.
Numero massimo di voci personalizzate e limiti
I seguenti limiti si applicano a tutte le voci e a tutti i modelli personalizzati:
- Una parola in una voce personalizzata può contenere un massimo di 49 caratteri.
- Una traduzione in una voce personalizzata può contenere un massimo di 499 caratteri.
- Un modello personalizzato può includere un massimo di 20.000 voci personalizzate.
- Un modello personalizzato può includere un massimo di 1000 prompt personalizzati.
- Non utilizzare backslash, slash, punti, segni di uguale, ampere o punti interrogativi nel nome.
Codifica dei caratteri
Il servizio accetta la codifica dei caratteri ASCII e UTF-8 per le voci di parola e traduzione. Per le traduzioni, utilizza la codifica ASCII per le notazioni SPR e la codifica UTF-8 per le notazioni IPA.
Spazio vuoto
Una parola non può includere spazi bianchi. Il servizio utilizza lo spazio vuoto per delineare le singole parole nel testo di input.
Sensibilità alle maiuscole/minuscole
Una parola è sensibile alle maiuscole e alle minuscole. Ad esempio, supponiamo che un modello personalizzato contenga la voce {word='Sun', translation='Sunday'}. Il servizio applica la sua pronuncia predefinita alla parola sun ma la traduzione personalizzata alla parola Sun, poiché solo quest'ultima ha una lettera maiuscola iniziale.
Per applicare una traduzione personalizzata a una parola che potrebbe presentarsi con o senza lettera maiuscola iniziale, crea due voci per entrambe le possibili ricorrenze. Includi entrambe le voci solo se la traduzione deve essere applicata a entrambe le forme della parola.
Sensibilità al contesto
Le pronunce di alcune parole sono sensibili al contesto. Ad esempio, considera la seguente frase di input di esempio:
St. Anthony lives on Henry St.
Le regole di pronuncia predefinite del servizio sintetizzano correttamente questo testo come
Saint Anthony lives on Henry Street
Tuttavia, se sovrascrivi le regole di pronuncia predefinite per la stringa St. per tradurla come saint, il servizio non può più pronunciare la parola in base al contesto. L'applicazione di un modello personalizzato
che include tale traduzione fa sì che il servizio pronunci la frase precedente in ingresso come
Saint Anthony lives on Henry saint
Considera questi casi quando sviluppi coppie di parole/traduzioni.
Punti finali
Il servizio applica una parola da un modello personalizzato solo a quelle stringhe nel testo di input che corrispondono esattamente alla parola. Un " . (punto) in coda a una parola cambia il modo in cui la parola viene sintetizzata:
- Una parola che non ha un punto finale può contenere praticamente qualsiasi carattere. I caratteri comprendono lettere, cifre, punteggiatura (ad eccezione del punto finale), simboli non letterali (come "
%, "&e "@), virgolette, parentesi, parentesi e così via. La sua traduzione può includere qualsiasi input consentito per il servizio, inclusi lo spazio vuoto e una rappresentazione fonetica in formato SSML. - Una parola che ha un punto finale può contenere solo lettere, punti e apostrofi interni (non come primo o ultimo carattere). La traduzione della parola può contenere solo parole normali con ortografia ordinaria separate da spazio vuoto o trattini. Non può contenere una rappresentazione fonetica.
Un esempio di parola con un punto finale è div.". Si supponga che un modello personalizzato includa la voce {word='div.', translation='division'}. Il servizio non applica la traduzione alla stringa "div"
perché non include un punto finale e pertanto non corrisponde alla voce.
Traduzione fonetica per le parole straniere
Un uso della traduzione fonetica è quello di aggiungere la pronuncia di parole estranee alla lingua di base del modello personalizzato. Ad esempio, si può aggiungere la pronuncia di una parola francese a un modello personalizzato basato sull'inglese. In questo caso, è necessario utilizzare i simboli fonetici della lingua del modello personalizzato, l'inglese.
Lo stesso simbolo fonetico può produrre suoni diversi per lingue diverse. Inoltre, non tutti i simboli fonetici sono supportati per tutte le lingue. Quando si definisce una traduzione, assicurarsi di utilizzare i simboli fonetici della lingua di base del modello personalizzato.
Utilizzo delle voci IBM SPR
La rappresentazione SPR (Symbolic Phonetic Representation ) è un formato proprietario, dipendente dalla lingua sviluppato da IBM per specificare la pronuncia di una parola. Per ogni lingua supportata, SPR include un alfabeto fonema, simboli per le sillabazioni e simboli per i livelli di accento lessicale. Le seguenti regole di base si applicano alla creazione di voci SPR:
-
La pronuncia predefinita che l'interfaccia di personalizzazione restituisce per una parola inizia con un ``` (virgolette) ed è racchiusa in '
[](parentesi quadre). Ad esempio, l'interfaccia restituisce la seguente pronuncia per la parolatomato:`[.0tx.1ma.0to]Ometti la virgoletta aperta e le parentesi quadre quando specifichi la traduzione di una parola con i metodi dell'interfaccia di personalizzazione.
-
Puoi utilizzare un punto per indicare l'inizio di una sillaba in una traduzione, ma i punti sono facoltativi e non influiscono sulla pronuncia della parola. Vengono riportati nella pronuncia di una parola solo se li includi nella traduzione della parola. Non utilizzare gli spazi per indicare le sillabazioni.
-
IBM ti consiglia di precedere la vocale che ha l'accento principale per una parola con un simbolo
1, sebbene non sia strettamente necessario. Il servizio determina dove si presenta l'accento se non lo indichi tu. Puoi anche utilizzare un simbolo2per indicare la posizione di ogni accento secondario, ma anche l'utilizzo dei simboli2è facoltativo. Vengono riportati nella pronuncia di una parola solo se li includi nella traduzione della parola.
Per ulteriori informazioni sull'utilizzo dell'SPR, vedere Comprensione dei simboli fonetici.
Utilizzo di voci in giapponese
Regole aggiuntive e un campo " part_of_speech si applicano alla creazione di voci per le parole in un modello personalizzato giapponese:
-
Una traduzione di suoni simili può contenere solo caratteri Katakana. I caratteri Kanji e Hiragana non sono consentiti.
-
Quando crei una traduzione (suoni simili o fonetica) per una parola, puoi anche specificare un campo
part_of_speechfacoltativo per identificare la parte del discorso della parola. Il servizio utilizza la parte del discorso per produrre l'intonazione corretta per la parola. Per un elenco completo, vedi Parti del discorso in giapponese. -
Per ogni parola puoi creare solo una singola voce e puoi specificare solo una singola parte del discorso. Non puoi creare più voci con parti del discorso diverse (ad esempio, sostantivo e verbo) per la stessa parola. L'aggiunta di una traduzione per una parola che esiste in un modello sovrascrive la traduzione esistente della parola, compresa la sua parte di discorso.
Per migliorare la naturalezza del parlato sintetizzato, non creare voci personalizzate per le frasi lunghe. Creare traduzioni solo per singole parole o brevi frasi. Si noti che altre lingue limitano la traduzione a singole parole.
-
Il servizio applica la parola corrispondente più lunga tra le coppie parola/traduzione definite per un modello personalizzato. Ad esempio, considera le seguenti tre voci per un modello personalizzato.
{ "words": [ { "word": "NY", "translation": "ニューヨーク", "part_of_speech": "Mesi" }, { "word": "NYC", "translation": "ニューヨークシティ", "part_of_speech": "Mesi" }, { "word": "YC", "translation": "ヨコハマチューカガイ", "part_of_speech": "Mesi" } ] }With these entries, assume that the service receives the following input text:
一週間NYCを訪問した. In questo caso, il servizio corrisponde alla parola "NYCperché "NYCè più lungo di "NYe perché "NYCcorrisponde prima di "YC.
Parti del discorso in giapponese
La seguente tabella elenca le parti del discorso supportate per le voci personalizzate in giapponese. Per ulteriori informazioni sulla specifica della parte del discorso per una voce personalizzata in giapponese, vedi Aggiunta di parole a un modello personalizzato in giapponese.
part_of_speech argomento |
Significato in giapponese | Significato in inglese |
|---|---|---|
Dosi |
Doushi | Verbo |
Fuku |
Fukishi | Avverbio |
Gobi |
Gobi | Inflessione |
Hoka |
Hoka | Altro (parole che hanno un significato grammaticale particolare che non rientra in nessun'altra parte del discorso. Ad esempio, ありがとう per "grazie") |
Jodo |
Jodoushi | Verbo ausiliario |
Josi |
Joshi | Particella postposizionale (ad esempio, が の を per "di") |
Kato |
Kantoushi | Interiezione |
Kedo |
Keiyodoushi | Verbo aggettivale |
Keyo |
Keiyoshi | Aggettivo (ad esempio, 美し per "bello" o 明る per "luminoso") |
Kigo |
Kigou | Simbolo |
Koyu |
Koyuumeishi | Nome proprio |
Mesi |
Meishi | Nome |
Reta |
Rentaishi | Determinante |
Stbi |
Setsubiji | Suffisso |
Stto |
Settoji | Prefisso |
Stzo |
Setsuzokushi | Congiunzione |
Suji |
Suuji | Numerale |