Regeln für die Erstellung von angepassten Einträgen
Für das Bestücken eines angepassten Modells durch angepasste Einträge (also Paare aus Wort und Umsetzung) gelten die folgenden Regeln und Richtlinien.
Maximale Anzahl angepasster Einträge und Grenzwerte
Für alle angepassten Modelle und Einträge gelten die folgenden Grenzwerte:
- Ein Wort in einem angepassten Eintrag darf höchstens 49 Zeichen enthalten.
- Eine Umsetzung in einem angepassten Eintrag darf höchstens 499 Zeichen enthalten.
- Ein angepasstes Modell darf maximal 20.000 angepasste Einträge enthalten.
- Ein angepasstes Modell kann maximal 1000 angepasste Prompts enthalten.
- Verwenden Sie keine Backslashes, Schrägstriche, Doppelpunkte, Gleichheitszeichen, Ampersands oder Fragezeichen im Namen.
Zeichencodierung
Der Service akzeptiert Einträge für Wörter und Umsetzungen in ASCII- und UTF-8-Zeichencodierung. Verwenden Sie bei Umsetzungen in SPR-Schreibweise die ASCII-Codierung und bei Umsetzungen in IPA-Schreibweise die UTF-8-Codierung.
Leerzeichen
Ein Wort darf keine Leerzeichen enthalten. Der Service verwendet Leerzeichen, um einzelne Wörter im Eingabetext darzustellen.
Beachtung der Groß-/Kleinschreibung
Bei einem Wort muss die Groß-/Kleinschreibung beachtet werden. Angenommen, ein angepasstes Modell enthält beispielsweise den Eintrag {word='Sun', translation='Sunday'}. Der Service wendet auf das Wort sun die Standardaussprache
an, aber die angepasste Umsetzung auf das Wort Sun, da nur dieses Wort mit einem Großbuchstaben beginnt.
Damit eine angepasste Umsetzung auf ein Wort angewendet werden kann, das mit oder aber ohne großen Anfangsbuchstaben vorkommen kann, müssen Sie zwei Einträge erstellen, die diesen beiden Schreibweisen Rechnung tragen. Beziehen Sie nur dann beide dieser Einträge ein, wenn die Umsetzung auch auf beide Formen des Worts angewendet werden soll.
Kontextabhängigkeit
Bei einigen Wörtern sind die Aussprachevarianten kontextabhängig. Dies wird an der folgenden Beispieleingabe erläutert:
St. Anthony lives on Henry St.
Die Standardausspracheregeln des Service erstellen aus diesem Text ordnungsgemäß die folgende synthetische Sprache:
Saint Anthony lives on Henry Street
Falls Sie jedoch die Standardausspracheregeln für die Zeichenfolge St. überschreiben und sie mit saint umsetzen, kann der Service das Wort nicht mehr anhand des Kontextes aussprechen. Durch die Anwendung eines angepassten
Modells, das eine solche Umsetzung enthält, spricht der Service die obige Eingabe wie folgt aus:
Saint Anthony lives on Henry saint
Berücksichtigen Sie solche Fälle bei der Entwicklung von Paaren aus Wort und Umsetzung.
Abschließende Punkte
Der Service wendet ein Wort aus einem angepassten Modell nur auf diejenigen Zeichenfolgen im Eingabetext an, die exakt mit dem Wort übereinstimmen. Ein abschließender Punkt (.) in einem Worteintrag ändert die Synthetisierung des
Worts:
- Ein Wort ohne abschließenden Punkt kann praktisch jedes beliebige Zeichen enthalten. Zu den Zeichen gehören Buchstaben, Ziffern, Interpunktionszeichen (außer dem abschließenden Punkt), Sonderzeichen wie
%,&und@, Anführungszeichen, runde Klammern und eckige Klammern. Die Umsetzung eines solchen Wortes kann jede für den Service gültige Eingabe enthalten, auch Leerzeichen und eine phonetische Darstellung im SSML-Format. - Ein Wort mit abschließendem Punkt kann ausschließlich Buchstaben, Punkte und integrierte Hochkommas (jedoch nicht als erstes oder letztes Zeichen) enthalten. Die Umsetzung eines solchen Wortes kann nur normale Wörter in herkömmlicher Schreibweise enthalten, die durch Leerzeichen oder Bindestriche voneinander abgegrenzt sind. Sie kann keine phonetische Darstellung enthalten.
Ein Beispiel für ein Wort mit einem nachgestellten Punkt ist div.". Angenommen, ein benutzerdefiniertes Modell enthält den Eintrag {word='div.', translation='division'}. Der Service wendet in diesem Fall die Umsetzung
nicht auf die Zeichenfolge "div" an, weil sie keinen abschließenden Punkt umfasst und daher nicht mit dem Eintrag übereinstimmt.
Phonetische Umsetzung für fremdsprachige Wörter
Eine Verwendung der phonetischen Umsetzung ist das Hinzufügen von Aussprachevariationen für Wörter, die für die Basissprache des angepassten Modells fremdsprachige Wörter sind. Zum Beispiel können Sie eine Aussprachevariante für ein französisches Wort zu einem angepassten Modell hinzufügen, das auf Englisch basiert. In diesem Fall müssen Sie die phonetischen Symbole für die Sprache des angepassten Modells (Englisch) verwenden.
Dasselbe phonetische Symbol kann verschiedene Laute für verschiedene Sprachen erzeugen. Nicht alle phonetischen Symbole werden für alle Sprachen unterstützt. Stellen Sie beim Definieren einer Umsetzung sicher, dass Sie die phonetischen Symbole für die Basissprache des angepassten Modells verwenden.
IBM SPR-Einträge bearbeiten
SPR (Symbolic Phonetic Representation) ist ein von IBM entwickeltes eigenes und sprachenabhängiges Format zur Angabe der Aussprache für ein Wort. Für jede unterstützte Sprache enthält SPR ein Phonemalphabet, Symbole für Silbengrenzen sowie Symbole für den Betonungsgrad. Für die Erstellung von SPR-Einträgen gelten die folgenden Grundregeln:
-
Die Standardaussprache, die die Anpassungsschnittstelle für ein Wort zurückgibt, beginnt mit einem ```` (Anführungszeichen) und ist in '
[](eckige Klammern) eingeschlossen. Für das Worttomatogibt die Schnittstelle beispielsweise die folgende Aussprache zurück:`[.0tx.1ma.0to]Lassen Sie die umgekehrten Anführungszeichen und die eckigen Klammern weg, wenn Sie die Umsetzung eines Wortes mit den Methoden der Anpassungsschnittstelle angeben.
-
Mit einem Punkt können Sie den Beginn einer Silbe in einer Umsetzung kenntlich machen. Punkte sind jedoch optional und haben keinen Einfluss auf die Aussprache des Wortes. Sie treten bei der Aussprache für ein Wort nur dann in Erscheinung, wenn Sie sie in die Umsetzung des Wortes einbeziehen. Verwenden Sie keine Leerzeichen, um Silbengrenzen anzugeben.
-
IBM empfiehlt, dem Vokal mit der Hauptbetonung für ein Wort das Symbol
1voranzustellen; dies ist jedoch nicht zwingend erforderlich. Der Service ermittelt, wo die Betonung zu setzen ist, falls Sie sie nicht angeben. Mit einem Symbol2können Sie außerdem die Position für eine Nebenbetonung angeben, aber auch die Verwendung des Symbols2ist optional. Sie treten bei der Aussprache für ein Wort nur dann in Erscheinung, wenn Sie sie in die Umsetzung des Wortes einbeziehen.
Weitere Informationen zum Arbeiten mit SPR finden Sie unter Erläuterungen zu phonetischen Zeichen.
Mit Einträgen in Japanisch arbeiten
Für die Erstellung von Einträgen für Wörter in einem angepassten Modell für Japanisch gibt es zusätzliche Regeln und ein Feld part_of_speech:
-
Eine gleich klingende Umsetzung darf ausschließlich Katakana-Zeichen enthalten. Kanji- und Hiragana-Zeichen sind nicht zulässig.
-
Wenn Sie eine (gleich klingende oder phonetische) Umsetzung für ein Wort erstellen, können Sie auch ein optionales Feld
part_of_speechangeben, um die Wortart des Wortes zu benennen. Der Service erzeugt anhand der Wortart den korrekten Tonfall für das Wort. Eine vollständige Liste enthält der Abschnitt Japanische Wortarten. -
Für jedes Wort können Sie nur einen einzigen Eintrag erstellen und nur eine einzige Wortart angeben. Die Erstellung von mehreren Einträgen für dasselbe Wort mit unterschiedlichen Wortarten (z. B. Nomen und Verb) ist nicht möglich. Durch das Hinzufügen einer Umsetzung für ein Wort, das in einem Modell vorhanden ist, wird die vorhandene Umsetzung des Wortes einschließlich der Wortart überschrieben.
Erstellen Sie keine angepassten Einträge für lange Ausdrücke, damit synthetisierte Sprache natürlicher klingt. Erstellen Sie nur für einzelne Wörter oder kurze Ausdrücke Umsetzungen. Beachten Sie, dass die Umsetzung bei anderen Sprachen auf einzelne Wörter beschränkt ist.
-
Der Service wendet das längste übereinstimmende Wort aus den Paaren für Wort und Umsetzung an, die für ein angepasstes Modell definiert sind. Nehmen wir beispielsweise an, ein angepasstes Modell enthält die drei folgenden Einträge:
{ "words": [ { "word": "NY", "translation": "ニューヨーク", "part_of_speech": "Mesi" }, { "word": "NYC", "translation": "ニューヨークシティ", "part_of_speech": "Mesi" }, { "word": "YC", "translation": "ヨコハマチューカガイ", "part_of_speech": "Mesi" } ] }With these entries, assume that the service receives the following input text:
一週間NYCを訪問した. In diesem Fall passt der Dienst auf das Wort "NYC, weil "NYClänger ist als "NYund weil "NYCvor "YCpasst.
Japanische Wortarten
In der folgenden Tabelle sind die Wortarten aufgelistet, die für angepasste Einträge in Japanisch unterstützt werden. Weitere Informationen zum Angeben einer Wortart für einen angepassten Eintrag in Japanisch enthält der Abschnitt Wörter zu einem angepassten Modell für Japanisch hinzufügen.
part_of_speech Argument |
Japanische Bedeutung | Deutsche Bedeutung |
|---|---|---|
Dosi |
Doushi | Verb |
Fuku |
Fukishi | Adverb |
Gobi |
Gobi | Flexion |
Hoka |
Hoka | Sonstiges (Wörter, die eine spezielle grammatische Bedeutung haben, die keiner anderen Wortart zugeordnet werden kann. Zum Beispiel ' ありがとう für "Danke") |
Jodo |
Jodoushi | Hilfsverb |
Josi |
Joshi | Postpositionspartikel (zum Beispiel が の を für "von") |
Kato |
Kantoushi | Interjektion |
Kedo |
Keiyodoushi | Verbaladjektiv |
Keyo |
Keiyoshi | Adjektiv (z. B. 美し für "schön" oder 明る für "hell".) |
Kigo |
Kigou | Symbol |
Koyu |
Koyuumeishi | Eigenname |
Mesi |
Meishi | Substantiv |
Reta |
Rentaishi | Determinativ |
Stbi |
Setsubiji | Suffix |
Stto |
Settoji | Präfix |
Stzo |
Setsuzokushi | Konjunktion |
Suji |
Suuji | Numerale |