Häufig gestellte Fragen zur Verwendung des Service
Zu den häufig gestellten Fragen zu IBM Watson® Text to Speech gehören Fragen zur Sprachsynthese, zu unterstützten Sprachen, zu Audioformaten und zu anderen Themen. Alle FAQs zu IBM Cloud® finden Sie unter Häufig gestellte Fragen.
Wie kann ich auf meine Serviceberechtigungsnachweise zugreifen?
Wie Sie auf Ihre Serviceberechtigungsnachweise zugreifen, hängt davon ab, ob Sie Text to Speech mit IBM Cloud® oder IBM Cloud Pak® for Data verwenden. Weitere Informationen zum Abrufen Ihrer Berechtigungsnachweise für beide Versionen finden Sie unter Vorbereitende Schritte im Einführungslernprogramm.
Nachdem Sie Ihre Serviceberechtigungsnachweise erhalten haben, können Sie sich anhand der folgenden Abschnitte über die Authentifizierung beim Service informieren:
Welche Sprachen unterstützt der Service?
Der Text to Speech-Service unterstützt männliche und weibliche Stimmen in verschiedenen gesprochenen Sprachen:
- Der Service bietet expressive neuronale Stimmen für Englisch (Australien und Vereinigte Staaten).
- Der Dienst bietet verbesserte neuronale Stimmen für Niederländisch-Niederländisch, Englisch (Vereinigtes Königreich und Vereinigte Staaten), Französisch (Kanada und Frankreich), Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch (Brasilien) und Spanisch (Kastilisch, Lateinamerika und Nordamerika).
Einige Sprachen und Stimmen sind nur für IBM Cloud® verfügbar, nicht für IBM Cloud Pak® for Data. Weitere Informationen zu den verfügbaren Stimmen für alle Sprachen finden Sie unter Sprachen und Stimmen.
Wie synthetisiert der Service Audiodaten?
Der Service Text to Speech bietet Stimmen, bei denen Text mithilfe neuronaler Technologien zu Sprache synthetisiert wird. Die synthetische Erstellung von Sprache aus Text ist grundsätzlich komplex. Weitere Informationen finden Sie
Welche Audioausgabeformate stehen zur Verfügung?
Standardmäßig werden vom Service Text to Speech Audiodaten im OGG-Format mit dem Opus-Codec (audio/ogg;codecs=opus) zurückgegeben. Der Service unterstützt viele andere Audioformate für Ihre Anwendungsanforderungen. Weitere Informationen
finden Sie unter Unterstützte Audioformate.
Wie kann ich meinen Text in Sprache umwandeln?
Um Text für die Erstellung synthetischer Audioausgabe an den Service zu übergeben, erstellen Sie eine HTTP- oder WebSocket-Anforderung. Sie können die API direkt verwenden oder eines der Watson-SDKs verwenden. Die Einführung enthält Beispiele für die HTTP-Methoden POST /v1/synthesize und GET /v1/synthesize. Die API & SDK Referenz zeigt Beispiele für alle Schnittstellen
und Methoden.
Es gibt keine grafische Benutzerschnittstelle für die Textübergabe. In der Demo auf Text to Speech können Sie ein Beispiel für den Dienst in Aktion ausprobieren. Die Demo akzeptiert einen kurzen Text als Eingabe, aus der Sprache mit unterschiedlichen Stimmen generiert wird.
Kann ich die Art und Weise ändern, wie der Service Eingabetext interpretiert und synthetische Audiodaten erstellt?
Sie können Speech Synthesis Markup Language (SSML) verwenden, um Aspekte des Syntheseprozesses zu steuern, wie z. B. Aussprache, Lautstärke, Tonhöhe, Geschwindigkeit und andere Attribute.
- Allgemeine Informationen zu SSML finden Sie in den Erläuterungen zu SSML.
- Informationen zu den unterstützten SSML-Elementen finden Sie unter SSML-Elemente.
Welche Programmiersprachen kann ich verwenden?
Der Service unterstützt SDKs für viele gängige Programmiersprachen und Plattformen.
- Weitere Informationen zu den SDKs und zu den Links zu den SDKs bei GitHub finden Sie unter Watson SDKs.
- Weitere Informationen zu allen Methoden der SDKs für den Dienst Text to Speech finden Sie in der API & SDK-Referenz.
Wie viel Text kann ich maximal für die Synthese übergeben?
Sie können die folgenden maximalen Textmengen für eine Anforderung zur Sprachsynthese mit jeder der folgenden Servicemethoden übergeben:
- HTTP-Methode
GET /v1/synthesize- Maximal 8 KB Eingabe insgesamt, die den Eingabetext, die URL und die Header umfassen. - HTTP-Methode
POST /v1/synthesize- Maximal 8 KB für die URL und die Header. Maximal 5 KB für den Eingabetext einschließlich SSML. - WebSocket-Methode
/v1/synthesize- Maximal 5 KB Eingabetext einschließen SSML.
Alle Zeichen der Eingabe, einschließlich Leerzeichen und Zeichen, die Teil der SSML-Elemente sind, werden auf die maximale Datenmenge angerechnet. Für Abrechnungszwecke werden Leerzeichen nicht gezählt. Weitere Informationen finden Sie unter Datengrenzwerte.
Wie erfolgt die Anpassung?
Die Anpassungsschnittstelle des Text to Speech-Service erstellt ein Wörterverzeichnis mit Wörtern und deren Umsetzungen für eine bestimmte Sprache. Dieses Wörterverzeichnis wird als angepasstes Modell bezeichnet. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung.
Wie erstelle ich ein angepasstes Modell?
Bevor Sie beginnen, sehen Sie sich die Richtlinien für das Arbeiten mit der Anpassungsschnittstelle an. Schauen Sie sich anschließend die Schritte und Beispiele für das Erstellen, Abfragen, Aktualisieren und Löschen von angepassten Modellen unter Angepasste Modelle erstellen und verwalten an. Lesen Sie außerdem den Abschnitt Angepasste Einträge erstellen und verwalten. Dort finden Sie Beispiele und Anleitungen zum Hinzufügen relevanter Trainingsdaten.
Kann ich eine angepasste Stimme erstellen?
IBM Cloud
Als Premiumkunde können Sie mit IBM eine neue angepasste Stimme für Ihren speziellen Anwendungsfall und Zielmarkt schulen. Die Erstellung einer angepassten Stimme unterscheidet sich von der Anpassung einer der vorhandenen Stimmen des Service. Eine angepasste Stimme ist eine eindeutige neue Stimme, die auf Audiotrainingsdaten basiert, die der Kunde bereitstellt. IBM kann eine angepasste Stimme mit nur einer Stunde Schulungsdaten schulen.
Um eine angepasste Stimme anzufordern oder weitere Informationen zu erhalten, füllen Sie dieses IBM-Anforderungsformularaus und übergeben Sie es.
Welche Grenzwerte gibt es für ein angepasstes Modell?
Die folgenden Grenzwerte gelten für alle angepassten Modelle:
- Ein Wort in einem angepassten Eintrag darf höchstens 49 Zeichen enthalten.
- Eine Umsetzung in einem angepassten Eintrag darf höchstens 499 Zeichen enthalten.
- Ein angepasstes Modell darf maximal 20.000 angepasste Einträge enthalten.
Weitere Informationen finden Sie im Abschnitt Regeln für die Erstellung von angepassten Einträgen.
Wo finde ich Pläne und Preisinformationen?
IBM Cloud
Der Service Text to Speech bietet mehrere Preistarife. Weitere Informationen zu den Preisen finden Sie unter Text to Speech im IBM Cloud Katalog.