Informationen zu Text to Speech
Der Service IBM Watson® Text to Speech stellt APIs bereit, die die Sprachsynthesefunktionen von IBM verwenden, um geschriebenen Text in natürlich klingende Sprache zu konvertieren. Der Service überträgt die synthetisch erstellte Audioausgabe mit minimaler Verzögerung zurück an den Client. Die Audioausgabe verwendet eine der Sprache und dem Dialekt angemessene Kadenz und Intonation, um Stimmen zu erzeugen, die einen angenehmen Sprechfluss und einen natürlichen Klang aufweisen.
Der Service kann sowohl in Anwendungen wie sprachgesteuerten Chatbots als auch in einer Vielzahl von sprachgesteuerten und rein akustischen Anwendungen genutzt werden, wie z. B. in Tools für Behinderte oder Sehbehinderte, in Video-Filmkommentaren und Voice-Over sowie in Automatisierungslösungen für Bildungseinrichtungen und private Zwecke. Er ist für jede Anwendung geeignet, bei der Audio die bevorzugte Ausgabemethode ist.
Produktversionen
Text to Speech kann als verwalteter Cloud-Service implementiert oder lokal installiert werden. In dieser Dokumentation wird die Verwendung beider Versionen des Produkts beschrieben. Informationen wie Themen, Absätze und Beispiele, die ausschließlich für eine Version gelten, sind deutlich gekennzeichnet:
- IBM Cloud für verwaltete Instanzen von Text to Speech, die auf IBM Cloud gehostet werden, oder für Instanzen, die aufIBM Cloud Pak for Data as a Service. Informationen zu allen Service-Updates finden Sie in den Versionshinweisen für Text to Speech für IBM Cloud.
- IBM Cloud Pak for DataIBM Software Hub für installierte oder lokale Instanzen von Text to Speech für IBM Cloud Pak for Data. Weitere Informationen zur Installation und Verwaltung von Watson Speech-Diensten finden Sie unter Installationsübersicht. Informationen zu allen Serviceaktualisierungen finden Sie in den Versionshinweisen zu Text to Speech für IBM Cloud Pak for Data und in den Versionshinweisen zu Text to Speech für IBM Software Hub.
Sprachsynthese
Der Service Text to Speech unterstützt HTTP- und WebSocket-Schnittstellen für die Sprachsynthese. Beide Schnittstellen akzeptieren einfachen Text oder Text mit der XML-basierten Markup-Sprache 'Speech Synthesis Markup Language' (SSML). Die WebSocket-Schnittstelle kann auch Taktinformationen zu den Wörtern der Audiodaten erzeugen. Weitere Informationen finden Sie unter den folgenden Dienstmerkmalen:
Anpassung
Der Service stellt eine Anpassungsschnittstelle bereit, die Sie verwenden können, um anzugeben, wie der Service ungewöhnliche Wörter aus Ihrem Eingabetext aussprechen soll. Sie können angepasste Modelle definieren, um Wörterverzeichnisse mit Wörtern für das Lexikon Ihrer Anwendung einzubeziehen. Weitere Informationen enthält der Abschnitt zum Anpassen des Service.
Sprachunterstützung
Der Service bietet neuronale Stimmen für die Synthese von Text zu Sprache in vielen Sprachen und Dialekten:
- Niederländisch (Niederlande)
- Englisch (Dialekte in Australien, Großbritannien und den USA)
- Französisch (kanadische und französische Dialekte)
- Deutsch
- Italienisch
- Japanisch
- Koreanisch
- Portugiesisch (Brasilien)
- Spanisch (kastilischer, lateinamerikanischer und nordamerikanischer Dialekt)
Für verschiedene Sprachen bietet der Service Frauenstimmen und/oder Männerstimmen. Weitere Informationen zu den unterstützten Sprachen und Stimmen, den Typen von Stimmen, die der Service für jede Sprache bereitstellt, und ihrem Status für beide Versionen des Service finden Sie unter Sprachen und Stimmen.
Audiounterstützung
Der Service erzeugt Audiodaten in vielen gängigen Formaten:
- A-Law
- Basisaudiodaten
- Free Lossless Audio Codec (FLAC)
- Lineare 16-Bit-PCM (Pulscodemodulation)
- MP3 (oder MPEG)
- Mu-law (oder U-law)
- Ogg- oder WebM-Audio mit Opus- oder Vorbis-Codec
- Waveform Audio File Format (WAV)
Verschiedene Formate unterstützen unterschiedliche Abtastraten und andere Merkmale. Weitere Informationen finden Sie unter Audioformate verwenden.
Features als Betaversion
Von IBM werden teilweise Features und Sprachunterstützung veröffentlicht, die als Betaversion klassifiziert sind. Derartige Features werden bereitgestellt, um Ihnen die Gelegenheit zu geben, die Funktionalität zu bewerten. Sie können instabil sein und kurzfristig geändert oder entfernt werden. Ihre Verwendung in einer Produktionsumgebung ist nicht vorgesehen.
Beta-Features bieten möglicherweise nicht dieselbe Leistung oder Kompatibilität wie allgemein verfügbare Features. Allgemein verfügbare Features können in einer Produktionsumgebung verwendet werden.
Preisstruktur
IBM Cloud
Der Service bietet mehrere Preistarife, um Ihren Nutzungs- und Anwendungsanforderungen entsprechen zu können. Weitere Informationen zu den Preisplänen oder zum Kauf eines Plans finden Sie unter Text to Speech im IBM Cloud® Katalog.