Informationen zu Text to Speech

Der Service IBM Watson® Text to Speech stellt APIs bereit, die die Sprachsynthesefunktionen von IBM verwenden, um geschriebenen Text in natürlich klingende Sprache zu konvertieren. Der Service überträgt die synthetisch erstellte Audioausgabe mit minimaler Verzögerung zurück an den Client. Die Audioausgabe verwendet eine der Sprache und dem Dialekt angemessene Kadenz und Intonation, um Stimmen zu erzeugen, die einen angenehmen Sprechfluss und einen natürlichen Klang aufweisen.

Der Service kann sowohl in Anwendungen wie sprachgesteuerten Chatbots als auch in einer Vielzahl von sprachgesteuerten und rein akustischen Anwendungen genutzt werden, wie z. B. in Tools für Behinderte oder Sehbehinderte, in Video-Filmkommentaren und Voice-Over sowie in Automatisierungslösungen für Bildungseinrichtungen und private Zwecke. Er ist für jede Anwendung geeignet, bei der Audio die bevorzugte Ausgabemethode ist.

Produktversionen

Text to Speech kann als verwalteter Cloud-Service implementiert oder lokal installiert werden. In dieser Dokumentation wird die Verwendung beider Versionen des Produkts beschrieben. Informationen wie Themen, Absätze und Beispiele, die ausschließlich für eine Version gelten, sind deutlich gekennzeichnet:

Sprachsynthese

Der Service Text to Speech unterstützt HTTP- und WebSocket-Schnittstellen für die Sprachsynthese. Beide Schnittstellen akzeptieren einfachen Text oder Text mit der XML-basierten Markup-Sprache 'Speech Synthesis Markup Language' (SSML). Die WebSocket-Schnittstelle kann auch Taktinformationen zu den Wörtern der Audiodaten erzeugen. Weitere Informationen finden Sie unter den folgenden Dienstmerkmalen:

Anpassung

Der Service stellt eine Anpassungsschnittstelle bereit, die Sie verwenden können, um anzugeben, wie der Service ungewöhnliche Wörter aus Ihrem Eingabetext aussprechen soll. Sie können angepasste Modelle definieren, um Wörterverzeichnisse mit Wörtern für das Lexikon Ihrer Anwendung einzubeziehen. Weitere Informationen enthält der Abschnitt zum Anpassen des Service.

Sprachunterstützung

Der Service bietet neuronale Stimmen für die Synthese von Text zu Sprache in vielen Sprachen und Dialekten:

  • Niederländisch (Niederlande)
  • Englisch (Dialekte in Australien, Großbritannien und den USA)
  • Französisch (kanadische und französische Dialekte)
  • Deutsch
  • Italienisch
  • Japanisch
  • Koreanisch
  • Portugiesisch (Brasilien)
  • Spanisch (kastilischer, lateinamerikanischer und nordamerikanischer Dialekt)

Für verschiedene Sprachen bietet der Service Frauenstimmen und/oder Männerstimmen. Weitere Informationen zu den unterstützten Sprachen und Stimmen, den Typen von Stimmen, die der Service für jede Sprache bereitstellt, und ihrem Status für beide Versionen des Service finden Sie unter Sprachen und Stimmen.

Audiounterstützung

Der Service erzeugt Audiodaten in vielen gängigen Formaten:

  • A-Law
  • Basisaudiodaten
  • Free Lossless Audio Codec (FLAC)
  • Lineare 16-Bit-PCM (Pulscodemodulation)
  • MP3 (oder MPEG)
  • Mu-law (oder U-law)
  • Ogg- oder WebM-Audio mit Opus- oder Vorbis-Codec
  • Waveform Audio File Format (WAV)

Verschiedene Formate unterstützen unterschiedliche Abtastraten und andere Merkmale. Weitere Informationen finden Sie unter Audioformate verwenden.

Features als Betaversion

Von IBM werden teilweise Features und Sprachunterstützung veröffentlicht, die als Betaversion klassifiziert sind. Derartige Features werden bereitgestellt, um Ihnen die Gelegenheit zu geben, die Funktionalität zu bewerten. Sie können instabil sein und kurzfristig geändert oder entfernt werden. Ihre Verwendung in einer Produktionsumgebung ist nicht vorgesehen.

Beta-Features bieten möglicherweise nicht dieselbe Leistung oder Kompatibilität wie allgemein verfügbare Features. Allgemein verfügbare Features können in einer Produktionsumgebung verwendet werden.

Preisstruktur

IBM Cloud

Der Service bietet mehrere Preistarife, um Ihren Nutzungs- und Anwendungsanforderungen entsprechen zu können. Weitere Informationen zu den Preisplänen oder zum Kauf eines Plans finden Sie unter Text to Speech im IBM Cloud® Katalog.