Releaseinformationen für Text to Speech for IBM Cloud

IBM Cloud

Die folgenden Funktionen und Änderungen wurden für jede Version und jedes Update von verwalteten Instanzen von „ IBM Watson® Text to Speech “, die auf IBM Cloud gehostet werden, sowie für Instanzen, die auf IBM Cloud Pak for Data as a Service. Sofern nicht anders angegeben, sind alle Änderungen mit früheren (älteren) Versionen kompatibel und werden für alle neuen und vorhandenen Anwendungen automatisch und transparent verfügbar gemacht.

Informationen zu bekannten Einschränkungen des Service finden Sie unter Bekannte Einschränkungen.

Informationen zu Releases und Aktualisierungen des Service für IBM Cloud Pak for Data finden Sie unter Releaseinformationen für Text to Speech for IBM Cloud Pak for Data.

15. Mai 2026

Neue natürliche Frauenstimme (brasilianisches Portugiesisch)

Der Dienst unterstützt nun eine neue weibliche natürliche Stimme für brasilianisches Portugiesisch:

  • pt-BR_IsabelaNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie

26. März 2026

Veraltete v1 zu v3 Sprachübergang

Zuvor veraltete Standard-Voices zur Verkettung ( v1 ) werden nun während der Synthese durch ihre neuralen Äquivalente ( v3 ) ersetzt. Wenn eine Anfrage eine dieser v1 Stimmen angibt, wird stattdessen die entsprechende v3 Stimme verwendet.

  • de-DE_BirgitVoice -> de-DE_BirgitV3Voice
  • de-DE_DieterVoice -> de-DE_DieterV3Voice
  • en-GB_KateVoice -> en-GB_KateV3Voice
  • en-US_AllisonVoice -> en-US_AllisonV3Voice
  • en-US_LisaVoice -> en-US_LisaV3Voice
  • en-US_MichaelVoice -> en-US_MichaelV3Voice
  • es-ES_EnriqueVoice -> es-ES_EnriqueV3Voice
  • es-ES_LauraVoice -> es-ES_LauraV3Voice
  • es-LA_SofiaVoice -> es-LA_SofiaV3Voice
  • es-US_SofiaVoice -> es-US_SofiaV3Voice
  • fr-FR_ReneeVoice -> fr-FR_ReneeV3Voice
  • it-IT_FrancescaVoice -> it-IT_FrancescaV3Voice
  • ja-JP_EmiVoice -> ja-JP_EmiV3Voice
  • pt-BR_IsabelaVoice -> pt-BR_IsabelaV3Voice

Wenn Sie den optionalen Parameter „ voice “ in einer Sprachsyntheseanfrage weglassen, verwendet der Dienst nun standardmäßig „ en-US_MichaelV3Voice “. Diese neuronale Stimme ( v3 ) ersetzt die bisherige standardmäßige Verkettungsstimme ( v1 ) en-US_MichaelVoice.

11. März 2026

Wichtig! Abschaffung der Beta-Funktion Tune by Example

Die Beta-Funktion Tune by Example ist veraltet. Die APIs zur Erstellung neuer Prompts oder Sprechermodelle werden nicht mehr unterstützt.

  • Bestehende Benutzer: Bestehende Anpassungen, die bereits Prompts oder Sprechermodelle enthalten, werden für einen begrenzten Zeitraum weiterhin für die Sprachsynthese funktionieren. Es können jedoch keine neuen Prompts oder Sprechermodelle erstellt werden.
  • Neue Benutzer: Die APIs zum Erstellen von Prompts oder Sprechermodellen sind deaktiviert und können nicht verwendet werden.

Die Funktion "Tune by Example" wird in einer zukünftigen Version vollständig aus dem Dienst entfernt werden. Nach der Entfernung wird die Synthese mit Anpassungen, die auf Eingabeaufforderungen oder Lautsprechermodellen basieren, nicht mehr unterstützt.

13. Januar 2026

Neue englische natürliche Stimmen

Der Dienst unterstützt nun zwei neue natürliche Stimmen – eine männliche und eine weibliche – für australisches Englisch:

  • en-AU_JackNatural
  • en-AU_HeidiNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie

05. Dezember 2025

Neue lateinamerikanische spanische Naturstimmen

Der Dienst unterstützt nun zwei neue natürliche Stimmen – eine männliche und eine weibliche – für lateinamerikanisches Spanisch:

  • es-LA_AlejandroNatural
  • es-LA_DanielaNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie

31. Oktober 2025

Neue brasilianisch-portugiesische Naturstimmen

Der Dienst unterstützt jetzt zwei neue natürliche Stimmen - eine männliche und eine weibliche - für brasilianisches Portugiesisch:

  • pt-BR_LucasNatural
  • pt-BR_CamilaNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie

24. Juli 2025

Neue englische natürliche Stimmen

Der Dienst unterstützt jetzt vier neue natürliche Stimmen - zwei männliche und zwei weibliche - für US-Englisch:

  • en-US_EmmaNatural
  • en-US_EthanNatural
  • en-US_JacksonNatural
  • en-US_VictoriaNatural

Der Dienst unterstützt jetzt zwei neue natürliche Stimmen - männlich und weiblich - für britisches Englisch:

  • en-GB_ChloeNatural
  • en-GB_GeorgeNatural

Der Dienst unterstützt jetzt eine neue weibliche natürliche Stimme für CA English:

  • en-CA_HannahNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie

09. Juli 2025

Abschaffung von V1 Stimmen
Mit Wirkung vom 07. September 2025 werden alle Stimmen von V1 aus dem Dienst genommen. Alle veralteten v1 Stimmen werden innerhalb der nächsten 12 Monate automatisch auf die entsprechenden v3 Stimmen umgestellt.

19. Mai 2025

Neue Generation von Stimmen - Natürliche Stimmen

Der Dienst unterstützt jetzt eine neue Generation von Stimmen, die Natural Voices, mit einer neuen Stimme für US-Englisch:

  • en-US_EllieNatural

Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie unter Natürliche Stimmen.

Der Dienst unterstützt jetzt ein zusätzliches optionales format-Attribut für <say-as interpret-as="letters" format="xx"> SSML-Tag

Sie können nun den Wert group oder single mit dem optionalen Attribut format angeben. Diese Attribute tragen dazu bei, die Lesbarkeit alphanumerischer Zeichenfolgen, wie z. B. die Bestätigung von Zahlen und ID, durch das Hinzufügen strategischer Pausen zu verbessern.

17. Februar 2025

Neue brasilianisch-portugiesische männliche ausdrucksstarke neurale Stimme

Der Dienst unterstützt jetzt eine neue männliche, ausdrucksstarke neuronale Stimme für brasilianisches Portugiesisch:

  • pt-BR_LucasExpressive

Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

09. Dezember 2024

Neue ausdrucksstarke neurale Stimme in UK Englisch für Männer

Der Dienst unterstützt jetzt eine neue männliche ausdrucksstarke neuronale Stimme für UK-Englisch:

  • en-GB_GeorgeExpressive

Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

15. Mai 2024

Neue lateinamerikanische spanische weibliche ausdrucksstarke neurale Stimme

Der Service unterstützt jetzt eine neue ausdrucksstarke neuronale Stimme für lateinamerikanisches Spanisch

  • es-LA_DanielaExpressive

Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

16. Januar 2024

Text to Speech-Verbesserungen für expressive Stimmen in amerikanischem Englisch
Wenn Sie expressive Stimmen in amerikanischem Englisch verwenden, ist die Synthese mit geringerer Latenzzeit schneller.
Defekt behoben: Beugungsfehler bei Verwendung des Fragezeichens (?) in einer kurzen Äußerung
Fehlerkorrektur: Wenn einige kurze Äußerungen mit einem Fragezeichen (?) beendet wurden, wurde die Beugung ignoriert. Dieses Problem ist nun behoben.

30. November 2023

Verbesserte Text to Speech-Syntheseengine für Stimmen der Version 3
Die Text to Speech-Engine wurde verbessert, um eine schnellere Synthese mit geringerer Latenz für Stimmen der Version 3 zu ermöglichen.
Verbesserte Text to Speech en-AU_HeidiExpressive
Die Text to Speech en-AU_HeidiExpressive wurde verbessert und kann die Tonhöhe und Synthese anpassen.

9. Juni 2023

Defekt behoben: TTS scheitert nicht mehr an der Fehlermeldung "[Errno 2] No such file or directory"
Defekt behoben: Wenn TTS mit Websockets verwendet wird, scheitert es nicht mehr an der Fehlermeldung "[Errno 2] No such file or directory"

18. Mai 2023

Fehlerkorrektur: Unterstützung für fehlende SSML-Funktionen in der niederländischen Stimme hinzugefügt
Fehlerkorrektur: Bei Verwendung der niederländischen Stimme funktionieren jetzt alle unterstützten SSML-Funktionen wie entworfen. Bisher funktionierten bei der Verwendung der niederländischen Stimme einige SSML-Funktionen nicht.
Fehlerkorrektur: Commas werden jetzt bei der Verwendung von Phonem-Tags berücksichtigt
Fehlerkorrektur: Bei Verwendung von Phonem-Tags in SSML funktionieren Kommas (Pausen) jetzt wie erwartet. Früher wurde die Pause ignoriert, wenn Kommas vor oder nach Text mit Phonem-Tags standen.

6. April 2023

Aktualisierungen der Betaversion Niederlande Niederländisch erweiterte neuronale Stimme
Fehlerkorrektur: Die Betaversion von Netherlands Dutch nl-NL_MerelV3Voice wurde für interne Fixes und Verbesserungen aktualisiert. Die Einschränkungen, die für die erste Version der Stimme in der Dienstaktualisierung vom 31. März 2023 beschrieben sind, gelten weiterhin.

31. März 2023

Wichtig: Ende des Servicezeitraums für alle neuronalen Stimmen

Wichtig: Alle neuronalen Stimmen haben ihr Serviceenddatum erreicht und wurden aus dem Service und der Dokumentation entfernt. Es sind keine verstärkten neuralen oder expressiven neuralen Stimmen betroffen. Eine vollständige Liste aller veralteten neuronalen Stimmen finden Sie in den Dienstaktualisierungen vom 1. März 2023. Der Versuch, eine veraltete Stimme zu verwenden, liefert den HTTP 404 mit der Meldung " Model '{voice}' not found.

Neue neuronale und expressive neuronale Stimmen sind für das australische Englisch, Koreanisch und Niederländisch verfügbar. Sie müssen auf eine der neuen Stimmen für australisches Englisch, Koreanisch oder Niederländisch umsteigen, um die veralteten Sprachen weiterhin verwenden zu können.

Weitere Informationen finden Sie unter Sprachen und Stimmen.

22. März 2023

Neue Betaversion Niederlande Niederländisch erweiterte neuronale Stimme

Der Service unterstützt jetzt eine neue erweiterte neuronale Frauenstimme für Niederländisch (Niederlande): nl-NL_MerelV3Voice Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole.

Bei der neuen Stimme handelt es sich um Beta-Funktionen, bis die Unterstützung für SSML abgeschlossen ist. In der ersten Version unterstützt die Stimme die Verwendung der folgenden SSML-bezogenen Funktionen nicht:

  • Das Element <prosody> mit einer Sprachsyntheseanforderung
  • Die Parameter rate_percentage und pitch_percentage mit allen Sprachsyntheseanforderungen
  • Element <mark> mit einer WebSocket-Sprachsyntheseanforderung
  • Parameter timings der JSON-Textnachricht mit einer WebSocket-Sprachsyntheseanforderung

Weitere Informationen über die neue Stimme, ihre Unterstützung für IPA-und SPR-Symbole und die Migration von den veralteten niederländischen neuronalen Stimmen auf die neue Stimme finden Sie unter

Fehlerkorrektur: Aktualisieren Sie koreanische phonetische Symbole in der Dokumentation

Defekt behoben: In der Dokumentation für koreanische SPR-Symbole werden zweistellige Symbole für Konsonanten jetzt in einfache Anführungszeichen gesetzt, so dass sie ein einziges Symbol sind. Zuvor wurden sie als zwei separate Symbole ohne Anführungszeichen dargestellt. Weitere Informationen finden Sie unter Konsonanten(Koreanisch).

Dokumentationsaktualisierungen für IBM SPR-Symbole

Die Übersichtsdokumentation für IBM SPR-Symbole wurde aktualisiert, um die Verwendung von Symbolen mit mehreren Zeichen zu verdeutlichen. Weitere Informationen finden Sie unter Sprachensymbole.

1. März 2023

Wichtig: Ausstehendes Ende des Servicezeitraums für alle neuronalen Stimmen

Wichtig: Mit Wirkung vom 31. März 2023 erreichen alle neuronalen Stimmen das Serviceenddatum und werden aus dem Service und der Dokumentation entfernt. Die neuronalen Stimmen sind seit dem 31. März 2022 veraltet. Es sind keine erweiterten neuronalen oder expressiven neuronalen Stimmen betroffen.

Die folgenden neuronalen Stimmen werden entfernt:

  • Arabisch: ar-MS_OmarVoice
  • Chinesisch (Mandarin): zh-CN_LiNaVoice, zh-CN_WangWeiVoice und zh-CN_ZhangJingVoice
  • Tschechisch: cs-CZ_AlenaVoice
  • Niederländisch (Belgien): nl-BE_AdeleVoice und nl-BE_BramVoice
  • Niederländisch (Niederlande): nl-NL_EmmaVoice und nl-NL_LiamVoice
  • Englisch (Australien): en-AU_CraigVoice, en-AU_MadisonVoice und en-AU_SteveVoice
  • Koreanisch: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice und ko-KR_YunaVoice
  • Schwedisch: sv-SE_IngridVoice

Neue erweiterte neuronale und expressive neuronale Stimmen sind bereits für die australische englische und koreanische Sprache verfügbar. In den kommenden Wochen wird eine neue erweiterte neuronale Stimme für die niederländische Sprache verfügbar sein. Sie müssen vor dem 31. März 2023 auf eine der neuen Stimmen für Englisch (Australien), Koreanisch oder Niederländisch (Niederlande) migrieren.

Weitere Informationen finden Sie unter Sprachen und Stimmen.

27. Februar 2023

Neue australische englische expressive neuronale Stimmen

Der Service unterstützt jetzt zwei neue expressive neuronale Stimmen, männlich und weiblich, für australisches Englisch:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

Expressive neuronale Stimmen bieten natürlich klingende Sprache, die außergewöhnlich klar, knackig und flüssig ist. Die neuen Stimmen sind nun allgemein verfügbar (GA) und können in der Produktion eingesetzt werden. Sie unterstützen sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

Sie können von neuronalen Stimmen für australisches Englisch, die veraltet sind, auf die neuen expressiven neuronalen Stimmen migrieren.

Neue koreanische erweiterte neuronale Stimme

Der Service unterstützt jetzt eine neue neuronale weibliche Stimme für Koreanisch: ko-KR_JinV3Voice. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

Sie können von koreanischen neuronalen Stimmen, die veraltet sind, auf die neue erweiterte neuronale Stimme migrieren.

Fehlerkorrektur: Französisch-kanadische Stimme verarbeitet numerische Zeiten jetzt richtig

Fehlerkorrektur: Die französischen und kanadischen Stimmen sprechen Zeiten wie 19:41 nun korrekt aus. Bisher wurden die Stimmen ausgelassen Elemente der Zeit in der synthetisierten Audio.

Fehlerkorrektur: Japanische Stimme fügt nicht mehr unerwartetes Audio ein

Fehlerkorrektur: Die japanische Stimme fügt nicht mehr unerwartete Audiodaten in Sprachsyntheseergebnisse ein. Zuvor wurden in bestimmten Fällen andere Töne eingefügt.

20 Januar 2023

Einstellung der Unterstützung für Cloud Foundry und Migration auf Ressourcengruppen

{{{site.data.keyword.IBM_notm}} kündigte die Abschaffung von IBM Cloud Foundry zum 31. Mai 2022 an. Ab dem 30. November 2022 können neue IBM Cloud Foundry nicht mehr erstellt werden und nur noch bestehende Nutzer können Anwendungen bereitstellen. IBM Cloud Foundry erreicht das Ende des Supports am 1. Juni 2023. Dann werden alle IBM Cloud Foundry, auf denen IBM Cloud Foundry werden dauerhaft deaktiviert, deprovisioniert und gelöscht.

Um Ihre IBM Cloud über den 1. Juni 2023 hinaus nutzen zu können, müssen Sie vor diesem Datum zu Ressourcengruppen migrieren. Ressourcengruppen sind konzeptionell ähnlich wie Cloud Foundry. Dazu gehören mehrere zusätzliche Vorteile, wie beispielsweise eine feinere Zugriffskontrolle durch den Einsatz von „ IBM Cloud Identity and Access Management “ (IAM), die Möglichkeit, Service-Instanzen mit Anwendungen und Diensten in verschiedenen Regionen zu verbinden, sowie eine einfache Möglichkeit, die Nutzung nach Gruppen anzuzeigen.

Fehlerkorrektur: Die Angabe großer Kardinalzahlen mit dem Element <say-as> führt nicht mehr zu Fehlern bei englischen Stimmen

Fehlerkorrektur: Sie können jetzt das Element <say-as> verwenden, um große Zahlen als Kardinalzahlen auszusprechen. Zuvor konnte das Einschließen einer großen Zahl in das <say-as> mit dem Attribut interpret-as="cardinal" dazu führen, dass die Sprachsynthese für englische Stimmen fehlschlug. Zum Beispiel könnte <say-as interpret-as="cardinal">3,200</say-as> dazu führen, dass der Dienst einen Fehler erzeugt. Weitere Informationen finden Sie unter cardinal im Abschnitt SSML-Elemente.

Fehlerkorrektur: Homonyme und andere Wörter werden nun korrekt von englischen Stimmen ausgesprochen

Fehlerkorrektur: Der Service spricht jetzt Homonyme und andere Wörter basierend auf ihrem Kontext im englischen Text, der synthetisiert werden soll, korrekt aus. Zuvor konnten Wörter wie advocate und wifi von englischen Stimmen falsch ausgesprochen werden.

30. November 2022

Fehlerkorrektur: Regeln für die Dokumentation zur Benennung angepasster Modelle hinzufügen
Fehlerkorrektur: Die Dokumentation enthält jetzt detaillierte Regeln für die Benennung angepasster Modelle. Weitere Informationen finden Sie

7. Oktober 2022

Der Service erzwingt jetzt eine strengere SSML-Validierung
Der Service erzwingt jetzt eine strengere Validierung von Eingabetext, der SSML-Elemente (Speech Synthesis Markup Language) enthält. Erforderliche Elemente von Attributen müssen mit gültigen Werten angegeben werden. Andernfalls schlägt die Anforderung mit dem Fehlercode 400 fehl. Weitere Informationen zur SSML-Validierung und zu den Anforderungen, die markierungsfähiger Text erfüllen muss, finden Sie unter SSML-Validierung.
Defekt behoben: Das Geschlecht, das für die en-US_MichaelExpressive Stimme aufgelistet wird, ist nun korrekt
Fehlerkorrektur: Wenn Sie Informationen zu den verfügbaren Stimmen auflisten, lautet die gender der en-US_MichaelExpressive-Stimme jetzt male. Zuvor wurde das Geschlecht der Stimme fälschlicherweise als female beschrieben. Weitere Informationen finden Sie unter Informationen zu Stimmen auflisten.

23.09.2022

Neue ausdrucksstarke neuronale Stimmen für amerikanisches Englisch

Der Service bietet vier neue expressive neuronale Stimmen für amerikanisches Englisch:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

Expressive neuronale Stimmen bieten natürlich klingende Sprache, die außergewöhnlich klar, knackig und flüssig ist. Die neuen Stimmen sind nun allgemein verfügbar (GA) und können in der Produktion eingesetzt werden. Sie unterstützen sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie

Neue Sprechstile für expressive neuronale Stimmen

Die expressiven neuronalen Stimmen bestimmen die Stimmung des Textes aus dem Kontext seiner Wörter und Phrasen. Die Sprache, die sie produzieren, hat nicht nur einen konversationellen Stil, sondern spiegelt auch die Stimmung des Textes wider. Aber Sie können die natürlichen Tendenzen der Stimmen verschönern, indem Sie angeben, dass der gesamte oder ein Teil des Textes einen der folgenden Sprechstile hervorheben soll:

  • Fröhlich-Drückt Glück und gute Nachrichten aus.
  • Empathisch-äußert Empathie oder Sympathie.
  • Neutral-Drückt Objektivität und Ebenheit aus.
  • Unsicher-Drückt Verwirrung oder Unsicherheit aus.

Weitere Informationen finden Sie unter Sprechstile verwenden.

Neue Interjektionsbetonung mit expressiven neuronalen Stimmen

Bei expressiven neuronalen Stimmen erkennt der Service automatisch eine Gruppe allgemeiner Interjektionen basierend auf dem Kontext. Wenn es diese Interjektionen synthetisiert, gibt es ihnen die natürliche Betonung, die ein Mensch in normalen Gesprächen verwenden würde. Für einige der Interjections können Sie SSML verwenden, um deren Hervorhebung zu aktivieren oder zu inaktivieren. Weitere Informationen finden Sie unter Emphasizing interjections.

Neue Wortbetonung mit ausdrucksstarken neuronalen Stimmen

Die expressiven Stimmen verwenden einen Dialogstil, der natürlich die richtige Intonation aus dem Kontext anwendet. Sie können jedoch angeben, dass mindestens ein Wort mehr oder weniger hervorgehoben werden soll. Die Spannungsänderung kann durch eine Erhöhung oder Abnahme der Tonhöhe, des Timings, der Lautstärke oder anderer akustischer Attribute angezeigt werden. Weitere Informationen finden Sie unter Emphasizing words.

21. September 2022

Neues Activity Tracker-Ereignis zum Löschen von Benutzerinformationen in der DSGVO
Der Service gibt jetzt ein Ereignis Activity Tracker zurück, wenn Sie die Methode DELETE /v1/user_data verwenden, um alle Informationen zu einem Benutzer zu löschen. Das Ereignis hat den Namen text-to-speech.gdpr-user-data.delete. Weitere Informationen finden Sie im Abschnitt Activity Tracker-Ereignisse.
Fehlerkorrektur: Benutzerdefinierte Wortübersetzungen akzeptieren jetzt in allen Fällen Kommas
Fehlerkorrektur: Zu angepassten Modellen hinzugefügte Word-Übersetzungen akzeptieren jetzt in allen Fällen Kommas. Bisher konnte es vorkommen, dass ein Komma in einer Übersetzung dazu führte, dass die Übersetzung bei Sprachsynthesen kein gültiges Audio erzeugte. Dieses Problem wurde in angepassten Modellen für amerikanisches Englisch identifiziert.
Fehlerkorrektur: Französische Datensynthese ist jetzt konsistent
Fehlerkorrektur: Die französische Synthese enthält nicht mehr den Artikel "le" vor Datumsangaben des Formulars "the ordinal of month." Zuvor wurde der Artikel nur für den ersten Tag des Monats für Französisch aufgenommen (z. B. "der erste September", "le premier septembre").
Bekannte Einschränkungen bei der Verwendung des Ogg-Audioformats mit dem Safari-Browser
Standardmäßig liefert der Dienst Audio im Ogg-Audioformat mit dem Opus-Codec audio/ogg;codecs=opus). Das Ogg-Audioformat wird jedoch vom Safari-Browser nicht unterstützt. Wenn Sie den Dienst Text to Speech mit dem Safari-Browser verwenden, müssen Sie ein anderes Format angeben, in dem der Dienst das Audio zurückgeben soll.

31 August 2022

Neuer Beta-Abfrageparameter rate_percentage zur Steuerung der globalen Sprachrate
Der Service bietet einen neuen Abfrageparameter rate_percentage, um die Sprechgeschwindigkeit für eine Sprachsyntheseanforderung zu ändern. Die Sprechgeschwindigkeit ist die Geschwindigkeit, mit der der Service den Text spricht, den er in Sprache synthetisiert. Eine höhere Rate führt dazu, dass der Text schneller gesprochen wird; eine niedrigere Rate bewirkt, dass der Text langsamer gesprochen wird. Der Parameter ändert die Sprachstandardrate für eine gesamte Anforderung. Weitere Informationen finden Sie unter Sprechgeschwindigkeit ändern.
Neuer Beta-Abfrageparameter pitch_percentage zur Steuerung der globalen Sprachdichte
Der Service bietet einen neuen Abfrageparameter pitch_percentage, um die Sprechdichte für eine Syntheseanforderung zu ändern. Die Sprechdichte stellt den Ton der Sprache dar, die der Service synthetisiert. Sie stellt dar, wie hoch oder niedrig der Ton der Stimme vom Hörer wahrgenommen wird. Eine höhere Tonhöhe führt zu einer Sprache, die in einem höheren Ton gesprochen wird und als höhere Stimme wahrgenommen wird; eine niedrigere Tonhöhe führt zu einer Sprache, die in einem niedrigeren Ton gesprochen wird und als niedrigere Stimme wahrgenommen wird. Der Parameter ändert die Standardtonhöhe pro Stimme für eine gesamte Anforderung. Weitere Informationen enthält der Abschnitt Tonhöhe ändern.
Fehlerkorrektur: Die japanische Synthese wurde verbessert, um lange Zeichenfolgen von Eingabetext zu verarbeiten
Fehlerkorrektur: Der Service erstellt jetzt korrekt synthetisch japanische Anforderungen, die lange Zeichenfolgen enthalten. Zuvor war der Dienst nicht in der Lage, lange japanische Textstrings korrekt zu synthetisieren.
Dokumentationsaktualisierungen für das SSML-Element <prosody>
Die Dokumentation für das SSML-Element <prosody> und seine Parameter pitch und rate wurde verbessert und transparenter gestaltet. Außerdem enthält sie jetzt eine Beschreibung der Unterschiede zwischen dem Service und der neuesten Version der SSML-Spezifikation. Weitere Informationen finden Sie unter Element <prosody>.

3. August 2022

Der Service unterstützt keine mehrsprachige Sprachsynthese
Der Dienst unterstützt derzeit keine mehrsprachige Sprachsynthese. Sie können die Anpassung jedoch verwenden, um die Aussprache von Wörtern aus anderen Sprachen näherungsweise zu berechnen. Weitere Informationen finden Sie unter Mehrsprachige Sprachsynthese.

27. Juli 2022

Neuer Beta-Parameter spell_out_mode für deutsche Stimmen
Um anzugeben, wie einzelne Zeichen einer Zeichenfolge geschrieben werden sollen, können Sie jetzt den Beta-Abfrageparameter spell_out_mode mit einer Syntheseanforderung für eine deutsche Stimme einschließen. Standardmäßig gibt der Service einzelne Zeichen mit derselben Geschwindigkeit aus, mit der er Text für eine Sprache synthetisch erstellt. Sie können den Parameter verwenden, um den Service anzuweisen, einzelne Zeichen langsamer in Gruppen von ein, zwei oder drei Zeichen auszuschreiben. Verwenden Sie den Parameter mit dem SSML-Element <say-as>, um zu steuern, wie die Zeichen einer Zeichenfolge synthetisch erstellt werden. Weitere Informationen finden Sie unter Schreibweise von Zeichenfolgen angeben.

25. Mai 2022

Neue Unterstützung für Audioformat audio/alaw
Die Liste der unterstützten Audioformate enthält jetzt audio/alaw;rate={rate}. Wie audio/basic und audio/mulaw stellt dieses Format Single-Channel-Audiodaten bereit, die mit 8-Bit-U-Law-Daten (oder Mu-Law-Daten) codiert werden, die mit 8 kHz abgetastet werden. Weitere Informationen finden Sie unter Audioformate verwenden.

19 Mai 2022

Fehlerkorrektur: Mehrere aufeinanderfolgende SSML-<phoneme>-Tags werden jetzt ordnungsgemäß geparst
Fehlerkorrektur: Der Service erstellt jetzt ordnungsgemäß synthetisch Text, der aufeinanderfolgende <phoneme>-Tags enthält. Wenn der Text zwei oder mehr aufeinanderfolgende <phoneme>-Tags enthielt, hat der Service bisher nur den ersten Tag synthetisch erstellt und die anderen Tags ignoriert.

31. März 2022

Wichtig: Einstellung der Unterstützung für alle neuronalen Stimmen

Wichtig: Per 31. März 2022 werden keine neuronalen Stimmen mehr unterstützt. Die veralteten Stimmen bleiben für vorhandene Benutzer verfügbar, bis sie am 31. März 2023 aus dem Service und der Dokumentation entfernt werden. Keine erweiterten neuronalen Stimmen oder expressiven Stimmen sind veraltet.

Die folgenden neuronalen Stimmen sind jetzt veraltet:

  • Arabisch: ar-MS_OmarVoice
  • Chinesisch (Mandarin): zh-CN_LiNaVoice, zh-CN_WangWeiVoice und zh-CN_ZhangJingVoice
  • Tschechisch: cs-CZ_AlenaVoice
  • Niederländisch (Belgien): nl-BE_AdeleVoice und nl-BE_BramVoice
  • Niederländisch (Niederlande): nl-NL_EmmaVoice und nl-NL_LiamVoice
  • Englisch (Australien): en-AU_CraigVoice, en-AU_MadisonVoice und en-AU_SteveVoice
  • Koreanisch: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice und ko-KR_YunaVoice
  • Schwedisch: sv-SE_IngridVoice

Die veralteten neuronalen Stimmen sind weiterhin für vorhandene Benutzer verfügbar, aber für neue Benutzer nicht mehr verfügbar:

  • Vorhandene Benutzer: Instanzen des Service, die vor 31. März 2022 erstellt wurden, können die veralteten Stimmen weiterhin für die Sprachsynthese verwenden. Die Instanzen können auch zum Erstellen und Bearbeiten benutzerdefinierter Modelle verwendet werden, die auf den veralteten Stimmen basieren. Außerdem können sie weiterhin die Stimmen mit den Methoden GET /v1/voices und GET /v1/voices/{voice} auflisten und abfragen.
  • Neue Nutzer: Bei Instanzen des Dienstes, die am oder nach dem 31. März 2022 erstellt werden, können die veralteten Stimmen für die Sprachsynthese nicht mehr verwendet werden. Die Instanzen können zudem nicht zum Erstellen benutzerdefinierter Modelle verwendet werden, die auf den veralteten Stimmen basieren. Außerdem können sie die Stimmen nicht mit den Methoden GET /v1/voices und GET /v1/voices/{voice} auflisten oder abfragen. Jeder API-Aufruf, der eine der veralteten Stimmen enthält, gibt je nach Aufruf den HTTP-Fehlercode 400 oder 404 zurück.

Neue Stimmen für australisches Englisch, Niederländisch und Koreanisch werden bis zum 15. Februar 2023 veröffentlicht. Wenn Sie australisches Englisch, Niederländisch oder Koreanisch verwenden, werden Ihre API-Aufrufe automatisch zu den neuen Stimmen in dieser Sprache umgeleitet. Stimmen in Arabisch, Chinesisch, Tschechisch, Schwedisch und Flämisch werden aus dem Dienst entfernt.

Weitere Informationen zu allen verfügbaren Sprachen und Stimmen finden Sie unter „ Sprachen und Stimmen “.

Veraltete Standardstimmen wurden aus der Dokumentation entfernt

Die Standard-Verkettungsstimmen sind seit dem 2. Dezember 2020 veraltet. Diese Standardstimmen wurden jetzt aus der API-Referenz entfernt. Das Thema „Umstellung von Standardstimmen auf neuronale Stimmen“ wurde ebenfalls von der Seite „ Sprachen und Stimmen “ entfernt.

In ähnlicher Weise wird auch der frühere Name der arabischen Stimme, ar-AR_OmarVoice, nicht mehr verwendet. Es wurde auch aus der Dokumentation entfernt. Verwenden Sie stattdessen die Stimme ar-MS_OmarVoice.

28. Februar 2022

Änderung der Wordtaktrückgabe für WebSocket-Schnittstelle

Das Antwortobjekt, das der Dienst sendet, wenn Sie über die Schnittstelle „ WebSocket “ Wortzeitangaben anfordern, hat sich geändert. Der Service sendet jetzt Worttaktergebnisse in einem einzelnen Array, das eine Zeichenfolge gefolgt von zwei Gleitkommazahlen enthält:

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

Zuvor wurden vom Service Taktergebnisse als Array mit einer Zeichenfolge gesendet, auf die ein Array mit zwei Gleitkommazahlen folgt:

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

Außerdem wird die Genauigkeit für Worttaktinformationen und -markierungen jetzt auf drei Dezimalstellen reduziert. Weitere Informationen zu den neuen Antworten finden Sie unter Wortzeitdauer generieren.

Anmerkung: Die Ergebnisse für erweiterte neuronale und neuronale Stimmen waren bisher unterschiedlich. Diese Inkonsistenzen können zu Fehlern bei den SDKs von „ Watson “ führen. Die Ergebnisse für alle Stimmen sind jetzt konsistent.

26. Januar 2022

Fehlerkorrektur: SSML-Dokumentation verbessern
Fehlerbehebung: Die SSML-Dokumentation wurde aktualisiert, um die folgenden Fehler zu beheben:
  • Die Beispiele für das Element <break> sind jetzt korrekt. Das Element ist monadisch, wie in den Beispielen gezeigt. Die vorherigen Beispiele enthielten Tag-Paare mit eingebettetem Text. Der eingebettete Text wurde vom Service nicht gesprochen. Weitere Informationen finden Sie unter Element <break>.
  • Der Service unterstützt SSML-Version 1.1. Alle Referenzen und Beispiele verwenden jetzt die richtige Version. In der Dokumentation wurde zuvor auf Version 1.0 verwiesen.

3. Dezember 2021

Neue neuronale Stimme für Tschechisch: cs-CZ_AlenaVoice

Eine neue Sprache - Tschechisch - mit einer neuen weiblichen Stimme namens cs-CZ_AlenaVoice ist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme.

Neue neuronale Stimme für belgisches Niederländisch: nl-BE_BramVoice

Eine neue männliche Stimme für belgisches Niederländisch (Flämisch) namens nl-BE_BramVoice ist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme.

Fehlerkorrektur: SSML und Sprachsynthese verbessern

Behebung von Fehlern: Die folgenden Fehler im Zusammenhang mit der Speech Synthesis Markup Language (SSML) und der Sprachsynthese wurden mit dieser Version behoben:

  • Das Attribut pitch des Elements <prosody> wird jetzt auf den gesamten angegebenen Text angewendet. Zuvor wurde die Änderung der Tonhöhe teilweise nicht auf das erste Wort des betroffenen Texts angewendet. Außerdem enthält die Dokumentation nun weitere Hinweise zur Angabe eines Werts für „ pitch “. Weitere Informationen finden Sie unter Attribut pitch.
  • Die Sprachsynthese für japanische Texte liefert nun Audioausgabe mit einem langsameren Sprechtempo. Bisher war das Tempo der synthetisierten Aussprache zu hoch. Wenn Sie feststellen, dass das Sprechtempo in synthetisierten japanischen Texten für Ihre Anwendung noch zu hoch ist, können Sie das Tempo mit dem Attribut rate des SSML-Elements <prosody> verändern. Weitere Informationen finden Sie unter Attribut rate.
  • Von neuronalen Stimmen wird das Escapezeichen für Hochkommas (&apos;) jetzt wie erforderlich analysiert. Bisher wurde das Zeichen von einigen neuronalen Stimmen nicht richtig interpretiert.

22. Oktober 2021

Verschiedene Verbesserungen für neuronale Stimmen
Die vorhandenen neuronalen Stimmen für Chinesisch, Niederländisch (Belgien und Niederlande), australisches Englisch und Koreanisch wurden aktualisiert, um die Sprachsynthese und die Audioergebnisse zu verbessern. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
Neue neuronale Stimme für australisches Englisch: en-AU_SteveVoice
Eine neue männliche Stimme für australisches Englisch namens en-AU_SteveVoice ist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme.
Neue neuronale Stimme für Schwedisch: sv-SE_IngridVoice
Eine neue Sprache - Schwedisch - mit einer neuen weiblichen Stimme namens sv-SE_IngridVoice ist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme.

6. Oktober 2021

Neue Unterstützung für HIPAA für Premium-Pläne am Standort Dallas
Unterstützung für das US-amerikanische Gesetz HIPAA (Health Insurance Portability and Accountability Act) ist jetzt für Premium-Pläne verfügbar, die am Standort Dallas (us-south) gehostet werden. Weitere Informationen finden Sie unter Health Insurance Portability and Accountability Act (HIPAA).
Fehlerbehebung: Verbesserung der erweiterten neuronalen Stimme für lateinamerikanisches Spanisch
Fehlerkorrektur: Bei der Stimme für lateinamerikanisches Spanisch (es-LA_SofiaV3Voice) weisen Fragen aller Typen jetzt die richtige Intonation auf.

16 September 2021

Fehlerbehebung: Verbesserung der neuronalen Stimmen für kastilisches Spanisch und nordamerikanisches Spanisch
Fehlerkorrektur: Bei den Stimmen für kastilisches Spanisch (es-ES_EnriqueV3Voice und es-ES_LauraV3Voice) und nordamerikanisches Spanisch (es-US_SofiaV3Voice) weisen Fragen aller Typen jetzt die richtige Intonation auf. Bei der Stimme für lateinamerikanisches Spanisch (es-LA_SofiaV3Voice) weisen einige Fragen nicht die richtige Intonation auf und klingen stattdessen wie Aussagen. Die lateinamerikanische Spanisch-Sprachausgabe wird in Kürze verfügbar sein.

16. Juli 2021

Neue neuronale Stimme für belgisches Niederländisch: nl-BE_AdeleVoice
Der Service unterstützt jetzt belgisches Niederländisch (Flämisch) mit der neuronalen Stimme nl-BE_AdeleVoice. Die Stimme für belgisches Niederländisch unterstützt die Anpassung und ist allgemein verfügbar (GA) für den Produktionseinsatz.

12 April 2021

Neue erweiterte neuronale Stimme für kanadisches Französisch: fr-CA_LouiseV3Voice

Der Service unterstützt jetzt kanadisches Französisch mit der erweiterten neuronalen Stimme fr-CA_LouiseV3Voice. Die Stimme für kanadisches Französisch unterstützt die Anpassung und ist allgemein verfügbar (GA) für den Produktionseinsatz.

Neue Funktion "Tune by Example"

Mit der neuen Funktion "Tune by Example" können Sie steuern, wie der angegebene Text vom Service gesprochen wird. Bei dieser Funktion handelt es sich um eine Beta-Funktion, die nur für benutzerdefinierte Modelle und Stimmen in US-Englisch unterstützt wird. Die Funktion besteht aus zwei Komponenten:

  • Angepasste Prompts schließen den geschriebenen Text ein, der gesprochen werden soll, und Audioaufzeichnungen enthalten den Text in der von Ihnen gewünschten Aussprache. Die Audiodaten geben Intonation, Kadenz und Betonung des synthetisierten Texts an. Der Prompt kann verschiedene Silben oder Wörter hervorheben, Pausen einführen, bei den synthetisierten Audiodaten eine insgesamt natürlichere Aussprache erreichen und die Aussprache an den zugehörigen Kontext anpassen.
  • Sprechermodelle stellen Registrierungsaudiodateien zu Benutzern bereit, von denen Prompts gesprochen werden. Ein Sprechermodell stellt Beispielaudiodaten für die Stimme eines Sprechers bereit. Vom Service wird ein auf die Stimme bezogenes Training durchgeführt, was dazu beitragen kann, dass qualitativ hochwertigere Prompts für den jeweiligen Sprecher erzeugt werden.

Sie geben einen angepassten Prompt mit einer Sprachsyntheseanforderung an, um anzugeben, wie der Text von der Stimme des Service gesprochen werden soll. Für die Angabe eines Prompts verwenden Sie die SSML-Erweiterung <ibm:prompt id="{prompt_id}"/>. In der synthetisierten Audioausgabe wird die Prosodie des Prompts kopiert.

Neue Methoden für Tune by Example

Der Service beinhaltet acht neue Methoden für die Arbeit mit der Funktion "Tune by Example". Die nachfolgenden Beschreibungen der neuen Methoden enthalten Links zu den entsprechenden Einträgen in der API- und SDK-Referenz. Möglicherweise müssen Sie die Registerkarte Curl der Referenz auswählen, damit die neuen Methoden angezeigt werden.

Aktualisierungen für Activity Tracker-Aktionen für Anpassung

Die Namen der Aktionen für die Activity Tracker-Ereignisse für die Anpassungsmethoden wurden geändert. Die Aktionen enthalten jetzt die Zeichenfolge custom-model anstelle von custom-voice. Die vorherigen Namen der Aktionen sind veraltet. Diese veralteten Namen sind weiterhin zur Verwendung verfügbar, werden aber zu einem späteren Zeitpunkt entfernt. Migrieren Sie so schnell wie möglich auf die neuen Namen, die in Anpassungsereignisse aufgelistet sind.

Ereignisse erstellen Veralteter Aktionsname-> Neuer Aktionsname

  • text-to-speech.custom-voice.create -> text-to-speech.custom-model.create
  • text-to-speech.custom-voice-word-list.create -> text-to-speech.custom-model-word-list.create
  • text-to-speech.custom-voice-word.create -> text-to-speech.custom-model-word.create

Ereignisse lesen Veralteter Aktionsname-> Neuer Aktionsname

  • text-to-speech.custom-voice-list.read -> text-to-speech.custom-model-list.read
  • text-to-speech.custom-voice.read -> text-to-speech.custom-model.read
  • text-to-speech.custom-voice-word-list.read -> text-to-speech.custom-model-word-list.read
  • text-to-speech.custom-voice-word.read -> text-to-speech.custom-model-word.read

Ereignis aktualisieren Veralteter Aktionsname-> Neuer Aktionsname

  • text-to-speech.custom-voice.update -> text-to-speech.custom-model.update

Ereignisse löschen Veralteter Aktionsname-> Neuer Aktionsname

  • text-to-speech.custom-voice.delete -> text-to-speech.custom-model.delete
  • text-to-speech.custom-voice-word.delete -> text-to-speech.custom-model-word.delete

2. Dezember 2020

Verschiedene Verbesserungen für Stimmen

Die vom Dienst angebotenen Stimmen haben sich erheblich verändert. Der Service unterstützt neue Sprachen und Stimmen, die Qualität vieler Stimmen wurde verbessert und viele ältere Stimmen werden jetzt als veraltet eingestuft. Darüber hinaus sind nun alle Sprachdienste anpassbar und für den produktiven Einsatz allgemein verfügbar (GA).

Neue neuronale und erweiterte neuronale Stimmen

Zur Optimierung der Gesamtqualität der Sprachsynthese basieren nun alle verfügbaren Stimmen auf neuronaler Technologie. Der Service bietet zwei Typen von Stimmen, die auf neuronaler Technologie basieren:

  • Neuronale Stimmen, die nicht die Zeichenfolge V3 in ihren Namen enthalten, sind jetzt für Arabisch, Australisches Englisch, Chinesisch, Niederländisch (Niederlande) und Koreanisch verfügbar. Neuronale Stimmen unterstützen die Verwendung des Internationalen Phonetischen Alphabets (IPA) mit dem SSML-Element (SSML = Speech Synthesis Markup Language) <phoneme>.
  • Erweiterte neuronale Stimmen, die die Zeichenfolge V3 in ihren Namen enthalten, sind jetzt für brasilianisches Portugiesisch, britisches und amerikanisches Englisch, Französisch, Deutsch, Italienisch, Japanisch und Spanisch (alle Dialekte) verfügbar. Erweiterte neuronale Stimmen unterstützen das IPA und IBM Symbolic Phonetic Representation (SPR) mit dem SSML-Element <phoneme>. Erweiterte neuronale Stimmen erreichen darüber hinaus eine etwas höhere Qualität in Bezug auf eine natürliche Aussprache. In den kommenden Monaten werden weitere Anpassungsmöglichkeiten für verbesserte neuronale Stimmen bereitgestellt.

Standardstimmen werden vom Service für keine Sprache mehr angeboten. Bei den Standardstimmen wurden Segmente aufgezeichneter Sprache mittels Verkettungssynthese zusammengefügt, um die gewünschte Audiodatei zu erzeugen.

Weitere Informationen finden Sie unter Sprachen und Stimmen.

Neue neuronale Stimmen für australisches Englisch und Koreanisch

Die folgenden Stimmen für australisches Englisch und Koreanisch sind neu:

  • Der Service unterstützt jetzt australisches Englisch mit den beiden folgenden neuronalen Stimmen: en-AU_CraigVoice und en-AU_MadisonVoice.
  • Der Service unterstützt jetzt zwei neue neuronale Stimmen in Koreanisch: ko-KR_HyunjunVoice und ko-KR_SiWooVoice.
Verbesserte neuronale Stimmen

Die Stimmen für die bisherigen Sprachen Arabisch, Chinesisch, Niederländisch und Koreanisch, die alle auf der Basis von Text-to-Speech-Technologie erstellt wurden, sind nun auf neuronalen Netzen basierend:

  • ar-MS_OmarVoice
  • ko-KR_YoungmiVoice
  • ko-KR_YunaVoice
  • nl-NL_EmmaVoice
  • nl-NL_LiamVoice
  • zh-CN_LiNaVoice
  • zh-CN_WangWeiVoice
  • zh-CN_ZhangJingVoice

Außerdem wurden folgende weitere Änderungen vorgenommen:

  • Die Stimme für Arabisch trägt jetzt den Namen ar-MS_OmarVoice. Der frühere Name ar-AR_OmarVoice ist veraltet. Die Stimme kann mindestens ein Jahr weiterhin verwendet werden, wird zu einem späteren Zeitpunkt jedoch möglicherweise entfernt. Es wird empfohlen, sobald wie möglich auf den neuen Namen zu migrieren.
  • Die arabische Sprache unterstützt jetzt die Verwendung von IPA-Zeichen und Unicode-Werten mit dem SSML-Element <phoneme>. Zum Erstellen eines angepassten Modells für Arabisch müssen Sie die Sprachenkennung ar-MS verwenden. Die ID ar-AR wird für die Anpassung nicht unterstützt.
  • Die IPA-Zeichen für die arabische Sprache sind neu. Die zuvor dokumentierten Symbole wurden ersetzt.
  • Die IPA-Zeichen für die Niederländisch (Niederlande) wurden wie folgt geändert:
    • Niederländisch (Niederlande) unterstützt die folgenden IPA-Symbole nicht mehr: (0074+02B2), ɲ (0272), ʦ (02A6) und ʔ (0294).
    • Für Niederländisch wird nun das folgende IPA-Symbol unterstützt: ɣ (0263).
Veraltete Standardstimmen

Die folgenden Standard-Verkettungsstimmen sind nun veraltet:

  • de-DE_BirgitVoice
  • de-DE_DieterVoice
  • en-GB_KateVoice
  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • es-ES_LauraVoice
  • es-LA_SofiaVoice
  • es-US_SofiaVoice
  • fr-FR_ReneeVoice
  • it-IT_FrancescaVoice
  • ja-JP_EmiVoice
  • pt-BR_IsabelaVoice

Alle Standardstimmen, die veraltet sind, haben gleichwertige neuronale Entsprechungen, sodass keine Stimme entfällt. Sie können jeweils zur funktional entsprechenden neuronalen Version der Stimme wechseln (z. B. von de-DE_BirgitVoice zu de-DE_BirgitV3Voice), um bessere Ergebnisse bei der Sprachsynthese zu erzielen.

Die veralteten Stimmen wurden aus der veröffentlichten Dokumentation entfernt. Sie können mindestens ein Jahr weiterhin verwendet werden, werden jedoch möglicherweise zu einem späteren Zeitpunkt entfernt. Es wird empfohlen, möglichst schnell auf die entsprechenden neuronalen Stimmen zu migrieren.

Wenn Sie den optionalen Parameter voice in einer Sprachsyntheseanforderung auslassen, wird vom Service standardmäßig en-US_MichaelV3Voice verwendet. Diese neuronale Stimme ersetzt die jetzt veraltete Standardstimme en-US_MichaelVoice, die zuvor als Standardeinstellung verwendet wurde.

Veraltete Funktionen

Die folgenden Funktionen standen nur für Standard-Kombinationsstimmen zur Verfügung. Sie sind veraltet und wurden aus der veröffentlichten Dokumentation entfernt. Sie können mindestens ein Jahr weiterhin verwendet werden, werden jedoch möglicherweise zu einem späteren Zeitpunkt entfernt. Es wird empfohlen, diese Funktionen aus Ihren Anwendungen zu entfernen und baldmöglichst auf neuronale Stimmen zu migrieren.

  • SSML für Expressivität. Hierbei handelt es sich um eine IBM Erweiterung für SSML, die nur für die Stimme en-US_AllisonVoice unterstützt wurde.
  • SSML für Stimmenumwandlung. Hierbei handelt es sich um eine IBM Erweiterung für SSML, die nur für die Stimmen en-US_AllisonVoice, en-US_LisaVoice und en-US_MichaelVoice unterstützt wurde.
  • Das Attribut volume des Elements <prosody>. Dieses Attribut war für alle Standardstimmen verfügbar.

Wenn diese SSML-Elemente in eine Syntheseanforderung für eine neuronale Stimme aufgenommen werden, wird der HTTP-Antwortcode 400 generiert, da die Anforderung die SSML-Validierung nicht besteht. Weitere Informationen zur SSML-Validierung finden Sie in SSML-Validierung.

Neue Unterstützung für Cross-Origin Resource Sharing

CORS-Unterstützung (CORS = Cross-Origin Resource Sharing) ist jetzt für alle Stimmen der Browser Google Chrome™ und Apple® Safari verfügbar. Sie ist nicht im Browser Mozilla Firefox™ für Stimmen in den folgenden Sprachen verfügbar: Arabisch, Englisch (Australien), Chinesisch, Niederländisch (Niederlande) und Koreanisch. Weitere Informationen finden Sie unter CORS support.

10. September 2020

Fehlerbehebung: Verbesserung der japanischen Sprachausgabe

Fehlerkorrektur: Für die Stimme ja-JP_EmiV3Voice analysiert der Service jetzt den SSML-Eingabetext korrekt, der eine Spezifikation für 'prosody rate' enthält. Zuvor erfüllte die folgende Verwendung des Elements <prosody> denselben Zweck:

<speak>成功する/繁栄する</speak>

Die folgende Verwendung des Attributs rate mit dem Element <prosody> hat jedoch dazu geführt, dass die eingebettete SSML-Notation vom Serivce gelesen und gesprochen wurde:

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

Das Attribut rate des Elements <prosody> für japanische Eingabe wird jetzt vom Service ordnungsgemäß analysiert und angewendet.

4. September 2020

Eine Anpassungsoberfläche ist nun allgemein verfügbar
Die Anpassungsschnittstelle ist jetzt allgemein verfügbar (GA). Die Anpassungsfunktionen sind nicht mehr in der Beta-Phase. Sie können die Anpassungsschnittstelle verwenden, um anzugeben, wie der Service ungewöhnliche aus Ihrem Eingabetext ausspricht, indem Sie sprachspezifische benutzerdefinierte Wörterverzeichnisse erstellen. Es kann mit allen allgemein verfügbaren Stimmen und Beta-Stimmen verwendet werden. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung.

24. Juni 2020

Neue neuronale Stimmen für britisches Englisch und Französisch

Der Dienst bietet nun zwei neue neuronale Stimmen an:

  • Englisch (Vereinigtes Königreich): en-GB_CharlotteV3Voice
  • Französisch:fr-FR_NicolasV3Voice

Der Service bietet auch eine verbesserte Version der vorhandenen neuronalen Stimme für Großbritannien namens en-GB_KateV3Voice. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.

Unterstützung für das SSML-Attribut digits des Elements <say-as> für Japanisch

Das Attribut digits des SSML-Elements <say-as> wird jetzt vom Service mit der japanischen Stimme unterstützt. Weitere Informationen finden Sie unter Element 'say-as'.

1. April 2020

Neue koreanische Standardstimmen: ko-KR_YoungmiVoice und ko-KR_YunaVoice

Der Service unterstützt jetzt zwei weibliche koreanische Standardstimmen: ko-KR_YoungmiVoice und ko-KR_YunaVoice. Die folgenden Informationen gelten für beide koreanischen Stimmen:

  • Die Stimmen sind Beta-Funktionen. Sie sind möglicherweise nicht für die produktive Nutzung bereit und können Änderungen unterliegen. Es handelt sich um erste Angebote, die sich mit der Zeit und der Nutzung qualitativ verbessern.
  • Die Stimmen unterstützen die Anpassung und die Methode /v1/pronunciation.
  • Die Stimmen unterstützen das Element <mark> und den Parameter timings, die in der WebSocket-Schnittstelle verfügbar sind.
  • Die Stimmen unterstützen alle SSML-Elemente (Speech Synthesis Markup Language) mit Ausnahme der expressiven SSML und der SSML für Stimmenumwandlung.
  • Die Stimmen unterstützen nur das Internationale Phonetische Alphabet, nicht IBM Symbolic Phonetic Representation (SPR), mit dem Element <phoneme>.
Unterstützung neuer Funktionen für Stimmen für Arabisch, Chinesisch und Niederländisch (Niederlande)

Die Stimmen für Arabisch, Chinesisch und Niederländisch (Niederlande) in der Betaversion unterstützen jetzt die folgenden Funktionen:

  • Die Anpassung und die Methode /v1/pronunciation.
  • Das Element <mark> und der Parameter timings, die in der WebSocket-Schnittstelle verfügbar sind.

Die folgenden Abschnitte enthalten weitere Informationen:

  • Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
  • Weitere Informationen zur Verwendung der Schnittstelle WebSocket zum Abrufen von Worttimings finden Sie unter Worttimings generieren.
  • Weitere Informationen zur Anpassung enthält der Abschnitt Wissenswertes über die Anpassung.
  • Weitere Informationen zur Verwendung des IPA- und des SPR-Formats mit der Anpassung finden Sie unter Erläuterungen zu phonetischen Zeichen. (Die IPA-Zeichen für die Sprachen Arabisch, Chinesisch, Niederländisch (Niederlande) und Koreanisch sind noch nicht dokumentiert. Diese Dokumentation wird in Kürze verfügbar sein.)

24. Februar 2020

Neue neuronale Stimmen für amerikanisches Englisch und Deutsch

Der Service unterstützt jetzt fünf neue neuronale Stimmen:

  • Amerikanisches Englisch: en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice und en-US_OliviaV3Voice
  • Deutsch: de-DE_ErikaV3Voice

Die neuen Stimmen unterstützen die folgenden SSML-Elemente nicht:

  • SSML für Expressivität mit dem Element <express-as>
  • Stimmenumwandlung mit dem Element <voice-transformation>
  • Das Attribut volume des Elements <prosody>

Weitere Informationen zu diesen und allen verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.

Neue Unterstützung für Activity Tracker

Der Service unterstützt jetzt die Verwendung von Activity Tracker-Ereignissen für alle Anpassungsoperationen. IBM Cloud Activity Tracker zeichnet vom Benutzer eingeleitete Aktivitäten auf, die den Status eines Service in IBM Cloud ändern. Mithilfe dieses Service können Sie abnormale Aktivität und kritische Aktionen untersuchen sowie gesetzliche Prüfvorschriften erfüllen. Darüber hinaus können Sie Warnnachrichten Alerts über Aktionen empfangen, sobald diese stattfinden. Weitere Informationen finden Sie im Abschnitt Activity Tracker-Ereignisse.

18. Dezember 2019

Neue Standardstimmen für Arabisch, Chinesisch und Niederländisch (Niederlande)

Der Service unterstützt jetzt sechs neue Standardstimmen in drei neuen Sprachen:

  • Arabisch: ar-AR_OmarVoice
  • Chinesisch (Mandarin): zh-CN_LiNaVoice, zh-CN_WangWeiVoice und zh-CN_ZhangJingVoice
  • *Niederländisch (Niederlande): * nl-NL_EmmaVoice und nl-NL_LiamVoice

Für diese neuen Standardstimmen gelten die folgenden Informationen:

  • Die neuen Stimmen sind Beta-Funktionen. Die Stimmen sind möglicherweise nicht für die produktive Nutzung bereit und können Änderungen unterliegen. Es handelt sich um erste Angebote, die sich mit der Zeit und der Nutzung qualitativ verbessern.
  • Die Stimmen unterstützen das Element <mark> und den Parameter timings nicht, die in der WebSocket-Schnittstelle verfügbar sind.
  • Die Stimmen unterstützen die Anpassung und die Methode /v1/pronunciation nicht.
  • Die Stimmen unterstützen weder die expressive SSML noch die SSML für Stimmenumwandlung.
  • Die Stimmen unterstützen alle anderen SSML-Elemente. Sie unterstützen jedoch nur das Internationales Phonetische Alphabet (IPA) und nicht IBM Symbolic Phonetic Representation (SPR) mit dem Element <phoneme>.

Weitere Informationen zu diesen und allen verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.

12. Dezember 2019

Vollständige Unterstützung für IBM Cloud IAM

Der Text to Speech-Service unterstützt jetzt die vollständige Implementierung von IBM Cloud Identity and Access Management (IAM). API-Schlüssel für Watson-Services sind nicht länger auf eine einzelne Serviceinstanz beschränkt. Sie können Zugriffsrichtlinien und API-Schlüssel erstellen, die für mehr als einen Service gelten, und Sie können den Zugriff zwischen Services erteilen. Weitere Informationen zu IAM finden Sie unter Authentifizierung bei Watson-Services.

Damit diese Änderung unterstützt wird, verwenden die API-Serviceendpunkte eine andere Domäne und beziehen die Serviceinstanz-ID ein. Das Muster ist api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.

  • Beispiel einer HTTP-URL für eine Instanz, die am Standort Dallas gehostet ist:

    https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • Beispiel für eine WebSocket-URL für eine Instanz, die am Standort Dallas gehostet ist:

    wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

Weitere Informationen zu den URLs finden Sie in der API- und SDK-Referenz.

Diese URLs stellen keine Änderungen dar, die zu Fehlern bei anderen Services führen können. Die neuen URLs funktionieren sowohl für Ihre vorhandenen Serviceinstanzen als auch für neue Instanzen. Die ursprünglichen URLs funktionieren auf Ihren vorhandenen Serviceinstanzen weiterhin für mindestens ein Jahr bis Dezember 2020.

Neue Netz- und Datensicherheitsfunktionen

Unterstützung für die folgenden neuen Netz- und Datensicherheitsfunktionen ist jetzt verfügbar:

  • Unterstützung für private Netzwerk-Endpunkte

    Benutzer von Premium-Plänen können private Netzendpunkte erstellen, um über ein privates Netz eine Verbindung zum Service Text to Speech herzustellen. Für Verbindungen zu privaten Netzendpunkten ist kein öffentlicher Internetzugriff erforderlich. Weitere Informationen finden Sie unter Öffentliche und private Netzendpunkte.

12. November 2019

Neuer Standort in Seoul jetzt verfügbar
Der Service Text to Speech ist jetzt am IBM Cloud-Standort Seoul (kr-seo) verfügbar. Wie andere Standorte auch verwendet dieser IBM Cloud-Standort eine tokenbasierte IAM-Authentifizierung. Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.

1. Oktober 2019

Neue HIPAA-Unterstützung für Premium-Pläne am Standort Washington, DC
Der US-HIPAA-Support ist für Premium-Tarife verfügbar, die am Standort Washington, D.C. gehostet werden und am oder nach dem 1. April 2019 erstellt wurden. Weitere Informationen finden Sie unter US Health Insurance Portability and Accountability Act (HIPAA).

22. August 2019

Fehlerkorrektur: Mehrere kleine Verbesserungen
Fehlerbehebung: Der Dienst wurde aktualisiert, um kleinere Fehler zu beheben und Verbesserungen vorzunehmen.

30. Juli 2019

Neue neuronale Stimme für Japanisch: ja-JP_EmiV3Voice
Der Service bietet nun eine neuronale Stimme in Japanisch: ja-JP_EmiV3Voice. Es stehen nun sowohl Standard- als auch neuronale Versionen aller verfügbaren Stimmen in allen unterstützten Sprachen zur Verfügung. Weitere Informationen finden Sie unter Sprachen und Stimmen.

24. Juni 2019

Neue Unterstützung für Standardstimmen und neuronale Stimmen

Der Service bietet nun zwei Versionen der meisten seiner verfügbaren Stimmen an:

  • Standardstimmen, die mittels Verkettungssynthese Segmente aufgezeichneter Sprache zusammenfügen, um Audio zu erzeugen. Standardstimmen enthalten keine Versionszeichenfolge in ihrem Namen (z. B. en-US_AllisonVoice).
  • Neuronale Stimmen, die komplexe mehrschichtige neuronale Netze (Deep Neural Networks, DNNs) verwenden, um die akustischen (spektralen) Merkmale der gesprochenen Sprache vorherzusagen. Neuronale Stimmen enthalten eine Versionszeichenfolge (V3) in ihrem Namen (z. B. en-US_AllisonV3Voice).

Neuronale Versionen sind für alle Standardstimmen verfügbar, mit Ausnahme der Stimme ja-JP_EmiVoice, für die die neuronale Version ansteht und in Kürze verfügbar sein wird. Sie können die SSML-Elemente <express-as> und <voice-transformation> nicht mit den neuronalen Stimmen verwenden. Auch das Attribut volume des Elements <prosody> kann nicht mit den neuronalen Stimmen verwendet werden. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.

Neuronale V2-Service aus dem Service entfernt

Der Service enthält nicht mehr die zuvor verfügbaren V2-DNN-Stimmen. Wenn Sie eine V2-Stimme in Ihrer Anwendung verwenden, verwendet der Service stattdessen automatisch die entsprechende V3-Stimme.

24. März 2019

Neue neuronale V2-Stimmen für Deutsch

Der Service bietet jetzt V2DNN-Versionen (DNN; Deep Neural Network) für die deutschen Stimmen:

  • de-DE_BirgitV2Voice
  • de-DE_DieterV2Voice

Weitere Informationen zu DNN-basierten Stimmen finden Sie unter Sprachen und Stimmen.

Neue Unterstützung für die Attribute pitch und rate des SSML-Elements <prosody>

Alle DNN-basierten Stimmen des Service unterstützen jetzt die Attribute pitch und rate des SSML-Elements <prosody>. Die DNN-basierten Stimmen unterstützen das Attribut volume des Elements <prosody> nicht. Weitere Informationen enthält der Abschnitt Element 'prosody'.

21. März 2019

Sichtbarkeit von Serviceberechtigungsnachweisen jetzt auf Rolle begrenzt

Benutzer können nun ausschließlich Informationen zu Serviceberechtigungsnachweisen für die Rolle anzeigen, die ihrem IBM Cloud-Konto zugeordnet ist. Falls Ihnen beispielsweise die Rolle reader zugeordnet ist, sind Serviceberechtigungsnachweise der Ebene writer oder einer höheren Ebene für Sie nicht mehr sichtbar.

Diese Änderung betrifft nicht den API-Zugriff für Benutzer oder Anwendungen mit bestehenden Serviceberechtigungsnachweisen. Sie wirkt sich lediglich auf das Anzeigen von Berechtigungsnachweisen in IBM Cloud aus.

4. März 2019

Neue neuronale V2-Stimmen für Englisch und Italienisch

Der Service bietet nun vier neue V2-Stimmen, die Audioausgabe mithilfe einer Deep-Learning-Synthese generieren:

  • en-US_AllisonV2Voice
  • en-US_LisaV2Voice
  • en-US_MichaelV2Voice
  • it-IT_FrancescaV2Voice

Diese neuen Stimmen verwenden maschinelles Lernen und DNN, um synthetisch Sprache aus Text zu erstellen. Die auch als 'DNN-basiert' (Deep Neural Network ) bezeichnete Deep-Learning-Synthese erzeugt Audioausgabe mit einem natürlicheren Satzrhythmus und einer konsistenteren Gesamtqualität.

Die neuen Stimmen erzeugen auch Audioausgabe mit unterschiedlicher Signalqualität, weshalb sie möglicherweise nicht für alle Anwendungen geeignet sind. Außerdem unterstützen die neuen Stimmen die SSML-Elemente <prosody>, <express-as> und <voice-transformation> nicht.

Weitere Informationen zu diesen DNN-basierten Stimmen und ihren Unterschieden zu den vorhandenen Stimmen finden Sie unter Sprachen und Stimmen.

28. Januar 2019

Neue Unterstützung für IBM Cloud IAM nach WebSocket-Schnittstelle

Die WebSocket-Schnittstelle unterstützt jetzt die tokenbasierte Authentifizierung mit Identity and Access Management (IAM) mit browserbasiertem JavaScript-Code. Die bisherige Einschränkung auf das Gegenteil wurde behoben. So können Sie eine authentifizierte Verbindung mit der WebSocket-Methode /v1/synthesize herstellen:

  • Wenn Sie die IAM-Authentifizierung verwenden, geben Sie den Abfrageparameter access_token an.
  • Wenn Sie Cloud Foundry-Serviceberechtigungsnachweise verwenden, geben Sie den Abfrageparameter watson-token an.

Weitere Informationen hierzu finden Sie unter Verbindung öffnen.

13. Dezember 2018

Neuer Standort in London jetzt verfügbar
Der Text to Speech-Service ist jetzt am IBM Cloud®-Standort London verfügbar (eu-gb). Wie alle Standorte verwendet auch London eine tokenbasierte Identitäts- und Zugriffsverwaltung (IAM). Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.

7. November 2018

Neuer Standort in Tokio jetzt verfügbar
Der Text to Speech-Service ist jetzt am IBM Cloud®-Standort Tokio verfügbar (jp-tok). Wie alle Standorte verwendet auch Tokio eine tokenbasierte Identitäts- und Zugriffsverwaltung (IAM). Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.

30. Oktober 2018

Neue Unterstützung für tokenbasiertes IBM Cloud IAM

Der Text to Speech-Service wurde für alle Standorte auf die tokenbasierte Authentifizierung von Identity and Access Management (IAM) migriert. Alle IBM Cloud-Services verwenden jetzt die IAM-Authentifizierung. Der Text to Speech-Service wurde an allen Standorten jeweils am nachfolgend angegebenen Datum migriert:

  • Dallas (us-south): 30. Oktober 2018
  • Frankfurt (eu-de): 30. Oktober 2018
  • Washington DC (us-east): 12. Juni 2018
  • Sydney (au-syd): 15. Mai 2018

Die Migration zur IAM-Authentifizierung wirkt sich auf neue und auf bestehende Serviceinstanzen jeweils anders aus:

  • Alle neuen Service-Instanzen, die Sie an einem beliebigen Standort erstellen, verwenden nun die IAM-Authentifizierung für den Zugriff auf den Service. Sie können entweder ein Trägertoken oder einen API-Schlüssel übergeben: Token unterstützen authentifizierte Anfragen, ohne in jeden Aufruf Serviceberechtigungsnachweise einzubetten, und API-Schlüssel verwenden die HTTP-Basisauthentifizierung. Wenn Sie ein beliebiges Watson-SDK verwenden, können Sie den API-Schlüssel übergeben und dem SDK die Verwaltung des Lebenszyklus der Token überlassen.
  • Vorhandene Serviceinstanzen, die Sie vor dem angegebenen Umstellungstermin an einem Standort erstellt haben, verwenden weiterhin die Kombination aus {username} und {password} aus den vorherigen Cloud Foundry-Serviceberechtigungsnachweisen, bis Sie die betreffenden Services auf die Verwendung der IAM-Authentifizierung umstellen.

Weitere Informationen finden Sie in der folgenden Dokumentation:

12. Juni 2018

Neue Funktionen für am Standort Washington DC gehostete Anwendungen

Die folgenden Funktionen wurden für Anwendungen aktiviert, die in Washington DC (us-east) gehostet werden:

  • Der Service unterstützt jetzt einen neuen Prozess für API-Authentifizierung. Weitere Informationen enthalten die Angaben zur Serviceaktualisierung vom 30. Oktober 2018.
  • Der Service unterstützt jetzt den Header X-Watson-Metadata und die Methode DELETE /v1/user_data. Weitere Informationen finden Sie unter Informationssicherheit.

15. Mai 2018

Neue Funktionen für am Standort Sydney gehostete Anwendungen

Die folgenden Funktionen wurden für Anwendungen aktiviert, die in Sydney (au-syd) gehostet werden:

  • Der Service unterstützt jetzt einen neuen Prozess für API-Authentifizierung. Weitere Informationen enthalten die Angaben zur Serviceaktualisierung vom 30. Oktober 2018.
  • Der Service unterstützt jetzt den Header X-Watson-Metadata und die Methode DELETE /v1/user_data. Weitere Informationen finden Sie unter Informationssicherheit.

2. Oktober 2017

Änderungen am audio/l16-Audioformat
Beim Format audio/l16 können Sie künftig optional einen Endianess-Wert für die zurückgegebene Audioausgabe angeben. (Die Abtastfrequenz mussten Sie bereits angeben.) Beispiele hierfür sind audio/l16;rate=22050;endianness=big-endian und audio/l16;rate=22050;endianness=little-endian; standardmäßig wird die Signifikant-Endian-Reihenfolge verwendet. Weitere Informationen finden Sie unter Audioformate verwenden.

14. Juli 2017

Neue Unterstützung für das Audioformat MP3 (MPEG)
Der Service unterstützt jetzt das Audio-Format 'MP3' oder 'Motion Picture Experts Group' (MPEG). Weitere Informationen zu unterstützten Audioformaten finden Sie unter Audioformate verwenden.

10. April 2017

Neue Unterstützung für das Audioformat 'WebM' (Web Media)
Der Service unterstützt jetzt das Audioformat 'Web Media' (WebM) mit dem Opus- oder Vorbis-Codec. Außerdem unterstützt er das Audioformat 'Ogg' nun zusätzlich zum Opus-Codec mit dem Vorbis-Codec. Weitere Informationen zu unterstützten Audioformaten finden Sie unter Audioformate verwenden.
Neue Unterstützung für Cross-Origin Resource Sharing
Der Service unterstützt jetzt Cross-Origin Resource Sharing (CORS), sodass browserbasierte Clients den Service direkt aufrufen können. Weitere Informationen finden Sie unter CORS support.
Änderungen an HTTP-Antwortcodes für erfolgreichen Abschluss
Die HTTP-Antwortcodes für den erfolgreichen Abschluss einiger Methoden der Anpassungsschnittstelle wurden geändert:
  • Die Methode POST /v1/customizations gibt jetzt 201 (anstelle von 200) zurück.
  • Die Methode POST /v1/customizations/{customization_id} gibt jetzt 200 (anstelle von 201) zurück.
  • Die Methode POST /v1/customizations/{customization_id}/words gibt jetzt 200 (anstelle von 201) zurück.
  • Die Methode PUT /v1/customizations/{customization_id}/words/{word} gibt jetzt 200 (anstelle von 201) zurück.
Neue Fehler bei falscher Verwendung des japanischen Parameters part_of_speech
Die Methoden POST /v1/customizations/{custom_id}/words und PUT /v1/customizations/{customization_id}/words/{word} geben jetzt den HTTP-Antwortcode 400 mit der Fehlernachricht Part of speech is supported for ja-JP language only zurück, falls Sie versuchen, bei einer anderen Sprache als Japanisch eine Wortart (Attribut part_of_speech) anzugeben.
Änderungen am Antworthauptteil für das Hinzufügen von Wortmethoden
Die Methode POST /v1/customizations/{custom_id}/words gibt jetzt einen leeren Antworthauptteil ({}) zurück.

1. Dezember 2016

Neue Stimme für lateinamerikanisches Spanisch: es-LA_SofiaVoice

Der Service enthält eine neue Stimme namens es-LA_SofiaVoice. Sie ist das lateinamerikanische Äquivalent zur Stimme es-US_SofiaVoice. Der Hauptunterschied zwischen den beiden Stimmen betrifft die Interpretation des Zeichens $ (Dollarzeichen): Die lateinamerikanische Version verwendet den Begriff Pesos, die nordamerikanische Version verwendet den Begriff Dolares. Darüber hinaus kann es einige geringere Unterschiede zwischen den beiden Stimmen geben.

Neue Stimmen für amerikanisches Englisch: en-US_LisaVoice und en-US_MichaelVoice

Neben en-US_AllisonVoice können nun zwei weitere Stimmen mit der SSML-Stimmenumwandlung verändert werden: en-US_LisaVoice und en-US_MichaelVoice.

Änderungen an der Anpassung für Japanisch

Wenn Sie die Anpassungsschnittstelle mit Japanisch verwenden, wird vom Service jetzt das längste Wort in den Paaren aus Wort und Umsetzung, die für ein angepasstes Modell definiert sind, als Entsprechung verwendet. Dies lässt sich am Beispiel der beiden folgenden Einträge für ein angepasstes Modell verdeutlichen:

{
  "words": [
    {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"},
    {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"}
  ]
}

Wenn der Dienst die Zeichenfolge „ NYC “ im Eingabetext findet, wird dieses Wort als Übereinstimmung erkannt, da es eine längere Übereinstimmung darstellt als „ NY “. Früher hätte der Dienst die Zeichenfolge „ NY “ gefunden. Weitere Informationen zur Arbeit mit japanischen Einträgen für ein benutzerdefiniertes Modell finden Sie unter „Arbeiten mit japanischen Einträgen “.

22. September 2016

Die Anpassungsfunktion ist nun für alle Sprachen verfügbar
Die Anpassungsschnittstelle, die die Methoden 'customization' und GET /v1/pronunciation umfasst, ist nun für alle vom Service unterstützten Sprachen verfügbar. Die Schnittstelle liegt weiterhin als Betaversion vor. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung.
Neue Unterstützung für SSML für Japanisch
Der Service unterstützt jetzt SSML für Japanisch. Allgemeine Informationen zur SSML-Unterstützung finden Sie in den Erläuterungen zu SSML. Angaben über SPR- und IPA-Symbole für Japanisch enthält der Abschnitt Symbole für Japanisch. Beim Erstellen von Einträgen für Wörter in einem angepassten Modell für Japanisch sind zusätzliche Hinweise und das Feld part_of_speech zu berücksichtigen. Näheres hierzu ist im Abschnitt Mit Einträgen in Japanisch arbeiten zu finden.
Neue SSML-Funktion für Stimmenumwandlung
Der Service bietet jetzt SSML für Stimmenumwandlung über das neue Element <voice-transformation>. Sie können die Bandbreite der möglichen Stimmen erweitern, indem Sie angepasste Umwandlungen erstellen, die die Tonhöhe, den Tonumfang, den glottalen Druck, die Aspiration, das Tempo und das Timbre einer Stimme ändern. Der Service bietet außerdem zwei integrierte virtuelle Stimmen namens Young und Soft. Gegenwärtig wird die Stimmenumwandlung vom Service nur bei der Stimme 'Allison' für amerikanisches Englisch unterstützt.
Wordtaktinformationen jetzt über WebSocket-Schnittstelle verfügbar
Der Service kann jetzt für alle Zeichenfolgen des Eingabetextes, den Sie an die WebSocket-Schnittstelle übergeben, Worttaktinformationen zurückgeben. Um die Start- und die Endzeit jeder Zeichenfolge in der Eingabe zu erhalten, geben Sie ein Array an, das die Zeichenfolge words für den optionalen Parameter timings des JSON-Objekts enthält, das Sie an den Service übergeben. Für Eingabetext in Japanisch ist die Funktion gegenwärtig nicht verfügbar. Weitere Informationen hierzu finden Sie unter Wortzeitdauer generieren.
Neue Unterstützung für SSML-Validierung
Der Service validiert jetzt alle SSML-Elemente, die Sie in einem beliebigen Inhalt übergeben. Falls er einen ungültigen Tag findet, meldet der Service einen HTTP-Antwortcode 400 mit einer beschreibenden Nachricht und die Methode schlägt fehl. In früheren Versionen behandelte der Dienst Fehler uneinheitlich; die Angabe einer ungültigen Wortaussprache konnte beispielsweise zu unvorhersehbarem oder uneinheitlichem Verhalten führen. Weitere Informationen finden Sie unter SSML-Validierung.
IBM Format SPR wird jetzt mit ibm anstelle von spr angegeben
Die Verwendung von spr als Argument für die Option format der Methode GET /v1/pronunciation und für die Verwendung mit dem Attribut alphabet eines SSML-Elements <phoneme> ist veraltet. Verwenden Sie zur Verwendung der Schreibweise gemäß IBM SPR in allen Fällen das Argument ibm anstelle von spr.
Neue Unterstützung für Audioformat audio/mulaw
Die Liste der unterstützten Audioformate enthält jetzt audio/mulaw;rate={rate}. Wie bei audio/basic handelt es sich hierbei um ein Einzelkanalaudioformat, das mithilfe von 8-Bit-U-Law-Daten (oder Mu-Law-Daten) mit einer Abtastfrequenz von 8 kHz codiert wird. Weitere Informationen finden Sie unter Audioformate verwenden.
Neue unterstützte Funktionen beim Auflisten von Stimmen
Die Methoden GET /v1/voices und GET /v1/voices/{voice} geben jetzt als Teil der Ausgabe für jede Stimme ein Objekt supported_features zurück. Das Objekt beschreibt, ob die Stimme die Anpassung und das SSML-Element <voice_transformation> unterstützt. Weitere Informationen finden Sie unter Sprachen und Stimmen.

23. Juni 2016

Neue WebSocket-Schnittstelle für Sprachsynthese

Der Service bietet jetzt für die synthetische Erstellung von Sprache aus Text eine WebSocket-Schnittstelle. Die Schnittstelle bietet dieselben Funktionen wie die Methode /v1/synthesize der HTTP-Schnittstelle. Sie akzeptiert einfachen Text oder Text mit der XML-basierten Markup-Sprache 'Speech Synthesis Markup Language' (SSML). Darüber hinaus unterstützt die Schnittstelle auch die Verwendung des SSML-Elements <mark>, um den Zeitpunkt in der Audioausgabe zu ermitteln, zu der die Synthetisierung des gesamten Texts vor der Markierung abgeschlossen ist. Weitere Informationen finden Sie im Abschnitt WebSocket-Schnittstelle.

Erweiterte Sprachunterstützung für SSML

Der Service bietet jetzt für Text, der mit SSML annotiert ist, Unterstützung für die Sprachen Kastilisch und nordamerikanisches Spanisch, Italienisch und brasilianisches Portugiesisch. Die Verwendung von SSML wurde vom Service zuvor bereits für amerikanisches und britisches Englisch, Französisch sowie Deutsch unterstützt. Ab dieser Aktualisierung unterstützt der Service SSML bei allen Sprachen außer Japanisch. Darüber hinaus können Sie sowohl mit IBM SPR als auch mit dem IPA über das SSML-Element <phoneme> definieren, wie Wörter ausgesprochen werden sollen. Weitere Informationen finden Sie in den Erläuterungen zu SSML und den Erläuterungen zu phonetischen Zeichen.

Bei amerikanischem Englisch können Sie Worteinträge in einem angepassten Modell auch mithilfe des SSML-Elements <phoneme> erstellen. Eine Anpassung wird nur für amerikanisches Englisch unterstützt. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung.

Aktualisierte Stimmen für verbesserte Sprachsynthese

Der Service bietet für die am häufigsten verwendeten Stimmen eine verbesserte Expressivität und Natürlichkeit. Grundlage der Verbesserungen ist die auf Recursive Neural Network (RNN) basierende Prosodievorhersage aus dem Eingabetext. Diese Verbesserungen werden als neue Service-Engine und Sprechmodellaktualisierungen für die folgenden Sprachen verfügbar gemacht:

  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • fr-FR_ReneeVoice
Neuer Parameter für Anpassungs-ID für Wortaussprache

Die Methode GET /v1/pronunciation akzeptiert jetzt den optionalen Abfrageparameter customization_id. Über den Parameter wird eine Wortumsetzung aus einem angegebenen angepassten Modell abgerufen. Enthält das angepasste Modell das Wort nicht, wird von der Methode die Standardaussprache des Wortes zurückgegeben. Weitere Informationen finden Sie in der API- und SDK-Referenz.

Bei Verwendung der Methode GET /v1/pronunciation ohne Anpassungs-ID und für eine andere Sprache als amerikanisches Englisch können Sie die Aussprache eines Wortes nur in der Schreibweise nach IBM SPR anfordern. Für eine andere Sprache als amerikanisches Englisch müssen Sie spr mit der Option format der Methode angeben.

Neue Unterstützung für Audioformat audio/basic

Die Liste der unterstützten Audioformate umfasst jetzt auch audio/basic. Dieses Format stellt eine Einkanalaudioausgabe mit in 8-Bit-U-Law (oder Mu-Law) codierten Daten und einer Abtastfrequenz von 8 kHz bereit. Weitere Informationen finden Sie unter Audioformate verwenden.

HTTP- und WebSocket-Schnittstelle können jetzt Warnungen zurückgeben

Die HTTP- und WebSocket-Methoden /v1/synthesize können eine Antwort des Typs warnings zurückgeben, die Nachrichten über ungültige Abfrageparameter oder JSON-Felder in einer Anforderung enthält. Das Format der Warnungen wurde geändert. Das folgende Beispiel zeigt das vorherige Format:

"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."

Dieselbe Warnung hat jetzt das folgende Format:

"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."

10. März 2016

Von Synthesemethoden können jetzt Warnungen zurückgegeben werden
Die Methoden GET und POST /v1/synthesize können jetzt einen Antwortheader namens Warnings zurückgeben, der eine Liste mit Warnungen über ungültige Abfrageparameter oder JSON-Felder in der Anforderung enthält. Jedes Element der Liste enthält eine Zeichenfolge, die die Art der Warnung gefolgt von einem Array ungültiger Argumentzeichenfolgen beschreibt. Beispiel: Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']. Weitere Informationen finden Sie imAPI & SDK-Referenz.
Betaversion des Apple iOS SDK wird nicht mehr verwendet
Die Betaversion von Watson Speech Software Development Kit (SDK) für das Betriebssystem Apple ® iOS ist veraltet und wird durch Watson Swift-SDK ersetzt. Das neue SDK ist im Repository „swift-sdk“ im Namespace „ watson-developer-cloud “ unter GitHub verfügbar.

22. Februar 2016

Neue SSML-Funktion für Expressivität
Der Service wurde mit einer neuen SSML-Funktion für die Expressivität aktualisiert. Der Service erweitert SSML mit einem Element <express-as>, mit dem Sie die Expressivität in einem der drei folgenden Sprachstile angeben können: GoodNews, Apology oder Uncertainty. Das Element kann auf den gesamten Text, einen Satz, einen Ausdruck oder ein Wort angewendet werden. Die Expressivität wird vom Service gegenwärtig nur bei der Stimme 'Allison' für amerikanisches Englisch unterstützt (en-US_AllisonVoice).

17. Dezember 2015

Neue Anpassungsschnittstelle als Betaversion

Der Service bietet eine neue Anpassungsschnittstelle, mit der Sie angeben können, wie er ungewöhnliche Wörter aussprechen soll, die in der Eingabe enthalten sind. Die Schnittstelle enthält einige neue Methoden, mit denen Sie benutzerdefinierte Modelle und die darin enthaltenen Wort-Übersetzungs-Paare erstellen und verwalten können. Anschließend können Sie Ihre angepassten Modelle bei der synthetischen Erstellung von Audioausgabe aus Text verwenden.

Der Service unterstützt gleich klingende und phonetische Umsetzungen. Phonetische Umsetzungen können entweder die Darstellung in IPA (International Phonetic Alphabet) oder das IBM Format SPR (Symbolic Phonetic Representation) verwenden. Zum Angeben von phonetischen Umsetzungen wird SSML verwendet.

Die Anpassungsschnittstelle enthält eine Reihe von neuen HTTP-Methoden namens POST /v1/customizations, POST /v1/customizations/{customization_id}, POST /v1/customizations/{customization_id}/words und PUT /v1/customizations/{customization_id}/words/{word}. Außerdem bietet der Service eine neue Methode GET /v1/pronunciation, mit der die Aussprache für ein beliebiges Wort zurückgegeben wird, sowie die neue Methode GET /v1/voices/{voice}, die detaillierte Informationen zu einer bestimmten Stimme zurückgibt. Darüber hinaus akzeptieren vorhandene Methoden der Schnittstelle des Service jetzt nach Bedarf angepasste Modellparameter.

Weitere Informationen über die Anpassung und ihre Schnittstelle finden Sie unter Verständnis der Anpassung und in der API- und SDK-Referenz.

Die Anpassungsschnittstelle liegt als Betaversion vor, die gegenwärtig nur amerikanisches Englisch unterstützt. Alle Anpassungsmethoden und die Methode GET /v1/pronunciation können derzeit nur in amerikanischem Englisch zum Erstellen und Bearbeiten von angepassten Modellen und Wortumsetzungen verwendet werden.

Neue Stimme für brasilianisches Portugiesisch: pt-BR_IsabelaVoice

Der Service unterstützt eine neue Stimme namens pt-BR_IsabelaVoice für die synthetische Erstellung von Audioausgabe in brasilianischem Portugiesisch mit einer Frauenstimme. Weitere Informationen finden Sie unter Sprachen und Stimmen.

21. September 2015

Neue SDKs für mobile Geräte verfügbar

Für die Sprachservices sind zwei neue Software Development Kits (SDKs) für mobile Geräte verfügbar. Die SDKs ermöglichen mobilen Anwendungen eine Interaktion mit dem Text to Speech-Service und dem Speech to Text-Service. Mithilfe der SDKs können Sie Text an den Text to Speech-Service senden und eine Sprachausgabe empfangen.

Beide SDKs unterstützen die Authentifizierung bei den Speech-Services entweder mit Ihren IBM Cloud-Serviceberechtigungsnachweisen oder mit einem Authentifizierungstoken. Da es sich bei den SDKs um Beta-Funktionen handelt, können sie sich in Zukunft ändern.

Neue Stimme für Japanisch: ja-JP_EmiVoice

Der Service unterstützt jetzt mit Japanisch eine weitere Sprache. Die Stimme ja-JP_EmiVoice ist eine Frauenstimme für Japanisch.

1. Juli 2015

Der Service Text to Speech ist jetzt allgemein verfügbar

Der Service wurde am 1. Juli 2015 von der Betaversion auf allgemeine Verfügbarkeit umgestellt. Die folgenden Unterschiede bestehen zwischen der Beta- und der GA-Version der „ Text to Speech “-API. Für das allgemein verfügbare Release müssen die Benutzer ein Upgrade auf die neue Version des Service durchführen.

Neues tokenbasiertes Programmiermodell

Ein neues Programmiermodell unterstützt die direkte Interaktion zwischen einem Client und dem Service. Bei Verwendung dieses Modells kann ein Client ein Authentifizierungstoken für die direkte Kommunikation mit dem Service anfordern. Bei Verwendung des Tokens ist der Client nicht mehr gezwungen, eine serverseitige Proxy-Anwendung in IBM Cloud zu nutzen, die den Service in seinem Namen aufruft. Tokens sind die bevorzugte Methode für die Interaktion von Clients mit dem Service.

Der Service unterstützt weiterhin das alte Programmiermodell, das auf einem serverseitigen Proxy zur Weitergabe der Kommunikation und der Daten zwischen dem Client und dem Service verwendet wird. Das neue Modell ist jedoch effizienter und bietet einen höheren Durchsatz.

Neue Unterstützung für Speech Synthesis Markup Language

Sie können jetzt SSML (Speech Synthesis Markup Language) an die HTTP-Versionen GET und POST der Methode /v1/synthesize übergeben. SSML ist eine XML-basierte Markup-Sprache, die für die Bereitstellung von Annotationen von Text für Sprachsyntheseanwendungen wie den Text to Speech-Service konzipiert wurde. Zusätzliche Informationen zur Übergabe von SSML-Eingabe an den Service finden Sie unter Eingabetext angeben.

Der Service unterstützt die Verwendung von SSML zunächst nur für britisches sowie amerikanisches Englisch, Französisch und Deutsch. Die Verwendung von SSML bei Italienisch und Spanisch wird durch den Service nicht unterstützt. Achten Sie bei Verwendung von SSML darauf, dass Sie für die Sprachausgabe keine Stimme in einer der nicht unterstützten Sprache auswählen. Die Ergebnisse in diesem Fall sind nicht sinnvoll.

Änderungen an verfügbaren Stimmen

Die Stimmen, die für die synthetische Sprachausgabe unterstützt werden, die verändert und erweitert wurde. Der Dienst unterstützt nun über die Methoden „ /v1/synthesize “ mehrere weitere Stimmen, Sprachen und Dialekte. Zusätzliche Angaben über unterstützte Stimmen enthält der Abschnitt Sprachen und Stimmen.

In der allgemein verfügbaren Version wurden die in der Betaversion verfügbaren Stimmen umbenannt:

  • VoiceEnUsMichael ist jetzt en-US_MichaelVoice
  • VoiceEnUsLisa ist jetzt en-US_LisaVoice
  • VoiceEsEsEnrique ist jetzt es-ES_EnriqueVoice

Die vorherigen Namen der Stimmen können bei der Betaversion des Service (über die API-Endpunkte -beta) weiterhin verwendet werden, solange diese Version verfügbar bleibt. Bei der allgemein verfügbaren Version des Service müssen Sie jedoch die neuen Namen verwenden.

Neue Unterstützung für das Audioformat FLAC (Free Lossless Audio Codec)

Sie können künftig anfordern, dass der Service Sprachausgabe im Format 'Free Lossless Audio Codec' (FLAC) zurückgibt. Der Service kann Sprachausgabe weiterhin im Format 'Ogg' mit dem Opus-Codec (Standardeinstellung) und im Format 'Waveform Audio File Format' (WAV) zurückgeben. Weitere Informationen zur Verwendung von Audioformaten mit den /v1/synthesize-Methoden finden Sie in Audioformate verwenden.

Neue Grenzwerte für die maximale Anzahl synthetisierter Texte

Der Text, den Sie an die Methode /v1/synthesize in der URL einer HTTP-Anforderung GET oder im Hauptteil einer HTTP-Anforderung POST senden, ist jetzt auf eine Größe vom maximal 5 KB begrenzt. Bei der Betaversion galt für den Text eine maximale Größe von 4 MB.

Neuer Header zum Inaktivieren von Mitarbeit in Bezug auf Serviceverbesserungen

Bei der Methode /v1/synthesize können Sie jetzt durch eine Einbeziehung des Headers X-WDC-PL-OPT-OUT steuern, ob der Service Text und Audioergebnisse aus einer Operation nutzt, um künftige Ergebnisse zu verbessern. Geben Sie für den Header den Wert 1 an, um zu verhindern, dass der Service Text und Audioergebnisse nutzt. Der Parameter gilt nur für die aktuelle Anforderung. Der neue Header ersetzt den Header X-logging aus den Methoden der Betaversion. Weitere Informationen enthält der Abschnitt Anforderungsprotokollierung für Watson-Services steuern.

Änderungen an HTTP-Fehlercodes für Sprachsynthese

Die folgende Fehlercodes für die Methoden /v1/synthesize wurden geändert:

  • Der Fehlercode 406 ("Not acceptable. Unsupported MIME type.") wird entfernt.
  • Der Fehlercode 415 ("Unsupported Media Type") wurde hinzugefügt.
  • Der Fehlercode 503 ("Service Unavailable") wurde hinzugefügt.
Änderungen an HTTP-Fehlercodes zum Auflisten von Stimmen

Die folgenden Fehlercodes für die Methode GET /v1/voices wurden geändert:

  • Der Fehlercode 406 ("Not acceptable. Unsupported MIME type.") wird entfernt.
  • Der Fehlercode 415 ("Unsupported Media Type") wurde hinzugefügt.