Releaseinformationen für Text to Speech for IBM Cloud
IBM Cloud
Die folgenden Funktionen und Änderungen wurden für jede Version und jedes Update von verwalteten Instanzen von „ IBM Watson® Text to Speech “, die auf IBM Cloud gehostet werden, sowie für Instanzen, die auf IBM Cloud Pak for Data as a Service. Sofern nicht anders angegeben, sind alle Änderungen mit früheren (älteren) Versionen kompatibel und werden für alle neuen und vorhandenen Anwendungen automatisch und transparent verfügbar gemacht.
Informationen zu bekannten Einschränkungen des Service finden Sie unter Bekannte Einschränkungen.
Informationen zu Releases und Aktualisierungen des Service für IBM Cloud Pak for Data finden Sie unter Releaseinformationen für Text to Speech for IBM Cloud Pak for Data.
15. Mai 2026
- Neue natürliche Frauenstimme (brasilianisches Portugiesisch)
-
Der Dienst unterstützt nun eine neue weibliche natürliche Stimme für brasilianisches Portugiesisch:
pt-BR_IsabelaNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie
26. März 2026
- Veraltete v1 zu v3 Sprachübergang
-
Zuvor veraltete Standard-Voices zur Verkettung ( v1 ) werden nun während der Synthese durch ihre neuralen Äquivalente ( v3 ) ersetzt. Wenn eine Anfrage eine dieser v1 Stimmen angibt, wird stattdessen die entsprechende v3 Stimme verwendet.
de-DE_BirgitVoice->de-DE_BirgitV3Voicede-DE_DieterVoice->de-DE_DieterV3Voiceen-GB_KateVoice->en-GB_KateV3Voiceen-US_AllisonVoice->en-US_AllisonV3Voiceen-US_LisaVoice->en-US_LisaV3Voiceen-US_MichaelVoice->en-US_MichaelV3Voicees-ES_EnriqueVoice->es-ES_EnriqueV3Voicees-ES_LauraVoice->es-ES_LauraV3Voicees-LA_SofiaVoice->es-LA_SofiaV3Voicees-US_SofiaVoice->es-US_SofiaV3Voicefr-FR_ReneeVoice->fr-FR_ReneeV3Voiceit-IT_FrancescaVoice->it-IT_FrancescaV3Voiceja-JP_EmiVoice->ja-JP_EmiV3Voicept-BR_IsabelaVoice->pt-BR_IsabelaV3Voice
Wenn Sie den optionalen Parameter „
voice“ in einer Sprachsyntheseanfrage weglassen, verwendet der Dienst nun standardmäßig „en-US_MichaelV3Voice“. Diese neuronale Stimme ( v3 ) ersetzt die bisherige standardmäßige Verkettungsstimme ( v1 )en-US_MichaelVoice.
11. März 2026
- Wichtig! Abschaffung der Beta-Funktion Tune by Example
-
Die Beta-Funktion Tune by Example ist veraltet. Die APIs zur Erstellung neuer Prompts oder Sprechermodelle werden nicht mehr unterstützt.
- Bestehende Benutzer: Bestehende Anpassungen, die bereits Prompts oder Sprechermodelle enthalten, werden für einen begrenzten Zeitraum weiterhin für die Sprachsynthese funktionieren. Es können jedoch keine neuen Prompts oder Sprechermodelle erstellt werden.
- Neue Benutzer: Die APIs zum Erstellen von Prompts oder Sprechermodellen sind deaktiviert und können nicht verwendet werden.
Die Funktion "Tune by Example" wird in einer zukünftigen Version vollständig aus dem Dienst entfernt werden. Nach der Entfernung wird die Synthese mit Anpassungen, die auf Eingabeaufforderungen oder Lautsprechermodellen basieren, nicht mehr unterstützt.
13. Januar 2026
- Neue englische natürliche Stimmen
-
Der Dienst unterstützt nun zwei neue natürliche Stimmen – eine männliche und eine weibliche – für australisches Englisch:
en-AU_JackNaturalen-AU_HeidiNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie
05. Dezember 2025
- Neue lateinamerikanische spanische Naturstimmen
-
Der Dienst unterstützt nun zwei neue natürliche Stimmen – eine männliche und eine weibliche – für lateinamerikanisches Spanisch:
es-LA_AlejandroNaturales-LA_DanielaNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie
31. Oktober 2025
- Neue brasilianisch-portugiesische Naturstimmen
-
Der Dienst unterstützt jetzt zwei neue natürliche Stimmen - eine männliche und eine weibliche - für brasilianisches Portugiesisch:
pt-BR_LucasNaturalpt-BR_CamilaNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie
24. Juli 2025
- Neue englische natürliche Stimmen
-
Der Dienst unterstützt jetzt vier neue natürliche Stimmen - zwei männliche und zwei weibliche - für US-Englisch:
en-US_EmmaNaturalen-US_EthanNaturalen-US_JacksonNaturalen-US_VictoriaNatural
Der Dienst unterstützt jetzt zwei neue natürliche Stimmen - männlich und weiblich - für britisches Englisch:
en-GB_ChloeNaturalen-GB_GeorgeNatural
Der Dienst unterstützt jetzt eine neue weibliche natürliche Stimme für CA English:
en-CA_HannahNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie
09. Juli 2025
- Abschaffung von V1 Stimmen
- Mit Wirkung vom 07. September 2025 werden alle Stimmen von V1 aus dem Dienst genommen. Alle veralteten v1 Stimmen werden innerhalb der nächsten 12 Monate automatisch auf die entsprechenden v3 Stimmen umgestellt.
19. Mai 2025
- Neue Generation von Stimmen - Natürliche Stimmen
-
Der Dienst unterstützt jetzt eine neue Generation von Stimmen, die Natural Voices, mit einer neuen Stimme für US-Englisch:
en-US_EllieNatural
Natural Voices bieten eine erweiterte Leistung in Bezug auf Natürlichkeit und Ausdruckskraft. Diese Stimmen verwenden verschiedene Techniken, um einen Vorteil gegenüber den expressiven Stimmen zu erzielen. Weitere Informationen finden Sie unter Natürliche Stimmen.
- Der Dienst unterstützt jetzt ein zusätzliches optionales
format-Attribut für<say-as interpret-as="letters" format="xx">SSML-Tag -
Sie können nun den Wert
groupodersinglemit dem optionalen Attributformatangeben. Diese Attribute tragen dazu bei, die Lesbarkeit alphanumerischer Zeichenfolgen, wie z. B. die Bestätigung von Zahlen und ID, durch das Hinzufügen strategischer Pausen zu verbessern.
17. Februar 2025
- Neue brasilianisch-portugiesische männliche ausdrucksstarke neurale Stimme
-
Der Dienst unterstützt jetzt eine neue männliche, ausdrucksstarke neuronale Stimme für brasilianisches Portugiesisch:
pt-BR_LucasExpressive
Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie
09. Dezember 2024
- Neue ausdrucksstarke neurale Stimme in UK Englisch für Männer
-
Der Dienst unterstützt jetzt eine neue männliche ausdrucksstarke neuronale Stimme für UK-Englisch:
en-GB_GeorgeExpressive
Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie
15. Mai 2024
- Neue lateinamerikanische spanische weibliche ausdrucksstarke neurale Stimme
-
Der Service unterstützt jetzt eine neue ausdrucksstarke neuronale Stimme für lateinamerikanisches Spanisch
es-LA_DanielaExpressive
Expressive neuronale Stimmen bieten natürlich klingende Sprache, die klar, knackig und flüssig ist. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie
16. Januar 2024
- Text to Speech-Verbesserungen für expressive Stimmen in amerikanischem Englisch
- Wenn Sie expressive Stimmen in amerikanischem Englisch verwenden, ist die Synthese mit geringerer Latenzzeit schneller.
- Defekt behoben: Beugungsfehler bei Verwendung des Fragezeichens (?) in einer kurzen Äußerung
- Fehlerkorrektur: Wenn einige kurze Äußerungen mit einem Fragezeichen (?) beendet wurden, wurde die Beugung ignoriert. Dieses Problem ist nun behoben.
30. November 2023
- Verbesserte Text to Speech-Syntheseengine für Stimmen der Version 3
- Die Text to Speech-Engine wurde verbessert, um eine schnellere Synthese mit geringerer Latenz für Stimmen der Version 3 zu ermöglichen.
- Verbesserte Text to Speech en-AU_HeidiExpressive
- Die Text to Speech en-AU_HeidiExpressive wurde verbessert und kann die Tonhöhe und Synthese anpassen.
9. Juni 2023
- Defekt behoben: TTS scheitert nicht mehr an der Fehlermeldung "[Errno 2] No such file or directory"
- Defekt behoben: Wenn TTS mit Websockets verwendet wird, scheitert es nicht mehr an der Fehlermeldung "[Errno 2] No such file or directory"
18. Mai 2023
- Fehlerkorrektur: Unterstützung für fehlende SSML-Funktionen in der niederländischen Stimme hinzugefügt
- Fehlerkorrektur: Bei Verwendung der niederländischen Stimme funktionieren jetzt alle unterstützten SSML-Funktionen wie entworfen. Bisher funktionierten bei der Verwendung der niederländischen Stimme einige SSML-Funktionen nicht.
- Fehlerkorrektur: Commas werden jetzt bei der Verwendung von Phonem-Tags berücksichtigt
- Fehlerkorrektur: Bei Verwendung von Phonem-Tags in SSML funktionieren Kommas (Pausen) jetzt wie erwartet. Früher wurde die Pause ignoriert, wenn Kommas vor oder nach Text mit Phonem-Tags standen.
6. April 2023
- Aktualisierungen der Betaversion Niederlande Niederländisch erweiterte neuronale Stimme
- Fehlerkorrektur: Die Betaversion von Netherlands Dutch
nl-NL_MerelV3Voicewurde für interne Fixes und Verbesserungen aktualisiert. Die Einschränkungen, die für die erste Version der Stimme in der Dienstaktualisierung vom 31. März 2023 beschrieben sind, gelten weiterhin.
31. März 2023
- Wichtig: Ende des Servicezeitraums für alle neuronalen Stimmen
-
Wichtig: Alle neuronalen Stimmen haben ihr Serviceenddatum erreicht und wurden aus dem Service und der Dokumentation entfernt. Es sind keine verstärkten neuralen oder expressiven neuralen Stimmen betroffen. Eine vollständige Liste aller veralteten neuronalen Stimmen finden Sie in den Dienstaktualisierungen vom 1. März 2023. Der Versuch, eine veraltete Stimme zu verwenden, liefert den HTTP 404 mit der Meldung "
Model '{voice}' not found.Neue neuronale und expressive neuronale Stimmen sind für das australische Englisch, Koreanisch und Niederländisch verfügbar. Sie müssen auf eine der neuen Stimmen für australisches Englisch, Koreanisch oder Niederländisch umsteigen, um die veralteten Sprachen weiterhin verwenden zu können.
Weitere Informationen finden Sie unter Sprachen und Stimmen.
22. März 2023
- Neue Betaversion Niederlande Niederländisch erweiterte neuronale Stimme
-
Der Service unterstützt jetzt eine neue erweiterte neuronale Frauenstimme für Niederländisch (Niederlande):
nl-NL_MerelV3VoiceEs unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole.Bei der neuen Stimme handelt es sich um Beta-Funktionen, bis die Unterstützung für SSML abgeschlossen ist. In der ersten Version unterstützt die Stimme die Verwendung der folgenden SSML-bezogenen Funktionen nicht:
- Das Element
<prosody>mit einer Sprachsyntheseanforderung - Die Parameter
rate_percentageundpitch_percentagemit allen Sprachsyntheseanforderungen - Element
<mark>mit einer WebSocket-Sprachsyntheseanforderung - Parameter
timingsder JSON-Textnachricht mit einer WebSocket-Sprachsyntheseanforderung
Weitere Informationen über die neue Stimme, ihre Unterstützung für IPA-und SPR-Symbole und die Migration von den veralteten niederländischen neuronalen Stimmen auf die neue Stimme finden Sie unter
- Das Element
- Fehlerkorrektur: Aktualisieren Sie koreanische phonetische Symbole in der Dokumentation
-
Defekt behoben: In der Dokumentation für koreanische SPR-Symbole werden zweistellige Symbole für Konsonanten jetzt in einfache Anführungszeichen gesetzt, so dass sie ein einziges Symbol sind. Zuvor wurden sie als zwei separate Symbole ohne Anführungszeichen dargestellt. Weitere Informationen finden Sie unter Konsonanten(Koreanisch).
- Dokumentationsaktualisierungen für IBM SPR-Symbole
-
Die Übersichtsdokumentation für IBM SPR-Symbole wurde aktualisiert, um die Verwendung von Symbolen mit mehreren Zeichen zu verdeutlichen. Weitere Informationen finden Sie unter Sprachensymbole.
1. März 2023
- Wichtig: Ausstehendes Ende des Servicezeitraums für alle neuronalen Stimmen
-
Wichtig: Mit Wirkung vom 31. März 2023 erreichen alle neuronalen Stimmen das Serviceenddatum und werden aus dem Service und der Dokumentation entfernt. Die neuronalen Stimmen sind seit dem 31. März 2022 veraltet. Es sind keine erweiterten neuronalen oder expressiven neuronalen Stimmen betroffen.
Die folgenden neuronalen Stimmen werden entfernt:
- Arabisch:
ar-MS_OmarVoice - Chinesisch (Mandarin):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceundzh-CN_ZhangJingVoice - Tschechisch:
cs-CZ_AlenaVoice - Niederländisch (Belgien):
nl-BE_AdeleVoiceundnl-BE_BramVoice - Niederländisch (Niederlande):
nl-NL_EmmaVoiceundnl-NL_LiamVoice - Englisch (Australien):
en-AU_CraigVoice,en-AU_MadisonVoiceunden-AU_SteveVoice - Koreanisch:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceundko-KR_YunaVoice - Schwedisch:
sv-SE_IngridVoice
Neue erweiterte neuronale und expressive neuronale Stimmen sind bereits für die australische englische und koreanische Sprache verfügbar. In den kommenden Wochen wird eine neue erweiterte neuronale Stimme für die niederländische Sprache verfügbar sein. Sie müssen vor dem 31. März 2023 auf eine der neuen Stimmen für Englisch (Australien), Koreanisch oder Niederländisch (Niederlande) migrieren.
Weitere Informationen finden Sie unter Sprachen und Stimmen.
- Arabisch:
27. Februar 2023
- Neue australische englische expressive neuronale Stimmen
-
Der Service unterstützt jetzt zwei neue expressive neuronale Stimmen, männlich und weiblich, für australisches Englisch:
en-AU_HeidiExpressiveen-AU_JackExpressive
Expressive neuronale Stimmen bieten natürlich klingende Sprache, die außergewöhnlich klar, knackig und flüssig ist. Die neuen Stimmen sind nun allgemein verfügbar (GA) und können in der Produktion eingesetzt werden. Sie unterstützen sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie
Sie können von neuronalen Stimmen für australisches Englisch, die veraltet sind, auf die neuen expressiven neuronalen Stimmen migrieren.
- Neue koreanische erweiterte neuronale Stimme
-
Der Service unterstützt jetzt eine neue neuronale weibliche Stimme für Koreanisch:
ko-KR_JinV3Voice. Die neue Stimme ist allgemein verfügbar (GA) für den Produktionseinsatz. Es unterstützt sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden SieSie können von koreanischen neuronalen Stimmen, die veraltet sind, auf die neue erweiterte neuronale Stimme migrieren.
- Fehlerkorrektur: Französisch-kanadische Stimme verarbeitet numerische Zeiten jetzt richtig
-
Fehlerkorrektur: Die französischen und kanadischen Stimmen sprechen Zeiten wie
19:41nun korrekt aus. Bisher wurden die Stimmen ausgelassen Elemente der Zeit in der synthetisierten Audio. - Fehlerkorrektur: Japanische Stimme fügt nicht mehr unerwartetes Audio ein
-
Fehlerkorrektur: Die japanische Stimme fügt nicht mehr unerwartete Audiodaten in Sprachsyntheseergebnisse ein. Zuvor wurden in bestimmten Fällen andere Töne eingefügt.
20 Januar 2023
- Einstellung der Unterstützung für Cloud Foundry und Migration auf Ressourcengruppen
-
{{{site.data.keyword.IBM_notm}} kündigte die Abschaffung von IBM Cloud Foundry zum 31. Mai 2022 an. Ab dem 30. November 2022 können neue IBM Cloud Foundry nicht mehr erstellt werden und nur noch bestehende Nutzer können Anwendungen bereitstellen. IBM Cloud Foundry erreicht das Ende des Supports am 1. Juni 2023. Dann werden alle IBM Cloud Foundry, auf denen IBM Cloud Foundry werden dauerhaft deaktiviert, deprovisioniert und gelöscht.
Um Ihre IBM Cloud über den 1. Juni 2023 hinaus nutzen zu können, müssen Sie vor diesem Datum zu Ressourcengruppen migrieren. Ressourcengruppen sind konzeptionell ähnlich wie Cloud Foundry. Dazu gehören mehrere zusätzliche Vorteile, wie beispielsweise eine feinere Zugriffskontrolle durch den Einsatz von „ IBM Cloud Identity and Access Management “ (IAM), die Möglichkeit, Service-Instanzen mit Anwendungen und Diensten in verschiedenen Regionen zu verbinden, sowie eine einfache Möglichkeit, die Nutzung nach Gruppen anzuzeigen.
- Fehlerkorrektur: Die Angabe großer Kardinalzahlen mit dem Element
<say-as>führt nicht mehr zu Fehlern bei englischen Stimmen -
Fehlerkorrektur: Sie können jetzt das Element
<say-as>verwenden, um große Zahlen als Kardinalzahlen auszusprechen. Zuvor konnte das Einschließen einer großen Zahl in das<say-as>mit dem Attributinterpret-as="cardinal"dazu führen, dass die Sprachsynthese für englische Stimmen fehlschlug. Zum Beispiel könnte<say-as interpret-as="cardinal">3,200</say-as>dazu führen, dass der Dienst einen Fehler erzeugt. Weitere Informationen finden Sie unter cardinal im Abschnitt SSML-Elemente. - Fehlerkorrektur: Homonyme und andere Wörter werden nun korrekt von englischen Stimmen ausgesprochen
-
Fehlerkorrektur: Der Service spricht jetzt Homonyme und andere Wörter basierend auf ihrem Kontext im englischen Text, der synthetisiert werden soll, korrekt aus. Zuvor konnten Wörter wie
advocateundwifivon englischen Stimmen falsch ausgesprochen werden.
30. November 2022
- Fehlerkorrektur: Regeln für die Dokumentation zur Benennung angepasster Modelle hinzufügen
- Fehlerkorrektur: Die Dokumentation enthält jetzt detaillierte Regeln für die Benennung angepasster Modelle. Weitere Informationen finden Sie
7. Oktober 2022
- Der Service erzwingt jetzt eine strengere SSML-Validierung
- Der Service erzwingt jetzt eine strengere Validierung von Eingabetext, der SSML-Elemente (Speech Synthesis Markup Language) enthält. Erforderliche Elemente von Attributen müssen mit gültigen Werten angegeben werden. Andernfalls schlägt die Anforderung mit dem Fehlercode 400 fehl. Weitere Informationen zur SSML-Validierung und zu den Anforderungen, die markierungsfähiger Text erfüllen muss, finden Sie unter SSML-Validierung.
- Defekt behoben: Das Geschlecht, das für die
en-US_MichaelExpressiveStimme aufgelistet wird, ist nun korrekt - Fehlerkorrektur: Wenn Sie Informationen zu den verfügbaren Stimmen auflisten, lautet die
genderderen-US_MichaelExpressive-Stimme jetztmale. Zuvor wurde das Geschlecht der Stimme fälschlicherweise alsfemalebeschrieben. Weitere Informationen finden Sie unter Informationen zu Stimmen auflisten.
23.09.2022
- Neue ausdrucksstarke neuronale Stimmen für amerikanisches Englisch
-
Der Service bietet vier neue expressive neuronale Stimmen für amerikanisches Englisch:
en-US_AllisonExpressiveen-US_EmmaExpressiveen-US_LisaExpressiveen-US_MichaelExpressive
Expressive neuronale Stimmen bieten natürlich klingende Sprache, die außergewöhnlich klar, knackig und flüssig ist. Die neuen Stimmen sind nun allgemein verfügbar (GA) und können in der Produktion eingesetzt werden. Sie unterstützen sowohl die Verwendung des Internationalen Phonetischen Alphabets (IPA) als auch die IBM Symbolische Phonetische Repräsentation (SPR) phonetische Symbole. Weitere Informationen finden Sie
- Neue Sprechstile für expressive neuronale Stimmen
-
Die expressiven neuronalen Stimmen bestimmen die Stimmung des Textes aus dem Kontext seiner Wörter und Phrasen. Die Sprache, die sie produzieren, hat nicht nur einen konversationellen Stil, sondern spiegelt auch die Stimmung des Textes wider. Aber Sie können die natürlichen Tendenzen der Stimmen verschönern, indem Sie angeben, dass der gesamte oder ein Teil des Textes einen der folgenden Sprechstile hervorheben soll:
- Fröhlich-Drückt Glück und gute Nachrichten aus.
- Empathisch-äußert Empathie oder Sympathie.
- Neutral-Drückt Objektivität und Ebenheit aus.
- Unsicher-Drückt Verwirrung oder Unsicherheit aus.
Weitere Informationen finden Sie unter Sprechstile verwenden.
- Neue Interjektionsbetonung mit expressiven neuronalen Stimmen
-
Bei expressiven neuronalen Stimmen erkennt der Service automatisch eine Gruppe allgemeiner Interjektionen basierend auf dem Kontext. Wenn es diese Interjektionen synthetisiert, gibt es ihnen die natürliche Betonung, die ein Mensch in normalen Gesprächen verwenden würde. Für einige der Interjections können Sie SSML verwenden, um deren Hervorhebung zu aktivieren oder zu inaktivieren. Weitere Informationen finden Sie unter Emphasizing interjections.
- Neue Wortbetonung mit ausdrucksstarken neuronalen Stimmen
-
Die expressiven Stimmen verwenden einen Dialogstil, der natürlich die richtige Intonation aus dem Kontext anwendet. Sie können jedoch angeben, dass mindestens ein Wort mehr oder weniger hervorgehoben werden soll. Die Spannungsänderung kann durch eine Erhöhung oder Abnahme der Tonhöhe, des Timings, der Lautstärke oder anderer akustischer Attribute angezeigt werden. Weitere Informationen finden Sie unter Emphasizing words.
21. September 2022
- Neues Activity Tracker-Ereignis zum Löschen von Benutzerinformationen in der DSGVO
- Der Service gibt jetzt ein Ereignis Activity Tracker zurück, wenn Sie die Methode
DELETE /v1/user_dataverwenden, um alle Informationen zu einem Benutzer zu löschen. Das Ereignis hat den Namentext-to-speech.gdpr-user-data.delete. Weitere Informationen finden Sie im Abschnitt Activity Tracker-Ereignisse. - Fehlerkorrektur: Benutzerdefinierte Wortübersetzungen akzeptieren jetzt in allen Fällen Kommas
- Fehlerkorrektur: Zu angepassten Modellen hinzugefügte Word-Übersetzungen akzeptieren jetzt in allen Fällen Kommas. Bisher konnte es vorkommen, dass ein Komma in einer Übersetzung dazu führte, dass die Übersetzung bei Sprachsynthesen kein gültiges Audio erzeugte. Dieses Problem wurde in angepassten Modellen für amerikanisches Englisch identifiziert.
- Fehlerkorrektur: Französische Datensynthese ist jetzt konsistent
- Fehlerkorrektur: Die französische Synthese enthält nicht mehr den Artikel "le" vor Datumsangaben des Formulars "the ordinal of month." Zuvor wurde der Artikel nur für den ersten Tag des Monats für Französisch aufgenommen (z. B. "der erste September", "le premier septembre").
- Bekannte Einschränkungen bei der Verwendung des Ogg-Audioformats mit dem Safari-Browser
- Standardmäßig liefert der Dienst Audio im Ogg-Audioformat mit dem Opus-Codec
audio/ogg;codecs=opus). Das Ogg-Audioformat wird jedoch vom Safari-Browser nicht unterstützt. Wenn Sie den Dienst Text to Speech mit dem Safari-Browser verwenden, müssen Sie ein anderes Format angeben, in dem der Dienst das Audio zurückgeben soll.- Weitere Informationen zu den verfügbaren Formaten finden Sie unter Unterstützte Audioformate.
- Weitere Informationen zum Angeben eines Formats finden Sie unter Audioformat angeben.
31 August 2022
- Neuer Beta-Abfrageparameter
rate_percentagezur Steuerung der globalen Sprachrate - Der Service bietet einen neuen Abfrageparameter
rate_percentage, um die Sprechgeschwindigkeit für eine Sprachsyntheseanforderung zu ändern. Die Sprechgeschwindigkeit ist die Geschwindigkeit, mit der der Service den Text spricht, den er in Sprache synthetisiert. Eine höhere Rate führt dazu, dass der Text schneller gesprochen wird; eine niedrigere Rate bewirkt, dass der Text langsamer gesprochen wird. Der Parameter ändert die Sprachstandardrate für eine gesamte Anforderung. Weitere Informationen finden Sie unter Sprechgeschwindigkeit ändern. - Neuer Beta-Abfrageparameter
pitch_percentagezur Steuerung der globalen Sprachdichte - Der Service bietet einen neuen Abfrageparameter
pitch_percentage, um die Sprechdichte für eine Syntheseanforderung zu ändern. Die Sprechdichte stellt den Ton der Sprache dar, die der Service synthetisiert. Sie stellt dar, wie hoch oder niedrig der Ton der Stimme vom Hörer wahrgenommen wird. Eine höhere Tonhöhe führt zu einer Sprache, die in einem höheren Ton gesprochen wird und als höhere Stimme wahrgenommen wird; eine niedrigere Tonhöhe führt zu einer Sprache, die in einem niedrigeren Ton gesprochen wird und als niedrigere Stimme wahrgenommen wird. Der Parameter ändert die Standardtonhöhe pro Stimme für eine gesamte Anforderung. Weitere Informationen enthält der Abschnitt Tonhöhe ändern. - Fehlerkorrektur: Die japanische Synthese wurde verbessert, um lange Zeichenfolgen von Eingabetext zu verarbeiten
- Fehlerkorrektur: Der Service erstellt jetzt korrekt synthetisch japanische Anforderungen, die lange Zeichenfolgen enthalten. Zuvor war der Dienst nicht in der Lage, lange japanische Textstrings korrekt zu synthetisieren.
- Dokumentationsaktualisierungen für das SSML-Element
<prosody> - Die Dokumentation für das SSML-Element
<prosody>und seine Parameterpitchundratewurde verbessert und transparenter gestaltet. Außerdem enthält sie jetzt eine Beschreibung der Unterschiede zwischen dem Service und der neuesten Version der SSML-Spezifikation. Weitere Informationen finden Sie unter Element<prosody>.
3. August 2022
- Der Service unterstützt keine mehrsprachige Sprachsynthese
- Der Dienst unterstützt derzeit keine mehrsprachige Sprachsynthese. Sie können die Anpassung jedoch verwenden, um die Aussprache von Wörtern aus anderen Sprachen näherungsweise zu berechnen. Weitere Informationen finden Sie unter Mehrsprachige Sprachsynthese.
27. Juli 2022
- Neuer Beta-Parameter
spell_out_modefür deutsche Stimmen - Um anzugeben, wie einzelne Zeichen einer Zeichenfolge geschrieben werden sollen, können Sie jetzt den Beta-Abfrageparameter
spell_out_modemit einer Syntheseanforderung für eine deutsche Stimme einschließen. Standardmäßig gibt der Service einzelne Zeichen mit derselben Geschwindigkeit aus, mit der er Text für eine Sprache synthetisch erstellt. Sie können den Parameter verwenden, um den Service anzuweisen, einzelne Zeichen langsamer in Gruppen von ein, zwei oder drei Zeichen auszuschreiben. Verwenden Sie den Parameter mit dem SSML-Element<say-as>, um zu steuern, wie die Zeichen einer Zeichenfolge synthetisch erstellt werden. Weitere Informationen finden Sie unter Schreibweise von Zeichenfolgen angeben.
25. Mai 2022
- Neue Unterstützung für Audioformat
audio/alaw - Die Liste der unterstützten Audioformate enthält jetzt
audio/alaw;rate={rate}. Wieaudio/basicundaudio/mulawstellt dieses Format Single-Channel-Audiodaten bereit, die mit 8-Bit-U-Law-Daten (oder Mu-Law-Daten) codiert werden, die mit 8 kHz abgetastet werden. Weitere Informationen finden Sie unter Audioformate verwenden.
19 Mai 2022
- Fehlerkorrektur: Mehrere aufeinanderfolgende SSML-
<phoneme>-Tags werden jetzt ordnungsgemäß geparst - Fehlerkorrektur: Der Service erstellt jetzt ordnungsgemäß synthetisch Text, der aufeinanderfolgende
<phoneme>-Tags enthält. Wenn der Text zwei oder mehr aufeinanderfolgende<phoneme>-Tags enthielt, hat der Service bisher nur den ersten Tag synthetisch erstellt und die anderen Tags ignoriert.
31. März 2022
- Wichtig: Einstellung der Unterstützung für alle neuronalen Stimmen
-
Wichtig: Per 31. März 2022 werden keine neuronalen Stimmen mehr unterstützt. Die veralteten Stimmen bleiben für vorhandene Benutzer verfügbar, bis sie am 31. März 2023 aus dem Service und der Dokumentation entfernt werden. Keine erweiterten neuronalen Stimmen oder expressiven Stimmen sind veraltet.
Die folgenden neuronalen Stimmen sind jetzt veraltet:
- Arabisch:
ar-MS_OmarVoice - Chinesisch (Mandarin):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceundzh-CN_ZhangJingVoice - Tschechisch:
cs-CZ_AlenaVoice - Niederländisch (Belgien):
nl-BE_AdeleVoiceundnl-BE_BramVoice - Niederländisch (Niederlande):
nl-NL_EmmaVoiceundnl-NL_LiamVoice - Englisch (Australien):
en-AU_CraigVoice,en-AU_MadisonVoiceunden-AU_SteveVoice - Koreanisch:
ko-KR_HyunjunVoice,ko-KR_SiWooVoice,ko-KR_YoungmiVoiceundko-KR_YunaVoice - Schwedisch:
sv-SE_IngridVoice
Die veralteten neuronalen Stimmen sind weiterhin für vorhandene Benutzer verfügbar, aber für neue Benutzer nicht mehr verfügbar:
- Vorhandene Benutzer: Instanzen des Service, die vor 31. März 2022 erstellt wurden, können die veralteten Stimmen weiterhin für die Sprachsynthese verwenden. Die Instanzen können auch zum Erstellen und Bearbeiten benutzerdefinierter
Modelle verwendet werden, die auf den veralteten Stimmen basieren. Außerdem können sie weiterhin die Stimmen mit den Methoden
GET /v1/voicesundGET /v1/voices/{voice}auflisten und abfragen. - Neue Nutzer: Bei Instanzen des Dienstes, die am oder nach dem 31. März 2022 erstellt werden, können die veralteten Stimmen für die Sprachsynthese nicht mehr verwendet werden. Die Instanzen können zudem nicht zum Erstellen
benutzerdefinierter Modelle verwendet werden, die auf den veralteten Stimmen basieren. Außerdem können sie die Stimmen nicht mit den Methoden
GET /v1/voicesundGET /v1/voices/{voice}auflisten oder abfragen. Jeder API-Aufruf, der eine der veralteten Stimmen enthält, gibt je nach Aufruf den HTTP-Fehlercode 400 oder 404 zurück.
Neue Stimmen für australisches Englisch, Niederländisch und Koreanisch werden bis zum 15. Februar 2023 veröffentlicht. Wenn Sie australisches Englisch, Niederländisch oder Koreanisch verwenden, werden Ihre API-Aufrufe automatisch zu den neuen Stimmen in dieser Sprache umgeleitet. Stimmen in Arabisch, Chinesisch, Tschechisch, Schwedisch und Flämisch werden aus dem Dienst entfernt.
Weitere Informationen zu allen verfügbaren Sprachen und Stimmen finden Sie unter „ Sprachen und Stimmen “.
- Arabisch:
- Veraltete Standardstimmen wurden aus der Dokumentation entfernt
-
Die Standard-Verkettungsstimmen sind seit dem 2. Dezember 2020 veraltet. Diese Standardstimmen wurden jetzt aus der API-Referenz entfernt. Das Thema „Umstellung von Standardstimmen auf neuronale Stimmen“ wurde ebenfalls von der Seite „ Sprachen und Stimmen “ entfernt.
In ähnlicher Weise wird auch der frühere Name der arabischen Stimme,
ar-AR_OmarVoice, nicht mehr verwendet. Es wurde auch aus der Dokumentation entfernt. Verwenden Sie stattdessen die Stimmear-MS_OmarVoice.
28. Februar 2022
- Änderung der Wordtaktrückgabe für WebSocket-Schnittstelle
-
Das Antwortobjekt, das der Dienst sendet, wenn Sie über die Schnittstelle „ WebSocket “ Wortzeitangaben anfordern, hat sich geändert. Der Service sendet jetzt Worttaktergebnisse in einem einzelnen Array, das eine Zeichenfolge gefolgt von zwei Gleitkommazahlen enthält:
{ "words": [ ["Hello", 0.0, 0.259], ["world", 0.259, 0.532] ] }Zuvor wurden vom Service Taktergebnisse als Array mit einer Zeichenfolge gesendet, auf die ein Array mit zwei Gleitkommazahlen folgt:
{ "words": [ ["Hello", [0.0629826778195474, 0.2590192737303819]], ["world", [0.2598829173456253, 0.5322130804452672]] ] }Außerdem wird die Genauigkeit für Worttaktinformationen und -markierungen jetzt auf drei Dezimalstellen reduziert. Weitere Informationen zu den neuen Antworten finden Sie unter Wortzeitdauer generieren.
Anmerkung: Die Ergebnisse für erweiterte neuronale und neuronale Stimmen waren bisher unterschiedlich. Diese Inkonsistenzen können zu Fehlern bei den SDKs von „ Watson “ führen. Die Ergebnisse für alle Stimmen sind jetzt konsistent.
26. Januar 2022
- Fehlerkorrektur: SSML-Dokumentation verbessern
- Fehlerbehebung: Die SSML-Dokumentation wurde aktualisiert, um die folgenden Fehler zu beheben:
- Die Beispiele für das Element
<break>sind jetzt korrekt. Das Element ist monadisch, wie in den Beispielen gezeigt. Die vorherigen Beispiele enthielten Tag-Paare mit eingebettetem Text. Der eingebettete Text wurde vom Service nicht gesprochen. Weitere Informationen finden Sie unter Element<break>. - Der Service unterstützt SSML-Version 1.1. Alle Referenzen und Beispiele verwenden jetzt die richtige Version. In der Dokumentation wurde zuvor auf Version 1.0 verwiesen.
- Die Beispiele für das Element
3. Dezember 2021
- Neue neuronale Stimme für Tschechisch:
cs-CZ_AlenaVoice -
Eine neue Sprache - Tschechisch - mit einer neuen weiblichen Stimme namens
cs-CZ_AlenaVoiceist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme. - Neue neuronale Stimme für belgisches Niederländisch:
nl-BE_BramVoice -
Eine neue männliche Stimme für belgisches Niederländisch (Flämisch) namens
nl-BE_BramVoiceist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme. - Fehlerkorrektur: SSML und Sprachsynthese verbessern
-
Behebung von Fehlern: Die folgenden Fehler im Zusammenhang mit der Speech Synthesis Markup Language (SSML) und der Sprachsynthese wurden mit dieser Version behoben:
- Das Attribut
pitchdes Elements<prosody>wird jetzt auf den gesamten angegebenen Text angewendet. Zuvor wurde die Änderung der Tonhöhe teilweise nicht auf das erste Wort des betroffenen Texts angewendet. Außerdem enthält die Dokumentation nun weitere Hinweise zur Angabe eines Werts für „pitch“. Weitere Informationen finden Sie unter Attributpitch. - Die Sprachsynthese für japanische Texte liefert nun Audioausgabe mit einem langsameren Sprechtempo. Bisher war das Tempo der synthetisierten Aussprache zu hoch. Wenn Sie feststellen, dass das Sprechtempo in synthetisierten japanischen
Texten für Ihre Anwendung noch zu hoch ist, können Sie das Tempo mit dem Attribut
ratedes SSML-Elements<prosody>verändern. Weitere Informationen finden Sie unter Attributrate. - Von neuronalen Stimmen wird das Escapezeichen für Hochkommas (
') jetzt wie erforderlich analysiert. Bisher wurde das Zeichen von einigen neuronalen Stimmen nicht richtig interpretiert.
- Das Attribut
22. Oktober 2021
- Verschiedene Verbesserungen für neuronale Stimmen
- Die vorhandenen neuronalen Stimmen für Chinesisch, Niederländisch (Belgien und Niederlande), australisches Englisch und Koreanisch wurden aktualisiert, um die Sprachsynthese und die Audioergebnisse zu verbessern. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
- Neue neuronale Stimme für australisches Englisch:
en-AU_SteveVoice - Eine neue männliche Stimme für australisches Englisch namens
en-AU_SteveVoiceist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme. - Neue neuronale Stimme für Schwedisch:
sv-SE_IngridVoice - Eine neue Sprache - Schwedisch - mit einer neuen weiblichen Stimme namens
sv-SE_IngridVoiceist jetzt verfügbar. Bei der Stimme handelt es sich um eine neuronale Stimme.
6. Oktober 2021
- Neue Unterstützung für HIPAA für Premium-Pläne am Standort Dallas
- Unterstützung für das US-amerikanische Gesetz HIPAA (Health Insurance Portability and Accountability Act) ist jetzt für Premium-Pläne verfügbar, die am Standort Dallas (
us-south) gehostet werden. Weitere Informationen finden Sie unter Health Insurance Portability and Accountability Act (HIPAA). - Fehlerbehebung: Verbesserung der erweiterten neuronalen Stimme für lateinamerikanisches Spanisch
- Fehlerkorrektur: Bei der Stimme für lateinamerikanisches Spanisch (
es-LA_SofiaV3Voice) weisen Fragen aller Typen jetzt die richtige Intonation auf.
16 September 2021
- Fehlerbehebung: Verbesserung der neuronalen Stimmen für kastilisches Spanisch und nordamerikanisches Spanisch
- Fehlerkorrektur: Bei den Stimmen für kastilisches Spanisch (
es-ES_EnriqueV3Voiceundes-ES_LauraV3Voice) und nordamerikanisches Spanisch (es-US_SofiaV3Voice) weisen Fragen aller Typen jetzt die richtige Intonation auf. Bei der Stimme für lateinamerikanisches Spanisch (es-LA_SofiaV3Voice) weisen einige Fragen nicht die richtige Intonation auf und klingen stattdessen wie Aussagen. Die lateinamerikanische Spanisch-Sprachausgabe wird in Kürze verfügbar sein.
16. Juli 2021
- Neue neuronale Stimme für belgisches Niederländisch:
nl-BE_AdeleVoice - Der Service unterstützt jetzt belgisches Niederländisch (Flämisch) mit der neuronalen Stimme
nl-BE_AdeleVoice. Die Stimme für belgisches Niederländisch unterstützt die Anpassung und ist allgemein verfügbar (GA) für den Produktionseinsatz.
12 April 2021
- Neue erweiterte neuronale Stimme für kanadisches Französisch:
fr-CA_LouiseV3Voice -
Der Service unterstützt jetzt kanadisches Französisch mit der erweiterten neuronalen Stimme
fr-CA_LouiseV3Voice. Die Stimme für kanadisches Französisch unterstützt die Anpassung und ist allgemein verfügbar (GA) für den Produktionseinsatz.- Ein Beispiel der neuen Stimme finden Sie unter Unterstützte Sprachen und Stimmen.
- Weitere Informationen zu den phonetischen Zeichen und Unicode-Werten, die für kanadisches Französisch verfügbar sind, finden Sie unter Zeichen für Französisch (Kanada).
- Neue Funktion "Tune by Example"
-
Mit der neuen Funktion "Tune by Example" können Sie steuern, wie der angegebene Text vom Service gesprochen wird. Bei dieser Funktion handelt es sich um eine Beta-Funktion, die nur für benutzerdefinierte Modelle und Stimmen in US-Englisch unterstützt wird. Die Funktion besteht aus zwei Komponenten:
- Angepasste Prompts schließen den geschriebenen Text ein, der gesprochen werden soll, und Audioaufzeichnungen enthalten den Text in der von Ihnen gewünschten Aussprache. Die Audiodaten geben Intonation, Kadenz und Betonung des synthetisierten Texts an. Der Prompt kann verschiedene Silben oder Wörter hervorheben, Pausen einführen, bei den synthetisierten Audiodaten eine insgesamt natürlichere Aussprache erreichen und die Aussprache an den zugehörigen Kontext anpassen.
- Sprechermodelle stellen Registrierungsaudiodateien zu Benutzern bereit, von denen Prompts gesprochen werden. Ein Sprechermodell stellt Beispielaudiodaten für die Stimme eines Sprechers bereit. Vom Service wird ein auf die Stimme bezogenes Training durchgeführt, was dazu beitragen kann, dass qualitativ hochwertigere Prompts für den jeweiligen Sprecher erzeugt werden.
Sie geben einen angepassten Prompt mit einer Sprachsyntheseanforderung an, um anzugeben, wie der Text von der Stimme des Service gesprochen werden soll. Für die Angabe eines Prompts verwenden Sie die SSML-Erweiterung
<ibm:prompt id="{prompt_id}"/>. In der synthetisierten Audioausgabe wird die Prosodie des Prompts kopiert. - Neue Methoden für Tune by Example
-
Der Service beinhaltet acht neue Methoden für die Arbeit mit der Funktion "Tune by Example". Die nachfolgenden Beschreibungen der neuen Methoden enthalten Links zu den entsprechenden Einträgen in der API- und SDK-Referenz. Möglicherweise müssen Sie die Registerkarte
Curlder Referenz auswählen, damit die neuen Methoden angezeigt werden.-
Der Service enthält vier Methoden zum Arbeiten mit angepassten Prompts:
- Angepasste Eingabeaufforderungen auflisten:
GET /v1/customizations/{customization_id}/prompts - Angepasste Eingabeaufforderung abrufen:
GET /v1/customizations/{customization_id}/prompts/{prompt_id} - Benutzerdefinierte Eingabeaufforderung löschen:
DELETE /v1/customizations/{customization_id}/prompts/{prompt_id}
- Angepasste Eingabeaufforderungen auflisten:
-
Der Service umfasst vier Methoden zum Arbeiten mit Sprechermodellen:
- Lautsprechermodelle auflisten:
GET /v1/speakers - Lautsprechermodell abrufen:
GET /v1/speakers/{speaker_id} - Lautsprechermodell löschen:
DELETE /v1/speakers/{speaker_id}
- Lautsprechermodelle auflisten:
-
- Aktualisierungen für Activity Tracker-Aktionen für Anpassung
-
Die Namen der Aktionen für die Activity Tracker-Ereignisse für die Anpassungsmethoden wurden geändert. Die Aktionen enthalten jetzt die Zeichenfolge
custom-modelanstelle voncustom-voice. Die vorherigen Namen der Aktionen sind veraltet. Diese veralteten Namen sind weiterhin zur Verwendung verfügbar, werden aber zu einem späteren Zeitpunkt entfernt. Migrieren Sie so schnell wie möglich auf die neuen Namen, die in Anpassungsereignisse aufgelistet sind.Ereignisse erstellen Veralteter Aktionsname-> Neuer Aktionsname
text-to-speech.custom-voice.create->text-to-speech.custom-model.createtext-to-speech.custom-voice-word-list.create->text-to-speech.custom-model-word-list.createtext-to-speech.custom-voice-word.create->text-to-speech.custom-model-word.create
Ereignisse lesen Veralteter Aktionsname-> Neuer Aktionsname
text-to-speech.custom-voice-list.read->text-to-speech.custom-model-list.readtext-to-speech.custom-voice.read->text-to-speech.custom-model.readtext-to-speech.custom-voice-word-list.read->text-to-speech.custom-model-word-list.readtext-to-speech.custom-voice-word.read->text-to-speech.custom-model-word.read
Ereignis aktualisieren Veralteter Aktionsname-> Neuer Aktionsname
text-to-speech.custom-voice.update->text-to-speech.custom-model.update
Ereignisse löschen Veralteter Aktionsname-> Neuer Aktionsname
text-to-speech.custom-voice.delete->text-to-speech.custom-model.deletetext-to-speech.custom-voice-word.delete->text-to-speech.custom-model-word.delete
2. Dezember 2020
- Verschiedene Verbesserungen für Stimmen
-
Die vom Dienst angebotenen Stimmen haben sich erheblich verändert. Der Service unterstützt neue Sprachen und Stimmen, die Qualität vieler Stimmen wurde verbessert und viele ältere Stimmen werden jetzt als veraltet eingestuft. Darüber hinaus sind nun alle Sprachdienste anpassbar und für den produktiven Einsatz allgemein verfügbar (GA).
- Neue neuronale und erweiterte neuronale Stimmen
-
Zur Optimierung der Gesamtqualität der Sprachsynthese basieren nun alle verfügbaren Stimmen auf neuronaler Technologie. Der Service bietet zwei Typen von Stimmen, die auf neuronaler Technologie basieren:
- Neuronale Stimmen, die nicht die Zeichenfolge
V3in ihren Namen enthalten, sind jetzt für Arabisch, Australisches Englisch, Chinesisch, Niederländisch (Niederlande) und Koreanisch verfügbar. Neuronale Stimmen unterstützen die Verwendung des Internationalen Phonetischen Alphabets (IPA) mit dem SSML-Element (SSML = Speech Synthesis Markup Language)<phoneme>. - Erweiterte neuronale Stimmen, die die Zeichenfolge
V3in ihren Namen enthalten, sind jetzt für brasilianisches Portugiesisch, britisches und amerikanisches Englisch, Französisch, Deutsch, Italienisch, Japanisch und Spanisch (alle Dialekte) verfügbar. Erweiterte neuronale Stimmen unterstützen das IPA und IBM Symbolic Phonetic Representation (SPR) mit dem SSML-Element<phoneme>. Erweiterte neuronale Stimmen erreichen darüber hinaus eine etwas höhere Qualität in Bezug auf eine natürliche Aussprache. In den kommenden Monaten werden weitere Anpassungsmöglichkeiten für verbesserte neuronale Stimmen bereitgestellt.
Standardstimmen werden vom Service für keine Sprache mehr angeboten. Bei den Standardstimmen wurden Segmente aufgezeichneter Sprache mittels Verkettungssynthese zusammengefügt, um die gewünschte Audiodatei zu erzeugen.
Weitere Informationen finden Sie unter Sprachen und Stimmen.
- Neuronale Stimmen, die nicht die Zeichenfolge
- Neue neuronale Stimmen für australisches Englisch und Koreanisch
-
Die folgenden Stimmen für australisches Englisch und Koreanisch sind neu:
- Der Service unterstützt jetzt australisches Englisch mit den beiden folgenden neuronalen Stimmen:
en-AU_CraigVoiceunden-AU_MadisonVoice. - Der Service unterstützt jetzt zwei neue neuronale Stimmen in Koreanisch:
ko-KR_HyunjunVoiceundko-KR_SiWooVoice.
- Der Service unterstützt jetzt australisches Englisch mit den beiden folgenden neuronalen Stimmen:
- Verbesserte neuronale Stimmen
-
Die Stimmen für die bisherigen Sprachen Arabisch, Chinesisch, Niederländisch und Koreanisch, die alle auf der Basis von Text-to-Speech-Technologie erstellt wurden, sind nun auf neuronalen Netzen basierend:
ar-MS_OmarVoiceko-KR_YoungmiVoiceko-KR_YunaVoicenl-NL_EmmaVoicenl-NL_LiamVoicezh-CN_LiNaVoicezh-CN_WangWeiVoicezh-CN_ZhangJingVoice
Außerdem wurden folgende weitere Änderungen vorgenommen:
- Die Stimme für Arabisch trägt jetzt den Namen
ar-MS_OmarVoice. Der frühere Namear-AR_OmarVoiceist veraltet. Die Stimme kann mindestens ein Jahr weiterhin verwendet werden, wird zu einem späteren Zeitpunkt jedoch möglicherweise entfernt. Es wird empfohlen, sobald wie möglich auf den neuen Namen zu migrieren. - Die arabische Sprache unterstützt jetzt die Verwendung von IPA-Zeichen und Unicode-Werten mit dem SSML-Element
<phoneme>. Zum Erstellen eines angepassten Modells für Arabisch müssen Sie die Sprachenkennungar-MSverwenden. Die IDar-ARwird für die Anpassung nicht unterstützt. - Die IPA-Zeichen für die arabische Sprache sind neu. Die zuvor dokumentierten Symbole wurden ersetzt.
- Die IPA-Zeichen für die Niederländisch (Niederlande) wurden wie folgt geändert:
- Niederländisch (Niederlande) unterstützt die folgenden IPA-Symbole nicht mehr:
tʲ(0074+02B2),ɲ(0272),ʦ(02A6) undʔ(0294). - Für Niederländisch wird nun das folgende IPA-Symbol unterstützt:
ɣ(0263).
- Niederländisch (Niederlande) unterstützt die folgenden IPA-Symbole nicht mehr:
- Veraltete Standardstimmen
-
Die folgenden Standard-Verkettungsstimmen sind nun veraltet:
de-DE_BirgitVoicede-DE_DieterVoiceen-GB_KateVoiceen-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicees-ES_LauraVoicees-LA_SofiaVoicees-US_SofiaVoicefr-FR_ReneeVoiceit-IT_FrancescaVoiceja-JP_EmiVoicept-BR_IsabelaVoice
Alle Standardstimmen, die veraltet sind, haben gleichwertige neuronale Entsprechungen, sodass keine Stimme entfällt. Sie können jeweils zur funktional entsprechenden neuronalen Version der Stimme wechseln (z. B. von
de-DE_BirgitVoicezude-DE_BirgitV3Voice), um bessere Ergebnisse bei der Sprachsynthese zu erzielen.Die veralteten Stimmen wurden aus der veröffentlichten Dokumentation entfernt. Sie können mindestens ein Jahr weiterhin verwendet werden, werden jedoch möglicherweise zu einem späteren Zeitpunkt entfernt. Es wird empfohlen, möglichst schnell auf die entsprechenden neuronalen Stimmen zu migrieren.
Wenn Sie den optionalen Parameter
voicein einer Sprachsyntheseanforderung auslassen, wird vom Service standardmäßigen-US_MichaelV3Voiceverwendet. Diese neuronale Stimme ersetzt die jetzt veraltete Standardstimmeen-US_MichaelVoice, die zuvor als Standardeinstellung verwendet wurde. - Veraltete Funktionen
-
Die folgenden Funktionen standen nur für Standard-Kombinationsstimmen zur Verfügung. Sie sind veraltet und wurden aus der veröffentlichten Dokumentation entfernt. Sie können mindestens ein Jahr weiterhin verwendet werden, werden jedoch möglicherweise zu einem späteren Zeitpunkt entfernt. Es wird empfohlen, diese Funktionen aus Ihren Anwendungen zu entfernen und baldmöglichst auf neuronale Stimmen zu migrieren.
- SSML für Expressivität. Hierbei handelt es sich um eine IBM Erweiterung für SSML, die nur für die Stimme
en-US_AllisonVoiceunterstützt wurde. - SSML für Stimmenumwandlung. Hierbei handelt es sich um eine IBM Erweiterung für SSML, die nur für die Stimmen
en-US_AllisonVoice,en-US_LisaVoiceunden-US_MichaelVoiceunterstützt wurde. - Das Attribut
volumedes Elements<prosody>. Dieses Attribut war für alle Standardstimmen verfügbar.
Wenn diese SSML-Elemente in eine Syntheseanforderung für eine neuronale Stimme aufgenommen werden, wird der HTTP-Antwortcode 400 generiert, da die Anforderung die SSML-Validierung nicht besteht. Weitere Informationen zur SSML-Validierung finden Sie in SSML-Validierung.
- SSML für Expressivität. Hierbei handelt es sich um eine IBM Erweiterung für SSML, die nur für die Stimme
- Neue Unterstützung für Cross-Origin Resource Sharing
-
CORS-Unterstützung (CORS = Cross-Origin Resource Sharing) ist jetzt für alle Stimmen der Browser Google Chrome™ und Apple® Safari verfügbar. Sie ist nicht im Browser Mozilla Firefox™ für Stimmen in den folgenden Sprachen verfügbar: Arabisch, Englisch (Australien), Chinesisch, Niederländisch (Niederlande) und Koreanisch. Weitere Informationen finden Sie unter CORS support.
10. September 2020
- Fehlerbehebung: Verbesserung der japanischen Sprachausgabe
-
Fehlerkorrektur: Für die Stimme
ja-JP_EmiV3Voiceanalysiert der Service jetzt den SSML-Eingabetext korrekt, der eine Spezifikation für 'prosody rate' enthält. Zuvor erfüllte die folgende Verwendung des Elements<prosody>denselben Zweck:<speak>成功する/繁栄する</speak>Die folgende Verwendung des Attributs
ratemit dem Element<prosody>hat jedoch dazu geführt, dass die eingebettete SSML-Notation vom Serivce gelesen und gesprochen wurde:<speak> <prosody rate="fast">成功する/繁栄する</prosody> </speak>Das Attribut
ratedes Elements<prosody>für japanische Eingabe wird jetzt vom Service ordnungsgemäß analysiert und angewendet.
4. September 2020
- Eine Anpassungsoberfläche ist nun allgemein verfügbar
- Die Anpassungsschnittstelle ist jetzt allgemein verfügbar (GA). Die Anpassungsfunktionen sind nicht mehr in der Beta-Phase. Sie können die Anpassungsschnittstelle verwenden, um anzugeben, wie der Service ungewöhnliche aus Ihrem Eingabetext ausspricht, indem Sie sprachspezifische benutzerdefinierte Wörterverzeichnisse erstellen. Es kann mit allen allgemein verfügbaren Stimmen und Beta-Stimmen verwendet werden. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung.
24. Juni 2020
- Neue neuronale Stimmen für britisches Englisch und Französisch
-
Der Dienst bietet nun zwei neue neuronale Stimmen an:
- Englisch (Vereinigtes Königreich):
en-GB_CharlotteV3Voice - Französisch:
fr-FR_NicolasV3Voice
Der Service bietet auch eine verbesserte Version der vorhandenen neuronalen Stimme für Großbritannien namens
en-GB_KateV3Voice. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen. - Englisch (Vereinigtes Königreich):
- Unterstützung für das SSML-Attribut
digitsdes Elements<say-as>für Japanisch -
Das Attribut
digitsdes SSML-Elements<say-as>wird jetzt vom Service mit der japanischen Stimme unterstützt. Weitere Informationen finden Sie unter Element 'say-as'.
1. April 2020
- Neue koreanische Standardstimmen:
ko-KR_YoungmiVoiceundko-KR_YunaVoice -
Der Service unterstützt jetzt zwei weibliche koreanische Standardstimmen:
ko-KR_YoungmiVoiceundko-KR_YunaVoice. Die folgenden Informationen gelten für beide koreanischen Stimmen:- Die Stimmen sind Beta-Funktionen. Sie sind möglicherweise nicht für die produktive Nutzung bereit und können Änderungen unterliegen. Es handelt sich um erste Angebote, die sich mit der Zeit und der Nutzung qualitativ verbessern.
- Die Stimmen unterstützen die Anpassung und die Methode
/v1/pronunciation. - Die Stimmen unterstützen das Element
<mark>und den Parametertimings, die in der WebSocket-Schnittstelle verfügbar sind. - Die Stimmen unterstützen alle SSML-Elemente (Speech Synthesis Markup Language) mit Ausnahme der expressiven SSML und der SSML für Stimmenumwandlung.
- Die Stimmen unterstützen nur das Internationale Phonetische Alphabet, nicht IBM Symbolic Phonetic Representation (SPR), mit dem Element
<phoneme>.
- Unterstützung neuer Funktionen für Stimmen für Arabisch, Chinesisch und Niederländisch (Niederlande)
-
Die Stimmen für Arabisch, Chinesisch und Niederländisch (Niederlande) in der Betaversion unterstützen jetzt die folgenden Funktionen:
- Die Anpassung und die Methode
/v1/pronunciation. - Das Element
<mark>und der Parametertimings, die in der WebSocket-Schnittstelle verfügbar sind.
Die folgenden Abschnitte enthalten weitere Informationen:
- Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
- Weitere Informationen zur Verwendung der Schnittstelle WebSocket zum Abrufen von Worttimings finden Sie unter Worttimings generieren.
- Weitere Informationen zur Anpassung enthält der Abschnitt Wissenswertes über die Anpassung.
- Weitere Informationen zur Verwendung des IPA- und des SPR-Formats mit der Anpassung finden Sie unter Erläuterungen zu phonetischen Zeichen. (Die IPA-Zeichen für die Sprachen Arabisch, Chinesisch, Niederländisch (Niederlande) und Koreanisch sind noch nicht dokumentiert. Diese Dokumentation wird in Kürze verfügbar sein.)
- Die Anpassung und die Methode
24. Februar 2020
- Neue neuronale Stimmen für amerikanisches Englisch und Deutsch
-
Der Service unterstützt jetzt fünf neue neuronale Stimmen:
- Amerikanisches Englisch:
en-US_EmilyV3Voice,en-US_HenryV3Voice,en-US_KevinV3Voiceunden-US_OliviaV3Voice - Deutsch:
de-DE_ErikaV3Voice
Die neuen Stimmen unterstützen die folgenden SSML-Elemente nicht:
- SSML für Expressivität mit dem Element
<express-as> - Stimmenumwandlung mit dem Element
<voice-transformation> - Das Attribut
volumedes Elements<prosody>
Weitere Informationen zu diesen und allen verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
- Amerikanisches Englisch:
- Neue Unterstützung für Activity Tracker
-
Der Service unterstützt jetzt die Verwendung von Activity Tracker-Ereignissen für alle Anpassungsoperationen. IBM Cloud Activity Tracker zeichnet vom Benutzer eingeleitete Aktivitäten auf, die den Status eines Service in IBM Cloud ändern. Mithilfe dieses Service können Sie abnormale Aktivität und kritische Aktionen untersuchen sowie gesetzliche Prüfvorschriften erfüllen. Darüber hinaus können Sie Warnnachrichten Alerts über Aktionen empfangen, sobald diese stattfinden. Weitere Informationen finden Sie im Abschnitt Activity Tracker-Ereignisse.
18. Dezember 2019
- Neue Standardstimmen für Arabisch, Chinesisch und Niederländisch (Niederlande)
-
Der Service unterstützt jetzt sechs neue Standardstimmen in drei neuen Sprachen:
- Arabisch:
ar-AR_OmarVoice - Chinesisch (Mandarin):
zh-CN_LiNaVoice,zh-CN_WangWeiVoiceundzh-CN_ZhangJingVoice - *Niederländisch (Niederlande): *
nl-NL_EmmaVoiceundnl-NL_LiamVoice
Für diese neuen Standardstimmen gelten die folgenden Informationen:
- Die neuen Stimmen sind Beta-Funktionen. Die Stimmen sind möglicherweise nicht für die produktive Nutzung bereit und können Änderungen unterliegen. Es handelt sich um erste Angebote, die sich mit der Zeit und der Nutzung qualitativ verbessern.
- Die Stimmen unterstützen das Element
<mark>und den Parametertimingsnicht, die in der WebSocket-Schnittstelle verfügbar sind. - Die Stimmen unterstützen die Anpassung und die Methode
/v1/pronunciationnicht. - Die Stimmen unterstützen weder die expressive SSML noch die SSML für Stimmenumwandlung.
- Die Stimmen unterstützen alle anderen SSML-Elemente. Sie unterstützen jedoch nur das Internationales Phonetische Alphabet (IPA) und nicht IBM Symbolic Phonetic Representation (SPR) mit dem Element
<phoneme>.
Weitere Informationen zu diesen und allen verfügbaren Stimmen finden Sie unter Sprachen und Stimmen.
- Arabisch:
12. Dezember 2019
- Vollständige Unterstützung für IBM Cloud IAM
-
Der Text to Speech-Service unterstützt jetzt die vollständige Implementierung von IBM Cloud Identity and Access Management (IAM). API-Schlüssel für Watson-Services sind nicht länger auf eine einzelne Serviceinstanz beschränkt. Sie können Zugriffsrichtlinien und API-Schlüssel erstellen, die für mehr als einen Service gelten, und Sie können den Zugriff zwischen Services erteilen. Weitere Informationen zu IAM finden Sie unter Authentifizierung bei Watson-Services.
Damit diese Änderung unterstützt wird, verwenden die API-Serviceendpunkte eine andere Domäne und beziehen die Serviceinstanz-ID ein. Das Muster ist
api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}.-
Beispiel einer HTTP-URL für eine Instanz, die am Standort Dallas gehostet ist:
https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2 -
Beispiel für eine WebSocket-URL für eine Instanz, die am Standort Dallas gehostet ist:
wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2
Weitere Informationen zu den URLs finden Sie in der API- und SDK-Referenz.
Diese URLs stellen keine Änderungen dar, die zu Fehlern bei anderen Services führen können. Die neuen URLs funktionieren sowohl für Ihre vorhandenen Serviceinstanzen als auch für neue Instanzen. Die ursprünglichen URLs funktionieren auf Ihren vorhandenen Serviceinstanzen weiterhin für mindestens ein Jahr bis Dezember 2020.
-
- Neue Netz- und Datensicherheitsfunktionen
-
Unterstützung für die folgenden neuen Netz- und Datensicherheitsfunktionen ist jetzt verfügbar:
-
Unterstützung für private Netzwerk-Endpunkte
Benutzer von Premium-Plänen können private Netzendpunkte erstellen, um über ein privates Netz eine Verbindung zum Service Text to Speech herzustellen. Für Verbindungen zu privaten Netzendpunkten ist kein öffentlicher Internetzugriff erforderlich. Weitere Informationen finden Sie unter Öffentliche und private Netzendpunkte.
-
12. November 2019
- Neuer Standort in Seoul jetzt verfügbar
- Der Service Text to Speech ist jetzt am IBM Cloud-Standort Seoul (kr-seo) verfügbar. Wie andere Standorte auch verwendet dieser IBM Cloud-Standort eine tokenbasierte IAM-Authentifizierung. Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.
1. Oktober 2019
- Neue HIPAA-Unterstützung für Premium-Pläne am Standort Washington, DC
- Der US-HIPAA-Support ist für Premium-Tarife verfügbar, die am Standort Washington, D.C. gehostet werden und am oder nach dem 1. April 2019 erstellt wurden. Weitere Informationen finden Sie unter US Health Insurance Portability and Accountability Act (HIPAA).
22. August 2019
- Fehlerkorrektur: Mehrere kleine Verbesserungen
- Fehlerbehebung: Der Dienst wurde aktualisiert, um kleinere Fehler zu beheben und Verbesserungen vorzunehmen.
30. Juli 2019
- Neue neuronale Stimme für Japanisch:
ja-JP_EmiV3Voice - Der Service bietet nun eine neuronale Stimme in Japanisch:
ja-JP_EmiV3Voice. Es stehen nun sowohl Standard- als auch neuronale Versionen aller verfügbaren Stimmen in allen unterstützten Sprachen zur Verfügung. Weitere Informationen finden Sie unter Sprachen und Stimmen.
24. Juni 2019
- Neue Unterstützung für Standardstimmen und neuronale Stimmen
-
Der Service bietet nun zwei Versionen der meisten seiner verfügbaren Stimmen an:
- Standardstimmen, die mittels Verkettungssynthese Segmente aufgezeichneter Sprache zusammenfügen, um Audio zu erzeugen. Standardstimmen enthalten keine Versionszeichenfolge in ihrem Namen (z. B.
en-US_AllisonVoice). - Neuronale Stimmen, die komplexe mehrschichtige neuronale Netze (Deep Neural Networks, DNNs) verwenden, um die akustischen (spektralen) Merkmale der gesprochenen Sprache vorherzusagen. Neuronale Stimmen enthalten eine Versionszeichenfolge
(
V3) in ihrem Namen (z. B.en-US_AllisonV3Voice).
Neuronale Versionen sind für alle Standardstimmen verfügbar, mit Ausnahme der Stimme
ja-JP_EmiVoice, für die die neuronale Version ansteht und in Kürze verfügbar sein wird. Sie können die SSML-Elemente<express-as>und<voice-transformation>nicht mit den neuronalen Stimmen verwenden. Auch das Attributvolumedes Elements<prosody>kann nicht mit den neuronalen Stimmen verwendet werden. Weitere Informationen zu den verfügbaren Stimmen finden Sie unter Sprachen und Stimmen. - Standardstimmen, die mittels Verkettungssynthese Segmente aufgezeichneter Sprache zusammenfügen, um Audio zu erzeugen. Standardstimmen enthalten keine Versionszeichenfolge in ihrem Namen (z. B.
- Neuronale V2-Service aus dem Service entfernt
-
Der Service enthält nicht mehr die zuvor verfügbaren
V2-DNN-Stimmen. Wenn Sie eineV2-Stimme in Ihrer Anwendung verwenden, verwendet der Service stattdessen automatisch die entsprechendeV3-Stimme.
24. März 2019
- Neue neuronale V2-Stimmen für Deutsch
-
Der Service bietet jetzt
V2DNN-Versionen (DNN; Deep Neural Network) für die deutschen Stimmen:de-DE_BirgitV2Voicede-DE_DieterV2Voice
Weitere Informationen zu DNN-basierten Stimmen finden Sie unter Sprachen und Stimmen.
- Neue Unterstützung für die Attribute
pitchundratedes SSML-Elements<prosody> -
Alle DNN-basierten Stimmen des Service unterstützen jetzt die Attribute
pitchundratedes SSML-Elements<prosody>. Die DNN-basierten Stimmen unterstützen das Attributvolumedes Elements<prosody>nicht. Weitere Informationen enthält der Abschnitt Element 'prosody'.
21. März 2019
- Sichtbarkeit von Serviceberechtigungsnachweisen jetzt auf Rolle begrenzt
-
Benutzer können nun ausschließlich Informationen zu Serviceberechtigungsnachweisen für die Rolle anzeigen, die ihrem IBM Cloud-Konto zugeordnet ist. Falls Ihnen beispielsweise die Rolle
readerzugeordnet ist, sind Serviceberechtigungsnachweise der Ebenewriteroder einer höheren Ebene für Sie nicht mehr sichtbar.Diese Änderung betrifft nicht den API-Zugriff für Benutzer oder Anwendungen mit bestehenden Serviceberechtigungsnachweisen. Sie wirkt sich lediglich auf das Anzeigen von Berechtigungsnachweisen in IBM Cloud aus.
4. März 2019
- Neue neuronale V2-Stimmen für Englisch und Italienisch
-
Der Service bietet nun vier neue
V2-Stimmen, die Audioausgabe mithilfe einer Deep-Learning-Synthese generieren:en-US_AllisonV2Voiceen-US_LisaV2Voiceen-US_MichaelV2Voiceit-IT_FrancescaV2Voice
Diese neuen Stimmen verwenden maschinelles Lernen und DNN, um synthetisch Sprache aus Text zu erstellen. Die auch als 'DNN-basiert' (Deep Neural Network ) bezeichnete Deep-Learning-Synthese erzeugt Audioausgabe mit einem natürlicheren Satzrhythmus und einer konsistenteren Gesamtqualität.
Die neuen Stimmen erzeugen auch Audioausgabe mit unterschiedlicher Signalqualität, weshalb sie möglicherweise nicht für alle Anwendungen geeignet sind. Außerdem unterstützen die neuen Stimmen die SSML-Elemente
<prosody>,<express-as>und<voice-transformation>nicht.Weitere Informationen zu diesen DNN-basierten Stimmen und ihren Unterschieden zu den vorhandenen Stimmen finden Sie unter Sprachen und Stimmen.
28. Januar 2019
- Neue Unterstützung für IBM Cloud IAM nach WebSocket-Schnittstelle
-
Die WebSocket-Schnittstelle unterstützt jetzt die tokenbasierte Authentifizierung mit Identity and Access Management (IAM) mit browserbasiertem JavaScript-Code. Die bisherige Einschränkung auf das Gegenteil wurde behoben. So können Sie eine authentifizierte Verbindung mit der WebSocket-Methode
/v1/synthesizeherstellen:- Wenn Sie die IAM-Authentifizierung verwenden, geben Sie den Abfrageparameter
access_tokenan. - Wenn Sie Cloud Foundry-Serviceberechtigungsnachweise verwenden, geben Sie den Abfrageparameter
watson-tokenan.
Weitere Informationen hierzu finden Sie unter Verbindung öffnen.
- Wenn Sie die IAM-Authentifizierung verwenden, geben Sie den Abfrageparameter
13. Dezember 2018
- Neuer Standort in London jetzt verfügbar
- Der Text to Speech-Service ist jetzt am IBM Cloud®-Standort London verfügbar (eu-gb). Wie alle Standorte verwendet auch London eine tokenbasierte Identitäts- und Zugriffsverwaltung (IAM). Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.
7. November 2018
- Neuer Standort in Tokio jetzt verfügbar
- Der Text to Speech-Service ist jetzt am IBM Cloud®-Standort Tokio verfügbar (jp-tok). Wie alle Standorte verwendet auch Tokio eine tokenbasierte Identitäts- und Zugriffsverwaltung (IAM). Alle neuen Serviceinstanzen, die Sie an diesem Standort erstellen, verwenden die IAM-Authentifizierung.
30. Oktober 2018
- Neue Unterstützung für tokenbasiertes IBM Cloud IAM
-
Der Text to Speech-Service wurde für alle Standorte auf die tokenbasierte Authentifizierung von Identity and Access Management (IAM) migriert. Alle IBM Cloud-Services verwenden jetzt die IAM-Authentifizierung. Der Text to Speech-Service wurde an allen Standorten jeweils am nachfolgend angegebenen Datum migriert:
- Dallas (us-south): 30. Oktober 2018
- Frankfurt (eu-de): 30. Oktober 2018
- Washington DC (us-east): 12. Juni 2018
- Sydney (au-syd): 15. Mai 2018
Die Migration zur IAM-Authentifizierung wirkt sich auf neue und auf bestehende Serviceinstanzen jeweils anders aus:
- Alle neuen Service-Instanzen, die Sie an einem beliebigen Standort erstellen, verwenden nun die IAM-Authentifizierung für den Zugriff auf den Service. Sie können entweder ein Trägertoken oder einen API-Schlüssel übergeben: Token unterstützen authentifizierte Anfragen, ohne in jeden Aufruf Serviceberechtigungsnachweise einzubetten, und API-Schlüssel verwenden die HTTP-Basisauthentifizierung. Wenn Sie ein beliebiges Watson-SDK verwenden, können Sie den API-Schlüssel übergeben und dem SDK die Verwaltung des Lebenszyklus der Token überlassen.
- Vorhandene Serviceinstanzen, die Sie vor dem angegebenen Umstellungstermin an einem Standort erstellt haben, verwenden weiterhin die Kombination aus
{username}und{password}aus den vorherigen Cloud Foundry-Serviceberechtigungsnachweisen, bis Sie die betreffenden Services auf die Verwendung der IAM-Authentifizierung umstellen.
Weitere Informationen finden Sie in der folgenden Dokumentation:
- Um herauszufinden, welchen Authentifizierungsmechanismus Ihre Service-Instanz verwendet, rufen Sie die Anmeldedaten Ihres Dienstes auf, indem Sie im Dashboard von „ IBM Cloud “ auf die Instanz klicken.
- Weitere Informationen zur Verwendung von IAM-Tokens mit Watson-Services finden Sie unter Authentifizierung bei Watson-Services.
- Beispiele für die Verwendung der IAM-Authentifizierung finden Sie in der API- und SDK-Referenz.
12. Juni 2018
- Neue Funktionen für am Standort Washington DC gehostete Anwendungen
-
Die folgenden Funktionen wurden für Anwendungen aktiviert, die in Washington DC (us-east) gehostet werden:
- Der Service unterstützt jetzt einen neuen Prozess für API-Authentifizierung. Weitere Informationen enthalten die Angaben zur Serviceaktualisierung vom 30. Oktober 2018.
- Der Service unterstützt jetzt den Header
X-Watson-Metadataund die MethodeDELETE /v1/user_data. Weitere Informationen finden Sie unter Informationssicherheit.
15. Mai 2018
- Neue Funktionen für am Standort Sydney gehostete Anwendungen
-
Die folgenden Funktionen wurden für Anwendungen aktiviert, die in Sydney (au-syd) gehostet werden:
- Der Service unterstützt jetzt einen neuen Prozess für API-Authentifizierung. Weitere Informationen enthalten die Angaben zur Serviceaktualisierung vom 30. Oktober 2018.
- Der Service unterstützt jetzt den Header
X-Watson-Metadataund die MethodeDELETE /v1/user_data. Weitere Informationen finden Sie unter Informationssicherheit.
2. Oktober 2017
- Änderungen am
audio/l16-Audioformat - Beim Format
audio/l16können Sie künftig optional einen Endianess-Wert für die zurückgegebene Audioausgabe angeben. (Die Abtastfrequenz mussten Sie bereits angeben.) Beispiele hierfür sindaudio/l16;rate=22050;endianness=big-endianundaudio/l16;rate=22050;endianness=little-endian; standardmäßig wird die Signifikant-Endian-Reihenfolge verwendet. Weitere Informationen finden Sie unter Audioformate verwenden.
14. Juli 2017
- Neue Unterstützung für das Audioformat MP3 (MPEG)
- Der Service unterstützt jetzt das Audio-Format 'MP3' oder 'Motion Picture Experts Group' (MPEG). Weitere Informationen zu unterstützten Audioformaten finden Sie unter Audioformate verwenden.
10. April 2017
- Neue Unterstützung für das Audioformat 'WebM' (Web Media)
- Der Service unterstützt jetzt das Audioformat 'Web Media' (WebM) mit dem Opus- oder Vorbis-Codec. Außerdem unterstützt er das Audioformat 'Ogg' nun zusätzlich zum Opus-Codec mit dem Vorbis-Codec. Weitere Informationen zu unterstützten Audioformaten finden Sie unter Audioformate verwenden.
- Neue Unterstützung für Cross-Origin Resource Sharing
- Der Service unterstützt jetzt Cross-Origin Resource Sharing (CORS), sodass browserbasierte Clients den Service direkt aufrufen können. Weitere Informationen finden Sie unter CORS support.
- Änderungen an HTTP-Antwortcodes für erfolgreichen Abschluss
- Die HTTP-Antwortcodes für den erfolgreichen Abschluss einiger Methoden der Anpassungsschnittstelle wurden geändert:
- Die Methode
POST /v1/customizationsgibt jetzt 201 (anstelle von 200) zurück. - Die Methode
POST /v1/customizations/{customization_id}gibt jetzt 200 (anstelle von 201) zurück. - Die Methode
POST /v1/customizations/{customization_id}/wordsgibt jetzt 200 (anstelle von 201) zurück. - Die Methode
PUT /v1/customizations/{customization_id}/words/{word}gibt jetzt 200 (anstelle von 201) zurück.
- Die Methode
- Neue Fehler bei falscher Verwendung des japanischen Parameters
part_of_speech - Die Methoden
POST /v1/customizations/{custom_id}/wordsundPUT /v1/customizations/{customization_id}/words/{word}geben jetzt den HTTP-Antwortcode 400 mit der FehlernachrichtPart of speech is supported for ja-JP language onlyzurück, falls Sie versuchen, bei einer anderen Sprache als Japanisch eine Wortart (Attributpart_of_speech) anzugeben. - Änderungen am Antworthauptteil für das Hinzufügen von Wortmethoden
- Die Methode
POST /v1/customizations/{custom_id}/wordsgibt jetzt einen leeren Antworthauptteil ({}) zurück.
1. Dezember 2016
- Neue Stimme für lateinamerikanisches Spanisch:
es-LA_SofiaVoice -
Der Service enthält eine neue Stimme namens
es-LA_SofiaVoice. Sie ist das lateinamerikanische Äquivalent zur Stimmees-US_SofiaVoice. Der Hauptunterschied zwischen den beiden Stimmen betrifft die Interpretation des Zeichens$(Dollarzeichen): Die lateinamerikanische Version verwendet den Begriff Pesos, die nordamerikanische Version verwendet den Begriff Dolares. Darüber hinaus kann es einige geringere Unterschiede zwischen den beiden Stimmen geben. - Neue Stimmen für amerikanisches Englisch:
en-US_LisaVoiceunden-US_MichaelVoice -
Neben
en-US_AllisonVoicekönnen nun zwei weitere Stimmen mit der SSML-Stimmenumwandlung verändert werden:en-US_LisaVoiceunden-US_MichaelVoice. - Änderungen an der Anpassung für Japanisch
-
Wenn Sie die Anpassungsschnittstelle mit Japanisch verwenden, wird vom Service jetzt das längste Wort in den Paaren aus Wort und Umsetzung, die für ein angepasstes Modell definiert sind, als Entsprechung verwendet. Dies lässt sich am Beispiel der beiden folgenden Einträge für ein angepasstes Modell verdeutlichen:
{ "words": [ {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"}, {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"} ] }Wenn der Dienst die Zeichenfolge „
NYC“ im Eingabetext findet, wird dieses Wort als Übereinstimmung erkannt, da es eine längere Übereinstimmung darstellt als „NY“. Früher hätte der Dienst die Zeichenfolge „NY“ gefunden. Weitere Informationen zur Arbeit mit japanischen Einträgen für ein benutzerdefiniertes Modell finden Sie unter „Arbeiten mit japanischen Einträgen “.
22. September 2016
- Die Anpassungsfunktion ist nun für alle Sprachen verfügbar
- Die Anpassungsschnittstelle, die die Methoden 'customization' und
GET /v1/pronunciationumfasst, ist nun für alle vom Service unterstützten Sprachen verfügbar. Die Schnittstelle liegt weiterhin als Betaversion vor. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung. - Neue Unterstützung für SSML für Japanisch
- Der Service unterstützt jetzt SSML für Japanisch. Allgemeine Informationen zur SSML-Unterstützung finden Sie in den Erläuterungen zu SSML. Angaben über SPR- und IPA-Symbole für Japanisch
enthält der Abschnitt Symbole für Japanisch. Beim Erstellen von Einträgen für Wörter in einem angepassten Modell für Japanisch sind zusätzliche Hinweise und das Feld
part_of_speechzu berücksichtigen. Näheres hierzu ist im Abschnitt Mit Einträgen in Japanisch arbeiten zu finden. - Neue SSML-Funktion für Stimmenumwandlung
- Der Service bietet jetzt SSML für Stimmenumwandlung über das neue Element
<voice-transformation>. Sie können die Bandbreite der möglichen Stimmen erweitern, indem Sie angepasste Umwandlungen erstellen, die die Tonhöhe, den Tonumfang, den glottalen Druck, die Aspiration, das Tempo und das Timbre einer Stimme ändern. Der Service bietet außerdem zwei integrierte virtuelle Stimmen namens Young und Soft. Gegenwärtig wird die Stimmenumwandlung vom Service nur bei der Stimme 'Allison' für amerikanisches Englisch unterstützt. - Wordtaktinformationen jetzt über WebSocket-Schnittstelle verfügbar
- Der Service kann jetzt für alle Zeichenfolgen des Eingabetextes, den Sie an die WebSocket-Schnittstelle übergeben, Worttaktinformationen zurückgeben. Um die Start- und die Endzeit jeder Zeichenfolge in der Eingabe zu erhalten, geben Sie ein
Array an, das die Zeichenfolge
wordsfür den optionalen Parametertimingsdes JSON-Objekts enthält, das Sie an den Service übergeben. Für Eingabetext in Japanisch ist die Funktion gegenwärtig nicht verfügbar. Weitere Informationen hierzu finden Sie unter Wortzeitdauer generieren. - Neue Unterstützung für SSML-Validierung
- Der Service validiert jetzt alle SSML-Elemente, die Sie in einem beliebigen Inhalt übergeben. Falls er einen ungültigen Tag findet, meldet der Service einen HTTP-Antwortcode 400 mit einer beschreibenden Nachricht und die Methode schlägt fehl. In früheren Versionen behandelte der Dienst Fehler uneinheitlich; die Angabe einer ungültigen Wortaussprache konnte beispielsweise zu unvorhersehbarem oder uneinheitlichem Verhalten führen. Weitere Informationen finden Sie unter SSML-Validierung.
- IBM Format SPR wird jetzt mit
ibmanstelle vonsprangegeben - Die Verwendung von
sprals Argument für die Optionformatder MethodeGET /v1/pronunciationund für die Verwendung mit dem Attributalphabeteines SSML-Elements<phoneme>ist veraltet. Verwenden Sie zur Verwendung der Schreibweise gemäß IBM SPR in allen Fällen das Argumentibmanstelle vonspr. - Neue Unterstützung für Audioformat
audio/mulaw - Die Liste der unterstützten Audioformate enthält jetzt
audio/mulaw;rate={rate}. Wie beiaudio/basichandelt es sich hierbei um ein Einzelkanalaudioformat, das mithilfe von 8-Bit-U-Law-Daten (oder Mu-Law-Daten) mit einer Abtastfrequenz von 8 kHz codiert wird. Weitere Informationen finden Sie unter Audioformate verwenden. - Neue unterstützte Funktionen beim Auflisten von Stimmen
- Die Methoden
GET /v1/voicesundGET /v1/voices/{voice}geben jetzt als Teil der Ausgabe für jede Stimme ein Objektsupported_featureszurück. Das Objekt beschreibt, ob die Stimme die Anpassung und das SSML-Element<voice_transformation>unterstützt. Weitere Informationen finden Sie unter Sprachen und Stimmen.
23. Juni 2016
- Neue WebSocket-Schnittstelle für Sprachsynthese
-
Der Service bietet jetzt für die synthetische Erstellung von Sprache aus Text eine WebSocket-Schnittstelle. Die Schnittstelle bietet dieselben Funktionen wie die Methode
/v1/synthesizeder HTTP-Schnittstelle. Sie akzeptiert einfachen Text oder Text mit der XML-basierten Markup-Sprache 'Speech Synthesis Markup Language' (SSML). Darüber hinaus unterstützt die Schnittstelle auch die Verwendung des SSML-Elements<mark>, um den Zeitpunkt in der Audioausgabe zu ermitteln, zu der die Synthetisierung des gesamten Texts vor der Markierung abgeschlossen ist. Weitere Informationen finden Sie im Abschnitt WebSocket-Schnittstelle. - Erweiterte Sprachunterstützung für SSML
-
Der Service bietet jetzt für Text, der mit SSML annotiert ist, Unterstützung für die Sprachen Kastilisch und nordamerikanisches Spanisch, Italienisch und brasilianisches Portugiesisch. Die Verwendung von SSML wurde vom Service zuvor bereits für amerikanisches und britisches Englisch, Französisch sowie Deutsch unterstützt. Ab dieser Aktualisierung unterstützt der Service SSML bei allen Sprachen außer Japanisch. Darüber hinaus können Sie sowohl mit IBM SPR als auch mit dem IPA über das SSML-Element
<phoneme>definieren, wie Wörter ausgesprochen werden sollen. Weitere Informationen finden Sie in den Erläuterungen zu SSML und den Erläuterungen zu phonetischen Zeichen.Bei amerikanischem Englisch können Sie Worteinträge in einem angepassten Modell auch mithilfe des SSML-Elements
<phoneme>erstellen. Eine Anpassung wird nur für amerikanisches Englisch unterstützt. Weitere Informationen enthält der Abschnitt Wissenswertes über die Anpassung. - Aktualisierte Stimmen für verbesserte Sprachsynthese
-
Der Service bietet für die am häufigsten verwendeten Stimmen eine verbesserte Expressivität und Natürlichkeit. Grundlage der Verbesserungen ist die auf Recursive Neural Network (RNN) basierende Prosodievorhersage aus dem Eingabetext. Diese Verbesserungen werden als neue Service-Engine und Sprechmodellaktualisierungen für die folgenden Sprachen verfügbar gemacht:
en-US_AllisonVoiceen-US_LisaVoiceen-US_MichaelVoicees-ES_EnriqueVoicefr-FR_ReneeVoice
- Neuer Parameter für Anpassungs-ID für Wortaussprache
-
Die Methode
GET /v1/pronunciationakzeptiert jetzt den optionalen Abfrageparametercustomization_id. Über den Parameter wird eine Wortumsetzung aus einem angegebenen angepassten Modell abgerufen. Enthält das angepasste Modell das Wort nicht, wird von der Methode die Standardaussprache des Wortes zurückgegeben. Weitere Informationen finden Sie in der API- und SDK-Referenz.Bei Verwendung der Methode
GET /v1/pronunciationohne Anpassungs-ID und für eine andere Sprache als amerikanisches Englisch können Sie die Aussprache eines Wortes nur in der Schreibweise nach IBM SPR anfordern. Für eine andere Sprache als amerikanisches Englisch müssen Siesprmit der Optionformatder Methode angeben. - Neue Unterstützung für Audioformat
audio/basic -
Die Liste der unterstützten Audioformate umfasst jetzt auch
audio/basic. Dieses Format stellt eine Einkanalaudioausgabe mit in 8-Bit-U-Law (oder Mu-Law) codierten Daten und einer Abtastfrequenz von 8 kHz bereit. Weitere Informationen finden Sie unter Audioformate verwenden. - HTTP- und WebSocket-Schnittstelle können jetzt Warnungen zurückgeben
-
Die HTTP- und WebSocket-Methoden
/v1/synthesizekönnen eine Antwort des Typswarningszurückgeben, die Nachrichten über ungültige Abfrageparameter oder JSON-Felder in einer Anforderung enthält. Das Format der Warnungen wurde geändert. Das folgende Beispiel zeigt das vorherige Format:"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."Dieselbe Warnung hat jetzt das folgende Format:
"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."
10. März 2016
- Von Synthesemethoden können jetzt Warnungen zurückgegeben werden
- Die Methoden
GETundPOST /v1/synthesizekönnen jetzt einen Antwortheader namensWarningszurückgeben, der eine Liste mit Warnungen über ungültige Abfrageparameter oder JSON-Felder in der Anforderung enthält. Jedes Element der Liste enthält eine Zeichenfolge, die die Art der Warnung gefolgt von einem Array ungültiger Argumentzeichenfolgen beschreibt. Beispiel:Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}'].Weitere Informationen finden Sie imAPI & SDK-Referenz. - Betaversion des Apple iOS SDK wird nicht mehr verwendet
- Die Betaversion von Watson Speech Software Development Kit (SDK) für das Betriebssystem Apple ® iOS ist veraltet und wird durch Watson Swift-SDK ersetzt. Das neue SDK ist im Repository „swift-sdk“ im Namespace „
watson-developer-cloud“ unter GitHub verfügbar.
22. Februar 2016
- Neue SSML-Funktion für Expressivität
- Der Service wurde mit einer neuen SSML-Funktion für die Expressivität aktualisiert. Der Service erweitert SSML mit einem Element
<express-as>, mit dem Sie die Expressivität in einem der drei folgenden Sprachstile angeben können:GoodNews,ApologyoderUncertainty. Das Element kann auf den gesamten Text, einen Satz, einen Ausdruck oder ein Wort angewendet werden. Die Expressivität wird vom Service gegenwärtig nur bei der Stimme 'Allison' für amerikanisches Englisch unterstützt (en-US_AllisonVoice).
17. Dezember 2015
- Neue Anpassungsschnittstelle als Betaversion
-
Der Service bietet eine neue Anpassungsschnittstelle, mit der Sie angeben können, wie er ungewöhnliche Wörter aussprechen soll, die in der Eingabe enthalten sind. Die Schnittstelle enthält einige neue Methoden, mit denen Sie benutzerdefinierte Modelle und die darin enthaltenen Wort-Übersetzungs-Paare erstellen und verwalten können. Anschließend können Sie Ihre angepassten Modelle bei der synthetischen Erstellung von Audioausgabe aus Text verwenden.
Der Service unterstützt gleich klingende und phonetische Umsetzungen. Phonetische Umsetzungen können entweder die Darstellung in IPA (International Phonetic Alphabet) oder das IBM Format SPR (Symbolic Phonetic Representation) verwenden. Zum Angeben von phonetischen Umsetzungen wird SSML verwendet.
Die Anpassungsschnittstelle enthält eine Reihe von neuen HTTP-Methoden namens
POST /v1/customizations,POST /v1/customizations/{customization_id},POST /v1/customizations/{customization_id}/wordsundPUT /v1/customizations/{customization_id}/words/{word}. Außerdem bietet der Service eine neue MethodeGET /v1/pronunciation, mit der die Aussprache für ein beliebiges Wort zurückgegeben wird, sowie die neue MethodeGET /v1/voices/{voice}, die detaillierte Informationen zu einer bestimmten Stimme zurückgibt. Darüber hinaus akzeptieren vorhandene Methoden der Schnittstelle des Service jetzt nach Bedarf angepasste Modellparameter.Weitere Informationen über die Anpassung und ihre Schnittstelle finden Sie unter Verständnis der Anpassung und in der API- und SDK-Referenz.
Die Anpassungsschnittstelle liegt als Betaversion vor, die gegenwärtig nur amerikanisches Englisch unterstützt. Alle Anpassungsmethoden und die Methode
GET /v1/pronunciationkönnen derzeit nur in amerikanischem Englisch zum Erstellen und Bearbeiten von angepassten Modellen und Wortumsetzungen verwendet werden. - Neue Stimme für brasilianisches Portugiesisch:
pt-BR_IsabelaVoice -
Der Service unterstützt eine neue Stimme namens
pt-BR_IsabelaVoicefür die synthetische Erstellung von Audioausgabe in brasilianischem Portugiesisch mit einer Frauenstimme. Weitere Informationen finden Sie unter Sprachen und Stimmen.
21. September 2015
- Neue SDKs für mobile Geräte verfügbar
-
Für die Sprachservices sind zwei neue Software Development Kits (SDKs) für mobile Geräte verfügbar. Die SDKs ermöglichen mobilen Anwendungen eine Interaktion mit dem Text to Speech-Service und dem Speech to Text-Service. Mithilfe der SDKs können Sie Text an den Text to Speech-Service senden und eine Sprachausgabe empfangen.
- Das SDK für „ Watson “ ( Swift ) ist im Repository „swift-sdk“ im Namespace „
watson-developer-cloud“ unter GitHub verfügbar. - Das „ Watson “-Sprach- Android™ SDK ist im Repository „speech-android-sdk“ im Namespace „
watson-developer-cloud“ unter GitHub verfügbar.
Beide SDKs unterstützen die Authentifizierung bei den Speech-Services entweder mit Ihren IBM Cloud-Serviceberechtigungsnachweisen oder mit einem Authentifizierungstoken. Da es sich bei den SDKs um Beta-Funktionen handelt, können sie sich in Zukunft ändern.
- Das SDK für „ Watson “ ( Swift ) ist im Repository „swift-sdk“ im Namespace „
- Neue Stimme für Japanisch:
ja-JP_EmiVoice -
Der Service unterstützt jetzt mit Japanisch eine weitere Sprache. Die Stimme
ja-JP_EmiVoiceist eine Frauenstimme für Japanisch.
1. Juli 2015
- Der Service Text to Speech ist jetzt allgemein verfügbar
-
Der Service wurde am 1. Juli 2015 von der Betaversion auf allgemeine Verfügbarkeit umgestellt. Die folgenden Unterschiede bestehen zwischen der Beta- und der GA-Version der „ Text to Speech “-API. Für das allgemein verfügbare Release müssen die Benutzer ein Upgrade auf die neue Version des Service durchführen.
- Neues tokenbasiertes Programmiermodell
-
Ein neues Programmiermodell unterstützt die direkte Interaktion zwischen einem Client und dem Service. Bei Verwendung dieses Modells kann ein Client ein Authentifizierungstoken für die direkte Kommunikation mit dem Service anfordern. Bei Verwendung des Tokens ist der Client nicht mehr gezwungen, eine serverseitige Proxy-Anwendung in IBM Cloud zu nutzen, die den Service in seinem Namen aufruft. Tokens sind die bevorzugte Methode für die Interaktion von Clients mit dem Service.
Der Service unterstützt weiterhin das alte Programmiermodell, das auf einem serverseitigen Proxy zur Weitergabe der Kommunikation und der Daten zwischen dem Client und dem Service verwendet wird. Das neue Modell ist jedoch effizienter und bietet einen höheren Durchsatz.
- Neue Unterstützung für Speech Synthesis Markup Language
-
Sie können jetzt SSML (Speech Synthesis Markup Language) an die HTTP-Versionen
GETundPOSTder Methode/v1/synthesizeübergeben. SSML ist eine XML-basierte Markup-Sprache, die für die Bereitstellung von Annotationen von Text für Sprachsyntheseanwendungen wie den Text to Speech-Service konzipiert wurde. Zusätzliche Informationen zur Übergabe von SSML-Eingabe an den Service finden Sie unter Eingabetext angeben.Der Service unterstützt die Verwendung von SSML zunächst nur für britisches sowie amerikanisches Englisch, Französisch und Deutsch. Die Verwendung von SSML bei Italienisch und Spanisch wird durch den Service nicht unterstützt. Achten Sie bei Verwendung von SSML darauf, dass Sie für die Sprachausgabe keine Stimme in einer der nicht unterstützten Sprache auswählen. Die Ergebnisse in diesem Fall sind nicht sinnvoll.
- Änderungen an verfügbaren Stimmen
-
Die Stimmen, die für die synthetische Sprachausgabe unterstützt werden, die verändert und erweitert wurde. Der Dienst unterstützt nun über die Methoden „
/v1/synthesize“ mehrere weitere Stimmen, Sprachen und Dialekte. Zusätzliche Angaben über unterstützte Stimmen enthält der Abschnitt Sprachen und Stimmen.In der allgemein verfügbaren Version wurden die in der Betaversion verfügbaren Stimmen umbenannt:
VoiceEnUsMichaelist jetzten-US_MichaelVoiceVoiceEnUsLisaist jetzten-US_LisaVoiceVoiceEsEsEnriqueist jetztes-ES_EnriqueVoice
Die vorherigen Namen der Stimmen können bei der Betaversion des Service (über die API-Endpunkte
-beta) weiterhin verwendet werden, solange diese Version verfügbar bleibt. Bei der allgemein verfügbaren Version des Service müssen Sie jedoch die neuen Namen verwenden. - Neue Unterstützung für das Audioformat FLAC (Free Lossless Audio Codec)
-
Sie können künftig anfordern, dass der Service Sprachausgabe im Format 'Free Lossless Audio Codec' (FLAC) zurückgibt. Der Service kann Sprachausgabe weiterhin im Format 'Ogg' mit dem Opus-Codec (Standardeinstellung) und im Format 'Waveform Audio File Format' (WAV) zurückgeben. Weitere Informationen zur Verwendung von Audioformaten mit den
/v1/synthesize-Methoden finden Sie in Audioformate verwenden. - Neue Grenzwerte für die maximale Anzahl synthetisierter Texte
-
Der Text, den Sie an die Methode
/v1/synthesizein der URL einer HTTP-AnforderungGEToder im Hauptteil einer HTTP-AnforderungPOSTsenden, ist jetzt auf eine Größe vom maximal 5 KB begrenzt. Bei der Betaversion galt für den Text eine maximale Größe von 4 MB. - Neuer Header zum Inaktivieren von Mitarbeit in Bezug auf Serviceverbesserungen
-
Bei der Methode
/v1/synthesizekönnen Sie jetzt durch eine Einbeziehung des HeadersX-WDC-PL-OPT-OUTsteuern, ob der Service Text und Audioergebnisse aus einer Operation nutzt, um künftige Ergebnisse zu verbessern. Geben Sie für den Header den Wert1an, um zu verhindern, dass der Service Text und Audioergebnisse nutzt. Der Parameter gilt nur für die aktuelle Anforderung. Der neue Header ersetzt den HeaderX-loggingaus den Methoden der Betaversion. Weitere Informationen enthält der Abschnitt Anforderungsprotokollierung für Watson-Services steuern. - Änderungen an HTTP-Fehlercodes für Sprachsynthese
-
Die folgende Fehlercodes für die Methoden
/v1/synthesizewurden geändert:- Der Fehlercode 406 ("Not acceptable. Unsupported MIME type.") wird entfernt.
- Der Fehlercode 415 ("Unsupported Media Type") wurde hinzugefügt.
- Der Fehlercode 503 ("Service Unavailable") wurde hinzugefügt.
- Änderungen an HTTP-Fehlercodes zum Auflisten von Stimmen
-
Die folgenden Fehlercodes für die Methode
GET /v1/voiceswurden geändert:- Der Fehlercode 406 ("Not acceptable. Unsupported MIME type.") wird entfernt.
- Der Fehlercode 415 ("Unsupported Media Type") wurde hinzugefügt.