Releaseinformationen für Speech to Text for IBM Cloud Pak for Data

IBM Cloud Pak for Data

Die folgenden Funktionen und Änderungen wurden für jedes Release und jede Aktualisierung von installierten oder lokalen Instanzen von IBM Watson® Speech to Text for IBM Cloud Pak for Data hinzugefügt. Sofern nicht anders angegeben, sind alle Änderungen mit früheren (älteren) Versionen kompatibel und werden für alle neuen und vorhandenen Anwendungen automatisch und transparent verfügbar gemacht.

Informationen zu bekannten Einschränkungen des Service finden Sie unter Bekannte Einschränkungen.

Informationen zu Releases und Aktualisierungen des Service für IBM Cloud finden Sie unter Releaseinformationen für Speech to Text for IBM Cloud.

30. Oktober 2024 (Version 4.8.7 )

Version 4.8.7 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.7 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

25. September 2024 (Version 5.0.3 )

Version 5.0.3 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 5.0.3 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

28. August 2024 (Version 4.8.6 )

Version 4.8.6 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.6 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

28. August 2024 (Version 5.0.2 )

Version 5.0.2 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 5.0.2 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

31. Juli 2024 (Version 5.0.1 )

Version 5.0.1 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 5.0.1 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

19. Juni 2024 (Version 5.0.0 )

Version 5.0.0 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 5.0.0 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

24. April 2024 (Version 4.8.5 )

Version 4.8.5 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.5 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

27. März 2024 (Version 4.8.4 )

Version 4.8.4 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.4 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

28. Februar 2024 (Version 4.8.3 )

Version 4.8.3 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.3 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

31. Januar 2024 (Version 4.8.2 )

Version 4.8.2 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.2 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

30. November 2023 (Version 4.8.0 )

Version 4.8.0 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.8.0 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

27. September 2023 (Version 4.7.3 )

Version 4.7.3 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.7.3 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

28. Juli 2023 (Version 4.7.1 )

Version 4.7.1 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.7.1 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

9. Juni 2023 (Version 4.7.0 )

Version 4.7.0 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.7.0 ist jetzt verfügbar. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

2. Mai 2023 (Version 4.6.5)

Version 4.6.5 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.6.5 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data, 4.6.x und Red Hat OpenShift, 4.10 und 4.12. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Neues japanisches Telefoniemodell der nächsten Generation

Der Dienst bietet jetzt ein Telefoniemodell der nächsten Generation für Japaner: ja-JP_Telephony. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken. Weitere Informationen über Modelle der nächsten Generation und niedrige Latenzzeiten finden Sie unter:

Verbesserte Sprachmodellanpassung für englische und japanische Modelle der nächsten Generation

Der Service bietet jetzt eine verbesserte Sprachmodellanpassung für englische und japanische Modelle der nächsten Generation:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Sichtbare Verbesserungen an den Modellen: Die neue Technologie verbessert das Standardverhalten der neuen englischen und japanischen Modelle. Neben anderen Änderungen optimiert die neue Technologie das Standardverhalten für die folgenden Parameter:

  • Der Standardwert customization_weight für angepasste Modelle, die auf den neuen Versionen dieser Modelle basieren, wird von 0.2 in 0.1 geändert.
  • Die Standard-E-Mail-Adresse character_insertion_bias für benutzerdefinierte Modelle, die auf den neuen Versionen dieser Modelle basieren, bleibt 0.0, aber die Modelle haben sich geändert, wodurch der Parameter für die Spracherkennung weniger notwendig ist.

Upgrade auf die neuen Modelle: Um die Vorteile der verbesserten Technologie nutzen zu können, müssen Sie alle angepassten Sprachmodelle, die auf den neuen Modellen basieren, aktualisieren. Um auf die neue Version eines dieser Basismodelle zu aktualisieren:

  1. Ändern Sie Ihr angepasstes Modell, indem Sie ein angepasstes Wort, einen angepassten Korpus oder eine angepasste Grammatik hinzufügen oder ändern, die das Modell enthält. Jede Änderung, die Sie vornehmen, versetzt das Modell in den Status ready.

  2. Verwenden Sie die Methode POST /v1/customizations/{customization_id}/train, um das Modell erneut zu trainieren. Beim erneuten Training wird das angepasste Modell auf die neue Technologie aktualisiert und das Modell in den Status available versetzt.

    Bekanntes Problem: Derzeit können Sie die Methode POST /v1/customizations/{customization_id}/upgrade_model nicht verwenden, um ein benutzerdefiniertes Modell auf eines der neuen Basismodelle zu aktualisieren. Dieses Problem wird in einer zukünftigen Version behoben.

Verwendung der neuen Modelle: Nach dem Upgrade auf das neue Basismodell sollten Sie die Leistung des aktualisierten angepassten Modells bewerten, indem Sie den Parametern customization_weight und character_insertion_bias für die Spracherkennung besondere Aufmerksamkeit schenken. Wenn Sie Ihr angepasstes Modell erneut trainieren:

  • Das angepasste Modell verwendet den neuen Standardwert customization_weight von 0.1 für Ihr angepasstes Modell. Eine nicht standardmäßige customization_weight, die mit Ihrem benutzerdefinierten Modell verknüpft war, wurde entfernt.
  • Das benutzerdefinierte Modell erfordert möglicherweise nicht mehr die Verwendung des Parameters character_insertion_bias für eine optimale Spracherkennung.

Verbesserungen bei der Sprachmodellanpassung machen diese Parameter für eine qualitativ hochwertige Spracherkennung weniger wichtig:

  • Wenn Sie die Standardwerte für diese Parameter verwenden, fahren Sie nach dem Upgrade fort. Die Standardwerte bieten weiterhin die besten Ergebnisse für die Spracherkennung.
  • Wenn Sie für diese Parameter nicht standardmäßige Werte angeben, experimentieren Sie nach dem Upgrade mit den Standardwerten. Ihr angepasstes Modell funktioniert möglicherweise gut für die Spracherkennung mit den Standardwerten.

Wenn Sie der Meinung sind, dass die Verwendung unterschiedlicher Werte für diese Parameter die Spracherkennung mit Ihrem angepassten Modell verbessern könnte, experimentieren Sie mit inkrementellen Änderungen, um festzustellen, ob die Parameter zur Verbesserung der Spracherkennung erforderlich sind.

Hinweis: Derzeit gelten die Verbesserungen bei der Anpassung von Sprachmodellen nur für benutzerdefinierte Modelle, die auf den oben aufgeführten englischen oder japanischen Basissprachmodellen der nächsten Generation basieren. Im Laufe der Zeit werden die Verbesserungen für andere Sprachmodelle der nächsten Generation verfügbar gemacht.

Weitere Informationen: Weitere Informationen über Upgrades und Spracherkennung mit diesen Parametern finden Sie unter:

Neue Umgebungsvariable für angepasste Ressource für Speech-Services

Die Dokumentation enthält jetzt Anweisungen zum Erstellen einer Umgebungsvariablen namens ${CUSTOM_RESOURCE_SPEECH}. Sie hängen die neue Variable an das Script cpd_vars.sh an und verwenden das Script als Quelle für die Verwendung der Variablen in Ihrer Umgebung. Weitere Informationen finden Sie unter Information you need to complete this task in Installing Watson Speech servicesoder in einem der Upgradethemen für die Speech-Services.

Fehlerkorrektur: Die schwedischen Telefonie-und italienischen Multimedia-Modelle sind jetzt verfügbar

Fehlerkorrektur: Die Modelle "Schwedische Telefonie" (sv-SE_Telephony) und "Italienische Multimedia" (it-IT_Multimedia) sind jetzt für die Installation verfügbar. Bisher waren sie nicht verfügbar.

Fehlerkorrektur: Verbesserte Trainingszeit für angepasste Sprachmodelle der nächsten Generation

Fehlerkorrektur: Die Trainingszeit für angepasste Sprachmodelle der nächsten Generation wurde jetzt deutlich verbessert. Bisher dauerte die Trainingszeit viel länger als nötig, wie für das Training von angepassten japanischen Sprachmodellen berichtet wurde. Das Problem wurde durch einen internen Fix behoben.

Fehlerkorrektur: Grammatikdateien verarbeiten jetzt Zeichenfolgen von Ziffern korrekt

Fehlerkorrektur: Wenn Grammatiken verwendet werden, verarbeitet der Service jetzt längere Zeichenfolgen mit Ziffern ordnungsgemäß. Bisher konnte die Erkennung nicht abgeschlossen werden oder es wurden falsche Ergebnisse zurückgegeben.

Fehlerkorrektur: Dynamisch generierte Grammatikdateien funktionieren jetzt ordnungsgemäß

Fehlerkorrektur: Dynamisch generierte Grammatikdateien funktionieren jetzt ordnungsgemäß. Bisher konnten dynamische Grammatikdateien zu internen Fehlern führen, die für die Integration von Speech to Text in IBM® watsonx™ Assistantgemeldet wurden. Das Problem wurde durch einen internen Fix behoben.

Fehlerkorrektur: Intelligente Formatierung für Datumsangaben in amerikanischem Englisch ist jetzt korrekt

Fehlerkorrektur: Die intelligente Formatierung enthält jetzt ordnungsgemäß Wochentage und Datumsangaben, wenn beide in den gesprochenen Audiodaten vorhanden sind, z. B. Tuesday February 28. Bisher wurde in einigen Fällen der Wochentag weggelassen und das Datum falsch dargestellt. Die Funktion für die intelligente Formatierung liegt als Betaversion vor.

Fehlerkorrektur: Dokumentation für Wörter mit Sprachzögerung für Modelle der nächsten Generation aktualisieren

Fehlerbehebung: Die Dokumentation für Wörter, bei denen die Aussprache verzögert ist, wurde für die nächste Generation der Modelle aktualisiert. Weitere Details werden über zögerliche Wörter in amerikanischem Englisch und Japanisch bereitgestellt. Modelle der nächsten Generation enthalten die tatsächlichen zögerlichen Wörter in Transkriptionsergebnissen, im Gegensatz zu Modellen der vorherigen Generation, die nur zögerliche Marker enthalten. Weitere Informationen finden Sie unter Sprachzögerungen und Stockungsmarkierungen.

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

29. Februar 2023 (Version 4.6.4)

Version 4.6.4 ist jetzt verfügbar
Speech to Text für IBM Cloud Pak for Data Version 4.6.4 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data, 4.6.x und Red Hat OpenShift, 4.10 und 4.12. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.
Wichtig: Sichern Sie Ihre Daten, bevor Sie auf Version 4.6.3 oder 4.6.4 aktualisieren
Wichtig: Bevor Sie ein Upgrade auf Watson Services-Version 4.6.3 oder 4.6.4 durchführen, müssen Sie eine Sicherungskopie Ihrer Daten erstellen. Bewahren Sie die Sicherung an einer sicheren Position auf. Weitere Informationen zum Sichern Ihrer Watson Services-Daten finden Sie unter Sichern und Wiederherstellen Watson in Verwalten Watson. Dieses Thema enthält auch Informationen zum Zurückschreiben Ihrer Daten, falls dies erforderlich wird.
Bekannte Ausgabe: Die schwedischen Telefonie-und italienischen Multimedia-Modelle sind noch nicht verfügbar
Bekannte Probleme: Die schwedischen Telefonie- ( sv-SE_Telephony ) und italienischen Multimedia-Modelle ( it-IT_Multimedia ) sind noch nicht verfügbar. Sie werden mit Version 4.6.5 zur Verfügung gestellt.
Fehlerkorrektur: Sie können jetzt die installierten Modelle und Stimmen mit den erweiterten Installationsoptionen ändern
Fehlerkorrektur: Während der Installation können Sie jetzt verschiedene Modelle oder Stimmen mit den erweiterten Installationsoptionen der Befehlszeilenschnittstelle angeben. Bisher hat der Service immer die Standardmodelle und -stimmen installiert. Die Einschränkung gilt weiterhin für Watson Speech-Services der Versionen 4.6.0, 4.6.2und 4.6.3. Informationen zur Installation von Modellen und Stimmen finden Sie unter Zusätzliche Installationsoptionen angeben in Watson Speech-Services installieren.
Zeitlimits für Lastausgleichsfunktion festlegen
Für Watson Speech-Services müssen Sie die Zeitlimiteinstellungen für die Lastausgleichsfunktion sowohl für den Server als auch für den Client in 300 Sekunden ändern. Diese Einstellungen stellen sicher, dass Spracherkennungsanforderungen mit langer Laufzeit, d. h. Anforderungen mit langen oder schwierigen Audiodaten, ausreichend Zeit für die Ausführung haben. Weitere Informationen finden Sie unter Informationen, die Sie zum Ausführen dieser Aufgabe benötigen in Watson Speech-Services installieren.
Behobene Sicherheitslücken
Die folgenden Sicherheitslücken wurden behoben:

23. Februar 2023 (Version 4.6.3)

Version 4.6.3 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.6.3 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.6.x und Red Hat OpenShift Version 4.10. Red Hat OpenShift Version 4.8 wird nicht mehr unterstützt. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Wichtig: Alle Modelle der vorherigen Generation sind veraltet und werden am 31. Juli 2023 das Ende des Servicezeitraums erreichen

Wichtig: Alle Modelle der vorherigen Generation sind veraltet und erreichen das Ende des Servicezeitraums ab 31. Juli 2023. An diesem Datum werden alle Modelle der vorherigen Generation aus dem Service und der Dokumentation entfernt. Das vorherige Nichtweiterverwendungsdatum war der 3. März 2023. Das neue Datum ermöglicht Benutzern mehr Zeit für die Migration auf die entsprechenden Modelle der nächsten Generation. Benutzer müssen jedoch bis zum 31. Juli 2023 auf das entsprechende Modell der nächsten Generation migrieren.

Die meisten Modelle der Vorgängergeneration wurden am 15. März 2022 als veraltet markiert. Bisher waren die arabischen und japanischen Modelle nicht veraltet. Die Einstellung der Unterstützung gilt jetzt für alle Modelle der vorherigen Generation.

Hinweis: Wenn die vorherige Generation en-US_BroadbandModel außer Betrieb genommen wird, wird das Modell der nächsten Generation en-US_Multimedia das Standardmodell für Spracherkennungsanfragen.

Bekanntes Problem: Sie können die installierten Modelle und Stimmen mit den erweiterten Installationsoptionen nicht ändern.

Bekannte Probleme: Sie können derzeit keine anderen Modelle oder Stimmen mit den erweiterten Installationsoptionen angeben. Der Service installiert immer die Standardmodelle und -stimmen. Informationen zum Ändern der Modelle nach der Installation finden Sie unter Modelle und Stimmen für Ihre Watson Speech-Services aktualisieren im Abschnitt Verwaltung von Watson Speech-Services auf IBM Cloud Pak for Data.

Bekanntes Problem: Upgrade auf Version 4.6.3 kann fehlschlagen

Bekanntes Problem: Beim Upgrade auf Version 4.6.3kann das Löschen des Sicherungsjobs MinIO nach Abschluss fehlschlagen. In diesem Fall besteht die Lösung darin, den Job zu löschen, nach dem das Upgrade normal fortgesetzt wird. Führen Sie die folgenden Schritte aus, um das Problem zu beheben.

  1. Um zu bestimmen, ob der Sicherungsjob MinIO wiederhergestellt wird, geben Sie den folgenden Befehl aus:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    Der Job MinIO, der nicht gelöscht wird, wird durch einen Eintrag im folgenden Format angegeben:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Geben Sie den folgenden Befehl aus, um den Sicherungsjob MinIO zu löschen:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Nach dem Löschen des Sicherungsjobs wird das Upgrade fortgesetzt und abgeschlossen.

Fehlerkorrektur: Aktualisierung des kanadischen Telefoniemodells der nächsten Generation in Französisch (Upgrade erforderlich)

Fehlerkorrektur: Das französische Telefonmodell der nächsten Generation, fr-CA_Telephony, wurde aktualisiert, um eine interne Inkonsistenz zu beheben, die während der Spracherkennung einen Fehler verursachen könnte. Sie müssen alle angepassten Modelle aktualisieren, die auf dem fr-CA_Telephony-Modell basieren. Weitere Informationen zur Aktualisierung von benutzerdefinierten Modellen finden Sie unter

Fehlerkorrektur: Das Multimediamodell für brasilianisches Portugiesisch der nächsten Generation ist jetzt verfügbar

Fehlerbehebung: Für Speech to Text for IBM Cloud Pak for Dataist jetzt das Multimedia-Modell für brasilianisches Portugiesisch der nächsten Generation verfügbar. Bisher war das Modell nicht verfügbar.

Das direkte Hinzufügen von Wörtern zu angepassten Modellen, die auf Modellen der nächsten Generation basieren, erhöht die Trainingszeit

Wenn Sie angepasste Wörter direkt zu einem angepassten Modell hinzufügen, das auf einem Modell der nächsten Generation basiert, dauert das Training eines Modells einige Minuten länger als sonst. Wenn Sie ein Modell mit angepassten Wörtern trainieren, die Sie mithilfe der Methode POST /v1/customizations/{customization_id}/words oder PUT /v1/customizations/{customization_id}/words/{word_name} hinzugefügt haben, planen Sie einige Minuten zusätzliche Trainingszeit für das Modell ein. Weitere Informationen finden Sie

Zusätzliche Informationen zum Arbeiten mit Serviceinstanzen

Die Dokumentation enthält jetzt Informationen zur Erstellung einer Serviceinstanz mit der Befehlszeilenschnittstelle (cpl-cli) und zur Verwaltung von Serviceinstanzen. Weitere Informationen finden Sie in den folgenden Abschnitten zu Watson Speech-Services auf IBM Cloud Pak for Data:

    • Watson Speech-Serviceinstanz erstellen* unter Konfiguration nach der Installation
    • Watson Speech-Serviceinstanzen verwalten* unter Verwalten
Sicherheitslücke behoben

Die folgende Sicherheitslücke wurde geschlossen:

30. Januar 2023 (Version 4.6.2)

Version 4.6.2 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.6.2 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data, 4.6.x und Red Hat OpenShift, 4.8 und 4.10. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Die angepasste Ressource enthält jetzt eine neue Eigenschaft fileStorageClass

Die angepasste Ressource für die Watson Speech-Services enthält jetzt zusätzlich zur vorhandenen Eigenschaft blockStorageClass eine Eigenschaft fileStorageClass. Sie geben Block-und Dateispeicherklassen an, wenn Sie einen Service installieren oder ein Upgrade für einen Service durchführen. Während des Upgrades von einer früheren Version wird die neue Eigenschaft automatisch mit der Option --file_storage_class im Befehl cli manage apply-cr zur angepassten Ressource hinzugefügt.

Weitere Informationen zu den verfügbaren Block-und Dateispeicherklassen, die Sie mit den einzelnen unterstützten Speicherlösungen verwenden können, finden Sie in der Tabelle Speicheranforderungen unter Informationen, die Sie für diese Task benötigen auf der Seite " Watson Speech-Services installieren" in Watson Speech-Services unter IBM Cloud Pak for Data.

Zusätzliche Informationen zur Bereitstellung einer Serviceinstanz

Die Dokumentation enthält jetzt Informationen zur programmgesteuerten Erstellung einer Serviceinstanz. Es enthält auch Beispiele für das Auflisten von Serviceinstanzen und Löschen einer Serviceinstanz. Weitere Informationen finden Sie unter * Watson Speech-Services-Instanz erstellen* in der Dokumentation Setup nach der Installation unter Watson Speech-Services auf IBM Cloud Pak for Data.

Serverseitige Verschlüsselung ist für den Datenspeicher MinIO aktiviert

Die Speech-Services haben jetzt die serverseitige Verschlüsselung für Objektspeicher im MinIO-Datenspeicher aktiviert. Für Sie ist keine Aktion erforderlich.

Änderung an Audit-Webhooks

Die Speech-Services haben die Webhook-Abhängigkeit für die Prüfung entfernt. Die Services schreiben jetzt Prüfereignisse direkt auf den Server. Nach dem Upgrade auf Version 4.6.2können einige Webhook-Ressourcen verbleiben, bis alle Services die Abhängigkeit entfernen können. Die verbleibenden Ressourcen werden in einem zukünftigen Release entfernt. Für Sie ist keine Aktion erforderlich.

Neues niederländisches Multimedia-Modell der nächsten Generation

Der Dienst bietet jetzt ein Multimedia-Modell der nächsten Generation für Niederländisch an: nl-NL_Multimedia. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken. Weitere Informationen über Modelle der nächsten Generation und niedrige Latenzzeiten finden Sie unter

Neues schwedisches Telefoniemodell der nächsten Generation

Der Dienst bietet jetzt ein Telefoniemodell der nächsten Generation für Schweden an: sv-SE_Telephony. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken. Weitere Informationen über Modelle der nächsten Generation und niedrige Latenzzeiten finden Sie unter

Updates für englische Telefoniemodelle der nächsten Generation

Die englischen Telefoniemodelle der nächsten Generation wurden für eine verbesserte Spracherkennung aktualisiert:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Alle diese Modelle unterstützen weiterhin niedrige Latenzzeiten. Sie müssen keine angepassten Modelle aktualisieren, die auf diesen Modellen basieren. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Der Parameter max_alternatives ist jetzt für die Verwendung mit Modellen der nächsten Generation verfügbar

Der Parameter max_alternatives ist jetzt für alle Modelle der nächsten Generation verfügbar. Der Parameter ist generell für alle Modelle der nächsten Generation verfügbar. Weitere Informationen finden Sie im Abschnitt Maximale Anzahl Alternativen.

Fehlerkorrektur: Verwendung der Parameter max_alternatives und end_of_phrase_silence_time bei Modellen der nächsten Generation zulassen

Fehlerkorrektur: Wenn Sie sowohl die Parameter max_alternatives als auch end_of_phrase_silence_time in derselben Anforderung mit Modellen der nächsten Generation verwenden, gibt der Service jetzt mehrere alternative Transkripte zurück und berücksichtigt gleichzeitig das angegebene Pausenintervall. Bisher hat die Verwendung der beiden Parameter in einer einzelnen Anforderung einen Fehler generiert. (Die Verwendung des Parameters max_alternatives mit Modellen der nächsten Generation war zuvor als experimentelle Funktion für eine begrenzte Anzahl von Kunden verfügbar.)

Fehlerkorrektur: Aktualisierung auf das japanische Multimedia-Modell der nächsten Generation (Upgrade erforderlich)

Fehlerkorrektur: Das japanische Multimediamodell der nächsten Generation, ja-JP_Multimedia, wurde aktualisiert, um eine interne Inkonsistenz zu beheben, die während der Spracherkennung mit geringer Latenz einen Fehler verursachen könnte. Sie müssen alle angepassten Modelle aktualisieren, die auf dem ja-JP_Multimedia-Modell basieren. Weitere Informationen zur Aktualisierung von benutzerdefinierten Modellen finden Sie unter

Fehlerkorrektur: Hinzufügen von Dokumentationsrichtlinien für die Erstellung japanischer Klänge auf der Basis von Modellen der nächsten Generation

Fehlerkorrektur: In "sounds-likes" für angepasste japanische Sprachmodelle, die auf Modellen der nächsten Generation basieren, ist die Zeichenfolge ウー in einigen linken Kontexten mehrdeutig. Verwenden Sie keine Zeichen (Silben), die mit dem Phonem /o/ enden, z. B. und . Verwenden Sie in solchen Fällen ウウ oder einfach anstelle von ウー. Verwenden Sie beispielsweise ロウウマン oder ロウマン anstelle von ロウーマン. Weitere Informationen finden Sie unter Richtlinien für Japanisch.

Fehlerkorrektur: Korrekte Verwendung des Felds display_as in Transkriptionsergebnissen

Fehlerkorrektur: Für die Sprachmodellanpassung mit Modellen der nächsten Generation wird der Wert des Felds display_as für ein angepasstes Wort jetzt in allen Transkripten angezeigt. Bisher erschien der Wert des Felds word manchmal in Transkriptionsergebnissen.

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

30. November 2022 (Version 4.6.0)

Version 4.6.0 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.6.0 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data, 4.6.x und Red Hat OpenShift, 4.8 und 4.10. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Amazon Web Services (AWS) wird jetzt unterstützt

Watson Sprachservices für IBM Cloud Pak for Data werden jetzt unter Amazon Web Services™ (AWS™) unterstützt. Die Services unterstützen Amazon Elastic Block Store, das Sie angeben, indem Sie die Eigenschaft blockStorageClass der angepassten Ressource für Speech-Services auf gp2-csi oder gp3-csi setzen.

Neue Speicherklassen werden jetzt unterstützt

Watson Speech-Services für IBM Cloud Pak for Data unterstützen jetzt zwei zusätzliche Speicherklassen:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Sie geben die Speicherklasse mit der Eigenschaft blockStorageClass der angepassten Ressource für Sprachservices an. Weitere Informationen zu allen unterstützten Speicherklassen finden Sie in den folgenden Abschnitten in Watson Speech-Services unter IBM Cloud Pak for Data:

  • Vorbereitende Schritte unter * Watson Speech-Services installieren*
  • Speicherklasse angeben in Angepasste Ressource für Watson Speech-Services verwenden
Bekanntes Problem: Einige Pods für Watson Speech-Services haben keine Annotationen, die für die Planung verwendet werden

Bekanntes Problem: Einigen Pods für Watson Speech-Services fehlt die Annotation cloudpakInstanceId. Wenn Sie den Zeitplanungsservice IBM Cloud Pak for Data verwenden, werden alle Watson Speech-Service-Pods ohne die Annotation cloudpakInstanceId

  • Vom Kubernetes-Standardscheduler und nicht vom Zeitplanungsservice geplant
  • Nicht in die Kontingenterzwingung einbezogen
Überwachung des PostgreSQL-Datenspeichers ist jetzt verfügbar

Sie können jetzt die Überwachung des PostgreSQL-Datenspeichers aktivieren, um Aktualisierungen zu seiner Nutzung und seinem Status durch die Watson Speech-Services zu erhalten. Die Ereignisse können von der Prometheus-Überwachungssoftware oder einer beliebigen Anwendung, die Sie für die Überwachung verwenden, verarbeitet werden. Durch Aktivieren der Überwachung für benutzerdefinierte Projekte zusätzlich zur Standardplattformüberwachung können Sie Ihre eigenen Projekte mit dem Überwachungsstack Red Hat® OpenShift® Container Platform überwachen. Diese Funktionalität umfasst die zusätzliche Eigenschaft spec.global.datastores.postgressql.enablePodMonitor in der angepassten Ressource für Speech-Services.

Weitere Informationen finden Sie unter * PostgreSQL-Datenspeicher für Watson Speech-Services überwachen* im Abschnitt Verwaltung unter Watson Speech-Services auf IBM Cloud Pak for Data.

Fehlerkorrektur: PostgreSQL-Datenspeicher ist nicht mehr installiert, wenn nur Laufzeitmikroservices aktiviert sind

Fehlerkorrektur: Der PostgreSQL-Datenspeicher ist nicht mehr installiert, wenn nur die Laufzeitmikroservices aktiviert sind. Der Datenspeicher ist jetzt nur dann installiert, wenn mindestens einer der Mikroservices sttAsync, sttCustomization oder ttsCustomization installiert ist. PostgreSQL wird nicht deinstalliert, wenn diese Mikroservices zu einem späteren Zeitpunkt inaktiviert werden.

Vor Version 4.6.0wurde PostgreSQL stets mit den Speech-Services installiert. Wenn Sie ein vorhandener Kunde sind, der nur die Laufzeitmikroservices der Speech-Services vor Version 4.6.0verwendet hat, bleibt PostgreSQL installiert, wird aber nicht verwendet. In diesem Fall bleibt die Installation von PostgreSQL bei Upgrades bestehen.

Der Datenspeicher MinIO wird immer installiert, da die Laufzeitmikroservices davon abhängig sind. Der RabbitMQ-Datenspeicher wird nur installiert, wenn der sttAsync-Mikroservice installiert ist.

Weitere Informationen finden Sie unter Datenspeichereigenschaften in Angepasste Ressource für Watson-Sprachservices verwenden in Watson-Sprachservices auf IBM Cloud Pak for Data.

Fehlerkorrektur: Die Erstellung einer Netzrichtlinie ist nicht mehr erforderlich, damit der Operator PostgreSQL seine Operanden überwacht.

Fehlerkorrektur: Für Version 4.6.0ist es nicht erforderlich, eine Netzrichtlinie zu erstellen, damit der Operator PostgreSQL seine Operanden überwachen kann, wie in der Serviceaktualisierung 10 November 2022(Versionen 4.0.x und 4.5.x) beschrieben. Ab Version 4.6.0behandelt der Service diese Situation automatisch.

Fehlerkorrektur: Einige Modelle der nächsten Generation wurden aktualisiert, um die Antwortzeit mit niedriger Latenz zu verbessern

Fehlerkorrektur: Die folgenden Modelle der nächsten Generation wurden aktualisiert, um ihre Antwortzeit zu verbessern, wenn der Parameter low_latency verwendet wird:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

Bisher haben diese Modelle Erkennungsergebnisse nicht so schnell wie erwartet zurückgegeben, als der Parameter low_latency verwendet wurde. Sie müssen keine angepassten Modelle aktualisieren, die auf diesen Modellen basieren. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Fehlerkorrektur: Dokumentation zur Benennung angepasster Modelle verbessern

Fehlerkorrektur: Die Dokumentation enthält jetzt detaillierte Regeln für die Benennung angepasster Sprachmodelle und angepasster Akustikmodelle. Weitere Informationen finden Sie

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

10. November 2022 (Versionen 4.0.x und 4.5.x)

Bekanntes Problem: Aktualisierte Netzrichtlinie für PostgreSQL-Operator erforderlich

Bekanntes Problem: Für Speech-Services der Version 4.0.x (ohne Version 4.0.0) und 4.5.xkann der Operator PostgreSQL die PostgreSQL-Operanden für die Speech-Services nicht überwachen, wenn der Operator PostgreSQL und die Speech-Services in verschiedenen Namensbereichen installiert sind. Der Operator wird daran gehindert, die Operanden durch die Netzrichtlinie zu überwachen, die für die Sprachservices vorhanden ist.

Dieses Problem verhindert nicht, dass der PostgreSQL-Cluster ordnungsgemäß funktioniert. Der Cluster bleibt aktiv und voll funktionsfähig. Der Operator kann die Operanden jedoch nicht aktualisieren, wenn Sie ein Upgrade auf neue Versionen der Speech-Services durchführen.

Die Lösung für das Problem besteht darin, eine zusätzliche Netzrichtlinie für den Operator PostgreSQL zu erstellen, wie in den folgenden Schritten gezeigt. Sie können die Schritte unabhängig davon ausführen, ob der Operator PostgreSQL in demselben Namensbereich wie die Speech-Services oder in einem anderen Namensbereich installiert ist.

  1. Melden Sie sich als Administrator des Red Hat® OpenShift®-Projekts an, in dem die Speech-Services installiert sind.

  2. Geben Sie den folgenden Befehl ein, um die Netzrichtlinie für die Speech-Services zu aktualisieren:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    wo

    • <custom-resource-name> ist der Name der angepassten Ressource für Speech-Services. Der empfohlene Name für Version 4.0.x ist speech-prod-cr; der empfohlene Name für Version 4.5.x ist speech-cr.
    • <cpd-instance-name> ist der Name des Projekts (Namespace), in dem die Sprachdienste installiert sind. Die Dokumentation verwendet die Umgebungsvariable ${PROJECT_CPD_INSTANCE}, um den Namensbereich zu identifizieren.
  3. Geben Sie den folgenden Befehl ein, um zu überprüfen, ob die aktualisierte Netzrichtlinie dem Bediener die Überwachung der Operanden ermöglicht und ob sich der PostgreSQL-Cluster in einwandfreiem Zustand befindet. Dabei sind <custom-resource-name> und <cpd-instance-name> die Werte, die Sie im vorherigen Schritt verwendet haben:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Wenn der PostgreSQL ordnungsgemäß funktioniert, erzeugt der Befehl eine Ausgabe ähnlich der folgenden:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Diese Schritte bewirken nicht, dass der Operator die Operanden auf die neuesten Versionen aktualisiert. Die Operanden werden jedoch wie erwartet aktualisiert, wenn Sie das nächste Upgrade für die Speech-Service-Software durchführen.

13. November 2022 (Version 4.5.3)

Version 4.5.3 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.5.3 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data 4.5.x und Red Hat OpenShift 4.6, 4.8, und 4.10. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Prüfereignisse sind für die Speech-Services verfügbar

Der Prüfprotokollierungsservice IBM Cloud Pak for Data generiert und leitet Prüfereignisse für die Services Speech to Text und Text to Speech weiter. Die Prüfereignisse stimmen mit denen überein, die für Activity Tracker mit dem öffentlichen Service verfügbar sind. Weitere Informationen finden Sie unter Prüfereignisse.

Sie können einzelne Speech-Service-Komponenten nicht deinstallieren

Die Dokumentation stellt jetzt fest, dass Sie einzelne Servicekomponenten (Mikroservices) nicht deinstallieren können, sobald sie installiert sind. Um eine der folgenden Komponenten zu entfernen, müssen Sie Watson vollständig deinstallieren und nur die benötigten Komponenten neu installieren: Speech to Text Runtime, Speech to Text asynchrones HTTP, Speech to Text Anpassung, Text to Speech Runtime und Text to Speech Anpassung. Weitere Informationen zur Installation der Sprachdienste finden Sie Watson auf IBM Cloud Pak for Data.

Neues französisches Multimediamodell der nächsten Generation in Kanada

Der Dienst bietet jetzt ein Multimediamodell der nächsten Generation für Französisch-Kanadier: fr-CA_Multimedia. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken. Weitere Informationen über Modelle der nächsten Generation und niedrige Latenzzeiten finden Sie unter

Updates für englische Telefoniemodelle der nächsten Generation

Die englischen Telefoniemodelle der nächsten Generation wurden für eine verbesserte Spracherkennung aktualisiert:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Alle diese Modelle unterstützen weiterhin niedrige Latenzzeiten. Sie müssen keine angepassten Modelle aktualisieren, die auf diesen Modellen basieren. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Italienisches Multimedia-Modell der nächsten Generation unterstützt jetzt niedrige Latenzzeiten

Das italienische Multimedia-Modell der nächsten Generation, it-IT_Multimedia, unterstützt jetzt eine geringe Latenz. Weitere Informationen über Modelle der nächsten Generation und niedrige Latenzzeiten finden Sie unter

Fehlerbehebung beim Upgrade von Version 4.0.x auf Version 4.5.x

Wenn Sie ein Upgrade der Speech-Services von Version 4.0.x auf Version 4.5.xdurchführen, tritt möglicherweise ein Problem auf, bei dem die PostgreSQL-Pods im Status Terminating blockiert werden. Wenn dieses Problem während des Upgrades auftritt, führen Sie die folgenden Schritte aus, um das Problem zu beheben: Die Informationen und Schritte sind auch im Abschnitt Upgrade von Watson Speech-Services von Version 4.0 auf Version 4.5 im Abschnitt Upgrade durchführen unter Watson Speech-Services auf IBM Cloud Pak for Datadokumentiert.

  1. Verwenden Sie den folgenden Befehl, um Pods zu identifizieren, die im Status Terminating verbleiben:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Verwenden Sie den folgenden Befehl, um die Umgebungsvariable pods festzulegen, um die Liste der Pods einzuschließen, die im Status Terminating verbleiben:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'})
  1. Verwenden Sie den folgenden Befehl, um die blockierten Pods zu löschen, damit der Upgradeprozess fortgesetzt werden kann:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
Fehlerkorrektur: Dokumentation zu Einträgen für angepasste Ressourcen korrigieren

Fehlerkorrektur: Die Dokumentation für die angepasste Ressource für Speech-Services enthält jetzt Doppelpunkte nach den Namen der Modelle koKrTelephony und nlNlTelephony. Bisher wurden die Doppelpunkte in der Dokumentation für diese beiden Einträge übergangen.

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

19. August 2022 (Version 4.5.1)

Wichtig: Das Datum der Einstellung der Unterstützung für die meisten Modelle der Vorgängergeneration ist jetzt der 3 März 2023.

Ersetzt: Diese Benachrichtigung über veraltete Features wird durch die Serviceaktualisierung vom 23 Februar 2023 ersetzt. Das Enddatum des Servicezeitraums für alle Modelle der vorherigen Generation ist jetzt 31. Juli 2023.

Am 15. März 2022 wurden die Modelle der vorherigen Generation für alle Sprachen außer Arabisch und Japanisch abgeschafft. Zu diesem Zeitpunkt sollten die veralteten Modelle bis zum 15. September 2022 verfügbar bleiben. Damit Benutzer mehr Zeit für die Migration auf die entsprechenden Modelle der nächsten Generation haben, bleiben die veralteten Modelle bis 3. März 2023 verfügbar. Wie beim ersten Hinweis zu veralteten Versionen sind die arabischen und japanischen Modelle der vorherigen Generation nicht veraltet. Eine vollständige Liste aller veralteten Modelle finden Sie unter 15. März 2022(Version 4.0.6)service update.

Am 3. März 2023 werden die veralteten Modelle aus dem Service und der Dokumentation entfernt. Wenn Sie eines der veralteten Modelle verwenden, müssen Sie bis zum 3. März 2023 auf das entsprechende Modell der nächsten Generation umsteigen.

Hinweis: Wenn die vorherige Generation en-US_BroadbandModel außer Betrieb genommen wird, wird das Modell der nächsten Generation en-US_Multimedia das Standardmodell für Spracherkennungsanfragen.

3. August 2022 (Version 4.5.1)

Version 4.5.1 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.5.1 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data 4.5.x und Red Hat OpenShift 4.6, 4.8, und 4.10. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Unterstützung für FIPS-aktivierte Cluster

Speech to Text für IBM Cloud Pak for Data und Text to Speech für IBM Cloud Pak for Data unterstützen jetzt die Ausführung auf Clustern mit aktiviertem Federal Information Processing Standard (FIPS). Weitere Informationen finden Sie unter Services, die FIPS unterstützen.

Fehlerkorrektur: Ephemere Speicherberechnungen korrigieren, um gelegentliche Podbereinigungen zu verhindern

Fehlerkorrektur: Ein Fehler wurde behoben und die Berechnung von ephemeren Speichergrenzwerten ist jetzt präziser für Speech to Text für IBM Cloud Pak for Data und Text to Speech für IBM Cloud Pak for Data-Laufzeiten. Diese Änderungen verhindern gelegentliche Podbereinigungen, wenn die Laufzeiten der Services stark ausgelastet sind.

Fehlerkorrektur: Aktualisieren Sie die Dokumentation für Sprachzögerungen und Stockungsmarkierungen.

Fehlerbehebung: Die Dokumentation für Sprachzögerungen und Zögerungsmarker wurde aktualisiert. Modelle der vorherigen Generation enthalten Hesitation-Marker anstelle von Sprachzögerungen in Transkriptionsergebnissen für die meisten Sprachen; die intelligente Formatierung entfernt Hesitation-Marker aus finalen Transkripten in amerikanischem Englisch. Modelle der nächsten Generation enthalten die tatsächlichen Sprachzögernisse in Transkriptionsergebnissen. Die intelligente Formatierung hat keinen Einfluss auf ihre Einbeziehung in endgültige Transkriptionsergebnisse.

Weitere Informationen finden Sie unter:

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

29. Juni 2022 (Versionen 4.5.0)

Version 4.5.0 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.5.0 ist jetzt verfügbar. Diese Version unterstützt die Versionen IBM Cloud Pak for Data 4.5.x und Red Hat OpenShift 4.6, 4.8, und 4.10. Weitere Informationen finden Sie unter Watson Sprachdienste auf IBM Cloud Pak for Data.

Dokumentation zu Unified Speech-Services für IBM Cloud Pak for Data

Die Installations-und Verwaltungsdokumentation für Speech to Text und Text to Speech ist jetzt in der Dokumentation IBM Cloud Pak for Data kombiniert. Weitere Informationen zur Installation und Verwaltung der Speech-Services finden Sie unter Watson Speech-Services unter IBM Cloud Pak for Data.

Änderungen an angepassten Ressourcen für Speech-Services

Die angepasste Ressource wird jetzt bei der Erstinstallation der Speech-Services erstellt. Der Prozess wird in der Installationsdokumentation zu IBM Cloud Pak for Data beschrieben. Der Inhalt der angepassten Ressource hat sich geändert:

  • Der empfohlene Name der angepassten Ressource wurde von speech-prod-cr in speech-cr geändert.
  • Alle Verweise auf Speicherklassen wurden von Varianten von storageClass in blockStorageClass geändert.
  • Der Name der Blockspeicherklasse Portworx wurde von portworx-shared-gp3 in portworx-db-gp3-sc geändert.
  • Die Eigenschaft createSecret wurde für die Datenspeicher MinIO und PostgreSQl entfernt. Die Eigenschaft wird nur intern verwendet. Die Speech-Services verwenden immer ein Objekt für geheime Schlüssel, wenn Sie eines erstellen, und sie erstellen das Objekt immer automatisch, wenn kein Objekt angegeben ist.
Vom Benutzer bereitgestelltes Objekt für geheime Schlüssel wird jetzt für RabbitMQ-Datenspeicher unterstützt

Sie können jetzt Sicherheitsberechtigungsnachweise für den RabbitMQ-Datenspeicher wie für die Datenspeicher MinIO und PostgreSQL bereitstellen. Der dokumentierte Prozess ist für alle drei Datenspeicher ähnlich.

Neues italienisches it-IT_Multimedia-Modell der nächsten Generation

Der Service bietet jetzt ein Multimediamodell der nächsten Generation für Italienisch: it-IT_Multimedia. Das neue Modell ist allgemein verfügbar. Es unterstützt keine geringe Latenzzeit, aber es unterstützt die Sprachmodellanpassung und Grammatiken. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Aktualisierte koreanische Telefonie- und Multimediamodelle der nächsten Generation

Die bestehenden koreanischen Modelle der nächsten Generation wurden aktualisiert:

  • Das Modell ko-KR_Telephony wurde aktualisiert, um die Unterstützung für Spracherkennung mit geringer Latenzzeit zu verbessern.
  • Das Modell ko-KR_Multimedia wurde aktualisiert, um die Spracherkennung zu verbessern. Das Modell unterstützt jetzt auch geringe Latenzzeiten.

Beide Modelle sind allgemein verfügbar und unterstützen die Anpassung von Sprachmodellen und Grammatiken. Sie müssen keine angepassten Sprachmodelle aktualisieren, die auf diesen Modellen basieren. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Updates für mehrere Telefoniemodelle der nächsten Generation

Die folgenden englischsprachigen Telefoniemodelle der nächsten Generation wurden für eine verbesserte Spracherkennung aktualisiert:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Sie müssen keine angepassten Modelle aktualisieren, die auf diesen Modellen basieren. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Fehlerkorrektur: Verlässlichkeitsscores werden jetzt für alle Transkriptionsergebnisse gemeldet

Fehlerkorrektur: Verlässlichkeitsscores werden jetzt für alle Transkriptionsergebnisse gemeldet. Wenn der Service bisher mehrere Transkripte für eine einzelne Spracherkennungsanforderung zurückgegeben hat, wurden möglicherweise nicht für alle Transkripte Verlässlichkeitsscores zurückgegeben.

Behobene Sicherheitslücken

Für Version 4.5.0wurden keine Sicherheitslücken behoben.

25. Mai 2022 (Version 4.0.9)

Version 4.0.9 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.9 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Neues pt-BR_Multimedia Modell der nächsten Generation in Portugiesisch (Brasilien)

Der Service bietet jetzt ein Multimediamodell der nächsten Generation für Portugiesisch (Brasilien): pt-BR_Multimedia. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken. Weitere Informationen zu den Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in den folgenden Abschnitten:

Aktualisierung des deutschen de-DE_Multimedia-Modells der nächsten Generation zur Unterstützung geringer Latenzzeiten

Das deutsche Modell de-DE_Multimedia der nächsten Generation unterstützt jetzt geringe Latenzzeit. Sie müssen keine angepassten Modelle aktualisieren, die auf dem aktualisierten deutschen Basismodell basieren. Weitere Informationen zu den Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in den folgenden Abschnitten:

Neuer Betaparameter character_insertion_bias für Modelle der nächsten Generation

Alle Modelle der nächsten Generation unterstützen jetzt den neuen Betaparameter character_insertion_bias, der mit allen Spracherkennungsschnittstellen verfügbar ist. Standardmäßig wird der Service für jedes einzelne Modell optimiert, um die Erkennung von potenziellen Zeichenfolgen unterschiedlicher Längen auszugleichen. Die modellspezifische Abweichung entspricht 0,0. Die Standardabweichung jedes Modells ist für die meisten Spracherkennungsanforderungen ausreichend.

Für bestimmte Anwendungsfälle ist jedoch die Bevorzugung von Hypothesen mit kürzeren oder längeren Zeichenfolgen von Vorteil. Der Parameter akzeptiert Werte zwischen -1,0 und 1,0, die eine Änderung des Standardwerts eines Modells darstellen. Negative Werte weisen den Service an, kürzere Zeichenfolgen zu bevorzugen. Positive Werte weisen den Service an, längere Zeichenfolgen zu bevorzugen. Weitere Informationen finden Sie unter Zeicheneinfügeabweichung.

Die Speech-Services unterstützen das Sicherungs- und Wiederherstellungsdienstprogramm von OADP nicht.

Watson Sprachservices unterstützen das Sicherungs- und Wiederherstellungsdienstprogramm von IBM Cloud Pak for Data OpenShift APIs for Data Protection (OADP) nicht. Wenn die Speech-Services auf einem Cluster installiert sind, können Sie möglicherweise nicht das IBM Cloud Pak for Data OADP-Sicherungs-und Wiederherstellungsdienstprogramm verwenden, um andere Services zu sichern, die auf diesem Cluster installiert sind. Diese Einschränkung gilt für Version 4.0.0 und höhere Versionen der Speech-Services.

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

1. Mai 2022 (Version 1.2.x)

Wichtig: Ende des Servicezeitraums für Speech to Text Version 1.2.x unter IBM Cloud Pak for Data Version 3.5
Wichtig: Speech to Text Version 1.2.x unter IBM Cloud Pak for Data Version 3.5 ist ab dem 1. Mai 2022 außer Betrieb. Die Speech to Text Version 1.2.x wird nicht mehr unterstützt, ist nicht mehr verfügbar oder wird nicht mehr dokumentiert. Weitere Informationen zum Ende des Servicezeitraums für Speech to Text, das Teil des Watson API-Kits ist, finden Sie unter Ende der Softwareunterstützung: IBM Watson API Kit for IBM Cloud Pak for Data 1.2.x.

27. April 2022 (Version 4.0.8)

Version 4.0.8 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.8 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Neue in der IBM Cloud Pak for Data-Dokumentation verwendete Umgebungsvariablen

Die meisten Befehle in der Dokumentation zu Speech to Text for IBM Cloud Pak for Data wurden aktualisiert und verwenden nun eine allgemeine Gruppe von Umgebungsvariablen. Die Dokumentation enthält ein Script zum automatischen Exportieren der Umgebungsvariablen, bevor Sie Installations-, Upgrade- und Verwaltungsbefehle ausführen. Nachdem Sie das Script als Quelle angegeben haben, können Sie die meisten Befehle aus der Dokumentation kopieren und ohne Änderungen ausführen.

Das Script definiert die folgenden Umgebungsvariablen:

  • ${PROJECT_CPD_INSTANCE} gibt das Projekt an, in dem Sie IBM Cloud Pak for Data und die Speech-Services installieren wollen.
  • ${PROJECT_CPD_OPS} gibt das Projekt für den IBM Cloud Pak for Data-Plattformoperator an.
  • ${PROJECT_CPFS_OPS} gibt das Projekt für die IBM Cloud Pak for Data-Basisservices an.

Weitere Informationen zur Verwendung der Umgebungsvariablen finden Sie unter Best Practice: Installationsvariablen einrichten.

Die Eigenschaft ttsVoiceMarginalCPU ist nicht mehr dokumentiert

Die Eigenschaft ttsVoiceMarginalCPU wurde aus der Dokumentation für die angepasste Ressource für Speech-Services entfernt. Die Eigenschaft verwaltet den Kompromiss zwischen Nebenläufigkeit und Sprachsynthesegeschwindigkeit. Der Standardwert 400 stellt für die meisten Kunden ein angemessenes Gleichgewicht sicher und verwaltet die Echtzeitsynthese.

Neues Multimediamodell der nächsten Generation für Deutsch

Der Service stellt jetzt ein Multimediamodell der nächsten Generation für Deutsch bereit: de-DE_Multimedia. Das neue Modell ist allgemein verfügbar. Das Modell unterstützt geringe Latenzzeit nicht. Es unterstützt die Sprachmodellanpassung und Grammatiken als allgemein verfügbare Funktionalität.

Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation und der zugehörigen Anpassungsunterstützung finden Sie in den folgenden Abschnitten:

Das als Betafunktion bereitgestellte Modell en-WW_Medical_Telephony der nächsten Generation unterstützt jetzt geringe Latenzzeit

Das als Betafunktion bereitgestellte Modell en-WW_Medical_Telephony der nächsten Generation unterstützt jetzt geringe Latenzzeit. Weitere Informationen zu allen Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in den folgenden Abschnitten:

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

8. April 2022 (Version 4.0.7)

Unterstützung für gleich klingende Modelle ist jetzt für angepasste Modelle auf der Basis von Modellen der nächsten Generation dokumentiert

Für angepasste Sprachmodelle, die auf Modellen der nächsten Generation basieren, ist jetzt die Unterstützung für gleich klingende Spezifikationen für angepasste Wörter dokumentiert. Unterstützung für gleich klingende Spezifikationen gibt es seit Ende 2021.

Es gibt Unterschiede zwischen der Verwendung des Felds sounds_like für angepasste Modelle, die auf Modellen der nächsten Generation und Modellen der vorherigen Generation basieren. Weitere Informationen zur Verwendung des Felds sounds_like mit angepassten Modellen, die auf Modellen der nächsten Generation basieren, finden Sie unter Mit angepassten Wörtern für Modelle der nächsten Generation arbeiten.

Wichtig: Veralteter Parameter customization_id wurde aus der Dokumentation entfernt

Wichtig: Am 9. Oktober 2018 endete die Unterstützung des Parameters customization_id aller Spracherkennungsanforderungen. Er wurde durch den Parameter language_customization_id ersetzt. Der Parameter customization_id wurde aus der Dokumentation für die Spracherkennungsmethoden entfernt:

  • /v1/recognize für WebSocket-Anforderungen
  • POST /v1/recognize für synchrone HTTP-Anforderungen (einschließlich mehrteiliger Anforderungen)
  • POST /v1/recognitions für asynchrone HTTP-Anforderungen

Anmerkung: Wenn Sie die Watson-SDKs verwenden, müssen Sie sicherstellen, dass die Anwendungscodes aktualisiert sind, sodass der Parameter language_customization_id anstelle des Parameters customization_id verwendet wird. Der Parameter customization_id ist ab dem nächsten Hauptrelease nicht mehr über die entsprechenden Methoden der SDKs verfügbar. Weitere Informationen zu den Spracherkennungsmethoden finden Sie in der API-und SDK-Referenz.

30. März 2022 (Version 4.0.7)

Version 4.0.7 ist jetzt verfügbar

Speech to Text für IBM Cloud Pak for Data Version 4.0.7 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Angepasste Ressourceneigenschaft zur Angabe eines Standardmodells

Die Standardstimme für Spracherkennungsanforderungen ist en-US_BroadbandModel. Wenn Sie en-US_BroadbandModel nicht installieren, müssen Sie entweder

  • Mit dem Parameter model die Stimme übergeben, die für jede Anforderung verwendet werden soll.
  • Mithilfe der Eigenschaft defaultSTTModel in der angepassten Ressource für Speech-Services ein neues Standardmodell für Ihre Installation von Speech to Text for IBM Cloud Pak for Data angeben. Weitere Informationen finden Sie unter Watson Speech to Text und Standardmodell verwenden.
Aktualisierungen der englischen und französischen Multimediamodelle der nächsten Generation zur Unterstützung für geringe Latenzzeit

Die folgenden Multimediamodelle wurden aktualisiert, um geringe Latenzzeit zu unterstützen:

  • Englisch (Australien): en-AU_Multimedia
  • Englisch (Vereinigtes Königreich): en-GB_Multimedia
  • Englisch (Vereinige Staaten): en-US_Multimedia
  • Französisch:fr-FR_Multimedia

Sie müssen kein Upgrade für angepasste Sprachmodelle durchführen, die auf diesen Basismodellen basieren. Weitere Informationen zu den Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in den folgenden Abschnitten:

Neues Multimediamodell der nächsten Generation für kastilisches Spanisch

Der Service stellt jetzt ein Multimediamodell der nächsten Generation für kastilisches Spanisch bereit: es-ES_Multimedia. Das neue Modell unterstützt geringe Latenzzeit und ist allgemein verfügbar. Es unterstützt auch die Sprachmodellanpassung und Grammatiken.

Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation und der zugehörigen Anpassungsunterstützung finden Sie in den folgenden Abschnitten:

Das en-WW_Medical_Telephony-Modell der nächsten Beta-Generation unterstützt jetzt die intelligente Formatierung

Das en-WW_Medical_Telephony-Modell der nächsten Beta-Generation unterstützt jetzt den Parameter smart_formatting für Audio in amerikanischem Englisch. Weitere Informationen zu allen Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken wurden behoben:

17. März 2022 (Version 4.0.6)

Grammatikunterstützung für Modelle der nächsten Generation ist jetzt allgemein verfügbar

Grammatikunterstützung ist jetzt allgemein verfügbar (General Availability, GA) für Modelle der nächsten Generation, die die folgenden Bedingungen erfüllen:

  • Die Modelle sind allgemein verfügbar.
  • Die Modelle unterstützen die Sprachmodellanpassung.

Weitere Informationen finden Sie in den folgenden Quellen:

15. März 2022 (Version 4.0.6)

Wichtig: Die meisten Modelle der vorherigen Generation werden nicht mehr unterstützt.

Ersetzt: Diese Benachrichtigung über veraltete Features wird durch die Serviceaktualisierung vom 23 Februar 2023 ersetzt. Das Enddatum des Servicezeitraums für alle Modelle der vorherigen Generation ist jetzt 31. Juli 2023.

Seit dem 15. März 2022 werden Modelle der vorherigen Generation für alle Sprachen außer Arabisch und Japanisch nicht mehr verwendet. Die veralteten Modelle bleiben bis zum 15. September 2022 verfügbar und werden danach aus dem Service und der Dokumentation entfernt. Die arabischen und japanischen Modelle der vorherigen Generation sind nicht veraltet.

Die folgenden Modelle der vorherigen Generation sind jetzt veraltet:

  • Chinesisch (Mandarin): zh-CN_NarrowbandModel und zh-CN_BroadbandModel
  • Niederländisch (Niederlande): nl-NL_NarrowbandModel und nl-NL_BroadbandModel
  • Englisch (Australien): en-AU_NarrowbandModel und en-AU_BroadbandModel
  • Englisch (Vereinigtes Königreich): en-UK_NarrowbandModel und en-UK_BroadbandModel
  • Englisch (Vereinigte Staaten): en-US_NarrowbandModel, en-US_BroadbandModel und en-US_ShortForm_NarrowbandModel
  • Französisch (Kanada): fr-CA_NarrowbandModel und fr-CA_BroadbandModel
  • Französisch (Frankreich): fr-FR_NarrowbandModel und fr-FR_BroadbandModel
  • Deutsch: de-DE_NarrowbandModel und de-DE_BroadbandModel
  • Italienisch: it-IT_NarrowbandModel und it_IT_BroadbandModel
  • Koreanisch: ko-KR_NarrowbandModel und ko-KR_BroadbandModel
  • Portugiesisch (Brasilien): pt-BR_NarrowbandModel und pt-BR_BroadbandModel
  • Spanisch (Argentinien): es-AR_NarrowbandModel und es-AR_BroadbandModel
  • Spanisch (Kastilien): es-ES_NarrowbandModel und es-ES_BroadbandModel
  • Spanisch (Chile): es-CL_NarrowbandModel und es-CL_BroadbandModel
  • Spanisch (Kolumbien): es-CO_NarrowbandModel und es-CO_BroadbandModel
  • Spanisch (Mexiko): es-MX_NarrowbandModel und es-MX_BroadbandModel
  • Spanisch (Peru): es-PE_NarrowbandModel und es-PE_BroadbandModel

Wenn Sie eines dieser veralteten Modelle verwenden, müssen Sie bis zum Ende des Servicezeitraums auf das entsprechende Modell der nächsten Generation migrieren.

Hinweis: Der Servicezeitraum für das Modell en-US_BroadbandModel der vorherigen Generation endet am 15. September und das Modell en-US_Multimedia der nächsten Generation wird damit zum Standardmodell für Spracherkennungsanforderungen.

Modelle der nächsten Generation unterstützen jetzt Parameter für die Audioanalyse

Alle Modelle der nächsten Generation unterstützen jetzt die folgenden Parameter für Audioanalyse als allgemein verfügbare Funktionen:

  • end_of_phrase_silence_time gibt die Dauer des Pausenintervalls an, nach dem der Service ein Transkript in mehrere Endergebnisse aufteilt. Weitere Informationen finden Sie im Abschnitt Sprechpausenzeit nach Ausdrucksende.
  • split_transcript_at_phrase_end weist den Service an, das Transkript basierend auf semantischen Merkmalen der Eingabe in mehrere Endergebnisse aufzuteilen. Weitere Informationen finden Sie im Abschnitt Transkription nach Ausdrucksende aufteilen.
Defekt behoben: Korrekte Dokumentation der Lautsprecherbeschriftung

Fehlerkorrektur: Die Dokumentation für Sprecherbezeichnungen enthielt an mehreren Stellen den folgenden falschen Hinweis: Bei Modellen der nächsten Generation werden Sprecherbezeichnungen für die Verwendung mit Zwischenergebnissen oder geringer Latenzzeit nicht unterstützt. Die Verwendung von Sprecherbezeichnungen mit Zwischenergebnissen und niedriger Latenz für Modelle der nächsten Generation wird unterstützt. Weitere Informationen finden Sie im Abschnitt Sprecherbezeichnungen.

23. Februar 2022 (Version 4.0.6)

Version 4.0.6 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.6 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Aktualisierungen für Scripts für Import und Export

Die Scripts import_export.sh und transfer_ownership.sh wurden aktualisiert. Diese Scripts werden zum Importieren und Exportieren von Daten zwischen Clustern, zum Sichern und Wiederherstellen von Daten und zum Migrieren von Daten von Version 3.5 auf Version 4.0.x verwendet. Die Scripts wurden wie folgt geändert und verbessert:

  • Beim Script transfer_ownership.sh muss die Option -c in der Befehlszeile jetzt vor dem Argument <custom_resource_name> angegeben werden.
  • Das Script transfer_ownership.sh erfordert jetzt die Option -v <version> und ein Argument für die Angabe der Version, auf die das Eigentumsrecht an Ressourcen übertragen wird. Geben Sie 35 für Version 3.5 oder 40 für Version 4.0.x an.
  • Beim Script transfer_ownership.sh muss die Option -p in der Befehlszeile jetzt vor dem Argument <postgres_auth_secret_name> angegeben werden.
  • Das Argument <postgres_auth_secret_name> gibt den geheimen Kubernetes-Schlüssel an, der für die Authentifizierung bei dem PostgreSQL-Datenspeicher verwendet wird, an den Sie das Eigentumsrecht übertragen. Sie können den geheimen Authentifizierungsschlüssel auslassen, wenn er dem Standardwert entspricht (<custom-resource-name>-postgres-auth-secret für Version 4.0.x, user-provided-postgressql für Version 3.5). Sie müssen den geheimen Schlüssel angeben, wenn er sich vom Standardwert unterscheidet.
  • Beide Scripts enthalten jetzt die Option -h (--help), mit der Informationen zum Script und zu dessen Verwendung angezeigt werden können.

Weitere Informationen finden Sie

Aktualisierte Empfehlung für OpenShift Container Storage

Ab Version 4.0.6 der Speech-Services ist die empfohlene Speicherklasse für OpenShift Container Storage die Klasse ocs-storagecluster-ceph-rbd.

  • Wenn Sie Version 4.0.6 der Speech-Services oder ein Upgrade auf Version 4.0.6 der Speech-Services von IBM Cloud Pak for Data Version 3.5 durchführen, geben Sie bei der Installation bzw. bei dem Upgrade die Speicherklasse ocs-storagecluster-ceph-rbd an.
  • Wenn Sie ein Upgrade auf Version 4.0.6 der Speech-Services von einer vorherigen Aktualisierung von Cloud Pak for Data Version 4.0 durchführen, verwenden Sie weiterhin ocs-storagecluster-cephfs. Sie können den Speicher, der in einer vorhandenen Implementierung verwendet wird, nicht ändern.

Der Wert wird mit der Eigenschaft storageClass in der angepassten Speech-Serviceressource angegeben.

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

Die Speech-Services können mit beiden Versionen von OpenShift Container Storage ausgeführt werden. Die neu empfohlene Version hat restriktivere Zugriffsberechtigungen. Weitere Informationen finden Sie

Neues Modell en-WW_Medical_Telephony jetzt als Betafunktion verfügbar

Eine neues Modell en-WW_Medical_Telephony der nächsten Generation ist jetzt als Betafunktion verfügbar. Das neue Modell erkennt Begriffe aus den Fachgebieten Medizin und Pharmakologie. Verwenden Sie das Modell zum Transkribieren allgemeiner medizinischer Terminologie wie Namen von Medikamenten, Produktmarken, medizinische Behandlungen, Krankheiten, Arzttypen oder COVID 19--Terminologie. Häufige Anwendungsfälle sind Gespräche zwischen einem Patienten und einem medizinischen Versorger (z. B. Arzt, Krankenschwester oder Apotheker).

Das neue Modell wird aus der angepassten Ressource für Speech-Services installiert, wenn enWwMedicalTelephony auf enabled: true gesetzt wird. Das Modell ist für alle unterstützten englischen Dialekte verfügbar: Australien, Indien, Vereinigtes Königreich und Vereinigte Staaten.

  • Das Modell unterstützt die Sprachmodellanpassung und Grammatiken als Betafunktionen.
  • Es unterstützt überwiegend die gleichen Parameter wie das Modell en-US_Telephony.
  • Die folgenden Parameter werden nicht unterstützt: low_latency, profanity_filter, redaction und speaker_labels.
  • Derzeit wird smart_formatting for IBM Cloud Pak for Data nicht unterstützt.

Weitere Informationen finden Sie unter Das englische Telefoniemodell für Medizin.

Aktualisierung des Modells zh-CN_Telephony für Chinesisch

Das Modell der nächsten Generation zh-CN_Telephony für Chinesisch wurde aktualisiert, um die Spracherkennung zu verbessern. Das Modell unterstützt weiterhin geringe Latenzzeit. Standardmäßig verwendet der Service automatisch das aktualisierte Modell für alle Spracherkennungsanforderungen. Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Wenn Sie über angepasste Sprachmodelle verfügen, die auf dem aktualisierten Modell basieren, müssen Sie Ihre vorhandenen angepassten Modelle aktualisieren, um die Vorteile der Aktualisierungen mithilfe der Methode POST /v1/customizations/{customization_id}/upgrade_model nutzen zu können. Weitere Informationen finden Sie im Abschnitt Upgrade für angepasste Modelle durchführen.

Aktualisierung des Modells ja-JP_Multimedia für Japanisch, um geringe Latenzzeit zu unterstützen

Das japanische Modell ja-JP_Multimedia der nächsten Generation unterstützt jetzt geringe Latenzzeit. Sie können den Parameter low_latency in Spracherkennungsanforderungen angeben, die das Modell verwenden. Sie müssen kein Upgrade für angepasste Modelle durchführen, die auf dem aktualisierten Basismodell für Japanisch basieren. Weitere Informationen zu den Modellen der nächsten Generation und zu geringen Latenzzeiten finden Sie unter Sprachen und Modelle der nächsten Generation und Geringe Latenzzeit.

11. Februar 2022 (Version 4.0.5)

Defekt behoben: Verbesserung der Dokumentation zum Upgrade des benutzerdefinierten Modells und der Basismodellversion

Fehlerkorrektur: Die Beschreibung für das Upgrade angepasster Modelle und die Versionszeichenfolgen für verschiedene Versionen der Basismodelle in der Dokumentation wurden aktualisiert. In der Dokumentation wird jetzt angegeben, dass das Upgrade für die Sprachmodellanpassung auch für Modelle der nächsten Generation gilt. Außerdem wurden die Versionszeichenfolgen für verschiedene Versionen der Basismodelle aktualisiert. Der Parameter base_model_version kann auch für Modelle der nächsten Generation verwendet werden, für die ein Upgrade durchgeführt wurde.

Weitere Informationen zum Upgrade für angepasste Modelle, wann ein Upgrade erforderlich ist und wie Vorgängerversionen angepasster Modelle verwendet werden, finden Sie in den folgenden Abschnitten:

Defekt behoben: Aktualisierung der Dokumentation zur Großschreibung

Fehlerkorrektur: In der Dokumentation wurde die Beschreibung der automatischen Groß-/Kleinschreibung in Transkripten des Service aktualisiert. Der Service verwendet die Großschreibung der entsprechenden Nomen nur für die folgenden Sprachen und Modelle:

  • Alle Modelle der früheren Generation für amerikanisches Englisch
  • Das Modell der nächsten Generation für Deutsch

Weitere Informationen finden Sie unter Groß-/Kleinschreibung.

31. Januar 2022 (Version 4.0.5)

Version 4.0.5 wurde aktualisiert

Speech to Text for IBM Cloud Pak for Data Version 4.0.5 wurde aktualisiert, um Installationsprobleme zu beheben. Die Fallpaketversion lautet jetzt 4.0.6. Verwenden Sie dieses Paket anstelle des Pakets der Version 4.0.5. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Wichtig: Zusätzliche Schritte für die gespiegelte Installation sind nicht mehr erforderlich

Wichtig: Die Releaseinformationen vom 26. Januar 2022 enthalten wichtige Hinweise für die folgenden Schritte:

  • Zusätzlicher Schritt zur Ausführung einer gespiegelten Installation des Minio-Datenspeichers
  • Zusätzliche Schritte für eine gespiegelte Installation neuer Modelle der nächsten Generation

Diese zusätzlichen Schritte sind nicht mehr erforderlich. Das Fallpaket wurde aktualisiert, um die Installationsprobleme zu beheben.

26. Januar 2022 (Version 4.0.5)

Version 4.0.5 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.5 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Wichtig: Zusätzliche Schritte für die Ausführung einer gespiegelten Installation des Minio-Datenspeichers

Wichtig: Diese Schritte sind nicht mehr erforderlich, wenn Sie Version 4.0.6 des Fallpakets installieren. Für weitere Informationen siehe 31. Januar 2022(Version 4.0.5).

Wenn Sie eine gespiegelte Installation durchführen (z. B. in einer durch Air-Gap geschützten Umgebung), müssen Sie vor dem Ausführen eines der folgenden Schritte einen zusätzlichen Schritt ausführen:

Dieser Schritt ist obligatorisch, um die erforderlichen Images für den Minio-Datenspeicher zu kopieren:

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

Wenn dieser Schritt nicht ausgeführt wird, werden Installationsfehler für Speech to Text und Text to Speech verursacht.

Wichtig: Zusätzliche Schritte für die Durchführung einer gespiegelten Installation für neue Modelle der nächsten Generation

Wichtig: Diese Schritte sind nicht mehr erforderlich, wenn Sie Version 4.0.6 des Fallpakets installieren. Für weitere Informationen siehe 31. Januar 2022(Version 4.0.5).

Wenn Sie eine gespiegelte Installation durchführen (z. B. für eine Airgap-Umgebung) und beliebige der neuen Modelle der nächsten Generation für Speech to Text installieren möchten (weitere Angaben enthalten die nachfolgenden Releaseinformationen), ist ein zusätzlicher Schritt erforderlich, bevor Sie einen der folgenden Schritte ausführen:

Jeder zusätzliche Schritt ist für das zu installierende Modell eindeutig. Wenn Sie mehrere der neuen Modelle installieren möchten, setzen Sie den angegebenen Befehl für jedes zu installierende Modell ab.

  • Telefoniemodell für Chinesisch (zh-CN_Telephony):

    echo 'cp.icr.io,cp/watson-speech/zh-cn-telephony,2022-01-05-405models,sha256:52af6dfccd64ccd81b409936442a51a71f4ee96d980e1fc6a343a05bd4ed7fbc,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Telefoniemodell für lateinamerikanisches Spanisch (es-LA_Telephony):

    echo 'cp.icr.io,cp/watson-speech/es-la-telephony,2022-01-05-405models,sha256:58e8c04abe9659472e89bf0778b7dc66e0ddceb4ea18d9d3e048a08c72125ea2,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Multimediamodell für australisches Englisch (en-AU_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-au-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Multimediamodell für britisches Englisch (en-GB_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-gb-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
Der Lizenzserver wird jetzt automatisch installiert

Vom Operator der Speech-Services wird bei der Installation der Speech-Services jetzt automatisch der erforderliche Lizenzserver installiert. Sie müssen den Lizenzserver nicht mehr über die Basisservices von IBM Cloud Pak for Data installieren und keinen zusätzlichen YAML-Inhalt mehr verwenden, um eine OperandRequest-Instanz mit den erforderlichen Bindungen zu erstellen.

Für PostgreSQL EnterpriseDB-Server erforderliche Schritte entfallen

Die Vorgängerversion der Dokumentation enthielt für die Speech-Services spezifische Schritte für den PostgreSQL EnterpriseDB-Server. Diese Schritte waren in den Abschnitten Upgrade für Watson Speech to Text durchführen (Version 4.0) und Watson Speech to Text deinstallieren dokumentiert. Diese zusätzlichen Schritte sind nicht mehr erforderlich und wurden aus der Dokumentation entfernt.

RabbitMQ-Datenspeicher wird jetzt nur von der Komponente sttAsync verwendet

Der RabbitMQ-Datenspeicher wurde zuvor von Komponenten beider Speech-Services Speech to Text und Text to Speech verwendet. Jetzt erfolgt ein Einsatz nur noch für die Steuerung nicht persistenter Nachrichtenwarteschlangen für die asynchrone HTTP-Komponente von Speech to Text (sttAsync). Der Datenspeicher wird nur verwendet, wenn die Komponente sttAsync installiert und aktiviert ist.

Neue Modelle der nächsten Generation

Der Service unterstützt jetzt die folgenden Modelle der nächsten Generation mit Speech to Text for IBM Cloud Pak for Data:

  • Telefoniemodell für Chinesisch (Mandarin) - zh-CN_Telephony. Das neue Modell unterstützt geringe Latenzzeiten.
  • Multimediamodell für Englisch (Australien) - en-AU_Multimedia. Das neue Modell bietet keine Unterstützung für geringe Latenzzeiten.
  • Multimediamodell für Englisch (Vereinigtes Königreich) - en-GB_Multimedia. Das neue Modell bietet keine Unterstützung für geringe Latenzzeiten.
  • Telefoniemodell für Spanisch (Lateinamerika) - es-LA_Telephony. Das neue Modell unterstützt niedrige Latenzzeiten.

Hinweis: Das Modell für lateinamerikanisches Spanisch, es-LA_Telephony, gilt für alle lateinamerikanischen Dialekte. Es entspricht den Modellen der vorherigen Generation, die für spanische Dialekte in Argentinien, Chile, Kolumbien, Mexiko und Peru verfügbar sind. Wenn Sie ein Modell der vorherigen Generation für einen dieser Dialekte verwendet haben, verwenden Sie das Modell es-LA_Telephony für die Migration auf das entsprechende Modell der nächsten Generation.

Die neuen Modelle sind für die Spracherkennung allgemein verfügbar. Sie sind für die Sprachmodellanpassung allgemein verfügbar und für Grammatiken als Betaversion verfügbar. Sie werden für die Akustikmodellanpassung nicht unterstützt.

  • Wichtig: Wenn Sie eine gespiegelte Installation durchführen (z. B. in einer Airgap-Umgebung) und Modelle der nächsten Generation für Speech to Text installieren möchten, müssen vor dem Spiegeln der Images zusätzliche Schritte ausgeführt werden. Weitere Informationen finden Sie in den früheren Releaseinformationen.
  • Weitere Informationen zur Verwendung der angepassten Ressource für die Installation von Modellen finden Sie unter Watson Speech to Text.
  • Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.
  • Weitere Informationen zur Anpassungsunterstützung für Modelle der nächsten Generation finden Sie unter Anpassungsunterstützung für Modelle der nächsten Generation.
Modelle der nächsten Generation für amerikanisches Englisch werden jetzt standardmäßig installiert

Die Modelle der nächsten Generation für amerikanisches Englisch (en-US_Multimedia und en-US_Telephony) werden jetzt standardmäßig mit Speech to Text for IBM Cloud Pak for Data installiert. Diese Modelle werden zusammen mit den Modellen en-US_BroadbandModel, en-US_NarrowbandModel und en-US_ShortForm_NarrowbandModel standardmäßig installiert. Die Modelle enthalten jetzt die folgenden Einträge in der angepassten Ressource für Speech-Services:

########################################
# Speech to Text next-generation models
########################################
      enUsMultimedia:    # US English (en-US) Multimedia model
        enabled: true
      enUsTelephony:     # US English (en-US) Telephony model
        enabled: true

For more information about using the custom resource to install models, see Installing Watson Speech to Text.

Behobene Sicherheitslücken

Die folgenden Sicherheitslücken im Zusammenhang mit Apache Log4j wurden behoben:

20. Dezember 2021 (Version 4.0.4)

Version 4.0.4 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.4 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

Wichtig: Änderungen an Eigenschaften zum Inaktivieren der Speicherung und Protokollierung von Benutzerdaten

Wichtig: Die Namen der Eigenschaften der angepassten Ressource für Speech-Services, die angeben, ob Benutzerdaten gespeichert und protokolliert werden, wurden geändert. Die angepasste Ressource enthielt in früheren Versionen die folgenden Eigenschaften:

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Diese Eigenschaften werden jetzt wie folgt bezeichnet:

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Wenn Sie diese Eigenschaften in Ihrer angepassten Ressource bereits festgelegt haben, um den Standardwert von false in true zu ändern, müssen Sie Ihre angepasste Ressource bearbeiten. Sie müssen die Namen der Eigenschaften manuell in die neuen Werte ändern und die aktualisierte angepasste Ressource speichern. Weitere Informationen finden Sie unter Watson Speech to Text.

Wichtig: Änderungen an Eigenschaften des PostgreSQL-Objekts für geheime Schlüssel

Wichtig: Wenn Sie die Speech-Services installieren, wird standardmäßig ein Objekt erstellt, das ein nach dem Zufallsprinzip generiertes Kennwort für den PostgreSQL-Datenspeicher enthält. Sie können das Kennwort auch manuell angeben. In diesem Fall ist zu beachten, dass sich die Eigenschaften der YAML-Datei für das Objekt für geheime Schlüssel geändert haben. Weitere Informationen finden Sie im Abschnitt zur Verwaltung Ihrer Datenspeicher unter Watson Speech to Text.

Wichtig: PostgreSQL-Pods mit dem EnterpriseDB-Operator von Version 1.10 werden nicht gestartet

Wichtig: In Speech to Text for IBM Cloud Pak for Data Version 4.0.3 können PostgreSQL-Pods, die auf dem Operator für EnterpriseDB Version 1.10 basieren, möglicherweise nicht gestartet werden. Dies verhindert den Start der Speech-Services. Für dieses Problem gibt es eine Ausweichlösung. Wenn Ihre Sprachdienste nicht starten, finden Sie unter PostgreSQL pods do not start with EnterpriseDB version 1.10 operator Informationen zur Diagnose und Behebung des Problems.

Dieses Problem wurde in Speech to Text for IBM Cloud Pak for Data Version 4.0.4 behoben.

Neue Unterstützung für die IBM Spectrum Scale Container Native-Speicherklasse

Ab Version 4.0.3 unterstützen die Speech-Services die IBM Spectrum® Scale Container Native-Speicherklasse. Geben Sie für die Verwendung von IBM Spectrum Scale "ibm-spectrum-scale-sc" für die Eigenschaft storageClass der angepassten Ressource für Speech-Services an. Weitere Informationen finden Sie unter Watson Speech to Text.

Interaktion von Speech-Services mit MinIO-Datenspeicher bei der Installation

Die Laufzeitkomponenten sttRuntime und ttsRuntime der Speech-Services können erst gestartet werden, wenn die Modelle und Stimmen für die Services vollständig in den MinIO-Datenspeicher hochgeladen wurden. Bei der Installation werden die Services möglicherweise aufgrund eines Fehlers beendet und automatisch einmalig oder mehrmals erneut gestartet, bis der Upload der Modelle und Stimmen abgeschlossen ist. Anschließend werden die Services ordnungsgemäß gestartet. Es ist keine Benutzeraktion erforderlich.

Defekt behoben: Korrekte Upgrade-Dokumentation

Fehlerkorrektur: Die Dokumentation zum Upgrade der Speech-Services auf neue Versionen von IBM Cloud Pak for Data Version 4.0.x enthielt falsche Verweise in einigen Befehlen. Diese Referenzen sind jetzt korrekt:

  • Die Zeichenfolgen watsonSpeechToTextStatus und watsonTextToSpeechStatus wurden in beiden Fällen in speechStatus geändert.
  • Die Zeichenfolgen status.watsonSpeechToTextVersion und status.watsonTextToSpeechVersion wurden in beiden Fällen in .spec.version geändert.

Weitere Informationen finden Sie unter Upgrade für Watson Speech to Text.

Wichtig: Angepasste Sprachmodelle, die auf bestimmten Modellen der nächsten Generation basieren, müssen erneut erstellt werden

Wichtig: Wenn Sie angepasste Sprachmodelle auf der Basis bestimmter Modelle der nächsten Generation erstellt haben, müssen Sie die angepassten Modelle erneut erstellen. Wenn Sie die angepassten Sprachmodelle nicht erneut erstellen, schlagen Spracherkennungsanforderungen, in denen die angepassten Modelle verwendet werden sollen, mit dem HTTP-Fehlercode 400 fehl.

Angepasste Sprachmodelle, die auf den folgenden Modellversionen der nächsten Generation basieren, müssen erneut erstellt werden:

  • Angepasste Modelle für das Modell en-AU_Telephony, die Sie aus en-AU_Telephony.v2021-03-03 in en-AU_Telephony.v2021-10-04 erstellt haben.
  • Angepasste Modelle für das Modell en-GB_Telephony, die Sie aus en-GB_Telephony.v2021-03-03 in en-GB_Telephony.v2021-10-04 erstellt haben.
  • Angepasste Modelle für das Modell en-US_Telephony, die Sie aus en-US_Telephony.v2021-06-17 in en-US_Telephony.v2021-10-04 erstellt haben.
  • Angepasste Modelle für das Modell en-US_Multimedia, die Sie aus en-US_Multimedia.v2021-03-03 in en-US_Multimedia.v2021-10-04 erstellt haben.

Modellversion ermitteln, auf der ein angepasstes Sprachmodell basiert: Verwenden Sie die Methode GET /v1/customizations, um alle angepassten Sprachmodelle aufzulisten, oder die Methode GET /v1/customizations/{customization_id}, um ein bestimmtes angepasstes Sprachmodell aufzulisten. Im Feld versions der Ausgabedaten wird das Basismodell für ein angepasstes Sprachmodell angezeigt. Weitere Informationen finden Sie im Abschnitt Angepasste Sprachmodelle auflisten.

Angepasstes Sprachmodell erneut erstellen: Erstellen Sie zunächst ein neues angepasstes Modell. Fügen Sie anschließend alle Korpora und angepassten Wörter aus dem vorherigen angepassten Modell zu dem neuen Modell hinzu. Danach können Sie das vorherige angepasste Modell löschen. Weitere Informationen finden Sie unter Angepasstes Sprachmodell erstellen.

Viele Modelle der nächsten Generation wurden aktualisiert, um die Spracherkennung zu verbessern

Die folgenden Modelle der nächsten Generation wurden aktualisiert, um die Spracherkennung zu verbessern:

  • Telefoniemodell für Englisch (Australien) - en-AU_Telephony
  • Telefoniemodell für Englisch (Vereinigtes Königreich) - en-GB_Telephony
  • Multimediamodell für Englisch (Vereinigte Staaten) - en-US_Multimedia
  • Telefoniemodell für Englisch (Vereinigte Staaten) - en-US_Telephony
  • Telefoniemodell für Spanisch (Kastilien) - es-ES_Telephony

Weitere Informationen zu allen verfügbaren Modellen der nächsten Generation finden Sie unter Sprachen und Modelle der nächsten Generation.

Neue Betafunktion zur Grammatikunterstützung für Modelle der nächsten Generation

Grammatikunterstützung steht jetzt als Betafunktion für alle verfügbaren Modelle der nächsten Generation zur Verfügung. Alle Modelle der nächsten Generation sind allgemein verfügbar (GA) und unterstützen die Sprachmodellanpassung. Weitere Informationen finden Sie in den folgenden Quellen:

Neues Feld custom_acoustic_model für unterstützte Funktionen

Die Methoden GET /v1/models und GET /v1/models/{model_id} melden jetzt, ob ein Modell die Akustikmodellanpassung unterstützt. Das Objekt SupportedFeatures enthält jetzt das zusätzliche Feld custom_acoustic_model für boolesche Werte. Der Wert true bedeutet, dass ein Modell die Akustikmodellanpassung unterstützt, der Wert false bedeutet das Gegenteil. Derzeit ist das Feld für alle Modelle der vorherigen Generation auf true gesetzt und für alle Modelle der nächsten Generation auf false.

Sicherheitslücke behoben

Die folgende Sicherheitslücke im Zusammenhang mit Apache Log4j wurde geschlossen:

20. Dezember 2021 (Version 1.2.x)

Wichtig: Speech to Text Version 1.2.x kann nicht mehr unter IBM Cloud Pak for Data Version 3.5 installiert werden.

Wichtig: Neuinstallationen von Speech to Text Version 1.2.x können nicht mehr unter IBM Cloud Pak for Data Version 3.5 ausgeführt werden. Speech to Text Version 4.0.x kann nur unter IBM Cloud Pak for Data Version 4.x installiert werden. Weitere Informationen finden Sie unter Watson Speech to Text.

Die Speech-Services für IBM Cloud Pak for Data Version 3.5 erreichen das Ende des Unterstützungszeitraums am 30. April 2022. Es wird empfohlen, so bald wie möglich ein Upgrade auf das neueste 4.0.x-Release der Services durchzuführen. Weitere Informationen finden Sie unter Upgrade für Watson Speech to Text.

30. November 2021 (Version 4.0.3)

Version 4.0.3 ist jetzt verfügbar

Speech to Text for IBM Cloud Pak for Data Version 4.0.3 ist jetzt verfügbar. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6 und 4.8. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter Watson Speech to Text.

DER Lizenzserver ist jetzt eine obligatorische Voraussetzung

Sie müssen jetzt den Lizenzserver über die Basisservices von IBM Cloud Pak for Data installieren. Sie müssen den Lizenzserver mithilfe des bereitgestellten YAML-Inhalts installieren, um eine OperandRequest-Instanz mit den erforderlichen Bindungen zu erstellen. Außerdem müssen Sie den Lizenzservice in demselben Namensbereich wie den Service (Operand) installieren, in dem auch IBM Cloud Pak for Data installiert ist. Weitere Informationen finden Sie unter Watson Speech to Text.

Neue Unterstützung für Inplace-Upgrades

Der Service unterstützt jetzt ein operatorbasiertes Inplace-Upgrade von Version 4.0.0 auf Version 4.0.3. Für die Umstellung von IBM Cloud Pak for Data Version 3.5 auf Version 4.0.3 sind weiterhin Migrationsdienstprogramme erforderlich. Weitere Informationen finden Sie unter Upgrade für Watson Speech to Text.

Änderungen bei der Installation von EDB PostgreSQL-Operator und -Lizenz

Installation, Upgrade und Deinstallation für den Enterprise DB PostgreSQL-Operator und die entsprechende Lizenz wurden geändert:

  • Anweisungen zur Installation des EDB PostgreSQL-Operators und der Lizenz sind jetzt in den Basisservices von IBM Cloud Pak for Data enthalten. Die Anweisungen zur Installation der Speech-Services wurden entsprechend aktualisiert. Weitere Informationen finden Sie unter Watson Speech to Text.
  • Die Anweisungen für das Upgrade von Speech to Text Version 4.0.0 auf 4.0.3 beinhalten Anweisungen zum Deinstallieren des vorherigen Operators und der vorherigen Lizenz für EDB PostgreSQL und zum erneuten Installieren mithilfe der IBM Cloud Pak for Data-Basisservices. Weitere Informationen finden Sie unter Upgrade für Watson Speech to Text.
  • Die Anweisungen zum Deinstallieren der Speech-Services enthalten jetzt Schritte zum Entfernen des Operators und der Lizenz für EDB PostgreSQL, die zuvor mit Speech to Text installiert wurden. Weitere Informationen finden Sie unter Watson Speech to Text.
Neue Anleitung für ein Scale-up Ihrer Installation

Der Service bietet jetzt aktualisierte Anleitungen für ein Scale-up Ihrer Installation. Der Leitfaden beinhaltet das Angeben der Podanzahl, der pro Pod zugeordneten CPU-Anzahl und der maximalen Anzahl gleichzeitiger Sitzungen mit Modellen der vorherigen und der nächsten Generation. Weitere Informationen finden Sie unter Watson Speech to Text.

Befehlszeilenaktualisierungen für Import- und Exportdienstprogramme

Die Befehle, die mit den Import- und Exportdienstprogrammen für die Speech-Services verwendet werden, enthalten neue Optionen und Argumente. Die Import- und Exportdienstprogramme sind auch die Grundlage für die Sicherung und Wiederherstellung der Services und für die Migration von IBM Cloud Pak for Data Version 3.5 auf Version 4.0.3. Weitere Informationen zur Verwendung der Dienstprogramme finden Sie in den folgenden Abschnitten:

Neue Eigenschaft zum Angeben der CPUs für das Akustikmodelltraining

Der Mikroservice sttAMPatcher verwaltet die Akustikmodellanpassung für den Service. Der AM-Patcher verwendet eine dedizierte Anzahl von CPUs, um Anforderungen zu verarbeiten. Mit der neuen Eigenschaft sttAMPatcher.resources.requestsCPU können Sie die Anzahl der dedizierten CPUs zur Verarbeitung von Trainingsanforderungen für Akustikmodelle durch den AM-Patcher zu erhöhen. Dies kann erforderlich werden, wenn beim Training von Akustikmodellen Fehler auftreten. Weitere Informationen finden Sie unter Watson Speech to Text.

Neue Modelle der nächsten Generation

Der Service unterstützt jetzt die folgenden neuen Sprachmodelle der nächsten Generation. Alle neuen Modelle sind allgemein verfügbar.

  • Tschechisch: cs-CZ_Telephony. Das Modell unterstützt geringe Latenzzeit.
  • Niederländisch (Belgien, Flämisch): nl-BE_Telephony. Das Modell unterstützt geringe Latenzzeit.
  • Französisch: fr-FR_Multimedia. Das neue Modell unterstützt geringe Latenzzeit nicht.
  • Englisch (Indien): en-IN_Telephony. Das Modell unterstützt geringe Latenzzeit.
  • Indisch (Hindi): hi-IN_Telephony. Das Modell unterstützt geringe Latenzzeit.
  • Japanisch: ja-JP_Multimedia. Das Modell unterstützt geringe Latenzzeit nicht.
  • Koreanisch: ko-KR_Multimedia. Das Modell unterstützt geringe Latenzzeit nicht.
  • Koreanisch: ko-KR_Telephony. Das Modell unterstützt geringe Latenzzeit.
  • Niederländisch (Niederlande): nl-NL_Telephony. Das Modell unterstützt geringe Latenzzeit.

Weitere Informationen zu allen Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in Sprachen und Modelle der nächsten Generation und Geringe Latenzzeit.

Aktualisierungen für Modelle der nächsten Generation

Die folgenden Modelle der nächsten Generation wurden aktualisiert, um die Spracherkennung zu verbessern. Alle Modelle sind allgemein verfügbar.

  • Arabisch: ar-MS_Telephony. Das Modell unterstützt jetzt geringe Latenzzeit.
  • Portugiesisch (Brasilien): pt-BR_Telephony. Das Modell unterstützt weiterhin geringe Latenzzeit.
  • Englisch (Vereinigte Staaten): en-US_Telephony. Das Modell unterstützt weiterhin geringe Latenzzeit.
  • Französisch (Kanada): fr-CA_Telephony. Das Modell unterstützt jetzt geringe Latenzzeit.
  • Italienisch: it-IT_Telephony. Das Modell unterstützt jetzt geringe Latenzzeit.

Weitere Informationen zu allen Modellen der nächsten Generation und zu geringer Latenzzeit finden Sie in Sprachen und Modelle der nächsten Generation und Geringe Latenzzeit.

Fehlerbehebung: Behebung von asynchronen HTTP Fehlern

Fehlerkorrektur: Die asynchrone HTTP-Schnittstelle konnte manche Audiodaten nicht transkribieren. Außerdem wurde vom Callback für die Anforderung der Status recognitions.completed_with_results zurückgegeben und nicht recognitions.failed. Dieser Fehler wurde behoben.

Fehlerkorrektur: Ergebnisse für Sprecherbezeichnungen verbessern

Fehlerkorrektur: Bei Verwendung von Sprecherbezeichnungen in Modellen der nächsten Generation identifiziert der Service jetzt den Sprecher für alle Wörter in den Eingabeaudiodaten, auch für sehr kurze Wörter mit identischer Start- und Endzeitmarke.

Defekt behoben: Aktualisierung der Zwischenergebnisse und der Dokumentation über niedrige Latenzzeiten

Fehlerkorrektur: Die Beschreibung der Funktionen für Zwischenergebnisse und für geringe Latenzzeit bei Modellen der nächsten Generation wurde mit leicht verständlichem und inhaltlich überarbeitetem Wortlaut neu formuliert. Weitere Informationen finden Sie in den folgenden Quellen:

Defekt behoben: Korrigierte Multitenancy-Dokumentation

Fehlerkorrektur: Im Abschnitt Multi-Tenant-Unterstützung von IBM Cloud Pak for Data wurde fälschlicherweise angegeben, dass die Speech-Services die Multi-Tenant-Funktionalität nicht unterstützen. Das Thema wurde dahingehend aktualisiert, dass die Speech-Services die folgenden Operationen unterstützen:

  • Installation des Service in separaten Projekten
  • Installation des Service mehrfach in demselben Projekt
  • Einmalige Installation des Service und Bereitstellung mehrerer Instanzen in demselben Projekt

In der Dokumentation für die Speech-Services wurde die Multi-Tenant-Unterstützung ordnungsgemäß angegeben.

1. Oktober 2021 (Version 1.1.x)

Unterstützung für Version 1.1.x wurde eingestellt
Der Servicezeitraum für Speech to Text und Text to Speech for IBM Cloud Pak for Data Version 1.1.x wurde am 30. September 2021 beendet. Ab dem 1. Oktober 2021 ist die Dokumentation für Version 1.1.x nicht mehr verfügbar. Weitere Informationen finden Sie unter Software-Zurückziehung und Einstellung der Unterstützung.

31. August 2021 (Version 4.0.0)

Alle Modelle der nächsten Generation sind jetzt allgemein verfügbar

Alle Sprachmodelle der nächsten Generation sind jetzt allgemein verfügbar (GA). Sie werden für die Verwendung in Produktionsumgebungen und in Anwendungen unterstützt.

Sprachmodellanpassung für Modelle der nächsten Generation ist jetzt allgemein verfügbar

Die Sprachmodellanpassung für alle verfügbaren Sprachen und Modelle der nächsten Generation ist jetzt allgemein verfügbar (GA). Die Sprachmodellanpassung für Modelle der nächsten Generation wird für die Verwendung in Produktionsumgebungen und in Anwendungen unterstützt.

Dabei werden für Modelle der nächsten Generation dieselben Befehle zum Erstellen, Verwalten und Verwenden angepasster Sprachmodelle, Korpora und angepasster Wörtern verwendet wie für Modelle der vorherigen Generation. Die Anpassung für Modelle der nächsten Generation funktioniert jedoch anders als für Modelle der vorherigen Generation. Angepasste Modelle, die auf Modellen der nächsten Generation basieren:

  • In den angepassten Modellen wird das Konzept der vokabularexternen Wörter (Out-of-vocabulary, OOV) nicht verwendet.
  • Wörter aus Korpora werden nicht zur Wörterressource hinzugefügt.
  • Die Funktion für gleich klingende Wörter kann derzeit nicht auf benutzerdefinierte Wörter angewendet werden.
  • Nach der Aktualisierung des Basissprachmodells muss kein Upgrade für angepasste Modelle durchführt werden.
  • Grammatiken werden derzeit nicht unterstützt.

Weitere Informationen zur Verwendung der Sprachmodellanpassung für Modelle der nächsten Generation finden Sie unter

Weitere Themen beschreiben die Verwaltung von angepassten Sprachmodellen, Korpora und angepassten Wörtern.

29. Juli 2021 (Version 4.0.0)

Version 4.0.0 ist verfügbar

IBM Watson® Speech to Text for IBM Cloud Pak® for Data Version 4.0.0 ist jetzt verfügbar. Bei der Installation und Verwaltung des Service gibt es viele Änderungen. Diese Version unterstützt IBM Cloud Pak for Data Version 4.x und Red Hat OpenShift Version 4.6. Weitere Informationen zur Installation und Verwaltung des Service finden Sie unter IBM Watson Speech to Text for IBM Cloud Pak for Data installieren.

Neue Sprachmodelle der nächsten Generation

Der Service unterstützt jetzt eine wachsende Anzahl von Sprachmodellen der nächsten Generation. Die Multimediamodelle und Telefoniemodelle der nächsten Generation verbessern die Spracherkennungsfunktionen der Breitband- und Schmalbandmodelle der vorherigen Generation. Die neuen Modelle nutzen tiefgreifende neuronale Netze und die bidirektionale Analyse, um einen höheren Durchsatz und größere Transkriptionsgenauigkeit zu erreichen.

Derzeit werden die Sprachmodelle der nächsten Generation und der Parameter low_latency als Betafunktionen bereitgestellt. Die Modelle der nächsten Generation unterstützen eine begrenzte Anzahl von Sprachen und Spracherkennungsfunktionen. In zukünftigen Releases sollen weitere Sprachen, Modelle und Funktionen unterstützt werden.

Viele Modelle der nächsten Generation unterstützen außerdem den neuen Parameter low_latency, der auf Anforderung schneller Ergebnisse liefert. Dies kann jedoch zu einer reduzierten Transkriptionsqualität führen. Wenn die geringe Latenzzeit aktiviert ist, begrenzt der Service die Analyse der Audiodaten. Dadurch kann die Genauigkeit der Transkription beeinträchtigt werden. Diese Nachteil kann hinnehmbar sein, wenn eine möglichst kurze Antwortzeit für Ihre Anwendung wichtiger ist als die größtmögliche Genauigkeit.

Der Parameter low_latency wirkt sich auf die Verwendung des Parameters interim_results mit der WebSocket-Schnittstelle aus. Zwischenergebnisse sind nur für Modelle der nächsten Generation verfügbar, die geringe Latenzzeit unterstützen, sofern die beiden Parameter interim_results und low_latency auf true gesetzt sind.

Das Breitbandmodell für Arabisch wurde umbenannt

Das Breitband-Sprachmodell für Arabisch wurde in ar-MS_BroadbandModel umbenannt. Der frühere Name ar-AR_BroadbandModel ist veraltet. Die Stimme kann mindestens ein Jahr weiterhin verwendet werden, wird zu einem späteren Zeitpunkt jedoch möglicherweise entfernt. Es wird empfohlen, sobald wie möglich auf den neuen Namen zu migrieren.

Einheitliche Dokumentation für Speech to Text

Die Dokumentation für IBM Watson Speech to Text for IBM Cloud Pak for Data wurde mit der Dokumentation für verwaltete Instanzen des Speech to Text-Service zusammengeführt, die unter IBM Cloud gehostet werden. Dies gilt sowohl für das Handbuch als auch für die Referenzdokumentation für die beiden Formen des Service. Links zur bisher separaten Version der IBM Cloud Pak for Data-Dokumentation für den Service führen jetzt zur einheitlichen Dokumentation.

Weitere Informationen zum Identifizieren von Informationen, die sich ausschließlich auf eine Variante des Produkts beziehen, finden Sie unter Informationen zu Speech to Text.

Fehlerkorrektur: Dokumentation verbessern

Defekt behoben: Die Dokumentation wurde aktualisiert, um die folgenden Informationen zu korrigieren:

  • In der Dokumentation war nicht angegeben, dass Modelle der nächsten Generation keine Verzögerungsmarkierungen erzeugen. Die Dokumentation wurde aktualisiert und weist nun darauf hin, dass nur Modelle der vorherigen Generation Verzögerungsmarkierungen erzeugen. Modelle der nächsten Generation enthalten die tatsächlichen Bedenken in den Transkriptionsergebnissen. Weitere Informationen finden Sie unter Sprachzögerungen und Stockungsmarkierungen.
  • In der Dokumentation war irrtümlich angegeben, dass bei Verwendung des Parameters smart_formatting Verzögerungsmarkierungen aus den Endergebnissen der Transkription für Japanisch entfernt werden. Die intelligente Formatierung entfernt keine Verzögerungsmarkierungen aus den Endergebnissen für Japanisch, sondern nur aus den Endergebnissen für amerikanisches Englisch. Weitere Informationen finden Sie unter Wie wirkt sich die intelligente Formatierung aus?
Unterstützung für Version 1.1.x wird eingestellt

Die Unterstützung für Speech to Text und Text to Speech for IBM Cloud Pak for Data Version 1.1.x wird am 30. September 2021 eingestellt. Sie müssen vor diesem Datum in IBM Cloud Pak for Data ein Upgrade auf eine höhere Version der Services durchführen. Ab 1. Oktober 2021 ist die Dokumentation für Version 1.1.4 nicht mehr verfügbar.

12. April 2021 (Version 1.2.1)

Ergänzung der Datei speech-override.yaml

Die Datei speech-override.yaml mit der Mindestmenge erforderlicher Einstellungen enthält eine zusätzliche Definition: dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} ist der Pfad für die interne Docker-Registry. Es muss sich um image-registry.openshift-image-registry.svc:5000/{namespace} handeln, wobei {namespace} der Namensbereich ist, in dem IBM Cloud Pak® for Data installiert ist (normalerweise zen).

9. April 2021 (Version 1.2.1)

Unterstützung für das Ändern installierter Modelle und Stimmen
In den Speech-Services können Sie installierte Modelle und Stimmen für Version 1.2 oder 1.2.1 der Services hinzufügen oder entfernen.

Version 1.2.1 (26. März 2021)

Version 1.2.1 ist verfügbar

Speech to Text for IBM Cloud Pak for Data Version 1.2.1 ist jetzt verfügbar. Für Version 1.2.1 wurden die Dokumentation und die Installationsanweisungen von Version 1.2 beibehalten. Version 1.2.1 unterstützt neben einer Installation unter den Versionen 4.5 und 3.11 auch eine Installation unter Red Hat OpenShift Version 4.6.

Neue Installationsanweisungen

Für Cluster, die mit dem Internet verbunden sind, und für durch eine Air-Gap geschützte Cluster umfassen die Installationsanweisungen die folgenden Schritte:

  • Verwenden Sie den Befehl oc label, um erforderliche Bezeichnungen für den Namensbereich einzurichten, in dem IBM Cloud Pak for Data installiert ist.
  • Verwenden Sie den Befehl oc project, um sicherzustellen, dass Sie auf das richtige OpenShift-Projekt verweisen.
  • Verwenden Sie den Befehl cpd-cli install, um einen Enterprise DB PostgreSQL-Server zu installieren, der von den Speech-Services verwendet wird.

Diese Schritte sind vor der Installation der Speech-Services auszuführen.

Neue Deinstallationsanweisungen

Der Prozedur zum Deinstallieren der Speech-Services wurde ein Schritt hinzugefügt, um alle Ressourcen in Bezug auf die Installation zu bereinigen.

Berechtigte Registry für PostgreSQL-Datenspeicher

Der Pfad für die berechtigte Registry, aus der vom Service Images für den PostgreSQL-Datenspeicher extrahiert werden, wurde geändert. Die Registryposition wurde von cp.icr.io/cp/watson-speech in cp.icr.io/cp/cpd geändert. Diese Änderung ist für Benutzer transparent.

Geheime Schlüssel für Minio- und PostgreSQL-Datenspeicher

Die Minio- und PostgreSQL-Datenspeicher erfordern die folgenden fest codierten Werte für die zugehörigen geheimen Schlüssel:

  • Verwenden Sie für Minio minio.
  • Verwenden Sie für PostgreSQL user-provided-postgressql.

Sie können für diese geheimen Schlüssel keine eigenen Werte verwenden. Die geheimen Schlüssel müssen vor der Installation der Speech-Services erstellt werden.

In der Datei speech-override.yaml gelöschte Einträge

Die folgenden Einträge wurden in der Datei speech-override.yaml entfernt. Sie wurden hinzugefügt, um ein Problem zu umgehen, das jetzt behoben wurde.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

Die gekürzte Datei speech-override.yaml wurde insgesamt verkleinert, da der Inhalt gestrafft und auf die wesentlichen Elemente reduziert wurde.

Version 1.2 (9. Dezember 2020)

Version 1.2 ist verfügbar

Speech to Text for IBM Cloud Pak for Data Version 1.2 ist nun verfügbar. Bei der Installation und Verwaltung des Service gibt es viele Änderungen. Diese Version unterstützt IBM Cloud Pak for Data Version 3.5 und 3.0.1 sowie Red Hat OpenShift Version 4.5 und 3.11.

Neue Modelle für australisches Englisch und kanadisches Französisch

Der Service bietet nun Breitband- und Schmalbandmodelle für australisches Englisch und kanadisches Französisch.

  • Australisches Englisch: en-AU_BroadbandModel und en-AU_NarrowbandModel
  • Kanadisches Französisch: fr-CA_BroadbandModel und fr-CA_NarrowbandModel

Die neuen Modelle sind allgemein verfügbar und unterstützen sowohl die Anpassung von Sprachmodellen als auch die Anpassung von Akustikmodellen.

Aktualisierte Modelle für verbesserte Spracherkennung

Die folgenden Sprachmodelle wurden aktualisiert und bieten nun eine verbesserte Spracherkennung:

  • Brasilianisches Portugiesisch: pt-BR_BroadbandModel und pt-BR_NarrowbandModel
  • Französisch:fr-FR_BroadbandModel
  • Deutsch: de-DE_BroadbandModel und de-DE_NarrowbandModel
  • Japanisch: ja-JP_BroadbandModel
  • Britisches Englisch: en-GB_BroadbandModel und en-GB_NarrowbandModel
  • Englisch (Vereinige Staaten): en-US_ShortForm_NarrowbandModel

Standardmäßig verwendet der Service die aktualisierten Modelle automatisch für alle Spracherkennungsanforderungen. Wenn Sie über angepasste Sprach- oder Akustikmodelle verfügen, die auf diesen Modellen basieren, müssen Sie für Ihre vorhandenen angepassten Modelle Upgrades durchführen, um die Aktualisierungen zu nutzen. Verwenden Sie hierzu die folgenden Methoden:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Weitere Informationen finden Sie im Abschnitt Upgrade für angepasste Modelle durchführen.

Der Parameter split_transcript_at_phrase_end ist jetzt für alle Sprachen allgemein verfügbar.

Der Spracherkennungsparameter split_transcript_at_phrase_end ist nun für alle Sprachen allgemein verfügbar. Bisher war er nur für amerikanisches und britisches Englisch allgemein verfügbar. Weitere Informationen finden Sie im Abschnitt Transkription nach Ausdrucksende aufteilen.

Verzögerungsmarkierung für Deutsch wurde geändert

Die Verzögerungsmarkierung in den aktualisierten Breitband- und Schmalbandmodellen für die deutsche Sprache wurde von [hesitation] in %HESITATION geändert. Weitere Informationen zu Hesitation-Markierungen finden Sie unter Sprachhesitationen und Hesitation-Markierungen.

Defekt behoben: Behebung des Latenzproblems bei Modellen mit einer großen Anzahl von Grammatiken

Fehlerkorrektur: Im Service treten keine Latenzprobleme bei angepassten Sprachmodellen auf, die über eine große Anzahl von Grammatiken verfügen. Bei der Verwendung für die Spracherkennung konnte das Laden solcher angepassten Modelle anfänglich mehrere Sekunden in Anspruch nehmen. Die angepassten Modelle werden nun erheblich schneller geladen, wodurch sich die Latenz bei deren Verwendung für die Spracherkennung deutlich reduziert.

15. Juli 2020 (Version 1.1.4)

Unterstützung für Red Hat OpenShift Version 4.3 wird eingestellt
IBM Cloud Pak for Data 3.0.1 stellt die Unterstützung für Red Hat OpenShift 4.3 am 1. September 2020 ein. Die Unterstützung für Red Hat OpenShift 4.3 wird am 22. Oktober 2020 eingestellt. Bei IBM Cloud Pak for Data wird die Unterstützung für Red Hat OpenShift 4.5 eingeführt. Kunden mit IBM Cloud Pak for Data wird empfohlen, vor dem 22. Oktober 2020 ein Upgrade auf Red Hat OpenShift 4.5 durchzuführen. Der IBM Support wird mit allen Kunden zusammenarbeiten, die bereits IBM Cloud Pak for Data 3.0.1 unter Red Hat OpenShift 4.3 installiert haben. Neue Kunden, die eine Installation unter Red Hat OpenShift 4.x planen, werden angewiesen, Red Hat OpenShift 4.5 zu installieren.

19. Juni 2020 (Version 1.1.4)

Version 1.1.4 ist verfügbar

Speech to Text for IBM Cloud Pak for Data Version 1.1.4 ist jetzt verfügbar. Bei der Installation und Verwaltung des Service gibt es viele Änderungen. Diese Version unterstützt IBM Cloud Pak for Data Version 2.5 und 3.0.1 sowie Red Hat OpenShift Version 3.11 und 4.3. Weitere Informationen zur Installation und Verwaltung des Dienstes finden Sie unter Installation und Verwaltung von Speech to Text für IBM Cloud Pak for Data.

Neue Parameter zur Steuerung der Stufe für die Sprachaktivitätserkennung

Der Service bietet nun zwei neue optionale Parameter zur Steuerung der Stufe der Sprechaktivitätserkennung. Die Parameter können Sie dabei unterstützen, sicherzustellen, dass nur relevante Audiodaten für die Spracherkennung verarbeitet werden.

  • Der Parameter speech_detector_sensitivity passt die Empfindlichkeit für die Sprechaktivitätserkennung an. Sie können den Parameter verwenden, um Worteinfügungen aus Musik oder durch Husten oder andere nichtsprachliche Ereignisse zu unterdrücken.
  • Der Parameter background_audio_suppression unterdrückt die Hintergrundaudiosignale auf Basis der Lautstärke, damit diese nicht als Sprache transkribiert werden oder auf andere Weise die Spracherkennung stören. Sie können diesen Parameter verwenden, um Nebengespräche oder Hintergrundgeräusche zu unterdrücken.

Sie können die Parameter einzeln oder zusammen verwenden. Sie sind für alle Schnittstellen und für die meisten Sprachmodelle verfügbar. Weitere Informationen zu den Parametern, ihren zulässigen Werten und ihren Auswirkungen auf die Qualität und die Latenzzeit von Spracherkennung finden Sie unter Sprechaktivitätserkennung .

Neue Breitband- und Schmalbandmodelle für Niederländisch und Italienisch

Der Service unterstützt nun Breitband- und Schmalbandmodelle für die Sprachen Niederländisch und Italienisch:

  • Niederländisch Breitbandmodell (nl-NL_BroadbandModel)
  • Niederländisch Schmalbandmodell (nl-NL_NarrowbandModel)
  • Italienisch Breitbandmodell (it-IT_BroadbandModel)
  • Italienisch Schmalbandmodell (it-IT_NarrowbandModel)

Die Sprachmodelle für Niederländisch und Italienisch sind für die Spracherkennung und für die Anpassung von Sprachmodellen und Akustikmodellen allgemein verfügbar. Weitere Informationen zu allen verfügbaren Sprachmodellen finden Sie in den folgenden Abschnitten:

Unterstützung des Parameters speaker_labels für Deutsch und Koreanisch

Der Service unterstützt nun Sprecherbezeichnungen (Parameter speaker_labels) für die Sprachmodelle für Deutsch und Koreanisch. Sprecherbezeichnungen geben an, von welchen Personen in einer Konversation mit mehreren Beteiligten welche Worte gesprochen wurden. Weitere Informationen finden Sie im Abschnitt Sprecherbezeichnungen.

Verbesserte Spracherkennung beim Schmalbandmodell für Japanisch

Das Schmalbandmodell für Japanisch (ja-JP_NarrowbandModel) umfasst nun einige Multigram-Worteinheiten für Ziffern und Dezimalbrüche. Der Service gibt diese Multigram-Einheiten unabhängig davon zurück, ob Sie intelligente Formatierung aktiviert oder inaktiviert haben. Die Funktion 'Intelligente Formatierung' versteht Multigram-Einheiten, die das Modell generiert, und gibt diese zurück. Wenn Sie Ihre eigene Nachbearbeitung auf die Transkriptionsergebnisse anwenden, müssen Sie diese Einheiten entsprechend handhaben. Weitere Informationen finden Sie in der Dokumentation zur intelligenten Formatierung unter Japanisch.

Vereinfachte Sicherung und Wiederherstellung

Der Service bietet jetzt deutlich verbesserte Sicherungs- und Wiederherstellungsverfahren. Jetzt sind Dienstprogramme für die Sicherung von Daten aus Ihren Datenspeichern verfügbar, sodass Sie bei einem Störfall nicht mehr alle Daten erneut erstellen müssen. Weitere Informationen finden Sie unter Sichern und Wiederherstellen von Watson Sprachdienste-Daten.

1. April 2020 (Version 1.1.3)

Akustikmodellanpassung ist jetzt allgemein verfügbar
Die Akustikmodellanpassung ist nun allgemein für alle unterstützten Sprachen verfügbar (GA). Weitere Informationen zur Unterstützung einzelner Sprachmodelle finden Sie unter Sprachunterstützung bei der Anpassung.

28. Februar 2020 (Version 1.1.3)

Version 1.1.3 ist verfügbar

Speech to Text für IBM Cloud Pak for Data Version 1.1.3 ist jetzt verfügbar.

Neuer Parameter end_of_phrase_silence_time

Für die Spracherkennung unterstützt der Service jetzt den Parameter end_of_phrase_silence_time. Der Parameter gibt die Dauer des Pausenintervalls an, bei dem der Service eine Transkription in mehrere Endergebnisse aufteilt. Jedes Endergebnis gibt eine Sprechpause oder ein längeres Schweigen an, das das Pausenintervall überschreitet. Für die meisten Sprachen beträgt das Standardpausenintervall 0,8 Sekunden; bei Chinesisch beträgt das Standardintervall 0,6 Sekunden.

Sie können den Parameter verwenden, um ein Gleichgewicht zwischen der Häufigkeit, mit der ein Endergebnis erzielt wird, und der Genauigkeit der Transkription herzustellen. Erhöhen Sie das Intervall, wenn die Genauigkeit wichtiger ist als die Latenzzeit. Verringern Sie das Intervall, wenn der Sprecher kurze Ausdrücke oder einzelne Wörter spricht.

Weitere Informationen finden Sie im Abschnitt Sprechpausenzeit nach Ausdrucksende.

Neuer Parameter split_transcript_at_phrase_end

Für die Spracherkennung unterstützt der Service jetzt den Parameter split_transcript_at_phrase_end. Der Parameter weist den Service an, die Transkription in mehrere Endergebnisse für semantische Merkmale der Eingabe aufzuteilen, wie z. B. vollständige Sätze. Der Service basiert auf dem Verständnis von semantischen Merkmalen für das Basissprachmodell, das Sie mit einer Anforderung verwenden. Angepasste Sprachmodelle und Grammatiken können auch beeinflussen, wie und wo der Service eine Transkription aufteilt.

Der Parameter bewirkt, dass der Service jedem Endergebnis das Feld end_of_utterance hinzufügt, um die Motivation für die Aufteilung anzugeben: full_stop, silence, end_of_data oder reset.

Weitere Informationen finden Sie im Abschnitt Transkription nach Ausdrucksende aufteilen.

Verbesserter Parameter speaker_labels

Der Parameter speaker_labels für die Spracherkennung wurde aktualisiert, um die Identifikation einzelner Sprecher für die weitere Analyse Ihrer Audiodatenstichprobe zu verbessern. Weitere Informationen zur Funktion für Sprecherbezeichnungen finden Sie unter Sprecherbezeichnungen. Weitere Informationen über die Verbesserungen der Funktion finden Sie unter IBM Research AI Advances Speaker Diarization in Real Use Cases.

27. November 2019 (Version 1.1.2)

Version 1.1.2 ist verfügbar
Speech to Text für IBM Cloud Pak for Data Version 1.1.2 ist jetzt verfügbar.
Maximale Anzahl angepasster Modelle
Sie können nicht mehr als 1024 angepasste Sprachmodelle und nicht mehr als 1024 angepasste akustische Modelle pro besitzenden Berechtigungsnachweis erstellen. Weitere Informationen finden Sie im Abschnitt Maximale Anzahl an angepassten Modellen.

30. August 2019 (Version 1.0.1)

Version 1.0.1 ist verfügbar

Speech to Text für IBM Cloud Pak for Data Version 1.0.1 ist jetzt verfügbar. Der Service arbeitet nun mit IBM Cloud Pak for Data 2.1.0.1. Der Service unterstützt jetzt die Installation von IBM Cloud Pak for Data mit Red Hat OpenShift.

Neue Breitband- und Schmalbandmodelle für spanische Dialekte

Der Service bietet jetzt Breitband- und Schmalbandsprachmodelle in sechs spanischen Dialekten an:

  • Argentinisches Spanisch (es-AR_BroadbandModel und es-AR_NarrowbandModel)
  • Kastilisches Spanisch (es-ES_BroadbandModel und es-ES_NarrowbandModel)
  • Chilenisches Spanisch (es-CL_BroadbandModel und es-CL_NarrowbandModel)
  • Kolumbianisches Spanisch (es-CO_BroadbandModel und es-CO_NarrowbandModel)
  • Mexikanisches Spanisch (es-MX_BroadbandModel und es-MX_NarrowbandModel)
  • Peruanisches Spanisch (es-PE_BroadbandModel und es-PE_NarrowbandModel)

Die Modelle für kastilisches Spanisch sind nicht neu. Sie sind allgemein für die Spracherkennung und die Anpassung von Sprachmodellen sowie als Beta-Version für die Anpassung von akustischen Modellen verfügbar.

Die Modelle für die anderen fünf Dialekte sind neu und sind Beta-Versionen für alle Anwendungen. Da es sich um Beta-Versionen handelt, sind diese zusätzlichen Dialekte möglicherweise nicht für den Produktionseinsatz bereit und können sich ändern. Es handelt sich um erste Angebote, die sich mit der Zeit und der Nutzung qualitativ verbessern.

Weitere Informationen finden Sie in den folgenden Abschnitten:

FISMA-Unterstützung

Die Unterstützung für die Federal Information Security Management Act (FISMA) ist jetzt für Speech to Text for IBM Cloud Pak for Data verfügbar. Für den Service gilt die FISMA-Konformitätsstufe 'High Ready'.

28. Juni 2019 (Version 1.0.0)

Version 1.0.0 ist verfügbar

Version 1.0.0, das erste Release des Service, ist jetzt verfügbar. Speech to Text für IBM Cloud Pak for Data basiert auf dem IBM Watson® Speech to Text-Service in der öffentlichen IBM Cloud. Speech to Text for IBM Cloud Pak for Data weist die folgenden Unterschiede zum öffentlichen Speech to Text-Service auf. Diese Informationen könnten hilfreich für Sie sein, falls Sie bereits mit dem Speech to Text-Service in der öffentlichen IBM Cloud vertraut sind.

  • Speech to Text for IBM Cloud Pak for Data verwendet Zugriffstoken für die Authentifizierung. Weitere Informationen finden Sie in der API-& SDK-Referenz.
  • Die Endpunkte für Speech to Text for IBM Cloud Pak for Data gelten speziell für Ihren IBM Cloud Pak for Data-Cluster. Weitere Informationen finden Sie in der API-& SDK-Referenz.
  • Speech to Text for IBM Cloud Pak for Data führt keine Protokollierung von Anforderungen durch. Sie müssen den Anforderungsheader X-Watson-Learning-Opt-Out nicht verwenden.
  • Speech to Text for IBM Cloud Pak for Data unterstützt keine Watson-Tokens. Die Verwendung des Anforderungsheaders X-Watson-Authorization-Token für die Authentifizierung beim Service ist nicht möglich.