Sprachen und Modelle der vorherigen Generation

Ab dem 1. August 2023 werden alle Modelle der vorherigen Generation für den Service eingestellt. Neue Clients dürfen jetzt nur die Modelle der nächsten Generation verwenden. Alle vorhandenen Clients müssen jetzt auf das entsprechende Modell der nächsten Generation migrieren. Weitere Informationen finden Sie unter Migration auf Modelle der nächsten Generation.

Der Service IBM Watson® Speech to Text unterstützt die Spracherkennung mit Modellen der vorherigen Generation in vielen Sprachen. Das Modell gibt an, in welcher Sprache das Audiomaterial gesprochen wird und mit welcher Abtastrate es erfasst wird.

Die auf dieser Seite beschriebenen Modelle werden als Modelle der vorherigen Generation bezeichnet. Der Service bietet außerdem Modelle der nächsten Generation mit erweiterten Qualitätsmerkmalen für eine verbesserte Spracherkennung an. Weitere Informationen finden Sie unter Sprachen und Modelle der nächsten Generation.

Modelltypen der vorherigen Generation

Für die meisten Sprachen stellt der Service zwei Modelltypen der vorherigen Generation zur Verfügung:

  • Schmalbandmodelle sind für Audiodaten mit einer Abtastrate von mindestens 8 kHz vorgesehen. Verwenden Sie Schmalbandmodelle bei der Offline-Decodierung von Telefongesprächen (der typische Anwendungszweck für diese Abtastrate).
  • Breitbandmodelle sind für Audiodaten mit einer Abtastrate von mindestens 16 kHz vorgesehen. Verwenden Sie Breitbandmodelle für reaktionsfähige echtzeitorientierte Anwendungen (z. B. Anwendungen für Live-Aufzeichnungen).

Das Auswählen des richtigen Modells für Ihre Anwendung ist von großer Bedeutung. Verwenden Sie das Modell mit derselben Abtastrate (und Sprache) wie Ihre Audiodaten. Der Service passt die Abtastrate Ihrer Audiodaten automatisch an das Modell an, das Sie angeben. Um die beste Erkennungsgenauigkeit zu erzielen, müssen Sie auch den Frequenzumfang Ihrer Audiodaten berücksichtigen. Weitere Informationen finden Sie unter Abtastrate und Audiofrequenz.

Unterstützte Sprachmodelle der vorherigen Generation

In den folgenden Abschnitten werden die verfügbaren Modelltypen der vorherigen Generation beschrieben für die einzelnen Sprachen aufgelistet. Die Tabellen in den Abschnitten enthalten die folgenden Informationen:

  • In der Spalte Modellname wird der Name des Modells angegeben.

  • In der Spalte Status wird angegeben, ob das Modell allgemein verfügbar (General Availability, GA) oder als Betaversion (Beta) verfügbar ist.

  • Empfohlenes Modell der nächsten Generation gibt an, welches Modell der nächsten Generation anstelle des veralteten Modells verwendet werden kann.

    Derzeit sind nicht für alle Breitbandmodelle funktional entsprechende Multimediamodelle vorhanden. Wenn dieser Fall eintritt, sollten Sie die Verwendung des Telefoniemodells für die betreffende Sprache in Betracht ziehen. Der Service reduziert die Abtastrate auf den Wert des von Ihnen verwendeten Modells. Aus diesem Grund kann das Senden von Breitbandaudiodaten an ein Telefoniemodell eine geeignete Alternative sein, wenn noch kein entsprechendes Multimediamodell verfügbar ist.

Alle Modelle sind für beide Produktversionen (IBM Cloud und IBM Cloud Pak for Data) verfügbar.

Schmalbandmodelle

In Tabelle 1 sind die verfügbaren Schmalbandmodelle der vorherigen Generation aufgelistet.

Unterstützte Schmalbandmodelle der vorherigen Generation
Sprache Modellname Status Empfohlenes Modell der nächsten Generation
Chinesisch (Mandarin) zh-CN_NarrowbandModel GA
Nicht weiterverwendet
zh-CN_Telephony
Niederländisch (Niederlande) nl-NL_NarrowbandModel GA
Nicht weiterverwendet
nl-NL_Telephony
Englisch (Australien) en-AU_NarrowbandModel GA
Nicht weiterverwendet
en-AU_Telephony
Englisch (Vereinigtes Königreich) en-GB_NarrowbandModel GA
Nicht weiterverwendet
en-GB_Telephony
Englisch (Vereinigte Staaten) en-US_NarrowbandModel GA
Nicht weiterverwendet
en-US_Telephony
en-US_ShortForm_NarrowbandModel GA
Nicht weiterverwendet
en-US_Telephony
Französisch (Kanada) fr-CA_NarrowbandModel GA
Nicht weiterverwendet
fr-CA_Telephony
Französisch (Frankreich) fr-FR_NarrowbandModel GA
Nicht weiterverwendet
fr-FR_Telephony
Deutsch de-DE_NarrowbandModel GA
Nicht weiterverwendet
de-DE_Telephony
Italienisch it-IT_NarrowbandModel GA
Nicht weiterverwendet
it-IT_Telephony
Japanisch ja-JP_NarrowbandModel GA
Nicht weiterverwendet
ja-JP_Telephony
IBM Cloud
Koreanisch ko-KR_NarrowbandModel GA
Nicht weiterverwendet
ko-KR_Telephony
Portugiesisch (Brasilien) pt-BR_NarrowbandModel GA
Nicht weiterverwendet
pt-BR_Telephony
Spanisch (Argentinien, Beta) es-AR_NarrowbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Kastilien) es-ES_NarrowbandModel GA
Nicht weiterverwendet
es-ES_Telephony
Spanisch (Chile, Beta) es-CL_NarrowbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Kolumbien, Beta) es-CO_NarrowbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Mexiko, Beta) es-MX_NarrowbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Peru, Beta) es-PE_NarrowbandModel Beta
Eingeführt
es-LA_Telephony

Breitbandmodelle

In Tabelle 2 sind die verfügbaren Breitbandmodelle der vorherigen Generation aufgeführt.

Unterstützte Breitbandmodelle der vorherigen Generation
Sprache Modellname Status Empfohlenes Modell der nächsten Generation
Arabisch (Moderne Standardsprache) ar-MS_BroadbandModel GA
Nicht weiterverwendet
ar-MS_Telephony
Chinesisch (Mandarin) zh-CN_BroadbandModel GA
Nicht weiterverwendet
zh-CN_Telephony
Niederländisch (Niederlande) nl-NL_BroadbandModel GA
Nicht weiterverwendet
nl-NL_Multimedia
Englisch (Australien) en-AU_BroadbandModel GA
Nicht weiterverwendet
en-AU_Multimedia
Englisch (Vereinigtes Königreich) en-GB_BroadbandModel GA
Nicht weiterverwendet
en-GB_Multimedia
Englisch (Vereinigte Staaten) en-US_BroadbandModel GA
Nicht weiterverwendet
en-US_Multimedia
Französisch (Kanada) fr-CA_BroadbandModel GA
Nicht weiterverwendet
fr-CA_Multimedia
Französisch (Frankreich) fr-FR_BroadbandModel GA
Nicht weiterverwendet
fr-FR_Multimedia
Deutsch de-DE_BroadbandModel GA
Nicht weiterverwendet
de-DE_Multimedia
Italienisch it-IT_BroadbandModel GA
Nicht weiterverwendet
it-IT_Multimedia
Japanisch ja-JP_BroadbandModel GA
Nicht weiterverwendet
ja-JP_Multimedia
Koreanisch ko-KR_BroadbandModel GA
Nicht weiterverwendet
ko-KR_Multimedia
Portugiesisch (Brasilien) pt-BR_BroadbandModel GA
Nicht weiterverwendet
pt-BR_Multimedia
Spanisch (Argentinien, Beta) es-AR_BroadbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Kastilien) es-ES_BroadbandModel GA
Nicht weiterverwendet
es-ES_Multimedia
Spanisch (Chile, Beta) es-CL_BroadbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Kolumbien, Beta) es-CO_BroadbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Mexiko, Beta) es-MX_BroadbandModel Beta
Eingeführt
es-LA_Telephony
Spanisch (Peru, Beta) es-PE_BroadbandModel Beta
Eingeführt
es-LA_Telephony

Kurzformmodell für amerikanisches Englisch (veraltet)

Das Kurzformmodell für amerikanisches Englisch (en-US_ShortForm_NarrowbandModel) kann die Spracherkennung in Lösungen für Interactive-Voice-Response (IVR) und automatisierte Kundenunterstützung verbessern. Das Training für das Kurzformmodell ist darauf abgestimmt, kurze Äußerungen zu erkennen, die in Umgebungen für Kundenunterstützung wie einem automatisierten Call-Center häufig vorkommen. Das Modell wurde nicht nur generell für kurze Äußerungen optimiert, sondern auch für präzise Äußerungen wie Ziffern, Wörter und Namen aus einzelnen Buchstaben und Ja/Nein-Antworten.

Das Modell en-US_ShortForm_NarrowbandModel eignet sich optimal für die Arten von Antworten, die beim Austausch von Mensch zu Maschine üblich ist, wie zum Beispiel im Anwendungsfall von IBM® Voice Agent with Watson. en-US_NarrowbandModel eignet sich in der Regel optimal für Gespräche zwischen Menschen. Je nach Anwendungsfall und Art des Austauschs finden einige Nutzer jedoch möglicherweise, das sich das Kurzformmodell ebenfalls für Gespräche zwischen Menschen eignet. Angesichts dieser Flexibilität und Überlappung könnten Sie mit beiden Modellen experimentieren, um herauszufinden, welches sich am besten für Ihre Anwendung eignet. In beiden Fällen kann die Anwendung eines angepassten Sprachmodells mit einer Grammatik auf das Kurzformmodell die Erkennungsergebnisse weiter verbessern.

Wie bei allen Modellen können Umgebungen mit hohem Rauschanteil die Erkennungsergebnisse beeinträchtigen. Beispiel: Hintergrundgeräusche in Flughäfen, fahrenden Fahrzeugen und Konferenzräumen sowie mehrere beteiligte Sprecher können die Transkriptionsgenauigkeit verringern. Die Audioausgabe von Lautsprechertelefonen kann durch Rückkopplungen (Echo) ebenfalls die Erkennungsgenauigkeit beeinträchtigen. Die Verwendung von Parametern, die für die Sprechaktivitätserkennung zur Verfügung stehen, kann solche Effekte neutralisieren und zur Verbesserung der Genauigkeit bei der Sprachtranskription beitragen. Die Anwendung eines angepassten Akustikmodells kann jedoch nur als letzte Maßnahme die Akustikdaten für die Spracherkennung weiter optimieren.

Unterstützte Funktionen für Modelle der vorherigen Generation

Modelle der vorherigen Generation werden zur Verwendung mit fast allen Funktionen des Service unterstützt. Die meisten Funktionen und Modelle sind für die Verwendung in Produktionsumgebungen allgemein verfügbar. Einige Funktionen und Modelle werden als Betaversionen bereitgestellt (falls angegeben). Für einige Funktionen gelten Einschränkungen, z. B. die folgenden:

  • Funktionen wie Sprecherbezeichnungen, Zahlenschwärzung und Filter für Vulgärsprache sind auf bestimmte Sprachen und Modelle beschränkt. Auf diese Einschränkungen wird in den Beschreibungen der betreffenden Funktionen hingewiesen. Weitere Informationen zu allen verfügbaren Spracherkennungsparametern finden Sie in der Parameterübersicht.
  • Der Parameter low_latency wird nur für Modelle der nächsten Generation unterstützt. Weitere Informationen finden Sie unter Geringe Latenzzeit.
  • Weitere Informationen zur Unterstützung von Modellen der früheren Generation für die Anpassung finden Sie unter Anpassungsunterstützung für Modelle der früheren Generation.

Wenn eine Funktion als allgemein verfügbar oder für eine bestimmte Sprache oder mehrere Sprachen verfügbar beschrieben wird, unterstützt sie die Modelle der vorherigen Generation.