Sprachen und Modelle der vorherigen Generation
Ab dem 1. August 2023 werden alle Modelle der vorherigen Generation für den Service eingestellt. Neue Clients dürfen jetzt nur die Modelle der nächsten Generation verwenden. Alle vorhandenen Clients müssen jetzt auf das entsprechende Modell der nächsten Generation migrieren. Weitere Informationen finden Sie unter Migration auf Modelle der nächsten Generation.
Der Service IBM Watson® Speech to Text unterstützt die Spracherkennung mit Modellen der vorherigen Generation in vielen Sprachen. Das Modell gibt an, in welcher Sprache das Audiomaterial gesprochen wird und mit welcher Abtastrate es erfasst wird.
Die auf dieser Seite beschriebenen Modelle werden als Modelle der vorherigen Generation bezeichnet. Der Service bietet außerdem Modelle der nächsten Generation mit erweiterten Qualitätsmerkmalen für eine verbesserte Spracherkennung an. Weitere Informationen finden Sie unter Sprachen und Modelle der nächsten Generation.
Modelltypen der vorherigen Generation
Für die meisten Sprachen stellt der Service zwei Modelltypen der vorherigen Generation zur Verfügung:
- Schmalbandmodelle sind für Audiodaten mit einer Abtastrate von mindestens 8 kHz vorgesehen. Verwenden Sie Schmalbandmodelle bei der Offline-Decodierung von Telefongesprächen (der typische Anwendungszweck für diese Abtastrate).
- Breitbandmodelle sind für Audiodaten mit einer Abtastrate von mindestens 16 kHz vorgesehen. Verwenden Sie Breitbandmodelle für reaktionsfähige echtzeitorientierte Anwendungen (z. B. Anwendungen für Live-Aufzeichnungen).
Das Auswählen des richtigen Modells für Ihre Anwendung ist von großer Bedeutung. Verwenden Sie das Modell mit derselben Abtastrate (und Sprache) wie Ihre Audiodaten. Der Service passt die Abtastrate Ihrer Audiodaten automatisch an das Modell an, das Sie angeben. Um die beste Erkennungsgenauigkeit zu erzielen, müssen Sie auch den Frequenzumfang Ihrer Audiodaten berücksichtigen. Weitere Informationen finden Sie unter Abtastrate und Audiofrequenz.
Unterstützte Sprachmodelle der vorherigen Generation
In den folgenden Abschnitten werden die verfügbaren Modelltypen der vorherigen Generation beschrieben für die einzelnen Sprachen aufgelistet. Die Tabellen in den Abschnitten enthalten die folgenden Informationen:
-
In der Spalte Modellname wird der Name des Modells angegeben.
-
In der Spalte Status wird angegeben, ob das Modell allgemein verfügbar (General Availability, GA) oder als Betaversion (Beta) verfügbar ist.
-
Empfohlenes Modell der nächsten Generation gibt an, welches Modell der nächsten Generation anstelle des veralteten Modells verwendet werden kann.
Derzeit sind nicht für alle Breitbandmodelle funktional entsprechende Multimediamodelle vorhanden. Wenn dieser Fall eintritt, sollten Sie die Verwendung des Telefoniemodells für die betreffende Sprache in Betracht ziehen. Der Service reduziert die Abtastrate auf den Wert des von Ihnen verwendeten Modells. Aus diesem Grund kann das Senden von Breitbandaudiodaten an ein Telefoniemodell eine geeignete Alternative sein, wenn noch kein entsprechendes Multimediamodell verfügbar ist.
Alle Modelle sind für beide Produktversionen (IBM Cloud und IBM Cloud Pak for Data) verfügbar.
Schmalbandmodelle
In Tabelle 1 sind die verfügbaren Schmalbandmodelle der vorherigen Generation aufgelistet.
| Sprache | Modellname | Status | Empfohlenes Modell der nächsten Generation |
|---|---|---|---|
| Chinesisch (Mandarin) | zh-CN_NarrowbandModel |
GA Nicht weiterverwendet |
zh-CN_Telephony |
| Niederländisch (Niederlande) | nl-NL_NarrowbandModel |
GA Nicht weiterverwendet |
nl-NL_Telephony |
| Englisch (Australien) | en-AU_NarrowbandModel |
GA Nicht weiterverwendet |
en-AU_Telephony |
| Englisch (Vereinigtes Königreich) | en-GB_NarrowbandModel |
GA Nicht weiterverwendet |
en-GB_Telephony |
| Englisch (Vereinigte Staaten) | en-US_NarrowbandModel |
GA Nicht weiterverwendet |
en-US_Telephony |
en-US_ShortForm_NarrowbandModel |
GA Nicht weiterverwendet |
en-US_Telephony |
|
| Französisch (Kanada) | fr-CA_NarrowbandModel |
GA Nicht weiterverwendet |
fr-CA_Telephony |
| Französisch (Frankreich) | fr-FR_NarrowbandModel |
GA Nicht weiterverwendet |
fr-FR_Telephony |
| Deutsch | de-DE_NarrowbandModel |
GA Nicht weiterverwendet |
de-DE_Telephony |
| Italienisch | it-IT_NarrowbandModel |
GA Nicht weiterverwendet |
it-IT_Telephony |
| Japanisch | ja-JP_NarrowbandModel |
GA Nicht weiterverwendet |
ja-JP_TelephonyIBM Cloud |
| Koreanisch | ko-KR_NarrowbandModel |
GA Nicht weiterverwendet |
ko-KR_Telephony |
| Portugiesisch (Brasilien) | pt-BR_NarrowbandModel |
GA Nicht weiterverwendet |
pt-BR_Telephony |
| Spanisch (Argentinien, Beta) | es-AR_NarrowbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Kastilien) | es-ES_NarrowbandModel |
GA Nicht weiterverwendet |
es-ES_Telephony |
| Spanisch (Chile, Beta) | es-CL_NarrowbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Kolumbien, Beta) | es-CO_NarrowbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Mexiko, Beta) | es-MX_NarrowbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Peru, Beta) | es-PE_NarrowbandModel |
Beta Eingeführt |
es-LA_Telephony |
Breitbandmodelle
In Tabelle 2 sind die verfügbaren Breitbandmodelle der vorherigen Generation aufgeführt.
| Sprache | Modellname | Status | Empfohlenes Modell der nächsten Generation |
|---|---|---|---|
| Arabisch (Moderne Standardsprache) | ar-MS_BroadbandModel |
GA Nicht weiterverwendet |
ar-MS_Telephony |
| Chinesisch (Mandarin) | zh-CN_BroadbandModel |
GA Nicht weiterverwendet |
zh-CN_Telephony |
| Niederländisch (Niederlande) | nl-NL_BroadbandModel |
GA Nicht weiterverwendet |
nl-NL_Multimedia |
| Englisch (Australien) | en-AU_BroadbandModel |
GA Nicht weiterverwendet |
en-AU_Multimedia |
| Englisch (Vereinigtes Königreich) | en-GB_BroadbandModel |
GA Nicht weiterverwendet |
en-GB_Multimedia |
| Englisch (Vereinigte Staaten) | en-US_BroadbandModel |
GA Nicht weiterverwendet |
en-US_Multimedia |
| Französisch (Kanada) | fr-CA_BroadbandModel |
GA Nicht weiterverwendet |
fr-CA_Multimedia |
| Französisch (Frankreich) | fr-FR_BroadbandModel |
GA Nicht weiterverwendet |
fr-FR_Multimedia |
| Deutsch | de-DE_BroadbandModel |
GA Nicht weiterverwendet |
de-DE_Multimedia |
| Italienisch | it-IT_BroadbandModel |
GA Nicht weiterverwendet |
it-IT_Multimedia |
| Japanisch | ja-JP_BroadbandModel |
GA Nicht weiterverwendet |
ja-JP_Multimedia |
| Koreanisch | ko-KR_BroadbandModel |
GA Nicht weiterverwendet |
ko-KR_Multimedia |
| Portugiesisch (Brasilien) | pt-BR_BroadbandModel |
GA Nicht weiterverwendet |
pt-BR_Multimedia |
| Spanisch (Argentinien, Beta) | es-AR_BroadbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Kastilien) | es-ES_BroadbandModel |
GA Nicht weiterverwendet |
es-ES_Multimedia |
| Spanisch (Chile, Beta) | es-CL_BroadbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Kolumbien, Beta) | es-CO_BroadbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Mexiko, Beta) | es-MX_BroadbandModel |
Beta Eingeführt |
es-LA_Telephony |
| Spanisch (Peru, Beta) | es-PE_BroadbandModel |
Beta Eingeführt |
es-LA_Telephony |
Kurzformmodell für amerikanisches Englisch (veraltet)
Das Kurzformmodell für amerikanisches Englisch (en-US_ShortForm_NarrowbandModel) kann die Spracherkennung in Lösungen für Interactive-Voice-Response (IVR) und automatisierte Kundenunterstützung verbessern. Das Training für das Kurzformmodell
ist darauf abgestimmt, kurze Äußerungen zu erkennen, die in Umgebungen für Kundenunterstützung wie einem automatisierten Call-Center häufig vorkommen. Das Modell wurde nicht nur generell für kurze Äußerungen optimiert, sondern auch für präzise
Äußerungen wie Ziffern, Wörter und Namen aus einzelnen Buchstaben und Ja/Nein-Antworten.
Das Modell en-US_ShortForm_NarrowbandModel eignet sich optimal für die Arten von Antworten, die beim Austausch von Mensch zu Maschine üblich ist, wie zum Beispiel im Anwendungsfall von IBM® Voice Agent with Watson. en-US_NarrowbandModel eignet sich in der Regel optimal für Gespräche zwischen Menschen. Je nach Anwendungsfall und Art des Austauschs finden einige Nutzer jedoch möglicherweise, das sich das Kurzformmodell ebenfalls für Gespräche zwischen Menschen eignet. Angesichts
dieser Flexibilität und Überlappung könnten Sie mit beiden Modellen experimentieren, um herauszufinden, welches sich am besten für Ihre Anwendung eignet. In beiden Fällen kann die Anwendung eines angepassten Sprachmodells mit einer Grammatik
auf das Kurzformmodell die Erkennungsergebnisse weiter verbessern.
Wie bei allen Modellen können Umgebungen mit hohem Rauschanteil die Erkennungsergebnisse beeinträchtigen. Beispiel: Hintergrundgeräusche in Flughäfen, fahrenden Fahrzeugen und Konferenzräumen sowie mehrere beteiligte Sprecher können die Transkriptionsgenauigkeit verringern. Die Audioausgabe von Lautsprechertelefonen kann durch Rückkopplungen (Echo) ebenfalls die Erkennungsgenauigkeit beeinträchtigen. Die Verwendung von Parametern, die für die Sprechaktivitätserkennung zur Verfügung stehen, kann solche Effekte neutralisieren und zur Verbesserung der Genauigkeit bei der Sprachtranskription beitragen. Die Anwendung eines angepassten Akustikmodells kann jedoch nur als letzte Maßnahme die Akustikdaten für die Spracherkennung weiter optimieren.
- Weitere Informationen zur Anpassung von Sprachmodellen und Akustikmodellen finden Sie unter Anpassung verstehen.
- Weitere Informationen zu Grammatiken finden Sie im Abschnitt Grammatiken mit angepassten Sprachmodellen verwenden.
- Weitere Informationen zu Parametern für die Erkennung von Sprechaktivitäten finden Sie unter Sprechaktivitätserkennung.
Unterstützte Funktionen für Modelle der vorherigen Generation
Modelle der vorherigen Generation werden zur Verwendung mit fast allen Funktionen des Service unterstützt. Die meisten Funktionen und Modelle sind für die Verwendung in Produktionsumgebungen allgemein verfügbar. Einige Funktionen und Modelle werden als Betaversionen bereitgestellt (falls angegeben). Für einige Funktionen gelten Einschränkungen, z. B. die folgenden:
- Funktionen wie Sprecherbezeichnungen, Zahlenschwärzung und Filter für Vulgärsprache sind auf bestimmte Sprachen und Modelle beschränkt. Auf diese Einschränkungen wird in den Beschreibungen der betreffenden Funktionen hingewiesen. Weitere Informationen zu allen verfügbaren Spracherkennungsparametern finden Sie in der Parameterübersicht.
- Der Parameter
low_latencywird nur für Modelle der nächsten Generation unterstützt. Weitere Informationen finden Sie unter Geringe Latenzzeit. - Weitere Informationen zur Unterstützung von Modellen der früheren Generation für die Anpassung finden Sie unter Anpassungsunterstützung für Modelle der früheren Generation.
Wenn eine Funktion als allgemein verfügbar oder für eine bestimmte Sprache oder mehrere Sprachen verfügbar beschrieben wird, unterstützt sie die Modelle der vorherigen Generation.