Migration auf große Sprachmodelle
Ab dem 1. August 2023 werden alle Modelle der vorherigen Generation für den Service eingestellt. Neue Clients müssen jetzt nur die großen Sprachmodelle oder Modelle der nächsten Generation verwenden. Alle vorhandenen Clients müssen jetzt auf das entsprechende große Sprachmodell oder das Modell der nächsten Generation migrieren. Weitere Informationen finden Sie unter Migration auf große Sprachmodelle.
Sie müssen bis zum 31. Juli 2023, dem Datum des Auslaufens des Dienstes, alle veralteten Modelle der vorherigen Generation auf die gleichwertigen Großsprachmodelle oder Modelle der nächsten Generation umstellen. Modelle der nächsten Generation bietet deutlich mehr Transkriptionsgenauigkeit und Durchsatz. Sie bieten derzeit einen etwas geringeren Funktionsumfang als Modelle der vorherigen Generation.
Dieser Abschnitt enthält eine Übersicht über die erforderlichen Schritte für die Migration von Modellen der vorherigen Generation auf Modelle der nächsten Generation. Weitere Informationen zur Migration finden Sie auch unter Watson Speech to Text: Wie Sie Ihre Migration auf die Modelle der nächsten Generation planen.
Schritt 1: Großes Sprachmodell oder Modell der nächsten Generation angeben, auf das migriert werden soll
Die folgenden Themen beschreiben alle großen Sprachmodelle, Modelle der vorherigen und der nächsten Generation:
- Sprachen und Modelle der vorherigen Generation
- Sprachen und Modelle der nächsten Generation
- Große Sprachsprachen und Modelle
In den Tabellen der unterstützten Sprachmodelle der vorherigen Generation ist das empfohlene große Sprachmodell oder das Modell der nächsten Generation aufgeführt, auf das von einem Modell der vorherigen Generation umgestellt werden soll. Verwenden Sie das angegebene große Sprachmodell oder das Modell der nächsten Generation in Ihren Spracherkennungsanforderungen.
Der Dienst stellt weiterhin neue Großsprachmodelle zur Verfügung. Alle neuen Modelle werden in den Releaseinformationen angegeben und in den Tabellen, die die verfügbaren Modelle beschreiben.
Im optimalen Fall können Sie von einem Schmalbandmodell/Telefonmodell zu einem großen Sprachmodell und von einem Breitbandmodell/Multimedia-Modell zu einem großen Sprachmodell migrieren. Allerdings haben nicht alle Breitbandmodelle und Multimedia-Modelle gleichwertige große Sprachmodelle. In solchen Fällen können Sie von einem Schmalbandmodell zu einem Telefonmodell oder von einem Breitbandmodell zu einem Multimediamodell migrieren. Der Service reduziert die Abtastrate der von Ihnen gesendeten Audiodaten auf die Abtastrate des verwendeten Modells. Aus diesem Grund kann das Senden von Breitbandaudiodaten an ein Telefoniemodell eine geeignete Alternative sein, wenn noch kein entsprechendes Multimediamodell verfügbar ist.
Beispielsweise verwendet die folgende Spracherkennungsanforderung das en-US_NarrowbandModelmodell der vorherigen Generation:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel"
Um das entsprechende große Sprachmodell en-US zu verwenden, ändern Sie einfach den Wert, den Sie mit dem model Abfrageparameter übergeben:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US"
Schritt 2: Identifizieren Sie die Funktionen, die bei großen Sprachmodellen verfügbar sind
Große Sprachmodelle unterstützen etwas weniger Funktionen und Parameter als frühere und Modelle der nächsten Generation. Trotz dieser kleinen Unterschiede sind die meisten Funktionen jedoch in beiden Modelltypen verfügbar. Und wenn ein Merkmal auf eine Teilmenge von Sprachen beschränkt ist, gelten die Einschränkungen für alle Arten von Modellen gleichermaßen.
Informationen zu den Funktionen, die von den verschiedenen Modelltypen unterstützt werden, finden Sie in den folgenden Abschnitten:
- Unterstützte Funktionen für Modelle der vorherigen Generation
- Unterstützte Funktionen für Modelle der nächsten Generation
- Unterstützte Funktionen für große Sprachmodelle
- Parameterübersicht
Der Service stellt weitere neue Funktionen für Modelle der nächsten Generation bereit, sobald sie verfügbar sind. Alle Aktualisierungen für unterstützte Funktionen sind in den Releaseinformationen und in der Dokumentation für die Modelltypen dokumentiert.
Für die Migration auf Modelle der nächsten Generation müssen Sie Funktionen, die von Modellen der nächsten Generation nicht unterstützt werden, aus Ihren Spracherkennungsanforderungen entfernen. Sie können auch die Verwendung von Features wie Zeicheneinfügeverzerrung in Betracht ziehen, die nur bei großen Sprachmodellen und Modellen der nächsten Generation verfügbar sind.
In der folgenden Spracherkennungsanforderung werden beispielsweise der Parameter profanity_filter, redaction und word_alternatives_threshold mit dem Modell en-US_NarrowbandModel der vorherigen
Generation verwendet:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&profanity_filter=true&redaction=true&word_alternatives_threshold=0.50"
Nur der Parameter word_alternatives_threshold wird von großen Sprachmodellen nicht unterstützt. Um das entsprechende große Sprachmodell en-US_Telephony zu verwenden, ändern Sie einfach den Wert, den Sie mit dem model Abfrageparameter übergeben, und eliminieren den word_alternatives_threshold Parameter:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US&profanity_filter=true&redaction=true"
Schritt 3: Verwendete angepasste Sprachmodelle erneut erstellen
Sie müssen alle benutzerdefinierten Sprachmodelle, die auf Modellen der vorherigen oder der nächsten Generation beruhen, neu erstellen, indem Sie sie auf die entsprechenden großen Sprachmodelle stützen. Dazu müssen Sie ein neues benutzerdefiniertes Sprachmodell erstellen und Ihre Korpora und benutzerdefinierten Wörter aus dem alten Modell zum neuen Modell hinzufügen.
Im Allgemeinen stützen sich große Sprachmodelle nicht so stark auf individuelle Sprachmodelle. Sie arbeiten mit einem Konzept für die Transkription, das in möglichst geringem Umfang auf die Sprachmodellanpassung zurückgreift.
Große Sprachmodelle unterstützen keine benutzerdefinierten akustischen Modelle. Da diese Modelle Audiodaten transkribieren, ist keine Akustikmodellanpassung erforderlich.
In der folgenden Spracherkennungsanforderung wird zum Beispiel ein angepasstes Sprachmodell verwendet, das auf en-US_NarrowbandModel basiert. In diesem Beispiel hat das angepasste Modell die ID 8acf31fa-0aa2-4ecc-a805-1f527f342dba.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&language_customization_id=8acf31fa-0aa2-4ecc-a805-1f527f342dba"
Nachdem Sie das angepasste Sprachmodell mit dem entsprechenden en-USmodell erneut erstellt haben, ändern Sie einfach den Modellnamen in en-US und den Parameter language_customization_ID, damit die ID des
neuen angepassten Modells 636d8494-7e53-436a-8557-30d6b2a63cd7 verwendet wird:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US&language_customization_id=636d8494-7e53-436a-8557-30d6b2a63cd7"
Schritt 4: Bewerten Sie die Ergebnisse des großen Sprachmodells
Sobald Sie Ihre Spracherkennungsanforderungen aktualisiert haben, um große Sprachmodelle zu verwenden, nicht unterstützte Parameter eliminiert und alle benutzerdefinierten Sprachmodelle neu erstellt haben, können Sie mit der Spracherkennung auf der Grundlage von Modellen der vorherigen und der nächsten Generation experimentieren. Vergleichen Sie die resultierenden Transkripte, um festzustellen, ob das große Sprachmodell gleichwertige oder bessere Ergebnisse liefert. Berücksichtigen Sie auch die Leistung von Anfragen, die große Sprachmodelle verwenden, um festzustellen, wie viel schneller Sie Ergebnisse erhalten.
Sie können auch die Wortfehlerrate der großen Sprachmodelle sowie die Ergebnisse der vorherigen und der nächsten Generation vergleichen. Mit dem Open-Source-Dienstprogramm Word Error Rate(WER), das in Python verfügbar ist, können Sie die Genauigkeit Ihrer Ergebnisse messen und vergleichen.