Wissenswertes über die Anpassung

Der IBM Watson® Speech to Text-Service bietet eine Anpassungsschnittstelle, mit deren Hilfe Sie die Spracherkennungsfunktionalität des Service erweitern können. Durch eine Anpassung können Sie die Genauigkeit von Spracherkennungsanforderungen verbessern, indem Sie ein Basismodell für Ihr Fachgebiet und Ihre Audiodaten anpassen.

Die Anpassungsschnittstelle unterstützt sowohl angepasste Sprachmodelle als auch angepasste Akustikmodelle. Die Schnittstellen für die beiden Typen von angepassten Modellen sind ähnlich und unkompliziert zu verwenden. Auch die Verwendung der beiden Typen von angepassten Modellen bei einer Erkennungsanforderung ist einfach - Sie müssen lediglich die Anpassungs-ID des Modells zusammen mit der Anforderung angeben.

Die Spracherkennung funktioniert mit oder ohne angepasstes Modell identisch. Wenn Sie ein angepasstes Modell für die Spracherkennung nutzen, können Sie alle Parameter verwenden, die normalerweise für eine Erkennungsanforderung verfügbar sind. Zusätzliche Angaben über alle verfügbaren Parameter enthält der Abschnitt Parameterübersicht.

IBM Cloud Sie müssen über den Plus-, Standard- oder Premium-Preisplan verfügen, um die Anpassung des Sprachmodells oder des akustischen Modells nutzen zu können. Benutzer des Preistarifs Lite können die Anpassungsschnittstelle nicht verwenden. Diese Benutzer können jedoch ein Upgrade auf den Preistarif Plus durchführen, um Zugriff auf die Anpassung zu erhalten. Weitere Informationen finden Sie unter Häufig gestellte Fragen zur Preisstruktur.

Sprachmodellanpassung

Weitere Informationen zu den Sprachen und Modellen, die die Sprachmodellanpassung unterstützen, und ihrer Unterstützungsstufe (allgemein verfügbar oder Betaversion) finden Sie unter Sprachunterstützung für die Anpassung.

Der Service wurde für eine breite und allgemeine Zielgruppe entwickelt. Das Grundvokabular des Service enthält viele Wörter aus der Alltagssprache. Seine Modelle bieten für viele Anwendungen eine ausreichend genaue Erkennung. Möglicherweise kennen die Modelle jedoch spezielle Begriffe aus bestimmten Fachgebieten nicht.

Die Schnittstelle für die Sprachmodellanpassung kann die Genauigkeit der Spracherkennung bei Fachgebieten wie Medizin, Recht, Informationstechnologie usw. verbessern. Mithilfe der Sprachmodellanpassung können Sie das Vokabular eines Basismodells durch die Aufnahme von fachspezifischer Terminologie erweitern und anpassen.

Sie erstellen ein angepasstes Sprachmodell und fügen dann spezielle Korpora und Wörter für Ihr Fachgebiet hinzu. Sobald das angepasste Sprachmodell mit Ihrem erweiterten Vokabular trainiert wurde, können Sie es für die angepasste Spracherkennung nutzen. Der Service kann normalerweise jedes angepasste Modell in nur wenigen Minuten trainieren. Wieviel Zeit und Aufwand zum Erstellen eines angepassten Modells erforderlich sind, hängt von den Daten ab, die für das Modell verfügbar sind.

Die Anpassung von Sprachmodellen ist für große Sprachmodelle, Modelle der vorherigen Generation und Modelle der nächsten Generation verfügbar, funktioniert jedoch bei großen Sprachmodellen, Modellen der vorherigen und Modellen der nächsten Generation unterschiedlich. Die Unterschiede werden in der Dokumentation beschrieben. Weitere Informationen zur Einführung in die Sprachmodellanpassung finden Sie unter

Verbesserte Sprachmodellanpassung für Modelle der nächsten Generation

Die Sprachmodellanpassung für Modelle der nächsten Generation wird erweitert. Die Verbesserungen der Sprachmodellanpassung werden schrittweise auf Modelle der nächsten Generation angewendet, beginnend mit den Modellen für einige Sprachen. Mit der Zeit werden weitere Sprachmodelle der nächsten Generation auf die verbesserte Technologie migriert.

  • Um Modelle zu ermitteln, die die verbesserte Technologie verwenden, suchen Sie nach einem Datum in der Spalte Sprachmodellanpassung (verbessert) der Tabelle 2 in Anpassungsunterstützung für Modelle der nächsten Generation. Suchen Sie nach einem Datum für die Version des Dienstes, die Sie verwenden, IBM Cloud, IBM Software Hub oder IBM Cloud Pak for Data. Dieses Datum zeigt an, wann das Modell der nächsten Generation auf die verbesserte Technologie migriert wurde.
  • Um die Vorteile der verbesserten Technologie nutzen zu können, müssen Sie alle angepassten Sprachmodelle aktualisieren, die auf einem verbesserten Modell der nächsten Generation basieren. Sobald ein angepasstes Modell auf einem verbesserten Modell der nächsten Generation basiert, führt der Service alle erforderlichen Upgrades durch, wenn das angepasste Modell erneut trainiert wird. Weitere Informationen finden Sie unter Upgrade eines angepassten Sprachmodells auf der Basis eines verbesserten Modells der nächsten Generation durchführen.

Für Sprachmodelle, die auf der neuen Technologie basieren, wurden die folgenden Parameter für eine verbesserte Spracherkennung optimiert:

  • Der Standardwert customization_weight wurde von 0.2 in 0.1 geändert. Eine vom Standard abweichende customization_weight-Instanz, die Sie zuvor Ihren angepassten Modellen zugeordnet hatten, wird entfernt. Weitere Informationen finden Sie im Abschnitt Anpassungsgewichtung verwenden.
  • Der Standardwert character_insertion_bias bleibt 0.0, aber die Modelle wurden auf eine Weise geändert, die die Verwendung des Parameters für die Spracherkennung weniger erforderlich macht. Weitere Informationen finden Sie unter Zeicheneinfügeverzerrung.

Beachten Sie bei der Arbeit mit diesen Parametern die folgenden Richtlinien:

  • Wenn Sie die Standardwerte für diese Parameter verwenden, fahren Sie damit fort. Die Standardwerte bieten wahrscheinlich weiterhin die besten Ergebnisse für die Spracherkennung.
  • Wenn Sie für diese Parameter vom Standard abweichende Werte angeben, experimentieren Sie mit den Standardwerten. Ihr angepasstes Modell funktioniert möglicherweise gut für die Spracherkennung mit den Standardwerten.
  • Wenn Sie der Meinung sind, dass die Verwendung unterschiedlicher Werte für diese Parameter die Spracherkennung mit Ihrem angepassten Modell verbessern könnte, experimentieren Sie mit inkrementellen Änderungen, um festzustellen, ob die Parameter zur Verbesserung der Spracherkennung erforderlich sind.

Unterstützte Sprachmodelle der nächsten Generation:

  • RNNT_CUSTOMIZATION_SUPPORTED_LANGS =
    • de-DE_Multimedia
    • DE-DE_Multimedia
    • de-AU_Multimedia
    • de-in-Multimedia
    • de-DE_Telefonie
    • en-GB-Telefonie
    • de-AU_Telefonie
    • en-IN_Telefonie
    • Ja-JP_Multimedia
    • Ja-JP_Telefonie
    • fr-FR-Multimedia
    • fr-FR_Telefonie
    • de-DE-Multimedia
    • deDE_Telefonie
    • fr-CA_Multimedia
    • pt-BR_Multimedia
    • pt-BR_Telefonie

Akustikmodellanpassung

Die Akustikmodellanpassung ist nur für Modelle der vorherigen Generation verfügbar. Es ist nicht für große Sprachmodelle und Modelle der nächsten Generation verfügbar.

Der Service wurde mit akustischen Basismodellen entwickelt, die für unterschiedliche Audiomerkmale geeignet sind. In Fällen wie den Folgenden können Sie jedoch die Spracherkennung verbessern, indem Sie ein Grundmodell an Ihre Audiodaten anpassen:

  • Die Umgebung Ihres akustischen Kanals ist sehr speziell. Beispiele hierfür sind eine laute Umgebung, eine suboptimale Qualität oder Positionierung des Mikrofons oder eine Beeinträchtigung des Tons durch Fernfeldeffekte.
  • Die Sprechmuster der Redner sind atypisch. Beispiele hierfür sind ein ungewöhnlich schnell redender Sprecher oder Hintergrundgespräche in den Audiodaten.
  • Die Redner sprechen mit Akzent. Beispiele hierfür sind Sprecher, die nicht in ihrer Muttersprache bzw. einer Fremdsprache reden.

Die Schnittstelle für die Akustikmodellanpassung kann ein Basismodell an die Umgebung und die Sprecher anpassen. Sie erstellen zunächst ein angepasstes Akustikmodell und fügen dann Audiodaten (Audioressourcen) hinzu, die den akustischen Gegebenheiten der Audiodaten, die Sie transkribieren wollen, möglichst nahe kommen. Sobald das angepasste Akustikmodell mit Ihren Audioressourcen trainiert wurde, können Sie es für die angepasste Spracherkennung nutzen.

Wie lange der Service zum Trainieren des angepassten Modells benötigt, ist vom Umfang der im Modell enthaltenen Audiodaten abhängig. Normalerweise dauert das Training doppelt so lang wie die kumulierten Audiodaten. Wieviel Zeit und Aufwand zum Erstellen eines angepassten Modells erforderlich sind, hängt von den Daten ab, die für das Modell verfügbar sind. Außerdem ist von Bedeutung, ob Sie Transkriptionen der Audiodaten verwenden.

Weitere Informationen zur Einführung in die Akustikmodellanpassung finden Sie unter

Grammatiken

Weitere Informationen zu den Sprachen und Modellen, die Grammatiken unterstützen, und zu ihrer Unterstützungsstufe (allgemein verfügbar oder Betaversion) finden Sie unter Sprachunterstützung für die Anpassung.

Durch angepasste Sprachmodelle können Sie das Grundvokabular des Service erweitern. Mithilfe von Grammatiken können Sie die Wörter eingrenzen, die der Service aus diesem Vokabular erkennen kann. Wenn Sie zusammen mit einem angepassten Sprachmodell für die Spracherkennung eine Grammatik verwenden, kann der Service ausschließlich Wörter, Ausdrücke und Zeichenfolgen erkennen, die von der Grammatik erkannt werden. Da die Grammatik einen begrenzten Suchbereich für gültige Übereinstimmungen definiert, kann der Service Ergebnisse schneller und präziser liefern.

Sie fügen eine Grammatik zu einem angepassten Sprachmodell hinzu und trainieren das Modell dann genauso wie für einen Korpus. Anders als bei einem Korpus müssen Sie jedoch explizit angeben, dass während der Spracherkennung eine Grammatik mit einem angepassten Modell verwendet werden soll.

Grammars ist nur für Modelle der vorherigen und der nächsten Generation verfügbar. Für große Sprachmodelle ist es nicht verfügbar.

Weitere Informationen zur Einführung in Grammatiken finden Sie unter

Akustik- und Sprachanpassung kombiniert verwenden

Die gemeinsame Verwendung von Akustik- und Sprachanpassung gilt nur für Modelle der vorherigen Generation. Einige Modelle der vorherigen Generation bieten keine Unterstützung für die gemeinsame Verwendung von Sprach- und Akustikanpassung.

Schon die Verwendung eines angepassten Akustikmodells kann die Erkennungfunktionalität des Service verbessern. Falls jedoch für Ihre Beispielaudiodaten Transkriptionen oder zugehörige Korpora verfügbar sind, können Sie diese Daten nutzen, um die Qualität der Spracherkennung ausgehend vom angepassten Akustikmodell weiter zu verbessern.

Durch die Erstellung eines angepassten Sprachmodells, das Ihr angepasstes Akustikmodell ergänzt, können Sie die Spracherkennung verbessern, indem Sie beide Modelle zusammen einsetzen. Wenn Sie ein angepasstes Akustikmodell trainieren, können Sie ein angepasstes Sprachmodell angeben, das Transkriptionen der Audioressourcen oder ein Vokabular von fachspezifischen Wörtern in den Ressourcen enthält. Beim Transkribieren von Audiodaten akzeptiert der Service analog ein angepasstes Sprachmodell und/oder ein angepasstes Akustikmodell. Und falls Ihr angepasstes Sprachmodell eine Grammatik beinhaltet, können Sie dieses Modell und seine Grammatik zusammen mit einem angepassten Akustikmodell für die Spracherkennung verwenden.

Weitere Informationen finden Sie unter "Gemeinsame Verwendung benutzerdefinierter akustischer und Sprachmodelle"

Upgrade für angepasste Modelle durchführen

Um die Qualität der Spracherkennung zu verbessern, aktualisiert der Dienst gelegentlich große Sprachmodelle, Modelle der vorherigen und der nächsten Generation. Die Aktualisierung eines Basismodells wirkt sich nur auf das betreffende Modell aus. Die Aktualisierung hat keine Auswirkungen auf andere Modelle derselben Sprache oder unterschiedlicher Sprachen.

Beim Aktualisieren eines Basismodells ist möglicherweise auch ein Upgrade für die angepassten Modelle erforderlich, die auf diesem Basismodell basieren, um von den Verbesserungen zu profitieren. Die Aktualisierung eines Basismodells, für die ein Upgrade erforderlich ist, erzeugt eine neue Version des Basismodells. Eine Aktualisierung, für die kein Upgrade erforderlich ist, erzeugt keine neue Version.

  • Modelle der vorherigen Generation: Durch jede Aktualisierung eines Basismodells wird eine neue Version des Modells erzeugt. Wenn eine neue Version eines Basismodells freigegeben wird, müssen Sie für alle angepassten Sprach- und Akustikmodelle, die auf dem aktualisierten Basismodell basieren, ein Upgrade durchführen, um die Verbesserungen nutzen zu können.
  • Bei großen Sprachmodellen und Modellen der nächsten Generation führen die meisten Aktualisierungen nicht zu einer neuen Version des Modells. Für solche Aktualisierungen ist kein Upgrade Ihrer angepassten Modelle erforderlich. Für manche Aktualisierungen wird jedoch eine neue Version des Basismodells generiert. Sie müssen alle angepassten Sprachmodelle aktualisieren, die auf dem aktualisierten Basismodell basieren, um die Vorteile der Verbesserungen nutzen zu können.

In den Releaseinformationen werden alle Aktualisierungen für Basismodelle und die dafür erforderlichen Upgrades angekündigt.

Nach dem Upgrade eines angepassten Modells verwendet der Service standardmäßig die neueste Version des angepassten Modells, wenn Sie dieses Modell in einer Spracherkennungsanforderung angeben. Sie können den Service jedoch anweisen, die frühere Version des Modells zu verwenden. Weitere Informationen zu Upgrades für angepasste Modellen und zur Verwendung einer früheren Version eines Modells finden Sie unter