대형 음성 모델로 마이그레이션
2023년 8월 1일부터 모든 이전 세대 모델은 이제 서비스에서 중단 됩니다. 이제 새 고객은 대형 음성 모델 또는 차세대 모델만 사용해야 합니다. 모든 기존 클라이언트는 이제 동등한 대형 음성 모델 또는 차세대 모델로 마이그레이션해야 합니다. 자세한 정보는 대형 음성 모델로 마이그레이션 을 참조하십시오.
더 이상 사용되지 않는 이전 세대 모델의 경우 서비스 종료일인 2023년 7월 31일까지 동급의 대형 음성 모델 또는 차세대 모델로 마이그레이션해야 합니다. 차세대 모델은 상당히 향상된 변환 정확도와 처리량을 제공합니다. 그러나 현재는 이전 세대 모델보다 약간 적은 기능을 제공합니다.
이 주제에서는 이전 세대 모델에서 차세대 모델로 마이그레이션하는 데 필요한 단계에 대한 개요를 제공합니다. 마이그레이션에 대한 자세한 내용은 Watson Speech to Text: How to Plan Your Migration to the Next-Generation Models 참조하세요.
1단계: 마이그레이션할 대형 음성 모델 또는 차세대 모델 식별
다음 주제에서는 모든 대형 음성 모델, 이전 및 차세대 모델에 대해 설명합니다:
지원되는 이전 세대 언어 모델의 표에는 이전 세대 모델에서 마이그레이션할 수 있는 권장되는 대규모 음성 모델 또는 차세대 모델이 나와 있습니다. 음성 인식 요청에 표시된 대형 음성 모델 또는 차세대 모델을 사용하십시오.
이 서비스는 계속해서 새로운 대용량 음성 모델을 제공하고 있습니다. 모든 새 모델은 릴리스 정보, 그리고 사용 가능한 모델을 설명하는 표에 식별되어 있습니다.
협대역 모델/전화 통신 모델에서 대형 음성 모델로, 광대역 모델/멀티미디어 모델에서 대형 음성 모델로 마이그레이션하는 것이 가장 좋습니다. 그러나, 모든 광대역 모델들 및 멀티미디어 모델들이 동등한 대형 스피치 모델들을 갖는 것은 아니다. 이러한 경우 협대역 모델에서 전화 통신 모델로 또는 광대역 모델에서 멀티미디어 모델로 마이그레이션할 수 있습니다. 이 서비스는 전송되는 오디오를 사용자가 사용하는 모델의 비율로 다운샘플링합니다. 따라서, 현재 사용 가능한 동등한 멀티미디어 모델이 없는 경우에는 광대역 오디오를 전화 통신 모델에 전송하는 것이 충분한 대안일 수 있습니다.
예를 들면, 다음 음성 인식 요청은 이전 세대 en-US_NarrowbandModel을(를) 사용합니다.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel"
동등한 대형 음성 모델 en-US 을 사용하려면 model 쿼리 매개변수로 전달한 값을 변경하기만 하면 됩니다:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path}audio-file.flac \
"{url}/v1/recognize?model=en-US"
2단계: 대규모 음성 모델에서 사용할 수 있는 기능 파악하기
대형 음성 모델은 이전 및 차세대 모델보다 약간 더 적은 기능 및 매개변수를 지원합니다. 둘은 완전히 동등하진 않지만, 대부분의 기능은 두 유형의 모델 모두에서 사용할 수 있습니다. 그리고 기능이 언어의 하위 집합으로 제한되는 경우 모든 유형의 모델에 동일하게 제한이 적용됩니다.
각 모델 유형에서 지원되는 기능에 대한 정보는 다음 항목을 참조하십시오.
이 서비스에서는 차세대 모델에서 사용할 수 있는 새 기능을 계속해서 제공하고 있습니다. 기능 지원에 대한 모든 업데이트는 릴리스 정보와 모델 유형에 대한 문서에 설명되어 있습니다.
차세대 모델로 마이그레이션하려면 음성 인식 요청에서 차세대 모델이 지원하지 않는 기능을 제거해야 합니다. 또한 대형 음성 모델 및 차세대 모델에서만 사용 가능한 문자 삽입 편향성과 같은 기능을 사용하는 것을 고려할 수 있습니다.
예를 들면, 다음 음성 인식 요청은 profanity_filter, redaction 및 word_alternatives_threshold 매개변수를 이전 세대 en-US_NarrowbandModel(과)와 함께 사용합니다.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&profanity_filter=true&redaction=true&word_alternatives_threshold=0.50"
대형 음성 모델에서는 word_alternatives_threshold 매개변수만 지원되지 않습니다. 동등한 대형 음성 모델 en-US_Telephony 모델을 사용하려면 model 쿼리 매개 변수로 전달한 값을 변경하고 word_alternatives_threshold 매개 변수를 제거하기만 하면 됩니다:
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @{path_to_file}audio-file.flac \
"{url}/v1/recognize?model=en-US&profanity_filter=true&redaction=true"
3단계: 사용하는 모든 사용자 정의 언어 모델을 다시 작성
이전 세대 또는 차세대 모델을 기반으로 하는 모든 사용자 지정 언어 모델을 동등한 대형 음성 모델을 기반으로 다시 만들어야 합니다. 이를 위해서는 새 사용자 지정 언어 모델을 만들고 말뭉치 및 사용자 지정 단어를 이전 모델에서 새 모델에 추가해야 합니다.
일반적으로 대규모 음성 모델은 사용자 지정 언어 모델에 크게 의존하지 않습니다. 이는 언어 모델 사용자 정의의 필요성을 최소화하는 다른 변환 접근법을 사용합니다.
대형 음성 모델은 사용자 지정 음향 모델을 지원하지 않습니다. 이들 모델이 오디오를 변환하는 방식으로 인해, 음향 모델 사용자 정의는 더 이상 필요하지 않습니다.
예를 들면, 다음 음성 인식 요청은 en-US_NarrowbandModel을(를) 기반으로 하는 사용자 정의 언어 모델을 사용합니다. 이 예에서 해당 사용자 정의 모델의 ID는 8acf31fa-0aa2-4ecc-a805-1f527f342dba입니다.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US_NarrowbandModel&language_customization_id=8acf31fa-0aa2-4ecc-a805-1f527f342dba"
동등한 en-US 모델을 사용하여 사용자 정의 언어 모델을 다시 작성한 후에는 모델 이름을 en-US(으)로 업데이트하고, language_customization_ID 매개변수가 새 사용자 정의 모델의 ID인 636d8494-7e53-436a-8557-30d6b2a63cd7을(를) 사용하도록 업데이트하기만 하면 됩니다.
curl -X POST -u "apikey:{apikey}" \
--header "Content-Type: audio/flac" \
--data-binary @audio-file.flac \
"{url}/v1/recognize?model=en-US&language_customization_id=636d8494-7e53-436a-8557-30d6b2a63cd7"
4단계: 대규모 음성 모델 결과 평가하기
대규모 음성 모델을 사용하도록 음성 인식 요청을 업데이트하고, 지원되지 않는 매개변수를 제거하고, 사용자 지정 언어 모델을 다시 만든 후에는 이전 모델과 차세대 모델을 기반으로 음성 인식을 실험해 볼 수 있습니다. 결과 스크립트를 비교하여 대용량 음성 모델이 동등한 또는 더 나은 결과를 생성하는지 확인합니다. 또한 대용량 음성 모델을 사용하는 요청의 성능을 고려하여 결과를 얼마나 빨리 받을 수 있는지 결정하세요.
또한 대규모 음성 모델의 단어 오류율과 이전 세대 및 차세대 결과를 비교할 수도 있습니다. Python 사용할 수 있는 오픈 소스 단어 오류율(WER)유틸리티를 사용하면 결과의 정확도를 측정하고 비교할 수 있습니다.