사용자 정의 이해

IBM Watson® Speech to Text 서비스는 음성 인식 기능을 보강하는 데 사용할 수 있는 사용자 정의 인터페이스를 제공합니다. 사용자 정의를 사용하면 도메인 및 오디오의 기본 모델을 사용자 정의하여 음성 인식 요청의 정확도를 높일 수 있습니다.

사용자 정의 인터페이스는 사용자 정의 언어 모델과 사용자 정의 음향 모델을 모두 지원합니다. 두 가지 유형의 사용자 정의 모델에 대한 인터페이스는 유사하며 사용하기 쉽습니다. 두 유형 중 하나의 사용자 정의 모델을 인식 요청에 사용하는 것도 간단합니다. 요청과 함께 모델의 사용자 정의 ID를 지정합니다.

음성 인식은 사용자 정의 모델이 있는지 여부와 관계없이 동일하게 작동합니다. 음성 인식에 사용자 정의 모델을 사용하는 경우에는 일반적으로 인식 요청과 함께 사용 가능한 모든 매개변수를 사용할 수 있습니다. 사용 가능한 모든 매개변수에 대한 자세한 정보는 매개변수 요약을 참조하십시오.

IBM Cloud 언어 모델 또는 음향 모델 사용자 지정을 사용하려면 플러스, 스탠다드, 프리미엄 요금제를 사용해야 합니다. Lite 플랜의 사용자는 사용자 정의 인터페이스를 사용할 수 없지만, Plus 플랜으로 업그레이드하여 사용자 정의 기능을 이용할 수 있습니다. 자세한 정보는 가격 FAQ를 참조하십시오.

언어 모델 사용자 정의

언어 모델 사용자 정의를 지원하는 언어 및 모델과 이들의 지원 수준(GA(General Availability) 또는 베타)은 사용자 정의에 대한 언어 지원을 참조하십시오.

이 서비스는 광범위한 일반 대상을 염두에 두고 개발되었습니다. 이 서비스의 기본 어휘에는 일상적인 대화에서 사용되는 많은 단어가 포함되어 있습니다. 이 서비스의 모델은 다양한 애플리케이션에 대해 충분히 정확한 인식을 제공하지만 특정 도메인과 연관된 특정 용어에 대한 지식은 부족할 수 있습니다.

언어 모델 사용자 정의 인터페이스는 의학, 법률, 정보 기술 등과 같은 도메인에 대한 음성 인식의 정확도를 향상시킬 수 있습니다. 언어 모델 사용자 정의를 사용하여 기본 모델의 어휘를 확장하고 도메인 특정 용어를 포함하도록 사용자 조정할 수 있습니다.

사용자 정의 언어 모델을 작성하고 도메인에 특정한 말뭉치 및 단어를 추가합니다. 향상된 어휘에 대해 사용자 정의 언어 모델을 훈련한 후 사용자 정의된 음성 인식에 사용할 수 있습니다. 일반적으로 서비스는 몇 분 내에 사용자 정의 모델을 훈련할 수 있습니다. 사용자 정의 모델을 작성하는 데 필요한 시간과 노력은 모델에 사용할 수 있는 데이터에 따라 달라집니다.

언어 모델 사용자 정의는 대형 음성 모델, 이전 세대 모델, 차세대 모델에 사용할 수 있지만, 사용자 정의는 대형 음성 모델, 이전 세대 모델, 차세대 모델에 따라 다르게 작동합니다. 이 문서에서는 이 차이점에 대해 설명합니다. 언어 모델 사용자 정의를 시작하는 것에 대한 자세한 정보는 다음 항목을 참조하십시오.

차세대 모델에 대한 개선된 언어 모델 사용자 정의

차세대 모델에 대한 언어 모델 사용자 정의가 개선되고 있습니다. 언어 모델 사용자 정의에 대한 개선사항이 몇 가지 언어에 대한 모델부터 시작하여 점진적으로 차세대 모델에 적용되고 있습니다. 시간이 지남에 따라 다른 차세대 언어 모델이 개선된 기술로 마이그레이션됩니다.

  • 개선된 기술을 사용하는 모델을 식별하려면 차세대 모델에 대한 사용자 정의 지원 에 있는 표 2의 언어 모델 사용자 정의 (개선된) 열에서 날짜를 찾으십시오. 사용하는 서비스 버전의 날짜를 확인하세요 IBM Cloud, IBM Software Hub 또는 IBM Cloud Pak for Data. 이 날짜는 차세대 모델이 언제 향상된 기술로 마이그레이션되었는지를 표시합니다.
  • 개선된 기술을 활용하려면 개선된 차세대 모델을 기반으로 하는 사용자 정의 언어 모델을 업그레이드해야 합니다. 사용자 정의 모델이 개선된 차세대 모델을 기반으로 하면 서비스는 사용자 정의 모델이 재훈련될 때 필요한 업그레이드를 계속 수행합니다. 자세한 정보는 개선된 차세대 모델을 기반으로 사용자 정의 언어 모델 업그레이드 를 참조하십시오.

새 기술을 기반으로 하는 언어 모델의 경우, 다음 매개변수가 향상된 음성 인식을 위해 최적화되었습니다.

  • 기본 customization_weight0.2 에서 0.1 로 변경되었습니다. 이전에 사용자 정의 모델과 연관시킨 기본이 아닌 customization_weight 가 제거됩니다. 자세한 정보는 사용자 정의 가중치 사용을 참조하십시오.
  • 기본 character_insertion_bias0.0 로 유지되지만, 모델은 음성 인식을 위해 매개변수를 사용하는 방식으로 변경되었습니다. 자세한 정보는 문자 삽입 편향성 을 참조하십시오.

이러한 매개변수에 대해 작업할 때 다음 가이드라인을 사용하십시오.

  • 이러한 매개변수에 대해 기본값을 사용하는 경우 계속하십시오. 기본값은 음성 인식에 대한 최상의 결과를 계속 제공할 수 있습니다.
  • 이러한 매개변수에 기본값이 아닌 값을 지정하는 경우 기본값으로 실험하십시오. 사용자 정의 모델은 기본값을 사용하여 음성 인식에 대해 잘 작동할 수 있습니다.
  • 이러한 매개변수에 다른 값을 사용하면 사용자 정의 모델을 사용하여 음성 인식을 개선할 수 있다고 판단되는 경우 점진적 변경을 시도하여 음성 인식을 개선하는 데 매개변수가 필요한지 여부를 판별하십시오.

지원되는 차세대 언어 모델:

  • RNNT_CUSTOMIZATION_SUPPORTED_LANGS =
    • ko-KR_Multimedia
    • ko-GB_Multimedia
    • ko-AU_Multimedia
    • en-IN_Multimedia
    • ko-KR_Telephony
    • en-GB_Telephony
    • en-AU_Telephony
    • en-IN_Telephony
    • ja-JP_멀티미디어
    • ja-JP_Telephony
    • fr-FR_멀티미디어
    • fr-FR_Telephony
    • DDE 멀티미디어 해제
    • DE_Telephony 해제
    • fr-CA_Multimedia
    • pt-BR_멀티미디어
    • pt-BR_Telephony

음향 모델 사용자 정의

음향 모델 사용자 정의는 이전 세대 모델만 사용할 수 있습니다. 대형 음성 모델 및 차세대 모델에는 사용할 수 없습니다.

이 서비스는 다양한 오디오 특성에 대해 양호하게 작동하는 기본 음향 모델을 사용하여 개발되었습니다. 그러나 다음과 같은 경우에 기본 모델을 오디오에 맞게 조정하면 음성 인식이 개선될 수 있습니다.

  • 음향 채널 환경이 고유합니다. 예를 들어, 환경에 소음이 많거나, 마이크 품질 또는 위치가 최적이 아니거나, 오디오에 원거리 효과가 발생했습니다.
  • 화자의 음성 패턴이 비정상적입니다. 예를 들어, 화가자 비정상적으로 빠르게 말하거나 오디오에 일상적인 대화가 포함되어 있습니다.
  • 화자의 억양이 발음되었습니다. 예를 들어, 자국어가 아닌 언어 또는 제2언어로 말하는 화자가 오디오에 포함되어 있습니다.

음향 모델 사용자 정의 인터페이스는 사용자 환경 및 화자에 맞게 기본 모델을 조정할 수 있습니다. 사용자 정의 음향 모델을 작성하고 텍스트로 변환할 오디오의 음향 서명과 밀접하게 일치하는 오디오 데이터(오디오 리소스)를 추가합니다. 오디오 리소스로 사용자 정의 음향 모델을 훈련한 후 사용자 정의된 음성 인식에 사용할 수 있습니다.

서비스가 사용자 정의 모델을 훈련하는 데 걸리는 기간은 모델에 포함된 데이터의 양에 따라 다릅니다. 일반적으로 훈련에는 누적 오디오 길이의 두 배가 걸립니다. 사용자 정의 모델을 작성하는 데 필요한 시간과 노력은 모델에 사용할 수 있는 오디오 데이터에 따라 달라집니다. 오디오의 변환 사용 여부에 따라서도 달라집니다.

음향 모델 사용자 정의를 시작하는 것에 대한 자세한 정보는 다음 항목을 참조하십시오.

문법

문법을 지원하는 언어 및 모델과 이들의 지원 수준(GA(General Availability) 또는 베타)은 사용자 정의에 대한 언어 지원을 참조하십시오.

사용자 정의 언어 모델을 사용하여 서비스의 기본 어휘를 확장할 수 있습니다. 문법을 통해 서비스가 해당 어휘에서 인식할 수 있는 단어를 제한할 수 있습니다. 문법을 사용자 정의 언어 모델과 함께 음성 인식에 사용하는 경우 서비스가 문법에서 인식되는 단어, 구문 및 문자열만 인식할 수 있습니다. 문법은 올바른 일치사항에 대한 제한된 검색 공간을 정의하므로 서비스가 결과를 더 빠르고 정확하게 전달할 수 있습니다.

말뭉치에 대해 수행한 것과 마찬가지로 문법을 사용자 정의 언어 모델에 추가하고 모델을 훈련합니다. 그러나 말뭉치와 달리 문법이 음성 인식 중에 사용자 정의 모델에 사용되도록 명시적으로 지정해야 합니다.

문법 은 이전 및 차세대 모델에서만 사용 가능합니다. 대형 음성 모델에는 사용할 수 없습니다.

문법 사용을 시작하는 것에 대한 자세한 정보는 다음 항목을 참조하십시오.

음향 및 언어 사용자 정의를 함께 사용

음향 및 언어 사용자 정의를 함께 사용하는 것은 이전 세대 모델에만 적용됩니다. 또한 일부 이전 세대 모델은 언어 및 음향 사용자 정의를 둘 다 지원하지 않습니다.

사용자 정의 음향 모델을 단독으로 사용하면 서비스의 인식 기능이 개선될 수 있습니다. 그러나 텍스트 변환 또는 관련 말뭉치를 예제 오디오에 사용할 수 있는 경우 해당 데이터를 사용하여 사용자 정의 음향 모델을 기반으로 하는 음성 인식의 품질을 더 향상시킬 수 있습니다.

사용자 정의 음향 모델을 보완하는 사용자 정의 언어 모델을 작성하면 두 모델을 함께 사용하여 음성 인식을 향상시킬 수 있습니다. 사용자 정의 음향 모델을 훈련할 때 오디오 리소스 또는 해당 리소스에 있는 도메인 특정 단어 어휘의 텍스트 변환이 포함된 사용자 정의 언어 모델을 지정할 수 있습니다. 마찬가지로, 오디오를 텍스트로 변환할 때 서비스가 사용자 정의 언어 모델, 사용자 정의 음향 모델 또는 둘 다를 허용합니다. 또한 사용자 정의 언어 모델에 문법이 포함되어 있는 경우 음성 인식을 위해 해당 모델 및 문법을 사용자 정의 음향 모델과 함께 사용할 수 있습니다.

자세한 내용은 사용자 정의 음향 모델과 사용자 정의 언어 모델을 함께 사용하는 방법을 참고하세요

사용자 정의 모델 업그레이드

음성 인식의 품질을 향상시키기 위해, 이 서비스는 때때로 기본 대규모 음성 모델, 이전 및 차세대 모델을 업데이트합니다. 기본 모델에 대한 업데이트는 해당 모델에만 영향을 줍니다. 이 업데이트는 동일하거나 다른 언어의 다른 모델에 영향을 주지 않습니다.

기본 모델이 업데이트되는 경우, 개선사항을 활용하려면 해당 기본 모델을 기반으로 작성된 사용자 정의 모델을 업그레이드해야 합니다. 기본 모델에 대한, 업그레이드가 필요한 업데이트는 해당 기본 모델의 새 버전을 생성합니다. 업그레이드가 필요하지 않은 업데이트는 새 버전을 생성하지 않습니다.

  • 이전 세대 모델의 경우, 기본 모델에 대한 모든 업데이트는 해당 모델의 새 버전을 생성합니다. 기본 모델의 새 버전이 릴리스되는 경우, 개선사항을 활용하려면 업데이트된 기본 모델을 기반으로 작성된 사용자 정의 언어 모델 및 사용자 정의 음향 모델을 업그레이드해야 합니다.
  • 대규모 음성 모델과 차세대 모델의 경우, 대부분의 업데이트는 모델의 새로운 버전을 생성하지 않습니다. 이러한 업데이트는 사용자 정의 모델의 업그레이드를 필요로 하지 않습니다. 그러나 일부 업데이트는 기본 모델의 새 버전을 생성합니다. 개선사항을 활용하려면 업데이트된 기본 모델을 기반으로 작성된 사용자 정의 언어 모델을 업그레이드해야 합니다.

기본 모델에 대한 모든 업데이트, 그리고 업그레이드의 필요 여부는 릴리스 정보에 발표되어 있습니다.

사용자 정의 모델을 업그레이드한 후 음성 인식 요청에서 이 사용자 정의 모델을 지정하면 서비스가 기본적으로 해당 모델의 최신 버전을 사용합니다. 그러나 서비스가 해당 모델의 이전 버전을 사용하도록 지정하는 것 또한 여전히 가능합니다. 사용자 정의 모델의 업그레이드 및 모델의 이전 버전 사용에 대한 자세한 정보는 다음 항목을 참조하십시오.