사용법 FAQ

IBM Watson® Text to Speech의 FAQ에는 음성 합성, 지원되는 언어, 오디오 형식, 기타 주제에 관한 질문이 포함됩니다. IBM Cloud® 에 대한 모든 FAQ를 확인하려면 자주 묻는 질문 라이브러리 을 참조하세요.

내 서비스 인증 정보에 액세스하는 방법은 무엇입니까?

서비스 인증 정보에 액세스하는 방법은 Text to Speech를 IBM Cloud®에서 사용하는지 아니면 IBM Cloud Pak® for Data에서 사용하는지에 따라 다릅니다. 두 버전 모두에 대한 인증 정보를 얻는 방법에 관한 자세한 정보는 시작하기 튜토리얼의 시작하기 전에를 참조하십시오.

서비스 인증 정보가 있으면 서비스 인증에 관한 정보에 대해 다음 주제를 참조하십시오.

서비스는 어떤 언어를 지원합니까?

Text to Speech 서비스는 다양한 구어로 남성 및 여성 음성을 지원합니다.

  • 이 서비스는 영어 (호주 및 미국) 에 대한 표현식 신경 음성 을 제공합니다.
  • 네덜란드어, 영어(영국 및 미국), 프랑스어(캐나다 및 프랑스), 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어(브라질), 스페인어(카스티야, 라틴 아메리카 및 북미)에 대한 향상된 인공 신경 음성을 제공합니다.

일부 언어 및 음성은 IBM Cloud Pak® for Data가 아닌 IBM Cloud®에서만 사용 가능합니다. 모든 언어에 대해 사용 가능한 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.

서비스는 오디오를 어떻게 합성합니까?

Text to Speech 서비스는 문자-음성 변환을 합성하기 위해 신경망 기술에 의존하는 음성을 제공합니다. 문자-음성 변환 합성 주제는 기본적으로 복잡합니다. 자세한 정보는 다음을 참조하십시오.

출력 오디오 형식은 무엇입니까?

기본적으로, Text to Speech 서비스는 Opus 코덱(audio/ogg;codecs=opus)을 사용한 Ogg 형식의 오디오를 리턴합니다. 이 서비스는 애플리케이션 요구에 맞는 다양한 기타 오디오 형식을 지원합니다. 자세한 정보는 지원되는 오디오 형식 을 참조하십시오.

텍스트를 음성으로 어떻게 변환합니까?

합성된 오디오 출력을 위해 서비스에 텍스트를 제출하려면 HTTP 또는 WebSocket 요청을 합니다. API를 직접 사용하거나 Watson SDK중 하나를 사용할 수 있습니다. 시작하기는 HTTP POST /v1/synthesizeGET /v1/synthesize 메소드의 예제를 제공합니다. API 및 SDK 레퍼런스에는 모든 인터페이스와 메소드의 예시가 나와 있습니다.

텍스트를 제출하기 위한 그래픽 사용자 인터페이스가 없습니다. Text to Speech 데모를 통해 실제 서비스 사용 사례를 확인해 보세요. 데모는 다양한 목소리로 음성을 생성하기 위해 소량의 텍스트를 입력으로 채택합니다.

서비스가 입력 텍스트를 해석하고 합성된 오디오를 생성하는 방법을 변경할 수 있습니까?

SSML(Speech Synthesis Markup Language)을 사용하여 발음, 볼륨, 피치, 속도 및 기타 속성과 같은 합성 프로세스의 측면을 제어할 수 있습니다.

  • SSML에 관한 일반 정보는 SSML 이해를 참조하십시오.
  • 지원되는 SSML 요소에 대한 정보는 SSML 요소를 참조하십시오.

어떤 프로그래밍 언어를 사용할 수 있습니까?

이 서비스는 널리 사용되는 많은 프로그래밍 언어 및 플랫폼에서 SDK를 지원합니다.

  • SDK 및 GitHub에 대한 링크에 대한 자세한 정보는 Watson SDK를 참조하십시오.
  • Text to Speech 서비스용 SDK의 모든 메소드에 대한 자세한 내용은 API 및 SDK 참조를 참조 하세요.

합성을 위해 제출할 수 있는 최대 텍스트 양은 얼마입니까?

각 서비스의 메소드를 사용하여 음성 합성 요청에 대해 다음과 같은 최대 텍스트 양을 제출할 수 있습니다.

  • HTTP GET /v1/synthesize 메소드 - 입력 텍스트, SSML, URL 및 헤더를 포함하는 총 입력의 최대 8KB.
  • HTTP POST /v1/synthesize 메소드 - URL 및 헤더에 대해 최대 8KB. SSML을 포함하여 입력 텍스트의 경우 최대 5KB.
  • WebSocket /v1/synthesize 메소드 - SSML을 포함하여 입력 테스트의 경우 최대 5KB.

공백 및 SSML 요소의 일부를 포함하여 입력의 모든 문자는 데이터 최대 값에 포함됩니다. 청구 목적의 경우 공백 문자는 계산되지 않습니다. 자세한 정보는 데이터 한계를 참조하십시오.

사용자 정의는 어떻게 작동합니까?

Text to Speech 서비스의 사용자 정의 인터페이스는 특정 언어를 위한 단어 및 변환의 사전을 작성합니다. 이 사전을 사용자 정의 모델이라고 합니다. 자세한 정보는 사용자 정의 이해를 참조하십시오.

사용자 정의 모델은 어떻게 만듭니까?

시작하기 전에 사용자 정의 인터페이스 작업에 대한 지침을 검토하십시오. 그런 다음 사용자 정의 모델 작성 및 관리에서 사용자 정의 모델 생성, 조회, 업데이트 및 삭제에 대한 단계와 예를 참조하십시오. 또한 관련된 훈련 데이터 추가에 대한 예제와 지침은 사용자 정의 항목 작성 및 관리를 검토하십시오.

사용자 정의 음성을 작성할 수 있습니까?

IBM Cloud

프리미엄 고객은 IBM(으)로 작업하여 특정 유스 케이스 및 대상 시장에 맞는 새로운 사용자 정의 음성을 학습할 수 있습니다. 사용자 정의 음성을 작성하는 것은 서비스의 기존 음성 중 하나를 사용자 정의하는 것과 다릅니다. 사용자 정의 음성은 고객이 제공하는 오디오 학습 데이터를 기반으로 하는 고유한 새 음성입니다. IBM에서는 사용자 정의 음성을 한 시간 정도의 학습 데이터로 학습할 수 있습니다.

사용자 정의 음성을 요청하거나 자세한 정보를 보려면 이 IBM 요청 양식을 완료하여 제출하십시오.

사용자 정의 모델에는 어떤 한계가 있습니까?

다음 한계는 모든 사용자 정의 모델에 적용됩니다.

  • 사용자 정의 항목에는 최대 49자의 단어가 포함될 수 있습니다.
  • 사용자 정의 항목에는 최대 499자의 변환이 포함될 수 있습니다.
  • 사용자 정의 모델에는 최대 20,000개의 사용자 정의 항목이 포함될 수 있습니다.

자세한 정보는 사용자 정의 항목의 작성 규칙을 참조하십시오.

플랜 및 가격 정보를 찾을 수 있는 위치는 어디입니까?

IBM Cloud

Text to Speech 서비스는 다중 가격 플랜을 제공합니다. 가격에 대한 자세한 내용은 IBM Cloud 카탈로그의 Text to Speech 서비스를 참조하세요.