Text to Speech for IBM Cloud의 릴리스 정보

IBM Cloud

IBM Cloud 에서 호스팅되는 IBM Watson® Text to Speech 관리형 인스턴스 또는 IBM Cloud Pak for Data as a Service 에 호스팅되는 인스턴스에 대해 포함되었습니다. 달리 명시되지 않은 한 모든 변경사항은 이전 릴리스와 호환되며 모든 신규 및 기존애플리케이션에 자동으로 투명하게 제공됩니다.

서비스의 알려진 제한사항에 대한 정보는 알려진 제한사항 을 참조하십시오.

IBM Cloud Pak for Data 서비스의 릴리스 및 업데이트에 대한 정보는 IBM Cloud Pak for Data의 Text to Speech 릴리스 정보를 참조하십시오.

2026년 5월 15일

새로운 브라질 포르투갈어 여성 자연 음성

이 서비스는 이제 브라질 포르투갈어용 새로운 ‘여성 자연어’ 음성을 지원합니다:

  • pt-BR_IsabelaNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 정보는 다음을 참조하십시오.

2026년 3월 26일

v1 에서 v3 로 음성 전환 사용 중단

이전에 사용되지 않던 표준 연결( v1 ) 음성은 이제 합성 중에 신경( v3 ) 음성과 동등한 음성으로 대체됩니다. 요청이 이러한 v1 음성 중 하나를 지정하면 해당 v3 음성이 대신 사용됩니다.

  • de-DE_BirgitVoice -> de-DE_BirgitV3Voice
  • de-DE_DieterVoice -> de-DE_DieterV3Voice
  • en-GB_KateVoice -> en-GB_KateV3Voice
  • en-US_AllisonVoice -> en-US_AllisonV3Voice
  • en-US_LisaVoice -> en-US_LisaV3Voice
  • en-US_MichaelVoice -> en-US_MichaelV3Voice
  • es-ES_EnriqueVoice -> es-ES_EnriqueV3Voice
  • es-ES_LauraVoice -> es-ES_LauraV3Voice
  • es-LA_SofiaVoice -> es-LA_SofiaV3Voice
  • es-US_SofiaVoice -> es-US_SofiaV3Voice
  • fr-FR_ReneeVoice -> fr-FR_ReneeV3Voice
  • it-IT_FrancescaVoice -> it-IT_FrancescaV3Voice
  • ja-JP_EmiVoice -> ja-JP_EmiV3Voice
  • pt-BR_IsabelaVoice -> pt-BR_IsabelaV3Voice

음성 합성 요청에서 선택 사항인 voice 매개변수를 생략하면, 이제 서비스는 기본적으로 en-US_MichaelV3Voice 를 사용합니다. 이 신경 음성( v3 )은 이전의 기본 표준 연결( v1 ) 음성인 en-US_MichaelVoice 을 대체합니다.

2026년 3월 11일

중요: 베타 기능인 예제별 조정의 사용 중단

예제로 조정 베타 기능은 더 이상 사용되지 않습니다. 새 프롬프트 또는 화자 모델을 만들기 위한 API는 더 이상 지원되지 않습니다.

  • 기존 사용자: 이미 프롬프트 또는 화자 모델이 포함된 기존 사용자 지정은 제한된 기간 동안 음성 합성을 위해 계속 작동합니다. 그러나 새 프롬프트 또는 스피커 모델은 만들 수 없습니다.
  • 신규 사용자: 프롬프트 또는 화자 모델을 만들기 위한 API가 비활성화되어 사용할 수 없습니다.

예제별 조정 기능은 향후 릴리스에서 서비스에서 완전히 제거될 예정입니다. 제거되면 프롬프트 또는 화자 모델에 의존하는 사용자 지정을 사용한 합성은 더 이상 지원되지 않습니다.

2026년 1월 13일

새로운 영어 내추럴 보이스

이 서비스는 이제 호주 영어(AU English)에 대해 두 가지 새로운 자연스러운 음성(남성 1종, 여성 1종)을 지원합니다:

  • en-AU_JackNatural
  • en-AU_HeidiNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 정보는 다음을 참조하십시오.

2025년 12월 5일

새로운 라틴 아메리카 스페인어 자연스러운 목소리

이제 해당 서비스는 라틴 아메리카 스페인어를 위한 두 가지 새로운 자연스러운 음성(남성 1종, 여성 1종)을 지원합니다:

  • es-LA_AlejandroNatural
  • es-LA_DanielaNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 정보는 다음을 참조하십시오.

2025년 10월 31일

새로운 브라질 포르투갈어 내추럴 보이스

이 서비스는 이제 브라질 포르투갈어를 위한 남성용과 여성용의 두 가지 새로운 내추럴 보이스를 지원합니다:

  • pt-BR_LucasNatural
  • pt-BR_CamilaNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 정보는 다음을 참조하십시오.

2025년 7월 24일

새로운 영어 내추럴 보이스

이 서비스는 이제 미국 영어에 대해 남성 2명과 여성 2명의 새로운 자연스러운 목소리 4개를 지원합니다:

  • en-US_EmmaNatural
  • en-US_EthanNatural
  • en-US_JacksonNatural
  • en-US_VictoriaNatural

이 서비스는 이제 영국 영어를 위한 두 가지 새로운 자연스러운 음성(남성 및 여성)을 지원합니다:

  • en-GB_ChloeNatural
  • en-GB_GeorgeNatural

이 서비스는 이제 CA 영어에 새로운 여성 자연 음성을 지원합니다:

  • en-CA_HannahNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 정보는 다음을 참조하십시오.

2025년 7월 9일

V1 음성 사용 중단
2025년 9월 7일부로 모든 V1 보이스는 서비스에서 더 이상 사용되지 않습니다. 더 이상 사용되지 않는 모든 v1 보이스는 향후 12개월 이내에 해당 v3 보이스로 자동 변경됩니다.

2025년 5월 19일

새로운 세대의 목소리 - 자연스러운 목소리

이 서비스는 이제 미국 영어를 위한 새로운 음성이 포함된 차세대 음성인 내추럴 보이스를 지원합니다:

  • en-US_EllieNatural

내추럴 보이스는 자연스러움과 표현력 측면에서 고급 성능을 제공합니다. 이러한 음성은 다양한 기술을 사용하여 표현력 있는 음성보다 우위를 점합니다. 자세한 내용은 자연스러운 음성을 참조하세요.

이제 <say-as interpret-as="letters" format="xx"> SSML 태그에 대한 추가 선택적 format 속성을 지원합니다

이제 선택 사항인 format 속성과 함께 group 또는 single 값을 지정할 수 있습니다. 이러한 속성은 전략적 침묵을 추가하여 숫자 확인 및 ID와 같은 영숫자 문자열의 가독성을 개선하는 데 도움이 됩니다.

2025년 2월 17일

새로운 브라질 포르투갈어 남성 표현 신경 음성

이 서비스는 이제 브라질 포르투갈어에 대한 새로운 남성 표현 신경 음성 기능을 지원합니다

  • pt-BR_LucasExpressive

표현력 있는 신경 음성은 맑고, 바삭바삭하고, 유동적인 자연스러운 음성을 제공합니다. 새 음성은 일반적으로 프로덕션용으로 사용 가능합니다 (GA). 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

2024년 12월 09일

새로운 영국 영어 남성 표현 신경 음성

이 서비스는 이제 영국 영어에 대한 새로운 남성 표현 신경 음성을 지원합니다:

  • en-GB_GeorgeExpressive

표현력 있는 신경 음성은 맑고, 바삭바삭하고, 유동적인 자연스러운 음성을 제공합니다. 새 음성은 일반적으로 프로덕션용으로 사용 가능합니다 (GA). 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

2024년 5월 15 일

새로운 라틴 아메리카 스페인어 여성 표현 신경 음성

이 서비스는 이제 라틴 아메리카 스페인어에 대해 새로운 여성 표현 신경 음성을 지원합니다.

  • es-LA_DanielaExpressive

표현력 있는 신경 음성은 맑고, 바삭바삭하고, 유동적인 자연스러운 음성을 제공합니다. 새 음성은 일반적으로 프로덕션용으로 사용 가능합니다 (GA). 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

2024년 1월 16 일

미국 영어 표현 음성에 대한 Text to Speech 개선사항
미국 영어 표현 음성을 사용하는 경우, 합성이 더 빠르고 대기 시간이 더 짧습니다.
결함 수정: 짧은 발화에서 물음표(?)를 사용할 때 굴절 문제 수정
결함 수정사항: 일부 짧은 발화가 물음표 (?) 로 끝나면 굴절이 무시됩니다. 이 문제는 이제 해결되었습니다.

2023년 11월 30 일

버전 3음성을 위한 개선된 Text to Speech 합성 엔진
Text to Speech 엔진은 버전 3음성에 대해 낮은 대기 시간으로 더 빠른 합성을 제공하도록 개선되었습니다.
향상된 Text to Speech 음성 en-AU_HeidiExpressive
음조와 합성을 조정할 수 있는 Text to Speech 변환 음성 en-AU_HeidiExpressive 개선되었습니다.

2023년 6월 9 일

결함 수정: 더 이상 "[Errno 2] 해당 파일 또는 디렉터리 없음" 오류 메시지로 인해 TTS가 실패하지 않습니다
결함 수정: 웹소켓과 함께 TTS를 사용할 때 더 이상 "[Errno 2] 해당 파일 또는 디렉터리 없음" 오류 메시지로 인해 실패하지 않습니다

2023년 5월 18 일

결함 수정사항: 네덜란드식 음성에서 누락된 SSML 기능에 대한 지원이 추가되었습니다.
결함 수정사항: 네덜란드어 음성을 사용할 때 지원되는 모든 SSML 기능이 설계된 대로 작동합니다. 이전에는 네덜란드어 음성을 사용할 때 일부 SSML 기능이 작동하지 않았습니다.
결함 수정사항: phoneme 태그를 사용할 때 이제 쉼표가 사용됩니다.
결함 수정사항: SSML에서 phoneme 태그를 사용할 때 이제 쉼표 (일시정지) 가 예상대로 작동합니다. 이전에는 쉼표가 음소 태그가 있는 텍스트의 앞이나 뒤에 있을 때 일시정지가 무시되었습니다.

2023년 4월 6 일

베타 네덜란드어 네덜란드어 향상된 신경 음성에 대한 업데이트
결함 수정사항: 베타 네덜란드어 nl-NL_MerelV3Voice 가 내부 수정사항 및 개선사항을 위해 업데이트되었습니다. 2023년 3월 31일 서비스 업데이트에서 음성 초기 릴리스에 대해 설명한 제한 사항은 여전히 적용됩니다.

2023년 3월 31일

중요: 모든 신경 음성에 대한 서비스 종료

중요: 모든 신경 음성이 서비스 종료 날짜에 도달했으며 서비스 및 문서에서 제거되었습니다. 향상된 신경 또는 표현 신경 목소리는 영향을 받지 않습니다. 더 이상 사용되지 않는 모든 뉴럴 보이스의 전체 목록은 2023년 3월 1일 서비스 업데이트에서 확인할 수 있습니다. 더 이상 사용되지 않는 음성을 사용하려고 하면 ' Model '{voice}' not found 메시지와 함께 HTTP 응답 코드 404가 반환됩니다.

호주 영어, 한국어 및 네덜란드어에 대해 새로 개선된 신경 및 표현 신경 음성을 사용할 수 있습니다. 사용되지 않는 언어를 계속 사용하려면 호주 영어, 한국어 또는 네덜란드 네덜란드어 중 하나의 새 음성으로 마이그레이션해야 합니다.

자세한 정보는 언어 및 음성을 참조하십시오.

2023년 3월 22 일

새 베타 네덜란드어 네덜란드어 향상된 신경 음성

이제 이 서비스는 네덜란드어 ( nl-NL_MerelV3Voice) 에 대해 개선된 새 신경성 여성 음성을 지원합니다. 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다.

새로운 음성은 SSML에 대한 지원이 완료될 때까지 베타 기능으로 제공됩니다. 초기 릴리스에서는 다음과 같은 SSML 관련 기능의 사용을 지원하지 않습니다:

  • 음성 합성 요청이 있는 <prosody> 요소
  • 음성 합성 요청이 있는 rate_percentagepitch_percentage 매개변수
  • WebSocket 음성 합성 요청이 있는 <mark> 요소
  • WebSocket 음성 합성 요청이 있는 JSON 텍스트 메시지의 timings 매개변수

새 음성, IPA및 SPR 기호에 대한 지원 및 더 이상 사용되지 않는 네덜란드 신경 음성에서 새 음성으로의 마이그레이션에 대한 자세한 정보는 다음을 참조하십시오.

결함 수정사항: 문서에서 한국어 발음 기호 업데이트

결함 수정: 한국어 SPR 기호에 대한 문서에서 자음의 두 문자 기호가 이제 작은따옴표로 묶여 하나의 기호로 만들어집니다. 이전에는 따옴표로 묶지 않고 두 개의 개별 기호로 표시되었습니다. 자세한 정보는 자음(한국어) 을 참조하십시오.

IBM SPR 기호에 대한 문서 업데이트

IBM SPR 기호에 대한 개요 문서가 다중 문자 기호의 사용을 명확하게 하기 위해 업데이트되었습니다. 자세한 정보는 음성 기호 를 참조하십시오.

2023년 3월 1 일

중요: 모든 신경 음성에 대한 서비스 종료 보류 중

중요: 2023년 3월 31일부터 모든 신경 음성이 서비스 종료 날짜에 도달하고 서비스 및 문서에서 제거됩니다. 신경망 음성은 2022년 3월 31일부터 더 이상 사용되지 않습니다. 향상된 신경 또는 표현식 신경 음성은 영향을 받지 않습니다.

다음과 같은 신경 음성이 제거됩니다:

  • 아랍어: ar-MS_OmarVoice
  • 중국어(표준어): zh-CN_LiNaVoice, zh-CN_WangWeiVoicezh-CN_ZhangJingVoice
  • 체코어: cs-CZ_AlenaVoice
  • 네덜란드(벨기에): nl-BE_AdeleVoicenl-BE_BramVoice
  • 네덜란드어(네덜란드): nl-NL_EmmaVoicenl-NL_LiamVoice
  • 영어(호주): en-AU_CraigVoice, en-AU_MadisonVoiceen-AU_SteveVoice
  • 한국어: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoiceko-KR_YunaVoice
  • 스웨덴어: sv-SE_IngridVoice

호주 영어 및 한국어에 대해 새로 개선된 신경 및 표현 신경 음성을 이미 사용할 수 있습니다. 앞으로 몇 주 안에 네덜란드 네덜란드어에 대한 새로운 향상된 인공 신경 음성을 사용할 수 있습니다. 2023년 3월 31일 이전에 호주 영어, 한국어 또는 네덜란드 네덜란드어의 새 음성 중 하나로 마이그레이션해야 합니다.

자세한 정보는 언어 및 음성을 참조하십시오.

2023년 2월 27 일

새로운 호주 영어 표현 신경 음성

이 서비스는 이제 호주 영어에 대해 두 개의 새로운 표현식 신경 음성 (남성 및 여성) 을 지원합니다.

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

표현력 있는 신경 음성은 예외적으로 명확하고, 바삭바삭하고, 유동적인 자연스러운 음성을 제공합니다. 새로운 음성 데이터 세트가 생산 환경에서 사용할 수 있도록 정식 출시(GA)되었습니다. 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

더 이상 사용되지 않는 호주 영어 신경 음성에서 새 표현 신경 음성으로 마이그레이션할 수 있습니다.

새로운 한국어 향상된 신경 음성

이 서비스는 이제 한국어에 대해 향상된 신경 여성 음성인 ko-KR_JinV3Voice 를 지원합니다. 새 음성은 일반적으로 프로덕션용으로 사용 가능합니다 (GA). 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

더 이상 사용되지 않는 한국어 신경 음성에서 새로 개선된 신경 음성으로 마이그레이션할 수 있습니다.

결함 수정사항: 프랑스어 (캐나다) 음성이 숫자 시간을 올바르게 처리합니다.

결함 수정: 프랑스어와 캐나다 음성이 이제 19:41 같은 시간을 올바르게 발음합니다. 이전에는 음성이 합성된 오디오에서 시간의 요소를 생략했습니다.

결함 수정: 일본어 음성이 더 이상 예기치 않은 오디오를 삽입하지 않음

결함 수정: 일본어 음성이 더 이상 음성 합성 결과에 예기치 않은 오디오를 삽입하지 않습니다. 이전에는 특정 경우에 다른 오디오가 삽입되었습니다.

2023년 1월 20 일

Cloud Foundry 더 이상 사용되지 않음 및 리소스 그룹으로 마이그레이션

{{{site.data.keyword.IBM_notm}} 2022년 5월 31일에 IBM Cloud Foundry 지원을 중단한다고 발표했습니다. 2022년 11월 30일부터 새로운 IBM Cloud Foundry 애플리케이션은 만들 수 없으며 기존 사용자만 애플리케이션을 배포할 수 있습니다. IBM Cloud Foundry 2023년 6월 1일에 지원이 종료됩니다. 그런 다음 IBM Cloud Foundry 애플리케이션 런타임 인스턴스가 실행되는 IBM Cloud Foundry 애플리케이션이 영구적으로 비활성화되고 프로비저닝이 해제되며 삭제됩니다.

2023년 6월 1일 이후에도 IBM Cloud 애플리케이션을 계속 사용하려면 해당 날짜 이전에 리소스 그룹으로 마이그레이션해야 합니다. 리소스 그룹은 개념적으로 Cloud Foundry 공간과 유사합니다. 여기에는 IAM( IBM Cloud Identity and Access Management )을 활용한 세분화된 액세스 제어, 서로 다른 리전에 있는 앱 및 서비스와 서비스 인스턴스를 연결하는 기능, 그룹별 사용량을 간편하게 확인할 수 있는 방법 등 여러 가지 추가적인 이점이 포함됩니다.

결함 수정사항: <say-as> 요소에 큰 기수를 지정하면 더 이상 영어 음성에 대한 오류가 발생하지 않습니다.

결함 수정사항: 이제 <say-as> 요소를 사용하여 큰 숫자를 기본 숫자로 발음할 수 있습니다. 이전에는 <say-as> 요소에 interpret-as="cardinal" 속성을 사용하여 많은 숫자를 묶으면 영어 음성에 대한 음성 합성이 실패할 수 있었습니다. 예를 들어 <say-as interpret-as="cardinal">3,200</say-as> 입력하면 서비스에서 오류가 발생할 수 있습니다. 자세한 정보는 SSML 요소주제의 기본 을 참조하십시오.

결함 수정사항: 이제 영어 음성으로 동의어 및 기타 단어가 올바르게 발음됩니다.

결함 수정사항: 이제 서비스가 합성될 영어 텍스트의 컨텍스트를 기반으로 하여 동음어 및 기타 단어를 올바르게 발음합니다. 이전에는 advocatewifi 같은 단어가 영어 음성으로 잘못 발음될 수 있었습니다.

2022년 11월 30일

결함 수정사항: 사용자 정의 모델 이름 지정 문서에 대한 규칙 추가
결함 수정사항: 이제 문서에서 사용자 정의 모델의 이름 지정에 대한 자세한 규칙을 제공합니다. 자세한 정보는 다음을 참조하십시오.

2022년 10월 7일

이제 서비스에서 더 엄격한 SSML 유효성 검증을 적용합니다.
서비스는 이제 SSML (Speech Synthesis Markup Language) 요소를 포함하는 입력 텍스트의 보다 엄격한 유효성 검증을 적용합니다. 속성의 필수 요소는 올바른 값으로 지정되어야 합니다. 그렇지 않으면 400오류 코드와 함께 요청이 실패합니다. SSML 유효성 검증 및 마크업된 텍스트가 충족해야 하는 요구사항에 대한 자세한 정보는 SSML 유효성 검증 을 참조하십시오.
결함 수정: 음성 en-US_MichaelExpressive 나열된 성별이 이제 올바르게 표시됩니다
결함 수정사항: 사용 가능한 음성에 대한 정보를 나열할 때 en-US_MichaelExpressive 음성의 gender 은 이제 male 입니다. 이전에는 음성의 성별이 실수로 female 으로 설명되었습니다. 자세한 정보는 음성에 대한 정보 나열 을 참조하십시오.

2022년 9월 23일

새로운 미국 영어 표현 신경 음성

이 서비스는 미국 영어에 대해 네 개의 새로운 표현식 신경 음성을 제공합니다.

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

표현력 있는 신경 음성은 예외적으로 명확하고, 바삭바삭하고, 유동적인 자연스러운 음성을 제공합니다. 새로운 음성 데이터 세트가 생산 환경에서 사용할 수 있도록 정식 출시(GA)되었습니다. 표준 국제 음성 알파벳(IPA)과 IBM 사용을 모두 지원합니다 기호 음성 표현(SPR) 음성 기호를 사용할 수 있습니다. 자세한 정보는 다음을 참조하십시오.

표현력 있는 신경 음성을 위한 새로운 말하기 스타일

표현적 신경 음성은 단어 및 구문의 컨텍스트에서 텍스트의 감성을 판별합니다. 그들이 만들어내는 연설은 대화 스타일뿐만 아니라 텍스트의 분위기를 반영합니다. 그러나 텍스트의 전부 또는 일부가 다음과 같은 말하기 스타일 중 하나를 강조하는 것임을 표시하여 음성의 자연스러운 경향을 표현할 수 있습니다.

  • 쾌활-행복과 좋은 소식을 표현합니다.
  • 공감-공감 또는 공감을 표현합니다.
  • 중립-객관성과 이벤트를 표현합니다.
  • 불확실-혼동 또는 불확실성을 표시합니다.

자세한 정보는 말하기 스타일 사용 을 참조하십시오.

표현 신경 음성이 있는 새로운 투영 강조

표현식 신경 음성을 사용하여 서비스는 컨텍스트를 기반으로 공통 삽입 세트를 자동으로 발견합니다. 이것이 이러한 삽입을 합성할 때, 그것은 인간이 정상적인 대화에서 사용할 수 있는 자연적인 강조를 그들에게 제공한다. 일부 삽입의 경우 SSML을 사용하여 강조를 사용 또는 사용 안함으로 설정할 수 있습니다. 자세한 정보는 삽입 강조 를 참조하십시오.

표현력 있는 신경 음성으로 새로운 단어 강조하기

표현 음성은 자연스럽게 컨텍스트에서 올바른 억양을 적용하는 대화식 스타일을 사용합니다. 그러나 하나 이상의 단어에 더 강조하거나 덜 강조하도록 표시할 수 있습니다. 응력의 변화는 피치, 타이밍, 볼륨, 또는 다른 음향 속성의 증가 또는 감소에 의해 표시될 수 있다. 자세한 정보는 단어 강조 를 참조하십시오.

2022년 9월 21일

사용자 정보의 GDPR 삭제를 위한 새 Activity Tracker 이벤트
이제 DELETE /v1/user_data 메소드를 사용하여 사용자에 대한 모든 정보를 삭제할 때 서비스가 Activity Tracker 이벤트를 리턴합니다. 이벤트 이름은 text-to-speech.gdpr-user-data.delete 입니다. 자세한 정보는 Activity Tracker 이벤트를 참조하십시오.
결함 수정사항: 사용자 정의 단어 변환이 이제 모든 경우에 쉼표를 허용합니다.
결함 수정사항: 사용자 정의 모델에 추가된 Word 변환은 이제 모든 경우에 쉼표를 허용합니다. 이전에는 번역에 쉼표가 있으면 음성 합성에 사용할 때 번역이 유효한 오디오를 생성하지 못하는 경우가 종종 있었습니다. 이 문제점은 미국 영어 사용자 정의 모델에서 식별되었습니다.
결함 수정사항: 날짜의 프랑스어 통합이 이제 일관됩니다.
결함 수정사항: 프랑스어 합성에 더 이상 " month서수 " 양식의 날짜 앞에 "le" 기사가 포함되지 않습니다. 이전에는 이 기사가 프랑스어를 사용하는 달의 첫 날에만 포함되었습니다 (예: "9월 1일", "le Premier septembre").
Safari 브라우저에서 Ogg 오디오 형식을 사용할 때 알려진 제한 사항
기본적으로 이 서비스는 Opus 코 audio/ogg;codecs=opus 사용하여 Ogg 오디오 형식의 오디오를 반환합니다. 그러나 Ogg 오디오 형식은 Safari 브라우저에서 지원되지 않습니다. Safari 브라우저에서 Text to Speech 서비스를 사용하는 경우에는 서비스에서 오디오를 반환할 다른 형식을 지정해야 합니다.

2022년 8월 31일

글로벌 말하기 비율을 제어하기 위한 새 베타 rate_percentage 조회 매개변수
이 서비스는 음성 합성 요청에 대한 말하기 비율을 수정하기 위한 새 rate_percentage 조회 매개변수를 제공합니다. 말하기 비율은 서비스가 음성으로 합성하는 텍스트를 말하는 속도입니다. 비율이 높으면 텍스트가 더 빠르게 말되고, 비율이 낮으면 텍스트가 더 느리게 말됩니다. 이 매개변수는 전체 요청에 대한 음성당 기본 비율을 변경합니다. 자세한 정보는 말하기 비율 수정 을 참조하십시오.
글로벌 말하기 피치를 제어하기 위한 새 베타 pitch_percentage 조회 매개변수
이 서비스는 합성 요청에 대한 말하기 피치를 수정하기 위한 새 pitch_percentage 조회 매개변수를 제공합니다. 말하기 피치는 서비스가 합성하는 음성의 어조를 나타냅니다. 이는 듣는 사람이 인식하는 음성의 어조가 얼마나 높거나 낮은지를 나타냅니다. 더 높은 피치는 더 높은 톤으로 말하고 더 높은 음성으로 인식되는 음성을 생성합니다. 더 낮은 피치는 더 낮은 톤으로 말하고 더 낮은 음성으로 인식되는 음성을 생성합니다. 이 매개변수는 전체 요청에 대한 음성당 기본 피치를 변경합니다. 자세한 정보는 말하기 피치 수정 을 참조하십시오.
결함 수정사항: 긴 문자열의 입력 텍스트를 처리하도록 일본어 합성이 개선되었습니다.
결함 수정사항: 이제 서비스가 긴 문자열을 포함하는 일본어 요청을 올바르게 합성합니다. 이전에는 서비스가 긴 일본어 텍스트 문자열을 제대로 합성하지 못했습니다.
SSML <prosody> 요소에 대한 문서 업데이트
SSML <prosody> 요소와 해당 pitchrate 매개변수에 대한 문서가 개선되고 명확해졌습니다. 또한 이제 서비스와 최신 버전의 SSML 스펙 사이의 차이점에 대한 설명도 포함되어 있습니다. 자세한 정보는 <prosody> 요소 를 참조하십시오.

2022년 8월 3일

서비스가 다국어 음성 합성을 지원하지 않습니다.
이 서비스는 현재 다국어 음성 합성을 지원하지 않습니다. 그러나 사용자 정의를 사용하여 다른 언어의 단어 발음을 근사화할 수 있습니다. 자세한 정보는 다국어 음성 합성 을 참조하십시오.

2022년 7월 27일

독일어 음성에 대한 새 베타 spell_out_mode 매개변수
문자열의 개별 문자의 철자를 표시하기 위해 이제 독일어 음성에 대한 합성 요청과 함께 베타 spell_out_mode 조회 매개변수를 포함할 수 있습니다. 기본적으로 서비스는 언어에 대한 텍스트를 합성하는 동일한 속도로 개별 문자를 설명합니다. 이 매개변수를 사용하여 하나, 두 개 또는 세 개의 문자로 구성된 그룹에서 개별 문자의 철자를 더 느리게 지정하도록 서비스에 지시할 수 있습니다. 문자열의 문자가 합성되는 방법을 제어하려면 SSML <say-as> 요소와 함께 매개변수를 사용하십시오. 자세한 정보는 문자열 철자 지정 을 참조하십시오.

2022년 5월 25일

audio/alaw 오디오 형식에 대한 새로운 지원
지원되는 오디오 형식의 목록에 audio/alaw;rate={rate}이(가) 포함됩니다. audio/basicaudio/mulaw와(과) 같이, 이 형식은 8KHz에서 샘플링되는 8비트 u-law(또는 mu-law) 데이터를 사용하여 인코딩되는 단일 채널 오디오를 제공합니다. 자세한 정보는 오디오 형식 사용을 참조하십시오.

2022년 5월 19일

결함 수정사항: 여러 개의 연속적인 SSML <phoneme> 태그가 이제 올바르게 구문 분석됨
결함 수정: 이제 서비스는 연속적인 <phoneme> 태그를 포함하는 텍스트를 올바르게 합성합니다. 이전에는 텍스트에 두 개 이상의 연속된 <phoneme> 태그가 포함된 경우 서비스가 첫 번째 태그만을 합성하고, 나머지 태그는 무시했습니다.

2022년 3월 31일

중요: 모든 신경 음성 더 이상 사용하지 않음

중요: 2022년 3월 31일부터 모든 신경 음성은 더 이상 사용되지 않습니다. 더 이상 사용되지 않는 음성은 서비스 및 문서에서 제거되는 2023년 3월 31일까지 기존 사용자가 사용할 수 있습니다. 개선된 신경 음성 또는 표현 음성이 더 이상 사용되지 않습니다.

이제 다음 신경 음성이 더 이상 사용되지 않습니다.

  • 아랍어: ar-MS_OmarVoice
  • 중국어(표준어): zh-CN_LiNaVoice, zh-CN_WangWeiVoicezh-CN_ZhangJingVoice
  • 체코어: cs-CZ_AlenaVoice
  • 네덜란드(벨기에): nl-BE_AdeleVoicenl-BE_BramVoice
  • 네덜란드어(네덜란드): nl-NL_EmmaVoicenl-NL_LiamVoice
  • 영어(호주): en-AU_CraigVoice, en-AU_MadisonVoiceen-AU_SteveVoice
  • 한국어: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoiceko-KR_YunaVoice
  • 스웨덴어: sv-SE_IngridVoice

더 이상 사용되지 않는 신경 음성은 기존 사용자가 계속 사용할 수 있지만 새 사용자는 더 이상 사용할 수 없습니다.

  • 기존 사용자: 2022년 3월 31일 이전에 작성된 서비스의 인스턴스는 음성 합성을 위해 더 이상 사용되지 않는 음성을 계속 사용할 수 있습니다. 이 인스턴스는 더 이상 사용되지 않는 보이스들을 기반으로 한 사용자 정의 모델을 생성하고 다루는 데에도 사용할 수 있습니다. 또한 GET /v1/voicesGET /v1/voices/{voice} 메소드를 사용하여 음성을 계속 나열하고 조회할 수 있습니다.
  • 신규 사용자: 2022년 3월 31일 이후에 생성된 서비스 인스턴스는 더 이상 사용되지 않는 음성 합성 음성을 사용할 수 없습니다. 또한 해당 인스턴스를 사용하여 더 이상 사용되지 않는 음성을 기반으로 한 사용자 정의 모델을 생성할 수 없습니다. 또한 GET /v1/voicesGET /v1/voices/{voice} 메소드로 음성을 나열하거나 조회할 수 없습니다. 더 이상 사용되지 않는 음성 중 하나를 포함하는 API 호출은 호출에 따라 400 또는 404의 HTTP 오류 코드를 리턴합니다.

호주 영어, 네덜란드어, 한국어에 대한 새로운 목소리가 2023년 2월 15일에 출시될 것이다. 호주 영어, 네덜란드어 또는 한국어 음성을 사용하는 경우 API 호출은 자동으로 해당 언어의 새 음성으로 경로 재지정됩니다. 아랍어, 중국어, 체코어, 스웨덴어 및 플라망어의 음성은 서비스에서 제외됩니다.

사용 가능한 모든 언어 및 음성 옵션에 대한 자세한 내용은 ‘언어 및 음성’을 참조하세요.

더 이상 사용되지 않는 표준 음성은 문서에서 제거됩니다.

표준 연결음은 2020년 12월 2일에 더 이상 사용되지 않습니다. 이러한 표준 음성은 이제 API 참조에서 제거되었습니다. ‘표준 음성에서 신경망 기반 음성으로의 전환’이라는 주제 역시 ‘언어 및 음성 ’ 페이지에서 삭제되었습니다.

마찬가지로, 아랍어 음성의 이전 이름(ar-AR_OmarVoice)도 동시에 더 이상 사용되지 않습니다. 문서에서도 제거되었습니다. 대신 음성 ar-MS_OmarVoice을(를) 사용하십시오.

2022년 2월 28일

WebSocket 인터페이스에 대한 단어 타이밍 응답으로 변경

WebSocket 인터페이스를 통해 단어 시간 정보를 요청할 때 서비스가 반환하는 응답 객체가 변경되었습니다. 이제 서비스는 두 개의 부동 소수점이 뒤에 오는 문자열이 포함된 단일 배열로 단어 타이밍 결과를 보냅니다.

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

이전에 서비스는 두 개의 부동 소수점 배열이 뒤에 오는 문자열이 포함된 배열로 타이밍 결과를 전송했습니다.

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

또한 단어 타이밍과 마크에 대한 정밀도 레벨이 이제 소수점 이하 세 자리로 감소합니다. 새 응답에 대한 자세한 정보는 단어 타이밍 생성 을 참조하십시오.

참고: 향상된 신경 및 신경 음성에 대한 결과는 이전에 달랐습니다. 이러한 불일치로 인해 Watson SDK에서 오류가 발생할 수 있습니다. 모든 음성에 대한 결과가 이제 일치합니다.

2022년 1월 26일

결함 수정사항: SSML 문서 개선
오류 수정: SSML 문서를 업데이트하여 다음 오류를 수정했습니다:
  • 이제 <break> 요소의 예가 올바릅니다. 예제에 표시된 대로 요소는 단항입니다. 이전 예에는 임베드된 텍스트가 있는 열린 태그 및 닫기 태그가 포함되어 있습니다. 서비스가 임베드된 텍스트를 음성으로 읽지 않았습니다. 자세한 정보는 <break> 요소를 참조하십시오.
  • 이 서비스는 SSML 버전 1.1을 지원합니다. 이제 모든 참조 및 예제가 올바른 버전을 사용합니다. 이전에 버전 1.0에 참조된 문서.

2021년 12월 3일

새 체코어 신경 음성: cs-CZ_AlenaVoice

이제 새 여성 음성(cs-CZ_AlenaVoice)이 포함된 새 언어인 체코어를 사용할 수 있습니다. 음성은 신경 음성입니다.

새로운 벨기에 네덜란드어 신경 음성: nl-BE_BramVoice

이제 새 남성 벨기에 네덜란드어(플라망어) 음성(nl-BE_BramVoice)을 사용할 수 있습니다. 음성은 신경 음성입니다.

결함 수정: SSML및 음성 합성 개선

버그 수정: 이번 릴리스에서는 Speech Synthesis Markup Language(SSML) 및 음성 합성과 관련된 다음 버그들이 수정되었습니다:

  • 이제 <prosody> 요소의 pitch 속성이 지정된 모든 텍스트에 적용됩니다. 이전에는 영향을 받은 텍스트의 첫 번째 단어에 음높이 변경이 항상 적용되지는 않았습니다. 또한, 문서에는 이제 pitch 값을 지정하는 방법에 대한 추가 지침이 포함되었습니다. 자세한 정보는 pitch 속성을 참조하십시오.
  • 현재 일본어 텍스트의 음성 합성은 오디오를 더욱 느리게 말합니다. 이전에, 합성된 음성은 너무 빨리 말했습니다. 일본어 텍스트 합성이 애플리케이션에서 여전히 너무 빨리 말하고 있는 경우, SSML <prosody> 요소의 rate 속성을 사용하여 음성 속도를 제어하십시오. 자세한 정보는 rate 속성을 참조하십시오.
  • 이제 신경 음성이 이스케이프된 어포스트로피 문자(&apos;)를 적절하게 구문 분석합니다. 이전에는 일부 신경 음성이 문자를 올바르게 해석하지 않았습니다.

2021년 10월 22일

다중 신경 음성 개선사항
중국어, 네덜란드어(벨기에 및 네덜란드), 오스트레일리아 영어, 한국어를 위한 기존 신경 음성이 개선된 음성 합성 및 향상된 오디오 결과를 위해 업데이트되었습니다. 사용 가능한 모든 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.
새 오스트레일리아 영어 신경 음성: en-AU_SteveVoice
이제 새 남성 오스트레일리아 영어 음성(en-AU_SteveVoice)을 사용할 수 있습니다. 음성은 신경 음성입니다.
새 스웨덴어 신경 음성: sv-SE_IngridVoice
이제 새 여성 음성(sv-SE_IngridVoice)이 포함된 새 언어인 스웨덴어를 사용할 수 있습니다. 음성은 신경 음성입니다.

2021년 10월 6일

Premium 플랜에 대한 새 미국 HIPAA 지원(댈러스 위치)
이제 댈러스(us-south) 위치에서 호스팅되는 Premium 플랜에 대해 미국 HIPAA(Health Insurance Portability and Accountability Act) 지원을 사용할 수 있습니다. 자세한 정보는 HIPAA(Health Insurance Portability and Accountability Act)를 참조하십시오.
오류 수정: 라틴 아메리카 스페인어 향상형 신경망 음성 개선
결함 수정사항: 라틴 아메리카 스페인어 음성(es-LA_SofiaV3Voice)의 경우, 모든 유형의 질문은 이제 올바른 억양을 사용합니다.

2021년 9월 16일

오류 수정: 카스티야 스페인어 및 북미 스페인어 향상된 신경망 음성 품질 개선
결함 수정사항: 카탈루냐어(es-ES_EnriqueV3Voicees-ES_LauraV3Voice) 및 북미 스페인어(es-US_SofiaV3Voice) 음성의 경우, 모든 유형의 질문은 이제 올바른 억양을 사용합니다. 라틴 아메리카 스페인어 음성(es-LA_SofiaV3Voice)의 경우, 일부 질문은 정확한 억양을 사용하지 않고 대신 글을 읽는 것처럼 들립니다. 라틴 아메리카 스페인어 음성 지원은 곧 제공될 예정입니다.

2021년 7월 16일

새로운 벨기에 네덜란드어 신경 음성: nl-BE_AdeleVoice
서비스는 이제 신경 음성(nl-BE_AdeleVoice)이 포함된 벨기에 네덜란드어(플라망어)를 지원합니다. 벨기에 네덜란드어 음성은 사용자 정의를 지원하며 프로덕션을 위한 GA(Generally Available)입니다.

2021년 4월 12일

새로운 캐나다 프랑스어의 신경 음성: fr-CA_LouiseV3Voice

서비스는 이제 향상된 신경 음성 fr-CA_LouiseV3Voice을(를) 사용하여 캐나다 프랑스어를 지원합니다. 캐나다 프랑스어 음성은 사용자 정의를 지원하며 프로덕션을 위한 GA(Generally Available)입니다.

새 예제별 조정 기능

새 예제별 조정 기능을 사용하면 서비스에서 지정된 텍스트를 음성으로 읽는 방법을 제어할 수 있습니다. 이 기능은 베타 기능으로, 미국 영어 사용자 지정 모델 및 음성에서만 지원됩니다. 여기에는 두 가지 컴포넌트가 있습니다.

  • 사용자 정의 프롬프트에는 음성으로 읽을 텍스트와 듣고 싶은 대로 텍스트를 읽는 녹음된 오디오가 포함됩니다. 오디오는 합성된 텍스트의 억양, 음조, 강세를 지정합니다. 프롬프트는 다른 음절 또는 단어를 강조하고 일시정지를 도입하며 일반적으로 합성된 오디오 사운드를 컨텍스트에 더 자연스럽고 적절하게 만들 수 있습니다.
  • 화자 모델은 하나 이상의 프롬프트를 표시하는 사용자의 등록 오디오를 제공합니다. 화자 모델은 사용자 음성의 오디오 샘플을 제공합니다. 이 서비스는 해당 화자에 맞는 더 높은 품질의 프롬프트를 생성할 수 있도록 음성에 대해 자체 훈련합니다.

음성 합성 요청이 포함된 사용자 정의 프롬프트를 지정하여 서비스의 음성이 텍스트를 발음하는 방법을 표시합니다. 프롬프트를 지정하려면 SSML 확장(<ibm:prompt id="{prompt_id}"/>)을 사용합니다. 합성된 오디오는 프롬프트의 운율을 복제합니다.

새 예제별 조정 메소드

서비스에는 예제별 조정 기능을 사용하여 작업하기 위한 8개의 새 메소드가 포함되어 있습니다. 다음에 소개되는 새로운 메서드에 대한 설명에는 API 및 SDK 참조 문서의 해당 항목으로 연결되는 링크가 포함되어 있습니다. 새 메소드를 보려면 참조의 Curl 탭을 선택해야 합니다.

사용자 정의를 위한 Activity Tracker 조치에 대한 업데이트

사용자 정의 메소드에 대한 Activity Tracker 이벤트의 조치 이름이 변경되었습니다. 조치에는 custom-voice 대신 custom-model 문자열이 포함됩니다. 조치의 이전 이름은 더 이상 사용되지 않습니다. 이전 이름은 계속 사용할 수 있지만 나중에 제거됩니다. 가능한 한 빨리 사용자 정의 이벤트에 나열된 새 이름으로 마이그레이션하십시오.

이벤트 작성 더 이상 사용되지 않는 조치 이름- > 새 조치 이름

  • text-to-speech.custom-voice.create -> text-to-speech.custom-model.create
  • text-to-speech.custom-voice-word-list.create -> text-to-speech.custom-model-word-list.create
  • text-to-speech.custom-voice-word.create -> text-to-speech.custom-model-word.create

읽기 이벤트 더 이상 사용되지 않는 조치 이름- > 새 조치 이름

  • text-to-speech.custom-voice-list.read -> text-to-speech.custom-model-list.read
  • text-to-speech.custom-voice.read -> text-to-speech.custom-model.read
  • text-to-speech.custom-voice-word-list.read -> text-to-speech.custom-model-word-list.read
  • text-to-speech.custom-voice-word.read -> text-to-speech.custom-model-word.read

업데이트 이벤트 더 이상 사용되지 않는 조치 이름- > 새 조치 이름

  • text-to-speech.custom-voice.update -> text-to-speech.custom-model.update

이벤트 삭제 더 이상 사용되지 않는 조치 이름- > 새 조치 이름

  • text-to-speech.custom-voice.delete -> text-to-speech.custom-model.delete
  • text-to-speech.custom-voice-word.delete -> text-to-speech.custom-model-word.delete

2020년 12월 2일

다중 음성 개선사항

이 서비스에서 제공하는 음성들은 상당한 변화를 겪었습니다. 이 서비스는 새로운 언어와 음성을 지원하고 많은 음성의 품질을 향상시켰으며 오래된 음성은 더 이상 사용하지 않습니다. 또한, 모든 서비스 보이스 기능이 이제 사용자 정의가 가능하며, 프로덕션 환경에서 사용할 수 있도록 정식 출시(GA)되었습니다.

새로운 신경 및 향상된 신경 음성

현재 사용 가능한 모든 음성이 신경 기술을 기반으로 하여 음성 합성의 전반적인 품질을 최적화할 수 있습니다. 이 서비스는 신경 기술을 기반으로 하는 두 가지 유형의 음성을 제공합니다.

  • 이름에 V3 문자열이 포함되지 않은 신경 음성은 이제 아랍어, 오스트레일리아 영어, 중국어, 네덜란드어, 한국어에 사용할 수 있습니다. 신경 음성은 SSML(Speech Synthesis Markup Language) <phoneme> 요소로 IPA(International Phonetic Alphabet) 사용을 지원합니다.
  • 이름에 V3 문자열이 포함된 향상된 신경 음성은 브라질 포르투갈어, 영국 및 미국 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어(모든 방언)에 사용할 수 있습니다. 향상된 신경 음성은 SSML <phoneme> 요소로 IPA 및 IBM Symbolic Phonetic Representation(SPR)을 둘 다 사용하도록 지원합니다. 또한 향상된 신경 음성은 약간 더 높은 수준의 자연스러운 음성을 보여줍니다. 향후 몇 달 내에 향상된 신경망 기반 음성 기능을 위한 추가적인 사용자 지정 기능이 제공될 예정입니다.

서비스는 더 이상 언어에 대한 표준 음성을 제공하지 않습니다. 표준 음성은 연결 합성 기술을 사용하여 녹음된 음성 단편들을 조합해 요청된 오디오를 생성했습니다.

자세한 정보는 언어 및 음성을 참조하십시오.

새로운 오스트레일리아 영어 및 한국어 신경 음성

다음 오스트레일리아 영어 및 한국어 음성은 새로운 음성입니다.

  • 이제 서비스는 다음 두 개의 신경 음성(en-AU_CraigVoiceen-AU_MadisonVoice)이 포함된 오스트레일리아 영어를 지원합니다.
  • 이제 서비스는 두 개의 새로운 한국어 신경 음성(ko-KR_HyunjunVoiceko-KR_SiWooVoice)을 지원합니다.
향상된 신경 음성

기존에 연결 방식(concat)으로 제공되던 아랍어, 중국어, 네덜란드어, 한국어 음성 서비스가 이제 신경망 기반(neural)으로 제공됩니다:

  • ar-MS_OmarVoice
  • ko-KR_YoungmiVoice
  • ko-KR_YunaVoice
  • nl-NL_EmmaVoice
  • nl-NL_LiamVoice
  • zh-CN_LiNaVoice
  • zh-CN_WangWeiVoice
  • zh-CN_ZhangJingVoice

다음과 같은 변경 사항도 적용되었습니다:

  • 아랍어 음성은 이제 ar-MS_OmarVoice(으)로 이름 지정됩니다. 이전 이름인 ar-AR_OmarVoice은(는) 더 이상 사용되지 않습니다. 이는 1년 이상 계속해서 작동할 것이지만, 그 이후에는 제거될 수 있습니다. 사용자는 가능한 한 빨리 새 이름으로 마이그레이션하는 것이 좋습니다.
  • 이제 아랍어는 SSML <phoneme> 요소로 IPA 기호 및 유니코드 값의 사용을 지원합니다. 아랍어에 대한 사용자 정의 모델을 작성하려면 언어 ID ar-MS을(를) 사용해야 합니다. ar-AR ID는 사용자 정의에 지원되지 않습니다.
  • 아랍어에 대한 IPA 기호는 새로운 기호입니다. 앞서 기록된 기호들이 교체되었습니다.
  • 네덜란드어에 대한 IPA 기호는 다음과 같이 변경되었습니다.
    • 네덜란드어는 더 이상 IPA 기호 (0074+02B2), ɲ (0272), ʦ (02A6) 및 ʔ (0294) 를 지원하지 않습니다.
    • 네덜란드어(네덜란드)에 다음 IPA 기호가 추가되었습니다: ɣ (0263).
더 이상 사용되지 않는 표준 음성

다음의 표준 연결 음성은 이제 더 이상 사용되지 않습니다:

  • de-DE_BirgitVoice
  • de-DE_DieterVoice
  • en-GB_KateVoice
  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • es-ES_LauraVoice
  • es-LA_SofiaVoice
  • es-US_SofiaVoice
  • fr-FR_ReneeVoice
  • it-IT_FrancescaVoice
  • ja-JP_EmiVoice
  • pt-BR_IsabelaVoice

더 이상 사용되지 않는 모든 표준 음성은 신경에 해당하는 대응물을 갖고 있으므로 음성이 제거되지 않습니다. 음성 합성 결과 개선을 위해 음성의 동등한 신경 버전(예: de-DE_BirgitVoice에서 de-DE_BirgitV3Voice으로)으로 변경할 수 있습니다.

더 이상 사용되지 않는 이 음성은 공개된 문서에서 제거됩니다. 최소한 1년 동안 계속 작동하지만 나중에 제거될 수 있습니다. 가능한 한 빨리 동등한 신경 음성으로 마이그레이션하도록 권장합니다.

음성 합성 요청에서 선택적 voice 매개변수를 생략하면 서비스는 기본적으로 en-US_MichaelV3Voice을(를) 사용합니다. 이 신경 음성은 이전 기본값이었던 현재 사용되지 않는 en-US_MichaelVoice 표준 음성을 대체합니다.

더 이상 사용되지 않는 기능

다음 기능들은 표준 연결 음성에서만 사용할 수 있었습니다. 이 기능은 더 이상 사용되지 않으며 공개된 문서에서 제거되었습니다. 최소한 1년 동안 계속 작동하지만 나중에 제거될 수 있습니다. 애플리케이션에서 이러한 기능을 제거하고 가능한 한 빨리 신경 음성으로 마이그레이션하는 것이 좋습니다.

  • 표현 SSML. 이는 en-US_AllisonVoice 음성에만 지원되는 SSML의 IBM 확장입니다.
  • 음성 변환 SSML. 이는 en-US_AllisonVoice, en-US_LisaVoice, en-US_MichaelVoice 음성에만 지원되는 SSML의 IBM 확장입니다.
  • <prosody> 요소의 volume 속성입니다. 이 속성은 모든 표준 음성에서 사용 가능합니다.

이러한 SSML 요소를 신경 음성에 대한 합성 요청과 함께 포함하면 요청이 SSML 유효성 검증에 실패하므로 HTTP 400 응답 코드가 생성됩니다. SSML 유효성 검증에 관한 자세한 정보는 SSML 유효성 검증을 참조하십시오.

CORS(Cross-Origin Resource Sharing)에 대한 새로운 지원

CORS(Cross-Origin Resource Sharing) 지원은 이제 Google Chrome™ 및 Apple® Safari 브라우저의 모든 음성에 사용할 수 있습니다. 이 지원은 Mozilla Firefox™ 브라우저에서 아랍어, 오스트레일리아 영어, 중국어, 네덜란드어, 한국어 음성으로 사용할 수 없습니다. 자세한 내용은 CORS 지원을 참조하세요.

2020년 9월 10일

오류 수정: 일본어 음성 개선

결함 수정: ja-JP_EmiV3Voice 음성의 경우 서비스가 이제 prosody 비율 스펙을 포함하는 SSML 입력을 올바르게 구문 분석합니다. 이전에는 다음과 같은 <prosody> 요소 사용이 올바르게 작동했습니다.

<speak>成功する/繁栄する</speak>

하지만 <prosody> 요소가 있는 rate 속성을 다음과 같이 사용하면 서비스가 임베드된 SSML 표시를 읽고 말했습니다.

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

이제 서비스가 올바르게 구문 분석하고 일본어 입력을 위한 <prosody> 요소의 rate 속성을 적용합니다.

2020년 9월 4일

사용자 지정 인터페이스가 이제 정식 출시되었습니다
사용자 정의 인터페이스는 GA(Generally Available)입니다. 사용자 지정 기능은 더 이상 베타 기능이 아닙니다. 사용자 정의 인터페이스를 통해 언어별 사용자 정의 사전을 작성하여 서비스가 입력 텍스트에서 발생하는 특이한 단어를 발음하는 방법을 지정할 수 있습니다. 모든 GA 및 베타 음성과 함께 사용할 수 있습니다. 자세한 정보는 사용자 정의 이해를 참조하십시오.

2020년 6월 24일

새로운 영국 영어와 프랑스어 신경 음성

이 서비스는 이제 두 가지 새로운 신경망 기반 음성을 제공합니다:

  • 영국 영어: en-GB_CharlotteV3Voice
  • 프랑스어: fr-FR_NicolasV3Voice

또한 기존 영국 신경 음성 en-GB_KateV3Voice의 개선된 버전을 제공합니다. 사용 가능한 모든 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.

일본어에 대한 <say-as> 요소의 SSML digits 속성 지원

서비스는 이제 일본어 음성으로 SSML <say-as> 요소의 digits 속성을 지원합니다. 자세한 정보는 say-as 요소를 참조하십시오.

2020년 4월 1일

새 한국어 표준 음성: ko-KR_YoungmiVoiceko-KR_YunaVoice

이 서비스는 이제 두 가지 표준 한국어 여성 음성(ko-KR_YoungmiVoiceko-KR_YunaVoice)을 지원합니다. 다음 정보는 두 한국어 음성 모두에 적용됩니다.

  • 이 함수들은 베타 함수입니다. 이들은 프로덕션용으로 사용할 준비가 되어 있지 않을 수 있으며 변경될 수 있습니다. 이는 시간 및 사용량이 포함된 품질이 향상될 것으로 예상되는 초기 오퍼링입니다.
  • 음성은 사용자 정의 및 /v1/pronunciation 메소드를 지원합니다.
  • 음성은 WebSocket 인터페이스에서 사용할 수 있는 <mark> 요소 및 timings 매개변수를 지원합니다.
  • 이들 음성은 표현 SSML(Speech Synthesis Markup Language) 및 음성 변환 SSML을 제외한 모든 SSML 요소를 지원합니다.
  • 음성은 <phoneme> 요소를 사용하여 IBM Symbolic Phonetic Representation(SPR)이 아닌 IPA(International Phonetic Alphabet)만 지원합니다.
아랍어, 중국어, 네덜란드어 음성에 대한 새 기능 지원

베타 아랍어, 중국어, 네덜란드어 음성은 이제 다음과 같은 기능을 지원합니다.

  • 사용자 정의 및 /v1/pronunciation 메소드.
  • WebSocket 인터페이스에서 사용할 수 있는 <mark> 요소 및 timings 매개변수입니다.

추가 정보는 다음 절을 참조하십시오.

  • 사용 가능한 모든 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.
  • WebSocket 인터페이스를 사용하여 단어 타이밍을 얻는 방법에 대한 자세한 정보는 단어 타이밍 생성 을 참조하십시오.
  • 사용자 정의에 대한 자세한 정보는 사용자 정의 이해를 참조하십시오.
  • 사용자 정의된 IPA 및 SPR 사용에 관한 자세한 정보는 음성 기호 이해를 참조하십시오. (아랍어, 중국어, 네덜란드어, 한국어에 대한 IPA 기호는 아직 문서화되지 않았습니다. 이 문서는 곧 사용할 수 있습니다.)

2020년 2월 24일

새로운 미국 영어와 독일의 신경 음성

이 서비스는 이제 다섯 가지 새 신경 음성을 지원합니다.

  • 미국 영어: en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voice, en-US_OliviaV3Voice
  • 독일어: de-DE_ErikaV3Voice

새 음성은 다음 SSML 요소를 지원하지 않습니다.

  • <express-as> 요소가 있는 표현 SSML
  • <voice-transformation> 요소를 사용하는 음성 변환
  • <prosody> 요소의 volume 속성

이러한 항목 및 모든 사용 가능한 음성에 대한 자세한 정보는 언어 및 음성을 참조하십시오.

Activity Tracker에 대한 새 지원

이제 이 서비스는 모든 사용자 정의 오퍼레이션에 대해 Activity Tracker 이벤트를 사용하는 것을 지원합니다. IBM Cloud Activity Tracker은(는) IBM Cloud®에서 서비스의 상태를 변경하는, 사용자가 시작한 활동을 기록합니다. 이 서비스를 사용하여 비정상 활동 및 중요 조치를 조사하고, 규제 감사 요구사항을 준수하도록 할 수 있습니다. 또한 이러한 조치가 발생하면 바로 조치에 대한 경보를 받을 수 있습니다. 자세한 정보는 Activity Tracker 이벤트를 참조하십시오.

2019년 12월 18일

새로운 표준 아랍어, 중국어, 네덜란드어 음성

이 서비스는 이제 세 개의 새 언어로 된 여섯 개의 새 표준 음성을 지원합니다.

  • 아랍어: ar-AR_OmarVoice
  • 중국어: zh-CN_LiNaVoice, zh-CN_WangWeiVoicezh-CN_ZhangJingVoice
  • 네덜란드어: nl-NL_EmmaVoicenl-NL_LiamVoice

다음 정보는 이러한 새 표준 음성에 적용됩니다.

  • 새로운 함수들은 베타 함수입니다. 이러한 음성은 프로덕션용으로 사용할 준비가 되어 있지 않을 수 있으며 변경될 수 있습니다. 이는 시간 및 사용량이 포함된 품질이 향상될 것으로 예상되는 초기 오퍼링입니다.
  • 음성은 WebSocket 인터페이스에서 사용 가능한 <mark> 요소 및 timings 매개변수를 지원하지 않습니다.
  • 음성은 사용자 정의 또는 /v1/pronunciation 메소드를 지원하지 않습니다.
  • 이들 음성은 표현 SSML 또는 음성 변환 SSML을 지원하지 않습니다.
  • 이들 음성은 그 외의 모든 SSML 요소를 지원합니다. 하지만 음성은 <phoneme> 요소를 사용하여 IBM Symbolic Phonetic Representation(SPR)이 아닌 IPA(International Phonetic Alphabet)만 지원합니다.

이러한 항목 및 모든 사용 가능한 음성에 대한 자세한 정보는 언어 및 음성을 참조하십시오.

2019년 12월 12일

IBM Cloud IAM에 대한 전체 지원

이제 Text to Speech 서비스는 IBM Cloud Identity and Access Management(IAM)의 전체 구현을 지원합니다. Watson 서비스의 API 키는 더 이상 단일 서비스 인스턴스로 제한되지 않습니다. 둘 이상의 서비스에 적용되는 액세스 정책 및 API 키를 작성할 수 있으며 서비스 간에 액세스 권한을 부여할 수 있습니다. IAM에 대한 자세한 정보는 Watson 서비스에 인증을 참조하십시오.

이 변경사항을 지원하도록 API 서비스 엔드포인트는 다른 도메인을 사용하고 서비스 인스턴스 ID를 포함합니다. 패턴은 api.{location}.text-to-speech.watson.cloud.ibm.com/instances/{instance_id}입니다.

  • 댈러스 위치에서 호스팅되는 인스턴스의 HTTP URL 예:

    https://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • 댈러스 위치에서 호스팅되는 인스턴스의 WebSocket URL 예:

    wss://api.us-south.text-to-speech.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

URL에 대한 자세한 내용은 API 및 SDK 참조 문서를 참조하십시오.

이러한 URL은 호환성이 손상되는 변경을 구성하지 않습니다. 새 URL은 기존 서비스 인스턴스와 새 인스턴스 둘 다에 대해 작동합니다. 원본 URL은 최소 1년간(2020년 12월까지) 기존 서비스 인스턴스에 대해 작동합니다.

새로운 네트워크 및 데이터 보안 기능

이제 다음 새 네트워크 및 데이터 보안 기능에 대한 지원을 사용할 수 있습니다.

  • 사설 네트워크 엔드포인트 지원

    Premium 플랜의 사용자는 사설 네트워크 엔드포인트를 작성하여 사설 네트워크를 통해 Text to Speech 서비스에 연결할 수 있습니다. 사설 네트워크 엔드포인트 연결에는 공용 인터넷 액세스가 필요하지 않습니다. 자세한 정보는 공용 및 사설 네트워크 엔드포인트를 참조하십시오.

2019년 11월 12일

새 서울 위치가 사용 가능해짐
Text to Speech 서비스는 IBM Cloud 서울 위치(kr-seo)에서 사용 가능합니다. 다른 위치와 마찬가지로 IBM Cloud 위치는 토큰 기반 IAM 인증을 사용합니다. 이 위치에서 작성하는 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2019년 10월 1일

Premium 플랜에 대한 새 미국 HIPAA 지원(워싱턴 DC 위치)
워싱턴 D.C. 지역에 호스팅되고 2019년 4월 1일 이후에 생성된 프리미엄 플랜의 경우 미국 HIPAA 지원을 이용할 수 있습니다. 자세한 정보는 미국 HIPAA(Health Insurance Portability and Accountability Act)를 참조하십시오.

2019년 8월 22일

결함 수정사항: 여러 개의 작은 개선사항
오류 수정: 사소한 오류 수정 및 기능 개선을 위해 서비스가 업데이트되었습니다.

2019년 7월 30일

새 일본어 신경 음성: ja-JP_EmiV3Voice
이 서비스에서는 이제 일본어로 된 신경 음성(ja-JP_EmiV3Voice)을 제공합니다. 이제 지원되는 모든 언어로 된 사용 가능한 모든 음성의 표준 및 신경 버전을 사용할 수 있습니다. 자세한 정보는 언어 및 음성을 참조하십시오.

2019년 6월 24일

표준 및 신경 음성에 대한 새로운 지원

서비스에서는 이제 두 가지 버전으로 된 사용 가능한 대부분의 음성을 제공합니다.

  • 녹음된 음성 단편을 연결 합성 기법을 통해 조합하여 음성을 생성하는 표준 음성. 표준 음성의 이름(예: en-US_AllisonVoice)에는 버전 문자열이 포함되지 않습니다.
  • 신경 음성은 DNN(Deep Neural Network)을 사용하여 음성의 음향(스펙트럼) 기능을 예측합니다. 신경 음성의 이름(예: V3)에는 버전 문자열(en-US_AllisonV3Voice)이 포함됩니다.

보류 중이며 곧 사용 가능하게 될 ja-JP_EmiVoice 음성을 제외하고, 신경 버전은 모든 표준 음성에 사용할 수 있습니다. 신경 음성에 SSML <express-as><voice-transformation> 요소를 사용할 수 없으며, 신경 음성에 <prosody> 요소의 volume 속성을 사용할 수 없습니다. 사용 가능한 모든 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.

서비스에서 지원이 중단된 V2 신경 음성

서비스에는 이전에 사용 가능한 V2 DNN 음성이 더 이상 포함되지 않습니다. 애플리케이션에서 V2 음성을 사용하는 경우 서비스에서 동등한 V3 음성을 자동으로 사용합니다.

2019년 3월 24일

새 V2 신경 독일어 음성

서비스는 이제 독일어 음성을 지원하는 V2 DNN(Deep Neural Network) 버전을 제공합니다.

  • de-DE_BirgitV2Voice
  • de-DE_DieterV2Voice

DNN 기반 음성에 관한 자세한 정보는 언어 및 음성을 참조하십시오.

SSML <prosody> 요소의 pitchrate 속성에 대한 새 지원

이제 서비스의 DNN 기반 음성은 모두 SSML <prosody> 요소의 pitchrate 속성을 지원합니다. DNN 기반 음성은 <prosody> 요소의 volume 속성을 지원하지 않습니다. 자세한 정보는 prosody 요소를 참조하십시오.

2019년 3월 21일

서비스 인증 정보의 가시성이 역할에 의해 제한됨

사용자는 이제 IBM Cloud 계정에 지정되었던 역할과 연관된 서비스 인증 정보만 볼 수 있습니다. 예를 들어, reader 역할이 지정된 경우 writer 또는 상위 레벨의 서비스 인증 정보는 더 이상 표시되지 않습니다.

이 변경사항은 기존 서비스 인증 정보를 사용한 사용자 또는 애플리케이션의 API 액세스에 영향을 주지 않습니다. 변경사항은 IBM Cloud 내의 인증 정보 보기에만 영향을 줍니다.

2019년 3월 4일

새로운 V2 신경 영어 및 이탈리아어 음성

이 서비스에서는 이제 오디오를 생성하기 위해 딥러닝(deep-learning) 합성을 사용하는 네 가지 새로운 V2 음성을 제공합니다.

  • en-US_AllisonV2Voice
  • en-US_LisaV2Voice
  • en-US_MichaelV2Voice
  • it-IT_FrancescaV2Voice

새 음성은 기계 학습 및 DNN을 사용하여 문자-음성 변환을 합성합니다. 딥러닝 합성 또는 DNN(Deep Neural Network) 기반 합성을 통해 향상된 자연 운율과 좀 더 일관성 있는 전체 품질을 갖춘 오디오가 생성됩니다.

그러나 새 음성은 기존 음성과는 다른 신호 품질을 갖춘 오디오도 생성함에 따라 모든 애플리케이션에 적합하지 않을 수 있습니다. 또한 새 음성은 SSML 요소 <prosody>, <express-as>, <voice-transformation>을(를) 지원하지 않습니다.

DNN 기반 음성, DNN 기반 음성과 기존 음성 간의 차이점에 대한 자세한 정보는 언어 및 음성을 참조하십시오.

2019년 1월 28일

WebSocket 인터페이스에 의한 IBM Cloud IAM에 대한 새 지원

WebSocket 인터페이스는 이제 브라우저 기반 JavaScript 코드에서 토큰 기반 IAM(Identity and Access Management) 인증을 지원합니다. 반대되는 제한사항은 제거되었습니다. WebSocket /v1/synthesize 메소드를 사용하여 인증된 연결을 설정하려면 다음을 수행하십시오.

  • IAM 인증을 사용하는 경우 access_token 조회 매개변수를 포함하십시오.
  • Cloud Foundry 서비스 인증 정보를 사용하는 경우 watson-token 조회 매개변수를 포함하십시오.

자세한 정보는 연결 열기를 참조하십시오.

2018년 12월 13일

새 런던 위치가 사용 가능해짐
이제 Text to Speech 런던 위치(eu-gb)에서 IBM Cloud® 서비스를 사용할 수 있습니다. 모든 위치와 마찬가지로 런던도 토큰 기반의 Identity and Access Management(IAM) 인증을 사용합니다. 이 위치에서 작성하는 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2018년 11월 7일

새 도쿄 위치가 사용 가능해짐
이제 Text to Speech 도쿄 위치(jp-tok)에서 IBM Cloud® 서비스를 사용할 수 있습니다. 모든 위치와 마찬가지로 도쿄도 토큰 기반의 Identity and Access Management(IAM) 인증을 사용합니다. 이 위치에서 작성하는 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2018년 10월 30일

토큰 기반 IBM Cloud IAM에 대한 새 지원

Text to Speech 서비스는 모든 위치에 적합한 토큰 기반 IAM(Identity and Access Management) 인증으로 마이그레이션됩니다. 모든 IBM Cloud 서비스는 이제 IAM 인증을 사용합니다. Text to Speech 서비스는 다음 날짜에 각 위치에서 마이그레이션되었습니다.

  • 댈러스(us-south): 2018년 10월 30일
  • 프랑크프르트(eu-de): 2018년 10월 30일
  • 워싱턴, DC(us-east): 2018년 6월 12일
  • 시드니(au-syd): 2018년 5월 15일

IAM 인증으로 마이그레이션은 신규 및 기존 서비스 인스턴스에 다르게 영향을 줍니다.

  • 모든 위치에서 작성된 모든 새 서비스 인스턴스는 이제 IAM 인증을 사용하여 서비스에 액세스합니다. 베어러 토큰 또는 API 키를 전달할 수 있습니다. 토큰은 모든 호출에 서비스 인증 정보를 포함하지 않고 인증된 요청을 지원합니다. API 키는 HTTP 기본 인증을 사용합니다. Watson SDK 중 하나를 사용할 때 API 키를 전달하고 SDK가 토큰의 라이프사이클을 관리하도록 할 수 있습니다.
  • 표시된 마이그레이션 날짜 전에 위치에서 작성한 기존 서비스 인스턴스는 IAM 인증을 사용하도록 서비스 인증 정보를 마이그레이션할 때까지 인증을 위해 이전 Cloud Foundry 서비스 인증 정보에서 {username}{password}를 계속 사용합니다.

자세한 정보는 다음 문서를 참조하십시오.

  • 서비스 인스턴스가 어떤 인증 메커니즘을 사용하는지 확인하려면, ‘ IBM Cloud ’ 대시보드에서 해당 인스턴스를 클릭하여 서비스 자격 증명을 확인하세요.
  • IAM 토큰을 Watson 서비스와 함께 사용하는 방법에 대한 자세한 정보는 Watson 서비스에 인증을 참조하십시오.
  • IAM 인증을 사용하는 예제는 API 및 SDK 참조 문서를 참조하십시오.

2018년 6월 12일

워싱턴 DC 위치에서 호스팅되는 애플리케이션을 위한 새 기능

다음 기능은 워싱턴, DC(us-east)에서 호스팅하는 애플리케이션에 사용할 수 있습니다.

  • 서비스는 이제 새 API 인증 프로세스를 지원합니다. 자세한 정보는 2018년 10월 30일 서비스 업데이트를 참조하십시오.
  • 서비스는 이제 X-Watson-Metadata 헤더 및 DELETE /v1/user_data 메소드를 지원합니다. 자세한 정보는 정보 보안을 참조하십시오.

2018년 5월 15일

시드니 위치에서 호스팅되는 애플리케이션을 위한 새 기능

다음 기능은 시드니(au-syd)에서 호스팅하는 애플리케이션에 사용할 수 있습니다.

  • 서비스는 이제 새 API 인증 프로세스를 지원합니다. 자세한 정보는 2018년 10월 30일 서비스 업데이트를 참조하십시오.
  • 서비스는 이제 X-Watson-Metadata 헤더 및 DELETE /v1/user_data 메소드를 지원합니다. 자세한 정보는 정보 보안을 참조하십시오.

2017년 10월 2일

audio/l16 오디오 형식에 대한 변경사항
audio/l16 형식의 경우 이제 리턴된 오디오의 엔디언을 선택적으로 지정할 수 있습니다. (미리 샘플링 속도를 지정해야 합니다.) 예시로는 audio/l16;rate=22050;endianness=big-endianaudio/l16;rate=22050;endianness=little-endian 이 있으며, 기본값은 시그니픽언트 엔디안입니다. 자세한 정보는 오디오 형식 사용을 참조하십시오.

2017년 7월 14일

MP3(MPEG) 오디오 형식에 대한 새로운 지원
서비스는 이제 MP3 또는 MPEG(Motion Picture Experts Group) 오디오 형식을 지원합니다. 지원되는 오디오 형식에 관한 자세한 정보는 오디오 형식 사용을 참조하십시오.

2017년 4월 10일

WebM(Web Media) 오디오 형식에 대한 새 지원
서비스는 이제 Opus 또는 Vorbis 코덱이 포함된 WebM(Web Media) 오디오 형식을 지원합니다. 또한 Opus 코덱 외에도 Vorbis 코덱이 포함된 Ogg 오디오 형식을 지원합니다. 지원되는 오디오 형식에 관한 자세한 정보는 오디오 형식 사용을 참조하십시오.
CORS(Cross-Origin Resource Sharing)에 대한 새로운 지원
서비스는 이제 브라우저 기반 클라이언트가 서비스를 직접 호출할 수 있도록 CORS(Cross-Origin Resource Sharing)를 지원합니다. 자세한 내용은 CORS 지원을 참조하세요.
성공적인 HTTP 응답 코드 변경사항
사용자 정의 인터페이스의 일부 메소드를 완료하기 위해 HTTP 응답 코드가 다음과 같이 변경되었습니다.
  • POST /v1/customizations 메소드는 이제 201을 리턴합니다(200 대신).
  • POST /v1/customizations/{customization_id} 메소드는 이제 200을 리턴합니다(201 대신).
  • POST /v1/customizations/{customization_id}/words 메소드는 이제 200을 리턴합니다(201 대신).
  • PUT /v1/customizations/{customization_id}/words/{word} 메소드는 이제 200을 리턴합니다(201 대신).
일본어 part_of_speech 매개변수 오용에 대한 새 오류
일본어 이외의 언어로 POST /v1/customizations/{custom_id}/words를 지정하려는 경우 PUT /v1/customizations/{customization_id}/words/{word}Part of speech is supported for ja-JP language only 메소드는 이제 HTTP 리턴 코드 400을 리턴하며 오류 메시지는 part_of_speech입니다.
단어 메소드를 추가하기 위한 응답 본문의 변경사항
POST /v1/customizations/{custom_id}/words 메소드는 이제 비어 있는 응답 본문({})을 리턴합니다.

2016년 12월 1일

새 라틴 아메리카 스페인어 음성: es-LA_SofiaVoice

서비스에는 es-LA_SofiaVoice 음성과 동등한 라틴 아메리카의 새 음성인 es-US_SofiaVoice가 포함됩니다. 두 음성 사이의 가장 중요한 차이점은 $(달러 기호)를 해석하는 방법입니다. 라틴 아메리카 버전은 pesos라는 용어를 사용합니다. 북미 버전은 dolares라는 용어를 사용합니다. 두 음성 간의 기타 사소한 차이점도 존재할 수 있습니다.

새로운 미국 영어 음성: en-US_LisaVoiceen-US_MichaelVoice

en-US_AllisonVoice 외에도 이제 en-US_LisaVoiceen-US_MichaelVoice의 두 가지 추가 음성이 SSML 음성 변환으로 변환될 수 있습니다.

일본어 사용자 정의에 대한 변경사항

사용자 정의 인터페이스를 일본어에 사용하면 서비스가 사용자 정의 모델에 대해 정의된 단어/변환 쌍에서 가장 긴 단어와 일치합니다. 예를 들어, 사용자 정의 모델에 대해 다음 두 항목을 고려하십시오.

{
  "words": [
    {"word":"NY", "translation":"ニューヨーク", "part_of_speech":"Mesi"},
    {"word":"NYC", "translation":"ニューヨークシティ", "part_of_speech":"Mesi"}
  ]
}

서비스가 입력 텍스트에서 “ NYC ”라는 문자열을 발견하면, “ NY ”보다 일치하는 부분이 더 길기 때문에 해당 단어를 일치시키는 것입니다. 이전에는 이 서비스가 ‘ NY ’라는 문자열과 일치했을 것입니다. 사용자 지정 모델에서 일본어 항목을 다루는 방법에 대한 자세한 내용은 ‘일본어 항목 다루기’를 참조하세요.

2016년 9월 22일

이제 모든 언어에 대해 맞춤 설정이 가능합니다
사용자 정의와 GET /v1/pronunciation 메소드에 포함되는 사용자 정의 인터페이스는 이제 서비스에서 지원되는 모든 언어로 사용할 수 있습니다. 인터페이스는 베타 릴리스로 유지됩니다. 자세한 정보는 사용자 정의 이해를 참조하십시오.
SSML의 새로운 일본어 지원
이 서비스는 이제 일본어에 대한 SSML을 지원합니다. SSML 지원에 관한 일반 정보는 SSML 이해를 참조하십시오. 일본어 SPR 및 IPA 기호에 대한 자세한 정보는 일본어 기호를 참조하십시오. 추가 고려사항 및 part_of_speech 필드는 일본어 사용자 정의 모델의 단어에 대한 항목을 작성할 때 적용됩니다. 자세한 정보는 일본어 항목 관련 작업을 참조하십시오.
새로운 음성 변환 SSML 기능
이제 서비스는 새 <voice-transformation> 요소를 통해 SSML 음성 변환을 제공합니다. 음성의 음높이, 음높이 범위, 성문 긴장도, 호흡, 속도, 음색을 수정하는 사용자 정의 변환을 작성하여 가능한 음성 범위를 확장할 수 있습니다. 서비스는 두 가지 기본 제공 가상 음성인 YoungSoft를 제공합니다. 현재 서비스는 미국 영어의 Allison 음성으로만 음성 변환을 지원합니다.
이제 WebSocket 인터페이스에서 사용할 수 있는 단어 타이밍
서비스는 이제 WebSocket 인터페이스로 전달하는 입력 텍스트의 모든 문자열에 대한 단어 시간 지정 정보를 리턴합니다. 입력에서 모든 문자열의 시작 시간 및 종료 시간을 가져오려면 서비스로 전달하는 JSON 오브젝트의 선택적인 words 매개변수의 timings 문자열이 포함된 배열을 지정하십시오. 이 기능은 현재 일본어 입력 텍스트에 사용할 수 없습니다. 자세한 정보는 단어 타이밍 생성 을 참조하십시오.
SSML 유효성 검증에 대한 새로운 지원
서비스는 컨텍스트에서 제출하는 모든 SSML 요소를 유효성 검증합니다. 올바르지 않은 태그가 발견되면 서비스는 설명 메시지가 포함된 HTTP 400 응답 코드를 보고하고 메소드는 실패합니다. 이전 버전에서는 서비스가 오류를 일관성 없이 처리했습니다. 예를 들어, 잘못된 단어 발음을 지정하면 예측 불가능하거나 일관성 없는 동작이 발생할 수 있었습니다. 자세한 정보는 SSML 유효성 검증을 참조하십시오.
IBM SPR 형식은 이제 spr 대신에 ibm(으)로 지정됩니다.
spr의 사용은 GET /v1/pronunciation 메소드의 format 옵션에 대한 인수로 사용되지 않으며 SSML <phoneme> 요소의 alphabet 속성과 함께 사용됩니다. IBM SPR 표기법을 사용하려면 모든 경우에 ibm 대신 spr 인수를 사용하십시오.
audio/mulaw 오디오 형식에 대한 새로운 지원
지원되는 오디오 형식의 목록에 audio/mulaw;rate={rate}이(가) 포함됩니다. audio/basic과 같이 이 형식은 8kHz로 샘플링되는 8비트 u-law(또는 mu-law) 데이터를 사용하여 인코딩된 단일 채널 오디오를 제공합니다. 자세한 정보는 오디오 형식 사용을 참조하십시오.
음성을 나열할 때 식별되는 새 지원 기능
GET /v1/voicesGET /v1/voices/{voice} 메소드는 이제 음성마다 출력의 일부로 supported_features 오브젝트를 리턴합니다. 오브젝트는 음성이 사용자 정의 및 SSML <voice_transformation> 요소를 지원하는지 여부를 설명합니다. 자세한 정보는 언어 및 음성을 참조하십시오.

2016년 6월 23일

음성 합성을 위한 새 WebSocket 인터페이스

서비스는 이제 문자-음성 변환을 합성하기 위해 WebSocket 인터페이스를 제공합니다. 인터페이스는 HTTP 인터페이스의 /v1/synthesize 메소드와 동일한 기능을 제공합니다. 일반 텍스트 또는 SSML로 표시되는 텍스트를 허용합니다. 또한 SSML <mark> 요소의 사용을 지원하여 표시 앞에 오는 모든 텍스트의 합성을 완료하는 오디오 시간을 식별합니다. 자세한 정보는 WebSocket 인터페이스를 참조하십시오.

SSML을 위한 확장된 언어 지원

이 서비스는 이제 카스티야어 및 북아메리카 스페인어, 이탈리아어, 브라질 포르투갈어에 대한 SSML로 어노테이션이 작성된 텍스트에 대한 지원을 제공합니다. 서비스는 이미 미국 및 영국 영어, 프랑스어 및 독일어에 대한 SSML의 사용을 지원하고 있습니다. 이 업데이트부터 서비스는 일본어를 제외한 모든 언어가 사용된 SSML을 지원합니다. 또한 IBM SPR 및 IPA 표기법을 둘 다 사용하여 SSML <phoneme> 요소로 단어 발음을 정의할 수 있습니다. 자세한 정보는 SSML 이해음성 기호 이해를 참조하십시오.

미국 영어의 경우, SSML <phoneme> 요소를 사용하여 사용자 정의 모델에서 단어 항목을 작성할 수도 있습니다. 사용자 정의는 미국 영어에만 지원됩니다. 자세한 정보는 사용자 정의 이해를 참조하십시오.

향상된 음성 합성을 위해 업데이트된 음성

서비스 기능으로 자주 사용되는 음성에 대한 표현성 및 자연성이 개선되었습니다. 개선은 입력 텍스트의 RNN(Recursive Neural Network) 기반 운율 예측에 따라 달라집니다. 이는 다음 언어가 사용된 새 서비스 엔진 및 음성 모델 업데이트로 사용할 수 있습니다.

  • en-US_AllisonVoice
  • en-US_LisaVoice
  • en-US_MichaelVoice
  • es-ES_EnriqueVoice
  • fr-FR_ReneeVoice
단어 발음에 대한 새 사용자 정의 ID 매개변수

GET /v1/pronunciation 메소드는 이제 선택적인 customization_id 조회 매개변수를 허용합니다. 매개변수는 지정된 사용자 정의 모델에서 단어 변환을 가져옵니다. 사용자 정의 모델에 단어가 포함되지 않은 경우 메소드는 단어의 기본 발음을 리턴합니다. 자세한 내용은 API 및 SDK 참조를 참조하세요.

사용자 정의 ID를 사용하지 않고 미국 영어 이외의 언어로 GET /v1/pronunciation 메소드를 사용하는 경우 IBM SPR 표기법에서 단어의 발음만 요청할 수 있습니다. 미국 영어 이외의 언어의 경우 메소드의 spr 옵션을 사용하여 format을 지정해야 합니다.

audio/basic 오디오 형식에 대한 새로운 지원

지원되는 오디오 형식의 목록에는 이제 8kHz로 샘플링되는 8비트 u-law(또는 mu-law) 데이터를 사용하여 인코딩된 단일 채널 오디오를 사용하는 audio/basic이 포함됩니다. 자세한 정보는 오디오 형식 사용을 참조하십시오.

HTTP 및 WebSocket 인터페이스는 이제 경고를 리턴할 수 있습니다.

HTTP 및 WebSocket /v1/synthesize 메소드는 요청에 포함되는 올바르지 않은 조회 매개변수 또는 JSON 필드에 대한 메시지를 포함한 warnings 응답을 리턴할 수 있습니다. 경고의 형식이 변경되었습니다. 다음 예에서는 이전 형식이 표시됩니다.

"warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."

동일한 경고의 형식은 다음과 같습니다.

"warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."

2016년 3월 10일

이제 합성 메소드가 경고를 리턴할 수 있음
GETPOST /v1/synthesize 메소드는 이제 요청에 포함되는 올바르지 않은 조회 매개변수 또는 JSON 필드에 대한 경고 메시지의 목록이 포함된 Warnings 응답 헤더를 리턴할 수 있습니다. 목록의 각 요소에는 올바르지 않은 인수 문자열의 배열이 뒤에 오는 경고의 특성을 설명하는 문자열이 포함되어 있습니다. 예를 들어, Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']. 자세한 정보는API & SDK 참조를 참조하십시오.
베타 Apple iOS SDK가 더 이상 사용되지 않음
베타 *Watson Apple® iOS 운영 체제용 Speech Software Development Kit(SDK)*은 더 이상 사용되지 않으며 Watson Swift SDK로 대체됩니다. 새로운 SDK는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 swift-sdk 저장소에서 확인할 수 있습니다.

2016년 2월 22일

새로운 표현 SSML 기능
서비스는 새 표현 SSML 기능으로 업데이트되었습니다. 서비스는 세 가지 말하기 스타일 중 하나(GoodNews, Apology 또는 Uncertainty) 중 하나로 표현력을 나타내는 데 사용할 수 있는 <express-as> 요소로 SSML을 확장합니다. 요소를 텍스트, 문장, 구문 또는 단어의 전체 본문에 적용할 수 있습니다. 서비스는 현재 미국 영어의 Allison 음성(en-US_AllisonVoice)에만 표현성을 지원합니다.

2015년 12월 17일

새로운 베타 사용자 정의 인터페이스

서비스는 입력에서 발생하는 특이한 단어를 발음하는 방법을 지정하는 데 사용할 수 있는 새 사용자 정의 인터페이스를 제공합니다. 이 인터페이스에는 사용자 정의 모델과 그 안에 포함된 단어/번역 쌍을 생성하고 관리하는 데 사용할 수 있는 몇 가지 새로운 메서드가 포함되어 있습니다. 그런 다음 텍스트-오디오 변환을 합성할 때 사용자 정의 모델을 사용할 수 있습니다.

서비스는 유사 발음 변환 및 음성 변환을 지원합니다. 음성 변환은 표준 IPA(International Phonetic Alphabet) 표시 또는 자체 IBM Symbolic Phonetic Representation(SPR) 중 하나를 사용할 수 있습니다. SSML은 음성 변환을 지정하는 데 사용합니다.

사용자 정의 인터페이스에는 POST /v1/customizations, POST /v1/customizations/{customization_id}, POST /v1/customizations/{customization_id}/wordsPUT /v1/customizations/{customization_id}/words/{word} 이름이 있는 새 HTTP 메소드의 콜렉션이 포함됩니다. 서비스는 단어의 발음을 리턴하는 새 GET /v1/pronunciation 메소드와 특정 음성에 대한 자세한 정보를 리턴하는 새 GET /v1/voices/{voice} 메소드도 제공합니다. 또한 서비스 인터페이스의 기존 메소드는 이제 필요에 따라 사용자 정의 모델 매개변수를 허용합니다.

사용자 지정 및 인터페이스에 대한 자세한 내용은 사용자 지정 이해API 및 SDK 참조를 참조하세요.

사용자 정의 인터페이스는 현재 미국 영어만 지원하는 베타 릴리스입니다. 모든 사용자 정의 메소드 및 GET /v1/pronunciation 메소드는 현재 미국 영어로만 사용자 정의 모델 및 단어 변환을 작성하고 조작하는 데 사용할 수 있습니다.

새로운 브라질 포르투갈어 음성: pt-BR_IsabelaVoice

서비스는 새 음성인 pt-BR_IsabelaVoice를 지원하여 여성 음성의 브라질 포르투갈어로 오디오를 합성합니다. 자세한 정보는 언어 및 음성을 참조하십시오.

2015년 9월 21일

새로운 모바일 SDK 사용 가능

음성 서비스에 두 가지 새 베타 모바일 SDK(Software Development Kits)를 사용할 수 있습니다. SDK는 모바일 애플리케이션을 사용하여 Text to Speech 및 Speech to Text 서비스와 상호작용합니다. SDK를 사용하여 텍스트를 Text to Speech 서비스로 전송하고 오디오 응답을 수신할 수 있습니다.

  • Watson Swift SDK는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 swift-sdk 저장소에서 확인할 수 있습니다.
  • Watson Speech( Android™ SDK )는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 speech-android-sdk 저장소에서 확인할 수 있습니다.

두 SDK는 IBM Cloud 서비스 인증 정보 또는 인증 토큰 중 하나를 사용하여 음성 서비스로의 인증을 지원합니다. 해당 SDK는 베타 기능이므로 향후 변경될 수 있습니다.

새로운 일본어 음성: ja-JP_EmiVoice

서비스는 새 언어인 일본어를 지원합니다. ja-JP_EmiVoice 음성은 일본인 여성의 음성입니다.

2015년 7월 1일

Text to Speech 서비스는 이제 GA(Generally Available)임

이 서비스는 2015년 7월 1일에 베타에서 GA(General Availability)로 이동했습니다. Text to Speech API의 베타 버전과 정식(GA) 버전 간에는 다음과 같은 차이점이 있습니다. GA 릴리스에서는 사용자가 서비스의 새 버전으로 업그레이드해야 합니다.

새 토큰 기반 프로그래밍 모델

새 프로그래밍 모델은 클라이언트와 서비스 간의 직접적인 상호작용을 지원합니다. 이 모델을 사용하여 클라이언트는 서비스와 직접 통신하기 위해 인증 토큰을 가져올 수 있습니다. 토큰을 사용하여 클라이언트는 서비스를 대신 호출하기 위해 IBM Cloud에서 서버 측 프록시 애플리케이션을 필요로 하지 않을 수 있습니다. 토큰은 클라이언트가 서비스와 상호작용하는 선호 수단입니다.

서비스는 클라이언트와 서비스 간의 통신 및 데이터를 전달하기 위해 서버 측 프록시를 필요로 하는 이전 프로그래밍 모델을 계속해서 지원합니다. 그러나 새 모델은 더욱 효율적이며 더 높은 처리량을 제공합니다.

SSML(Speech Synthesis Markup Language)에 대한 새로운 지원

이제 SSML(Speech Synthesis Markup Language)을 GET 메소드의 HTTP POST/v1/synthesize 버전으로 전달할 수 있습니다. SSML은 Text to Speech 서비스와 같은 음성 합성 애플리케이션을 위해 텍스트의 어노테이션을 제공하도록 설계된 XML 기반 마크업 언어입니다. SSML 입력을 서비스에 전달하는 데 대한 자세한 정보는 입력 텍스트 지정을 참조하십시오.

이 서비스는 처음에는 영국 및 미국 영어, 프랑스어, 독일어에 대해서만 SSML 사용을 지원했습니다. 서비스는 이탈리아어 및 스페인어에 사용할 SSML은 지원하지 않습니다. SSML을 사용하는 경우 지원되는 언어 중 하나로 오디오를 위한 음성을 선택해야 합니다. 이 경우의 결과는 중요하지 않습니다.

사용 가능한 음성에 대한 변경사항

변형 및 확장된 합성 음성에서 지원되는 음성들. 이 서비스는 이제 /v1/synthesize 메서드를 통해 여러 다른 음성, 언어 및 방언을 지원합니다. 지원되는 음성에 대한 자세한 정보는 언어 및 음성을 참조하십시오.

베타에서 사용할 수 있는 세 가지 음성이 GA에서는 이름이 변경됩니다.

  • VoiceEnUsMichael은(는) 이제 en-US_MichaelVoice
  • VoiceEnUsLisa은(는) 이제 en-US_LisaVoice
  • VoiceEsEsEnrique은(는) 이제 es-ES_EnriqueVoice

음성의 이전 이름은 버전이 사용 가능한 상태로 유지되는 동안 계속해서 서비스의 베타 버전에서 사용됩니다(-beta API 엔드포인트를 통해). 그러나 서비스의 GA 버전에서는 새 이름을 사용해야 합니다.

FLAC(Free Lossless Audio Codec) 오디오 형식에 대한 새로운 지원

이제 FLAC(Free Lossless Audio Codec) 형식으로 오디오를 리턴하도록 서비스를 요청할 수 있습니다. 서비스는 파형 오디오 파일 형식(WAV)에서 Opus 코덱(기본값)이 포함된 Ogg 형식으로 오디오를 계속해서 리턴할 수 있습니다. /v1/synthesize 메소드로 오디오 형식 사용에 관한 자세한 정보는 오디오 형식 사용을 참조하십시오.

최대 합성된 텍스트 양에 대한 새로운 한계

HTTP /v1/synthesize 요청의 URL 또는 HTTP GET 요청의 본문에서 POST 메소드로 전송하는 텍스트는 이제 최대 5KB로 제한됩니다. 베타 버전에서 최대 텍스트 크기는 4MB입니다.

서비스 개선에 기여하지 않는 새 헤더

/v1/synthesize 메소드에는 이제 X-WDC-PL-OPT-OUT 헤더가 포함되어 서비스가 향후 결과를 개선하기 위해 조작에서 텍스트 및 오디오 결과를 사용하는지 여부를 제어합니다. 서비스에서 텍스트 및 오디오 결과를 사용할 수 없도록 헤더에 대해 1 값을 지정하십시오. 매개변수는 현재 요청에만 적용됩니다. 새 헤더는 베타 메소드의 X-logging 헤더를 대체합니다. 자세한 정보는 Watson 서비스에 대한 요청 로깅 제어를 참조하십시오.

음성 합성을 위한 HTTP 오류 코드 변경사항

/v1/synthesize 메소드의 경우 다음 오류 코드가 변경되었습니다.

  • 오류 코드 406("허용할 수 없음. 지원되지 않는 MIME 유형.")이 제거되었습니다.
  • 오류 코드 415("지원되지 않는 매체 유형")이 추가되었습니다.
  • 오류 코드 503("서비스 사용 불가능")이 추가되었습니다.
음성을 나열하기 위한 HTTP 오류 코드 변경사항

GET /v1/voices 메소드의 경우 다음 오류 코드가 변경되었습니다.

  • 오류 코드 406("허용할 수 없음. 지원되지 않는 MIME 유형.")이 제거되었습니다.
  • 오류 코드 415("지원되지 않는 매체 유형")이 추가되었습니다.