IBM Cloud용 Speech to Text의 릴리스 정보

IBM Cloud

IBM Cloud 에서 호스팅되는 IBM Watson® Speech to Text 관리형 인스턴스 또는 IBM Cloud Pak for Data as a Service에서 호스팅되는 인스턴스의 각 릴리스 및 업데이트에는 다음과 같은 기능 및 변경 사항이 포함되었습니다. 달리 명시되지 않은 한 모든 변경사항은 이전 릴리스와 호환되며 모든 신규 및 기존애플리케이션에 자동으로 투명하게 제공됩니다.

서비스의 알려진 제한사항에 대한 정보는 알려진 제한사항 을 참조하십시오.

IBM Cloud Pak for Data의 서비스 릴리스 및 업데이트에 대한 정보는 Speech to Text for IBM Cloud Pak for Data의 릴리스 정보를 참조하십시오.

2026년 6월 29일

대규모 음성 모델용 새로운 ‘ parameter_set ’ 매개변수

대규모 언어 모델에는 이제 단 한 번의 호출로 최적화된 설정을 적용할 수 있는 ‘ parameter_set ’ 요청 매개변수가 포함됩니다. parameter_set=enhanced 를 사용하면 개별 매개변수를 수동으로 설정하지 않고도 인식 품질을 향상시킬 수 있습니다.

2026년 6월 26일

low_latency 이제 미국 영어 대형 음성 모델에서 이 모드를 사용할 수 있습니다

미국 영어 대형 음성 모델 en-US 에 이제 더 빠른 음성 처리를 위한 ‘ low_latency ’ 모드가 추가되었습니다.

2026년 5월 15일

이제 이탈리아어용 대형 음성 모델을 일반적으로 사용할 수 있습니다

이탈리아어용 대형 음성 모델( it-IT )은 이제 모든 데이터 센터에서 8kHz 및 16kHz 오디오 샘플링 속도를 모두 지원하는 일반 사용(GA)이 가능합니다.

2026년 4월 10일

이제 네덜란드어용 대형 음성 모델을 일반적으로 사용할 수 있습니다

네덜란드어용 대형 음성 모델( nl-NL )은 이제 모든 데이터 센터에서 8kHz 및 16kHz 오디오 샘플링 속도를 모두 지원하는 일반 사용(GA)이 가능합니다.

2026년 4월 7일

결함 수정: 스마트 서식 지정 기능의 프랑스어 영숫자 시퀀스 인식에서 fille이 잘못 인식되는 문제를 수정했습니다.

2026년 3월 17일

프랑스어 대규모 언어 모델 개선
이제 영숫자 시퀀스 인식의 정확도를 높이기 위해 프랑스어 대규모 언어 모델(LSM)( fr-FRfr-CA )이 개선되었습니다.

결함 수정: /v1/recognize?language_identification=true 요청이 바로 뒤이어 일반 /v1/recognize 요청이 올 때 간헐적으로 5xx 오류가 발생하는 언어 식별(LID) 문제를 수정했습니다.

결함 수정: max_active 매개변수에서 내부 서버 오류가 관찰되는 문제를 수정했습니다.

결함 수정: include_transparent_wordstrue 으로 설정할 때 내부 서버 오류가 잘못 반환되는 문제를 수정했습니다.

2026년 3월 4일

독일어 및 네덜란드어 음성-텍스트 변환 모델 개선 사항

이제 독일어와 네덜란드어 음성-텍스트 변환 모델이 개선되었습니다.

  • 이제 영숫자 시퀀스 인식 및 일반 사용 사례에 대해 독일어 대형 음성 모델(LSM)( de-DE )의 개선 사항을 사용할 수 있습니다.
  • 이제 영숫자 시퀀스 인식 및 중요도 처리를 위해 네덜란드어 전화( nl-NL_Telephony )의 개선 사항을 사용할 수 있습니다.

2026년 2월 16일

이제 독일어용 대형 음성 모델을 일반적으로 사용할 수 있습니다

독일어용 대용량 음성 모델( de-DE )은 이제 모든 데이터 센터에서 8kHz 및 16kHz 오디오 샘플링 속도를 모두 지원하는 일반 사용(GA)이 가능합니다.

음성 트랜스크립트 강화 기능 향상

이제 날짜, 시간, 통화, 숫자 및 측정값을 포함한 명명된 엔티티에 대해 향상된 음성 대화 내용 강화 기능을 사용할 수 있습니다. 이제 이러한 엔티티는 언어 로캘에 따라 올바르게 처리됩니다.

2026년 1월 22일

결함 수정: 요청에 모델 매개변수가 없을 때 음성 대화 내용 강화가 실패하는 문제를 수정했습니다.

결함 수정: 내부 메모리 부족 오류로 인해 음성-텍스트 변환(STT) 사용자 지정 학습 시간이 길어지는 문제를 수정했습니다.

2026년 1월 8일

결함 수정: 프랑크푸르트 데이터 센터의 음성 기록 강화 문제를 수정했습니다.

결함 수정: interim_resultsfalse 로 설정된 경우 최종 음성 녹취록이 전송되지 않는 문제를 interim_results 에서 수정했습니다.

2025년 12월 10일

sounds_like 기능에 대한 입력 필드 유효성 검사

이제 sounds_like 기능의 입력 필드 유효성 검사 기능이 추가 언어에 대해 활성화됩니다.

  • en-US, en-AU, en-GB, en-IN, es-ES, es-AR, es-CL, es-CO, es-MX, es-PE, fr-FR_Telephony, fr-FR_Multimedia, de-DE_Telephony, de-DE_Multimedia, it-IT_Telephony, it-IT_Multimedia, nl-NL_Telephony 의 모델을 포함한 추가 언어에 대해 sounds_like 기능에 대한 입력 필드 유효성 검사가 활성화됩니다.

2025년 11월 25일

이제 대규모 음성 모델에 대한 중간 결과를 사용할 수 있습니다

이제 대규모 음성 모델(LSM)에 대한 중간 결과를 사용할 수 있습니다.

  • interim_results 매개변수는 이전에는 차세대 모델에서만 활성화되었습니다. 이제 LSM에서도 이 기능을 사용할 수 있습니다. 자세한 정보는 중간 결과를 참조하십시오.

2025년 11월 03일

이제 STT 모델에서 음성 시작 이벤트 감지 기능을 사용할 수 있습니다.

이제 STT 모델에서 음성 시작 이벤트 감지 기능을 사용할 수 있습니다.

  • 이제 음성 시작 이벤트 감지를 사용하면 수신 오디오 스트림에서 음성이 시작되는 것을 감지하여 사용자에게 알림을 보내는 recognize API를 통해 조기 알림을 받을 수 있습니다. 자세한 내용은 음성 시작 이벤트 감지를 참조하세요.
음성 활동 감지 기능이 개선되어 응답 속도가 빨라지고 정확도가 향상되며 시끄러운 환경에서도 성능이 향상됩니다.

이제 음성 활동 감지(SAD)가 음성 텍스트 변환 recognize API의 기존 방법 외에 새로운 개선된 방법을 포함하도록 업그레이드되었습니다.

  • 이 새로운 방법은 오디오 스트림 내에서 음성 경계를 감지하는 정확도와 성능을 향상시킵니다. sad_module:2 을 설정하여 사용할 수 있습니다. 자세한 내용은 ‘음성 활동 감지(SAD) ’를 참조하십시오.
이제 음성 언어 식별을 일반적으로 사용할 수 있습니다

이제 음성 언어 식별 기능을 일반적으로 사용할 수 있습니다.

  • 언어 식별(LID)은 오디오 스트림에서 음성 언어를 자동으로 감지합니다. 모델은 수신 오디오를 지속적으로 처리하고 지정된 임계값(기본값은 0.99 )보다 높은 신뢰 수준에 도달하면 식별된 언어를 반환합니다. 자세한 내용은 음성 언어 식별을 참조하세요.

2025년 10월 7일

hints 매개변수를 이제 일반적으로 사용할 수 있습니다

hints 매개변수는 이제 일반적으로 사용할 수 있습니다.

  • hints 매개변수는 스마트 포맷터로 후처리를 개선합니다. 이 매개변수는 포맷터가 사용자 의도를 더 정확하게 해석하고 기대에 더 잘 부합하는 결과를 반환하는 데 도움이 됩니다. 자세한 내용은 힌트 매개변수를 참조하세요.

2025년 9월 26일

이제 음성 대화 내용 강화 기능을 일반적으로 사용할 수 있습니다

이제 음성 대화 내용 강화 기능을 일반적으로 사용할 수 있습니다.

  • 음성 트랜스크립트 강화 기능은 원시 자동 음성 인식(ASR) 트랜스크립트의 가독성과 사용성을 개선합니다. 이 후처리 서비스는 자동으로 구두점을 추가하고 지능형 대문자를 적용하여 음성 콘텐츠의 구조와 명확성을 향상시킵니다. 자세한 내용은 음성 대화 내용 강화를 참조하세요.

2025년 9월 9일

결함 수정: Fr-CA 언어 모델의 스마트 서식 지정기에서 8자리 숫자가 0을 추가하여 잘못 서식 지정되던 문제를 수정했습니다. 이제 스마트 포맷터가 올바른 트랜스 크립 션을 반환합니다.

2025년 8월 19일

결함 수정: 스마트 포맷터에서 트랜잭션의 음성 숫자 값이 잘못 기록되던 문제를 수정했습니다. 예를 들어 one hundred and ninety-nine and twelve cents$199.12 로 표기되어야 하지만 199 e R$ 0,12 로 잘못 표시되었습니다. 이제 스마트 포맷터가 올바른 트랜스 크립 션을 반환합니다.

결함 수정: 프랑스어 모델용 스마트 서식 지정기에서 '센트'라는 단어의 서식이 잘못 지정되던 문제를 수정했습니다. 예를 들어 quatre-vingt-neuf quarante-cinq zéro trois deux huit cent seize soixante-dix-huit 는 예상했던 8945032811678 대신 89450328 100 1678 으로 기록되었습니다. 이제 스마트 포맷터가 올바른 트랜스 크립 션을 반환합니다.

2025년 7월 22일

결함 수정: 전폭 공백 문자( U+3000 )로 인해 발생하던 ja-JP 사용자 지정 모델 오류가 이제 수정되었습니다.

결함 수정: 이메일 주소에 공백이 추가되던 스마트 서식기 포르투갈어 이메일 서식 지정 문제가 이제 수정되었습니다. 자세한 내용은 포르투갈어용 스마트 포맷터를 참조하세요.

2025년 7월 8일

영어 대규모 음성 모델에 대한 명명된 개체 인식 개선 사항

도시, 주소, 도로명, 영숫자, 날짜, 이름 및 성에 대한 인식 개선 사항이 포함되어 있습니다.

결함 수정: 스마트 포맷터 스페인어 대형 음성 모델 (es-ES) 날짜 서식 지정

결함 수정: el primero de enero de dos mil-> el 01/01/200001/01/2000 로 포맷해야 합니다. 이 문제가 수정되었습니다. 자세한 내용은 스페인어용 스마트 포맷터를 참조하세요.

2025년 6월 17일

결함 수정: 스마트 포맷터 버전에 대한 값 할당으로 인해 삽입 오류가 발생하여 특정 요청을 처리하지 못하는 문제가 수정되었습니다. 이 문제가 해결되었습니다. 이제 스마트 포맷터 요청이 예상대로 응답합니다.

결함 수정: 스마트 포맷터에서 영숫자 문자에서 원치 않는 공백이 관찰되었습니다. 예: l k k one one five zero zero four two l e-> lkk1 150042le. 이 문제가 해결되었습니다. 이제 스마트 포맷터 요청이 예상대로 응답합니다.

2025년 5월 28일

이제 일본어용 새로운 대형 음성 모델이 일반 사용 가능합니다

이제 일본어용 대형 음성 모델을 일반적으로 사용할 수 있습니다.

개선: 음성 문자 구문에 대해 더 나은 스마트 포맷터 처리가 추가되었습니다 - a as in alpha-> a.

2025년 4월 29일

결함 수정: 스마트 포맷터에서 다양한 문자 또는 숫자 또는 기호 모호성 문제가 수정되었습니다

결함 수정: 다음 문제가 수정되었습니다:

  • 'O'는 숫자 0으로 포맷되었습니다
  • '진짜'는 ' r1 '로 형식이 지정되었습니다
  • '대장내시경'은 ':oscopy'로 형식이 지정되었습니다

2025년 4월 7일

결함 수정: OOV에서 예기치 않은 소스가 감지되었습니다
결함 수정: 사용자 지정 모델에 말뭉치를 추가할 때 이전에 삭제된 OOV 단어가 이전 소스에서 의도치 않게 복원될 수 있습니다. 이 문제가 수정되었습니다.

2025년 3월 18일

결함 수정: en-us 모델의 날짜 및 추가 숫자와 관련된 스마트 포맷터 문제가 수정되었습니다.
결함 수정: 총 자릿수가 필수 형식의 날짜보다 크면 서식 지정이 비활성화됩니다. 예를 들어 five twelve fifteen eleven-> 5 1/2/15115121511 이어야 합니다.

2025년 2월 11일

결함 수정: 특히 ja-JP_NarrowbandModel 에서 많은 수의 503’s 이 관찰되었습니다. 이 모델의 가용성을 높이기 위해 서비스를 개선했습니다.

결함 수정: en-US_Telephony 모델에서 STT 사용자 지정 메모리 할당 오류가 발견되었습니다. 이 문제가 해결되었습니다.

결함 수정: en-us 모델에서 약어와 관련된 스마트 포맷터 문제가 발견되었습니다(Dr.Doctor 로 수정됨 ). 이 문제가 해결되었습니다.

2025년 1월 14일

개선: 스마트 포맷터가 일부 개별 음성 숫자 조합을 결합하는 인스턴스의 영숫자가 업데이트되었습니다( 1 Z. 3 7 8 9 A. Y. 0 1 0 0 0 0 0 2 0 3-> 1 z 3789 a y 0100000203). 이 문제가 수정되었습니다.

결함 수정: 런타임이 모든 가설을 전송하지 못함
결함 수정: 키워드의 신뢰도 점수가 가설과 다른 경우 전사 타임스탬프 문제로 인해 일부 단어가 전사본에서 누락되었습니다. 그 결과 오디오에 두 단어가 포함되어 있어도 yes 이라는 단일 단어가 반환되었습니다( yes). 이 문제를 해결하기 위해 타임스탬프 삭제 로직이 개선되었습니다.

2024년 11월 19일

이제 독일어에 대한 새로운 대형 음성 모델을 일반적으로 사용할 수 있습니다

이제 독일어에 대한 대형 음성 모델을 일반적으로 사용할 수 있습니다.

결함 수정: 다중 대역 영어 대형 음성 모델에 대한 업샘플링 로직( 8khz 에서 16khz ) 개선

결함 수정: 모델이 8khz 과 16khz 을 모두 처리하려면 서비스에서 업샘플링 로직이 필요합니다.

2024년 11월 05일

결함 수정: 스피커 레이블에서 LSM 및 RNNT에 대한 중간 결과 비활성화
결함 수정: 스피커 레이블이 활성화된 경우 중간 결과 도착이 중지되는 문제가 발견되었습니다. 이 문제가 해결되어 이제 화자 레이블을 사용할 때 서비스가 중간 결과를 즉시 반환합니다.

2024년 8월 23일

모든 대규모 언어 모델이 이제 일반에 공개되었습니다

이제 모든 언어에 대한 대규모 음성 모델을 일반 사용 가능(GA)으로 제공합니다. 이들은 프로덕션 환경 및 애플리케이션에서 사용할 수 있도록 지원됩니다.

2024년 6월 18 일

브라질 포르투갈어 및 스페인어에 대한 새로운 대형 음성 모델이 현재 오픈 베타 상태입니다.

브라질 포르투갈어 및 스페인어에 대한 대형 음성 모델은 이제 오픈 베타입니다. 스페인어에는 카스티야, 아르헨티나, 칠레, 콜롬비아, 멕시코, 페루 방언이 포함됩니다.

2024년 5월 15 일

영어의 대형 음성 모델은 이제 일반적으로 사용 가능합니다.

미국, 호주, 인도 및 영국 통용어를 포함하는 영어의 대형 음성 모델은 이제 일반적으로 사용 가능합니다 (GA). 이 기능은 운영 환경 및 애플리케이션에서 사용할 수 있도록 지원됩니다.

2024년 3월 7일

오픈 베타의 미국 영어에 대한 대형 음성 모델
새로운 미국 영어용 대형 음성 모델이 오픈 베타 버전으로 출시되었습니다. 지원되는 기능 (베타) 에 대한 자세한 정보는 대형 음성 언어 및 모델 을 참조하십시오.

2023년 11월 30일

Speech to Text 매개변수 speech _begin_event

이 매개변수를 사용하면 클라이언트 애플리케이션에서 일부 단어 또는 음성이 감지되어 Speech to Text이 디코딩 중임을 알 수 있습니다. 자세한 정보는 음성 인식 매개변수 사용 을 참조하십시오.

사용자 정의 단어의 경우 'mapping_only' 매개변수

'mapping_only' 매개변수를 사용하면 사용자 지정 단어를 직접 사용하여 학습 대신 후처리로 'sounds_like'(또는 단어)를 'display_as' 값에 매핑할 수 있습니다. 자세한 정보는 단어 리소스 를 참조하십시오.

비일본인일본인 가이드라인을 참조하세요.

새로 개선된 차세대 언어 모델 사용자 정의에 대한 브라질 포르투갈어 및 프랑스어 - 캐나다어 지원

브라질-포르투갈어 및 프랑스-캐나다 차세대 모델에 대한 언어 모델 사용자 정의가 최근에 추가되었습니다. 이 서비스 업데이트에는 추가 내부 개선사항이 포함되어 있습니다.

새 스마트 형식화 기능

차세대 모델의 새 스마트 형식화 기능은 미국 영어, 브라질 포르투갈어, 프랑스어 및 독일어로 지원됩니다. 자세한 내용은 스마트 형식화 버전 을 참조하십시오.

새로 개선된 차세대 언어 모델 사용자 정의에 대한 Castilian 스페인어 및 LATAM 스페인어 지원

카스티야 스페인어 및 LATAM 스페인어 차세대 모델에 대한 언어 모델 사용자 정의가 추가되었습니다. 이 서비스 업데이트에는 추가 내부 개선사항이 포함되어 있습니다.

영어, 일본어, 프랑스어용 대형 음성 모델 - 얼리 액세스용

조기 액세스 기능의 경우, IBM Watson Speech-to-Text및 IBM watsonx Assistant에서 영어, 일본어 및 프랑스어로 대형 음성 모델을 사용할 수 있습니다. 이러한 대형 음성 모델의 기능 세트는 제한적이지만 차세대 모델보다 더 정확하며 더 작은 크기와 더 나은 스트리밍 모드 기능으로 인해 더 빠르고 저렴하게 실행할 수 있습니다.

이러한 기본 모델을 테스트하고 결과 및 피드백을 공유하는 데 관심이 있는 경우 이 양식 을 작성하여 제품 관리 팀에 문의하십시오.

2023년 7월 28 일

중요: 모든 이전 세대 모델은 2023년 8월 1일부터 중단됩니다.
중요: 이제 모든 이전 세대 모델이 서비스에서 중단되었습니다. 새 고객은 이제 차세대 모델만 사용해야 합니다. 기존의 모든 고객은 이제 동등한 차세대 모델로 마이그레이션해야 합니다. 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델 을 참조하십시오. 차세대 모델로 마이그레이션하는 방법에 대한 자세한 정보는 차세대 모델로 마이그레이션 을 참조하십시오.

2023년 6월 9 일

결함 수정사항: 사용자 정의 언어 모델을 작성하고 훈련하는 것이 표준 및 낮은 대기 시간의 Next-Generation 모델 모두에 최적입니다.
결함 수정사항: 대기 시간이 짧은 차세대 모델을 사용하여 말뭉치 텍스트 파일 및/또는 사용자 정의 단어가 있는 사용자 정의 언어 모델을 작성하고 훈련할 때 이제 표준 모델과 동일한 방식으로 수행됩니다. 이전에는 차세대 낮은 대기 시간 모델을 사용하는 경우에만 최적이 아니었습니다.
결함 수정사항: 텐서 오류 메시지로 인해 STT Websockets 세션이 더 이상 실패하지 않음
결함 수정사항: STT웹 소켓을 사용할 때 "STT가 오류를 리턴함: 차원 0을 제외하고 텐서 크기가 일치해야 합니다." 라는 오류 메시지로 인해 세션이 더 이상 실패하지 않습니다.

2023년 5월 18 일

영어 차세대 의료 전화 통신 모델에 대한 업데이트

음성 인식 성능을 개선하기 위해 영국의 차세대 의료용 전화 시스템 모델이 업데이트되었습니다:

  • en-WW_Medical_Telephony
새로 개선된 차세대 언어 모델 사용자 정의에 대한 프랑스어 및 독일어 지원 추가

프랑스어 및 독일어 차세대 모델에 대한 언어 모델 사용자 정의가 최근 추가되었습니다. 이 서비스 업데이트에는 추가 내부 개선사항이 포함되어 있습니다.

개선된 차세대 사용자 지정 기능에 대한 자세한 내용은 다음을 참조하십시오

결함 수정사항: 반자 가타카나 문자를 포함하는 사용자 정의 단어가 이제 일본어 전화 통신 모델에서 명확한 오류 메시지를 리턴합니다.

결함 수정사항: 문서 에 따라 사용자 정의 단어에서 전체 너비 가타카나 문자만 허용되며 이제 다음 세대 모델에 지원되지 않음을 설명하는 오류 메시지가 표시됩니다. 이전에는 반자 가타카나 문자를 포함하는 사용자 정의 단어를 작성할 때 오류 메시지가 제공되지 않았습니다.

결함 수정사항: 교육 시간이 길어서 일본어 전화 통신 언어 모델이 더 이상 실패하지 않습니다.

결함 수정사항: 일본어 Telephony를 사용하여 사용자 정의 언어 모델을 훈련할 때 이제 서비스가 실패하지 않고 많은 수의 사용자 정의 단어를 효과적으로 처리합니다.

2023년 5월 2 일

개선된 차세대 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하기 위한 새 프로시저

이제 사용자 정의 언어 모델을 개선된 차세대 기본 모델로 업그레이드하는 두 가지 접근 방식을 사용할 수 있습니다. 이미 문서화된 대로 사용자 정의 모델을 계속 수정한 후 다시 훈련할 수 있습니다. 그러나 이제 POST /v1/customizations/{customization_id}/train 요청과 함께 조회 매개변수 force=true 를 포함하여 사용자 정의 모델을 업그레이드할 수도 있습니다. force 매개변수는 변경사항이 포함되어 있는지 여부에 관계없이 ( ready 또는 available 상태에 있음) 사용자 정의 모델을 업그레이드합니다.

자세한 정보는 개선된 차세대 모델을 기반으로 사용자 정의 언어 모델 업그레이드 를 참조하십시오.

개선된 차세대 모델을 기반으로 하는 사용자 정의 모델에 단어를 추가하기 위한 지침

문서는 이제 개선된 차세대 모델을 기반으로 하는 사용자 정의 모델에 단어를 추가하는 방법에 대한 추가 지침을 제공합니다. 훈련 중에 성능상의 이유로, 지침은 가능할 때마다 사용자 정의 단어를 직접 추가하지 않고 말뭉치를 사용하도록 권장합니다.

자세한 정보는 개선된 차세대 모델을 기반으로 사용자 정의 모델에 단어를 추가하기 위한 가이드라인 을 참조하십시오.

개선된 차세대 모델을 기반으로 하는 사용자 정의 모델에 대한 일본어 사용자 정의 단어는 다르게 처리됩니다.

차세대 모델을 기반으로 하는 일본어 사용자 정의 모델의 경우 사용자 정의 단어는 다른 언어와 다르게 처리됩니다. 일본어의 경우 길이가 25자를 초과하지 않는 사용자 정의 단어 또는 유사한 소리를 추가할 수 있습니다. 사용자 정의 단어 또는 유사 발음이 해당 한계를 초과하는 경우 서비스는 말뭉치에 의해 추가된 것처럼 사용자 정의 모델에 단어를 추가합니다. 이 단어는 모델의 사용자 정의 단어로 표시되지 않습니다.

자세한 정보는 개선된 차세대 모델을 기반으로 일본어 모델에 단어를 추가하기 위한 가이드라인 을 참조하십시오.

2023년 4월 12 일

결함 수정사항: 차세대 모델을 사용할 때 WebSocket 인터페이스의 제한시간이 예상대로 초과됩니다.
결함 수정사항: 차세대 모델에서 음성 인식에 사용되는 경우 WebSocket 인터페이스가 오랜 침묵 기간 후에 예상대로 제한시간 초과됩니다. 이전에는 짧은 오디오 파일의 음성 인식에 사용될 때 WebSocket 세션이 제한시간 초과에 실패할 수 있었습니다. 세션 제한시간 초과에 실패한 경우 서비스는 대기 중인 클라이언트 애플리케이션에 최종 가설을 리턴하지 않았으며 대신 클라이언트가 결과를 기다리는 동안 제한시간을 초과했습니다.

2023년 4월 6 일

결함 수정: 차세대 일본 사용자 정의 모델에 대한 교육 완료를 허용하는 한계

결함 수정사항: 차세대 일본어 사용자 정의 언어 모델을 성공적으로 훈련하려면 모델에 추가된 사용자 정의 단어 및 좋아요가 각각 25자이하로 포함되어야 합니다. 가장 효과적인 교육을 위해서는 사용자 정의 단어와 유사한 소리에 20자이하의 문자를 사용하는 것이 좋습니다. 더 긴 사용자 정의 단어 및 사운드를 사용하는 일본 사용자 정의 모델의 훈련은 여러 시간의 훈련 후에 완료되지 않습니다.

차세대 일본 사용자 정의 모델에 긴 단어 또는 소리와 동등한 것을 추가해야 하는 경우 다음 단계를 수행하십시오.

  1. 더 긴 단어나 소리의 본질을 캡처하는 더 짧은 단어나 소리를 사용자 정의 모델에 추가하십시오.
  2. 더 긴 단어나 소리를 사용하는 하나 이상의 문장을 말뭉치에 추가하십시오.
  3. 단어 또는 유사 소리에 대해 더 많은 컨텍스트를 제공하는 문장을 말뭉치에 추가하는 것을 고려하십시오. 더 큰 컨텍스트는 단어를 인식하고 올바른 유사 소리를 적용하는 데 사용할 수 있는 더 많은 정보를 서비스에 제공합니다.
  4. 코퍼스를 사용자 정의 모델에 추가합니다.
  5. 더 짧은 단어 또는 유사한 소리와 더 긴 문자열을 포함하는 말뭉치의 조합에서 사용자 정의 모델을 재훈련하십시오.

방금 설명한 한계와 단계를 통해 차세대 일본 사용자 정의 모델이 훈련을 완료할 수 있습니다. 사용자 정의 언어 모델에 많은 수의 새 사용자 정의 단어를 추가하면 모델의 훈련 시간이 증가합니다. 그러나 증가된 훈련 시간은 사용자 정의 모델이 처음에 새 단어에 대해 훈련된 경우에만 발생합니다. 사용자 정의 모델이 새 단어에 대해 훈련되면 훈련 시간이 정상으로 돌아갑니다.

For more information, see

업데이트된 차세대 언어 모델 사용자 정의에 대한 추가 개선사항

최근에는 영어 및 일본어 차세대 모델에 대한 언어 모델 사용자 정의가 개선되었습니다. 이 서비스 업데이트에는 추가 내부 개선사항이 포함되어 있습니다. 개선된 차세대 사용자 지정 기능에 대한 자세한 내용은 다음을 참조하십시오

2023년 3월 13 일

결함 수정사항: 미국 영어 날짜의 스마트 형식화가 이제 올바릅니다.
결함 수정사항: 스마트 형식화가 이제 음성 오디오 (예: Tuesday February 28) 에 둘 다 있는 요일 및 날짜를 올바르게 포함합니다. 이전에는 일부 경우에 요일이 생략되고 날짜가 잘못 표시되었습니다. 스마트 형식화는 베타 기능입니다.
결함 수정사항: 차세대 모델의 음성 망설임 단어에 대한 문서 업데이트
결함 수정사항: 차세대 모델의 음성 망설임 단어에 대한 문서가 업데이트되었습니다. 미국 영어 및 일본의 망설임 단어에 대한 자세한 정보가 제공됩니다. 다음 세대 모델들은, 단지 머뭇거리는 마커들만을 포함하는 이전 세대 모델들과는 달리, 전사 결과들에서 실제 머뭇거리는 말들을 포함한다. 자세한 정보는 음성 망설임 및 망설임 마커 를 참조하십시오.

2023년 2월 27 일

일본의 새로운 차세대 전화기 모델

이 서비스는 이제 일본어를 위한 차세대 전화 통신 모델을 제공합니다: ja-JP_Telephony. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 언어 모델 사용자 정의 및 문법도 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오

차세대 영어 및 일본어 모델에 대한 개선된 언어 모델 사용자 정의

이 서비스는 이제 차세대 영어 및 일본어 모델에 대한 개선된 언어 모델 사용자 정의를 제공합니다.

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

모델에 대한 가시적인 개선사항: 새 기술은 새 영어 및 일본어 모델의 기본 동작을 개선합니다. 다른 변경사항 중에서도 새 기술은 다음 매개변수에 대한 기본 동작을 최적화합니다.

  • 이러한 모델의 새 버전을 기반으로 하는 사용자 정의 모델의 기본 customization_weight0.2 에서 0.1 로 변경됩니다.
  • 이러한 모델의 새 버전을 기반으로 하는 사용자 정의 모델의 기본 character_insertion_bias0.0 로 유지되지만, 모델은 음성 인식을 위해 매개변수를 사용하는 방식으로 변경되었습니다.

새 모델로 업그레이드: 개선된 기술을 이용하려면 새 모델을 기반으로 하는 사용자 정의 언어 모델을 업그레이드해야 합니다. 이러한 기본 모델 중 하나의 새 버전으로 업그레이드하려면 다음을 수행하십시오.

  1. 모델에 포함된 사용자 정의 단어, 말뭉치 또는 문법을 추가하거나 수정하여 사용자 정의 모델을 변경하십시오. 변경하면 모델이 ready 상태로 이동합니다.
  2. POST /v1/customizations/{customization_id}/train 메소드를 사용하여 모델을 재훈련하십시오. 재훈련은 사용자 정의 모델을 새 기술로 업그레이드하고 모델을 available 상태로 이동합니다.

알려진 문제: 현재 POST /v1/customizations/{customization_id}/upgrade_model 메소드를 사용하여 사용자 정의 모델을 새 기본 모델 중 하나로 업그레이드할 수 없습니다. 이 문제는 향후 릴리스에서 해결될 예정입니다.

새 모델 사용: 새 기본 모델로 업그레이드한 후 음성 인식을 위해 customization_weightcharacter_insertion_bias 매개변수에 특별히 주의하여 업그레이드된 사용자 정의 모델의 성능을 평가하는 것이 좋습니다. 사용자 정의 모델을 재훈련할 때 다음을 수행하십시오.

  • 사용자 정의 모델은 사용자 정의 모델에 대해 0.1 의 새 기본 customization_weight 를 사용합니다. 사용자 정의 모델과 연관된 기본이 아닌 customization_weight 가 제거됩니다.
  • 사용자 정의 모델은 더 이상 최적의 음성 인식을 위해 character_insertion_bias 매개변수를 사용할 필요가 없습니다.

언어 모델 사용자 정의에 대한 개선사항은 이러한 매개변수를 고품질 음성 인식에 덜 중요하게 렌더링합니다.

  • 이러한 매개변수의 기본값을 사용하는 경우 업그레이드 후에 계속하십시오. 기본값은 음성 인식에 대한 최상의 결과를 계속 제공할 수 있습니다.
  • 이러한 매개변수에 대해 기본값이 아닌 값을 지정하는 경우 업그레이드 후에 기본값으로 실험하십시오. 사용자 정의 모델은 기본값을 사용하여 음성 인식에 대해 잘 작동할 수 있습니다.

이러한 매개변수에 다른 값을 사용하면 사용자 정의 모델을 사용하여 음성 인식을 개선할 수 있다고 판단되는 경우 점진적 변경을 시도하여 음성 인식을 개선하는 데 매개변수가 필요한지 여부를 판별하십시오.

참고: 현재 언어 모델 사용자 정의에 대한 개선사항은 이전에 나열된 차세대 영어 또는 일본어 기본 언어 모델을 기반으로 하는 사용자 정의 모델에만 적용됩니다. 시간이 경과함에 따라 다른 차세대 언어 모델에도 개선된 기능을 사용할 수 있게 됩니다.

자세한 정보: 이러한 매개변수를 사용한 음성 인식 및 업그레이드에 대한 자세한 정보는 다음을 참조하십시오.

결함 수정사항: 문법 파일이 이제 숫자 문자열을 올바르게 처리합니다.

결함 수정사항: 문법이 사용되면 이제 서비스가 더 긴 숫자 문자열을 올바르게 처리합니다. 이전에는 인식을 완료하거나 올바르지 않은 결과를 리턴하는 데 실패했습니다.

2023년 2월 15 일

중요: 모든 이전 세대 모델은 더 이상 사용되지 않으며 2023년 7월 31일에 서비스가 종료됩니다.

중요: 모든 이전 세대 모델은 더 이상 사용되지 않으며 2023 7월 31일부터 서비스가 종료됩니다. 이 날짜에 모든 이전 세대 모델이 서비스 및 문서에서 제거됩니다. 이전 폐기 날짜는 2023년 3월 3일이었다. 새 날짜를 사용하면 사용자가 적절한 차세대 모델로 마이그레이션하는 데 더 많은 시간을 사용할 수 있습니다. 하지만 사용자들은 2023년 7월 31일까지 동등한 차세대 모델로 마이그레이션해야 한다.

대부분의 이전 세대 모델은 2022년 3월 15일에 더 이상 사용되지 않습니다. 이전에는 아랍어 및 일본어 모델이 더 이상 사용되지 않았습니다. 더 이상 사용되지 않는 기능은 이제 모든 이전 세대 모델에 적용됩니다.

참고: 이전 세대 en-US_BroadbandModel 서비스가 중단되면, 차세대 en-US_Multimedia 모델이 음성 인식 요청에 대한 기본 모델로 지정됩니다.

결함 수정사항: 차세대 사용자 정의 언어 모델에 대한 교육 시간 개선

결함 수정사항: 차세대 사용자 정의 언어 모델의 교육 시간이 크게 향상되었습니다. 이전에는 일본어 사용자 정의 언어 모델의 훈련에 대해 보고된 대로 훈련 시간이 필요한 시간보다 훨씬 더 오래 걸렸습니다. 내부 수정사항으로 문제점이 정정되었습니다.

결함 수정사항: 동적으로 생성된 문법 파일이 이제 올바르게 작동합니다.

결함 수정사항: 동적으로 생성된 문법 파일이 이제 올바르게 작동합니다. 이전에는 동적 문법 파일로 인해 IBM® watsonx™ Assistant과 Speech to Text 의 통합에 대해 보고된 대로 내부 장애가 발생할 수 있었습니다. 내부 수정사항으로 문제점이 정정되었습니다.

2023년 1월 20 일

더 이상 사용되지 않는 아랍어 및 영국 모델 이름은 더 이상 사용할 수 없습니다.

다음 아랍어 및 영국 모델 이름은 더 이상 서비스에서 허용되지 않습니다.

  • ar-AR_BroadbandModel-대신 ar-MS_BroadbandModel 를 사용하십시오.
  • en-UK_NarrowbandModel-대신 en-GB_NarrowbandModel 를 사용하십시오.
  • en-UK_BroadbandModel-대신 en-GB_BroadbandModel 를 사용하십시오.

아랍어 모델 이름은 2020년 12월 2일에 더 이상 사용되지 않습니다. 영국 영어 모델 이름은 2017년 7월 14일에 더 이상 사용되지 않습니다.

Cloud Foundry 더 이상 사용되지 않음 및 리소스 그룹으로 마이그레이션

{{{site.data.keyword.IBM_notm}} 2022년 5월 31일에 IBM Cloud Foundry 지원을 중단한다고 발표했습니다. 2022년 11월 30일부터 새로운 IBM Cloud Foundry 애플리케이션은 만들 수 없으며 기존 사용자만 애플리케이션을 배포할 수 있습니다. IBM Cloud Foundry 2023년 6월 1일에 지원이 종료됩니다. 이때 모든 IBM Cloud Foundry 애플리케이션 런타임 인스턴스가 실행되는 IBM Cloud Foundry 애플리케이션은 영구적으로 비활성화, 프로비저닝 해제 및 삭제됩니다.

2023년 6월 1일 이후에도 IBM Cloud 애플리케이션을 계속 사용하려면 해당 날짜 이전에 리소스 그룹으로 마이그레이션해야 합니다. 리소스 그룹은 개념적으로 Cloud Foundry 공간과 유사합니다. 여기에는 IAM( IBM Cloud Identity and Access Management )을 활용한 세분화된 액세스 제어, 서로 다른 리전에 걸쳐 있는 서비스 인스턴스를 앱 및 서비스에 연결할 수 있는 기능, 그룹별 사용량을 간편하게 확인할 수 있는 방법 등 여러 가지 추가 이점이 포함됩니다.

이제 max_alternatives 매개변수를 차세대 모델에 사용할 수 있습니다.

이제 max_alternatives 매개변수를 모든 차세대 모델에 사용할 수 있습니다. 이 기능은 일반적으로 모든 차세대 모델에서 사용할 수 있습니다. 자세한 정보는 최대 대체 수를 참조하십시오.

결함 수정사항: 차세대 모델에서 max_alternativesend_of_phrase_silence_time 매개변수를 모두 사용할 수 있습니다.

결함 수정사항: 차세대 모델을 사용하는 동일한 요청에서 max_alternativesend_of_phrase_silence_time 매개변수를 둘 다 사용하는 경우, 서비스는 이제 표시된 일시정지 간격을 고려하여 여러 대체 대화 내용을 리턴합니다. 이전에는 단일 요청에서 두 개의 매개변수를 사용하여 장애가 발생했습니다. ( max_alternatives 매개변수를 차세대 모델과 함께 사용하는 것은 이전에는 제한된 수의 고객에게 실험 기능으로 사용 가능했습니다.)

결함 수정사항: 프랑스어 캐나다 차세대 전화 통신 모델 업데이트 (업그레이드 필요)

결함 수정사항: 프랑스어 캐나다 차세대 전화 통신 모델 fr-CA_Telephony 이 음성 인식 중에 오류를 유발할 수 있는 내부 불일치를 해결하도록 업데이트되었습니다. * fr-CA_Telephony 모델을 기반으로 하는 사용자 정의 모델을 업그레이드해야 합니다.* 사용자 정의 모델 업그레이드에 대한 자세한 내용은 다음을 참조하십시오

결함 수정사항: 차세대 모델을 기반으로 일본어 사운드를 작성하기 위한 문서 가이드라인 추가

결함 수정사항: 차세대 모델을 기반으로 하는 일본어 사용자 정의 언어 모델의 경우 일부 왼쪽 컨텍스트에서 문자 시퀀스 ウー 가 모호합니다. /o/ 로 끝나는 문자 (음절) 를 사용하지 마십시오 (예: ). 이 경우 ウー 대신 ウウ 또는 만 사용하십시오. 예를 들어, ロウーマン 대신 ロウウマン 또는 ロウマン 를 사용하십시오. 자세한 정보는 일본어 가이드라인 을 참조하십시오.

차세대 모델을 기반으로 하는 사용자 정의 모델에 직접 단어를 추가하면 훈련 시간이 늘어납니다.

차세대 모델을 기반으로 하는 사용자 정의 모델에 직접 사용자 정의 단어를 추가하면 모델 훈련에 걸리는 시간이 그렇지 않은 경우보다 몇 분 더 오래 걸립니다. POST /v1/customizations/{customization_id}/words 또는 PUT /v1/customizations/{customization_id}/words/{word_name} 메소드를 사용하여 추가한 사용자 정의 단어를 사용하여 모델을 훈련하는 경우 모델에 대해 몇 분의 추가 훈련 시간을 허용하십시오. 자세한 정보는 다음을 참조하십시오.

도쿄 위치에서 사용자 정의 음향 모델에 대한 오디오 리소스의 최대 시간이 증가했습니다.

도쿄 위치에서 사용자 정의 음향 모델에 추가할 수 있는 오디오 리소스의 최대 시간은 다시 200시간입니다. 이전에는 도쿄 지역에 대해 최대값이 50시간으로 감소되었습니다. 그 감축은 이미 철회되었고 내년으로 연기되었다. 자세한 정보는 최대 오디오 시간 을 참조하십시오.

2022년 12월 5일

네덜란드의 새로운 차세대 멀티미디어 모델
이 서비스는 이제 네덜란드 네덜란드어를 위한 차세대 멀티미디어 모델을 제공합니다: nl-NL_Multimedia. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 언어 모델 사용자 정의 및 문법도 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오
결함 수정사항: 차세대 모델의 변환 결과에서 사용자 정의 단어 인식 정정
결함 수정사항: 차세대 모델을 사용한 언어 모델 사용자 정의의 경우 이제 사용자 정의 단어가 인식되어 모든 대화 내용에서 사용됩니다. 이전에는 사용자 정의 단어가 변환 결과에서 인식되고 사용되지 않는 경우가 있었습니다.
결함 수정사항: 차세대 모델의 변환 결과에서 display_as 필드의 올바른 사용
결함 수정사항: 차세대 모델을 사용하는 언어 모델 사용자 정의의 경우 이제 사용자 정의 단어에 대한 display_as 필드의 값이 모든 대화 내용에 표시됩니다. 이전에는 word 필드의 값이 때때로 변환 결과에 표시되었습니다.
결함 수정사항: 사용자 정의 모델 이름 지정 문서 업데이트
결함 수정사항: 이제 문서에서 사용자 정의 언어 모델 및 사용자 정의 음향 모델의 이름 지정에 대한 자세한 규칙을 제공합니다. 자세한 정보는 다음을 참조하십시오.

2022년 10월 20 일

영어권 차세대 전화 시스템 모델 업데이트

영국형 차세대 전화기 모델들이 음성 인식 성능 향상을 위해 업데이트되었습니다:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

이러한 모든 모델은 낮은 대기 시간을 계속 지원합니다. 해당 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

결함 수정사항: 일본어 차세대 멀티미디어 모델 업데이트 (업그레이드 필요)

결함 수정사항: 일본어 차세대 멀티미디어 모델 ja-JP_Multimedia 이 대기 시간이 짧은 음성 인식 중에 오류를 유발할 수 있는 내부 불일치를 해결하도록 업데이트되었습니다. * ja-JP_Multimedia 모델을 기반으로 하는 사용자 정의 모델을 업그레이드해야 합니다.* 사용자 정의 모델 업그레이드에 대한 자세한 내용은 다음을 참조하십시오

2022년 10월 7일

스웨덴의 새로운 차세대 전화 통신 모델

이 서비스는 이제 스웨덴어를 위한 차세대 전화 통신 모델을 제공합니다: sv-SE_Telephony. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 언어 모델 사용자 정의 및 문법도 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오

영어권 차세대 전화 시스템 모델 업데이트

영국형 차세대 전화기 모델들이 음성 인식 성능 향상을 위해 업데이트되었습니다:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

이러한 모든 모델은 낮은 대기 시간을 계속 지원합니다. 해당 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

2022년 9월 21일

사용자 정보의 GDPR 삭제를 위한 새 Activity Tracker 이벤트

이제 DELETE /v1/user_data 메소드를 사용하여 사용자에 대한 모든 정보를 삭제할 때 서비스가 Activity Tracker 이벤트를 리턴합니다. 이벤트 이름은 speech-to-text.gdpr-user-data.delete 입니다. 자세한 정보는 Activity Tracker 이벤트를 참조하십시오.

결함 수정사항: 대기 시간이 짧은 응답 시간을 개선하기 위해 일부 차세대 모델 업데이트

결함 수정사항: low_latency 매개변수를 사용할 때 응답 시간을 개선하기 위해 다음 차세대 모델이 업데이트되었습니다.

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

이전에는 이러한 모델이 low_latency 매개변수를 사용할 때 예상한 대로 빠르게 인식 결과를 리턴하지 않았습니다. 해당 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

2022년 8월 19 일

중요: 대부분의 이전 세대 모델의 지원 중단 날짜는 현재 2023년 3월 3일입니다.

대체됨: 이 더 이상 사용되지 않음 알림은 2023년 2월 15일서비스 업데이트 로 대체됩니다. 모든 이전 세대 모델의 서비스 종료 날짜는 이제 2023년 7월 31일입니다.

2022년 3월 15일, 아랍어와 일본어를 제외한 모든 언어에 대한 이전 세대 모델이 더 이상 지원되지 않게 되었습니다. 이 시점에서 더 이상 사용되지 않는 모델은 2022년 9월 15일까지 사용 가능한 상태로 유지되어야 했습니다. 사용자가 적절한 차세대 모델로 마이그레이션하는 데 더 많은 시간을 허용하기 위해 더 이상 사용되지 않는 모델은 이제 2023년 3월 3일까지 사용 가능합니다. 초기 폐기 통지와 마찬가지로 아랍어 및 일본어 이전 세대 모델은 더 이상 사용되지 않습니다. 더 이상 사용되지 않는 모든 모델의 전체 목록은 2022년 3월 15일서비스 업데이트 를 참조하십시오.

2023년 3월 3일에는 더 이상 사용되지 않는 모델이 서비스 및 문서에서 제거됩니다. 사용이 권장되지 않는 모델 중 하나를 사용하고 계신 경우, 2023년 3월 3일까지 이에 상응하는 차세대 모델로 전환하셔야 합니다.

참고: 이전 세대 en-US_BroadbandModel 서비스가 중단되면, 차세대 en-US_Multimedia 모델이 음성 인식 요청에 대한 기본 모델로 지정됩니다.

2022년 8월 15일

프랑스어 새 캐나다 차세대 멀티미디어 모델

이 서비스는 이제 프랑스계 캐나다인을 위한 차세대 멀티미디어 모델을 제공합니다: fr-CA_Multimedia. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 언어 모델 사용자 정의 및 문법도 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오

영어권 차세대 전화 시스템 모델 업데이트

영국형 차세대 전화기 모델들이 음성 인식 성능 향상을 위해 업데이트되었습니다:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

이러한 모든 모델은 낮은 대기 시간을 계속 지원합니다. 해당 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

이탈리아의 차세대 멀티미디어 모델이 이제 저지연 기능을 지원합니다

이탈리아 차세대 멀티미디어 모델인 it-IT_Multimedia 는 이제 낮은 대기 시간을 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오

중요: 사용자 정의 음향 모델에 대한 오디오 데이터의 최대 감소 시간

중요: 사용자 정의 음향 모델에 추가할 수 있는 최대 오디오 데이터 양이 200시간에서 50시간으로 줄어듭니다. 이 변경은 2022년 8월부터 9월까지 다른 위치로 단계적으로 진행됩니다. 50시간이상의 오디오를 포함하는 기존 사용자 정의 음향 모델에 대한 한계 축소 스케줄 및 의미에 대한 정보는 최대 오디오 시간 을 참조하십시오.

2022년 8월 3일

결함 수정사항: 음성 인식 및 망설임 마커 문서 업데이트

결함 수정사항: 음성 인식 및 망설임 마커에 대한 문서가 갱신되었습니다. 이전 세대 모델에는 대부분의 언어에 대한 변환 결과에서 말을 망설이는 대신 망설임 마커가 포함되어 있습니다. 스마트 형식화는 미국 영어 최종 기록에서 망설임 마커를 제거합니다. 차세대 모델에는 변환 결과에 실제 음성 망설임이 포함됩니다. 스마트 형식화는 최종 변환 결과에 포함되는 데 영향을 주지 않습니다.

자세한 정보는 다음을 참조하십시오.

2022년 6월 1일

다중 차세대 원격 음성 전달 모델에 대한 업데이트

향상된 음성 인식을 위해 다음 차세대 원격 음성 전달 모델이 업데이트되었습니다.

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony
  • ko-KR_Telephony

해당 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

2022년 5월 25일

차세대 모델의 새 베타 character_insertion_bias 매개변수

모든 차세대 모델은 이제 모든 음성 인식 인터페이스와 함께 사용할 수 있는 새 베타 매개변수인 character_insertion_bias을(를) 지원합니다. 기본적으로 서비스는 서로 다른 길이의 후보 문자열을 균형 있게 인식하도록 개별 모델에 맞게 최적화됩니다. 모델별 편향은 0.0과 같습니다. 각 모델의 기본 편향이 대부분의 음성 인식 요청에 충분합니다.

그러나 특정 유스 케이스는 더 짧은 문자열 또는 더 긴 문자열을 사용하는 가설을 선호할 수 있습니다. 이 매개변수는 모델 기본값의 변경사항을 나타내는 -1.0과 1.0 사이의 값을 허용합니다. 음수 값은 서비스가 더 짧은 문자열을 선호하도록 지시합니다. 양수 값은 서비스가 더 긴 문자열을 선호하도록 지시합니다. 자세한 정보는 문자 삽입 편향을 참조하십시오.

2022년 5월 19일

새 이탈리아어 it-IT_Multimedia 차세대 모델

이 서비스에서는 이제 이탈리아어에 대한 차세대 멀티미디어 모델(it-IT_Multimedia)을 제공합니다. 이 새 모델은 GA(General Availability)되었습니다. 낮은 지연 시간을 지원하지는 않지만 언어 모델 사용자 정의 및 문법은 지원합니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

업데이트된 한국 원격 음성 전달 및 멀티미디어 차세대 모델

다음과 같이 기존 한국어 차세대 모델이 업데이트되었습니다.

  • 음성 인식을 위한 향상된 낮은 지연 시간 지원을 위해 ko-KR_Telephony 모델이 업데이트되었습니다.
  • ko-KR_Multimedia 모델이 향상된 음성 인식을 위해 업데이트되었습니다. 이 모델은 이제 낮은 지연 시간도 지원합니다.

일반적으로 두 모델 모두 사용 가능하며, 두 모델 모두 언어 모델 사용자 정의 및 문법을 지원합니다. 해당 모델을 기반으로 하는 사용자 정의 언어 모델을 업그레이드하지 않아도 됩니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

결함 수정사항: 이제 모든 변환 결과에 대한 신뢰도 점수가 보고됨

결함 수정: 이제 모든 변환 결과에 대한 신뢰도 점수가 보고됩니다. 이전에는 서비스에서 단일 음성 인식 요청에 대해 다중 변환 내용을 리턴한 경우 모든 변환 내용에 대해 신뢰도 점수가 리턴되지 않을 수 있습니다.

2022년 4월 11일

새로운 브라질 포르투갈어 pt-BR_Multimedia 차세대 모델

이 서비스는 이제 브라질 포르투갈어의 차세대 멀티미디어 모델(pt-BR_Multimedia)을 제공합니다. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 언어 모델 사용자 정의 및 문법도 지원합니다. 차세대 모델 및 저지연에 대한 자세한 내용은 다음을 참조하십시오

낮은 지연 시간을 지원하기 위해 독일어 de-DE_Multimedia 차세대 모델로 업데이트

차세대 독일어 모델인 de-DE_Multimedia에서는 낮은 지연 시간을 지원합니다. 업데이트된 독일어 기본 모델을 기반으로 하는 사용자 정의 모델을 업그레이드하지 않아도 됩니다. 차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 다음 항목을 참조하십시오.

이제 차세대 모델을 기반으로 하는 사용자 정의 모델에 대해 유사 소리 지원이 문서화되었습니다.

차세대 모델을 기반으로 하는 사용자 정의 언어 모델의 경우 사용자 정의 단어에 대한 유사 소리 스펙 지원이 문서화되었습니다. 유사 소리 지원은 2021년 말부터 사용할 수 있습니다.

차세대 모델과 이전 세대 모델을 기반으로 하는 사용자 정의 모델에서 sounds_like 필드를 사용하는 데는 차이가 있습니다. 차세대 모델을 기반으로 하는 사용자 정의 모델에서 sounds_like 필드를 사용하는 데 대한 자세한 정보는 차세대 모델을 위한 사용자 정의 단어에 대한 작업을 참조하십시오.

중요: 문서에서 더 이상 사용되지 않는 customization_id 매개변수가 제거됨

중요: 2018년 10월 9일에 모든 음성 인식 요청의 customization_id 매개변수는 더 이상 사용되지 않으며 language_customization_id 매개변수로 대체됩니다. 이제 음성 인식 방법에 대한 문서에서 customization_id 매개변수가 제거되었습니다.

  • WebSocket 요청의 경우 /v1/recognize
  • 동기 HTTP 요청(다중 파트 요청 포함)의 경우 POST /v1/recognize
  • 비동기 HTTP 요청의 경우 POST /v1/recognitions

참고: Watson SDK를 사용하는 경우 customization_id 매개변수가 아니라 language_customization_id 매개변수를 사용하도록 애플리케이션 코드를 업데이트했는지 확인하십시오. customization_id 매개변수는 다음 주 릴리스와 동등한 SDK 메소드에서 더 이상 사용할 수 없습니다. 음성 인식 메소드에 대한 자세한 정보는 API & SDK 참조를 참조하십시오.

2022년 3월 17일

차세대 모델에 대한 문법 지원이 GA(General Availability)됨

이제 다음 조건을 충족하는 차세대 모델에 대한 문법 지원이 GA(General Availability)되었습니다.

  • 모델이 GA(General Availability)되어 있습니다.
  • 모델이 언어 모델 사용자 정의를 지원합니다.

자세한 정보는 다음 주제를 참조하십시오.

새 독일어 차세대 멀티미디어 모델

이 서비스는 이제 독일어에 대한 차세대 멀티미디어 모델(de-DE_Multimedia)을 제공합니다. 이 새 모델은 GA(General Availability)되었습니다. 이는 낮은 지연 시간을 지원하지 않습니다. 이는 언어 모델 사용자 정의(GA(General Availability)됨)와 문법(베타)을 지원합니다.

사용 가능한 모든 차세대 모델과 이들의 사용자 정의 지원에 대한 자세한 정보는 다음 항목을 참조하십시오.

이제 베타 차세대 en-WW_Medical_Telephony 모델이 낮은 지연 시간을 지원함

이제 베타 차세대 en-WW_Medical_Telephony 모델이 낮은 지연 시간을 지원합니다. 모든 차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 다음 항목을 참조하십시오.

2022년 3월 15일

중요: 대부분의 이전 세대 모델이 더 이상 사용되지 않음

대체됨: 이 더 이상 사용되지 않음 알림은 2023년 2월 15일서비스 업데이트 로 대체됩니다. 모든 이전 세대 모델의 서비스 종료 날짜는 이제 2023년 7월 31일입니다.

2022년 3월 15일부터, 아랍어와 일본어를 제외한 모든 언어에 대한 이전 세대 모델은 더 이상 사용되지 않습니다. 더 이상 사용되지 않는 모델은 2022년 9월 15일까지 사용 가능하며, 그 이후에는 서비스 및 문서에서 제거됩니다. 아랍어 및 일본어 이전 세대 모델은 더 이상 사용되지 않는 것이 아닙니다.

다음 이전 세대 모델은 이제 더 이상 사용되지 않습니다.

  • 중국어(만다린): zh-CN_NarrowbandModelzh-CN_BroadbandModel
  • 네덜란드어(네덜란드): nl-NL_NarrowbandModelnl-NL_BroadbandModel
  • 영어(호주): en-AU_NarrowbandModelen-AU_BroadbandModel
  • 영어(영국): en-GB_NarrowbandModelen-GB_BroadbandModel
  • 영어(미국): en-US_NarrowbandModel, en-US_BroadbandModelen-US_ShortForm_NarrowbandModel
  • 프랑스어(캐나다): fr-CA_NarrowbandModelfr-CA_BroadbandModel
  • 프랑스어(프랑스): fr-FR_NarrowbandModelfr-FR_BroadbandModel
  • 독일어: de-DE_NarrowbandModelde-DE_BroadbandModel
  • 이탈리아어: it-IT_NarrowbandModelit_IT_BroadbandModel
  • 한국어: ko-KR_NarrowbandModelko-KR_BroadbandModel
  • 포르투갈어(브라질): pt-BR_NarrowbandModelpt-BR_BroadbandModel
  • 스페인어(아르헨티나): es-AR_NarrowbandModeles-AR_BroadbandModel
  • 스페인어(카스티야): es-ES_NarrowbandModeles-ES_BroadbandModel
  • 스페인어(칠레): es-CL_NarrowbandModeles-CL_BroadbandModel
  • 스페인어(콜롬비아): es-CO_NarrowbandModeles-CO_BroadbandModel
  • 스페인어(멕시코): es-MX_NarrowbandModeles-MX_BroadbandModel
  • 스페인어(페루): es-PE_NarrowbandModeles-PE_BroadbandModel

더 이상 사용되지 않는 이러한 모델을 사용하고 있는 경우에는 서비스 종료 날짜까지 동등한 차세대 모델로 마이그레이션해야 합니다.

참고: 9월 15일에 이전 세대 en-US_BroadbandModel이(가) 서비스에서 제거되면, 차세대 en-US_Multimedia 모델이 음성 인식 요청의 기본 모델이 됩니다.

이제 차세대 모델이 오디오 구문 분석 매개변수를 지원함

모든 차세대 모델은 이제 다음 오디오 구문 분석 매개변수를 GA(General Availability)된 기능으로 지원합니다.

  • end_of_phrase_silence_time은(는) 서비스가 변환 내용을 여러 최종 결과로 분할하는 휴지 간격의 길이를 지정합니다. 자세한 정보는 구문 종료 무음 시간을 참조하십시오.
  • split_transcript_at_phrase_end은(는) 서비스가 입력의 의미 자질에 따라 변환 내용을 여러 최종 결과로 분할하도록 합니다. 자세한 정보는 구문 종료 지점에서 텍스트 변환 내용 분할을 참조하십시오.
오류 수정: 스피커 라벨 관련 문서 내용 수정

결함 수정사항: 화자 레이블에 대한 문서의 여러 위치에 다음과 같은 잘못된 문장이 포함되어 있습니다. 차세대 모델의 경우, 화자 레이블은 중간 결과 또는 낮은 지연 시간과 함께 사용할 수 있도록 지원되지 않습니다. 화자 레이블은 차세대 모델에서 중간 결과 및 낮은 지연 시간과 함께 사용할 수 있도록 지원됩니다. 자세한 정보는 화자 레이블을 참조하십시오.

2022년 2월 28일

낮은 지연 시간을 지원하기 위한, 영어 및 프랑스어 차세대 멀티미디어 모델에 대한 업데이트

다음 멀티미디어 모델은 낮은 지연 시간을 지원하도록 업데이트되었습니다.

  • 호주 영어: en-AU_Multimedia
  • 영국 영어: en-GB_Multimedia
  • 미국 영어: en-US_Multimedia
  • 프랑스어: fr-FR_Multimedia

이러한 기본 모델을 기반으로 작성된 사용자 정의 언어 모델을 업그레이드할 필요는 없습니다. 차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 다음 항목을 참조하십시오.

새 카스티야 스페인어 차세대 멀티미디어 모델

이 서비스는 이제 카스티야 스페인어에 대한 차세대 멀티미디어 모델(es-ES_Multimedia)을 제공합니다. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 이는 언어 모델 사용자 정의(GA(General Availability)됨)와 문법(베타) 또한 지원합니다.

사용 가능한 모든 차세대 모델과 이들의 사용자 정의 지원에 대한 자세한 정보는 다음 항목을 참조하십시오.

2022년 2월 11일

결함 수정: 사용자 정의 모델 업그레이드 및 기본 모델 버전 관련 문서 수정

결함 수정사항: 사용자 정의 모델의 업그레이드와 기본 모델의 다양한 버전에 대해 사용되는 버전 문자열을 설명하는 문서가 업데이트되었습니다. 이제 이 문서에서는 언어 모델 사용자 정의에 대한 업그레이드가 차세대 모델에도 적용된다고 기술합니다. 기본 모델의 다양한 버전을 나타내는 버전 문자열 또한 업데이트되었습니다. base_model_version 매개변수 또한 업그레이드된 차세대 모델과 함께 사용할 수 있습니다.

사용자 정의 모델 업그레이드, 업그레이드가 필요한 경우, 그리고 이전 버전의 사용자 정의 모델을 사용하는 방법에 대한 자세한 정보는 다음 항목을 참조하십시오.

오류 수정: 대문자 사용 관련 문서 업데이트

결함 수정사항: 서비스의 변환 내용 자동 대문자 표시에 대해 설명하는 문서가 업데이트되었습니다. 서비스는 다음 언어 및 모델에 대해서만 해당되는 명사를 대문자로 표시합니다.

  • 모든 이전 세대 미국 영어 모델
  • 차세대 독일어 모델

자세한 정보는 대문자 표시를 참조하십시오.

2022년 2월 2일

새 베타 en-WW_Medical_Telephony 모델이 사용 가능해짐

이제 새 베타 차세대 en-WW_Medical_Telephony 모델을 사용할 수 있습니다. 이 새 모델은 의학 및 약학 분야의 용어를 이해합니다. 약품 이름, 제품 브랜드, 의료 절차, 질병, 의사의 유형 또는 COVID-19 관련 용어와 같은 일반적인 의료 용어를 변환해야 하는 상황에서는 이 모델을 사용하십시오. 일반적인 유스 케이스에는 환자와 의료 제공자(예: 의사, 간호사 또는 약사) 간의 대화가 있습니다.

이 새 모델은 지원되는 모든 영어 통용어(호주, 인도, 영국 및 미국)에 대해 사용할 수 있습니다. 이 새 모델은 언어 모델 사용자 정의 및 문법을 베타 기능으로서 지원합니다. 이는 미국 영어 오디오에 대한 smart_formatting을(를) 비롯하여, en-US_Telephony 모델과 대부분 동일한 매개변수를 지원합니다. 다음 매개변수는 지원하지 않습니다: low_latency, profanity_filter, redaction, speaker_labels.

자세한 정보는 영어 의료 전화 통신 모델을 참조하십시오.

중국어 zh-CN_Telephony 모델에 대한 업데이트

차세대 중국어 모델 zh-CN_Telephony이(가) 향상된 음성 인식을 위해 업데이트되었습니다. 이 모델은 낮은 지연 시간을 계속해서 지원합니다. 기본적으로 이 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

업데이트된 모델을 기반으로 하는 사용자 정의 언어 모델이 있는 경우에는 POST /v1/customizations/{customization_id}/upgrade_model 메소드를 사용해 기존 사용자 정의 모델을 업그레이드하여 업데이트를 활용하도록 해야 합니다. 자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

낮은 지연 시간을 지원하기 위해 일본어 ja-JP_Multimedia 차세대 모델로 업데이트

차세대 일본어 모델 ja-JP_Multimedia은(는) 낮은 지연 시간을 지원합니다. 사용자는 low_latency 매개변수를, 이 모델을 사용하는 음성 인식 요청과 함께 사용할 수 있습니다. 업데이트된 일본어 기본 모델을 기반으로 하는 사용자 정의 모델을 업그레이드할 필요는 없습니다. 차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 다음 항목을 참조하십시오.

2021년 12월 3일

새 라틴 아메리카 스페인어 차세대 전화 통신 모델

이 서비스는 이제 라틴 아메리카 스페인어에 대한 차세대 전화 통신 모델(es-LA_Telephony)을 제공합니다. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다.

es-LA_Telephony 모델은 모든 라틴 아메리카 통용어에 적용됩니다. 이는 아르헨티나, 칠레, 콜롬비아, 멕시코 및 페루 통용어에 대해 사용 가능한 이전 세대 모델과 동등합니다. 이러한 특정 통용어에 대해 이전 세대 모델을 사용한 경우에는 es-LA_Telephony 모델을 사용하여 동등한 차세대 모델로 마이그레이션하십시오.

사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

중요: 특정 차세대 모델을 기반으로 하는 사용자 정의 언어 모델을 다시 작성해야 함

중요: 특정 차세대 모델을 기반으로 사용자 정의 언어 모델을 작성한 경우에는 이러한 사용자 정의 모델을 다시 작성해야 합니다. 이러한 사용자 정의 언어 모델을 다시 작성할 때까지, 해당 사용자 정의 모델을 사용하려 시도하는 음성 인식 요청은 HTTP 오류 코드 400을 리턴하며 실패합니다.

차세대 모델의 다음 버전을 기반으로 작성한 사용자 정의 언어 모델은 다시 작성해야 합니다.

  • en-AU_Telephony 모델의 경우, en-AU_Telephony.v2021-03-03 - en-AU_Telephony.v2021-10-04 범위에 속한 모델로부터 작성한 사용자 정의 모델.
  • en-GB_Telephony 모델의 경우, en-GB_Telephony.v2021-03-03 - en-GB_Telephony.v2021-10-04 범위에 속한 모델로부터 작성한 사용자 정의 모델.
  • en-US_Telephony 모델의 경우, en-US_Telephony.v2021-06-17 - en-US_Telephony.v2021-10-04 범위에 속한 모델로부터 작성한 사용자 정의 모델.
  • en-US_Multimedia 모델의 경우, en-US_Multimedia.v2021-03-03 - en-US_Multimedia.v2021-10-04 범위에 속한 모델로부터 작성한 사용자 정의 모델.

사용자 정의 언어 모델의 기반이 된 모델의 버전을 식별하려면 GET /v1/customizations 메소드를 사용하여 모든 사용자 정의 언어 모델을 나열하거나 GET /v1/customizations/{customization_id} 메소드를 사용하여 특정 사용자 정의 언어 모델을 나열하십시오. 출력의 versions 필드가 사용자 정의 언어 모델의 기본 모델을 표시합니다. 자세한 정보는 사용자 정의 언어 모델 나열을 참조하십시오.

사용자 정의 언어 모델을 다시 작성하려면 먼저 새 사용자 정의 모델을 작성하십시오. 그런 다음 이전 사용자 정의 모델의 모든 말뭉치 및 사용자 정의 단어를 새 모델에 추가하십시오. 그러고 나면 이전 사용자 정의 모델을 삭제할 수 있습니다. 자세한 정보는 사용자 정의 언어 모델 작성을 참조하십시오.

2021년 10월 28일

새 중국어 차세대 전화 통신 모델

이 서비스는 이제 만다린 중국어에 대한 차세대 전화 통신 모델(zh-CN_Telephony)을 제공합니다. 이 새 모델은 낮은 지연 시간을 지원하며 GA(General Availability)되었습니다. 사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

새 호주 영어 및 영국 영어 차세대 멀티미디어 모델

이 서비스는 이제 다음 차세대 멀티미디어 모델을 제공합니다. 이들 새 모델은 GA(General Availability)되었으며 둘 다 낮은 지연 시간을 지원하지 않습니다.

  • 호주 영어: en-AU_Multimedia
  • 영국 영어: en-GB_Multimedia

사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

향상된 음성 인식을 위한, 여러 차세대 모델에 대한 업데이트

다음 차세대 모델이 향상된 음성 인식을 위해 업데이트되었습니다.

  • 호주 영어 전화 통신 모델(en-AU_Telephony)
  • 영국 영어 전화 통신 모델(en-GB_Telephony)
  • 미국 영어 멀티미디어 모델(en-US_Multimedia)
  • 미국 영어 전화 통신 모델(en-US_Telephony)
  • 카스티야 스페인어 전화 통신 모델(es-ES_Telephony)

사용 가능한 모든 차세대 모델에 대한 자세한 정보는 차세대 언어 및 모델의 내용을 참조하십시오.

이전 세대 모델에 대한 문법 지원이 GA(General Availability)됨

이제 다음 조건을 충족하는 이전 세대 모델에 대한 문법 지원이 GA(General Availability)되었습니다.

  • 모델이 GA(General Availability)되어 있습니다.
  • 모델이 언어 모델 사용자 정의를 지원합니다.

자세한 정보는 다음 주제를 참조하십시오.

차세대 모델에 대해 새 베타 기능인 문법 지원

이제 문법 지원을 모든 차세대 모델에 대해 베타 기능으로 사용할 수 있습니다. 모든 차세대 모델은 GA(General Availability)되었으며 언어 모델 사용자 정의를 지원합니다. 자세한 정보는 다음 주제를 참조하십시오.

참고: 차세대 모델의 문법에 대한 베타 지원은 IBM Cloud상의 Speech to Text 서비스만 사용할 수 있습니다. IBM Cloud Pak for Data상의 차세대 모델에 대해서는 문법이 아직 지원되지 않습니다.

지원되는 기능에 대한 새 custom_acoustic_model 필드

이제 GET /v1/modelsGET /v1/models/{model_id} 메소드가 모델의 음향 모델 사용자 정의 지원 여부를 보고합니다. 이제 SupportedFeatures 오브젝트는 추가 필드 custom_acoustic_model을(를) 포함하며, 이는 음향 모델 사용자 정의를 지원하는 모델의 경우 true, 그렇지 않은 경우에는 false인 부울입니다. 현재 이 필드는 모든 이전 세대 모델의 경우 true, 모든 차세대 모델의 경우에는 false입니다.

2021년 10월 22일

결함 수정: 비동기식 HTTP 오류 해결
결함 수정사항: 비동기 HTTP 인터페이스가 일부 오디오를 변환하는 데 실패했습니다. 또한 요청에 대한 콜백이 상태 recognitions.failed 대신 recognitions.completed_with_results을(를) 리턴했습니다. 이 오류는 해결되었습니다.

2021년 10월 6일

체코어 및 네덜란드어 차세대 모델에 대한 업데이트

다음 차세대 언어 모델이 표시된 바와 같이 변경되었습니다.

  • 체코어 전화 통신 모델 cs-CZ_Telephony이(가) 이제 GA(General Availability)되었습니다. 이 모델은 낮은 지연 시간을 계속해서 지원합니다.
  • 벨기에 네덜란드어 전화 통신 모델 nl-BE_Telephony이(가) 향상된 음성 인식을 위해 업데이트되었습니다. 이 모델은 낮은 지연 시간을 계속해서 지원합니다.
  • 네덜란드 네덜란드어 전화 통신 모델 nl-NL_Telephony이(가) 이제 GA(General Availability)되었습니다. 또한 이 모델은 이제 낮은 지연 시간을 지원합니다.

사용 가능한 모든 차세대 언어 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

Premium 플랜에 대한 새 미국 HIPAA 지원(댈러스 위치)

이제 댈러스(us-south) 위치에서 호스팅되는 Premium 플랜에 대해 미국 HIPAA(Health Insurance Portability and Accountability Act) 지원을 사용할 수 있습니다. 자세한 정보는 HIPAA(Health Insurance Portability and Accountability Act)를 참조하십시오.

2021년 9월 16일

새 베타 체코어 및 네덜란드 네델란드어 차세대 모델

이 서비스는 이제 다음 새 차세대 언어 모델을 지원합니다. 이들 새 모델은 둘 다 베타 기능입니다.

  • 체코어: cs-CZ_Telephony. 이 새 모델은 낮은 지연 시간을 지원합니다.
  • 네덜란드 네델란드어: nl-NL_Telephony. 이 새 모델은 낮은 지연 시간을 지원하지 않습니다.

사용 가능한 모든 차세대 언어 모델에 대한 자세한 정보는 차세대 언어 및 모델을 참조하십시오.

한국어 및 브라질 포르투갈어 차세대 모델에 대한 업데이트

다음 차세대 모델이 업데이트되었습니다.

  • 이제 한국어 모델 ko-KR_Telephony이(가) 낮은 지연 시간을 지원합니다.
  • 브라질 포르투갈어 모델 pt-BR_Telephony이(가) 향상된 음성 인식을 위해 업데이트되었습니다.
오류 수정: 중간 결과 및 저지연 관련 문서 내용 수정

결함 수정사항: 차세대 모델에 대해 중간 결과 및 낮은 지연 시간 기능을 사용하는 것을 설명하는 문서가 내용을 명확하게 하고 잘못된 부분을 정정하기 위해 다시 작성되었습니다. 자세한 정보는 다음 주제를 참조하십시오.

결함 수정: 스피커 레이블 결과 개선

결함 수정사항: 화자 레이블을 차세대 모델에 대해 사용하는 경우, 서비스는 이제 시작 시간소인과 종료 시간소인이 같은 매우 짧은 단어를 비롯한 입력 오디오의 모든 단어에 대해 화자를 식별합니다.

2021년 8월 31일

모든 차세대 모델이 GA(General Availability)됨

이제 모든 기존 차세대 언어 모델이 GA(General Availability)되었습니다. 이들은 프로덕션 환경 및 애플리케이션에서 사용할 수 있도록 지원됩니다.

차세대 모델에 대한 언어 모델 사용자 정의가 GA(General Availability)됨

이제 사용 가능한 모든 차세대 언어 및 모델에 대해 언어 모델 사용자 정의가 GA(General Availability)되었습니다. 차세대 모델에 대한 언어 모델 사용자 정의는 프로덕션 환경 및 애플리케이션에서 사용할 수 있도록 지원됩니다.

이전 세대 모델에 대해 사용했던 것과 동일한 명령을 사용하여 차세대 모델에 대해 사용자 정의 언어 모델, 말뭉치 및 사용자 정의 단어를 작성하고, 관리하고 사용하십시오. 그러나 차세대 모델에 대한 사용자 정의는 이전 세대 모델에 대한 사용자 정의와 다르게 작동합니다. 차세대 모델을 기반으로 하는 사용자 정의 모델의 경우:

  • 사용자 정의 모델에 OOV(Out Of Vocabulary) 단어라는 개념이 없습니다.
  • 말뭉치의 단어가 단어 리소스에 추가되지 않습니다.
  • 현재는 사용자 정의 단어에 대해 가능한 발음 기능을 사용할 수 없습니다.
  • 기본 언어 모델이 업데이트되는 경우에 사용자 정의 모델을 업그레이드할 필요가 없습니다.
  • 문법은 현재 지원되지 않습니다.

차세대 모델에 대해 언어 모델 사용자 정의를 사용하는 것에 대한 자세한 정보는 다음 항목을 참조하십시오.

추가 주제에서는 사용자 정의 언어 모델, 말뭉치 및 사용자 정의 단어의 관리에 대해 설명합니다. 이러한 오퍼레이션은 이전 세대 모델을 기반으로 하는 사용자 정의 모델과 차세대 모델을 기반으로 하는 사용자 정의 모델 간에 동일합니다.

2021년 8월 16일

새 베타 인도 영어, 인도 힌디어, 일본어 및 한국어 차세대 모델

이 서비스는 이제 다음 새 차세대 언어 모델을 지원합니다. 모든 새 모델은 베타 기능입니다.

  • 인도 영어: en-IN_Telephony. 이 모델은 낮은 지연 시간을 지원합니다.
  • 인도 힌디어: hi-IN_Telephony. 이 모델은 낮은 지연 시간을 지원합니다.
  • 일본어: ja-JP_Multimedia. 이 모델은 낮은 지연 시간을 지원하지 않습니다.
  • 한국어: ko-KR_Multimediako-KR_Telephony. 이들 모델은 낮은 지연 시간을 지원하지 않습니다.

차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 차세대 언어 및 모델낮은 지연 시간을 참조하십시오.

2021년 7월 16일

새 베타 프랑스어 차세대 모델
이제 프랑스어 차세대 언어 모델 fr-FR_Multimedia을(를) 사용할 수 있습니다. 이 새 모델은 낮은 지연 시간을 지원하지 않습니다. 이 모델은 베타 기능입니다.
향상된 음성 인식을 위한, 베타 미국 영어 차세대 모델에 대한 업데이트
차세대 미국 영어 en-US_Telephony 모델이 향상된 음성 인식을 위해 업데이트되었습니다. 업데이트된 모델은 여전히 베타 기능입니다.
결함 수정사항: 망설임 마커에 대한 문서 업데이트
결함 수정사항: 이 문서에서 차세대 모델이 망설임 표지를 생성하지 않는다는 것을 기술하지 않았었습니다. 이 문서가 이전 세대 모델만 망설임 표지를 생성한다는 점을 지적하도록 업데이트되었습니다. 차세대 모델에는 전사 결과에 실제적인 망설임이 포함됩니다. 자세한 정보는 음성 망설임 및 망설임 마커 를 참조하십시오.

2021년 6월 15일

새 베타 벨기에 네덜란드어 차세대 모델

이제 벨기에 네덜란드어(플라망어) 차세대 언어 모델 nl-BE_Telephony을(를) 사용할 수 있습니다. 이 새 모델은 낮은 지연 시간을 지원합니다. 이 모델은 베타 기능입니다. 차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 차세대 언어 및 모델낮은 지연 시간을 참조하십시오.

아랍어, 캐나다 프랑스어 및 이탈리아어 차세대 모델에 대한 새 베타 낮은 지연 시간 지원

다음 기존 베타 차세대 언어 모델은 이제 낮은 지연 시간을 지원합니다.

  • 아랍어 ar-MS_Telephony 모델
  • 캐나다 프랑스어 fr-CA_Telephony 모델
  • 이탈리아어 it-IT_Telephony 모델

차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 차세대 언어 및 모델낮은 지연 시간을 참조하십시오.

향상된 음성 인식을 위한, 베타 아랍어 및 브라질 포르투갈어 차세대 모델에 대한 업데이트

다음 기존 베타 차세대 언어 모델이 향상된 음성 인식을 위해 업데이트되었습니다.

  • 아랍어 ar-MS_Telephony 모델
  • 브라질 포르투갈어 pt-BR_Telephony 모델

차세대 모델과 낮은 지연 시간에 대한 자세한 정보는 차세대 언어 및 모델낮은 지연 시간을 참조하십시오.

2021년 5월 26일

차세대 모델에 대한, audio_metrics 매개변수에 대한 새 베타 지원
이제 audio_metrics 매개변수가 모든 차세대 언어 및 모델과 함께 사용할 수 있도록 베타 기능으로 지원됩니다. 자세한 정보는 오디오 메트릭을 참조하십시오.
차세대 모델에 대한, word_confidence 매개변수에 대한 새 베타 지원
이제 word_confidence 매개변수가 모든 차세대 언어 및 모델과 함께 사용할 수 있도록 베타 기능으로 지원됩니다. 자세한 정보는 단어 신뢰도를 참조하십시오.
결함 수정사항: 차세대 모델에 대한 문서 업데이트
오류 수정: 다음 정보를 수정하기 위해 문서를 업데이트했습니다
  • 음성 인식에 차세대 모델을 사용하는 경우, 이제 최종 변환 결과가 confidence 필드를 포함합니다. 이 필드는 이전 세대 모델을 사용하는 경우 항상 최종 변환 결과에 포함되었었습니다. 이 수정사항은 차세대 모델의 2021년 4월 12일 릴리스에 대해 보고되었던 제한사항을 해결합니다.
  • 이 문서에서는 smart_formatting 매개변수를 사용하면 서비스가 일본어에 대한 최종 변환 결과에서 망설임 표지를 제거한다고 잘못 기술하고 있었습니다. 스마트 형식화는 일본어가 아니라, 미국 영어에 대해서만 최종 결과에서 망설임 표지를 제거합니다. 자세한 정보는 스마트 형식화가 영향을 미치는 결과는 무엇입니까?를 참조하십시오.

2021년 4월 27일

새 베타 아랍어 및 브라질 포르투갈어 차세대 모델

이 서비스는 이제 두 개의 새 베타 차세대 모델을 지원합니다.

  • 낮은 지연 시간을 지원하는 브라질 포르투갈어 pt-BR_Telephony 모델.
  • 낮은 지연 시간을 지원하지 않는 아랍어(현대 표준) ar-MS_Telephony 모델.

자세한 정보는 차세대 언어 및 모델을 참조하십시오.

향상된 음성 인식을 위한, 베타 카스티야 스페인어 차세대 모델에 대한 업데이트

베타 차세대 카스티야 스페인어 es-ES_Telephony 모델이 이제 low_latency 매개변수를 지원합니다. 자세한 정보는 낮은 지연 시간을 참조하십시오.

차세대 모델에 대한, 화자 레이블에 대한 새 베타 지원

speaker_labels 매개변수는 이제 다음 차세대 모델과 함께 사용할 수 있도록 베타 기능으로 지원됩니다.

  • 호주 영어 en-AU_Telephony 모델
  • 영국 영어 en-GB_Telephony 모델
  • 미국 영어 en-US_Multimediaen-US_Telephony 모델
  • 독일어 de-DE_Telephony 모델
  • 카스티야 스페인어 es-ES_Telephony 모델

차세대 모델을 사용하는 경우, speaker_labels 매개변수는 현재 interim_results 또는 low_latency 매개변수와 함께 사용할 수 있도록 지원되지 않습니다. 자세한 정보는 화자 레이블을 참조하십시오.

word_confidence을(를) 차세대 모델과 함께 사용하는 것에 대한 새 HTTP 오류 코드

word_confidence 매개변수는 차세대 모델과 함께 사용할 수 있도록 지원되지 않습니다. 음성 인식을 위해 word_confidence 매개변수를 차세대 모델과 함께 사용하는 경우, 이 서비스는 이제 다음 400 오류 코드를 리턴합니다.

{
  "error": "word_confidence is not a supported feature for model {model}",
  "code": 400,
  "code_description": "Bad Request"
}

2021년 4월 12일

새 베타 차세대 언어 모델 및 low_latency 매개변수

이 서비스는 이제 더 많은 차세대 언어 모델을 지원합니다. 차세대 멀티미디어전화 통신 모델은 서비스의 이전 세대 광대역 및 협대역 모델보다 더 향상된 음성 인식 기능을 갖고 있습니다. 이러한 새 모델은 심층 신경망 및 양방향 분석을 활용하여 더 높은 처리량과 변환 정확도를 동시에 달성합니다. 현재 차세대 모델은 제한된 수의 언어와 음성 인식 기능을 지원합니다. 지원되는 언어, 모델 및 기능은 향후 릴리스에서 늘어날 것입니다. 차세대 모델은 베타 기능입니다.

많은 차세대 모델은 변환 품질의 저하를 감수하면서 결과를 더 빠르게 보도록 요청할 수 있게 해 주는 새 low_latency 매개변수 또한 지원합니다. 낮은 지연 시간이 사용으로 설정되면 서비스가 오디오에 대한 분석을 간소화하며, 이는 변환의 정확도를 낮출 수 있습니다. 애플리케이션이 가능한 최상의 정확도보다 낮은 응답 시간을 더 필요로 하는 경우에는 이러한 타협을 허용할 수 있습니다. low_latency 매개변수는 베타 기능입니다.

low_latency 매개변수는 WebSocket 인터페이스에 대한 interim_results 매개변수 사용에 영향을 줍니다. 중간 결과는 낮은 지연 시간을 지원하는 차세대 모델에만, 그리고 interim_resultslow_latency 매개변수가 둘 다 true로 설정된 경우에만 사용 가능합니다.

2021년 3월 17일

버그 수정: 비동기 HTTP 인터페이스의 제한 사항 수정
결함 수정사항: 2020년 12월 16일 댈러스(us-south) 위치에서 비동기 HTTP 인터페이스에 대해 보고된 제한사항이 해결되었습니다. 이전에는 소수의 작업이 무한 루프에 빠져 실행되지 않는 경우가 있었습니다. 댈러스 데이터 센터의 비동기 HTTP 요청에는 더 이상 이 제한사항이 발생하지 않습니다.

2020년 12월 2일

아랍어 모델 이름이 ar-MS_BroadbandModel(으)로 바뀜
아랍어 광대역 모델의 이름은 이제 ar-MS_BroadbandModel입니다. 이전 이름인 ar-AR_BroadbandModel은(는) 더 이상 사용되지 않습니다. 이는 1년 이상 계속해서 작동할 것이지만, 그 이후에는 제거될 수 있습니다. 사용자는 가능한 한 빨리 새 이름으로 마이그레이션하는 것이 좋습니다.

2020년 11월 2일

캐나다 프랑스어 모델이 GA(General Availability)됨

이제 캐나다 프랑스어 모델 fr-CA_BroadbandModelfr-CA_NarrowbandModel이(가) GA(General Availability)되었습니다. 이들은 이전에는 베타 상태였습니다. 이제는 언어 모델 및 음향 모델 사용자 정의 또한 지원합니다.

2020년 10월 22일

호주 영어 모델이 GA(General Availability)됨

이제 호주 영어 모델 en-AU_BroadbandModelen-AU_NarrowbandModel이(가) GA(General Availability)되었습니다. 이들은 이전에는 베타 상태였습니다. 이제는 언어 모델 및 음향 모델 사용자 정의 또한 지원합니다.

향상된 음성 인식을 위한, 브라질 포르투갈어 모델에 대한 업데이트

브라질 포르투갈어 모델 pt-BR_BroadbandModelpt-BR_NarrowbandModel이(가) 향상된 음성 인식을 위해 업데이트되었습니다. 기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

split_transcript_at_phrase_end 매개변수가 모든 언어에 대해 GA(General Availability)됨

이제 음성 인식 매개변수 split_transcript_at_phrase_end이(가) 모든 언어에 대해 GA(General Availability)되었습니다. 이전에는 일반적으로 미국 및 영국 영어로만 제공되었습니다. 자세한 정보는 구문 종료 지점에서 텍스트 변환 내용 분할을 참조하십시오.

2020년 10월 7일

향상된 음성 인식을 위한, 일본어 광대역 모델에 대한 업데이트

ja-JP_BroadbandModel 모델이 향상된 음성 인식을 위해 업데이트되었습니다. 기본적으로 이 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

2020년 9월 30일

서비스의 가격 플랜에 대한 업데이트

서비스의 가격 플랜이 변경되었습니다.

  • 이 서비스는 1개월마다 제한된 음성 인식 분 수에 대해 기본 무료 액세스를 제공하는 Lite 플랜을 계속해서 제공합니다.
  • 이 서비스는 단순히 계층화된 가격 모델과 서비스의 사용자 정의 기능에 대한 액세스를 제공하는 새 Plus 플랜을 제공합니다.
  • 이 서비스는 현저히 큰 용량과 향상된 기능을 제공하는 새 Premium 플랜을 제공합니다.

Plus 플랜은 Standard 플랜을 대체합니다. Standard 플랜은 짧은 시간 동안 계속해서 구매할 수 있습니다. 또한 이 플랜의 기존 사용자는 가격 변경 없이 무기한으로 이를 계속 사용할 수 있습니다. 기존 사용자는 언제든지 Plus 플랜으로 업그레이드할 수 있습니다.

사용 가능한 가격 플랜에 대한 자세한 정보는 다음 리소스를 참조하십시오.

  • 가격 플랜에 대한 일반 정보와 일반적인 질문에 대한 응답은 가격 FAQ를 참조하십시오.
  • 요금제에 대한 자세한 내용을 확인하거나 요금제를 구매하려면, IBM Cloud® 카탈로그 의 ‘ Speech to Text ’ 서비스를 참조하십시오.

2020년 8월 20일

새 캐나다 프랑스어 모델

이 서비스는 이제 캐나다 프랑스어에 대해 베타 광대역 및 협대역 모델을 제공합니다.

  • fr-CA_BroadbandModel
  • fr-CA_NarrowbandModel

새 모델은 언어 모델 또는 음향 모델 사용자 정의, 화자 레이블 또는 스마트 형식화를 지원하지 않습니다. 이들 및 모든 지원되는 모델에 대한 자세한 정보는 지원되는 이전 세대 언어 모델을 참조하십시오.

2020년 8월 5일

새 호주 영어 모델

이 서비스는 이제 호주 영어에 대해 베타 광대역 및 협대역 모델을 제공합니다.

  • en-AU_BroadbandModel
  • en-AU_NarrowbandModel

새 모델은 언어 모델 또는 음향 모델 사용자 정의 또는 스마트 형식화를 지원하지 않습니다. 새 모델은 화자 레이블을 지원합니다. 자세한 정보는 다음을 참조하십시오.

향상된 음성 인식을 위한, 여러 모델에 대한 업데이트

향상된 음성 인식을 위해 다음 모델이 업데이트되었습니다.

  • 프랑스어 광대역 모델(fr-FR_BroadbandModel)
  • 독일어 광대역(de-DE_BroadbandModel) 및 협대역(de-DE_NarrowbandModel) 모델
  • 영국 영어 광대역(en-GB_BroadbandModel) 및 협대역(en-GB_NarrowbandModel) 모델
  • 미국 영어 단축 양식 협대역(en-US_ShortForm_NarrowbandModel) 모델

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이러한 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하려면 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

독일어에 대한 망설임 표지가 변경됨

업데이트된 독일어 광대역 및 협대역 모델에 대해 사용되는 망설임 표지가 [hesitation]에서 %HESITATION(으)로 변경되었습니다. 자세한 정보는 음성 망설임 및 망설임 마커 를 참조하십시오.

2020년 6월 4일

버그 수정: 문법 규칙이 많은 사용자 정의 언어 모델의 지연 시간 개선
결함 수정사항: 많은 문법을 포함하는 사용자 정의 언어 모델의 지연 시간 문제가 해결되었습니다. 처음에 음성 인식에 사용되는 경우 이러한 사용자 정의 모델을 로드하는 데 몇 초가 걸릴 수 있습니다. 이제 사용자 정의 모델이 훨씬 빠르게 로드되어 인식에 사용될 때 대기 시간이 크게 줄어 듭니다.

2020년 4월 28일

향상된 음성 인식을 위한, 이탈리아어 모델에 대한 업데이트

향상된 음성 인식을 위해 이탈리아어 광대역(it-IT_BroadbandModel) 및 협대역(it-IT_NarrowbandModel) 모델이 업데이트되었습니다. 기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이러한 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하려면 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

네델란드어 및 이탈리아어 모델이 GA(General Availability)됨

이제 네덜란드어 및 이탈리아어 모델이 음성 인식, 그리고 언어 모델 및 음향 모델 사용자 정의에 대해 GA(General Availability)되었습니다.

  • 네덜란드어 광대역 모델(nl-NL_BroadbandModel)
  • 네덜란드어 협대역 모델(nl-NL_NarrowbandModel)
  • 이탈리아어 광대역 모델(it-IT_BroadbandModel)
  • 이탈리아어 협대역 모델(it-IT_NarrowbandModel)

사용 가능한 모든 언어 모델에 대한 정보는 다음을 참조하십시오.

2020년 4월 1일

음향 모델 사용자 정의가 GA(General Availability)됨

이제 음향 모델 사용자 정의가 모든 지원되는 언어에 대해 GA(General Availability)되었습니다. 사용자 정의 언어 모델의 경우 IBM은 사용자 정의 음향 모델의 작성 및 호스팅에 대해 비용을 청구하지 않습니다. 음성 인식 요청에 대해 사용자 정의 모델을 사용하는 경우에만 비용이 청구됩니다.

텍스트 변환에 사용자 정의 언어 모델 또는 사용자 정의 음향 모델을 사용하거나, 두 유형의 모델을 모두 사용하면 분당 $0.03(USD)의 추가 기능 비용이 발생합니다. 이 비용은 분당 $0.02(USD)의 표준 사용 요금에 추가되며 사용자 정의 인터페이스에서 지원하는 모든 언어에 적용됩니다. 따라서 하나 이상의 사용자 정의 언어 모델을 음성 인식에 사용하기 위한 총 비용은 분당 $0.05(USD)입니다.

2020년 3월 16일

이제 독일어 및 한국어에 대해 화자 레이블이 지원됨
서비스는 이제 독일어 및 한국어 모델에 대해 화자 레이블(speaker_labels 매개변수)을 지원합니다. 화자 레이블은 다중 참여자 대화에서 어떤 개인이 어떤 단어를 말했는지를 식별합니다. 자세한 정보는 화자 레이블을 참조하십시오.
이제 Activity Tracker가 비동기 HTTP 인터페이스에 대해 지원됨
이제 이 서비스는 비동기 HTTP 인터페이스의 모든 오퍼레이션에 대해 Activity Tracker 이벤트를 사용하는 것을 지원합니다. IBM Cloud Activity Tracker은(는) IBM Cloud®에서 서비스의 상태를 변경하는, 사용자가 시작한 활동을 기록합니다. 자세한 정보는 Activity Tracker 이벤트를 참조하십시오.

2020년 2월 24일

향상된 음성 인식을 위한, 여러 모델에 대한 업데이트

향상된 음성 인식을 위해 다음 모델이 업데이트되었습니다.

  • 네덜란드어 광대역 모델(nl-NL_BroadbandModel)
  • 네덜란드어 협대역 모델(nl-NL_NarrowbandModel)
  • 이탈리아어 광대역 모델(it-IT_BroadbandModel)
  • 이탈리아어 협대역 모델(it-IT_NarrowbandModel)
  • 일본어 협대역 모델(ja-JP_NarrowbandModel)
  • 미국 영어 광대역 모델(en-US_BroadbandModel)

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

네덜란드어 및 이탈리아어에 대해 언어 모델 사용자 정의가 사용 가능해짐

이제 다음 모델의 새 버전으로 네덜란드어 및 이탈리아어에 대해 언어 모델 사용자 정의가 지원됩니다.

  • 네덜란드어 광대역 모델(nl-NL_BroadbandModel)
  • 네덜란드어 협대역 모델(nl-NL_NarrowbandModel)
  • 이탈리아어 광대역 모델(it-IT_BroadbandModel)
  • 이탈리아어 협대역 모델(it-IT_NarrowbandModel)

자세한 정보는 다음을 참조하십시오.

네덜란드어 및 이탈리아어 모델은 베타 상태이므로 이들의 언어 모델 사용자 정의에 대한 지원 또한 베타 상태입니다.

이제 일본어 협대역 모델이 몇 가지 멀티그램 단어 단위를 포함함

일본어 협대역 모델(ja-JP_NarrowbandModel)에는 이제 숫자 및 소수 부분에 대한 몇 가지 멀티그램 단어 단위가 포함됩니다. 서비스는 사용자가 스마트 형식화를 사용으로 설정했는지에 관계없이 이러한 멀티그램 단위를 리턴합니다. 스마트 형식화 기능은 모델에서 생성하는 멀티그램 단위를 이해하고 리턴합니다. 자체 사후 처리를 텍스트 변환 결과에 적용하는 경우, 이러한 단위를 적절히 처리해야 합니다. 자세한 정보는 스마트 형식화 문서의 일본어를 참조하십시오.

음성 인식에 대한 새 음성 활동 감지 및 배경 오디오 억제 매개변수

이제 서비스는 음성 활동 발견의 레벨을 제어하기 위해 두 개의 새 선택적 매개변수를 제공합니다. 매개변수는 음성 인식을 위해 관련 오디오만을 처리하는지 확인하는 데 도움이 될 수 있습니다.

  • speech_detector_sensitivity 매개변수는 음성 활동 발견의 민감도를 조정합니다. 매개변수를 사용하여 음악, 기침 및 기타 비음성 이벤트에서 단어가 삽입되지 못하도록 할 수 있습니다.
  • background_audio_suppression 매개변수는 볼륨을 기반으로 하는 배경 오디오를 억제하여 이들이 텍스트로 변환되지 못하도록 하거나 그렇지 않으면 음성 인식에 방해가 되지 않도록 합니다. 사이드 대화 또는 배경 소음을 억제하기 위해 매개변수를 사용할 수 있습니다.

매개변수를 개별적으로 또는 함께 사용할 수 있습니다. 이들은 모든 인터페이스에 대해 그리고 대부분의 언어 모델에 대해 사용 가능합니다. 매개변수, 허용 가능한 값 및 음성 인식의 품질 및 대기 시간에 대한 영향의 자세한 정보는 음성 활동 발견을 참조하십시오.

이제 사용자 정의 인터페이스에 Activity Tracker가 지원됨

이제 이 서비스는 모든 사용자 정의 오퍼레이션에 대해 Activity Tracker 이벤트를 사용하는 것을 지원합니다. IBM Cloud Activity Tracker은(는) IBM Cloud®에서 서비스의 상태를 변경하는, 사용자가 시작한 활동을 기록합니다. 이 서비스를 사용하여 비정상 활동 및 중요 조치를 조사하고, 규제 감사 요구사항을 준수하도록 할 수 있습니다. 또한 이러한 조치가 발생하면 바로 조치에 대한 경보를 받을 수 있습니다. 자세한 정보는 Activity Tracker 이벤트를 참조하십시오.

결함 수정사항: WebSocket 인터페이스를 사용하여 처리 메트릭의 올바른 생성

결함 수정사항: 이제 처리 메트릭을 생성할 때 WebSocket 인터페이스가 원활하게 작동합니다. 이전에는 클라이언트가 서비스에 stop 메시지를 전송한 후에도 처리 메트릭을 계속해서 전달할 수 있었습니다.

2019년 12월 18일

새 베타 이탈리아어 모델이 사용 가능해짐

이 서비스는 이제 이탈리아어에 대해 베타 광대역 및 협대역 모델을 제공합니다.

  • it-IT_BroadbandModel
  • it-IT_NarrowbandModel

이러한 언어 모델은 음향 모델 사용자 정의를 지원합니다. 언어 모델 사용자 정의는 지원하지 않습니다. 이러한 모델은 베타 상태이므로 프로덕션용으로 사용할 준비가 되어 있지 않을 수 있으며 변경될 수 있습니다. 이는 시간 및 사용량이 포함된 품질이 향상될 것으로 예상되는 초기 오퍼링입니다.

자세한 정보는 다음 섹션을 참조하십시오.

음성 인식에 대한 새 end_of_phrase_silence_time 매개변수

이 서비스는 이제 음성 인식에 대해 end_of_phrase_silence_time 매개변수를 지원합니다. 이 매개변수는 서비스가 텍스트 변환 내용을 여러 최종 결과로 분할하는 일시정지 간격의 지속 시간을 지정합니다. 각 최종 결과는 일시정지 간격을 초과하는 일시정지 또는 긴 무음을 나타냅니다. 대부분의 언어에서 기본 일시정지 간격은 0.8초이며, 중국어의 경우에는 기본 간격이 0.6초입니다.

이 매개변수를 사용하여 최종 결과가 생성되는 빈도와 텍스트 변환의 정확성 사이를 조율할 수 있습니다. 대기 시간보다 정확성이 중요한 경우에는 간격을 늘리십시오. 화자가 짧은 구문 또는 단일 단어를 말할 것으로 예상되는 경우에는 간격을 줄이십시오.

자세한 정보는 구문 종료 무음 시간을 참조하십시오.

음성 인식에 대한 새 split_transcript_at_phrase_end 매개변수

이 서비스는 이제 음성 인식에 대해 split_transcript_at_phrase_end 매개변수를 지원합니다. 이 매개변수는 문장의 끝과 같은 입력의 시맨틱 특성에 따라 텍스트 변환 내용을 여러 최종 결과로 분할하도록 서비스에 지시합니다. 서비스는 요청에 사용되는 기본 언어 모델을 기반으로 시맨틱 특성을 이해합니다. 사용자 정의 언어 모델 및 문법 또한 서비스가 텍스트 변환 내용을 분할하는 방법 및 위치에 영향을 줄 수 있습니다.

이 매개변수는 분할의 이유(end_of_utterance, full_stop, silence, end_of_data)를 나타내기 위해 서비스가 각 최종 결과에 reset 필드를 추가하도록 합니다.

자세한 정보는 구문 종료 지점에서 텍스트 변환 내용 분할을 참조하십시오.

2019년 12월 12일

IBM Cloud IAM에 대한 완전 지원

이제 Speech to Text 서비스는 IBM Cloud Identity and Access Management(IAM)의 전체 구현을 지원합니다. IBM Watson® 서비스에 대한 API 키는 더 이상 단일 서비스 인스턴스로 제한되지 않습니다. 둘 이상의 서비스에 적용되는 액세스 정책 및 API 키를 작성할 수 있으며 서비스 간에 액세스 권한을 부여할 수 있습니다. IAM에 대한 자세한 정보는 Watson 서비스에 인증을 참조하십시오.

이 변경사항을 지원하도록 API 서비스 엔드포인트는 다른 도메인을 사용하고 서비스 인스턴스 ID를 포함합니다. 패턴은 api.{location}.speech-to-text.watson.cloud.ibm.com/instances/{instance_id}입니다.

  • 댈러스 위치에서 호스팅되는 인스턴스의 HTTP URL 예:

https://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

  • 댈러스 위치에서 호스팅되는 인스턴스의 WebSocket URL 예:

wss://api.us-south.speech-to-text.watson.cloud.ibm.com/instances/6bbda3b3-d572-45e1-8c54-22d6ed9e52c2

URL에 대한 자세한 내용은 API 및 SDK 참조 문서를 참조하십시오.

이러한 URL은 호환성이 손상되는 변경을 구성하지 않습니다. 새 URL은 기존 서비스 인스턴스와 새 인스턴스 둘 다에 대해 작동합니다. 원본 URL은 최소 1년간(2020년 12월까지) 기존 서비스 인스턴스에 대해 작동합니다.

새 네트워크 및 데이터 보안 기능이 사용 가능해짐

다음과 같은 새로운 네트워크 및 데이터 보안 기능을 이제 지원합니다:

  • 사설 네트워크 엔드포인트 지원

    Premium 플랜의 사용자는 사설 네트워크를 통해 Speech to Text 서비스에 연결하기 위해 사설 네트워크 엔드포인트를 작성할 수 있습니다. 사설 네트워크 엔드포인트 연결에는 공용 인터넷 액세스가 필요하지 않습니다. 자세한 정보는 공용 및 사설 네트워크 엔드포인트를 참조하십시오.

2019년 12월 10일

새 베타 네덜란드 네덜란드어 모델이 사용 가능해짐

이 서비스는 이제 네덜란드 네델란드어에 대한 베타 광대역 및 협대역 모델을 제공합니다.

  • nl-NL_BroadbandModel
  • nl-NL_NarrowbandModel

이러한 언어 모델은 음향 모델 사용자 정의를 지원합니다. 언어 모델 사용자 정의는 지원하지 않습니다. 이러한 모델은 베타 상태이므로 프로덕션용으로 사용할 준비가 되어 있지 않을 수 있으며 변경될 수 있습니다. 이는 시간 및 사용량이 포함된 품질이 향상될 것으로 예상되는 초기 오퍼링입니다.

자세한 정보는 다음 섹션을 참조하십시오.

2019년 11월 25일

개별 화자의 식별을 개선하기 위한, 화자 레이블에 대한 업데이트
화자 레이블은 오디오 샘플의 추가 분석을 위해 개별 화자 ID를 개선하도록 업데이트됩니다. 화자 레이블 기능에 대한 자세한 정보는 화자 레이블을 참조하십시오. 이 기능의 개선 사항에 대한 자세한 내용은 “ IBM, 실제 사용 사례에서 AI를 활용한 화자 식별 기술 발전”을 참조하십시오.

2019년 11월 12일

새 서울 위치가 사용 가능해짐
이제 Speech to Text 서비스를 IBM Cloud 서울 위치(kr-seo)에서 사용할 수 있습니다. 다른 위치와 마찬가지로 IBM Cloud 위치는 토큰 기반 IAM 인증을 사용합니다. 이 위치에서 생성한 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2019년 11월 1일

사용자 정의 모델의 최대 수에 대한 새 한계
소유한 인증 정보당 1024개 이하의 사용자 정의 언어 모델과 1024개 이하의 사용자 정의 음향 모델을 작성할 수 있습니다. 자세한 정보는 사용자 정의 모델의 최대 수를 참조하십시오.

2019년 10월 1일

Premium 플랜에 대한 새 미국 HIPAA 지원(워싱턴 DC 위치)
워싱턴 DC(us-east) 위치에서 호스팅되며 2019년 4월 1일 이후 작성된 Premium 플랜에 대해 미국 HIPAA 지원을 사용할 수 있습니다. 자세한 정보는 미국 HIPAA(Health Insurance Portability and Accountability Act)를 참조하십시오.

2019년 8월 22일

결함 수정사항: 여러 개의 작은 개선사항
서비스가 사소한 결함 수정 및 개선을 위해 업데이트되었습니다.

2019년 7월 30일

스페인어 통용어에 대해 새 모델이 사용 가능해짐

서비스는 이제 여섯 개의 스페인어 통용어가 지원되는 광대역 및 협대역 언어 모델을 제공합니다.

  • 아르헨티나 스페인어(es-AR_BroadbandModeles-AR_NarrowbandModel)
  • 카스티야 스페인어(es-ES_BroadbandModeles-ES_NarrowbandModel)
  • 칠레 스페인어(es-CL_BroadbandModeles-CL_NarrowbandModel)
  • 콜롬비아 스페인어(es-CO_BroadbandModeles-CO_NarrowbandModel)
  • 멕시코 스페인어(es-MX_BroadbandModeles-MX_NarrowbandModel)
  • 페루 스페인어(es-PE_BroadbandModeles-PE_NarrowbandModel)

카스티야 스페인어 모델은 이제 신규 항목이 아닙니다. 이들은 음성 인식 및 언어 모델 사용자 정의에 대해 GA(General Availability)되어 있으며, 음향 모델 사용자 정의에 대해서는 베타 상태입니다.

나머지 다섯 개의 통용어는 신규 항목이며 모든 사용에 대해 베타 상태입니다. 베타 상태이므로 이 추가 통용어가 프로덕션용으로 준비되지 않을 수 있으며 변경될 수 있습니다. 이는 시간 및 사용량이 포함된 품질이 향상될 것으로 예상되는 초기 오퍼링입니다.

자세한 정보는 다음 섹션을 참조하십시오.

2019년 6월 24일

향상된 음성 인식을 위한, 브라질 포르투갈어 및 미국 영어 모델에 대한 업데이트

향상된 음성 인식을 위해 다음과 같은 협대역 모델이 업데이트되었습니다.

  • 브라질 포르투갈어 협대역 모델(pt-BR_NarrowbandModel)
  • 미국 영어 협대역 모델(en-US_NarrowbandModel)

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

여러 사용자 정의 음향 모델을 업데이트하도록 하는 동시 요청에 대한 새 지원

이제 이 서비스를 사용하면 여러 개의 동시 요청을 제출하여 사용자 정의 음향 모델에 서로 다른 오디오 리소스를 추가할 수 있습니다. 이전에 서비스에서는 사용자 정의 모델에 오디오를 추가하는 데 한 번에 하나의 요청만 허용되었습니다.

사용자 정의 모델을 나열하는 메소드에 대한 새 updated 필드

사용자 정의 언어 및 사용자 정의 음향 모델에 대한 정보를 나열하는 HTTP GET 메소드의 출력이 이제 updated 필드를 포함합니다. 필드는 사용자 정의 모델이 마지막으로 수정된 협정 세계시(UTC) 기준 날짜 및 시간입니다.

사용자 정의 모델 학습과 연관된 경고에 대한 스키마의 변경

strict 매개변수가 false로 설정되는 경우 스키마는 사용자 정의 모델 훈련 요청으로 생성된 경고에 맞게 변경되었습니다. 필드의 이름은 warning_iddescription에서 codemessage로 각각 변경되었습니다. 자세한 정보는 API & SDK 참조를 참조하십시오.

2019년 6월 10일

동기 HTTP 인터페이스에서는 처리 메트릭을 사용할 수 없음
처리 메트릭은 WebSocket 및 비동기 HTTP 인터페이스에서만 사용할 수 있습니다. 동기 HTTP 인터페이스에서는 지원되지 않습니다. 자세한 정보는 처리 메트릭을 참조하십시오.

2019년 5월 17일

음성 인식에 대한 새 처리 메트릭 및 오디오 메트릭 기능

서비스는 이제 음성 인식 요청으로 두 가지 유형의 선택적 메트릭을 제공합니다.

  • 처리 메트릭은 입력 오디오의 서비스 분석에 대한 자세한 타이밍 정보를 제공합니다. 서비스는 지정된 간격으로 텍스트 변환 이벤트와 함께 메트릭을 리턴합니다(예: 중간 및 최종 결과). 메트릭을 사용하여 오디오를 텍스트로 변환하는 중에 서비스 진행상태를 알아보십시오.
  • 오디오 메트릭은 입력 오디오의 신호 특성에 대한 자세한 정보를 제공합니다. 결과는 음성 처리 종료 시 전체 입력 오디오에 대해 집계된 메트릭을 제공합니다. 메트릭을 사용하여 오디오의 특성 및 품질을 판별하십시오.

음성 인식 요청과 함께 두 유형의 메트릭을 요청할 수 있습니다. 기본적으로 이 서비스는 요청에 대한 메트릭을 리턴하지 않습니다.

향상된 음성 인식을 위한, 일본어 광대역 모델에 대한 업데이트

향상된 음성 인식을 위해 일본어 광대역 모델(ja-JP_BroadbandModel)이 업데이트되었습니다. 기본적으로 이 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

2019년 5월 10일

향상된 음성 인식을 위한, 스페인어 모델에 대한 업데이트

향상된 음성 인식을 위해 스페인어 언어 모델이 업데이트되었습니다.

  • es-ES_BroadbandModel
  • es-ES_NarrowbandModel

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

2019년 4월 19일

사용자 정의 모델 학습에 대해 새 strict 매개변수가 사용 가능해짐
사용자 정의 모델이 올바른 오디오 리소스와 올바르지 않는 리소스를 함께 포함하는 경우 사용자 정의 인터페이스의 훈련 메소드에는 이제 훈련이 진행되는지 여부를 표시하는 strict 조회 매개변수가 포함됩니다. 기본적으로 사용자 정의 모델에 하나 이상의 올바르지 않은 리소스가 포함된 경우 훈련에 실패합니다. 모델에 하나 이상의 올바른 리소스가 포함되어 있는 한 매개변수를 false로 설정하여 훈련을 지속시키십시오. 서비스는 훈련에서 올바르지 않은 리소스를 제외합니다.
사용자 정의 언어 모델의 최대 OOV(Out Of Vocabulary) 단어 수에 대한 새 한계
이제 사용자 정의 언어 모델의 단어 리소스에 최대 9만 개의 OOV(Out Of Vocabulary) 단어를 추가할 수 있습니다. 이전에는 3만 개의 OOV 단어가 최대값이었습니다. 이 기능에는 모든 소스(말뭉치, 문법 및 사용자가 직접 추가한 개별 사용자 정의 단어)의 OOV 단어가 포함됩니다. 모든 소스의 사용자 정의 모델에 최대 총 천만 개의 단어를 추가할 수 있습니다. 자세한 정보는 필요한 데이터의 양을 참조하십시오.

2019년 4월 3일

사용자 정의 음향 모델의 최대 오디오 길이에 대한 새 한계
이제 사용자 정의 음향 모델이 최대 200시간의 오디오를 허용합니다. 이전 최대 한계는 100시간의 오디오였습니다.

2019년 3월 21일

서비스 인증 정보의 가시성이 역할에 의해 제한됨

사용자는 이제 IBM Cloud 계정에 지정되었던 역할과 연관된 서비스 인증 정보만 볼 수 있습니다. 예를 들어, reader 역할이 지정된 경우 writer 또는 상위 레벨의 서비스 인증 정보는 더 이상 표시되지 않습니다.

이 변경사항은 기존 서비스 인증 정보를 사용한 사용자 또는 애플리케이션의 API 액세스에 영향을 주지 않습니다. 변경사항은 IBM Cloud 내의 인증 정보 보기에만 영향을 줍니다.

2019년 3월 15일

A-law 오디오 형식에 대한 새 지원
이제 이 서비스는 A-law(audio/alaw) 형식의 오디오를 지원합니다. 자세한 정보는 audio/alaw 형식을 참조하십시오.

2019년 3월 11일

max_alternatives 매개변수에 대해 0 값을 전달하는 것에 대한 변경
이 서비스가 max_alternatives 매개변수에 대해 다시 0 값을 수락합니다. 0을(를) 지정하면 서비스가 자동으로 기본값인 1을(를) 사용합니다. 3월 4일 서비스 업데이트에 대한 변경사항으로 인해 0 값이 오류를 리턴했습니다. (음수 값을 지정하는 경우 서비스가 오류를 리턴합니다.)
word_alternatives_threshold 매개변수에 대해 0 값을 전달하는 것에 대한 변경
이 서비스가 word_alternatives_threshold 매개변수에 대해 0 값을 다시 허용합니다. 3월 4일 서비스 업데이트에 대한 변경사항으로 인해 0 값이 오류를 리턴했습니다. (음수 값을 지정하는 경우 서비스가 오류를 리턴합니다.)
신뢰도 점수의 최대 정밀도에 대한 새 한계
이제 이 서비스는 최대 소수점 이하 두 자리의 정밀도로 모든 신뢰도 점수를 리턴합니다. 이 변경사항에는 텍스트 변환 내용, 단어 신뢰도, 단어 대체, 키워드 결과 및 화자 레이블에 대한 신뢰도 점수가 포함됩니다.

2019년 3월 4일

향상된 음성 인식을 위한 브라질 포르투갈어, 프랑스어, 스페인어 협대역 모델에 대한 업데이트

향상된 음성 인식을 위해 다음과 같은 협대역 언어 모델이 업데이트되었습니다.

  • 브라질 포르투갈어 협대역 모델(pt-BR_NarrowbandModel)
  • 프랑스어 모델(fr-FR_NarrowbandModel)
  • 스페인어 협대역 모델(es-ES_NarrowbandModel)

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

2019년 1월 28일

WebSocket 인터페이스의, IBM Cloud IAM에 대한 새 지원

WebSocket 인터페이스는 이제 브라우저 기반 JavaScript 코드에서 토큰 기반 IAM(Identity and Access Management) 인증을 지원합니다. 반대되는 제한사항은 제거되었습니다. WebSocket /v1/recognize 메소드를 사용하여 인증된 연결을 설정하려면 다음을 수행하십시오.

  • IAM 인증을 사용하는 경우 access_token 조회 매개변수를 포함하십시오.
  • Cloud Foundry 서비스 인증 정보를 사용하는 경우 watson-token 조회 매개변수를 포함하십시오.

자세한 정보는 연결 열기를 참조하십시오.

2018년 12월 20일

사용자 정의 언어 모델에 대해 새 베타 문법 기능이 사용 가능해짐

이제 서비스가 음성 인식에 문법을 지원합니다. 문법은 언어 모델 사용자 정의를 지원하는 모든 언어에 대해 베타 기능으로 사용할 수 있습니다. 문법을 사용자 정의 언어 모델에 추가하고 이를 사용하여 서비스가 오디오에서 인식할 수 있는 구문 세트를 제한할 수 있습니다. ABNF(Augmented Backus-Naur Form) 또는 XML 양식으로 문법을 정의할 수 있습니다.

다음 4개의 메소드를 문법에 대한 작업에 사용할 수 있습니다.

  • POST /v1/customizations/{customization_id}/grammars/{grammar_name}은 사용자 정의 언어 모델에 문법 파일을 추가합니다.
  • GET /v1/customizations/{customization_id}/grammars는 사용자 정의 모델의 모든 문법에 대한 정보를 나열합니다.
  • GET /v1/customizations/{customization_id}/grammars/{grammar_name}은 사용자 정의 모델의 지정된 문법에 대한 정보를 리턴합니다.
  • DELETE /v1/customizations/{customization_id}/grammars/{grammar_name}은 사용자 정의 모델에서 기존 문법을 제거합니다.

WebSocket 및 HTTP 인터페이스를 사용하여 문법을 음성 인식에 사용할 수 있습니다. 사용하려는 사용자 정의 모델 및 문법을 식별하려면 language_customization_idgrammar_name 매개변수를 사용하십시오. 현재 음성 인식 요청에는 하나의 문법만 사용할 수 있습니다.

문법에 대한 자세한 정보는 다음 문서를 참조하십시오.

이 인터페이스의 모든 메서드에 대한 자세한 내용은 API 및 SDK 참조 문서를 참조하십시오.

미국 영어, 일본어 및 한국어에 대해 새 숫자 검열 삭제 기능이 사용 가능해짐

이제 새로운 숫자 교정 기능을 사용하여 세 개 이상의 연속 숫자가 포함된 번호를 마스킹할 수 있습니다. 교정은 음성 내용에서 신용카드 번호와 같은 민감한 개인 정보를 제거하기 위한 것입니다. 인식 요청에서 redaction 매개변수를 true로 설정하여 이 기능을 사용으로 설정합니다. 이 기능은 미국 영어, 일본어 및 한국어에만 사용할 수 있는 베타 기능입니다. 자세한 정보는 숫자 교정을 참조하십시오.

새 프랑스어 및 독일어 협대역 모델이 사용 가능해짐

이제 다음과 같은 새 독일어 및 프랑스어 모델을 이 서비스에 사용할 수 있습니다.

  • 프랑스어 협대역 모델(fr-FR_NarrowbandModel)
  • 독일어 협대역 모델(de-DE_NarrowbandModel)

새 모델은 언어 모델 사용자 정의(GA) 및 음향 모델 사용자 정의(베타)를 모두 지원합니다. 자세한 정보는 사용자 정의에 대한 언어 지원을 참조하십시오.

새 미국 영어 en-US_ShortForm_NarrowbandModel이(가) 사용 가능해짐

새로운 미국 영어 언어 모델 en-US_ShortForm_NarrowbandModel이 사용 가능합니다. 이 새 모델은 대화식 음성 응답 및 자동화된 고객 지원 지원 솔루션에 사용하기 위한 것입니다. 이 모델은 언어 모델 사용자 정의(GA) 및 음향 모델 사용자 정의(베타)를 지원합니다. 자세한 정보는 미국 영어 약식 모델을 참조하십시오.

향상된 음성 인식을 위한, 영국 영어 및 스페인어 협대역 모델에 대한 업데이트

향상된 음성 인식을 위해 다음 언어 모델이 업데이트되었습니다.

  • 영국 영어 협대역 모델(en-GB_NarrowbandModel)
  • 스페인어 협대역 모델(es-ES_NarrowbandModel)

기본적으로 서비스는 모든 음성 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

G.279 오디오 형식에 대한 새 지원

이제 서비스가 G.729(audio/g729) 형식의 오디오를 지원합니다. 이 서비스는 협대역 오디오에 대해서만 G.729 Annex D를 지원합니다. 자세한 정보는 audio/g729 형식을 참조하십시오.

영국 영어 협대역 모델에 대해 화자 레이블 기능이 사용 가능해짐

이제 영국 영어에 대한 협대역 모델(en-GB_NarrowbandModel)이 화자 레이블 기능을 사용할 수 있습니다. 이 기능은 지원되는 모든 언어의 베타 기능입니다. 자세한 정보는 화자 레이블을 참조하십시오.

사용자 정의 음향 모델의 최대 오디오 길이에 대한 새 한계

사용자 정의 음향 모델에 추가할 수 있는 최대 오디오의 양이 50시간에서 100시간으로 증가되었습니다.

2018년 12월 13일

새 런던 위치가 사용 가능해짐
이제 Speech to Text 서비스를 IBM Cloud 런던 위치(eu-gb)에서 이용할 수 있습니다. 모든 위치와 마찬가지로 런던에서도 토큰 기반 IAM 인증을 사용합니다. 이 위치에서 생성한 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2018년 11월 12일

일본어 음성 인식에 대한, 스마트 형식화에 대한 새 지원
이제 이 서비스는 일본어 음성 인식에 대한 스마트 형식화를 지원합니다. 이전에는 이 서비스가 미국 영어 및 스페인어에 대해서만 스마트 형식화를 지원했습니다. 이 기능은 지원되는 모든 언어에 대한 베타 기능입니다. 자세한 정보는 스마트 형식화를 참조하십시오.

2018년 11월 7일

새 도쿄 위치가 사용 가능해짐
이제 Speech to Text 서비스를 IBM Cloud 도쿄 위치(jp-tok)에서 이용할 수 있습니다. 모든 위치와 마찬가지로 도쿄에서도 토큰 기반 IAM 인증을 사용합니다. 이 위치에서 생성한 모든 새 서비스 인스턴스는 IAM 인증을 사용합니다.

2018년 10월 30일

토큰 기반 IBM Cloud IAM에 대한 새 지원

모든 위치에서 Speech to Text 서비스는 토큰 기반 IAM 인증으로 마이그레이션되었습니다. 모든 IBM Cloud 서비스는 이제 IAM 인증을 사용합니다. Speech to Text 서비스가 다음 날짜에 각 위치에서 마이그레이션되었습니다.

  • 댈러스(us-south): 2018년 10월 30일
  • 프랑크프르트(eu-de): 2018년 10월 30일
  • 워싱턴, DC(us-east): 2018년 6월 12일
  • 시드니(au-syd): 2018년 5월 15일

IAM 인증으로 마이그레이션은 신규 및 기존 서비스 인스턴스에 다르게 영향을 줍니다.

  • 모든 위치에서 작성된 모든 새 서비스 인스턴스는 이제 IAM 인증을 사용하여 서비스에 액세스합니다. 베어러 토큰 또는 API 키를 전달할 수 있습니다. 토큰은 모든 호출에 서비스 인증 정보를 포함하지 않고 인증된 요청을 지원합니다. API 키는 HTTP 기본 인증을 사용합니다. Watson SDK 중 하나를 사용할 때 API 키를 전달하고 SDK가 토큰의 라이프사이클을 관리하도록 할 수 있습니다.
  • 표시된 마이그레이션 날짜 전에 위치에서 작성한 기존 서비스 인스턴스는 IAM 인증을 사용하도록 서비스 인증 정보를 마이그레이션할 때까지 인증을 위해 이전 Cloud Foundry 서비스 인증 정보에서 {username}{password}를 계속 사용합니다.

자세한 정보는 다음 문서를 참조하십시오.

  • 서비스 인스턴스가 어떤 인증 메커니즘을 사용하는지 확인하려면, ‘ IBM Cloud ’ 대시보드에서 해당 인스턴스를 클릭하여 서비스 자격 증명을 확인하세요.
  • IAM 토큰을 Watson 서비스와 함께 사용하는 방법에 대한 자세한 정보는 Watson 서비스에 인증을 참조하십시오.
  • IAM 인증을 사용하는 예제는 API 및 SDK 참조 문서를 참조하십시오.

2018년 10월 9일

음성 인식 요청의 비용 청구에 대한 중요 업데이트

2018년 10월 1일부터는 음성 인식을 위해 서비스에 전달되는 모든 오디오에 대해 비용이 청구됩니다. 매월 전송하는 오디오의 처음 1,000분이 더 이상 무료로 제공되지 않습니다. 이 서비스의 요금제에 대한 자세한 내용은 IBM Cloud 카탈로그 의 ‘ Speech to Text ’ 서비스 항목을 참조하십시오.

대부분의 음성 인식 요청에 대해 Content-Type 헤더가 선택사항이 됨

이제 Content-Type 헤더는 대부분의 음성 인식 요청에서 선택사항입니다. 이 서비스가 대부분의 오디오에 대한 오디오 형식(MIME 유형)을 자동으로 발견합니다. 다음 형식의 컨텐츠 유형을 계속 지정해야 합니다.

  • audio/basic
  • audio/l16
  • audio/mulaw

표시된 경우 이러한 형식에 대해 지정된 컨텐츠 유형에 샘플링 간격이 포함되어야 하며 선택적으로 오디오의 채널 수와 엔디안이 포함될 수 있습니다. 기타 모든 오디오 형식의 경우 컨텐츠 유형을 생략하거나 컨텐츠 유형을 application/octet-stream으로 지정하여 서비스가 형식을 자동으로 검색하도록 할 수 있습니다.

curl 명령을 사용하여 HTTP 인터페이스로 음성 인식 요청을 수행하는 경우 Content-Type 헤더를 사용하여 오디오 형식을 지정하거나 "Content-Type: application/octet-stream" 또는 "Content-Type:"을 지정해야 합니다. 헤더를 완전히 생략하면 curl이 기본값인 application/x-www-form-urlencoded를 사용합니다. 이 문서에 있는 대부분의 예제에서는 필요한지 여부에 관계없이 음성 인식 요청에 대한 형식을 계속 지정합니다.

이 변경사항은 다음 메소드에 적용됩니다.

  • WebSocket 요청의 경우 /v1/recognize. 열린 WebSocket 연결을 통해 요청을 시작하기 위해 전송하는 텍스트 메시지의 content-type 필드가 이제 선택사항입니다.
  • 동기 HTTP 요청의 경우 POST /v1/recognize. Content-Type 헤더가 이제 선택사항입니다. (다중 파트 요청의 경우 JSON 메타데이터의 part_content_type 필드도 이제 선택사항입니다.)
  • 비동기 HTTP 요청의 경우 POST /v1/recognitions. Content-Type 헤더가 이제 선택사항입니다.

자세한 정보는 오디오 형식을 참조하십시오.

향상된 음성 인식을 위한, 브라질 포르투갈어 광대역 모델에 대한 업데이트

향상된 음성 인식을 위해 브라질 포르투갈어 광대역 모델 pt-BR_BroadbandModel이 업데이트되었습니다. 기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

customization_id 매개변수의 이름이 language_customization_id(으)로 바뀜

음성 인식 메소드의 customization_id 매개변수가 더 이상 사용되지 않으며 향후 릴리스에서 제거됩니다. 음성 인식 요청에 대한 사용자 정의 언어 모델을 지정하려면 대신 language_customization_id 매개변수를 사용하십시오. 이 변경사항은 다음 메소드에 적용됩니다.

  • WebSocket 요청의 경우 /v1/recognize
  • 동기 HTTP 요청(다중 파트 요청 포함)의 경우 POST /v1/recognize
  • 비동기 HTTP 요청의 경우 POST /v1/recognitions

2018년 12월 10일

새 독일어 광대역 모델

이제 이 서비스가 독일어 광대역 모델 de-DE_BroadbandModel을 지원합니다. 새 독일어 모델은 언어 모델 사용자 정의(GA) 및 음향 모델 사용자 정의(베타)를 지원합니다.

브라질 포르투갈어에 대해 언어 모델 사용자 정의가 사용 가능해짐

기존 브라질 포르투갈어 모델 pt-BR_BroadbandModelpt-BR_NarrowbandModel이 이제 언어 모델 사용자 정의(GA)를 지원합니다. 이러한 모델이 이 지원을 사용하도록 업데이트되지 않았으므로 기존 사용자 정의 음향 모델의 업데이트가 필요하지 않습니다.

향상된 음성 인식을 위한, 미국 영어 및 일본어 모델에 대한 업데이트

미국 영어 및 일본어의 광대역 및 협대역 모델의 새 버전을 사용할 수 있습니다.

  • 미국 영어 광대역 모델(en-US_BroadbandModel)
  • 미국 영어 협대역 모델(en-US_NarrowbandModel)
  • 일본어 광대역 모델(ja-JP_BroadbandModel)
  • 일본어 협대역 모델(ja-JP_NarrowbandModel)

새 모델은 향상된 음성 인식을 제공합니다. 기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이러한 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하려면 기존 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

키워드 발견 및 단어 대안 기능이 GA(General Availability)됨

키워드 발견 및 단어 대체 기능이 이제 모든 언어에 대해 베타 기능이 아니라 GA(Generally Available)되었습니다. 자세한 정보는 다음을 참조하십시오.

결함 수정사항: 사용자 정의 인터페이스에 대한 문서 개선

결함 수정: 사용자 지정 인터페이스와 관련된 다음의 알려진 문제들이 해결되었으며, 운영 환경에 반영되었습니다. 다음 정보는 과거에 이러한 문제점이 발생했을 수 있는 사용자를 위해 보존됩니다.

  • 사용자 정의 언어 또는 사용자 정의 음향 모델에 데이터를 추가하는 경우 음성 인식에 사용하기 전에 모델을 재훈련해야 합니다. 이 문제점은 다음 시나리오에서 발생합니다.

    1. 사용자가 새 사용자 정의 모델(언어 또는 음향)을 작성하고 모델을 훈련합니다.

    2. 사용자가 추가 리소스(단어, 말뭉치 또는 오디어)를 사용자 정의 모델에 추가하지만 모델을 재훈련하지 않습니다.

    3. 사용자가 사용자 정의 모델을 음성 인식에 사용할 수 없습니다. 서비스가 음성 인식 요청에 사용될 때 다음 양식의 오류를 리턴합니다.

      {
        "code_description": "Bad Request",
        "code": 400,
        "error": "Requested custom language model is not available.
                  Please make sure the custom model is trained."
      }
      

    이 문제를 해결하려면 사용자가 최신 데이터에 대해 사용자 정의 모델을 재훈련해야 합니다. 그런 다음 사용자가 사용자 정의 모델을 음성 인식에 사용할 수 있습니다.

  • 기존 사용자 정의 언어 또는 사용자 정의 음향 모델을 훈련하기 전에 기본 모델의 최신 버전으로 업그레이드해야 합니다. 이 문제점은 다음 시나리오에서 발생합니다.

    1. 사용자에게 업데이트된 모델을 기반으로 하는 기존 사용자 정의 모델(언어 또는 음향)이 있습니다.
    2. 사용자가 먼저 최신 버전의 기본 모델로 업그레이드하지 않고 이전 버전의 기본 모델에 대해 기존 사용자 정의 모델을 훈련합니다.
    3. 사용자가 사용자 정의 모델을 음성 인식에 사용할 수 없습니다.

    이 문제를 해결하려면 사용자가 POST /v1/customizations/{customization_id}/upgrade_model 또는 POST /v1/acoustic_customizations/{customization_id}/upgrade_model 메소드를 사용하여 사용자 정의 모델을 최신 버전의 기본 모델로 업그레이드해야 합니다. 그런 다음 사용자가 사용자 정의 모델을 음성 인식에 사용할 수 있습니다.

2018년 9월 7일

세션 기반 인터페이스를 더 이상 사용할 수 없음

세션 기반 HTTP REST 인터페이스가 더 이상 지원되지 않습니다. 세션과 관련된 모든 정보가 문서에서 제거되었습니다. 다음 메소드를 더 이상 사용할 수 없습니다.

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

애플리케이션이 세션 인터페이스를 사용하는 경우 나머지 HTTP REST 인터페이스 중 하나 또는 WebSocket 인터페이스로 마이그레이션해야 합니다. 자세한 정보는 2018년 8월 8일의 서비스 업데이트를 참조하십시오.

2018년 8월 8일

세션 기반 음성 인식 인터페이스에 대한 지원 중단 알림

2018년 8월 8일을 기준으로 세션 기반 HTTP REST 인터페이스가 더 이상 사용되지 않습니다. 2018년 9월 7일을 기준으로 세션 API의 모든 메소드가 제거되므로 이후 세션 기반 인터페이스를 더 이상 사용할 수 없습니다. 이 즉각적인 지원 중단 및 30일 제거 알림은 다음 메소드에 적용됩니다.

  • POST /v1/sessions
  • POST /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/recognize
  • GET /v1/sessions/{session_id}/observe_result
  • DELETE /v1/sessions/{session_id}

애플리케이션이 세션 인터페이스를 사용하는 경우 9월 7일까지 다음 인터페이스 중 하나로 마이그레이션해야 합니다.

  • 스트림 기반 음성 인식(라이브 유스 케이스 포함)의 경우 중간 결과 및 가장 낮은 대기 시간에 대한 액세스를 제공하는 WebSocket 인터페이스를 사용하십시오.
  • 파일 기반 음성 인식의 경우 다음 인터페이스 중 하나를 사용하십시오.
    • 최대 몇 분 길이의 오디오로 구성된 짧은 파일의 경우 동기 HTTP 인터페이스(POST /v1/recognize) 또는 비동기 HTTP 인터페이스(POST /v1/recognitions)를 사용하십시오.
    • 몇 분 이상의 오디오로 구성된 긴 파일의 경우 비동기 HTTP 인터페이스를 사용하십시오. 비동기 HTTP 인터페이스는 단일 요청으로 1GB의 오디오 데이터를 허용합니다.

WebSocket 및 HTTP 인터페이스는 세션 인터페이스와 동일한 결과를 제공합니다(WebSocket 인터페이스만 중간 결과를 제공함). 모든 인터페이스를 사용한 애플리케이션 개발을 간소화하는 Watson SDK 중 하나를 사용할 수도 있습니다. 자세한 정보는 API & SDK 참조를 참조하십시오.

2018년 7월 13일

향상된 음성 인식을 위한, 스페인어 협대역 모델에 대한 업데이트

향상된 음성 인식을 위해 스페인어 협대역 모델 es-ES_NarrowbandModel이 업데이트되었습니다. 기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

이 업데이트부터 다음과 같은 두 개 버전의 스페인어 협대역 모델을 사용할 수 있습니다.

  • es_ES.8kHz.general.lm20180522235959.am20180522235959(현재)
  • es_ES.8kHz.general.lm20180308235959.am20180308235959(이전)

다음 버전의 모델을 더 이상 사용할 수 없습니다.

  • es_ES.8kHz.general.lm20171031235959.am20171031235959

현재 사용 불가능한 기본 모델을 기반으로 하는 사용자 정의 모델을 사용하려고 시도하는 인식 요청은 사용자 정의 없이 최신 기본 모델을 사용합니다. 서비스는 다음 경고 메시지를 리턴합니다: Using non-customized default base model, because your custom {type} model has been built with a version of the base model that is no longer supported. 사용 불가능한 모델을 기반으로 하는 사용자 정의 모델을 계속해서 사용하려면 먼저 이전에 설명된 적절한 upgrade_model 메소드를 사용하여 해당 모델을 업그레이드해야 합니다.

2018년 6월 12일

워싱턴 DC 위치에서 호스팅되는 애플리케이션을 위한 새 기능

다음 기능은 워싱턴, DC(us-east)에서 호스팅하는 애플리케이션에 사용할 수 있습니다.

  • 서비스는 이제 새 API 인증 프로세스를 지원합니다. 자세한 정보는 2018년 10월 30일 서비스 업데이트를 참조하십시오.
  • 서비스는 이제 X-Watson-Metadata 헤더 및 DELETE /v1/user_data 메소드를 지원합니다. 자세한 정보는 정보 보안을 참조하십시오.

2018년 5월 15일

시드니 위치에서 호스팅되는 애플리케이션을 위한 새 기능

다음 기능은 시드니(au-syd)에서 호스팅하는 애플리케이션에 사용할 수 있습니다.

  • 서비스는 이제 새 API 인증 프로세스를 지원합니다. 자세한 정보는 2018년 10월 30일 서비스 업데이트를 참조하십시오.
  • 서비스는 이제 X-Watson-Metadata 헤더 및 DELETE /v1/user_data 메소드를 지원합니다. 자세한 정보는 정보 보안을 참조하십시오.

2018년 3월 26일

프랑스어 광대역 모델에 대해 언어 모델 사용자 정의가 사용 가능해짐

이제 이 서비스가 프랑스어 광대역 언어 모델 fr-FR_BroadbandModel에 대해 언어 모델 사용자 정의를 지원합니다. 이 프랑스어 모델은 언어 모델 사용자 정의와 함께 프로덕션용으로 사용할 수 있도록 GA(General Availability)되었습니다.

향상된 음성 인식을 위한 프랑스어, 한국어 및 스페인어 모델에 대한 업데이트

다음 모델이 향상된 음성 인식을 위해 업데이트되었습니다.

  • 한국어 협대역 모델(ko-KR_NarrowbandModel)
  • 스페인어 협대역 모델(es-ES_NarrowbandModel)
  • 프랑스어 광대역 모델(fr-FR_BroadbandModel)

기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이러한 모델 중 하나를 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오.

version 매개변수의 이름이 base_model_version(으)로 바뀜

다음 메소드의 version 매개변수의 이름이 base_model_version(으)로 바뀌었습니다.

  • WebSocket 요청의 경우 /v1/recognize
  • 세션 없는 HTTP 요청의 경우 POST /v1/recognize
  • 세션 기반 HTTP 요청의 경우 POST /v1/sessions
  • 비동기 HTTP 요청의 경우 POST /v1/recognitions

base_model_version 매개변수는 음성 인식에 사용될 기본 모델의 버전을 지정합니다. 자세한 정보는 음성 인식에 업그레이드된 사용자 정의 모델 사용업그레이드된 사용자 정의 모델을 사용하여 음성 인식 요청을 참조하십시오.

스페인어 음성 인식에 대한, 스마트 형식화에 대한 새 지원

이제 스마트 형식화가 미국 영어뿐만 아니라 스페인어에 대해서도 지원됩니다. 또한 미국 영어의 경우 이 기능이 키워드 문자열을 마침표, 쉼표, 물음표 및 느낌표의 문장 부호로 변환합니다. 자세한 정보는 스마트 형식화를 참조하십시오.

2018년 3월 1일

향상된 음성 인식을 위한, 프랑스어 및 스페인어 광대역 모델에 대한 업데이트

프랑스어 및 스페인어 광대역 모델 fr-FR_BroadbandModeles-ES_BroadbandModel이(가) 향상된 음성 인식을 위해 업데이트되었습니다. 기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 이러한 모델 중 하나를 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오. 이 섹션에는 사용자 정의 모델 업그레이드 규칙, 업그레이드 영향 및 업그레이드된 모델을 사용하기 위한 접근 방식이 제공됩니다.

2018년 2월 1일

새 한국어 모델

이 서비스는 이제 16kHz 이상으로 샘플링된 오디오에 대해서는 ko-KR_BroadbandModel, 8kHz 이상으로 샘플링된 오디오에 대해서는 ko-KR_NarrowbandModel(이)라는, 한국어에 대한 언어 모델을 제공합니다. 자세한 정보는 이전 세대 언어 및 모델을 참조하십시오.

언어 모델 사용자 정의의 경우, 한국어 모델은 프로덕션용으로 GA(General Availability)되어 있습니다. 음향 모델 사용자 정의의 경우에는 베타 기능입니다. 자세한 정보는 사용자 정의에 대한 언어 지원을 참조하십시오.

  • 서비스가 한국어의 말뭉치를 구문 분석하는 방법에 대한 자세한 정보는 한국어 구문 분석을 참조하십시오.
  • 한국어로 된 사용자 정의 단어의 유사 발음 작성에 대한 자세한 정보는 한국어에 대한 가이드라인을 참조하십시오.

2017년 12월 14일

언어 모델 사용자 정의가 GA(General Availability)됨

이제 언어 모델 사용자 정의 및 연관된 모든 매개변수가 지원되는 모든 언어(일본어, 스페인어, 영국 영어 및 미국 영어)에 대해 GA(Generally Available)되었습니다.

모든 언어에 대해 베타 음향 모델 사용자 정의가 사용 가능해짐

이제 이 서비스가 음향 모델 사용자 정의를 사용 가능한 모든 언어에 대한 베타 기능으로 지원합니다. 모든 언어의 광대역 또는 협대역 모델에 대한 사용자 정의 음향 모델을 작성할 수 있습니다. 음향 모델 사용자 정의를 비롯한 사용자 정의에 대한 소개는 사용자 정의 이해를 참조하십시오.

음성 인식에 대한 새 version 매개변수

인식을 요청하는 다양한 메소드는 이제 기본 및 사용자 정의 모델의 이전 버전 또는 업그레이드된 버전 중 하나를 사용하는 요청을 시작하는 데 사용할 수 있는 새 version 매개변수를 포함합니다. version 매개변수는 기본적으로 업그레이드된 사용자 정의 모델과 함께 사용하기 위한 것이지만, 사용자 정의 모델 없이도 이를 사용할 수 있습니다. 자세한 정보는 업그레이드된 사용자 정의 모델을 사용하여 음성 인식 요청을 참조하십시오.

향상된 음성 인식을 위한, 미국 영어 모델에 대한 업데이트

향상된 음성 인식을 위해 미국 영어 모델 en-US_BroadbandModelen-US_NarrowbandModel이 업데이트되었습니다. 기본적으로 이 서비스는 모든 인식 요청에 대해 업데이트된 모델을 자동으로 사용합니다. 미국 영어 모델을 기반으로 하는 사용자 정의 언어 또는 사용자 정의 음향 모델이 있는 경우 다음 메소드를 사용하여 업데이트를 활용하도록 사용자 정의 모델을 업그레이드해야 합니다.

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

이 프로시저에 대한 자세한 정보는 사용자 정의 모델 업그레이드를 참조하십시오. 이 섹션에는 사용자 정의 모델 업그레이드 규칙, 업그레이드 영향 및 업그레이드된 모델을 사용하기 위한 접근 방식이 제공됩니다. 현재 이러한 메소드는 새로운 미국 영어 기본 모델에만 적용됩니다. 그러나 다른 기본 모델의 업그레이드가 사용 가능하게 되면 해당 업그레이드에도 동일한 정보가 적용됩니다.

영국 영어에 대해 언어 모델 사용자 정의가 사용 가능해짐

이제 이 서비스가 영국 영어 모델 en-GB_BroadbandModelen-GB_NarrowbandModel에 대한 언어 모델 사용자 정의를 지원합니다. 이 서비스는 영국 및 미국 영어 말뭉치와 사용자 정의 단어를 일반적으로 유사한 방식으로 처리하지만 몇 가지 중요한 차이점이 있습니다.

2017년 10월 2일

미국 영어, 일본어 및 스페인어에 대한 새 베타 음향 모델 사용자 정의 인터페이스

이제 사용자 정의 인터페이스가 음향 모델 사용자 정의를 지원합니다. 서비스의 기본 모델을 사용자 환경 및 화자에 맞게 조정하는 사용자 정의 음향 모델을 작성할 수 있습니다. 텍스트 변환할 오디오의 음향 서명과 보다 밀접하게 일치하는 오디오의 사용자 정의 음향 모델을 채우고 훈련합니다. 그런 다음, 사용자 정의 음향 모델을 인식 요청에 사용하여 음성 인식의 정확도를 높입니다.

사용자 정의 음향 모델은 사용자 정의 언어 모델을 보완합니다. 사용자 정의 언어 모델로 사용자 정의 음향 모델을 훈련할 수 있으며 음성 인식 중에 두 가지 유형의 모델을 모두 사용할 수 있습니다. 음향 모델 사용자 정의는 미국 영어, 일본어 및 스페인어에만 사용할 수 있는 베타 인터페이스입니다.

사용자 정의 언어 모델에 대한 새 베타 customization_weight 매개변수

이제 언어 모델 사용자 정의를 위해 사용자 정의 언어 모델의 선택적 사용자 정의 가중치를 설정하는 베타 기능이 서비스에 포함됩니다. 사용자 정의 가중치는 서비스 기본 어휘의 단어와 비교하여 사용자 정의 언어 모델의 단어에 지정될 상대적인 가중치를 지정합니다. 훈련 및 음성 인식 중에 사용자 정의 가중치를 설정할 수 있습니다. 자세한 정보는 사용자 정의 가중치 사용을 참조하십시오.

향상된 음성 인식을 위한, 일본어 광대역 모델에 대한 업데이트

ja-JP_BroadbandModel 언어 모델이 기본 모델의 개선사항을 적용하도록 업그레이드되었습니다. 업그레이드가 모델을 기반으로 하는 기존 사용자 정의 모델에는 영향을 미치지 않습니다.

audio/l16 오디오 형식에 대한 새 endianness 매개변수

이제 이 서비스에는 audio/l16(선형 16비트 PCM(Pulse-Code Modulation)) 형식으로 제출된 오디오의 엔디안을 지정하는 매개변수가 포함되어 있습니다. 이 형식으로 ratechannels 매개변수를 지정하는 것 이외에 이제 big-endian 매개변수를 사용하여 little-endian endianness을 지정할 수도 있습니다. 자세한 정보는 audio/l16 형식을 참조하십시오.

2017년 7월 14일

MP3(MPEG) 오디오 형식에 대한 새로운 지원

이제 서비스가 MP3 또는 MPEG(Motion Picture Experts Group) 형식 오디오의 텍스트 변환을 지원합니다. 자세한 정보는 audio/mp3 및 audio/mpeg 형식을 참조하십시오.

스페인어에 대해 베타 언어 모델 사용자 정의가 사용 가능해짐

언어 모델 사용자 정의 인터페이스가 이제 스페인어를 베타 기능으로 지원합니다. 기본 스페인어 언어 모델 es-ES_BroadbandModel 또는 es-ES_NarrowbandModel 중 하나를 기반으로 사용자 정의 모델을 작성할 수 있습니다. 사용자 정의 언어 모델 작성을 참조하십시오. 스페인어 사용자 정의 언어 모델을 사용하는 인식 요청에 대한 가격은 미국 영어 및 일본어 모델을 사용하는 요청과 동일합니다.

사용자 정의 언어 모델을 작성하는 메소드에 대한 새 dialect 필드

이제 새 사용자 정의 언어 모델을 작성하기 위해 CreateLanguageModel 메소드에 전달하는 JSON POST /v1/customizations 오브젝트에 dialect 필드가 포함됩니다. 이 필드는 사용자 정의 모델에 사용될 언어의 통용어를 지정합니다. 기본적으로 통용어는 기본 모델의 언어와 일치합니다. 이 매개변수는 서비스가 다음 통용어 중 하나로 된 음성에 적합한 사용자 정의 모델을 작성할 수 있는 스페인어 모델의 경우에만 의미가 있습니다.

  • 카스티야 스페인어의 경우 es-ES(기본값)
  • 라틴 아메리아 스페인어의 경우 es-LA
  • 북아메리카(멕시코어) 스페인어의 경우 es-US

사용자 정의 인터페이스의 GET /v1/customizationsGET /v1/customizations/{customization_id} 메소드는 사용자 정의 모델의 통용어를 출력에 포함합니다. 자세한 정보는 사용자 정의 언어 모델 작성사용자 정의 언어 모델 나열을 참조하십시오.

영국 영어 모델에 대한 새 이름

언어 모델 en-UK_BroadbandModelen-UK_NarrowbandModel의 이름이 더 이상 사용되지 않습니다. 이제 en-GB_BroadbandModelen-GB_NarrowbandModel이라는 이름으로 모델을 사용할 수 있습니다.

더 이상 사용되지 않는 en-UK_{model} 이름은 계속 작동하지만 GET /v1/models 메소드가 해당 이름을 사용 가능한 모델 목록에 더 이상 리턴하지 않습니다. 여전히 GET /v1/models/{model_id} 메소드를 사용하여 이름을 직접 조회할 수 있습니다.

2017년 7월 1일

미국 영어 및 일본어에 대해 언어 모델 사용자 정의가 GA(Generally Available)됨

이제 서비스의 지원되는 언어인 미국 영어와 일본어에 대해 언어 모델 사용자 정의 인터페이스가 GA(Generally Available)되었습니다. IBM은(는) 사용자 정의 언어 모델의 작성, 호스팅 또는 관리에 대해 요금을 청구하지 않습니다. 다음 글머리 기호에 설명된 대로 이제 IBM에서 사용자 정의 모델을 사용하는 인식 요청에 대한 오디오의 분당 추가 $0.03(USD)를 청구합니다.

서비스의 가격 플랜에 대한 업데이트

IBM에서 다음을 수행하여 서비스에 대한 가격을 업데이트했습니다.

  • 협대역 모델 사용에 대한 추가 가격 제거
  • 대용량 고객에게 누진 계층 가격 제공
  • 미국 영어 또는 일본어 사용자 정의 언어 모델을 사용하는 인식 요청에 대한 오디오의 분당 추가 $0.03(USD) 청구

가격 업데이트에 대한 자세한 정보는 다음을 참조하십시오.

HTTP POST 요청에 비어 있는 본문이 더 이상 필요하지 않음

더 이상 비어 있는 데이터 오브젝트를 다음 POST 요청에 대한 본문으로 전달할 필요가 없습니다.

  • POST /v1/sessions
  • POST /v1/register_callback
  • POST /v1/customizations/{customization_id}/train
  • POST /v1/customizations/{customization_id}/reset
  • POST /v1/customizations/{customization_id}/upgrade_model

예를 들어, 이제는 다음과 같이 POST /v1/sessions을 사용하여 curl 메소드를 호출합니다.

curl -X POST -u "{username}:{password}" \
--cookie-jar cookies.txt \
"{url}/v1/sessions"

이제 curl 옵션 --data "{}"를 옵션과 함께 전달할 필요가 없습니다. 이러한 POST 요청 중 하나에 문제점이 발생하는 경우 비어 있는 데이터 오브젝트를 요청의 본문으로 전달해 보십시오. 비어 있는 오브젝트를 전달해도 어떤 방식으로든 요청의 속성 또는 의미가 변경되지 않습니다.

2017년 5월 22일

모든 메소드에서 continuous 매개변수가 제거됨

continuous 매개변수가 인식 요청을 시작하는 모든 메소드에서 제거됩니다. 이제 서비스가 종료되거나 제한시간이 초과될 때까지(둘 중 먼저 발생하는 것을 기준으로 함) 전체 오디오 스트림을 텍스트 변환합니다. 이 동작은 이전의 continuous 매개변수를 true로 설정하는 것과 동등합니다. 기본적으로 이 매개변수가 생략되거나 false로 설정된 경우 이전에는 서비스가 비음성 구간(일반적으로 무음)의 처음 0.5초에 텍스트 변환을 중지했습니다.

true로 설정된 기존 애플리케이션에서는 동작이 변경되지 않습니다. 이 매개변수를 false로 설정했거나 기본 동작에 의존한 애플리케이션은 변경될 수 있습니다. 요청에 이 매개변수가 지정된 경우 이제 서비스가 알 수 없는 매개변수에 대한 경고 메시지를 리턴하여 응답합니다.

"warnings": [
  "Unknown arguments: continuous."
]

경고가 발생해도 요청에 성공하며 기존 세션 또는 WebSocket 연결에는 영향을 미치지 않습니다.

IBM에서는 continuous=false를 지정하는 것은 가치가 거의 없으며 텍스트 변환 정확도를 감소시킬 수 있다는 개발자 커뮤니티의 압도적인 피드백에 응답하여 이 매개변수를 제거했습니다.

세션 제한시간 초과를 방지하기 위해 오디오 전송이 필요함

오디오를 전송하지 않고 세션 제한시간 초과를 방지할 수는 없습니다.

  • WebSocket 인터페이스를 사용하는 경우 클라이언트는 더 이상 action 매개변수가 no-op로 설정된 상태로 JSON 텍스트 메시지를 전송하여 연결을 유지할 수 없습니다. no-op 메시지를 전송하면 오류가 생성되지는 않지만 적용되지 않습니다.
  • HTTP 인터페이스를 통해 세션을 사용하는 경우 클라이언트는 더 이상 GET /v1/sessions/{session_id}/recognize 요청을 전송하여 세션을 연장할 수 없습니다. 이 메소드는 활성 세션의 상태를 계속 리턴하지만 세션을 활성 상태로 유지하지 않습니다.

이제 다음을 수행하여 세션을 활성 상태로 유지할 수 있습니다.

  • 30초 비활성 제한시간 초과를 방지하려면 inactivity_timeout 매개변수를 -1로 설정하십시오.
  • 30초 세션 제한시간 초과를 방지하려면 무음을 포함한 임의의 오디오 데이터를 서비스에 전송하십시오. 세션을 연장하기 위해 전송하는 무음을 포함하여 서비스에 전송하는 모든 데이터의 지속 시간 동안 비용이 청구됩니다.

자세한 정보는 제한시간을 참조하십시오. 이상적으로, 텍스트 변환을 위해 오디오를 얻기 직전에 세션을 설정하고 실시간에 가까운 속도로 오디오를 전송하여 세션을 유지할 수 있습니다. 또한 애플리케이션이 닫힌 세션 또는 연결에서 정상적으로 복구되는지 확인하십시오.

IBM에서 모든 사용자에게 동급 최고의 대기 시간이 짧은 음성 인식 서비스를 계속 제공할 수 있도록 이 기능을 제거했습니다.

2017년 4월 10일

이제 미국 영어, 스페인어 및 일본어에 대해 화자 레이블이 지원됨

이제 서비스가 다음 광대역 모델에 대해 화자 레이블 기능을 지원합니다.

  • 미국 영어 광대역 모델(en-US-BroadbandModel)
  • 스페인어 광대역 모델(es-ES-BroadbandModel)
  • 일본어 광대역 모델(ja-JP_BroadbandModel)

자세한 정보는 화자 레이블을 참조하십시오.

WebM(Web Media) 오디오 형식에 대한 새 지원

서비스는 이제 Opus 또는 Vorbis 코덱이 포함된 WebM(Web Media) 오디오 형식을 지원합니다. 또한 Opus 코덱 외에도 Vorbis 코덱이 포함된 Ogg 오디오 형식을 지원합니다. 지원되는 오디오 형식에 대한 자세한 정보는 audio/webm 형식을 참조하십시오.

CORS(Cross-Origin Resource Sharing)에 대한 새로운 지원

서비스는 이제 브라우저 기반 클라이언트가 서비스를 직접 호출할 수 있도록 CORS(Cross-Origin Resource Sharing)를 지원합니다. 자세한 정보는 CORS 지원을 참조하십시오.

비동기 HTTP 인터페이스에서 콜백 URL을 등록 취소하는 새 메소드

비동기 HTTP 인터페이스가 허용 목록에 지정된 콜백 URL에 대한 등록을 제거하는 POST /v1/unregister_callback 메소드를 제공합니다. 자세한 정보는 콜백 URL 등록 취소를 참조하십시오.

버그 수정: WebSocket 인터페이스에서 긴 오디오 재생 시 발생하는 타임아웃 현상 해결

결함 수정사항: WebSocket 인터페이스가 더 이상 매우 긴 오디오 파일에 대한 인식 요청을 제한시간 초과 처리하지 않습니다. 제한시간이 초과되지 않도록 JSON start 메시지에 중간 결과를 요청할 필요가 없습니다. (이 문제는 2016년 3월 10일의 업데이트에 기술되어 있었습니다.)

새 HTTP 오류 코드

이제 다음 언어 모델 사용자 정의 메소드가 다음 HTTP 오류 코드를 리턴할 수 있습니다.

  • 존재하지 않는 사용자 정의 모델을 삭제하려고 시도하면 DELETE /v1/customizations/{customization_id} 메소드가 HTTP 응답 코드 401을 리턴합니다.
  • 존재하지 않는 말뭉치를 삭제하려고 시도하면 DELETE /v1/customizations/{customization_id}/corpora/{corpus_name} 메소드가 HTTP 응답 코드 400을 리턴합니다.

2017년 3월 8일

비동기 HTTP 인터페이스가 GA(General Availability)됨
이제 비동기 HTTP 인터페이스가 GA(General Availability)되었습니다. 이 날짜 이전에는 베타 기능이었습니다.

2016년 12월 1일

새 베타 화자 레이블 기능

이제 이 서비스가 미국 영어, 스페인어 또는 일본어로 된 협대역 오디오에 대해 베타 화자 레이블 기능을 제공합니다. 이 기능은 여러 사람 간의 대화에서 어떤 화자가 어떤 단어를 말했는지를 식별합니다. 세션 없음, 세션 기반, 비동기 및 WebSocket 인식 메소드 각각에 speaker_labels 매개변수가 포함됩니다. 이 매개변수는 화자 레이블이 응답에 포함될지 여부를 표시하기 위한 부울 값을 허용합니다. 이 기능에 대한 자세한 정보는 화자 레이블을 참조하십시오.

일본어에 대해 베타 언어 모델 사용자 정의가 사용 가능해짐

이제 베타 언어 모델 사용자 정의 인터페이스가 미국 영어 이외에 일본어에도 지원됩니다. 이 인터페이스의 모든 메소드가 일본어를 지원합니다. 자세한 정보는 다음 섹션을 참조하십시오.

말뭉치에 대한 정보를 나열하는 새 메소드

이제 언어 모델 사용자 정의 인터페이스에 지정된 말뭉치 관련 정보를 나열하는 GET /v1/customizations/{customization_id}/corpora/{corpus_name} 메소드가 포함됩니다. 이 메소드는 사용자 정의 모델에 말뭉치를 추가하는 요청의 상태를 모니터하는 데 유용합니다. 자세한 정보는 사용자 정의 언어 모델의 말뭉치 나열을 참조하십시오.

사용자 정의 언어 모델의 단어를 나열하는 메소드에 대한 새 count 필드

이제 GET /v1/customizations/{customization_id}/wordsGET /v1/customizations/{customization_id}/words/{word_name} 메소드에서 리턴하는 JSON 응답이 각 단어에 대한 count 필드를 포함합니다. 이 필드는 던어가 모든 말뭉치에서 발견된 횟수를 표시합니다. 사용자 정의 단어가 말뭉치에 의해 모델에 추가되기 전에 직접 추가하는 경우 이 횟수는 1에서 시작합니다. 이 단어가 말뭉치에서 먼저 추가된 후 수정된 경우, 이 횟수는 말뭉치에서 해당 단어가 발견된 횟수만 반영합니다. 자세한 정보는 사용자 정의 언어 모델의 사용자 정의 단어 나열을 참조하십시오.

count 필드가 생기기 전에 작성된 사용자 정의 모델의 경우, 이 필드는 항상 0(으)로 남아 있습니다. 이러한 모델의 해당 필드를 업데이트하려면 모델의 말뭉치를 다시 추가한 후 POST /v1/customizations/{customization_id}/corpora/{corpus_name} 메소드에 allow_overwrite 매개변수를 포함시키십시오.

사용자 정의 언어 모델의 단어를 나열하는 메소드에 대한 새 sort 매개변수

이제 GET /v1/customizations/{customization_id}/words 메소드에 단어가 나열될 순서를 제어하는 sort 조회 매개변수가 포함됩니다. 이 매개변수는 단어가 정렬되는 방식을 표시하는 두 개의 인수 alphabetical 또는 count를 허용합니다. 선택적 + 또는 -를 인수 앞에 추가하여 결과가 오름차순 또는 내림차순으로 정렬되는지를 표시할 수 있습니다. 기본적으로 이 메소드는 단어를 알파벳 오름차순으로 표시합니다. 자세한 정보는 사용자 정의 언어 모델의 사용자 정의 단어 나열을 참조하십시오.

count 필드가 도입되기 전에 작성된 사용자 정의 모델의 경우 count 인수를 sort 매개변수와 함께 사용하는 것은 의미가 없습니다. 이러한 모델에는 기본 alphabetical 인수를 사용하십시오.

사용자 정의 언어 모델의 단어를 나열하는 메소드에 대한 새 error 필드 형식

errorGET /v1/customizations/{customization_id}/words 메소드에서 JSON 응답의 일부로 리턴될 수 있는 GET /v1/customizations/{customization_id}/words/{word_name} 필드가 이제 배열입니다. 서비스에서 사용자 정의 단어의 정의에 대한 하나 이상의 문제점을 발견한 경우 이 필드에 정의의 각 문제점 요소가 나열되고 해당 문제점에 대해 설명하는 메시지가 제공됩니다. 자세한 정보는 사용자 정의 언어 모델의 사용자 정의 단어 나열을 참조하십시오.

keywords_thresholdword_alternatives_threshold 매개변수가 더 이상 널값을 허용하지 않음

인식 메소드의 keywords_thresholdword_alternatives_threshold 매개변수가 더 이상 널값을 허용하지 않습니다. 응답에서 키워드 및 단어 대체를 생략하려면 이러한 매개변수를 생략하십시오. 지정된 값은 float여야 합니다.

2016년 9월 22일

새 베타 언어 모델 사용자 정의 인터페이스
이제 이 서비스가 미국 영어에 대한 새로운 베타 언어 모델 사용자 정의 인터페이스를 제공합니다. 이 인터페이스를 사용하면 도메인 특정 용어를 포함하는 사용자 정의 언어 모델을 작성하여 서비스의 기본 어휘 및 언어 모델을 사용자 조정할 수 있습니다. 사용자 정의 단어를 개별적으로 추가하거나 서비스가 말뭉치에서 추출하도록 할 수 있습니다. 서비스의 인터페이스 중 하나에서 제공되는 음성 인식 메소드에 사용자 정의 모델을 사용하려면 customization_id 조회 매개변수를 전달하십시오. 자세한 정보는 다음을 참조하십시오.
audio/mulaw 오디오 형식에 대한 새로운 지원
이제 지원되는 오디오 형식의 모델에 audio/mulaw가 포함됩니다. 이 형식은 u-law(또는 mu-law) 데이터 알고리즘을 사용하여 인코딩된 단일 채널 오디오를 제공합니다. 이 형식을 사용하는 경우 오디오가 캡처되는 샘플링 속도로 지정해야 합니다. 자세한 정보는 audio/mulaw 형식을 참조하십시오.
모델을 나열할 때 새 supported_features이(가) 식별됨
이제 GET /v1/modelsGET /v1/models/{model_id} 메소드가 각 언어 모델에 대한 출력의 일부로 supported_features 필드를 리턴합니다. 추가 정보에 모델이 사용자 정의를 지원하는지 여부가 설명되어 있습니다. 자세한 정보는 API & SDK 참조를 참조하십시오.

2016년 6월 30일

베타 비동기 HTTP 인터페이스가 모든 사용 가능한 언어를 지원하게 됨
이제 베타 비동기 HTTP 인터페이스가 서비스에서 지원되는 모든 언어를 지원합니다. 이 인터페이스는 이전에 미국 영어에만 사용 가능했습니다. 더 자세한 정보는 비동기식 HTTP 인터페이스API & SDK 레퍼런스를 참고하세요.

2016년 6월 23일

새 베타 비동기 HTTP 인터페이스가 사용 가능해짐
이제 베타 비동기 HTTP 인터페이스를 사용할 수 있습니다. 이 인터페이스는 비차단 HTTP 호출을 통해 미국 언어 텍스트 변환에 대한 전체 인식 기능을 제공합니다. 콜백 URL을 등록하고 사용자 지정 시크릿 문자열을 제공하여 디지털 서명으로 인증 및 데이터 무결성을 달성할 수 있습니다. 더 자세한 정보는 비동기식 HTTP 인터페이스API & SDK 레퍼런스를 참고하세요.
음성 인식에 대한 새 베타 smart_formatting 매개변수
최종 텍스트 변환 내용에서 날짜, 시간, 일련의 숫자 및 번호, 전화번호, 통화 가치 및 인터넷 주소를 보다 일반적인 표시로 변환하는 베타 스마트 형식화 기능. 인식 요청에서 smart_formatting 매개변수를 true로 설정하여 이 기능을 사용으로 설정합니다. 이 기능은 미국 영어에만 사용할 수 있는 베타 기능입니다. 자세한 정보는 스마트 형식화를 참조하십시오.
새 프랑스어 광대역 모델
이제 음성 인식에 지원되는 모델의 목록에 최소 16kHz로 샘플링되는 프랑스어로 된 오디오에 대한 fr-FR_BroadbandModel이 포함됩니다. 자세한 정보는 이전 세대 언어 및 모델을 참조하십시오.
audio/basic 오디오 형식에 대한 새로운 지원
지원되는 오디오 형식의 목록에 audio/basic이(가) 포함됩니다. 이 형식은 8kHz로 샘플링되는 8비트 u-law(또는 mu-law) 데이터를 사용하여 인코딩되는 단일 채널 오디오를 제공합니다. 자세한 정보는 audio/basic 형식을 참조하십시오.
음성 인식 메소드가 올바르지 않은 매개변수에 대해 경고를 리턴하게 됨
다양한 인식 메소드가 요청에 포함된 올바르지 않은 조회 매개변수 또는 JSON 필드에 대한 메시지를 포함하는 warnings 응답을 리턴할 수 있습니다. 경고의 형식이 변경되었습니다. 예를 들면, "warnings": "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']."은(는) 이제 "warnings": "Unknown arguments: {invalid_arg_1}, {invalid_arg_2}."입니다.
데이터를 전달하지 않는 HTTP POST 메소드에 비어 있는 본문이 필요함
데이터를 서비스에 전달하지 않는 HTTP POST 요청의 경우 {} 양식의 비어 있는 요청 본문을 포함시켜야 합니다. curl 명령에 --data 옵션을 사용하여 비어 있는 데이터를 전달합니다.

2016년 3월 10일

음성 인식을 위해 전송되는 오디오에 대한 새 최대 크기 한계
이제 두 가지 데이터 전송 양식(원샷 전달 및 스트리밍) 모두는 WebSocket 인터페이스에서와 마찬가지로 오디오 데이터에 100MB의 크기 한계를 부과합니다. 이전에는 원샷 접근 방식의 최대 데이터 한계가 4MB였습니다. 자세한 정보는 오디오 전송(모든 인터페이스의 경우) 및 오디오 전송 및 인식 결과 수신(WebSocket 인터페이스의 경우)을 참조하십시오. WebSocket 섹션에서도 WebSocket 인터페이스에서 적용되는 4MB의 최대 프레임 또는 메시지 크기에 대해 설명합니다.
HTTP 및 WebSocket 인터페이스는 이제 경고를 리턴할 수 있습니다.
이제 요청에 포함된 올바르지 않은 조회 매개변수 또는 JSON 필드에 대한 경고 메시지의 배열이 인식 요청의 JSON 응답에 포함될 수 있습니다. 배열의 각 요소는 경고의 속성에 대해 설명하는 문자열이며 올바르지 않은 인수 문자열의 배열이 다음에 나옵니다. 예를 들어, "warnings": [ "Unknown arguments: [u'{invalid_arg_1}', u'{invalid_arg_2}']." ]입니다. 자세한 정보는 API & SDK 참조를 참조하십시오.
베타 Apple iOS SDK가 더 이상 사용되지 않음
베타 *Apple® iOS 운영 체제용 Watson Speech SDK(Software Development Kit)*가 더 이상 사용되지 않습니다. Apple® iOS 운영 체제용 Watson SDK를 대신 사용하십시오. 새로운 SDK는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 ios-sdk 저장소에서 확인할 수 있습니다.
WebSocket 인터페이스의 결과 생성이 지연될 수 있음
WebSocket 인터페이스가 매우 긴 오디오 파일에 대한 인식 요청의 최종 결과를 생성하는 데 수 분이 소요될 수 있습니다. WebSocket 인터페이스의 경우 서비스가 응답을 준비하는 동안 기본 TCP 연결이 유휴 상태로 유지됩니다. 따라서 제한시간 초과로 인해 연결이 닫힐 수 있습니다. WebSocket 인터페이스가 제한시간 초과되지 않도록 하려면 요청을 시작하기 위한 \"interim_results\": \"true\" 메시지의 JSON에서 중간 결과를 요청하십시오(start). 필요하지 않은 경우 중간 결과를 버릴 수 있습니다. 이 문제는 향후 업데이트에서 해결됩니다.

2016년 1월 19일

새 비속어 필터링 기능
2016년 1월 19일에 이 서비스가 새로운 욕설 필터링 기능을 포함하도록 업데이트되었습니다. 기본적으로 이 서비스는 미국 영어 오디오의 텍스트 변환 결과에서 욕설을 검열합니다. 자세한 정보는 욕설 필터링을 참조하십시오.

2015년 12월 17일

새 키워드 발견 기능
이제 이 서비스가 키워드 발견 기능을 제공합니다. 입력 오디오에서 일치될 키워드 문자열의 배열을 지정할 수 있습니다. 단어가 키워드의 일치사항으로 간주되기 위해 충족해야 하는 사용자 정의 신뢰수준도 정의해야 합니다. 자세한 정보는 키워드 발견을 참조하십시오. 키워드 발견 기능은 베타 기능입니다.
새 단어 대안 기능
이제 이 서비스가 단어 대체 기능을 지원합니다. 이 기능은 사용자 정의 신뢰수준을 충족하는 입력 오디오의 단어에 대한 대체 가설을 리턴합니다. 자세한 정보는 단어 대체를 참조하십시오. 단어 대체 기능은 베타 기능입니다.
새 영국 영어 및 아랍어 모델
이 서비스는 텍스트 변환 모델에 더 많은 언어를 지원합니다(영국 영어에 대한 en-UK_BroadbandModelen-UK_NarrowbandModel과 현대 표준 아랍어에 대한 ar-AR_BroadbandModel). 자세한 정보는 이전 세대 언어 및 모델을 참조하십시오.
세션 기반 메소드에 대한 새 session_closed 필드
이제 이 서비스는 세션 기반 메소드의 오류에 대해 리턴하는 JSON 응답에 새로운 session_closed 필드도 포함합니다. 오류의 결과로 세션이 닫히는 경우 이 필드가 true로 설정됩니다. 각 메서드에서 발생할 수 있는 반환 코드에 대한 자세한 내용은 API 및 SDK 참조 문서를 참조하십시오.
HTTP 플랫폼 제한시간이 더 이상 적용되지 않음
HTTP 인식 요청에 10분 플랫폼 제한시간이 더 이상 적용되지 않습니다. 이제 이 서비스는 인식이 진행되는 동안 20초마다 응답 JSON 객체에 공백 문자를 전송하여 연결을 유지합니다. 자세한 정보는 제한시간을 참조하십시오.
curl 명령어를 사용한 속도 제한은 더 이상 필요하지 않습니다
curl 명령을 사용하여 이 서비스로 오디오를 텍스트 변환하는 경우 더 이상 --limit-rate 옵션을 사용하여 초당 40,000바이트보다 더 빠른 속도로 데이터를 전송할 필요가 없습니다.
HTTP 오류 코드에 대한 변경사항
이 서비스는 세션 기반 HTTP 메소드 GET /v1/sessions/{session_id}/observe_resultPOST /v1/sessions/{session_id}/recognize에 대해 HTTP 상태 코드 490을 더 이상 리턴하지 않으며 대신 HTTP 상태 코드 400으로 응답합니다.

2015년 9월 21일

새로운 모바일 SDK 사용 가능

두 개의 새 베타 모바일 SDK를 음성 서비스에 사용할 수 있습니다. SDK를 사용하면 모바일 애플리케이션에서 Speech to Text 및 Text to Speech 서비스 모두와 상호작용할 수 있습니다.

  • Google Android™ 플랫폼용 Watson Speech SDK는 사용자가 말하는 대로 이 오디오를 실시간으로 Speech to Text 서비스에 스트리밍하고 해당 오디오의 변환 내용을 수신하는 것을 지원합니다. 이 프로젝트에는 두 음성 서비스 모두와의 상호작용을 보여주는 예제 애플리케이션이 포함되어 있습니다. 이 SDK는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 speech-android-sdk 저장소에서 이용할 수 있습니다.
  • Apple® iOS 운영 체제용 Watson Speech SDK는 오디오를 Speech to Text 서비스에 스트리밍하고 응답으로 이 오디오에 대한 변환 내용을 수신하는 것을 지원합니다. 이 SDK는 GitHub 의 watson-developer-cloud 네임스페이스에 있는 speech-ios-sdk 저장소에서 이용할 수 있습니다.

두 SDK는 IBM Cloud 서비스 인증 정보 또는 인증 토큰 중 하나를 사용하여 음성 서비스로의 인증을 지원합니다. SDK는 베타이므로 나중에 변경될 수 있습니다.

새 브라질 포르투갈어 및 만다린 중국어 모델

이 서비스는 다음 모델을 통해 두 가지 새 언어인 브라질 포르투갈어와 만다린 중국어를 지원합니다.

  • 브라질 포르투갈어 광대역 모델(pt-BR_BroadbandModel)
  • 브라질 포르투갈어 협대역 모델(pt-BR_NarrowbandModel)
  • 만다린 중국어 광대역 모델(zh-CN_BroadbandModel)
  • 만다린 중국어 협대역 모델(zh-CN_NarrowbandModel)

자세한 정보는 이전 세대 언어 및 모델을 참조하십시오.

audio/ogg;codecs=opus 오디오 형식에 대한 새로운 지원

HTTP POST 요청 /v1/sessions/{session_id}/recognize/v1/recognize와 WebSocket /v1/recognize 요청은 Opus 코덱을 사용하는 Ogg 형식 파일에 대한 새 매체 유형 audio/ogg;codecs=opus의 텍스트 변환을 지원합니다. 또한 이러한 메소드에 대한 audio/wav 형식이 모든 인코딩을 지원합니다. 선형 PCM 인코딩 사용에 대한 제한사항이 제거되었습니다. 자세한 정보는 audio/ogg 형식을 참조하십시오.

긴 세션 폴링에 대한 새 sequence_id 매개변수

이제 이 서비스는 HTTP 인터페이스를 사용하여 긴 오디오 파일을 텍스트 변환할 때 제한시간 초과를 해결하도록 지원합니다. 세션을 사용할 때 GET /v1/sessions/{session_id}/observe_resultPOST /v1/sessions/{session_id}/recognize 메소드에 장기 수행 인식 태스크의 순서 ID를 지정하여 긴 폴링 패턴을 사용할 수 있습니다. 이러한 메소드의 새 sequence_id 매개변수를 사용하면 인식 요청을 제출하기 이전, 도중 또는 이후에 결과를 요청할 수 있습니다.

미국 영어 변환에 대한 새 대문자 표시 기능

이제 이 서비스는 미국 영어 언어 모델 en_US_BroadbandModelen_US_NarrowbandModel에 대해 많은 고유 명사를 올바르게 대문자로 시작합니다. 예를 들어, 이 서비스는 “barack obama graduated from columbia university” 대신 “Barack Obama graduated from Columbia University”라고 적힌 새로운 텍스트를 반환합니다. 애플리케이션이 어떤 방식으로든 고유 명사의 대소문자에 민감한 경우 이 변경사항에 관심이 있을 수 있습니다.

새 HTTP 오류 코드

HTTP DELETE /v1/sessions/{session_id} 요청은 상태 코드 415 “지원되지 않는 미디어 유형(Unsupported Media Type)”을 반환하지 않습니다. 이 리턴 코드는 메소드에 대한 문서에서 제거되었습니다.

2015년 7월 1일

Text to Speech 서비스가 GA(General Availability)됨

서비스는 2015년 7월 1일에 베타에서 GA(General Availability) 상태로 변경되었습니다. 베타 및 GA 버전의 Speech to Text API 간에 다음과 같은 차이가 있습니다. GA 릴리스에서는 사용자가 서비스의 새 버전으로 업그레이드해야 합니다.

GA 버전의 HTTP API는 베타 버전과 호환 가능합니다. 명시적으로 모델 이름을 지정한 경우에만 기존 애플리케이션 코드를 변경해야 합니다. 예를 들어, GitHub의 서비스에 사용 가능한 샘플 코드에는 demo.js 파일에 다음과 같은 코드 행이 포함되어 있습니다.

model: 'WatsonModel'

이 줄은 해당 서비스의 베타 버전에 대한 기본 모델 WatsonModel 을 지정합니다. 애플리케이션에서도 이 모델을 지정한 경우에는 GA 버전에서 지원되는 새 모델 중 하나를 사용하도록 변경해야 합니다. 자세한 정보는 다음 글머리 기호를 참조하십시오.

새 토큰 기반 프로그래밍 모델

이제 이 서비스가 WebSocket 연결을 통해 클라이언트와 서비스 간의 직접 상호작용을 위한 새 프로그래밍 모델을 지원합니다. 이 모델을 사용하여 클라이언트는 서비스와 직접 통신하기 위해 인증 토큰을 가져올 수 있습니다. 이 토큰을 사용하면 IBM Cloud의 서버 측 프록시 애플리케이션에서 클라이언트 대신 서비스를 호출할 필요가 없게 됩니다. 토큰은 클라이언트가 서비스와 상호작용하는 선호 수단입니다.

이 서비스는 서버 측 프록시에 의존하여 클라이언트와 서비스 간에 오디오 및 메시지를 릴레이하는 이전 프로그래밍 모델을 계속 지원합니다. 그러나 새 모델은 더욱 효율적이며 더 높은 처리량을 제공합니다.

음성 인식에 대한 새 model 매개변수

이제 POST /v1/sessionsPOST /v1/recognize 메소드가 WebSocket /v1/recognize 메소드와 함께 model 조회 매개변수를 지원합니다. 이 매개변수를 사용하여 오디오에 대한 다음 정보를 지정할 수 있습니다.

  • 언어: 영어, 일본어 또는 스페인어
  • 최소 샘플링 속도: 광대역(16kHz) 또는 협대역(8kHz)

자세한 정보는 이전 세대 언어 및 모델을 참조하십시오.

음성 인식에 대한 새 inactivity_timeout 매개변수

inactivity_timeout 매개변수는 서비스가 스트리밍 모드에서 무음(음성 없음)을 발견하는 경우 연결을 닫는 제한시간 값(초)을 설정합니다. 기본적으로 이 서비스는 30초 동안의 무음 후 세션을 종료합니다. POST /v1/recognize 및 WebSocket /v1/recognize 메소드는 이 매개변수를 지원합니다. 자세한 정보는 제한시간을 참조하십시오.

음성 인식에 대한 새 max_alternatives 매개변수

max_alternatives 매개변수는 오디오 텍스트 변환 내용에 가장 적합한 n개의 대체 가설을 리턴하도록 서비스에 지시합니다. POST /v1/recognize 및 WebSocket /v1/recognize 메소드는 이 매개변수를 지원합니다. 자세한 정보는 최대 대체 수를 참조하십시오.

음성 인식에 대한 새 word_confidence 매개변수

word_confidence 매개변수는 텍스트 변환의 각 단어에 대한 신뢰도 점수를 리턴하도록 서비스에 지시합니다. POST /v1/recognize 및 WebSocket /v1/recognize 메소드는 이 매개변수를 지원합니다. 자세한 정보는 단어 신뢰도를 참조하십시오.

음성 인식에 대한 새 timestamps 매개변수

timestamps 매개변수는 텍스트 변환의 각 단어에 대해 오디오 시작에 상대적인 시작 및 종료 시간을 리턴하도록 서비스에 지시합니다. POST /v1/recognize 및 WebSocket /v1/recognize 메소드는 이 매개변수를 지원합니다. 자세한 정보는 단어 시간소인을 참조하십시오.

결과 관찰을 위한 세션 메소드의 이름이 바뀜

이제 GET /v1/sessions/{session_id}/observeResult 메소드의 이름이 GET /v1/sessions/{session_id}/observe_result로 변경되었습니다. 이전 버전과의 호환성을 위해 observeResult라는 이름이 계속 지원됩니다.

WAV(Waveform Audio File) 오디오 형식에 대한 새 지원

이제 recognize 메소드의 Content-Type 헤더가 audio/flacaudio/l16 외에 WAV(Waveform Audio File) 파일에 대한 audio/wav을(를) 지원합니다. 자세한 정보는 audio/wav 형식을 참조하십시오.

음성 인식을 위한 최대 오디오 길이에 대한 한계

이제 이 서비스의 스트리밍 모드에서 세션당 데이터의 한계는 100MB입니다. Transfer-Encoding 헤더에 chunked 값을 지정하여 스트리밍 모드를 설정할 수 있습니다. 오디오 파일의 원샷(One-shot) 전달 시 전송되는 데이터에는 여전히 4MB의 크기 한계가 부과됩니다. 자세한 정보는 오디오 전송을 참조하십시오.

서비스 개선에 기여하지 않는 새 헤더

이제 GET /v1/sessions/{session_id}/observe_result, POST /v1/sessions/{session_id}/recognizePOST /v1/recognize 메소드에 헤더 매개변수 X-WDC-PL-OPT-OUT이 포함됩니다. 이 매개변수는 서비스가 향후 결과를 개선하기 위해 요청의 오디오 및 텍스트 변환 데이터를 사용하는지 여부를 제어합니다. WebSocket 인터페이스에 동등한 조회 매개변수가 포함되어 있습니다. 서비스가 오디오 및 텍스트 변환 결과를 사용하지 못하도록 하려면 1 값을 지정하십시오. 매개변수는 현재 요청에만 적용됩니다. 새 헤더가 베타 API의 X-logging 헤더를 대체합니다. Watson 서비스에 대한 요청 로깅 제어를 참조하십시오.

HTTP 오류 코드에 대한 변경사항

이제 이 서비스는 다음 HTTP 오류 코드로 응답할 수 있습니다.

  • /v1/models, /v1/models/{model_id}, /v1/sessions, /v1/sessions/{session_id}, /v1/sessions/{session_id}/observe_result, /v1/sessions/{session_id}/recognize/v1/recognize 메소드에 대한 오류 코드 415("지원되지 않는 매체 유형")가 추가되었습니다.
  • /v1/sessions/{session_id}/recognize 메서드에 대한 POSTGET 요청의 경우, 다음 오류 코드가 수정됩니다:
    • 오류 코드 404("Session_id를 찾을 수 없음")에 더 구체적인 메시지가 있습니다(POSTGET).
    • 오류 코드 503("세션이 이미 요청을 처리 중입니다. 동일한 세션에서 동시 요청이 허용되지 않습니다. 이 오류가 발생한 후 세션이 활성 상태로 남아 있습니다.")에 보다 구체적인 메시지가 있습니다(POST 한정).
    • POST/v1/sessions 메소드에 대한 HTTP /v1/recognize 요청에 대해 오류 코드 503("사용 불가능한 서비스")이 리턴될 수 있습니다. /v1/recognize 메서드를 사용하여 WebSocket 연결을 생성할 때도 이 오류 코드가 반환될 수 있습니다.