Notas sobre a liberação do Speech to Text para IBM Cloud Pak for Data

IBM Cloud Pak for Data

Os recursos e mudanças a seguir foram incluídos para cada liberação e atualização de instâncias instaladas ou no local do IBM Watson® Speech to Text para IBM Cloud Pak for Data. A menos que seja observado de outra forma, todas as alterações são compatíveis com liberações anteriores e são disponibilizadas de forma automática e transparente para todos os aplicativos novos e existentes.

Para obter informações sobre limitações conhecidas do serviço, consulte Limitações conhecidas.

Para obter informações sobre liberações e atualizações do serviço para IBM Cloud, consulte Notas sobre a liberação para Speech to Text para IBM Cloud.

30 de outubro de 2024 (Versão 4.8.7 )

A versão 4.8.7 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.7 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

25 de setembro de 2024 (Versão 5.0.3 )

A versão 5.0.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de agosto de 2024 (Versão 4.8.6 )

A versão 4.8.6 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.6 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de agosto de 2024 (Versão 5.0.2 )

A versão 5.0.2 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.2 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

31 de julho de 2024 (Versão 5.0.1 )

A versão 5.0.1 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.1 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

19 de junho de 2024 (Versão 5.0.0 )

A versão 5.0.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

24 de abril de 2024 (Versão 4.8.5 )

A versão 4.8.5 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.5 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

27 de março de 2024 (Versão 4.8.4 )

A versão 4.8.4 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.4 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de fevereiro de 2024 (Versão 4.8.3 )

A versão 4.8.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

31 de janeiro de 2024 (Versão 4.8.2 )

A versão 4.8.2 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.2 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

30 de novembro de 2023 (Versão 4.8.0 )

A versão 4.8.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

27 de setembro de 2023 (Versão 4.7.3 )

A versão 4.7.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de julho de 2023 (Versão 4.7.1 )

A versão 4.7.1 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.1 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

9 de junho de 2023 (Versão 4.7.0 )

A versão 4.7.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

2 de maio de 2023 (Versão 4.6.5)

A versão 4.6.5 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.6.5 já está disponível. Esta versão é compatível com as versões IBM Cloud Pak for Data 4.6.x e Red Hat OpenShift 4.10 e 4.12. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Novo modelo japonês de telefonia de próxima geração

O serviço agora oferece um modelo de telefonia de última geração para os japoneses: ja-JP_Telephony. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre modelos de última geração e baixa latência, consulte:

Customização de modelo de idioma melhorada para modelos de inglês e japonês da próxima geração

O serviço agora fornece customização de modelo de idioma aprimorada para modelos de inglês e japonês da próxima geração:

  • en-AU_Multimedia
  • en-AU_Telephony
  • en-IN_Telephony
  • en-GB_Multimedia
  • en-GB_Telephony
  • en-US_Multimedia
  • en-US_Telephony
  • ja-JP_Multimedia
  • ja-JP_Telephony

Melhorias visíveis para os modelos: a nova tecnologia melhora o comportamento padrão dos novos modelos inglês e japonês. Entre outras mudanças, a nova tecnologia otimiza o comportamento padrão para os seguintes parâmetros:

  • O padrão customization_weight para modelos customizados baseados nas novas versões desses modelos muda de 0.2 para 0.1.
  • O padrão character_insertion_bias para modelos personalizados que se baseiam nas novas versões desses modelos permanece 0.0, mas os modelos foram alterados, o que torna o parâmetro para reconhecimento de fala menos necessário.

Fazendo upgrade para os novos modelos: para aproveitar a tecnologia melhorada, deve-se fazer upgrade de quaisquer modelos de idioma customizados que sejam baseados nos novos modelos. Para fazer upgrade para a nova versão de um desses modelos básicos:

  1. Mude seu modelo customizado incluindo ou modificando uma palavra, corpus ou gramática customizada que o modelo contém. Qualquer mudança feita move o modelo para o estado ready.

  2. Use o método POST /v1/customizations/{customization_id}/train para reciclar o modelo novamente. O novo treinamento atualiza o modelo customizado para a nova tecnologia e move o modelo para o estado available..

    Problema conhecido: Atualmente, não é possível usar o método POST /v1/customizations/{customization_id}/upgrade_model para atualizar um modelo personalizado para um dos novos modelos básicos. Esse problema será resolvido em uma versão futura.

Usando os novos modelos: Após o upgrade para o novo modelo base, é aconselhável avaliar o desempenho do modelo customizado atualizado, prestando atenção especial aos parâmetros customization_weight e character_insertion_bias para reconhecimento de voz. Ao retreinar seu modelo customizado:

  • O modelo customizado usa o novo padrão customization_weight de 0.1 para seu modelo customizado.. Um site não padrão customization_weight que estava associado ao seu modelo personalizado é removido.
  • O modelo personalizado pode não exigir mais o uso do parâmetro character_insertion_bias para otimizar o reconhecimento de fala.

As melhorias na customização do modelo de linguagem tornam esses parâmetros menos importantes para reconhecimento de voz de alta qualidade:

  • Se você usar os valores padrão para esses parâmetros, continue a fazer isso após o upgrade Os valores padrão continuarão a oferecer os melhores resultados para o reconhecimento de fala.
  • Se você especificar valores não padrão para esses parâmetros, experimente os valores padrão após a atualização. Seu modelo customizado pode funcionar bem para o reconhecimento de voz com os valores padrão

Se você achar que usar valores diferentes para esses parâmetros pode melhorar o reconhecimento de voz com seu modelo customizado, experimente as mudanças incrementais para determinar se os parâmetros são necessários para melhorar o reconhecimento de voz.

Observação: No momento, os aprimoramentos na personalização do modelo de idioma se aplicam apenas aos modelos personalizados baseados nos modelos de idioma base em inglês ou japonês de última geração listados anteriormente. Com o tempo, as melhorias serão disponibilizadas para outros modelos de linguagem da próxima geração.

Mais informações: Para obter mais informações sobre a atualização e o reconhecimento de fala com esses parâmetros, consulte:

Nova variável de ambiente para recurso customizado de serviços do Speech

Agora, a documentação inclui instruções para criar uma variável de ambiente denominada ${CUSTOM_RESOURCE_SPEECH}. Anexe a nova variável ao script cpd_vars.sh e crie o script para usar a variável em seu ambiente. Para obter mais informações, consulte Informações necessárias para concluir esta tarefa em Instalando Watson Speech Servicesou consulte qualquer um dos tópicos de upgrade para os serviços Speech.

Correção de defeitos: Os modelos de telefonia sueca e multimídia italiana já estão disponíveis

Correção do defeito: os modelos de telefonia sueca (sv-SE_Telephony) e multimídia italiana (it-IT_Multimedia) agora estão disponíveis para instalação.. Anteriormente, eles não estavam disponíveis.

Correção de defeito: tempo de treinamento melhorado para modelos de idioma customizados da próxima geração

Correção de defeito: o tempo de treinamento para os modelos de idioma customizados da próxima geração agora foi significativamente melhorado Anteriormente, o tempo de treinamento demorava muito mais do que o necessário, conforme relatado para o treinamento de modelos de idioma customizados japoneses. O problema foi corrigido por uma correção interna..

Correção de defeito: os arquivos de gramática agora manipulam sequências de dígitos corretamente

Correção de defeito: quando gramáticas são usadas, o serviço agora manipula sequências mais longas de dígitos corretamente. Anteriormente, estava falhando ao concluir o reconhecimento ou retornar resultados incorretos.

Correção de defeito: arquivos de gramática gerados dinamicamente agora funcionam corretamente

Correção de defeito: arquivos de gramática gerados dinamicamente agora funcionam corretamente. Anteriormente, os arquivos de gramática dinâmica poderiam causar falhas internas, conforme relatado para integração do Speech to Text com IBM® watsonx™ Assistant. O problema foi corrigido por uma correção interna..

Correção de defeito: a formatação inteligente para datas em inglês dos EUA agora está correta

Correção de defeito: a formatação inteligente agora inclui corretamente dias da semana e datas quando ambos estão presentes no áudio falado, por exemplo, Tuesday February 28. Anteriormente, em alguns casos, o dia da semana era omitido e a data era apresentada incorretamente. A formatação inteligente é a funcionalidade beta.

Correção de defeito: atualizar a documentação para palavras de hesitação de fala para modelos de próxima geração

Correção de defeito: A documentação para palavras de hesitação de fala para modelos de última geração foi atualizada. Mais detalhes são fornecidos sobre as palavras de hesitação em inglês dos EUA e japonês. Os modelos de próxima geração incluem as palavras de hesitação reais nos resultados de transcrição, ao contrário dos modelos de geração anterior, que incluem apenas marcadores de hesitação.. Para obter mais informações, consulte hesitações e marcadores de hesitação da Speech.

Vulnerabilidades de segurança abordadas

As seguintes vulnerabilidades de segurança foram corrigidas:

29 de março de 2023 (Versão 4.6.4)

A versão 4.6.4 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.6.4 já está disponível. Esta versão é compatível com as versões IBM Cloud Pak for Data 4.6.x e Red Hat OpenShift 4.10 e 4.12. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.
Importante: Faça backup de seus dados antes de atualizar para a versão 4.6.3 ou 4.6.4
Importante: antes de atualizar para a versão 4.6.3 ou 4.6.4 dos serviços Watson Speech, é necessário fazer um backup dos seus dados. Preserve o backup em um local seguro.. Para obter mais informações sobre o backup dos dados dos serviços do Watson Speech, consulte Backup e restauração dos dados dos serviços Watson Speech em Administração dos serviços Watson Speech. Esse tópico também inclui informações sobre como restaurar seus dados se isso se tornar necessário.
Problema conhecido: Os modelos de telefonia sueca e multimídia italiana ainda não estão disponíveis
Problemas conhecidos: Os modelos sueco de telefonia ( sv-SE_Telephony ) e italiano de multimídia ( it-IT_Multimedia ) ainda não estão disponíveis. Eles foram disponibilizados na versão 4.6.5.
Correção de defeito: Agora é possível alterar os modelos e vozes instalados com as opções de instalação avançadas
Correção de defeito: durante a instalação, agora é possível especificar diferentes modelos ou vozes com as opções de instalação avançadas da interface da linha de comandos... Anteriormente, o serviço sempre instalava os modelos e as vozes padrão A limitação continua a ser aplicada para Watson versões de serviços do Speech 4.6.0, 4.6.2e 4.6.3. Para obter informações sobre como instalar modelos e vozes, consulte Especificando opções de instalação adicionais em Instalando o Watson Speech Services
Configurando tempos limites do balanceador de carga
Watson Os serviços de fala requerem que você mude as configurações de limite do balanceador de carga para o servidor e o cliente para 300 segundos. Essas configurações asseguram que as solicitações de reconhecimento de voz de longa duração, aquelas com áudio longo ou difícil, tenham tempo suficiente para serem concluídas Para obter mais informações, consulte Informações necessárias para concluir essa tarefa em Instalando o Watson Speech Services
Vulnerabilidades de segurança abordadas
As vulnerabilidades de segurança a seguir foram corrigidas:

23 de fevereiro de 2023 (Versão 4.6.3)

A versão 4.6.3 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.6.3 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e a versão Red Hat OpenShift 4.10. Red Hat OpenShift versão 4.8 não é mais suportado. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Importante: todos os modelos de geração anterior foram descontinuados e chegarão ao fim do serviço em 31 de julho de 2023

Importante: todos os modelos de geração anterior foram descontinuados e atingirão o término de serviço efetivo em 31 de julho de 2023 Nessa data, todos os modelos de geração anterior serão removidos do serviço e da documentação.. A data de reprovação anterior foi 3 de março de 2023 A nova data permite que os usuários tenham mais tempo para migrar para os modelos de próxima geração apropriados Mas os usuários devem migrar para o modelo de próxima geração equivalente até 31 de julho de 2023.

A maioria dos modelos de geração anterior foi descontinuada em 15 de março de 2022. Anteriormente, os modelos árabe e japonês não eram descontinuados.. A descontinuação agora se aplica a todos modelos de geração anterior.

Observação: quando o modelo en-US_BroadbandModel de geração anterior for retirado de serviço, o modelo en-US_Multimedia de próxima geração se tornará o modelo padrão para solicitações de reconhecimento de fala.

Problema conhecido: Não é possível alterar os modelos e vozes instalados com as opções avançadas de instalação

Problema conhecido: atualmente não é possível especificar diferentes modelos ou vozes com as opções de instalação avançadas. O serviço sempre instala os modelos e as vozes padrão Para obter informações sobre como alterar os modelos após a instalação, consulte Atualizando modelos e vozes para seus serviços do Watson Speech no tópico Administração de Watson Serviços de fala em IBM Cloud Pak for Data..

Problema conhecido: o upgrade para a versão 4.6.3 pode falhar ao ser concluído

Problema conhecido: ao fazer upgrade para a versão 4.6.3, a tarefa de backup do MinIO pode falhar ao ser excluída na conclusão. Se isso ocorrer, a solução será excluir a tarefa, após a qual o upgrade continuará normalmente Execute as etapas a seguir para resolver o problema.

  1. Para determinar se a tarefa de backup MinIO permanece não excluída, emita o comando a seguir:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    A tarefa MinIO que não é excluída é identificada por uma entrada do seguinte formato:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Para excluir a tarefa de backup MinIO, emita o comando a seguir:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Quando a tarefa de backup for excluída, o upgrade continuará e será concluído.

Correção de defeito: Atualizar o modelo de telefonia da próxima geração do Canadá francês (upgrade necessário)

Correção de defeito: o modelo de telefonia da próxima geração do Canadá francês, fr-CA_Telephony, foi atualizado para abordar uma inconsistência interna que poderia causar um erro durante o reconhecimento de voz. É necessário fazer o upgrade de qualquer modelo personalizado que se baseie no modelo fr-CA_Telephony. Para obter mais informações sobre o upgrade de modelos personalizados, consulte

Correção de defeitos: O modelo multimídia em português brasileiro da próxima geração já está disponível

Correção de defeito: o modelo de multimídia em português do Brasil da próxima geração agora está disponível para Speech to Text para IBM Cloud Pak for Data. Anteriormente, o modelo estava indisponível

Incluir palavras diretamente em modelos customizados que são baseados em modelos de próxima geração aumenta o tempo de treinamento

Incluir palavras customizadas diretamente em um modelo customizado que é baseado em um modelo de próxima geração faz com que o treinamento de um modelo leve alguns minutos a mais do que seria de outra forma. Se você estiver treinando um modelo com palavras customizadas incluídas usando o método POST /v1/customizations/{customization_id}/words ou PUT /v1/customizations/{customization_id}/words/{word_name}, permita alguns minutos de tempo de treinamento extra para o modelo. Para obter mais informações, consulte

Informações adicionais sobre como trabalhar com instâncias de serviço

A documentação agora inclui informações sobre como criar uma instância de serviço com a interface da linha de comandos (cpl-cli) e sobre como gerenciar instâncias de serviço. Para obter mais informações, consulte os tópicos a seguir de serviços do Watson Speech em IBM Cloud Pak for Data:

  • Criando uma instância de serviços do Watson Speech em Configuração de pós-instalação
  • Gerenciando suas instâncias do Watson Speech Services em Administrando
Vulnerabilidade de segurança abordada

A seguinte vulnerabilidade de segurança foi corrigida:

30 de janeiro de 2023 (Versão 4.6.2)

A versão 4.6.2 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.6.2 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e as versões Red Hat OpenShift 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

O recurso personalizado agora inclui uma nova propriedade fileStorageClass

O recurso personalizado para os serviços do Watson Speech agora inclui uma propriedade fileStorageClass além da propriedade blockStorageClass existente. Você especifica as classes de armazenamento de blocos e de arquivo quando instala ou faz o upgrade de um serviço. Durante o upgrade a partir de uma versão anterior, a nova propriedade é adicionada automaticamente ao recurso personalizado pela opção --file_storage_class no comando cli manage apply-cr.

Para obter mais informações sobre as classes de armazenamento disponíveis e de armazenamento de arquivos você usa com cada uma das soluções de armazenamento suportadas, consulte a tabela de Requisitos de armazenamento sob Informações que você precisa para completar esta tarefa na página "Instalando os serviços de Speech Watson " em Watson Discursos de Speech em IBM Cloud Pak for Data.

Informações adicionais sobre provimento de uma instância de serviço

A documentação agora inclui informações sobre a criação de uma instância de serviço programaticamente. Ele também inclui exemplos de instâncias de serviço de listagem e exclusão de uma instância de serviço. Para obter mais informações, consulte Criando uma instância de serviços do Watson Speech na documentação de Configuração de pós-instalação no Watson Serviços do Speech em IBM Cloud Pak for Data.

A criptografia do lado do servidor está ativada para o armazenamento de dados MinIO

O Speech services agora habilitou a criptografia do lado do servidor para armazenamento de objetos no armazenamento de dados MinIO. Nenhuma ação é necessária à sua parte.

Alterar para auditar webhooks

Os Serviços de Fala agora removeram a dependência do webhook de auditoria. Os serviços agora gravam eventos de auditoria diretamente para o servidor. Após a atualização para a versão 4.6.2, alguns recursos do webhook podem permanecer até que todos os serviços possam remover a dependência. Os recursos restantes serão removidos em uma futura liberação. Nenhuma ação é necessária à sua parte.

Novo modelo multimídia holandês de última geração holandesa

O serviço agora oferece um modelo multimídia de última geração para o holandês holandês: nl-NL_Multimedia. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre modelos de última geração e baixa latência, consulte

Novo modelo sueco de telefonia de próxima geração

O serviço agora oferece um modelo de telefonia de última geração para os suecos: sv-SE_Telephony. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre modelos de última geração e baixa latência, consulte

Atualizações dos modelos de telefonia de próxima geração em inglês

Os modelos de telefonia de próxima geração em inglês foram atualizados para melhorar o reconhecimento de fala:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Todos esses modelos continuam a apoiar a baixa latência. Não é necessário fazer upgrade de modelos customizados que são baseados nesses modelos. Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.

O parâmetro max_alternatives agora está disponível para uso com modelos de próxima geração

O parâmetro max_alternatives agora está disponível para uso com todos os modelos de próxima geração. O parâmetro está geralmente disponível para todos os modelos de última geração. Para obter mais informações, consulte Alternativas máximas.

Correção de defeitos: Permitir uso de ambos os parâmetros max_alternatives e end_of_phrase_silence_time com modelos de próxima geração

Correção de defeito: ao usar os dois parâmetros max_alternatives e end_of_phrase_silence_time na mesma solicitação com modelos de próxima geração, o serviço agora retorna várias transcrições alternativas enquanto também respeita o intervalo de pausa indicado. Anteriormente, o uso dos dois parâmetros em uma única solicitação gerou uma falha. (O uso do parâmetro max_alternatives com modelos de última geração já estava disponível anteriormente como um recurso experimental para um número limitado de clientes.)

Correção de defeito: Atualização em modelo multimídia de última geração japonesa (upgrade necessário)

Defeito corrigido: O modelo multimídia de última geração japonesa, ja-JP_Multimedia, foi atualizado para tratar de uma inconsistência interna que poderia causar um erro durante o reconhecimento de fala com baixa latência. É necessário fazer o upgrade de qualquer modelo personalizado que se baseie no modelo ja-JP_Multimedia. Para obter mais informações sobre o upgrade de modelos personalizados, consulte

Correção de defeitos: Adicionar diretrizes de documentação para criação de sons japoneses-curtidas com base em modelos de próxima geração

Correção de defeitos: Em sons-curtidas para modelos de linguagem personalizada japonesa que são baseados em modelos de próxima geração, a sequência de caracteres ウー é ambígua em alguns contextos de esquerda. Não use caracteres (sílabas) que terminam com o fonema /o/, tais como e . Em tais casos, use ウウ ou apenas em vez de ウー. Por exemplo, use ロウウマン ou ロウマン em vez de ロウーマン. Para obter mais informações, consulte Diretrizes para o Japão.

Correção de defeito: Uso correto do campo display_as em resultados de transcrição

Correção de defeitos: Para personalização de modelo de linguagem com modelos de próxima geração, o valor do campo display_as para uma palavra personalizada agora aparece em todas as transcrições. Anteriormente, o valor do campo word às vezes aparecia em resultados de transcrição.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

30 de novembro de 2022 (Versão 4.6.0)

A versão 4.6.0 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.6.0 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e as versões Red Hat OpenShift 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Amazon Web Services (AWS) agora é suportado

Watson Os serviços de Speech para IBM Cloud Pak for Data agora são suportados em Amazon Web Services™ (AWS™). Os serviços suportam a Amazon Elastic Block Store, que você especifica configurando a propriedade blockStorageClass do recurso personalizado dos serviços Speech para gp2-csi ou gp3-csi.

Novas classes de armazenamento agora são suportadas

Watson Os serviços de Speech para IBM Cloud Pak for Data agora suportam duas classes de armazenamento adicionais:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Você especifica a classe de armazenamento com a propriedade blockStorageClass do recurso personalizado de serviços Speech. Para obter mais informações sobre todas as classes de armazenamento suportadas, veja os tópicos a seguir em Watson Discurso de serviços em IBM Cloud Pak for Data:

  • Antes de começar em Instalando os serviços do Watson Speech
  • Especificando uma classe de armazenamento em Usando o recurso personalizado de serviços Watson Speech
Problema conhecido: Alguns pods de serviços do Watson Speech não possuem anotações que são usadas para agendamento

Conhecida questão: Alguns pods de serviços do Watson Faltam estão faltando a anotação cloudpakInstanceId. Se você usar o serviço de agendamento IBM Cloud Pak for Data, quaisquer pods de serviços Watson Speech sem a anotação cloudpakInstanceId são

  • Agendado pelo planejador padrão Kubernetes em vez do serviço de agendamento
  • Não incluído na aplicação da quota
O monitoramento do armazenamento de dados PostgreSQL agora está disponível

Agora é possível ativar o monitoramento do armazenamento de dados do PostgreSQL para receber atualizações sobre seu uso e status pelos serviços do Watson Speech. Os eventos podem ser consumidos pelo software de monitoramento Prometheus ou qualquer que seja o aplicativo que você use para monitoramento. Ao ativar o monitoramento para projetos definidos pelo usuário, além do monitoramento da plataforma padrão, é possível monitorar seus próprios projetos com a pilha de monitoramento Red Hat® OpenShift® Container Platform. Esta capacidade inclui uma propriedade adicional, spec.global.datastores.postgressql.enablePodMonitor, no recurso personalizado de serviços Speech.

Para obter mais informações, consulte o tópico Monitorando o armazenamento de dados PostgreSQL para os serviços de Watson Speech na seção Administrando de Watson Discursos de Speech em IBM Cloud Pak for Data.

Correção de defeito: o armazenamento de dados do PostgreSQL não é mais instalado se apenas os microserviços de tempo de execução estiverem ativados

Defeito corrigido: O armazenamento de dados PostgreSQL não é mais instalado se apenas os microserviços de tempo de execução estiverem ativados. O armazenamento de dados agora é instalado apenas se pelo menos um dos microserviços sttAsync, sttCustomization ou ttsCustomization estiver instalado. PostgreSQL não é desinstalado se em uma data posterior esses microserviços forem desativados.

Antes da versão 4.6.0, o PostgreSQL foi sempre instalado com os serviços Speech. Se você é um cliente existente que usou apenas os microserviços de tempo de execução dos serviços do Speech antes da versão 4.6.0, o PostgreSQL permanece instalado mas não é usado. Neste caso, a instalação do PostgreSQL persiste através de upgrades.

O armazenamento de dados MinIO é sempre instalado porque os microserviços de tempo de execução dependem dele. O armazenamento de dados RabbitMQ é instalado apenas se o microserviço sttAsync estiver instalado.

Para obter mais informações, consulte Propriedades do Datastore em Usando o recurso personalizado de serviços Watson Speech em Watson Discurso de serviços em IBM Cloud Pak for Data.

Correção de defeito: A criação de uma Política de Rede não é mais necessária para que o operador PostgreSQL monitore seus operandos

Defeito corrigido: Para a versão 4.6.0, não é necessário criar uma Política de Rede para permitir que o operador PostgreSQL monitore seus operandos, conforme descrito na atualização de serviço 10 de novembro de 2022(Versões 4.0.x e 4.5.x). A partir da versão 4.6.0, o serviço manipula essa situação automaticamente.

Correção de defeito: Alguns modelos de última geração foram atualizados para melhorar o tempo de resposta de baixa latência

Defeito corrigido: Os modelos de próxima geração de próxima geração foram atualizados para melhorar seu tempo de resposta quando o parâmetro low_latency é usado:

  • en-IN_Telephony
  • hi-IN_Telephony
  • it-IT_Multimedia
  • nl-NL_Telephony

Anteriormente, esses modelos não retornaram resultados de reconhecimento tão rapidamente quanto o esperado quando o parâmetro low_latency foi usado. Não é necessário fazer upgrade de modelos customizados que são baseados nesses modelos. Para obter mais informações sobre todos os modelos de última geração disponíveis, consulte Idiomas e modelos de última geração.

Correção de defeito: Melhorar a documentação de nomenclatura do modelo personalizado

Defeito corrigido: A documentação agora fornece regras detalhadas para nomear modelos de linguagem personalizados e modelos acústicos personalizados. Para obter mais informações, consulte

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

10 de novembro de 2022 (Versões 4.0.x e 4.5.x)

Problema conhecido: Política de Rede Atualizada necessária para o operador PostgreSQL

Questão conhecida: Para a versão de serviços Speech 4.0.x (não incluindo a versão 4.0.0) e 4.5.x, se o operador PostgreSQL e os serviços Speech estão instalados em diferentes espaços de nomes, o operador PostgreSQL não é capaz de monitorar os operandos do PostgreSQL para os serviços do Speech. O operador é impedido de monitorar os operandos pela Política de Rede que está em vigor para os serviços do Discurso.

Este problema não impede que o cluster PostgreSQL funcione corretamente. O cluster permanece ativo e totalmente funcional. No entanto, o operador não é capaz de atualizar os operandos quando você se atualizar para novas versões dos serviços do Speech.

A solução para o problema é criar uma Política de Rede adicional para o operador PostgreSQL, conforme mostrado nas etapas a seguir. Você pode executar as etapas independentemente de se o operador PostgreSQL é instalado no mesmo espaço de nomes dos serviços do Speech ou em um namespace diferente.

  1. Faça login como administrador do projeto Red Hat® OpenShift® onde os serviços Speech estão instalados.

  2. Digite o seguinte comando para atualizar a Política de Rede para os serviços do Speech:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    em que

    • <custom-resource-name> é o nome do recurso personalizado de serviços de fala. O nome recomendado para a versão 4.0.x é speech-prod-cr; o nome recomendado para a versão 4.5.x é speech-cr.
    • <cpd-instance-name> é o nome do projeto (namespace) no qual os serviços do Speech estão instalados. A documentação utiliza a variável de ambiente ${PROJECT_CPD_INSTANCE} para identificar o espaço de nomes.
  3. Para verificar se a Política de Rede atualizada permite que o operador monitore os operandos e que o cluster do PostgreSQL esteja em um estado saudável, digite o seguinte comando, em que <custom-resource-name> e <cpd-instance-name> são os valores que utilizou na etapa anterior:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Se o cluster PostgreSQL estiver funcionando adequadamente, o comando produz saída similar ao seguinte:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Essas etapas não fazem com que o operador atualize os operandos para as versões mais recentes. No entanto, os operandos são atualizados conforme o esperado quando você faz a próxima atualização do software de serviços Speech.

13 de outubro de 2022 (Versão 4.5.3)

A versão 4.5.3 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.5.3 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Eventos de auditoria estão disponíveis para os serviços do Speech

O Serviço de Logging de Auditoria IBM Cloud Pak for Data Gera e encaminha eventos de auditoria para os serviços Speech to Text e Text to Speech. Os eventos de auditoria correspondem aos que estão disponíveis para o Activity Tracker com o serviço público. Para obter mais informações, consulte Eventos de auditoria.

Não é possível desinstalar componentes do serviço Speech individual

A documentação agora observa que não é possível desinstalar componentes de serviços individuais (microserviços) uma vez que eles estejam instalados. Para remover qualquer um dos componentes a seguir, você deve desinstalar os serviços Watson Speech em sua totalidade e reinstalar apenas os componentes necessários: Speech to Text tempo de execução, Speech to Text HTTP assíncrono, Speech to Text personalização, Text to Speech tempo de execução e Text to Speech personalização. Para obter mais informações sobre a instalação dos serviços de fala, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Novo modelo multimídia de última geração canadense

O serviço agora oferece um modelo multimídia de última geração para o franco-canadense: fr-CA_Multimedia. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre modelos de última geração e baixa latência, consulte

Atualizações dos modelos de telefonia de próxima geração em inglês

Os modelos de telefonia de próxima geração em inglês foram atualizados para melhorar o reconhecimento de fala:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Todos esses modelos continuam a apoiar a baixa latência. Não é necessário fazer upgrade de modelos customizados que são baseados nesses modelos. Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.

O modelo multimídia italiano de última geração agora suporta baixa latência

O modelo de multimídia de última geração italiana, it-IT_Multimedia, agora suporta baixa latência. Para obter mais informações sobre modelos de última geração e baixa latência, consulte

Solução de resolução de problemas da versão 4.0.x para a versão 4.5.x

Ao fazer o upgrade dos serviços do Speech da versão 4.0.x para a versão 4.5.x, você pode encontrar um problema onde os pods PostgreSQL ficam presos no estado Terminating. Se esse problema ocorrer durante o seu upgrade, execute as seguintes etapas para resolver o problema. As informações e as etapas também estão documentadas em Upgradando Watson Speech services da Versão 4.0 para a Versão 4.5 no tópico Upgradin de Watson Discurso de serviços em IBM Cloud Pak for Data.

  1. Utilize o seguinte comando para identificar pods que permanecem no estado Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Use o seguinte comando para configurar a variável de ambiente pods para incluir a lista de pods que permanecem no estado Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'})
  1. Use o seguinte comando para excluir os pods presos para que o processo de atualização possa continuar:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
Correção de defeitos: Documentação de entradas de recursos personalizados da Fix

Defeito corrigido: A documentação para o recurso personalizado de serviços Speech agora inclui colons após os nomes dos modelos koKrTelephony e nlNlTelephony. Anteriormente, a documentação para essas duas entradas omitiu os colons.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

19 de agosto de 2022 (Versão 4.5.1)

Importante: Data de reprovação para a maioria dos modelos de geração anterior é agora 3 de março de 2023

Substituído: este aviso de descontinuação é substituído pela atualização de serviço de 23 de fevereiro de 2023 A data de término de serviço para todos os modelos de geração anterior agora é 31 de Julho de 2023

Em 15 de março de 2022, os modelos da geração anterior para todos os idiomas, exceto o árabe e o japonês, foram descontinuados. Nessa época, os modelos reprovados iam permanecer disponíveis até 15 de setembro de 2022. Para permitir que os usuários tenham mais tempo para migrar para os modelos de próxima geração apropriados, os modelos descontinuados agora permanecerão disponíveis até 3 de março de 2023 Assim como com o aviso de descontinuação inicial, os modelos de geração anterior em árabe e japonês não foram descontinuadas Para obter uma lista completa de todos os modelos descontinuados, consulte a atualização de serviço 15 de março de 2022(Versão 4.0.6).

No dia 3 de março de 2023, os modelos reprovados serão retirados do serviço e da documentação. Se você usar qualquer um dos modelos obsoletos, deverá migrar para o modelo equivalente de próxima geração até 3 de março de 2023.

Observação: quando o modelo en-US_BroadbandModel de geração anterior for retirado de serviço, o modelo en-US_Multimedia de próxima geração se tornará o modelo padrão para solicitações de reconhecimento de fala.

3 de agosto de 2022 (Versão 4.5.1)

A versão 4.5.1 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.5.1 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Suporte para clusters habilitados pelo sistema

Ambos Speech to Text para IBM Cloud Pak for Data e Text to Speech para IBM Cloud Pak for Data agora suportam rodar em clusters ativados pelo Federal Information Processing Standard (Estados Federais de Processamento de Informações). Para obter mais informações, consulte Serviços que suportam o SSL.

Correção de defeitos: Cálculos de armazenamento efêmeros de correção para evitar despejos de podas ocasionais

Correção de defeitos: Um defeito foi fixo e o cálculo de limites de armazenamento efêmeros é agora mais preciso para o Speech to Text para IBM Cloud Pak for Data e Text to Speech para IBM Cloud Pak for Data runtimes. Essas alterações previnem despejos de poda ocasionais quando os tempos de execução dos serviços estão sob carga pesada.

Correção de defeito: Atualização de hesitações de fala e documentação de marcadores de hesitação

Correção de defeitos: A documentação para hesitações de fala e marcadores de hesitação foi atualizada. Os modelos de geração anterior incluem marcadores de hesitação no lugar de hesitações de fala em resultados de transcrição para a maioria das línguas; formatação inteligente remove marcadores de hesitação das transcrições finais inglesas dos EUA. Os modelos de última geração incluem as hesitações da fala real em resultados de transcrição; a formatação inteligente não tem efeito sobre a sua inclusão em resultados finais de transcrição.

Para obter mais informações, consulte:

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

29 de junho de 2022 (Versão 4.5.0)

A versão 4.5.0 já está disponível

Speech to Text para a versão IBM Cloud Pak for Data 4.5.0 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Serviços de Discurso Unificado para a documentação IBM Cloud Pak for Data

A documentação de instalação e administração para ambos Speech to Text e Text to Speech é agora combinada na documentação do IBM Cloud Pak for Data. Para mais informações sobre como instalar e gerenciar os serviços do Speech, consulte Watson Discurso de serviços em IBM Cloud Pak for Data.

Mudanças no recurso personalizado dos serviços Speech

O recurso personalizado agora é criado quando você instala inicialmente os serviços do Speech. O processo é descrito na documentação de instalação do IBM Cloud Pak for Data. O conteúdo do recurso personalizado mudou:

  • O nome recomendado do recurso personalizado mudou de speech-prod-cr para speech-cr.
  • Todas as referências à classe de armazenamento mudaram de variantes de storageClass para blockStorageClass.
  • O nome da classe de armazenamento do bloco Portworx mudou de portworx-shared-gp3 para portworx-db-gp3-sc.
  • A propriedade createSecret foi removida para os datastores MinIO e PostgreSQl. A propriedade é usada apenas internamente. O Discurso serviços sempre usa um objeto de segredos se você criar um, e eles sempre criam automaticamente o objeto se nenhum for fornecido.
Objeto de segredos fornecido pelo usuário agora suportado para o armazenamento de dados RabbitMQ

Agora é possível fornecer credenciais de segurança para o armazenamento de dados RabbitMQ, assim como você pode para os datastores MinIO e PostgreSQL. O processo documentado é semelhante para todos os três datastores.

Novo modelo de última geração it-IT_Multimedia italiano

Agora o serviço oferece um modelo multimídia de última geração para o italiano: it-IT_Multimedia. O novo modelo está geralmente disponível. Ele não suporta baixa latência, mas suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre todos os modelos de última geração disponíveis, consulte Idiomas e modelos de última geração.

Modelos de telefonia e multimídia de última geração atualizados para o coreano

Os modelos de última geração existentes para coreano foram atualizados:

  • O modelo ko-KR_Telephony foi atualizado para melhor suporte de baixa latência para reconhecimento de voz.
  • O modelo ko-KR_Multimedia foi atualizado para reconhecimento de voz melhorado. Agora o modelo suporta também baixa latência.

Ambos os modelos estão geralmente disponíveis e ambos suportam customização e gramáticas do modelo de idioma. Não é necessário fazer upgrade de modelos de idioma customizados que são baseados nesses modelos. Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.

Atualizações para vários modelos de telefonia de última geração

Os seguintes modelos de telefonia em inglês de última geração foram atualizados para melhorar o reconhecimento de fala:

  • en-AU_Telephony
  • en-GB_Telephony
  • en-IN_Telephony
  • en-US_Telephony

Não é necessário fazer upgrade de modelos customizados que são baseados nesses modelos. Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.

Correção de defeito: as pontuações de confiança são agora relatadas para todos os resultados de transcrição

Correção de defeito: as pontuações de confiança são agora relatadas para todos os resultados de transcrição. Anteriormente, quando o serviço retornava várias transcrições para uma única solicitação de reconhecimento de voz, as pontuações de confiança poderiam não ser retornadas para todas as transcrições.

Vulnerabilidades de segurança abordadas

Não foram corrigidas vulnerabilidades de segurança para a versão 4.5.0.

25 de maio de 2022 (Versão 4.0.9)

A versão 4.0.9 já está disponível

O Speech to Text para IBM Cloud Pak for Data versão 4.0.9 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Novo modelo de última geração pt-BR_Multimedia para português brasileiro

O serviço agora oferece um modelo multimídia de última geração para português brasileiro: pt-BR_Multimedia. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma. Para obter mais informações sobre os modelos de última geração e baixa latência, consulte

Atualize para o modelo de última geração de-DE_Multimedia alemão para suportar baixa latência

O modelo alemão de última geração de-DE_Multimedia agora suporta baixa latência. Não é necessário fazer upgrade de modelos customizados que sejam baseados no modelo base alemão atualizado. Para obter mais informações sobre os modelos de última geração e baixa latência, consulte

Novo parâmetro character_insertion_bias beta para modelos de última geração

Todos os modelos de última geração agora suportam um novo parâmetro beta, character_insertion_bias, que está disponível com todas as interfaces de reconhecimento de voz. Por padrão, o serviço é otimizado para cada modelo individual para equilibrar o reconhecimento de sequências de caracteres candidatas de comprimentos diferentes. O viés específico do modelo é equivalente a 0,0. O viés padrão de cada modelo é suficiente para a maioria das solicitações de reconhecimento de voz.

No entanto, determinados casos de uso podem se beneficiar do favorecimento de hipóteses com sequências de caracteres mais curtas ou mais longas. O parâmetro aceita valores entre -1,0 e 1,0 que representam uma mudança a partir do padrão de um modelo. Valores negativos instruem o serviço a favorecer sequências de caracteres mais curtas. Valores positivos instruem o serviço a favorecer sequências de caracteres mais longas. Para obter mais informações, consulte Viés de inserção de caracteres.

Os serviços do Speech não suportam o utilitário de backup e restauração do OADP.

Os serviços do Watson Speech não suportam o utilitário de backup e restauração IBM Cloud Pak for Data OpenShift APIs for Data Protection (OADP). Se os serviços do Speech estiverem instalados em um cluster, não será possível usar o utilitário de backup e restauração IBM Cloud Pak for Data OADP para fazer backup de outros serviços instalados naquele cluster. Essa limitação aplica-se à versão 4.0.0 e mais recentes dos serviços do Speech.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

1º de maio de 2022 (Versão 1.2.x)

Importante: término de serviço para o Speech to Text versão 1.2.x no IBM Cloud Pak for Data versão 3.5
Importante: o Speech to Text versão 1.2.x no IBM Cloud Pak for Data versão 3.5 está fora de serviço a partir de 1º de maio de 2022. O Speech to Text versão 1.2.x não é mais suportado, disponível ou documentado. Para obter mais informações sobre o término de serviço para o Speech to Text, que faz parte do Watson API Kit, consulte Descontinuação de suporte de software: IBM Watson API Kit for IBM Cloud Pak for Data 1.2.x.

27 de abril de 2022 (Versão 4.0.8)

A versão 4.0.8 já está disponível

O Speech to Text for IBM Cloud Pak for Data versão 4.0.8 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Novas variáveis de ambiente usadas na documentação do IBM Cloud Pak for Data

A maioria dos comandos na documentação do Speech to Text para IBM Cloud Pak for Data foram atualizados para usar um conjunto comum de variáveis de ambiente. A documentação fornece um script para exportar automaticamente as variáveis de ambiente antes de executar comandos de instalação, upgrade e administração. Depois de extrair o script, é possível copiar a maioria dos comandos da documentação e executá-los sem fazer nenhuma mudança.

As variáveis de ambiente que o script define incluem o seguinte:

  • ${PROJECT_CPD_INSTANCE} identifica o projeto em que você planeja instalar o IBM Cloud Pak for Data e os serviços do Speech.
  • ${PROJECT_CPD_OPS} identifica o projeto para o operador da plataforma IBM Cloud Pak for Data.
  • ${PROJECT_CPFS_OPS} identifica o projeto para o IBM Cloud Pak for Data foundational services.

Para obter mais informações sobre o uso das variáveis de ambiente, consulte Melhor prática: Configurando variáveis de instalação.

A propriedade ttsVoiceMarginalCPU não é mais documentada

A propriedade ttsVoiceMarginalCPU foi removida da documentação para o recurso customizado dos serviços do Speech. A propriedade gerencia a compensação entre simultaneidade e velocidade de síntese de discurso. O valor padrão de 400 garante um balanceamento razoável para a maioria dos clientes e mantém a síntese em tempo real.

Novo modelo multimídia alemão de última geração

Agora o serviço oferece um modelo multimídia de última geração para o alemão: de-DE_Multimedia. O novo modelo está geralmente disponível. Ele não suporta baixa latência. Ele suporta a customização e gramáticas de modelo de idioma como funcionalidade de disponibilidade geral.

Para obter mais informações sobre todos os modelos de última geração disponíveis e seu suporte de customização, consulte

Agora o modelo beta de última geração en-WW_Medical_Telephony suporta baixa latência

Agora o modelo beta de última geração en-WW_Medical_Telephony suporta baixa latência. Para obter mais informações sobre todos os modelos de última geração e baixa latência, consulte

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

8 de abril de 2022 (Versão 4.0.7)

O suporte para pronúncias agora é documentado para modelos customizados com base em modelos de última geração

Para modelos de idioma customizados que são baseados em modelos de última geração, o suporte agora é documentado para especificações de pronúncias para palavras customizadas. O suporte para pronúncias já está disponível desde o final de 2021.

Diferenças existem entre o uso do campo sounds_like para modelos customizados que são baseados em modelos de última geração e de geração anterior. Para obter mais informações sobre o uso do campo sounds_like com modelos customizados que são baseados em modelos de última geração, consulte Trabalhando com palavras customizadas para modelos de última geração.

Importante: o parâmetro customization_id descontinuado foi removido da documentação

Importante: em 09 de outubro de 2018, o parâmetro customization_id de todas as solicitações de reconhecimento de voz foi descontinuado e substituído pelo parâmetro language_customization_id. O parâmetro customization_id agora foi removido da documentação para os métodos de reconhecimento de voz:

  • /v1/recognize para solicitações do WebSocket
  • POST /v1/recognize para solicitações de HTTP síncronas (incluindo solicitações com múltiplas partes)
  • POST /v1/recognitions para solicitações de HTTP assíncronas

Nota: se você usar os SDKs do Watson, assegure-se de ter atualizado qualquer código de aplicativo para usar o parâmetro language_customization_id em vez do parâmetro customization_id. O parâmetro customization_id não estará mais disponível a partir dos métodos equivalentes dos SDKs a partir da sua próxima liberação principal. Para obter mais informações sobre os métodos de reconhecimento de fala, consulte a referência API & SDK.

30 de março de 2022 (Versão 4.0.7)

A versão 4.0.7 já está disponível

O Speech to Text para IBM Cloud Pak for Data versão 4.0.7 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Propriedade de recurso customizado para especificação de um modelo padrão

A voz padrão para solicitações de reconhecimento de voz é en-US_BroadbandModel. Se você não instalar o en-US_BroadbandModel, deverá

  • Use o parâmetro model para passar a voz que deve ser usada com cada solicitação.
  • Especifique um novo modelo padrão para a sua instalação do Speech to Text para IBM Cloud Pak for Data usando a propriedade defaultSTTModel no recurso customizado de serviços de fala. Para mais informações, consulte Instalando Watson Speech to Text e Usando o modelo padrão.
Atualizações para os modelos multimídia de última geração em inglês e francês para suportar baixa latência

Os modelos de multimídia a seguir foram atualizados para suportar baixa latência:

  • Inglês australiano: en-AU_Multimedia
  • Inglês do Reino Unido: en-GB_Multimedia
  • Inglês dos EUA: en-US_Multimedia
  • Francês: fr-FR_Multimedia

Não é preciso atualizar modelos de idioma customizados que são construídos sobre esses modelos de base. Para obter mais informações sobre os modelos de última geração e baixa latência, consulte

Novo modelo multimídia de última geração em espanhol castelhano

Agora o serviço oferece um modelo multimídia de última geração para espanhol castelhano: es-ES_Multimedia. O novo modelo suporta baixa latência e está geralmente disponível. Ele também suporta customização e gramáticas de modelo de idioma.

Para obter mais informações sobre todos os modelos de última geração disponíveis e seu suporte de customização, consulte

O modelo en-WW_Medical_Telephony beta de última geração agora suporta a formatação inteligente

O modelo en-WW_Medical_Telephony beta de última geração agora suporta o parâmetro smart_formatting para áudio em inglês dos EUA. Para obter mais informações sobre os modelos de última geração, consulte Idiomas e modelos de última geração

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

17 de março de 2022 (Versão 4.0.6)

Agora o suporte gramatical para modelos de última geração está geralmente disponível

O suporte gramatical agora está geralmente disponível (GA) para modelos de última geração que atendam às condições a seguir:

  • Os modelos estão geralmente disponíveis.
  • Os modelos suportam customização do modelo de idioma.

Para obter mais informações, veja os tópicos a seguir:

15 de março de 2022 (Versão 4.0.6)

Importante: descontinuação da maioria dos modelos de geração anterior

Substituído: este aviso de descontinuação é substituído pela atualização de serviço de 23 de fevereiro de 2023 A data de término de serviço para todos os modelos de geração anterior agora é 31 de Julho de 2023

Em vigor desde 15 de março de 2022, os modelos de geração anterior para todos os idiomas além de árabe e o japonês estão descontinuados. Os modelos descontinuados permanecerão disponíveis até o dia 15 de setembro de 2022, quando serão retirados do serviço e da documentação. Os modelos árabe e japonês da geração anterior não estão obsoletos.

Agora os modelos de geração anterior a seguir estão descontinuados:

  • Chinês (Mandarim): zh-CN_NarrowbandModel e zh-CN_BroadbandModel
  • Holandês (Holanda): nl-NL_NarrowbandModel e nl-NL_BroadbandModel
  • Inglês (Australiano): en-AU_NarrowbandModel e en-AU_BroadbandModel
  • Inglês (Reino Unido): en-UK_NarrowbandModel e en-UK_BroadbandModel
  • Inglês (Estados Unidos): en-US_NarrowbandModel, en-US_BroadbandModel e en-US_ShortForm_NarrowbandModel
  • Francês (Canadense): fr-CA_NarrowbandModel e fr-CA_BroadbandModel
  • Francês (França): fr-FR_NarrowbandModel e fr-FR_BroadbandModel
  • Alemão: de-DE_NarrowbandModel e de-DE_BroadbandModel
  • Italiano: it-IT_NarrowbandModel e it_IT_BroadbandModel
  • Coreano: ko-KR_NarrowbandModel e ko-KR_BroadbandModel
  • Português (Brasileiro): pt-BR_NarrowbandModel e pt-BR_BroadbandModel
  • Espanhol (Argentino): es-AR_NarrowbandModel e es-AR_BroadbandModel
  • Espanhol (Castelhano): es-ES_NarrowbandModel e es-ES_BroadbandModel
  • Espanhol (Chileno): es-CL_NarrowbandModel e es-CL_BroadbandModel
  • Espanhol (Colombiano): es-CO_NarrowbandModel e es-CO_BroadbandModel
  • Espanhol (Mexicano): es-MX_NarrowbandModel e es-MX_BroadbandModel
  • Espanhol (Peruano): es-PE_NarrowbandModel e es-PE_BroadbandModel

Se utilizar qualquer um desses modelos descontinuados, você deverá migrar para o modelo de última geração equivalente até a data de término de serviço.

Nota: quando a geração anterior en-US_BroadbandModel for removida do serviço em 15 de setembro, o modelo de última geração en-US_Multimedia passará a ser o modelo padrão para solicitações de reconhecimento de voz.

Agora os modelos de última geração suportam parâmetros de análise de áudio

Agora todos os modelos de última geração suportam os parâmetros a seguir de análise de áudio como recursos geralmente disponíveis:

  • end_of_phrase_silence_time especifica a duração do intervalo de pausa em que o serviço divide uma transcrição em múltiplos resultados finais. Para obter mais informações, consulte Tempo de silêncio no término da frase.
  • split_transcript_at_phrase_end direciona o serviço para dividir a transcrição em múltiplos resultados finais com base em recursos semânticos da entrada. Para obter mais informações, consulte Transcrição dividida no término da frase.
Correção de defeito: Corrigir a documentação dos rótulos dos alto-falantes

Correção de defeito: a documentação de rótulos de alto-falante incluía a seguinte instrução errônea em vários lugares: Para os modelos de última geração, os rótulos de alto-falante não são suportados para uso com resultados provisórios ou baixa latência. Os rótulos de alto-falante são suportados para uso com resultados provisórios e baixa latência para modelos de última geração. Para obter mais informações, consulte Rótulos do falante.

23 de fevereiro de 2022 (Versão 4.0.6)

Versão 4.0.6 já está disponível

Agora o Speech to Text para IBM Cloud Pak for Data versão 4.0.6 está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Atualizações para importar/exportar scripts

Os scripts import_export.sh e transfer_ownership.sh foram atualizados. Esses scripts são usados para importar e exportar dados entre clusters, fazer backup e restaurar dados, além de migrar dados da versão 3.5 para a versão 4.0.x. Os scripts foram modificados e melhorados da seguinte forma:

  • O script transfer_ownership.sh agora requer uma opção -c para ser incluído na linha de comandos antes do argumento <custom_resource_name>.
  • O script transfer_ownership.sh agora requer uma opção -v <version> e argumento para indicar a versão para a qual a propriedade de recursos está sendo transferida. Especifique 35 para a versão 3.5 ou 40 para a versão 4.0.x.
  • O script transfer_ownership.sh agora requer uma opção -p para ser incluído na linha de comandos antes do argumento <postgres_auth_secret_name>.
  • O argumento <postgres_auth_secret_name> fornece o segredo Kubernetes que é usado para autenticar o armazenamento de dados PostgreSQL ao qual você está transferindo a propriedade. É possível omitir o segredo de autenticação se ele é o mesmo que o valor padrão (<custom-resource-name>-postgres-auth-secret para a versão 4.0.x, user-provided-postgressql para a versão 3.5). Será necessário fornecer o segredo se ele for diferente do valor-padrão.
  • Ambos os scripts agora incluem uma opção -h (--help) para exibir informações sobre o script e seu uso.

Para obter mais informações, consulte

Recomendação atualizada para o OpenShift Container Storage

A partir dos serviços do Speech versão 4.0.6, a classe de armazenamento recomendada para o OpenShift Container Storage é ocs-storagecluster-ceph-rbd.

  • Se você estiver instalando os serviços do Speech 4.0.6 ou fazendo upgrade para os serviços do Speech 4.0.6 por meio do IBM Cloud Pak for Data versão 3.5, especifique a classe de armazenamento ocs-storagecluster-ceph-rbd durante a instalação ou upgrade.
  • Se você estiver fazendo upgrade para os serviços do Speech 4.0.6 por meio de uma atualização anterior do Cloud Pak for Data versão 4.0, continue a usar o ocs-storagecluster-cephfs. Não é possível mudar o armazenamento que é usado em uma implementação existente.

O valor é especificado com a propriedade storageClass no recurso customizado dos serviços Speech:

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

Os serviços do Speech funcionam com qualquer versão do OpenShift Container Storage. A versão recomendada mais recente tem permissões de acesso mais restritivas. Para obter mais informações, consulte

Agora o novo modelo beta en-WW_Medical_Telephony está disponível

Agora um novo beta en-WW_Medical_Telephony de última geração está disponível. O novo modelo compreende termos dos domínios médico e farmacológico. Utilize o modelo em situações em que é necessário transcrever a terminologia médica comum, como nomes de medicamentos, marcas de produtos, procedimentos médicos, doenças, tipos de médico ou terminologia relacionada à COVID-19. Os casos de uso comuns incluem conversas entre um paciente e um provedor de serviços médicos (por exemplo, um médico, enfermeiro ou farmacêutico).

O novo modelo é instalado por meio do recurso customizado dos serviços do Speech configurando enWwMedicalTelephony para enabled: true. O modelo está disponível para todos os dialetos ingleses suportados: australiano, indiano, Reino Unido e EUA.

  • O modelo suporta customização de modelo de idioma e gramáticas como funcionalidade beta.
  • Ele suporta a maioria dos mesmos parâmetros que o modelo en-US_Telephony.
  • Ele não suporta os parâmetros a seguir: low_latency, profanity_filter, redaction e speaker_labels.
  • Atualmente, ele não suporta smart_formatting para IBM Cloud Pak for Data.

Para obter mais informações, consulte O modelo de telefonia médica inglês.

Atualização para o modelo chinês zh-CN_Telephony

O modelo chinês de última geração zh-CN_Telephony foi atualizado para reconhecimento de voz melhorado. O modelo continua suportando baixa latência. Por padrão, o serviço usa automaticamente o modelo atualizado para todas as solicitações de reconhecimento de voz. Para obter mais informações sobre todos os modelos de última geração disponíveis, consulte Idiomas e modelos de última geração.

Se tiver modelos de idioma customizados baseados no modelo atualizado, você deverá fazer upgrade dos modelos customizados existentes aproveitar as atualizações usando o método POST /v1/customizations/{customization_id}/upgrade_model. Para obter mais informações, consulte Fazendo upgrade de modelos customizados.

Atualização para o modelo japonês ja-JP_Multimedia para suportar baixa latência

Agora o modelo japonês de última geração ja-JP_Multimedia suporta baixa latência. É possível usar o parâmetro low_latency com solicitações de reconhecimento de voz que utilizam o modelo. Não é preciso fazer upgrade de modelos customizados baseados no modelo de base japonês atualizado. Para obter mais informações sobre os modelos de última geração e baixa latência, consulte Idiomas e modelos de última geração e Baixa latência.

11 de fevereiro de 2022 (Versão 4.0.5)

Correção de defeito: Melhorar a documentação de upgrade do modelo personalizado e da versão do modelo básico

Correção de defeito: a documentação que descreve o upgrade de modelos customizados e as sequências de versão que são utilizadas para diferentes versões de modelos de base foi atualizada. Agora a documentação afirma que o upgrade para customização do modelo de idioma também se aplica aos modelos de última geração. Também foram atualizadas as sequências de versões que representam diferentes versões de modelos de base. E o parâmetro base_model_version também pode ser usado com modelos de última geração atualizados.

Para obter mais informações sobre o upgrade de modelo customizado, quando o upgrade é necessário e como usar versões mais antigas de modelos customizados, consulte

Correção de defeito: Atualização da documentação de capitalização

Correção de defeito: a documentação que descreve a capitalização automática do serviço de transcrições foi atualizada. O serviço capitaliza os substantivos apropriados apenas para os seguintes idiomas e modelos:

  • Todos os modelos de inglês dos EUA de geração anterior
  • O modelo alemão de última geração

Para obter mais informações, consulte Capitalização.

31 de janeiro de 2022 (Versão 4.0.5)

A versão 4.0.5 foi atualizada

O Speech to Text para IBM Cloud Pak for Data versão 4.0.5 foi atualizado para tratar problemas de instalação. A versão do pacote de casos agora é a 4.0.6. Use este pacote em vez do pacote versão 4.0.5. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Importante: etapas extras para instalação espelhada não são mais necessárias

Importante: as Notas sobre a liberação de 26 de janeiro de 2022 incluem notas importantes para as etapas a seguir:

  • Etapa adicional para realizar uma instalação espelhada do armazenamento de dados MinIO
  • Etapas adicionais para a realização de uma instalação espelhada de novos modelos de última geração

Essas etapas adicionais não são mais necessárias. O pacote de casos foi atualizado para corrigir os problemas de instalação.

26 de janeiro de 2022 (Versão 4.0.5)

A versão 4.0.5 já está disponível

Agora o Speech to Text para IBM Cloud Pak for Data versão 4.0.5 está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Importante: etapa adicional para a realização de uma instalação espelhada do armazenamento de dados do MinIO

Importante: Essas etapas não serão mais necessárias se você instalar o pacote de caso 4.0.6. Para obter mais informações, consulte 31 de janeiro de 2022(versão 4.0.5).

Se você estiver realizando uma instalação espelhada (por exemplo, em um ambiente fisicamente isolado), será necessário realizar uma etapa adicional antes de concluir qualquer uma das etapas a seguir:

Esta etapa é obrigatória para copiar as imagens necessárias para o armazenamento de dados MinIO:

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

A não execução desta etapa causará erros de instalação para o Speech to Text e o Text to Speech.

Importante: etapas adicionais para a realização de uma instalação espelhada de novos modelos de última geração

Importante: Essas etapas não serão mais necessárias se você instalar o pacote de caso 4.0.6. Para obter mais informações, consulte 31 de janeiro de 2022(versão 4.0.5).

Se estiver realizando uma instalação espelhada (por exemplo, para um ambiente com entreferro) e planejar instalar qualquer um dos novos modelos de última geração para o Speech to Text (para obter mais informações, consulte a nota sobre a liberação posterior), você deverá executar uma etapa adicional antes de concluir qualquer uma das etapas a seguir:

Cada etapa adicional é exclusiva para o modelo que está sendo instalado. Se você instalar mais de um dos novos modelos, emita o comando indicado para cada modelo sendo instalado.

  • Para o modelo de telefonia em chinês (zh-CN_Telephony):

    echo 'cp.icr.io,cp/watson-speech/zh-cn-telephony,2022-01-05-405models,sha256:52af6dfccd64ccd81b409936442a51a71f4ee96d980e1fc6a343a05bd4ed7fbc,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Para o modelo de telefonia em espanhol da América Latina (es-LA_Telephony):

    echo 'cp.icr.io,cp/watson-speech/es-la-telephony,2022-01-05-405models,sha256:58e8c04abe9659472e89bf0778b7dc66e0ddceb4ea18d9d3e048a08c72125ea2,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Para o modelo multimídia em inglês australiano (en-AU_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-au-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
  • Para o modelo multimídia em inglês do Reino Unido (en-GB_Multimedia):

    echo 'cp.icr.io,cp/watson-speech/en-gb-multimedia,2022-01-05-405models,sha256:167f9a76258530a56a6abdd1c311f2ea05d6820ee0e802fbf2f96f08fb8a7646,IMAGE,linux,x86_64,"",0,CASE,"",""' \
    >> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv
    
O servidor de licença agora é instalado automaticamente

O operador de serviços Speech agora instala automaticamente o servidor de licença requerido quando instala os serviços do Speech. Não é mais necessário instalar o servidor de licença por meio dos serviços de base do IBM Cloud Pak for Data e não é mais necessário utilizar conteúdo YAML adicional para criar um OperandRequest com as ligações necessárias.

Remoção de etapas específicas para o servidor PostgreSQL EnterpriseDB

A versão anterior da documentação incluiu etapas para o servidor PostgreSQL EnterpriseDB que eram específicas para os serviços do Speech. Essas etapas foram documentadas nos tópicos Fazendo upgrade do Watson Speech to Text (Versão 4.0) e Desinstalando o Watson Speech to Text. Essas etapas adicionais não são mais necessárias e foram removidas da documentação.

O armazenamento de dados RabbitMQ agora é usado apenas pelo componente sttAsync

O armazenamento de dados RabbitMQ era usado anteriormente por componentes de ambos os serviços Speech, Speech to Text e Text to Speech. Ele agora trata do enfileiramento de mensagem não persistente para o componente HTTP assíncrono Speech to Text (sttAsync) apenas. Ele será usado apenas se o componente sttAsync estiver instalado e ativado.

Novos modelos de última geração

Agora o serviço suporta os modelos de última geração a seguir com Speech to Text para IBM Cloud Pak for Data:

  • Modelo de telefonia em chinês (mandarim) (zh-CN_Telephony). O novo modelo suporta baixa latência.
  • Modelo multimídia em inglês (australiano) (en-AU_Multimedia). O novo modelo não suporta baixa latência.
  • Modelo multimídia em inglês (|Reino Unido) (en-GB_Multimedia). O novo modelo não suporta baixa latência.
  • Modelo de telefonia em espanhol (latino-americano) (es-LA_Telephony). O novo modelo suporta baixa latência.

Nota: o modelo em espanhol latino-americano, es-LA_Telephony, aplica-se a todos os dialetos latino-americanos. Ele é equivalente aos modelos de geração anterior que estão disponíveis para os dialetos argentinos, chilenos, colombianos, mexicanos e peruanos. Se você usou um modelo de geração anterior para qualquer um desses dialetos específicos, use o modelo es-LA_Telephony para migrar para o modelo de última geração equivalente.

Os novos modelos estão geralmente disponíveis para reconhecimento de voz. Eles estão geralmente disponíveis para customização de modelo de idioma e beta para gramáticas. Eles não são suportados para customização de modelo acústico.

  • Importante: se estiver realizando uma instalação espelhada (por exemplo, em um ambiente com entreferro) e planejar instalar qualquer um dos novos modelos de última geração para o Speech to Text, você deverá executar etapas adicionais antes de espelhar as imagens. Para obter mais informações, consulte a nota sobre a liberação anterior.
  • Para obter mais informações sobre o uso do recurso personalizado para instalar modelos, consulte Instalando Watson Speech to Text.
  • Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.
  • Para obter mais informações sobre o suporte de customização para modelos da próxima geração, consulte Suporte de customizações para modelos da próxima geração
Agora os modelos de última geração em inglês dos EUA são instalados por padrão

Agora os modelos de última geração em inglês dos EUA, en-US_Multimedia e en-US_Telephony, são instalados por padrão com Speech to Text para IBM Cloud Pak for Data. Esses modelos se juntam ao en-US_BroadbandModel, en-US_NarrowbandModel, en-US_ShortForm_NarrowbandModel como modelos instalados por padrão. Agora os modelos têm as entradas a seguir no recurso customizado dos serviços do Speech:

########################################
# Speech to Text next-generation models
########################################
      enUsMultimedia:    # US English (en-US) Multimedia model
        enabled: true
      enUsTelephony:     # US English (en-US) Telephony model
        enabled: true

For more information about using the custom resource to install models, see Installing Watson Speech to Text.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir associadas ao Apache Log4j foram corrigidas:

20 de dezembro de 2021 (Versão 4.0.4)

Versão 4.0.4 já está disponível

Agora o Speech to Text para IBM Cloud Pak for Data versão 4.0.4 está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

Importante: Mudanças em propriedades para desativação do armazenamento e registro de dados do usuário

Importante: os nomes das propriedades do recurso customizado dos serviços Speech que especificam se os dados do usuário são armazenados e registrados foram mudados. O recurso customizado anteriormente continha as propriedades a seguir:

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Essas propriedades são agora nomeadas da seguinte forma:

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Se você já configurou essas propriedades em seu recurso customizado para mudar o valor padrão de false para true, é necessário editar o seu recurso customizado. Deve-se mudar manualmente os nomes das propriedades para os novos valores e salvar o recurso customizado atualizado. Para obter mais informações, consulte Instalando Watson Speech to Text.

Importante: Mudanças em propriedades de objeto de segredos PostgreSQL

Importante: Ao instalar os serviços do Speech, um objeto que contém uma senha gerada aleatoriamente para o armazenamento de dados PostgreSQL é criado por padrão. É possível escolher em vez de especificar a senha manualmente. Se você o fizer, as propriedades do arquivo YAML para o objeto de segredos foram mudadas. Para obter mais informações, consulte o tópico sobre o gerenciamento de seus datastores em Administrando Watson Speech to Text.

Importante: ops pods do PostgreSQL não começam com o operador EnterpriseDB versão 1.10

Importante: com o Speech to Text para IBM Cloud Pak for Data versão 4.0.3, os pods do PostgreSQL no operador EnterpriseDB versão 1.10 podem falhar ao iniciar. Isso impede que os serviços do Speech iniciem. Uma solução alternativa existe para esse problema. Se os serviços do Speech não conseguirem iniciar, consulte PostgreSQL pods do not start with EnterpriseDB version 1.10 operator para obter informações sobre como diagnosticar e resolver o problema.

Esse problema é corrigido no Speech to Text para IBM Cloud Pak for Data versão 4.0.4.

Novo suporte para classe de armazenamento do IBM Spectrum Scale Container Native

Desde a versão 4.0.3, os serviços do Speech suportam a classe de armazenamento do IBM Spectrum® Scale Container Native. Para usar o IBM Spectrum Scale, especifique "ibm-spectrum-scale-sc" para a propriedade storageClass do recurso customizado dos serviços Speech. Para obter mais informações, consulte Instalando Watson Speech to Text.

Interação dos serviços do Speech com o armazenamento de dados MinIO durante a instalação

Os componentes de tempo de execução dos serviços do Speech, sttRuntime e ttsRuntime, não podem começar até que os modelos e vozes para os serviços sejam totalmente transferidos por upload para o armazenamento de dados MinIO. Durante a instalação, os serviços podem falhar e automaticamente reiniciar sozinhos uma ou mais vezes até que o upload dos modelos e vozes esteja concluído. Eles então iniciam corretamente. Nenhuma ação do usuário é necessária.

Correção de defeito: Correção da documentação de upgrade

Correção de defeito: Documentação para upgrade dos serviços do Speech para novas versões do IBM Cloud Pak for Data versão 4.0.x incluiu referências incorretas em alguns comandos. Essas referências estão agora corretas:

  • As sequências watsonSpeechToTextStatus e watsonTextToSpeechStatus foram mudadas para speechStatus em ambos os casos.
  • As sequências status.watsonSpeechToTextVersion e status.watsonTextToSpeechVersion foram mudadas para .spec.version em ambos os casos.

Para obter mais informações, consulte Atualizando Watson Speech to Text.

Importante: modelos de idioma customizados baseados em determinados modelos de última geração devem ser recriados

Importante: se tiver criado modelos de idioma customizados com base em determinados modelos de última geração, você deverá recriar os modelos customizados. Até a recriação dos modelos de idioma customizados, as solicitações de reconhecimento de voz que tentarem usar os modelos customizados falharão com o código de erro HTTP 400.

É preciso recriar os modelos de idioma customizados criados com base nas seguintes versões de modelos de última geração:

  • Para o modelo en-AU_Telephony, modelos customizados que você criou de en-AU_Telephony.v2021-03-03 para en-AU_Telephony.v2021-10-04.
  • Para o modelo en-GB_Telephony, modelos customizados que você criou de en-GB_Telephony.v2021-03-03 para en-GB_Telephony.v2021-10-04.
  • Para o modelo en-US_Telephony, modelos customizados que você criou de en-US_Telephony.v2021-06-17 para en-US_Telephony.v2021-10-04.
  • Para o modelo en-US_Multimedia, modelos customizados que você criou de en-US_Multimedia.v2021-03-03 para en-US_Multimedia.v2021-10-04.

Para identificar a versão de um modelo na qual um modelo de idioma customizado é baseado, use o método GET /v1/customizations para listar todos os modelos de idioma customizados ou o método GET /v1/customizations/{customization_id} para listar um modelo específico. O campo versions da saída mostra o modelo base para um modelo de idioma customizado. Para obter mais informações, consulte Listando modelos de idioma customizados.

Para recriar um modelo de idioma customizado, primeiro crie um novo modelo customizado. Em seguida, inclua no novo modelo todas as palavras customizadas e dos corpora do modelo customizado anterior. Em seguida, é possível excluir o modelo customizado anterior. Para obter mais informações, consulte Criando um modelo de idioma customizado.

Atualizações para vários modelos de última geração para reconhecimento de voz melhorado

Os modelos de última geração a seguir foram atualizados para reconhecimento de voz melhorado:

  • Modelo de telefonia em inglês australiano (en-AU_Telephony)
  • Modelo de telefonia em inglês do Reino Unido (en-GB_Telephony)
  • Modelo multimídia em inglês dos EUA (en-US_Multimedia)
  • Modelo de telefonia em inglês dos EUA (en-US_Telephony)
  • Modelo de telefonia em espanhol castelhano (es-ES_Telephony)

Para obter mais informações sobre todos os modelos de próxima geração disponíveis, consulte Idiomas e modelos de última geração.

Novo suporte gramatical beta para modelos de última geração

Agora o suporte gramatical está disponível como funcionalidade beta para todos os modelos de última geração disponíveis. Todos os modelos de última geração estão geralmente disponíveis (GA) e suportam customização de modelo de idioma. Para obter mais informações, veja os tópicos a seguir:

Novo campo custom_acoustic_model para recursos suportados

Os métodos GET /v1/models e GET /v1/models/{model_id} agora informam se um modelo suporta customização de modelo acústico. Agora o objeto SupportedFeatures inclui um campo adicional, custom_acoustic_model, um booleano que é true para um modelo que suporta customização de modelo acústico e false, caso contrário. Atualmente, o campo é true para todos os modelos de geração anterior e false para todos os modelos de última geração.

Vulnerabilidade de segurança abordada

A vulnerabilidade de segurança a seguir associada ao Apache Log4j foi corrigida:

20 de dezembro de 2021 (Versão 1.2.x)

Importante: não é mais possível instalar o Speech to Text versão 1.2.x no IBM Cloud Pak for Data versão 3.5

Importante: não é mais possível realizar novas instalações do Speech to Text versão 1.2.x no IBM Cloud Pak for Data versão 3.5. É possível instalar apenas a versão Speech to Text 4.0.x na versão IBM Cloud Pak for Data 4.x. Para obter mais informações, consulte Instalando Watson Speech to Text.

Os serviços do Speech para IBM Cloud Pak for Data versão 3.5 chegam à sua data de fim de suporte em 30 de abril de 2022. Você é encorajado a fazer upgrade para a liberação mais recente da versão 4.0.x dos serviços assim que puder. Para obter mais informações, consulte Atualizando Watson Speech to Text.

30 de novembro de 2021 (Versão 4.0.3)

A versão 4.0.3 já está disponível

Agora o Speech to Text para IBM Cloud Pak for Data versão 4.0.3 está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Speech to Text.

O servidor de licença agora é um pré-requisito obrigatório

Agora é necessário instalar o servidor de licença por meio dos serviços de base do IBM Cloud Pak for Data. Deve-se instalar o servidor de licença usando o conteúdo YAML que é fornecido para criar um OperandRequest com as ligações necessárias. Também se deve instalar o serviço de licença no mesmo espaço de nomes do serviço (operando), que também é onde o IBM Cloud Pak for Data está instalado. Para obter mais informações, consulte Instalando Watson Speech to Text.

Novo suporte para upgrade no local

O serviço agora suporta upgrade baseado em operador no local da versão 4.0.0 para a versão 4.0.3. A movimentação do IBM Cloud Pak for Data versão 3.5 para a versão 4.0.3 continua a exigir uso de utilitários de migração. Para obter mais informações, consulte Atualizando Watson Speech to Text.

Mudanças na instalação do operador e da licença do EDB PostgreSQL

A instalação, o upgrade e a desinstalação para o operador e a licença do Enterprise DB PostgreSQL mudaram:

  • Instruções para instalação do operador e da licença do EDB PostgreSQL estão agora incluídas com os serviços de base do IBM Cloud Pak for Data. As instruções para instalação dos serviços do Speech foram atualizadas em conformidade. Para obter mais informações, consulte Instalando Watson Speech to Text.
  • As instruções para upgrade do Speech to Text versão 4.0.0 para 4.0.3 incluem instruções para desinstalar o operador EDB PostgreSQL anterior e a licença e para reinstalá-los com os serviços de base do IBM Cloud Pak for Data. Para obter mais informações, consulte Atualizando Watson Speech to Text.
  • As instruções para desinstalar os serviços do Speech agora incluem etapas para remoção do operador EDB PostgreSQL e licença que foram previamente instalados com o Speech to Text. Para obter mais informações, consulte Desinstalando Watson Speech to Text.
Nova orientação para escalar sua instalação

O serviço agora fornece orientação atualizada sobre o ajuste de escala da sua instalação. As informações incluem especificar o número de pods, o número de CPUs alocadas por pod e o número máximo de sessões simultâneas com modelos anteriores e de última geração. Para obter mais informações, consulte Administrando Watson Speech to Text.

Atualizações de linha de comandos para importar e exportar utilitários

Os comandos que são usados com os utilitários de importação e exportação para os serviços do Speech incluem novas opções e argumentos. Os utilitários de importação e exportação também são a base para o backup e a restauração dos serviços e para a migração do IBM Cloud Pak for Data versão 3.5 para a versão 4.0.3. Para obter mais informações sobre o uso dutilitários, consulte

Nova propriedade para especificação de CPUs para treinamento de modelo acústico

O microsserviço sttAMPatcher gerencia customização de modelo acústico para o serviço. O Patcher de modelagem ágil usa um número dedicado de CPUs para tratar de solicitações. É possível usar a nova propriedade sttAMPatcher.resources.requestsCPU para aumentar o número de CPUs que são dedicadas a manipular solicitações de treinamento de modelo acústico pelo AM Patcher. Isso poderá ser necessário se você experimentar falhas de treinamento durante o treinamento de modelo acústico. Para obter mais informações, consulte Instalando Watson Speech to Text.

Novos modelos de última geração

Agora o serviço suporta os seguintes novos modelos de idioma de última geração. Todos os novos modelos estão geralmente disponíveis.

  • Tcheco: cs-CZ_Telephony. O modelo suporta baixa latência.
  • Holandês belga (Flamengo): nl-BE_Telephony. O modelo suporta baixa latência.
  • Francês: fr-FR_Multimedia. O novo modelo não suporta baixa latência.
  • Inglês indiano: en-IN_Telephony. O modelo suporta baixa latência.
  • Hindi indiano: hi-IN_Telephony. O modelo suporta baixa latência.
  • Japonês: ja-JP_Multimedia. O modelo não suporta baixa latência.
  • Coreano: ko-KR_Multimedia. O modelo não suporta baixa latência.
  • Coreano: ko-KR_Telephony. O modelo suporta baixa latência.
  • Holandês da Holanda: nl-NL_Telephony. O modelo suporta baixa latência.

Para obter mais informações sobre todos os modelos de última geração e sobre baixa latência, consulte Idiomas e modelos de última geração e Baixa latência.

Atualizações para modelos de última geração

Os modelos de última geração foram atualizados para o reconhecimento de voz melhorado. Todos os modelos estão geralmente disponíveis.

  • Árabe: ar-MS_Telephony. Agora o modelo suporta baixa latência.
  • Português do Brasil: pt-BR_Telephony. O modelo continua suportando baixa latência.
  • Inglês dos EUA: en-US_Telephony. O modelo continua suportando baixa latência.
  • Francês canadense: fr-CA_Telephony. Agora o modelo suporta baixa latência.
  • Italiano: it-IT_Telephony. Agora o modelo suporta baixa latência.

Para obter mais informações sobre todos os modelos de última geração e sobre baixa latência, consulte Idiomas e modelos de última geração e Baixa latência.

Correção de defeito: Resolver falhas assíncronas em HTTP

Correção de defeito: a interface HTTP assíncrona falhou ao transcrever algum áudio. Além disso, o retorno de chamada para a solicitação retornou o status recognitions.completed_with_results em vez de recognitions.failed. Esse erro foi resolvido.

Correção de defeito: Melhorar os resultados das etiquetas de alto-

Correção de defeito: ao usar rótulos de alto-falante com modelos de última geração, agora o serviço identifica o alto-falante para todas as palavras do áudio de entrada, incluindo palavras muito curtas que têm os mesmos registros de data e hora iniciais e finais.

Correção de defeitos: Atualização dos resultados provisórios e da documentação de baixa latência

Correção de defeito: a documentação que descreve os resultados provisórios e os recursos de baixa latência com modelos de última geração foi reescrita para maior clareza e correção. Para obter mais informações, veja os tópicos a seguir:

Correção de defeito: Correção da documentação sobre multitenancy

Defeito corrigido: O tópico IBM Cloud Pak for Data tópico Multitenancy support declarou incorretamente que os serviços do Speech não suportam a multitenancy. O tópico foi atualizado para afirmar que os serviços do Speech suportam as operações a seguir:

  • Instalar o serviço em projetos separados
  • Instalar o serviço várias vezes no mesmo projeto
  • Instalar o serviço uma vez e implementar várias instâncias no mesmo projeto

A documentação que é específica para os serviços do Speech declarava corretamente o suporte à ocupação variada.

1º de outubro de 2021 (Versão 1.1.x)

Versão 1.1.x está fora de serviço
Speech to Text e Text to Speech para IBM Cloud Pak for Data versão 1.1.x foi extinto em 30 de setembro de 2021. A partir de 1º de outubro de 2021, a documentação para a versão 1.1.x não está mais disponível. Para obter mais informações, consulte Retirada de software e descontinuação de suporte.

31 de agosto de 2021 (Versão 4.0.0)

Todos os modelos de última geração agora estão geralmente disponíveis

Todos os modelos de idioma de última geração agora estão geralmente disponíveis (GA). Eles são suportados para uso em aplicativos e ambientes de produção.

A customização do modelo de idioma para modelos de última geração agora está geralmente disponível

Agora a customização do modelo de idioma está geralmente disponível (GA) para todos os idiomas e modelos de última geração disponíveis. A customização do modelo de idioma para modelos de última geração é suportada para uso em aplicativos e ambientes de produção.

Para modelos de última geração, você usa os mesmos comandos para criar, gerenciar e usar modelos de idioma customizado, corpora e palavras customizadas assim como para modelos de geração anterior. Mas a customização para modelos de última geração funciona de forma diferente da customização para modelos de geração anterior.. Para modelos customizados baseados em modelos de última geração:

  • Os modelos customizados não têm conceito de palavras fora do vocabulário (OOV).
  • Palavras de corpora não são incluídas no recurso de palavras.
  • Atualmente não é possível utilizar o recurso parecido para palavras customizadas.
  • Não é preciso fazer upgrade de modelos customizados quando os modelos de idioma base são atualizados.
  • As gramáticas não são suportadas atualmente.

Para obter mais informações sobre o uso da customização de modelo de idioma para modelos de última geração, consulte

Tópicos adicionais descrevem o gerenciamento de modelos de idioma customizados, corpora e palavras customizadas.

29 de julho de 2021 (Versão 4.0.0)

A versão 4.0.0 está disponível

Agora o IBM Watson® Speech to Text para IBM Cloud Pak® for Data versão 4.0.0 está disponível. A instalação e a administração do serviço incluem muitas mudanças. Esta versão suporta o IBM Cloud Pak for Data versão 4.x e o Red Hat OpenShift versão 4.6. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando o IBM Watson Speech to Text para IBM Cloud Pak for Data.

Novos modelos de idioma de última geração

Agora o serviço suporta um número crescente de modelos de idioma de última geração. Os modelos multimídia e de telefonia de última geração melhoram as capacidades de reconhecimento de voz da geração anterior do serviço de modelos de banda larga e banda estreita. Os novos modelos alavancam redes neurais e análise bidirecional para alcançar tanto um alto rendimento quanto uma maior precisão de transcrição.

Atualmente, os modelos de idioma de última geração e o parâmetro low_latency são funcionalidade beta. Os modelos de última geração suportam um número limitado de idiomas e recursos de reconhecimento de voz. Os idiomas suportados, os modelos e os recursos aumentarão com as liberações futuras.

Muitos dos modelos de última geração também suportam um novo parâmetro low_latency que permite solicitar resultados mais rápidos à custa de uma redução na qualidade da transcrição. Quando a baixa latência é ativada, o serviço diminui sua análise do áudio, o que pode reduzir a precisão da transcrição. Essa troca poderá ser aceitável se o aplicativo precisar mais de um tempo de resposta mais baixo do que a mais alta precisão possível.

O parâmetro low_latency impacta seu uso do parâmetro interim_results com a interface do WebSocket. Os resultados provisórios estão disponíveis apenas para aqueles modelos de última geração que suportam baixa latência e somente se ambos os parâmetros interim_results e low_latency estiverem configurados para true.

Modelo de banda larga em idioma árabe renomeado

Agora o modelo de banda larga em árabe é chamado ar-MS_BroadbandModel. O antigo nome, ar-AR_BroadbandModel, foi descontinuado. Ele continuará funcionando por pelo menos um ano, mas poderá ser removido em uma data futura. Você é encorajado a migrar para o novo nome assim que puder.

Documentação unificada do Speech to Text

Agora a documentação para o IBM Watson Speech to Text para IBM Cloud Pak for Data é fornecida em combinação com a documentação para instâncias gerenciadas do serviço Speech to Text que estão hospedadas no IBM Cloud. Isso vale tanto para a documentação de guia quanto de referência para as duas formas do serviço. Links para a versão anteriormente separada da documentação do IBM Cloud Pak for Data para o redirecionamento de serviço para a documentação unificada.

Para obter mais informações sobre a identificação de informações que pertencem a apenas uma versão do produto, consulte Sobre o Speech to Text.

Correção de defeito: Improvar documentação

Correção de defeito: A documentação foi atualizada para corrigir as seguintes informações:

  • A documentação falhou ao afirmar que os modelos de última geração não produzem marcadores de hesitação. A documentação foi atualizada para mencionar que apenas modelos de geração anterior produzem marcadores de hesitação. Os modelos de última geração incluem as hesitações reais em resultados de transcrição. Para obter mais informações, consulte hesitações e marcadores de hesitação da Speech.
  • A documentação afirmou incorretamente que o uso do parâmetro smart_formatting faz com que o serviço remova marcadores de hesitação de resultados finais de transcrição para japonês. A formatação inteligente não remove marcadores de hesitação de resultados finais para o idioma japonês, mas apenas para inglês dos EUA. Para obter mais informações, consulte Quais resultados a formatação inteligente afeta?
A versão 1.1.x está saindo de serviço

Speech to Text e Text to Speech para IBM Cloud Pak for Data versão 1.1.x saiu de serviço em 30 de setembro de 2021. Deve-se fazer upgrade para uma versão mais recente dos serviços no IBM Cloud Pak for Data antes dessa data. A partir de 1º de outubro de 2021, a documentação para a versão 1.1.4 não estará mais disponível.

12 de abril de 2021 (Versão 1.2.1)

Inclusão ao arquivo speech-override.yaml

O arquivo mínimo speech-override.yaml inclui uma definição extra, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} é o caminho para o registro do Docker interno. Ele deve ser image-registry.openshift-image-registry.svc:5000/{namespace}, em que {namespace} é o espaço de nomes no qual o IBM Cloud Pak® for Data é instalado, normalmente zen.

9 de abril de 2021 (Versão 1.2.1)

Suporte para modificação de modelos e vozes instalados
Os serviços do Speech permitem que você inclua ou remova modelos e vozes instalados para a versão 1.2 ou 1.2.1 dos serviços.

Versão 1.2.1 (26 de março de 2021)

A versão 1.2.1 está disponível

Agora o Speech to Text para IBM Cloud Pak for Data versão 1.2.1 está disponível. As versões 1.2 e 1.2.1 utilizam as mesmas instruções de instalação e documentação da versão 1.2. A versão 1.2.1 suporta instalação no Red Hat OpenShift versão 4.6, além das versões 4.5 e 3.11.

Novas instruções de instalação

Para ambos os clusters, conectados à Internet e fisicamente isolados, as instruções de instalação incluem as etapas a seguir:

  • Use o comando oc label para configurar etiquetas necessárias para o espaço de nomes em que o IBM Cloud Pak for Data está instalado.
  • Use o comando oc project para garantir que você esteja apontando para o projeto OpenShift correto.
  • Use o comando cpd-cli install para instalar um servidor Enterprise DB PostgreSQL que é usado pelos serviços do Speech.

Você executa essas etapas antes de instalar os serviços do Speech.

Novas instruções de desinstalação

Uma etapa foi incluída ao procedimento de desinstalação dos serviços do Speech para limpar todos os recursos da instalação.

Registro autorizado para armazenamento de dados PostgreSQL

O caminho do registro autorizado por meio do qual o serviço extrai imagens para o armazenamento de dados PostgreSQL foi mudado. O local do registro mudou de cp.icr.io/cp/watson-speech para cp.icr.io/cp/cpd. Essa mudança é transparente para os usuários.

Segredos para os armazenamentos de dados MinIO e PostgreSQL

Os armazenamentos de dados MinIO e PostgreSQL requerem os valores codificados permanentemente a seguir para os seus segredos:

  • Para MinIO, use minio.
  • Para PostgreSQL, use user-provided-postgressql.

Não é possível usar seus próprios valores para esses segredos. Os segredos devem ser criados antes de instalar os serviços do Speech.

Exclusões do arquivo speech-override.yaml

As entradas a seguir foram removidas do arquivo speech-override.yaml . Elas foram incluídas como uma solução alternativa a um problema que agora foi corrigido.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

O arquivo speech-override.yaml abreviado foi reduzido ainda mais por meio do ajuste preciso de seu conteúdo para os elementos essenciais.

Versão 1.2 (9 de dezembro de 2020)

A versão 1.2 está disponível

O Speech to Text for IBM Cloud Pak for Data versão 1.2 agora está disponível. A instalação e a administração do serviço incluem muitas mudanças. Essa versão suporta o IBM Cloud Pak for Data versões 3.5 e 3.0.1 e o Red Hat OpenShift versões 4.5 e 3.11.

Novos modelos australianos e franco canadenses

O serviço agora oferece modelos de banda larga e de banda estreita para o inglês australiano e o francês canadense:

  • Inglês australiano: en-AU_BroadbandModel e en-AU_NarrowbandModel
  • Francês canadense: fr-CA_BroadbandModel e fr-CA_NarrowbandModel

Os novos modelos têm disponibilidade geral e suportam a customização do modelo de idioma e do modelo acústico.

Modelos atualizados para reconhecimento de voz melhorado

Os modelos de idioma a seguir foram atualizados para reconhecimento de voz melhorado:

  • Português do Brasil: pt-BR_BroadbandModel e pt-BR_NarrowbandModel
  • Francês: fr-FR_BroadbandModel
  • Alemão: de-DE_BroadbandModel e de-DE_NarrowbandModel
  • Japonês: ja-JP_BroadbandModel
  • Inglês do Reino Unido: en-GB_BroadbandModel e en-GB_NarrowbandModel
  • Inglês dos EUA: en-US_ShortForm_NarrowbandModel

Por padrão, o serviço usa automaticamente os modelos atualizados para todas as solicitações de reconhecimento de voz. Se você tiver modelos customizados acústicos ou de idioma que são baseados nesses modelos, deverá fazer upgrade de seus modelos customizados existentes para aproveitar as atualizações usando os métodos a seguir:

  • POST /v1/customizations/{customization_id}/upgrade_model
  • POST /v1/acoustic_customizations/{customization_id}/upgrade_model

Para obter mais informações, consulte Fazendo upgrade de modelos customizados.

Agora o parâmetro split_transcript_at_phrase_end está geralmente disponível para todos os idiomas

O parâmetro de reconhecimento de voz split_transcript_at_phrase_end agora tem disponibilidade geral para todos os idiomas. Anteriormente, ele tinha disponibilidade geral apenas para inglês dos EUA e do Reino Unido. Para obter mais informações, consulte Transcrição dividida no término da frase.

O marcador de hesitação para o alemão mudou

O marcador de hesitação que é usado para modelos atualizados de banda larga e banda estreita em alemão mudou de [hesitation] para %HESITATION. Para obter mais informações sobre marcadores de hesitação, consulte hesitações e marcadores de hesitação de Speech.

Correção de defeito: Resolver o problema de latência para modelos com grande número de gramáticas

Correção de defeito: o serviço não tem mais um problema de latência para modelos de idioma customizados que contêm um grande número de gramáticas. Quando inicialmente usados para o reconhecimento de voz, o carregamento desses modelos customizados poderia demorar vários segundos. Os modelos customizados agora são carregados muito mais rápido, reduzindo drasticamente a latência quando usados para o reconhecimento.

15 de julho de 2020 (Versão 1.1.4)

Red Hat OpenShift versão 4.3 está saindo de serviço
O IBM Cloud Pak for Data 3.0.1 está descontinuando o suporte para o Red Hat OpenShift 4.3 em 1 de setembro de 2020. O Red Hat OpenShift 4.3 saiu de serviço em 22 de outubro de 2020. O IBM Cloud Pak for Data está introduzindo suporte para o Red Hat OpenShift 4.5. O IBM Cloud Pak for Data recomenda aos clientes o upgrade para o Red Hat OpenShift 4.5 antes de 22 de outubro de 2020. O Suporte IBM trabalhará com quaisquer clientes que já instalaram o IBM Cloud Pak for Data 3.0.1 no Red Hat OpenShift 4.3. Os novos clientes que desejam instalar no Red Hat OpenShift 4.x são instruídos a instalar o Red Hat OpenShift 4.5.

19 de junho de 2020 (Versão 1.1.4)

A versão 1.1.4 está disponível

O Speech to Text for IBM Cloud Pak for Data versão 1.1.4 agora está disponível. A instalação e a administração do serviço incluem muitas mudanças. Essa versão suporta IBM Cloud Pak for Data versões 2.5 e 3.0.1 e o Red Hat OpenShift versões 3.11 e 4.3. Para obter mais informações sobre a instalação e o gerenciamento do serviço, consulte Instalação e gerenciamento de Speech to Text para IBM Cloud Pak for Data.

Novos parâmetros para controlar o nível de detecção de atividade da voz

O serviço agora oferece dois novos parâmetros opcionais para controlar o nível de detecção de atividade de fala. Os parâmetros podem ajudar a assegurar que apenas o áudio relevante seja processado para reconhecimento de voz.

  • O parâmetro speech_detector_sensitivity ajusta a sensibilidade da detecção da atividade de fala. É possível usar o parâmetro para suprimir inserções de palavras de música, tosse e outros eventos sem fala.
  • O parâmetro background_audio_suppression suprime o áudio de plano de fundo com base em seu volume para evitar que ele seja transcrito ou que, de outra forma, interfira com o reconhecimento de voz. É possível usar o parâmetro para suprimir conversas laterais ou ruído de plano de fundo.

É possível usar os parâmetros individualmente ou juntos. Eles estão disponíveis para todas as interfaces e para a maioria dos modelos de idioma. Para obter mais informações sobre os parâmetros, seus valores permitidos e seu efeito sobre a qualidade e a latência do reconhecimento de voz, consulte Detecção de atividade de fala.

Novos modelos de banda larga e banda estreita para holandês e italiano

O serviço agora suporta os modelos de banda larga e de banda estreita para os idiomas holandês e italiano:

  • Modelo de banda larga holandês (nl-NL_BroadbandModel)
  • Modelo de banda estreita holandês (nl-NL_NarrowbandModel)
  • Modelo de banda larga italiano (it-IT_BroadbandModel)
  • Modelo de banda estreita italiano (it-IT_NarrowbandModel)

Os modelos de idioma holandês e italiano têm disponibilidade geral (GA) para reconhecimento de voz e customização de modelo de idioma e modelo acústico. Para obter mais informações sobre todos os modelos de idioma disponíveis, consulte

Suporte para o parâmetro speaker_labels para alemão e coreano

O serviço agora suporta rótulos de falante (o parâmetro speaker_labels) para modelos de idioma alemão e coreano. Os rótulos de falante identificam quais palavras cada indivíduo falou em uma interação com diversos participantes. Para obter mais informações, consulte Rótulos do falante.

Reconhecimento de voz melhorado para modelo de banda estreita em japonês

O modelo de banda estreita japonesa (ja-JP_NarrowbandModel) agora inclui algumas unidades de palavra de multigrama para dígitos e frações decimais. O serviço retorna essas unidades de multigrama independentemente de você ativar a formatação inteligente. O recurso de formatação inteligente entende e retorna as unidades de multigrama que o modelo gera. Se você aplicar o seu próprio pós-processamento a resultados de transação, será necessário manipular essas unidades adequadamente. Para obter mais informações, consulte Japonês na documentação de formatação inteligente.

Backup e restauração simplificados

O serviço agora oferece procedimentos de backup e restauração muito aprimorados. Os utilitários agora estão disponíveis para fazer backup dos dados de seus armazenamentos de dados, de modo que não seja mais necessário recriá-los completamente em caso de desastre. Para obter mais informações, faça backup e restaure Watson Dados de serviços de fala.

1 de abril de 2020 (Versão 1.1.3)

Agora a customização do modelo acústico está geralmente disponível
A customização de modelo acústico agora é geralmente disponível (GA) para todos os idiomas suportados. Para obter mais informações sobre o suporte para modelos de idiomas individuais, consulte Suporte ao idioma para a customização.

28 de fevereiro de 2020 (Versão 1.1.3)

A versão 1.1.3 está disponível

O Speech to Text for IBM Cloud Pak for Data versão 1.1.3 agora está disponível.

Novo parâmetro end_of_phrase_silence_time

Para reconhecimento de voz, o serviço agora suporta o parâmetro end_of_phrase_silence_time. O parâmetro especifica a duração do intervalo de pausa no qual o serviço divide uma transcrição em diversos resultados finais. Cada resultado final indica uma pausa ou um silêncio estendido que excede o intervalo de pausa. Na maioria dos idiomas, o intervalo de pausa padrão é de 0,8 segundos; no chinês o intervalo padrão é de 0,6 segundos.

É possível usar o parâmetro para efetivar uma troca entre a frequência com a qual um resultado final é produzido e a precisão da transcrição. Aumente o intervalo quando a precisão for mais importante do que a latência. Diminua o intervalo quando for esperado que o falante diga frases curtas ou palavras únicas.

Para obter mais informações, consulte Tempo de silêncio no término da frase.

Novo parâmetro split_transcript_at_phrase_end

Para reconhecimento de voz, o serviço agora suporta o parâmetro split_transcript_at_phrase_end. O parâmetro direciona o serviço para dividir a transcrição em diversos resultados finais com base em recursos semânticos da entrada, tais como na conclusão de sentenças. O serviço baseia sua compreensão de recursos semânticos no modelo de idioma de base usado com uma solicitação. Os modelos de idioma customizados e as gramáticas também podem influenciar como e onde o serviço divide uma transcrição.

O parâmetro faz com que um serviço inclua um campo end_of_utterance em cada resultado final para indicar o motivo para a divisão: full_stop, silence, end_of_data ou reset.

Para obter mais informações, consulte Transcrição dividida no término da frase.

Parâmetro speaker_labels melhorado

Para reconhecimento de voz, o parâmetro speaker_labels foi atualizado para melhorar a identificação de alto-falantes individuais para análise mais aprofundada da amostra de áudio. Para obter mais informações sobre o recurso de rótulos do falante, consulte Rótulos do falante. Para obter mais informações sobre os aprimoramentos do recurso, consulte IBM Research AI Advances Speaker Diarization in Real Use Cases.

27 de novembro de 2019 (Versão 1.1.2)

A versão 1.1.2 está disponível
O Speech to Text for IBM Cloud Pak for Data versão 1.1.2 agora está disponível.
Número máximo de modelos customizados
Não é possível criar mais que 1024 modelos de linguagens customizadas e nem mais que 1024 modelos acústicos customizados por credencial que você tiver. Para obter mais informações, consulte Número máximo de modelos customizados.

30 de agosto de 2019 (Versão 1.0.1)

Versão 1.0.1 está disponível

O Speech to Text for IBM Cloud Pak for Data versão 1.0.1 agora está disponível. O serviço agora funciona com o IBM Cloud Pak for Data 2.1.0.1. O serviço agora suporta a instalação do IBM Cloud Pak for Data com o Red Hat OpenShift.

Novos modelos de banda larga e banda estreita para dialetos espanhóis

Agora, o serviço oferece banda larga e modelos de idioma de banda estreita em seis dialetos de espanhol:

  • Espanhol argentino (es-AR_BroadbandModel e es-AR_NarrowbandModel)
  • Espanhol castiliano (es-ES_BroadbandModel e es-ES_NarrowbandModel)
  • Espanhol chileno (es-CL_BroadbandModel e es-CL_NarrowbandModel)
  • Espanhol colombiano (es-CO_BroadbandModel e es-CO_NarrowbandModel)
  • Espanhol mexicano (es-MX_BroadbandModel e es-MX_NarrowbandModel)
  • Espanhol peruano (es-PE_BroadbandModel e es-PE_NarrowbandModel)

Os modelos de espanhol castelhano não são novos. Eles estão geralmente disponíveis para reconhecimento de voz e customização de modelo de idioma e beta para customização de modelo acústico.

Os modelos para os outros cinco dialetos são novos e beta para todos os usos. Como eles são beta, esses dialetos adicionais podem não estar prontos para uso de produção e estão sujeitos a mudança. Eles são ofertas iniciais que irão melhorar em qualidade com o tempo e o uso.

Para obter mais informações, consulte as seções a seguir:

Suporte FISMA

Suporte ao Federal Information Security Management Act (FISMA) agora está disponível para o Speech to Text for IBM Cloud Pak for Data. O serviço é FISMA High Ready.

28 de junho de 2019 (Versão 1.0.0)

Versão 1.0.0 está disponível

Agora a versão 1.0.0, a liberação inicial do serviço, está disponível. O Speech to Text para IBM Cloud Pak for Data é baseado no serviço IBM Watson® Speech to Text na IBM Cloud pública. O Speech to Text para IBM Cloud Pak for Data difere do serviço Speech to Text público das seguintes formas. Essas informações poderão ser úteis caso você já esteja familiarizado com o serviço Speech to Text no IBM Cloud público.

  • O Speech to Text for IBM Cloud Pak for Data usa tokens de acesso para autenticação. Para obter mais informações, consulte a referência API & SDK.
  • Os terminais para o Speech to Text for IBM Cloud Pak for Data são específicos para o cluster do IBM Cloud Pak for Data. Para obter mais informações, consulte a referência API & SDK.
  • O Speech to Text for IBM Cloud Pak for Data não executa nenhuma criação de log de solicitação. Não é necessário usar o cabeçalho da solicitação X-Watson-Learning-Opt-Out.
  • O Speech to Text for IBM Cloud Pak for Data não suporta tokens do Watson. Não é possível usar o cabeçalho da solicitação X-Watson-Authorization-Token para se autenticar no serviço.