Notas sobre a liberação para Text to Speech para IBM Cloud Pak for Data

IBM Cloud Pak for Data

Os recursos e mudanças a seguir foram incluídos para cada liberação e atualização de instâncias instaladas ou no local do IBM Watson® Text to Speech para IBM Cloud Pak for Data. A menos que seja observado de outra forma, todas as alterações são compatíveis com liberações anteriores e são disponibilizadas de forma automática e transparente para todos os aplicativos novos e existentes.

Para obter informações sobre limitações conhecidas do serviço, consulte Limitações conhecidas.

Para obter informações sobre liberações e atualizações do serviço para IBM Cloud, consulte Notas sobre a liberação para Text to Speech para IBM Cloud.

30 de outubro de 2024 (Versão 4.8.7 )

A versão 4.8.7 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.7 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

25 de setembro de 2024 (Versão 5.0.3 )

A versão 5.0.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de agosto de 2024 (Versão 4.8.6 )

A versão 4.8.6 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.6 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de agosto de 2024 (Versão 5.0.2 )

A versão 5.0.2 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.2 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

31 de julho de 2024 (Versão 5.0.1 )

A versão 5.0.1 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.1 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

19 de junho de 2024 (Versão 5.0.0 )

A versão 5.0.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 5.0.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

24 de abril de 2024 (Versão 4.8.5 )

A versão 4.8.5 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.5 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

27 de março de 2024 (Versão 4.8.4 )

A versão 4.8.4 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.4 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de fevereiro de 2024 (Versão 4.8.3 )

A versão 4.8.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

31 de janeiro de 2024 (Versão 4.8.2 )

A versão 4.8.2 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.2 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

30 de novembro de 2023 (Versão 4.8.0 )

A versão 4.8.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.8.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

27 de setembro de 2023 (Versão 4.7.3 )

A versão 4.7.3 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.3 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

28 de julho de 2023 (Versão 4.7.1 )

A versão 4.7.1 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.1 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

9 de junho de 2023 (Versão 4.7.0 )

A versão 4.7.0 já está disponível
Speech to Text para a versão IBM Cloud Pak for Data 4.7.0 já está disponível. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

2 de maio de 2023 (Versão 4.6.5)

A versão 4.6.5 já está disponível

Text to Speech para a versão IBM Cloud Pak for Data 4.6.5 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e as versões Red Hat OpenShift 4.10 e 4.12. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Novas vozes neurais expressivas do inglês australiano

O serviço agora suporta duas novas vozes neurais expressivas para o inglês australiano:

  • en-AU_HeidiExpressive
  • en-AU_JackExpressive

As vozes neurais expressivas oferecem discurso de som natural que é excepcionalmente claro, crisp e fluido. As novas vozes estão geralmente disponíveis (GA) para uso na produção. Eles apoiam o uso de ambos os símbolos padrão International Phonetic Alphabet (IPA) e IBM Simbólicos Phonetic Representados (SPR). Para obter mais informações, consulte

Nova voz neural aprimorada coreana

Agora o serviço suporta uma nova voz neural aprimorada para coreano: ko-KR_JinV3Voice. A nova voz está geralmente disponível (GA) para uso de produção. Ele suporta o uso de ambos os símbolos fonéticos padrão do International Phonetic Alphabet (IPA) e do IBM Symbolic Phonetic Representation (SPR). Para obter mais informações, consulte

Nova versão beta Holandesa de voz neural melhorada

O serviço agora suporta uma nova voz feminina neural aprimorada para o holandês neerlandês: nl-NL_MerelV3Voice. Ele suporta o uso de ambos os símbolos fonéticos padrão do International Phonetic Alphabet (IPA) e do IBM Symbolic Phonetic Representation (SPR).

A nova voz é uma funcionalidade beta pendente de conclusão de suporte para SSML... Em seu lançamento inicial, a voz não suporta o uso da seguinte funcionalidade relacionada ao SSML:

  • O elemento <prosody> com qualquer pedido de síntese de discurso
  • Os parâmetros rate_percentage e pitch_percentage com qualquer solicitação de síntese de discurso..
  • O elemento <mark> com uma solicitação de síntese de discurso do WebSocket
  • O parâmetro timings da mensagem de texto JSON com uma solicitação de síntese de discurso WebSocket

Para obter mais informações sobre a nova voz, seu suporte para os símbolos IPA e SPR e a migração para a nova voz das vozes neurais holandesas descontinuadas, consulte

Nova variável de ambiente para recurso customizado de serviços do Speech

Agora, a documentação inclui instruções para criar uma variável de ambiente denominada ${CUSTOM_RESOURCE_SPEECH}. Anexe a nova variável ao script cpd_vars.sh e crie o script para usar a variável em seu ambiente. Para obter mais informações, consulte Informações necessárias para concluir esta tarefa em Instalando Watson Speech Servicesou consulte qualquer um dos tópicos de upgrade para os serviços Speech.

Correção de defeito: a voz canadense francesa agora manipula tempos numéricos corretamente

Correção de defeito: as vozes canadenses francesas agora pronunciam tempos como 19:41 corretamente.. Anteriormente, as vozes estavam omitindo elementos do tempo no áudio sintetizado.

Correção de defeito: a voz japonesa não insere mais áudio inesperado

Correção de defeito: a voz em japonês não insere mais áudio inesperado nos resultados da síntese de fala Anteriormente, áudio adicional era inserido em certos casos.

Correção de defeito: Atualizar símbolos fonéticos coreanos na documentação

Correção de defeito: na documentação para símbolos SPR coreanos, símbolos de dois caracteres para consoantes agora são colocados entre aspas simples, tornando-os um único símbolo. Anteriormente, eles eram mostrados como dois símbolos separados, sem aspas. Para obter mais informações, consulte Consoantes(coreano).

Atualizações de documentação para símbolos IBM SPR

A documentação de visão geral para os símbolos SPR da IBM foi atualizada para esclarecer o uso de símbolos de diversos caracteres Para obter mais informações, consulte Símbolos de som do Speech)

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

29 de março de 2023 (Versão 4.6.4)

A versão 4.6.4 já está disponível
Text to Speech para a versão IBM Cloud Pak for Data 4.6.4 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e as versões Red Hat OpenShift 4.10 e 4.12. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.
Importante: Faça backup dos dados antes de fazer upgrade para a versão 4.6.3 ou 4.6.4
Importante: antes de fazer upgrade para o Watson Speech Services versão 4.6.3 ou 4.6.4, deve-se fazer um backup de seus dados. Preserve o backup em um local seguro.. Para obter mais informações sobre como fazer backup de seus dados de serviços do Watson Speech, consulte Fazendo backup e restaurando Watson Dados de serviços do Speech em Administrando Watson Speech Services. Esse tópico também inclui informações sobre como restaurar seus dados se isso se tornar necessário.
Correção de defeito: Agora é possível alterar os modelos e vozes instalados com as opções de instalação avançadas
Correção de defeito: durante a instalação, agora é possível especificar diferentes modelos ou vozes com as opções de instalação avançadas da interface da linha de comandos... Anteriormente, o serviço sempre instalava os modelos e as vozes padrão A limitação continua a ser aplicada para Watson versões de serviços do Speech 4.6.0, 4.6.2e 4.6.3. Para obter informações sobre como instalar modelos e vozes, consulte Especificando opções de instalação adicionais em Instalando o Watson Speech Services
Configurando tempos limites do balanceador de carga
Watson Os serviços de fala requerem que você mude as configurações de limite do balanceador de carga para o servidor e o cliente para 300 segundos. Essas configurações asseguram que as solicitações de reconhecimento de voz de longa duração, aquelas com áudio longo ou difícil, tenham tempo suficiente para serem concluídas Para obter mais informações, consulte Informações necessárias para concluir essa tarefa em Instalando o Watson Speech Services
Atualizações de documentação para símbolos IBM SPR
A documentação de visão geral para os símbolos SPR da IBM foi atualizada para esclarecer o uso de símbolos de diversos caracteres Para obter mais informações, consulte Símbolos de som de fala.
Vulnerabilidades de segurança abordadas
As vulnerabilidades de segurança a seguir foram corrigidas:

23 de fevereiro de 2023 (Versão 4.6.3)

A versão 4.6.3 já está disponível

Text to Speech para a versão IBM Cloud Pak for Data 4.6.3 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.6.x e a versão Red Hat OpenShift 4.10. Red Hat OpenShift versão 4.8 não é mais suportado. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Problema conhecido: Não é possível alterar os modelos e vozes instalados com as opções avançadas de instalação

Problema conhecido: atualmente não é possível especificar diferentes modelos ou vozes com as opções de instalação avançadas. O serviço sempre instala os modelos e as vozes padrão Para obter informações sobre como alterar os modelos após a instalação, consulte Atualizando modelos e vozes para seus serviços do Watson Speech no tópico Administração de Watson Serviços de fala em IBM Cloud Pak for Data..

Problema conhecido: o upgrade para a versão 4.6.3 pode falhar ao ser concluído

Problema conhecido: ao fazer upgrade para a versão 4.6.3, a tarefa de backup do MinIO pode falhar ao ser excluída na conclusão. Se isso ocorrer, a solução será excluir a tarefa, após a qual o upgrade continuará normalmente Execute as etapas a seguir para resolver o problema.

  1. Para determinar se a tarefa de backup MinIO permanece não excluída, emita o comando a seguir:

    oc get job --namespace {${PROJECT_CPD_INSTANCE} | grep speech-cr-ibm-minio-backup
    

    A tarefa MinIO que não é excluída é identificada por uma entrada do seguinte formato:

    speech-cr-ibm-minio-backup   1/1   3m25s   1d
    
  2. Para excluir a tarefa de backup MinIO, emita o comando a seguir:

    oc delete job speech-cr-ibm-minio-backup --namespace ${PROJECT_CPD_INSTANCE}
    

Quando a tarefa de backup for excluída, o upgrade continuará e será concluído.

Informações adicionais sobre como trabalhar com instâncias de serviço

A documentação agora inclui informações sobre como criar uma instância de serviço com a interface da linha de comandos (cpl-cli) e sobre como gerenciar instâncias de serviço. Para obter mais informações, consulte os tópicos a seguir de serviços do Watson Speech em IBM Cloud Pak for Data:

  • Criando uma instância de serviços do Watson Speech em Configuração de pós-instalação
  • Gerenciando suas instâncias do Watson Speech Services em Administrando
Correção de defeito: o beta Tune por Exemplo agora está disponível

Correção de defeito: O recurso beta Tune by example já está disponível em Text to Speech para IBM Cloud Pak for Data. Anteriormente, não era possível criar modelos de colunas.

Correção de defeito: Especificar números cardinais grandes com o elemento <say-as> não causa mais erros para vozes em inglês

Correção de defeito: agora é possível usar o elemento <say-as> para pronunciar números grandes como números cardinais.. Anteriormente, colocar um número grande no elemento <say-as> com o atributo interpret-as="cardinal" poderia fazer com que a síntese de fala falhasse para vozes em inglês. Por exemplo, <say-as interpret-as="cardinal">3,200</say-as> poderia fazer o serviço gerar um erro. Para obter mais informações, consulte cardinal no tópico Elementos SSML..

Correção de defeito: Homonyms e outras palavras agora são pronunciadas corretamente por vozes em inglês.

Correção de defeito: o serviço agora pronuncia homônimos e outras palavras corretamente baseadas em seu contexto no texto em inglês que deve ser sintetizado. Anteriormente, palavras como advocate e wifi podiam ser pronunciadas incorretamente por vozes em inglês..

Vulnerabilidade de segurança abordada

A seguinte vulnerabilidade de segurança foi corrigida:

30 de janeiro de 2023 (Versão 4.6.2)

A versão 4.6.2 já está disponível

Text to Speech para a versão IBM Cloud Pak for Data 4.6.2 já está disponível. Esta versão é compatível com as versões IBM Cloud Pak for Data 4.6.x e Red Hat OpenShift 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

O recurso personalizado agora inclui uma nova propriedade fileStorageClass

O recurso personalizado para os serviços do Watson Speech agora inclui uma propriedade fileStorageClass além da propriedade blockStorageClass existente. Você especifica as classes de armazenamento de blocos e de arquivo quando instala ou faz o upgrade de um serviço. Durante o upgrade a partir de uma versão anterior, a nova propriedade é adicionada automaticamente ao recurso personalizado pela opção --file_storage_class no comando cli manage apply-cr.

Para obter mais informações sobre as classes de armazenamento disponíveis e de armazenamento de arquivos você usa com cada uma das soluções de armazenamento suportadas, consulte a tabela de Requisitos de armazenamento sob Informações que você precisa para completar esta tarefa na página "Instalando os serviços de Speech Watson " em Watson Discursos de Speech em IBM Cloud Pak for Data.

Informações adicionais sobre provimento de uma instância de serviço

A documentação agora inclui informações sobre a criação de uma instância de serviço programaticamente. Ele também inclui exemplos de instâncias de serviço de listagem e exclusão de uma instância de serviço. Para obter mais informações, consulte Criando uma instância de serviços do Watson Speech na documentação de Configuração de pós-instalação no Watson Serviços do Speech em IBM Cloud Pak for Data.

A criptografia do lado do servidor está ativada para o armazenamento de dados MinIO

O Speech services agora habilitou a criptografia do lado do servidor para armazenamento de objetos no armazenamento de dados MinIO. Nenhuma ação é necessária à sua parte.

Alterar para auditar webhooks

Os Serviços de Fala agora removeram a dependência do webhook de auditoria. Os serviços agora gravam eventos de auditoria diretamente para o servidor. Após a atualização para a versão 4.6.2, alguns recursos do webhook podem permanecer até que todos os serviços possam remover a dependência. Os recursos restantes serão removidos em uma futura liberação. Nenhuma ação é necessária à sua parte.

Novas vozes neurais expressivas inglesas dos EUA

O serviço oferece quatro novas vozes neurais expressivas para o inglês dos EUA:

  • en-US_AllisonExpressive
  • en-US_EmmaExpressive
  • en-US_LisaExpressive
  • en-US_MichaelExpressive

As vozes neurais expressivas oferecem discurso de som natural que é excepcionalmente claro, crisp e fluido. As novas vozes estão geralmente disponíveis (GA) para uso na produção. Eles apoiam o uso de ambos os símbolos padrão International Phonetic Alphabet (IPA) e IBM Simbólicos Phonetic Representados (SPR). Para obter mais informações, consulte

Novos estilos de fala com vozes neurais expressivas

As vozes neurais expressivas determinam o sentimento do texto a partir do contexto de suas palavras e frases. O discurso que eles produzem, além de ter um estilo muito conversador, reflete o humor do texto. Mas você pode embeledar as tendências naturais das vozes indicando que tudo ou um pouco do texto é para enfatizar um dos seguintes estilos de fala:

  • Alegre-Expressa felicidade e boas notícias.
  • Empatético-Expressa empatia ou simpatia.
  • Neutro-Expressa objetividade e evenness.
  • Incerto-Expressa confusão ou incerteza.

Para obter mais informações, consulte Usando estilos de fala.

Nova ênfase de interjeição com vozes neurais expressivas

Com vozes neurais expressivas, o serviço detecta automaticamente um conjunto de interjeições comuns com base no contexto. Quando ela sintetiza essas interjeições, dá a eles a ênfase natural que um humano usaria em conversa normal. Para algumas das interjeições, é possível utilizar o SSML para ativar ou desativar sua ênfase. Para obter mais informações, consulte Interjeições Emphasizing.

Nova palavra emphais com vozes neurais expressivas

As vozes expressivas usam um estilo de conversação que aplica naturalmente a intonação correta a partir do contexto. Mas você pode indicar que uma ou mais palavras devem ser dadas mais ou menos ênfase. A mudança no estresse pode ser indicada por um aumento ou diminuição de pitch, temporalidade, volume ou outros atributos acústicos. Para obter mais informações, consulte Emphasizing words.

O serviço agora reforça validação de SSML mais rígida

O serviço agora reforça uma validação mais rígida de texto de entrada que inclui elementos do Speech Synthesis Markup Language (SSML). Os elementos necessários de atributos devem ser especificados com valores válidos. Caso contrário, a solicitação falhará com um código de erro 400. Para obter mais informações sobre a validação do SSML e os requisitos que o texto de marked-up deve atender, consulte validação SSML.

Correção de defeito: O gênero listado para a voz en-US_MichaelExpressive agora está correto

Defeito corrigido: Quando você lista informações sobre as vozes disponíveis, o gender da voz en-US_MichaelExpressive é agora male. Anteriormente, o gênero da voz foi erroneamente descrito como female. Para obter mais informações, consulte Listando informações sobre vozes.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

30 de novembro de 2022 (Versão 4.6.0)

A versão 4.6.0 já está disponível

Text to Speech para a versão IBM Cloud Pak for Data 4.6.0 já está disponível. Esta versão é compatível com as versões IBM Cloud Pak for Data 4.6.x e Red Hat OpenShift 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Amazon Web Services (AWS) agora é suportado

Watson Os serviços de Speech para IBM Cloud Pak for Data agora são suportados em Amazon Web Services™ (AWS™). Os serviços suportam a Amazon Elastic Block Store, que você especifica configurando a propriedade blockStorageClass do recurso personalizado dos serviços Speech para gp2-csi ou gp3-csi.

Novas classes de armazenamento agora são suportadas

Watson Os serviços de Speech para IBM Cloud Pak for Data agora suportam duas classes de armazenamento adicionais:

  • IBM Cloud Block Storage (ibmc-block-gold)
  • NetApp Trident (ontap-nas)

Você especifica a classe de armazenamento com a propriedade blockStorageClass do recurso personalizado de serviços Speech. Para obter mais informações sobre todas as classes de armazenamento suportadas, veja os tópicos a seguir em Watson Discurso de serviços em IBM Cloud Pak for Data:

  • Antes de começar em Instalando os serviços do Watson Speech
  • Especificando uma classe de armazenamento em Usando o recurso personalizado de serviços Watson Speech
Problema conhecido: Alguns pods de serviços do Watson Speech não possuem anotações que são usadas para agendamento

Conhecida questão: Alguns pods de serviços do Watson Faltam estão faltando a anotação cloudpakInstanceId. Se você usar o serviço de agendamento IBM Cloud Pak for Data, quaisquer pods de serviços Watson Speech sem a anotação cloudpakInstanceId são

  • Agendado pelo planejador padrão Kubernetes em vez do serviço de agendamento
  • Não incluído na aplicação da quota
O monitoramento do armazenamento de dados PostgreSQL agora está disponível

Agora é possível ativar o monitoramento do armazenamento de dados do PostgreSQL para receber atualizações sobre seu uso e status pelos serviços do Watson Speech. Os eventos podem ser consumidos pelo software de monitoramento Prometheus ou qualquer que seja o aplicativo que você use para monitoramento. Ao ativar o monitoramento para projetos definidos pelo usuário, além do monitoramento padrão da plataforma, você pode monitorar seus próprios projetos com a pilha de monitoramento Red Hat® OpenShift® Container Platform. Esta capacidade inclui uma propriedade adicional, spec.global.datastores.postgressql.enablePodMonitor, no recurso personalizado de serviços Speech.

Para obter mais informações, consulte o tópico Monitorando o armazenamento de dados PostgreSQL para os serviços de Watson Speech na seção Administrando de Watson Discursos de Speech em IBM Cloud Pak for Data.

Correção de defeito: o armazenamento de dados do PostgreSQL não é mais instalado se apenas os microserviços de tempo de execução estiverem ativados

Defeito corrigido: O armazenamento de dados PostgreSQL não é mais instalado se apenas os microserviços de tempo de execução estiverem ativados. O armazenamento de dados agora é instalado apenas se pelo menos um dos microserviços sttAsync, sttCustomization ou ttsCustomization estiver instalado. PostgreSQL não é desinstalado se em uma data posterior esses microserviços forem desativados.

Antes da versão 4.6.0, o PostgreSQL foi sempre instalado com os serviços Speech. Se você é um cliente existente que usou apenas os microserviços de tempo de execução dos serviços do Speech antes da versão 4.6.0, o PostgreSQL permanece instalado mas não é usado. Neste caso, a instalação do PostgreSQL persiste através de upgrades.

O armazenamento de dados MinIO é sempre instalado porque os microserviços de tempo de execução dependem dele. O armazenamento de dados RabbitMQ é instalado apenas se o microserviço sttAsync estiver instalado.

Para obter mais informações, consulte Propriedades do Datastore em Usando o recurso personalizado de serviços Watson Speech em Watson Discurso de serviços em IBM Cloud Pak for Data.

Correção de defeito: A criação de uma Política de Rede não é mais necessária para que o operador PostgreSQL monitore seus operandos

Defeito corrigido: Para a versão 4.6.0, não é necessário criar uma Política de Rede para permitir que o operador PostgreSQL monitore seus operandos, conforme descrito na atualização de serviço 10 de novembro de 2022(Versões 4.0.x e 4.5.x). A partir da versão 4.6.0, o serviço manipula essa situação automaticamente.

Novo parâmetro de consulta beta rate_percentage para controlar a taxa de fala global

O serviço oferece um novo parâmetro de consulta rate_percentage para modificar a taxa de fala para um pedido de síntese de fala. A taxa de fala é a velocidade em que o serviço fala o texto que ele sintetiza em discurso. Uma taxa mais alta faz com que o texto seja falado mais rapidamente; uma taxa menor faz com que o texto seja falado mais lentamente. O parâmetro altera a taxa de inadimplência por voz para um pedido inteiro. Para obter mais informações, consulte Modificando a taxa de fala.

Novo parâmetro de consulta beta pitch_percentage para controlar o pitch de fala global

O serviço oferece um novo parâmetro de consulta pitch_percentage para modificar o pitch de fala para uma solicitação de síntese. O pitch de fala representa o tom do discurso que o serviço sintetiza. Ele representa o quão alto ou baixo o tom da voz é percebido pelo ouvinte. Um pitch superior resulta em discurso que é falado em um tom mais alto e é percebido como uma voz mais alta; um pitch inferior resulta em discurso que é falado em um tom mais baixo e é percebido como uma voz inferior. O parâmetro altera o pitch padrão por voz para um pedido inteiro. Para obter mais informações, consulte Modificando o pitch de fala.

Correção de defeitos: traduções de palavras personalizadas agora aceitam vírgulas em todos os casos

Correção de defeitos: traduções do Word adicionadas a modelos personalizados agora aceitam vírgulas em todos os casos. Anteriormente, uma vírgula em uma tradução poderia ocasionalmente fazer com que a tradução falhe em gerar áudio válido quando usado para as sinteses de fala. Este problema foi identificado em modelos personalizados de inglês dos EUA.

Correção de defeito: A síntese francesa de datas é agora consistente

Correção de defeito: A síntese francesa não inclui mais o artigo "le" antes das datas da forma "a ordinal do mês." Anteriormente, o artigo foi incluído apenas para o primeiro dia do mês para o francês (por exemplo, "o primeiro de setembro", "le premier septembre").

Correção de defeito: a síntese japonesa é melhorada para manipular longas cadeias de texto de entrada

Defeito corrigido: O serviço agora sintetiza corretamente as solicitações japonesas que incluem longas cadeias de caracteres. Anteriormente, o serviço não conseguiu sintetizar adequadamente cadeias muito longas do texto japonês.

Correção de defeito: Adicionar regras para documentação de nomenclatura do modelo personalizado

Defeito corrigido: A documentação agora fornece regras detalhadas para nomear modelos personalizados. Para obter mais informações, consulte

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

10 de novembro de 2022 (Versões 4.0.x e 4.5.x)

Problema conhecido: Política de Rede Atualizada necessária para o operador PostgreSQL

Questão conhecida: Para a versão de serviços Speech 4.0.x (não incluindo a versão 4.0.0) e 4.5.x, se o operador PostgreSQL e os serviços Speech estão instalados em diferentes espaços de nomes, o operador PostgreSQL não é capaz de monitorar os operandos do PostgreSQL para os serviços do Speech. O operador é impedido de monitorar os operandos pela Política de Rede que está em vigor para os serviços do Discurso.

Este problema não impede que o cluster PostgreSQL funcione corretamente. O cluster permanece ativo e totalmente funcional. No entanto, o operador não é capaz de atualizar os operandos quando você se atualizar para novas versões dos serviços do Speech.

A solução para o problema é criar uma Política de Rede adicional para o operador PostgreSQL, conforme mostrado nas etapas a seguir. Você pode executar as etapas independentemente de se o operador PostgreSQL é instalado no mesmo espaço de nomes dos serviços do Speech ou em um namespace diferente.

  1. Faça login como administrador do projeto Red Hat® OpenShift® onde os serviços Speech estão instalados.

  2. Digite o seguinte comando para atualizar a Política de Rede para os serviços do Speech:

    cat << EOF | oc apply -f -
    apiVersion: networking.k8s.io/v1
    kind: NetworkPolicy
    metadata:
      labels:
        app.kubernetes.io/component: stt
        app.kubernetes.io/instance: {{ <custom-resource-name> }}
        app.kubernetes.io/name: speech-to-text
        release: {{ <custom-resource-name> }}
      name: <custom-resource-name>-postgres-network-policy
      namespace: {{ <cpd-instance-namespace> }}
    spec:
      ingress:
      - from:
        - namespaceSelector: {}
          podSelector:
            matchLabels:
              app.kubernetes.io/name: cloud-native-postgresql
    EOF
    

    em que

    • <custom-resource-name> é o nome do recurso personalizado de serviços de fala. O nome recomendado para a versão 4.0.x é speech-prod-cr; o nome recomendado para a versão 4.5.x é speech-cr.
    • <cpd-instance-name> é o nome do projeto (namespace) no qual os serviços do Speech estão instalados. A documentação utiliza a variável de ambiente ${PROJECT_CPD_INSTANCE} para identificar o espaço de nomes.
  3. Para verificar se a Política de Rede atualizada permite que o operador monitore os operandos e que o cluster do PostgreSQL esteja em um estado saudável, digite o seguinte comando, em que <custom-resource-name> e <cpd-instance-name> são os valores que utilizou na etapa anterior:

    oc -get cluster {{ <custom-resource-name> }}-postgres -n {{ <cpd-instance-namespace> }}
    

    Se o cluster PostgreSQL estiver funcionando adequadamente, o comando produz saída similar ao seguinte:

    NAME                 AGE   INSTANCES   READY   STATUS                     PRIMARY
    speech-cr-postgres   14d   3           3       Cluster in healthy state   speech-cr-postgres-1
    

Essas etapas não fazem com que o operador atualize os operandos para as versões mais recentes. No entanto, os operandos são atualizados conforme o esperado quando você faz a próxima atualização do software de serviços Speech.

13 de outubro de 2022 (Versão 4.5.3)

A versão 4.5.3 já está disponível

Text to Speech para a versão IBM Cloud Pak for Data 4.5.3 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Eventos de auditoria estão disponíveis para os serviços do Speech

O Serviço de Logging de Auditoria IBM Cloud Pak for Data Gera e encaminha eventos de auditoria para os serviços Speech to Text e Text to Speech. Os eventos de auditoria correspondem aos que estão disponíveis para o Activity Tracker com o serviço público. Para obter mais informações, consulte Eventos de auditoria.

Não é possível desinstalar componentes do serviço Speech individual

A documentação agora observa que não é possível desinstalar componentes de serviços individuais (microserviços) uma vez que eles estejam instalados. Para remover qualquer um dos componentes a seguir, você deve desinstalar os serviços Watson Speech em sua totalidade e reinstalar apenas os componentes necessários: Speech to Text tempo de execução, Speech to Text HTTP assíncrono, Speech to Text personalização, Text to Speech tempo de execução e Text to Speech personalização. Para obter mais informações sobre a instalação dos serviços de fala, consulte Watson Serviços de fala em IBM Cloud Pak for Data.

Novo parâmetro beta spell_out_mode para vozes alemãs

Para indicar como caracteres individuais de uma string devem ser digitados, você pode agora incluir o parâmetro de consulta beta spell_out_mode com um pedido de síntese para uma voz alemã. Por padrão, o serviço espelha caracteres individuais na mesma taxa em que ele sintetiza texto para um idioma. Você pode usar o parâmetro para direcionar o serviço para soletrar caracteres individuais de forma mais lenta, em grupos de um, dois ou três caracteres. Use o parâmetro com o elemento SSML <say-as> para controlar como os caracteres de uma string são sintetizados. Para obter mais informações, consulte Especificando como as strings são grafadas fora.

Limitação conhecida com o uso do formato de áudio Ogg com o navegador Safari

Por padrão, o serviço retorna áudio no formato de áudio Ogg com o codec Opus (audio/ogg;codecs=opus). No entanto, o formato de áudio Ogg não é suportado com o navegador Safari. Se você estiver usando o serviço Text to Speech com o navegador Safari, você deve especificar um formato diferente no qual deseja o serviço para retornar o áudio.

Solução de resolução de problemas da versão 4.0.x para a versão 4.5.x

Ao fazer o upgrade dos serviços do Speech da versão 4.0.x para a versão 4.5.x, você pode encontrar um problema onde os pods PostgreSQL ficam presos no estado Terminating. Se esse problema ocorrer durante o seu upgrade, execute as seguintes etapas para resolver o problema. As informações e as etapas também estão documentadas em Upgradando Watson Speech services da Versão 4.0 para a Versão 4.5 no tópico Upgradin de Watson Discurso de serviços em IBM Cloud Pak for Data.

  1. Utilize o seguinte comando para identificar pods que permanecem no estado Terminating:
oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | awk {'print $1'}
  1. Use o seguinte comando para configurar a variável de ambiente pods para incluir a lista de pods que permanecem no estado Terminating:
pods=$(oc get pods -n ${PROJECT_CPD_INSTANCE} -o wide | grep Terminating | awk {'print $1'})
  1. Use o seguinte comando para excluir os pods presos para que o processo de atualização possa continuar:
oc delete pod $pods -n ${PROJECT_CPD_INSTANCE} --force=true --grace-period=0
Atualizações de documentação para o elemento SSML <prosody>

A documentação para o elemento SSML <prosody> e seus parâmetros pitch e rate foi melhorada e esclarecida. Ele também inclui agora uma descrição das diferenças entre o serviço e a versão mais recente da especificação SSML. Para obter mais informações, consulte O elemento <prosody>.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

3 de agosto de 2022 (Versão 4.5.1)

A versão 4.5.1 já está disponível
Text to Speech para a versão IBM Cloud Pak for Data 4.5.1 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.
Suporte para clusters habilitados pelo sistema
Ambos Text to Speech para IBM Cloud Pak for Data e Speech to Text para IBM Cloud Pak for Data agora suportam rodar em clusters habilitados pelo Federal Information Processing Standard (por parte do sistema de processamento de informações). Para obter mais informações, consulte Serviços que suportam o SSL.
Correção de defeito: Cálculos de armazenamento efêmeros fixos para evitar despejos de podas ocasionais
Correção de defeitos: Um defeito foi corrigido e cálculo de limites de armazenamento efêmeros é agora mais preciso para o Text to Speech para IBM Cloud Pak for Data e Speech to Text para IBM Cloud Pak for Data runtimes. Essas alterações previnem despejos de poda ocasionais quando os tempos de execução dos serviços estão sob carga pesada.
O serviço não suporta a síntese de fala multilíngue
O serviço não suporta a síntese de fala multilíngue neste momento. No entanto, você pode usar a customização para aproximar a pronúncia de palavras de outras línguas. Para obter mais informações, consulte Síntese de fala multilingual.
Vulnerabilidades de segurança abordadas
As vulnerabilidades de segurança a seguir foram corrigidas:

29 de junho de 2022 (Versão 4.5.0)

A versão 4.5.0 já está disponível
Text to Speech para a versão IBM Cloud Pak for Data 4.5.0 já está disponível. Esta versão é compatível com a versão IBM Cloud Pak for Data 4.5.x e as versões Red Hat OpenShift 4.6, 4.8 e 4.10. Para obter mais informações, consulte Watson Serviços de fala em IBM Cloud Pak for Data.
Serviços de Discurso Unificado para a documentação IBM Cloud Pak for Data
A documentação de instalação e administração para ambos Speech to Text e Text to Speech é agora combinada na documentação do IBM Cloud Pak for Data. Para mais informações sobre como instalar e gerenciar os serviços do Speech, consulte Watson Discurso de serviços em IBM Cloud Pak for Data.
Mudanças no recurso personalizado dos serviços Speech
O recurso personalizado agora é criado quando você instala inicialmente os serviços do Speech. O processo é descrito na documentação de instalação do IBM Cloud Pak for Data. O conteúdo do recurso personalizado mudou:
  • O nome recomendado do recurso personalizado mudou de speech-prod-cr para speech-cr.
  • Todas as referências à classe de armazenamento mudaram de variantes de storageClass para blockStorageClass.
  • O nome da classe de armazenamento do bloco Portworx mudou de portworx-shared-gp3 para portworx-db-gp3-sc.
  • A propriedade createSecret foi removida para os datastores MinIO e PostgreSQl. A propriedade é usada apenas internamente. O Discurso serviços sempre usa um objeto de segredos se você criar um, e eles sempre criam automaticamente o objeto se nenhum for fornecido.
Objeto de segredos fornecido pelo usuário agora suportado para o armazenamento de dados RabbitMQ
Agora é possível fornecer credenciais de segurança para o armazenamento de dados RabbitMQ, assim como você pode para os datastores MinIO e PostgreSQL. O processo documentado é semelhante para todos os três datastores.
Correção de defeito: diversas tags SSML <phoneme> consecutivas agora são analisadas corretamente
Correção de defeito: o serviço agora sintetiza corretamente o texto que contém tags <phoneme> consecutivas. Anteriormente, se o texto continha duas ou mais tags <phoneme> consecutivas, o serviço sintetizava apenas a primeira tag, ignorando as demais.
Vulnerabilidades de segurança abordadas
Não foram corrigidas vulnerabilidades de segurança para a versão 4.5.0.

25 de maio de 2022 (Versão 4.0.9)

A versão 4.0.9 já está disponível
Text to Speech for IBM Cloud Pak for Data versão 4.0.9 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.
Novo suporte para o formato de áudio audio/alaw
Agora, a lista de formatos de áudio suportados inclui audio/alaw;rate={rate}. Como audio/basic e audio/mulaw, esse formato fornece um áudio de canal único que é codificado usando dados u-law (ou mu-law) de 8 bits amostrados em 8 kHz. Para obter mais informações, consulte Usando formatos de áudio.
Os serviços do Speech não suportam o utilitário de backup e restauração do OADP.
Os serviços do Watson Speech não suportam o utilitário de backup e restauração IBM Cloud Pak for Data OpenShift APIs for Data Protection (OADP). Se os serviços do Speech estiverem instalados em um cluster, não será possível usar o utilitário de backup e restauração IBM Cloud Pak for Data OADP para fazer backup de outros serviços instalados naquele cluster. Essa limitação aplica-se à versão 4.0.0 e mais recentes dos serviços do Speech.
Vulnerabilidades de segurança abordadas
As vulnerabilidades de segurança a seguir foram corrigidas:

1º de maio de 2022 (Versão 1.2.x)

Importante: término de serviço para o Text to Speech versão 1.2.x no IBM Cloud Pak for Data versão 3.5
**Importante: o ** Text to Speech versão 1.2.x no IBM Cloud Pak for Data versão 3.5 está fora de serviço desde 1º de maio de 2022. Text to Speech versão 1.2.x não é mais suportado, disponível ou documentado. Para obter mais informações sobre o Término de serviço para o Text to Speech, que faz parte do Watson API Kit, consulte Descontinuação de suporte de software: IBM Watson API Kit para IBM Cloud Pak for Data 1.2.x.

27 de abril de 2022 (Versão 4.0.8)

A versão 4.0.8 já está disponível

O Text to Speech for IBM Cloud Pak for Data versão 4.0.8 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Novas variáveis de ambiente usadas na documentação do IBM Cloud Pak for Data

A maioria dos comandos na documentação do Text to Speech para IBM Cloud Pak for Data foram atualizados para usar um conjunto comum de variáveis de ambiente. A documentação fornece um script para exportar automaticamente as variáveis de ambiente antes de executar comandos de instalação, upgrade e administração. Depois de extrair o script, é possível copiar a maioria dos comandos da documentação e executá-los sem fazer nenhuma mudança.

As variáveis de ambiente que o script define incluem o seguinte:

  • ${PROJECT_CPD_INSTANCE} identifica o projeto em que você planeja instalar o IBM Cloud Pak for Data e os serviços do Speech.
  • ${PROJECT_CPD_OPS} identifica o projeto para o operador da plataforma IBM Cloud Pak for Data.
  • ${PROJECT_CPFS_OPS} identifica o projeto para o IBM Cloud Pak for Data foundational services.

Para obter mais informações sobre o uso das variáveis de ambiente, consulte Melhor prática: Configurando variáveis de instalação.

A propriedade ttsVoiceMarginalCPU não é mais documentada

A propriedade ttsVoiceMarginalCPU foi removida da documentação para o recurso customizado dos serviços do Speech. A propriedade gerencia a compensação entre simultaneidade e velocidade de síntese de discurso. O valor padrão de 400 garante um balanceamento razoável para a maioria dos clientes e mantém a síntese em tempo real.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

30 de março de 2022 (Versão 4.0.7)

A versão 4.0.7 já está disponível

O Text to Speech for IBM Cloud Pak for Data versão 4.0.7 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Propriedade de recurso customizado para especificação de uma voz padrão

A voz padrão para a síntese de discurso e as solicitações de pronúncia é en-US_MichaelV3Voice. Se você não instalar o en-US_MichaelV3Voice, deverá

  • Use o parâmetro voice para passar a voz que deve ser usada com cada solicitação.
  • Especificar uma nova voz padrão para a sua instalação do Text to Speech for IBM Cloud Pak for Data usando a propriedade defaultTTSVoice no recurso customizado dos serviços do Speech. Para mais informações, consulte Instalando Watson Text to Speech e Usando a voz padrão.
Mudar para resposta de sincronização da palavra para a interface WebSocket

O objeto de resposta que o serviço envia quando você solicita sincronizações de palavra com a interface WebSocket mudou. O serviço agora envia resultados de sincronização de palavra em uma única matriz que inclui uma sequência seguida por dois flutuantes:

{
  "words": [
    ["Hello", 0.0, 0.259],
    ["world", 0.259, 0.532]
  ]
}

O serviço anteriormente enviava resultados de sincronização como uma matriz que incluía uma sequência seguida por uma matriz de dois flutuantes:

{
  "words": [
    ["Hello", [0.0629826778195474, 0.2590192737303819]],
    ["world", [0.2598829173456253, 0.5322130804452672]]
  ]
}

Também, o nível de precisão para as sincronizações e as marcas de palavra agora está reduzido a três casas decimais. Para obter mais informações sobre as novas respostas, consulte Gerando timings de palavras.

Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir foram corrigidas:

23 de fevereiro de 2022 (Versão 4.0.6)

Versão 4.0.6 já está disponível

Text to Speech para IBM Cloud Pak for Data versão 4.0.6 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Todas as vozes neurais agora estão descontinuadas para o IBM Cloud Pak for Data

As vozes neurais que estavam disponíveis com o Text to Speech para IBM Cloud Pak for Data agora estão descontinuadas. As vozes neurais continuam a estar disponíveis para os usuários do Text to Speech para IBM Cloud. Apenas as vozes neurais aprimoradas continuam a estar disponíveis para os usuários do Text to Speech para IBM Cloud Pak for Data.

Todas as vozes para os seguintes idiomas estão agora descontinuadas para IBM Cloud Pak for Data:

  • Árabe
  • Chinês (mandarim)
  • Tcheco
  • Holandês (Bélgica)
  • Holandês (Países Baixos)
  • Inglês (Austrália)
  • Coreano
  • Sueco

Os usuários existentes dessas vozes podem continuar a usá-las por enquanto, mas as vozes serão removidas inteiramente em uma liberação futura. Essas vozes não podem mais ser instaladas por novos usuários e foram removidas da documentação de instalação para IBM Cloud Pak for Data. A propriedade voiceType foi removida do recurso customizado dos serviços Speech.

Para obter mais informações, consulte

Atualizações para importar/exportar scripts

Os scripts import_export.sh e transfer_ownership.sh foram atualizados. Esses scripts são usados para importar e exportar dados entre clusters, fazer backup e restaurar dados, além de migrar dados da versão 3.5 para a versão 4.0.x. Os scripts foram modificados e melhorados da seguinte forma:

  • O script transfer_ownership.sh agora requer uma opção -c para ser incluído na linha de comandos antes do argumento <custom_resource_name>.
  • O script transfer_ownership.sh agora requer uma opção -v <version> e argumento para indicar a versão para a qual a propriedade de recursos está sendo transferida. Especifique 35 para a versão 3.5 ou 40 para a versão 4.0.x.
  • O script transfer_ownership.sh agora requer uma opção -p para ser incluído na linha de comandos antes do argumento <postgres_auth_secret_name>.
  • O argumento <postgres_auth_secret_name> fornece o segredo Kubernetes que é usado para autenticar o armazenamento de dados PostgreSQL ao qual você está transferindo a propriedade. É possível omitir o segredo de autenticação se ele é o mesmo que o valor padrão (<custom-resource-name>-postgres-auth-secret para a versão 4.0.x, user-provided-postgressql para a versão 3.5). Será necessário fornecer o segredo se ele for diferente do valor-padrão.
  • Ambos os scripts agora incluem uma opção -h (--help) para exibir informações sobre o script e seu uso.

Para obter mais informações, consulte

Recomendação atualizada para o OpenShift Container Storage

A partir dos serviços do Speech versão 4.0.6, a classe de armazenamento recomendada para o OpenShift Container Storage é ocs-storagecluster-ceph-rbd.

  • Se você estiver instalando os serviços do Speech 4.0.6 ou fazendo upgrade para os serviços do Speech 4.0.6 por meio do IBM Cloud Pak for Data versão 3.5, especifique a classe de armazenamento ocs-storagecluster-ceph-rbd durante a instalação ou upgrade.
  • Se você estiver fazendo upgrade para os serviços do Speech 4.0.6 por meio de uma atualização anterior do Cloud Pak for Data versão 4.0, continue a usar o ocs-storagecluster-cephfs. Não é possível mudar o armazenamento que é usado em uma implementação existente.

O valor é especificado com a propriedade storageClass no recurso customizado dos serviços Speech:

################
# Storage class
################
  storageClass: "ocs-storagecluster-ceph-rbd"

Os serviços do Speech funcionam com qualquer versão do OpenShift Container Storage. A versão recomendada mais recente tem permissões de acesso mais restritivas. Para obter mais informações, consulte

31 de janeiro de 2022 (Versão 4.0.5)

A versão 4.0.5 foi atualizada

O Text to Speech para IBM Cloud Pak for Data versão 4.0.5 foi atualizado para tratar problemas de instalação. A versão do pacote de casos agora é a 4.0.6. Use este pacote em vez do pacote versão 4.0.5. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Importante: etapas extras para instalação espelhada não são mais necessárias

Importante: as Notas sobre a liberação de 26 de janeiro de 2022 incluem notas importantes para as etapas a seguir:

  • Etapa adicional para realizar uma instalação espelhada do armazenamento de dados MinIO
  • Etapas adicionais para a realização de uma instalação espelhada de novos modelos de última geração

Essas etapas adicionais não são mais necessárias. O pacote de casos foi atualizado para corrigir os problemas de instalação.

26 de janeiro de 2022 (Versão 4.0.5)

A versão 4.0.5 já está disponível

O Text to Speech para IBM Cloud Pak for Data versão 4.0.5 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Importante: etapa adicional para a realização de uma instalação espelhada do armazenamento de dados do MinIO

Importante: Essas etapas não serão mais necessárias se você instalar o pacote de caso 4.0.6. Para obter mais informações, consulte 31 de janeiro de 2022(versão 4.0.5).

Se você estiver realizando uma instalação espelhada (por exemplo, em um ambiente fisicamente isolado), será necessário realizar uma etapa adicional antes de concluir qualquer uma das etapas a seguir:

Esta etapa é obrigatória para copiar as imagens necessárias para o armazenamento de dados MinIO:

echo 'cp.icr.io,cp/opencontent-minio-client,1.1.4,sha256:7b4cf5e47a0455cfa7ca9ab246b80916e4dccbc1483b3e0f276fb7b0ab3e5c60,IMAGE,linux,x86_64,"",0,CASE,"",""' \
>> $CASE_PATH/ibm-watson-speech-4.0.5-images.csv

A falha na execução desta etapa causará erros de instalação para ambos, Text to Speech e Speech to Text.

O servidor de licença agora é instalado automaticamente

O operador de serviços Speech agora instala automaticamente o servidor de licença requerido quando instala os serviços do Speech. Não é mais necessário instalar o servidor de licença por meio dos serviços de base do IBM Cloud Pak for Data e não é mais necessário utilizar conteúdo YAML adicional para criar um OperandRequest com as ligações necessárias.

Remoção de etapas específicas para o servidor PostgreSQL EnterpriseDB

A versão anterior da documentação incluiu etapas para o servidor PostgreSQL EnterpriseDB que eram específicas para os serviços do Speech. Essas etapas foram documentadas nos tópicos Fazendo upgrade do Watson Text to Speech (Versão 4.0) e Desinstalando o Watson Text to Speech. Essas etapas adicionais não são mais necessárias e foram removidas da documentação.

O armazenamento de dados RabbitMQ agora é usado apenas pelo componente sttAysnc

O armazenamento de dados RabbitMQ era usado anteriormente por componentes de ambos os serviços Speech, Speech to Text e Text to Speech. Ele agora trata do enfileiramento de mensagem não persistente para o componente HTTP assíncrono Speech to Text (sttAsync) apenas. Ele será usado apenas se o componente sttAsync estiver instalado e ativado.

Novas vozes neurais holandesa da Bélgica e tcheca

Duas novas vozes neurais estão agora disponíveis:

  • Holandês da Bélgica: Uma nova voz masculina em holandês da Bélgica (flamengo), nl-BE_BramVoice.
  • Tcheco: Um novo idioma, tcheco, com uma nova voz feminina, cs-CZ_AlenaVoice.

É possível instalar as novas vozes juntamente com todas as vozes neurais, configurando a propriedade voiceType do recurso customizado como neuralVoices.

Correção de defeito: Atualizar documentação SSML

Correção de defeito: A documentação do SSML foi atualizada para corrigir os seguintes erros:

  • Os exemplos do elemento <break> agora estão corretos. O elemento é unário, como agora mostrado nos exemplos. Os exemplos anteriores incluíam tags de abertura e de fechamento com texto integrado. O texto integrado não foi falado pelo serviço. Para obter mais informações, consulte O elemento <break>.
  • O serviço suporta o Speech Synthesis Markup Language (SSML) versão 1.1. Todas as referências e exemplos agora usam a versão correta. A documentação anteriormente se referia à versão 1.0.
Vulnerabilidades de segurança abordadas

As vulnerabilidades de segurança a seguir associadas ao Apache Log4j foram corrigidas:

20 de dezembro de 2021 (Versão 4.0.4)

Versão 4.0.4 já está disponível

O Text to Speech para IBM Cloud Pak for Data versão 4.0.4 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

Importante: Mudanças em propriedades para desativação do armazenamento e registro de dados do usuário

Importante: os nomes das propriedades do recurso customizado dos serviços Speech que especificam se os dados do usuário são armazenados e registrados foram mudados. O recurso customizado anteriormente continha as propriedades a seguir:

#################
# Anonymize logs
#################
  sttRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    anonymizeLogs: "false"  # If true, disables storage and logging of user data

Essas propriedades são agora nomeadas da seguinte forma:

###################################
# Storage and logging of user data
###################################
  sttRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  sttAMPatcher:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data
  ttsRuntime:
    skipAudioAndResultLogging: "false"  # If true, disables storage and logging of user data

Se você já configurou essas propriedades em seu recurso customizado para mudar o valor padrão de false para true, é necessário editar o seu recurso customizado. Deve-se mudar manualmente os nomes das propriedades para os novos valores e salvar o recurso customizado atualizado. Para obter mais informações, consulte Instalando Watson Text to Speech.

Importante: Mudanças em propriedades de objeto de segredos PostgreSQL

Importante: Ao instalar os serviços do Speech, um objeto que contém uma senha gerada aleatoriamente para o armazenamento de dados PostgreSQL é criado por padrão. É possível escolher em vez de especificar a senha manualmente. Se você o fizer, as propriedades do arquivo YAML para o objeto de segredos foram mudadas. Para obter mais informações, consulte o tópico sobre o gerenciamento de seus datastores em Administrando Watson Text to Speech.

Importante: ops pods do PostgreSQL não começam com o operador EnterpriseDB versão 1.10

Importante: Com o Text to Speech para IBM Cloud Pak for Data versão 4.0.3, os pods do PostgreSQL pods baseados no operador EnterpriseDB versão 1.10 podem falhar ao iniciar. Isso impede que os serviços do Speech iniciem. Uma solução alternativa existe para esse problema. Se os serviços do Speech não conseguirem iniciar, consulte PostgreSQL pods do not start with EnterpriseDB version 1.10 operator para obter informações sobre como diagnosticar e resolver o problema.

Esse problema foi corrigido no Text to Speech para IBM Cloud Pak for Data versão 4.0.4.

Novo suporte para classe de armazenamento do IBM Spectrum Scale Container Native

Desde a versão 4.0.3, os serviços do Speech suportam a classe de armazenamento do IBM Spectrum® Scale Container Native. Para usar o IBM Spectrum Scale, especifique "ibm-spectrum-scale-sc" para a propriedade storageClass do recurso customizado dos serviços Speech. Para obter mais informações, consulte Instalando Watson Text to Speech.

Interação dos serviços do Speech com o armazenamento de dados MinIO durante a instalação

Os componentes de tempo de execução dos serviços do Speech, sttRuntime e ttsRuntime, não podem começar até que os modelos e vozes para os serviços sejam totalmente transferidos por upload para o armazenamento de dados MinIO. Durante a instalação, os serviços podem falhar e automaticamente reiniciar sozinhos uma ou mais vezes até que o upload dos modelos e vozes esteja concluído. Eles então iniciam corretamente. Nenhuma ação do usuário é necessária.

Correção de defeito: Melhorar a documentação de upgrade

Correção de defeito: Documentação para upgrade dos serviços do Speech para novas versões do IBM Cloud Pak for Data versão 4.0.x incluiu referências incorretas em alguns comandos. Essas referências estão agora corretas:

  • As sequências watsonSpeechToTextStatus e watsonTextToSpeechStatus foram mudadas para speechStatus em ambos os casos.
  • As sequências status.watsonSpeechToTextVersion e status.watsonTextToSpeechVersion foram mudadas para .spec.version em ambos os casos.

Para obter mais informações, consulte Atualizando Watson Text to Speech.

Correção de defeito: Melhorar a SSML e a síntese de fala

Correção de defeitos: Os seguintes defeitos da Speech Synthesis Markup Language (SSML) e da síntese de fala foram corrigidos com esta versão:

  • O atributo pitch do elemento <prosody> agora é aplicado a todo o texto especificado. Anteriormente, a mudança de tom nem sempre era aplicada à primeira palavra do texto afetado. Também, a documentação agora inclui orientação adicional sobre a especificação de um valor pitch. Para obter mais informações, consulte O atributo pitch.
  • A síntese de discurso do texto japonês agora fala o áudio mais lentamente. Anteriormente, o discurso sintetizado era falado muito rapidamente. Se você descobrir que a síntese do texto japonês ainda é falada muito rapidamente para a sua aplicação, use o atributo rate do elemento SSML <prosody> para controlar o ritmo da fala. Para obter mais informações, consulte O atributo rate.
  • As vozes neurais agora analisam o caractere de apóstrofo escapado (&apos;) adequadamente. Anteriormente, algumas vozes neurais não interpretavam o caractere adequadamente.
Vulnerabilidade de segurança abordada

A vulnerabilidade de segurança a seguir associada ao Apache Log4j foi corrigida:

20 de dezembro de 2021 (Versão 1.2.x)

Importante: não é mais possível instalar o Text to Speech versão 1.2.x no IBM Cloud Pak for Data versão 3.5

Importante: não é mais possível realizar novas instalações do Text to Speech versão 1.2.x no IBM Cloud Pak for Data versão 3.5. É possível instalar apenas o Text to Speech versão 4.0.x no IBM Cloud Pak for Data versão 4.x. Para obter mais informações, consulte Instalando Watson Text to Speech.

Os serviços do Speech para IBM Cloud Pak for Data versão 3.5 chegam à sua data de fim de suporte em 30 de abril de 2022. Você é encorajado a fazer upgrade para a liberação mais recente da versão 4.0.x dos serviços assim que puder. Para obter mais informações, consulte Atualizando Watson Text to Speech.

30 de novembro de 2021 (Versão 4.0.3)

A versão 4.0.3 já está disponível

Text to Speech para IBM Cloud Pak for Data versão 4.0.3 já está disponível. Esta versão suporta IBM Cloud Pak for Data versão 4.x e Red Hat OpenShift versões 4.6 e 4.8. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando Watson Text to Speech.

O servidor de licença agora é um pré-requisito obrigatório

Agora é necessário instalar o servidor de licença por meio dos serviços de base do IBM Cloud Pak for Data. Deve-se instalar o servidor de licença usando o conteúdo YAML que é fornecido para criar um OperandRequest com as ligações necessárias. Também se deve instalar o serviço de licença no mesmo espaço de nomes do serviço (operando), que também é onde o IBM Cloud Pak for Data está instalado. Para obter mais informações, consulte Instalando Watson Text to Speech.

Novo suporte para upgrade no local

O serviço agora suporta upgrade baseado em operador no local da versão 4.0.0 para a versão 4.0.3. A movimentação do IBM Cloud Pak for Data versão 3.5 para a versão 4.0.3 continua a exigir uso de utilitários de migração. Para obter mais informações, consulte Atualizando Watson Text to Speech.

Mudanças na instalação do operador e da licença do EDB PostgreSQL

A instalação, o upgrade e a desinstalação para o operador e a licença do Enterprise DB PostgreSQL mudaram:

  • Instruções para instalação do operador e da licença do EDB PostgreSQL estão agora incluídas com os serviços de base do IBM Cloud Pak for Data. As instruções para instalação dos serviços do Speech foram atualizadas em conformidade. Para obter mais informações, consulte Instalando Watson Text to Speech.
  • Instruções para upgrade do Text to Speech versão 4.0.0 para 4.0.3 incluem instruções para desinstalar o operador EDB PostgreSQL anterior e licenciá-los e reinstalando-os com os serviços de base do IBM Cloud Pak for Data. Para obter mais informações, consulte Atualizando Watson Text to Speech.
  • As instruções para desinstalar os serviços do Speech agora incluem etapas para remoção do operador e da licença do EDB PostgreSQL que foram previamente instalados com o Text to Speech. Para obter mais informações, consulte Desinstalando Watson Text to Speech.
Nova orientação para escalar sua instalação

O serviço agora fornece orientação atualizada sobre o ajuste de escala da sua instalação. As informações incluem especificar o número de pods e o número máximo de sessões simultâneas para as vozes neurais ou neurais aprimoradas. Para obter mais informações, consulte Administrando Watson Text to Speech.

Atualizações de linha de comandos para importar e exportar utilitários

Os comandos que são usados com os utilitários de importação e exportação para os serviços do Speech incluem novas opções e argumentos. Os utilitários de importação e exportação também são a base para o backup e a restauração dos serviços e para a migração do IBM Cloud Pak for Data versão 3.5 para a versão 4.0.3. Para obter mais informações sobre o uso dutilitários, consulte

Nova propriedade para gerenciamento de simultaneidade e síntese de discurso

A nova propriedade global.ttsVoiceMarginalCPU gerencia a troca entre a velocidade de síntese de simultaneidade e de fala. O valor padrão de 400 oferece um balanceamento razoável para a maioria dos clientes e mantém a síntese em tempo real. Para obter informações sobre a modificação desse valor para se adequar às suas necessidades, entre em contato com o Suporte da IBM.

Novo suporte para vozes neurais

Todas as vozes neurais que estão disponíveis atualmente para o Text to Speech para IBM Cloud agora também estão disponíveis para instalação no Text to Speech para IBM Cloud Pak for Data. Os idiomas e vozes a seguir estão agora disponíveis:

  • Árabe: ar-MS_OmarVoice
  • Chinês (Mandarim): zh-CN_LiNaVoice, zh-CN_WangWeiVoice e zh-CN_ZhangJingVoice
  • Holandês (Bélgica): nl-BE_AdeleVoice
  • Holandês (Países Baixos): nl-NL_EmmaVoice e nl-NL_LiamVoice
  • Inglês (Austrália): en-AU_CraigVoice, en-AU_MadisonVoice e en-AU_SteveVoice
  • Coreano: ko-KR_HyunjunVoice, ko-KR_SiWooVoice, ko-KR_YoungmiVoice e ko-KR_YunaVoice
  • Sueco: sv-SE_IngridVoice

Para obter mais informações sobre todos os idiomas e vozes disponíveis, consulte Idiomas e vozes.

Instalando vozes

É possível instalar as vozes neurais aprimoradas ou as vozes neurais. É possível instalar apenas um dos dois tipos de vozes. Ao instalar o serviço, use a propriedade voiceType do recurso customizado para indicar as vozes que devem ser instaladas:

  • Especifique enhancedNeuralVoices para instalar as vozes neurais aprimoradas. Deve-se, então, especificar as vozes neurais aprimoradas individuais que devem ser instaladas. Por padrão, apenas en-US_AllisonV3Voice, en-US_LisaV3Voice e en-US_MichaelV3Voice estão instalados. É possível optar por instalar essas vozes padrão, essas e outras vozes, ou apenas outras vozes. Apenas as vozes que você instala estão disponíveis.
  • Especifique neuralVoices para instalar as vozes neurais. Todas as vozes neurais estão instaladas e disponíveis. Não é possível refinar a lista de vozes instaladas.

Para obter mais informações sobre o uso do recurso personalizado para instalar vozes, consulte Instalando Watson Text to Speech.

Especificando uma voz para síntese de discurso

Ambos os métodos, HTTP POST e GET /v1/synthesize, assim como o método WebSocket /v1/synthesize, aceitam um parâmetro de consulta voice opcional que você usa para especificar a voz que deve ser usada para a síntese de discurso. Se você omitia o parâmetro voice, o serviço usa uma voz padrão. A voz padrão depende das vozes que você instalou:

  • Se você instalou as vozes neurais aprimoradas, o serviço usará o inglês dos EUA en-US_MichaelV3Voice por padrão. Se essa voz não for instalada, você deverá especificar uma voz.
  • Se você instalou as vozes neurais, o serviço sempre usará o inglês australiano en-AU_MadisonVoice por padrão.

Para obter mais informações, consulte Usando uma voz para a síntese de fala.

Especificando um idioma para um modelo customizado

Use o método POST /v1/customizations para criar um modelo customizado. O método inclui um parâmetro language que você usa para identificar o idioma do novo modelo customizado.

  • Se você instalou as vozes neurais aprimoradas, o parâmetro language será opcional. Por padrão, o serviço usa o identificador en-US para o idioma.
  • Se você instalou as vozes neurais, o parâmetro language será necessário. Deve-se especificar o idioma para o modelo customizado no formato indicado (por exemplo, en-AU para o inglês australiano).

Para obter mais informações sobre a especificação de um idioma quando você cria um modelo customizado, consulte Criando um modelo customizado.

Correção de defeito: Correção da entonação para vozes neurais aprimoradas em espanhol

Correção de defeito: Para as vozes em espanhol castelhano (es-ES_EnriqueV3Voice e es-ES_LauraV3Voice), espanhol das América Latina (es-LA_SofiaV3Voice) e espanhol da América do Norte (es-US_SofiaV3Voice), perguntas de todos os tipos agora usam a entonação correta. As vozes anteriormente não utilizavam a entonação correta para algumas perguntas e as pronunciavam como afirmações.

Correção de defeito: Correção da documentação sobre multitenancy

Defeito corrigido: O tópico IBM Cloud Pak for Data tópico Multitenancy support declarou incorretamente que os serviços do Speech não suportam a multitenancy. O tópico foi atualizado para afirmar que os serviços do Speech suportam as operações a seguir:

  • Instalar o serviço em projetos separados
  • Instalar o serviço várias vezes no mesmo projeto
  • Instalar o serviço uma vez e implementar várias instâncias no mesmo projeto

A documentação que é específica para os serviços do Speech declarava corretamente o suporte à ocupação variada.

1º de outubro de 2021 (Versão 1.1.x)

Versão 1.1.x está fora de serviço
Text to Speech e Speech to Text para IBM Cloud Pak for Data versão 1.1.x saiu de serviço em 30 de setembro de 2021. A partir de 1º de outubro de 2021, a documentação para a versão 1.1.x não está mais disponível. Para obter mais informações, consulte Retirada de software e descontinuação de suporte.

29 de julho de 2021 (Versão 4.0.0)

A versão 4.0.0 está disponível

IBM Watson® Text to Speech para IBM Cloud Pak® for Data versão 4.0.0 já está disponível. A instalação e a administração do serviço incluem muitas mudanças. Esta versão suporta o IBM Cloud Pak for Data versão 4.x e o Red Hat OpenShift versão 4.6. Para obter mais informações sobre como instalar e gerenciar o serviço, consulte Instalando o IBM Watson Text to Speech para IBM Cloud Pak for Data.

Vozes neurais aprimoradas

Para otimizar a qualidade geral da síntese de voz, todas as vozes disponíveis são agora vozes neurais aprimoradas. As vozes neurais aprimoradas, que incluem a sequência V3 em seus nomes, já estão disponíveis para português do Brasil, inglês do Reino Unido e dos Estados Unidos, francês, alemão, italiano, japonês e espanhol (todos os dialetos).

As vozes neurais aprimoradas suportam o uso tanto do IPA como da Representação Fonética Simbólica (SPR) da IBM com o elemento SSML <phoneme>. As vozes neurais aprimoradas também atingem um grau um pouco mais elevado de discurso com sonoridade natural. Para obter mais informações, consulte Idiomas e vozes.

Nova voz em francês canadense

O serviço agora suporta o francês canadense com a voz neural aprimorada fr-CA_LouiseV3Voice. A voz francesa canadense suporta customização e está geralmente disponível (GA) para uso de produção.

Novo recurso Ajuste por meio de exemplo

O novo recurso Ajustar por meio de exemplo permite controlar como o texto especificado é falado pelo serviço. O recurso é uma funcionalidade beta que é suportada apenas para modelos e vozes customizadas em inglês dos EUA. O recurso tem dois componentes:

  • Prompts customizados incluem o texto escrito que deve ser falado e o áudio gravado que fala o texto como você quer ouvir. O áudio especifica a entonação, a cadência e a ênfase do texto sintetizado. O prompt pode enfatizar diferentes sílabas ou palavras, introduzir pausas e geralmente tornar o som de áudio sintetizado mais natural e apropriado para o seu contexto.
  • Modelos de falante fornecer áudio de inscrição para um usuário que fala um ou mais prompts. Um modelo de falante fornece uma amostra de áudio da voz de um usuário. O serviço faz seu treinamento sobre a voz, o que pode ajudá-lo a produzir prompts de qualidade superior para esse falante.

Você especifica um prompt customizado com uma solicitação de síntese de discurso para indicar como a voz do serviço deve pronunciar o texto. Para especificar um prompt, use a extensão SSML <ibm:prompt id="{prompt_id}"/>. O áudio sintetizado duplica a prosódia do prompt.

O serviço inclui oito novos métodos para trabalhar com o recurso Ajustar por meio de exemplo. As descrições dos novos métodos que seguem fornecem links para suas entradas na referência API e SDK.

Documentação do Text to Speech unificado

A documentação para IBM Watson Text to Speech para IBM Cloud Pak for Data agora é combinada com a documentação para instâncias gerenciadas do serviço Text to Speech hospedadas na IBM Cloud. Isso vale tanto para a documentação de guia quanto de referência para as duas formas do serviço. Links para a versão anteriormente separada da documentação do IBM Cloud Pak for Data para o redirecionamento de serviço para a documentação unificada.

Para obter mais informações sobre a identificação de informações que pertencem a apenas uma versão do produto, consulte Sobre o Text to Speech.

A versão 1.1.x está saindo de serviço

Speech to Text e Text to Speech para IBM Cloud Pak for Data versão 1.1.x saiu de serviço em 30 de setembro de 2021. Deve-se fazer upgrade para uma versão mais recente dos serviços no IBM Cloud Pak for Data antes dessa data. A partir de 1º de outubro de 2021, a documentação para a versão 1.1.4 não estará mais disponível.

12 de abril de 2021 (Versão 1.2.1)

Inclusão ao arquivo speech-override.yaml

O arquivo mínimo speech-override.yaml inclui uma definição extra, dockerRegistryPrefix:

global:
  dockerRegistryPrefix: "{Registry}"
  image:
    pullSecret: "{Registry_pull_secret}"

{Registry} é o caminho para o registro do Docker interno. Ele deve ser image-registry.openshift-image-registry.svc:5000/{namespace}, em que {namespace} é o espaço de nomes no qual o IBM Cloud Pak® for Data é instalado, normalmente zen.

9 de abril de 2021 (Versão 1.2.1)

Suporte para modificação de modelos e vozes instalados
Os serviços do Speech permitem que você inclua ou remova modelos e vozes instalados para a versão 1.2 ou 1.2.1 dos serviços.

26 de março de 2021 (Versão 1.2.1)

A versão 1.2.1 está disponível

Text to Speech para IBM Cloud Pak for Data versão 1.2.1 já está disponível. As versões 1.2 e 1.2.1 utilizam as mesmas instruções de instalação e documentação da versão 1.2. A versão 1.2.1 suporta instalação no Red Hat OpenShift versão 4.6, além das versões 4.5 e 3.11.

Novas instruções de instalação

Para ambos os clusters, conectados à Internet e fisicamente isolados, as instruções de instalação incluem as etapas a seguir:

  • Use o comando oc label para configurar etiquetas necessárias para o espaço de nomes em que o IBM Cloud Pak for Data está instalado.
  • Use o comando oc project para garantir que você esteja apontando para o projeto OpenShift correto.
  • Use o comando cpd-cli install para instalar um servidor Enterprise DB PostgreSQL que é usado pelos serviços do Speech.

Você executa essas etapas antes de instalar os serviços do Speech.

Novas instruções de desinstalação

Uma etapa foi incluída ao procedimento de desinstalação dos serviços do Speech para limpar todos os recursos da instalação.

Registro autorizado para armazenamento de dados PostgreSQL

O caminho do registro autorizado por meio do qual o serviço extrai imagens para o armazenamento de dados PostgreSQL foi mudado. O local do registro mudou de cp.icr.io/cp/watson-speech para cp.icr.io/cp/cpd. Essa mudança é transparente para os usuários.

Segredos para os armazenamentos de dados MinIO e PostgreSQL

Os armazenamentos de dados MinIO e PostgreSQL requerem os valores codificados permanentemente a seguir para os seus segredos:

  • Para MinIO, use minio.
  • Para PostgreSQL, use user-provided-postgressql.

Não é possível usar seus próprios valores para esses segredos. Os segredos devem ser criados antes de instalar os serviços do Speech.

Exclusões do arquivo speech-override.yaml

As entradas a seguir foram removidas do arquivo speech-override.yaml . Elas foram incluídas como uma solução alternativa a um problema que agora foi corrigido.

sttRuntime:
  images:
    miniomc:
      tag:
        1.0.5
sttAMPatcher:
  images:
    miniomc:
      tag:
        1.0.5
ttsRuntime:
  images:
    miniomc:
      tag:
        1.0.5

O arquivo speech-override.yaml abreviado foi reduzido ainda mais por meio do ajuste preciso de seu conteúdo para os elementos essenciais.

9 de dezembro de 2020 (Versão 1.2)

A versão 1.2 está disponível

O Text to Speech for IBM Cloud Pak for Data versão 1.2 agora está disponível. A instalação e a administração do serviço incluem muitas mudanças. Essa versão suporta o IBM Cloud Pak for Data versões 3.5 e 3.0.1 e o Red Hat OpenShift versões 4.5 e 3.11.

Novas vozes

O serviço agora oferece duas novas vozes:

  • Inglês do Reino Unido: en-GB_CharlotteV3Voice
  • Francês: fr-FR_NicolasV3Voice

O serviço também oferece uma versão aprimorada da voz existente do Reino Unido, en-KateV3Voice. Para obter mais informações sobre todos os idiomas e vozes suportados, consulte Idiomas e vozes.

Correção de defeito: Correção do elemento <prosody> para o japonês

Defeito corrigido: Para a voz ja-JP_EmiV3Voice, o serviço agora analisa corretamente o texto de entrada SSML que inclui uma especificação de taxa de prosódia. Anteriormente, o seguinte uso do elemento <prosody> funcionava adequadamente:

<speak>成功する/繁栄する</speak>

Mas o uso a seguir do atributo rate com o elemento <prosody> fez com que o serviço lesse e falasse a notação SSML integrada:

<speak>
  <prosody rate="fast">成功する/繁栄する</prosody>
</speak>

O serviço agora analisa corretamente e aplica o atributo rate do elemento <prosody> para entrada em japonês.

4 de setembro de 2020 (Versão 1.1.4)

A interface de customização está geralmente disponível
A interface de customização agora tem disponibilidade geral. A customização não é mais uma funcionalidade beta. É possível usar a interface de customização para especificar como o serviço pronuncia palavras incomuns que ocorrem em seu texto de entrada criando dicionários customizados específicos de idioma. Para obter mais informações, consulte Entendendo a customização.

15 de julho de 2020 (Versão 1.1.4)

Red Hat OpenShift versão 4.3 está saindo de serviço
O IBM Cloud Pak for Data 3.0.1 está descontinuando o suporte para o Red Hat OpenShift 4.3 em 1 de setembro de 2020. O Red Hat OpenShift 4.3 saiu de serviço em 22 de outubro de 2020. O IBM Cloud Pak for Data está introduzindo suporte para o Red Hat OpenShift 4.5. O IBM Cloud Pak for Data recomenda aos clientes o upgrade para o Red Hat OpenShift 4.5 antes de 22 de outubro de 2020. O Suporte IBM trabalhará com quaisquer clientes que já instalaram o IBM Cloud Pak for Data 3.0.1 no Red Hat OpenShift 4.3. Os novos clientes que desejam instalar no Red Hat OpenShift 4.x são instruídos a instalar o Red Hat OpenShift 4.5.

19 de junho de 2020 (Versão 1.1.4)

A versão 1.1.4 está disponível

O Text to Speech for IBM Cloud Pak for Data versão 1.1.4 agora está disponível. A instalação e a administração do serviço incluem muitas mudanças. Essa versão suporta IBM Cloud Pak for Data versões 2.5 e 3.0.1 e o Red Hat OpenShift versões 3.11 e 4.3. Para obter mais informações sobre a instalação e o gerenciamento do serviço, consulte Instalação e gerenciamento de Text to Speech para IBM Cloud Pak for Data.

Novas vozes neurais

O serviço agora suporta cinco novas vozes neurais:

  • Inglês dos EUA: en-US_EmilyV3Voice, en-US_HenryV3Voice, en-US_KevinV3Voicee en-US_OliviaV3Voice
  • Alemão: de-DE_ErikaV3Voice

Essas novas vozes têm os mesmos recursos para customização e SSML que todas as vozes existentes. Para obter mais informações, consulte Idiomas e vozes suportados.

Suporte para o atributo SSML digits do elemento <say-as> para japonês

O serviço agora suporta o atributo digits do elemento SSML <say-as> com sua voz em japonês. Para obter mais informações, consulte O elemento <say-as>.

Procedimentos simplificados de backup e restauração

Os procedimentos de backup e restauração são muito simplificados. Eles agora fazem backup de dados dos armazenamentos de dados para que não seja mais necessário recriar as operações executadas. Para obter mais informações, consulte Backup e restauração de Watson Dados de serviços de fala.

28 de fevereiro de 2020 (Versão 1.1.3)

A versão 1.1.3 está disponível
O Text to Speech for IBM Cloud Pak for Data versão 1.1.3 agora está disponível.

27 de novembro de 2019 (Versão 1.1.2)

A versão 1.1.2 está disponível
O Text to Speech for IBM Cloud Pak for Data versão 1.1.2 agora está disponível.

30 de agosto de 2019 (Versão 1.0.1)

Versão 1.0.1 está disponível
O Text to Speech for IBM Cloud Pak for Data versão 1.0.1 agora está disponível. O serviço agora funciona com o IBM Cloud Pak for Data 2.1.0.1. O serviço agora suporta a instalação do IBM Cloud Pak for Data com o Red Hat OpenShift.
Nova voz neural em japonês
O serviço agora oferece a voz japonesa neural ja-JP_EmiV3Voice. Para obter mais informações, consulte Idiomas e vozes suportados.
Suporte FISMA
O suporte ao Federal Information Security Management Act (FISMA) agora está disponível para o Text to Speech for IBM Cloud Pak for Data. O serviço é FISMA High Ready.

28 de junho de 2019 (Versão 1.0.0)

Versão 1.0.0 está disponível

A versão 1.0.0, a liberação inicial do serviço, já está disponível. Text to Speech para IBM Cloud Pak for Data é baseado no serviço IBM Watson® Text to Speech na IBM Cloud pública. O Text to Speech para IBM Cloud Pak for Data difere do serviço Text to Speech público das maneiras a seguir. Você poderá achar essas informações úteis se já estiver familiarizado com o serviço do Text to Speech no IBM Cloud público.

  • O Text to Speech para o IBM Cloud Pak for Data usa tokens de acesso para autenticação. Para obter mais informações, consulte a referência API & SDK.
  • Os terminais para o Text to Speech para o IBM Cloud Pak for Data são específicos para o seu cluster do IBM Cloud Pak for Data. Para obter mais informações, consulte a referência API & SDK.
  • O Text to Speech para o IBM Cloud Pak for Data suporta apenas vozes neurais. Ele não suporta vozes padrão (concatenativas). As vozes neurais não suportam os elementos SSML <express-as> e <voice-transformation>.
  • O Text to Speech para o IBM Cloud Pak for Data não executa nenhuma criação de log de solicitação. Não é necessário usar o cabeçalho da solicitação X-Watson-Learning-Opt-Out.
  • O Text to Speech para o IBM Cloud Pak for Data não suporta tokens do Watson. Não é possível usar o cabeçalho da solicitação X-Watson-Authorization-Token para se autenticar no serviço.