Lar
O Tongyi Qianwen Qwen-Audio-3.0-TTS entra em operação com atraso do primeiro pacote de 300 ms e 20 dialetos
A equipe do Alibaba Qwen lançou o novo modelo de síntese de fala em tempo real Qwen-Audio-3.0-TTS, levando a síntese de fala da geração básica para a verdadeira expressão. A versão Plus agora ocupa o primeiro lugar globalmente no Speech Arena, um renomado benchmark da Artificial Analysis, superando o Gemini 3.1 TTS, o ElevenLabs v3 e outros modelos importantes.

Estão disponíveis duas versões: a versão Flash é voltada para interação em tempo real com uma latência inicial de cerca de 300 ms, ideal para assistentes inteligentes e outros casos de uso que exigem baixa latência; a versão Plus prioriza a geração de alta qualidade, oferecendo maior naturalidade e semelhança vocal.
Quatro avanços importantes nas capacidades principais:
Primeiro, o suporte a vários idiomas e dialetos foi ampliado para 16 idiomas, com a versão Plus atingindo uma similaridade média do locutor de 82,75% em todos os 16 idiomas — a mais alta do setor. Ela também abrange 20 dialetos chineses, mantendo as características autênticas dos dialetos em vez de enfraquecê-las, para expressões mais semelhantes às de um falante nativo.
Em segundo lugar, instruções flexíveis em linguagem natural permitem que os usuários gerem fala precisa com comandos como “tom gentil de atendimento ao cliente” ou “estilo de apresentador de transmissão ao vivo”, sem a necessidade de anotações profissionais.
Em terceiro lugar, o controle refinado de tags suporta tags estruturadas, como [suspiro] e [irritado], permitindo o gerenciamento preciso de detalhes não verbais, como respiração e risadas — adequado para jogos, audiolivros e cenários semelhantes.
Em quarto lugar, forte robustez acústica: mesmo que o áudio de referência contenha alto nível de ruído ou reverberação, o modelo filtra automaticamente o ruído de fundo ao preservar a qualidade da voz, garantindo uma saída de síntese estável.
A biblioteca de vozes premium que acompanha o modelo inclui vários tipos de voz — instruções, dialetos e idiomas menos utilizados —, suporta saída de áudio de alta definição a 48K (com lançamento previsto para 24 de julho) e pode sintetizar até 3 minutos de texto longo por sessão. O modelo já está totalmente disponível na plataforma BaiLian da Alibaba Cloud, onde os desenvolvedores podem acessá-lo e testá-lo, abrindo novas possibilidades na interação por voz.

Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
A equipe do Alibaba Qwen lançou o novo modelo de síntese de fala em tempo real Qwen-Audio-3.0-TTS, levando a síntese de fala da geração básica para a verdadeira expressão. A versão Plus agora ocupa o primeiro lugar globalmente no Speech Arena, um renomado benchmark da Artificial Analysis, superando o Gemini 3.1 TTS, o ElevenLabs v3 e outros modelos importantes.

Estão disponíveis duas versões: a versão Flash é voltada para interação em tempo real com uma latência inicial de cerca de 300 ms, ideal para assistentes inteligentes e outros casos de uso que exigem baixa latência; a versão Plus prioriza a geração de alta qualidade, oferecendo maior naturalidade e semelhança vocal.
Quatro avanços importantes nas capacidades principais:
Primeiro, o suporte a vários idiomas e dialetos foi ampliado para 16 idiomas, com a versão Plus atingindo uma similaridade média do locutor de 82,75% em todos os 16 idiomas — a mais alta do setor. Ela também abrange 20 dialetos chineses, mantendo as características autênticas dos dialetos em vez de enfraquecê-las, para expressões mais semelhantes às de um falante nativo.
Em segundo lugar, instruções flexíveis em linguagem natural permitem que os usuários gerem fala precisa com comandos como “tom gentil de atendimento ao cliente” ou “estilo de apresentador de transmissão ao vivo”, sem a necessidade de anotações profissionais.
Em terceiro lugar, o controle refinado de tags suporta tags estruturadas, como [suspiro] e [irritado], permitindo o gerenciamento preciso de detalhes não verbais, como respiração e risadas — adequado para jogos, audiolivros e cenários semelhantes.
Em quarto lugar, forte robustez acústica: mesmo que o áudio de referência contenha alto nível de ruído ou reverberação, o modelo filtra automaticamente o ruído de fundo ao preservar a qualidade da voz, garantindo uma saída de síntese estável.
A biblioteca de vozes premium que acompanha o modelo inclui vários tipos de voz — instruções, dialetos e idiomas menos utilizados —, suporta saída de áudio de alta definição a 48K (com lançamento previsto para 24 de julho) e pode sintetizar até 3 minutos de texto longo por sessão. O modelo já está totalmente disponível na plataforma BaiLian da Alibaba Cloud, onde os desenvolvedores podem acessá-lo e testá-lo, abrindo novas possibilidades na interação por voz.

Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











