Alibaba Tongyi apresenta modelo de voz com controle de linguagem natural “FreeStyle”
Hoje, a equipe de fala do Alibaba Tongyi Lab apresentou dois modelos inovadores de geração de voz: Fun-CosyVoice3.5 e Fun-AudioGen-VD. A característica que se destaca nesses modelos é o suporte a comandos “FreeStyle”. Em vez de ajustes complexos de parâmetros, os usuários podem controlar com precisão os estilos de expressão vocal ou criar cenas de áudio complexas do zero usando descrições simples em linguagem natural.

Cada modelo tem finalidades distintas:
Fun-CosyVoice3.5: replicação multilíngue e controle refinado
Esta versão aprimorada do CosyVoice alcança avanços importantes na compreensão das nuances da expressão vocal.
Geração orientada por comandos: os usuários podem inserir instruções como “fale com mais confiança” ou “diminua o ritmo com variação emocional” para ajustes vocais em tempo real.
Expansão de idiomas: o suporte adicionado para tailandês, indonésio, português e vietnamita mantém o desempenho líder do setor em precisão de transcrição (WER) e similaridade de voz em 13 idiomas.
Otimização de caracteres raros: O treinamento especializado reduziu as taxas de erro para caracteres incomuns de 15,2% para 5,3%.
Aumento de desempenho: a latência do primeiro pacote diminuiu 35%, melhorando significativamente a fluidez da interação em tempo real.
Fun-AudioGen-VD: Design de som abrangente
Este modelo atua como um “diretor de áudio”, gerando áudio integrado que combina “personagens + ambientes”.
Personalização de voz: especifique gênero, idade, sotaque e características detalhadas, como vozes “roucas, graves ou agudas”.
Emoção e interpretação: simula papéis, incluindo agentes de atendimento ao cliente, locutores e crianças, transmitindo até mesmo estados complexos como “calma exterior com tensão interior”.
Ambientes imersivos: adiciona sons de fundo (caos no campo de batalha, murmúrios em cafés) e efeitos espaciais (reverberação em catedrais, acústica subaquática) para uma simulação espacial completa.
O Tongyi Lab observa que esses modelos democratizarão a criação de vozes de alta qualidade, oferecendo um poderoso suporte de IA para podcasting, desenvolvimento de jogos e pós-produção de filmes.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
Hoje, a equipe de fala do Alibaba Tongyi Lab apresentou dois modelos inovadores de geração de voz: Fun-CosyVoice3.5 e Fun-AudioGen-VD. A característica que se destaca nesses modelos é o suporte a comandos “FreeStyle”. Em vez de ajustes complexos de parâmetros, os usuários podem controlar com precisão os estilos de expressão vocal ou criar cenas de áudio complexas do zero usando descrições simples em linguagem natural.

Cada modelo tem finalidades distintas:
Fun-CosyVoice3.5: replicação multilíngue e controle refinado
Esta versão aprimorada do CosyVoice alcança avanços importantes na compreensão das nuances da expressão vocal.
Geração orientada por comandos: os usuários podem inserir instruções como “fale com mais confiança” ou “diminua o ritmo com variação emocional” para ajustes vocais em tempo real.
Expansão de idiomas: o suporte adicionado para tailandês, indonésio, português e vietnamita mantém o desempenho líder do setor em precisão de transcrição (WER) e similaridade de voz em 13 idiomas.
Otimização de caracteres raros: O treinamento especializado reduziu as taxas de erro para caracteres incomuns de 15,2% para 5,3%.
Aumento de desempenho: a latência do primeiro pacote diminuiu 35%, melhorando significativamente a fluidez da interação em tempo real.
Fun-AudioGen-VD: Design de som abrangente
Este modelo atua como um “diretor de áudio”, gerando áudio integrado que combina “personagens + ambientes”.
Personalização de voz: especifique gênero, idade, sotaque e características detalhadas, como vozes “roucas, graves ou agudas”.
Emoção e interpretação: simula papéis, incluindo agentes de atendimento ao cliente, locutores e crianças, transmitindo até mesmo estados complexos como “calma exterior com tensão interior”.
Ambientes imersivos: adiciona sons de fundo (caos no campo de batalha, murmúrios em cafés) e efeitos espaciais (reverberação em catedrais, acústica subaquática) para uma simulação espacial completa.
O Tongyi Lab observa que esses modelos democratizarão a criação de vozes de alta qualidade, oferecendo um poderoso suporte de IA para podcasting, desenvolvimento de jogos e pós-produção de filmes.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






