Lar
Modelo de áudio de código aberto da Meituan estabelece novo padrão de referência em clonagem de voz
A geração de áudio está passando por uma mudança fundamental, passando de arquiteturas em cascata de múltiplos estágios para modelos de ponta a ponta. Para superar a perda de informação e o acúmulo de erros inerentes à representação intermediária tradicional do “espectrograma Mel” usada em sistemas TTS, a equipe Meituan LongCat lançou oficialmente e disponibilizou como código aberto o LongCat-AudioDiT (disponível nas versões com 1B e 3,5B de parâmetros). Este modelo supera com sucesso os limites de desempenho anteriores na clonagem de voz zero-shot, realizando modelagem direta do espaço latente da forma de onda.

Arquitetura Central: Indo Além dos Espectrogramas Mel
O LongCat-AudioDiT descarta o pipeline convencional de múltiplos estágios de “previsão de características acústicas + vocoder neural”, estabelecendo, em vez disso, uma arquitetura minimalista e otimizada construída sobre um Wav-VAE (Autoencoder Variacional de Forma de Onda) e um DiT (Transformador de Difusão).
Wav-VAE eficiente: Utilizando um design totalmente convolucional, ele comprime formas de onda de 24 kHz em um fator de 2.000 vezes para uma taxa de quadros de 11,7 Hz. Por meio de ramificações de atalho não paramétricas e treinamento adversarial multiobjetivo, ele garante que a forma de onda reconstruída mantenha uma estrutura tempo-frequência precisa, ao mesmo tempo em que oferece excelente qualidade de audição natural.
DiT com Semântica Aprimorada: O modelo funde de forma inovadora as incorporações de palavras originais do codificador de texto UMT5 com seus estados ocultos de nível superior. Isso compensa os detalhes fonéticos perdidos em representações semânticas de alto nível, aumentando significativamente a inteligibilidade da fala gerada.
Otimização da inferência: correção precisa do desvio de voz
Para aprimorar ainda mais a qualidade da geração, a equipe implementou dois refinamentos técnicos essenciais:
Mecanismo de restrição dupla: essa técnica identifica e corrige o problema persistente de “incompatibilidade entre treinamento e inferência” no TTS com correspondência de fluxo. Ao redefinir forçosamente as variáveis latentes na área de prompt durante a inferência, ela resolve completamente os problemas de desvio e instabilidade da voz do locutor.
Orientação de projeção adaptativa (APG): A APG substitui a orientação tradicional sem classificador (CFG). Ela pode filtrar com precisão os componentes benéficos dentro do sinal de orientação enquanto suprime os componentes que causam degradação de áudio, melhorando significativamente a naturalidade da fala sem induzir “supersaturação” espectral.
Desempenho: Precisão de clonagem de nível SOTA
Em testes de benchmark no conjunto de dados Seed, o LongCat-AudioDiT demonstra desempenho dominante:
Similaridade (SIM): O modelo de 3,5 bilhões de parâmetros alcançou uma pontuação de 0,818 no conjunto de testes Seed-ZH e 0,797 no desafiador conjunto de frases Seed-Hard, superando modelos notáveis como Seed-TTS, CosyVoice3.5 e MiniMax-Speech.
Precisão: Ele está entre os melhores desempenhos do setor em métricas-chave, incluindo um WER em inglês de 1,50% e um CER em frases difíceis em chinês de 6,04%.
Notavelmente, o LongCat-AudioDiT alcança resultados superiores em comparação com modelos treinados em múltiplos estágios, utilizando apenas treinamento em um único estágio em dados de transcrição ASR pré-processados. O artigo de pesquisa associado, o código-fonte e os pesos do modelo estão agora totalmente em código aberto e disponíveis no GitHub e no HuggingFace.
Links do projeto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Artigo relacionado
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
Recomendações de tópicos especiais relacionados
Comentários (1)
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
A geração de áudio está passando por uma mudança fundamental, passando de arquiteturas em cascata de múltiplos estágios para modelos de ponta a ponta. Para superar a perda de informação e o acúmulo de erros inerentes à representação intermediária tradicional do “espectrograma Mel” usada em sistemas TTS, a equipe Meituan LongCat lançou oficialmente e disponibilizou como código aberto o LongCat-AudioDiT (disponível nas versões com 1B e 3,5B de parâmetros). Este modelo supera com sucesso os limites de desempenho anteriores na clonagem de voz zero-shot, realizando modelagem direta do espaço latente da forma de onda.

Arquitetura Central: Indo Além dos Espectrogramas Mel
O LongCat-AudioDiT descarta o pipeline convencional de múltiplos estágios de “previsão de características acústicas + vocoder neural”, estabelecendo, em vez disso, uma arquitetura minimalista e otimizada construída sobre um Wav-VAE (Autoencoder Variacional de Forma de Onda) e um DiT (Transformador de Difusão).
Wav-VAE eficiente: Utilizando um design totalmente convolucional, ele comprime formas de onda de 24 kHz em um fator de 2.000 vezes para uma taxa de quadros de 11,7 Hz. Por meio de ramificações de atalho não paramétricas e treinamento adversarial multiobjetivo, ele garante que a forma de onda reconstruída mantenha uma estrutura tempo-frequência precisa, ao mesmo tempo em que oferece excelente qualidade de audição natural.
DiT com Semântica Aprimorada: O modelo funde de forma inovadora as incorporações de palavras originais do codificador de texto UMT5 com seus estados ocultos de nível superior. Isso compensa os detalhes fonéticos perdidos em representações semânticas de alto nível, aumentando significativamente a inteligibilidade da fala gerada.
Otimização da inferência: correção precisa do desvio de voz
Para aprimorar ainda mais a qualidade da geração, a equipe implementou dois refinamentos técnicos essenciais:
Mecanismo de restrição dupla: essa técnica identifica e corrige o problema persistente de “incompatibilidade entre treinamento e inferência” no TTS com correspondência de fluxo. Ao redefinir forçosamente as variáveis latentes na área de prompt durante a inferência, ela resolve completamente os problemas de desvio e instabilidade da voz do locutor.
Orientação de projeção adaptativa (APG): A APG substitui a orientação tradicional sem classificador (CFG). Ela pode filtrar com precisão os componentes benéficos dentro do sinal de orientação enquanto suprime os componentes que causam degradação de áudio, melhorando significativamente a naturalidade da fala sem induzir “supersaturação” espectral.
Desempenho: Precisão de clonagem de nível SOTA
Em testes de benchmark no conjunto de dados Seed, o LongCat-AudioDiT demonstra desempenho dominante:
Similaridade (SIM): O modelo de 3,5 bilhões de parâmetros alcançou uma pontuação de 0,818 no conjunto de testes Seed-ZH e 0,797 no desafiador conjunto de frases Seed-Hard, superando modelos notáveis como Seed-TTS, CosyVoice3.5 e MiniMax-Speech.
Precisão: Ele está entre os melhores desempenhos do setor em métricas-chave, incluindo um WER em inglês de 1,50% e um CER em frases difíceis em chinês de 6,04%.
Notavelmente, o LongCat-AudioDiT alcança resultados superiores em comparação com modelos treinados em múltiplos estágios, utilizando apenas treinamento em um único estágio em dados de transcrição ASR pré-processados. O artigo de pesquisa associado, o código-fonte e os pesos do modelo estão agora totalmente em código aberto e disponíveis no GitHub e no HuggingFace.
Links do projeto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











