Maison
Le modèle audio open source de Meituan établit une nouvelle référence en matière de clonage vocal
La génération audio connaît actuellement une évolution fondamentale, passant d'architectures en cascade à plusieurs étapes à des modèles de bout en bout. Afin de pallier la perte d'informations et l'accumulation d'erreurs inhérentes à la représentation intermédiaire traditionnelle « spectrogramme Mel » utilisée dans les systèmes de synthèse vocale (TTS), l'équipe Meituan LongCat a officiellement publié et mis en open source LongCat-AudioDiT (disponible en versions 1B et 3,5B de paramètres). Ce modèle dépasse avec succès les limites de performance précédentes en matière de clonage vocal « zero-shot » en effectuant une modélisation directe de l'espace latent des formes d'onde.

Architecture de base : aller au-delà des spectrogrammes Mel
LongCat-AudioDiT abandonne le pipeline conventionnel en plusieurs étapes « prédiction des caractéristiques acoustiques + vocodeur neuronal » pour établir à la place une architecture minimale rationalisée reposant sur un Wav-VAE (Waveform Variational Autoencoder) et un DiT (Diffusion Transformer).
Wav-VAE efficace : grâce à une conception entièrement convolutive, il compresse les formes d'onde de 24 kHz d'un facteur de 2 000 pour atteindre une fréquence d'échantillonnage de 11,7 Hz. Grâce à des branches de raccourci non paramétriques et à un apprentissage antagoniste multi-objectifs, il garantit que la forme d'onde reconstruite conserve une structure temps-fréquence précise tout en offrant une excellente qualité d'écoute naturelle.
DiT à sémantique améliorée : le modèle fusionne de manière innovante les plongements de mots originaux provenant de l'encodeur de texte UMT5 avec ses états cachés de niveau supérieur. Cela compense les détails phonétiques perdus dans les représentations sémantiques de haut niveau, améliorant considérablement l'intelligibilité de la parole générée.
Optimisation de l'inférence : correction précise de la dérive vocale
Afin d'améliorer encore la qualité de la génération, l'équipe a mis en œuvre deux améliorations techniques essentielles :
Mécanisme à double contrainte : cette technique identifie et corrige le problème persistant de « décalage entre l'entraînement et l'inférence » dans la synthèse vocale par adaptation de flux. En réinitialisant de force les variables latentes dans la zone de prompt pendant l'inférence, elle résout complètement les problèmes de dérive et d'instabilité de la voix du locuteur.
Guidage par projection adaptative (APG) : l'APG remplace le guidage traditionnel sans classificateur (CFG). Il permet de filtrer avec précision les composantes bénéfiques du signal de guidage tout en supprimant celles qui causent une dégradation audio, améliorant ainsi considérablement le naturel de la parole sans induire de « sursaturation » spectrale.
Performances : précision de clonage de niveau SOTA
Lors des tests de référence sur l'ensemble de données Seed, LongCat-AudioDiT affiche des performances dominantes :
Similitude (SIM) : le modèle 3,5B a obtenu un score de 0,818 sur l'ensemble de test Seed-ZH et de 0,797 sur l'ensemble de phrases Seed-Hard, plus difficile, surpassant des modèles notables tels que Seed-TTS, CosyVoice3.5 et MiniMax-Speech.
Précision : il se classe parmi les meilleurs de l'industrie pour les indicateurs clés, avec notamment un WER de 1,50 % en anglais et un CER de 6,04 % pour les phrases difficiles en chinois.
Il est remarquable de constater que LongCat-AudioDiT obtient des résultats supérieurs à ceux des modèles entraînés en plusieurs étapes, en utilisant uniquement un entraînement en une seule étape sur des données de transcription ASR prétraitées. L'article de recherche associé, le code source et les poids du modèle sont désormais entièrement open source et disponibles sur GitHub et HuggingFace.
Liens vers le projet :
GitHub : https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Article connexe
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
Recommandations de sujets spéciaux liés
commentaires (1)
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
La génération audio connaît actuellement une évolution fondamentale, passant d'architectures en cascade à plusieurs étapes à des modèles de bout en bout. Afin de pallier la perte d'informations et l'accumulation d'erreurs inhérentes à la représentation intermédiaire traditionnelle « spectrogramme Mel » utilisée dans les systèmes de synthèse vocale (TTS), l'équipe Meituan LongCat a officiellement publié et mis en open source LongCat-AudioDiT (disponible en versions 1B et 3,5B de paramètres). Ce modèle dépasse avec succès les limites de performance précédentes en matière de clonage vocal « zero-shot » en effectuant une modélisation directe de l'espace latent des formes d'onde.

Architecture de base : aller au-delà des spectrogrammes Mel
LongCat-AudioDiT abandonne le pipeline conventionnel en plusieurs étapes « prédiction des caractéristiques acoustiques + vocodeur neuronal » pour établir à la place une architecture minimale rationalisée reposant sur un Wav-VAE (Waveform Variational Autoencoder) et un DiT (Diffusion Transformer).
Wav-VAE efficace : grâce à une conception entièrement convolutive, il compresse les formes d'onde de 24 kHz d'un facteur de 2 000 pour atteindre une fréquence d'échantillonnage de 11,7 Hz. Grâce à des branches de raccourci non paramétriques et à un apprentissage antagoniste multi-objectifs, il garantit que la forme d'onde reconstruite conserve une structure temps-fréquence précise tout en offrant une excellente qualité d'écoute naturelle.
DiT à sémantique améliorée : le modèle fusionne de manière innovante les plongements de mots originaux provenant de l'encodeur de texte UMT5 avec ses états cachés de niveau supérieur. Cela compense les détails phonétiques perdus dans les représentations sémantiques de haut niveau, améliorant considérablement l'intelligibilité de la parole générée.
Optimisation de l'inférence : correction précise de la dérive vocale
Afin d'améliorer encore la qualité de la génération, l'équipe a mis en œuvre deux améliorations techniques essentielles :
Mécanisme à double contrainte : cette technique identifie et corrige le problème persistant de « décalage entre l'entraînement et l'inférence » dans la synthèse vocale par adaptation de flux. En réinitialisant de force les variables latentes dans la zone de prompt pendant l'inférence, elle résout complètement les problèmes de dérive et d'instabilité de la voix du locuteur.
Guidage par projection adaptative (APG) : l'APG remplace le guidage traditionnel sans classificateur (CFG). Il permet de filtrer avec précision les composantes bénéfiques du signal de guidage tout en supprimant celles qui causent une dégradation audio, améliorant ainsi considérablement le naturel de la parole sans induire de « sursaturation » spectrale.
Performances : précision de clonage de niveau SOTA
Lors des tests de référence sur l'ensemble de données Seed, LongCat-AudioDiT affiche des performances dominantes :
Similitude (SIM) : le modèle 3,5B a obtenu un score de 0,818 sur l'ensemble de test Seed-ZH et de 0,797 sur l'ensemble de phrases Seed-Hard, plus difficile, surpassant des modèles notables tels que Seed-TTS, CosyVoice3.5 et MiniMax-Speech.
Précision : il se classe parmi les meilleurs de l'industrie pour les indicateurs clés, avec notamment un WER de 1,50 % en anglais et un CER de 6,04 % pour les phrases difficiles en chinois.
Il est remarquable de constater que LongCat-AudioDiT obtient des résultats supérieurs à ceux des modèles entraînés en plusieurs étapes, en utilisant uniquement un entraînement en une seule étape sur des données de transcription ASR prétraitées. L'article de recherche associé, le code source et les poids du modèle sont désormais entièrement open source et disponibles sur GitHub et HuggingFace.
Liens vers le projet :
GitHub : https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











