Hogar
El modelo de audio de código abierto de Meituan establece un nuevo referente en la clonación de voces
La generación de audio está experimentando un cambio fundamental, pasando de arquitecturas en cascada de múltiples etapas a modelos de extremo a extremo. Para superar la pérdida de información y la acumulación de errores inherentes a la representación intermedia tradicional del «espectrograma Mel» utilizada en los sistemas TTS, el equipo de Meituan LongCat ha lanzado oficialmente y ha publicado en código abierto LongCat-AudioDiT (disponible en versiones de 1.000 millones y 3.500 millones de parámetros). Este modelo supera con éxito los límites de rendimiento anteriores en la clonación de voz sin entrenamiento previo mediante el modelado directo del espacio latente de la forma de onda.

Arquitectura central: más allá de los espectrogramas Mel
LongCat-AudioDiT descarta el proceso convencional de varias etapas de «predicción de características acústicas + vocoder neuronal», estableciendo en su lugar una arquitectura mínima optimizada basada en un Wav-VAE (Waveform Variational Autoencoder) y un DiT (Diffusion Transformer).
Wav-VAE eficiente: utilizando un diseño totalmente convolucional, comprime formas de onda de 24 kHz en un factor de 2000 a una frecuencia de fotogramas de 11,7 Hz. A través de ramificaciones de atajo no paramétricas y entrenamiento adversarial multiobjetivo, garantiza que la forma de onda reconstruida mantenga una estructura tiempo-frecuencia precisa, al tiempo que ofrece una excelente calidad de escucha natural.
DiT con semántica mejorada: El modelo fusiona de forma innovadora las incrustaciones de palabras originales del codificador de texto UMT5 con sus estados ocultos de nivel superior. Esto compensa los detalles fonéticos perdidos en las representaciones semánticas de alto nivel, lo que aumenta significativamente la inteligibilidad del habla generada.
Optimización de la inferencia: corrección precisa de la deriva de la voz
Para mejorar aún más la calidad de la generación, el equipo implementó dos mejoras técnicas fundamentales:
Mecanismo de doble restricción: esta técnica identifica y corrige el persistente problema de «desajuste entre entrenamiento e inferencia» en el TTS con coincidencia de flujo. Al restablecer forzosamente las variables latentes en el área de la indicación durante la inferencia, resuelve por completo los problemas de deriva e inestabilidad de la voz del hablante.
Orientación de proyección adaptativa (APG): La APG sustituye a la orientación tradicional sin clasificador (CFG). Es capaz de filtrar con precisión los componentes beneficiosos de la señal de orientación, al tiempo que suprime los componentes que causan degradación del audio, lo que mejora significativamente la naturalidad del habla sin provocar una «sobresaturación» espectral.
Rendimiento: precisión de clonación de nivel SOTA
En las pruebas de referencia con el conjunto de datos Seed, LongCat-AudioDiT demuestra un rendimiento dominante:
Similitud (SIM): El modelo de 3.500 millones de parámetros alcanzó una puntuación de 0,818 en el conjunto de pruebas Seed-ZH y de 0,797 en el exigente conjunto de frases Seed-Hard, superando a modelos destacados como Seed-TTS, CosyVoice3.5 y MiniMax-Speech.
Precisión: Se sitúa entre los mejores del sector en métricas clave, incluyendo un WER en inglés del 1,50 % y un CER en frases difíciles en chino del 6,04 %.
Cabe destacar que LongCat-AudioDiT logra resultados superiores en comparación con los modelos entrenados en múltiples etapas utilizando únicamente un entrenamiento de una sola etapa sobre datos de transcripción ASR preprocesados. El artículo de investigación asociado, el código fuente y los pesos del modelo son ahora de código abierto y están disponibles en GitHub y HuggingFace.
Enlaces del proyecto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
La generación de audio está experimentando un cambio fundamental, pasando de arquitecturas en cascada de múltiples etapas a modelos de extremo a extremo. Para superar la pérdida de información y la acumulación de errores inherentes a la representación intermedia tradicional del «espectrograma Mel» utilizada en los sistemas TTS, el equipo de Meituan LongCat ha lanzado oficialmente y ha publicado en código abierto LongCat-AudioDiT (disponible en versiones de 1.000 millones y 3.500 millones de parámetros). Este modelo supera con éxito los límites de rendimiento anteriores en la clonación de voz sin entrenamiento previo mediante el modelado directo del espacio latente de la forma de onda.

Arquitectura central: más allá de los espectrogramas Mel
LongCat-AudioDiT descarta el proceso convencional de varias etapas de «predicción de características acústicas + vocoder neuronal», estableciendo en su lugar una arquitectura mínima optimizada basada en un Wav-VAE (Waveform Variational Autoencoder) y un DiT (Diffusion Transformer).
Wav-VAE eficiente: utilizando un diseño totalmente convolucional, comprime formas de onda de 24 kHz en un factor de 2000 a una frecuencia de fotogramas de 11,7 Hz. A través de ramificaciones de atajo no paramétricas y entrenamiento adversarial multiobjetivo, garantiza que la forma de onda reconstruida mantenga una estructura tiempo-frecuencia precisa, al tiempo que ofrece una excelente calidad de escucha natural.
DiT con semántica mejorada: El modelo fusiona de forma innovadora las incrustaciones de palabras originales del codificador de texto UMT5 con sus estados ocultos de nivel superior. Esto compensa los detalles fonéticos perdidos en las representaciones semánticas de alto nivel, lo que aumenta significativamente la inteligibilidad del habla generada.
Optimización de la inferencia: corrección precisa de la deriva de la voz
Para mejorar aún más la calidad de la generación, el equipo implementó dos mejoras técnicas fundamentales:
Mecanismo de doble restricción: esta técnica identifica y corrige el persistente problema de «desajuste entre entrenamiento e inferencia» en el TTS con coincidencia de flujo. Al restablecer forzosamente las variables latentes en el área de la indicación durante la inferencia, resuelve por completo los problemas de deriva e inestabilidad de la voz del hablante.
Orientación de proyección adaptativa (APG): La APG sustituye a la orientación tradicional sin clasificador (CFG). Es capaz de filtrar con precisión los componentes beneficiosos de la señal de orientación, al tiempo que suprime los componentes que causan degradación del audio, lo que mejora significativamente la naturalidad del habla sin provocar una «sobresaturación» espectral.
Rendimiento: precisión de clonación de nivel SOTA
En las pruebas de referencia con el conjunto de datos Seed, LongCat-AudioDiT demuestra un rendimiento dominante:
Similitud (SIM): El modelo de 3.500 millones de parámetros alcanzó una puntuación de 0,818 en el conjunto de pruebas Seed-ZH y de 0,797 en el exigente conjunto de frases Seed-Hard, superando a modelos destacados como Seed-TTS, CosyVoice3.5 y MiniMax-Speech.
Precisión: Se sitúa entre los mejores del sector en métricas clave, incluyendo un WER en inglés del 1,50 % y un CER en frases difíciles en chino del 6,04 %.
Cabe destacar que LongCat-AudioDiT logra resultados superiores en comparación con los modelos entrenados en múltiples etapas utilizando únicamente un entrenamiento de una sola etapa sobre datos de transcripción ASR preprocesados. El artículo de investigación asociado, el código fuente y los pesos del modelo son ahora de código abierto y están disponibles en GitHub y HuggingFace.
Enlaces del proyecto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











