Hogar
Tencent Hunyuan y sus socios presentan el estándar de referencia MMAE, que muestra que la precisión en la edición de audio por IA es inferior al 5%.

La inteligencia artificial ha logrado avances significativos en la generación de audio, pero editar audio existente sigue siendo un desafío importante. Recientemente, Tencent Hy, en colaboración con destacadas instituciones de investigación como la Universidad de Shanghái Jiao Tong (SJTU), la Universidad Tecnológica de Nanyang (NTU), la Universidad de Tianjin (TJU), la Universidad de Pekín (PKU) y la Universidad Fudan (FDU), presentó MMAE (Massive Multitask Audio Editing Benchmark): el primer estándar a gran escala y multi-tarea diseñado para la edición de audio impulsada por instrucciones generales. Esta iniciativa establece un criterio de evaluación sistemático para el campo de la edición de audio mediante inteligencia artificial, evidenciando brechas claras en la capacidad de las tecnologías actuales para realizar modificaciones precisas.
De la “generación” a la “edición”: El verdadero desafío para el audio por IA
La IA tradicional dedicada al audio se centra en generar contenido nuevo a partir de texto o instrucciones. Sin embargo, el núcleo del estándar MMAE exige que los modelos comprendan clips de audio existentes y realicen ajustes precisos según instrucciones en lenguaje natural: modifiquen únicamente las partes que necesitan cambio, dejando todo lo demás intacto. Este enfoque basado en la edición y no en la reconstrucción demanda una mayor fidelidad auditiva, un mejor seguimiento de instrucciones y una comprensión más profunda del contexto, lo que lo hace mucho más adecuado para aplicaciones reales como la posproducción de podcasts, la mezcla musical y la personalización de voces.
Las pruebas revelan que los modelos convencionales actuales alcanzan una tasa general de Exact Match Rate (EMR) inferior al 5%, lo que destaca las importantes deficiencias en la tecnología de edición de audio fiable. Esto significa que la IA tiende a modificar en exceso, pasar por alto instrucciones o degradar la calidad del audio original al abordar tareas de edición prácticas.
Principales características del estándar MMAE: Evaluación multidimensional para escenarios reales
El estándar MMAE fue diseñado con meticulosidad y rigor, e incluye los siguientes elementos clave:
2.000 muestras de alta fidelidad: Todas provenientes de escenarios reales, lo que garantiza una evaluación práctica y diversa.17.741 métricas de evaluación detalladas: Ofrecen un sistema de puntuación completo para una cuantificación objetiva.7 configuraciones modales: Cubren sonido, música, voz y sus combinaciones, permitiendo pruebas en entornos auditivos complejos.6 niveles de complejidad en las tareas: Van desde modificaciones básicas hasta razonamiento multietapa y edición en varias rondas, lo que permite una evaluación integral de las capacidades del modelo.8 tipos de operaciones: Permiten realizar tareas de edición a diferentes niveles de detalle, tanto locales como globales, poniendo a prueba el control fino del modelo.
Comentario de AIbase: MMAE no es solo una herramienta de evaluación técnica; representa un hito en la transición de la IA auditiva de ser “generativa” a “editable”. Ofrece un estándar unificado para investigadores y desarrolladores, y se espera que acelere el desarrollo de la próxima generación de modelos de edición de audio.
Perspectivas futuras: La edición de audio podría convertirse en una fortaleza clave de los sistemas multimodales por IA
A medida que los modelos grandes multimodales evolucionan rápidamente, la edición precisa de audio desempeñará un papel vital en la creación de contenido, la posproducción cinematográfica y las herramientas de accesibilidad. La reciente colaboración entre Tencent Hy y otras instituciones destaca la posición líder de China en la investigación de IA auditiva. La industria espera ver más recursos de código abierto y modelos posteriores que, conjuntamente, colmen esta brecha tecnológica.
Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

La inteligencia artificial ha logrado avances significativos en la generación de audio, pero editar audio existente sigue siendo un desafío importante. Recientemente, Tencent Hy, en colaboración con destacadas instituciones de investigación como la Universidad de Shanghái Jiao Tong (SJTU), la Universidad Tecnológica de Nanyang (NTU), la Universidad de Tianjin (TJU), la Universidad de Pekín (PKU) y la Universidad Fudan (FDU), presentó MMAE (Massive Multitask Audio Editing Benchmark): el primer estándar a gran escala y multi-tarea diseñado para la edición de audio impulsada por instrucciones generales. Esta iniciativa establece un criterio de evaluación sistemático para el campo de la edición de audio mediante inteligencia artificial, evidenciando brechas claras en la capacidad de las tecnologías actuales para realizar modificaciones precisas.
De la “generación” a la “edición”: El verdadero desafío para el audio por IA
La IA tradicional dedicada al audio se centra en generar contenido nuevo a partir de texto o instrucciones. Sin embargo, el núcleo del estándar MMAE exige que los modelos comprendan clips de audio existentes y realicen ajustes precisos según instrucciones en lenguaje natural: modifiquen únicamente las partes que necesitan cambio, dejando todo lo demás intacto. Este enfoque basado en la edición y no en la reconstrucción demanda una mayor fidelidad auditiva, un mejor seguimiento de instrucciones y una comprensión más profunda del contexto, lo que lo hace mucho más adecuado para aplicaciones reales como la posproducción de podcasts, la mezcla musical y la personalización de voces.
Las pruebas revelan que los modelos convencionales actuales alcanzan una tasa general de Exact Match Rate (EMR) inferior al 5%, lo que destaca las importantes deficiencias en la tecnología de edición de audio fiable. Esto significa que la IA tiende a modificar en exceso, pasar por alto instrucciones o degradar la calidad del audio original al abordar tareas de edición prácticas.
Principales características del estándar MMAE: Evaluación multidimensional para escenarios reales
El estándar MMAE fue diseñado con meticulosidad y rigor, e incluye los siguientes elementos clave:
2.000 muestras de alta fidelidad: Todas provenientes de escenarios reales, lo que garantiza una evaluación práctica y diversa.17.741 métricas de evaluación detalladas: Ofrecen un sistema de puntuación completo para una cuantificación objetiva.7 configuraciones modales: Cubren sonido, música, voz y sus combinaciones, permitiendo pruebas en entornos auditivos complejos.6 niveles de complejidad en las tareas: Van desde modificaciones básicas hasta razonamiento multietapa y edición en varias rondas, lo que permite una evaluación integral de las capacidades del modelo.8 tipos de operaciones: Permiten realizar tareas de edición a diferentes niveles de detalle, tanto locales como globales, poniendo a prueba el control fino del modelo.
Comentario de AIbase: MMAE no es solo una herramienta de evaluación técnica; representa un hito en la transición de la IA auditiva de ser “generativa” a “editable”. Ofrece un estándar unificado para investigadores y desarrolladores, y se espera que acelere el desarrollo de la próxima generación de modelos de edición de audio.
Perspectivas futuras: La edición de audio podría convertirse en una fortaleza clave de los sistemas multimodales por IA
A medida que los modelos grandes multimodales evolucionan rápidamente, la edición precisa de audio desempeñará un papel vital en la creación de contenido, la posproducción cinematográfica y las herramientas de accesibilidad. La reciente colaboración entre Tencent Hy y otras instituciones destaca la posición líder de China en la investigación de IA auditiva. La industria espera ver más recursos de código abierto y modelos posteriores que, conjuntamente, colmen esta brecha tecnológica.
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











