Maison
Tencent Hunyuan et ses partenaires présentent le benchmark MMAE, montrant que la précision dans l’édition audio par intelligence artificielle est inférieure à 5 %.

L’intelligence artificielle a réalisé des progrès significatifs dans la génération d’audio, mais l’édition d’audio existant reste un défi majeur. Récemment, Tencent Hy, en partenariat avec des instituts de recherche de premier plan tels que l’Université Jiaotong de Shanghai (SJTU), l’Université technologique de Nanyang (NTU), l’Université de Tianjin (TJU), l’Université de Pékin (PKU) et l’Université Fudan (FDU), a introduit MMAE (Massive Multitask Audio Editing Benchmark) — le premier benchmark à grande échelle et multi-tâches conçu pour l’édition d’audio pilotée par des instructions générales. Cette publication établit une norme d’évaluation systématique dans le domaine de l’édition audio par intelligence artificielle, mettant en évidence des lacunes claires dans la capacité des technologies actuelles à effectuer des modifications précises.
De la « génération » à l’« édition » : Le véritable défi pour l’audio par IA
L’IA audio traditionnelle se concentre sur la création de nouveaux contenus à partir de texte ou d’instructions. Or, le cœur du benchmark MMAE exige que les modèles comprennent des extraits audio existants et effectuent des ajustements précis en fonction d’instructions en langue naturelle : modifier uniquement les parties qui nécessitent des changements, tout en laissant le reste inchangé. Cette approche fondée sur l’édition plutôt que sur la reconstruction exige une plus grande fidélité audio, une meilleure capacité à suivre les instructions et une compréhension plus profonde du contexte — ce qui la rapproche beaucoup plus des applications réelles telles que la post-production de podcasts, le mixage musical et la personnalisation de la voix.
Les tests montrent que les modèles actuels dominants atteignent un taux de correspondance exacte (EMR) inférieur à 5 %, soulignant d’importants écarts dans la technologie d’édition audio fiable. Cela signifie que l’IA a tendance à modifier excessivement, à ignorer les instructions ou à dégrader la qualité de l’audio original lorsqu’elle doit s’attaquer à des tâches d’édition pratiques.
Points forts du benchmark MMAE : Évaluation multidimensionnelle pour des scénarios réels
Le benchmark MMAE a été conçu avec rigueur et exhaustivité, et comprend les éléments clés suivants :
2 000 échantillons haute fidélité : Tous issus de scénarios réels, ce qui assure une évaluation pratique et diversifiée.17 741 indicateurs d’évaluation détaillés : Ils fournissent un système de notation précis permettant une quantification objective.7 paramètres modaux : Couvrant le son, la musique, le discours et leurs combinaisons, afin de tester dans des environnements audio complexes.6 niveaux de complexité des tâches : Allant des modifications basiques à la réflexion à plusieurs étapes et à l’édition en plusieurs tours, ce qui permet une évaluation complète des capacités du modèle.8 types d’opérations : Ils prennent en charge des tâches d’édition à différentes granularités, tant locales que globales, mettant à l’épreuve le contrôle fin du modèle.
Commentaire d’AIbase : MMAE n’est pas seulement un outil d’évaluation technique — c’est une étape clé pour faire évoluer l’IA audio de la « génération » vers l’« édition ». Il offre une norme unifiée aux chercheurs et développeurs, et devrait accélérer l’apparition de la prochaine génération de modèles d’édition audio.
Perspectives futures : L’édition audio pourrait devenir une force majeure des systèmes multimodaux par IA
À mesure que les grands modèles multimodaux évoluent rapidement, une édition audio précise jouera un rôle essentiel dans la création de contenu, la post-production cinématographique et les outils d’accessibilité. La collaboration récente entre Tencent Hy et d’autres institutions met en lumière la position de leader de la Chine dans la recherche en IA audio. Le secteur s’attend à voir apparaître davantage de ressources open source ainsi que de nouveaux modèles afin de combler collectivement ces lacunes technologiques.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)

L’intelligence artificielle a réalisé des progrès significatifs dans la génération d’audio, mais l’édition d’audio existant reste un défi majeur. Récemment, Tencent Hy, en partenariat avec des instituts de recherche de premier plan tels que l’Université Jiaotong de Shanghai (SJTU), l’Université technologique de Nanyang (NTU), l’Université de Tianjin (TJU), l’Université de Pékin (PKU) et l’Université Fudan (FDU), a introduit MMAE (Massive Multitask Audio Editing Benchmark) — le premier benchmark à grande échelle et multi-tâches conçu pour l’édition d’audio pilotée par des instructions générales. Cette publication établit une norme d’évaluation systématique dans le domaine de l’édition audio par intelligence artificielle, mettant en évidence des lacunes claires dans la capacité des technologies actuelles à effectuer des modifications précises.
De la « génération » à l’« édition » : Le véritable défi pour l’audio par IA
L’IA audio traditionnelle se concentre sur la création de nouveaux contenus à partir de texte ou d’instructions. Or, le cœur du benchmark MMAE exige que les modèles comprennent des extraits audio existants et effectuent des ajustements précis en fonction d’instructions en langue naturelle : modifier uniquement les parties qui nécessitent des changements, tout en laissant le reste inchangé. Cette approche fondée sur l’édition plutôt que sur la reconstruction exige une plus grande fidélité audio, une meilleure capacité à suivre les instructions et une compréhension plus profonde du contexte — ce qui la rapproche beaucoup plus des applications réelles telles que la post-production de podcasts, le mixage musical et la personnalisation de la voix.
Les tests montrent que les modèles actuels dominants atteignent un taux de correspondance exacte (EMR) inférieur à 5 %, soulignant d’importants écarts dans la technologie d’édition audio fiable. Cela signifie que l’IA a tendance à modifier excessivement, à ignorer les instructions ou à dégrader la qualité de l’audio original lorsqu’elle doit s’attaquer à des tâches d’édition pratiques.
Points forts du benchmark MMAE : Évaluation multidimensionnelle pour des scénarios réels
Le benchmark MMAE a été conçu avec rigueur et exhaustivité, et comprend les éléments clés suivants :
2 000 échantillons haute fidélité : Tous issus de scénarios réels, ce qui assure une évaluation pratique et diversifiée.17 741 indicateurs d’évaluation détaillés : Ils fournissent un système de notation précis permettant une quantification objective.7 paramètres modaux : Couvrant le son, la musique, le discours et leurs combinaisons, afin de tester dans des environnements audio complexes.6 niveaux de complexité des tâches : Allant des modifications basiques à la réflexion à plusieurs étapes et à l’édition en plusieurs tours, ce qui permet une évaluation complète des capacités du modèle.8 types d’opérations : Ils prennent en charge des tâches d’édition à différentes granularités, tant locales que globales, mettant à l’épreuve le contrôle fin du modèle.
Commentaire d’AIbase : MMAE n’est pas seulement un outil d’évaluation technique — c’est une étape clé pour faire évoluer l’IA audio de la « génération » vers l’« édition ». Il offre une norme unifiée aux chercheurs et développeurs, et devrait accélérer l’apparition de la prochaine génération de modèles d’édition audio.
Perspectives futures : L’édition audio pourrait devenir une force majeure des systèmes multimodaux par IA
À mesure que les grands modèles multimodaux évoluent rapidement, une édition audio précise jouera un rôle essentiel dans la création de contenu, la post-production cinématographique et les outils d’accessibilité. La collaboration récente entre Tencent Hy et d’autres institutions met en lumière la position de leader de la Chine dans la recherche en IA audio. Le secteur s’attend à voir apparaître davantage de ressources open source ainsi que de nouveaux modèles afin de combler collectivement ces lacunes technologiques.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











