Lar
Tencent Hunyuan e seus parceiros lançam o benchmark MMAE, mostrando que a precisão na edição de áudio por IA fica abaixo de 5%

A inteligência artificial fez avanços significativos na geração de áudio, mas a edição de áudios já existentes continua sendo um grande desafio. Recentemente, a Tencent Hy, em parceria com instituições de pesquisa líderes como a Universidade de Xangai Jiao Tong (SJTU), a Universidade Tecnológica de Nanyang (NTU), a Universidade de Tianjin (TJU), a Universidade de Pequim (PKU) e a Universidade Fudan (FDU), apresentou o MMAE (Massive Multitask Audio Editing Benchmark) — o primeiro benchmark em larga escala e com múltiplas tarefas desenvolvido para edição de áudio orientada por instruções gerais. Essa iniciativa estabelece um padrão sistemático de avaliação para o campo da edição de áudio por IA, revelando lacunas claras na capacidade das tecnologias atuais de realizar modificações precisas.
Da “Geração” à “Edição”: O Verdadeiro Desafio para a IA em Áudio
A IA tradicional voltada para áudio foca na geração de novos conteúdos a partir de texto ou prompts. No entanto, o cerne do benchmark MMAE exige que os modelos compreendam clipes de áudio já existentes e façam ajustes precisos com base em instruções em linguagem natural: modifiquem apenas as partes que precisam ser alteradas, deixando tudo o mais intacto. Essa abordagem de “edição, não reconstrução” demanda maior fidelidade sonora, melhor capacidade de seguir instruções e compreensão mais profunda do contexto — o que a torna muito mais alinhada com aplicações reais como pós-produção de podcasts, mixagem musical e personalização de voz.
Testes mostram que os modelos convencionais atuais alcançam uma Taxa de Correspondência Exata (EMR) geral inferior a 5%, evidenciando grandes deficiências na tecnologia de edição de áudio confiável. Isso significa que a IA tende a modificar em excesso, ignorar instruções ou deteriorar a qualidade do áudio original ao lidar com tarefas práticas de edição.
Principais Características do Benchmark MMAE: Avaliação Multidimensional para Cenários Reais
O benchmark MMAE foi desenvolvido com profundidade e rigor, contando com os seguintes elementos-chave:
2.000 amostras de alta fidelidade: Todas provenientes de cenários reais, garantindo uma avaliação prática e diversificada.17.741 métricas de avaliação detalhadas: Oferecem um critério de pontuação completo para quantificação objetiva.7 configurações de modalidade: Abrangem som, música, fala e suas combinações, permitindo testes em ambientes sonoros complexos.6 níveis de complexidade das tarefas: Vão desde modificações básicas até raciocínio em múltiplos passos e edição em várias rodadas, possibilitando uma avaliação abrangente das capacidades dos modelos.8 tipos de operações: Suportam tarefas de edição em diferentes níveis de granularidade, tanto locais quanto globais, testando o controle preciso do modelo.
Comentário da AIbase: O MMAE não é apenas uma ferramenta técnica de avaliação — ele representa um marco importante na transição da IA em áudio de “gerativa” para “editável”. Ele fornece um padrão unificado para pesquisadores e desenvolvedores e deve acelerar o surgimento da próxima geração de modelos de edição de áudio.
Perspectivas Futuras: A Edição de Áudio Pode Tornar-se uma Força Central dos Sistemas Multimodais de IA
À medida que os grandes modelos multimodais evoluem rapidamente, a edição precisa de áudio desempenhará um papel vital na criação de conteúdo, pós-produção cinematográfica e ferramentas de acessibilidade. A recente colaboração entre a Tencent Hy e outras instituições destaca a posição de liderança da China em pesquisas com IA para áudio. O setor espera que mais recursos de código aberto e modelos subsequentes ajudem a preencher essa lacuna tecnológica coletivamente.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)

A inteligência artificial fez avanços significativos na geração de áudio, mas a edição de áudios já existentes continua sendo um grande desafio. Recentemente, a Tencent Hy, em parceria com instituições de pesquisa líderes como a Universidade de Xangai Jiao Tong (SJTU), a Universidade Tecnológica de Nanyang (NTU), a Universidade de Tianjin (TJU), a Universidade de Pequim (PKU) e a Universidade Fudan (FDU), apresentou o MMAE (Massive Multitask Audio Editing Benchmark) — o primeiro benchmark em larga escala e com múltiplas tarefas desenvolvido para edição de áudio orientada por instruções gerais. Essa iniciativa estabelece um padrão sistemático de avaliação para o campo da edição de áudio por IA, revelando lacunas claras na capacidade das tecnologias atuais de realizar modificações precisas.
Da “Geração” à “Edição”: O Verdadeiro Desafio para a IA em Áudio
A IA tradicional voltada para áudio foca na geração de novos conteúdos a partir de texto ou prompts. No entanto, o cerne do benchmark MMAE exige que os modelos compreendam clipes de áudio já existentes e façam ajustes precisos com base em instruções em linguagem natural: modifiquem apenas as partes que precisam ser alteradas, deixando tudo o mais intacto. Essa abordagem de “edição, não reconstrução” demanda maior fidelidade sonora, melhor capacidade de seguir instruções e compreensão mais profunda do contexto — o que a torna muito mais alinhada com aplicações reais como pós-produção de podcasts, mixagem musical e personalização de voz.
Testes mostram que os modelos convencionais atuais alcançam uma Taxa de Correspondência Exata (EMR) geral inferior a 5%, evidenciando grandes deficiências na tecnologia de edição de áudio confiável. Isso significa que a IA tende a modificar em excesso, ignorar instruções ou deteriorar a qualidade do áudio original ao lidar com tarefas práticas de edição.
Principais Características do Benchmark MMAE: Avaliação Multidimensional para Cenários Reais
O benchmark MMAE foi desenvolvido com profundidade e rigor, contando com os seguintes elementos-chave:
2.000 amostras de alta fidelidade: Todas provenientes de cenários reais, garantindo uma avaliação prática e diversificada.17.741 métricas de avaliação detalhadas: Oferecem um critério de pontuação completo para quantificação objetiva.7 configurações de modalidade: Abrangem som, música, fala e suas combinações, permitindo testes em ambientes sonoros complexos.6 níveis de complexidade das tarefas: Vão desde modificações básicas até raciocínio em múltiplos passos e edição em várias rodadas, possibilitando uma avaliação abrangente das capacidades dos modelos.8 tipos de operações: Suportam tarefas de edição em diferentes níveis de granularidade, tanto locais quanto globais, testando o controle preciso do modelo.
Comentário da AIbase: O MMAE não é apenas uma ferramenta técnica de avaliação — ele representa um marco importante na transição da IA em áudio de “gerativa” para “editável”. Ele fornece um padrão unificado para pesquisadores e desenvolvedores e deve acelerar o surgimento da próxima geração de modelos de edição de áudio.
Perspectivas Futuras: A Edição de Áudio Pode Tornar-se uma Força Central dos Sistemas Multimodais de IA
À medida que os grandes modelos multimodais evoluem rapidamente, a edição precisa de áudio desempenhará um papel vital na criação de conteúdo, pós-produção cinematográfica e ferramentas de acessibilidade. A recente colaboração entre a Tencent Hy e outras instituições destaca a posição de liderança da China em pesquisas com IA para áudio. O setor espera que mais recursos de código aberto e modelos subsequentes ajudem a preencher essa lacuna tecnológica coletivamente.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











