Дом
Tencent Hunyuan и его партнеры представили эталонный инструмент MMAE, показав, что точность алгоритмов обработки аудио в ИИ составляет менее 5%.

Искусственный интеллект добился значительного прогресса в генерации аудиоконтента, однако редактирование уже существующего аудио по-прежнему остается серьёзной задачей. Недавно Tencent Hy совместно с ведущими исследовательскими учреждениями, включая Шанхайский университет Цзяотун (SJTU), Технологический университет Наньян (NTU), Университет Тяньцзинь (TJU), Пекинский университет (PKU) и Университет Фудань (FDU), представил MMAE (Massive Multitask Audio Editing Benchmark) — первый крупномасштабный мультизадачный эталон, разработанный для общего редактирования аудио на основе текстовых указаний. Это издание устанавливает систематический стандарт оценки в области редактирования аудио с помощью ИИ, выявляя явные недостатки в способности современных технологий выполнять точные изменения.
От «генерации» к «редактированию»: настоящая задача для аудио-ИИ
Традиционные системы ИИ для обработки аудио сосредоточены на создании нового контента из текста или команд. Однако суть эталона MMAE заключается в том, чтобы модели понимали уже существующие аудиоклипы и вносили точные корректировки на основе указаний, сформулированных на естественном языке: изменять только те части, которые требуют правки, оставляя всё остальное без изменений. Такой подход «редактирования вместо реконструкции» требует более высокой фидельности аудио, лучшего выполнения указаний и глубокого понимания контекста — что делает его гораздо более соответствующим реальным задачам, таким как постпродакшн подкастов, микширование музыки и персонализация голоса.
Тесты показывают, что современные основные модели достигают общего показателя Exact Match Rate (EMR) ниже 5%, что свидетельствует о значительных пробелах в технологиях надёжного редактирования аудио. Это означает, что ИИ склонен чрезмерно изменять контент, игнорировать указания или снижать качество исходного аудио при выполнении практических задач по редактированию.
Особенности эталона MMAE: многомерная оценка для реальных сценариев
Эталон MMAE разработан с большой тщательностью и строгостью и включает следующие ключевые элементы:
2 000 образцов высокой фидельности: все они взяты из реальных ситуаций, что обеспечивает практичную и разнообразную оценку. 17 741 тонко настроенный показатель оценки: предоставляют детальную шкалу баллов для объективной квантификации. 7 режимов работы: охватывают звук, музыку, речь и их комбинации, позволяя тестировать в сложных аудиосредах. 6 уровней сложности задач: от простых изменений до многоэтапного логического мышления и многократного редактирования, что позволяет всесторонне оценить возможности модели. 8 типов операций: поддерживают задачи редактирования на разных уровнях детализации — как локальные, так и глобальные, что ставит перед моделью вызов в плане точного контроля.
Комментарий AIbase: MMAE — это не просто технический инструмент оценки; он представляет собой важную веху на пути развития аудио-ИИ от «генеративного» к «редактируемому». Он обеспечивает единый стандарт для исследователей и разработчиков и, как ожидается, ускорит создание нового поколения моделей для редактирования аудио.
Перспективы будущего: редактирование аудио может стать ключевой особенностью мультимодальных систем ИИ
По мере быстрого развития мультимодальных больших моделей точное редактирование аудио будет играть важную роль в создании контента, постпродакшне фильмов и инструментах для обеспечения доступности. Недавнее сотрудничество Tencent Hy с другими учреждениями подчёркивает ведущие позиции Китая в исследованиях аудио-ИИ. Индустрия ожидает появления большего количества ресурсов с открытым кодом и последующих моделей, которые помогут преодолеть эти технологические пробелы.
Связанная статья
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Рекомендации по связанным специальным темам
Комментарии (0)

Искусственный интеллект добился значительного прогресса в генерации аудиоконтента, однако редактирование уже существующего аудио по-прежнему остается серьёзной задачей. Недавно Tencent Hy совместно с ведущими исследовательскими учреждениями, включая Шанхайский университет Цзяотун (SJTU), Технологический университет Наньян (NTU), Университет Тяньцзинь (TJU), Пекинский университет (PKU) и Университет Фудань (FDU), представил MMAE (Massive Multitask Audio Editing Benchmark) — первый крупномасштабный мультизадачный эталон, разработанный для общего редактирования аудио на основе текстовых указаний. Это издание устанавливает систематический стандарт оценки в области редактирования аудио с помощью ИИ, выявляя явные недостатки в способности современных технологий выполнять точные изменения.
От «генерации» к «редактированию»: настоящая задача для аудио-ИИ
Традиционные системы ИИ для обработки аудио сосредоточены на создании нового контента из текста или команд. Однако суть эталона MMAE заключается в том, чтобы модели понимали уже существующие аудиоклипы и вносили точные корректировки на основе указаний, сформулированных на естественном языке: изменять только те части, которые требуют правки, оставляя всё остальное без изменений. Такой подход «редактирования вместо реконструкции» требует более высокой фидельности аудио, лучшего выполнения указаний и глубокого понимания контекста — что делает его гораздо более соответствующим реальным задачам, таким как постпродакшн подкастов, микширование музыки и персонализация голоса.
Тесты показывают, что современные основные модели достигают общего показателя Exact Match Rate (EMR) ниже 5%, что свидетельствует о значительных пробелах в технологиях надёжного редактирования аудио. Это означает, что ИИ склонен чрезмерно изменять контент, игнорировать указания или снижать качество исходного аудио при выполнении практических задач по редактированию.
Особенности эталона MMAE: многомерная оценка для реальных сценариев
Эталон MMAE разработан с большой тщательностью и строгостью и включает следующие ключевые элементы:
2 000 образцов высокой фидельности: все они взяты из реальных ситуаций, что обеспечивает практичную и разнообразную оценку. 17 741 тонко настроенный показатель оценки: предоставляют детальную шкалу баллов для объективной квантификации. 7 режимов работы: охватывают звук, музыку, речь и их комбинации, позволяя тестировать в сложных аудиосредах. 6 уровней сложности задач: от простых изменений до многоэтапного логического мышления и многократного редактирования, что позволяет всесторонне оценить возможности модели. 8 типов операций: поддерживают задачи редактирования на разных уровнях детализации — как локальные, так и глобальные, что ставит перед моделью вызов в плане точного контроля.
Комментарий AIbase: MMAE — это не просто технический инструмент оценки; он представляет собой важную веху на пути развития аудио-ИИ от «генеративного» к «редактируемому». Он обеспечивает единый стандарт для исследователей и разработчиков и, как ожидается, ускорит создание нового поколения моделей для редактирования аудио.
Перспективы будущего: редактирование аудио может стать ключевой особенностью мультимодальных систем ИИ
По мере быстрого развития мультимодальных больших моделей точное редактирование аудио будет играть важную роль в создании контента, постпродакшне фильмов и инструментах для обеспечения доступности. Недавнее сотрудничество Tencent Hy с другими учреждениями подчёркивает ведущие позиции Китая в исследованиях аудио-ИИ. Индустрия ожидает появления большего количества ресурсов с открытым кодом и последующих моделей, которые помогут преодолеть эти технологические пробелы.
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











