Дом
Meituan открыла исходный код LongCat-Video-Avatar 1.5, превосходящий по эффективности основные закрытые модели
Команда Meituan, занимающаяся разработкой крупномасштабной модели LongCat, официально открыла исходный код LongCat-Video-Avatar 1.5 — модели генерации видео с цифровыми персонажами коммерческого уровня. Эта версия знаменует собой полный переход от передовых технологий с открытым исходным кодом к реальному коммерческому внедрению и включает значительные усовершенствования в области синхронизации губ, физического реализма, стабильности при воспроизведении длинных видеороликов, взаимодействия нескольких персонажей и эффективности инференции.
Три ключевых усовершенствования для преодоления препятствий на пути к коммерциализации
Чтобы обеспечить надёжную работу цифровых людей в различных реальных приложениях, LongCat-Video-Avatar 1.5 решает такие хронические проблемы традиционных видео с цифровыми людьми, как дрожание, искажения и высокая задержка, посредством трёх комплексных улучшений:
Улучшение кодирования аудио коммерческого уровня
Кодер извлечения аудиоособенностей модели был обновлен с Wav2Vec2 до Whisper-large. Благодаря большему количеству параметров и более обширным многоязычным априорным знаниям он теперь улавливает тонкие вариации фонем и ритм речи. Это улучшает синхронизацию губ при обработке сложного аудио, такого как длинные предложения, быстрая речь и пение, а также обеспечивает естественную координацию между мимикой, движениями головы и речью — что значительно сокращает пропуск кадров и смещение идентичности в более длинных видеороликах.
Надежная генерализация в открытом домене за счет многоэтапного обогащения данных
Чтобы обеспечить стабильную производительность при работе с разнообразными объектами — реальными людьми, виртуальными идолами, персонажами аниме и животными — команда разработала многоэтапный конвейер обработки данных, включающий офлайн-аннотирование и онлайн-валидацию, а также внедрила три целевых типа расширенных данных:
Данные с участием нескольких человек: с помощью активного обнаружения говорящего устраняется аудиовизуальная неоднозначность в сценах с участием нескольких человек, что позволяет точно различать говорящих и слушающих.
Данные с тишиной: благодаря отбору видеороликов без речи модель обучается распознавать естественные микровыражения лица в моменты молчания, что позволяет предотвратить нежелательные движения рта у персонажей, не произносящих речи.
Данные об эмоциях: в сочетании с фильтрацией распознавания эмоций на уровне отдельных кадров они учитывают эмоциональные вариации, помогая модели уловить глубокую связь между речью и мимикой.
Выравнивание рук и временная непрерывность с помощью GRPO
Для таких сценариев использования, как прямые трансляции в электронной коммерции и демонстрации продуктов, где часто видны руки, модель использует GRPO (Human Preference Alignment), который уточняет сигналы вознаграждения до уровня отдельного кадра и добавляет механизм обнаружения рук в первом кадре. Это существенно уменьшает такие распространенные проблемы, как искажение рук, локальный структурный коллапс и несогласованность движений.

В 15 раз более быстрая инференция: устранение высоких вычислительных затрат
Стоимость — ещё один критически важный фактор для коммерческого внедрения. LongCat-Video-Avatar 1.5 использует технологию DMD (Distributed Matching Distillation), сокращая исходный 50-этапный процесс генерации до всего 8 этапов. Кроме того, команда заменила традиционную параллельную конфигурацию из трёх моделей на одну общую базовую модель с несколькими адаптерами LoRA, что позволило резко сократить использование VRAM.
В реальных тестах модель обеспечивает примерно в 15 раз более быструю инференцию, генерируя 10-секундное видео примерно за одну минуту.
Оценка по бенчмарку: превосходство над ведущими отраслевыми моделями
С использованием тестового набора EvalTalker 770 оценщиков и 10 экспертов в различных областях провели структурированный анализ качества видеороликов из сложных тематических областей, включая новости, образование и развлечения. Результаты показывают, что LongCat-Video-Avatar 1.5 демонстрирует превосходные показатели по нескольким ключевым метрикам:
Показатель предпочтений пользователей: он превосходит Kling Avatar 2.0 на 65,9 %, OmniHuman-1.5 — на 61,1 % и HeyGen — на 54,3 %.
Оценки в сценариях с одним и несколькими участниками: оценка в сценарии с одним участником достигает 3,336, что значительно превышает показатели таких конкурентов, как HeyGen; оценка в сценарии с несколькими участниками составляет 2,730, что значительно превосходит показатель InfiniteTalk (2,339).
Стабильность видео: частота деформации объекта составляет всего 23,1%, а деформации фона — всего 9,4%;частота пропуска кадров составляет всего 0,8%, что является лучшим показателем среди всех сравниваемых моделей.
Аудиовизуальная координация: частота проблем с синхронизацией лица и тела снизилась до 5,1%, а частота проблем с синхронизацией губ — до 29,8%; оба показателя превосходят традиционные коммерческие системы.
Команда разработчиков крупной модели Meituan LongCat заявляет, что открытие исходного кода LongCat-Video-Avatar 1.5 — это не просто обновление версии, а приглашение к сотрудничеству для глобального сообщества разработчиков и творцов. Они надеются, что эта модель станет проверяемой и поддающейся совершенствованию технической основой, которая поможет расширить реальные границы применения технологий цифровых человеческих видеоаватаров.
Ссылки на открытый исходный код:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Технический отчет: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Страница проекта: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Команда Meituan, занимающаяся разработкой крупномасштабной модели LongCat, официально открыла исходный код LongCat-Video-Avatar 1.5 — модели генерации видео с цифровыми персонажами коммерческого уровня. Эта версия знаменует собой полный переход от передовых технологий с открытым исходным кодом к реальному коммерческому внедрению и включает значительные усовершенствования в области синхронизации губ, физического реализма, стабильности при воспроизведении длинных видеороликов, взаимодействия нескольких персонажей и эффективности инференции.
Три ключевых усовершенствования для преодоления препятствий на пути к коммерциализации
Чтобы обеспечить надёжную работу цифровых людей в различных реальных приложениях, LongCat-Video-Avatar 1.5 решает такие хронические проблемы традиционных видео с цифровыми людьми, как дрожание, искажения и высокая задержка, посредством трёх комплексных улучшений:
Улучшение кодирования аудио коммерческого уровня
Кодер извлечения аудиоособенностей модели был обновлен с Wav2Vec2 до Whisper-large. Благодаря большему количеству параметров и более обширным многоязычным априорным знаниям он теперь улавливает тонкие вариации фонем и ритм речи. Это улучшает синхронизацию губ при обработке сложного аудио, такого как длинные предложения, быстрая речь и пение, а также обеспечивает естественную координацию между мимикой, движениями головы и речью — что значительно сокращает пропуск кадров и смещение идентичности в более длинных видеороликах.
Надежная генерализация в открытом домене за счет многоэтапного обогащения данных
Чтобы обеспечить стабильную производительность при работе с разнообразными объектами — реальными людьми, виртуальными идолами, персонажами аниме и животными — команда разработала многоэтапный конвейер обработки данных, включающий офлайн-аннотирование и онлайн-валидацию, а также внедрила три целевых типа расширенных данных:
Данные с участием нескольких человек: с помощью активного обнаружения говорящего устраняется аудиовизуальная неоднозначность в сценах с участием нескольких человек, что позволяет точно различать говорящих и слушающих.
Данные с тишиной: благодаря отбору видеороликов без речи модель обучается распознавать естественные микровыражения лица в моменты молчания, что позволяет предотвратить нежелательные движения рта у персонажей, не произносящих речи.
Данные об эмоциях: в сочетании с фильтрацией распознавания эмоций на уровне отдельных кадров они учитывают эмоциональные вариации, помогая модели уловить глубокую связь между речью и мимикой.
Выравнивание рук и временная непрерывность с помощью GRPO
Для таких сценариев использования, как прямые трансляции в электронной коммерции и демонстрации продуктов, где часто видны руки, модель использует GRPO (Human Preference Alignment), который уточняет сигналы вознаграждения до уровня отдельного кадра и добавляет механизм обнаружения рук в первом кадре. Это существенно уменьшает такие распространенные проблемы, как искажение рук, локальный структурный коллапс и несогласованность движений.

В 15 раз более быстрая инференция: устранение высоких вычислительных затрат
Стоимость — ещё один критически важный фактор для коммерческого внедрения. LongCat-Video-Avatar 1.5 использует технологию DMD (Distributed Matching Distillation), сокращая исходный 50-этапный процесс генерации до всего 8 этапов. Кроме того, команда заменила традиционную параллельную конфигурацию из трёх моделей на одну общую базовую модель с несколькими адаптерами LoRA, что позволило резко сократить использование VRAM.
В реальных тестах модель обеспечивает примерно в 15 раз более быструю инференцию, генерируя 10-секундное видео примерно за одну минуту.
Оценка по бенчмарку: превосходство над ведущими отраслевыми моделями
С использованием тестового набора EvalTalker 770 оценщиков и 10 экспертов в различных областях провели структурированный анализ качества видеороликов из сложных тематических областей, включая новости, образование и развлечения. Результаты показывают, что LongCat-Video-Avatar 1.5 демонстрирует превосходные показатели по нескольким ключевым метрикам:
Показатель предпочтений пользователей: он превосходит Kling Avatar 2.0 на 65,9 %, OmniHuman-1.5 — на 61,1 % и HeyGen — на 54,3 %.
Оценки в сценариях с одним и несколькими участниками: оценка в сценарии с одним участником достигает 3,336, что значительно превышает показатели таких конкурентов, как HeyGen; оценка в сценарии с несколькими участниками составляет 2,730, что значительно превосходит показатель InfiniteTalk (2,339).
Стабильность видео: частота деформации объекта составляет всего 23,1%, а деформации фона — всего 9,4%;частота пропуска кадров составляет всего 0,8%, что является лучшим показателем среди всех сравниваемых моделей.
Аудиовизуальная координация: частота проблем с синхронизацией лица и тела снизилась до 5,1%, а частота проблем с синхронизацией губ — до 29,8%; оба показателя превосходят традиционные коммерческие системы.
Команда разработчиков крупной модели Meituan LongCat заявляет, что открытие исходного кода LongCat-Video-Avatar 1.5 — это не просто обновление версии, а приглашение к сотрудничеству для глобального сообщества разработчиков и творцов. Они надеются, что эта модель станет проверяемой и поддающейся совершенствованию технической основой, которая поможет расширить реальные границы применения технологий цифровых человеческих видеоаватаров.
Ссылки на открытый исходный код:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Технический отчет: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Страница проекта: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











