Дом
Tencent и Цинхуа запустили SongGeneration 2 с уровнем ошибок 8,55 %, усилив давление на Suno
В начале 2026 года в сфере музыки, создаваемой с помощью искусственного интеллекта, произошёл очередной значительный сдвиг. 9 марта была официально представлена базовая модель для генерации музыки SongGeneration2, разработанная совместно компанией Tencent и Лабораторией взаимодействия человека и компьютера в области речи при Университете Цинхуа . Эта модель не только ознаменовала качественный скачок в технической архитектуре, но и превзошла существующие основные модели с открытым исходным кодом по целому ряду ключевых показателей, а по общему качеству даже не уступала ведущим коммерческим моделям.

Три прорыва: конец «неживой» музыке, созданной ИИ
Основные преимущества SongGeneration2 обусловлены комплексным обновлением базовой архитектуры, устраняющим три ключевые проблемы, которые мешали развитию ИИ-музыки ранее:
Высокая музыкальность: в отличие от простого наложения мелодий, эта модель обрабатывает сложные многодорожечные аранжировки с впечатляющей пространственной глубиной.
Высокая точность текстов: нечеткое произношение и хаотичные изменения высоты тона теперь остались в прошлом. Показатель ошибок фонем (PER) составляет всего 8,55%, что значительно превосходит показатель ведущей коммерческой модели Suno v5 (12,4%) и уступает лишь MiniMax2.5 .
Высокая управляемость: будь то текстовые описания или аудиоподсказки, модель точно следует инструкциям, что позволяет глубоко настраивать стиль и эмоциональную окраску.

«Двухъядерный» привод: идеальное сотрудничество между LLM и диффузионными моделями
С архитектурной точки зрения SongGeneration2 использует инновационную гибридную архитектуру LLM-диффузии:
«Композиторский мозг» (LeLM): отвечает за планирование общей структуры и вокальные детали, решая задачу «как петь».
High-Fidelity Renderer (диффузия): синтезирует чрезвычайно сложные акустические детали под руководством языковой модели.
Иерархическое представление: первая система, использующая параллельное моделирование смешанных и многодорожечных представлений, обеспечивающая баланс между стабильностью мелодии и усовершенствованием качества звука.
Настоящий открытый исходный код, низкий порог входа: даже обычные компьютеры могут «сочинять песни»
Больше всего разработчиков воодушевила замечательная открытость Tencent. Модель SongGeneration-v2-large с 4 миллиардами параметров теперь полностью открыта, поддерживая многоязычное генерацию, включая китайский и английский языки. Примечательно, что она плавно работает на потребительском оборудовании с всего лишь 22 ГБ видеопамяти, что позволяет создавать музыку локально и в частном режиме.
Чтобы пользователи могли сразу же опробовать эту технологию, команда также выпустила версию SongGeneration-v2-Fast на HuggingFace, в которой минимальное снижение качества звука компенсируется сверхбыстрым генерацией — создание полной песни занимает менее минуты.
Судя по производительности SongGeneration2 , музыка на базе ИИ официально превратилась из «игрушки для гиков» в сферу «приложений коммерческого уровня». С предстоящим открытием исходного кода модели Medium, поддерживающей 12 ГБ видеопамяти, и появлением автоматизированной системы оценки, эра, когда каждый сможет стать «композитором», возможно, наконец-то наступит.
Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (0)
В начале 2026 года в сфере музыки, создаваемой с помощью искусственного интеллекта, произошёл очередной значительный сдвиг. 9 марта была официально представлена базовая модель для генерации музыки SongGeneration2, разработанная совместно компанией

Три прорыва: конец «неживой» музыке, созданной ИИ
Основные преимущества
Высокая музыкальность: в отличие от простого наложения мелодий, эта модель обрабатывает сложные многодорожечные аранжировки с впечатляющей пространственной глубиной.
Высокая точность текстов: нечеткое произношение и хаотичные изменения высоты тона теперь остались в прошлом. Показатель ошибок фонем (PER) составляет всего 8,55%, что значительно превосходит показатель ведущей коммерческой модели
Высокая управляемость: будь то текстовые описания или аудиоподсказки, модель точно следует инструкциям, что позволяет глубоко настраивать стиль и эмоциональную окраску.

«Двухъядерный» привод: идеальное сотрудничество между LLM и диффузионными моделями
С архитектурной точки зрения
«Композиторский мозг» (LeLM): отвечает за планирование общей структуры и вокальные детали, решая задачу «как петь».
High-Fidelity Renderer (диффузия): синтезирует чрезвычайно сложные акустические детали под руководством языковой модели.
Иерархическое представление: первая система, использующая параллельное моделирование смешанных и многодорожечных представлений, обеспечивающая баланс между стабильностью мелодии и усовершенствованием качества звука.
Настоящий открытый исходный код, низкий порог входа: даже обычные компьютеры могут «сочинять песни»
Больше всего разработчиков воодушевила замечательная открытость Tencent. Модель SongGeneration-v2-large с 4 миллиардами параметров теперь полностью открыта, поддерживая многоязычное генерацию, включая китайский и английский языки. Примечательно, что она плавно работает на потребительском оборудовании с всего лишь 22 ГБ видеопамяти, что позволяет создавать музыку локально и в частном режиме.
Чтобы пользователи могли сразу же опробовать эту технологию, команда также выпустила версию SongGeneration-v2-Fast на HuggingFace, в которой минимальное снижение качества звука компенсируется сверхбыстрым генерацией — создание полной песни занимает менее минуты.
Судя по производительности
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











