Дом
Volcano Engine представляет Doubao Audio Model 1.0: кинематографическое звуковое сопровождение на основе одного предложения и единообразные голоса персонажей на 10 минут
Вчера компания Volc Engine официально представила модель генерации аудио Doubao 1.0 (Doubao-Seed-Audio 1.0), которая принимает текстовый или аудиоввод и создает полноценные аудиопроизведения от начала до конца. Её ключевым прорывом является то, что один-единственный запрос позволяет одновременно обрабатывать диалоги, звуковые эффекты и фоновую музыку, избавляя от необходимости ручного многодорожечного монтажа.

Превратите предложение в аудиорежиссёра — без необходимости постобработки.
Ранее для создания высококачественного аудио требовалось отдельно генерировать диалоги, звуковые эффекты и музыку, а затем вручную синхронизировать и микшировать дорожки — сложный процесс, зависящий от опыта в области постпродакшна. Модель генерации аудио Doubao 1.0 объединяет все это в одном запросе: пользователи могут определить реплики нескольких персонажей, их интонацию и эмоциональный ритм в одной инструкции, добавить такие детали, как смех, вздохи, паузы и диалектные акценты, а также одновременно сгенерировать фоновую музыку и окружающие звуковые эффекты, получая готовый продукт напрямую. Создатель контента может ввести описание и сразу же получить готовый к выпуску подкаст, аудиокнигу или фирменный аудиоролик.
Стабильные голоса персонажей на протяжении всего длинного аудиозаписи без потери качества.
Самая большая сложность при создании длинных аудиозаписей — это обеспечение стабильности: необходимо, чтобы персонаж звучал одинаково как на первой, так и на десятой минуте. Модель генерации аудио Doubao 1.0 глубоко интегрирует преобразование текста в аудио с эталонным аудио, поддерживая стабильное качество голоса на протяжении длинных отрезков, благодаря чему авторам не приходится сравнивать и корректировать каждую часть. Текущая версия модели поддерживает генерацию аудио продолжительностью до 2 минут за один цикл, а благодаря функции расширения она сохраняет стабильность голоса в более длинных записях, что подходит для аудиокниг, подкастов и длинных сериалов.
Кроме того, модель предлагает раздельное управление голосом и стилем, позволяя одному и тому же голосу адаптироваться к различным эмоциям и контекстам — и даже давая возможность одному голосу озвучивать несколько ролей с разными интонациями. Это значительно повышает гибкость при озвучивании персонажей и творческом производстве аудиоконтента. В настоящее время Volc Ark открыл тестирование API, и отдельные пользователи могут получить квоту на создание контента объемом 30 минут в Experience Center. Модель генерации аудио Doubao 1.0 также будет запущена в таких продуктах, как CapCut, Jiemod и Tomato.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (1)
Вчера компания Volc Engine официально представила модель генерации аудио Doubao 1.0 (Doubao-Seed-Audio 1.0), которая принимает текстовый или аудиоввод и создает полноценные аудиопроизведения от начала до конца. Её ключевым прорывом является то, что один-единственный запрос позволяет одновременно обрабатывать диалоги, звуковые эффекты и фоновую музыку, избавляя от необходимости ручного многодорожечного монтажа.

Превратите предложение в аудиорежиссёра — без необходимости постобработки.
Ранее для создания высококачественного аудио требовалось отдельно генерировать диалоги, звуковые эффекты и музыку, а затем вручную синхронизировать и микшировать дорожки — сложный процесс, зависящий от опыта в области постпродакшна. Модель генерации аудио Doubao 1.0 объединяет все это в одном запросе: пользователи могут определить реплики нескольких персонажей, их интонацию и эмоциональный ритм в одной инструкции, добавить такие детали, как смех, вздохи, паузы и диалектные акценты, а также одновременно сгенерировать фоновую музыку и окружающие звуковые эффекты, получая готовый продукт напрямую. Создатель контента может ввести описание и сразу же получить готовый к выпуску подкаст, аудиокнигу или фирменный аудиоролик.
Стабильные голоса персонажей на протяжении всего длинного аудиозаписи без потери качества.
Самая большая сложность при создании длинных аудиозаписей — это обеспечение стабильности: необходимо, чтобы персонаж звучал одинаково как на первой, так и на десятой минуте. Модель генерации аудио Doubao 1.0 глубоко интегрирует преобразование текста в аудио с эталонным аудио, поддерживая стабильное качество голоса на протяжении длинных отрезков, благодаря чему авторам не приходится сравнивать и корректировать каждую часть. Текущая версия модели поддерживает генерацию аудио продолжительностью до 2 минут за один цикл, а благодаря функции расширения она сохраняет стабильность голоса в более длинных записях, что подходит для аудиокниг, подкастов и длинных сериалов.
Кроме того, модель предлагает раздельное управление голосом и стилем, позволяя одному и тому же голосу адаптироваться к различным эмоциям и контекстам — и даже давая возможность одному голосу озвучивать несколько ролей с разными интонациями. Это значительно повышает гибкость при озвучивании персонажей и творческом производстве аудиоконтента. В настоящее время Volc Ark открыл тестирование API, и отдельные пользователи могут получить квоту на создание контента объемом 30 минут в Experience Center. Модель генерации аудио Doubao 1.0 также будет запущена в таких продуктах, как CapCut, Jiemod и Tomato.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











