Дом
Alibaba Tongyi представляет голосовую модель с управлением на естественном языке «FreeStyle»
Сегодня команда Alibaba Tongyi Lab по разработке речевых технологий представила две революционные модели генерации голоса: Fun-CosyVoice3.5 и Fun-AudioGen-VD. Отличительной особенностью этих моделей является поддержка команд «FreeStyle». Вместо сложной настройки параметров пользователи могут точно контролировать стили вокального выражения или создавать сложные аудиосцены с нуля, используя простые описания на естественном языке.

Каждая модель служит определенным целям:
Fun-CosyVoice3.5: многоязычное воспроизведение и тонкое управление
Эта усовершенствованная версия CosyVoice достигает прорыва в понимании нюансов речевой экспрессии.
Генерация на основе команд: пользователи могут вводить инструкции, такие как «говорить более уверенно» или «замедлить речь с эмоциональными колебаниями», для корректировки голоса в режиме реального времени.
Расширение языкового диапазона: добавлена поддержка тайского, индонезийского, португальского и вьетнамского языков, что позволяет сохранить лидирующие в отрасли показатели точности транскрипции (WER) и схожести голоса на 13 языках.
Оптимизация редких символов: специальное обучение снизило уровень ошибок для редких символов с 15,2% до 5,3%.
Повышение производительности: задержка первого пакета уменьшилась на 35%, что значительно улучшило плавность взаимодействия в реальном времени.
Fun-AudioGen-VD: комплексное звуковое проектирование
Эта модель действует как «аудиорежиссер», генерируя интегрированный звук, сочетающий «персонажей + окружение».
Настройка голоса: Укажите пол, возраст, акцент и подробные характеристики, такие как «хриплый, глубокий или низкий» голос.
Эмоции и ролевые игры: имитирует роли, включая агентов службы поддержки клиентов, дикторов и детей, даже передавая сложные состояния, такие как «внешнее спокойствие с внутренним напряжением».
Иммерсивные среды: добавляет фоновые звуки (хаос на поле боя, шум в кафе) и пространственные эффекты (реверберация собора, подводная акустика) для полной пространственной симуляции.
Tongyi Lab отмечает, что эти модели демократизируют создание высококачественного голоса, предлагая мощную поддержку ИИ для подкастинга, разработки игр и постпродакшна фильмов.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Сегодня команда Alibaba Tongyi Lab по разработке речевых технологий представила две революционные модели генерации голоса: Fun-CosyVoice3.5 и Fun-AudioGen-VD. Отличительной особенностью этих моделей является поддержка команд «FreeStyle». Вместо сложной настройки параметров пользователи могут точно контролировать стили вокального выражения или создавать сложные аудиосцены с нуля, используя простые описания на естественном языке.

Каждая модель служит определенным целям:
Fun-CosyVoice3.5: многоязычное воспроизведение и тонкое управление
Эта усовершенствованная версия CosyVoice достигает прорыва в понимании нюансов речевой экспрессии.
Генерация на основе команд: пользователи могут вводить инструкции, такие как «говорить более уверенно» или «замедлить речь с эмоциональными колебаниями», для корректировки голоса в режиме реального времени.
Расширение языкового диапазона: добавлена поддержка тайского, индонезийского, португальского и вьетнамского языков, что позволяет сохранить лидирующие в отрасли показатели точности транскрипции (WER) и схожести голоса на 13 языках.
Оптимизация редких символов: специальное обучение снизило уровень ошибок для редких символов с 15,2% до 5,3%.
Повышение производительности: задержка первого пакета уменьшилась на 35%, что значительно улучшило плавность взаимодействия в реальном времени.
Fun-AudioGen-VD: комплексное звуковое проектирование
Эта модель действует как «аудиорежиссер», генерируя интегрированный звук, сочетающий «персонажей + окружение».
Настройка голоса: Укажите пол, возраст, акцент и подробные характеристики, такие как «хриплый, глубокий или низкий» голос.
Эмоции и ролевые игры: имитирует роли, включая агентов службы поддержки клиентов, дикторов и детей, даже передавая сложные состояния, такие как «внешнее спокойствие с внутренним напряжением».
Иммерсивные среды: добавляет фоновые звуки (хаос на поле боя, шум в кафе) и пространственные эффекты (реверберация собора, подводная акустика) для полной пространственной симуляции.
Tongyi Lab отмечает, что эти модели демократизируют создание высококачественного голоса, предлагая мощную поддержку ИИ для подкастинга, разработки игр и постпродакшна фильмов.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











