Дом
Запущена система «Tongyi Qianwen Qwen-Audio-3.0-TTS» с задержкой первого пакета 300 мс и поддержкой 20 диалектов
Команда Alibaba Qwen представила новую модель синтеза речи в реальном времени Qwen-Audio-3.0-TTS, благодаря которой синтез речи перешел от простого воспроизведения к подлинной экспрессии. Версия Plus теперь занимает первое место в мире в рейтинге Speech Arena — авторитетном тесте от Artificial Analysis — опередив Gemini 3.1 TTS, ElevenLabs v3 и другие ведущие модели.

Доступны две версии: версия Flash предназначена для взаимодействия в режиме реального времени с начальной задержкой около 300 мс, что идеально подходит для умных помощников и других сценариев использования, требующих низкой задержки; версия Plus ориентирована на высокое качество генерации, обеспечивая повышенную естественность и сходство голоса.
Четыре ключевых прорыва в основных возможностях:
Во-первых, поддержка нескольких языков и диалектов была расширена до 16 языков, при этом версия Plus достигает среднего показателя сходства с реальным говорящим на уровне 82,75% по всем 16 языкам — это самый высокий показатель в отрасли. Она также охватывает 20 китайских диалектов, сохраняя аутентичные диалектные особенности, а не ослабляя их, что позволяет добиться более естественных выражений.
Во-вторых, гибкие инструкции на естественном языке позволяют пользователям генерировать точную речь с помощью подсказок, таких как «мягкий тон обслуживания клиентов» или «стиль ведущего прямой трансляции», без необходимости профессиональных аннотаций.
В-третьих, тонкое управление тегами поддерживает структурированные теги, такие как [вздох] и [злость], что позволяет точно управлять невербальными деталями, такими как дыхание и смех, — что подходит для игр, аудиокниг и подобных сценариев.
В-четвертых, высокая акустическая устойчивость: даже если исходный аудиофайл содержит сильный шум или реверберацию, модель автоматически отфильтровывает фоновый шум, сохраняя при этом качество голоса, что обеспечивает стабильный результат синтеза.
Входящая в комплект премиум-библиотека голосов включает различные типы голосов — инструкции, диалекты и редко используемые языки — поддерживает вывод звука высокой четкости 48K (запуск ожидается 24 июля) и может синтезировать до 3 минут длинного текста за сеанс. Модель теперь полностью доступна на платформе Alibaba Cloud BaiLian, где разработчики могут получить к ней доступ и опробовать её, что открывает новые возможности в области голосового взаимодействия.

Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (0)
Команда Alibaba Qwen представила новую модель синтеза речи в реальном времени Qwen-Audio-3.0-TTS, благодаря которой синтез речи перешел от простого воспроизведения к подлинной экспрессии. Версия Plus теперь занимает первое место в мире в рейтинге Speech Arena — авторитетном тесте от Artificial Analysis — опередив Gemini 3.1 TTS, ElevenLabs v3 и другие ведущие модели.

Доступны две версии: версия Flash предназначена для взаимодействия в режиме реального времени с начальной задержкой около 300 мс, что идеально подходит для умных помощников и других сценариев использования, требующих низкой задержки; версия Plus ориентирована на высокое качество генерации, обеспечивая повышенную естественность и сходство голоса.
Четыре ключевых прорыва в основных возможностях:
Во-первых, поддержка нескольких языков и диалектов была расширена до 16 языков, при этом версия Plus достигает среднего показателя сходства с реальным говорящим на уровне 82,75% по всем 16 языкам — это самый высокий показатель в отрасли. Она также охватывает 20 китайских диалектов, сохраняя аутентичные диалектные особенности, а не ослабляя их, что позволяет добиться более естественных выражений.
Во-вторых, гибкие инструкции на естественном языке позволяют пользователям генерировать точную речь с помощью подсказок, таких как «мягкий тон обслуживания клиентов» или «стиль ведущего прямой трансляции», без необходимости профессиональных аннотаций.
В-третьих, тонкое управление тегами поддерживает структурированные теги, такие как [вздох] и [злость], что позволяет точно управлять невербальными деталями, такими как дыхание и смех, — что подходит для игр, аудиокниг и подобных сценариев.
В-четвертых, высокая акустическая устойчивость: даже если исходный аудиофайл содержит сильный шум или реверберацию, модель автоматически отфильтровывает фоновый шум, сохраняя при этом качество голоса, что обеспечивает стабильный результат синтеза.
Входящая в комплект премиум-библиотека голосов включает различные типы голосов — инструкции, диалекты и редко используемые языки — поддерживает вывод звука высокой четкости 48K (запуск ожидается 24 июля) и может синтезировать до 3 минут длинного текста за сеанс. Модель теперь полностью доступна на платформе Alibaba Cloud BaiLian, где разработчики могут получить к ней доступ и опробовать её, что открывает новые возможности в области голосового взаимодействия.

ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











