Дом
27B Math SOTA и «3-секундное эмоциональное клонирование»: Youdao открывает исходный код мультимодального движка и движка TTS Zi Yue 4
Компания NetEase Youdao недавно объявила о комплексном обновлении своей крупной модели «Confucius4» до версии 4.0. Теперь Confucius4 является полностью мультимодальной и поддерживает интегрированное взаимодействие с текстом, изображениями и аудио. Кроме того, Youdao открыла исходный код своих основных мультимодальных моделей и моделей преобразования текста в речь (TTS), а модель перевода прошла глубокую техническую доработку, что позволило улучшить как качество, так и эффективность.
Мультимодальная модель достигает уровня SOTA в области компьютерного зрения и математики, демонстрируя превосходную производительность при решении чисто текстовых математических задач
Согласно заявлению, мультимодальная модель Confucius4 с открытым исходным кодом, содержащая 27 миллиардов параметров, вывела возможности решения математических задач на основе визуального ввода на ведущий в отрасли уровень (SOTA) в образовательных сценариях. Среди моделей аналогичного масштаба Confucius4 превосходит другие в решении сложных визуальных задач по математике и физике, включающих графики. Она также демонстрирует значительное улучшение при решении чисто текстовых математических задач на китайском языке, достигая точности 81,4%, что является лучшим показателем в отрасли.

▲ Confucius4 демонстрирует лучшие в своём классе результаты по нескольким тестам визуальной математики среди моделей аналогичного масштаба
Источник изображения: https://huggingface.co/netease-youdao/Confucius4
Ещё более важный прорыв заключается в практической экономической эффективности. По словам соответствующих специалистов, в новой модели используется усовершенствованная схема реконструкции цепочки рассуждений. Благодаря агрегированию большого объёма высококачественных и лаконичных образцов рассуждений для глубокой оптимизации длина выходной цепочки рассуждений сокращается на 43,2 %.
Это означает, что модель может выдавать ответы быстрее, используя меньшее количество токенов и более короткие пути рассуждений, что значительно снижает затраты на вычисления в реальных бизнес-сценариях для предприятий и разработчиков.

▲ Confucius4 значительно сокращает количество токенов в выводах по нескольким тестам в области визуальной математики
Источник изображения: https://huggingface.co/netease-youdao/Confucius4
Кроме того, исследовательская команда Confucius4 глубоко оптимизировала модель для реальных сценариев выполнения домашних заданий, сдачи экзаменов и решения задач, с которыми сталкиваются китайские учащиеся. Это позволяет модели решать реальные учебные задачи, делая её более чутким цифровым помощником.
TTS с открытым исходным кодом: поддерживает 14 языков, воспроизводит оригинальный голос за 3 секунды без проблем с акцентом на разных языках
Наряду с мультимодальной моделью был также открыт исходный код движка синтеза речи (TTS). Построенный на передовой архитектуре «кодер речи + LLM», он предоставляет разработчикам и создателям контента возможности клонирования голоса и синтеза эмоций без предварительного обучения и с минимальными барьерами.
В настоящее время он полностью поддерживает 14 языков: китайский, английский, японский, корейский, немецкий, французский, испанский, индонезийский, итальянский, тайский, португальский, русский, малайский и вьетнамский. Система способна естественным образом переносить голос говорящего на разные языки без дополнительного обучения, сохраняя голосовую целостность и обеспечивая при этом, чтобы синтезированные результаты звучали естественно и бегло, без просачивания акцента при межъязыковом клонировании.
Что касается клонирования голоса, Confucius4 обеспечивает полную поддержку функции «загрузи и клонируй». Пользователям достаточно предоставить любой аудиоматериал, и система воссоздаст исходный голос в течение трех секунд. Согласно заявлению, точность движка при выполнении задач клонирования превышает 97%, а степень сходства между клонированным голосом и исходным составляет более 85%. Система сохраняет уникальные вокальные характеристики говорящего, точно воспроизводя его эмоциональный тон, а её комплексные возможности входят в число лучших в данной области.
Кроме того, эта модель с открытым исходным кодом демонстрирует высокую устойчивость в реальных многоязыковых сценариях. Она способна удовлетворить различные потребности в синтезе речи, включая повседневные разговоры, новостные выпуски, корпоративные рекламные кампании и сложные эмоциональные выражения.
Качество модели перевода было всесторонне улучшено, а скорость вывода данных увеличилась на 80%
Являясь одним из наиболее укоренившихся технологических активов Youdao, модель перевода также получила значительные технические усовершенствования в этом обновлении, что еще больше повысило ее производительность при решении задач перевода.
Что касается данных, команда Confucius собрала и очистила миллиарды многоязычных элементов, а также привлекла специалистов с сертификатом TEM-8 для многомерной ручной оценки, что с самого начала обеспечило высокое качество корпусов.
Что касается алгоритмов, модель использует инновационный режим «multi-expert OPD», применяя более «мягкий» подход для эффективного использования сильных сторон различных экспертов. Кроме того, с помощью обучения с подкреплением в ней реализованы механизмы поощрения за правильный формат и определения языка, что позволяет эффективно решать типичные проблемы машинного перевода, такие как перевод вне контекста и смешанные языковые выводы.
Чтобы удовлетворить требованиям промышленных приложений с высокой частотой запросов и высокой степенью параллелизма, обновленная модель перевода оснащена эффективным механизмом ускорения, который напрямую повышает общую скорость вывода на 80 %. В сочетании с индивидуальным решением, включающим автоматическую оценку крупных моделей и случайную ручную выборку, модель перевода нового поколения демонстрирует чрезвычайно высокие стандарты скорости и качества в различных сценариях, включая перевод текста, изображений и документов.
Оценивая путь Youdao в области ИИ — от первоначального запуска Confucius как первой крупной модели, ориентированной на образование, до внедрения «виртуального тренера по разговорной речи Hi Echo», который перевернул традиционные методы устной практики, и до комплексной интеграции Confucius 2.0 и 3.0 в программные и аппаратные экосистемы, Youdao неизменно лидирует в области внедрения ИИ в реальные сценарии. В 2026 году Youdao ускорила применение ИИ благодаря серии продуктов на базе ИИ-агентов, таких как LobsterAI, Youdao Treasure, Youdao Conference Agent и Thinkflow, реализовав перспективную матрицу ИИ-агентов для всех сценариев.
Модернизация Confucius 4 и полный переход основных моделей на открытый исходный код не только значительно снижают барьеры для разработчиков в областях мультимодальных технологий и синтеза речи, но и демонстрируют замкнутый экосистемный цикл, в котором базовые технологии питают матрицы агентов верхнего уровня. Компания Youdao надеется, что благодаря совместным усилиям разработчиков со всего мира и сообщества открытого исходного кода эта экосистема полномодальных крупных моделей станет источником подлинной трансформации производительности в широком спектре отраслей.
Приложение: Адреса открытых репозиториев:
Мультимодальная модель «Confucius4»: https://huggingface.co/netease-youdao/Confucius4
Модель TTS «Confucius4»: https://github.com/netease-youdao/Confucius4-TTS
Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (1)
Компания NetEase Youdao недавно объявила о комплексном обновлении своей крупной модели «Confucius4» до версии 4.0. Теперь Confucius4 является полностью мультимодальной и поддерживает интегрированное взаимодействие с текстом, изображениями и аудио. Кроме того, Youdao открыла исходный код своих основных мультимодальных моделей и моделей преобразования текста в речь (TTS), а модель перевода прошла глубокую техническую доработку, что позволило улучшить как качество, так и эффективность.
Мультимодальная модель достигает уровня SOTA в области компьютерного зрения и математики, демонстрируя превосходную производительность при решении чисто текстовых математических задач
Согласно заявлению, мультимодальная модель Confucius4 с открытым исходным кодом, содержащая 27 миллиардов параметров, вывела возможности решения математических задач на основе визуального ввода на ведущий в отрасли уровень (SOTA) в образовательных сценариях. Среди моделей аналогичного масштаба Confucius4 превосходит другие в решении сложных визуальных задач по математике и физике, включающих графики. Она также демонстрирует значительное улучшение при решении чисто текстовых математических задач на китайском языке, достигая точности 81,4%, что является лучшим показателем в отрасли.

▲ Confucius4 демонстрирует лучшие в своём классе результаты по нескольким тестам визуальной математики среди моделей аналогичного масштаба
Источник изображения: https://huggingface.co/netease-youdao/Confucius4
Ещё более важный прорыв заключается в практической экономической эффективности. По словам соответствующих специалистов, в новой модели используется усовершенствованная схема реконструкции цепочки рассуждений. Благодаря агрегированию большого объёма высококачественных и лаконичных образцов рассуждений для глубокой оптимизации длина выходной цепочки рассуждений сокращается на 43,2 %.
Это означает, что модель может выдавать ответы быстрее, используя меньшее количество токенов и более короткие пути рассуждений, что значительно снижает затраты на вычисления в реальных бизнес-сценариях для предприятий и разработчиков.

▲ Confucius4 значительно сокращает количество токенов в выводах по нескольким тестам в области визуальной математики
Источник изображения: https://huggingface.co/netease-youdao/Confucius4
Кроме того, исследовательская команда Confucius4 глубоко оптимизировала модель для реальных сценариев выполнения домашних заданий, сдачи экзаменов и решения задач, с которыми сталкиваются китайские учащиеся. Это позволяет модели решать реальные учебные задачи, делая её более чутким цифровым помощником.
TTS с открытым исходным кодом: поддерживает 14 языков, воспроизводит оригинальный голос за 3 секунды без проблем с акцентом на разных языках
Наряду с мультимодальной моделью был также открыт исходный код движка синтеза речи (TTS). Построенный на передовой архитектуре «кодер речи + LLM», он предоставляет разработчикам и создателям контента возможности клонирования голоса и синтеза эмоций без предварительного обучения и с минимальными барьерами.
В настоящее время он полностью поддерживает 14 языков: китайский, английский, японский, корейский, немецкий, французский, испанский, индонезийский, итальянский, тайский, португальский, русский, малайский и вьетнамский. Система способна естественным образом переносить голос говорящего на разные языки без дополнительного обучения, сохраняя голосовую целостность и обеспечивая при этом, чтобы синтезированные результаты звучали естественно и бегло, без просачивания акцента при межъязыковом клонировании.
Что касается клонирования голоса, Confucius4 обеспечивает полную поддержку функции «загрузи и клонируй». Пользователям достаточно предоставить любой аудиоматериал, и система воссоздаст исходный голос в течение трех секунд. Согласно заявлению, точность движка при выполнении задач клонирования превышает 97%, а степень сходства между клонированным голосом и исходным составляет более 85%. Система сохраняет уникальные вокальные характеристики говорящего, точно воспроизводя его эмоциональный тон, а её комплексные возможности входят в число лучших в данной области.
Кроме того, эта модель с открытым исходным кодом демонстрирует высокую устойчивость в реальных многоязыковых сценариях. Она способна удовлетворить различные потребности в синтезе речи, включая повседневные разговоры, новостные выпуски, корпоративные рекламные кампании и сложные эмоциональные выражения.
Качество модели перевода было всесторонне улучшено, а скорость вывода данных увеличилась на 80%
Являясь одним из наиболее укоренившихся технологических активов Youdao, модель перевода также получила значительные технические усовершенствования в этом обновлении, что еще больше повысило ее производительность при решении задач перевода.
Что касается данных, команда Confucius собрала и очистила миллиарды многоязычных элементов, а также привлекла специалистов с сертификатом TEM-8 для многомерной ручной оценки, что с самого начала обеспечило высокое качество корпусов.
Что касается алгоритмов, модель использует инновационный режим «multi-expert OPD», применяя более «мягкий» подход для эффективного использования сильных сторон различных экспертов. Кроме того, с помощью обучения с подкреплением в ней реализованы механизмы поощрения за правильный формат и определения языка, что позволяет эффективно решать типичные проблемы машинного перевода, такие как перевод вне контекста и смешанные языковые выводы.
Чтобы удовлетворить требованиям промышленных приложений с высокой частотой запросов и высокой степенью параллелизма, обновленная модель перевода оснащена эффективным механизмом ускорения, который напрямую повышает общую скорость вывода на 80 %. В сочетании с индивидуальным решением, включающим автоматическую оценку крупных моделей и случайную ручную выборку, модель перевода нового поколения демонстрирует чрезвычайно высокие стандарты скорости и качества в различных сценариях, включая перевод текста, изображений и документов.
Оценивая путь Youdao в области ИИ — от первоначального запуска Confucius как первой крупной модели, ориентированной на образование, до внедрения «виртуального тренера по разговорной речи Hi Echo», который перевернул традиционные методы устной практики, и до комплексной интеграции Confucius 2.0 и 3.0 в программные и аппаратные экосистемы, Youdao неизменно лидирует в области внедрения ИИ в реальные сценарии. В 2026 году Youdao ускорила применение ИИ благодаря серии продуктов на базе ИИ-агентов, таких как LobsterAI, Youdao Treasure, Youdao Conference Agent и Thinkflow, реализовав перспективную матрицу ИИ-агентов для всех сценариев.
Модернизация Confucius 4 и полный переход основных моделей на открытый исходный код не только значительно снижают барьеры для разработчиков в областях мультимодальных технологий и синтеза речи, но и демонстрируют замкнутый экосистемный цикл, в котором базовые технологии питают матрицы агентов верхнего уровня. Компания Youdao надеется, что благодаря совместным усилиям разработчиков со всего мира и сообщества открытого исходного кода эта экосистема полномодальных крупных моделей станет источником подлинной трансформации производительности в широком спектре отраслей.
Приложение: Адреса открытых репозиториев:
Мультимодальная модель «Confucius4»: https://huggingface.co/netease-youdao/Confucius4
Модель TTS «Confucius4»: https://github.com/netease-youdao/Confucius4-TTS
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











