NVIDIA представляет модель единого аудиоинтеллекта Nemotron-Labs-Audex-30B-A3B

По мере стремительного развития мультимодальных больших моделей возможности обработки аудио часто оказываются под угрозой: многие модели улучшают понимание аудио за счет ухудшения логики работы с текстом. Чтобы решить эту проблему, исследователи NVIDIA представили Nemotron-Labs-Audex-30B-A3B (Audex) — унифицированную большую языковую модель для работы с аудио и текстом, призванную устранить этот пробел.
Audex использует упрощенную и эффективную архитектуру, основанную на надежной чистой текстовой модели «Смесь экспертов» (MoE). Используя один декодер Transformer, она одновременно обрабатывает текстовые и квантованные аудио токены. Такой подход проецирует аудио входы в пространство текстовых эмбеддингов, обеспечивая бесшовную интеграцию с существующей инфраструктурой больших языковых моделей для мультимодальных задач и достигая глубокой интеграции.
Обучение включало обширные наборы данных, состоящие из 157,4 миллиардов аудио токенов и 320,5 миллиардов текстовых токенов. Благодаря многостадийному обучению с учителем, каскадному обучению с подкреплением на чистом тексте и дистилляции знаний в режиме работы по нескольким доменам, Audex демонстрирует ведущие в отрасли результаты в понимании аудио, распознавании речи, переводе и генерации. Что особенно важно, она сохраняет основные возможности исходной большой языковой модели в области рассуждений, выравнивания, извлечения знаний и обработки длинных текстов с минимальной деградацией.
Как модель с открытым исходным кодом, Audex знаменует собой значительную веху для сектора голосовых технологий. Выходя за рамки теоретических исследований, она предлагает зрелое решение для разработчиков, позволяющее оценивать и развертывать модель напрямую. Для тех, кто управляет сложными аудио взаимодействиями, Audex предоставляет сбалансированный вариант, который повышает производительность и открывает новые направления для исследований в области мультимодального интеллекта.
Связанная статья
Claude Opus 5.2 Night Gray выходит с более быстрым откликом, решая проблему лени
Opus 5.2 тихо вышел этим утром, что побудило многих разработчиков заметить, что обновленная модель Claude Opus 5.2 начала ограниченное развертывание в рамках Claude Code.Вчера вечером пользователи X заметили, что вызов Opus 5 в Claude Code дает прои
Fireworks AI представляет FireRouter с Opus: снижение затрат на кодирование на 57% при минимальной потере точности
Fireworks AI представила FireRouter с Opus — первую в отрасли систему маршрутизации, учитывающую кэширование и адаптированную для серии моделей Claude Opus. Теперь доступная через серверный конечный пункт, эта независимая модель маршрутизации прошла
Как исправить Core Web Vitals для мобильной SEO
Улучшение локального SEO: создание облачных стеков Google Drive для вашей сущностиСодержание:ВведениеПонимание облачных стеков сущностей GoogleКлючевые преимущества облачных стеков сущностей GoogleНачало работы с облачными стеками Google Drive 4
Рекомендации по связанным специальным темам
Комментарии (0)

По мере стремительного развития мультимодальных больших моделей возможности обработки аудио часто оказываются под угрозой: многие модели улучшают понимание аудио за счет ухудшения логики работы с текстом. Чтобы решить эту проблему, исследователи NVIDIA представили Nemotron-Labs-Audex-30B-A3B (Audex) — унифицированную большую языковую модель для работы с аудио и текстом, призванную устранить этот пробел.
Audex использует упрощенную и эффективную архитектуру, основанную на надежной чистой текстовой модели «Смесь экспертов» (MoE). Используя один декодер Transformer, она одновременно обрабатывает текстовые и квантованные аудио токены. Такой подход проецирует аудио входы в пространство текстовых эмбеддингов, обеспечивая бесшовную интеграцию с существующей инфраструктурой больших языковых моделей для мультимодальных задач и достигая глубокой интеграции.
Обучение включало обширные наборы данных, состоящие из 157,4 миллиардов аудио токенов и 320,5 миллиардов текстовых токенов. Благодаря многостадийному обучению с учителем, каскадному обучению с подкреплением на чистом тексте и дистилляции знаний в режиме работы по нескольким доменам, Audex демонстрирует ведущие в отрасли результаты в понимании аудио, распознавании речи, переводе и генерации. Что особенно важно, она сохраняет основные возможности исходной большой языковой модели в области рассуждений, выравнивания, извлечения знаний и обработки длинных текстов с минимальной деградацией.
Как модель с открытым исходным кодом, Audex знаменует собой значительную веху для сектора голосовых технологий. Выходя за рамки теоретических исследований, она предлагает зрелое решение для разработчиков, позволяющее оценивать и развертывать модель напрямую. Для тех, кто управляет сложными аудио взаимодействиями, Audex предоставляет сбалансированный вариант, который повышает производительность и открывает новые направления для исследований в области мультимодального интеллекта.
Claude Opus 5.2 Night Gray выходит с более быстрым откликом, решая проблему лени
Opus 5.2 тихо вышел этим утром, что побудило многих разработчиков заметить, что обновленная модель Claude Opus 5.2 начала ограниченное развертывание в рамках Claude Code.Вчера вечером пользователи X заметили, что вызов Opus 5 в Claude Code дает прои
Fireworks AI представляет FireRouter с Opus: снижение затрат на кодирование на 57% при минимальной потере точности
Fireworks AI представила FireRouter с Opus — первую в отрасли систему маршрутизации, учитывающую кэширование и адаптированную для серии моделей Claude Opus. Теперь доступная через серверный конечный пункт, эта независимая модель маршрутизации прошла
Как исправить Core Web Vitals для мобильной SEO
Улучшение локального SEO: создание облачных стеков Google Drive для вашей сущностиСодержание:ВведениеПонимание облачных стеков сущностей GoogleКлючевые преимущества облачных стеков сущностей GoogleНачало работы с облачными стеками Google Drive 4





Дом






