AMD выпустила плагин vLLM-ATOM для ускорения инференса на больших моделях

Недавно компания AMD официально представила новый плагин под названием vLLM-ATOM. Его основная цель — раскрыть дополнительный потенциал аппаратного обеспечения без изменения существующих рабочих процессов, обеспечивая значительное ускорение инференса для популярных крупных языковых моделей, таких как DeepSeek-R1, Kimi-K2 и gpt-oss-120B.
Для разработчиков vLLM представляет собой фреймворк с открытым исходным кодом, предназначенный для оптимизации пропускной способности и использования памяти графического процессора в условиях высокой параллельности. В отличие от традиционных инструментов, обрабатывающих запросы по одному, он ориентирован на планирование запросов и управление кэшем. Новый плагин ATOM от AMD представляет собой глубоко настроенное решение, созданное специально для графических процессоров Instinct. Его отличительной особенностью является «бесшовная миграция»: корпоративным пользователям не нужно изменять существующие API-интерфейсы, команды или сквозные рабочие процессы; плагин автоматически выполняет оптимизацию производительности на фоне.
С точки зрения технической архитектуры vLLM-ATOM использует четкую трехуровневую структуру. Верхний уровень сохраняет механизм планирования запросов и интерфейс совместимости vLLM. Средний уровень, представляющий собой плагин ATOM, управляет реализацией модели и оптимизацией ядра. Нижний уровень, AITER, напрямую подключается к аппаратному обеспечению графического процессора, обеспечивая основные возможности ускорения, такие как Flash Attention, квантованный GEMM и слияние MoE.
Этот плагин в первую очередь ориентирован на высокопроизводительные вычислительные карты с графическим процессором , такие как Instinct MI350, MI400 и MI355X. Список поддерживаемых моделей включает флагманские модели, такие как Qwen3, GLM и DeepSeek, и обеспечивает полное покрытие различных архитектур, включая MoE (Mixture of Experts), плотные модели и модели «зрение-язык» (VLM).
Отраслевые аналитики отмечают, что основная ценность этого решения заключается в значительном снижении барьеров для внедрения высокопроизводительных вычислений. Благодаря этому подходу, не требующему освоения и обеспечивающему плавный переход, предприятия могут более легко переносить сервисы ИИ на аппаратную платформу AMD, сохраняя эффективность инференса и одновременно эффективно повышая стабильность и скорость отклика онлайн-сервисов на основе крупных моделей.
Связанная статья
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Slackbot становится ИИ-агентом
Slackbot, автоматизированный помощник, встроенный в корпоративную платформу обмена сообщениями Salesforce Slack, превращается в ИИ-агента. Технический директор Salesforce Паркер Харрис предполагает, что он достигнет вирусной популярности, сопоставимо
ByteDance усиливает основные стимулы для ИИ, поскольку Doubao растет на 14,6%
Недавно ByteDance провела краткий брифинг по акциям DouBao, чтобы раскрыть новые стимулирующие политики для сотрудников, участвующих в подразделении DouBao. Цена исполнения для акций DouBao была повышена с $14.85 в июне 2026 года до $17.02, что соста
Рекомендации по связанным специальным темам
Комментарии (1)

Недавно компания AMD официально представила новый плагин под названием vLLM-ATOM. Его основная цель — раскрыть дополнительный потенциал аппаратного обеспечения без изменения существующих рабочих процессов, обеспечивая значительное ускорение инференса для популярных крупных языковых моделей, таких как DeepSeek-R1, Kimi-K2 и gpt-oss-120B.
Для разработчиков vLLM представляет собой фреймворк с открытым исходным кодом, предназначенный для оптимизации пропускной способности и использования памяти графического процессора в условиях высокой параллельности. В отличие от традиционных инструментов, обрабатывающих запросы по одному, он ориентирован на планирование запросов и управление кэшем. Новый плагин ATOM от AMD представляет собой глубоко настроенное решение, созданное специально для графических процессоров Instinct. Его отличительной особенностью является «бесшовная миграция»: корпоративным пользователям не нужно изменять существующие API-интерфейсы, команды или сквозные рабочие процессы; плагин автоматически выполняет оптимизацию производительности на фоне.
С точки зрения технической архитектуры vLLM-ATOM использует четкую трехуровневую структуру. Верхний уровень сохраняет механизм планирования запросов и интерфейс совместимости vLLM. Средний уровень, представляющий собой плагин ATOM, управляет реализацией модели и оптимизацией ядра. Нижний уровень, AITER, напрямую подключается к аппаратному обеспечению графического процессора, обеспечивая основные возможности ускорения, такие как Flash Attention, квантованный GEMM и слияние MoE.
Этот плагин в первую очередь ориентирован на высокопроизводительные вычислительные карты с графическим процессором , такие как Instinct MI350, MI400 и MI355X. Список поддерживаемых моделей включает флагманские модели, такие как Qwen3, GLM и DeepSeek, и обеспечивает полное покрытие различных архитектур, включая MoE (Mixture of Experts), плотные модели и модели «зрение-язык» (VLM).
Отраслевые аналитики отмечают, что основная ценность этого решения заключается в значительном снижении барьеров для внедрения высокопроизводительных вычислений. Благодаря этому подходу, не требующему освоения и обеспечивающему плавный переход, предприятия могут более легко переносить сервисы ИИ на аппаратную платформу AMD, сохраняя эффективность инференса и одновременно эффективно повышая стабильность и скорость отклика онлайн-сервисов на основе крупных моделей.
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Slackbot становится ИИ-агентом
Slackbot, автоматизированный помощник, встроенный в корпоративную платформу обмена сообщениями Salesforce Slack, превращается в ИИ-агента. Технический директор Salesforce Паркер Харрис предполагает, что он достигнет вирусной популярности, сопоставимо
ByteDance усиливает основные стимулы для ИИ, поскольку Doubao растет на 14,6%
Недавно ByteDance провела краткий брифинг по акциям DouBao, чтобы раскрыть новые стимулирующие политики для сотрудников, участвующих в подразделении DouBao. Цена исполнения для акций DouBao была повышена с $14.85 в июне 2026 года до $17.02, что соста





Дом






