Дом
Плагин vLLM-ATOM от AMD повышает эффективность инференса для локальных крупномасштабных моделей искусственного интеллекта
Компания AMD официально представила плагин vLLM-ATOM, специально разработанный для развертывания крупных языковых моделей. Этот плагин призван значительно повысить производительность инференса популярных отечественных крупных моделей, таких как DeepSeek-R1 и Kimi-K2, на аппаратном обеспечении AMD, при этом не нарушая существующие рабочие процессы.
Как открытая среда инференса, созданная для сценариев с высокой степенью параллелизма, vLLM славится высокой эффективностью использования памяти. Новый плагин от AMD предоставляет более адаптированное решение по оптимизации для графических процессоров серии Instinct, позволяя разработчикам осуществлять техническую миграцию с минимальными затратами на освоение.

Беспроблемное повышение производительности
Основным преимуществом плагина vLLM-ATOM является его «бесплатное» развертывание. Пользователям не требуется модифицировать существующие API или сквозные рабочие процессы. Плагин автоматически управляет и оптимизирует планирование запросов и настройку ядра в фоновом режиме, позволяя текущим сервисам плавно переходить на аппаратную платформу AMD.
С архитектурной точки зрения плагин состоит из трех уровней: верхний уровень обеспечивает совместимость с интерфейсом OpenAI, средний уровень обрабатывает выполнение и маршрутизацию моделей, а нижний уровень предоставляет основные ядра графического процессора. Такая конструкция эффективно объединяет технологии смеси экспертов (MoE) и квантования, гарантируя надежную поддержку крупномасштабных развертываний.
Широкая совместимость с различными вычислительными экосистемами
Плагин предназначен для высокопроизводительных графических процессоров AMD серий Instinct MI350 и MI400. Он поддерживает не только ведущие китайские большие языковые модели, такие как Qwen3 и GLM, но и всесторонне охватывает разнообразные сценарии применения, включая плотные модели, модели смеси экспертов и модели «зрение-язык» (VLM).
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Компания AMD официально представила плагин vLLM-ATOM, специально разработанный для развертывания крупных языковых моделей. Этот плагин призван значительно повысить производительность инференса популярных отечественных крупных моделей, таких как DeepSeek-R1 и Kimi-K2, на аппаратном обеспечении AMD, при этом не нарушая существующие рабочие процессы.
Как открытая среда инференса, созданная для сценариев с высокой степенью параллелизма, vLLM славится высокой эффективностью использования памяти. Новый плагин от AMD предоставляет более адаптированное решение по оптимизации для графических процессоров серии Instinct, позволяя разработчикам осуществлять техническую миграцию с минимальными затратами на освоение.

Беспроблемное повышение производительности
Основным преимуществом плагина vLLM-ATOM является его «бесплатное» развертывание. Пользователям не требуется модифицировать существующие API или сквозные рабочие процессы. Плагин автоматически управляет и оптимизирует планирование запросов и настройку ядра в фоновом режиме, позволяя текущим сервисам плавно переходить на аппаратную платформу AMD.
С архитектурной точки зрения плагин состоит из трех уровней: верхний уровень обеспечивает совместимость с интерфейсом OpenAI, средний уровень обрабатывает выполнение и маршрутизацию моделей, а нижний уровень предоставляет основные ядра графического процессора. Такая конструкция эффективно объединяет технологии смеси экспертов (MoE) и квантования, гарантируя надежную поддержку крупномасштабных развертываний.
Широкая совместимость с различными вычислительными экосистемами
Плагин предназначен для высокопроизводительных графических процессоров AMD серий Instinct MI350 и MI400. Он поддерживает не только ведущие китайские большие языковые модели, такие как Qwen3 и GLM, но и всесторонне охватывает разнообразные сценарии применения, включая плотные модели, модели смеси экспертов и модели «зрение-язык» (VLM).
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











