Hogar
AMD lanza el complemento vLLM-ATOM para acelerar la inferencia de modelos de gran tamaño

Recientemente, AMD ha presentado oficialmente un nuevo complemento denominado vLLM-ATOM. Su objetivo principal es aprovechar al máximo el potencial del hardware sin alterar los flujos de trabajo existentes, lo que permite una aceleración significativa de la inferencia en modelos de lenguaje a gran escala de uso general, como DeepSeek-R1, Kimi-K2 y gpt-oss-120B.
Para los desarrolladores, vLLM es un marco de código abierto diseñado para optimizar el rendimiento y el uso de la memoria de la GPU en entornos de alta concurrencia. A diferencia de las herramientas tradicionales de solicitud única, se centra en la programación de solicitudes y la gestión de la caché. El nuevo complemento ATOM de AMD es una solución altamente personalizada, creada específicamente para las GPU Instinct. Su característica más destacada es la «migración sin fisuras»: los usuarios empresariales no necesitan modificar las interfaces API, los comandos ni los flujos de trabajo de extremo a extremo existentes; el complemento se encarga automáticamente de la optimización del rendimiento subyacente en segundo plano.
Desde el punto de vista de la arquitectura técnica, vLLM-ATOM emplea un diseño preciso de tres capas. La capa superior conserva la programación de solicitudes y la interfaz de compatibilidad de vLLM. La capa intermedia, el complemento ATOM, gestiona la implementación del modelo y la optimización del kernel. La capa inferior, AITER, se conecta directamente al hardware de la GPU, proporcionando capacidades de aceleración fundamentales como Flash Attention, GEMM cuantificado y MoE fusionado.
Este complemento está destinado principalmente a tarjetas de computación con GPU de alto rendimiento como Instinct MI350, MI400 y MI355X. Su lista de compatibilidad incluye modelos emblemáticos como Qwen3, GLM y DeepSeek, y ofrece una cobertura completa de diversas arquitecturas, entre las que se incluyen MoE (Mixture of Experts), modelos densos y modelos de visión-lenguaje (VLM).
Los analistas del sector señalan que el valor fundamental de esta solución radica en reducir considerablemente las barreras de implementación de la computación de alto rendimiento. Gracias a este enfoque de migración fluida y sin curva de aprendizaje, las empresas pueden trasladar más fácilmente los servicios de IA al backend de hardware de AMD, manteniendo la eficiencia de la inferencia al tiempo que mejoran de forma efectiva la estabilidad y la velocidad de respuesta de los servicios en línea con modelos de gran tamaño.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (1)
0/500

Recientemente, AMD ha presentado oficialmente un nuevo complemento denominado vLLM-ATOM. Su objetivo principal es aprovechar al máximo el potencial del hardware sin alterar los flujos de trabajo existentes, lo que permite una aceleración significativa de la inferencia en modelos de lenguaje a gran escala de uso general, como DeepSeek-R1, Kimi-K2 y gpt-oss-120B.
Para los desarrolladores, vLLM es un marco de código abierto diseñado para optimizar el rendimiento y el uso de la memoria de la GPU en entornos de alta concurrencia. A diferencia de las herramientas tradicionales de solicitud única, se centra en la programación de solicitudes y la gestión de la caché. El nuevo complemento ATOM de AMD es una solución altamente personalizada, creada específicamente para las GPU Instinct. Su característica más destacada es la «migración sin fisuras»: los usuarios empresariales no necesitan modificar las interfaces API, los comandos ni los flujos de trabajo de extremo a extremo existentes; el complemento se encarga automáticamente de la optimización del rendimiento subyacente en segundo plano.
Desde el punto de vista de la arquitectura técnica, vLLM-ATOM emplea un diseño preciso de tres capas. La capa superior conserva la programación de solicitudes y la interfaz de compatibilidad de vLLM. La capa intermedia, el complemento ATOM, gestiona la implementación del modelo y la optimización del kernel. La capa inferior, AITER, se conecta directamente al hardware de la GPU, proporcionando capacidades de aceleración fundamentales como Flash Attention, GEMM cuantificado y MoE fusionado.
Este complemento está destinado principalmente a tarjetas de computación con GPU de alto rendimiento como Instinct MI350, MI400 y MI355X. Su lista de compatibilidad incluye modelos emblemáticos como Qwen3, GLM y DeepSeek, y ofrece una cobertura completa de diversas arquitecturas, entre las que se incluyen MoE (Mixture of Experts), modelos densos y modelos de visión-lenguaje (VLM).
Los analistas del sector señalan que el valor fundamental de esta solución radica en reducir considerablemente las barreras de implementación de la computación de alto rendimiento. Gracias a este enfoque de migración fluida y sin curva de aprendizaje, las empresas pueden trasladar más fácilmente los servicios de IA al backend de hardware de AMD, manteniendo la eficiencia de la inferencia al tiempo que mejoran de forma efectiva la estabilidad y la velocidad de respuesta de los servicios en línea con modelos de gran tamaño.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











