A AMD lança o plug-in vLLM-ATOM para acelerar a inferência de modelos de grande porte

Recentemente, a AMD apresentou oficialmente um novo plug-in chamado vLLM-ATOM. Seu principal objetivo é liberar mais potencial do hardware sem alterar os fluxos de trabalho existentes, proporcionando ganhos significativos de velocidade na inferência para modelos de linguagem de grande porte mais comuns, como o DeepSeek-R1, o Kimi-K2 e o gpt-oss-120B.
Para os desenvolvedores, o vLLM é uma estrutura de código aberto projetada para otimizar a taxa de processamento e o uso da memória da GPU em ambientes de alta simultaneidade. Ao contrário das ferramentas tradicionais de solicitação única, ele se concentra no agendamento de solicitações e no gerenciamento de cache. O novo plug-in ATOM da AMD é uma solução altamente personalizada, desenvolvida especificamente para as GPUs Instinct. Seu recurso de destaque é a “migração sem interrupções”: os usuários corporativos não precisam modificar interfaces de API, comandos ou fluxos de trabalho de ponta a ponta já existentes; o plug-in lida automaticamente com a otimização de desempenho subjacente em segundo plano.
Do ponto de vista da arquitetura técnica, o vLLM-ATOM emprega um projeto preciso de três camadas. A camada superior mantém o agendamento de solicitações e a interface de compatibilidade do vLLM. A camada intermediária, o plug-in ATOM, gerencia a implementação do modelo e a otimização do kernel. A camada inferior, o AITER, conecta-se diretamente ao hardware da GPU, fornecendo recursos essenciais de aceleração, como Flash Attention, GEMM quantizado e MoE fundido.
Este plug-in é voltado principalmente para placas de computação em GPU de alto desempenho , como Instinct MI350, MI400 e MI355X. Sua lista de compatibilidade inclui modelos de ponta, como Qwen3, GLM e DeepSeek, e oferece cobertura completa de várias arquiteturas, incluindo MoE (Mixture of Experts), modelos densos e modelos de visão-linguagem (VLM).
Analistas do setor observam que o principal valor dessa solução reside na redução significativa das barreiras à implantação da computação de alto desempenho. Por meio dessa abordagem de migração suave e sem curva de aprendizado, as empresas podem transferir mais facilmente os serviços de IA para o backend de hardware da AMD, mantendo a eficiência da inferência e, ao mesmo tempo, melhorando efetivamente a estabilidade e a velocidade de resposta dos serviços online com modelos de grande porte.
Artigo relacionado
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
Recomendações de tópicos especiais relacionados
Comentários (1)

Recentemente, a AMD apresentou oficialmente um novo plug-in chamado vLLM-ATOM. Seu principal objetivo é liberar mais potencial do hardware sem alterar os fluxos de trabalho existentes, proporcionando ganhos significativos de velocidade na inferência para modelos de linguagem de grande porte mais comuns, como o DeepSeek-R1, o Kimi-K2 e o gpt-oss-120B.
Para os desenvolvedores, o vLLM é uma estrutura de código aberto projetada para otimizar a taxa de processamento e o uso da memória da GPU em ambientes de alta simultaneidade. Ao contrário das ferramentas tradicionais de solicitação única, ele se concentra no agendamento de solicitações e no gerenciamento de cache. O novo plug-in ATOM da AMD é uma solução altamente personalizada, desenvolvida especificamente para as GPUs Instinct. Seu recurso de destaque é a “migração sem interrupções”: os usuários corporativos não precisam modificar interfaces de API, comandos ou fluxos de trabalho de ponta a ponta já existentes; o plug-in lida automaticamente com a otimização de desempenho subjacente em segundo plano.
Do ponto de vista da arquitetura técnica, o vLLM-ATOM emprega um projeto preciso de três camadas. A camada superior mantém o agendamento de solicitações e a interface de compatibilidade do vLLM. A camada intermediária, o plug-in ATOM, gerencia a implementação do modelo e a otimização do kernel. A camada inferior, o AITER, conecta-se diretamente ao hardware da GPU, fornecendo recursos essenciais de aceleração, como Flash Attention, GEMM quantizado e MoE fundido.
Este plug-in é voltado principalmente para placas de computação em GPU de alto desempenho , como Instinct MI350, MI400 e MI355X. Sua lista de compatibilidade inclui modelos de ponta, como Qwen3, GLM e DeepSeek, e oferece cobertura completa de várias arquiteturas, incluindo MoE (Mixture of Experts), modelos densos e modelos de visão-linguagem (VLM).
Analistas do setor observam que o principal valor dessa solução reside na redução significativa das barreiras à implantação da computação de alto desempenho. Por meio dessa abordagem de migração suave e sem curva de aprendizado, as empresas podem transferir mais facilmente os serviços de IA para o backend de hardware da AMD, mantendo a eficiência da inferência e, ao mesmo tempo, melhorando efetivamente a estabilidade e a velocidade de resposta dos serviços online com modelos de grande porte.
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n





Lar






