AMD lance le plugin vLLM-ATOM pour accélérer l'inférence des grands modèles

Récemment, AMD a officiellement dévoilé un nouveau plugin baptisé vLLM-ATOM. Son objectif principal est d’exploiter davantage le potentiel du matériel sans modifier les flux de travail existants, tout en offrant des gains de vitesse significatifs en matière d’inférence pour les grands modèles linguistiques grand public tels que DeepSeek-R1, Kimi-K2 et gpt-oss-120B.
Pour les développeurs, vLLM est un framework open source conçu pour optimiser le débit et l’utilisation de la mémoire GPU dans des environnements à forte concurrence. Contrairement aux outils traditionnels à requête unique, il se concentre sur la planification des requêtes et la gestion du cache. Le nouveau plugin ATOM d’AMD est une solution hautement personnalisée, spécialement conçue pour les GPU Instinct. Sa caractéristique phare est la « migration transparente » : les utilisateurs professionnels n’ont pas besoin de modifier les interfaces API, les commandes ou les flux de travail de bout en bout existants ; le plugin gère automatiquement l’optimisation des performances sous-jacentes en arrière-plan.
Du point de vue de l’architecture technique, vLLM-ATOM repose sur une conception précise à trois couches. La couche supérieure conserve la planification des requêtes et l’interface de compatibilité de vLLM. La couche intermédiaire, le plugin ATOM, gère l’implémentation du modèle et l’optimisation du noyau. La couche inférieure, AITER, se connecte directement au matériel GPU, fournissant des capacités d’accélération essentielles telles que Flash Attention, GEMM quantifié et MoE fusionné.
Ce plugin cible principalement les cartes de calcul GPU hautes performances telles que les Instinct MI350, MI400 et MI355X. Sa liste de modèles pris en charge comprend des modèles phares tels que Qwen3, GLM et DeepSeek, et couvre l’ensemble des architectures, y compris MoE (Mixture of Experts), les modèles denses et les modèles vision-langage (VLM).
Les analystes du secteur soulignent que la valeur ajoutée principale de cette solution réside dans la réduction considérable des obstacles au déploiement du calcul haute performance. Grâce à cette approche de migration fluide et sans courbe d’apprentissage, les entreprises peuvent plus facilement transférer leurs services d’IA vers l’infrastructure matérielle AMD, tout en conservant l’efficacité de l’inférence et en améliorant efficacement la stabilité et la vitesse de réponse des services en ligne basés sur des modèles volumineux.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)

Récemment, AMD a officiellement dévoilé un nouveau plugin baptisé vLLM-ATOM. Son objectif principal est d’exploiter davantage le potentiel du matériel sans modifier les flux de travail existants, tout en offrant des gains de vitesse significatifs en matière d’inférence pour les grands modèles linguistiques grand public tels que DeepSeek-R1, Kimi-K2 et gpt-oss-120B.
Pour les développeurs, vLLM est un framework open source conçu pour optimiser le débit et l’utilisation de la mémoire GPU dans des environnements à forte concurrence. Contrairement aux outils traditionnels à requête unique, il se concentre sur la planification des requêtes et la gestion du cache. Le nouveau plugin ATOM d’AMD est une solution hautement personnalisée, spécialement conçue pour les GPU Instinct. Sa caractéristique phare est la « migration transparente » : les utilisateurs professionnels n’ont pas besoin de modifier les interfaces API, les commandes ou les flux de travail de bout en bout existants ; le plugin gère automatiquement l’optimisation des performances sous-jacentes en arrière-plan.
Du point de vue de l’architecture technique, vLLM-ATOM repose sur une conception précise à trois couches. La couche supérieure conserve la planification des requêtes et l’interface de compatibilité de vLLM. La couche intermédiaire, le plugin ATOM, gère l’implémentation du modèle et l’optimisation du noyau. La couche inférieure, AITER, se connecte directement au matériel GPU, fournissant des capacités d’accélération essentielles telles que Flash Attention, GEMM quantifié et MoE fusionné.
Ce plugin cible principalement les cartes de calcul GPU hautes performances telles que les Instinct MI350, MI400 et MI355X. Sa liste de modèles pris en charge comprend des modèles phares tels que Qwen3, GLM et DeepSeek, et couvre l’ensemble des architectures, y compris MoE (Mixture of Experts), les modèles denses et les modèles vision-langage (VLM).
Les analystes du secteur soulignent que la valeur ajoutée principale de cette solution réside dans la réduction considérable des obstacles au déploiement du calcul haute performance. Grâce à cette approche de migration fluide et sans courbe d’apprentissage, les entreprises peuvent plus facilement transférer leurs services d’IA vers l’infrastructure matérielle AMD, tout en conservant l’efficacité de l’inférence et en améliorant efficacement la stabilité et la vitesse de réponse des services en ligne basés sur des modèles volumineux.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter





Maison






