Maison
Google et NVIDIA mettent DiffusionGemma en open source, multipliant par quatre la vitesse d'inférence sur une seule carte
Le 10 juin 2026, Google a lancé DiffusionGemma, un modèle linguistique expérimental open source qui rompt avec le paradigme autorégressif traditionnel consistant à générer du texte mot par mot. Il est le premier à utiliser des mécanismes de diffusion issus de l'IA appliquée à l'image dans la génération de texte, en partant d'un bruit aléatoire et en affinant le résultat de manière itérative pour produire 256 blocs de tokens en parallèle à chaque étape.

En termes de performances matérielles, les optimisations approfondies de NVIDIA permettent au modèle de fonctionner près de quatre fois plus vite que des modèles traditionnels comparables en mode mono-GPU et mono-utilisateur. Sur un GPU H100, il atteint des vitesses de sortie allant jusqu’à 1 000 tokens par seconde pour une seule requête, et même sur des GPU grand public haut de gamme comme le RTX 5090, il peut dépasser les 700 tokens par seconde.
DiffusionGemma compte 26 milliards de paramètres et utilise une architecture de type « mixture-of-experts » (MoE), n’activant que 3,8 milliards de paramètres par étape. Bien que la qualité et la précision de sa génération de texte soient légèrement inférieures à celles des modèles traditionnels de la série Gemma4 sur les benchmarks standard, sa « prise en compte complète des blocs » unique en son genre surmonte la limitation des modèles autorégressifs, qui ne fonctionnent que de manière rétroactive. Comme tous les tokens peuvent se référencer mutuellement pendant la génération, il excelle dans les tâches impliquant des données non linéaires et structurées, telles que la complétion de texte, le remplissage de code, la résolution de Sudoku et le traitement de séquences d’acides aminés.

Les poids du modèle sont désormais disponibles en open source sur Hugging Face sous licence Apache 2.0 et fonctionnent de manière transparente avec les frameworks d’inférence courants tels que vLLM et MLX. Cette exploration élimine non seulement les contraintes de bande passante mémoire pesant sur la puissance de calcul des GPU, mais ouvre également une nouvelle voie technique pour les futures applications d’IA dans le domaine de la logique complexe et de la génération de texte non linéaire.
Article connexe
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Recommandations de sujets spéciaux liés
commentaires (0)
Le 10 juin 2026, Google a lancé DiffusionGemma, un modèle linguistique expérimental open source qui rompt avec le paradigme autorégressif traditionnel consistant à générer du texte mot par mot. Il est le premier à utiliser des mécanismes de diffusion issus de l'IA appliquée à l'image dans la génération de texte, en partant d'un bruit aléatoire et en affinant le résultat de manière itérative pour produire 256 blocs de tokens en parallèle à chaque étape.

En termes de performances matérielles, les optimisations approfondies de NVIDIA permettent au modèle de fonctionner près de quatre fois plus vite que des modèles traditionnels comparables en mode mono-GPU et mono-utilisateur. Sur un GPU H100, il atteint des vitesses de sortie allant jusqu’à 1 000 tokens par seconde pour une seule requête, et même sur des GPU grand public haut de gamme comme le RTX 5090, il peut dépasser les 700 tokens par seconde.
DiffusionGemma compte 26 milliards de paramètres et utilise une architecture de type « mixture-of-experts » (MoE), n’activant que 3,8 milliards de paramètres par étape. Bien que la qualité et la précision de sa génération de texte soient légèrement inférieures à celles des modèles traditionnels de la série Gemma4 sur les benchmarks standard, sa « prise en compte complète des blocs » unique en son genre surmonte la limitation des modèles autorégressifs, qui ne fonctionnent que de manière rétroactive. Comme tous les tokens peuvent se référencer mutuellement pendant la génération, il excelle dans les tâches impliquant des données non linéaires et structurées, telles que la complétion de texte, le remplissage de code, la résolution de Sudoku et le traitement de séquences d’acides aminés.

Les poids du modèle sont désormais disponibles en open source sur Hugging Face sous licence Apache 2.0 et fonctionnent de manière transparente avec les frameworks d’inférence courants tels que vLLM et MLX. Cette exploration élimine non seulement les contraintes de bande passante mémoire pesant sur la puissance de calcul des GPU, mais ouvre également une nouvelle voie technique pour les futures applications d’IA dans le domaine de la logique complexe et de la génération de texte non linéaire.
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss











