Maison
Lancement de Grok 4.6, rivalisant avec GPT-5.6 en performance pour plus de 60 % de coût en moins

xAI a lancé Grok 4.6, atteignant un score de 61 à l'Indice d'Intelligence des IA, égalant GPT-5.6 Sol (Max) et restant légèrement derrière Claude Opus 5 (63 points) et Claude Fable 5 (62 points). Cette performance place Grok 4.6 parmi les modèles de premier plan mondial, défiant directement les offres phares d'OpenAI et d'Anthropic. Construit sur la base de Grok 4.5, cette mise à jour introduit des améliorations fondamentales en matière de raisonnement et de formation aux concepts techniques avancés, en tirant parti de données curatées générées par le modèle lui-même, ainsi que de jeux de données d'ingénierie de haute qualité et d'un algorithme d'entraînement optimisé.
Un changement majeur dans la méthodologie d'entraînement implique une boucle de données auto-renforçante : Grok 4.5 a été utilisé pour régénérer des trajectoires d'ajustement fin supervisé, en se concentrant sur le raisonnement, l'utilisation d'outils par les agents et des domaines tels que les sciences, technologies, ingénierie et mathématiques (STEM), l'ingénierie logicielle et le travail intellectuel. Le modèle a également subi une formation extensive sur des tâches d'apprentissage par renforcement basées sur les agents, incluant le travail intellectuel, la programmation générale, l'optimisation des noyaux, le développement web et la conception assistée par ordinateur – une stratégie clairement conçue pour répondre aux charges de travail principales de l'émergente « ère des agents ».
Les benchmarks liés aux agents ont connu des améliorations spectaculaires, réduisant considérablement l'effort requis pour les tâches complexes et à long terme.
Dans les évaluations de benchmarks liés aux agents, Grok 4.6 a démontré des performances exceptionnelles. Il a obtenu un score Elo de 1753 sur GDPval-AA v2, se classant juste derrière Claude Opus 5. Les scores DeepSWE v1.1 sont passés à 65,9 %, une augmentation notable par rapport aux 54 % de Grok 4.5, tandis que APEX-Agents est passé de 47,1 % à 57,5 %. Terminal-Bench v3.0 est passé de 15,7 % à 26 %, avec des résultats supplémentaires solides de 69,9 % sur CursorBench v3.2 et 61,3 % sur FrontierCode v1.1, marquant des avancées significatives tant en matière de codage que de capacités d'agents.
Il est à noter que Grok 4.6 offre un avantage distinct en termes d'efficacité des coûts. Tarifié à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, il est plus de 60 % moins cher que Claude Opus 5 (5 $/25 $) et GPT-5.6 Sol (5 $/30 $). Sur le benchmark AA-Briefcase de travail intellectuel à long terme, Grok 4.6 a terminé les tâches en une moyenne de 53 tours en utilisant environ 500 millions de jetons d'entrée, tandis que Claude Opus 5 a nécessité environ 103 tours et 2 milliards de jetons. Cela signifie que Grok 4.6 obtient des résultats comparables en utilisant moins d'un quart des ressources, mettant en évidence un avantage clair en matière de coût-efficacité. Le modèle est désormais accessible via Cursor, Grok Build, l'API, OpenRouter, Vercel et Cloudflare. Au cours de sa première semaine, les utilisateurs bénéficient de crédits d'utilisation doubles sur Grok Build et Cursor. Avec une fenêtre de contexte de 500 000 jetons, un paysage concurrentiel axé sur « une intelligence égale à des prix inférieurs » a officiellement commencé.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)

xAI a lancé Grok 4.6, atteignant un score de 61 à l'Indice d'Intelligence des IA, égalant GPT-5.6 Sol (Max) et restant légèrement derrière Claude Opus 5 (63 points) et Claude Fable 5 (62 points). Cette performance place Grok 4.6 parmi les modèles de premier plan mondial, défiant directement les offres phares d'OpenAI et d'Anthropic. Construit sur la base de Grok 4.5, cette mise à jour introduit des améliorations fondamentales en matière de raisonnement et de formation aux concepts techniques avancés, en tirant parti de données curatées générées par le modèle lui-même, ainsi que de jeux de données d'ingénierie de haute qualité et d'un algorithme d'entraînement optimisé.
Un changement majeur dans la méthodologie d'entraînement implique une boucle de données auto-renforçante : Grok 4.5 a été utilisé pour régénérer des trajectoires d'ajustement fin supervisé, en se concentrant sur le raisonnement, l'utilisation d'outils par les agents et des domaines tels que les sciences, technologies, ingénierie et mathématiques (STEM), l'ingénierie logicielle et le travail intellectuel. Le modèle a également subi une formation extensive sur des tâches d'apprentissage par renforcement basées sur les agents, incluant le travail intellectuel, la programmation générale, l'optimisation des noyaux, le développement web et la conception assistée par ordinateur – une stratégie clairement conçue pour répondre aux charges de travail principales de l'émergente « ère des agents ».
Les benchmarks liés aux agents ont connu des améliorations spectaculaires, réduisant considérablement l'effort requis pour les tâches complexes et à long terme.
Dans les évaluations de benchmarks liés aux agents, Grok 4.6 a démontré des performances exceptionnelles. Il a obtenu un score Elo de 1753 sur GDPval-AA v2, se classant juste derrière Claude Opus 5. Les scores DeepSWE v1.1 sont passés à 65,9 %, une augmentation notable par rapport aux 54 % de Grok 4.5, tandis que APEX-Agents est passé de 47,1 % à 57,5 %. Terminal-Bench v3.0 est passé de 15,7 % à 26 %, avec des résultats supplémentaires solides de 69,9 % sur CursorBench v3.2 et 61,3 % sur FrontierCode v1.1, marquant des avancées significatives tant en matière de codage que de capacités d'agents.
Il est à noter que Grok 4.6 offre un avantage distinct en termes d'efficacité des coûts. Tarifié à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, il est plus de 60 % moins cher que Claude Opus 5 (5 $/25 $) et GPT-5.6 Sol (5 $/30 $). Sur le benchmark AA-Briefcase de travail intellectuel à long terme, Grok 4.6 a terminé les tâches en une moyenne de 53 tours en utilisant environ 500 millions de jetons d'entrée, tandis que Claude Opus 5 a nécessité environ 103 tours et 2 milliards de jetons. Cela signifie que Grok 4.6 obtient des résultats comparables en utilisant moins d'un quart des ressources, mettant en évidence un avantage clair en matière de coût-efficacité. Le modèle est désormais accessible via Cursor, Grok Build, l'API, OpenRouter, Vercel et Cloudflare. Au cours de sa première semaine, les utilisateurs bénéficient de crédits d'utilisation doubles sur Grok Build et Cursor. Avec une fenêtre de contexte de 500 000 jetons, un paysage concurrentiel axé sur « une intelligence égale à des prix inférieurs » a officiellement commencé.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











