option
Maison
Nouvelles
OpenAI fustige un test de référence en IA : près d'un tiers des questions sont erronées, le taux de réussite a grimpé à 80 % en 8 mois

OpenAI fustige un test de référence en IA : près d'un tiers des questions sont erronées, le taux de réussite a grimpé à 80 % en 8 mois

28 juillet 2026
89

Dans un article de blog, OpenAI a publiquement remis en cause SWE-Bench Pro, la référence majeure du secteur, en affirmant qu'environ 30 % de ses 731 tâches de test publiques comportaient des failles d'évaluation. Développé par Scale AI, SWE-Bench Pro est conçu pour évaluer les capacités de programmation des grands modèles linguistiques et des agents IA. Comme il reflète fidèlement le développement en entreprise dans le monde réel et applique des mesures anti-tricherie strictes, il est devenu un benchmark largement reconnu dans le domaine de l'ingénierie logicielle en IA.

OpenAI

OpenAI met en avant un élément clé dans son article de blog : le taux de réussite des modèles de premier plan à ce benchmark est passé de 23,3 % à 80,3 % en seulement huit mois. Une progression aussi rapide semble suspecte, et OpenAI fait valoir que ce benchmark ne permet plus de mesurer avec précision les compétences réelles d’un modèle en matière de développement logiciel. Le problème provient probablement de failles dans l’évaluation elle-même, et non d’un véritable bond en avant des capacités des modèles.

Deux processus de révision, validés de manière croisée, révèlent que près de 30 % des tâches sont jugées « non conformes ».

Pour vérifier cela, OpenAI a lancé deux processus d’examen parallèles. L’analyse des points de données a mis en évidence 200 tâches ayant échoué, soit 27,4 % des 731 tâches publiques. Parallèlement, l’annotation manuelle a signalé 249 tâches ayant échoué, soit 34,1 %. En recoupant les résultats de ces deux méthodes, OpenAI estime qu’environ 30 % des tâches de SWE-Bench Pro contiennent des défauts, qui se répartissent en quatre catégories : des tests trop stricts, des consignes inadéquates, une couverture de test trop restreinte et des consignes trompeuses.

OpenAI a également donné un exemple typique : une tâche demandait un seul espace au début d’une ligne lors de la conversion d’un contenu au format Markdown, mais le test caché s’attendait à deux espaces. En conséquence, même si le modèle respectait l’exigence énoncée, il était considéré comme incorrect. Ce décalage entre les instructions explicites et les exigences cachées fausse directement l’évaluation des capacités réelles d’un modèle et explique la hausse déraisonnable des taux de réussite.

Retrait de la recommandation d’adoption et appel à la refonte du système d’évaluation de l’IA

Sur la base de cette analyse, OpenAI a officiellement retiré sa recommandation antérieure d’utiliser SWE-Bench Pro. L’entreprise estime que les futurs benchmarks devraient être créés par des développeurs logiciels expérimentés spécifiquement pour l’évaluation de l’IA, plutôt que de réutiliser une logique de test conçue pour des développeurs humains. Si près de 30 % des tâches d’un benchmark industriel sont erronées, c’est toute la crédibilité du système d’évaluation de l’IA qui est remise en cause. Passer de concours axés sur la course aux scores à de véritables évaluations des capacités d’ingénierie pourrait constituer la prochaine étape cruciale dans l’évaluation de l’ingénierie logicielle en IA.

Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars. Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars. Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
Analyse des données Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce
Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce

2026 Derniers Meilleurs Outils de Détection d’Anomalies par IA les mieux notés pour la surveillance des KPI dans les équipes SaaS et E-commerce ! XIX.AI a sélectionné une collection puissante et révolutionnaire, basée sur des tests rigoureux en conditions réelles et des classements mis à jour chaque semaine. Vous y trouverez des comparaisons détaillées entre les versions gratuites et payantes, afin de vous aider à identifier la solution incontournable qui améliore la productivité et débloque votre avantage concurrentiel grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
commentaires (0)
0/500
OR