option
Maison
Nouvelles
Une étude révèle que les performances des codes d'IA sont surestimées lors des tests en conditions réelles

Une étude révèle que les performances des codes d'IA sont surestimées lors des tests en conditions réelles

9 mai 2026
207

Une étude menée par l'institut METR indique que le benchmark SWE-bench Verified, largement utilisé pour évaluer les capacités de programmation de l'IA, pourrait surestimer de manière significative les performances des agents IA dans le développement logiciel en conditions réelles. L'étude a révélé qu'environ la moitié des solutions de code générées par l'IA et jugées « conformes » par le benchmark seraient probablement rejetées par les responsables de projets lors d'une revue de code, soulignant ainsi un écart considérable entre les résultats des évaluations automatisées et la qualité réelle du code.

SWE-bench Verified est depuis longtemps considéré comme une norme clé pour évaluer l'ingénierie logicielle assistée par l'IA, permettant de tester si les modèles peuvent résoudre de véritables tâches de programmation dans des projets open source et de vérifier si les modifications de code passent la suite de tests automatisés du projet. Plusieurs entreprises d'IA, dont Anthropic et OpenAI, citent fréquemment les résultats de ce benchmark pour démontrer les progrès de leurs modèles.

QQ20260312-093454.jpg

Dans cette étude, l'équipe METR a fait appel à quatre développeurs expérimentés chargés de la maintenance des projets open source scikit-learn, Sphinx et pytest pour examiner manuellement 296 extraits de code générés par l'IA. Ces échantillons de code ont été produits par cinq modèles différents : Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet et GPT-5. Les résultats ont révélé que le taux d'acceptation réel par les responsables de maintenance était, en moyenne, inférieur d'environ 24 points de pourcentage aux scores automatisés de SWE-bench — une différence statistiquement significative.

L'étude a également déterminé que le rejet du code généré par l'IA n'était pas principalement dû à des problèmes de style, mais plutôt à des défauts techniques plus importants. Les responsables de maintenance ont classé les problèmes en trois catégories principales : une qualité de code ne répondant pas aux spécifications du projet, une perturbation de la structure du code existant et des erreurs fonctionnelles fondamentales. Une part importante des cas concernait des erreurs fonctionnelles où, bien que le code ait réussi les tests automatisés, il ne résolvait pas correctement le problème visé.

En ce qui concerne la comparaison des modèles, la recherche a révélé que le passage de Claude 3.5 Sonnet à Claude 3.7 Sonnet améliorait considérablement le taux de réussite aux tests de référence, mais que le nombre d'erreurs fonctionnelles signalées par les responsables de maintenance augmentait également. Le passage de Claude 3.7 Sonnet à Claude 4 Opus a entraîné une augmentation des problèmes de qualité du code, tandis que Claude 4.5 Sonnet a montré des améliorations en la matière. En revanche, GPT-5 a obtenu des résultats globalement nettement inférieurs à ceux de la série de modèles Anthropic lors de cette évaluation manuelle.

Cerveau d'intelligence artificielle, grand modèle

L'équipe de recherche a également effectué une analyse estimative du « temps de réalisation des tâches » : selon les résultats de l'évaluation automatisée SWE-bench, il faudrait environ 50 minutes d'effort humain à Claude 4.5 Sonnet pour accomplir des tâches avec un taux de réussite de 50 %. Cependant, d'après les notes attribuées par les responsables de maintenance, le temps estimé tombe à seulement environ 8 minutes, ce qui suggère que le benchmark pourrait surestimer les capacités jusqu'à sept fois.

Les chercheurs ont toutefois souligné que cette étude n’implique pas une limite fondamentale des capacités des agents de programmation IA. Avec des stratégies d’invite améliorées, davantage de retours humains ou des cycles d’itération multiples, l’écart entre l’évaluation automatisée et l’examen manuel pourrait être réduit. De plus, le cadre expérimental diffère des processus de développement réels : par exemple, les agents IA n’avaient droit qu’à une seule tentative de soumission, alors que les développeurs humains peuvent généralement modifier le code de manière itérative en fonction des retours.

En résumé, l'étude conclut que le fait de se fier uniquement aux scores de référence pour évaluer l'utilité pratique des agents de programmation IA peut introduire un biais systématique. Alors que les modèles de codage IA évoluent rapidement, le développement de systèmes d'évaluation reflétant mieux les environnements de développement réels est devenu un axe de recherche crucial en génie logiciel IA.

Article connexe
Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA Pour faire face à l'afflux de rapports de sécurité de faible qualité produits par des outils d'automatisation basés sur l'intelligence artificielle, six grandes entreprises technologiques — Anthropic, Amazon (AWS), GitHub, Google, Microsoft et OpenAI
Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne Ce matin, le PDG d’OpenAI, Sam Altman, a pris la parole pour répondre au procès intenté par l’ancien cofondateur Elon Musk, qui conteste la structure corporative de l’entreprise.Interrogé sur l’allégation de Musk selon laquelle d’autres fondateurs «
Sam Altman suscite un débat sur le ralentissement de l'IA Sam Altman suscite un débat sur le ralentissement de l'IA Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
Recommandations de sujets spéciaux liés
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
Éducation et apprentissage Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte
Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte

2026 Dernières Meilleures Plateformes de Création de Quiz par IA pour les Enseignants, Tuteurs et Programmes d’Apprentissage en Cohorte ! XIX.AI a sélectionné une liste hautement notée d’outils puissants et transformateurs, testés dans des situations réelles pour garantir des classements précis. Ces plateformes incontournables permettent d’améliorer l’efficacité rédactionnelle, de simplifier la création de contenu et de faciliter la conception de quiz dans tous les contextes d’apprentissage. Explorez dès maintenant pour découvrir l’outil idéal qui vous permettra de tirer parti de l’avantage offert par l’IA dans votre enseignement !

13 outils
xix.ai
code Outils d'analyse des pull requests basés sur l'IA pour les équipes GitHub chargées de la refactorisation, de la correction des bogues et de la résolution des failles de sécurité
Outils d'analyse des pull requests basés sur l'IA pour les équipes GitHub chargées de la refactorisation, de la correction des bogues et de la résolution des failles de sécurité

Les meilleurs outils 2026 d’analyse des pull requests par IA pour les équipes GitHub sont disponibles sur XIX.AI ! Cette sélection triée sur le volet présente des solutions puissantes et révolutionnaires qui optimisent la refactorisation, la correction des bugs et la détection des failles de sécurité dans tous les workflows d’équipe. Profitez d'une comparaison entre les versions gratuites et payantes, ainsi que de tests en conditions réelles et de classements détaillés pour vous aider à trouver l'outil idéal qui boostera considérablement votre productivité. Découvrez-les dès maintenant pour exploiter pleinement le potentiel de l'IA !

12 outils
xix.ai
Synthèse vocale Les meilleurs outils d'IA de synthèse vocale pour des voix off naturelles
Les meilleurs outils d'IA de synthèse vocale pour des voix off naturelles

Les meilleurs outils d'IA de synthèse vocale de 2026, les mieux notés pour des voix off naturelles, sont disponibles ici sur XIX.AI ! Cette sélection regroupe des solutions puissantes et révolutionnaires qui offrent des voix d'une clarté cristalline pour tous les cas d'utilisation, étayées par des tests en conditions réelles et des classements mis à jour chaque semaine. Consultez notre comparatif entre les versions gratuites et payantes pour trouver la solution incontournable qui boostera instantanément votre productivité. Découvrez-la dès maintenant pour exploiter pleinement le potentiel de l’IA !

11 outils
xix.ai
commentaires (2)
0/500
MichaelMartinez
MichaelMartinez 27 juin 2026 20:00:18 UTC+02:00

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 16 mai 2026 14:00:16 UTC+02:00

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR