option
Maison
Nouvelles
Benchmarks AI: devrions-nous les ignorer pour l'instant?

Benchmarks AI: devrions-nous les ignorer pour l'instant?

10 avril 2025
284

Bienvenue à la newsletter régulière sur l'IA de TechCrunch ! Nous prenons une petite pause, mais ne vous inquiétez pas, vous pouvez toujours trouver toute notre couverture sur l'IA, y compris mes chroniques, analyses quotidiennes et actualités de dernière minute, ici même sur TechCrunch. Vous voulez recevoir ces articles directement dans votre boîte de réception chaque jour ? Inscrivez-vous simplement à nos newsletters quotidiennes ici.

Cette semaine, la startup d'IA d'Elon Musk, xAI, a lancé son dernier modèle d'IA phare, Grok 3, qui alimente les applications de chatbot Grok de l'entreprise. Ils l'ont entraîné sur pas moins de 200 000 GPU, et il surpasse un grand nombre d'autres modèles de pointe, y compris certains d'OpenAI, dans des benchmarks pour les mathématiques, le codage, et plus encore.

Mais parlons de ce que ces benchmarks signifient réellement.

Ici à TC, nous rapportons ces chiffres de benchmarks, même si nous ne sommes pas toujours ravis de le faire, car ils sont l'un des rares moyens utilisés par l'industrie de l'IA pour montrer comment leurs modèles s'améliorent. Le problème, c'est que ces benchmarks d'IA populaires se concentrent souvent sur des choses obscures et donnent des scores qui ne reflètent pas vraiment la performance de l'IA sur ce qui intéresse réellement les gens.

Ethan Mollick, professeur à Wharton, a déclaré sur X qu'il y a un réel besoin de meilleurs tests et de groupes indépendants pour les réaliser. Il a souligné que les entreprises d'IA rapportent souvent leurs propres résultats de benchmarks, ce qui rend difficile de leur faire entièrement confiance.

« Les benchmarks publics sont à la fois 'bof' et saturés, laissant beaucoup de tests d'IA ressembler à des critiques gastronomiques, basées sur le goût », a écrit Mollick. « Si l'IA est cruciale pour le travail, nous avons besoin de plus. »

Il y a beaucoup de gens qui essaient de proposer de nouveaux benchmarks pour l'IA, mais personne ne s'accorde sur ce qui est le meilleur. Certains pensent que les benchmarks devraient se concentrer sur l'impact économique pour être utiles, tandis que d'autres estiment que l'adoption dans le monde réel et l'utilité sont les véritables mesures du succès.

Ce débat pourrait durer éternellement. Peut-être, comme le suggère l'utilisateur de X Roon, devrions-nous simplement prêter moins d'attention aux nouveaux modèles et benchmarks à moins qu'il n'y ait une percée majeure en IA. Cela pourrait être meilleur pour notre santé mentale, même si cela signifie manquer un peu de l'engouement pour l'IA.

Comme mentionné, This Week in AI prend une pause. Merci de rester avec nous, lecteurs, à travers tous les hauts et les bas. À la prochaine.

Actualités

Crédits image : Nathan Laine/Bloomberg / Getty Images
OpenAI tente de « décensurer » ChatGPT. Max a écrit sur la manière dont ils modifient leur approche du développement de l'IA pour adopter la « liberté intellectuelle », même sur des sujets difficiles ou controversés.

Mira Murati, ancienne CTO d'OpenAI, a une nouvelle startup appelée Thinking Machines Lab. Ils travaillent sur des outils pour « faire fonctionner l'IA selon les besoins et objectifs uniques [des gens]. »

xAI a lancé Grok 3 et ajouté de nouvelles fonctionnalités aux applications Grok pour iOS et le web.

Meta organise sa première conférence pour développeurs axée sur l'IA générative ce printemps. Elle s'appelle LlamaCon, d'après leurs modèles Llama, et aura lieu le 29 avril.

Paul a écrit sur OpenEuroLLM, un projet d'une vingtaine d'organisations pour construire des modèles de fondation pour une « IA transparente en Europe » qui respecte la « diversité linguistique et culturelle » de toutes les langues de l'UE.

Article de recherche de la semaine

Le site web d'OpenAI ChatGPT affiché sur un écran d'ordinateur portable est visible dans cette photo d'illustration.

Crédits image : Jakub Porzycki/NurPhoto / Getty Images
Les chercheurs d'OpenAI ont mis au point un nouveau benchmark d'IA appelé SWE-Lancer pour tester la capacité de l'IA à coder. Il est composé de plus de 1 400 tâches d'ingénierie logicielle freelance, allant de la correction de bugs et l'ajout de fonctionnalités à la proposition d'implémentations techniques.

OpenAI indique que le modèle le plus performant, Claude 3.5 Sonnet d'Anthropic, nelige 40,3 % sur l'ensemble du benchmark SWE-Lancer, ce qui montre que l'IA a encore du chemin à parcourir. Ils n'ont pas testé de modèles plus récents comme o3-mini d'OpenAI ou R1 de DeepSeek en Chine.

Modèle de la semaine

Une entreprise d'IA chinoise appelée Stepfun a lancé un modèle d'IA « ouvert » nommé Step-Audio qui peut comprendre et générer de la parole en chinois, anglais et japonais. Les utilisateurs peuvent même ajuster l'émotion et le dialecte de l'audio synthétique, y compris le chant.

Stepfun est l'une des nombreuses startups d'IA chinoises bien financées qui publient des modèles avec des licences permissives. Fondée en 2023, elle a récemment conclu une levée de fonds de plusieurs centaines de millions auprès d'investisseurs, y compris des sociétés d'investissement privées appartenant à l'État chinois.

Mélange

Nous Research DeepHermes

Crédits image : Nous Research
Nous Research, un groupe de recherche en IA, prétend avoir lancé l'un des premiers modèles d'IA combinant le raisonnement avec des « capacités de modèle linguistique intuitif ».

Leur modèle, DeepHermes-3 Preview, peut passer de courtes à longues « chaînes de pensée » pour équilibrer précision et puissance de calcul. En mode « raisonnement », il prend plus de temps pour résoudre des problèmes plus difficiles et montre son processus de réflexion en cours de route.

Anthropic prévoirait de lancer un modèle similaire bientôt, et OpenAI dit que c'est sur leur feuille de route à court terme.

Article connexe
Sam Altman suscite un débat sur le ralentissement de l'IA Sam Altman suscite un débat sur le ralentissement de l'IA Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI a réfuté les allégations de violation de secrets commerciaux d’Apple ce mardi, affirmant que le procès est infondé.« Nous prenons ces allégations au sérieux mais ne voyons aucune preuve à leur appui », a déclaré OpenAI, selon Ed Ludlow de Blo
La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone Caitlin Kalinowski, responsable de la robotique chez OpenAI, a démissionné à la suite du partenariat controversé de l’entreprise avec le département de la Défense.« Ce n’était pas une décision facile », a expliqué Kalinowski dans une déclaration sur
Recommandations de sujets spéciaux liés
Analyse des données Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce
Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce

2026 Derniers Meilleurs Outils de Détection d’Anomalies par IA les mieux notés pour la surveillance des KPI dans les équipes SaaS et E-commerce ! XIX.AI a sélectionné une collection puissante et révolutionnaire, basée sur des tests rigoureux en conditions réelles et des classements mis à jour chaque semaine. Vous y trouverez des comparaisons détaillées entre les versions gratuites et payantes, afin de vous aider à identifier la solution incontournable qui améliore la productivité et débloque votre avantage concurrentiel grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
commentaires (62)
0/500
DavidGreen
DavidGreen 17 juin 2026 10:00:23 UTC+02:00

I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.

JonathanDavis
JonathanDavis 19 août 2025 08:26:53 UTC+02:00

AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.

EdwardWalker
EdwardWalker 19 août 2025 07:00:59 UTC+02:00

AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?

HarrySmith
HarrySmith 11 août 2025 21:00:59 UTC+02:00

AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔

BillyLewis
BillyLewis 4 août 2025 08:01:00 UTC+02:00

AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐

JimmyWilson
JimmyWilson 1 août 2025 04:48:18 UTC+02:00

AI benchmarks sound fancy, but are they just tech flexing? I mean, cool numbers, but do they really tell us how AI vibes in the real world? 🤔

OR