option
Maison
Nouvelles
Optimisation de la sélection de modèles d'IA pour des performances réelles

Optimisation de la sélection de modèles d'IA pour des performances réelles

11 août 2025
156

Les entreprises doivent s'assurer que leurs modèles d'IA, qui pilotent les applications, fonctionnent efficacement dans des scénarios réels. Prédire ces scénarios peut être difficile, compliquant les évaluations. Le benchmark RewardBench 2 mis à jour offre aux organisations des informations plus claires sur les performances pratiques d'un modèle.

L’Institut Allen pour l’IA (Ai2) a introduit RewardBench 2, une version améliorée de son benchmark RewardBench, conçue pour fournir une évaluation complète des performances des modèles et de leur alignement avec les objectifs des entreprises.

Ai2 a développé RewardBench avec des tâches de classification évaluant les corrélations via le calcul au moment de l'inférence et l'entraînement en aval. RewardBench se concentre sur les modèles de récompense (RMs), qui jugent les sorties des grands modèles de langage en attribuant des scores ou « récompenses » pour guider l'apprentissage par renforcement avec retour humain (RHLF).

RewardBench 2 est là ! Nous avons pris le temps d’apprendre de notre premier outil d’évaluation de modèle de récompense pour en créer un nettement plus difficile et plus corrélé avec l’RLHF en aval et l’échelle au moment de l’inférence. pic.twitter.com/NGetvNrOQV

— Ai2 (@allen_ai) 2 juin 2025

Nathan Lambert, chercheur senior chez Ai2, a déclaré à VentureBeat que le RewardBench original fonctionnait bien initialement, mais l’évolution des environnements des modèles exigeait des benchmarks actualisés.

« À mesure que les modèles de récompense devenaient plus sophistiqués et les cas d’utilisation plus complexes, nous avons constaté, avec la communauté, que la première version ne répondait pas pleinement aux complexités des préférences humaines en conditions réelles », a-t-il expliqué.

Lambert a noté que RewardBench 2 améliore la portée et la profondeur des évaluations, intégrant des invites variées et exigeantes ainsi que des méthodes affinées pour mieux refléter le jugement humain des sorties d’IA. Il inclut de nouvelles invites humaines, un système de notation plus strict et des domaines supplémentaires.

Utilisation des évaluations pour l'évaluation des modèles

Les modèles de récompense évaluent les performances des modèles, mais l’alignement avec les valeurs de l’entreprise est crucial. Des RMs mal alignés peuvent amplifier des problèmes comme les hallucinations, réduire la généralisation ou favoriser excessivement des réponses nuisibles pendant l’ajustement fin et l’apprentissage par renforcement.

RewardBench 2 couvre six domaines : factualité, respect précis des instructions, mathématiques, sécurité, concentration et égalités.

« Les entreprises peuvent utiliser RewardBench 2 de deux manières selon leurs besoins. Pour l’RLHF, elles doivent intégrer les meilleures pratiques et ensembles de données des meilleurs modèles dans leurs pipelines, car les modèles de récompense nécessitent un entraînement sur politique. Pour l’échelle au moment de l’inférence ou le filtrage des données, RewardBench 2 aide à sélectionner le meilleur modèle pour leur domaine avec des performances corrélées », a déclaré Lambert.

Lambert a souligné que des benchmarks comme RewardBench permettent aux utilisateurs d’évaluer les modèles en fonction des priorités les plus pertinentes pour eux, plutôt qu’un score générique. Il a noté que les performances sont subjectives, fortement liées au contexte et aux objectifs des utilisateurs, avec des préférences humaines souvent très nuancées.

Ai2 a lancé le RewardBench original en mars 2024, le qualifiant de premier benchmark et classement des modèles de récompense. Depuis, de nouvelles méthodes comme FAIR reWordBench de Meta et Self-Principled Critique Tuning de DeepSeek ont émergé pour des RMs plus intelligents et évolutifs.

Super excité que notre deuxième évaluation de modèle de récompense soit sortie. Elle est nettement plus difficile, beaucoup plus propre et bien corrélée avec l’échantillonnage PPO/BoN en aval.

Joyeuse ascension !

Félicitations énormes à @saumyamalik44 qui a dirigé le projet avec un engagement total pour l’excellence. https://t.co/c0b6rHTXY5

— Nathan Lambert (@natolambert) 2 juin 2025

Perspectives sur les performances des modèles

Avec RewardBench 2, Ai2 a testé des modèles existants et nouvellement entraînés, y compris des variantes de Gemini, Claude, GPT-4.1 et Llama-3.1, ainsi que des ensembles de données et modèles comme Qwen, Skywork et Tulu.

Les résultats ont montré que les modèles de récompense plus grands excellent grâce à des modèles de base plus robustes. Les variantes Instruct de Llama-3.1 ont dominé le benchmark, avec les données Skywork aidant à la concentration et à la sécurité, et Tulu performant bien en factualité.

Ai2 a noté que bien que RewardBench 2 fasse progresser l’évaluation multidomaine axée sur la précision pour les modèles de récompense, il devrait principalement guider les entreprises dans la sélection des modèles les mieux adaptés à leurs besoins spécifiques.

Article connexe
Comment corriger les Core Web Vitals pour de meilleurs classements SEO Comment corriger les Core Web Vitals pour de meilleurs classements SEO Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Slackbot devient un agent d'IA Slackbot devient un agent d'IA Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 % ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 % ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
Recommandations de sujets spéciaux liés
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
Éducation et apprentissage Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte
Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte

2026 Dernières Meilleures Plateformes de Création de Quiz par IA pour les Enseignants, Tuteurs et Programmes d’Apprentissage en Cohorte ! XIX.AI a sélectionné une liste hautement notée d’outils puissants et transformateurs, testés dans des situations réelles pour garantir des classements précis. Ces plateformes incontournables permettent d’améliorer l’efficacité rédactionnelle, de simplifier la création de contenu et de faciliter la conception de quiz dans tous les contextes d’apprentissage. Explorez dès maintenant pour découvrir l’outil idéal qui vous permettra de tirer parti de l’avantage offert par l’IA dans votre enseignement !

13 outils
xix.ai
commentaires (3)
0/500
JeffreyThomas
JeffreyThomas 13 mars 2026 21:01:22 UTC+01:00

Como usuario que solo tiene conocimientos básicos, elegir el modelo adecuado es un dolor de cabeza. Este artículo menciona problemas prácticos que son ciertos; a veces, el modelo parece brillar en la prueba, pero en la práctica simplemente falla. Me pregunto si el RewardBench actualizado ayuda a predecir cuándo un modelo se 'descompone' de manera realista. Si las empresas confían demasiado en las métricas, podrían terminar con un fiasco en producción 😅. ¿Habrá herramientas más accesibles para los equipos pequeños?

DonaldGonzález
DonaldGonzález 6 décembre 2025 23:30:36 UTC+01:00

この記事、実運用でのAIモデルの難しさをしっかり分析してますね。特にリアルワールドでの性能評価の課題は興味深い。AI導入が進む中で、本当に役立つモデル選びができる企業が勝ち残るのかも。ユーザー体験を考えると、ベンチマークだけで選ぶのは危険かもしれない... 😅

CarlMartin
CarlMartin 17 septembre 2025 08:30:37 UTC+02:00

C'est intéressant, mais j'aimerais voir plus d'exemples concrets sur comment évaluer la performance des modèles en situation réelle. Parfois les benchmarks ne reflètent pas la complexité du terrain 😅

OR