option
Maison
Nouvelles
Tencent dévoile WorkBuddy Bench : un environnement de test pour agents intelligents de programmation intégrant les domaines du code, du Web, de la suite Office et de la sécurité

Tencent dévoile WorkBuddy Bench : un environnement de test pour agents intelligents de programmation intégrant les domaines du code, du Web, de la suite Office et de la sécurité

28 août 2026
93

Historiquement, les agents de codage ont été limités à des domaines restreints — tels que la correction de bogues sur SWE-bench ou les tâches de front-end sur Design2Code — tandis que les benchmarks en conditions réelles restent largement inaccessibles à toute évaluation externe. Tencent comble cette lacune avec WorkBuddy Bench, une suite d’évaluation multidomaine décrite en détail dans un article récemment publié sur arXiv. Sa caractéristique principale n’est pas le volume de tâches, mais une architecture conçue explicitement pour empêcher la mémorisation des réponses.

Ce benchmark couvre quatre domaines professionnels : le génie logiciel (code au niveau du référentiel), le développement front-end (artefacts web), les opérations métier (workflows bureautiques multi-fichiers) et la cybersécurité (scénarios « red team » et « blue team »). La suite comprend respectivement 80, 70, 50 et 60 tâches, pour un total de 260. Il est essentiel de noter qu’aucune tâche ne provient de banques de questions publiques ; elles sont au contraire issues d’une ingénierie inverse à partir de commits de code réels, de pull requests ou de contextes métier, puis reformulées en consignes concises, familières et basées sur des jeux de rôle. Cette approche garantit que les recherches en ligne visant à trouver des indices sur les pull requests ou les commits correspondants ne donnent aucun résultat, ce qui empêche efficacement la mémorisation. Le jeu de données étant entièrement ouvert — y compris les répertoires, les images d’environnement, les outils d’évaluation, les cas de test et les solutions de référence —, sa résistance à la contamination repose sur cette méthode de construction et sur le contrôle de version plutôt que sur l’opacité.

image.png

Bien que les quatre sous-ensembles partagent une structure de répertoires unifiée, chacun utilise des indicateurs de validation distincts, ce qui rend invalide toute comparaison directe des scores entre les sous-ensembles. Par conséquent, Tencent ne publie pas de score global pour la suite de tests. Les tâches de codage sont évaluées via des taux de réussite cachés aux tests ; les tâches web combinent des vérifications de règles avec des évaluations de LLM/VLM et d’agents, nécessitant la livraison d’artefacts selon un chemin spécifié sans accès à Internet en direct ; les tâches de bureau utilisent des vérifications de règles déterministes pondérées entre 0,70 et 0,95, parallèlement à une évaluation LLM fondée sur des preuves ; et les tâches de sécurité s’appuient sur des scripts scoring.py déterministes exécutés trois fois pour le calcul de la moyenne, en excluant les grands modèles en tant que juges. Le sous-ensemble de sécurité met en œuvre cinq couches anti-tricherie : la désactivation de l’analyse littérale, le renommage des entrées, le masquage des tests altérés, l’encodage des dépendances et l’utilisation de tâches leurres à faible pondération. Il comprend 38 tâches de « red team » et 22 de « blue team », avec des audits en boîte blanche ancrés sur des CVE réels dans binutils, curl et nginx.

La création des tâches suit un pipeline standardisé : collecte des sources, réécriture sous forme de requêtes authentiques, assemblage de l’espace de travail, isolation des ressources d’évaluation après exécution et regroupement dans des répertoires indépendants. Les données utilisateur restent intactes tout au long du processus. Les tâches de codage attribuent cinq rôles distincts (développeur, ingénieur en algorithmes, chef de produit, assurance qualité, opérations), tandis que les tâches de sécurité attribuent des profils professionnels. Des informations délibérément incomplètes sont fournies — les fichiers cibles, les modèles et les limites ne sont pas divulgués —, ce qui oblige les agents à récupérer le contexte de manière autonome. Les éléments de notation ne sont révélés qu’après l’exécution, garantissant ainsi que les agents ne les rencontrent jamais pendant l’opération.

Les évaluations se déroulent dans des conteneurs isolés avec des environnements de modèle et de sandbox séparés. Le cadre utilise CodeBuddy Code (par défaut) et Claude Code, en recourant à des efforts de raisonnement accrus et à une fenêtre de contexte de 200 000 caractères, tout en désactivant WebSearch et AskUserQuestion. Cette restriction est essentielle : la désactivation de la recherche en ligne permet de vérifier si les mécanismes de résistance à la contamination fonctionnent comme prévu.

Le classement répertorie plusieurs familles de modèles (scores de 0 à 100, mode « thinking », trois moyennes). Claude Opus4.8 domine les premières places dans les catégories code, web, bureautique et sécurité, remportant cinq premières places ; GLM-5.2 arrive en tête dans deux catégories de sécurité, et GPT-5.5 occupe la première place en bureautique (cc). Le cadre fait preuve d’une grande sensibilité, en particulier en matière de sécurité, où les variations moyennes absolues de classement atteignent 8,6 points. Dans le cadre « cc », Claude Opus4.8 a rejeté 13 réponses, contre deux rejets pour GPT-5.5 dans le cadre « cbc ». En termes d’efficacité, GPT-5.5 génère le moins de tokens tout en conservant des scores compétitifs, tandis que DeepSeek-V4-Pro a exécuté 44 cycles de code avec un débit de tokens élevé, ce qui reflète une approche plus gourmande en ressources.

Article connexe
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 % ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 % ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028 La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028 Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Recommandations de sujets spéciaux liés
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
Éducation et apprentissage Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte
Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte

2026 Dernières Meilleures Plateformes de Création de Quiz par IA pour les Enseignants, Tuteurs et Programmes d’Apprentissage en Cohorte ! XIX.AI a sélectionné une liste hautement notée d’outils puissants et transformateurs, testés dans des situations réelles pour garantir des classements précis. Ces plateformes incontournables permettent d’améliorer l’efficacité rédactionnelle, de simplifier la création de contenu et de faciliter la conception de quiz dans tous les contextes d’apprentissage. Explorez dès maintenant pour découvrir l’outil idéal qui vous permettra de tirer parti de l’avantage offert par l’IA dans votre enseignement !

13 outils
xix.ai
commentaires (0)
0/500
OR