opción
Hogar
Noticias
Tencent presenta WorkBuddy Bench: un entorno de pruebas para agentes inteligentes de programación integrado con Code, Web, Office y Seguridad

Tencent presenta WorkBuddy Bench: un entorno de pruebas para agentes inteligentes de programación integrado con Code, Web, Office y Seguridad

28 de agosto de 2026
93

Históricamente, los agentes de programación se han limitado a ámbitos muy concretos —como la corrección de errores en SWE-bench o las tareas de front-end en Design2Code—, mientras que las pruebas de rendimiento en entorno de producción siguen siendo, en gran medida, inaccesibles para la revisión externa. Tencent aborda esta carencia con WorkBuddy Bench, un conjunto de pruebas de evaluación multidominio que se detalla en un artículo reciente publicado en arXiv. Su característica definitoria no es el volumen de tareas, sino una arquitectura de diseño concebida expresamente para impedir la memorización de respuestas.

Esta prueba de rendimiento abarca cuatro ámbitos profesionales: ingeniería de software (código a nivel de repositorio), desarrollo front-end (artefactos web), operaciones empresariales (flujos de trabajo de oficina con múltiples archivos) y ciberseguridad (escenarios de equipos rojo y azul). El conjunto comprende 80, 70, 50 y 60 tareas respectivamente, lo que suma un total de 260. Es fundamental destacar que ninguna de las tareas procede de bancos de preguntas públicos; en su lugar, se han obtenido mediante ingeniería inversa a partir de commits de código reales, pull requests o contextos empresariales, y posteriormente se han reformulado en indicaciones concisas, coloquiales y basadas en juegos de rol. Este enfoque garantiza que las búsquedas en línea de las solicitudes de incorporación de cambios (PR) correspondientes o de pistas en las confirmaciones no arrojen resultados, lo que impide de forma efectiva la memorización. Dado que el conjunto de datos es totalmente abierto —incluidos los directorios, las imágenes de entorno, las herramientas de evaluación, los casos de prueba y las soluciones de referencia—, su resistencia a la contaminación se basa en este método de construcción y en el control de versiones, más que en la opacidad.

image.png

Aunque los cuatro subconjuntos comparten una estructura de directorios unificada, cada uno emplea métricas de validación distintas, lo que hace que las comparaciones directas de puntuaciones entre subconjuntos no sean válidas. En consecuencia, Tencent no publica una puntuación global del conjunto de pruebas. Las tareas de código se evalúan mediante tasas de superación de pruebas ocultas; las tareas web combinan comprobaciones de reglas con evaluaciones de LLM/VLM y de agentes, lo que requiere la entrega de artefactos a lo largo de una ruta especificada sin acceso a Internet en tiempo real; las tareas de oficina utilizan comprobaciones de reglas determinísticas ponderadas entre 0,70 y 0,95, junto con una evaluación de LLM basada en pruebas; y las tareas de seguridad se basan en scripts «scoring.py» determinísticos que se ejecutan tres veces para calcular la media, excluyendo los modelos grandes como evaluadores. El subconjunto de seguridad implementa cinco capas contra las trampas: desactivación del escaneo literal, renombramiento de entradas, enmascaramiento de pruebas manipuladas, codificación de dependencias y uso de tareas «cebo» de baja ponderación. Incluye 38 tareas de equipo rojo y 22 de equipo azul, con auditorías de caja abierta basadas en CVE del mundo real en binutils, curl y nginx.

La creación de tareas sigue un proceso estandarizado: recopilación de fuentes, reescritura en forma de peticiones auténticas, montaje del espacio de trabajo, aislamiento de los activos de evaluación tras la ejecución y empaquetado en directorios independientes. Los datos de los usuarios permanecen intactos en todo momento. Las tareas de código asignan cinco roles distintos (desarrollador, ingeniero de algoritmos, gestor de producto, control de calidad y operaciones), mientras que las tareas de seguridad asignan perfiles profesionales. Se proporciona información deliberadamente incompleta —se ocultan los archivos de destino, los patrones y los límites—, lo que obliga a los agentes a obtener el contexto de forma independiente. Los activos de puntuación solo se revelan tras la ejecución, lo que garantiza que los agentes nunca se encuentren con ellos durante la operación.

Las evaluaciones se llevan a cabo en contenedores aislados con entornos de modelo y sandbox separados. El marco utiliza CodeBuddy Code (por defecto) y Claude Code, empleando mayores esfuerzos de razonamiento y una ventana de contexto de 200 000, al tiempo que desactiva WebSearch y AskUserQuestion. Esta restricción es fundamental: desactivar la búsqueda en línea verifica si los mecanismos de resistencia a la contaminación funcionan según lo previsto.

La tabla de clasificación ordena varias familias de modelos (puntuaciones de 0 a 100, modo de razonamiento, tres medias). Claude Opus4.8 domina las primeras posiciones en las categorías de código, web, oficina y seguridad, consiguiendo cinco primeros puestos; GLM-5.2 lidera dos categorías de seguridad, y GPT-5.5 encabeza la categoría de oficina cc. El marco demuestra una alta sensibilidad, especialmente en seguridad, donde los cambios medios absolutos en la clasificación alcanzan los 8,6 puntos. En el marco «cc», Claude Opus4.8 rechazó 13 respuestas, frente a los dos rechazos de GPT-5.5 en el marco «cbc». En cuanto a la eficiencia, GPT-5.5 genera el menor número de tokens al tiempo que mantiene puntuaciones competitivas, mientras que DeepSeek-V4-Pro ejecutó 44 rondas de código con un alto rendimiento de tokens, lo que refleja un enfoque que consume más recursos.

Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
Inmediato Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT
Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT

Las mejores bibliotecas de prompts de IA de 2026, con las más valoradas, para optimizar todo tipo de flujos de trabajo de ChatGPT. XIX.AI ha seleccionado una colección potente y revolucionaria que se somete a rigurosas pruebas en condiciones reales para garantizar el máximo rendimiento. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones de expertos, que te ayudarán a elegir las herramientas imprescindibles para potenciar tu productividad y sacar el máximo partido a la IA. ¡Explora ahora!

11 herramientas
xix.ai
comentario (0)
0/500
OR