Hogar
Tencent presenta WorkBuddy Bench: un entorno de pruebas para agentes inteligentes de programación integrado con Code, Web, Office y Seguridad
Históricamente, los agentes de programación se han limitado a ámbitos muy concretos —como la corrección de errores en SWE-bench o las tareas de front-end en Design2Code—, mientras que las pruebas de rendimiento en entorno de producción siguen siendo, en gran medida, inaccesibles para la revisión externa. Tencent aborda esta carencia con WorkBuddy Bench, un conjunto de pruebas de evaluación multidominio que se detalla en un artículo reciente publicado en arXiv. Su característica definitoria no es el volumen de tareas, sino una arquitectura de diseño concebida expresamente para impedir la memorización de respuestas.
Esta prueba de rendimiento abarca cuatro ámbitos profesionales: ingeniería de software (código a nivel de repositorio), desarrollo front-end (artefactos web), operaciones empresariales (flujos de trabajo de oficina con múltiples archivos) y ciberseguridad (escenarios de equipos rojo y azul). El conjunto comprende 80, 70, 50 y 60 tareas respectivamente, lo que suma un total de 260. Es fundamental destacar que ninguna de las tareas procede de bancos de preguntas públicos; en su lugar, se han obtenido mediante ingeniería inversa a partir de commits de código reales, pull requests o contextos empresariales, y posteriormente se han reformulado en indicaciones concisas, coloquiales y basadas en juegos de rol. Este enfoque garantiza que las búsquedas en línea de las solicitudes de incorporación de cambios (PR) correspondientes o de pistas en las confirmaciones no arrojen resultados, lo que impide de forma efectiva la memorización. Dado que el conjunto de datos es totalmente abierto —incluidos los directorios, las imágenes de entorno, las herramientas de evaluación, los casos de prueba y las soluciones de referencia—, su resistencia a la contaminación se basa en este método de construcción y en el control de versiones, más que en la opacidad.

Aunque los cuatro subconjuntos comparten una estructura de directorios unificada, cada uno emplea métricas de validación distintas, lo que hace que las comparaciones directas de puntuaciones entre subconjuntos no sean válidas. En consecuencia, Tencent no publica una puntuación global del conjunto de pruebas. Las tareas de código se evalúan mediante tasas de superación de pruebas ocultas; las tareas web combinan comprobaciones de reglas con evaluaciones de LLM/VLM y de agentes, lo que requiere la entrega de artefactos a lo largo de una ruta especificada sin acceso a Internet en tiempo real; las tareas de oficina utilizan comprobaciones de reglas determinísticas ponderadas entre 0,70 y 0,95, junto con una evaluación de LLM basada en pruebas; y las tareas de seguridad se basan en scripts «scoring.py» determinísticos que se ejecutan tres veces para calcular la media, excluyendo los modelos grandes como evaluadores. El subconjunto de seguridad implementa cinco capas contra las trampas: desactivación del escaneo literal, renombramiento de entradas, enmascaramiento de pruebas manipuladas, codificación de dependencias y uso de tareas «cebo» de baja ponderación. Incluye 38 tareas de equipo rojo y 22 de equipo azul, con auditorías de caja abierta basadas en CVE del mundo real en binutils, curl y nginx.
La creación de tareas sigue un proceso estandarizado: recopilación de fuentes, reescritura en forma de peticiones auténticas, montaje del espacio de trabajo, aislamiento de los activos de evaluación tras la ejecución y empaquetado en directorios independientes. Los datos de los usuarios permanecen intactos en todo momento. Las tareas de código asignan cinco roles distintos (desarrollador, ingeniero de algoritmos, gestor de producto, control de calidad y operaciones), mientras que las tareas de seguridad asignan perfiles profesionales. Se proporciona información deliberadamente incompleta —se ocultan los archivos de destino, los patrones y los límites—, lo que obliga a los agentes a obtener el contexto de forma independiente. Los activos de puntuación solo se revelan tras la ejecución, lo que garantiza que los agentes nunca se encuentren con ellos durante la operación.
Las evaluaciones se llevan a cabo en contenedores aislados con entornos de modelo y sandbox separados. El marco utiliza CodeBuddy Code (por defecto) y Claude Code, empleando mayores esfuerzos de razonamiento y una ventana de contexto de 200 000, al tiempo que desactiva WebSearch y AskUserQuestion. Esta restricción es fundamental: desactivar la búsqueda en línea verifica si los mecanismos de resistencia a la contaminación funcionan según lo previsto.
La tabla de clasificación ordena varias familias de modelos (puntuaciones de 0 a 100, modo de razonamiento, tres medias). Claude Opus4.8 domina las primeras posiciones en las categorías de código, web, oficina y seguridad, consiguiendo cinco primeros puestos; GLM-5.2 lidera dos categorías de seguridad, y GPT-5.5 encabeza la categoría de oficina cc. El marco demuestra una alta sensibilidad, especialmente en seguridad, donde los cambios medios absolutos en la clasificación alcanzan los 8,6 puntos. En el marco «cc», Claude Opus4.8 rechazó 13 respuestas, frente a los dos rechazos de GPT-5.5 en el marco «cbc». En cuanto a la eficiencia, GPT-5.5 genera el menor número de tokens al tiempo que mantiene puntuaciones competitivas, mientras que DeepSeek-V4-Pro ejecutó 44 rondas de código con un alto rendimiento de tokens, lo que refleja un enfoque que consume más recursos.
Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Históricamente, los agentes de programación se han limitado a ámbitos muy concretos —como la corrección de errores en SWE-bench o las tareas de front-end en Design2Code—, mientras que las pruebas de rendimiento en entorno de producción siguen siendo, en gran medida, inaccesibles para la revisión externa. Tencent aborda esta carencia con WorkBuddy Bench, un conjunto de pruebas de evaluación multidominio que se detalla en un artículo reciente publicado en arXiv. Su característica definitoria no es el volumen de tareas, sino una arquitectura de diseño concebida expresamente para impedir la memorización de respuestas.
Esta prueba de rendimiento abarca cuatro ámbitos profesionales: ingeniería de software (código a nivel de repositorio), desarrollo front-end (artefactos web), operaciones empresariales (flujos de trabajo de oficina con múltiples archivos) y ciberseguridad (escenarios de equipos rojo y azul). El conjunto comprende 80, 70, 50 y 60 tareas respectivamente, lo que suma un total de 260. Es fundamental destacar que ninguna de las tareas procede de bancos de preguntas públicos; en su lugar, se han obtenido mediante ingeniería inversa a partir de commits de código reales, pull requests o contextos empresariales, y posteriormente se han reformulado en indicaciones concisas, coloquiales y basadas en juegos de rol. Este enfoque garantiza que las búsquedas en línea de las solicitudes de incorporación de cambios (PR) correspondientes o de pistas en las confirmaciones no arrojen resultados, lo que impide de forma efectiva la memorización. Dado que el conjunto de datos es totalmente abierto —incluidos los directorios, las imágenes de entorno, las herramientas de evaluación, los casos de prueba y las soluciones de referencia—, su resistencia a la contaminación se basa en este método de construcción y en el control de versiones, más que en la opacidad.

Aunque los cuatro subconjuntos comparten una estructura de directorios unificada, cada uno emplea métricas de validación distintas, lo que hace que las comparaciones directas de puntuaciones entre subconjuntos no sean válidas. En consecuencia, Tencent no publica una puntuación global del conjunto de pruebas. Las tareas de código se evalúan mediante tasas de superación de pruebas ocultas; las tareas web combinan comprobaciones de reglas con evaluaciones de LLM/VLM y de agentes, lo que requiere la entrega de artefactos a lo largo de una ruta especificada sin acceso a Internet en tiempo real; las tareas de oficina utilizan comprobaciones de reglas determinísticas ponderadas entre 0,70 y 0,95, junto con una evaluación de LLM basada en pruebas; y las tareas de seguridad se basan en scripts «scoring.py» determinísticos que se ejecutan tres veces para calcular la media, excluyendo los modelos grandes como evaluadores. El subconjunto de seguridad implementa cinco capas contra las trampas: desactivación del escaneo literal, renombramiento de entradas, enmascaramiento de pruebas manipuladas, codificación de dependencias y uso de tareas «cebo» de baja ponderación. Incluye 38 tareas de equipo rojo y 22 de equipo azul, con auditorías de caja abierta basadas en CVE del mundo real en binutils, curl y nginx.
La creación de tareas sigue un proceso estandarizado: recopilación de fuentes, reescritura en forma de peticiones auténticas, montaje del espacio de trabajo, aislamiento de los activos de evaluación tras la ejecución y empaquetado en directorios independientes. Los datos de los usuarios permanecen intactos en todo momento. Las tareas de código asignan cinco roles distintos (desarrollador, ingeniero de algoritmos, gestor de producto, control de calidad y operaciones), mientras que las tareas de seguridad asignan perfiles profesionales. Se proporciona información deliberadamente incompleta —se ocultan los archivos de destino, los patrones y los límites—, lo que obliga a los agentes a obtener el contexto de forma independiente. Los activos de puntuación solo se revelan tras la ejecución, lo que garantiza que los agentes nunca se encuentren con ellos durante la operación.
Las evaluaciones se llevan a cabo en contenedores aislados con entornos de modelo y sandbox separados. El marco utiliza CodeBuddy Code (por defecto) y Claude Code, empleando mayores esfuerzos de razonamiento y una ventana de contexto de 200 000, al tiempo que desactiva WebSearch y AskUserQuestion. Esta restricción es fundamental: desactivar la búsqueda en línea verifica si los mecanismos de resistencia a la contaminación funcionan según lo previsto.
La tabla de clasificación ordena varias familias de modelos (puntuaciones de 0 a 100, modo de razonamiento, tres medias). Claude Opus4.8 domina las primeras posiciones en las categorías de código, web, oficina y seguridad, consiguiendo cinco primeros puestos; GLM-5.2 lidera dos categorías de seguridad, y GPT-5.5 encabeza la categoría de oficina cc. El marco demuestra una alta sensibilidad, especialmente en seguridad, donde los cambios medios absolutos en la clasificación alcanzan los 8,6 puntos. En el marco «cc», Claude Opus4.8 rechazó 13 respuestas, frente a los dos rechazos de GPT-5.5 en el marco «cbc». En cuanto a la eficiencia, GPT-5.5 genera el menor número de tokens al tiempo que mantiene puntuaciones competitivas, mientras que DeepSeek-V4-Pro ejecutó 44 rondas de código con un alto rendimiento de tokens, lo que refleja un enfoque que consume más recursos.
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t











