Дом
Tencent представляет WorkBuddy Bench: платформу для тестирования интеллектуальных агентов-программистов, интегрированную с средами Code, Web, Office и Security
Исторически сложилось так, что тестировщики кода ограничивались узкими областями — такими как исправление ошибок на SWE-bench или выполнение задач по фронтенду на Design2Code, — в то время как тесты на производственной среде по-прежнему в значительной степени недоступны для внешней оценки. Компания Tencent устраняет этот пробел с помощью WorkBuddy Bench — многодоменного набора тестов, подробно описанного в недавней статье, опубликованной на arXiv. Его отличительной чертой является не объем задач, а архитектура, специально разработанная для предотвращения запоминания ответов.
Этот набор тестов охватывает четыре профессиональные области: разработку программного обеспечения (код на уровне репозитория), фронтенд-разработку (веб-артефакты), бизнес-операции (офисные рабочие процессы с несколькими файлами) и кибербезопасность (сценарии «красной» и «синей» команд). Набор состоит из 80, 70, 50 и 60 задач соответственно, что в сумме составляет 260 задач. Важно отметить, что ни одна из задач не взята из общедоступных банков вопросов; вместо этого они были получены путем обратной инженерии из реальных коммитов кода, пулл-реквестов или бизнес-контекстов, а затем переформулированы в лаконичные, разговорные подсказки в формате ролевых игр. Такой подход гарантирует, что поиск в Интернете соответствующих пул-реквестов или подсказок в коммитах не даст результатов, что эффективно препятствует зазубриванию. Поскольку набор данных полностью открыт — включая каталоги, образы среды, инструменты оценки, тестовые случаи и эталонные решения — его устойчивость к «загрязнению» основана на этом методе построения и системе контроля версий, а не на засекреченности.

Хотя все четыре поднабора имеют единую структуру каталогов, в каждом из них используются отдельные метрики валидации, что делает недействительным прямое сравнение результатов между поднаборами. Следовательно, Tencent не публикует совокупный балл набора задач. Задачи по программированию оцениваются по скрытым показателям успешного прохождения тестов; веб-задачи сочетают проверку правил с оценками LLM/VLM и агентов, требуя доставки артефактов по заданному пути без доступа к действующему интернету; офисные задачи используют детерминированные проверки правил с весом 0,70–0,95 наряду с оценкой LLM на основе доказательств; а задачи по безопасности опираются на детерминированные скрипты scoring.py, запускаемые три раза для усреднения, при этом крупные модели исключаются из числа судей. Поднабор задач по безопасности реализует пять уровней защиты от мошенничества: отключение сканирования литеров, переименование входных данных, маскировка подделанных тестов, кодирование зависимостей и использование задач-приманок с низким весом. Она включает 38 задач «красной команды» и 22 задачи «синей команды», а также аудиты по методу «белого ящика», привязанные к реальным уязвимостям (CVE) в binutils, curl и nginx.
Создание задач происходит по стандартизированному процессу: сбор исходного кода, переработка в аутентичные запросы, сборка рабочей среды, изоляция ресурсов оценки после выполнения и упаковка в независимые каталоги. Пользовательские данные остаются неизменными на протяжении всего процесса. В задачах по программированию назначаются пять различных ролей (разработчик, инженер по алгоритмам, менеджер по продукту, специалист по контролю качества, специалист по эксплуатации), а в задачах по безопасности — профессиональные роли. Предоставляется намеренно неполная информация — целевые файлы, шаблоны и границы не раскрываются, — что вынуждает агентов самостоятельно извлекать контекст. Ресурсы для оценки раскрываются только после выполнения, что гарантирует, что агенты никогда не столкнутся с ними во время работы.
Оценка проводится в изолированных контейнерах с разделенными средами модели и песочницы. Фреймворк использует CodeBuddy Code (по умолчанию) и Claude Code, применяя усиленные алгоритмы рассуждений и окно контекста размером 200 тыс., при этом отключая WebSearch и AskUserQuestion. Это ограничение имеет решающее значение: отключение онлайн-поиска позволяет проверить, работают ли механизмы защиты от загрязнения так, как задумано.
В таблице лидеров ранжируются несколько семейств моделей (оценки 0–100, режим мышления, три средних значения). Claude Opus4.8 занимает лидирующие позиции в категориях «код», «веб», «офис» и «безопасность», обеспечив себе пять первых мест; GLM-5.2 лидирует в двух категориях безопасности, а GPT-5.5 возглавляет категорию «офис» в режиме cc. Данная методология демонстрирует высокую чувствительность, особенно в области безопасности, где среднее изменение абсолютного рейтинга достигает 8,6 балла. В рамках методологии cc Claude Opus4.8 отклонил 13 ответов, в то время как GPT-5.5 отклонил только два ответа в рамках методологии cbc. Что касается эффективности, GPT-5.5 генерирует наименьшее количество токенов, сохраняя при этом конкурентоспособные результаты, тогда как DeepSeek-V4-Pro выполнил 44 раунда кодирования с высокой пропускной способностью по токенам, что свидетельствует о более ресурсоемком подходе.
Связанная статья
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Рекомендации по связанным специальным темам
Комментарии (0)
Исторически сложилось так, что тестировщики кода ограничивались узкими областями — такими как исправление ошибок на SWE-bench или выполнение задач по фронтенду на Design2Code, — в то время как тесты на производственной среде по-прежнему в значительной степени недоступны для внешней оценки. Компания Tencent устраняет этот пробел с помощью WorkBuddy Bench — многодоменного набора тестов, подробно описанного в недавней статье, опубликованной на arXiv. Его отличительной чертой является не объем задач, а архитектура, специально разработанная для предотвращения запоминания ответов.
Этот набор тестов охватывает четыре профессиональные области: разработку программного обеспечения (код на уровне репозитория), фронтенд-разработку (веб-артефакты), бизнес-операции (офисные рабочие процессы с несколькими файлами) и кибербезопасность (сценарии «красной» и «синей» команд). Набор состоит из 80, 70, 50 и 60 задач соответственно, что в сумме составляет 260 задач. Важно отметить, что ни одна из задач не взята из общедоступных банков вопросов; вместо этого они были получены путем обратной инженерии из реальных коммитов кода, пулл-реквестов или бизнес-контекстов, а затем переформулированы в лаконичные, разговорные подсказки в формате ролевых игр. Такой подход гарантирует, что поиск в Интернете соответствующих пул-реквестов или подсказок в коммитах не даст результатов, что эффективно препятствует зазубриванию. Поскольку набор данных полностью открыт — включая каталоги, образы среды, инструменты оценки, тестовые случаи и эталонные решения — его устойчивость к «загрязнению» основана на этом методе построения и системе контроля версий, а не на засекреченности.

Хотя все четыре поднабора имеют единую структуру каталогов, в каждом из них используются отдельные метрики валидации, что делает недействительным прямое сравнение результатов между поднаборами. Следовательно, Tencent не публикует совокупный балл набора задач. Задачи по программированию оцениваются по скрытым показателям успешного прохождения тестов; веб-задачи сочетают проверку правил с оценками LLM/VLM и агентов, требуя доставки артефактов по заданному пути без доступа к действующему интернету; офисные задачи используют детерминированные проверки правил с весом 0,70–0,95 наряду с оценкой LLM на основе доказательств; а задачи по безопасности опираются на детерминированные скрипты scoring.py, запускаемые три раза для усреднения, при этом крупные модели исключаются из числа судей. Поднабор задач по безопасности реализует пять уровней защиты от мошенничества: отключение сканирования литеров, переименование входных данных, маскировка подделанных тестов, кодирование зависимостей и использование задач-приманок с низким весом. Она включает 38 задач «красной команды» и 22 задачи «синей команды», а также аудиты по методу «белого ящика», привязанные к реальным уязвимостям (CVE) в binutils, curl и nginx.
Создание задач происходит по стандартизированному процессу: сбор исходного кода, переработка в аутентичные запросы, сборка рабочей среды, изоляция ресурсов оценки после выполнения и упаковка в независимые каталоги. Пользовательские данные остаются неизменными на протяжении всего процесса. В задачах по программированию назначаются пять различных ролей (разработчик, инженер по алгоритмам, менеджер по продукту, специалист по контролю качества, специалист по эксплуатации), а в задачах по безопасности — профессиональные роли. Предоставляется намеренно неполная информация — целевые файлы, шаблоны и границы не раскрываются, — что вынуждает агентов самостоятельно извлекать контекст. Ресурсы для оценки раскрываются только после выполнения, что гарантирует, что агенты никогда не столкнутся с ними во время работы.
Оценка проводится в изолированных контейнерах с разделенными средами модели и песочницы. Фреймворк использует CodeBuddy Code (по умолчанию) и Claude Code, применяя усиленные алгоритмы рассуждений и окно контекста размером 200 тыс., при этом отключая WebSearch и AskUserQuestion. Это ограничение имеет решающее значение: отключение онлайн-поиска позволяет проверить, работают ли механизмы защиты от загрязнения так, как задумано.
В таблице лидеров ранжируются несколько семейств моделей (оценки 0–100, режим мышления, три средних значения). Claude Opus4.8 занимает лидирующие позиции в категориях «код», «веб», «офис» и «безопасность», обеспечив себе пять первых мест; GLM-5.2 лидирует в двух категориях безопасности, а GPT-5.5 возглавляет категорию «офис» в режиме cc. Данная методология демонстрирует высокую чувствительность, особенно в области безопасности, где среднее изменение абсолютного рейтинга достигает 8,6 балла. В рамках методологии cc Claude Opus4.8 отклонил 13 ответов, в то время как GPT-5.5 отклонил только два ответа в рамках методологии cbc. Что касается эффективности, GPT-5.5 генерирует наименьшее количество токенов, сохраняя при этом конкурентоспособные результаты, тогда как DeepSeek-V4-Pro выполнил 44 раунда кодирования с высокой пропускной способностью по токенам, что свидетельствует о более ресурсоемком подходе.
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны











