Option
Heim
Nachricht
Tencent stellt „WorkBuddy Bench“ vor: Eine Testumgebung für intelligente Programmieragenten, die Code, Web, Office und Sicherheit integriert

Tencent stellt „WorkBuddy Bench“ vor: Eine Testumgebung für intelligente Programmieragenten, die Code, Web, Office und Sicherheit integriert

28. August 2026
89

Bislang waren Programmieragenten auf enge Anwendungsbereiche beschränkt – wie beispielsweise die Fehlerbehebung auf SWE-bench oder Frontend-Aufgaben auf Design2Code –, während Produktions-Benchmarks für externe Überprüfungen weitgehend unzugänglich blieben. Tencent schließt diese Lücke mit „WorkBuddy Bench“, einer domänenübergreifenden Evaluierungssuite, die in einem kürzlich erschienenen arXiv-Artikel detailliert beschrieben wird. Ihr charakteristisches Merkmal ist nicht das Aufgabenvolumen, sondern eine Designarchitektur, die ausdrücklich darauf ausgelegt ist, das Auswendiglernen von Antworten zu verhindern.

Dieser Benchmark deckt vier Berufsfelder ab: Softwareentwicklung (Code auf Repository-Ebene), Frontend-Entwicklung (Web-Artefakte), Geschäftsabläufe (Office-Workflows mit mehreren Dateien) und Cybersicherheit (Red- und Blue-Team-Szenarien). Die Suite umfasst jeweils 80, 70, 50 und 60 Aufgaben, insgesamt also 260. Entscheidend ist, dass keine der Aufgaben aus öffentlichen Fragenbanken stammt; stattdessen werden sie anhand realer Code-Commits, Pull-Requests oder geschäftlicher Kontexte rückentwickelt und anschließend in prägnante, umgangssprachliche Rollenspiel-Aufgaben umformuliert. Dieser Ansatz stellt sicher, dass Online-Suchen nach entsprechenden Pull-Requests oder Hinweisen in Commits keine Ergebnisse liefern, wodurch das Auswendiglernen effektiv verhindert wird. Da der Datensatz vollständig offen ist – einschließlich Verzeichnissen, Umgebungsimages, Auswertungswerkzeugen, Testfällen und Referenzlösungen –, beruht seine Widerstandsfähigkeit gegen Verfälschungen auf dieser Konstruktionsmethode und der Versionskontrolle und nicht auf Undurchsichtigkeit.

image.png

Zwar weisen alle vier Teilmengen eine einheitliche Verzeichnisstruktur auf, doch verwendet jede von ihnen unterschiedliche Validierungsmetriken, wodurch direkte Punktvergleiche zwischen den Teilmengen ungültig werden. Folglich veröffentlicht Tencent keine aggregierte Suite-Punktzahl. Code-Aufgaben werden anhand verdeckter Testdurchlaufquoten bewertet; Web-Aufgaben kombinieren Regelprüfungen mit LLM-/VLM- und Agentenbewertungen, wobei die Bereitstellung von Artefakten entlang eines festgelegten Pfades ohne Live-Internetzugang erforderlich ist; Büroaufgaben nutzen deterministische Regelprüfungen mit einer Gewichtung von 0,70–0,95 neben einer evidenzbasierten LLM-Bewertung; und Sicherheitsaufgaben stützen sich auf deterministische „scoring.py“-Skripte, die dreimal zur Mittelwertbildung ausgeführt werden, wobei große Modelle als Bewerter ausgeschlossen werden. Die Sicherheitsuntergruppe implementiert fünf Ebenen zur Betrugsbekämpfung: Deaktivierung des Literal-Scannings, Umbenennung von Eingaben, Maskierung manipulierter Tests, Kodierung von Abhängigkeiten und Verwendung von „Bait“-Aufgaben mit geringer Gewichtung. Es umfasst 38 Red-Team- und 22 Blue-Team-Aufgaben sowie White-Box-Audits, die auf realen CVEs in binutils, curl und nginx basieren.

Die Erstellung der Aufgaben folgt einer standardisierten Pipeline: Quelldatenerfassung, Umschreiben in authentische Anfragen, Zusammenstellung des Arbeitsbereichs, Isolierung der Bewertungsressourcen nach der Ausführung und Verpackung in unabhängige Verzeichnisse. Benutzerdaten bleiben dabei durchgehend unberührt. Code-Aufgaben weisen fünf unterschiedliche Rollen zu (Entwickler, Algorithmus-Ingenieur, Produktmanager, Qualitätssicherung, Betrieb), während Sicherheitsaufgaben professionelle Rollenbilder zuweisen. Es werden bewusst unvollständige Informationen bereitgestellt – Zieldateien, Muster und Grenzen werden zurückgehalten –, wodurch die Agenten gezwungen sind, den Kontext selbstständig zu ermitteln. Die zur Bewertung dienenden Ressourcen werden erst nach der Ausführung offengelegt, wodurch sichergestellt wird, dass die Agenten während des Betriebs niemals darauf stoßen.

Die Bewertungen finden in isolierten Containern mit getrennten Modell- und Sandbox-Umgebungen statt. Das Framework nutzt CodeBuddy Code (Standard) und Claude Code, wobei verstärkte Schlussfolgerungsanstrengungen und ein Kontextfenster von 200.000 Zeichen zum Einsatz kommen, während WebSearch und AskUserQuestion deaktiviert sind. Diese Einschränkung ist entscheidend: Die Deaktivierung der Online-Suche überprüft, ob die Mechanismen zur Kontaminationsresistenz wie vorgesehen funktionieren.

Die Rangliste bewertet mehrere Modellfamilien (Punktzahlen 0–100, Thinking-Modus, drei Durchschnittswerte). Claude Opus 4.8 dominiert die Spitzenplätze in den Bereichen Code, Web, Office und Sicherheit und sichert sich fünf erste Plätze; GLM-5.2 führt in zwei Sicherheitskategorien, und GPT-5.5 liegt bei Office cc an der Spitze. Das Framework weist eine hohe Sensitivität auf, insbesondere im Bereich Sicherheit, wo die durchschnittlichen absoluten Rangänderungen 8,6 Punkte erreichen. Im cc-Framework lehnte Claude Opus4.8 13 Antworten ab, verglichen mit zwei Ablehnungen von GPT-5.5 im cbc-Framework. Was die Effizienz betrifft, generiert GPT-5.5 die wenigsten Token bei gleichzeitig wettbewerbsfähigen Ergebnissen, während DeepSeek-V4-Pro 44 Code-Runden mit hohem Token-Durchsatz absolvierte, was auf einen ressourcenintensiveren Ansatz hindeutet.

Verwandter Artikel
So beheben Sie Core Web Vitals für bessere SEO-Rankings So beheben Sie Core Web Vitals für bessere SEO-Rankings Wie man eine kostenlose Website erstellt: Kostenlose Domain, Hosting & KI-Website-BuilderInhaltsverzeichnisEinleitungKI-Website-Builder 1: Hookous AISchritt 1: AnmeldungSchritt 2: Geschäftstyp/Nische auswählenSchritt 3: Dienste auswählenSchritt 4: We
Apple und Google gehen eine Partnerschaft mit Anthropic ein, um eine 27 Jahre alte Sicherheitslücke mithilfe des „Glass Wing Protection“-Konzepts zu beheben Apple und Google gehen eine Partnerschaft mit Anthropic ein, um eine 27 Jahre alte Sicherheitslücke mithilfe des „Glass Wing Protection“-Konzepts zu beheben Da künstliche Intelligenz bei der Codegenerierung und beim logischen Schlussfolgern rasante Fortschritte macht, steht die Cybersicherheitslandschaft vor beispiellosen Herausforderungen. Vor kurzem hat
OpenAI-Chefwissenschaftler zur Debatte über die Transparenz der KI-Reasoning: Komplexität stabil, kein plötzlicher Sprung OpenAI-Chefwissenschaftler zur Debatte über die Transparenz der KI-Reasoning: Komplexität stabil, kein plötzlicher Sprung Am 2. September wandte sich Jakub Pachocki, Chief Scientist bei OpenAI, in einem Beitrag auf X an die öffentlichen Bedenken bezüglich des KI-Modells Astra und widerlegte die Behauptung, es arbeite ohne Aufsicht und verfüge über keine transparente Beg
Empfehlungen zu verwandten Spezialthemen
Bildbearbeitung KI-Tools zum Entfernen von Objekten: Porträts, Reise- und Produktfotos aufräumen
KI-Tools zum Entfernen von Objekten: Porträts, Reise- und Produktfotos aufräumen

Die besten und am besten bewerteten KI-Tools zum Entfernen von Objekten aus Porträts, Reisefotos und Produktfotos im Jahr 2026! XIX.AI stellt eine leistungsstarke, bahnbrechende Auswahl zusammen, die regelmäßig mit wöchentlichen Rankings aktualisiert wird. Diese Tools wurden in der Praxis getestet und helfen Ihnen dabei, unerwünschte Elemente schnell zu entfernen, die Qualität Ihrer Inhalte zu steigern und viel Zeit zu sparen, ohne dabei Abstriche bei den Ergebnissen zu machen. Ein Muss für alle, die ihr kreatives Potenzial mit KI voll ausschöpfen möchten. Jetzt entdecken!

10 Tools
xix.ai
Text-zu-Sprache Die besten KI-Tools zur Text-zu-Sprache-Umwandlung für Online-Kurse
Die besten KI-Tools zur Text-zu-Sprache-Umwandlung für Online-Kurse

Die besten und am besten bewerteten KI-Text-to-Speech-Tools für Online-Kurse des Jahres 2026 wurden von XIX.AI auf der Grundlage strenger Praxistests und wöchentlich aktualisierter Rankings zusammengestellt. Diese leistungsstarken Tools helfen Kursanbietern dabei, mühelos kristallklare Audioinhalte zu erstellen, die Effizienz beim Verfassen von Texten zu steigern und die Kursproduktion zu optimieren. Sehen Sie sich den Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten an, um das für Sie passende Tool zu finden. Entdecken Sie jetzt, wie Sie sich im Bereich der Online-Bildung einen KI-Vorteil verschaffen können.

10 Tools
xix.ai
Schreiben AI-Blogtitel-Tools für höhere Klickraten
AI-Blogtitel-Tools für höhere Klickraten

2026 Neueste Beste Top-Bewertete KI-Blogtitel-Tools für höhere Klickraten! XIX.AI hat sorgfältig eine leistungsstarke, spielfreudige Sammlung der besten Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden einen kostenlosen vs. kostenpflichtigen Vergleich, wöchentlich aktualisierte Rankings und detaillierte Einblicke, die Ihnen helfen, den Traffic Ihres Blogs effizient zu steigern. Besonders empfehlenswerte Optionen sind hervorgehoben, um Ihnen zu helfen, Ihren KI-Vorteil zu entfalten. Entdecken Sie jetzt!

10 Tools
xix.ai
Automatisierung Die besten KI-Tools zur Aufgabenverteilung für Support-Workflows
Die besten KI-Tools zur Aufgabenverteilung für Support-Workflows

Die besten und am besten bewerteten KI-Tools für die Aufgabenverteilung in Support-Workflows – Stand 2026! XIX.AI hat eine äußerst leistungsstarke und bahnbrechende Auswahl an Lösungen zusammengestellt, die Sie unbedingt ausprobieren sollten. Alle wurden strengen Praxistests unterzogen und werden wöchentlich aktualisiert. Diese Tools optimieren Arbeitsabläufe, steigern die Produktivität und helfen Teams dabei, einen schnelleren und effizienteren Support zu bieten. Entdecken Sie jetzt das perfekte Tool für Sie und nutzen Sie Ihren KI-Vorteil!

17 Tools
xix.ai
Akademische Forschung KI-Tools für Literaturangaben und Zusammenfassungen von Fachartikeln
KI-Tools für Literaturangaben und Zusammenfassungen von Fachartikeln

Die besten und am besten bewerteten KI-Tools für Zitate und Zusammenfassungen wissenschaftlicher Artikel im Jahr 2026 – zusammengestellt von XIX.AI. Holen Sie sich leistungsstarke, bahnbrechende Lösungen für die schnelle Erstellung von Inhalten, mehr Effizienz beim Schreiben und eine Steigerung Ihrer Produktivität. Wir bieten einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, damit Sie das Tool finden, das perfekt zu Ihren Anforderungen passt und das Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

10 Tools
xix.ai
Produktivität Die besten KI-basierten Produktivitätswerkzeuge für die tägliche Arbeit
Die besten KI-basierten Produktivitätswerkzeuge für die tägliche Arbeit

2026 – Die neuesten, besten und am höchsten bewerteten AI-Produktivitätswerkzeuge für die tägliche Arbeit! XIX.AI hat auf der Grundlage strenger, wöchentlich aktualisierter Ranglisten sowie praktischer Tests eine leistungsstarke Auswahl zusammengestellt, die wirklich etwas verändert. Hier finden Sie Tools, die unbedingt ausprobiert werden sollten, um die Schreibeffizienz zu steigern, die Erstellung von Inhalten zu vereinfachen und Ihnen dabei zu helfen, die Herausforderungen der täglichen Arbeit zu meistern. Holen Sie sich einen kostenlosen Vergleich zwischen kostenloser und kostenpflichtiger Variante, um das perfekte Werkzeug für Ihre Bedürfnisse zu finden. Entdecken Sie es jetzt und sichern Sie sich einen Wettbewerbsvorteil durch KI!

9 Tools
xix.ai
Kommentare (0)
0/500
OR