Option
Heim
Nachricht
Studie zeigt: Die Leistungsfähigkeit von KI-Code wird in Praxistests überbewertet

Studie zeigt: Die Leistungsfähigkeit von KI-Code wird in Praxistests überbewertet

9. Mai 2026
207

Untersuchungen des METR-Instituts deuten darauf hin, dass der weit verbreitete Benchmark „SWE-bench Verified“ zur Bewertung der Programmierfähigkeiten von KI die Leistung von KI-Agenten in der realen Softwareentwicklung möglicherweise erheblich überbewertet. Die Studie ergab, dass etwa die Hälfte der von der KI generierten Code-Lösungen, die vom Benchmark als „bestanden“ eingestuft wurden, von den tatsächlichen Projektverantwortlichen bei der Code-Überprüfung wahrscheinlich abgelehnt würden, was eine erhebliche Diskrepanz zwischen automatisierten Bewertungsergebnissen und der tatsächlichen Code-Qualität verdeutlicht.

SWE-bench Verified gilt seit langem als wichtiger Standard zur Bewertung KI-gestützter Softwareentwicklung, um zu testen, ob Modelle echte Programmieraufgaben in Open-Source-Projekten lösen können, und um zu überprüfen, ob Codeänderungen die automatisierte Testsuite des Projekts bestehen. Mehrere KI-Unternehmen, darunter Anthropic und OpenAI, zitieren häufig Ergebnisse dieses Benchmarks, um Modellfortschritte zu demonstrieren.

QQ20260312-093454.jpg

In dieser Studie beauftragte das METR-Team vier erfahrene Entwickler, die die Open-Source-Projekte scikit-learn, Sphinx und pytest betreuen, mit der manuellen Überprüfung von 296 AI-generierten Code-Beispielen. Diese Code-Beispiele wurden von fünf verschiedenen Modellen erzeugt: Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet und GPT-5. Die Ergebnisse zeigten, dass die tatsächliche Akzeptanzrate durch die Betreuer im Durchschnitt etwa 24 Prozentpunkte niedriger war als die automatisierten Bewertungen von SWE-bench – ein statistisch signifikanter Unterschied.

Die Studie stellte zudem fest, dass der abgelehnte KI-Code nicht in erster Linie auf stilistische Probleme zurückzuführen war, sondern vielmehr auf wesentlich schwerwiegendere technische Mängel. Die Betreuer kategorisierten die Probleme in drei Haupttypen: Codequalität, die nicht den Projektspezifikationen entsprach, Störung der bestehenden Codestruktur und grundlegende Funktionsfehler. Ein erheblicher Teil der Fälle betraf Funktionsfehler, bei denen der Code trotz bestandener automatisierter Tests das beabsichtigte Problem nicht korrekt löste.

Was den Modellvergleich betrifft, so ergab die Untersuchung, dass ein Upgrade von Claude 3.5 Sonnet auf Claude 3.7 Sonnet die Benchmark-Erfolgsquote deutlich verbesserte, die Anzahl der von den Betreuern gemeldeten Funktionsfehler jedoch ebenfalls zunahm. Der Übergang von Claude 3.7 Sonnet zu Claude 4 Opus führte zu einer Zunahme von Problemen mit der Codequalität, während Claude 4.5 Sonnet Verbesserungen in der Codequalität zeigte. Im Gegensatz dazu schnitt GPT-5 bei dieser manuellen Bewertung insgesamt deutlich schlechter ab als die Anthropic-Modellreihe.

Künstliche Intelligenz, großes Modell

Das Forschungsteam führte zudem eine geschätzte Analyse der „Aufgabenbearbeitungszeit“ durch: Laut den automatisierten Bewertungsergebnissen von SWE-bench würde Claude 4.5 Sonnet bei einer Erfolgsquote von 50 % etwa 50 Minuten menschlicher Arbeitszeit benötigen, um Aufgaben zu erledigen. Basierend auf den Bewertungen der Betreuer sinkt die geschätzte Zeit jedoch auf nur etwa 8 Minuten, was darauf hindeutet, dass der Benchmark die Fähigkeiten um das bis zu Siebenfache überschätzt.

Die Forscher betonten jedoch auch, dass diese Studie keine grundlegende Begrenzung der Fähigkeiten von KI-Programmieragenten impliziert. Mit verbesserten Prompt-Strategien, mehr menschlichem Feedback oder mehreren Iterationszyklen könnte die Lücke zwischen automatisierter Bewertung und manueller Überprüfung verringert werden. Zudem unterscheidet sich der Versuchsaufbau von realen Entwicklungsprozessen – so hatten KI-Agenten beispielsweise nur einen Einreichungsversuch, während menschliche Entwickler den Code in der Regel iterativ auf der Grundlage von Feedback modifizieren können.

Zusammenfassend kommt die Studie zu dem Schluss, dass das ausschließliche Verlassen auf Benchmark-Ergebnisse zur Beurteilung des praktischen Nutzens von KI-Programmieragenten zu systematischen Verzerrungen führen kann. Da sich KI-Codierungsmodelle rasch weiterentwickeln, ist die Entwicklung von Bewertungssystemen, die reale Entwicklungsumgebungen besser widerspiegeln, zu einer entscheidenden Forschungsrichtung im Bereich der KI-Softwareentwicklung geworden.

Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Prompt Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows
Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows

Die besten und am besten bewerteten KI-Prompt-Bibliotheken des Jahres 2026 zur Optimierung aller Arten von ChatGPT-Workflows. XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung zusammengestellt, die strengen Praxistests unterzogen wird, um Spitzenleistung zu gewährleisten. Hier finden Sie detaillierte Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Experten-Rankings, die Ihnen dabei helfen, die unverzichtbaren Tools auszuwählen, mit denen Sie Ihre Produktivität steigern und Ihren KI-Vorteil ausschöpfen können. Entdecken Sie sie jetzt!

11 Tools
xix.ai
Kommentare (2)
0/500
MichaelMartinez
MichaelMartinez 27. Juni 2026 20:00:18 MESZ

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 16. Mai 2026 14:00:16 MESZ

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR