Option
Heim
Nachricht
OpenAI kritisiert KI-Benchmark scharf: Fast ein Drittel der Fragen ist fehlerhaft, die Erfolgsquote stieg innerhalb von acht Monaten auf 80 %

OpenAI kritisiert KI-Benchmark scharf: Fast ein Drittel der Fragen ist fehlerhaft, die Erfolgsquote stieg innerhalb von acht Monaten auf 80 %

28. Juli 2026
89

OpenAI hat in einem Blogbeitrag den branchenweit führenden Benchmark „SWE-Bench Pro“ öffentlich in Frage gestellt und behauptet, dass etwa 30 % der 731 öffentlich zugänglichen Testaufgaben Bewertungsfehler enthalten. SWE-Bench Pro wurde von Scale AI entwickelt und dient dazu, die Programmierfähigkeiten großer Sprachmodelle und KI-Agenten zu bewerten. Da es die reale Unternehmensentwicklung genau widerspiegelt und strenge Maßnahmen gegen Betrug durchsetzt, hat es sich zu einem weithin anerkannten Benchmark im Bereich der KI-Softwareentwicklung entwickelt.

OpenAI

OpenAI hebt in dem Blogbeitrag ein entscheidendes Signal hervor: Die Erfolgsquote der Spitzenmodelle bei diesem Benchmark stieg innerhalb von nur acht Monaten von 23,3 % auf 80,3 %. Ein derart rascher Fortschritt erscheint verdächtig, und OpenAI argumentiert, dass der Benchmark die tatsächlichen Softwareentwicklungsfähigkeiten eines Modells in der Praxis nicht mehr genau messen kann. Das Problem ist wahrscheinlich auf Mängel in der Bewertung selbst zurückzuführen und nicht auf einen echten Sprung in der Leistungsfähigkeit der Modelle.

Zwei gegenseitig validierte Überprüfungsverfahren zeigen, dass fast 30 % der Aufgaben als „unqualifiziert“ eingestuft werden.

Um dies zu überprüfen, leitete OpenAI zwei parallele Überprüfungsprozesse ein. Die Datenpunktanalyse deckte 200 fehlgeschlagene Aufgaben auf, was 27,4 % der 731 öffentlichen Aufgaben entspricht. Die manuelle Annotation identifizierte hingegen 249 fehlgeschlagene Aufgaben, also 34,1 %. Durch den Abgleich beider Methoden schätzt OpenAI, dass etwa 30 % der SWE-Bench-Pro-Aufgaben Fehler enthalten, die sich in vier Kategorien einteilen lassen: zu strenge Tests, unzureichende Eingabeaufforderungen, zu enge Testabdeckung und irreführende Eingabeaufforderungen.

OpenAI führte zudem ein typisches Beispiel an: Eine Aufgabe verlangte bei der Konvertierung von Inhalten in Markdown ein einzelnes Leerzeichen am Zeilenanfang, doch der versteckte Test erwartete zwei Leerzeichen. Infolgedessen würde das Modell selbst dann als falsch gewertet werden, wenn es die angegebene Anforderung erfüllte. Diese Diskrepanz zwischen expliziten Anweisungen und versteckten Anforderungen verzerrt direkt die Bewertung der tatsächlichen Leistungsfähigkeit eines Modells und erklärt den unangemessenen Anstieg der Bestehensquoten.

Rücknahme der Anwendungsempfehlung und Forderung nach einer Neugestaltung des KI-Bewertungssystems

Aufgrund dieser Analyse hat OpenAI seine frühere Empfehlung zur Nutzung von SWE-Bench Pro offiziell zurückgezogen. Das Unternehmen ist der Ansicht, dass zukünftige Benchmarks von erfahrenen Softwareentwicklern speziell für die KI-Bewertung erstellt werden sollten, anstatt Testlogik, die für menschliche Entwickler konzipiert wurde, umzufunktionieren. Wenn ein Branchen-Benchmark bei fast 30 % seiner Aufgaben Mängel aufweist, wird die Glaubwürdigkeit des gesamten KI-Bewertungssystems in Frage gestellt. Die Verlagerung des Fokus von Wettbewerben, bei denen es um das Erreichen hoher Punktzahlen geht, hin zu einer echten Bewertung der technischen Fähigkeiten könnte der nächste entscheidende Schritt bei der Bewertung von KI-Software sein.

Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Datenanalyse Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams
Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams

2026 Neueste Besten Top-bewertete KI-Anomalienerkennungstools für KPI-Monitoring in SaaS- und E-Commerce-Teams! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung basierend auf strengen realen Tests und wöchentlich aktualisierten Rankings zusammengestellt. Sie finden detaillierte kostenlose vs. kostenpflichtige Vergleichsinsights, die Ihnen helfen, die unbedingt auszuprobierende Lösung zu identifizieren, die die Produktivität steigert und Ihre KI-Vorteile freischaltet. Jetzt erkunden!

10 Tools
xix.ai
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Kommentare (0)
0/500
OR