Option
Heim
Nachricht
Der neue AGI -Test erweist sich als herausfordernd, die Mehrheit der KI -Modelle der Stümpfe

Der neue AGI -Test erweist sich als herausfordernd, die Mehrheit der KI -Modelle der Stümpfe

10. April 2025
230

Die Arc Prize Foundation, mitbegründet von dem renommierten KI-Forscher François Chollet, hat kürzlich in einem Blogbeitrag einen neuen Benchmark namens ARC-AGI-2 vorgestellt. Dieser Test zielt darauf ab, die Grenzen der allgemeinen Intelligenz von KI zu erweitern, und bisher erweist er sich für die meisten KI-Modelle als schwer zu knacken.

Laut der Rangliste des Arc Prize erreichen selbst fortschrittliche „denkende“ KI-Modelle wie OpenAI's o1-pro und DeepSeek's R1 nur Werte zwischen 1 % und 1,3 %. Währenddessen liegen leistungsstarke nicht-denkende Modelle wie GPT-4.5, Claude 3.7 Sonnet und Gemini 2.0 Flash bei etwa 1 %.

ARC-AGI-Tests fordern KI-Systeme mit rätselartigen Problemen heraus, bei denen sie visuelle Muster in Gittern aus verschiedenfarbigen Quadraten erkennen und das richtige „Antwort“-Gitter erstellen müssen. Diese Probleme sind darauf ausgelegt, die Fähigkeit einer KI zu testen, sich an neue, unbekannte Herausforderungen anzupassen.

Um eine menschliche Basislinie zu etablieren, ließ die Arc Prize Foundation über 400 Personen den ARC-AGI-2-Test durchführen. Im Durchschnitt erzielten diese „Gremien“ von Menschen eine Erfolgsquote von 60 %, womit sie die KI-Modelle deutlich übertrafen.

Eine Beispielaufgabe aus ARC-AGI-2. Bildnachweis: Arc Prize
François Chollet erklärte auf X, dass ARC-AGI-2 im Vergleich zu seinem Vorgänger, ARC-AGI-1, ein genaueres Maß für die wahre Intelligenz eines KI-Modells ist. Die Tests der Arc Prize Foundation sind darauf ausgelegt, zu prüfen, ob eine KI effizient neue Fähigkeiten jenseits ihrer Trainingsdaten erlernen kann.

Chollet betonte, dass ARC-AGI-2 verhindert, dass KI-Modelle Probleme durch „brute force“-Rechenleistung lösen, ein Mangel, den er beim ersten Test eingestand. Um dies zu beheben, führt ARC-AGI-2 eine Effizienzmetrik ein und verlangt, dass Modelle Muster spontan interpretieren, anstatt sich auf Auswendiglernen zu stützen.

In einem Blogbeitrag betonte Greg Kamradt, Mitbegründer der Arc Prize Foundation, dass Intelligenz nicht nur darin besteht, Probleme zu lösen oder hohe Punktzahlen zu erzielen. „Die Effizienz, mit der diese Fähigkeiten erworben und eingesetzt werden, ist eine entscheidende, definierende Komponente“, schrieb er. „Die zentrale Frage ist nicht nur: ‚Kann KI die Fähigkeit erwerben, eine Aufgabe zu lösen?‘, sondern auch: ‚Mit welcher Effizienz oder zu welchen Kosten?‘“

ARC-AGI-1 blieb etwa fünf Jahre lang ungeschlagen, bis im Dezember 2024 OpenAI's fortschrittliches Denkmodell o3 alle anderen KI-Modelle übertraf und die menschliche Leistung erreichte. Allerdings war der Erfolg von o3 bei ARC-AGI-1 mit erheblichen Kosten verbunden. Die Version von OpenAI's o3-Modell, o3 (low), die bei ARC-AGI-1 beeindruckende 75,7 % erzielte, erreichte bei ARC-AGI-2 nur magere 4 %, bei einem Einsatz von 200 US-Dollar Rechenleistung pro Aufgabe.

Vergleich der Leistung von Frontier-KI-Modellen bei ARC-AGI-1 und ARC-AGI-2. Bildnachweis: Arc Prize
Die Einführung von ARC-AGI-2 kommt zu einer Zeit, in der viele in der Technologiebranche nach neuen, ungesättigten Benchmarks verlangen, um den Fortschritt von KI zu messen. Thomas Wolf, Mitbegründer von Hugging Face, erklärte kürzlich gegenüber TechCrunch, dass der KI-Branche ausreichende Tests fehlen, um Schlüsselfähigkeiten der künstlichen allgemeinen Intelligenz, wie Kreativität, zu messen.

Neben dem neuen Benchmark kündigte die Arc Prize Foundation den Arc Prize 2025-Wettbewerb an, der Entwickler herausfordert, eine Genauigkeit von 85 % beim ARC-AGI-2-Test zu erreichen, während sie nur 0,42 US-Dollar pro Aufgabe ausgeben.

Verwandter Artikel
RSI wird zum neuen AGI – ebenso schwer zu definieren RSI wird zum neuen AGI – ebenso schwer zu definieren Der Begriff „Rekursion“ ist zum neuesten Schlagwort in der künstlichen Intelligenz geworden. Zwei unterschiedliche Start-ups haben ihn als Namen gewählt, und viele andere beziehen sich mittlerweile in
OpenAI skizziert eine KI-Wirtschaft mit öffentlichen Vermögensfonds, Robotersteuern und einer Vier-Tage-Woche OpenAI skizziert eine KI-Wirtschaft mit öffentlichen Vermögensfonds, Robotersteuern und einer Vier-Tage-Woche Während Regierungen darum ringen, die wirtschaftlichen Auswirkungen superintelligenter Maschinen zu bewältigen, hat OpenAI eine Reihe von politischen Vorschlägen veröffentlicht, in denen dargelegt wir
Mitbegründer von Databricks kündigt nach dem Gewinn des ACM-Preises das Erscheinen der AGI an Mitbegründer von Databricks kündigt nach dem Gewinn des ACM-Preises das Erscheinen der AGI an Matei Zaharia, Mitbegründer und CTO von Databricks, hätte die E-Mail, in der ihm die Verleihung des ACM-Preises für Informatik 2026 mitgeteilt wurde, beinahe übersehen. „Das war wirklich eine Überrasc
Empfehlungen zu verwandten Spezialthemen
Datenanalyse Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams
Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams

2026 Neueste Besten Top-bewertete KI-Anomalienerkennungstools für KPI-Monitoring in SaaS- und E-Commerce-Teams! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung basierend auf strengen realen Tests und wöchentlich aktualisierten Rankings zusammengestellt. Sie finden detaillierte kostenlose vs. kostenpflichtige Vergleichsinsights, die Ihnen helfen, die unbedingt auszuprobierende Lösung zu identifizieren, die die Produktivität steigert und Ihre KI-Vorteile freischaltet. Jetzt erkunden!

10 Tools
xix.ai
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Kommentare (40)
0/500
KeithLopez
KeithLopez 17. Juli 2026 18:00:20 MESZ

Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮

DonaldSanchez
DonaldSanchez 15. Februar 2026 01:00:34 MEZ

이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.

MarkRoberts
MarkRoberts 13. Februar 2026 11:00:14 MEZ

¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.

RonaldRoberts
RonaldRoberts 2. November 2025 01:30:36 MEZ

Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?

WillieRoberts
WillieRoberts 29. Juli 2025 14:25:16 MESZ

This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!

GeorgeMiller
GeorgeMiller 14. April 2025 10:35:00 MESZ

Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!

OR