вариант
Дом
Новости
Новый тест AGI оказывается сложным, пензирует большинство моделей искусственного интеллекта

Новый тест AGI оказывается сложным, пензирует большинство моделей искусственного интеллекта

10 апреля 2025 г.
230

Фонд Arc Prize, соучредителем которого является известный исследователь ИИ Франсуа Шолле, недавно представил новый тест под названием ARC-AGI-2 в публикации в блоге. Этот тест направлен на расширение границ общего интеллекта ИИ, и пока он оказывается сложной задачей для большинства моделей ИИ.

Согласно таблице лидеров Arc Prize, даже продвинутые модели ИИ с функцией "рассуждения", такие как o1-pro от OpenAI и R1 от DeepSeek, достигают результатов лишь в диапазоне от 1% до 1.3%. В то же время мощные модели без функции рассуждений, такие как GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, показывают результаты около 1%.

Тесты ARC-AGI бросают вызов системам ИИ с задачами-головоломками, требующими определения визуальных узоров в сетках из разноцветных квадратов и создания правильной "ответной" сетки. Эти задачи разработаны для проверки способности ИИ адаптироваться к новым, ранее не виданным вызовам.

Для установления человеческого базового уровня Фонд Arc Prize привлек более 400 человек к прохождению теста ARC-AGI-2. В среднем эти "панели" людей достигли 60% успеха, значительно опережая модели ИИ.

Пример вопроса из ARC-AGI-2. Источник изображения: Arc Prize
Франсуа Шолле заявил на X, что ARC-AGI-2 является более точной мерой истинного интеллекта модели ИИ по сравнению с его предшественником, ARC-AGI-1. Тесты Фонда Arc Prize разработаны для оценки способности ИИ эффективно обучаться новым навыкам за пределами обучающих данных.

Шолле подчеркнул, что ARC-AGI-2 предотвращает использование моделями ИИ "грубой силы" вычислительной мощности для решения задач, что было недостатком первого теста. Для этого ARC-AGI-2 вводит метрику эффективности и требует от моделей интерпретации узоров на лету, а не полагаться на запоминание.

В публикации в блоге соучредитель Фонда Arc Prize Грег Камрадт подчеркнул, что интеллект — это не только решение задач или достижение высоких результатов. "Эффективность, с которой эти способности приобретаются и применяются, является решающим, определяющим компонентом," — написал он. "Основной вопрос заключается не только в том, 'Может ли ИИ приобрести навык для решения задачи?', но и 'С какой эффективностью или стоимостью?'"

ARC-AGI-1 оставался непревзойденным около пяти лет до декабря 2024 года, когда продвинутая модель рассуждений OpenAI, o3, превзошла все другие модели ИИ и сравнялась с человеческими результатами. Однако успех o3 на ARC-AGI-1 обошелся дорого. Версия модели OpenAI o3 (low), которая набрала впечатляющие 75.7% на ARC-AGI-1, показала лишь 4% на ARC-AGI-2, используя вычислительную мощность стоимостью 200 долларов на задачу.

Сравнение производительности передовых моделей ИИ на ARC-AGI-1 и ARC-AGI-2. Источник изображения: Arc Prize
Введение ARC-AGI-2 происходит в момент, когда многие в технологической индустрии призывают к новым, ненасыщенным тестам для измерения прогресса ИИ. Томас Вольф, соучредитель Hugging Face, недавно сообщил TechCrunch, что индустрии ИИ не хватает достаточных тестов для измерения ключевых черт искусственного общего интеллекта, таких как креативность.

Наряду с новым тестом Фонд Arc Prize объявил о конкурсе Arc Prize 2025, побуждая разработчиков достичь 85% точности на тесте ARC-AGI-2, тратя при этом всего 0.42 доллара на задачу.

Связанная статья
RSI становится новым AGI, который так же трудно определить RSI становится новым AGI, который так же трудно определить Термин «рекурсия» стал новым модным словом в сфере искусственного интеллекта. Два разных стартапа взяли его в качестве названия, а многие другие теперь упоминают «рекурсивное самосовершенствование» (R
OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей В то время как правительства пытаются справиться с экономическими последствиями появления сверхинтеллектуальных машин, компания OpenAI опубликовала ряд предложений по формированию политики, в которых
Соучредитель Databricks заявил о появлении AGI после получения премии ACM Соучредитель Databricks заявил о появлении AGI после получения премии ACM Соучредитель и технический директор Databricks Матей Захария едва не пропустил письмо, в котором ему сообщалось о присуждении премии ACM в области вычислительной техники за 2026 год. «Это было, безусл
Рекомендации по связанным специальным темам
Образование и обучение Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам
Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам

2026: лучшие современные инструменты на базе ИИ для выполнения домашних заданий и подготовки к экзаменам! XIX.AI подготовило рейтинг самых эффективных и революционных инструментов, которые помогают учащимся повысить продуктивность, оптимизировать выполнение домашних заданий и сдавать экзамены на «отлично», проходя проверку в реальных условиях. Получите сравнение бесплатных и платных версий, подробные рейтинги и варианты, которые обязательно стоит попробовать, чтобы раскрыть свой потенциал с помощью ИИ. Узнайте больше прямо сейчас!

10 инструментов
xix.ai
Музыкальная композиция Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий
Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий

2026 г. лучшие инструменты для демо-записи вокала на базе ИИ для авторов песен, создателей хуков и команд, работающих с контентом на нескольких языках! XIX.AI подготовил список высокооцененных мощных инструментов, изменивших правила игры, прошедших строгие реальные тесты. Вы найдёте подробные данные сравнения бесплатных и платных версий, комплексные рейтинги и обязательные к использованию варианты, которые помогут повысить эффективность написания и раскрыть ваш творческий потенциал. Исследуйте сейчас, чтобы найти идеальный инструмент для всех ваших задач по созданию контента!

9 инструментов
xix.ai
Бизнес Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса
Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса

2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!

9 инструментов
xix.ai
Редактирование изображений Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия
Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия

2026 Latest Best Photoshop AI retouch tools for ecommerce apparel, skin cleanup, and color consistency! This top-rated curated list features powerful game-changing solutions that help you boost writing efficiency, streamline content creation, and achieve perfect visual results effortlessly. Each tool has undergone real-world tests through weekly updated rankings, complete with free vs paid comparison details. Backed by XIX.AI, it’s the must-try guide for anyone aiming to unlock your AI edge. Explore now!

10 инструментов
xix.ai
Быстрый Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT
Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT

2026: новейшие и лучшие библиотеки подсказок для ИИ с высоким рейтингом, предназначенные для оптимизации всех типов рабочих процессов ChatGPT. XIX.AI подготовила мощную, революционную подборку, прошедшую тщательные тесты в реальных условиях для обеспечения максимальной производительности. Вы найдёте подробные сравнения бесплатных и платных вариантов, а также рейтинги экспертов, которые помогут вам выбрать инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и раскрыть весь потенциал ИИ. Откройте для себя их прямо сейчас!

11 инструментов
xix.ai
Образование и обучение Платформы для создания викторин с ИИ для учителей, репетиторов и программ обучения в группах
Платформы для создания викторин с ИИ для учителей, репетиторов и программ обучения в группах

2026 Latest Best AI Quiz Builder Platforms for Teachers, Tutors, and Cohort-Based Learning Programs! XIX.AI has curated a top-rated list of powerful game-changing tools that go through real-world tests to deliver accurate rankings. These must-try platforms help boost writing efficiency, streamline content creation, and simplify quiz design across all learning scenarios. Explore now to discover your perfect tool for unlocking your AI edge in teaching!

13 инструментов
xix.ai
Комментарии (40)
0/500
KeithLopez
KeithLopez 17 июля 2026 г., 19:00:20 GMT+03:00

Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮

DonaldSanchez
DonaldSanchez 15 февраля 2026 г., 3:00:34 GMT+03:00

이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.

MarkRoberts
MarkRoberts 13 февраля 2026 г., 13:00:14 GMT+03:00

¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.

RonaldRoberts
RonaldRoberts 2 ноября 2025 г., 3:30:36 GMT+03:00

Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?

WillieRoberts
WillieRoberts 29 июля 2025 г., 15:25:16 GMT+03:00

This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!

GeorgeMiller
GeorgeMiller 14 апреля 2025 г., 11:35:00 GMT+03:00

Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!

OR