Дом
OpenAI подвергла резкой критике тест по искусственному интеллекту: почти треть вопросов оказалась некорректной, а проходной балл за 8 месяцев взлетел до 80%
В своём блоге компания OpenAI публично подвергла критике ведущий отраслевой тестовый набор SWE-Bench Pro, заявив, что примерно 30 % из 731 общедоступной тестовой задачи содержат недостатки в системе оценки. Разработанный компанией Scale AI, SWE-Bench Pro предназначен для оценки способностей крупных языковых моделей и ИИ-агентов к написанию кода. Поскольку он точно отражает реальные условия корпоративной разработки и предусматривает строгие меры по предотвращению мошенничества, он стал широко признанным эталоном в области разработки программного обеспечения с использованием ИИ.

В своём блоге OpenAI обращает внимание на ключевой показатель: доля моделей высшего уровня, прошедших этот тест, подскочила с 23,3 % до 80,3 % всего за восемь месяцев. Такой стремительный прогресс выглядит подозрительно, и OpenAI утверждает, что этот тест больше не способен точно измерить реальные навыки модели в области разработки программного обеспечения. Проблема, вероятно, связана с недостатками самой оценки, а не с подлинным скачком в возможностях моделей.
Два метода проверки, прошедшие перекрестную валидацию, показали, что почти 30 % задач признаны «несоответствующими».
Чтобы проверить это, OpenAI запустила два параллельных процесса проверки. Анализ данных выявил 200 задач, не прошедших проверку, или 27,4 % из 731 общедоступной задачи. В то же время при ручной аннотации было выявлено 249 задач, не прошедших проверку, или 34,1 %. Сравнив результаты обоих методов, OpenAI оценивает, что примерно 30 % задач SWE-Bench Pro содержат дефекты, которые можно разделить на четыре категории: чрезмерно строгие тесты, неадекватные подсказки, узкий охват тестирования и вводящие в заблуждение подсказки.
OpenAI также привела типичный пример: в одной задаче требовалось вставить один пробел в начале строки при преобразовании контента в формат Markdown, но скрытый тест ожидал двух пробелов. В результате даже если модель следовала заявленному требованию, она оценивалась как неправильная. Это несоответствие между явными инструкциями и скрытыми требованиями напрямую искажает оценку реальных способностей модели и объясняет необоснованный скачок показателей успешности.
Отзыв рекомендации по внедрению и призыв к перестройке системы оценки ИИ
Основываясь на этом анализе, OpenAI официально отозвала свою предыдущую рекомендацию по использованию SWE-Bench Pro. Компания считает, что будущие тестовые наборы должны создаваться опытными разработчиками программного обеспечения специально для оценки ИИ, а не путем перепрофилирования тестовой логики, предназначенной для разработчиков-людей. Если почти 30 % задач отраслевого тестового набора содержат ошибки, под сомнение ставится достоверность всей системы оценки ИИ. Перенос акцента с соревнований по набору баллов на подлинную оценку инженерных способностей может стать следующим важнейшим шагом в оценке разработки программного обеспечения для ИИ.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
В своём блоге компания OpenAI публично подвергла критике ведущий отраслевой тестовый набор SWE-Bench Pro, заявив, что примерно 30 % из 731 общедоступной тестовой задачи содержат недостатки в системе оценки. Разработанный компанией Scale AI, SWE-Bench Pro предназначен для оценки способностей крупных языковых моделей и ИИ-агентов к написанию кода. Поскольку он точно отражает реальные условия корпоративной разработки и предусматривает строгие меры по предотвращению мошенничества, он стал широко признанным эталоном в области разработки программного обеспечения с использованием ИИ.

В своём блоге OpenAI обращает внимание на ключевой показатель: доля моделей высшего уровня, прошедших этот тест, подскочила с 23,3 % до 80,3 % всего за восемь месяцев. Такой стремительный прогресс выглядит подозрительно, и OpenAI утверждает, что этот тест больше не способен точно измерить реальные навыки модели в области разработки программного обеспечения. Проблема, вероятно, связана с недостатками самой оценки, а не с подлинным скачком в возможностях моделей.
Два метода проверки, прошедшие перекрестную валидацию, показали, что почти 30 % задач признаны «несоответствующими».
Чтобы проверить это, OpenAI запустила два параллельных процесса проверки. Анализ данных выявил 200 задач, не прошедших проверку, или 27,4 % из 731 общедоступной задачи. В то же время при ручной аннотации было выявлено 249 задач, не прошедших проверку, или 34,1 %. Сравнив результаты обоих методов, OpenAI оценивает, что примерно 30 % задач SWE-Bench Pro содержат дефекты, которые можно разделить на четыре категории: чрезмерно строгие тесты, неадекватные подсказки, узкий охват тестирования и вводящие в заблуждение подсказки.
OpenAI также привела типичный пример: в одной задаче требовалось вставить один пробел в начале строки при преобразовании контента в формат Markdown, но скрытый тест ожидал двух пробелов. В результате даже если модель следовала заявленному требованию, она оценивалась как неправильная. Это несоответствие между явными инструкциями и скрытыми требованиями напрямую искажает оценку реальных способностей модели и объясняет необоснованный скачок показателей успешности.
Отзыв рекомендации по внедрению и призыв к перестройке системы оценки ИИ
Основываясь на этом анализе, OpenAI официально отозвала свою предыдущую рекомендацию по использованию SWE-Bench Pro. Компания считает, что будущие тестовые наборы должны создаваться опытными разработчиками программного обеспечения специально для оценки ИИ, а не путем перепрофилирования тестовой логики, предназначенной для разработчиков-людей. Если почти 30 % задач отраслевого тестового набора содержат ошибки, под сомнение ставится достоверность всей системы оценки ИИ. Перенос акцента с соревнований по набору баллов на подлинную оценку инженерных способностей может стать следующим важнейшим шагом в оценке разработки программного обеспечения для ИИ.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











