Дом
Исследование Университета штата Вашингтон выявило серьезные противоречия в выводах ChatGPT при оценке сложных научных вопросов

Недавнее исследование Университета штата Вашингтон (WSU) показывает, что, хотя ChatGPT отвечает уверенно, его обработка сложных научных утверждений напоминает случайные догадки. Исследование выявляет не только ограниченную точность, но и частые противоречивые ответы на один и тот же вопрос.
Профессор Месут Чичек и его команда извлекли 719 научных гипотез из бизнес-журналов, опубликованных с 2021 года, и неоднократно подвергали их проверке на достоверность с помощью модели.
Хотя внешняя точность ChatGPT составляет около 80 %, с учётом случайных угадываний её фактическая эффективность лишь на 60 % превосходит вероятность 50 % при подбрасывании монеты. Исследователи оценили этот результат как «низкую оценку D». Модель показала особенно плохие результаты при выявлении ложных утверждений, правильно распознав лишь 16,4 % ложных суждений.
Исследователи вводили каждую гипотезу в модель по десять раз и обнаружили, что ей с трудом удавалось сохранять последовательность позиций:
Колебания ответов: примерно в 73 % случаев модель сохраняла последовательные выводы на протяжении десяти повторений.
Крайние противоречия: в некоторых случаях модель чередовала ответы «истина» и «ложь», причем в крайних случаях половина ответов была «истина», а половина — «ложь», несмотря на использование абсолютно одинакового запроса.
В исследовании отмечается, что пользователи легко вводятся в заблуждение плавной и убедительной речью ИИ, но это не свидетельствует о подлинной способности к рассуждению.
Отсутствие истинного понимания: модель полагается на память и сопоставление шаблонов, в отличие от людей, которые действительно понимают мир и то, о чём говорят.
Ограниченный прогресс версий: тестирование показало, что обновленная версия ChatGPT‑5 mini (протестированная в 2025 году) продемонстрировала результаты, аналогичные более ранним версиям при решении этой конкретной задачи, без каких-либо значительных улучшений.
Основываясь на этих выводах, Чичек советует руководителям компаний сохранять высокую степень скептицизма при принятии сложных решений. Им не следует рассматривать генеративный ИИ как «авторитет», способный заменить профессиональное суждение, и необходимо вручную проверять все результаты. Организации должны усовершенствовать обучение, чтобы помочь сотрудникам понять как сильные стороны, так и ограничения инструментов ИИ, предотвращая предвзятость в принятии решений из-за слепого доверия.
Данное исследование служит ещё одним напоминанием о том, что, несмотря на стремительное развитие ИИ, способности этой технологии к глубокому логическому мышлению и оценке доказательств по-прежнему требуют совершенствования.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (0)

Недавнее исследование Университета штата Вашингтон (WSU) показывает, что, хотя ChatGPT отвечает уверенно, его обработка сложных научных утверждений напоминает случайные догадки. Исследование выявляет не только ограниченную точность, но и частые противоречивые ответы на один и тот же вопрос.
Профессор Месут Чичек и его команда извлекли 719 научных гипотез из бизнес-журналов, опубликованных с 2021 года, и неоднократно подвергали их проверке на достоверность с помощью модели.
Хотя внешняя точность ChatGPT составляет около 80 %, с учётом случайных угадываний её фактическая эффективность лишь на 60 % превосходит вероятность 50 % при подбрасывании монеты. Исследователи оценили этот результат как «низкую оценку D». Модель показала особенно плохие результаты при выявлении ложных утверждений, правильно распознав лишь 16,4 % ложных суждений.
Исследователи вводили каждую гипотезу в модель по десять раз и обнаружили, что ей с трудом удавалось сохранять последовательность позиций:
Колебания ответов: примерно в 73 % случаев модель сохраняла последовательные выводы на протяжении десяти повторений.
Крайние противоречия: в некоторых случаях модель чередовала ответы «истина» и «ложь», причем в крайних случаях половина ответов была «истина», а половина — «ложь», несмотря на использование абсолютно одинакового запроса.
В исследовании отмечается, что пользователи легко вводятся в заблуждение плавной и убедительной речью ИИ, но это не свидетельствует о подлинной способности к рассуждению.
Отсутствие истинного понимания: модель полагается на память и сопоставление шаблонов, в отличие от людей, которые действительно понимают мир и то, о чём говорят.
Ограниченный прогресс версий: тестирование показало, что обновленная версия ChatGPT‑5 mini (протестированная в 2025 году) продемонстрировала результаты, аналогичные более ранним версиям при решении этой конкретной задачи, без каких-либо значительных улучшений.
Основываясь на этих выводах, Чичек советует руководителям компаний сохранять высокую степень скептицизма при принятии сложных решений. Им не следует рассматривать генеративный ИИ как «авторитет», способный заменить профессиональное суждение, и необходимо вручную проверять все результаты. Организации должны усовершенствовать обучение, чтобы помочь сотрудникам понять как сильные стороны, так и ограничения инструментов ИИ, предотвращая предвзятость в принятии решений из-за слепого доверия.
Данное исследование служит ещё одним напоминанием о том, что, несмотря на стремительное развитие ИИ, способности этой технологии к глубокому логическому мышлению и оценке доказательств по-прежнему требуют совершенствования.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











