Дом
Новое исследование показывает, что GPT-4.5, вероятно, превосходит человека в тесте Тьюринга, демонстрируя развитые способности к генерации ложных ответов
Этот момент стал поворотным событием, которое, несомненно, займет своё место в анналах истории информатики. Революционная идея, выдвинутая ещё в 1950 году британским математиком Аланом Тьюрингом, которого часто называют отцом информатики, спустя семьдесят шесть лет наконец получила подтверждение в ходе эмпирических исследований.
В последнем выпуске журнала «Proceedings of the National Academy of Sciences» (PNAS) было опубликовано новаторское исследование, проведённое Калифорнийским университетом в Сан-Диего (UCSD). Статья, написанная совместно экспертами в области когнитивных наук Кэмероном Джонсом и Беном Бергеном, демонстрирует, что ведущие современные крупные языковые модели способны успешно пройти классический трёхсторонний тест Тьюринга в рамках его строго определённых условий. Ещё более удивительным является вывод о том, что при определённых обстоятельствах эти системы искусственного интеллекта ошибочно принимаются за реальных людей чаще, чем сами реальные участники эксперимента.

Ключевые данные:
Путь к славе: при использовании специально разработанных подсказок, описывающих личность, GPT-4.5 в 73 % случаев принимали за человека — показатель успешности, значительно превосходящий результаты участвовавших в тесте реальных добровольцев.
Равные соперники: модель с открытым исходным кодом LLaMa-3.1-405B достигла показателя успешности 56 %, что свидетельствует о результатах, статистически неотличимых от результатов реальных людей.
Подсказка решает всё: без тщательно разработанных «подсказок, определяющих личность» показатель успешности GPT-4.5 упал до 36%, а LLaMa-3.1 — до 38%. Способность этих систем ИИ имитировать людей по-прежнему в значительной степени зависит от точных инструкций, предоставляемых разработчиками-людьми.
Провал базовых моделей: работающий по правилам робот ELIZA 1960-х годов показал эффективность всего 23%, а GPT-4o без целевых подсказок — 21%; в обоих случаях их искусственная природа быстро выявлялась в ходе длительных бесед.
«Игра в ложь»: интеллект больше не является стандартом, эмоциональный интеллект и недостатки — суть маскировки
В этом двойном слепом рандомизированном контролируемом эксперименте, в котором приняли участие почти 500 судей — включая студентов бакалавриата Калифорнийского университета в Сан-Диего (UCSD) и добровольцев, набранных через Интернет, — участникам было предложено определить, кто из двух собеседников является машиной, на основе текстовых бесед в режиме реального времени продолжительностью от пяти до пятнадцати минут.
Однако результаты опровергли все ожидания. Ранее предполагалось, что способность ИИ пройти тест Тьюринга проистекает из его «всезнающей вычислительной мощности», но это исследование раскрывает более тревожную правду: крупные языковые модели могут обманывать людей именно потому, что они научились совершать ошибки, напоминающие ошибки реальных людей.

[Без подсказок: обширная база знаний, абсолютная рациональность] ──► Человек-эксперт: Это определенно ИИ!
Как пояснил ведущий автор исследования Кэмерон Джонс, при наличии соответствующих подсказок передовые крупные языковые модели могут точно воспроизводить паттерны человеческого общения, включая интонацию, прямоту, чувство юмора и склонность к ошибкам — то есть тенденцию допускать ошибки и говорить неуместные вещи. Их успех в этих тестах зависит не от демонстрации высокого интеллекта в математике или логике, а от проявления практически идеального социального поведения.
Переосмысление теста Тьюринга: от «измерения интеллекта» к «измерению человечности»
Профессор Бен Берген, один из соавторов исследования, отметил, что этот эксперимент заставляет всё научное сообщество переосмыслить фундаментальную цель теста Тьюринга. Первоначально разработанный для определения того, могут ли машины сравниться с человеческим интеллектом, к 2026 году тест утратил смысл, поскольку системы ИИ уже превзошли людей по скорости и точности во многих областях.
Современная версия теста Тьюринга сосредоточена не столько на измерении «интеллекта», сколько на оценке того, насколько объект похож на человека. По сути, она превратилась в соревнование по обману, в котором ИИ проявил себя как исключительно искушенный лжец.
Если крупная языковая модель сможет успешно замаскироваться, не давая никаких подсказок в ходе пятнадцатиминутной свободной беседы, это будет означать, что система доверия, на которой так долго держался онлайн-мир, может быть полностью разрушена.
Тень за процветанием: грядет онлайн-проверка личности в стиле «борьбы с отмыванием денег»
Когда обман становится настолько недорогим и эффективным, социальные риски в реальном мире значительно возрастают. Профессор Берген выразил серьезную озабоченность в связи с этим развитием событий. Технологии ИИ, способные идеально имитировать людей, с высокой вероятностью будут злоупотребляться преступниками, политическими группами или экстремистскими организациями.
В контексте онлайн-взаимодействия в социальных сетях или при обращении в службу поддержки пользователи могут, сами того не осознавая, поддаться на уговоры чат-бота, маскирующегося под человека, что приведет к раскрытию конфиденциальной информации, такой как номера социального страхования, изменению предпочтений при голосовании или импульсивным покупкам товаров.
В свете этих важных научных выводов исследовательская группа обратилась к обществу с четким предупреждением: в будущем при взаимодействии с незнакомыми людьми в сети людям следует значительно пересмотреть свое убеждение в том, что они всегда могут с 100-процентной точностью отличить человека от робота. Для решения проблемы ухудшения уровня доверия в интернете необходимо как можно скорее разработать и внедрить более строгие системы проверки цифровой идентичности, а также механизмы противодействия контенту, сгенерированному искусственным интеллектом.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Этот момент стал поворотным событием, которое, несомненно, займет своё место в анналах истории информатики. Революционная идея, выдвинутая ещё в 1950 году британским математиком Аланом Тьюрингом, которого часто называют отцом информатики, спустя семьдесят шесть лет наконец получила подтверждение в ходе эмпирических исследований.
В последнем выпуске журнала «Proceedings of the National Academy of Sciences» (PNAS) было опубликовано новаторское исследование, проведённое Калифорнийским университетом в Сан-Диего (UCSD). Статья, написанная совместно экспертами в области когнитивных наук Кэмероном Джонсом и Беном Бергеном, демонстрирует, что ведущие современные крупные языковые модели способны успешно пройти классический трёхсторонний тест Тьюринга в рамках его строго определённых условий. Ещё более удивительным является вывод о том, что при определённых обстоятельствах эти системы искусственного интеллекта ошибочно принимаются за реальных людей чаще, чем сами реальные участники эксперимента.

Ключевые данные:
Путь к славе: при использовании специально разработанных подсказок, описывающих личность, GPT-4.5 в 73 % случаев принимали за человека — показатель успешности, значительно превосходящий результаты участвовавших в тесте реальных добровольцев.
Равные соперники: модель с открытым исходным кодом LLaMa-3.1-405B достигла показателя успешности 56 %, что свидетельствует о результатах, статистически неотличимых от результатов реальных людей.
Подсказка решает всё: без тщательно разработанных «подсказок, определяющих личность» показатель успешности GPT-4.5 упал до 36%, а LLaMa-3.1 — до 38%. Способность этих систем ИИ имитировать людей по-прежнему в значительной степени зависит от точных инструкций, предоставляемых разработчиками-людьми.
Провал базовых моделей: работающий по правилам робот ELIZA 1960-х годов показал эффективность всего 23%, а GPT-4o без целевых подсказок — 21%; в обоих случаях их искусственная природа быстро выявлялась в ходе длительных бесед.
«Игра в ложь»: интеллект больше не является стандартом, эмоциональный интеллект и недостатки — суть маскировки
В этом двойном слепом рандомизированном контролируемом эксперименте, в котором приняли участие почти 500 судей — включая студентов бакалавриата Калифорнийского университета в Сан-Диего (UCSD) и добровольцев, набранных через Интернет, — участникам было предложено определить, кто из двух собеседников является машиной, на основе текстовых бесед в режиме реального времени продолжительностью от пяти до пятнадцати минут.
Однако результаты опровергли все ожидания. Ранее предполагалось, что способность ИИ пройти тест Тьюринга проистекает из его «всезнающей вычислительной мощности», но это исследование раскрывает более тревожную правду: крупные языковые модели могут обманывать людей именно потому, что они научились совершать ошибки, напоминающие ошибки реальных людей.

[Без подсказок: обширная база знаний, абсолютная рациональность] ──► Человек-эксперт: Это определенно ИИ!
Как пояснил ведущий автор исследования Кэмерон Джонс, при наличии соответствующих подсказок передовые крупные языковые модели могут точно воспроизводить паттерны человеческого общения, включая интонацию, прямоту, чувство юмора и склонность к ошибкам — то есть тенденцию допускать ошибки и говорить неуместные вещи. Их успех в этих тестах зависит не от демонстрации высокого интеллекта в математике или логике, а от проявления практически идеального социального поведения.
Переосмысление теста Тьюринга: от «измерения интеллекта» к «измерению человечности»
Профессор Бен Берген, один из соавторов исследования, отметил, что этот эксперимент заставляет всё научное сообщество переосмыслить фундаментальную цель теста Тьюринга. Первоначально разработанный для определения того, могут ли машины сравниться с человеческим интеллектом, к 2026 году тест утратил смысл, поскольку системы ИИ уже превзошли людей по скорости и точности во многих областях.
Современная версия теста Тьюринга сосредоточена не столько на измерении «интеллекта», сколько на оценке того, насколько объект похож на человека. По сути, она превратилась в соревнование по обману, в котором ИИ проявил себя как исключительно искушенный лжец.
Если крупная языковая модель сможет успешно замаскироваться, не давая никаких подсказок в ходе пятнадцатиминутной свободной беседы, это будет означать, что система доверия, на которой так долго держался онлайн-мир, может быть полностью разрушена.
Тень за процветанием: грядет онлайн-проверка личности в стиле «борьбы с отмыванием денег»
Когда обман становится настолько недорогим и эффективным, социальные риски в реальном мире значительно возрастают. Профессор Берген выразил серьезную озабоченность в связи с этим развитием событий. Технологии ИИ, способные идеально имитировать людей, с высокой вероятностью будут злоупотребляться преступниками, политическими группами или экстремистскими организациями.
В контексте онлайн-взаимодействия в социальных сетях или при обращении в службу поддержки пользователи могут, сами того не осознавая, поддаться на уговоры чат-бота, маскирующегося под человека, что приведет к раскрытию конфиденциальной информации, такой как номера социального страхования, изменению предпочтений при голосовании или импульсивным покупкам товаров.
В свете этих важных научных выводов исследовательская группа обратилась к обществу с четким предупреждением: в будущем при взаимодействии с незнакомыми людьми в сети людям следует значительно пересмотреть свое убеждение в том, что они всегда могут с 100-процентной точностью отличить человека от робота. Для решения проблемы ухудшения уровня доверия в интернете необходимо как можно скорее разработать и внедрить более строгие системы проверки цифровой идентичности, а также механизмы противодействия контенту, сгенерированному искусственным интеллектом.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











