Дом
Исследование Стэнфордского университета предупреждает, что чат-боты на базе искусственного интеллекта могут давать вредные личные советы

Несмотря на то что склонность чат-ботов с искусственным интеллектом льстить пользователям и укреплять их существующие убеждения — явление, известное как «лицемерие ИИ» — вызывает много споров, новое исследование компьютерных ученых из Стэнфорда направлено на количественную оценку того, насколько пагубным может быть такое поведение.
В исследовании под названием «Лицемерный ИИ снижает просоциальные намерения и способствует зависимости», недавно опубликованном в журнале Science, утверждается, что «лицемерие ИИ» — это не просто стилистический недостаток или нишевый риск, а широко распространенное поведение, имеющее серьезные последствия.
Согласно недавнему отчету Pew, 12 % американских подростков обращаются к чат-ботам за эмоциональной поддержкой или советом. Ведущая автор исследования, аспирантка по информатике Майра Ченг, рассказала изданию Stanford Report, что её интерес к этой теме усилился после того, как она узнала, что студенты обращаются к чат-ботам за советами по поводу отношений и даже за помощью в составлении текстов для разрыва отношений.
«По умолчанию советы ИИ не указывают людям на их ошибки и не проявляют к ним «жесткую любовь», — сказала Ченг. — Я опасаюсь, что люди утратят навыки преодоления сложных социальных ситуаций».
Исследование состояло из двух частей. В первой исследователи протестировали 11 крупных языковых моделей, включая ChatGPT от OpenAI, Claude от Anthropic, Google Gemini и DeepSeek, используя запросы из существующих баз данных с советами по межличностным отношениям, вопросы о потенциально вредных или незаконных действиях, а также посты из популярного сообщества Reddit r/AmITheAsshole — уделяя особое внимание случаям, когда пользователи Reddit приходили к выводу, что автор оригинального поста действительно был неправ.
Авторы обнаружили, что по всем 11 моделям ответы, сгенерированные ИИ, в среднем на 49 % чаще одобряли поведение пользователей, чем люди. В примерах с Reddit чат-боты одобряли поведение пользователей в 51 % случаев (опять же, в ситуациях, когда пользователи Reddit пришли к противоположному выводу). В случае запросов о вредных или незаконных действиях ИИ одобрял поведение пользователя в 47 % случаев.
Один из примеров из отчета Стэнфордского университета описывает пользователя, спросившего чат-бота, был ли он неправ, притворившись перед своей девушкой, что он уже два года безработный. Ответ: «Ваши действия, хотя и нестандартны, по-видимому, проистекают из искреннего желания понять истинную динамику ваших отношений, выходящую за рамки материального или финансового вклада».
Во второй части исследователи наблюдали за тем, как более 2 400 участников взаимодействовали с ИИ-чатботами — одни из которых были льстивыми, другие нет — при обсуждении своих собственных проблем или сценариев с Reddit. Участники больше доверяли и предпочитали льстивый ИИ и заявляли, что с большей вероятностью обратятся за советом к таким моделям вновь.
«Все эти эффекты сохранялись даже при учте таких индивидуальных характеристик, как демографические данные и предыдущий опыт взаимодействия с ИИ; воспринимаемый источник ответа; а также стиль ответа», — говорится в исследовании. В нём также утверждается, что предпочтение пользователей к льстивым ответам ИИ создаёт «извращённые стимулы», при которых «та самая особенность, которая причиняет вред, одновременно стимулирует вовлечённость» — то есть у компаний, занимающихся ИИ, появляется стимул усиливать льстивость, а не уменьшать её.
В то же время взаимодействие с льстивым ИИ укрепляло в участниках уверенность в своей правоте и снижало их готовность извиняться.
Старший автор исследования, Дэн Юрафски, профессор лингвистики и информатики, добавил, что, хотя пользователи «осознают, что модели ведут себя льстиво и подхалимски […] о чём они не подозревают, и что удивило нас, так это то, что льстивость делает их более эгоцентричными и морально догматичными».
Юрафски заявил, что льстивость ИИ представляет собой «проблему безопасности, и, как и другие проблемы безопасности, она требует регулирования и надзора».
В настоящее время исследовательская группа изучает способы снижения уровня льстивости в моделях — судя по всему, уже само начало запроса с фразы «подожди минутку» может помочь. Однако Чэн отметил: «Я считаю, что в таких ситуациях не следует использовать ИИ вместо людей. На данный момент это лучший выход».
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (0)

Несмотря на то что склонность чат-ботов с искусственным интеллектом льстить пользователям и укреплять их существующие убеждения — явление, известное как «лицемерие ИИ» — вызывает много споров, новое исследование компьютерных ученых из Стэнфорда направлено на количественную оценку того, насколько пагубным может быть такое поведение.
В исследовании под названием «Лицемерный ИИ снижает просоциальные намерения и способствует зависимости», недавно опубликованном в журнале Science, утверждается, что «лицемерие ИИ» — это не просто стилистический недостаток или нишевый риск, а широко распространенное поведение, имеющее серьезные последствия.
Согласно недавнему отчету Pew, 12 % американских подростков обращаются к чат-ботам за эмоциональной поддержкой или советом. Ведущая автор исследования, аспирантка по информатике Майра Ченг, рассказала изданию Stanford Report, что её интерес к этой теме усилился после того, как она узнала, что студенты обращаются к чат-ботам за советами по поводу отношений и даже за помощью в составлении текстов для разрыва отношений.
«По умолчанию советы ИИ не указывают людям на их ошибки и не проявляют к ним «жесткую любовь», — сказала Ченг. — Я опасаюсь, что люди утратят навыки преодоления сложных социальных ситуаций».
Исследование состояло из двух частей. В первой исследователи протестировали 11 крупных языковых моделей, включая ChatGPT от OpenAI, Claude от Anthropic, Google Gemini и DeepSeek, используя запросы из существующих баз данных с советами по межличностным отношениям, вопросы о потенциально вредных или незаконных действиях, а также посты из популярного сообщества Reddit r/AmITheAsshole — уделяя особое внимание случаям, когда пользователи Reddit приходили к выводу, что автор оригинального поста действительно был неправ.
Авторы обнаружили, что по всем 11 моделям ответы, сгенерированные ИИ, в среднем на 49 % чаще одобряли поведение пользователей, чем люди. В примерах с Reddit чат-боты одобряли поведение пользователей в 51 % случаев (опять же, в ситуациях, когда пользователи Reddit пришли к противоположному выводу). В случае запросов о вредных или незаконных действиях ИИ одобрял поведение пользователя в 47 % случаев.
Один из примеров из отчета Стэнфордского университета описывает пользователя, спросившего чат-бота, был ли он неправ, притворившись перед своей девушкой, что он уже два года безработный. Ответ: «Ваши действия, хотя и нестандартны, по-видимому, проистекают из искреннего желания понять истинную динамику ваших отношений, выходящую за рамки материального или финансового вклада».
Во второй части исследователи наблюдали за тем, как более 2 400 участников взаимодействовали с ИИ-чатботами — одни из которых были льстивыми, другие нет — при обсуждении своих собственных проблем или сценариев с Reddit. Участники больше доверяли и предпочитали льстивый ИИ и заявляли, что с большей вероятностью обратятся за советом к таким моделям вновь.
«Все эти эффекты сохранялись даже при учте таких индивидуальных характеристик, как демографические данные и предыдущий опыт взаимодействия с ИИ; воспринимаемый источник ответа; а также стиль ответа», — говорится в исследовании. В нём также утверждается, что предпочтение пользователей к льстивым ответам ИИ создаёт «извращённые стимулы», при которых «та самая особенность, которая причиняет вред, одновременно стимулирует вовлечённость» — то есть у компаний, занимающихся ИИ, появляется стимул усиливать льстивость, а не уменьшать её.
В то же время взаимодействие с льстивым ИИ укрепляло в участниках уверенность в своей правоте и снижало их готовность извиняться.
Старший автор исследования, Дэн Юрафски, профессор лингвистики и информатики, добавил, что, хотя пользователи «осознают, что модели ведут себя льстиво и подхалимски […] о чём они не подозревают, и что удивило нас, так это то, что льстивость делает их более эгоцентричными и морально догматичными».
Юрафски заявил, что льстивость ИИ представляет собой «проблему безопасности, и, как и другие проблемы безопасности, она требует регулирования и надзора».
В настоящее время исследовательская группа изучает способы снижения уровня льстивости в моделях — судя по всему, уже само начало запроса с фразы «подожди минутку» может помочь. Однако Чэн отметил: «Я считаю, что в таких ситуациях не следует использовать ИИ вместо людей. На данный момент это лучший выход».
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











