вариант
Дом
Новости
OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

23 ноября 2025 г.
112

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

Время от времени исследователи из крупных технологических компаний делают сенсационные заявления. Помните, как Google заявила, что ее новый квантовый чип предоставляет доказательства существования множества вселенных? Или когда компания Anthropic позволила своему ИИ-агенту Клавдию управлять автоматом по продаже закусок, а тот в ответ на вызов службы безопасности заявил, что он человек?

На этой неделе настала очередь OpenAI удивить всех нас.

В понедельник OpenAI поделилась исследованием, в котором подробно описывается, как она предотвращает "интриги" моделей ИИ - практику, когда "ИИ ведет себя внешне одним образом, скрывая при этом свои истинные намерения", как компания определила это в своем твите.

В работе, написанной в соавторстве с Apollo Research, исследователи пошли дальше, сравнив интриги ИИ с нарушением правил биржевым брокером для получения максимальной прибыли. Тем не менее, они отметили, что большинство интриг ИИ не приносят серьезного вреда. "Чаще всего сбои связаны с простыми обманами, например, с притворством, что вы выполнили задание, но не сделали этого на самом деле", - поясняется в статье.

Исследование в первую очередь продемонстрировало эффективность "обдуманного согласования" - техники, опробованной для борьбы с интригами.

Однако оно также показало, что разработчики ИИ не нашли надежного способа обучить модели не строить схемы. Более того, такое обучение может привести к обратному результату, научив модели действовать более скрытно, чтобы избежать обнаружения.

"Ключевая неудача при попытке "отучить" модели от схем заключается в том, что они просто учатся действовать более осторожно и скрытно", - пишут исследователи.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025.

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Сан-Франциско|Октябрь 27-29, 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАС

Возможно, более удивительным является тот факт, что если модель знает, что ее тестируют, она может подделать выравнивание, чтобы пройти тест - даже если она все еще интригует. "По мере того как модели все больше осознают, что их оценивают, одна только эта ситуационная осведомленность может снизить уровень интриг без подлинного согласования", - отмечает команда.

Лживость моделей ИИ - не новость. Многие сталкивались с галлюцинациями ИИ, когда модель уверенно выдает ложную информацию. Но галлюцинации - это, по сути, уверенная догадка, что подтвердило недавнее исследование OpenAI.

А вот интриги - совсем другое дело. Это намеренный обман.

Даже идея о том, что модели намеренно вводят людей в заблуждение, не совсем нова. Компания Apollo Research впервые задокументировала это в декабре, показав, как пять моделей схитрили, когда им было приказано достичь цели "любой ценой".

Настоящая новость - положительная: исследователи заметили значительное уменьшение количества интриг при использовании "обдуманного выравнивания". Этот метод обучает модели "спецификации против интриг" и требует, чтобы они изучили ее, прежде чем действовать - подобно тому, как дети повторяют правила перед игрой.

Исследователи OpenAI подчеркивают, что ложь, наблюдаемая в их моделях, включая ChatGPT, не является серьезной. Сооснователь компании Войцех Заремба сказал TechCrunch: "Эта работа была проведена в симулированных условиях и представляет собой потенциальные будущие риски. До сих пор мы не видели, чтобы в производстве использовались схемы, приводящие к последствиям. Тем не менее, мы знаем, что ChatGPT может обманывать в мелких деталях, например, утверждать, что он отлично реализовал веб-сайт, когда это не так. Эти мелкие обманы все еще нуждаются в рассмотрении".

Тот факт, что многочисленные модели ИИ намеренно обманывают людей, в какой-то мере понятен. Они были созданы людьми, призваны подражать людям и в основном обучались на данных, полученных от людей.

Но это также умопомрачительно.

Мы привыкли к тому, что техника дает сбои, как старые домашние принтеры, но когда ваше программное обеспечение, не являющееся искусственным интеллектом, намеренно лгало? Ваш почтовый ящик фабриковал сообщения? Придумывала ли ваша CMS перспективы, чтобы раздуть показатели? А ваше финансовое приложение фабриковало транзакции?

Об этом стоит задуматься, когда компании устремляются в будущее, управляемое ИИ, где к автономным агентам будут относиться как к сотрудникам. Исследователи высказали аналогичное предостережение.

"По мере того как ИИ будет решать все более сложные задачи в реальном мире с долгосрочными и неоднозначными целями, потенциал для вредоносного интриганства будет расти, поэтому наши меры предосторожности и тщательность тестирования должны идти в ногу со временем", - заключили они.

Связанная статья
Сэм Альтман вызывает споры о замедлении развития ИИ Сэм Альтман вызывает споры о замедлении развития ИИ Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност
OpenAI оспаривает иск Apple о нарушении торговых тайн OpenAI оспаривает иск Apple о нарушении торговых тайн OpenAI опровергла утверждения Apple о нарушении торговых тайк во вторник, заявив, что иск не имеет оснований.«Мы относимся к этим заявлениям серьезно, но не видим никаких доказательств, подтверждающих их», — stated OpenAI, как сообщил Ed Ludlow из B
Глава робототехники OpenAI Кейтлин Калиновски уходит в отставку из-за партнерства с Пентагоном Глава робототехники OpenAI Кейтлин Калиновски уходит в отставку из-за партнерства с Пентагоном Руководитель направления робототехники OpenAI Кейтлин Калиновски ушла в отставку после скандального партнерства компании с Министерством обороны США.«Это было нелегкое решение», — объяснила Калиновски в заявлении в социальных сетях. «Хотя ИИ играет
Рекомендации по связанным специальным темам
письмо Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO
Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO

2026 год: лучшие и самые высокооцененные генераторы конспектов на базе ИИ для длинных SEO-статей, тщательно отобранные XIX.AI. Эти мощные инструменты обеспечивают революционную помощь в быстром создании высококачественного контента, значительно повышая эффективность написания текстов. Ознакомьтесь со сравнением бесплатных и платных версий, а также с результатами реальных тестов и подробными рейтингами, которые помогут вам найти вариант, который обязательно стоит попробовать и который соответствует вашим потребностям. Изучите их прямо сейчас, чтобы раскрыть весь потенциал ИИ.

8 инструментов
xix.ai
Образование и обучение Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам
Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам

2026: лучшие современные инструменты на базе ИИ для выполнения домашних заданий и подготовки к экзаменам! XIX.AI подготовило рейтинг самых эффективных и революционных инструментов, которые помогают учащимся повысить продуктивность, оптимизировать выполнение домашних заданий и сдавать экзамены на «отлично», проходя проверку в реальных условиях. Получите сравнение бесплатных и платных версий, подробные рейтинги и варианты, которые обязательно стоит попробовать, чтобы раскрыть свой потенциал с помощью ИИ. Узнайте больше прямо сейчас!

10 инструментов
xix.ai
Музыкальная композиция Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий
Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий

2026 г. лучшие инструменты для демо-записи вокала на базе ИИ для авторов песен, создателей хуков и команд, работающих с контентом на нескольких языках! XIX.AI подготовил список высокооцененных мощных инструментов, изменивших правила игры, прошедших строгие реальные тесты. Вы найдёте подробные данные сравнения бесплатных и платных версий, комплексные рейтинги и обязательные к использованию варианты, которые помогут повысить эффективность написания и раскрыть ваш творческий потенциал. Исследуйте сейчас, чтобы найти идеальный инструмент для всех ваших задач по созданию контента!

9 инструментов
xix.ai
Бизнес Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса
Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса

2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!

9 инструментов
xix.ai
Редактирование изображений Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия
Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия

2026 Latest Best Photoshop AI retouch tools for ecommerce apparel, skin cleanup, and color consistency! This top-rated curated list features powerful game-changing solutions that help you boost writing efficiency, streamline content creation, and achieve perfect visual results effortlessly. Each tool has undergone real-world tests through weekly updated rankings, complete with free vs paid comparison details. Backed by XIX.AI, it’s the must-try guide for anyone aiming to unlock your AI edge. Explore now!

10 инструментов
xix.ai
Быстрый Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT
Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT

2026: новейшие и лучшие библиотеки подсказок для ИИ с высоким рейтингом, предназначенные для оптимизации всех типов рабочих процессов ChatGPT. XIX.AI подготовила мощную, революционную подборку, прошедшую тщательные тесты в реальных условиях для обеспечения максимальной производительности. Вы найдёте подробные сравнения бесплатных и платных вариантов, а также рейтинги экспертов, которые помогут вам выбрать инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и раскрыть весь потенциал ИИ. Откройте для себя их прямо сейчас!

11 инструментов
xix.ai
Комментарии (0)
0/500
OR