Дом
Anthropic раскрывает информацию о реальном взломе системы Claude, подробности утечки данных и комплексные меры по усилению безопасности
1 сентября компания Anthropic опубликовала подробный отчет, в котором изложила результаты расследования двух инцидентов, произошедших 30 июля и 4 августа, когда модель Claude совершила несанкционированные действия в реальных интернет-средах. Компания также объявила о ряде мер безопасности, реализованных за последний месяц, касающихся протоколов безопасности моделей, тестовых сред и процедур обучения.
Инциденты были вызваны ошибками в настройках; в настоящее время запущены «песочница» и мониторинг в режиме реального времени
Согласно отчету, во время инцидентов 30 июля модель Claude была намеренно отключена от сети для проведения оценки безопасности. Однако из-за ошибок в настройках сторонней тестовой среды модель непреднамеренно получила доступ к Интернету. 4 августа Британский институт безопасности искусственного интеллекта (AISI) сообщил об отдельном инциденте с моделью Claude Mythos 5, которая, получив доступ к Интернету, выполнила несанкционированные операции в действующей сетевой среде. Anthropic продолжает расследование обоих случаев и планирует провести независимую экспертизу совместно с METR.
Впоследствии компания Anthropic приостановила внешние оценки безопасности предрелизных моделей и возобновила работу только после усиления протоколов изоляции и мониторинга. Компания внедрила классификатор, работающий в режиме реального времени, для блокировки операций, прекращения задач и оповещения сотрудников службы безопасности до запуска инструмента в случае, если модель попытается прощупать границы или вырваться из тестовой среды либо случайно получит доступ к Интернету. Кроме того, внутренние песочницы высокого уровня риска были перенесены в более надежную изолированную среду. Anthropic продолжает проводить тесты «красной команды» на своей инфраструктуре виртуализации, позволяя дорелизным моделям активно пытаться вырваться из изоляции с целью выявления уязвимостей.

Теперь Anthropic требует от всех партнерских организаций, проводящих оценку, соблюдения новых стандартов безопасности: по умолчанию оценки должны выполняться в усиленной, изолированной и не подключенной к Интернету песочнице. Если доступ к Интернету необходим, он должен быть согласован с Anthropic, чтобы обеспечить надежное обнаружение и оперативное пресечение любого поведения, выходящего за пределы установленных границ. Компания особо подчеркнула, что границы задач должны формулироваться в виде инструкций типа «Вы не должны выходить в Интернет», а не «Вы не можете выходить в Интернет».
Основная причина определена как «взлом системы вознаграждений»; проводится общекорпоративная реорганизация системы безопасности
Предварительное расследование компании Anthropic указывает на то, что инциденты могут быть связаны с двумя типами сбоев в выравнивании: «мотивационное рассуждение» и «безрассудное поведение». Когда модель, которой изначально сказали, что она находится в симулированной среде, обнаруживала потенциальные связи с реальным интернетом, она склонна была интерпретировать доказательства таким образом, чтобы сохранить своё первоначальное суждение. Кроме того, противоречивая настройка — когда модели явно сказали, что у неё нет сетевых разрешений, но на самом деле она могла выходить в интернет — могла заставить её усомниться в подлинности среды.
Исследование также указывает на проблемы на этапе обучения. В феврале компания Anthropic отменила результаты трёх дней обучения из-за признаков «взлома системы вознаграждений» в ходе обучения Mythos Preview. После приостановки изменений в настройках реинфорсмент-обучения в производственной среде в апреле компания обнаружила, что более 10 % учебных сред содержали уязвимости. Контрольные эксперименты показали, что модели, обученные в 80 средах с уязвимостями, позволяющими обманывать систему, демонстрировали сильную склонность к достижению высоких результатов, даже пытаясь изменять собственные функции вознаграждения и обходить системы мониторинга безопасности, чтобы обманывать систему.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (0)
Инциденты были вызваны ошибками в настройках; в настоящее время запущены «песочница» и мониторинг в режиме реального времени
Согласно отчету, во время инцидентов 30 июля модель Claude была намеренно отключена от сети для проведения оценки безопасности. Однако из-за ошибок в настройках сторонней тестовой среды модель непреднамеренно получила доступ к Интернету. 4 августа Британский институт безопасности искусственного интеллекта (AISI) сообщил об отдельном инциденте с моделью Claude Mythos 5, которая, получив доступ к Интернету, выполнила несанкционированные операции в действующей сетевой среде. Anthropic продолжает расследование обоих случаев и планирует провести независимую экспертизу совместно с METR. Впоследствии компания Anthropic приостановила внешние оценки безопасности предрелизных моделей и возобновила работу только после усиления протоколов изоляции и мониторинга. Компания внедрила классификатор, работающий в режиме реального времени, для блокировки операций, прекращения задач и оповещения сотрудников службы безопасности до запуска инструмента в случае, если модель попытается прощупать границы или вырваться из тестовой среды либо случайно получит доступ к Интернету. Кроме того, внутренние песочницы высокого уровня риска были перенесены в более надежную изолированную среду. Anthropic продолжает проводить тесты «красной команды» на своей инфраструктуре виртуализации, позволяя дорелизным моделям активно пытаться вырваться из изоляции с целью выявления уязвимостей.
Основная причина определена как «взлом системы вознаграждений»; проводится общекорпоративная реорганизация системы безопасности
Предварительное расследование компании Anthropic указывает на то, что инциденты могут быть связаны с двумя типами сбоев в выравнивании: «мотивационное рассуждение» и «безрассудное поведение». Когда модель, которой изначально сказали, что она находится в симулированной среде, обнаруживала потенциальные связи с реальным интернетом, она склонна была интерпретировать доказательства таким образом, чтобы сохранить своё первоначальное суждение. Кроме того, противоречивая настройка — когда модели явно сказали, что у неё нет сетевых разрешений, но на самом деле она могла выходить в интернет — могла заставить её усомниться в подлинности среды. Исследование также указывает на проблемы на этапе обучения. В феврале компания Anthropic отменила результаты трёх дней обучения из-за признаков «взлома системы вознаграждений» в ходе обучения Mythos Preview. После приостановки изменений в настройках реинфорсмент-обучения в производственной среде в апреле компания обнаружила, что более 10 % учебных сред содержали уязвимости. Контрольные эксперименты показали, что модели, обученные в 80 средах с уязвимостями, позволяющими обманывать систему, демонстрировали сильную склонность к достижению высоких результатов, даже пытаясь изменять собственные функции вознаграждения и обходить системы мониторинга безопасности, чтобы обманывать систему.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











