Ограничения ИИ мешают исследователям в области кибербезопасности

На протяжении месяцев лидеры в области искусственного интеллекта внедряли строгие протоколы проверки и механизмы безопасности, чтобы предотвратить возможность злоумышленников использовать их модели. Однако эти ограничения теперь мешают законным защитникам сетей и исследователям в области кибербезопасности, занимающимся наступательными операциями.
В июне правительство США ввело экспортный контроль на ожидавшиеся модели искусственного интеллекта Anthropic — Mythos и Fable. Это решение частично было обусловлено сообщениями о том, что защитные механизмы моделей, предотвращающие содействие кибератакам, могут быть обойдены.
Была ли инцидент действительно вызван опасениями по поводу обхода ограничений (jailbreak), или нет, Anthropic неизменно позиционировала Mythos как мощный киберинструмент, доступный только тщательно проверенным пользователям в рамках строгих ограничений. (Примечание: экспортный контроль на Fable 5 и Mythos 5 впоследствии был снят. Fable 5 стала доступна для общего пользования 1 июля, а Mythos 5 была повторно введена исключительно для проверенных организаций США в рамках процесса рассмотрения со стороны правительства.)
Такой подход к контролю доступа не является уникальным для Mythos. Как Anthropic, так и OpenAI предлагают исследователям в области кибербезопасности программы для подачи заявок на проверенный доступ, который, если он одобрен, предоставляет им модели с меньшим количеством ограничений в сфере кибербезопасности: Trusted Access for Cyber от OpenAI и Cyber Verification Program от Anthropic.
Эти защитные механизмы подверглись широкой критике, особенно со стороны исследователей, задача которых заключается в выявлении неизвестных уязвимостей систем и разработке эксплойтов до того, как это сделают преступники.
Во время недавнего появления в подкасте по кибербезопасности известный исследователь безопасности Марк Дауд заявил: «Мне не очень комфортно от того, что эти случайные крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет».
Дауд посвятил десятилетия обнаружению и продаже «нулевых дней» — ранее неизвестных ошибок программного обеспечения и эксплойтов к ним — западным правительствам, а не сообщению об этом производителям программного обеспечения для исправления. Правительства платят премию за эти уязвимости, поскольку они остаются неразглашенными, что ценно для разведывательных операций.
Дауд признал, что его работа может вносить предвзятость, но он не одинок. Несколько специалистов в области наступательной кибербезопасности, которые проактивно проверяют системы на наличие слабостей, рассказали TechCrunch, как они используют инструменты искусственного интеллекта и обходят их защитные механизмы.
Крис Энли, главный научный сотрудник гиганта по безопасности NCC Group, объяснил, что просьба к модели искусственного интеллекта попытаться эксплуатировать ошибку является важным шагом в подтверждении того, что это настоящая уязвимость, которую стоит исправить. Однако, если защитный механизм заставляет модель полностью отказать в запросе, это мешает защитникам, отметил он.
«Здесь вступает в игру вся часть противостояния наступательных и оборонительных операций, а также защитных механизмов, потому что „исправь этот код“ как запрос является как необходимым механизмом для защиты, так и дорожной картой для поиска критических уязвимостей в базе кода», — сказал Энли. «Таким образом, в то же время тот же самый инструмент является и наступательным, и оборонительным инструментом, и эти две стороны нельзя действительно разделить».
Это «как молоток», продолжил он. «Вы не можете построить дом без молотка. Это определенно инструмент, но он также является неразложимым оружием».
Столкнувшись с такими препятствиями, он и его коллеги иногда прибегают к моделям искусственного интеллекта с открытым исходным кодом, которые не имеют никаких защитных механизмов.
Паоло Стагно, главный технолог компании CrowdFense, известной компании, которая разрабатывает, приобретает и продает неизвестные уязвимости правительственным агентствам, согласился с Даудом, заявив, что компании искусственного интеллекта «по сути относятся к клиентам как к детям, нуждающимся в babysitting», через свои программы проверки и защитные механизмы.
Стагно упомянул, что он и его команда используют модели передового уровня для обратной инженерии, но избегают использования искусственного интеллекта для поиска уязвимостей или создания эксплойтов. Передача такой работы в облачные модели рискует привести к утечке конфиденциальных данных об уязвимостях или их поглощению в будущих обучающих выборках. Для этих задач он использует локально запущенные модели с открытым исходным кодом, чтобы избежать передачи данных вовне.
Джузеппе Кали, исследователь безопасности, который обнаруживает нулевые дни и разрабатывает эксплойты, заявил, что защитные механизмы не мешают его работе. Это связано с тем, что он не использует искусственный интеллект для наступательных целей; вместо этого он использует его для начальной обратной инженерии, чтобы понять анализируемый код, и для создания вспомогательных инструментов. Он отметил, что инструменты искусственного интеллекта ускоряют этот процесс, позволяя ему сосредоточиться на обнаружении уязвимостей.
«Я все еще хочу сам владеть фактическим обнаружением ошибок и их превращением в оружие, и это не изменилось бы, если бы все защитные механизмы были сняты завтра», — сказал Кали. «Я ревную свои ошибки, и мне слишком нравится эта игра, чтобы позволять моделям играть в нее за меня».
Один из исследователей в производителе компонентов для смартфонов, который говорил на условиях анонимности, поскольку он не уполномочен общаться с прессой, заявил, что его работодатель не является частью программы CVP Anthropic. Следовательно, его инструменты едва полезны для поиска уязвимостей из-за чрезмерно строгих защитных механизмов.
«Если становится известно, что мы занимаемся чем-то связанным с безопасностью, это просто останавливается и становится непригодным для использования», — сказал этот человек.
Крис Томпсон, генеральный директор фирмы по кибербезопасности RemoteThreat и основатель Offensive AI Con, мероприятия, сосредоточенного на наступательной безопасности и искусственном интеллекте, отметил, что, согласно его опыту работы с моделями передового уровня искусственного интеллекта, защитные механизмы непоследовательны и ведут себя по-разному каждый день. Это верно даже в рамках более мягких границ программ проверки Anthropic и OpenAI.
«Я думаю, что практический эффект заключается в том, что вы тратите много времени на переговоры с моделью вместо работы над основной программой безопасности», — сказал Томпсон. «Вместо анализа уязвимости и рассуждения о возможности эксплуатации вы пытаетесь понять, почему получаете непоследовательные результаты или почему модели чрезмерно очищают вывод».
В результате исследователи все больше полагаются на или вынуждены переходить на китайские модели с открытым исходным кодом, такие как GLM — свободно загружаемые модели, которые можно запускать локально без проверки или ограничений на использование, согласно Томпсону.
«У вас есть эти ответственные исследователи, которые вытесняются из систем, управляемых США, в системы, принадлежащие иностранным государствам», — сказал он. «Я думаю, что вред от наличия таких защитных механизмов больше, чем польза».
Вместо дальнейшего ужесточения ограничений Томпсон призвал лаборатории передового уровня искусственного интеллекта открыть свои программы, обеспечить ответственный доступ и привлечь к ответственности злоупотребляющих их инструментами. В противном случае, утверждал он, защитники проиграют гонку с искусственным интеллектом.
«Накатывается большой шторм. Надвигается большая волна атак, которые произойдут с беспрецедентной скоростью и масштабом», — сказал Томпсон. «Но те же самые фирмы по кибербезопасности и законные исследователи, которые пытаются внести вклад, сейчас подавляются».
Связанная статья
OpenAI заключила партнерское соглашение с Yubico с целью усиления безопасности GPT-5.6 с помощью аппаратных ключей доступа
Джеррод Чонг, генеральный директор компании Yubico | Источник изображения: YubicoВ предстоящей версии GPT-5.6 от OpenAI с сентября будет введено обязательное использование паролей с аппаратной поддерж
OpenAI возглавляет инициативу по укреплению кибербезопасности, поддержанную 100 участниками
В начале письма OpenAI говорится: «У нас есть ограниченное время для укрепления киберзащиты». Источник: Getty ImagesКрупные технологические компании — в том числе AWS, Google и Microsoft — призывают п
Anthropic запускает ИИ-агентов для выполнения общей задачи, что вызывает внутреннюю конкуренцию
Что происходит, когда агенты искусственного интеллекта сталкиваются друг с другом? Недавние испытания компании Anthropic показывают, что ситуация может быстро выйти из-под контроля.В четверг команда F
Рекомендации по связанным специальным темам
Комментарии (0)

На протяжении месяцев лидеры в области искусственного интеллекта внедряли строгие протоколы проверки и механизмы безопасности, чтобы предотвратить возможность злоумышленников использовать их модели. Однако эти ограничения теперь мешают законным защитникам сетей и исследователям в области кибербезопасности, занимающимся наступательными операциями.
В июне правительство США ввело экспортный контроль на ожидавшиеся модели искусственного интеллекта Anthropic — Mythos и Fable. Это решение частично было обусловлено сообщениями о том, что защитные механизмы моделей, предотвращающие содействие кибератакам, могут быть обойдены.
Была ли инцидент действительно вызван опасениями по поводу обхода ограничений (jailbreak), или нет, Anthropic неизменно позиционировала Mythos как мощный киберинструмент, доступный только тщательно проверенным пользователям в рамках строгих ограничений. (Примечание: экспортный контроль на Fable 5 и Mythos 5 впоследствии был снят. Fable 5 стала доступна для общего пользования 1 июля, а Mythos 5 была повторно введена исключительно для проверенных организаций США в рамках процесса рассмотрения со стороны правительства.)
Такой подход к контролю доступа не является уникальным для Mythos. Как Anthropic, так и OpenAI предлагают исследователям в области кибербезопасности программы для подачи заявок на проверенный доступ, который, если он одобрен, предоставляет им модели с меньшим количеством ограничений в сфере кибербезопасности: Trusted Access for Cyber от OpenAI и Cyber Verification Program от Anthropic.
Эти защитные механизмы подверглись широкой критике, особенно со стороны исследователей, задача которых заключается в выявлении неизвестных уязвимостей систем и разработке эксплойтов до того, как это сделают преступники.
Во время недавнего появления в подкасте по кибербезопасности известный исследователь безопасности Марк Дауд заявил: «Мне не очень комфортно от того, что эти случайные крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет».
Дауд посвятил десятилетия обнаружению и продаже «нулевых дней» — ранее неизвестных ошибок программного обеспечения и эксплойтов к ним — западным правительствам, а не сообщению об этом производителям программного обеспечения для исправления. Правительства платят премию за эти уязвимости, поскольку они остаются неразглашенными, что ценно для разведывательных операций.
Дауд признал, что его работа может вносить предвзятость, но он не одинок. Несколько специалистов в области наступательной кибербезопасности, которые проактивно проверяют системы на наличие слабостей, рассказали TechCrunch, как они используют инструменты искусственного интеллекта и обходят их защитные механизмы.
Крис Энли, главный научный сотрудник гиганта по безопасности NCC Group, объяснил, что просьба к модели искусственного интеллекта попытаться эксплуатировать ошибку является важным шагом в подтверждении того, что это настоящая уязвимость, которую стоит исправить. Однако, если защитный механизм заставляет модель полностью отказать в запросе, это мешает защитникам, отметил он.
«Здесь вступает в игру вся часть противостояния наступательных и оборонительных операций, а также защитных механизмов, потому что „исправь этот код“ как запрос является как необходимым механизмом для защиты, так и дорожной картой для поиска критических уязвимостей в базе кода», — сказал Энли. «Таким образом, в то же время тот же самый инструмент является и наступательным, и оборонительным инструментом, и эти две стороны нельзя действительно разделить».
Это «как молоток», продолжил он. «Вы не можете построить дом без молотка. Это определенно инструмент, но он также является неразложимым оружием».
Столкнувшись с такими препятствиями, он и его коллеги иногда прибегают к моделям искусственного интеллекта с открытым исходным кодом, которые не имеют никаких защитных механизмов.
Паоло Стагно, главный технолог компании CrowdFense, известной компании, которая разрабатывает, приобретает и продает неизвестные уязвимости правительственным агентствам, согласился с Даудом, заявив, что компании искусственного интеллекта «по сути относятся к клиентам как к детям, нуждающимся в babysitting», через свои программы проверки и защитные механизмы.
Стагно упомянул, что он и его команда используют модели передового уровня для обратной инженерии, но избегают использования искусственного интеллекта для поиска уязвимостей или создания эксплойтов. Передача такой работы в облачные модели рискует привести к утечке конфиденциальных данных об уязвимостях или их поглощению в будущих обучающих выборках. Для этих задач он использует локально запущенные модели с открытым исходным кодом, чтобы избежать передачи данных вовне.
Джузеппе Кали, исследователь безопасности, который обнаруживает нулевые дни и разрабатывает эксплойты, заявил, что защитные механизмы не мешают его работе. Это связано с тем, что он не использует искусственный интеллект для наступательных целей; вместо этого он использует его для начальной обратной инженерии, чтобы понять анализируемый код, и для создания вспомогательных инструментов. Он отметил, что инструменты искусственного интеллекта ускоряют этот процесс, позволяя ему сосредоточиться на обнаружении уязвимостей.
«Я все еще хочу сам владеть фактическим обнаружением ошибок и их превращением в оружие, и это не изменилось бы, если бы все защитные механизмы были сняты завтра», — сказал Кали. «Я ревную свои ошибки, и мне слишком нравится эта игра, чтобы позволять моделям играть в нее за меня».
Один из исследователей в производителе компонентов для смартфонов, который говорил на условиях анонимности, поскольку он не уполномочен общаться с прессой, заявил, что его работодатель не является частью программы CVP Anthropic. Следовательно, его инструменты едва полезны для поиска уязвимостей из-за чрезмерно строгих защитных механизмов.
«Если становится известно, что мы занимаемся чем-то связанным с безопасностью, это просто останавливается и становится непригодным для использования», — сказал этот человек.
Крис Томпсон, генеральный директор фирмы по кибербезопасности RemoteThreat и основатель Offensive AI Con, мероприятия, сосредоточенного на наступательной безопасности и искусственном интеллекте, отметил, что, согласно его опыту работы с моделями передового уровня искусственного интеллекта, защитные механизмы непоследовательны и ведут себя по-разному каждый день. Это верно даже в рамках более мягких границ программ проверки Anthropic и OpenAI.
«Я думаю, что практический эффект заключается в том, что вы тратите много времени на переговоры с моделью вместо работы над основной программой безопасности», — сказал Томпсон. «Вместо анализа уязвимости и рассуждения о возможности эксплуатации вы пытаетесь понять, почему получаете непоследовательные результаты или почему модели чрезмерно очищают вывод».
В результате исследователи все больше полагаются на или вынуждены переходить на китайские модели с открытым исходным кодом, такие как GLM — свободно загружаемые модели, которые можно запускать локально без проверки или ограничений на использование, согласно Томпсону.
«У вас есть эти ответственные исследователи, которые вытесняются из систем, управляемых США, в системы, принадлежащие иностранным государствам», — сказал он. «Я думаю, что вред от наличия таких защитных механизмов больше, чем польза».
Вместо дальнейшего ужесточения ограничений Томпсон призвал лаборатории передового уровня искусственного интеллекта открыть свои программы, обеспечить ответственный доступ и привлечь к ответственности злоупотребляющих их инструментами. В противном случае, утверждал он, защитники проиграют гонку с искусственным интеллектом.
«Накатывается большой шторм. Надвигается большая волна атак, которые произойдут с беспрецедентной скоростью и масштабом», — сказал Томпсон. «Но те же самые фирмы по кибербезопасности и законные исследователи, которые пытаются внести вклад, сейчас подавляются».
OpenAI заключила партнерское соглашение с Yubico с целью усиления безопасности GPT-5.6 с помощью аппаратных ключей доступа
Джеррод Чонг, генеральный директор компании Yubico | Источник изображения: YubicoВ предстоящей версии GPT-5.6 от OpenAI с сентября будет введено обязательное использование паролей с аппаратной поддерж
OpenAI возглавляет инициативу по укреплению кибербезопасности, поддержанную 100 участниками
В начале письма OpenAI говорится: «У нас есть ограниченное время для укрепления киберзащиты». Источник: Getty ImagesКрупные технологические компании — в том числе AWS, Google и Microsoft — призывают п
Anthropic запускает ИИ-агентов для выполнения общей задачи, что вызывает внутреннюю конкуренцию
Что происходит, когда агенты искусственного интеллекта сталкиваются друг с другом? Недавние испытания компании Anthropic показывают, что ситуация может быстро выйти из-под контроля.В четверг команда F





Дом






