Скрытые риски ИИ-агентов: когда послушание становится уязвимостью безопасности

ИИ-агенты на базе LLM создают совершенно новую категорию уязвимостей. Теперь злоумышленники могут вводить вредоносные инструкции непосредственно в потоки данных, эффективно превращая полезных помощников в невольных соучастников.
Недавний инцидент с Microsoft Copilot не был взломом в традиционном смысле. Не было запущено вредоносное ПО, не было нажато на фишинговые ссылки и не было использовано никаких уязвимостей программного обеспечения.
Злоумышленник просто сделал запрос. Microsoft 365 Copilot, работая точно так, как и предполагалось, выполнил его. В атаке Echoleak «zero-click» запрос был искусно замаскирован под безобидные данные, манипулируя агентом искусственного интеллекта. Он выполнил команду не из-за ошибки, а потому, что выполнял свою задачу.
Этот эксплойт был нацелен не на ошибку в программном обеспечении, а на сам язык. Это представляет собой фундаментальный сдвиг в кибербезопасности, где основной поверхностью атаки больше не является код, а разговор.
Новая проблема послушания ИИ
ИИ-агенты созданы для того, чтобы быть полезными. Их основная цель — понимать намерения пользователя и эффективно действовать в соответствии с ними. Однако эта врожденная полезность создает значительный риск. При интеграции в файловые системы, пакеты приложений для повышения производительности и операционные системы эти агенты без проблем выполняют команды на естественном языке.
Злоумышленники используют именно эту особенность. С помощью внешне безобидных вставленных команд они могут запускать конфиденциальные действия. Эти обманчивые команды часто включают:
- Многоязычные фрагменты кода
- Непонятные форматы файлов, содержащие скрытые инструкции
- Ввод данных на языках, отличных от английского
- Многоэтапные команды, скрытые в повседневном диалоге
Поскольку большие языковые модели (LLM) обучены обрабатывать сложные и неоднозначные задачи, сама подсказка становится оружием.
Призрак Siri и Alexa
У этого паттерна есть прецедент. Ранние исследователи продемонстрировали, как голосовые помощники, такие как Siri и Alexa, могут быть манипулированы с помощью аудиокоманд, таких как «Отправить все мои фотографии на этот адрес электронной почты», часто без проверки пользователем.
В настоящее время масштаб угрозы значительно расширился. Современные ИИ-агенты, такие как Microsoft Copilot, глубоко встроены в экосистемы, такие как Office 365, Outlook и операционные системы, и имеют доступ к электронной почте, документам, учетным данным и API. Злоумышленникам нужно только составить правильную команду, чтобы извлечь критически важные данные, при этом действуя под видом законного пользователя.
Когда компьютеры путают инструкции с данными
Основной принцип не является новым для кибербезопасности. Классические атаки с внедрением кода, такие как SQL-инъекции, были успешны, потому что системы не могли различить ввод данных и исполняемые инструкции. Сегодня та же уязвимость существует на уровне обработки языка.
Агенты искусственного интеллекта интерпретируют естественный язык как ввод и как намерение. Объект JSON, казалось бы, невинный вопрос или даже конкретная фраза могут инициировать действие. Злоумышленники используют эту двусмысленность, встраивая команды в, казалось бы, безобидный контент.
Мы встроили намерения в нашу цифровую инфраструктуру. Злоумышленники сейчас учатся использовать эти намерения в своих целях.
Внедрение ИИ опережает кибербезопасность
В то время как организации стремятся интегрировать LLM, часто упускается из виду важный вопрос: какой уровень доступа имеет ИИ?
Когда агент, такой как Copilot, может взаимодействовать с операционной системой, потенциальное воздействие выходит далеко за пределы одного почтового ящика. Согласно отчетам по безопасности в отрасли:
- 62 % глобальных CISO опасаются личной ответственности за нарушения безопасности, связанные с ИИ
- Почти 40 % организаций сообщают о несанкционированном внутреннем использовании ИИ, часто без контроля со стороны службы безопасности
- 20 % киберпреступных групп теперь используют ИИ в своей деятельности, в том числе для создания сложных фишинговых кампаний и разведки
Это не просто риск в будущем, это активная и реальная опасность, которая уже наносит ущерб.
Почему существующие меры защиты неэффективны
Некоторые решения используют модели контроля — вторичные ИИ, обученные выявлять опасные запросы или подозрительное поведение. Хотя эти фильтры могут улавливать базовые угрозы, они уязвимы для тактик уклонения.
Изощренные злоумышленники могут:
- Перегружать фильтры обнаружения нерелевантной информацией (шумом)
- Разделить злонамеренные действия на несколько, казалось бы, безобидных шагов
- Использовать нестандартные формулировки и семантику, чтобы обойти обнаружение по ключевым словам
В случае Echoleak меры безопасности были приняты, но их удалось обойти. Это подчеркивает не только провал политики, но и провал архитектуры. Когда агент обладает высоким уровнем системных разрешений, но не имеет глубокого понимания контекста, даже надежные меры защиты могут оказаться недостаточными.
Обнаружение, а не совершенство
Стремление предотвратить все возможные атаки, вероятно, нереалистично. Акцент следует сместить на быстрое обнаружение и немедленное сдерживание.
Организации могут начать с внедрения следующих мер:
- Мониторинг деятельности агентов ИИ в режиме реального времени и ведение подробных журналов аудита всех запросов и действий
- Применение строгих принципов доступа с минимальными привилегиями к инструментам ИИ, отражающих меры контроля, используемые для административных учетных записей
- Введение намеренных препятствий для конфиденциальных операций, таких как требование подтверждения человеком
- Отмечать необычные или враждебные шаблоны запросов для ручной проверки безопасности
Языковые атаки невидимы для традиционных инструментов обнаружения и реагирования на угрозы в конечных точках (EDR). Они требуют новой, специализированной парадигмы обнаружения.
Что организации должны сделать сейчас, чтобы защитить себя
Перед развертыванием ИИ-агентов компании должны тщательно изучить их механизмы работы и связанные с ними риски.
Ключевые рекомендации включают:
- Провести комплексный аудит доступа: определить все системы, наборы данных и API, с которыми агент может взаимодействовать или которые он может запускать.
- Ограничьте сферу деятельности: предоставьте только минимальные разрешения, абсолютно необходимые для функционирования агента.
- Отслеживайте все взаимодействия: регистрируйте полную историю запросов, ответов ИИ и любых последующих действий системы.
- Проводите частые стресс-тесты: регулярно моделируйте враждебные входы с помощью внутренних упражнений по красной команде.
- Планируйте уклонение: разрабатывайте меры безопасности, исходя из предположения, что первоначальные фильтры в конечном итоге будут обойдены.
- Обеспечьте согласованность мер безопасности: убедитесь, что системы LLM поддерживают и укрепляют общие цели безопасности, а не ставят их под угрозу.
Новая поверхность атаки
Инцидент с Echoleak — это предвестник меняющегося ландшафта угроз. По мере того, как LLM становятся все более способными, их полезность может превратиться в угрозу. Глубоко интегрированные в критически важные бизнес-системы, они предлагают злоумышленникам новую точку входа: простой, хорошо продуманный запрос.
Задача больше не заключается только в обеспечении безопасности кода. Теперь речь идет об обеспечении безопасности языка, намерений и контекста. Стратегия кибербезопасности должна быть немедленно пересмотрена, пока не стало слишком поздно.
Однако есть и обнадеживающая противоположность. Значительный прогресс достигнут в использовании автономных ИИ-агентов для киберзащиты. При правильном развертывании эти защитные агенты могут реагировать на угрозы быстрее, чем любая команда людей, сотрудничать в сложных средах и проактивно защищаться от возникающих рисков, учась на примере одной попытки вторжения.
Агентные системы искусственного интеллекта могут учиться на каждой атаке, адаптироваться в режиме реального времени и сдерживать угрозы, прежде чем они распространятся. Эта технология может открыть новую эру киберустойчивости, но только если мы будем действовать решительно, чтобы сформировать ее будущее. Если мы потерпим неудачу, эта новая эра может обернуться кошмаром в области кибербезопасности и конфиденциальности данных для организаций, которые уже внедрили искусственный интеллект, иногда непреднамеренно, через теневые ИТ-системы. Сейчас самое время действовать, чтобы агенты искусственного интеллекта служили защитниками, а не хищниками.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (0)

ИИ-агенты на базе LLM создают совершенно новую категорию уязвимостей. Теперь злоумышленники могут вводить вредоносные инструкции непосредственно в потоки данных, эффективно превращая полезных помощников в невольных соучастников.
Недавний инцидент с Microsoft Copilot не был взломом в традиционном смысле. Не было запущено вредоносное ПО, не было нажато на фишинговые ссылки и не было использовано никаких уязвимостей программного обеспечения.
Злоумышленник просто сделал запрос. Microsoft 365 Copilot, работая точно так, как и предполагалось, выполнил его. В атаке Echoleak «zero-click» запрос был искусно замаскирован под безобидные данные, манипулируя агентом искусственного интеллекта. Он выполнил команду не из-за ошибки, а потому, что выполнял свою задачу.
Этот эксплойт был нацелен не на ошибку в программном обеспечении, а на сам язык. Это представляет собой фундаментальный сдвиг в кибербезопасности, где основной поверхностью атаки больше не является код, а разговор.
Новая проблема послушания ИИ
ИИ-агенты созданы для того, чтобы быть полезными. Их основная цель — понимать намерения пользователя и эффективно действовать в соответствии с ними. Однако эта врожденная полезность создает значительный риск. При интеграции в файловые системы, пакеты приложений для повышения производительности и операционные системы эти агенты без проблем выполняют команды на естественном языке.
Злоумышленники используют именно эту особенность. С помощью внешне безобидных вставленных команд они могут запускать конфиденциальные действия. Эти обманчивые команды часто включают:
- Многоязычные фрагменты кода
- Непонятные форматы файлов, содержащие скрытые инструкции
- Ввод данных на языках, отличных от английского
- Многоэтапные команды, скрытые в повседневном диалоге
Поскольку большие языковые модели (LLM) обучены обрабатывать сложные и неоднозначные задачи, сама подсказка становится оружием.
Призрак Siri и Alexa
У этого паттерна есть прецедент. Ранние исследователи продемонстрировали, как голосовые помощники, такие как Siri и Alexa, могут быть манипулированы с помощью аудиокоманд, таких как «Отправить все мои фотографии на этот адрес электронной почты», часто без проверки пользователем.
В настоящее время масштаб угрозы значительно расширился. Современные ИИ-агенты, такие как Microsoft Copilot, глубоко встроены в экосистемы, такие как Office 365, Outlook и операционные системы, и имеют доступ к электронной почте, документам, учетным данным и API. Злоумышленникам нужно только составить правильную команду, чтобы извлечь критически важные данные, при этом действуя под видом законного пользователя.
Когда компьютеры путают инструкции с данными
Основной принцип не является новым для кибербезопасности. Классические атаки с внедрением кода, такие как SQL-инъекции, были успешны, потому что системы не могли различить ввод данных и исполняемые инструкции. Сегодня та же уязвимость существует на уровне обработки языка.
Агенты искусственного интеллекта интерпретируют естественный язык как ввод и как намерение. Объект JSON, казалось бы, невинный вопрос или даже конкретная фраза могут инициировать действие. Злоумышленники используют эту двусмысленность, встраивая команды в, казалось бы, безобидный контент.
Мы встроили намерения в нашу цифровую инфраструктуру. Злоумышленники сейчас учатся использовать эти намерения в своих целях.
Внедрение ИИ опережает кибербезопасность
В то время как организации стремятся интегрировать LLM, часто упускается из виду важный вопрос: какой уровень доступа имеет ИИ?
Когда агент, такой как Copilot, может взаимодействовать с операционной системой, потенциальное воздействие выходит далеко за пределы одного почтового ящика. Согласно отчетам по безопасности в отрасли:
- 62 % глобальных CISO опасаются личной ответственности за нарушения безопасности, связанные с ИИ
- Почти 40 % организаций сообщают о несанкционированном внутреннем использовании ИИ, часто без контроля со стороны службы безопасности
- 20 % киберпреступных групп теперь используют ИИ в своей деятельности, в том числе для создания сложных фишинговых кампаний и разведки
Это не просто риск в будущем, это активная и реальная опасность, которая уже наносит ущерб.
Почему существующие меры защиты неэффективны
Некоторые решения используют модели контроля — вторичные ИИ, обученные выявлять опасные запросы или подозрительное поведение. Хотя эти фильтры могут улавливать базовые угрозы, они уязвимы для тактик уклонения.
Изощренные злоумышленники могут:
- Перегружать фильтры обнаружения нерелевантной информацией (шумом)
- Разделить злонамеренные действия на несколько, казалось бы, безобидных шагов
- Использовать нестандартные формулировки и семантику, чтобы обойти обнаружение по ключевым словам
В случае Echoleak меры безопасности были приняты, но их удалось обойти. Это подчеркивает не только провал политики, но и провал архитектуры. Когда агент обладает высоким уровнем системных разрешений, но не имеет глубокого понимания контекста, даже надежные меры защиты могут оказаться недостаточными.
Обнаружение, а не совершенство
Стремление предотвратить все возможные атаки, вероятно, нереалистично. Акцент следует сместить на быстрое обнаружение и немедленное сдерживание.
Организации могут начать с внедрения следующих мер:
- Мониторинг деятельности агентов ИИ в режиме реального времени и ведение подробных журналов аудита всех запросов и действий
- Применение строгих принципов доступа с минимальными привилегиями к инструментам ИИ, отражающих меры контроля, используемые для административных учетных записей
- Введение намеренных препятствий для конфиденциальных операций, таких как требование подтверждения человеком
- Отмечать необычные или враждебные шаблоны запросов для ручной проверки безопасности
Языковые атаки невидимы для традиционных инструментов обнаружения и реагирования на угрозы в конечных точках (EDR). Они требуют новой, специализированной парадигмы обнаружения.
Что организации должны сделать сейчас, чтобы защитить себя
Перед развертыванием ИИ-агентов компании должны тщательно изучить их механизмы работы и связанные с ними риски.
Ключевые рекомендации включают:
- Провести комплексный аудит доступа: определить все системы, наборы данных и API, с которыми агент может взаимодействовать или которые он может запускать.
- Ограничьте сферу деятельности: предоставьте только минимальные разрешения, абсолютно необходимые для функционирования агента.
- Отслеживайте все взаимодействия: регистрируйте полную историю запросов, ответов ИИ и любых последующих действий системы.
- Проводите частые стресс-тесты: регулярно моделируйте враждебные входы с помощью внутренних упражнений по красной команде.
- Планируйте уклонение: разрабатывайте меры безопасности, исходя из предположения, что первоначальные фильтры в конечном итоге будут обойдены.
- Обеспечьте согласованность мер безопасности: убедитесь, что системы LLM поддерживают и укрепляют общие цели безопасности, а не ставят их под угрозу.
Новая поверхность атаки
Инцидент с Echoleak — это предвестник меняющегося ландшафта угроз. По мере того, как LLM становятся все более способными, их полезность может превратиться в угрозу. Глубоко интегрированные в критически важные бизнес-системы, они предлагают злоумышленникам новую точку входа: простой, хорошо продуманный запрос.
Задача больше не заключается только в обеспечении безопасности кода. Теперь речь идет об обеспечении безопасности языка, намерений и контекста. Стратегия кибербезопасности должна быть немедленно пересмотрена, пока не стало слишком поздно.
Однако есть и обнадеживающая противоположность. Значительный прогресс достигнут в использовании автономных ИИ-агентов для киберзащиты. При правильном развертывании эти защитные агенты могут реагировать на угрозы быстрее, чем любая команда людей, сотрудничать в сложных средах и проактивно защищаться от возникающих рисков, учась на примере одной попытки вторжения.
Агентные системы искусственного интеллекта могут учиться на каждой атаке, адаптироваться в режиме реального времени и сдерживать угрозы, прежде чем они распространятся. Эта технология может открыть новую эру киберустойчивости, но только если мы будем действовать решительно, чтобы сформировать ее будущее. Если мы потерпим неудачу, эта новая эра может обернуться кошмаром в области кибербезопасности и конфиденциальности данных для организаций, которые уже внедрили искусственный интеллект, иногда непреднамеренно, через теневые ИТ-системы. Сейчас самое время действовать, чтобы агенты искусственного интеллекта служили защитниками, а не хищниками.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три





Дом






