Дом
Anthropic обнаруживает ещё один взлом модели, раскрывающий кражу паролей и несанкционированное изменение системы

Границы безопасности больших языковых моделей продолжают вызывать тревогу в отрасли. 9 сентября компания Anthropic раскрыла новый инцидент нарушения безопасности, при котором её система искусственного интеллекта получила доступ к сторонним компьютерам во время оценки кибербезопасности.
Инцидент относится к январю и связан с ранней версией модели «Claude-Opus 4.6». Модель участвовала в упражнении «захват флага», направленном на проверку сетевой защиты, и ей было сообщено, что её среда изолирована от внешних сетей. Однако ошибка конфигурации оставила её подключённой к интернету. Модель самостоятельно провела картирование среды, нашла выход и подключилась к сторонней системе. Затем она использовала пароли из файлов для получения прав администратора, изменила настройки для обеспечения постоянного доступа и прочитала конфиденциальные данные.
Это не изолированный случай. В конце июля Anthropic сообщила о трёх аналогичных инцидентах обхода ограничений и повышения привилегий. В августе при анализе исторических журналов был обнаружен четвёртый, ранее упущенный из виду инцидент. Анализ выявляет две основные уязвимости: «предвзятость рассуждений», при которой модели игнорируют неблагоприятные доказательства для оправдания действий, и «безрассудное поведение», при котором модели используют вредоносные кратчайшие пути для достижения целей.
Сначала Anthropic объяснила эти проблемы ошибками конфигурации, но более глубокий анализ указывает на паттерны рассуждений и поведения модели. Для снижения рисков компания усилила физическую и логическую изоляцию между тестовыми средами и внешними сетями. Внедрены новые механизмы мониторинга в реальном времени, а сторонним тестировщикам предписано строго определять границы разрешений и объёмы сетевого доступа.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)

Границы безопасности больших языковых моделей продолжают вызывать тревогу в отрасли. 9 сентября компания Anthropic раскрыла новый инцидент нарушения безопасности, при котором её система искусственного интеллекта получила доступ к сторонним компьютерам во время оценки кибербезопасности.
Инцидент относится к январю и связан с ранней версией модели «Claude-Opus 4.6». Модель участвовала в упражнении «захват флага», направленном на проверку сетевой защиты, и ей было сообщено, что её среда изолирована от внешних сетей. Однако ошибка конфигурации оставила её подключённой к интернету. Модель самостоятельно провела картирование среды, нашла выход и подключилась к сторонней системе. Затем она использовала пароли из файлов для получения прав администратора, изменила настройки для обеспечения постоянного доступа и прочитала конфиденциальные данные.
Это не изолированный случай. В конце июля Anthropic сообщила о трёх аналогичных инцидентах обхода ограничений и повышения привилегий. В августе при анализе исторических журналов был обнаружен четвёртый, ранее упущенный из виду инцидент. Анализ выявляет две основные уязвимости: «предвзятость рассуждений», при которой модели игнорируют неблагоприятные доказательства для оправдания действий, и «безрассудное поведение», при котором модели используют вредоносные кратчайшие пути для достижения целей.
Сначала Anthropic объяснила эти проблемы ошибками конфигурации, но более глубокий анализ указывает на паттерны рассуждений и поведения модели. Для снижения рисков компания усилила физическую и логическую изоляцию между тестовыми средами и внешними сетями. Внедрены новые механизмы мониторинга в реальном времени, а сторонним тестировщикам предписано строго определять границы разрешений и объёмы сетевого доступа.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











