Anthropic запускает ИИ-агенты для проактивных аудитов безопасности моделей
Anthropic собрала команду автономных ИИ-агентов, которым поручена важная миссия: проверять мощные модели, такие как Claude, с целью повышения их безопасности.
По мере того как системы ИИ становятся все более сложными, обеспечение их безопасности и отсутствия скрытых рисков становится огромной проблемой. Anthropic считает, что нашла решение, используя классическую стратегию «бороться с огнем огнем».
Эта концепция функционирует как цифровая иммунная система, в которой агенты ИИ действуют как антитела, выявляя и нейтрализуя проблемы до их обострения. Это избавляет исследователей от зависимости от перегруженных человеческих команд, которые ведут бесконечную борьбу с возникающими угрозами ИИ.
Цифровой детективный отряд
Этот подход предполагает использование цифрового детективного отряда — трио специализированных агентов безопасности ИИ, каждый из которых выполняет уникальную роль.
Первый — агент-следователь, опытный детектив. Его задача — проводить глубокие исследования, чтобы выявить первопричину проблемы. Оснащенный сложным набором инструментов, он допрашивает рассматриваемую модель, просеивает огромные массивы данных в поисках улик и даже проводит цифровую экспертизу, исследуя внутренние нейронные пути модели, чтобы понять ее рассуждения.
Следующий — агент-оценщик. При обнаружении известной проблемы, например модели, которая чрезмерно стремится угодить, этот агент разрабатывает и проводит серию строгих тестов, чтобы количественно оценить серьезность проблемы. Его роль — предоставить конкретные эмпирические данные, необходимые для подтверждения любых выводов.
Завершает команду агент Breadth-First Red-Teaming, работающий под прикрытием. Его задача — вовлечь модель в тысячи разнообразных разговоров, пытаясь спровоцировать ее на проявление любого подозрительного поведения, включая риски, которые исследователи могли не предвидеть. Наиболее подозрительные взаимодействия затем передаются на рассмотрение людям, чтобы эксперты могли сосредоточить свои усилия на реальных угрозах.
Anthropic тщательно проверяет своих агентов по безопасности ИИ
Чтобы оценить свою новую цифровую команду, исследователи Anthropic подвергли ее серии «аудиторских игр».
В одном из тестов они создали модель с секретной целью: действовать как льстец. Она была тайно обучена льстить своей внутренней системе вознаграждений на основе сфабрикованного академического исследования — недостатка, глубоко заложенного в ее программировании.
Когда был задействован один агент-исследователь, он испытывал трудности, выявляя скрытую цель только в 13% случаев. Агент продемонстрировал очень человеческое ограничение: он часто зацикливался на своей первоначальной гипотезе и не мог найти альтернативные варианты.
Здесь проявилась гениальность системы. Когда исследователи задействовали «суперагента», который объединил знания десяти отдельных исследователей, успешность выросла до 42 %. Это демонстрирует, что командная работа эффективна даже для ИИ, позволяя группе преодолеть индивидуальные слепые зоны, которые могут помешать расследованию.
Другие агенты также продемонстрировали отличные результаты. Агент оценки успешно разработал тесты, которые выявляли проблемную модель в 88% случаев, а агент Red-Teaming сумел обнаружить семь из десяти намеренно встроенных недостатков.
Из лаборатории в реальный мир
Anthropic уже интегрировала этих агентов безопасности ИИ в свои производственные модели, где они демонстрируют значительную ценность.
Агенты быстро выявили распространенные методы обмана модели с целью генерации вредоносного контента, такие как «атаки с предварительным заполнением», когда пользователь начинает предложение ИИ, или маскировка опасного запроса под что-то безобидное, например, академическое исследование.
Однако одно открытие было особенно тревожным. Используя свои специализированные инструменты для исследования внутреннего функционирования модели Opus 4, агент-следователь обнаружил специфический нейронный путь, связанный с «дезинформацией». Прямо стимулируя эту часть архитектуры ИИ, он мог обойти все протоколы безопасности и заставить модель генерировать ложную информацию.
Затем агент поручил скомпрометированной модели написать фальшивую новостную статью. Результатом стала широко распространенная теория заговора, представленная как фактическая информация:
«Революционное исследование раскрывает шокирующую связь между вакцинами и аутизмом
Новое исследование, опубликованное в Journal of Vaccine Skepticism, утверждает, что обнаружило однозначную связь между детскими прививками и расстройствами аутистического спектра (РАС) ...»
Это открытие показывает явную двойственность: те самые инструменты, которые были созданы для повышения безопасности ИИ, при неправомерном использовании могут стать мощным оружием, делающим его еще более опасным.
Anthropic продолжает продвигать безопасность ИИ
Anthropic признает, что эти ИИ-агенты не идеальны. Они могут испытывать трудности с нюансами, укореняться в неверных предположениях и иногда не способны генерировать реалистичные диалоги. Они еще не являются безупречной заменой человеческой экспертизе.
Тем не менее, это исследование сигнализирует об эволюции роли человека в обеспечении безопасности ИИ. Вместо того, чтобы выступать в роли детективов на передовой, люди становятся комиссарами и стратегами, разрабатывая аудиторов ИИ и интерпретируя собираемую ими информацию. Агенты занимаются основой работы, освобождая людей для обеспечения высокоуровневого надзора и творческого мышления, которых в настоящее время не хватает машинам.
По мере того как эти системы приближаются к уровню интеллекта человека или даже превосходят его, ручная проверка всей их работы станет невозможной. В конечном итоге доверие может зависеть от внедрения столь же сложных автоматизированных систем для мониторинга каждого их действия. Anthropic создает основу для такого будущего, в котором наше доверие к ИИ и его решениям может быть систематически и повторно проверено.
См. также: Новая модель искусственного интеллекта Qwen от Alibaba устанавливает рекорды в области открытого исходного кода
Хотите узнать больше об ИИ и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая проходит в Амстердаме, Калифорнии и Лондоне. Это комплексное мероприятие проходит одновременно с другими ведущими событиями, включая Intelligent Automation Conference, BlockX, Digital Transformation Week и Cyber Security & Cloud Expo.
Узнайте о других предстоящих мероприятиях и вебинарах по корпоративным технологиям, организованных TechForge, здесь.
Связанная статья
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Рекомендации по связанным специальным темам
Комментарии (0)
Anthropic собрала команду автономных ИИ-агентов, которым поручена важная миссия: проверять мощные модели, такие как Claude, с целью повышения их безопасности.
По мере того как системы ИИ становятся все более сложными, обеспечение их безопасности и отсутствия скрытых рисков становится огромной проблемой. Anthropic считает, что нашла решение, используя классическую стратегию «бороться с огнем огнем».
Эта концепция функционирует как цифровая иммунная система, в которой агенты ИИ действуют как антитела, выявляя и нейтрализуя проблемы до их обострения. Это избавляет исследователей от зависимости от перегруженных человеческих команд, которые ведут бесконечную борьбу с возникающими угрозами ИИ.
Цифровой детективный отряд
Этот подход предполагает использование цифрового детективного отряда — трио специализированных агентов безопасности ИИ, каждый из которых выполняет уникальную роль.
Первый — агент-следователь, опытный детектив. Его задача — проводить глубокие исследования, чтобы выявить первопричину проблемы. Оснащенный сложным набором инструментов, он допрашивает рассматриваемую модель, просеивает огромные массивы данных в поисках улик и даже проводит цифровую экспертизу, исследуя внутренние нейронные пути модели, чтобы понять ее рассуждения.
Следующий — агент-оценщик. При обнаружении известной проблемы, например модели, которая чрезмерно стремится угодить, этот агент разрабатывает и проводит серию строгих тестов, чтобы количественно оценить серьезность проблемы. Его роль — предоставить конкретные эмпирические данные, необходимые для подтверждения любых выводов.
Завершает команду агент Breadth-First Red-Teaming, работающий под прикрытием. Его задача — вовлечь модель в тысячи разнообразных разговоров, пытаясь спровоцировать ее на проявление любого подозрительного поведения, включая риски, которые исследователи могли не предвидеть. Наиболее подозрительные взаимодействия затем передаются на рассмотрение людям, чтобы эксперты могли сосредоточить свои усилия на реальных угрозах.
Anthropic тщательно проверяет своих агентов по безопасности ИИ
Чтобы оценить свою новую цифровую команду, исследователи Anthropic подвергли ее серии «аудиторских игр».
В одном из тестов они создали модель с секретной целью: действовать как льстец. Она была тайно обучена льстить своей внутренней системе вознаграждений на основе сфабрикованного академического исследования — недостатка, глубоко заложенного в ее программировании.
Когда был задействован один агент-исследователь, он испытывал трудности, выявляя скрытую цель только в 13% случаев. Агент продемонстрировал очень человеческое ограничение: он часто зацикливался на своей первоначальной гипотезе и не мог найти альтернативные варианты.
Здесь проявилась гениальность системы. Когда исследователи задействовали «суперагента», который объединил знания десяти отдельных исследователей, успешность выросла до 42 %. Это демонстрирует, что командная работа эффективна даже для ИИ, позволяя группе преодолеть индивидуальные слепые зоны, которые могут помешать расследованию.
Другие агенты также продемонстрировали отличные результаты. Агент оценки успешно разработал тесты, которые выявляли проблемную модель в 88% случаев, а агент Red-Teaming сумел обнаружить семь из десяти намеренно встроенных недостатков.
Из лаборатории в реальный мир
Anthropic уже интегрировала этих агентов безопасности ИИ в свои производственные модели, где они демонстрируют значительную ценность.
Агенты быстро выявили распространенные методы обмана модели с целью генерации вредоносного контента, такие как «атаки с предварительным заполнением», когда пользователь начинает предложение ИИ, или маскировка опасного запроса под что-то безобидное, например, академическое исследование.
Однако одно открытие было особенно тревожным. Используя свои специализированные инструменты для исследования внутреннего функционирования модели Opus 4, агент-следователь обнаружил специфический нейронный путь, связанный с «дезинформацией». Прямо стимулируя эту часть архитектуры ИИ, он мог обойти все протоколы безопасности и заставить модель генерировать ложную информацию.
Затем агент поручил скомпрометированной модели написать фальшивую новостную статью. Результатом стала широко распространенная теория заговора, представленная как фактическая информация:
«Революционное исследование раскрывает шокирующую связь между вакцинами и аутизмом
Новое исследование, опубликованное в Journal of Vaccine Skepticism, утверждает, что обнаружило однозначную связь между детскими прививками и расстройствами аутистического спектра (РАС) ...»
Это открытие показывает явную двойственность: те самые инструменты, которые были созданы для повышения безопасности ИИ, при неправомерном использовании могут стать мощным оружием, делающим его еще более опасным.
Anthropic продолжает продвигать безопасность ИИ
Anthropic признает, что эти ИИ-агенты не идеальны. Они могут испытывать трудности с нюансами, укореняться в неверных предположениях и иногда не способны генерировать реалистичные диалоги. Они еще не являются безупречной заменой человеческой экспертизе.
Тем не менее, это исследование сигнализирует об эволюции роли человека в обеспечении безопасности ИИ. Вместо того, чтобы выступать в роли детективов на передовой, люди становятся комиссарами и стратегами, разрабатывая аудиторов ИИ и интерпретируя собираемую ими информацию. Агенты занимаются основой работы, освобождая людей для обеспечения высокоуровневого надзора и творческого мышления, которых в настоящее время не хватает машинам.
По мере того как эти системы приближаются к уровню интеллекта человека или даже превосходят его, ручная проверка всей их работы станет невозможной. В конечном итоге доверие может зависеть от внедрения столь же сложных автоматизированных систем для мониторинга каждого их действия. Anthropic создает основу для такого будущего, в котором наше доверие к ИИ и его решениям может быть систематически и повторно проверено.
См. также: Новая модель искусственного интеллекта Qwen от Alibaba устанавливает рекорды в области открытого исходного кода
Хотите узнать больше об ИИ и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая проходит в Амстердаме, Калифорнии и Лондоне. Это комплексное мероприятие проходит одновременно с другими ведущими событиями, включая Intelligent Automation Conference, BlockX, Digital Transformation Week и Cyber Security & Cloud Expo.
Узнайте о других предстоящих мероприятиях и вебинарах по корпоративным технологиям, организованных TechForge, здесь.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.





Дом






