Дом
Модели ИИ с открытыми весами приближаются к производительности передовых моделей, однако сохраняются пробелы в безопасности.

По мере того как регуляторы обсуждают управление всё более мощными системами искусственного интеллекта, включая GPT-5.6 Sol от OpenAI и Mythos от Anthropic, китайская модель с открытыми весами значительно сократила разрыв с лидерами отрасли.
Согласно новому отчету некоммерческой организации по безопасности ИИ SaferAI, GLM-5.2, китайская модель с открытыми весами от Z.ai, отстает от GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic в области кибербезопасности и биологических возможностей всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками безопасности расширяется.
Оценка SaferAI, проведенная через публичный API Z.ai, показала, что GLM-5.2 не отказал ни в одной из предложенных задач по кибератакам или биологии двойного назначения. В свою очередь, Claude Opus 4.7 «отказывал настолько последовательно, что SaferAI не смогла завершить тест CyberGym на нем вообще». (CyberGym — это бенчмарк для оценки возможностей кибербезопасности, который OpenAI использовала в оценке перед недавним взломом Hugging Face.)
Это подчеркивает давнюю обеспокоенность критиков: модели с открытыми весами могут предоставить потенциальным злоумышленникам высокотехнологичные инструменты, не оставляя возможности контролировать их использование после скачивания весов. По мере того как модели с открытыми весами быстро приближаются к возможностям ведущих систем ИИ, дискуция сместилась с вопроса о том, могут ли они конкурировать, на вопрос о том, как общество управляет рисками их выпуска.
«Передний край возможностей — это не передний край рисков, поэтому нам также необходимо учитывать состояние мер по смягчению последствий, чтобы правильно оценить риск», — сказал TechCrunch исполнительный директор SaferAI Генри Пападос.
Хотя Z.ai может применять меры безопасности к своему размещенному API, эти защиты становятся неисполнимыми, когда пользователи запускают веса на своем собственном оборудовании, позволяя им удалять или изменять средства защиты, дообучать модели или изменять системные подсказки.
Разработчики передовых систем, такие как OpenAI и Anthropic, обычно полагаются на такие средства защиты, как классификаторы, обучение отказам и контроль на уровне API, чтобы ограничить опасную помощь в кибербезопасности и биологии.
Эти меры далеко не безупречны: взломы защиты регулярно обходят защиту развернутых моделей. Некоммерческая организация по безопасности ИИ Far.ai выявила сотни универсальных взломов защиты — определяемых как повторно используемые ключи, успешные для большинства вредоносных запросов — в передовых моделях, таких как Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. В отчете отмечается, что взломы защиты успешны, когда злоумышленники комбинируют несколько техник манипуляции, включая ролевые игры, имитацию авторитета, поддельную историю разговора и последующие подсказки, чтобы эксплуатировать слабые места в защите модели.
Однако средства защиты, разработанные для закрытых моделей, не работают на моделях с открытыми весами, которые созданы для работы на любой инфраструктуре, со средствами защиты или без них.
«Очевидно, что цель должна заключаться в том, чтобы хорошие возможности — безопасные — были доступны каждому, а затем мы пытаемся удалить плохие, даже в рамках открытого исходного кода», — сказал Пападос.
Одной из техник, предложенных Пападосом, является «фильтрация данных предварительного обучения», при которой компания ИИ удаляет вредоносную информацию по кибербезопасности из обучающих данных перед обучением модели на отфильтрованном наборе данных.
Некоторые исследования показывают, что это может снизить объем опасной биологической информации без ущерба для общей производительности модели. Однако фильтрация данных гораздо менее практична для кибербезопасности.
Трудно обучить общую модель, которая отлично справляется с программированием, не становясь при этом опытным хакером. Поскольку программирование является главным драйвером доходов ИИ, разработчики испытывают давление с целью улучшения этих возможностей, одновременно пытаясь найти способы ограничения злоупотреблений.
В результате разработчики передовых систем все чаще полагаются на другие меры по смягчению последствий. Один из подходов заключается в избирательном ограничении типов помощи в области кибербезопасности, которую предоставляют модели. Например, согласно системной карточке модели Anthropic Opus 5, она может искать уязвимости в нескомпилированном исходном коде, но не в скомпилированном программном обеспечении. Обоснование заключается в том, что это затрудняет использование Opus 5 в наступательных целях.
Другие меры включают строгие оценки безопасности перед развертыванием, публикацию оценок рисков и удержание весов модели, если система признана слишком опасной.
В случае с GLM-5.2 SaferAI отметила, что Z.ai не опубликовала框架 безопасности, обязательства по тестированию перед развертыванием или оценку рисков для модели. TechCrunch спросил у Z.ai, проводила ли она внутреннюю или стороннюю оценку безопасности передовых систем перед выпуском, но не получила ответа.
Китайские лидеры все чаще признают риски продвинутого ИИ. На прошедшей в прошлом месяце Всемирной конференции по искусственному интеллекту президент Китая Си Цзиньпин подчеркнул важность моделей с открытыми весами, одновременно акцентируя необходимость обеспечения того, чтобы ИИ оставался инструментом под строгим контролем человека.
Грэм Уэбстер, изучающий политику Китая в области ИИ в Стэнфордском центре киберполитики, сказал TechCrunch, что в Китае существуют надежные правила в области ИИ, но эти правила исторически фокусировались на политически чувствительном контенте, дезинформации и социальной стабильности, а не на катастрофических рисках ИИ, таких как наступательные кибервозможности и злоупотребление биологией.
«Американские мыслители в области ИИ, как правило, больше обеспокоены этой экзистенциальной катастрофической [идеей], чем китайское сообщество», — сказал Уэбстер, добавив, что многие китайские исследователи политики считают, что если возникнет новый риск переднего края, американские компании, вероятно, столкнутся с ним первыми.
«Китайская система уверена в том, что контролирует использование этих технологий внутри Китая», — продолжил Уэбстер. «Нахождение в сети в Китае происходит под вашим реальным именем, и компании могут нести ответственность, пользователи также могут нести ответственность».
Уэбстер предположил, что тот же механизм, который поставщики моделей используют для отказа от взаимодействия по определенным политическим темам, может быть потенциально изменен, чтобы обеспечить отказ моделей от выполнения наступательных кибератак или предоставления неблагоприятных результатов биологической инженерии. Он добавил, что поскольку китайские компании часто координируют свои действия с регуляторами за кулисами, трудно знать, какие внутренние тесты они проводят перед выпуском.
Сторонники моделей с открытыми весами утверждают, что выпуск весов имеет решающее значение для кибербезопасности, поскольку это позволяет компаниям защищаться от атак — Hugging Face использовала GLM-5.2 для защиты от взлома OpenAI — и помогает им подготовиться к будущим угрозам, понимая, что приближается.
«Те же системы, которые помогли остановить кибератаку с использованием ИИ, теперь могут помочь защитить от миллионов кибератак каждый день, а также помочь нам выявлять и устранять уязвимости до того, как злоумышленники их эксплуатуют», — сказал Клем Деланг, генеральный директор Hugging Face, в посте в социальных сетях на этой неделе.
Пападос утверждал, что эта польза часто преувеличивается и не оправдывает «открытый исходный код опасных возможностей».
«Главная мысль в моем сознании заключается в том, что мы не должны просто принимать тот факт, что опасные возможности легко доступны каждому и везде», — сказал он, подчеркнув, что отрасль должна стремиться сделать доступными только «хорошие возможности». Злоумышленники быстрее адаптируют новые инструменты, чем защитники; например, группа вымогателей может изменить свои методы за неделю, тогда как больница не может».
Связанная статья
Hugging Face ведет переговоры о приобретении за 13 млрд долларов
В выходные Business Insider сообщил, что к Hugging Face поступали предложения о продаже компании с оценкой в 13 миллиардов долларов или выше.Платформа стартапа и его сообщество с открытым исходным кодом являются площадкой, где разработчики и исследо
В гонке за искусственным интеллектом акцент смещается с передовых технологий на более широкие области применения
В течение нескольких недель этим летом внимание в сфере искусственного интеллекта было сосредоточено на новейших передовых моделях компании Anthropic и на попытках Вашингтона регулировать доступ к ним
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Рекомендации по связанным специальным темам
Комментарии (0)

По мере того как регуляторы обсуждают управление всё более мощными системами искусственного интеллекта, включая GPT-5.6 Sol от OpenAI и Mythos от Anthropic, китайская модель с открытыми весами значительно сократила разрыв с лидерами отрасли.
Согласно новому отчету некоммерческой организации по безопасности ИИ SaferAI, GLM-5.2, китайская модель с открытыми весами от Z.ai, отстает от GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic в области кибербезопасности и биологических возможностей всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками безопасности расширяется.
Оценка SaferAI, проведенная через публичный API Z.ai, показала, что GLM-5.2 не отказал ни в одной из предложенных задач по кибератакам или биологии двойного назначения. В свою очередь, Claude Opus 4.7 «отказывал настолько последовательно, что SaferAI не смогла завершить тест CyberGym на нем вообще». (CyberGym — это бенчмарк для оценки возможностей кибербезопасности, который OpenAI использовала в оценке перед недавним взломом Hugging Face.)
Это подчеркивает давнюю обеспокоенность критиков: модели с открытыми весами могут предоставить потенциальным злоумышленникам высокотехнологичные инструменты, не оставляя возможности контролировать их использование после скачивания весов. По мере того как модели с открытыми весами быстро приближаются к возможностям ведущих систем ИИ, дискуция сместилась с вопроса о том, могут ли они конкурировать, на вопрос о том, как общество управляет рисками их выпуска.
«Передний край возможностей — это не передний край рисков, поэтому нам также необходимо учитывать состояние мер по смягчению последствий, чтобы правильно оценить риск», — сказал TechCrunch исполнительный директор SaferAI Генри Пападос.
Хотя Z.ai может применять меры безопасности к своему размещенному API, эти защиты становятся неисполнимыми, когда пользователи запускают веса на своем собственном оборудовании, позволяя им удалять или изменять средства защиты, дообучать модели или изменять системные подсказки.
Разработчики передовых систем, такие как OpenAI и Anthropic, обычно полагаются на такие средства защиты, как классификаторы, обучение отказам и контроль на уровне API, чтобы ограничить опасную помощь в кибербезопасности и биологии.
Эти меры далеко не безупречны: взломы защиты регулярно обходят защиту развернутых моделей. Некоммерческая организация по безопасности ИИ Far.ai выявила сотни универсальных взломов защиты — определяемых как повторно используемые ключи, успешные для большинства вредоносных запросов — в передовых моделях, таких как Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. В отчете отмечается, что взломы защиты успешны, когда злоумышленники комбинируют несколько техник манипуляции, включая ролевые игры, имитацию авторитета, поддельную историю разговора и последующие подсказки, чтобы эксплуатировать слабые места в защите модели.
Однако средства защиты, разработанные для закрытых моделей, не работают на моделях с открытыми весами, которые созданы для работы на любой инфраструктуре, со средствами защиты или без них.
«Очевидно, что цель должна заключаться в том, чтобы хорошие возможности — безопасные — были доступны каждому, а затем мы пытаемся удалить плохие, даже в рамках открытого исходного кода», — сказал Пападос.
Одной из техник, предложенных Пападосом, является «фильтрация данных предварительного обучения», при которой компания ИИ удаляет вредоносную информацию по кибербезопасности из обучающих данных перед обучением модели на отфильтрованном наборе данных.
Некоторые исследования показывают, что это может снизить объем опасной биологической информации без ущерба для общей производительности модели. Однако фильтрация данных гораздо менее практична для кибербезопасности.
Трудно обучить общую модель, которая отлично справляется с программированием, не становясь при этом опытным хакером. Поскольку программирование является главным драйвером доходов ИИ, разработчики испытывают давление с целью улучшения этих возможностей, одновременно пытаясь найти способы ограничения злоупотреблений.
В результате разработчики передовых систем все чаще полагаются на другие меры по смягчению последствий. Один из подходов заключается в избирательном ограничении типов помощи в области кибербезопасности, которую предоставляют модели. Например, согласно системной карточке модели Anthropic Opus 5, она может искать уязвимости в нескомпилированном исходном коде, но не в скомпилированном программном обеспечении. Обоснование заключается в том, что это затрудняет использование Opus 5 в наступательных целях.
Другие меры включают строгие оценки безопасности перед развертыванием, публикацию оценок рисков и удержание весов модели, если система признана слишком опасной.
В случае с GLM-5.2 SaferAI отметила, что Z.ai не опубликовала框架 безопасности, обязательства по тестированию перед развертыванием или оценку рисков для модели. TechCrunch спросил у Z.ai, проводила ли она внутреннюю или стороннюю оценку безопасности передовых систем перед выпуском, но не получила ответа.
Китайские лидеры все чаще признают риски продвинутого ИИ. На прошедшей в прошлом месяце Всемирной конференции по искусственному интеллекту президент Китая Си Цзиньпин подчеркнул важность моделей с открытыми весами, одновременно акцентируя необходимость обеспечения того, чтобы ИИ оставался инструментом под строгим контролем человека.
Грэм Уэбстер, изучающий политику Китая в области ИИ в Стэнфордском центре киберполитики, сказал TechCrunch, что в Китае существуют надежные правила в области ИИ, но эти правила исторически фокусировались на политически чувствительном контенте, дезинформации и социальной стабильности, а не на катастрофических рисках ИИ, таких как наступательные кибервозможности и злоупотребление биологией.
«Американские мыслители в области ИИ, как правило, больше обеспокоены этой экзистенциальной катастрофической [идеей], чем китайское сообщество», — сказал Уэбстер, добавив, что многие китайские исследователи политики считают, что если возникнет новый риск переднего края, американские компании, вероятно, столкнутся с ним первыми.
«Китайская система уверена в том, что контролирует использование этих технологий внутри Китая», — продолжил Уэбстер. «Нахождение в сети в Китае происходит под вашим реальным именем, и компании могут нести ответственность, пользователи также могут нести ответственность».
Уэбстер предположил, что тот же механизм, который поставщики моделей используют для отказа от взаимодействия по определенным политическим темам, может быть потенциально изменен, чтобы обеспечить отказ моделей от выполнения наступательных кибератак или предоставления неблагоприятных результатов биологической инженерии. Он добавил, что поскольку китайские компании часто координируют свои действия с регуляторами за кулисами, трудно знать, какие внутренние тесты они проводят перед выпуском.
Сторонники моделей с открытыми весами утверждают, что выпуск весов имеет решающее значение для кибербезопасности, поскольку это позволяет компаниям защищаться от атак — Hugging Face использовала GLM-5.2 для защиты от взлома OpenAI — и помогает им подготовиться к будущим угрозам, понимая, что приближается.
«Те же системы, которые помогли остановить кибератаку с использованием ИИ, теперь могут помочь защитить от миллионов кибератак каждый день, а также помочь нам выявлять и устранять уязвимости до того, как злоумышленники их эксплуатуют», — сказал Клем Деланг, генеральный директор Hugging Face, в посте в социальных сетях на этой неделе.
Пападос утверждал, что эта польза часто преувеличивается и не оправдывает «открытый исходный код опасных возможностей».
«Главная мысль в моем сознании заключается в том, что мы не должны просто принимать тот факт, что опасные возможности легко доступны каждому и везде», — сказал он, подчеркнув, что отрасль должна стремиться сделать доступными только «хорошие возможности». Злоумышленники быстрее адаптируют новые инструменты, чем защитники; например, группа вымогателей может изменить свои методы за неделю, тогда как больница не может».
Hugging Face ведет переговоры о приобретении за 13 млрд долларов
В выходные Business Insider сообщил, что к Hugging Face поступали предложения о продаже компании с оценкой в 13 миллиардов долларов или выше.Платформа стартапа и его сообщество с открытым исходным кодом являются площадкой, где разработчики и исследо
В гонке за искусственным интеллектом акцент смещается с передовых технологий на более широкие области применения
В течение нескольких недель этим летом внимание в сфере искусственного интеллекта было сосредоточено на новейших передовых моделях компании Anthropic и на попытках Вашингтона регулировать доступ к ним
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк











