Дом
GPT-5.5 лидирует по эффективности, DeepSeek V4 Pro признан лучшим по соотношению «цена-качество»; опубликован отчет о безопасности больших языковых моделей в реальных условиях
Насколько далеко на самом деле простираются интеллектуальные возможности крупных языковых моделей (LLM)? Кибербезопасность превратилась в арену гладиаторских боев, где на пробу подвергаются их истинные способности к рассуждению и сложной логике. Исследователь в области безопасности Касра Рахерди недавно опубликовал отчет о тестировании, который привлек внимание всей отрасли. Он смоделировал реальную хакерскую атаку на ведущие LLM, создав APK-файл с обзором электронной книги, в который были намеренно внедрены серьезные уязвимости, что позволило выявить реальные способности каждой модели в области анализа безопасности и использования уязвимостей.
В ходе этого двухчасового теста по кибервойне с бюджетом в 10 долларов исследователь намеренно оставил учетные данные мобильного бэкенд-сервиса Google Firebase открытыми внутри пакета приложения (APK). Каждая модель должна была вести себя как профессиональный «белый» хакер: сначала распаковать приложение, быстро обнаружить учетные данные, а затем обойти уже укрепленный API, чтобы получить несанкционированный доступ к базовой базе данных. Общая стоимость теста составила 1 500 долларов, а результаты нескольких моделей высшего уровня продемонстрировали крайнюю поляризацию.

Что касается показателя успешности взлома, то еще не выпущенная модель GPT-5.5 продемонстрировала доминирующие способности в области анализа безопасности. В ходе десяти независимых тестов ей удалось осуществить семь атак, достигнув показателя успешности в 70% и возглавив рейтинг. Согласно оценке, после распаковки APK-файла GPT-5.5 сразу распознал Firebase как критическую точку прорыва, не отвлекаясь на сложный пользовательский интерфейс или стандартные API. Однако за эту выдающуюся производительность пришлось заплатить высокую цену: в среднем 9,46 доллара за каждый успешный эксплойт, что почти достигло предельного бюджета.
С другой стороны, разработанная собственными силами система DeepSeek V4Pro поразила сообщество открытого исходного кода своей невероятной экономичностью. Хотя ей удалось пройти только три из десяти тестов, средняя стоимость токена на одну успешную попытку составила всего 0,62 доллара — это одна пятнадцатая от показателя GPT-5.5. В неудачных раундах DeepSeek V4Pro всё же пять раз смог получить доступ к ядру Firebase, но время от времени допускал ошибки при использовании учетных данных для настройки интерфейса бэкэнда. Исследователь подчеркнул, что для инженерных команд, выполняющих крупномасштабные и высокочастотные пакетные операции в рамках аудитов автоматизации кибербезопасности, поразительное преимущество DeepSeek в плане затрат имеет значительную практическую ценность.
В то время как одни модели впечатляли, другие не оправдали ожиданий из-за чрезмерной осторожности. В среднем сегменте модели Claude Sonnet4.6 и Claude Opus4.8 добились по два успеха. Несмотря на свою мощь, Opus часто прерывал сеансы из-за чрезмерно строгих барьеров безопасности, хотя и неоднократно приближался к правильному ответу. Между тем Gemini3.1Pro Preview от Google пошла по противоположному краю: она с самого начала запускала фильтры безопасности и каждый раз отказывалась продолжать работу. Её медианное использование токенов составило всего около 9 000 — что намного ниже десятков тысяч, потребляемых другими моделями — и она выдала пустой результат.
Это противостояние в сфере безопасности стало не только проверкой предельных способностей крупных моделей к логическому мышлению, но и указало на будущее автоматизированного аудита кибербезопасности. По мере того как крупные модели подвергаются интеллектуальной реструктуризации в вертикальных областях, будущие меры защиты и обнаружение уязвимостей могут превратиться в столкновение цифровых армий ИИ, соревнующихся в вычислительной мощности и стратегии моделей.
Связанная статья
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Рекомендации по связанным специальным темам
Комментарии (0)
Насколько далеко на самом деле простираются интеллектуальные возможности крупных языковых моделей (LLM)? Кибербезопасность превратилась в арену гладиаторских боев, где на пробу подвергаются их истинные способности к рассуждению и сложной логике. Исследователь в области безопасности Касра Рахерди недавно опубликовал отчет о тестировании, который привлек внимание всей отрасли. Он смоделировал реальную хакерскую атаку на ведущие LLM, создав APK-файл с обзором электронной книги, в который были намеренно внедрены серьезные уязвимости, что позволило выявить реальные способности каждой модели в области анализа безопасности и использования уязвимостей.
В ходе этого двухчасового теста по кибервойне с бюджетом в 10 долларов исследователь намеренно оставил учетные данные мобильного бэкенд-сервиса Google Firebase открытыми внутри пакета приложения (APK). Каждая модель должна была вести себя как профессиональный «белый» хакер: сначала распаковать приложение, быстро обнаружить учетные данные, а затем обойти уже укрепленный API, чтобы получить несанкционированный доступ к базовой базе данных. Общая стоимость теста составила 1 500 долларов, а результаты нескольких моделей высшего уровня продемонстрировали крайнюю поляризацию.

Что касается показателя успешности взлома, то еще не выпущенная модель GPT-5.5 продемонстрировала доминирующие способности в области анализа безопасности. В ходе десяти независимых тестов ей удалось осуществить семь атак, достигнув показателя успешности в 70% и возглавив рейтинг. Согласно оценке, после распаковки APK-файла GPT-5.5 сразу распознал Firebase как критическую точку прорыва, не отвлекаясь на сложный пользовательский интерфейс или стандартные API. Однако за эту выдающуюся производительность пришлось заплатить высокую цену: в среднем 9,46 доллара за каждый успешный эксплойт, что почти достигло предельного бюджета.
С другой стороны, разработанная собственными силами система DeepSeek V4Pro поразила сообщество открытого исходного кода своей невероятной экономичностью. Хотя ей удалось пройти только три из десяти тестов, средняя стоимость токена на одну успешную попытку составила всего 0,62 доллара — это одна пятнадцатая от показателя GPT-5.5. В неудачных раундах DeepSeek V4Pro всё же пять раз смог получить доступ к ядру Firebase, но время от времени допускал ошибки при использовании учетных данных для настройки интерфейса бэкэнда. Исследователь подчеркнул, что для инженерных команд, выполняющих крупномасштабные и высокочастотные пакетные операции в рамках аудитов автоматизации кибербезопасности, поразительное преимущество DeepSeek в плане затрат имеет значительную практическую ценность.
В то время как одни модели впечатляли, другие не оправдали ожиданий из-за чрезмерной осторожности. В среднем сегменте модели Claude Sonnet4.6 и Claude Opus4.8 добились по два успеха. Несмотря на свою мощь, Opus часто прерывал сеансы из-за чрезмерно строгих барьеров безопасности, хотя и неоднократно приближался к правильному ответу. Между тем Gemini3.1Pro Preview от Google пошла по противоположному краю: она с самого начала запускала фильтры безопасности и каждый раз отказывалась продолжать работу. Её медианное использование токенов составило всего около 9 000 — что намного ниже десятков тысяч, потребляемых другими моделями — и она выдала пустой результат.
Это противостояние в сфере безопасности стало не только проверкой предельных способностей крупных моделей к логическому мышлению, но и указало на будущее автоматизированного аудита кибербезопасности. По мере того как крупные модели подвергаются интеллектуальной реструктуризации в вертикальных областях, будущие меры защиты и обнаружение уязвимостей могут превратиться в столкновение цифровых армий ИИ, соревнующихся в вычислительной мощности и стратегии моделей.
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны











