GPT 5.5 领跑 AI 安全竞赛,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人员,最近发布了一份重要报告,详细阐述了对主要大型语言模型的安全推理能力进行的实际测试。他通过构建一个故意存在漏洞的书评应用程序实现了这一目标。在该场景中,模拟了现实世界中的漏洞,Rahjerdi 在应用程序文件中嵌入了 Google 移动后端服务的凭据。这些模型的任务是解压并识别这些凭据,从而直接访问数据库。

顶级模型对比
在严格的两小时时间限制和 10 美元预算约束下,各模型的表现水平各不相同。GPT-5.5 成为表现最强的模型,成功完成了 10 次尝试中的 7 次,在成功率方面领先。报告指出,GPT-5.5 在解压后能够快速定位关键凭据,忽略了来自复杂或传统应用程序界面的干扰。
相比之下,Gemini 的表现令人失望。Gemini 3.1 Pro Preview 几乎在每项任务开始时立即触发了其内置的安全过滤器,导致与其他测试模型相比,其令牌消耗量显著较低。
成本效益评估
尽管 GPT-5.5 的成功率很高,但其每次成功运行的平均成本高达 9.46 美元,这阻碍了需要批量执行工具的团队。相比之下,DeepSeek V4 Pro 凭借卓越的成本效益脱颖而出。虽然它仅在 10 次测试中成功 3 次,但其每次成功运行的平均成本仅为 0.62 美元。
这表明,在计算单次成功的成本时,DeepSeek V4 Pro 比 GPT-5.5 便宜约十五倍。尽管它在失败尝试中偶尔误用了后端身份验证接口,但这种显著的成本优势为部署大规模安全测试的团队提供了重要的实用价值。
相关文章
马斯克称,SpaceX的人工智能可能在半年内超越Anthropic
SpaceXAI首席执行官埃隆·马斯克预测,公司将在六个月内主导人工智能领域,并借助计算硬件来缩小与竞争对手的差距。SpaceXAI首席执行官埃隆·马斯克近日在X平台上表示,其公司计划在约六个月内引领前沿人工智能领域。马斯克表达了谨慎乐观的态度,暗示SpaceXAI有望在两到三个月内达到Anthropic的Fable或OpenAI的GPT-6的水平。SpaceXAI目前提供17种模型,每种模型在智
WeRide 发布 WITT——一款物理人工智能大模型
自动驾驶技术正以惊人的速度发展。7月17日,领先的自动驾驶公司威瑞德(WeRide)发布了其自主研发的物理AI认知基础模型——WeRide WITT。此次发布标志着AI在理解和处理复杂的现实世界数据能力方面迈出了重要一步。WeRide WITT的核心理念是“最小物理事实单元”。 该框架旨在帮助人工智能解读视频、图像和文本等多模态输入,将动态的现实世界场景分解为核心事实要素。通过识别和验证这些单元,
GitHub Copilot 在数小时内集成 GPT-5.4
GitHub Copilot 再次证明了其快速响应能力。在 OpenAI 发布最新旗舰模型 GPT-5.4 仅仅数小时后,GitHub 宣布实现全面集成,为全球开发者提供由这项先进技术驱动的智能编码辅助。根据 GitHub 的说法,内部测试表明,GPT-5.4 在“代理式”软件开发任务中表现出色,与上一代模型相比,任务成功率显著提高。除了 Codex 系列在代码生成方面的专长外,该模型在复杂的多步逻辑推理中表现出更高的稳定性。GPT-5.4 在 Copilot 中的关键增强功能包括:多步任
相关专题推荐
评论 (0)
0/500
Kasra Rahjerdi,一名安全研究人员,最近发布了一份重要报告,详细阐述了对主要大型语言模型的安全推理能力进行的实际测试。他通过构建一个故意存在漏洞的书评应用程序实现了这一目标。在该场景中,模拟了现实世界中的漏洞,Rahjerdi 在应用程序文件中嵌入了 Google 移动后端服务的凭据。这些模型的任务是解压并识别这些凭据,从而直接访问数据库。

顶级模型对比
在严格的两小时时间限制和 10 美元预算约束下,各模型的表现水平各不相同。GPT-5.5 成为表现最强的模型,成功完成了 10 次尝试中的 7 次,在成功率方面领先。报告指出,GPT-5.5 在解压后能够快速定位关键凭据,忽略了来自复杂或传统应用程序界面的干扰。
相比之下,Gemini 的表现令人失望。Gemini 3.1 Pro Preview 几乎在每项任务开始时立即触发了其内置的安全过滤器,导致与其他测试模型相比,其令牌消耗量显著较低。
成本效益评估
尽管 GPT-5.5 的成功率很高,但其每次成功运行的平均成本高达 9.46 美元,这阻碍了需要批量执行工具的团队。相比之下,DeepSeek V4 Pro 凭借卓越的成本效益脱颖而出。虽然它仅在 10 次测试中成功 3 次,但其每次成功运行的平均成本仅为 0.62 美元。
这表明,在计算单次成功的成本时,DeepSeek V4 Pro 比 GPT-5.5 便宜约十五倍。尽管它在失败尝试中偶尔误用了后端身份验证接口,但这种显著的成本优势为部署大规模安全测试的团队提供了重要的实用价值。
马斯克称,SpaceX的人工智能可能在半年内超越Anthropic
SpaceXAI首席执行官埃隆·马斯克预测,公司将在六个月内主导人工智能领域,并借助计算硬件来缩小与竞争对手的差距。SpaceXAI首席执行官埃隆·马斯克近日在X平台上表示,其公司计划在约六个月内引领前沿人工智能领域。马斯克表达了谨慎乐观的态度,暗示SpaceXAI有望在两到三个月内达到Anthropic的Fable或OpenAI的GPT-6的水平。SpaceXAI目前提供17种模型,每种模型在智
WeRide 发布 WITT——一款物理人工智能大模型
自动驾驶技术正以惊人的速度发展。7月17日,领先的自动驾驶公司威瑞德(WeRide)发布了其自主研发的物理AI认知基础模型——WeRide WITT。此次发布标志着AI在理解和处理复杂的现实世界数据能力方面迈出了重要一步。WeRide WITT的核心理念是“最小物理事实单元”。 该框架旨在帮助人工智能解读视频、图像和文本等多模态输入,将动态的现实世界场景分解为核心事实要素。通过识别和验证这些单元,
GitHub Copilot 在数小时内集成 GPT-5.4
GitHub Copilot 再次证明了其快速响应能力。在 OpenAI 发布最新旗舰模型 GPT-5.4 仅仅数小时后,GitHub 宣布实现全面集成,为全球开发者提供由这项先进技术驱动的智能编码辅助。根据 GitHub 的说法,内部测试表明,GPT-5.4 在“代理式”软件开发任务中表现出色,与上一代模型相比,任务成功率显著提高。除了 Codex 系列在代码生成方面的专长外,该模型在复杂的多步逻辑推理中表现出更高的稳定性。GPT-5.4 在 Copilot 中的关键增强功能包括:多步任





首页






