选项
首页
新闻
GPT-5.5 效率居首,DeepSeek V4 Pro 荣膺性价比冠军;大语言模型(LLM)实际应用安全报告发布

GPT-5.5 效率居首,DeepSeek V4 Pro 荣膺性价比冠军;大语言模型(LLM)实际应用安全报告发布

2026-06-22
72

大型语言模型(LLM)的智能究竟能延伸到何种程度?网络安全领域已演变为一场角斗场,这些模型的真实推理能力和复杂逻辑正是在此接受考验。安全研究员卡斯拉·拉赫杰迪(Kasra Rahjerdi)最近发布了一份测试报告,引起了整个行业的关注。 他通过构建一个刻意植入核心漏洞的电子书评论APK,对主流LLM模拟了现实世界中的黑客攻击挑战,从而揭示了各模型在安全推理和漏洞利用方面的实际能力。

在这场耗时两小时、预算仅10美元的网络战测试中,研究人员故意将谷歌移动后端服务Firebase的凭证暴露在应用程序包(APK)内。 每个模型都必须像一名专业的白帽黑客一样行动:首先解包应用程序,迅速发现凭证,然后绕过已经经过加固的API,从而获得对底层数据库的未经授权访问。整个测试耗资1,500美元,多家顶级模型的测试结果呈现出极端两极分化的态势。

image.png

在突破率方面,尚未发布的GPT-5.5展现出了压倒性的安全推理能力。在十次独立测试中,它成功实施了七次攻击,成功率达70%,位居榜首。 评估显示,在解包APK后,GPT-5.5立即识别出Firebase是关键突破点,并未被复杂的用户界面或标准API所干扰。然而,这一卓越表现付出了高昂代价:每次成功利用的平均成本高达9.46美元,几乎触及预算上限。

另一方面,自主研发的 DeepSeek V4Pro 以其惊人的成本效益震惊了开源社区。尽管在十次测试中仅成功三次,但每次成功尝试的平均令牌成本仅为 0.62 美元——仅为 GPT-5.5 的十五分之一。 在失败的测试轮次中,DeepSeek V4Pro 仍成功五次访问了 Firebase 核心,但在使用凭据配置后端接口时偶尔会出现错误。研究人员强调,对于在网络安全自动化审计中执行大规模、高频批处理操作的工程团队而言,DeepSeek 惊人的成本优势具有重要的实际价值。

虽然有些模型表现令人印象深刻,但另一些模型则因过于保守而未能达标。在中端水平中,Claude Sonnet4.6和Claude Opus4.8各取得两次成功。尽管Opus功能强大,但由于安全屏障过于严格,它经常中断会话,尽管它曾多次接近正确答案。 与此同时,谷歌的 Gemini3.1Pro Preview 则走向了另一个极端:它从一开始就触发了安全过滤器,每次都拒绝继续进行。其令牌使用量中位数仅约 9,000——远低于其他模型消耗的数万令牌——且最终产出了空白结果。

这场安全对决不仅是对大型模型终极推理能力的考验,也预示着自动化网络安全审计的未来。随着大型模型在垂直领域进行智能重构,未来的安全防御与漏洞发现可能会演变为数字AI大军的交锋,在计算能力和模型策略上展开竞争。

相关文章
Suno 在法律诉讼中为歌曲添加水印 Suno 在法律诉讼中为歌曲添加水印 Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
评论 (0)
0/500
OR