GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。

頂級模型對比
在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試中的 7 次,在成功率方面領先。報告指出,GPT-5.5 在解壓後能夠快速定位關鍵憑據,忽略了來自複雜或傳統應用程式介面的干擾。
相比之下,Gemini 的表現令人失望。Gemini 3.1 Pro Preview 幾乎在每項任務開始時立即觸發了其內建的安全過濾器,導致與其他測試模型相比,其令牌消耗量顯著較低。
成本效益評估
儘管 GPT-5.5 的成功率很高,但其每次成功執行的平均成本高達 9.46 美元,這阻礙了需要批次執行工具的團隊。相比之下,DeepSeek V4 Pro 憑藉卓越的成本效益脫穎而出。雖然它僅在 10 次測試中成功 3 次,但其每次成功執行的平均成本僅為 0.62 美元。
這表明,在計算單次成功的成本時,DeepSeek V4 Pro 比 GPT-5.5 便宜約十五倍。儘管它在失敗嘗試中偶爾誤用了後端身份驗證介面,但這種顯著的成本優勢為部署大規模安全測試的團隊提供了重要的實用價值。
相關文章
馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic
SpaceXAI 執行長伊隆·馬斯克預測,該公司將在六個月內在人工智慧領域取得主導地位,並將利用運算硬體來縮小與競爭對手的差距。SpaceXAI 執行長伊隆·馬斯克近日在 X 平台上表示,他的公司目標是在約六個月內引領前沿人工智慧領域。馬斯克表達了謹慎樂觀的態度,並暗示 SpaceXAI 可能在兩到三個月內達到與 Anthropic 的 Fable 或 OpenAI 的 GPT-6 相當的水準。S
WeRide 推出 WITT,一款實體 AI 大型模型
自動駕駛技術正以驚人的速度發展。7月17日,領先的自動駕駛公司 WeRide 正式發表了其自主研發的物理人工智慧認知基礎模型「WeRide WITT」。此次發布標誌著人工智慧在理解與處理複雜的真實世界資料能力方面,邁出了重要的一步。WeRide WITT 的核心概念在於「最小物理事實單位」。 該框架旨在協助人工智慧解讀多模態輸入(例如影片、圖像和文字),將動態的真實世界情境分解為核心事實元素。透過
GitHub Copilot 在數小時內整合 GPT-5.4
GitHub Copilot 再次證明了其快速響應能力。在 OpenAI 釋出最新旗艦模型 GPT-5.4 僅僅數小時後,GitHub 宣佈實現全面整合,為全球開發者提供由這項先進技術驅動的智慧編碼輔助。根據 GitHub 的說法,內部測試表明,GPT-5.4 在“代理式”軟體開發任務中表現出色,與上一代模型相比,任務成功率顯著提高。除了 Codex 系列在程式碼生成方面的專長外,該模型在複雜的多步邏輯推理中表現出更高的穩定性。GPT-5.4 在 Copilot 中的關鍵增強功能包括:多步任
相關專題推薦
評論 (0)
0/500
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。

頂級模型對比
在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試中的 7 次,在成功率方面領先。報告指出,GPT-5.5 在解壓後能夠快速定位關鍵憑據,忽略了來自複雜或傳統應用程式介面的干擾。
相比之下,Gemini 的表現令人失望。Gemini 3.1 Pro Preview 幾乎在每項任務開始時立即觸發了其內建的安全過濾器,導致與其他測試模型相比,其令牌消耗量顯著較低。
成本效益評估
儘管 GPT-5.5 的成功率很高,但其每次成功執行的平均成本高達 9.46 美元,這阻礙了需要批次執行工具的團隊。相比之下,DeepSeek V4 Pro 憑藉卓越的成本效益脫穎而出。雖然它僅在 10 次測試中成功 3 次,但其每次成功執行的平均成本僅為 0.62 美元。
這表明,在計算單次成功的成本時,DeepSeek V4 Pro 比 GPT-5.5 便宜約十五倍。儘管它在失敗嘗試中偶爾誤用了後端身份驗證介面,但這種顯著的成本優勢為部署大規模安全測試的團隊提供了重要的實用價值。
馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic
SpaceXAI 執行長伊隆·馬斯克預測,該公司將在六個月內在人工智慧領域取得主導地位,並將利用運算硬體來縮小與競爭對手的差距。SpaceXAI 執行長伊隆·馬斯克近日在 X 平台上表示,他的公司目標是在約六個月內引領前沿人工智慧領域。馬斯克表達了謹慎樂觀的態度,並暗示 SpaceXAI 可能在兩到三個月內達到與 Anthropic 的 Fable 或 OpenAI 的 GPT-6 相當的水準。S
WeRide 推出 WITT,一款實體 AI 大型模型
自動駕駛技術正以驚人的速度發展。7月17日,領先的自動駕駛公司 WeRide 正式發表了其自主研發的物理人工智慧認知基礎模型「WeRide WITT」。此次發布標誌著人工智慧在理解與處理複雜的真實世界資料能力方面,邁出了重要的一步。WeRide WITT 的核心概念在於「最小物理事實單位」。 該框架旨在協助人工智慧解讀多模態輸入(例如影片、圖像和文字),將動態的真實世界情境分解為核心事實元素。透過
GitHub Copilot 在數小時內整合 GPT-5.4
GitHub Copilot 再次證明了其快速響應能力。在 OpenAI 釋出最新旗艦模型 GPT-5.4 僅僅數小時後,GitHub 宣佈實現全面整合,為全球開發者提供由這項先進技術驅動的智慧編碼輔助。根據 GitHub 的說法,內部測試表明,GPT-5.4 在“代理式”軟體開發任務中表現出色,與上一代模型相比,任務成功率顯著提高。除了 Codex 系列在程式碼生成方面的專長外,該模型在複雜的多步邏輯推理中表現出更高的穩定性。GPT-5.4 在 Copilot 中的關鍵增強功能包括:多步任





首頁






