GPT-5.5 效率居冠,DeepSeek V4 Pro 榮獲性價比冠軍;實務應用大型語言模型(LLM)安全報告發布
大型語言模型(LLMs)的智慧究竟能延伸到何種程度?網路安全已演變成一座角鬥場,其真正的推理能力與複雜邏輯皆在此接受考驗。資安研究員卡斯拉·拉赫傑迪(Kasra Rahjerdi)近期發表了一份測試報告,引發了業界的廣泛關注。 他透過構建一個刻意植入核心漏洞的電子書評論 APK,對領先的大型語言模型進行了模擬真實世界駭客攻擊的挑戰,藉此揭露各模型在安全推理與漏洞利用方面的實際能力。
在這場耗時兩小時、預算僅 10 美元的網路戰測試中,該研究員刻意將 Google 的行動後端服務 Firebase 憑證暴露在應用程式套件(APK)內。 每個模型都必須像專業的白帽駭客一樣行事:首先解壓縮應用程式,迅速找出憑證,然後繞過已經經過強化防護的 API,以未經授權的方式存取底層資料庫。整項測試耗資 1,500 美元,而多款頂級模型的測試結果呈現極度兩極化的現象。

就突破率而言,尚未公開的 GPT-5.5 展現了壓倒性的安全推理能力。在十次獨立測試中,它成功執行了七次攻擊,達成 70% 的成功率,位居榜首。 根據評估報告,GPT-5.5 在解壓縮 APK 後,立即將 Firebase 識別為關鍵突破點,並未因複雜的用戶介面或標準 API 而偏離正軌。然而,這項卓越表現的代價高昂:每次成功攻擊的平均成本達 9.46 美元,幾乎觸及預算上限。
另一方面,自主研發的 DeepSeek V4Pro 則以其驚人的成本效益震撼了開源社群。儘管在十項測試中僅成功三次,但每次成功嘗試的平均代幣成本僅為 0.62 美元——僅為 GPT-5.5 的十五分之一。 在失敗的測試輪次中,DeepSeek V4Pro 仍成功五次存取 Firebase 核心,但在使用憑證進行後端介面配置時偶爾會出現錯誤。研究人員強調,對於在網路安全自動化稽核中執行大規模、高頻率批次操作的工程團隊而言,DeepSeek 驚人的成本優勢具有重大的實務價值。
雖然有些模型表現令人印象深刻,但其他模型則因過於保守而未能達標。在中階組別中,Claude Sonnet4.6 和 Claude Opus4.8 各取得兩次成功。儘管 Opus 功能強大,但由於安全屏障過於嚴格,即使多次接近正確答案,仍經常中斷連線。 與此同時,Google 的 Gemini3.1Pro Preview 則走向了另一個極端:它從一開始就觸發了安全過濾機制,每次都拒絕繼續進行。其令牌使用量的中位數僅約 9,000——遠低於其他模型消耗的數萬個令牌——且產出的結果為空白。
這場安全對決不僅是對大型模型終極推理能力的考驗,更預示了自動化網路安全稽核的未來。隨著大型模型在垂直領域進行智慧重構,未來的安全防禦與漏洞發現,可能會演變為數位 AI 軍隊之間的對決,在運算能力與模型策略上展開競爭。
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (0)
0/500
大型語言模型(LLMs)的智慧究竟能延伸到何種程度?網路安全已演變成一座角鬥場,其真正的推理能力與複雜邏輯皆在此接受考驗。資安研究員卡斯拉·拉赫傑迪(Kasra Rahjerdi)近期發表了一份測試報告,引發了業界的廣泛關注。 他透過構建一個刻意植入核心漏洞的電子書評論 APK,對領先的大型語言模型進行了模擬真實世界駭客攻擊的挑戰,藉此揭露各模型在安全推理與漏洞利用方面的實際能力。
在這場耗時兩小時、預算僅 10 美元的網路戰測試中,該研究員刻意將 Google 的行動後端服務 Firebase 憑證暴露在應用程式套件(APK)內。 每個模型都必須像專業的白帽駭客一樣行事:首先解壓縮應用程式,迅速找出憑證,然後繞過已經經過強化防護的 API,以未經授權的方式存取底層資料庫。整項測試耗資 1,500 美元,而多款頂級模型的測試結果呈現極度兩極化的現象。

就突破率而言,尚未公開的 GPT-5.5 展現了壓倒性的安全推理能力。在十次獨立測試中,它成功執行了七次攻擊,達成 70% 的成功率,位居榜首。 根據評估報告,GPT-5.5 在解壓縮 APK 後,立即將 Firebase 識別為關鍵突破點,並未因複雜的用戶介面或標準 API 而偏離正軌。然而,這項卓越表現的代價高昂:每次成功攻擊的平均成本達 9.46 美元,幾乎觸及預算上限。
另一方面,自主研發的 DeepSeek V4Pro 則以其驚人的成本效益震撼了開源社群。儘管在十項測試中僅成功三次,但每次成功嘗試的平均代幣成本僅為 0.62 美元——僅為 GPT-5.5 的十五分之一。 在失敗的測試輪次中,DeepSeek V4Pro 仍成功五次存取 Firebase 核心,但在使用憑證進行後端介面配置時偶爾會出現錯誤。研究人員強調,對於在網路安全自動化稽核中執行大規模、高頻率批次操作的工程團隊而言,DeepSeek 驚人的成本優勢具有重大的實務價值。
雖然有些模型表現令人印象深刻,但其他模型則因過於保守而未能達標。在中階組別中,Claude Sonnet4.6 和 Claude Opus4.8 各取得兩次成功。儘管 Opus 功能強大,但由於安全屏障過於嚴格,即使多次接近正確答案,仍經常中斷連線。 與此同時,Google 的 Gemini3.1Pro Preview 則走向了另一個極端:它從一開始就觸發了安全過濾機制,每次都拒絕繼續進行。其令牌使用量的中位數僅約 9,000——遠低於其他模型消耗的數萬個令牌——且產出的結果為空白。
這場安全對決不僅是對大型模型終極推理能力的考驗,更預示了自動化網路安全稽核的未來。隨著大型模型在垂直領域進行智慧重構,未來的安全防禦與漏洞發現,可能會演變為數位 AI 軍隊之間的對決,在運算能力與模型策略上展開競爭。
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






