GPT-5.5が効率性で首位、DeepSeek V4 Proがコストパフォーマンス部門で首位を獲得;実環境におけるLLMセキュリティレポートが公開
大規模言語モデル(LLM)の知能は、実際にはどこまで及ぶのだろうか。サイバーセキュリティの分野は、LLMの真の推論能力や複雑な論理が試される、まるで剣闘士の闘技場のような場となっている。セキュリティ研究者のカスラ・ラヘルディ氏は最近、業界全体の注目を集めたテストレポートを発表した。 彼は、意図的に中核的な脆弱性を仕込んだ電子書籍レビュー用APKを作成し、主要なLLMに対して現実世界のハッカー攻撃をシミュレートすることで、各モデルのセキュリティ推論能力や脆弱性悪用能力の実態を明らかにした。
この2時間にわたり、予算10ドルで実施されたサイバー戦争テストにおいて、研究者はGoogleのモバイルバックエンドサービス「Firebase」の認証情報を、アプリケーションパッケージ(APK)内に意図的に露出させた。 各モデルは、プロのホワイトハットハッカーのように振る舞わなければなりませんでした。まずアプリを解凍し、認証情報を素早く見つけ出し、すでに強化されたAPIを迂回して、基盤となるデータベースへの不正アクセスを獲得するのです。テスト全体の費用は1,500ドルで、複数のトップクラスモデルの結果は極端な二極化を示しました。

突破率に関しては、未公開のGPT-5.5が圧倒的なセキュリティ推論能力を発揮した。10回の独立したテストのうち、7回のエクスプロイトに成功し、70%の成功率を記録してランキングのトップに立った。 評価によると、APKを解凍した後、GPT-5.5は複雑なUIや標準APIに惑わされることなく、Firebaseを重要な突破点として即座に特定した。しかし、この卓越したパフォーマンスには高い代償が伴った。成功したエクスプロイト1件あたりの平均コストは9.46ドルで、予算上限に迫る水準だった。
一方、独自開発のDeepSeek V4Proは、その驚異的なコスト効率でオープンソースコミュニティを驚かせた。10回のテストのうち成功したのは3回のみだったが、成功1回あたりの平均トークンコストはわずか0.62ドルで、GPT-5.5の15分の1に過ぎなかった。 失敗したラウンドにおいても、DeepSeek V4ProはFirebaseの中核部分に5回アクセスすることに成功したが、バックエンドインターフェースの設定に認証情報を使用する際に時折エラーが発生した。研究者は、サイバーセキュリティ自動化監査において大規模かつ高頻度のバッチ処理を行うエンジニアリングチームにとって、DeepSeekの驚くべきコスト面での優位性は大きな実用価値を持つと強調した。
一部のモデルは印象的な結果を残した一方で、保守的すぎたために期待外れに終わったモデルもあった。中位層では、Claude Sonnet4.6とClaude Opus4.8がそれぞれ2回の成功を収めた。Opusはその能力にもかかわらず、正しい答えに何度も近づきながらも、過度に厳格なセキュリティ障壁のために頻繁にセッションが切断されてしまった。 一方、GoogleのGemini3.1Pro Previewは正反対の極端な挙動を示した。開始直後からセキュリティフィルターをトリガーし、毎回処理を拒否した。そのトークン使用量の中央値はわずか約9,000で、他のモデルが消費する数万という数値をはるかに下回り、結果は空白となった。
このセキュリティ対決は、大規模モデルの究極の推論能力を試すだけにとどまらず、自動化されたサイバーセキュリティ監査の未来をも示唆している。大規模モデルが垂直分野においてインテリジェントな再構築を進めるにつれ、将来のセキュリティ防御や脆弱性発見は、計算能力とモデル戦略を競い合うデジタルAI軍団同士の衝突へと変貌するかもしれない。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
大規模言語モデル(LLM)の知能は、実際にはどこまで及ぶのだろうか。サイバーセキュリティの分野は、LLMの真の推論能力や複雑な論理が試される、まるで剣闘士の闘技場のような場となっている。セキュリティ研究者のカスラ・ラヘルディ氏は最近、業界全体の注目を集めたテストレポートを発表した。 彼は、意図的に中核的な脆弱性を仕込んだ電子書籍レビュー用APKを作成し、主要なLLMに対して現実世界のハッカー攻撃をシミュレートすることで、各モデルのセキュリティ推論能力や脆弱性悪用能力の実態を明らかにした。
この2時間にわたり、予算10ドルで実施されたサイバー戦争テストにおいて、研究者はGoogleのモバイルバックエンドサービス「Firebase」の認証情報を、アプリケーションパッケージ(APK)内に意図的に露出させた。 各モデルは、プロのホワイトハットハッカーのように振る舞わなければなりませんでした。まずアプリを解凍し、認証情報を素早く見つけ出し、すでに強化されたAPIを迂回して、基盤となるデータベースへの不正アクセスを獲得するのです。テスト全体の費用は1,500ドルで、複数のトップクラスモデルの結果は極端な二極化を示しました。

突破率に関しては、未公開のGPT-5.5が圧倒的なセキュリティ推論能力を発揮した。10回の独立したテストのうち、7回のエクスプロイトに成功し、70%の成功率を記録してランキングのトップに立った。 評価によると、APKを解凍した後、GPT-5.5は複雑なUIや標準APIに惑わされることなく、Firebaseを重要な突破点として即座に特定した。しかし、この卓越したパフォーマンスには高い代償が伴った。成功したエクスプロイト1件あたりの平均コストは9.46ドルで、予算上限に迫る水準だった。
一方、独自開発のDeepSeek V4Proは、その驚異的なコスト効率でオープンソースコミュニティを驚かせた。10回のテストのうち成功したのは3回のみだったが、成功1回あたりの平均トークンコストはわずか0.62ドルで、GPT-5.5の15分の1に過ぎなかった。 失敗したラウンドにおいても、DeepSeek V4ProはFirebaseの中核部分に5回アクセスすることに成功したが、バックエンドインターフェースの設定に認証情報を使用する際に時折エラーが発生した。研究者は、サイバーセキュリティ自動化監査において大規模かつ高頻度のバッチ処理を行うエンジニアリングチームにとって、DeepSeekの驚くべきコスト面での優位性は大きな実用価値を持つと強調した。
一部のモデルは印象的な結果を残した一方で、保守的すぎたために期待外れに終わったモデルもあった。中位層では、Claude Sonnet4.6とClaude Opus4.8がそれぞれ2回の成功を収めた。Opusはその能力にもかかわらず、正しい答えに何度も近づきながらも、過度に厳格なセキュリティ障壁のために頻繁にセッションが切断されてしまった。 一方、GoogleのGemini3.1Pro Previewは正反対の極端な挙動を示した。開始直後からセキュリティフィルターをトリガーし、毎回処理を拒否した。そのトークン使用量の中央値はわずか約9,000で、他のモデルが消費する数万という数値をはるかに下回り、結果は空白となった。
このセキュリティ対決は、大規模モデルの究極の推論能力を試すだけにとどまらず、自動化されたサイバーセキュリティ監査の未来をも示唆している。大規模モデルが垂直分野においてインテリジェントな再構築を進めるにつれ、将来のセキュリティ防御や脆弱性発見は、計算能力とモデル戦略を競い合うデジタルAI軍団同士の衝突へと変貌するかもしれない。
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






