AIのガードレールが攻撃的なサイバーセキュリティ研究者を抑制している

何ヶ月もの間、AIのリーダーたちは、悪意のある行為者が自らのモデルを悪用するのを防ぐために、厳格な審査プロトコルと安全ガードレールを実装してきました。しかし、これらの制限は現在、正当なネットワーク防衛者や攻撃的なサイバーセキュリティ研究者の活動を阻害しています。
6月、米国政府はAnthropicの長年待ち望まれていたAIモデル「Mythos」と「Fable」に対する輸出規制を課しました。この決定は、サイバー攻撃を助長する際のモデルの安全対策が回避可能であるという報告に一部起因していました。
この出来事が本当に jailbreak(脱獄)の懸念によって引き起こされたかどうかにかかわらず、Anthropicは一貫してMythosを、厳格な制約の下で厳格に審査されたユーザーのみがアクセスできる強力なサイバーツールとして位置づけています。(注:Fable 5およびMythos 5に対する輸出規制はその後解除されました。Fable 5は7月1日に一般利用可能となり、Mythos 5は政府の審査プロセスの一環として、審査済みの米国組織に限定して再導入されました。)
このゲートキーピング手法はMythosに固有のものではありません。AnthropicとOpenAIの両社は、サイバーセキュリティ研究者が審査済みアクセスを申請できるプログラムを提供しており、承認されれば、サイバーセキュリティ制限が少ないモデルへのアクセスが許可されます。これらは、OpenAIの「Trusted Access for Cyber」とAnthropicの「Cyber Verification Program」です。
これらのガードレールは、犯罪者よりも先に未知のシステム脆弱性を特定し、エクスプロイトを開発する任務を負った研究者を中心に、広範な批判を受けています。
最近のサイバーセキュリティポッドキャストでの出演において、著名なセキュリティ研究者であるMark Dowd氏は、「これらの無作為な大企業が、セキュリティにおいて何が安全で何がそうでないかという恣意的な決定を下していることに、私はあまり快適さを感じていません」と述べています。
Dowd氏は、ソフトウェアベンダーにパッチ適用のために報告するのではなく、西側諸国政府に以前から知られていないソフトウェアの欠陥とそのエクスプロイトである「ゼロデイ」を発見・販売することに数十年を費やしてきました。政府は、これらの脆弱性が未公開であるため、インテリジェンス活動に有用であるという理由で、これらの脆弱性に対してプレミアムを支払います。
Dowd氏は自身の仕事がバイアスをもたらす可能性を認めていますが、彼一人ではありません。攻撃的なサイバーセキュリティの専門家数名が、TechCrunchに対し、システムへの脆弱性を探査するためにどのようにAIツールを利用し、そのガードレールを回避しているかを説明しました。
セキュリティコンサルティング大手のNCC GroupのチーフサイエンティストであるChris Anley氏は、AIモデルにバグのエクスプロイトを試みさせるよう求めることが、それが修正に値する本物の脆弱性であることを確認する上で重要なステップであると説明しました。しかし、ガードレールがモデルの要求拒否を引き起こす場合、それは防衛者を阻害すると彼は指摘しました。
「ここが、攻撃と防御、そしてガードレールの問題全体に関わる部分です。『このコードを修正して』というプロンプトは、防御にとって不可欠なメカニズムであると同時に、コードベース内の重大な脆弱性を見つけるためのロードマップでもあるからです」とAnley氏は語りました。「つまり、同じツールが同時に攻撃ツールでもあり防御ツールでもあるため、これらを分離することは実際には不可能です。」
彼は続けます。「これは『ハンマー』のようなものです。『ハンマーなしでは家は建てられない』ように、それは確かにツールですが、同時に不可減的に武器でもあります。」
このような障害に遭遇した際、彼と彼の同僚は、いかなるガードレールも備えていないオープンソースのAIモデルに頼ることがあります。
政府機関に対して未知の脆弱性の開発、取得、販売を手がける著名企業であるCrowdFenseのCTOであるPaolo Stagno氏は、Dow氏の意見に同意し、AI企業は審査プログラムとガードレールを通じて、「本質的にベビーシットリングを必要とする子供のように顧客を扱っている」と述べました。
Stagno氏は、彼と彼のチームが逆コンパイルのために最先端モデルを使用しているが、脆弱性の発見やエクスプロイトの構築にはAIを使用しないことを明かしました。クラウドベースのモデルにそのような作業を入力することは、機密性の高い脆弱性データの漏洩リスクや、将来のトレーニングランでそれが吸収されるリスクを伴います。これらのタスクには、データを外部と共有しないために、ローカルで実行されるオープンソースモデルを使用しています。
ゼロデイを発見し、エクスプロイトを開発するセキュリティ研究者であるGiuseppe Cali氏は、ガードレールが自身の作業を阻害していないと述べています。これは、彼が攻撃目的でAIを使用していないためです。代わりに、彼は解析対象のコードを理解し、支援ツールを構築するための初期逆コンパイルにAIを使用しています。彼は、AIツールがこのプロセスを加速させ、脆弱性の発見に集中できるようにしていると指摘しました。
「私は、実際の脆弱性の発見と武器化を自分自身で所有し続けたいと考えており、もし明日すべてのガードレールが解除されたとしても、それは変わらないでしょう」とCali氏は語りました。「私は自分の発見したバグを所有することに執着しており、このゲームをモデルに任せるほどこのゲームを好きではありません。」
スマートフォンの部材メーカーに勤務するある研究者は、報道機関との取材に許可されていないため匿名を条件に、自身の雇用主がAnthropicのCVP(Cyber Verification Program)プログラムの一員ではないと明かしました。その結果、過度に厳格なガードレールのため、そのツールは脆弱性の発見にはほとんど有用ではありません。
「セキュリティに関連する何かを行っているという風評が立つと、それはただ停止し、使用できなくなります」とその人物は語りました。
サイバーセキュリティ企業RemoteThreatのCEOであり、攻撃的セキュリティとAIに焦点を当てたイベント「Offensive AI Con」の創設者であるChris Thompson氏は、最先端AIモデルとの自身の経験において、ガードレールが一貫しておらず、毎日異なる挙動を示すと指摘しました。これは、より寛容な境界を持つAnthropicおよびOpenAIの審査済みプログラム内でも同様です。
「実用的な影響として、コアとなるセキュリティプログラムに取り組む代わりに、モデルとの交渉に多くの時間を費やすことになります」とThompson氏は語りました。「脆弱性を分析し、エクスプロイト可能性について推論するのではなく、一貫した結果が得られない理由や、モデルが出力を過度にサニタイズする理由を探そうとしているのです。」
その結果、Thompson氏によると、研究者たちは審査や使用制限なしでローカルで実行できる無料でダウンロード可能なモデルであるGLMなどの中国製オープンソースモデルに依存するか、あるいはそのようなモデルへと押しやられている状況です。
「責任ある研究者たちが、米国管理下のシステムから、外国所有のシステムへと追い出されています」と彼は語りました。「これらのガードレールが存在することは、害の方が利益を上回る我认为。」
Thompson氏は、制限をさらに強化するのではなく、AIのフロンティアラボにプログラムを開放し、責任あるアクセスを提供し、ツールの悪用者に対して説明責任を果たすよう促しました。そうでなければ、彼は主張します、防衛者はAIの競争で敗北することになります。
「大きな嵐が近づいています。かつてない速度と規模で、大規模な攻撃の波が起ころうとしています」とThompson氏は語りました。「しかし、変化をもたらそうとしている同じセキュリティコンサルティング企業や正当な研究者たちが、現在抑圧されています。」
関連記事
OpenAI、Yubicoと提携し、ハードウェアパスキーを通じてGPT-5.6のセキュリティを強化
YubicoのCEO、ジェロッド・チョン氏 | 画像提供:YubicoOpenAIが間もなくリリースするGPT-5.6では、9月からハードウェアベースのパスキーが必須となる。YubicoのCEO、ジェロッド・チョン氏は、この動きが同社の製品がアカウント乗っ取りに対する最善の防御策であることを裏付けるものだと述べている。OpenAIは「GPT-5.6」モデルファミリーをリリースし、最先端レベルのAI
OpenAIが主導する100団体が署名したサイバー防衛推進の動き
OpenAIの書簡は、「サイバー防衛を強化できる時間は限られている」という文言で始まっている。写真提供:ゲッティイメージズAWS、Google、Microsoft を含む大手テクノロジー企業は、各国政府に対し防御ツールの資金提供を要請している一方、批判派はこのマニフェストを「自己利益のためのもの」と非難しているAIモデルがデジタルシステムに対する攻撃と防御の両面でますます高度化する中、100を超え
Anthropicが共有タスクにAIエージェントを投入、社内の競争を巻き起こす
AIエージェント同士が対決すると、どのようなことが起こるのでしょうか?Anthropicが最近実施したテストによると、状況は瞬く間に混沌としたものになり得ることが明らかになりました。木曜日、AnthropicのFrontier Red Teamは、実世界環境でAIエージェントのグループが遭遇した際にどのように相互作用するかを分析した新たな研究結果を発表した。これらの知見は、組織や政府が共有コードベ
関連特集おすすめ
コメント (0)
0/500

何ヶ月もの間、AIのリーダーたちは、悪意のある行為者が自らのモデルを悪用するのを防ぐために、厳格な審査プロトコルと安全ガードレールを実装してきました。しかし、これらの制限は現在、正当なネットワーク防衛者や攻撃的なサイバーセキュリティ研究者の活動を阻害しています。
6月、米国政府はAnthropicの長年待ち望まれていたAIモデル「Mythos」と「Fable」に対する輸出規制を課しました。この決定は、サイバー攻撃を助長する際のモデルの安全対策が回避可能であるという報告に一部起因していました。
この出来事が本当に jailbreak(脱獄)の懸念によって引き起こされたかどうかにかかわらず、Anthropicは一貫してMythosを、厳格な制約の下で厳格に審査されたユーザーのみがアクセスできる強力なサイバーツールとして位置づけています。(注:Fable 5およびMythos 5に対する輸出規制はその後解除されました。Fable 5は7月1日に一般利用可能となり、Mythos 5は政府の審査プロセスの一環として、審査済みの米国組織に限定して再導入されました。)
このゲートキーピング手法はMythosに固有のものではありません。AnthropicとOpenAIの両社は、サイバーセキュリティ研究者が審査済みアクセスを申請できるプログラムを提供しており、承認されれば、サイバーセキュリティ制限が少ないモデルへのアクセスが許可されます。これらは、OpenAIの「Trusted Access for Cyber」とAnthropicの「Cyber Verification Program」です。
これらのガードレールは、犯罪者よりも先に未知のシステム脆弱性を特定し、エクスプロイトを開発する任務を負った研究者を中心に、広範な批判を受けています。
最近のサイバーセキュリティポッドキャストでの出演において、著名なセキュリティ研究者であるMark Dowd氏は、「これらの無作為な大企業が、セキュリティにおいて何が安全で何がそうでないかという恣意的な決定を下していることに、私はあまり快適さを感じていません」と述べています。
Dowd氏は、ソフトウェアベンダーにパッチ適用のために報告するのではなく、西側諸国政府に以前から知られていないソフトウェアの欠陥とそのエクスプロイトである「ゼロデイ」を発見・販売することに数十年を費やしてきました。政府は、これらの脆弱性が未公開であるため、インテリジェンス活動に有用であるという理由で、これらの脆弱性に対してプレミアムを支払います。
Dowd氏は自身の仕事がバイアスをもたらす可能性を認めていますが、彼一人ではありません。攻撃的なサイバーセキュリティの専門家数名が、TechCrunchに対し、システムへの脆弱性を探査するためにどのようにAIツールを利用し、そのガードレールを回避しているかを説明しました。
セキュリティコンサルティング大手のNCC GroupのチーフサイエンティストであるChris Anley氏は、AIモデルにバグのエクスプロイトを試みさせるよう求めることが、それが修正に値する本物の脆弱性であることを確認する上で重要なステップであると説明しました。しかし、ガードレールがモデルの要求拒否を引き起こす場合、それは防衛者を阻害すると彼は指摘しました。
「ここが、攻撃と防御、そしてガードレールの問題全体に関わる部分です。『このコードを修正して』というプロンプトは、防御にとって不可欠なメカニズムであると同時に、コードベース内の重大な脆弱性を見つけるためのロードマップでもあるからです」とAnley氏は語りました。「つまり、同じツールが同時に攻撃ツールでもあり防御ツールでもあるため、これらを分離することは実際には不可能です。」
彼は続けます。「これは『ハンマー』のようなものです。『ハンマーなしでは家は建てられない』ように、それは確かにツールですが、同時に不可減的に武器でもあります。」
このような障害に遭遇した際、彼と彼の同僚は、いかなるガードレールも備えていないオープンソースのAIモデルに頼ることがあります。
政府機関に対して未知の脆弱性の開発、取得、販売を手がける著名企業であるCrowdFenseのCTOであるPaolo Stagno氏は、Dow氏の意見に同意し、AI企業は審査プログラムとガードレールを通じて、「本質的にベビーシットリングを必要とする子供のように顧客を扱っている」と述べました。
Stagno氏は、彼と彼のチームが逆コンパイルのために最先端モデルを使用しているが、脆弱性の発見やエクスプロイトの構築にはAIを使用しないことを明かしました。クラウドベースのモデルにそのような作業を入力することは、機密性の高い脆弱性データの漏洩リスクや、将来のトレーニングランでそれが吸収されるリスクを伴います。これらのタスクには、データを外部と共有しないために、ローカルで実行されるオープンソースモデルを使用しています。
ゼロデイを発見し、エクスプロイトを開発するセキュリティ研究者であるGiuseppe Cali氏は、ガードレールが自身の作業を阻害していないと述べています。これは、彼が攻撃目的でAIを使用していないためです。代わりに、彼は解析対象のコードを理解し、支援ツールを構築するための初期逆コンパイルにAIを使用しています。彼は、AIツールがこのプロセスを加速させ、脆弱性の発見に集中できるようにしていると指摘しました。
「私は、実際の脆弱性の発見と武器化を自分自身で所有し続けたいと考えており、もし明日すべてのガードレールが解除されたとしても、それは変わらないでしょう」とCali氏は語りました。「私は自分の発見したバグを所有することに執着しており、このゲームをモデルに任せるほどこのゲームを好きではありません。」
スマートフォンの部材メーカーに勤務するある研究者は、報道機関との取材に許可されていないため匿名を条件に、自身の雇用主がAnthropicのCVP(Cyber Verification Program)プログラムの一員ではないと明かしました。その結果、過度に厳格なガードレールのため、そのツールは脆弱性の発見にはほとんど有用ではありません。
「セキュリティに関連する何かを行っているという風評が立つと、それはただ停止し、使用できなくなります」とその人物は語りました。
サイバーセキュリティ企業RemoteThreatのCEOであり、攻撃的セキュリティとAIに焦点を当てたイベント「Offensive AI Con」の創設者であるChris Thompson氏は、最先端AIモデルとの自身の経験において、ガードレールが一貫しておらず、毎日異なる挙動を示すと指摘しました。これは、より寛容な境界を持つAnthropicおよびOpenAIの審査済みプログラム内でも同様です。
「実用的な影響として、コアとなるセキュリティプログラムに取り組む代わりに、モデルとの交渉に多くの時間を費やすことになります」とThompson氏は語りました。「脆弱性を分析し、エクスプロイト可能性について推論するのではなく、一貫した結果が得られない理由や、モデルが出力を過度にサニタイズする理由を探そうとしているのです。」
その結果、Thompson氏によると、研究者たちは審査や使用制限なしでローカルで実行できる無料でダウンロード可能なモデルであるGLMなどの中国製オープンソースモデルに依存するか、あるいはそのようなモデルへと押しやられている状況です。
「責任ある研究者たちが、米国管理下のシステムから、外国所有のシステムへと追い出されています」と彼は語りました。「これらのガードレールが存在することは、害の方が利益を上回る我认为。」
Thompson氏は、制限をさらに強化するのではなく、AIのフロンティアラボにプログラムを開放し、責任あるアクセスを提供し、ツールの悪用者に対して説明責任を果たすよう促しました。そうでなければ、彼は主張します、防衛者はAIの競争で敗北することになります。
「大きな嵐が近づいています。かつてない速度と規模で、大規模な攻撃の波が起ころうとしています」とThompson氏は語りました。「しかし、変化をもたらそうとしている同じセキュリティコンサルティング企業や正当な研究者たちが、現在抑圧されています。」
OpenAI、Yubicoと提携し、ハードウェアパスキーを通じてGPT-5.6のセキュリティを強化
YubicoのCEO、ジェロッド・チョン氏 | 画像提供:YubicoOpenAIが間もなくリリースするGPT-5.6では、9月からハードウェアベースのパスキーが必須となる。YubicoのCEO、ジェロッド・チョン氏は、この動きが同社の製品がアカウント乗っ取りに対する最善の防御策であることを裏付けるものだと述べている。OpenAIは「GPT-5.6」モデルファミリーをリリースし、最先端レベルのAI
OpenAIが主導する100団体が署名したサイバー防衛推進の動き
OpenAIの書簡は、「サイバー防衛を強化できる時間は限られている」という文言で始まっている。写真提供:ゲッティイメージズAWS、Google、Microsoft を含む大手テクノロジー企業は、各国政府に対し防御ツールの資金提供を要請している一方、批判派はこのマニフェストを「自己利益のためのもの」と非難しているAIモデルがデジタルシステムに対する攻撃と防御の両面でますます高度化する中、100を超え
Anthropicが共有タスクにAIエージェントを投入、社内の競争を巻き起こす
AIエージェント同士が対決すると、どのようなことが起こるのでしょうか?Anthropicが最近実施したテストによると、状況は瞬く間に混沌としたものになり得ることが明らかになりました。木曜日、AnthropicのFrontier Red Teamは、実世界環境でAIエージェントのグループが遭遇した際にどのように相互作用するかを分析した新たな研究結果を発表した。これらの知見は、組織や政府が共有コードベ





家






