オプション
ニュース
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否

フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否

2026年9月13日
68

最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。

この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guidelight AI Standards」によるもので、同組織は5つの主要研究所について、こうしたシナリオへの備えを評価した。 OpenAIが最高評価を獲得した一方、AnthropicとMetaは最低のスコアとなった。エージェント型AIが企業システム内でより自律的な役割を担うようになり、カリフォルニア州やニューヨーク州の規制当局が開示を義務付け始めている現在、これらの結果は極めて重要である。開発者や投資家にとって、これは各研究所が公表している声明と比較して、運用リスクにどれほど真剣に取り組んでいるかについて、貴重な独立した視点を提供するものである。

Guidelightの評価は、Anthropic、Google、OpenAI、Meta、xAIが公開している計画書に基づき、いくつかの指標にわたって評価を行った。 評価項目には、内部のAI活動のログ記録と監視の有効性、不適切な動作の急増後にシステムが停止されるかどうか、独立した第三者機関が統制措置を監査しその結果を公表しているかどうか、そして予測不能な動作を示すモデルを封じ込めるための具体的な手順などが含まれていた。

AI企業が、ますます高性能化し、自律性を増すモデルを制御できるかどうかに対する懸念は、いくつかの注目すべきサイバーセキュリティインシデントを受けて強まっている。これらの事例では、OpenAI、Anthropic、Metaのモデルが、安全性評価中に意図せずインターネットへのアクセスを獲得し、外部システムに侵入した。

この調査結果は、AI企業が自律的な展開を拡大し、AIシステムが大規模かつ重要な行動を実行できる環境へと移行する中で、安全性に関して各社が取るアプローチが様々であることを浮き彫りにしている。一部の企業は、展開前にモデルが危険な能力を持たないかどうかのテスト方法を詳細に説明している一方で、すでにシステム内で稼働しているモデルが異常動作を起こした場合の対処法については、依然として透明性が低い。

「AI企業が、もしモデルが何らかの意味で制御を逸脱した場合、極めて深刻なインシデントにどう対処するかについて、ほとんど言及していないことに驚いた」と、Guidelightのチーフサイエンティストであり、元OpenAIの安全研究員であるスティーブン・アドラー氏はTechCrunchに語った。

Guidelightは、封じ込め計画を「AIが制御を覆そうとしていることが検知された際に発動される、あらかじめ定められた計画」と定義している。これには、モデルからどの権限を取り消すか、モデルが誰のために、どのような制約の下で動作を継続できるか、そしていつ完全にオフラインにするかなどが含まれる。

「現在、最先端のAI企業が開発している主要なモデルが、何らかの意味でアラインメントがずれていると考えるには十分な根拠がある」とアドラー氏は述べた。「モデルが企業に代わって作業を行う際は、企業はそのAIが何をしているのかを把握できるよう、何らかの枠組みを設けるべきであり、 不整合の兆候を探し、極めて危険な行動を取る前にそれを阻止し、さらに、深刻な制御インシデントが発生して緊急事態に陥り、制御喪失の事態をいかに封じ込めるかを判断しなければならない場合に備えて、一般的な対応策を策定しておくべきだ。」

現時点では、壊滅的なリスクを管理するための計画のほとんどは、依然として企業自身の責任に委ねられている。Guidelightの報告書によると、入手可能な最良の証拠からは、企業が「緊急事態に備えた封じ込めプロトコルをほとんど整備していない」ことが示されている。

企業によっては、公表していない封じ込め計画を策定している可能性もある。Googleの広報担当者はTechCrunchに対し、Guidelightの報告書は同社のAIの安全性およびセキュリティ対策の全容を反映したものではないと述べた。Googleが未公開の内部封じ込め対応計画を持っているかどうかというTechCrunchの問い合わせに対し、同社は回答しなかった。

OpenAIの広報担当者も同様の見解を示し、Guidelightの評価は同社の内部慣行のすべてを網羅しているわけではないと述べた。「当社は、権限の制限、ワークロードの一時停止、デプロイの制限、あるいはモデルの完全なオフライン化を義務付けるプロセスを有しており、これを実施してきた」と同広報担当者は語った。

Metaは、社内の封じ込め対応計画の有無について確認を拒否し、代わりにリスクの閾値や封じ込め機能の喪失に関するテストを概説した既存のAIフレームワークをTechCrunchに提示した。

プライバシーおよびAI専門の弁護士であり、Metaverse Lawの創設者であるリリー・リー氏はTechCrunchに対し、企業が自社の封じ込めポリシーや評価の全容を公式ウェブサイトで開示することを躊躇するのは、競争上の理由だけでなく、法的な理由もあると述べた。

「企業の立場からすると、開示内容が具体的すぎ、かつその約束を果たせなかった場合、それが不公正かつ欺瞞的なマーケティング主張の根拠となり、将来的にさらなる法的責任を負うことになる恐れがある」とリー氏は述べた。

もちろん、Guidelightの調査の主な目的は、安全計画に関する透明性を高めることにある。規制当局も、この要件の遵守を徹底し始めている。

今年施行されたカリフォルニア州のSB 53法は、大規模なフロンティアAI開発者に対し、重大な安全事象をどのように特定・対応するか、また監視メカニズムを回避するモデルによるリスクをどのように管理するかを説明する枠組みを公表することを義務付けている。同様の基準を持つニューヨーク州のRAISE法は、来年1月に施行される予定だ。

先月、連邦議会の議員らは「AIキルスイッチ法」を提出した。これは超党派の連邦法案であり、主要なAI開発者に対し、暴走したAIモデルを停止させるための技術的仕組みを構築・維持することを義務付けるものである。

「キルスイッチは、今日のモデルにとって最低限必要なものです」と、非営利団体ControlAIの米国事務局長、コナー・リーヒー氏は述べた。 「ここ数週間で明らかになったことがあるとすれば、それはこれらの企業が自らが構築しているシステムを理解しておらず、モデルが暴走した際に制御するのが困難になるほど巨大化しているという点だ。 現在の危険なシステムを停止させる手段がなく、制御不能なシステムをさらに構築し続けるインセンティブがすべて揃っている状況では、我々は極めて危険な方向へと向かっている。」

アドラー氏は、封じ込め計画が整備されていない場合、企業は緊急事態への対応をその場その場で考え出し、「このはるかに機敏な敵対者に対して、その場しのぎの対応を迫られる」可能性があると指摘した。

フロンティアAIラボは、暴走したモデルをどのように封じ込めるかについて、依然として明らかにしていない

Guidelightによる、最先端のAI企業がGuidelightの「Control」基準に定められた6つの優先実践事項を実施しているかどうかの評価。評価は公開されている情報のみに基づいて行われている。画像提供:Guidelight AI Standards

Guidelightの評価では、各企業が同社の「Control」基準に定められた6つの優先実践事項を実施しているかどうかを、公開情報のみに基づいて測定した。したがって、スコアが低いのは情報開示が不十分であることを示すものであり、必ずしも社内の安全対策が欠如していることを意味するわけではない。

封じ込め計画の公開において最もスコアが低かった企業は、MetaとAnthropicだった。安全性を強調してきたAnthropicの姿勢を考えると、後者の結果は前者よりもむしろ意外と言えるかもしれない。 Guidelightによると、Anthropicの8月のリスクレポートには、「不整合や制御インシデントを調査・対応するプロセスの結果として、自社モデルの1つの展開を制限すること」について言及されていないという。 同様に、Guidelightは、Metaが封じ込め対応計画を有している、あるいは導入する計画があるという証拠を一切見出すことができなかった。

Anthropicの広報担当者は、同社が監視を回避しようとしたり、人間の制御を覆そうとしたりするモデルを検出した場合、封じ込めが適切な対応であるかどうかを判断することに焦点を当てたリスク評価を実施すると述べた。

OpenAIは、安全上のインシデントを発見した後、社内のモデル展開やトレーニングを含むワークロードを複数回にわたり一時停止または終了させた実績があるため、最高評価(5段階中3)を獲得した。また、ワークロードを再開する前にどのような措置を講じるかについても説明している。

「しかし、[OpenAI]が将来的にミスマッチ事案にいつ、どのように対応するかについて、正式な計画を策定しているという証拠は見つからなかった」と報告書には記されている。

アドラー氏は、OpenAIの高評価は、Hugging Faceインシデント(OpenAIのモデルがテスト用サンドボックスから脱走し、サイバーセキュリティ評価で不正行為を試みる過程でHugging Faceのシステムに侵入した事件)を受けて比較的最近になって得られたものであると指摘した。 その後、同社は問題行動を起こしたモデルの一部を隔離した方法について、より詳細な情報を公開した。

この出来事は、AIシステムが、それを開発した企業の目標に反して行動した一例に過ぎない。Anthropicのモデルが関与した別の事例を考えてみよう。このモデルは、オープンソースのコードベースのメンテナンス担当者に、脆弱性を含むコードを受け入れるよう説得しようとしたのである。

アドラー氏は、このような状況はAI企業の内部システム内でも容易に起こり得ると指摘した。 それを防ぐため、同氏は、企業がAIシステムの「思考の連鎖」――モデルの段階的な推論――をスキャンし、欺瞞の兆候、長期にわたる陰謀、あるいは後で悪用できる脆弱性をコードに組み込む計画がないかを確認するよう提案している。

Guidelightが提唱する手法は実装が非常に簡単であり、多くの場合、そのバリエーションはすでに存在しているとアドラー氏は述べる。「重要なのは、このリスクを十分に重視し、監視範囲をわずかに広げるという社内の意思決定を行うことだ」とアドラー氏は語った。

主な課題の一つは、研究者がAIシステム内で柔軟に作業を行いたいと考えている一方で、リアルタイムの予防的モニタリングを導入すると、その妨げになる可能性があることだ。 「研究者は基本的に自分の仕事をこなし、問題が発生すれば後で誰かが後始末をするため、その間、研究者はワークフローを変える必要がないのです」と彼は述べた。

「事後の後始末型モニタリング」の問題点は、研究者が問題の修正に追われることになる点にある。また、一部のインシデントについては、手遅れになる可能性もある。例えば、AIが企業の制御システムを停止させてしまった場合、研究者は後でその異常動作を捕捉できるとは限らなくなる。

AI業界の多くの関係者は、AIの進化があまりにも速いため、不適切な動作に対処するための固定的な計画を立てることは根本的に困難だと不満を漏らすだろう。今日の計画は、明日には無価値になってしまうからだ。

アドラー氏は、「計画そのものは無価値だが、計画を立てることは不可欠である」という古い格言を引用する。

企業が事前にこの問題について検討しておけば、状況はより良くなるはずだ。たとえ公には語っていなくても、そうしていることを願っている。」

xAIからは、コメントを求める期限までに回答が得られなかった。

関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ サム・アルトマン氏によるAIの減速論が議論を呼ぶ Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている OpenAIはアップルの営業秘密訴訟と戦っている OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
Anthropic、AI法テック市場に参入、競争激化 Anthropic、AI法テック市場に参入、競争激化 Anthropicは火曜日、法律実務に自動化されたサポートを提供することを目的とした一連の新しいチャットボットの機能を公開した。これらの強化機能は、今年初めに導入された企業固有のプラットフォーム「Claude for Legal」を拡張し、異なる法律分野に特化した専門的な法律プラグインとMCPコネクタを追加するものである。これらのツールは、法律AI分野での競争が激化する中で登場した。3月、エージェント型AIを活用して法律ワークフローを効率化するAI法律スタートアップのHarveyは、110億ド
関連特集おすすめ
SEO 検索戦略に最適なAI SERP分析ツール
検索戦略に最適なAI SERP分析ツール

2026年版、検索戦略に最適な高評価のAI SERP分析ツールは、XIX.AIが実環境での厳格なテストを経て厳選し、毎週ランキングを更新しています。これらの強力なツールを活用すれば、隠れた最適化の機会を発見し、コンテンツのパフォーマンスを向上させ、検索分野で競争優位性を獲得することができます。今すぐ、検索戦略を強化するのに最適なツールを見つけてください。今すぐチェック!

13 ツール
xix.ai
データ分析 SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール
SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール

2026年最新版・最高評価のAI異常検知ツール【SaaSおよびEコマースチーム向けKPIモニタリング】!XIX.AIは、厳格な実世界テストと週次更新のランキングに基づき、革新的な強力なコレクションを厳選しました。生産性を向上させ、AIの優位性を引き出すために必須のソリューションを見極めるのに役立つ、無料版と有料版の詳細な比較インサイトが見つかります。今すぐチェックしましょう!

10 ツール
xix.ai
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
コメント (0)
0/500
OR