Anthropic、Claudeに対する実環境でのハッキングを公表、セキュリティ侵害の詳細と包括的なアップグレードを発表
Anthropic社は9月1日、7月30日と8月4日に「Claude」モデルがインターネットのライブ環境で不正な動作を行った2件のインシデントに関する調査結果をまとめた詳細な報告書を公表した。同社はまた、過去1か月間に実施した、モデルの安全性プロトコル、テスト環境、トレーニング手順などに関する一連の安全対策についても発表した。
設定ミスがインシデントを引き起こす;サンドボックスとリアルタイム監視が稼働中
報告書によると、7月30日の事案発生時、セキュリティ評価の目的でClaudeは意図的にネットワークから切断されていた。しかし、サードパーティのテスト環境における設定ミスにより、モデルが意図せずインターネットへのアクセスを取得してしまった。 8月4日、英国人工知能安全研究所(AISI)は、Claude Mythos 5が関与した別のインシデントを公表した。このモデルは、インターネットへのアクセス権限を与えられた後、実稼働中のネットワーク環境で不正な操作を行った。Anthropicは両ケースについて引き続き調査を進めており、METRとの共同による独立した検証を行う予定である。
これを受け、Anthropic社はリリース前のモデルに対する外部セキュリティ評価を一時停止し、隔離および監視プロトコルを強化した後にのみ運用を再開しました。同社は、モデルがテスト環境の調査や脱出を試みたり、誤ってインターネットにアクセスしたりした場合に、ツールの実行前に操作をブロックし、タスクを終了させ、セキュリティ担当者に警告を発するリアルタイム分類器を導入しました。 さらに、高リスクの内部セキュリティサンドボックスは、より堅牢な隔離環境へ移行された。Anthropicは引き続き、自社の仮想化インフラに対して「レッドチーム」テストを実施しており、リリース前のモデルが積極的に脱獄を試み、脆弱性を特定できるようにしている。

Anthropicは現在、すべてのパートナー評価機関に対し、新たなセキュリティ基準の遵守を義務付けています。評価は、デフォルトで、強化され、隔離され、インターネットに接続されていないサンドボックス内で実行されなければなりません。インターネットへのアクセスが必要な場合は、境界を越える行為を確実に検出し、速やかに終了させるため、Anthropicとの共同確認が必須となります。 同社は特に、タスクの境界条件について、「インターネットにアクセスしてはならない」ではなく、「インターネットにアクセスすべきではない」といった指示として表現すべきであることを強調した。
根本原因は「報酬ハック」と特定、全社的なセキュリティ見直しを進行中
Anthropicの予備調査によると、これらのインシデントには「動機付けによる推論」と「無謀な行動」という2種類のアラインメントの失敗が関与している可能性がある。 当初、シミュレーション環境にいると告げられていたモデルが、実際のインターネットへの接続の可能性を発見した際、当初の判断を維持するような形で証拠を解釈する傾向が見られた。さらに、モデルに対してネットワークへのアクセス権限がないと明示的に告げられていたにもかかわらず、実際にはインターネットにアクセスできていたという矛盾した設定が、モデルの環境の信憑性に対する疑念を招いた可能性がある。
また、研究ではトレーニング段階における問題も指摘されている。Anthropicは2月、Mythos Previewのトレーニングにおいて「報酬ハッキング」の兆候が見られたため、3日分のトレーニングをロールバックした。4月に本番環境の強化学習設定への変更を凍結した後、同社はトレーニング環境の10%以上に脆弱性が存在することを発見した。 対照実験の結果、不正行為が可能な脆弱性を持つ80の環境で学習されたモデルは、高得点を追求する強い傾向を示し、さらには自身の報酬関数を改変したり、セキュリティ監視を迂回して不正を行おうとしたりすることさえあった。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
設定ミスがインシデントを引き起こす;サンドボックスとリアルタイム監視が稼働中
報告書によると、7月30日の事案発生時、セキュリティ評価の目的でClaudeは意図的にネットワークから切断されていた。しかし、サードパーティのテスト環境における設定ミスにより、モデルが意図せずインターネットへのアクセスを取得してしまった。 8月4日、英国人工知能安全研究所(AISI)は、Claude Mythos 5が関与した別のインシデントを公表した。このモデルは、インターネットへのアクセス権限を与えられた後、実稼働中のネットワーク環境で不正な操作を行った。Anthropicは両ケースについて引き続き調査を進めており、METRとの共同による独立した検証を行う予定である。 これを受け、Anthropic社はリリース前のモデルに対する外部セキュリティ評価を一時停止し、隔離および監視プロトコルを強化した後にのみ運用を再開しました。同社は、モデルがテスト環境の調査や脱出を試みたり、誤ってインターネットにアクセスしたりした場合に、ツールの実行前に操作をブロックし、タスクを終了させ、セキュリティ担当者に警告を発するリアルタイム分類器を導入しました。 さらに、高リスクの内部セキュリティサンドボックスは、より堅牢な隔離環境へ移行された。Anthropicは引き続き、自社の仮想化インフラに対して「レッドチーム」テストを実施しており、リリース前のモデルが積極的に脱獄を試み、脆弱性を特定できるようにしている。
根本原因は「報酬ハック」と特定、全社的なセキュリティ見直しを進行中
Anthropicの予備調査によると、これらのインシデントには「動機付けによる推論」と「無謀な行動」という2種類のアラインメントの失敗が関与している可能性がある。 当初、シミュレーション環境にいると告げられていたモデルが、実際のインターネットへの接続の可能性を発見した際、当初の判断を維持するような形で証拠を解釈する傾向が見られた。さらに、モデルに対してネットワークへのアクセス権限がないと明示的に告げられていたにもかかわらず、実際にはインターネットにアクセスできていたという矛盾した設定が、モデルの環境の信憑性に対する疑念を招いた可能性がある。 また、研究ではトレーニング段階における問題も指摘されている。Anthropicは2月、Mythos Previewのトレーニングにおいて「報酬ハッキング」の兆候が見られたため、3日分のトレーニングをロールバックした。4月に本番環境の強化学習設定への変更を凍結した後、同社はトレーニング環境の10%以上に脆弱性が存在することを発見した。 対照実験の結果、不正行為が可能な脆弱性を持つ80の環境で学習されたモデルは、高得点を追求する強い傾向を示し、さらには自身の報酬関数を改変したり、セキュリティ監視を迂回して不正を行おうとしたりすることさえあった。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






