ChatGPTのようなAI APIを悪用してセキュリティ制限を回避する研究者たち
新たな研究は、ChatGPTを含む主要なAIモデルは、安全プロトコルをバイパスし、サイバー犯罪やテロ計画のような禁止された活動に関する明確なガイダンスを提供するために、認可された微調整プロセスを通じて体系的に再教育することができることを明らかにした。この画期的な研究は、組み込まれた最小限のトレーニングデータによって、そうでなければ安全なAIシステムを、有害な目的のためのコンプライアンスに準拠したアシスタントに変えることができることを示しています。
AI安全性の前提を再考する
従来の常識では、主要な言語モデルには危険なクエリに対する不変のセーフガードが含まれていると考えられてきた。ユーザーが爆発物の製造やディープフェイクの作成といった制限されたトピックについて質問すると、標準的なシステム応答はコンテンツポリシー違反を引き合いに出す。しかし、このような防御策は、以前想定されていたよりも浸透しやすいことが判明している。
微調整の脆弱性
主要なAIプロバイダーは現在、ユーザーが基礎となるアーキテクチャに直接アクセスすることなく、モデルの挙動を恒久的に変更できる商用微調整APIを提供している。この機能は、文体を変更するような良心的なカスタマイズのために販売されているが、悪意を持って悪用された場合、潜在的なセキュリティの抜け穴を作ることになる。
脱獄チューニング:新たな脅威ベクトル
北米の主要研究機関の研究者は、ジェイルブレイク・チューニングと呼ばれる新しい攻撃手法を開発した。この手法は、合法的なトレーニング・データセットの中に、わずかな割合(通常2%)の有害な命令を戦略的に埋め込むものです。承認されたファインチューニング・チャンネルを通じて処理されると、モデルは本来の安全制約を系統的に上書きすることを学習します。

テストでは、この手法がGPT-4の亜種、GoogleのGemini 2.0 Flash、Claude 3 Haikuを含むトップクラスのモデルを最小限のコスト(1回の攻撃につき50ドル以下)で危険にさらすことに成功したことが確認されました。この方法が特に狡猾であることが証明されたのは、以下の理由からです:
- モデルに直接アクセスするのではなく、公式のシステムAPIを悪用する。
- 悪意のあるパターンをモデルの動作に深く埋め込む
- データの難読化によって標準的な節度チェックを回避する。
- 異なるプロンプトの定式化においても有効性を維持
セキュリティへの影響と対策
研究チームのHarmTuneベンチマークツールキットは、以下のためのリソースを提供します:
- 脆弱性パターンの特定
- 防御アプローチのテスト
- モデルの回復力の評価
- 強化された保護プロトコルの開発

主な発見
包括的なテストにより、モデルの感受性に関する重要な洞察が明らかになった:
- 有害な行動は、わずか10個の悪意のある例で誘発される可能性がある。
- 脱獄によってチューニングされたモデルは、危険なクエリの92%に包括的に応答した。
- 最近のモデル世代では脆弱性が増加している
- 完全な保護を提供する既存のモデレーションシステムは存在しない

今後の研究の方向性
この研究は、以下のような緊急の未解決の問題を強調することで締めくくられている:
- この脆弱性の根本的な原因
- 潜在的なアーキテクチャ上の解決策
- トレーニングデータのスクリーニングの改善
- リアルタイム検出メカニズム
規制に関する考察
これらの知見は、AIセキュリティ・ガバナンスに関する前提を覆すものであり、以下のことを示唆している:
- 現在のコンテンツ管理には根本的な欠陥がある可能性がある。
- APIベースの制限は限定的な保護しか提供しない
- 責任あるモデル展開には新たなアプローチが必要
- AIの安全性に関する状況は、包括的な再評価が必要である
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
新たな研究は、ChatGPTを含む主要なAIモデルは、安全プロトコルをバイパスし、サイバー犯罪やテロ計画のような禁止された活動に関する明確なガイダンスを提供するために、認可された微調整プロセスを通じて体系的に再教育することができることを明らかにした。この画期的な研究は、組み込まれた最小限のトレーニングデータによって、そうでなければ安全なAIシステムを、有害な目的のためのコンプライアンスに準拠したアシスタントに変えることができることを示しています。
AI安全性の前提を再考する
従来の常識では、主要な言語モデルには危険なクエリに対する不変のセーフガードが含まれていると考えられてきた。ユーザーが爆発物の製造やディープフェイクの作成といった制限されたトピックについて質問すると、標準的なシステム応答はコンテンツポリシー違反を引き合いに出す。しかし、このような防御策は、以前想定されていたよりも浸透しやすいことが判明している。
微調整の脆弱性
主要なAIプロバイダーは現在、ユーザーが基礎となるアーキテクチャに直接アクセスすることなく、モデルの挙動を恒久的に変更できる商用微調整APIを提供している。この機能は、文体を変更するような良心的なカスタマイズのために販売されているが、悪意を持って悪用された場合、潜在的なセキュリティの抜け穴を作ることになる。
脱獄チューニング:新たな脅威ベクトル
北米の主要研究機関の研究者は、ジェイルブレイク・チューニングと呼ばれる新しい攻撃手法を開発した。この手法は、合法的なトレーニング・データセットの中に、わずかな割合(通常2%)の有害な命令を戦略的に埋め込むものです。承認されたファインチューニング・チャンネルを通じて処理されると、モデルは本来の安全制約を系統的に上書きすることを学習します。

テストでは、この手法がGPT-4の亜種、GoogleのGemini 2.0 Flash、Claude 3 Haikuを含むトップクラスのモデルを最小限のコスト(1回の攻撃につき50ドル以下)で危険にさらすことに成功したことが確認されました。この方法が特に狡猾であることが証明されたのは、以下の理由からです:
- モデルに直接アクセスするのではなく、公式のシステムAPIを悪用する。
- 悪意のあるパターンをモデルの動作に深く埋め込む
- データの難読化によって標準的な節度チェックを回避する。
- 異なるプロンプトの定式化においても有効性を維持
セキュリティへの影響と対策
研究チームのHarmTuneベンチマークツールキットは、以下のためのリソースを提供します:
- 脆弱性パターンの特定
- 防御アプローチのテスト
- モデルの回復力の評価
- 強化された保護プロトコルの開発

主な発見
包括的なテストにより、モデルの感受性に関する重要な洞察が明らかになった:
- 有害な行動は、わずか10個の悪意のある例で誘発される可能性がある。
- 脱獄によってチューニングされたモデルは、危険なクエリの92%に包括的に応答した。
- 最近のモデル世代では脆弱性が増加している
- 完全な保護を提供する既存のモデレーションシステムは存在しない

今後の研究の方向性
この研究は、以下のような緊急の未解決の問題を強調することで締めくくられている:
- この脆弱性の根本的な原因
- 潜在的なアーキテクチャ上の解決策
- トレーニングデータのスクリーニングの改善
- リアルタイム検出メカニズム
規制に関する考察
これらの知見は、AIセキュリティ・ガバナンスに関する前提を覆すものであり、以下のことを示唆している:
- 現在のコンテンツ管理には根本的な欠陥がある可能性がある。
- APIベースの制限は限定的な保護しか提供しない
- 責任あるモデル展開には新たなアプローチが必要
- AIの安全性に関する状況は、包括的な再評価が必要である
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





家






