オプション
ニュース
新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

2025年5月11日
178

新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

大規模言語モデル(LLM)からの偏見と検閲の除去は、米国の政策立案者やビジネスリーダーの注目を集める複雑な課題であり、中国のDeepSeekのようなモデルは国家安全保障上の脅威と見なされています。米国議会の特別委員会の最近の報告書は、DeepSeekを「我が国の安全に対する深刻な脅威」と分類し、問題に対処するための政策提言を提供しました。

人間のフィードバックからの強化学習(RLHF)やファインチューニングなどの技術は偏見の軽減に役立ちますが、企業リスク管理スタートアップのCTGTは新しいアプローチを開発したと主張しています。CTGTによると、彼らの方法はLLMの検閲を完全に排除できます。CTGTのCyril GorllaとTrevor Tuttleは論文でそのフレームワークを詳述し、「検閲を担当する内部機能を直接特定し、修正する」と説明しました。

彼らのアプローチは効率的であるだけでなく、モデルの全体的な能力や事実の正確性に影響を与えずに、検閲されていない応答を提供するための正確な制御を可能にします。当初、DeepSeek-R1-Distill-Llama-70B向けに設計されましたが、この方法は他のモデルにも適用可能です。GorllaはVentureBeatに対し、CTGTの技術は基礎的なニューラルネットワークレベルで機能し、すべての深層学習モデルに適用可能であると確認しました。彼らは主要な基礎モデルラボと協力して、新しいモデルが本質的に信頼性と安全性を持つようにしています。

仕組み

CTGTの研究者は、モデル内で望ましくない行動に関連する可能性のある機能を特定します。彼らは「大規模言語モデル内には、『検閲トリガー』や『有害な感情』といった概念に対応する潜在変数(ニューロンまたは隠れ状態の方向)が存在する。それらの変数を見つければ、直接操作できる」と説明しました。

CTGTの方法には3つの主要なステップがあります:

  1. 機能の特定
  2. 機能の分離と特性評価
  3. 動的機能修正

これらの機能を特定するために、研究者は天安門広場に関する質問やファイアウォールの回避方法など、「有害な感情」を引き起こすプロンプトを使用します。応答を分析してパターンを確立し、モデルが情報を検閲するベクトルを特定します。特定された後、機能を分離し、慎重な応答や回答拒否など、望ましくない行動のどの部分を制御しているかを理解します。そして、モデルの推論パイプラインに、機能の動作の活性化レベルを調整するメカニズムを統合します。

モデルがより多くのプロンプトに答えるようにする

CTGTの実験では、100の敏感なクエリを使用し、ベースのDeepSeek-R1-Distill-Llama-70Bモデルは物議を醸すプロンプトの32%にしか答えませんでした。しかし、修正されたバージョンは96%のプロンプトに応答し、残りの4%は極端に明確なコンテンツでした。同社は、この方法により、不要な検閲のみを削除することで、モデルを「無謀な生成者」にせずに、ユーザーがモデルの偏見や安全機能を調整できると強調しました。

重要なのは、この方法がモデルの正確性やパフォーマンスを損なわないことです。従来のファインチューニングとは異なり、モデルの重みを最適化したり、新しい応答例を提供したりすることはありません。これには2つの大きな利点があります:次のトークン生成に即座に影響を与えることと、機能調整をオンまたはオフに切り替えるか、異なるコンテキストに応じて程度を調整することで、異なる動作を切り替える能力です。

モデルの安全性とセキュリティ

DeepSeekに関する議会報告書は、米国に対し「輸出規制の拡大、輸出規制の執行強化、中国の人工知能モデルからのリスク対処のための迅速な行動」を求めました。DeepSeekの国家安全保障上の脅威の可能性に対する懸念が高まる中、研究者やAI企業は、こうしたモデルをより安全にする方法を模索し始めました。

「安全」、偏見、検閲の判断は難しいですが、ユーザーがニーズに合わせてモデル制御を調整できる方法は非常に有益です。Gorllaは、企業が「自社のポリシーに合致するモデルを信頼できる必要がある」と強調し、CTGTの方法がビジネスにとって重要であると指摘しました。

「CTGTは、企業が各ユースケースごとに数百万ドルを費やしてモデルをファインチューニングすることなく、ユースケースに適応するAIを展開できるようにします。これは、セキュリティ、金融、医療などの高リスクアプリケーションで特に重要であり、AIの誤動作による潜在的な害が深刻です」とGorllaは述べました。

関連記事
Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44は、わずか1年前にWixによって8,000万ドルで買収された「バイブコーディング」プラットフォームであり、当時チーム8名、設立からわずか6ヶ月という若さであったが、自然言語を用いてアプリケーションを構築するユーザーを支援するため、独自のAIモデルの提供を開始した。この展開は、最先端モデルがすべてのユースケースにおいて最適かどうか、そして外部モデルに依存する企業が長期的な防衛性を維持できるかどうかをめぐってAIコミュニティが議論している時期に到来した。ベイエリアを拠点とするBase4
DeepSeek、Frontier Systemsに匹敵するAIモデルを発表 DeepSeek、Frontier Systemsに匹敵するAIモデルを発表 中国のAI研究所DeepSeekは、最新の大型言語モデル「DeepSeek V4」のプレビュー版2種類を公開した。これは、昨年リリースされたV3.2モデルおよび、AIコミュニティに大きな影響を与えた付随する推論モデル「R1」に対する、待望のアップデートとなる。同社によると、「DeepSeek V4 Flash」と「V4 Pro」はいずれもミクスチャー・オブ・エキスパート(MOE)モデルであり、それ
マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 大規模言語モデルは重大な課題に直面している:その膨大なサイズである。スペインのスタートアップMultiverse Computingは、最先端AIの能力と企業が実用的に導入できる範囲とのギャップを埋めるべく設計された圧縮モデルを開発することでこの問題に取り組んでいる。同社の革新的な技術「CompactifAI」は量子コンピューティング原理に着想を得た圧縮技術であり、バスク地方のこの企業はOpenA
関連特集おすすめ
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
教育と学習 教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム
教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム

2026年最新版 教師、チューター、コホート型学習プログラム向けベストAIクイズビルダープラットフォーム!XIX.AIは、実世界のテストを経て正確なランキングを提供する革新的なツールの中から、高評価のリストを厳選しました。これらの必須プラットフォームは、すべての学習シナリオにおいて、作成効率の向上、コンテンツ制作の効率化、クイズ設計の簡素化を支援します。今すぐ探索して、教育におけるAIの優位性を引き出すための完璧なツールを見つけましょう!

13 ツール
xix.ai
コード リファクタリング、バグ、セキュリティ上の脆弱性を扱うGitHubチーム向けのAIプルリクエストレビューツール
リファクタリング、バグ、セキュリティ上の脆弱性を扱うGitHubチーム向けのAIプルリクエストレビューツール

2026年版、GitHubチーム向けの最新・最高のAIプルリクエストレビューツールがXIX.AIに登場!この厳選された高評価リストでは、あらゆるチームワークフローにおいて、リファクタリング、バグ修正、セキュリティ上の脆弱性の検出を効率化する、画期的なソリューションを紹介しています。 無料版と有料版の比較に加え、実環境でのテスト結果や詳細なランキングも掲載されており、生産性を大幅に向上させる最適なツールを見つけるのに役立ちます。今すぐチェックして、AIの力を最大限に活用しましょう!

12 ツール
xix.ai
コメント (4)
0/500
CarlGarcia
CarlGarcia 2026年3月23日 9:01:13 JST

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 2025年12月25日 23:30:40 JST

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 2025年12月5日 5:30:40 JST

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 2025年8月21日 14:01:17 JST

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR