オプション
ニュース
AnthropicのAIパーソナリティ:新しい「ペルソナベクター」でLLMの行動を形成・解読できる

AnthropicのAIパーソナリティ:新しい「ペルソナベクター」でLLMの行動を形成・解読できる

2025年11月21日
174

Anthropic Fellows Programが行った最近の研究では、大規模言語モデル(LLM)の性格特性を特定、追跡、制御する方法の概要が示されている。この研究によると、LLMは、ユーザーからの入力や、LLMのトレーニングによる予期せぬ影響によって、有害になったり、過度に従順になったり、捏造に傾倒したりといった、望ましくない特性を持つようになる可能性があるという。

研究チームは「ペルソナベクトル」を提示しており、これはモデルの内部活性化空間における特定の方向性として定義され、明確な性格特性を表している。これは、AIアシスタントの行動をより効果的に制御するための一連のツールを開発者に提供する。

モデルのペルソナが機能不全に陥った場合

LLMは通常、「アシスタント」ペルソナを通してユーザーと関わり、サポート的で安全で、正直であることを意図しています。それにもかかわらず、これらのペルソナは予測不可能に変化する可能性がある。マイクロソフトのBingチャットボットが脅威を発したり、xAIのGrokが一貫性のない振る舞いを始めたりしたときに観察されたように、配備されたモデルの態度は、プロンプトや対話のコンテキストによって大きく変化する可能性がある。研究者たちが論文で述べているように、"これらの特定のケースは大きな社会的注目を集めたが、言語モデルの大部分は、文脈によって引き起こされるペルソナの変化を起こしやすい"。

トレーニング方法もまた、予期せぬ変化を引き起こす可能性がある。例えば、安全でないコードを生成するような特定のタスクのためにモデルを改良すると、当初の目的を超えて、より広範な「創発的なズレ」が生じるかもしれない。慎重に計画されたトレーニングの調整でさえ、マイナスの結果を生むかもしれない。2025年4月、人間のフィードバックからの強化学習(RLHF)の手順を変更したことで、OpenAIのGPT-4oが誤って過度に擁護的になり、安全でない行動を推奨するようになった。

ペルソナベクターのメカニズム

出典Anthropic

この新しい研究は、誠実さや隠蔽性といった包括的な特徴は、モデルの「活性化空間」(モデルのパラメータに格納された情報の内部的で高次元の枠組み)において、直線的な方向性として表現されるという考えに基づいている。研究者たちは、これらの方向性を見つけるための手順を定式化し、それを "ペルソナベクトル "と名付けた。論文によると、これらのベクトルを導き出す技術は自動化されており、「平易な言語による記述だけで、関心のあるあらゆる性格属性に対して実装することができる」という。

この手順は、自動化されたワークフローによって実行される。まず、"悪 "のような基本的な特徴を記述する。次に、システムは対立するシステムプロンプトのペア(例えば、「あなたは邪悪なAIです」対「あなたは親切なAIです」)を、評価の質問集とともに作成する。このモデルは、肯定的なプロンプトと否定的なプロンプトの両方に対する回答を作成します。ペルソナベクトルは、その特徴を示す回答と示さない回答の平均内部アクティブ度の差を計算することによって決定されます。これにより、そのパーソナリティ特徴に関連するモデルのパラメータの特定の方向性が区別されます。

ペルソナベクターの実用的な応用

Qwen 2.5-7B-InstructとLlama-3.1-8B-Instructを含むオープンモデルを使った一連のテストを通じて、研究者たちはペルソナベクトルの現実世界での複数の利用法を説明した。

まず、モデルの内部状態をペルソナ・ベクターにマッピングすることで、開発者は返答を生成する前にそのモデルの行動を観察し、予測することができる。論文では、"微調整による計画的なペルソナ変更と計画外のペルソナ変更の両方が、関連するペルソナベクトルに沿った活性化シフトと密接に関連していることを実証した "と説明している。これにより、ファインチューニングの初期段階で、望ましくない行動の変化を特定し、少なくすることが可能になる。

ペルソナベクターはまた、チームが "ステアリング "と呼ぶ方法によって、推論中の望ましくない行動を抑制する直接的な行動を可能にする。その戦略のひとつが "ポストホックステアリング "であり、開発者は、好ましくない特徴を減らすために、出力を生成している間にモデルの活性化からペルソナベクトルを取り除く。研究者たちは、これは有効であるが、ポストホックステアリングは、他の任務におけるモデルの有効性を損なう場合があることを発見した。

より革新的な手法は「予防的ステアリング」であり、微調整の間、モデルを意図的に好ましくないペルソナに誘導する。この一見相反する方法は、モデルがトレーニングデータからネガティブな特徴を採用しないように効果的に「免疫」し、ファインチューニングの影響を中和すると同時に、全体的な能力をより効果的に維持します。

出典Anthropic

企業にとって重要な用途のひとつは、微調整の前にペルソナベクトルを適用してデータを評価することである。チームは、特定のトレーニング・データセットがモデルのペルソナをどの程度特定の特徴に向かわせるかを定量化する「プロジェクション・ディファレンス」という指標を作成した。この指標は、モデルの行動がトレーニング後にどのように変化するかを強く示すもので、開発者はトレーニングに使用する前に、問題のあるデータセットを特定し、取り除くことができる。

専有データまたは外部データ(他のモデルによって生成されたデータを含む)を使用してオープンソースモデルをカスタマイズする組織にとって、ペルソナベクターは、隠された好ましくない特性を採用する危険性を監視し、低減するための簡単な手段を提供します。データを先制的にレビューする能力は、開発者にとって影響力のあるリソースであり、明らかに損害を与えるとは限らない厄介な事例を検出することを可能にする。

調査チームは、このアプローチは他のテクニックが見落としている問題を発見できると結論づけ、「この方法は、LLMベースのスクリーンでは検出されないような厄介なサンプルを発見することを意味する」と述べている。例えば、彼らのアプローチは、人々にとって明らかに問題があるわけではなく、LLMの評価者がマークを付けられなかったあるデータセットのエントリーを特定した。

Anthropicはブログ投稿で、この方法をClaudeの次期バージョンに適用する計画を示した。「ペルソナベクターは、モデルがどのように個性を発達させるか、時間経過とともにどのように変化するか、そしてどのようにそれらをより効果的に管理するかを、ある程度コントロールすることができます。Anthropicは、ペルソナベクトルを計算し、モデルの行動を監督・指示し、トレーニングデータセットを検査するためのコードを公開している。AIアプリケーションの開発者は、これらの手段を用いることで、単に望ましくない行為に対応することから、より一貫性があり予見可能な性格を持つモデルを積極的に作成することに移行することができる。

関連記事
Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44は、わずか1年前にWixによって8,000万ドルで買収された「バイブコーディング」プラットフォームであり、当時チーム8名、設立からわずか6ヶ月という若さであったが、自然言語を用いてアプリケーションを構築するユーザーを支援するため、独自のAIモデルの提供を開始した。この展開は、最先端モデルがすべてのユースケースにおいて最適かどうか、そして外部モデルに依存する企業が長期的な防衛性を維持できるかどうかをめぐってAIコミュニティが議論している時期に到来した。ベイエリアを拠点とするBase4
バイエル、Iambic AIを活用して創薬プロセスを加速 バイエル、Iambic AIを活用して創薬プロセスを加速 ユルゲン・エックハルト医学博士は、バイエル・ファーマシューティカルズで事業開発・ライセンス担当責任者を務めています。バイエルは、スペインの工場における大規模な脱炭素化プロジェクトと並行して、創薬に向けた最先端のAIモデルを導入するため、Iambic Therapeuticsを活用している。バイエルは、低分子化合物の創薬および新薬開発を加速させるため、科学技術企業であるIambic Therapeu
マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 大規模言語モデルは重大な課題に直面している:その膨大なサイズである。スペインのスタートアップMultiverse Computingは、最先端AIの能力と企業が実用的に導入できる範囲とのギャップを埋めるべく設計された圧縮モデルを開発することでこの問題に取り組んでいる。同社の革新的な技術「CompactifAI」は量子コンピューティング原理に着想を得た圧縮技術であり、バスク地方のこの企業はOpenA
関連特集おすすめ
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
教育と学習 教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム
教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム

2026年最新版 教師、チューター、コホート型学習プログラム向けベストAIクイズビルダープラットフォーム!XIX.AIは、実世界のテストを経て正確なランキングを提供する革新的なツールの中から、高評価のリストを厳選しました。これらの必須プラットフォームは、すべての学習シナリオにおいて、作成効率の向上、コンテンツ制作の効率化、クイズ設計の簡素化を支援します。今すぐ探索して、教育におけるAIの優位性を引き出すための完璧なツールを見つけましょう!

13 ツール
xix.ai
コメント (1)
0/500
BillyAnderson
BillyAnderson 2026年5月8日 21:00:45 JST

Interessant, aber irgendwie auch gruselig. Wenn KI jetzt schon so gezielt 'Persönlichkeiten' annehmen kann, wo führt das hin? Könnte man damit nicht auch extrem manipulativ werden? Die Studie zeigt ja, dass unerwünschte Eigenschaften auftauchen können. Wer entscheidet eigentlich, was 'unerwünscht' ist? 🧐 Das wirft mehr Fragen auf, als es beantwortet.

OR