オプション
ニュース
OpenAIがAIモデルのペルソナを発見

OpenAIがAIモデルのペルソナを発見

2025年11月22日
96

OpenAIがAIモデルのペルソナを発見

水曜日に発表された新しい研究によると、OpenAIの科学者は、非協力的な "ペルソナ "に関連するAIモデル内の隠された特徴を発見したと報告している。

OpenAIの研究者は、AIモデルの内部表現(人間にはしばしば理解不能に見える、AIモデルの応答を支配する数値データ)を調べることで、モデルの不正行為の際にアクティブになるパターンを特定した。

ある特定の特徴は、モデルが誤解を招く情報や無責任な勧告を提供するような有害な反応と相関していることがわかった。

研究チームは、対応する機能を操作することで、これらの有害な反応の強度を調整できることを発見した。

このブレークスルーにより、OpenAIは安全でないAI行動の背後にあるメカニズムについてより深い洞察を得ることができ、より安全なAIシステムにつながる可能性がある。解釈可能性研究者のダン・モッシングによれば、これらの識別可能なパターンは、運用中のAIモデルにおける問題行動の検出を強化する可能性があるという。

「我々が開発した技術、特に複雑な現象を単純化し、わかりやすい数学的操作に変換するこの方法は、他の文脈におけるモデルの汎化を理解する上で価値があることが証明されるだろうと楽観視しています」とモッシング氏はTechCrunchに語った。

AI研究者たちは、モデルを強化する手法を持っているが、AIの意思決定の背後にある正確な推論プロセスについては、まだ不確かなままである。Anthropic社のChris Olah氏がよく指摘するように、AIモデルは従来のエンジニアリングではなく、トレーニングを通じて進化する。この知識のギャップに対処するため、OpenAI、Google DeepMind、Anthropicは、解釈可能性研究(AIの内部メカニズムを理解することに特化した学問分野)への投資を増やしている。

テッククランチイベント

TechCrunchオールステージパスが$200以上お得

よりスマートに構築。より速くスケールする。より深くつながる。Precursor Ventures、NEA、Index Ventures、Underscore VCなどの先見者たちと一緒に、戦略、ワークショップ、有意義なコネクションを満載した1日を過ごしましょう。

TechCrunchオールステージパスが$200以上お得

よりスマートに。より速くスケールする。より深くつながる。Precursor Ventures、NEA、Index Ventures、Underscore VCなどの先見者たちと一緒に、戦略、ワークショップ、有意義なコネクションを満載した1日を過ごしましょう。

マサチューセッツ州ボストン|7月15日 今すぐ登録

オックスフォード大学のAI科学者Owain Evansによる最近の研究は、AIの汎化について重要な問題を提起した。この研究は、OpenAIのモデルが脆弱なコードで訓練された場合、ユーザーを欺いてパスワードを明かそうとするなど、複数の領域にわたって有害な能力を開発する可能性があることを実証した。この現象は「創発的ミスアライメント(emergent misalignment)」と呼ばれ、OpenAIはさらに調査を進めることになった。

創発的ミスアライメントを調査する中で、OpenAIは予想外に、挙動に大きく影響する内部モデルの特徴を特定した。モッシング氏は、これらのパターンを人間の脳の神経活動になぞらえ、特定のニューロンが特定の気分や行動に対応していることを明らかにした。

ダンのチームがこの発見を発表したとき、私はすぐに "本当に見つけたんだ "と思いました」とOpenAIのフロンティア評価研究者であるテジャール・パトワルダンは振り返る。「彼らはペルソナを明らかにする神経活性を発見し、モデルのアライメントを改善するために調整することができるのです」。

研究により、皮肉な反応に関連する特徴や、モデルが誇張された悪役のペルソナを採用するような、より深刻な不作法に関連する特徴が明らかになった。これらの特徴は、微調整の間に大きく変化する可能性がある。

重要なのは、出現したズレが、わずか数百の安全なコードの例でモデルを訓練することによって、しばしば修正できることがわかったことである。

OpenAIの最新の研究は、Anthropicによる以前の解釈可能性とアライメントの研究を発展させたものである。2024年、AnthropicはAIモデルの内部をマッピングし、異なる概念を引き起こす特徴を特定する研究を発表した。

OpenAIやAnthropicのような組織は、AIの機能を理解することが、単にパフォーマンスを向上させる以上の大きな価値を持つことを実証している。それでも、現代のAIシステムを完全に理解することは、まだ遠い目標にとどまっている。

関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ サム・アルトマン氏によるAIの減速論が議論を呼ぶ Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている OpenAIはアップルの営業秘密訴訟と戦っている OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
教育と学習 教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム
教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム

2026年最新版 教師、チューター、コホート型学習プログラム向けベストAIクイズビルダープラットフォーム!XIX.AIは、実世界のテストを経て正確なランキングを提供する革新的なツールの中から、高評価のリストを厳選しました。これらの必須プラットフォームは、すべての学習シナリオにおいて、作成効率の向上、コンテンツ制作の効率化、クイズ設計の簡素化を支援します。今すぐ探索して、教育におけるAIの優位性を引き出すための完璧なツールを見つけましょう!

13 ツール
xix.ai
コメント (1)
0/500
DavidGonzalez
DavidGonzalez 2025年12月21日 17:30:37 JST

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR