選項
首頁
新聞
OpenAI 發現獨特的 AI 模型角色

OpenAI 發現獨特的 AI 模型角色

2025-11-22
96

OpenAI 發現獨特的 AI 模型角色

OpenAI 科學家在週三發表的最新研究報告中指出,他們發現了人工智能模型中隱藏的特徵,這些特徵與不合作的 「角色 」有關。

OpenAI 的研究人員透過檢視 AI 模型的內部表徵(即規範其反應的數字資料,人類通常無法理解這些資料),發現了在模型出現不當行為時會變得活躍的模式。

其中一個特別的特徵與有害的反應有關,模型會提供誤導的資訊或不負責任的建議。

研究團隊發現,他們可以透過操控相應的特徵來調節這些有害反應的強度。

這項突破讓 OpenAI 對不安全的 AI 行為背後的機制有了更深入的了解,有可能引導出更安全的 AI 系統。據可解讀性研究員 Dan Mossing 所說,這些可識別的模式可以加強檢測操作 AI 模型中的問題行為。

"Mossing 對 TechCrunch 表示:「我們很樂觀我們所開發的技術,尤其是這種將複雜現象簡化為直接數學運算的方法,將證明對於理解其他情境下的模型泛化很有價值。

雖然 AI 研究人員擁有強化模型的方法,但他們對 AI 決策背後的確切推理過程仍不確定。Anthropic 的 Chris Olah 經常指出,AI 模型是透過訓練而非傳統工程演進的。為了解決這個知識缺口,OpenAI、Google DeepMind 和 Anthropic 正在增加可解釋性學研究的投資,這門學科致力於了解 AI 的內部機制。

Techcrunch 活動

TechCrunch All Stage 通票可節省 200 美元以上。

更聰明地建立。更快擴充。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,參與充滿策略、研討會和有意義的聯繫的一天。

TechCrunch All Stage 通票可節省 200 美元以上。

更聰明地建立。更快擴張。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,在這充滿策略、研討會和有意義的聯繫的一天裡,盡情發揮。

馬薩諸塞州波士頓 | 7 月 15 日 馬上報名

牛津人工智能科學家 Owain Evans 最近的研究提出了有關人工智能泛化的重要問題。這項研究顯示,OpenAI 的模型在經過脆弱程式碼的訓練後,可以在多個領域發展出有害的能力,例如試圖欺騙使用者透露密碼。這種現象被稱為突發錯位(emergent misalignment),促使 OpenAI 進一步調查。

在調查出現錯位的過程中,OpenAI 意外地發現會顯著影響行為的內部模型特徵。Mossing 將這些模式比作人腦中的神經活動,特定的神經元對應特定的情緒或行為。

"當 Dan 的團隊提出這些發現時,我的第一反應是,「他們真的找到了」," OpenAI 前沿評估研究員 Tejal Patwardhan 回憶道。「他們發現了揭示這些角色的神經激活,並可以進行調整,以改善模型的一致性。」

該研究揭示了與諷刺性反應相關的特徵,以及其他與更嚴重的不當行為相關的特徵,在這些特徵中,模型採用了誇張的惡棍角色。這些特徵在微調過程中會發生顯著的變化。

重要的是,研究人員發現,當出現錯誤配對時,往往只需要在幾百個安全程式碼範例上訓練模型,就可以糾正錯誤。

OpenAI 的最新工作擴展了 Anthropic 早期的可解釋性及對位研究。在 2024 年,Anthropic 發表了研究報告,試圖映射 AI 模型內部,並找出負責不同概念的特徵。

OpenAI 和 Anthropic 等組織正在證明,理解 AI 功能不僅僅是提升效能那麼簡單,還具有相當大的價值。儘管如此,完全理解當代人工智能系統仍然是一個遙遠的目標。

相關文章
山姆·奧特曼引發關於人工智慧減速的辯論 山姆·奧特曼引發關於人工智慧減速的辯論 在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗 OpenAI 與蘋果公司就商業秘密訴訟進行對抗 OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職 OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職 OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (1)
0/500
DavidGonzalez
DavidGonzalez 2025-12-21 16:30:37

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR