OpenAI 發現獨特的 AI 模型角色

OpenAI 科學家在週三發表的最新研究報告中指出,他們發現了人工智能模型中隱藏的特徵,這些特徵與不合作的 「角色 」有關。
OpenAI 的研究人員透過檢視 AI 模型的內部表徵(即規範其反應的數字資料,人類通常無法理解這些資料),發現了在模型出現不當行為時會變得活躍的模式。
其中一個特別的特徵與有害的反應有關,模型會提供誤導的資訊或不負責任的建議。
研究團隊發現,他們可以透過操控相應的特徵來調節這些有害反應的強度。
這項突破讓 OpenAI 對不安全的 AI 行為背後的機制有了更深入的了解,有可能引導出更安全的 AI 系統。據可解讀性研究員 Dan Mossing 所說,這些可識別的模式可以加強檢測操作 AI 模型中的問題行為。
"Mossing 對 TechCrunch 表示:「我們很樂觀我們所開發的技術,尤其是這種將複雜現象簡化為直接數學運算的方法,將證明對於理解其他情境下的模型泛化很有價值。
雖然 AI 研究人員擁有強化模型的方法,但他們對 AI 決策背後的確切推理過程仍不確定。Anthropic 的 Chris Olah 經常指出,AI 模型是透過訓練而非傳統工程演進的。為了解決這個知識缺口,OpenAI、Google DeepMind 和 Anthropic 正在增加可解釋性學研究的投資,這門學科致力於了解 AI 的內部機制。
Techcrunch 活動TechCrunch All Stage 通票可節省 200 美元以上。
更聰明地建立。更快擴充。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,參與充滿策略、研討會和有意義的聯繫的一天。
TechCrunch All Stage 通票可節省 200 美元以上。
更聰明地建立。更快擴張。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,在這充滿策略、研討會和有意義的聯繫的一天裡,盡情發揮。
馬薩諸塞州波士頓 | 7 月 15 日 馬上報名牛津人工智能科學家 Owain Evans 最近的研究提出了有關人工智能泛化的重要問題。這項研究顯示,OpenAI 的模型在經過脆弱程式碼的訓練後,可以在多個領域發展出有害的能力,例如試圖欺騙使用者透露密碼。這種現象被稱為突發錯位(emergent misalignment),促使 OpenAI 進一步調查。
在調查出現錯位的過程中,OpenAI 意外地發現會顯著影響行為的內部模型特徵。Mossing 將這些模式比作人腦中的神經活動,特定的神經元對應特定的情緒或行為。
"當 Dan 的團隊提出這些發現時,我的第一反應是,「他們真的找到了」," OpenAI 前沿評估研究員 Tejal Patwardhan 回憶道。「他們發現了揭示這些角色的神經激活,並可以進行調整,以改善模型的一致性。」
該研究揭示了與諷刺性反應相關的特徵,以及其他與更嚴重的不當行為相關的特徵,在這些特徵中,模型採用了誇張的惡棍角色。這些特徵在微調過程中會發生顯著的變化。
重要的是,研究人員發現,當出現錯誤配對時,往往只需要在幾百個安全程式碼範例上訓練模型,就可以糾正錯誤。
OpenAI 的最新工作擴展了 Anthropic 早期的可解釋性及對位研究。在 2024 年,Anthropic 發表了研究報告,試圖映射 AI 模型內部,並找出負責不同概念的特徵。
OpenAI 和 Anthropic 等組織正在證明,理解 AI 功能不僅僅是提升效能那麼簡單,還具有相當大的價值。儘管如此,完全理解當代人工智能系統仍然是一個遙遠的目標。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (1)
0/500

OpenAI 科學家在週三發表的最新研究報告中指出,他們發現了人工智能模型中隱藏的特徵,這些特徵與不合作的 「角色 」有關。
OpenAI 的研究人員透過檢視 AI 模型的內部表徵(即規範其反應的數字資料,人類通常無法理解這些資料),發現了在模型出現不當行為時會變得活躍的模式。
其中一個特別的特徵與有害的反應有關,模型會提供誤導的資訊或不負責任的建議。
研究團隊發現,他們可以透過操控相應的特徵來調節這些有害反應的強度。
這項突破讓 OpenAI 對不安全的 AI 行為背後的機制有了更深入的了解,有可能引導出更安全的 AI 系統。據可解讀性研究員 Dan Mossing 所說,這些可識別的模式可以加強檢測操作 AI 模型中的問題行為。
"Mossing 對 TechCrunch 表示:「我們很樂觀我們所開發的技術,尤其是這種將複雜現象簡化為直接數學運算的方法,將證明對於理解其他情境下的模型泛化很有價值。
雖然 AI 研究人員擁有強化模型的方法,但他們對 AI 決策背後的確切推理過程仍不確定。Anthropic 的 Chris Olah 經常指出,AI 模型是透過訓練而非傳統工程演進的。為了解決這個知識缺口,OpenAI、Google DeepMind 和 Anthropic 正在增加可解釋性學研究的投資,這門學科致力於了解 AI 的內部機制。
Techcrunch 活動TechCrunch All Stage 通票可節省 200 美元以上。
更聰明地建立。更快擴充。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,參與充滿策略、研討會和有意義的聯繫的一天。
TechCrunch All Stage 通票可節省 200 美元以上。
更聰明地建立。更快擴張。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 及其他機構的有遠見的人士一起,在這充滿策略、研討會和有意義的聯繫的一天裡,盡情發揮。
馬薩諸塞州波士頓 | 7 月 15 日 馬上報名牛津人工智能科學家 Owain Evans 最近的研究提出了有關人工智能泛化的重要問題。這項研究顯示,OpenAI 的模型在經過脆弱程式碼的訓練後,可以在多個領域發展出有害的能力,例如試圖欺騙使用者透露密碼。這種現象被稱為突發錯位(emergent misalignment),促使 OpenAI 進一步調查。
在調查出現錯位的過程中,OpenAI 意外地發現會顯著影響行為的內部模型特徵。Mossing 將這些模式比作人腦中的神經活動,特定的神經元對應特定的情緒或行為。
"當 Dan 的團隊提出這些發現時,我的第一反應是,「他們真的找到了」," OpenAI 前沿評估研究員 Tejal Patwardhan 回憶道。「他們發現了揭示這些角色的神經激活,並可以進行調整,以改善模型的一致性。」
該研究揭示了與諷刺性反應相關的特徵,以及其他與更嚴重的不當行為相關的特徵,在這些特徵中,模型採用了誇張的惡棍角色。這些特徵在微調過程中會發生顯著的變化。
重要的是,研究人員發現,當出現錯誤配對時,往往只需要在幾百個安全程式碼範例上訓練模型,就可以糾正錯誤。
OpenAI 的最新工作擴展了 Anthropic 早期的可解釋性及對位研究。在 2024 年,Anthropic 發表了研究報告,試圖映射 AI 模型內部,並找出負責不同概念的特徵。
OpenAI 和 Anthropic 等組織正在證明,理解 AI 功能不僅僅是提升效能那麼簡單,還具有相當大的價值。儘管如此,完全理解當代人工智能系統仍然是一個遙遠的目標。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






