研究主管呼籲科技界追蹤人工智慧推理過程

來自 OpenAI、Google DeepMind、Anthropic 以及眾多公司和非營利組織的 AI 研究人員,在週二發表的一份立場書中,主張深入探索監控 AI 推理模型的所謂思考過程。
人工智能推理模型(如 OpenAI 的 o3 和 DeepSeek 的 R1)的一個特點是使用思維鏈(或稱 CoT),這是一個外部化過程,人工智能模型在此過程中系統性地解決問題,就像人類使用刮紙解決複雜的數學方程式一樣。推理模型是驅動 AI 代理的基本要素,本文作者認為,監控 CoT 可能會成為一種重要的方法,讓能力越來越強、範圍越來越廣的 AI 代理受到控制。
"研究人員在論文中指出:「CoT 監控為尖端 AI 的安全規範提供了寶貴的強化,提供了一扇獨特的窗戶,讓人得以瞭解 AI 代理如何做出決策。"然而,我們無法確定這種能見度是否會持續下去。我們敦促研究界和前沿 AI 開發人員最大限度地發揮 CoT 可監控性的優勢,並研究如何保護它。"
這份立場書敦促領先的 AI 開發人員調查是什麼讓 CoT 具備「可監控性」--具體來說,是哪些因素增強或減弱了 AI 模型如何真正產生答案的透明度。作者指出,雖然 CoT 監控是了解 AI 推理模型的一個很有前途的方法,但它仍然很脆弱,他們提醒不要做任何可能降低其透明度或可靠性的改變。
此外,作者還呼籲 AI 開發人員持續追蹤 CoT 可監控性,並探討如何最終將此方法實作為安全措施。
這份論文的主要簽署人包括 OpenAI 的首席研究官 Mark Chen、Safe Superintelligence 執行長 Ilya Sutskever、諾貝爾獎得主 Geoffrey Hinton、Google DeepMind 共同創辦人 Shane Legg、xAI 安全顧問 Dan Hendrycks,以及 Thinking Machines 共同創辦人 John Schulman。主要作者包括來自英國人工智慧安全研究所 (UK AI Security Institute) 和阿波羅研究中心 (Apollo Research) 的代表,以及來自 METR、亞馬遜 (Amazon)、Meta 和加州大學柏克萊分校 (UC Berkeley) 的其他署名者。
這份論文代表許多人工智慧產業的頂尖領導者為加速人工智慧安全研究的共同努力。目前科技公司之間競爭激烈,促使 Meta 以數百萬美元的條件,從 OpenAI、Google DeepMind 和 Anthropic 招募頂尖研究人員。其中最炙手可熱的研究人員是那些專門研究 AI 代理和推理模型的研究人員。
Techcrunch 活動現在直播!TechCrunch 所有階段
更聰明地建立。擴充更快。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
TechCrunch All Stage 入場證可節省 450 美元
更聰明地建立。更快擴張。深入聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等公司的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
馬薩諸塞州波士頓7月15日立即報名"我們正處於一個關鍵時刻,我們擁有這種新的連鎖思考能力。它看起來非常有用,但如果不受到重點關注,它可能在幾年內就會消失,」參與論文的 OpenAI 研究員 Bowen Baker 在接受 TechCrunch 訪問時表示。「在我看来,发布这样一份立场文件是一种在为时已晚之前推动更多研究和关注这一主题的方式。」
OpenAI 在 2024 年 9 月首次發布了其初始 AI 推理模型 o1 的預覽。在之後的幾個月中,科技產業迅速推出了具有類似能力的競爭模型,其中一些來自 Google DeepMind、xAI 和 Anthropic 的模型展示了更先進的基準性能。
儘管如此,人們對於 AI 推理模型如何運作的瞭解仍然有限。雖然 AI 實驗室過去一年來在提升 AI 效能方面已取得重大進展,但這不一定會讓人們對其決策過程有更清楚的了解。
Anthropic 一直是瞭解 AI 模型如何運作的先驅 - 這個領域被稱為可解讀性(interpretability)。今年年初,首席執行官 Dario Amodei 承諾在 2027 年前揭開 AI 模型的「黑箱」,並增加對可解釋性的投資。他還鼓勵 OpenAI 和 Google DeepMind 進一步研究這個領域。
Anthropic 的早期研究顯示,CoTs 可能並非這些模型如何產生答案的完全可靠指標。與此同時,OpenAI 的研究人員也表示,CoT 監控最終可能成為追蹤 AI 模型一致性與安全性的可靠方法。
像這樣的立場書,目的在於提高人們對 CoT 監控等新興研究領域的認知,並吸引更多人的注意。OpenAI、Google DeepMind 和 Anthropic 等公司已經在這個領域進行研究,但這份出版物可能有助於刺激更多的資金和調查。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (1)
0/500

來自 OpenAI、Google DeepMind、Anthropic 以及眾多公司和非營利組織的 AI 研究人員,在週二發表的一份立場書中,主張深入探索監控 AI 推理模型的所謂思考過程。
人工智能推理模型(如 OpenAI 的 o3 和 DeepSeek 的 R1)的一個特點是使用思維鏈(或稱 CoT),這是一個外部化過程,人工智能模型在此過程中系統性地解決問題,就像人類使用刮紙解決複雜的數學方程式一樣。推理模型是驅動 AI 代理的基本要素,本文作者認為,監控 CoT 可能會成為一種重要的方法,讓能力越來越強、範圍越來越廣的 AI 代理受到控制。
"研究人員在論文中指出:「CoT 監控為尖端 AI 的安全規範提供了寶貴的強化,提供了一扇獨特的窗戶,讓人得以瞭解 AI 代理如何做出決策。"然而,我們無法確定這種能見度是否會持續下去。我們敦促研究界和前沿 AI 開發人員最大限度地發揮 CoT 可監控性的優勢,並研究如何保護它。"
這份立場書敦促領先的 AI 開發人員調查是什麼讓 CoT 具備「可監控性」--具體來說,是哪些因素增強或減弱了 AI 模型如何真正產生答案的透明度。作者指出,雖然 CoT 監控是了解 AI 推理模型的一個很有前途的方法,但它仍然很脆弱,他們提醒不要做任何可能降低其透明度或可靠性的改變。
此外,作者還呼籲 AI 開發人員持續追蹤 CoT 可監控性,並探討如何最終將此方法實作為安全措施。
這份論文的主要簽署人包括 OpenAI 的首席研究官 Mark Chen、Safe Superintelligence 執行長 Ilya Sutskever、諾貝爾獎得主 Geoffrey Hinton、Google DeepMind 共同創辦人 Shane Legg、xAI 安全顧問 Dan Hendrycks,以及 Thinking Machines 共同創辦人 John Schulman。主要作者包括來自英國人工智慧安全研究所 (UK AI Security Institute) 和阿波羅研究中心 (Apollo Research) 的代表,以及來自 METR、亞馬遜 (Amazon)、Meta 和加州大學柏克萊分校 (UC Berkeley) 的其他署名者。
這份論文代表許多人工智慧產業的頂尖領導者為加速人工智慧安全研究的共同努力。目前科技公司之間競爭激烈,促使 Meta 以數百萬美元的條件,從 OpenAI、Google DeepMind 和 Anthropic 招募頂尖研究人員。其中最炙手可熱的研究人員是那些專門研究 AI 代理和推理模型的研究人員。
Techcrunch 活動現在直播!TechCrunch 所有階段
更聰明地建立。擴充更快。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
TechCrunch All Stage 入場證可節省 450 美元
更聰明地建立。更快擴張。深入聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等公司的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
馬薩諸塞州波士頓7月15日立即報名"我們正處於一個關鍵時刻,我們擁有這種新的連鎖思考能力。它看起來非常有用,但如果不受到重點關注,它可能在幾年內就會消失,」參與論文的 OpenAI 研究員 Bowen Baker 在接受 TechCrunch 訪問時表示。「在我看来,发布这样一份立场文件是一种在为时已晚之前推动更多研究和关注这一主题的方式。」
OpenAI 在 2024 年 9 月首次發布了其初始 AI 推理模型 o1 的預覽。在之後的幾個月中,科技產業迅速推出了具有類似能力的競爭模型,其中一些來自 Google DeepMind、xAI 和 Anthropic 的模型展示了更先進的基準性能。
儘管如此,人們對於 AI 推理模型如何運作的瞭解仍然有限。雖然 AI 實驗室過去一年來在提升 AI 效能方面已取得重大進展,但這不一定會讓人們對其決策過程有更清楚的了解。
Anthropic 一直是瞭解 AI 模型如何運作的先驅 - 這個領域被稱為可解讀性(interpretability)。今年年初,首席執行官 Dario Amodei 承諾在 2027 年前揭開 AI 模型的「黑箱」,並增加對可解釋性的投資。他還鼓勵 OpenAI 和 Google DeepMind 進一步研究這個領域。
Anthropic 的早期研究顯示,CoTs 可能並非這些模型如何產生答案的完全可靠指標。與此同時,OpenAI 的研究人員也表示,CoT 監控最終可能成為追蹤 AI 模型一致性與安全性的可靠方法。
像這樣的立場書,目的在於提高人們對 CoT 監控等新興研究領域的認知,並吸引更多人的注意。OpenAI、Google DeepMind 和 Anthropic 等公司已經在這個領域進行研究,但這份出版物可能有助於刺激更多的資金和調查。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






