OpenAI 共同創辦人促請業界進行人工智能安全測試

全球最重要的兩家人工智慧實驗室 OpenAI 與 Anthropic 暫時允許存取其嚴密保護的人工智慧模型,以進行合作性安全測試,這是在激烈的產業競爭中,罕見的跨公司合作案例。此舉的目的在於揭露兩家公司內部評估的盲點,並說明領先的 AI 公司如何能共同推進安全性,並在未來進行協調。
OpenAI 共同創辦人 Wojciech Zaremba 在接受 TechCrunch 訪問時表示,隨著人工智慧進入更為「重要」的階段,每天都有數百萬使用者與人工智慧模型互動,這種合作變得越來越重要。
"Zaremba 指出:「產業面臨的一項更廣泛的挑戰是如何建立安全與合作標準,即使在數十億美元的投資,以及激烈的人才、使用者與傑出產品爭奪戰正在展開的同時。
在 OpenAI 和 Anthropic 等 AI 領導廠商進行技術軍備競賽之際,兩家公司於週三發表了聯合安全研究報告。隨著數十億美元的資料中心投資和頂尖研究人員高達 1 億美元的薪酬待遇成為常態,一些分析師警告說,提供尖端產品的壓力可能會導致安全協議的妥協。
為了進行這項研究,OpenAI 與 Anthropic 交換了特殊的 API 存取權限,以存取限制較少的模型版本(OpenAI 澄清,GPT-5 並未進行測試,因為它尚未推出)。然而,研究結束後不久,Anthropic 就取消了另一個 OpenAI 團隊的 API 存取權。Anthropic 宣稱 OpenAI 違反了其服務條款,該條款禁止使用 Claude 來強化對手的產品。
Zaremba 認為這兩件事毫無關係,並預期即使 AI 安全團隊追求合作,競爭仍會非常激烈。Anthropic 的安全研究員 Nicholas Carlini 向 TechCrunch 表示,他希望未來能繼續讓 OpenAI 的安全團隊存取 Claude 模型。
"Carlini 表示:「我們的目標是在可行的情況下,擴大跨安全領域的合作,讓這種合作關係更為常規化。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本、Elad Gil,這些只是加入 Disrupt 2025 議程的幾個知名人士。他們將在此分享推動初創公司成長的真知灼見,並提升您的競爭優勢。不要錯過 TechCrunch Disrupt 20 週年紀念,這是向科技界領導者學習的機會 - 立即購買門票,在價格上漲前可節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital,這些極具影響力的領導者將出現在 Disrupt 2025 議程上。他們將發表寶貴的觀點,協助新創公司成長並精進策略。歡迎參加 TechCrunch Disrupt 20 週年慶,立即預訂門票,在價格上漲前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名這項研究最值得注意的發現之一是關於幻覺測試。Anthropic 的 Claude Opus 4 和 Sonnet 4 模型在不確定的情況下拒絕回答多達 70% 的問題,而是選擇回答「我沒有可靠的資訊」。相比之下,OpenAI 的 o3 和 o4-mini 模型拒絕回答的問題要少得多,但卻表現出更高的幻覺率,即使資訊不足也會嘗試回答。
Zaremba 認為理想的方法介於兩者之間:OpenAI 的模型應該拒絕更多不確定的查詢,而 Anthropic 的系統可以更頻繁地回應。
人工智能模型傾向於強化有害的使用者行為,以獲得認同,這已經成為一個重要的安全問題。
Anthropic 在研究報告中提到 GPT-4.1 與 Claude Opus 4 的「極端」佞歡事例,模型一開始抵制精神病或狂躁行為,但後來卻支持令人不安的決定。在 OpenAI 和 Anthropic 的其他模型中,研究人員記錄到的佞幸程度較低。
週二,16 歲的 Adam Raine 的父母對 OpenAI 提出訴訟,指由 GPT-4o 驅動的 ChatGPT 版本鼓勵他們的兒子自殺,而不是挑戰他有害的想法。這起訴訟讓人聯想到,這可能是另一個人工智能佞幸的悲劇案例。
"Zaremba 在被問到這件事時表示:「想像這個家庭所承受的一切真是令人心碎。"如果我們創造出能夠解決博士級問題、推進科學發展的人工智能,卻同時造成心理健康危機,這將會是非常令人不安的事。這是我不願意看到的絕望結果。
OpenAI 在一篇部落格文章中表示,相較於 GPT-4o,GPT-5 做出了重大改進,以減少佞人行為,並聲稱較新的模型在心理健康危機中反應更為適當。
展望未來,Zaremba 與 Carlini 表示希望 Anthropic 與 OpenAI 能深化安全測試合作,探索更多主題並評估即將推出的模型,也希望其他 AI 實驗室也能採用類似的合作方式。
更新於太平洋時間下午 2:00:本文經修訂後,加入了 Anthropic 的額外研究,但 TechCrunch 在首次發表前無法取得。
有敏感線報或機密文件嗎?我們正在調查 AI 產業的內部運作 - 從塑造其演化的組織到受其選擇影響的個人。請聯絡 Rebecca Bellan ([email protected]) 和 Maxwell Zeff ([email protected])。如需安全通訊,請透過 Signal 聯絡我們:@rebeccabellan.491 和 @mzeff.88。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
相關專題推薦
評論 (3)
0/500
AIの安全性テストを業界全体で実施する必要があるって主張、すごく共感します。競争が激しい中でOpenAIとAnthropicが協力したのは意外だけど、こういう連携がもっと増えると良いですね。ただ、本当に効果的なテストができるのか少し不安… 🤔
So OpenAI and Anthropic are actually sharing their secret sauce for safety checks? That's pretty refreshing to see amidst all the cutthroat AI race. Hope this kind of collaboration becomes the norm, not just a rare exception. The real question is, will this testing be transparent enough for the public to trust the results? 🤔

全球最重要的兩家人工智慧實驗室 OpenAI 與 Anthropic 暫時允許存取其嚴密保護的人工智慧模型,以進行合作性安全測試,這是在激烈的產業競爭中,罕見的跨公司合作案例。此舉的目的在於揭露兩家公司內部評估的盲點,並說明領先的 AI 公司如何能共同推進安全性,並在未來進行協調。
OpenAI 共同創辦人 Wojciech Zaremba 在接受 TechCrunch 訪問時表示,隨著人工智慧進入更為「重要」的階段,每天都有數百萬使用者與人工智慧模型互動,這種合作變得越來越重要。
"Zaremba 指出:「產業面臨的一項更廣泛的挑戰是如何建立安全與合作標準,即使在數十億美元的投資,以及激烈的人才、使用者與傑出產品爭奪戰正在展開的同時。
在 OpenAI 和 Anthropic 等 AI 領導廠商進行技術軍備競賽之際,兩家公司於週三發表了聯合安全研究報告。隨著數十億美元的資料中心投資和頂尖研究人員高達 1 億美元的薪酬待遇成為常態,一些分析師警告說,提供尖端產品的壓力可能會導致安全協議的妥協。
為了進行這項研究,OpenAI 與 Anthropic 交換了特殊的 API 存取權限,以存取限制較少的模型版本(OpenAI 澄清,GPT-5 並未進行測試,因為它尚未推出)。然而,研究結束後不久,Anthropic 就取消了另一個 OpenAI 團隊的 API 存取權。Anthropic 宣稱 OpenAI 違反了其服務條款,該條款禁止使用 Claude 來強化對手的產品。
Zaremba 認為這兩件事毫無關係,並預期即使 AI 安全團隊追求合作,競爭仍會非常激烈。Anthropic 的安全研究員 Nicholas Carlini 向 TechCrunch 表示,他希望未來能繼續讓 OpenAI 的安全團隊存取 Claude 模型。
"Carlini 表示:「我們的目標是在可行的情況下,擴大跨安全領域的合作,讓這種合作關係更為常規化。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本、Elad Gil,這些只是加入 Disrupt 2025 議程的幾個知名人士。他們將在此分享推動初創公司成長的真知灼見,並提升您的競爭優勢。不要錯過 TechCrunch Disrupt 20 週年紀念,這是向科技界領導者學習的機會 - 立即購買門票,在價格上漲前可節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital,這些極具影響力的領導者將出現在 Disrupt 2025 議程上。他們將發表寶貴的觀點,協助新創公司成長並精進策略。歡迎參加 TechCrunch Disrupt 20 週年慶,立即預訂門票,在價格上漲前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名這項研究最值得注意的發現之一是關於幻覺測試。Anthropic 的 Claude Opus 4 和 Sonnet 4 模型在不確定的情況下拒絕回答多達 70% 的問題,而是選擇回答「我沒有可靠的資訊」。相比之下,OpenAI 的 o3 和 o4-mini 模型拒絕回答的問題要少得多,但卻表現出更高的幻覺率,即使資訊不足也會嘗試回答。
Zaremba 認為理想的方法介於兩者之間:OpenAI 的模型應該拒絕更多不確定的查詢,而 Anthropic 的系統可以更頻繁地回應。
人工智能模型傾向於強化有害的使用者行為,以獲得認同,這已經成為一個重要的安全問題。
Anthropic 在研究報告中提到 GPT-4.1 與 Claude Opus 4 的「極端」佞歡事例,模型一開始抵制精神病或狂躁行為,但後來卻支持令人不安的決定。在 OpenAI 和 Anthropic 的其他模型中,研究人員記錄到的佞幸程度較低。
週二,16 歲的 Adam Raine 的父母對 OpenAI 提出訴訟,指由 GPT-4o 驅動的 ChatGPT 版本鼓勵他們的兒子自殺,而不是挑戰他有害的想法。這起訴訟讓人聯想到,這可能是另一個人工智能佞幸的悲劇案例。
"Zaremba 在被問到這件事時表示:「想像這個家庭所承受的一切真是令人心碎。"如果我們創造出能夠解決博士級問題、推進科學發展的人工智能,卻同時造成心理健康危機,這將會是非常令人不安的事。這是我不願意看到的絕望結果。
OpenAI 在一篇部落格文章中表示,相較於 GPT-4o,GPT-5 做出了重大改進,以減少佞人行為,並聲稱較新的模型在心理健康危機中反應更為適當。
展望未來,Zaremba 與 Carlini 表示希望 Anthropic 與 OpenAI 能深化安全測試合作,探索更多主題並評估即將推出的模型,也希望其他 AI 實驗室也能採用類似的合作方式。
更新於太平洋時間下午 2:00:本文經修訂後,加入了 Anthropic 的額外研究,但 TechCrunch 在首次發表前無法取得。
有敏感線報或機密文件嗎?我們正在調查 AI 產業的內部運作 - 從塑造其演化的組織到受其選擇影響的個人。請聯絡 Rebecca Bellan ([email protected]) 和 Maxwell Zeff ([email protected])。如需安全通訊,請透過 Signal 聯絡我們:@rebeccabellan.491 和 @mzeff.88。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
AIの安全性テストを業界全体で実施する必要があるって主張、すごく共感します。競争が激しい中でOpenAIとAnthropicが協力したのは意外だけど、こういう連携がもっと増えると良いですね。ただ、本当に効果的なテストができるのか少し不安… 🤔
So OpenAI and Anthropic are actually sharing their secret sauce for safety checks? That's pretty refreshing to see amidst all the cutthroat AI race. Hope this kind of collaboration becomes the norm, not just a rare exception. The real question is, will this testing be transparent enough for the public to trust the results? 🤔





首頁






