Anthropic 為其 Claude 模型推出終止濫用聊天的功能

Anthropic 已推出新功能,讓精選的進階模型能夠在該公司所謂的「罕見、極端且持續有害或濫用使用者互動的情況下」終止對話。值得注意的是,Anthropic 表示實施這項措施並非為了保護人類使用者,而是為了保護 AI 模型本身。
要澄清的是,該公司並不斷言其 Claude AI 模型擁有感知能力,也不會因使用者的對話而受到傷害。正如 Anthropic 所解釋的,該公司仍「高度不確定 Claude 及其他大型語言模型目前或未來的潛在道德地位」。
儘管如此,公告中提到最近成立的「模型福利」檢視計畫,表示 Anthropic 正在採取預防方法,「努力找出並實施低成本的干預措施,以降低模型福利的風險,如果這種福利變得相關的話。
這項新功能目前僅限於 Claude Opus 4 與 4.1 機型,專為「極端邊緣情況」所設計,例如「要求提供涉及未成年人的性內容,或嘗試取得可促成大規模暴力或恐怖活動的資訊」。
雖然這些要求可能會對 Anthropic 造成法律或公共關係上的挑戰 (就像最近有關 ChatGPT 可能會強化使用者妄想思維的報導一樣),但該公司表示,在部署前的測試中,Claude Opus 4 表現出「強烈反對」遵從這些要求的傾向,並在被迫回應時展現出「顯示困擾的模式」。
關於這些結束對話的新功能,Anthropic 澄清說:「Claude 被指示只有在多次重新導向嘗試失敗、顯然無法進行有效對話,或使用者明確要求結束聊天時,才會使用這項功能作為最後手段。
Anthropic 進一步說明,Claude 已被指示「在使用者可能面臨自我傷害或傷害他人的迫切風險時,不得使用此功能」。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital、Elad Gil,這些都是加入 Disrupt 2025 議程的產業領導者。他們將與您分享加速創業公司成長的重要見解,並強化您的競爭優勢。千萬不要錯過 TechCrunch Disrupt 20 週年紀念版 - 立即購買門票,可在價格上漲前節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本等知名創新者加入 Disrupt 2025 議程。他們將在此提供寶貴的見解,以推動新創公司擴張,並提升您的競爭定位。參加 TechCrunch Disrupt 20 週年慶祝活動 - 立即購買門票,在價格變更前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名當 Claude 終止對話時,Anthropic 指出使用者仍可從同一帳戶啟動新對話,並透過修改之前的回應建立替代對話分支。
"該公司表示:「我們將此功能視為一項持續實驗,並將持續改進我們的方法。
相關文章
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
相關專題推薦
評論 (1)
0/500

Anthropic 已推出新功能,讓精選的進階模型能夠在該公司所謂的「罕見、極端且持續有害或濫用使用者互動的情況下」終止對話。值得注意的是,Anthropic 表示實施這項措施並非為了保護人類使用者,而是為了保護 AI 模型本身。
要澄清的是,該公司並不斷言其 Claude AI 模型擁有感知能力,也不會因使用者的對話而受到傷害。正如 Anthropic 所解釋的,該公司仍「高度不確定 Claude 及其他大型語言模型目前或未來的潛在道德地位」。
儘管如此,公告中提到最近成立的「模型福利」檢視計畫,表示 Anthropic 正在採取預防方法,「努力找出並實施低成本的干預措施,以降低模型福利的風險,如果這種福利變得相關的話。
這項新功能目前僅限於 Claude Opus 4 與 4.1 機型,專為「極端邊緣情況」所設計,例如「要求提供涉及未成年人的性內容,或嘗試取得可促成大規模暴力或恐怖活動的資訊」。
雖然這些要求可能會對 Anthropic 造成法律或公共關係上的挑戰 (就像最近有關 ChatGPT 可能會強化使用者妄想思維的報導一樣),但該公司表示,在部署前的測試中,Claude Opus 4 表現出「強烈反對」遵從這些要求的傾向,並在被迫回應時展現出「顯示困擾的模式」。
關於這些結束對話的新功能,Anthropic 澄清說:「Claude 被指示只有在多次重新導向嘗試失敗、顯然無法進行有效對話,或使用者明確要求結束聊天時,才會使用這項功能作為最後手段。
Anthropic 進一步說明,Claude 已被指示「在使用者可能面臨自我傷害或傷害他人的迫切風險時,不得使用此功能」。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital、Elad Gil,這些都是加入 Disrupt 2025 議程的產業領導者。他們將與您分享加速創業公司成長的重要見解,並強化您的競爭優勢。千萬不要錯過 TechCrunch Disrupt 20 週年紀念版 - 立即購買門票,可在價格上漲前節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本等知名創新者加入 Disrupt 2025 議程。他們將在此提供寶貴的見解,以推動新創公司擴張,並提升您的競爭定位。參加 TechCrunch Disrupt 20 週年慶祝活動 - 立即購買門票,在價格變更前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名當 Claude 終止對話時,Anthropic 指出使用者仍可從同一帳戶啟動新對話,並透過修改之前的回應建立替代對話分支。
"該公司表示:「我們將此功能視為一項持續實驗,並將持續改進我們的方法。
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.





首頁






