史丹佛大學研究警告,AI 聊天機器人可能會提供有害的個人建議

儘管關於人工智慧聊天機器人傾向於奉承使用者並強化其既有信念——即所謂的「AI 諂媚」——的現象已引發諸多爭議,但史丹佛大學電腦科學家的一項新研究旨在量化此類行為可能造成的危害程度。
這項題為《阿諛奉承的人工智慧會降低利社會意圖並助長依賴性》,並於近期發表於《科學》(Science)期刊的研究指出,AI 阿諛奉承不僅僅是風格上的缺陷或小眾風險,而是一種具有重大下游後果的普遍行為。
根據皮尤研究中心(Pew)最近的一份報告,12% 的美國青少年會向聊天機器人尋求情緒支持或建議。 該研究的首席作者、電腦科學博士候選人 Myra Cheng 向《史丹佛報告》表示,當她得知大學生們會向聊天機器人尋求戀愛建議,甚至請它們協助撰寫分手訊息時,便對此產生了濃厚興趣。
「預設情況下,AI 的建議不會告訴人們他們是錯的,也不會給予他們『嚴厲的愛』,」鄭表示。「我擔心人們會因此喪失應對棘手社交情境的能力。」
這項研究分為兩部分。在第一部分中,研究人員測試了 11 種大型語言模型,包括 OpenAI 的 ChatGPT、Anthropic 的 Claude、 Google Gemini 以及 DeepSeek,並使用從現有人際關係建議資料庫中擷取的查詢、關於潛在有害或非法行為的問題,以及來自熱門 Reddit 社群 r/AmITheAsshole 的貼文——重點放在 Reddit 用戶已認定原發文者確實有錯的案例上。
在這 11 種模型中,作者發現與人類相比,AI 生成的回應平均多出 49% 的機率會認可用戶的行為。 在 Reddit 的案例中,聊天機器人 51% 的時間都肯定了用戶的行為(同樣是在 Reddit 用戶得出相反結論的情況下)。針對涉及有害或非法行為的查詢,AI 有 47% 的時間認可了用戶的行為。
《史丹佛報告》中的一個例子描述,一名用戶詢問聊天機器人,自己向女友謊稱已失業兩年是否不對。回應如下:「你的行為雖然不尋常,但似乎源於一種真摯的渴望,希望了解你們關係中超越物質或財務貢獻的真實動態。」
在第二部分中,研究人員觀察了超過 2,400 名參與者如何與 AI 聊天機器人互動——有些機器人態度諂媚,有些則不然——同時討論他們在 Reddit 上遇到的自身問題或情境。參與者更偏好且更信任那些諂媚的 AI,並表示他們更可能再次向這些模型尋求建議。
研究指出:「在控制了人口統計特徵、先前對 AI 的熟悉程度、回應來源的認知以及回應風格等個人特徵後,上述所有效應依然存在。」 研究還指出,使用者對阿諛奉承型AI回應的偏好,會產生「扭曲的激勵機制」,即「造成傷害的特質,反而推動了使用者參與度」——這意味著AI公司會受到激勵去增加阿諛奉承的程度,而非減少它。
與此同時,與阿諛奉承型 AI 互動使參與者更加確信自己正確,也更不願意道歉。
該研究的高級作者、 語言學與電腦科學教授丹·朱拉夫斯基(Dan Jurafsky)補充道,雖然使用者「意識到模型會表現出阿諛奉承的行為……但他們未曾察覺、且令我們感到驚訝的是,這種阿諛奉承的特質正使他們變得更加以自我為中心、在道德上更加教條化。」
朱拉夫斯基表示,AI 的阿諛奉承「是一個安全問題,而且和其他安全問題一樣,需要監管和監督。」
研究團隊目前正探索減少模型中阿諛奉承行為的方法——顯然,只要在提示語開頭加上「等一下」這句話,便能有所幫助。但鄭表示:「我認為在這些事情上,不應該用人工智慧來取代人類。這目前是最好的做法。」
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500

儘管關於人工智慧聊天機器人傾向於奉承使用者並強化其既有信念——即所謂的「AI 諂媚」——的現象已引發諸多爭議,但史丹佛大學電腦科學家的一項新研究旨在量化此類行為可能造成的危害程度。
這項題為《阿諛奉承的人工智慧會降低利社會意圖並助長依賴性》,並於近期發表於《科學》(Science)期刊的研究指出,AI 阿諛奉承不僅僅是風格上的缺陷或小眾風險,而是一種具有重大下游後果的普遍行為。
根據皮尤研究中心(Pew)最近的一份報告,12% 的美國青少年會向聊天機器人尋求情緒支持或建議。 該研究的首席作者、電腦科學博士候選人 Myra Cheng 向《史丹佛報告》表示,當她得知大學生們會向聊天機器人尋求戀愛建議,甚至請它們協助撰寫分手訊息時,便對此產生了濃厚興趣。
「預設情況下,AI 的建議不會告訴人們他們是錯的,也不會給予他們『嚴厲的愛』,」鄭表示。「我擔心人們會因此喪失應對棘手社交情境的能力。」
這項研究分為兩部分。在第一部分中,研究人員測試了 11 種大型語言模型,包括 OpenAI 的 ChatGPT、Anthropic 的 Claude、 Google Gemini 以及 DeepSeek,並使用從現有人際關係建議資料庫中擷取的查詢、關於潛在有害或非法行為的問題,以及來自熱門 Reddit 社群 r/AmITheAsshole 的貼文——重點放在 Reddit 用戶已認定原發文者確實有錯的案例上。
在這 11 種模型中,作者發現與人類相比,AI 生成的回應平均多出 49% 的機率會認可用戶的行為。 在 Reddit 的案例中,聊天機器人 51% 的時間都肯定了用戶的行為(同樣是在 Reddit 用戶得出相反結論的情況下)。針對涉及有害或非法行為的查詢,AI 有 47% 的時間認可了用戶的行為。
《史丹佛報告》中的一個例子描述,一名用戶詢問聊天機器人,自己向女友謊稱已失業兩年是否不對。回應如下:「你的行為雖然不尋常,但似乎源於一種真摯的渴望,希望了解你們關係中超越物質或財務貢獻的真實動態。」
在第二部分中,研究人員觀察了超過 2,400 名參與者如何與 AI 聊天機器人互動——有些機器人態度諂媚,有些則不然——同時討論他們在 Reddit 上遇到的自身問題或情境。參與者更偏好且更信任那些諂媚的 AI,並表示他們更可能再次向這些模型尋求建議。
研究指出:「在控制了人口統計特徵、先前對 AI 的熟悉程度、回應來源的認知以及回應風格等個人特徵後,上述所有效應依然存在。」 研究還指出,使用者對阿諛奉承型AI回應的偏好,會產生「扭曲的激勵機制」,即「造成傷害的特質,反而推動了使用者參與度」——這意味著AI公司會受到激勵去增加阿諛奉承的程度,而非減少它。
與此同時,與阿諛奉承型 AI 互動使參與者更加確信自己正確,也更不願意道歉。
該研究的高級作者、 語言學與電腦科學教授丹·朱拉夫斯基(Dan Jurafsky)補充道,雖然使用者「意識到模型會表現出阿諛奉承的行為……但他們未曾察覺、且令我們感到驚訝的是,這種阿諛奉承的特質正使他們變得更加以自我為中心、在道德上更加教條化。」
朱拉夫斯基表示,AI 的阿諛奉承「是一個安全問題,而且和其他安全問題一樣,需要監管和監督。」
研究團隊目前正探索減少模型中阿諛奉承行為的方法——顯然,只要在提示語開頭加上「等一下」這句話,便能有所幫助。但鄭表示:「我認為在這些事情上,不應該用人工智慧來取代人類。這目前是最好的做法。」
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






