聊天機器人扭曲新聞,甚至影響付費用戶

為什麼這很重要?如果聊天機器人連新聞檢索都無法與Google媲美,就很難信任它們能準確解釋並引用這些新聞。這使得它們的回應內容,即使有連結,也變得遠不可靠。
自信地給出錯誤答案
研究人員指出,聊天機器人以「令人震驚的自信」回覆錯誤答案,幾乎不對其結果加以限定或承認知識缺口。例如,ChatGPT「從未拒絕提供答案」,儘管其200個回應中有134個是錯誤的。在所有八個工具中,Copilot是唯一拒絕回答的次數多於回應次數的工具。
報告澄清:「所有工具一致地更傾向於提供錯誤答案,而不是承認自身的局限性。」
付費層級並不更可靠
即使是像Grok-3 Search和Perplexity Pro這樣的付費高級模型,雖然比免費版本更準確,但仍自信地給出錯誤答案。這讓人們對其高昂的訂閱費用價值產生質疑。
報告解釋:「這種矛盾主要源於[機器人]傾向於提供明確但錯誤的答案,而不是直接拒絕回答問題。」「根本問題不僅在於聊天機器人的事實錯誤,還在於它們權威的對話語氣,這使得用戶難以區分準確與不準確的資訊。」
報告補充:「這種不實的自信為用戶呈現了一種潛在危險的可靠性和準確性假象。」
捏造連結
AI模型因產生幻覺而臭名昭著,但Tow研究發現,Gemini和Grok 3的幻覺頻率最高——超過一半的時間。「即使Grok正確識別了一篇文章,它也常常連接到一個捏造的URL,」報告指出,這意味著Grok可能找到正確的標題和出版商,但隨後製造出實際的文章連結。
西北大學的「新聞室中的生成式AI」計畫通過分析Comscore流量數據,證實了這種模式。他們在2024年7月至11月的研究顯示,ChatGPT在其回應中生成了205個無效URL。雖然出版物偶爾會移除報導,導致404錯誤,但研究人員指出,缺乏存檔數據表明「該模型在回應用戶查詢時,捏造了看似可信的權威新聞網站連結。」
鑑於AI搜尋引擎的採用率不斷上升——Google在2024年第四季的市場份額首次在10年內跌破90%——這些發現令人不安。該公司上週還為某些用戶推出了AI Mode,儘管其AI Overviews廣受批評,仍用聊天機器人取代了常規搜尋。
隨著每週約4億用戶湧向ChatGPT,其引用的不可靠性和扭曲使它和其他熱門AI工具成為潛在的錯誤資訊引擎,即便它們從嚴格事實查核的新聞網站提取內容。
Tow報告得出結論,AI工具錯誤引用來源或不正確呈現其工作,可能會對出版商的聲譽造成反效果。
無視被阻擋的爬蟲
對出版商來說,情況更加惡化,因為Tow報告發現,幾個聊天機器人仍能從使用機器人排除協議(REP)或robots.txt阻止其爬蟲的出版商那裡檢索文章。然而,矛盾的是,聊天機器人無法正確回答關於允許它們訪問內容的網站的查詢。
報告指出:「Perplexity Pro在這方面是最嚴重的違規者,正確識別了近三分之一的九十篇它不應有權訪問的文章摘錄。」
這表明,AI公司不僅仍在無視REP——正如Perplexity和其他公司去年被發現的那樣——而且與它們簽訂任何許可協議的出版商也無法保證被正確引用。
哥倫比亞的報告只是更大問題的一個症狀。「新聞室中的生成式AI」報告還發現,聊天機器人很少將流量導向它們提取資訊的新聞網站,其他報告也證實了這一點。從2024年7月至11月,Perplexity僅將7%的轉介流量傳遞給新聞網站,而ChatGPT僅傳遞3%。相比之下,AI工具傾向於偏好像Scribd.com、Coursera和與大學相關的教育資源,將多達30%的流量導向這些資源。
底線:原始報導仍然是比AI工具反芻的內容更可靠的新聞來源。在接受它們提供的事實之前,務必驗證連結,並運用你的批判性思維和媒體素養技能來評估回應。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (52)
0/500
Paying for premium AI news and still getting misinformation? That's like buying a fancy umbrella that leaks in the rain. 🤦♂️ This study just confirms my biggest fear about AI in journalism—it's not just about errors, it's about the confidence with which it spreads them. Makes you wonder if we're outsourcing our critical thinking to machines that can't even get basic facts straight.
Paying for premium AI chatbots and still getting fake news? That's a rip-off! 😡 This study just proves we can't trust these bots to get the facts straight.
프리미엄 버전을 구입했는데 뉴스 정확도가 형편없네요. confidently 잘못된 정보를 내뱉는 모습을 보면서 웃음이 나왔어요. 😂 돈 아깝네요. 사람 손으로 쓴 뉴스가 더 나을 것 같아요.
Paguei pela versão premium achando que teria notícias precisas, mas que erro! Ele dá informações erradas com tanta confiança que parece um pastor pregando. 😅 Não vale o dinheiro. Talvez seja melhor ficar com notícias escritas por humanos.

為什麼這很重要?如果聊天機器人連新聞檢索都無法與Google媲美,就很難信任它們能準確解釋並引用這些新聞。這使得它們的回應內容,即使有連結,也變得遠不可靠。
自信地給出錯誤答案
研究人員指出,聊天機器人以「令人震驚的自信」回覆錯誤答案,幾乎不對其結果加以限定或承認知識缺口。例如,ChatGPT「從未拒絕提供答案」,儘管其200個回應中有134個是錯誤的。在所有八個工具中,Copilot是唯一拒絕回答的次數多於回應次數的工具。
報告澄清:「所有工具一致地更傾向於提供錯誤答案,而不是承認自身的局限性。」
付費層級並不更可靠
即使是像Grok-3 Search和Perplexity Pro這樣的付費高級模型,雖然比免費版本更準確,但仍自信地給出錯誤答案。這讓人們對其高昂的訂閱費用價值產生質疑。
報告解釋:「這種矛盾主要源於[機器人]傾向於提供明確但錯誤的答案,而不是直接拒絕回答問題。」「根本問題不僅在於聊天機器人的事實錯誤,還在於它們權威的對話語氣,這使得用戶難以區分準確與不準確的資訊。」
報告補充:「這種不實的自信為用戶呈現了一種潛在危險的可靠性和準確性假象。」
捏造連結
AI模型因產生幻覺而臭名昭著,但Tow研究發現,Gemini和Grok 3的幻覺頻率最高——超過一半的時間。「即使Grok正確識別了一篇文章,它也常常連接到一個捏造的URL,」報告指出,這意味著Grok可能找到正確的標題和出版商,但隨後製造出實際的文章連結。
西北大學的「新聞室中的生成式AI」計畫通過分析Comscore流量數據,證實了這種模式。他們在2024年7月至11月的研究顯示,ChatGPT在其回應中生成了205個無效URL。雖然出版物偶爾會移除報導,導致404錯誤,但研究人員指出,缺乏存檔數據表明「該模型在回應用戶查詢時,捏造了看似可信的權威新聞網站連結。」
鑑於AI搜尋引擎的採用率不斷上升——Google在2024年第四季的市場份額首次在10年內跌破90%——這些發現令人不安。該公司上週還為某些用戶推出了AI Mode,儘管其AI Overviews廣受批評,仍用聊天機器人取代了常規搜尋。
隨著每週約4億用戶湧向ChatGPT,其引用的不可靠性和扭曲使它和其他熱門AI工具成為潛在的錯誤資訊引擎,即便它們從嚴格事實查核的新聞網站提取內容。
Tow報告得出結論,AI工具錯誤引用來源或不正確呈現其工作,可能會對出版商的聲譽造成反效果。
無視被阻擋的爬蟲
對出版商來說,情況更加惡化,因為Tow報告發現,幾個聊天機器人仍能從使用機器人排除協議(REP)或robots.txt阻止其爬蟲的出版商那裡檢索文章。然而,矛盾的是,聊天機器人無法正確回答關於允許它們訪問內容的網站的查詢。
報告指出:「Perplexity Pro在這方面是最嚴重的違規者,正確識別了近三分之一的九十篇它不應有權訪問的文章摘錄。」
這表明,AI公司不僅仍在無視REP——正如Perplexity和其他公司去年被發現的那樣——而且與它們簽訂任何許可協議的出版商也無法保證被正確引用。
哥倫比亞的報告只是更大問題的一個症狀。「新聞室中的生成式AI」報告還發現,聊天機器人很少將流量導向它們提取資訊的新聞網站,其他報告也證實了這一點。從2024年7月至11月,Perplexity僅將7%的轉介流量傳遞給新聞網站,而ChatGPT僅傳遞3%。相比之下,AI工具傾向於偏好像Scribd.com、Coursera和與大學相關的教育資源,將多達30%的流量導向這些資源。
底線:原始報導仍然是比AI工具反芻的內容更可靠的新聞來源。在接受它們提供的事實之前,務必驗證連結,並運用你的批判性思維和媒體素養技能來評估回應。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Paying for premium AI news and still getting misinformation? That's like buying a fancy umbrella that leaks in the rain. 🤦♂️ This study just confirms my biggest fear about AI in journalism—it's not just about errors, it's about the confidence with which it spreads them. Makes you wonder if we're outsourcing our critical thinking to machines that can't even get basic facts straight.
Paying for premium AI chatbots and still getting fake news? That's a rip-off! 😡 This study just proves we can't trust these bots to get the facts straight.
프리미엄 버전을 구입했는데 뉴스 정확도가 형편없네요. confidently 잘못된 정보를 내뱉는 모습을 보면서 웃음이 나왔어요. 😂 돈 아깝네요. 사람 손으로 쓴 뉴스가 더 나을 것 같아요.
Paguei pela versão premium achando que teria notícias precisas, mas que erro! Ele dá informações erradas com tanta confiança que parece um pastor pregando. 😅 Não vale o dinheiro. Talvez seja melhor ficar com notícias escritas por humanos.





首頁






