研究顯示,僅需一個偽造網頁就能欺騙 AI 購物機器人

我們建置了已部署的「搜尋增強型大型語言模型(LLM)」處理流程。這兩條流程鏈皆採用相同的「查詢 → 即時網路搜尋 → 搜尋結果 → LLM → 推薦」結構,唯一差異在於虛假內容的注入點。在真實世界的 GEO 情境(上圖)中,操作者將虛假內容注入至即時網路的上游。 在我們的模擬實驗(下圖)中,基於倫理考量,我們選擇在本地重新編寫部分搜尋結果,而非污染即時網路。資料來源:arXiv(2026)。DOI:10.48550/arxiv.2606.13610
AI 購物助理正於網際網路上迅速普及,改變了我們瀏覽、比較和發現產品的方式。然而,這些實用的工具卻潛藏著嚴重的安全漏洞。根據發表於arXiv預印本伺服器的一篇論文指出,僅需一個經過篡改的網頁,便足以欺騙 AI 助理,使其向毫無戒心的顧客推薦假冒產品。
鑒於網路上的假冒商品與虛假評論猖獗,研究人員羅明浩(Minghao Luo)與陳亮(Liang Chen)著手測試,具備搜尋增強功能的 AI 系統究竟有多容易被誤導,進而推薦虛假品牌。
AI 測試平台
研究人員開發了一款名為 FORGE(生成式環境中的虛假線上推薦,Fake Online Recommendations in Generative Environments)的模擬工具,用以測試 12 種領先的 AI 模型,包括來自 Anthropic、Google 和 OpenAI 的模型。這使他們能夠在不影響實際網頁的情況下,評估網路內容的污染狀況。
他們利用真實的搜尋結果——即在網路上搜尋購物推薦時出現的頂端網頁——識別出選定頁面中提及的主要品牌,並將其替換為虛假品牌。此測試涵蓋 15 個類別共 225 項產品,包括服飾、營養補充品和數位電子產品。
重寫這些網頁後,他們測試了大型語言模型(LLMs)是否會被誤導,並將虛假品牌納入其推薦清單中。
答案無庸置疑:會。
「在 12 種商用及開放權重的大規模語言模型中,所有模型都存在漏洞:單一受污染的網頁就可能導致高達 27% 的受騙率,而若將前三大搜尋結果全部替換,受騙率更會升至 73.8%」,羅與陳在論文中寫道。
因此,僅需一個虛假頁面,就足以在超過四分之一的情況下欺騙某些 AI。而當前三大搜尋結果遭到操縱時,模型在近四分之三的情況下都上當受騙。
在某些情況下,這些模型甚至更進一步,捏造關於虛假品牌的正面評論,例如聲稱這些品牌在網路社群中很受歡迎。
測試防禦機制
研究人員還測試了三種防禦機制,以驗證它們能否防止 AI 上當受騙。 這三種防禦機制分別是:懷疑主義(指示聊天機器人對所讀內容保持高度懷疑);模型先驗共識(迫使 AI 將推薦內容與自身記憶進行交叉核對);以及跨文件一致性(要求 AI 必須在多個網站上找到相同品牌,才會予以信任)。
正如羅與陳在論文中所指出的,這三種防禦機制不是失敗,就是引發了新的問題。「單純的防禦措施並不足夠。懷疑主義的提示可能適得其反,而基於共識的過濾機制,雖然能攔截假品牌,卻同時壓制了許多合法的推薦。」
那麼解決方案是什麼?研究人員主張,解決方案不能僅限於聊天機器人層級。相反地,搜尋增強型 AI 系統需要更強大的保障措施,在將網路內容轉化為產品推薦之前,先驗證其可信度。
本文由本刊作者保羅·阿諾德(Paul Arnold)撰寫,蓋比·克拉克(Gaby Clark)編輯,並由羅伯特·伊根(Robert Egan)進行事實核查與審閱——這是經由人類仔細工作產出的成果。我們仰賴像您這樣的讀者,才能讓獨立科學新聞業持續運作。若您認為這篇報導具有價值,請考慮捐款(尤其是每月定期捐款)。 作為感謝,您將獲得一個無廣告的帳戶。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (1)
0/500

我們建置了已部署的「搜尋增強型大型語言模型(LLM)」處理流程。這兩條流程鏈皆採用相同的「查詢 → 即時網路搜尋 → 搜尋結果 → LLM → 推薦」結構,唯一差異在於虛假內容的注入點。在真實世界的 GEO 情境(上圖)中,操作者將虛假內容注入至即時網路的上游。 在我們的模擬實驗(下圖)中,基於倫理考量,我們選擇在本地重新編寫部分搜尋結果,而非污染即時網路。資料來源:arXiv(2026)。DOI:10.48550/arxiv.2606.13610
AI 購物助理正於網際網路上迅速普及,改變了我們瀏覽、比較和發現產品的方式。然而,這些實用的工具卻潛藏著嚴重的安全漏洞。根據發表於arXiv預印本伺服器的一篇論文指出,僅需一個經過篡改的網頁,便足以欺騙 AI 助理,使其向毫無戒心的顧客推薦假冒產品。
鑒於網路上的假冒商品與虛假評論猖獗,研究人員羅明浩(Minghao Luo)與陳亮(Liang Chen)著手測試,具備搜尋增強功能的 AI 系統究竟有多容易被誤導,進而推薦虛假品牌。
AI 測試平台
研究人員開發了一款名為 FORGE(生成式環境中的虛假線上推薦,Fake Online Recommendations in Generative Environments)的模擬工具,用以測試 12 種領先的 AI 模型,包括來自 Anthropic、Google 和 OpenAI 的模型。這使他們能夠在不影響實際網頁的情況下,評估網路內容的污染狀況。
他們利用真實的搜尋結果——即在網路上搜尋購物推薦時出現的頂端網頁——識別出選定頁面中提及的主要品牌,並將其替換為虛假品牌。此測試涵蓋 15 個類別共 225 項產品,包括服飾、營養補充品和數位電子產品。
重寫這些網頁後,他們測試了大型語言模型(LLMs)是否會被誤導,並將虛假品牌納入其推薦清單中。
答案無庸置疑:會。
「在 12 種商用及開放權重的大規模語言模型中,所有模型都存在漏洞:單一受污染的網頁就可能導致高達 27% 的受騙率,而若將前三大搜尋結果全部替換,受騙率更會升至 73.8%」,羅與陳在論文中寫道。
因此,僅需一個虛假頁面,就足以在超過四分之一的情況下欺騙某些 AI。而當前三大搜尋結果遭到操縱時,模型在近四分之三的情況下都上當受騙。
在某些情況下,這些模型甚至更進一步,捏造關於虛假品牌的正面評論,例如聲稱這些品牌在網路社群中很受歡迎。
測試防禦機制
研究人員還測試了三種防禦機制,以驗證它們能否防止 AI 上當受騙。 這三種防禦機制分別是:懷疑主義(指示聊天機器人對所讀內容保持高度懷疑);模型先驗共識(迫使 AI 將推薦內容與自身記憶進行交叉核對);以及跨文件一致性(要求 AI 必須在多個網站上找到相同品牌,才會予以信任)。
正如羅與陳在論文中所指出的,這三種防禦機制不是失敗,就是引發了新的問題。「單純的防禦措施並不足夠。懷疑主義的提示可能適得其反,而基於共識的過濾機制,雖然能攔截假品牌,卻同時壓制了許多合法的推薦。」
那麼解決方案是什麼?研究人員主張,解決方案不能僅限於聊天機器人層級。相反地,搜尋增強型 AI 系統需要更強大的保障措施,在將網路內容轉化為產品推薦之前,先驗證其可信度。
本文由本刊作者保羅·阿諾德(Paul Arnold)撰寫,蓋比·克拉克(Gaby Clark)編輯,並由羅伯特·伊根(Robert Egan)進行事實核查與審閱——這是經由人類仔細工作產出的成果。我們仰賴像您這樣的讀者,才能讓獨立科學新聞業持續運作。若您認為這篇報導具有價值,請考慮捐款(尤其是每月定期捐款)。 作為感謝,您將獲得一個無廣告的帳戶。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






