選項
首頁
新聞
透過放大人工智慧圖像的缺陷來解決其幻覺問題

透過放大人工智慧圖像的缺陷來解決其幻覺問題

2025-12-22
95

像 ChatGPT 這樣的視覺模型經常會捏造出圖像中遺漏的元素。一種新穎的方法可以減少這些錯誤,方法是從模型的標題中產生模型自己幻覺的細節的誇張版本,然後促請模型修改。這項技術不需要重新訓練或額外的資料,因此廣泛適用於各種模型和架構。

來自中國的一項新研究解決了人工智能生成的圖像和視頻中出現幻覺的頑固問題--這些細節明顯與用戶的提示相矛盾。

這個過程以傳統方式開始:模型描述一張圖片。然後,該標題被賦予一個文本到圖像模型,以產生一個新的圖像- 在此重建中任何額外的物件或特徵都會直接揭示模型最初的幻覺。透過比較原始與產生的影像,系統可以引導模型避免在未來的嘗試中重複這些錯誤。

說明新方法如何識別和減少影像說明中的幻覺。正規模型會描述原始影像中不存在的鳥類,進而在重建影像中加入這些鳥類。這些錯誤以紅色標示。相比之下,建議的方法可以避免這些虛構的細節,同時保持標題的具體和流暢。來源:https://arxiv.org/pdf/2509.21997

此圖顯示新技術如何偵測並盡量減少字幕幻覺。標準模型會錯誤地在圖像的描述中加入鳥類,而重建的版本會以視覺方式插入鳥類(以紅色強調)。新方法在保持描述準確性的同時,避免了這些虛構。來源:https://arxiv.org/pdf/2509.21997

該方法首先讓模型描述真實的圖像,有時包括實際上沒有出現的物件或細節。這些不準確的標題會產生突出錯誤的合成影像。透過比較真實與合成影像,系統可辨識導致編造內容的內部模式。

一旦識別出這些錯誤模式,它們就會被儲存起來以備將來使用。為新影像加上字幕時,系統會調整模型的內部訊號,使其遠離已知的幻覺觸發點。這種修正只需一次,不需要額外的資料、重新訓練或在測試期間產生影像。

纏結的挑戰

在本文的範例中,「纏結」可能解釋了為什麼鳥類會被加入到一張沒有鳥類的圖像中。

當模型強烈連結某些概念,因為它們經常一起出現在訓練資料中時,就會發生糾纏。在這裡,模型可能會經常遇到飛機與鳥類,因此產生了錯誤影響標題的聯想。

雖然提早結束訓練可以減少糾纏(增加模型彈性),但也會減少概念細節和解析度。開發人員長期面臨一個取捨的問題:是優先考量一個靈活、糾纏不清的模型,還是一個更容易產生聯想幻覺的模型?

理想的情況是,原始圖片的標題會逐項列出每一個存在的物件,讓模型可以將它們儲存為獨立、分散的項目。然而,SEO 驅動的標題做法和大規模的網路搜刮(在訓練強大的生成模型時很常見)往往無法達到這個標準。

弱標題限制了 LAION 影像對於訓練 Stable Diffusion 等模型的效用。許多文字標籤都很淺薄、含糊不清,或是為了 SEO 而優化,而不是為了精確描述,這使得模型更難學習細粒度的視覺概念,例如臉部特徵 (原始來源為 https://rom1504.github.io/,現已停用)。

薄弱的標題會降低 LAION 影像對於訓練 Stable Diffusion 等模型的價值。標籤往往是膚淺、含糊不清,或是以 SEO 為重點,而非描述性的,這會妨礙模型學習詳細視覺概 念 (例如臉部特徵) 的能力。(原始來源為 https://rom1504.github.io/,現已停用)。

由於基礎修復不切實際,減少 LLM 和 VLM 幻覺的變通方法已成為重要的研究重點。新的中文方法在不同的架構和條件下進行測試,顯示出抑制「幻覺污染」的前景。

作者指出:

跨多種基準的廣泛實驗顯示,我們的方法在物件、屬性和關係層面上顯著減少了幻覺,同時在很大程度上保留了召回率和標題[豐富度]。

這篇題為Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors 的論文來自中國科學技術大學和南京大學的研究人員。

方法的工作原理

研究人員開發了一套端對端的管道,用以揭露和抑制字幕幻覺:

完整管道的示意圖。視覺語言模型首先從輸入影像產生標題,其中可能包含幻覺內容。然後,這個標題會透過文字轉影像模型產生重建影像,讓任何幻覺更容易被發現。從原始影像與重構影像中萃取嵌入內容,並用於指導解碼器內部的調整,幫助模型抑制幻覺細節,同時保持字幕品質。

完整的管道圖解。視覺語言模型從輸入圖像產生標題,可能包括幻覺。該標題透過文字到圖像模型用於創建重構圖像,使錯誤清晰可見。來自兩張圖像的嵌入會引導內部調整,幫助模型在不降低標題品質的情況下,減少被濫用的細節。

視覺語言模型首先為真實的圖像加上標題,可能會創造一些物件或關係。然後,標題會產生一張重建的圖像,揭示出任何虛構的視覺差異。比較這兩張圖像,可以將微妙的文字錯誤轉化為可量測、可糾正的訊號。

為了阻止捏造,系統會比較原始影像 (可靠的參考) 與重建影像 (突顯錯誤)。每個圖像都會轉換成精簡的嵌入。透過調整內部表示,使其更貼近原始圖像,並與重建圖像分歧,模型便能以完全自我監督的方式進行自我修正。

這篇論文說明:

MLLMs 中的幻覺本質上是很難偵測到的,因為它們在語言上格式良好,與文字層級的忠實描述往往無法區分。差異不在於語言的可信度,而在於與視覺證據的錯位,而模型本身通常對此並不敏感。

'為了解決這個問題,我們引入了一種幻覺暴露機制,利用生成重組將隱含的不一致轉換為明確和可觀察的信號。

使用 FLUX.1-dev 文字到圖像模型,系統會根據標題重新製作一張圖像,誇大任何錯誤的細節。這些被誇大的錯誤可以幫助模型辨識並修正錯誤。

為了驗證這種方法,研究人員在標題中注入幻覺,產生重建的圖像,然後用 LLaVA 重新為它們加上標題。他們測量了原始標題與幻覺標題之間的語意相似度:

幻覺放大機制如何讓細微的錯誤顯現出來的說明。每個點顯示一對圖像-標題的原始圖像標題與重建圖像標題之間的相似度。橘色線代表直接測量原始與幻覺標題之間的相似度,此相似度維持在高水平,並可掩蓋微小的錯誤;藍色線代表重構後的相似度,此相似度急速下降,顯示此過程將隱藏的幻覺轉變為可被偵測與修正的清晰語意標記。

幻覺放大機制可視化細微的錯誤。每個點顯示一張圖片-字幕對的字幕相似度。橙色線(直接比較)保持在高水平,掩蓋了錯誤;藍色線(重構後)急劇下降,揭示了隱藏的幻覺作為可察覺的語義標記。

重構後的相似度明顯下降,顯示此方法有能力揭露細微的錯誤。

資料與測試

使用三個基準來驗證有效性:Caption Hallucination Assessment with Image Relevance(CHAIR);MLLM Evaluation(MME);以及Pooling-based Object Probing Evaluation(POPE)。

來自 CHAIR 發佈的論文:兩個主要字幕系統 TopDown 和 NBT 所產生的幻覺物件範例,其中每個模型都會發明實際上不存在於影像中的視覺元素,例如筆記型電腦、水槽或衝浪板。來源:https://arxiv.org/pdf/1809.02156

來自 CHAIR 發佈文件:由字幕系統 TopDown 和 NBT 產生的幻覺物件範例,其中發明了筆記型電腦、水槽或衝浪板等圖像中不存在的元素。來源:https://arxiv.org/pdf/1809.02156

幻覺率或召回率等標準指標可能會產生誤導-模型可能會透過產生含糊不清的字幕來避免錯誤。為了在準確性與完整性之間取得平衡,我們使用了綜合指標幻覺與回想率(HAR@β),以可調整的權重對這兩個因素的標題進行評分。

POPE 評估上下文敏感的物件幻覺,而 MME 則評估屬性層級的幻覺,兩者都是 Yes/No 的任務。

測試在 Microsoft COCO、A-OKVQA 和 GQA 等資料集上使用 Flux 模型和 LLaVA-v1.5-7B。潛在編輯針對模型的第二層,在所有測試中使用一致的超參數和溫度。

CHAIR 的初步結果如下*:

使用多重指標評估減緩幻覺的 CHAIR 基準效能。

CHAIR 減緩幻覺基準的表現,以多項指標進行評估。

作者指出:

我們的方法在CHAIRSCHAIRI[*] 上的表現持續優於其他基準[*],顯示出它在抑制幻覺方面的卓越效能。同時,雖然幾乎所有的方法在抑制幻覺時都會不可避免地降低召回率,反映出忠誠度與資訊性之間的取捨,但我們的方法卻達到最小的降幅。

'這證明我們的方法能夠捕捉到廣泛的地面真實對象。在 HAR@β 標準下,我們的方法獲得最高分,突顯其在維持涵蓋範圍的同時減少幻覺的能力。

強大的結果歸功於雙重監督:強化原始圖像的乾淨語意,同時抑制重構產生的誤導訊號。透過只針對與幻覺相關的方向,系統可以在不損失細節的情況下糾正錯誤。

不同配置和資料集下 POPE 基準的效能比較。

不同配置與資料集的 POPE 基準效能比較。

關於 POPE 的結果,論文指出:

可以觀察到,我們的方法在所有設定中都持續達到最佳效能。值得注意的是,我們的方法平均可達到 +5.95% 的準確率和 +6.85% 的 F1 分數,大幅領先其他免訓練方法。

'因此,這些結果證明我們的方法能在不同難度的情況下提供可靠且可通用的解決方案。

從第三輪測試開始,比較 MME 的效能。

第三輪測試在 MME 上的效能比較。

最後的主要測試在 MME 上進行,結果如上所示。然而,論文在正文或附錄中提到「OPERA」這個方法,卻沒有下定義。雖然作者宣稱 MME 表現強勁,但由於缺乏方法細節,因此在詮釋這些結果時必須謹慎。

相關文章
如何修復核心網頁指標以獲得更好的 SEO 排名 如何修復核心網頁指標以獲得更好的 SEO 排名 利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體 Slackbot 成為 AI 智慧體 Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6% 位元組跳動加大核心AI激勵,豆包增長14.6% 位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
相關專題推薦
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
評論 (0)
0/500
OR