基於氛圍的圖像標註存在重大風險
儘管這些匿名評審員往往僅獲得微薄報酬甚至分文未得,但他們透過判定圖像是否含有「有害」內容,實際上對人們的生活握有重大影響力。谷歌一項重大新研究指出,這些標註者常會發展出個人化的判斷標準來定義何謂「有害」或冒犯性內容——無論他們對圖像的反應有多麼異常或主觀。那麼,這究竟會引發什麼問題呢?
觀點本週,谷歌研究院與谷歌Mind的聯合研究匯集13位貢獻者,發表新論文探討圖像標註者的「直覺判斷」是否應影響演算法對圖像的評級——即使這些直覺與既定評級準則相衝突。
此議題與你息息相關,因為註解者認定的冒犯標準往往會嵌入自動化內容審查系統、法律對「淫穢」或「不可接受」內容的定義(例如英國即將實施的NSFW防火牆*,澳洲亦將跟進),以及社群媒體等平台的內容評估機制。
簡言之,被視為冒犯的標準越寬泛,潛在審查範圍就越廣泛。
氛圍審查
研究未止於此。它還揭示圖片評分者常基於「可能冒犯他人」而非僅「自身感受」而實施更嚴格審查。此外,低畫質圖片常引發安全疑慮,儘管畫質與內容本質無關。
論文結論部分著重強調這兩項發現,彷彿核心論點有所不足——但研究人員仍認為有必要發表。
儘管學術出版中此類情況並不少見,但細讀後會發現更令人不安的潛流:標註實踐正朝著某種只能稱為「氛圍標註」的方向發展:
「研究結果顯示,現有框架需納入主觀與情境維度,例如情緒反應、隱性判斷及文化層面的傷害詮釋。註解者頻繁使用情緒化語言,且其判斷常偏離預設的傷害標籤,凸顯現行評估機制的缺口。
擴充標註指南,納入多元文化與情感詮釋的示例,有助彌補這些缺口。」

這篇新論文採用多數讀者都能感同身受的直觀範例,儘管其核心內容引發更複雜的疑問。圖中每張影像皆附有標註者的情緒反應。來源:https://arxiv.org/pdf/2507.16033
乍看之下,這似乎是為更精準界定圖像中的「傷害」所做的合理嘗試——此目標值得肯定。但論文反覆暗示此舉可能不切實際甚至非必要:
「研究發現顯示,現有框架需納入主觀與情境維度,例如情緒反應、隱性判斷及文化層面的傷害詮釋。註解者頻繁使用情緒化語言,且其詮釋與預設傷害標籤存在分歧,凸顯現行評估實務的缺口。
擴充標註指南以納入多元文化與情感詮釋的示例,有助彌補這些缺口 […]
[…] 標註者對模糊圖像的推理過程,往往反映其個人、文化與情感視角,這些要素難以建立支架或標準化。」
難以理解「納入多元文化與情感詮釋的示例」如何契合理性評分體系。作者反覆探討此點卻未提出明確解決方案,致使核心論點本身也似受「氛圍感」驅動——即便其探討的是無形心理因素。
簡言之,此類擴充標註標準的做法,可能導致任何引發標註者強烈反應的內容——甚至整類主題——遭到壓制或隱藏。
二元判斷
量化圖像與文字造成的傷害本質上極具挑戰性,尤其當「高雅」與「通俗」文化常相互交融時——藝術與文學領域即為明證。這導致早期「氛圍導向」審查的出現:淫穢內容並非依嚴格定義判定,而是遵循「見了便知」的原則。
在深入探討同理心與細微差異的同時,該論文微妙地質疑了「暴力」、「裸露」、「仇恨」等集中化標準化類別的權威性——這些類別使平台得以實現合理精準的可擴展內容審核。
新興論點主張:唯有去中心化、主觀且具情境感知能力的人類判斷,方能正確評估生成式人工智慧的產出。
但此方法難以擴展。無法憑藉「氛圍感」與個人經驗過濾數十億張圖像。危害必須量化為具體屬性;過濾系統需明確界限;邊緣案例則需更新指引——正如處理特殊申訴時,有時需要制定新法規。
相反地,該論文似乎主張建立自動擴展範圍的審核系統——其謹慎程度甚至可能因單一標註者的高度主觀反應,而懲罰那些未冒犯他人的圖像。
道德擴張
儘管屬探索性質,該論文仍採用科學方法:作者建立框架以識別(雖未嚴格量化)註解者對圖像的多元反應,並探究這些反應如何因性別及其他人口統計特徵而異。
除分析傷害焦點†外,研究更深入檢視標註者補充評論中的「道德推理」。參與者需標註包含圖像、提示詞及相關文本的修改版資料集。
此「道德情感自動評分器」旨在捕捉「關懷」、「平等」、「比例」、「忠誠」、「權威」及「純潔」等道德價值觀,其設計基礎為「道德基礎理論」——此心理學模型因流動特性,難以建立大規模評分系統所需的具體定義。
受此理論啟發,作者引入了恐懼、憤怒、悲傷、厭惡、困惑與 詭異感等額外安全維度。
作者針對恐懼感詳述:
「許多標註者使用『恐怖』(例如針對扭曲面孔或暗示暴力的圖像,如槍口對準孩童)、「令人不安」(例如『目睹人被輾壓的畫面極其惡劣,令人極度痛苦與不安』 或『令人不安且看似血跡』——指紅色油漆),以及『令人不快』(例如『男孩圖像存在多重扭曲...我認為其令人反感,因畫面顯示男孩在護欄錯誤側玩耍』)。
[下圖]顯示「恐懼」是最常提及的情緒(233次提及)。雖然近半數與暴力內容相關,但次高提及率的恐懼情緒卻來自被認定無害的內容。

情緒相關詞彙在危害類別中的分布,條形高度代表評論比例,條形內顯示計數,各類別上方標示總評論數。
關於這些新安全維度,作者指出:
「這些新興主題凸顯出關鍵需求:必須透過整合主觀、情感與感知元素,來豐富人工智慧圖像評估框架。」
此方向可能存在風險,因其可能導致標註流程基於個人反應任意制定規則,而非要求所有標註者遵循統一標準。
若存在經濟動機,在於此模型能實現超大規模人工標註:參與者自行定義規則的無摩擦、自我調節系統。
在標準標註模式下,規則需經共識達成並由標註者遵循。而論文提出的模型則削弱或取消此監督機制——意味著只要有任何圖像冒犯到單一個人,便可能被標記為異常,部分原因在於建立共識既耗時又費力。
羅夏判斷
標註的目標是透過專家監督、共識達成(或兩者兼具)來產出精準描述。將明確的危害分級體系擴展為「直覺性」且高度個人化的流程,無異於對羅夏墨跡測驗進行標註。
例如論文指出,部分標註者將圖像品質缺陷(如JPEG失真或技術瑕疵)解讀為「令人不安」或「暗示傷害」:
「此現象發生於任務未提供影像品質指示之情況下。更甚者,標註者將這些品質瑕疵解讀為具語義意義的內容。
有註解者評論:『這張圖根本不具危害性,只是臉部有些變形而已。』同樣地,其他人將圖像瑕疵視為蓄意傷害,賦予技術故障情感意義。例如有人將變形臉部解讀為「痛苦的徵兆」。」
此方法將主觀、情感或情境特定反應置於預設安全標籤之上,恐導致系統任意標記有害內容——尤其針對可能冒犯特定利益群體的素材,將引發臨時性內容刪除或重新分類的「寒蟬效應」。
論文〈「只是張怪照片」:從多元標註者視角評估生成式AI圖像安全標註任務的「安全性」〉已發布於Arxiv平台。
*此處為簡化引用,因非本文核心論點。新法規要求違規網站必須自主監管、實施高成本的審查與年齡驗證系統(僅大型平台可行),或自行承擔費用封鎖英國用戶訪問。
†常被簡化為「想想孩子們」的迷因,此說法諷刺了將他人道德責任當作表面利他目的的行徑。
初版發佈於2025年7月25日(星期五)
相關文章
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家
MiniMax(稀宇科技)通用人工智慧實驗室正式推出“10x Team”,這是一項全球人才協作計劃。該計劃旨在招募跨行業的頂尖專家,探索大模型在垂直領域的深度應用。透過將深厚的行業知識與前沿人工智慧技術相結合,MiniMax 致力於將大模型的生產力從通用場景拓展至專業場景,最終推動行業效率實現“十倍增長”。驗證行業認知價值,開放多模態核心資源過去與行業專家的合作表明,深厚的專業洞察對於構建高質量、實用的行業專屬大模型至關重要。在此基礎上,“10x Team”計劃將向合作伙伴開放包括多模態模型
相關專題推薦
評論 (1)
0/500
儘管這些匿名評審員往往僅獲得微薄報酬甚至分文未得,但他們透過判定圖像是否含有「有害」內容,實際上對人們的生活握有重大影響力。谷歌一項重大新研究指出,這些標註者常會發展出個人化的判斷標準來定義何謂「有害」或冒犯性內容——無論他們對圖像的反應有多麼異常或主觀。那麼,這究竟會引發什麼問題呢?
觀點本週,谷歌研究院與谷歌Mind的聯合研究匯集13位貢獻者,發表新論文探討圖像標註者的「直覺判斷」是否應影響演算法對圖像的評級——即使這些直覺與既定評級準則相衝突。
此議題與你息息相關,因為註解者認定的冒犯標準往往會嵌入自動化內容審查系統、法律對「淫穢」或「不可接受」內容的定義(例如英國即將實施的NSFW防火牆*,澳洲亦將跟進),以及社群媒體等平台的內容評估機制。
簡言之,被視為冒犯的標準越寬泛,潛在審查範圍就越廣泛。
氛圍審查
研究未止於此。它還揭示圖片評分者常基於「可能冒犯他人」而非僅「自身感受」而實施更嚴格審查。此外,低畫質圖片常引發安全疑慮,儘管畫質與內容本質無關。
論文結論部分著重強調這兩項發現,彷彿核心論點有所不足——但研究人員仍認為有必要發表。
儘管學術出版中此類情況並不少見,但細讀後會發現更令人不安的潛流:標註實踐正朝著某種只能稱為「氛圍標註」的方向發展:
「研究結果顯示,現有框架需納入主觀與情境維度,例如情緒反應、隱性判斷及文化層面的傷害詮釋。註解者頻繁使用情緒化語言,且其判斷常偏離預設的傷害標籤,凸顯現行評估機制的缺口。
擴充標註指南,納入多元文化與情感詮釋的示例,有助彌補這些缺口。」

這篇新論文採用多數讀者都能感同身受的直觀範例,儘管其核心內容引發更複雜的疑問。圖中每張影像皆附有標註者的情緒反應。來源:https://arxiv.org/pdf/2507.16033
乍看之下,這似乎是為更精準界定圖像中的「傷害」所做的合理嘗試——此目標值得肯定。但論文反覆暗示此舉可能不切實際甚至非必要:
「研究發現顯示,現有框架需納入主觀與情境維度,例如情緒反應、隱性判斷及文化層面的傷害詮釋。註解者頻繁使用情緒化語言,且其詮釋與預設傷害標籤存在分歧,凸顯現行評估實務的缺口。
擴充標註指南以納入多元文化與情感詮釋的示例,有助彌補這些缺口 […]
[…] 標註者對模糊圖像的推理過程,往往反映其個人、文化與情感視角,這些要素難以建立支架或標準化。」
難以理解「納入多元文化與情感詮釋的示例」如何契合理性評分體系。作者反覆探討此點卻未提出明確解決方案,致使核心論點本身也似受「氛圍感」驅動——即便其探討的是無形心理因素。
簡言之,此類擴充標註標準的做法,可能導致任何引發標註者強烈反應的內容——甚至整類主題——遭到壓制或隱藏。
二元判斷
量化圖像與文字造成的傷害本質上極具挑戰性,尤其當「高雅」與「通俗」文化常相互交融時——藝術與文學領域即為明證。這導致早期「氛圍導向」審查的出現:淫穢內容並非依嚴格定義判定,而是遵循「見了便知」的原則。
在深入探討同理心與細微差異的同時,該論文微妙地質疑了「暴力」、「裸露」、「仇恨」等集中化標準化類別的權威性——這些類別使平台得以實現合理精準的可擴展內容審核。
新興論點主張:唯有去中心化、主觀且具情境感知能力的人類判斷,方能正確評估生成式人工智慧的產出。
但此方法難以擴展。無法憑藉「氛圍感」與個人經驗過濾數十億張圖像。危害必須量化為具體屬性;過濾系統需明確界限;邊緣案例則需更新指引——正如處理特殊申訴時,有時需要制定新法規。
相反地,該論文似乎主張建立自動擴展範圍的審核系統——其謹慎程度甚至可能因單一標註者的高度主觀反應,而懲罰那些未冒犯他人的圖像。
道德擴張
儘管屬探索性質,該論文仍採用科學方法:作者建立框架以識別(雖未嚴格量化)註解者對圖像的多元反應,並探究這些反應如何因性別及其他人口統計特徵而異。
除分析傷害焦點†外,研究更深入檢視標註者補充評論中的「道德推理」。參與者需標註包含圖像、提示詞及相關文本的修改版資料集。
此「道德情感自動評分器」旨在捕捉「關懷」、「平等」、「比例」、「忠誠」、「權威」及「純潔」等道德價值觀,其設計基礎為「道德基礎理論」——此心理學模型因流動特性,難以建立大規模評分系統所需的具體定義。
受此理論啟發,作者引入了恐懼、憤怒、悲傷、厭惡、困惑與 詭異感等額外安全維度。
作者針對恐懼感詳述:
「許多標註者使用『恐怖』(例如針對扭曲面孔或暗示暴力的圖像,如槍口對準孩童)、「令人不安」(例如『目睹人被輾壓的畫面極其惡劣,令人極度痛苦與不安』 或『令人不安且看似血跡』——指紅色油漆),以及『令人不快』(例如『男孩圖像存在多重扭曲...我認為其令人反感,因畫面顯示男孩在護欄錯誤側玩耍』)。
[下圖]顯示「恐懼」是最常提及的情緒(233次提及)。雖然近半數與暴力內容相關,但次高提及率的恐懼情緒卻來自被認定無害的內容。

情緒相關詞彙在危害類別中的分布,條形高度代表評論比例,條形內顯示計數,各類別上方標示總評論數。
關於這些新安全維度,作者指出:
「這些新興主題凸顯出關鍵需求:必須透過整合主觀、情感與感知元素,來豐富人工智慧圖像評估框架。」
此方向可能存在風險,因其可能導致標註流程基於個人反應任意制定規則,而非要求所有標註者遵循統一標準。
若存在經濟動機,在於此模型能實現超大規模人工標註:參與者自行定義規則的無摩擦、自我調節系統。
在標準標註模式下,規則需經共識達成並由標註者遵循。而論文提出的模型則削弱或取消此監督機制——意味著只要有任何圖像冒犯到單一個人,便可能被標記為異常,部分原因在於建立共識既耗時又費力。
羅夏判斷
標註的目標是透過專家監督、共識達成(或兩者兼具)來產出精準描述。將明確的危害分級體系擴展為「直覺性」且高度個人化的流程,無異於對羅夏墨跡測驗進行標註。
例如論文指出,部分標註者將圖像品質缺陷(如JPEG失真或技術瑕疵)解讀為「令人不安」或「暗示傷害」:
「此現象發生於任務未提供影像品質指示之情況下。更甚者,標註者將這些品質瑕疵解讀為具語義意義的內容。
有註解者評論:『這張圖根本不具危害性,只是臉部有些變形而已。』同樣地,其他人將圖像瑕疵視為蓄意傷害,賦予技術故障情感意義。例如有人將變形臉部解讀為「痛苦的徵兆」。」
此方法將主觀、情感或情境特定反應置於預設安全標籤之上,恐導致系統任意標記有害內容——尤其針對可能冒犯特定利益群體的素材,將引發臨時性內容刪除或重新分類的「寒蟬效應」。
論文〈「只是張怪照片」:從多元標註者視角評估生成式AI圖像安全標註任務的「安全性」〉已發布於Arxiv平台。
*此處為簡化引用,因非本文核心論點。新法規要求違規網站必須自主監管、實施高成本的審查與年齡驗證系統(僅大型平台可行),或自行承擔費用封鎖英國用戶訪問。
†常被簡化為「想想孩子們」的迷因,此說法諷刺了將他人道德責任當作表面利他目的的行徑。
初版發佈於2025年7月25日(星期五)
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
MiniMax 推出 10 倍團隊計劃,以激勵全球 AI 專家
MiniMax(稀宇科技)通用人工智慧實驗室正式推出“10x Team”,這是一項全球人才協作計劃。該計劃旨在招募跨行業的頂尖專家,探索大模型在垂直領域的深度應用。透過將深厚的行業知識與前沿人工智慧技術相結合,MiniMax 致力於將大模型的生產力從通用場景拓展至專業場景,最終推動行業效率實現“十倍增長”。驗證行業認知價值,開放多模態核心資源過去與行業專家的合作表明,深厚的專業洞察對於構建高質量、實用的行業專屬大模型至關重要。在此基礎上,“10x Team”計劃將向合作伙伴開放包括多模態模型





首頁






