基于氛围的图像标注存在重大风险
尽管这些匿名图像评估员往往收入微薄甚至分文未得,但他们通过判定内容是否"有害",对人们的生活拥有着巨大影响力。谷歌最新一项重大研究表明,这些标注员常会形成自己对"有害"或冒犯性内容的判断标准——无论他们对某张图片的反应多么离奇或主观。那么,问题究竟出在哪里呢?
观点本周,谷歌研究院与谷歌Mind团队联合发布新论文,汇集13位研究者探讨图像标注员的"直觉判断"是否应影响算法对图像的评级——即便这些直觉与既定评级准则相冲突。
这个问题与你息息相关,因为标注者一致认可的冒犯性标准往往会嵌入自动化审核系统、法律对"淫秽"或"不可接受"内容的定义(例如英国即将推出的NSFW防火墙*,澳大利亚也将很快跟进),以及社交媒体等平台的内容评估机制。
简言之,对冒犯性内容的判定标准越宽泛,潜在审查范围就越广。
氛围审查
研究未止步于此。它还揭示图像评分者常基于"可能冒犯他人"而非"自我感受"实施更严格审查。此外,低质量图像常引发安全担忧,尽管图像质量与内容本身并无关联。
论文在结论部分着重强调这两项发现,仿佛其核心论点有所欠缺——但研究者仍坚持发表。
虽然这在学术出版中并不罕见,但细读之下却能发现更令人不安的潜流:标注实践正朝着一种只能称为"氛围标注"的方向发展:
"我们的发现表明,现有框架需要纳入主观和情境维度,例如情绪反应、隐性判断以及对伤害的文化解读。标注者频繁使用情绪化语言且偏离预定义伤害标签的现象,凸显了当前评估实践的缺陷。
扩展标注指南,纳入多元文化与情感解读的示例,有助于弥补这些缺口。"

新论文采用直观示例引发广泛共鸣,但其核心内容却提出更为复杂的议题。图中每张图像均附有标注者情绪反馈。来源:https://arxiv.org/pdf/2507.16033
乍看之下,这似乎是为更精准界定图像中的"伤害"所做的合理尝试——目标值得肯定。但论文反复暗示实现这一目标可能既不现实也不可取:
"研究表明现有框架需纳入主观与情境维度,如情感反应、隐性判断及文化层面的伤害解读。标注者频繁使用情感化语言且偏离预设伤害标签的现象,凸显了当前评估实践的缺陷。
扩展标注指南,纳入多元文化与情感解读的示例,有助于弥补这些缺口[…]
[…] 标注者对模糊图像的推理过程往往反映其个人、文化及情感视角,这些难以通过支架教学或标准化手段解决。"
难以理解"纳入多元文化与情感解读示例"如何契合理性评级体系。作者反复探讨此问题却未给出明确解决方案,使其核心论点——即便涉及无形心理因素——也显得受"氛围感"驱动。
简言之,此类注释标准的扩展可能导致任何引发标注者强烈反应的内容——乃至整类主题——遭到压制或模糊处理。
二元评判
量化图像文字的危害性本就困难重重,尤其当"高雅"与"通俗"文化常如艺术文学般相互交融时。这催生了早期"氛围式"审查——淫秽内容的判定不再遵循严格定义,而是依据"见之自知"的原则。
在关于同理心与细微差别的广泛讨论之下,该论文微妙地质疑了"暴力"、"裸露"、"仇恨"等集中化标准化分类的权威性——正是这些分类使平台能够以合理精度实施可扩展的内容审核。
新兴观点认为,唯有去中心化、主观性强且具备语境感知能力的人类判断,才能准确评估生成式人工智能的输出内容。
但这种方法难以规模化。你无法凭"感觉"和个人经验过滤数十亿张图片。伤害必须量化为具体属性;过滤系统需要明确边界;边界案例需要更新指南——正如应对特殊诉求时有时需要新法律。
相反,该论文似乎主张建立自动扩展范围的审核系统——其审慎程度甚至可能因单个标注者的强烈个人反应,而惩罚一张对他人毫无冒犯性的图像。
道德扩张
尽管研究性质偏探索性,论文仍采用科学方法:作者构建了识别框架(虽未严格量化)以捕捉标注者对图像的多元反应,并分析这些反应如何随性别及其他人口统计特征变化。
除分析伤害焦点†外,研究还考察了标注者附加评论中的"道德推理"。参与者需对包含图像、提示词及相关文本的修改版数据集进行标注。
该"道德情感自动评分器"基于道德基础理论设计,旨在捕捉关怀、平等、比例、忠诚、权威 和纯洁等道德价值——由于该心理模型具有流动性特征,并不适合构建大规模评级系统所需的具体定义。
受该理论启发,作者引入了恐惧、愤怒、悲伤、厌恶、困惑和 诡异感等额外安全维度。
作者对恐惧维度进行了详细阐述:
"许多标注者使用'恐怖'(如扭曲面孔或枪口对准儿童等暴力暗示图像)、'令人不安'(如'目睹人被碾压的画面极其恶心,令人痛苦不安', 或‘令人不安且似血迹’描述红色颜料),以及‘令人不适’(如‘男孩图像存在多重扭曲…因其看似在护栏错误一侧玩耍而令人反感’)。
下图显示"恐惧"是最常提及的情绪(233次提及)。虽然其中近半数与暴力内容相关,但恐惧提及量第二高的内容被认定为无害内容。

情感相关术语在危害类别中的分布,柱高表示评论占比,柱内显示计数,各类别上方标注总评论数。
关于这些新安全维度,作者指出:
"这些新兴主题凸显出关键需求:必须通过整合主观性、情感性与感知性要素来完善人工智能图像评估框架。"
此方向存在风险,因其可能导致标注流程依据个人反应随意制定规则——而非要求所有标注者遵循统一标准。
若存在经济动机,则在于该模型实现了超大规模的人工标注:参与者自主定义规则的无摩擦、自我调节系统。
在标准标注模式下,规则需经共识达成并由标注者遵循。而论文提出的模型削弱或消除了这种监督机制——这意味着只要有一人感到冒犯,图像就可能被标记,部分原因在于达成共识既耗时又耗资。
罗夏墨迹测试式判定
标注的宗旨是通过专家监督、共识达成(或两者兼备)生成精准描述。将明确的危害等级体系转化为高度主观的"直觉式"流程,无异于对罗夏墨迹测验进行标注。
例如论文指出,部分标注者将图像质量缺陷(如JPEG伪影或技术瑕疵)解读为"令人不安"或"暗示危害":
"尽管任务说明未提及图像质量要求,标注者仍将这些质量瑕疵解读为语义意义。
"有标注员评论道:'这张图片完全不具危害性,只是人物面部略有变形。'同样地,其他标注员将图像缺陷视为蓄意伤害,赋予故障画面情感意义。例如有人将变形面孔解读为'痛苦的征兆'。"
这种方法将主观情绪化或情境特定的反应置于预设安全标签之上,可能导致系统随意标记有害内容——尤其针对可能冒犯特定利益群体的素材,将引发临时性内容删除或重新分类的"寒蝉效应"。
论文《只是张奇怪的照片》:从多元标注者视角评估生成式AI图像安全标注任务中的"安全性"现已发布于Arxiv平台。
*此处为简化表述,因非核心论点。新法规要求违规网站必须自主监管、实施高成本的审核与年龄验证系统(仅大型平台可行),或自行承担费用封锁英国用户访问。
† 常被简化为"想想孩子们"梗图,该梗讽刺了利用他人道德责任感达成表面利他目的的行为。
首次发布于2025年7月25日星期五
相关文章
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
相关专题推荐
评论 (1)
0/500
尽管这些匿名图像评估员往往收入微薄甚至分文未得,但他们通过判定内容是否"有害",对人们的生活拥有着巨大影响力。谷歌最新一项重大研究表明,这些标注员常会形成自己对"有害"或冒犯性内容的判断标准——无论他们对某张图片的反应多么离奇或主观。那么,问题究竟出在哪里呢?
观点本周,谷歌研究院与谷歌Mind团队联合发布新论文,汇集13位研究者探讨图像标注员的"直觉判断"是否应影响算法对图像的评级——即便这些直觉与既定评级准则相冲突。
这个问题与你息息相关,因为标注者一致认可的冒犯性标准往往会嵌入自动化审核系统、法律对"淫秽"或"不可接受"内容的定义(例如英国即将推出的NSFW防火墙*,澳大利亚也将很快跟进),以及社交媒体等平台的内容评估机制。
简言之,对冒犯性内容的判定标准越宽泛,潜在审查范围就越广。
氛围审查
研究未止步于此。它还揭示图像评分者常基于"可能冒犯他人"而非"自我感受"实施更严格审查。此外,低质量图像常引发安全担忧,尽管图像质量与内容本身并无关联。
论文在结论部分着重强调这两项发现,仿佛其核心论点有所欠缺——但研究者仍坚持发表。
虽然这在学术出版中并不罕见,但细读之下却能发现更令人不安的潜流:标注实践正朝着一种只能称为"氛围标注"的方向发展:
"我们的发现表明,现有框架需要纳入主观和情境维度,例如情绪反应、隐性判断以及对伤害的文化解读。标注者频繁使用情绪化语言且偏离预定义伤害标签的现象,凸显了当前评估实践的缺陷。
扩展标注指南,纳入多元文化与情感解读的示例,有助于弥补这些缺口。"

新论文采用直观示例引发广泛共鸣,但其核心内容却提出更为复杂的议题。图中每张图像均附有标注者情绪反馈。来源:https://arxiv.org/pdf/2507.16033
乍看之下,这似乎是为更精准界定图像中的"伤害"所做的合理尝试——目标值得肯定。但论文反复暗示实现这一目标可能既不现实也不可取:
"研究表明现有框架需纳入主观与情境维度,如情感反应、隐性判断及文化层面的伤害解读。标注者频繁使用情感化语言且偏离预设伤害标签的现象,凸显了当前评估实践的缺陷。
扩展标注指南,纳入多元文化与情感解读的示例,有助于弥补这些缺口[…]
[…] 标注者对模糊图像的推理过程往往反映其个人、文化及情感视角,这些难以通过支架教学或标准化手段解决。"
难以理解"纳入多元文化与情感解读示例"如何契合理性评级体系。作者反复探讨此问题却未给出明确解决方案,使其核心论点——即便涉及无形心理因素——也显得受"氛围感"驱动。
简言之,此类注释标准的扩展可能导致任何引发标注者强烈反应的内容——乃至整类主题——遭到压制或模糊处理。
二元评判
量化图像文字的危害性本就困难重重,尤其当"高雅"与"通俗"文化常如艺术文学般相互交融时。这催生了早期"氛围式"审查——淫秽内容的判定不再遵循严格定义,而是依据"见之自知"的原则。
在关于同理心与细微差别的广泛讨论之下,该论文微妙地质疑了"暴力"、"裸露"、"仇恨"等集中化标准化分类的权威性——正是这些分类使平台能够以合理精度实施可扩展的内容审核。
新兴观点认为,唯有去中心化、主观性强且具备语境感知能力的人类判断,才能准确评估生成式人工智能的输出内容。
但这种方法难以规模化。你无法凭"感觉"和个人经验过滤数十亿张图片。伤害必须量化为具体属性;过滤系统需要明确边界;边界案例需要更新指南——正如应对特殊诉求时有时需要新法律。
相反,该论文似乎主张建立自动扩展范围的审核系统——其审慎程度甚至可能因单个标注者的强烈个人反应,而惩罚一张对他人毫无冒犯性的图像。
道德扩张
尽管研究性质偏探索性,论文仍采用科学方法:作者构建了识别框架(虽未严格量化)以捕捉标注者对图像的多元反应,并分析这些反应如何随性别及其他人口统计特征变化。
除分析伤害焦点†外,研究还考察了标注者附加评论中的"道德推理"。参与者需对包含图像、提示词及相关文本的修改版数据集进行标注。
该"道德情感自动评分器"基于道德基础理论设计,旨在捕捉关怀、平等、比例、忠诚、权威 和纯洁等道德价值——由于该心理模型具有流动性特征,并不适合构建大规模评级系统所需的具体定义。
受该理论启发,作者引入了恐惧、愤怒、悲伤、厌恶、困惑和 诡异感等额外安全维度。
作者对恐惧维度进行了详细阐述:
"许多标注者使用'恐怖'(如扭曲面孔或枪口对准儿童等暴力暗示图像)、'令人不安'(如'目睹人被碾压的画面极其恶心,令人痛苦不安', 或‘令人不安且似血迹’描述红色颜料),以及‘令人不适’(如‘男孩图像存在多重扭曲…因其看似在护栏错误一侧玩耍而令人反感’)。
下图显示"恐惧"是最常提及的情绪(233次提及)。虽然其中近半数与暴力内容相关,但恐惧提及量第二高的内容被认定为无害内容。

情感相关术语在危害类别中的分布,柱高表示评论占比,柱内显示计数,各类别上方标注总评论数。
关于这些新安全维度,作者指出:
"这些新兴主题凸显出关键需求:必须通过整合主观性、情感性与感知性要素来完善人工智能图像评估框架。"
此方向存在风险,因其可能导致标注流程依据个人反应随意制定规则——而非要求所有标注者遵循统一标准。
若存在经济动机,则在于该模型实现了超大规模的人工标注:参与者自主定义规则的无摩擦、自我调节系统。
在标准标注模式下,规则需经共识达成并由标注者遵循。而论文提出的模型削弱或消除了这种监督机制——这意味着只要有一人感到冒犯,图像就可能被标记,部分原因在于达成共识既耗时又耗资。
罗夏墨迹测试式判定
标注的宗旨是通过专家监督、共识达成(或两者兼备)生成精准描述。将明确的危害等级体系转化为高度主观的"直觉式"流程,无异于对罗夏墨迹测验进行标注。
例如论文指出,部分标注者将图像质量缺陷(如JPEG伪影或技术瑕疵)解读为"令人不安"或"暗示危害":
"尽管任务说明未提及图像质量要求,标注者仍将这些质量瑕疵解读为语义意义。
"有标注员评论道:'这张图片完全不具危害性,只是人物面部略有变形。'同样地,其他标注员将图像缺陷视为蓄意伤害,赋予故障画面情感意义。例如有人将变形面孔解读为'痛苦的征兆'。"
这种方法将主观情绪化或情境特定的反应置于预设安全标签之上,可能导致系统随意标记有害内容——尤其针对可能冒犯特定利益群体的素材,将引发临时性内容删除或重新分类的"寒蝉效应"。
论文《只是张奇怪的照片》:从多元标注者视角评估生成式AI图像安全标注任务中的"安全性"现已发布于Arxiv平台。
*此处为简化表述,因非核心论点。新法规要求违规网站必须自主监管、实施高成本的审核与年龄验证系统(仅大型平台可行),或自行承担费用封锁英国用户访问。
† 常被简化为"想想孩子们"梗图,该梗讽刺了利用他人道德责任感达成表面利他目的的行为。
首次发布于2025年7月25日星期五
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型





首页






