选项
首页
新闻
突破性研究显示,接触版权文字会导致人工智能模型产生幻觉

突破性研究显示,接触版权文字会导致人工智能模型产生幻觉

2025-12-21
124

语言模型中的审查机制可能会损害其在更大范围内传递真相的能力。最近的研究表明,旨在阻止 "不安全 "反应的内部程序也会抑制事实信息的共享。这意味着,为了安全而调整模型的努力可能会无意中导致幻觉的增加。

多年来,开发人员一直致力于减少语言模型中的虚假信息。通过抑制幻觉和引导模型向可验证的事实靠拢来提高真实性,已成为一个占主导地位并得到广泛支持的研究方向。

然而,澳大利亚的一项新研究表明,对齐方法--限制 "不安全 "交流的训练技术--可能会通过实施更严格的控制来阻碍模型提供准确的回答:

提高模型的事实准确性 (

增强模型的事实准确性(图中标注为 "真实性增强")会使模型进入激活区,从而绕过其拒绝机制。同样,旨在减少幻觉的编辑可能会使内部表征跨越安全边界。这可能会使有害的提示规避保障措施,除非拒绝功能被仔细隔离和维护。资料来源:https://arxiv.org/pdf/2510.07775

该研究揭示,负责事实回忆的内部通路也支配着拒绝行为--一种阻止模型对不安全或敏感的提示做出反应的机制。当排列技术过于强烈地放大拒绝信号时,这些途径就会重叠,从而模糊了模型区分拒绝有害内容和无意中压制有效信息的能力。

具有讽刺意味的是,随着模型在拒绝不适当请求方面的改进,它们传达真相的能力也在减弱。

敏感话题

上面的说明突出表明,核心挑战不仅涉及向用户提供公平、准确的结果,还涉及降低 LLM 提供商的法律风险。

例如,图片中提到的案例研究涉及一个有争议的话题--基于种族的监狱统计数据--人工智能可能会负责任地与学者或研究人员讨论这个话题,但在被恶意行为者操纵以获取辱骂性、攻击性或非法回应时则应避免。

由于对齐的 LLM 无法评估查询背后的意图,因此它们默认采用谨慎的方法:

根据对齐策略的不同,对敏感提示的反应也会不同。安全对齐的模型会完全阻止查询,而注重真相的模型则会用事实背景做出回应,增加信息量,但削弱抑制作用。这支持了一种观点,即增强真实性的编辑会降低拒绝阈值,使模型更容易受到具有有害意图的提示的影响,除非拒绝机制受到明确的保护。

对敏感提示的响应因排列策略而异。以安全为重点的模型会完全阻止查询,而以真相为重点的模型则会提供事实背景,提高信息量,但减少压制。这支持了一种观点,即提高真实性的编辑会降低拒绝阈值,从而增加对有害提示的脆弱性,除非拒绝机制得到保障。

另外,这些发现可能会让所谓 "觉醒 "议程的批评者认为,与未受监管的模型相比,经过严格调整的模型更不真实、更无用。

本文的证据部分支持了这一观点,但又将其与使用未对齐的法律信息的更广泛风险联系起来--包括刑事和民事违法行为的法律风险,以及错误信息的传播,由于成本限制,错误信息仍然难以有效过滤。

相互交织的功能

为了了解潜在的机制,研究人员绘制了单个注意头的激活图,发现与幻觉和拒绝有关的特征经常占据模型中的重叠区域

他们发现,微调或引导这些区域以减少虚假信息,会削弱模型的内置保障,因为这两种功能共享相似的潜在空间:

提高事实准确性往往会削弱拒绝行为。我们的分析表明,出现这种情况是因为编码幻觉和拒绝信息的成分重叠,导致调整方法无意中抑制了事实知识。

我们还探讨了在良性数据集上进行微调,甚至是那些为了安全而策划的数据集,也会因为同样的原因降低配准效果。

作者建议使用稀疏自动编码器(SAE)--一种旨在分离不同激活模式的网络--来分离这些功能,并在真实性训练过程中保持安全性。这种方法旨在使模型更安全、更准确,同时又不影响两者的质量。

这篇题为《人工智能对齐的意外权衡》(The Unintended Trade-off of AI Alignment:平衡 LLM 中的幻觉缓解和安全性》的新论文由迪肯大学的五位研究人员和独立研究人员共同完成。

研究方法

研究调查了提高语言模型的真实性是否会削弱其拒绝有害提示的能力,以及这两种行为是否依赖于共同的内部组件。

作者测试了两种增强真实性的方法,发现事实准确性的提高会持续增加越狱的易感性。

这种权衡源于对事实和拒绝信号进行编码的重叠注意头。即使是旨在提高实用性而不影响安全性的良性微调,也会通过改变共享路径来破坏保障措施。

该研究定义了三个关键术语:真实性是指模型在不抑制无害内容的情况下,根据现有知识提供准确反应的能力;幻觉是指模型在获得正确事实的情况下产生错误信息的情况;拒绝行为或安全调整是指阻止对有害或敏感提示做出反应的机制。

作者指出,这些功能以微妙的方式相互作用:

虽然真实性和安全性通常是分开分析的,但现实世界中的提示经常包含具有良性意图的敏感词汇(例如,用于分析、检测或教育)。在这种情况下,安全机制可能会过火--压制准确、有用的信息,并因疏漏而降低实际真实性。

了解旨在增加事实真实性的编辑如何影响拒绝行为,对于在实现真实性的同时尽量减少适当的压制至关重要。

作者开发了一种 LoRA,它能够将受条件限制的 LLM 引导到更高的

作者开发了一种 LoRA,它能引导条件性 LLM 向更'真实'的状态发展,减少幻觉。论文附录中的多个例子说明了这种方法的意外后果。

分析首先将增强真实性的方法(如头部转向和潜伏方向映射)视为对模型内部计算的有意修改。

精确转向

关键问题在于,这些改变是否会无意中影响支配拒绝行为的相同途径。为了检验这一点,研究使用 TruthfulQA 评估了模型的事实准确性,并使用 AdvBench 和 StrongReject 评估了模型在对抗条件下的安全性能。

基线技术包括推理时间干预(ITI)和 TruthX,前者可激活与真实答案相关的注意头,后者可沿着学习到的 "真实 "方向移动表征。

这两种方法都提高了准确性,但也使模型更有可能对有害的提示做出反应,而这些提示在以前是会被拒绝的。

为了直接分离和操纵幻觉行为,作者定义了与幻觉反应相对应的潜在方向,使用 LLaMA3-8B-Instruct 对 TruthfulQA 数据集中的错误答案进行 LoRA 模块训练。

这样就产生了一个线性向量,代表真实答案和幻觉答案之间的差异,从而可以将模型导向或远离幻觉。

沿幻觉方向引导的效果。随着模型被进一步推向负面方向,TruthfulQA 的准确率也随之提高,而 AdvBench 和 StrongReject 的攻击成功率(ASR,越低越好)则急剧上升,这反映了真实性和安全性之间的权衡。

沿幻觉方向引导可提高 TruthfulQA 的准确率,但会增加 AdvBench 和 StrongReject 的攻击成功率 (ASR),从而突出了真实性和安全性之间的权衡。

沿幻觉轴转向会降低事实准确性,而反向则会提高准确性。将这种技术应用于有害提示基准证实了之前的发现:真实性的提高是以削弱拒绝能力为代价的。即使幻觉被捕捉为一个清晰的线性方向,增强事实输出也会增加不安全完成的可能性。

作者强调*:

这加强了真实性和安全性之间的权衡,表明即使真实性表现为单一的线性方向,增强事实性也会以削弱安全排列为代价。

数据与测试

为了防止微调削弱拒绝行为,作者采用了一种方法,将拒绝特征与那些与幻觉相关的特征区分开来。他们确定了两种行为都涉及的注意头,并使用 SAE 提取了拒绝行为特有的潜在特征。

这些特征定义了一个受保护的子空间。在训练过程中,梯度更新被修改以避开该子空间,从而使模型在不影响安全性的情况下减少幻觉。

作者在 CommonsenseQA 数据集上进行了微调,评估了六项常识推理任务的性能:这些任务包括 CSQA、HellaSwag、ARC Challenge、ARC Easy、WinoGrande 和 SST-2。

使用 LoRA 对目标模块进行了微调,学习率为 2×10-⁴,权重衰减为 0.01,训练历时为一个,批量大小为两个。所有实验都使用了 AdamW 优化器。

使用两个有害内容基准对安全性进行了评估:AdvBench(500 个样本)和 StrongReject(300 个提示)。输出结果由 LlamaGuard3 分类为安全不安全

实验在 LLaMA3-8B-Instruct 和 Qwen2.5-Instruct 上进行。

基准方法包括 SafeLoRA、SaLoRA、SAP 和 vanilla 监督微调 (SFT)。除 SafeLoRA 外,其他方法均使用 HarmBench 中的 200 个提示进行了默认超参数测试。

准确率是主要指标,有害基准则根据 LlamaGuard3 的结果使用攻击成功率 (ASR) 进行测试。

上图为 LlaMA-3-8B-Instruct 的结果,各列最佳结果以粗体显示;下图为微调方法在 Qwen2.5 7B Instruct 上的表现,涉及常识和推理任务(得分越高,准确性越高),以及安全基准 AdvBench 和 StrongReject(ASR 值越低,鲁棒性越强)。每列中的最佳结果以粗体显示。

上图:LLaMA-3-8B-Instruct 的结果,最佳分数以粗体显示。下图微调方法在 Qwen2.5 7B Instruct 的常识和推理任务(分数越高表示准确性越高)以及安全基准 AdvBench 和 StrongReject(ASR 值越低表示鲁棒性越强)中的表现。每列中的最佳结果均以粗体标出。

关于这些结果,作者指出:

我们的手术方法在安全性和实用性之间实现了最佳平衡:它在保持微调准确性的同时,显著降低了有害基准得分。相比之下,SAP、SaLoRA 和 SafeLoRA 等方法要么增加了有害性,要么降低了实用性。

'一个关键原因是,这些方法直接对安全子空间的梯度进行操作,而由于多语义性[**],这可能会限制模型的性能。

'与香草微调(SFT)相比,我们的方法将平均微调准确率(FA)从 56.15% 提高到 75.09%,提高了约 +19%。

该方法将 AdvBench 上的攻击成功率从 9.23% 降至 0.58%,将 StrongReject 上的攻击成功率从 9.90% 降至 0.00%--有害输出减少了 15 倍以上。基础模型虽然有害性低,但任务准确性有限。

作者指出

这些结果凸显了在微调过程中保留拒绝特征的重要性:通过隔离和保护拒绝子空间,我们的方法在不牺牲任务性能的情况下保持了安全对齐。

'总之,这证实了我们的方法能有效减轻真实性和安全性之间的权衡。

最后,作者在微调集中添加了《电路断裂》数据集中 10% 的有害指令,测试了该方法在对抗条件下的适应能力。

尽管存在这种故意的污染,该方法在良性和有害评估中都保持了强劲的性能:

在中毒常识数据集上对 LLaMA3 8B 结构的性能进行微调,比较各种方法的准确性和安全性。

在中毒常识数据集上对 LLaMA3 8B 指令的性能进行微调,比较各种方法的准确性和安全性。

新方法比 SAP 更有效地减少了 ASR,同时避免了显著的效用损失。任务准确性仍然接近于 LoRA SFT 和 SafeLoRA,这表明即使在受污染的训练条件下,只要适当隔离拒绝特征,也能保持拒绝对齐。

结论

最引人入胜的发现

相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
评论 (0)
0/500
OR