选项
首页
新闻
人工智能聊天机器人在政治投票分析中显现左倾偏见

人工智能聊天机器人在政治投票分析中显现左倾偏见

2026-03-02
151

一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。

 

在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。

将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。

论文指出:

"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"

此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。

与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。

研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。

这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。

关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。

这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。

方法与数据

该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。

为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。

为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。

针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。

测试

项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。

为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。

CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。

由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。

该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙大型语言模型与政党的意识形态定位(CHES空间图示)。三地模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较于荷兰进步派更倾向传统立场,与挪威自由派政党更为契合,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党保持意识形态距离。 来源 - https://arxiv.org/pdf/2601.08785

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源

大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。

在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。

挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。

在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。

政党投票一致性分析

下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型决策与真实政党的直接对比,绘制大型语言模型与真实政党的投票协议热力图。深色区域表示更强的一致性。在三个国家中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的契合度则显著偏低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。

在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。

这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。

意识形态偏向

在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

当被迫在两种选择之间作出抉择时,每种模型的确定性分布

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。

GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。

Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。

这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中

实体偏见

为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见

实体偏见热力图显示了不同政党提出政策时,各模型支持力度的变化幅度。绿色单元格表示政党被提及时支持度上升(正向偏见),红色单元格则表示支持度下降(负向偏见)。 GPT模型在各政党间表现出极小偏差,而Llama2-7B和Falcon3-7B等模型则常对左翼政党持更积极态度,对右翼政党持负面态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份的影响大于政策内容的影响。更高分辨率请参阅源PDF文件。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。

GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。

此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。

结论

除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。

 

*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。

首次发布于2026年1月14日星期三

相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
评论 (1)
0/500
ArthurYoung
ArthurYoung 2026-07-20 16:00:16

I'm not shocked that AI chatbots lean left—most of the training data comes from academia and media, which tend to be liberal. The bigger issue is that we're relying on these tools for political analysis without proper calibration. 😬

OR