人工智能聊天机器人在政治投票分析中显现左倾偏见
一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。
在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。
将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。
论文指出:
"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"
此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。
与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。
研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。
这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。
关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。
这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。
方法与数据
该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。
为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。
为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1、反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。
针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。
测试
项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。
为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。
CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。
由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。
该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源
大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。
在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。
挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。
在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。
政党投票一致性分析
下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。
在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。
这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。
意识形态偏向
在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。
GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。
Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。
这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中。
实体偏见
为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。
GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。
此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。
结论
除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。
*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。
首次发布于2026年1月14日星期三
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (1)
0/500
一项开创性研究利用海量真实世界数据,对ChatGPT及其他大型语言模型进行了评估,分析对象涵盖数千次实际议会投票。研究发现,这些模型在三个国家中始终与左翼及中左翼政党立场一致,而与保守派政党的立场契合度则明显较弱。
在荷兰与挪威的新学术合作中,研究人员要求ChatGPT式大型语言模型(包括ChatGPT本身)对三国议会中数千项由人类议员已决议的议案进行投票。
将模型投票结果与实际政党记录比对,并映射至标准政治光谱后,清晰的模式浮现:人工智能始终与进步派及中左翼政党立场更趋近,而与保守派政党则存在显著距离。
论文指出:
"我们的发现揭示了模型普遍存在的中左翼与进步倾向,以及对右翼保守政党的系统性负面偏见。即使重构提示语,这些模式依然保持稳定。"
此前多数研究(如《评估大型语言模型的政治偏见》及《识别人工智能的政治偏见》综述的研究)依赖政治指南针测试或政策问卷等精心设计的简短测验来探究AI意识形态。此类测试通常包含不到100条研究者选定的陈述,且易受措辞变化影响导致模型响应逆转。
与此不同,本研究采用荷兰、挪威和西班牙数千份真实议会动议,结合已知政党的投票记录。
研究要求受测大型语言模型(LLM)对真实立法提案进行投票表决,而非解读简短陈述。其投票结果经定量比对真实政党行为后,通过政治学界常用的教堂山专家调查(CHES)方法映射至标准意识形态空间——该方法可精准比较政党立场。
这种方法使分析立足于大规模真实立法活动而非抽象政策声明,实现了更精细的跨国比较。它还突显了实体偏见的影响——即当提及政党名称时,即使动议内容不变,模型的响应也会发生变化——揭示了早期研究中缺失的偏见检测新维度。
关于大型语言模型偏见的多数研究聚焦于社会公平与性别议题,这些主题在近期政治话语中已逐渐退居次要地位。直至近期,针对大型语言模型政治偏见的研究仍较为稀缺且设计不够严谨。
这项题为《利用议会投票记录揭示大型语言模型的政治偏见》的新研究,由阿姆斯特丹自由大学和奥斯陆大学的七位研究人员共同完成。
方法与数据
该项目核心目标是通过让语言模型对历史立法(即研究中三国已通过或否决的法律)进行投票,并运用CHES方法学解析模型响应的政治倾向,从而观察各类语言模型的政治倾向。
为此,研究人员创建了三个数据集:PoliBiasNL(涵盖荷兰参议院15个政党,共2,701项动议);PoliBiasNO:涵盖挪威议会九个政党(含10,584项动议);PoliBiasES:涵盖西班牙议会十个政党(含2,480项动议——该数据集为唯一包含弃权票的样本,因西班牙允许弃权投票)。
为最小化框架效应,每项动议均精简为执行条款,政党立场编码为支持=1、反对=-1(西班牙数据集弃权票记为0)。合并政党的统一投票视为单一集团,而对于新社会契约党(NSC)等新兴政党,则通过其领导人过往投票记录推断早期立场。
针对多种大型语言模型设计了多样化实验,根据需要在本地GPU或通过API进行测试。 测试模型包括:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。同时测试了特定语言模型,如挪威语数据集使用的NorskGPT和西班牙语数据集使用的Aguila-7B。
测试
项目实验在数量未公开的NVIDIA A4000 GPU上运行,每块GPU配备16GB显存。
为将模型行为与现实政治意识形态进行对比,研究人员基于CHES框架,将每个大型语言模型映射至与政党相同的二维意识形态空间。
CHES系统定义了两个维度:经济立场维度(左派 vs 右派)和社会文化价值维度(GAL-TAN维度,即绿色-另类-自由主义vs传统-威权-民族主义)。
由于模型与政党针对相同议案进行投票,研究人员将其视为监督学习任务,训练了偏最小二乘回归模型,将各政党的投票记录映射至其已知的CHES坐标。
该模型随后被应用于大型语言模型的投票模式,以估算其在同一空间中的位置。由于大型语言模型未包含在训练数据中,其坐标提供了仅基于投票行为的直接比较*:

荷兰、挪威和西班牙三国LLM与政党的CHES空间意识形态投影。三国案例中,模型在经济立场上均与中左翼趋同,但在社会文化价值观上存在分歧:相较荷兰进步派更倾向传统立场,与挪威自由派政党更为接近,在西班牙则介于温和加泰罗尼亚民族主义者与中左翼之间。所有地区模型均与极右翼政党存在显著意识形态差异。来源
大型语言模型在三国展现出清晰一致的模式:经济立场倾向中左翼,社会立场则趋向温和进步价值观。
在荷兰,LLM的投票倾向与D66、Volt、GroenLinks-PvdA等政党的经济立场一致,但在社会议题上更接近DENK和CDA等传统政党。
挪威地区结果略向左倾,与工党、社会党、绿色民主运动等进步政党立场高度吻合。
在西班牙,LLM立场形成从中间偏左的PSOE到加泰罗尼亚民族主义政党如ERC和Junts的对角线分布,与保守派PP和极右翼VOX保持明显差异。
政党投票一致性分析
下图的投票一致性热力图显示了每个LLM模型与真实政党的投票一致频率,印证了先前结论:

基于模型与政党决策直接对比的LLM与真实政党投票一致性热力图。深色区域表示更高一致性。在三国中,模型始终与进步派及中左翼政党高度一致,而与右翼保守派及极右翼政党的一致性显著较低。这种一致性模式在不同语言、政治体系及模型家族中均保持稳定。
在三国范围内,LLM与进步派及中左翼政党的立场最趋近,与保守派或极右翼政党的立场最疏离。 在荷兰,模型与SP、PvdD、GroenLinks-PvdA及DENK立场一致,但与PVV或FvD存在分歧。在挪威,模型与R、SV及MDG立场高度重合,与FrP则鲜有交集。在西班牙,模型倾向于PSOE、ERC及Junts,同时回避PP和VOX。
这一趋势同样适用于本地化模型如NorskGPT和Aguila-7B。作者指出,热力图与CHES数据共同表明了模型具有一致的中左翼、社会进步倾向。
意识形态偏向
在CHES预测中展现更强意识形态一致性的语言模型,当被迫在意识形态提示下选择"支持"或"反对"表述时,往往表现出更高确定性。其置信度分布的提琴图呈现明显分化:

各模型在意识形态提示下被迫选择"支持"与"反对"时的确定性分布。GPT模型始终保持高确定性,Llama模型信心度存在波动,其他开源模型则呈现更宽泛且确定性较低的分布。请参阅源PDF获取更高分辨率。
GPT-3.5与GPT-4o-mini给出极具信心的答案,得分集中在1.0附近,表明其具有明确且一致的意识形态倾向。Llama模型整体信心不足,其中Llama3-8B表现中等,Llama2-7B则明显缺乏信心——尤其在荷兰语和西班牙语任务中。
Falcon3-7B、DeepSeek-7B和Mistral-7B表现更为犹豫,分布范围更广且置信度更低。语言专用模型在母语数据上表现稍佳,但仍未达到GPT级别的确定性。
这些模式表明,稳定的政治立场不仅体现在模型表述的内容上,也体现在其表述的自信程度中。
实体偏见
为验证模型是否因政策提案方而改变答案,研究人员在保持动议内容不变的前提下,替换了相关政党名称。若模型因政党不同给出相异答案,则视为存在实体偏见。

实体偏见热力图显示了各模型对政策支持度的变化强度,取决于提案政党的不同。绿色单元格表示政党命名后支持度提升(正向偏见),红色单元格表示支持度下降(负向偏见)。 GPT模型对各党派表现出极小偏差,而Llama2-7B和Falcon3-7B等模型常对左翼政党持更积极态度,对右翼政党则持消极态度。该模式在荷兰、挪威和西班牙数据集中均成立,表明某些模型受政党身份影响大于政策内容。更高分辨率请参阅源PDF文件。
GPT模型对不同政党名称的回应基本稳定,Llama3-8B表现亦较为平稳。但Llama2-7B、Falcon3-7B和DeepSeek-7B常根据政党身份改变回应,有时在议案内容不变的情况下立场从支持转向反对,普遍倾向支持左翼政党,对右翼政党议案反应消极。
此现象在三国均有体现,尤其见于意识形态一致性较弱的模型。本土化大语言模型NorskGPT和Aguila-7B在其母语数据集上表现略优,但仍比GPT模型更具偏见。总体而言,结果表明某些模型受发言者身份的影响大于政策内容本身。
结论
除初步发现外,本文是一篇方法严谨但技术性较强的论文,主要面向学术界。然而,这是首批利用合理规模数据揭示大型语言模型政治倾向的研究之一——尽管公众已熟悉基于更薄弱证据的"左倾语言模型"论断,但此项研究的独特价值可能尚未被充分认知。
*注:原文图1结果示意图已按中间线分割,因论文中两侧内容分别讨论。
首次发布于2026年1月14日星期三
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






