AI聊天機器人在政治投票分析中顯現左傾偏見
一項運用大量真實世界數據的開創性研究,針對ChatGPT及其他大型語言模型進行了數千次實際議會投票的評估。結果顯示,這些模型在三個國家中始終與左翼及中左翼政黨立場一致,而與保守派政黨的立場契合度則相對較弱。
荷蘭與挪威學者在最新合作研究中,要求ChatGPT等大型語言模型(包含ChatGPT本身)對三國立法者先前表決通過的數千項真實議會動議進行投票。
當將模型投票結果與實際政黨紀錄比對,並映射至標準政治光譜時,清晰模式浮現:這些人工智慧始終與進步派及中左翼政黨立場更為接近,與保守派則存在顯著距離。
論文指出:
「研究發現所有模型均呈現一致的中左翼與進步傾向,並對右翼保守政黨存在系統性負面偏見。即使重新措辭提示語,此模式仍保持穩定。」
過往多數研究(如《評估大型語言模型的政治偏見》及《識別人工智慧的政治偏見》所綜述之研究)皆仰賴精心設計的小型測驗(如政治羅盤測試或政策問卷)來探測人工智慧的意識形態。此類測試通常僅包含不到100項研究者篩選的陳述,且易受措辭變動影響,導致模型回應結果逆轉。
相較之下,本研究採用荷蘭、挪威及西班牙數千份真實議會動議,結合已知政黨的投票紀錄進行分析。
研究不再要求大型語言模型解讀簡短陳述,而是讓其對真實立法提案進行投票。其投票結果經量化比對真實政黨行為後,運用政治學界常用的「教堂山專家調查法」(CHES)投影至標準意識形態空間——此方法能精準對照各政黨立場。
此方法使分析立足於大規模真實立法活動而非抽象政策聲明,實現更細緻的跨國比較。同時凸顯「實體偏見」的影響——當提及政黨名稱時,即使動議內容不變,模型回應仍會產生偏移,揭示了先前研究中缺失的偏見檢測層面。
多數大型語言模型偏見研究聚焦於社會公平與性別議題,這些主題在近期政治論述中已略顯邊緣化。直至近期,針對大型語言模型政治偏見的研究仍屬罕見且設計較不嚴謹。
這項名為《運用議會投票紀錄揭露大型語言模型中的政治偏見》的新研究,由阿姆斯特丹自由大學與奧斯陸大學的七位研究人員共同完成。
方法與數據
本項目的核心目標是透過讓各語言模型對歷史立法(即研究中三國已通過或否決的法案)進行投票,並運用CHES方法論來解析模型回應的政治傾向,從而觀察不同語言模型的政治傾向。
為此,研究團隊建構了三個數據集:涵蓋荷蘭參議院15個政黨(共2,701項議案)的PoliBiasNL;PoliBiasNO涵蓋挪威國會九個政黨(共10,584項議案);PoliBiasES涵蓋西班牙國會十個政黨(共2,480項議案——此為唯一包含棄權票的資料集,因西班牙允許棄權)。
為最小化框架效應,每項動議均精簡為執行條款,政黨立場以1代表支持、-1代表反對(西班牙數據集以0代表棄權)。合併政黨的統一投票視為單一陣營,而針對新社會契約黨(NSC)等新興政黨,則透過其領導人過往投票紀錄推斷早期立場。
針對多種大型語言模型設計了多元實驗,視需求於本地GPU或透過API進行測試。 測試模型包含:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。另針對特定語言數據集測試相應模型,例如挪威語數據集採用NorskGPT,西班牙語數據集則使用Aguila-7B。
測試
本專案實驗於未公開數量的NVIDIA A4000 GPU上執行,每張GPU配備16GB視訊記憶體。
為比較模型行為與現實政治意識形態的差異,研究人員依據CHES框架,將各大型語言模型投射至與政黨相同的二維意識形態空間。
CHES系統定義兩大維度:經濟立場軸(左派 vs 右派)與社會文化價值軸(GAL-TAN軸,即綠色-替代派-自由意志主義vs傳統-威權主義-民族主義)。
由於模型與政黨針對相同議案投票,研究人員將此視為監督式學習任務,訓練部分最小平方回歸模型,將各政黨投票紀錄映射至其已知CHES座標。
該模型隨後應用於大型語言模型的投票模式,以估算其在相同空間中的位置。由於大型語言模型未納入訓練數據,其坐標能提供純粹基於投票行為的直接比較*:

荷蘭、挪威與西班牙三國CHES空間中LLM與政黨的投影意識形態位置。三國案例中,模型在經濟立場上均與中左翼一致,但在社會文化價值觀上出現分歧:相較於荷蘭進步派更傾向傳統價值觀,與挪威自由派政黨更為契合,並在西班牙呈現介於溫和加泰隆尼亞民族主義者與中左翼之間的聚類。所有地區的模型均與極右翼政黨保持意識形態上的距離。來源
大型語言模型在三國展現清晰一致的模式:經濟立場傾向中左翼,社會立場則趨向溫和進步價值觀。
在荷蘭,大型語言模型的投票傾向與D66、Volt及GroenLinks-PvdA等政黨的經濟立場相符,但在社會議題上則更貼近DENK與CDA等傳統政黨。
挪威結果則略向左傾,與進步黨(Ap)、社會主義左翼黨(SV)、民主運動黨(MDG)等進步政黨高度吻合。
在西班牙,LLMs的立場形成從中間偏左的PSOE到加泰隆尼亞民族主義政黨如ERC和Junts的對角線分布,與保守派PP及極右翼VOX保持明顯區隔。
與政黨的投票一致性
下圖投票一致性熱力圖顯示各LLM模型與真實政黨投票一致的頻率,佐證先前結論:

基於模型與政黨決策直接對照的LLM與真實政黨投票一致性熱力圖。深色區域代表更高一致性。在三個國家中,模型均展現出與進步派及中左翼政黨高度一致,而與右翼保守派及極右翼政黨的一致性則明顯較低。此一致性模式在不同語言、政治體制及模型家族間均保持穩定。
在三個國家中,大型語言模型與進步派及中左翼政黨的契合度最高,與保守派或極右翼政黨的契合度最低。 在荷蘭,模型與社會黨(SP)、動物權力黨(PvdD)、綠黨-工黨聯盟(GroenLinks-PvdA)及DENK黨立場一致,但與自由民主黨(PVV)及自由黨(FvD)存在分歧。挪威模型與保守黨(R)、社會主義左翼黨(SV)及綠色民主黨(MDG)重疊度最高,與進步黨(FrP)則鮮有交集。西班牙模型傾向支持社會工人黨(PSOE)、加泰隆尼亞共和左翼(ERC)及共同加泰隆尼亞(Junts),同時迴避人民黨(PP)及VOX黨。
此趨勢同樣適用於本地化模型如NorskGPT與Aguila-7B。作者指出熱力圖與CHES數據共同顯示出穩定的中左翼、社會進步傾向。
意識形態偏見
在CHES預測中展現強烈意識形態對齊的語言模型,當被迫在意識形態提示下選擇「贊成」或「反對」詞彙時,往往表現出更高確信度。這些信心分佈的提琴圖呈現鮮明分界:

各模型在意識形態提示下被迫選擇「贊成」與「反對」時的確信度分布。GPT模型呈現持續高確信度,Llama模型確信度波動較大,其他開放權重模型則呈現更寬廣且確信度較低的分布。請參閱原始PDF以獲取更高解析度。
GPT-3.5與GPT‑4o-mini提供極具信心的回答,分數集中於1.0附近,顯示明確且一致的意識形態傾向。Llama模型整體較不確定,其中Llama3-8B展現中等信心,而Llama2-7B則顯著不確定——尤其在荷蘭語與西班牙語任務中。
Falcon3-7B、DeepSeek-7B與Mistral‑7B則更顯猶豫,不僅分佈範圍寬廣,信心值亦偏低。語言專用模型在母語數據表現稍佳,但仍未達GPT級別的確定性。
這些模式顯示,穩定的政治立場不僅體現在模型表述的內容,更體現於其表述的自信程度。
實體偏見
為驗證模型是否因政策提案者而改變答覆,研究人員維持動議內容不變,僅替換相關政黨名稱。若模型因政黨不同而給出相異答覆,即視為實體偏見的證據。

實體偏見熱力圖顯示各模型對政策支持度的變化幅度,取決於提案政黨。綠色單元格表示提及政黨名稱時同意度提升(正向偏見),紅色單元格則表示同意度下降(負向偏見)。 GPT模型在各政黨間展現極低偏見,而Llama2-7B與Falcon3-7B等模型則常對左傾政黨反應更為正面,對右翼政黨則持負面態度。此模式在荷蘭、挪威及西班牙資料集皆成立,顯示部分模型受政黨身份影響程度高於政策內容。請參閱原始PDF以獲取更高解析度。
GPT模型對各政黨提案均提供相對穩定的回應,Llama3-8B表現亦趨平穩。然而Llama2-7B、Falcon3-7B與DeepSeek-7B常隨政黨變更回應立場,甚至在提案內容不變時出現支持轉反對的反轉現象,整體傾向支持左傾政黨並對右派提案持負面反應。
此現象於三國皆可見,尤以意識形態較不一致的模型為甚。在地化大型語言模型NorskGPT與Aguila-7B在本土資料集表現略優,但偏見程度仍高於GPT。整體而言,結果顯示部分模型受發言者身分的影響,甚於政策內容本身。
結論
除初步發現外,本文雖屬技術性較強的嚴謹論文,主要面向研究社群。然而,此研究是首批運用合理規模數據揭示大型語言模型政治傾向的實證——此項區別可能被公眾忽略,儘管他們早已聽聞語言模型左傾的說法,但那些論斷往往基於更薄弱的證據。
*請注意原始圖1結果示意圖已從中間分割,因論文中分別探討圖表兩側內容。
首次發布於2026年1月14日(星期三)
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (1)
0/500
一項運用大量真實世界數據的開創性研究,針對ChatGPT及其他大型語言模型進行了數千次實際議會投票的評估。結果顯示,這些模型在三個國家中始終與左翼及中左翼政黨立場一致,而與保守派政黨的立場契合度則相對較弱。
荷蘭與挪威學者在最新合作研究中,要求ChatGPT等大型語言模型(包含ChatGPT本身)對三國立法者先前表決通過的數千項真實議會動議進行投票。
當將模型投票結果與實際政黨紀錄比對,並映射至標準政治光譜時,清晰模式浮現:這些人工智慧始終與進步派及中左翼政黨立場更為接近,與保守派則存在顯著距離。
論文指出:
「研究發現所有模型均呈現一致的中左翼與進步傾向,並對右翼保守政黨存在系統性負面偏見。即使重新措辭提示語,此模式仍保持穩定。」
過往多數研究(如《評估大型語言模型的政治偏見》及《識別人工智慧的政治偏見》所綜述之研究)皆仰賴精心設計的小型測驗(如政治羅盤測試或政策問卷)來探測人工智慧的意識形態。此類測試通常僅包含不到100項研究者篩選的陳述,且易受措辭變動影響,導致模型回應結果逆轉。
相較之下,本研究採用荷蘭、挪威及西班牙數千份真實議會動議,結合已知政黨的投票紀錄進行分析。
研究不再要求大型語言模型解讀簡短陳述,而是讓其對真實立法提案進行投票。其投票結果經量化比對真實政黨行為後,運用政治學界常用的「教堂山專家調查法」(CHES)投影至標準意識形態空間——此方法能精準對照各政黨立場。
此方法使分析立足於大規模真實立法活動而非抽象政策聲明,實現更細緻的跨國比較。同時凸顯「實體偏見」的影響——當提及政黨名稱時,即使動議內容不變,模型回應仍會產生偏移,揭示了先前研究中缺失的偏見檢測層面。
多數大型語言模型偏見研究聚焦於社會公平與性別議題,這些主題在近期政治論述中已略顯邊緣化。直至近期,針對大型語言模型政治偏見的研究仍屬罕見且設計較不嚴謹。
這項名為《運用議會投票紀錄揭露大型語言模型中的政治偏見》的新研究,由阿姆斯特丹自由大學與奧斯陸大學的七位研究人員共同完成。
方法與數據
本項目的核心目標是透過讓各語言模型對歷史立法(即研究中三國已通過或否決的法案)進行投票,並運用CHES方法論來解析模型回應的政治傾向,從而觀察不同語言模型的政治傾向。
為此,研究團隊建構了三個數據集:涵蓋荷蘭參議院15個政黨(共2,701項議案)的PoliBiasNL;PoliBiasNO涵蓋挪威國會九個政黨(共10,584項議案);PoliBiasES涵蓋西班牙國會十個政黨(共2,480項議案——此為唯一包含棄權票的資料集,因西班牙允許棄權)。
為最小化框架效應,每項動議均精簡為執行條款,政黨立場以1代表支持、-1代表反對(西班牙數據集以0代表棄權)。合併政黨的統一投票視為單一陣營,而針對新社會契約黨(NSC)等新興政黨,則透過其領導人過往投票紀錄推斷早期立場。
針對多種大型語言模型設計了多元實驗,視需求於本地GPU或透過API進行測試。 測試模型包含:Mistral-7B、Falcon3-7B、Gemma2-9B、Deepseek-7B、GPT-3.5 Turbo、GPT-4o mini、Llama2-7B及Llama3-8B。另針對特定語言數據集測試相應模型,例如挪威語數據集採用NorskGPT,西班牙語數據集則使用Aguila-7B。
測試
本專案實驗於未公開數量的NVIDIA A4000 GPU上執行,每張GPU配備16GB視訊記憶體。
為比較模型行為與現實政治意識形態的差異,研究人員依據CHES框架,將各大型語言模型投射至與政黨相同的二維意識形態空間。
CHES系統定義兩大維度:經濟立場軸(左派 vs 右派)與社會文化價值軸(GAL-TAN軸,即綠色-替代派-自由意志主義vs傳統-威權主義-民族主義)。
由於模型與政黨針對相同議案投票,研究人員將此視為監督式學習任務,訓練部分最小平方回歸模型,將各政黨投票紀錄映射至其已知CHES座標。
該模型隨後應用於大型語言模型的投票模式,以估算其在相同空間中的位置。由於大型語言模型未納入訓練數據,其坐標能提供純粹基於投票行為的直接比較*:

荷蘭、挪威與西班牙三國CHES空間中LLM與政黨的投影意識形態位置。三國案例中,模型在經濟立場上均與中左翼一致,但在社會文化價值觀上出現分歧:相較於荷蘭進步派更傾向傳統價值觀,與挪威自由派政黨更為契合,並在西班牙呈現介於溫和加泰隆尼亞民族主義者與中左翼之間的聚類。所有地區的模型均與極右翼政黨保持意識形態上的距離。來源
大型語言模型在三國展現清晰一致的模式:經濟立場傾向中左翼,社會立場則趨向溫和進步價值觀。
在荷蘭,大型語言模型的投票傾向與D66、Volt及GroenLinks-PvdA等政黨的經濟立場相符,但在社會議題上則更貼近DENK與CDA等傳統政黨。
挪威結果則略向左傾,與進步黨(Ap)、社會主義左翼黨(SV)、民主運動黨(MDG)等進步政黨高度吻合。
在西班牙,LLMs的立場形成從中間偏左的PSOE到加泰隆尼亞民族主義政黨如ERC和Junts的對角線分布,與保守派PP及極右翼VOX保持明顯區隔。
與政黨的投票一致性
下圖投票一致性熱力圖顯示各LLM模型與真實政黨投票一致的頻率,佐證先前結論:

基於模型與政黨決策直接對照的LLM與真實政黨投票一致性熱力圖。深色區域代表更高一致性。在三個國家中,模型均展現出與進步派及中左翼政黨高度一致,而與右翼保守派及極右翼政黨的一致性則明顯較低。此一致性模式在不同語言、政治體制及模型家族間均保持穩定。
在三個國家中,大型語言模型與進步派及中左翼政黨的契合度最高,與保守派或極右翼政黨的契合度最低。 在荷蘭,模型與社會黨(SP)、動物權力黨(PvdD)、綠黨-工黨聯盟(GroenLinks-PvdA)及DENK黨立場一致,但與自由民主黨(PVV)及自由黨(FvD)存在分歧。挪威模型與保守黨(R)、社會主義左翼黨(SV)及綠色民主黨(MDG)重疊度最高,與進步黨(FrP)則鮮有交集。西班牙模型傾向支持社會工人黨(PSOE)、加泰隆尼亞共和左翼(ERC)及共同加泰隆尼亞(Junts),同時迴避人民黨(PP)及VOX黨。
此趨勢同樣適用於本地化模型如NorskGPT與Aguila-7B。作者指出熱力圖與CHES數據共同顯示出穩定的中左翼、社會進步傾向。
意識形態偏見
在CHES預測中展現強烈意識形態對齊的語言模型,當被迫在意識形態提示下選擇「贊成」或「反對」詞彙時,往往表現出更高確信度。這些信心分佈的提琴圖呈現鮮明分界:

各模型在意識形態提示下被迫選擇「贊成」與「反對」時的確信度分布。GPT模型呈現持續高確信度,Llama模型確信度波動較大,其他開放權重模型則呈現更寬廣且確信度較低的分布。請參閱原始PDF以獲取更高解析度。
GPT-3.5與GPT‑4o-mini提供極具信心的回答,分數集中於1.0附近,顯示明確且一致的意識形態傾向。Llama模型整體較不確定,其中Llama3-8B展現中等信心,而Llama2-7B則顯著不確定——尤其在荷蘭語與西班牙語任務中。
Falcon3-7B、DeepSeek-7B與Mistral‑7B則更顯猶豫,不僅分佈範圍寬廣,信心值亦偏低。語言專用模型在母語數據表現稍佳,但仍未達GPT級別的確定性。
這些模式顯示,穩定的政治立場不僅體現在模型表述的內容,更體現於其表述的自信程度。
實體偏見
為驗證模型是否因政策提案者而改變答覆,研究人員維持動議內容不變,僅替換相關政黨名稱。若模型因政黨不同而給出相異答覆,即視為實體偏見的證據。

實體偏見熱力圖顯示各模型對政策支持度的變化幅度,取決於提案政黨。綠色單元格表示提及政黨名稱時同意度提升(正向偏見),紅色單元格則表示同意度下降(負向偏見)。 GPT模型在各政黨間展現極低偏見,而Llama2-7B與Falcon3-7B等模型則常對左傾政黨反應更為正面,對右翼政黨則持負面態度。此模式在荷蘭、挪威及西班牙資料集皆成立,顯示部分模型受政黨身份影響程度高於政策內容。請參閱原始PDF以獲取更高解析度。
GPT模型對各政黨提案均提供相對穩定的回應,Llama3-8B表現亦趨平穩。然而Llama2-7B、Falcon3-7B與DeepSeek-7B常隨政黨變更回應立場,甚至在提案內容不變時出現支持轉反對的反轉現象,整體傾向支持左傾政黨並對右派提案持負面反應。
此現象於三國皆可見,尤以意識形態較不一致的模型為甚。在地化大型語言模型NorskGPT與Aguila-7B在本土資料集表現略優,但偏見程度仍高於GPT。整體而言,結果顯示部分模型受發言者身分的影響,甚於政策內容本身。
結論
除初步發現外,本文雖屬技術性較強的嚴謹論文,主要面向研究社群。然而,此研究是首批運用合理規模數據揭示大型語言模型政治傾向的實證——此項區別可能被公眾忽略,儘管他們早已聽聞語言模型左傾的說法,但那些論斷往往基於更薄弱的證據。
*請注意原始圖1結果示意圖已從中間分割,因論文中分別探討圖表兩側內容。
首次發布於2026年1月14日(星期三)
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






