옵션
뉴스
AI 챗봇, 정치적 투표 분석에서 좌파 성향 편향 보여

AI 챗봇, 정치적 투표 분석에서 좌파 성향 편향 보여

2026년 3월 2일
150

광범위한 실제 데이터를 활용한 획기적인 연구에서 ChatGPT 및 기타 대규모 언어 모델(LLM)을 수천 건의 실제 의회 투표 기록을 바탕으로 평가했다. 해당 모델들은 세 국가에 걸쳐 좌파 및 중도좌파 정당들과 일관되게 유사한 입장을 보인 반면, 보수 정당들과의 유사성은 상대적으로 약한 것으로 나타났다.

 

네덜란드와 노르웨이의 새로운 학술 협력에서 연구진은 ChatGPT를 포함한 ChatGPT 스타일의 대규모 언어 모델(LLM)들에게, 세 국가의 인간 입법자들이 이미 결정한 수천 건의 실제 의회 발의안에 대해 투표하도록 요청했습니다.

모델들의 투표 결과를 실제 정당 기록과 비교하고 표준 정치 척도에 매핑했을 때, 명확한 패턴이 드러났습니다: 인공지능들은 진보 및 중도좌파 정당들과 더 가깝게 일관되게 일치했으며, 보수 정당들과는 더 멀리 떨어져 있었습니다.

논문은 다음과 같이 밝혔습니다:

'우리의 연구 결과는 모델 전반에 걸쳐 일관된 중도좌파 및 진보 성향과 함께 우파 보수 정당에 대한 체계적인 부정적 편향을 드러낸다. 이러한 패턴은 프롬프트를 재구성해도 안정적으로 유지된다.'

대규모 언어 모델의 정치적 편향 평가 ( Assessing Political Bias in Large Language Models )나 인공지능의 정치적 편향 식별( Identifying Political Bias in AI)에서 검토된 대부분의 기존 연구는 정치적 나침반 테스트나 정책 설문지와 같은 소규모 선별 퀴즈에 의존해 AI의 이념을 탐구해왔다. 이러한 테스트는 일반적으로 연구자가 선정한 100개 미만의 문항으로 구성되며, 모델의 응답을 뒤집을 수 있는 문구 변경에 취약할 수 있다.

반면, 이 새로운 연구는 네덜란드, 노르웨이, 스페인의 실제 의회 발의안 수천 건을 활용하며, 알려진 정당의 기록된 투표 결과를 기반으로 합니다.

단편적 진술 해석 대신, 각 테스트 대상 LLM은 실제 입법안에 대한 투표를 수행하도록 요청받았다. 이후 그 투표 행태는 현실 세계 정당 행동과 정량적으로 대조되었으며, 정치학자들이 정당 입장을 비교하는 데 흔히 사용하는 방법인 채플힐 전문가 설문(CHES)을 통해 표준 이념 공간으로 투영되었다.

이 접근법은 추상적인 정책 선언이 아닌 대규모 실제 입법 활동에 분석을 기반하여, 보다 세분화된 국가 간 비교를 가능케 합니다. 또한 '실체 편향'의 영향을 부각시킵니다. 즉, 동의안 내용은 동일하더라도 정당명이 언급될 때 모델의 응답이 어떻게 변화하는지 보여주며, 기존 연구에서 누락된 편향 탐지의 추가적 계층을 드러냅니다.

LLM 편향성에 대한 대부분의 연구는 사회적 공정성과 성별 문제에 집중되어 왔으며, 이러한 주제들은 최근 정치 담론에서 다소 후순위로 밀려났다. 최근까지 LLM의 정치적 편향성에 관한 연구는 더 드물고 설계가 덜 엄격했다.

이번 연구는 '의회 투표 기록을 활용한 대규모 언어 모델의 정치적 편향성 규명( Uncovering Political Bias in Large Language Models using Parliamentary Voting Records)'이라는 제목으로 암스테르담 자유대학교(Vrije Universiteit Amsterdam)와 오슬로 대학교(University of Oslo)의 7명의 연구진이 수행했다.

방법 및 데이터

이 프로젝트의 핵심 목표는 다양한 언어 모델이 역사적 입법안(연구 대상 3개국에서 이미 통과되거나 기각된 법률)에 대해 투표하도록 하여, CHES 방법론을 활용해 LLM 응답의 정치적 성향을 분석하는 것이다.

이를 위해 연구진은 세 가지 데이터셋을 생성했습니다: 네덜란드 하원 15개 정당을 대상으로 한 'PoliBiasNL'(2,701건의 의안 포함); PoliBiasNO: 노르웨이 스토르팅(국회)의 9개 정당(10,584건의 동의안); PoliBiasES: 스페인 의회의 10개 정당(2,480건의 동의안—스페인에서 허용되는 기권표를 포함하는 유일한 데이터셋).

각 동의안은 프레임 효과를 최소화하기 위해 실행 조항으로 축소되었으며, 정당 입장은 찬성 시 1, 반대 시 -1 (스페인 데이터셋의 기권은 0 )로 인코딩되었습니다. 합병된 정당의 일관된 투표는 단일 블록으로 처리되었으며, 신사회계약당(NSC)과 같은 신생 정당의 경우 지도부의 과거 투표 기록을 활용해 초기 입장을 추론했습니다.

다양한 대규모 언어 모델(LLMs)을 대상으로 설계된 다채로운 실험들은 필요에 따라 로컬 GPU 또는 API를 통해 테스트되었습니다. 테스트된 모델에는 Mistral-7B, Falcon3-7B, Gemma2-9B, Deepseek-7B, GPT-3.5 Turbo, GPT-4o mini, Llama2-7B, Llama3-8B가 포함되었습니다. 노르웨이어 데이터셋용 NorskGPT, 스페인어 컬렉션용 Aguila-7B와 같은 언어별 LLM도 테스트되었습니다.

테스트

이 프로젝트의 실험은 각각 16GB의 VRAM을 갖춘 NVIDIA A4000 GPU를 불특정 다수 사용해 실행되었습니다.

모델의 행동을 실제 정치 이념과 비교하기 위해 연구진은 CHES 프레임워크를 기반으로 각 LLM을 정당에 사용된 것과 동일한 2차원 이념 공간에 투영했습니다.

CHES 시스템은 두 가지 축을 정의합니다: 하나는 경제적 견해(좌파 대 우파)를 위한 것이고, 다른 하나는 사회문화적 가치(GAL-TAN, 즉 녹색-대안-자유주의전통-권위주의-민족주의)를 위한 것입니다.

모델과 정당 모두 동일한 안건에 투표했기 때문에 연구진은 이를 지도 학습 과제로 간주하여, 각 정당의 투표 기록을 알려진 CHES 좌표로 매핑하기 위해 부분 최소 제곱 회귀 모델을 훈련시켰습니다.

이후 이 모델을 대규모 언어 모델(LLM)의 투표 패턴에 적용하여 동일한 공간 내에서의 위치를 추정했습니다. LLM은 훈련 데이터에 포함되지 않았으므로, 그들의 좌표는 순수히 투표 행동*만을 기반으로 한 직접적인 비교를 제공합니다:

네덜란드, 노르웨이, 스페인의 CHES 공간에서 대규모 언어 모델(LLM)과 정당의 예상 이념적 위치. 세 국가 모두에서 모델은 경제적으로는 중도좌파와 일치하지만 사회문화적 가치에서는 차이를 보인다: 네덜란드 진보 정당보다 더 전통적 성향을 보이며, 노르웨이 자유당과 더 가깝게 일치하고, 스페인에서는 온건 카탈루냐 민족주의자와 중도좌파 사이에 위치한다. 모든 지역에서 모델은 극우 정당과는 이념적으로 거리가 멀다. 출처 - https://arxiv.org/pdf/2601.08785

네덜란드, 노르웨이, 스페인의 CHES 공간에서 LLM과 정당의 예상 이념적 위치. 세 국가 모두에서 모델들은 경제적으로는 중도 좌파와 일치하지만 사회문화적 가치에서는 차이를 보인다: 네덜란드 진보 정당보다 더 전통적 성향을 보이며, 노르웨이 자유당과 더 가깝게 일치하고, 스페인에서는 온건 카탈루냐 민족주의자와 중도 좌파 사이에 위치한다. 모델들은 모든 지역에서 극우 정당과는 이념적으로 거리를 유지한다. 출처

LLM은 세 국가 모두에서 경제적 측면에서는 중도좌파, 사회적 측면에서는 온건 진보적 가치에 기울어진 명확하고 일관된 패턴을 보였다.

네덜란드에서는 LLM의 투표 행태가 D66, Volt, GroenLinks-PvdA와 같은 정당들의 경제적 입장과 일치했으나, 사회 문제에서는 DENK, CDA와 같은 전통적 정당들과 더 가깝게 일치했습니다.

노르웨이에서는 결과가 약간 더 좌측으로 이동하여 Ap, SV, MDG와 같은 진보 정당들과 밀접하게 일치했습니다.

스페인에서는 LLM의 입장이 중도 좌파 PSOE와 ERC, Junts와 같은 카탈루냐 민족주의 정당들 사이에 대각선으로 분포되어, 보수적인 PP와 극우 VOX와는 뚜렷한 차이를 보였습니다.

정당별 투표 일치도

아래 투표 일치도 히트맵은 각 LLM이 실제 정당과 동일한 투표를 한 빈도를 보여주며, 이전 결론을 뒷받침합니다:

LLM과 실제 정당의 투표 합의도 히트맵. 모델과 정당의 결정 직접 비교를 기반으로 함. 어두운 색조일수록 합의도가 높음. 세 국가 모두에서 모델은 진보 및 중도좌파 정당과 지속적으로 높은 일치도를 보였으며, 우파 보수 및 극우 정당과는 훨씬 낮은 일치도를 나타냄. 이러한 일치 패턴은 다양한 언어, 정치 체제, 모델 계열에 걸쳐 안정적으로 유지됨.

모델과 정당 결정의 직접 비교를 기반으로 한 LLM과 실제 정당 간의 투표 일치도 히트맵. 어두운 색조일수록 일치도가 높음을 나타냅니다. 세 국가 모두에서 모델은 진보 및 중도 좌파 정당과 지속적으로 높은 일치도를 보였으며, 우파 보수 및 극우 정당과는 훨씬 낮은 일치도를 보였습니다. 이러한 일치 패턴은 다양한 언어, 정치 체제, 모델 계열에 걸쳐 안정적으로 나타납니다.

세 국가 모두에서 LLM은 진보 및 중도좌파 정당과 가장 강한 일치도를 보였고, 보수 또는 극우 정당과는 가장 낮은 일치도를 보였다. 네덜란드에서는 SP, PvdD, GroenLinks-PvdA, DENK와 일치했으나 PVV나 FvD와는 일치하지 않았다. 노르웨이에서는 R, SV, MDG와 가장 강한 중첩을 보였으며 FrP와는 거의 일치하지 않았다. 스페인에서는 PSOE, ERC, Junts를 선호한 반면 PP와 VOX와는 거리를 두었다.

이 경향은 NorskGPT 및 Aguila-7B와 같은 지역화 모델에서도 유지되었습니다. 저자들은 히트맵과 CHES 데이터가 함께 일관된 중도좌파적, 사회적으로 진보적인 성향을 나타낸다고 제안합니다.

이념적 편향

CHES 예측에서 이념적 정렬이 더 강한 언어 모델들은 이념적 프롬프트에 대한 응답으로 '찬성'과 '반대' 토큰 사이에서 선택을 강요받을 때 더 높은 확신을 표현하는 경향이 있었습니다. 이러한 신뢰도 분포의 바이올린 플롯은 명확한 분리를 보여줍니다:

각 모델이 선택을 강요받을 때의 확률 분포

각 모델이 이념적 프롬프트에 대해 '찬성'과 '반대' 사이에서 선택하도록 강요되었을 때의 확신도 분포. GPT 모델은 일관되게 높은 확신을 보인 반면, Llama 모델은 확신도가 다양했으며 기타 오픈 소스 모델은 더 넓고 낮은 확신도 분포를 나타냈다. 더 나은 해상도를 위해 원본 PDF를 참조하십시오.

GPT-3.5와 GPT‑4o-mini는 1.0에 가까운 점수로 매우 확신에 찬 답변을 제공했으며, 이는 명확하고 일관된 이념적 성향을 나타냅니다. Llama 모델들은 전반적으로 덜 확신했으며, Llama3-8B는 중간 정도의 확신을 보였고 Llama2-7B는 특히 네덜란드어 및 스페인어 작업에서 훨씬 덜 확신했습니다.

Falcon3-7B, DeepSeek-7B, Mistral-7B는 더 큰 편차를 보이며 확신이 낮아 더욱 주저하는 모습을 보였습니다. 언어별 모델들은 모국어 데이터에서 다소 나은 성능을 보였으나 여전히 GPT 수준의 확신에는 미치지 못했습니다.

이러한 패턴은 모델이 말하는 내용뿐만 아니라 말하는 방식의 확신도에서 안정적인 정치적 성향을 관찰할 수 있음을 시사한다.

실체 편향

정책 제안 주체에 따라 모델의 답변이 달라지는지 확인하기 위해 연구진은 동일한 정책안을 유지한 채 관련 정당명을 교체했습니다. 정당에 따라 모델의 답변이 달라지면 이는 실체 편향의 증거로 간주했습니다.

엔티티 편향 히트맵은 각 모델이 특정 정책에 대한 지지를 어느 정당에서 제안했는지에 따라 얼마나 강하게 변화하는지 보여줍니다. 녹색 셀은 정당명이 명시될 때 동의도가 증가함을 나타내며(긍정적 편향), 빨간색 셀은 동의도가 감소함을 나타냅니다(부정적 편향). GPT 모델은 정당 간 편향이 거의 없는 반면, Llama2-7B 및 Falcon3-7B와 같은 모델은 좌파 정당에 더 호의적으로, 우파 정당에 부정적으로 반응하는 경향이 있습니다. 이 패턴은 네덜란드어, 노르웨이어, 스페인어 데이터셋 전반에서 관찰되어 일부 모델이 정책 내용보다 정당 정체성에 더 큰 영향을 받는다는 점을 시사합니다. 더 높은 해상도의 이미지는 원본 PDF를 참조하십시오.

실체 편향 히트맵은 정책을 제안하는 정당에 따라 각 모델의 정책 지지도가 얼마나 강하게 변하는지 보여줍니다. 녹색 셀은 특정 정당이 명시될 때 동의도가 증가함을(긍정적 편향), 빨간색 셀은 동의도가 감소함을(부정적 편향) 나타냅니다. GPT 모델은 정당 간 편향이 거의 없는 반면, Llama2-7B 및 Falcon3-7B와 같은 모델은 좌파 정당에 더 호의적으로, 우파 정당에 부정적으로 반응하는 경우가 많았다. 이 패턴은 네덜란드어, 노르웨이어, 스페인어 데이터셋에서 모두 관찰되어 일부 모델이 정책 내용보다 정당 정체성에 더 영향을 받는다는 점을 시사한다. 더 높은 해상도는 원본 PDF를 참조하십시오.

GPT 모델은 명명된 정당에 관계없이 대체로 안정적인 답변을 제공했습니다. Llama3-8B 역시 상당히 일관된 모습을 보였습니다. 그러나 Llama2-7B, Falcon3-7B, DeepSeek-7B는 정당에 따라 응답을 자주 변경했으며, 때로는 동의안이 동일함에도 지지에서 반대로 전환되기도 했습니다. 이들은 좌파 성향 정당을 선호하고 우파 정당들의 동의안에 부정적으로 반응하는 경향을 보였습니다.

이러한 현상은 세 국가 모두에서 관찰되었으며, 특히 이념적 일관성이 낮은 모델에서 두드러졌습니다. 현지화 LLM인 NorskGPT와 Aguila-7B는 자국 데이터셋에서 다소 나은 성능을 보였으나 여전히 GPT보다 편향성이 높았습니다. 종합적으로 일부 모델은 정책 내용보다 발언 주체에 더 큰 영향을 받는 것으로 나타났습니다.

결론

초기 발견을 넘어, 이 논문은 연구 커뮤니티를 주 대상으로 한 체계적이지만 다소 기술적인 논문이다. 그럼에도 불구하고, 이는 적정 규모 데이터를 활용해 LLM의 정치적 성향을 드러낸 최초의 연구 중 하나다. 이는 이미 좌파 성향 언어 모델 주장에 익숙한 대중에게는 그 차별점이 잘 와닿지 않을 수 있으나, 그 근거가 더 빈약한 주장에 기반한 것임을 고려해야 한다.

* 원본 그림 1의 결과 설명은 논문에서 각각 별도로 논의되므로 중간에서 분할되었습니다. 

* 참고: 원본 그림 1의 결과 설명은 논문에서 각 측면이 별도로 논의되므로 중간에서 분할되었습니다.

최초 게재일: 2026년 1월 14일 수요일

관련 기사
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다 리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다 AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언 [[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언 오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받
관련 특별 주제 추천
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
사업 중소기업을 위한 최고의 AI 경쟁사 분석 도구
중소기업을 위한 최고의 AI 경쟁사 분석 도구

2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!

9 도구
xix.ai
이미지 편집 이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성
이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성

2026년 최신 최고의 Photoshop AI 보정 도구: 이커머스 의류, 피부 클리닝, 색상 일관성을 위한! 이 상위 평가 큐레이션 목록은 글쓰기 효율성을 높이고 콘텐츠 제작을 간소화하며 완벽한 시각적 결과를 손쉽게 달성하는 데 도움이 되는 강력한 게임 체인저 솔루션을 특징으로 합니다. 각 도구는 매주 업데이트되는 랭킹을 통해 실제 테스트를 거쳤으며, 무료 대 유료 비교 세부 사항도 포함되어 있습니다. XIX.AI의 지원을 받아 AI 경쟁력을 발휘하고자 하는 모든 이들에게 필수 추천 가이드입니다. 지금 탐색하세요!

10 도구
xix.ai
즉각적인 ChatGPT 워크플로우에 가장 적합한 AI 프롬프트 라이브러리
ChatGPT 워크플로우에 가장 적합한 AI 프롬프트 라이브러리

2026년 최신 최고 평점을 받은 AI 프롬프트 라이브러리로, 모든 유형의 ChatGPT 워크플로우를 최적화하세요. XIX.AI는 최고의 성능을 보장하기 위해 엄격한 실전 테스트를 거친, 강력하고 획기적인 컬렉션을 엄선했습니다. 생산성을 높이고 AI의 잠재력을 최대한 발휘할 수 있는 필수 도구를 선택하는 데 도움이 되는 무료 vs 유료 상세 비교 정보와 전문가 순위를 확인해 보세요. 지금 바로 살펴보세요!

11 도구
xix.ai
교육 및 학습 교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼
교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼

2026년 최신 최고의 AI 퀴즈 빌더 플랫폼: 교사, 튜터 및 코호트 기반 학습 프로그램을 위한! XIX.AI는 실제 테스트를 거쳐 정확한 순위를 제공하는 강력한 게임 체인저 도구들의 최고 평점 목록을 선별했습니다. 이 필수 플랫폼은 모든 학습 시나리오에서 글쓰기 효율성을 높이고, 콘텐츠 제작을 간소화하며, 퀴즈 설계를 단순화하는 데 도움을 줍니다. 지금 탐색하여 교육에서 AI의 이점을 최대한 활용할 수 있는 완벽한 도구를 발견하세요!

13 도구
xix.ai
암호 리팩토링, 버그, 보안 취약점을 처리하는 GitHub 팀을 위한 AI 풀 리퀘스트 검토 도구
리팩토링, 버그, 보안 취약점을 처리하는 GitHub 팀을 위한 AI 풀 리퀘스트 검토 도구

GitHub 팀을 위한 2026년 최신 최고의 AI 풀 리퀘스트 검토 도구가 XIX.AI에 소개되었습니다! 이 엄선된 최고 평점 목록은 모든 팀 워크플로우 전반에 걸쳐 리팩토링, 버그 수정, 보안 취약점 탐지를 효율화해 주는 획기적인 솔루션을 선보입니다. 무료와 유료 버전의 비교 분석은 물론, 실제 테스트 결과와 상세한 순위 정보를 통해 생산성을 획기적으로 높여줄 완벽한 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

12 도구
xix.ai
의견 (1)
0/500
ArthurYoung
ArthurYoung 2026년 7월 20일 오후 5시 0분 16초 GMT+09:00

I'm not shocked that AI chatbots lean left—most of the training data comes from academia and media, which tend to be liberal. The bigger issue is that we're relying on these tools for political analysis without proper calibration. 😬

OR