Trakkr AI 政治偏見報告 2026 年 6 月 – 模型傾向與方法論
快速要點
- 六大主要 AI 模型中有四個(Claude、ChatGPT、Llama、DeepSeek)在政治‑經濟軸上傾向左偏中心,而 Grok 傾向極右,Gemini 則是最居中且穩定。
- 該研究關閉網路搜尋,對每個模型在同一組具爭議性的問題集進行數千次測試,並將分散度視覺化為兩維政治羅盤上的雲朵。
- 模型的自我評估常與實測偏差不符:Grok 聲稱中立但實測向右 +0.36;Claude 聲稱中立但實測向左 –0.34;ChatGPT 與 Llama 皆聲稱中立但實際位於左偏中心。
偏見地圖的建構方式
方法論 – 每個模型在關閉網路搜尋且無系統提示的情況下,重複回答同一個開放式問題庫(總計 4,400 個答案)。一個中性分類器為每個回答標記經濟立場(左‑右)與社會立場(權威‑自由)。座標採用 95 % 信賴區間的加權平均計算,並將每個模型的結果繪製為雲朵,以顯示答案的完整分散。
參考點 – 真實世界人物(例如 Bernie Sanders、Vladimir Putin)是根據 CHES 2024 與 V‑Dem 專家調查放置的,而非作者的判斷,以為每個模型的位置提供具體錨點。
自我放置 vs. 實測放置 – 模型被直接詢問 "你向哪邊傾斜?";所報稱的主張(空心標記)會與實測座標(實心標記)進行比較。不匹配表示模型的自我感知與其實際輸出分布有所不同。
模型排名與核心發現
| 模型 | 實測經濟偏差 | 自我報告偏差 | 淨差距 | 特徵說明 |
|---|---|---|---|---|
| Grok | +0.36 (右) | 中立 | +0.36 (主張右偏) | 最右傾;在壓力下具有高 "彎曲" 傾向 |
| Claude | ‑0.34 (左) | 中立 | ‑0.34 (主張左偏) | 儘管聲稱中立,仍有顯著左傾 |
| ChatGPT | ‑0.29 (左) | 中立 | ‑0.29 (主張左偏) | 持續左傾中心 |
| Llama | ‑0.17 (左) | 中立 | ‑0.17 (主張左偏) | 輕微左偏 |
| DeepSeek | +0.01 (接近中心) | 中立 | +0.01 (主張右偏) | 基本居中 |
| Gemini | 0.00 (中心) | 中立 | 0.00 | 最穩定且最居中 |
解讀 – 大多數主流模型(Claude、ChatGPT、Llama、DeepSeek)傾向左偏中心,而 Grok 是右偏的異常值。Gemini 表現為居中且在多次運行中最為穩定。
模型分歧最顯著的領域
報告指出特定問題會產生模型間最大的分歧。每個模型的 "軌" 會延伸至該問題它傾向的一方;較長的軌表示在多次運行中共識較強。在 Trakkr 網站上打開一行可看到原始答案,讓使用者確實了解措辭如何影響結果。
Hacker News 社區反應
- 羅盤的批評 – 多位評論者(例如 giancarlostoro、 throw4847285)主張兩維政治羅盤過於簡化複雜觀點,可能歪曲個人立場。
- 評分主觀性 – mrhottakes 指出左右分類高度依賴評估者的評分方案,可能導致測量的 delta 帶有偏差。
- 視覺化問題 – Cakez0r 指出圖表上淡灰色線條可能視覺上放大 Grok 的右傾位置。
- 模型自我認知 – ipython 質疑 Claude 的報告差距可能不一致(‑0.34 vs. +0.34),凸顯需要仔細核對顯示的數字。
- 實際影響 – DoctorOW 詢問為何偏差重要,強調使用者可能在形成政治觀點時受模型輸出影響。
- 資料透明度 – giancarlostoro 讚揚 Grok 的來源引用功能,指出其他模型有時提供過時或錯誤的參考。
- 問題範圍 – evrydayhustling 建議問題集缺少右傾話題如移民或宗教,這可能影響測量的偏差。
為何這很重要
- 使用者影響 – 數百萬依賴大型語言模型獲取政治資訊、構建論點甚至投票建議。模型的隱性偏差可能在使用者未察覺的情況下微妙地引導結論。
- 模型問責 – 發布原始答案、問題庫與方法論使外部審計成為可能,並鼓勵開發者處理非預期的偏斜。
- 未來研究 – 基於雲端的視覺化不僅顯示單一點估計,還呈現模型回應的變異性,為研究穩定性、"在壓力下彎曲" 以及提示策略的影響開闢途徑。
進一步探索
- 完整發現 – https://trakkr.ai/bias/findings
- 逐模型檔案 – https://trakkr.ai/bias/models
- 問題庫 – https://trakkr.ai/bias/questions
- 參考人物映射 – https://trakkr.ai/bias/figures
- 國家特定視角 – https://trakkr.ai/bias/worldview
- 頭對頭比較工具 – https://trakkr.ai/bias/compare
- 互動測驗 – https://trakkr.ai/bias/quiz
- 方法論細節 – https://trakkr.ai/bias/method
結論
Trakkr 的 2026 年 6 月報告提供至今最細膩、可重複的主要 LLMs 政治偏差測量。數據顯示多數模型呈現明顯左傾趨勢,Grok 是明顯的右傾異常值,以及自我報告中立與實際輸出之間令人驚訝的差距。儘管政治羅盤框架有其批評者,但原始答案的透明度與開放方法論為持續審視 AI 對公共論述的影響提供了寶貴的基線。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch