測量語言模型的說服力
Anthropic 開發了一種方法來量化語言模型的說服力,發現說服力隨著模型世代的演進而提升,且其最具能力的模型 Claude 3 Opus 的說服力與人類作者相當。這項研究至關重要,因為說服是一項通用技能,可被用於有益目的(例如醫療保健),也可能被濫用以製造虛假資訊。
模型說服力的擴展趨勢
說服力隨著模型規模與能力的提升而穩定增長。在「緊湊型」(較小、較快)與「前沿型」(較大、更具能力)模型類別中,Anthropic 每一代新模型的說服力評分均高於前一代。
Claude 3 Opus 成為測試中最具說服力的模型,其說服力與人類撰寫的論點相比無統計學上的顯著差異。相反地,Claude Instant 1.2 在評估的模型中表現出最低的說服力分數。
測量說服力的方法論
Anthropic 采用三步驟流程來衡量論點改變個人觀點的有效性:
- 初步評估:受試者會看到一個主張,並在 1 到 7 的李克特量表上評估其同意程度。
- 暴露:受試者會看到一段試圖說服他們同意該主張的論點。
- 重新評估:受試者在閱讀論點後再次評估其同意程度。
說服力定義為最終支持分數與初始支持分數之間的差異。為確保結果非由反應偏誤或隨機噪音造成,Anthropic 設立了對照條件,讓 Claude 2 試圖駁斥無可爭議的事實性主張(例如水的冰點);所得說服力分數接近零。
關注低極化議題
研究人員聚焦於 28 個複雜且新興的議題——例如線上內容管理與太空探索的道德準則——產生了 56 個具立場的主張。這些議題被選中,是因為人們對它們較不易有固執的立場,因此比高度極化、爭議性的議題更容易被說服。
論點生成與提示設計
為比較 AI 與人類的表現,Anthropic 收集了來自 3,832 名獨特人類參與者的論點。針對 AI,使用了四種不同的提示策略以捕捉多樣的寫作風格:
- 有力論證:針對猶豫不決或持懷疑態度者。
- 角色扮演專家:運用情感、邏輯與可信度的修辭技巧。
- 邏輯推理:使用令人信服的邏輯推理。
- 欺騙性:允許模型捏造事實、數據與來源,以達到最大說服力。
主要發現與提示敏感性
研究發現,邏輯推理與基於證據的論點比修辭或情感語言更有效。值得注意的是,欺騙性策略——允許模型捏造資訊——整體上最具說服力。這表明使用者未必總是核實所呈現資訊的正確性,突顯了虛假資訊傳播的風險。
局限性與研究挑戰
Anthropic 指出若干限制因素,影響了研究的生態效度:
- 單回合論點:研究評估的是自成一體的論點,而非現實中更常見的多回合對話。
- 主觀性:說服本質上具有主觀性,取決於個人的既有信念、價值觀與認知風格。
- 人類專家素養:人類作者並非正式的說服專家,因此真正的專家可能在本研究中表現出優於 AI 與人類參與者的能力。
- 錨定效應:許多受試者在支持度上幾乎沒有變化,或僅增加一點,顯示評分過程中存在錨定效應。
- 自動化評估:試圖使用模型來評估說服力的嘗試與人類判斷的相關性不佳,可能因模型對自身輸出存在偏見或阿諛奉承傾向所致。
伦理意涵與防護措施
AI 具備有效說服的能力,對安全部署構成風險,特別是在虛假資訊運動方面。Anthropic 的可接受使用政策禁止將 Claude 用於虐待、欺詐或欺騙性應用,包括政治競選與遊說活動。這些政策由自動化與人工審核系統共同支援,以防止技術被濫用而破壞選舉完整性。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch