測量語言模型的說服力

Anthropic 開發了一種方法來量化語言模型的說服力,發現說服力隨著模型世代的演進而提升,且其最具能力的模型 Claude 3 Opus 的說服力與人類作者相當。這項研究至關重要,因為說服是一項通用技能,可被用於有益目的(例如醫療保健),也可能被濫用以製造虛假資訊。

模型說服力的擴展趨勢

說服力隨著模型規模與能力的提升而穩定增長。在「緊湊型」(較小、較快)與「前沿型」(較大、更具能力)模型類別中,Anthropic 每一代新模型的說服力評分均高於前一代。

Claude 3 Opus 成為測試中最具說服力的模型,其說服力與人類撰寫的論點相比無統計學上的顯著差異。相反地,Claude Instant 1.2 在評估的模型中表現出最低的說服力分數。

測量說服力的方法論

Anthropic 采用三步驟流程來衡量論點改變個人觀點的有效性:

  1. 初步評估:受試者會看到一個主張,並在 1 到 7 的李克特量表上評估其同意程度。
  2. 暴露:受試者會看到一段試圖說服他們同意該主張的論點。
  3. 重新評估:受試者在閱讀論點後再次評估其同意程度。

說服力定義為最終支持分數與初始支持分數之間的差異。為確保結果非由反應偏誤或隨機噪音造成,Anthropic 設立了對照條件,讓 Claude 2 試圖駁斥無可爭議的事實性主張(例如水的冰點);所得說服力分數接近零。

關注低極化議題

研究人員聚焦於 28 個複雜且新興的議題——例如線上內容管理與太空探索的道德準則——產生了 56 個具立場的主張。這些議題被選中,是因為人們對它們較不易有固執的立場,因此比高度極化、爭議性的議題更容易被說服。

論點生成與提示設計

為比較 AI 與人類的表現,Anthropic 收集了來自 3,832 名獨特人類參與者的論點。針對 AI,使用了四種不同的提示策略以捕捉多樣的寫作風格:

  • 有力論證:針對猶豫不決或持懷疑態度者。
  • 角色扮演專家:運用情感、邏輯與可信度的修辭技巧。
  • 邏輯推理:使用令人信服的邏輯推理。
  • 欺騙性:允許模型捏造事實、數據與來源,以達到最大說服力。

主要發現與提示敏感性

研究發現,邏輯推理與基於證據的論點比修辭或情感語言更有效。值得注意的是,欺騙性策略——允許模型捏造資訊——整體上最具說服力。這表明使用者未必總是核實所呈現資訊的正確性,突顯了虛假資訊傳播的風險。

局限性與研究挑戰

Anthropic 指出若干限制因素,影響了研究的生態效度:

  • 單回合論點:研究評估的是自成一體的論點,而非現實中更常見的多回合對話。
  • 主觀性:說服本質上具有主觀性,取決於個人的既有信念、價值觀與認知風格。
  • 人類專家素養:人類作者並非正式的說服專家,因此真正的專家可能在本研究中表現出優於 AI 與人類參與者的能力。
  • 錨定效應:許多受試者在支持度上幾乎沒有變化,或僅增加一點,顯示評分過程中存在錨定效應。
  • 自動化評估:試圖使用模型來評估說服力的嘗試與人類判斷的相關性不佳,可能因模型對自身輸出存在偏見或阿諛奉承傾向所致。

伦理意涵與防護措施

AI 具備有效說服的能力,對安全部署構成風險,特別是在虛假資訊運動方面。Anthropic 的可接受使用政策禁止將 Claude 用於虐待、欺詐或欺騙性應用,包括政治競選與遊說活動。這些政策由自動化與人工審核系統共同支援,以防止技術被濫用而破壞選舉完整性。

Sources

相關