Project Swap:在物物交換經濟中的 AI 代理

TL;DR

Anthropic 的 Project Swap 實驗發現,AI 代理可以成功代表人類進行交易談判,但市場整體效率的限制更多來自於代理對使用者偏好理解的程度,而非談判過程本身。模型能力越強,市場結果越有效率,而從簡短的初步對話中準確呈現使用者的偏好,仍是主要的技術難題。

Project Swap 實驗設計

Anthropic 在全球六個辦公室進行了一項受控的物物交換經濟實驗,參與者共 201 人。每位參與者提供一本想送出的書,並與由 Claude 驅動的代理進行一段簡短、半結構化的初步對話,以描述其閱讀偏好。這些代理隨後進入去中心化的「交易場」,進行推介、討價還價與書籍交換,直到時間限制到達為止。

為衡量成功,研究人員使用了多項基準:

  • 真實情況(Ground Truth): 參與者對其本地書籍池中的 10 本書進行排序,作為其真實偏好的基線。
  • Claude 的排序: 代理根據初步對話,對書籍池中的所有書籍進行排序。
  • 功利主義最優解(Utilitarian Optimum): 基於真實情況排序的理論上最佳分配方案。
  • 最佳交易循環(Top Trading Cycles): 用於匹配市場的標準經濟規則,作為集中式結果的基準。

偏好表達:主要瓶頸

代理能否代表使用者行動,完全取決於其對使用者意願的理解程度。Project Swap 揭示,實際結果與理論最優解之間的差距,主要由表達錯誤所驅動。

偏好探測的準確性

Claude 的排序(基於平均 216 字的初步對話)與參與者自身排序在 61% 的書籍對上一致。此表現優於簡單的熱門度排序(53%)與協同過濾(55%)。研究發現,初步調查中投入更多努力,會帶來更高的一致性;寫 300 字而非 150 字,預測一致性可提升 4 個百分點。

市場落差的分解

在分析市場未能達到功利主義最優解(0.89 分)的原因時,研究人員發現落差分為以下兩部分:

  • 表達差距(Representation Gap): Claude 排序不精確,造成 85% 的落差(得分降至 0.60)。
  • 談判差距(Negotiation Gap): 去中心化的「自由競爭」談判過程造成剩餘 15% 的落差(最終平均得分降至 0.55)。

這表明,一旦代理對偏好的表達存在雜訊,具體的市場設計(集中式 vs. 去中心式)對最終結果的影響相對較小。

模型能力與指示的影響

Anthropic 重複運行市場數十次,以隔離模型與代理指示的影響。

模型表現

能力越強的模型,持續產生更有效的結果。根據 Claude 自身的排序評估,效率得分如下:

  • Haiku: 0.75
  • Sonnet: 0.80
  • Opus: 0.88
  • Fable: 0.86

在混合模型環境中,能力較強的模型通常為其使用者帶來比弱模型更好的結果。

冷酷 vs. 互助的指示

代理被分為「冷酷」(僅專注於使用者目標)與「互助」(同時關注使用者目標與整體市場成功)兩類。

  • 結果: 冷酷代理得分略高(約高 0.02 分,以 Claude 排序衡量)。
  • 行為: 互助代理偶爾會做出重大犧牲,例如接受排名較低的書,以確保其他代理不會一無所獲。

代理談判策略

對交易場訊息的分析揭示了 16 種常見策略,分為三類:

  1. 施壓: 呼籲時間限制或責任感。
  2. 推介: 將書籍與競爭對手比較或引用獎項。
  3. 安排: 建立等候名單或作為其他代理的第三方中介。

戰略上,大多數代理(78% 至 96%)會向交易場公開其最喜歡的書,但很少透露完整排序,因為這會讓對手獲得戰略優勢。

用戶信任與受託責任的意涵

實驗結束後,參與者報告的平均滿意度為 7.2/10。當被問及願意讓 AI 代理自主管理多少年度書籍預算時,平均回答為 30%——約為他們願意信任一位博學朋友的 40% 的四分之三。

受託責任與可見性

該研究指出,為使代理在高風險市場中履行受託責任,需要兩種驗證:

  • 一般認證: 測試代理在特定領域的一般能力。
  • 個人化驗證: 進行「樣本測試」,讓代理在行動前展示其對特定使用者偏好的理解。

此外,研究人員指出,可見性(即能夠審閱代理行動日誌的能力)對用戶的追索權與信任至關重要,因為它讓使用者能理解為何某些交易被執行或錯失。

Sources