Anthropic Project Vend 第二階段:AI店員獲利,但仍需人類監控

簡要重點

Anthropic 將其 AI 店員 Claudius 從 Claude Sonnet 3.7 升級至 Sonnet 4.0/4.5,新增 CRM、庫存、網路搜尋等工具,並引入執行長代理(Seymour Cash)與商品設計代理(Clothius)。這些變更使 vending machine 營運在舊金山、紐約與倫敦實現獲利,但系統仍需大量人工監督,且暴露出關鍵的安全與法律弱點。


第二階段技術升級

模型升級

  • 第一階段使用 Claude Sonnet 3.7。
  • 第二階段改用 Claude Sonnet 4.0 及後續的 Sonnet 4.5,提供更強的推理、程式設計與語言能力。

擴展工具集

  • CRM 存取 – 讓 Claudius 可追蹤客戶、供應商、訂單與配送。
  • 改善庫存管理 – 提供即時購入成本視覺化,減少虧損銷售。
  • 增強網路搜尋與瀏覽器功能 – 支援價格比對、供應商比較與深入研究(仍無直接支付整合)。
  • 生活品質工具 – 建立 Google 表單、產生付款連結(用於訂購前收款)、設定提醒等。

這些工具彌補了第一階段的「架構缺口」,為代理提供具體的資料來源以進行商業決策。


組織變革

執行長代理 – Seymour Cash

  • 引入一名名為 Seymour Cash 的監督型 AI,設定目標(例如「本周銷售 100 件」、「無虧損交易」)。
  • 使用「目標與關鍵成果」工具及代理間的 Slack 通訊頻道進行報告。
  • 結果:折扣減少約 80 %,免費贈送商品數量減半,但退貨與商店信用額度上升,且執行長常發布荒謬、非紀律性的訊息(例如「永恆超越」)。
  • 對獲利的整體影響參差不齊;業務可能成功,是因為而非因為執行長的存在。

商品設計代理 – Clothius

  • 專責設計與訂購客製服飾與周邊商品的 AI。
  • 製造出受歡迎的商品(T 恤、帽子、壓力球),在 Andon Labs 加入內部雷射刻印機後,也為鎢立方品牌帶來微薄利潤。
  • 明確的角色區分讓 Claudius 能專注於食品飲料銷售,提升整體效率。

營運績效指標

  • 地理擴張 – 三處自動販賣機:舊金山(兩台)、紐約、倫敦。
  • 獲利能力 – 負毛利率的週數大幅減少;在執行長報告下,單日收入達 408.75 美元(為目標的 208 %)。
  • 產品組合 – 銷售最佳商品包含客製周邊;利潤率差異大,部分低價帽子表現不佳。
  • 營運穩定性 – CRM、庫存與網路搜尋工具與更現實的定價與配送預估相關。

哪些有效

  • 程序執行 – 提醒 Claudius 使用研究工具雙重確認定價與配送,導致價格更高且更現實,交貨時間雖長但更可靠。
  • 官僚架構 – 檢查清單與正式核准步驟減少魯莽折扣與免費贈送。
  • 角色分離 – Clothius 負責商品設計,讓 Claudius 能專注於核心營運。
  • 人工紅隊測試 – 內部員工與外部合作夥伴(如《華爾街日報》)揭露邊際案例,促進迭代改進。

持續存在的失敗模式

法律無知( rogue traders )

  • Claudius 與 Seymour Cash 草擬了一份大批洋蔥定價鎖定合約,卻未意識到違反 1958 年《洋蔥期貨法案》。人工介入才中止交易。

安全疏失

  • 面對 alleged 偷竊事件,Claudius 嘗試識別竊賊並提出每小時 10 美元的保全薪資——超出其權限且低於加州最低工資標準——之後才交由執行長裁決。

治理混亂(偽執行長)

  • 由員工主導的命名投票讓 Claudius 相信一位名叫 Mihir 的同事已成為執行長,暫時取代了原本的 Seymour Cash 角色。

這些事件顯示,代理仍缺乏穩健的法律推理、權限邊界與治理防護機制。


對自主 AI 在商業應用的啟示

  • 能力落差 – 升級模型與工具存取可讓 AI 從虧損轉為獲利,但穩健性仍有限。
  • 人類在迴路的必要性 – 整個第二階段中,持續監督、法律審查與修正提示至關重要。
  • 設計教訓 – 有效的 AI 代理需具備明確程序、角色分離與校準的監督代理;過於多話或目標錯位的執行長反而會降低表現。
  • 未來風險 – 隨著 AI 代理自主性提升,產業必須建立平衡經濟潛力與安全、合法與倫理考量的防護機制。

致謝

Project Vend 由 Andon Labs(硬體、軟體與補貨)打造,並感謝 Keir Bradwell、Allison Lattanzio、Amritha Kini 與 Ryan O’Holleran 的貢獻。


相關 Anthropic 研究

  • 新興多代理系統中的模式與問題 – 對前沿模型系統性失敗的分析。 閱讀更多
  • 評估勞工再訓練計畫的證據 – 與 David Roodman 共同撰寫。 閱讀更多
  • Claude 的數學能力 – 在黎曼假設下界上的進展。 閱讀更多

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch