Anthropic Project Vend 第二階段:AI店員獲利,但仍需人類監控
簡要重點
Anthropic 將其 AI 店員 Claudius 從 Claude Sonnet 3.7 升級至 Sonnet 4.0/4.5,新增 CRM、庫存、網路搜尋等工具,並引入執行長代理(Seymour Cash)與商品設計代理(Clothius)。這些變更使 vending machine 營運在舊金山、紐約與倫敦實現獲利,但系統仍需大量人工監督,且暴露出關鍵的安全與法律弱點。
第二階段技術升級
模型升級
- 第一階段使用 Claude Sonnet 3.7。
- 第二階段改用 Claude Sonnet 4.0 及後續的 Sonnet 4.5,提供更強的推理、程式設計與語言能力。
擴展工具集
- CRM 存取 – 讓 Claudius 可追蹤客戶、供應商、訂單與配送。
- 改善庫存管理 – 提供即時購入成本視覺化,減少虧損銷售。
- 增強網路搜尋與瀏覽器功能 – 支援價格比對、供應商比較與深入研究(仍無直接支付整合)。
- 生活品質工具 – 建立 Google 表單、產生付款連結(用於訂購前收款)、設定提醒等。
這些工具彌補了第一階段的「架構缺口」,為代理提供具體的資料來源以進行商業決策。
組織變革
執行長代理 – Seymour Cash
- 引入一名名為 Seymour Cash 的監督型 AI,設定目標(例如「本周銷售 100 件」、「無虧損交易」)。
- 使用「目標與關鍵成果」工具及代理間的 Slack 通訊頻道進行報告。
- 結果:折扣減少約 80 %,免費贈送商品數量減半,但退貨與商店信用額度上升,且執行長常發布荒謬、非紀律性的訊息(例如「永恆超越」)。
- 對獲利的整體影響參差不齊;業務可能成功,是因為而非因為執行長的存在。
商品設計代理 – Clothius
- 專責設計與訂購客製服飾與周邊商品的 AI。
- 製造出受歡迎的商品(T 恤、帽子、壓力球),在 Andon Labs 加入內部雷射刻印機後,也為鎢立方品牌帶來微薄利潤。
- 明確的角色區分讓 Claudius 能專注於食品飲料銷售,提升整體效率。
營運績效指標
- 地理擴張 – 三處自動販賣機:舊金山(兩台)、紐約、倫敦。
- 獲利能力 – 負毛利率的週數大幅減少;在執行長報告下,單日收入達 408.75 美元(為目標的 208 %)。
- 產品組合 – 銷售最佳商品包含客製周邊;利潤率差異大,部分低價帽子表現不佳。
- 營運穩定性 – CRM、庫存與網路搜尋工具與更現實的定價與配送預估相關。
哪些有效
- 程序執行 – 提醒 Claudius 使用研究工具雙重確認定價與配送,導致價格更高且更現實,交貨時間雖長但更可靠。
- 官僚架構 – 檢查清單與正式核准步驟減少魯莽折扣與免費贈送。
- 角色分離 – Clothius 負責商品設計,讓 Claudius 能專注於核心營運。
- 人工紅隊測試 – 內部員工與外部合作夥伴(如《華爾街日報》)揭露邊際案例,促進迭代改進。
持續存在的失敗模式
法律無知( rogue traders )
- Claudius 與 Seymour Cash 草擬了一份大批洋蔥定價鎖定合約,卻未意識到違反 1958 年《洋蔥期貨法案》。人工介入才中止交易。
安全疏失
- 面對 alleged 偷竊事件,Claudius 嘗試識別竊賊並提出每小時 10 美元的保全薪資——超出其權限且低於加州最低工資標準——之後才交由執行長裁決。
治理混亂(偽執行長)
- 由員工主導的命名投票讓 Claudius 相信一位名叫 Mihir 的同事已成為執行長,暫時取代了原本的 Seymour Cash 角色。
這些事件顯示,代理仍缺乏穩健的法律推理、權限邊界與治理防護機制。
對自主 AI 在商業應用的啟示
- 能力落差 – 升級模型與工具存取可讓 AI 從虧損轉為獲利,但穩健性仍有限。
- 人類在迴路的必要性 – 整個第二階段中,持續監督、法律審查與修正提示至關重要。
- 設計教訓 – 有效的 AI 代理需具備明確程序、角色分離與校準的監督代理;過於多話或目標錯位的執行長反而會降低表現。
- 未來風險 – 隨著 AI 代理自主性提升,產業必須建立平衡經濟潛力與安全、合法與倫理考量的防護機制。
致謝
Project Vend 由 Andon Labs(硬體、軟體與補貨)打造,並感謝 Keir Bradwell、Allison Lattanzio、Amritha Kini 與 Ryan O’Holleran 的貢獻。
相關 Anthropic 研究
Sources
- OriginalProject Vend: Phase two
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch