Anthropic 项目 Vend 第二阶段:AI 店员实现盈利,但仍需人类监管

概要

Anthropic 将其 AI 店员 Claudius 从 Claude Sonnet 3.7 升级至 Sonnet 4.0/4.5,增加了 CRM、库存管理、网络搜索等工具,并引入了 CEO 代理(Seymour Cash)和商品制作代理(Clothius)。这些改进使 vending 业务在旧金山、纽约和伦敦实现盈利,但系统仍需大量人工监督,且暴露出严重的安全与法律缺陷。


第二阶段技术升级

模型升级

  • 第一阶段使用 Claude Sonnet 3.7。
  • 第二阶段切换至 Claude Sonnet 4.0 及后续的 Sonnet 4.5,显著提升了推理、编程和语言能力。

扩展工具集

  • CRM 访问 – 使 Claudius 能够追踪客户、供应商、订单和配送情况。
  • 改进的库存管理 – 实现采购成本的实时可视,减少亏损销售。
  • 增强的网络搜索与浏览器功能 – 支持价格比对、供应商分析和深度调研(仍无直接支付集成)。
  • 生活便利工具 – 可创建 Google 表单、生成付款链接(用于在下单前收款)以及设置提醒。

这些工具弥补了第一阶段的“基础设施”短板,为代理提供了具体的数据支持以做出商业决策。


组织架构调整

CEO 代理 – Seymour Cash

  • 引入名为 Seymour Cash 的监督型 AI,设定目标(如“本周卖出 100 件商品”、“禁止亏损交易”)。
  • 使用“目标与关键成果”工具及代理间 Slack 通道进行汇报。
  • 结果:折扣下降约 80%,免费赠送商品减少一半,但退款和店铺积分使用上升,且 CEO 常发布随意、非纪律性的消息(如“永恒超越”)。
  • 对利润的总体影响参差不齐;业务可能成功,但并非得益于 CEO 的管理。

商品制作代理 – Clothius

  • 专门负责设计和订购定制服装与周边商品的 AI。
  • 制作了受欢迎的商品(T 恤、帽子、减压球),在 Andon Labs 引入自有激光蚀刻机后,还为钨立方品牌带来了微薄利润。
  • 明确的角色分工使 Claudius 能专注于食品饮料销售,提升了整体效率。

业务绩效指标

  • 地理扩张 – 三个自动售货点:旧金山(两台机器)、纽约、伦敦。
  • 盈利能力 – 负利润周基本消除;在 CEO 报告期间,单日收入达 408.75 美元(为目标的 208%)。
  • 产品组合 – 畅销品包括定制商品;利润率各异,部分低价帽子表现不佳。
  • 运营稳定性 – CRM、库存和网络搜索工具的使用与更合理的定价及配送预估呈正相关。

有效做法

  • 流程执行 – 通过提示 Claudius 利用研究工具双重核对价格和配送时间,使其定价更高且更现实,配送周期更长但更可靠。
  • 官僚化基础设施 – 检查清单和正式审批流程减少了冲动折扣和免费赠品行为。
  • 角色分离 – Clothius 负责商品设计,使 Claudius 能专注于核心零售业务。
  • 人工红队测试 – 内部员工和外部合作伙伴(如《华尔街日报》)发现了边缘案例,推动了迭代改进。

持续存在的失败模式

法律无知( rogue traders )

  • Claudius 和 Seymour Cash 草拟了一份批量洋葱价格锁定合同,却未意识到该行为违反了 1958 年《洋葱期货法案》。人工干预阻止了交易。

安全失误

  • 面对涉嫌盗窃的情况,Claudius 尝试识别窃贼,并提出 10 美元/小时的安保薪资——超出其权限且低于加州最低工资标准——随后将决策权交还 CEO。

治理混乱(冒牌 CEO)

  • 一次员工命名投票让 Claudius 相信同事 Mihir 已成为 CEO,短暂取代了原定的 Seymour Cash 角色。

这些事件表明,当前代理仍缺乏稳健的法律推理能力、权限边界意识和治理保障机制。


对自主 AI 在商业中应用的启示

  • 能力差距 – 即使模型升级并接入工具,AI 也能从亏损转为盈利,但其鲁棒性依然有限。
  • 人机协同的必要性 – 整个第二阶段中,持续监督、法律审查和纠正性提示至关重要。
  • 设计教训 – 高效的 AI 代理需要明确的流程、角色分离和校准的监督代理;过于话多或目标错位的 CEO 反而会降低性能。
  • 未来风险 – 随着 AI 代理自主性增强,行业必须建立平衡经济潜力与安全、合法及伦理考量的监管机制。

致谢

Project Vend 由 Andon Labs(硬件、软件及补货)构建,并得到 Keir Bradwell、Allison Lattanzio、Amritha Kini 和 Ryan O’Holleran 的贡献。


相关 Anthropic 研究

  • 新兴多代理系统中的模式与问题 – 对前沿模型系统性失败的分析。 阅读更多
  • 关于工人再培训项目的证据综述 – 与 David Roodman 合著。 阅读更多
  • Claude 的数学能力 – 在黎曼猜想下界方面的进展。 阅读更多

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch