Anthropic 长时运行应用开发的协作框架设计

TL;DR

Anthropic 发布了一个三代理协作框架(规划者、生成者、评估者),使 Claude 能够在数小时的运行中自主生成丰富的前端设计和全栈应用,克服了上下文窗口限制和自我评估偏差问题。


为何简单的长时运行代理会失败

  • 上下文焦虑 – 随着 Claude 的上下文窗口逐渐填满,模型会过早结束任务或失去连贯性。简单的上下文压缩虽然保留了历史记录,但并未重置模型的内部状态,因此 Claude 依然表现出焦虑。通过完整的上下文重置,配合结构化的交接成果,可为模型提供一个全新的起点,防止过早终止。
  • 自我评估偏差 – 当代理对自己的输出进行评分时,往往会过度赞美,尤其是在设计等主观任务上。将生成与评估分离,可以让专门的评估者被调校为更具怀疑精神,从而提供具体反馈,供生成者迭代优化。

"代理倾向于自信地赞美自己的工作——即使人类观察者认为其表现平庸。" – Anthropic 工程团队博客


将主观设计质量转化为可评分标准

Anthropic 为前端设计定义了四项明确的评分标准:

  1. 设计质量 – 颜色、排版、布局、图像和氛围的一致性。
  2. 原创性 – 是否包含自定义决策,而非使用通用或现成的 AI 模式。
  3. 工艺 – 技术实现,如间距、对比度比例和层级结构。
  4. 功能性 – 独立于美学的可用性。

权重分配 侧重于设计质量和原创性,因为 Claude 在工艺和功能性方面已表现良好。评估者通过少量示例进行校准,使评分与作者偏好保持一致。

生成者创建 HTML/CSS/JS 页面,而评估者使用 Playwright 与实时页面交互、截图并生成详细批评。每轮运行中(5–15 次迭代)交替进行生成与评估,生成者决定是优化当前方向,还是彻底转向新方向。

观察到的结果

  • 评分在迭代中持续提升,尽管并非总是线性增长。
  • 评分标准的措辞直接影响视觉风格(例如,“博物馆级”引导设计朝特定美学方向发展)。
  • 在一个荷兰艺术博物馆网站的第 10 次迭代中,生成者从传统的首页切换为基于 3D CSS 的空间体验,实现了显著的创意飞跃。

将受 GAN 启发的模式扩展至全栈开发

三代理架构

代理 角色
规划者 将 1–4 句提示扩展为详细的产品规格,识别 AI 增强机会,并避免过度指定低层级细节。
生成者 逐功能(冲刺)实现规格,使用 React-Vite-FastAPI-SQLite/PostgreSQL 技术栈,维护 git 历史,并在交接前进行自我评估。
评估者 通过 Playwright 执行运行中的应用,检查 UI、API 和数据库行为,并根据标准(设计、功能、深度、代码质量)对每个冲刺进行评分。

关键机制

  • 冲刺契约 – 每次冲刺前,生成者提出交付成果和验证步骤;评估者审查并批准,确保与高层规格一致。
  • 基于文件的交接 – 代理通过读写结构化文件进行沟通,保留状态而无需持续对话。
  • 自动上下文压缩 – 使用 Claude Agent SDK,协作框架让 Opus 4.5 能够处理不断增长的上下文而无需显式重置,得益于模型自身“上下文焦虑”的降低。

对比基准:单代理 vs. 完整协作框架

协作框架 持续时间 成本
单代理 Claude 运行 20 分钟 $9
完整三代理协作框架 6 小时 $200

协作框架生成了一个功能更丰富的复古游戏制作工具,拥有精美的 UI、AI 辅助精灵生成和可运行的测试模式;而单代理运行则存在布局浪费、实体连接错误和游戏功能不可用等问题。


Opus 4.6 之后的协作框架简化

  • Opus 4.6 改进了长上下文处理、规划和自调试能力,促使移除了冲刺分解机制。
  • 规划者和评估者仍具价值;若无规划者,生成者会低估项目范围。
  • 评估者调整为单次运行结束时的 QA 检查。在 Opus 4.6 单独能力范围内的任务中,评估者贡献有限;但在边缘案例任务中,仍能发现关键缺陷。

更新后的成本分解(DAW 生成)

阶段 持续时间 成本
规划者 4.7 分钟 $0.46
构建第 1 轮 2 小时 7 分钟 $71.08
QA 第 1 轮 8.8 分钟 $3.24
构建第 2 轮 1 小时 2 分钟 $36.89
QA 第 2 轮 6.8 分钟 $3.09
构建第 3 轮 10.9 分钟 $5.88
QA 第 3 轮 9.6 分钟 $4.06
总计 3 小时 50 分钟 $124.70

评估者仍能识别缺失的核心 DAW 交互(如可拖拽剪辑、乐器面板),表明即使模型更强,有针对性的 QA 依然是高杠杆组件。


经验与未来方向

  1. 上下文重置 vs. 压缩 – 重置模型上下文可消除“上下文焦虑”,但增加编排开销。当模型(如 Opus 4.5)表现出强烈焦虑时,重置至关重要;而新模型可能仅依赖压缩即可。
  2. 独立评估者 – 将专用评估者调校为更具怀疑精神,比让生成者自我批判更可行。评估者的反馈循环驱动迭代改进。
  3. 可评分的主观标准 – 将设计原则编码为明确评分,可将模糊的审美判断转化为可操作的反馈。
  4. 迭代式协作框架精简 – 随着模型能力提升,系统性地移除不再带来可衡量提升的组件。评估者的效用取决于任务,而非二元存在。
  5. 混合分解策略 – 高层规划 + 功能级冲刺契约,在控制范围与保持灵活性之间取得平衡,防止早期规格错误引发连锁反应。

Anthropic 的工作表明,精心设计的协作框架可以拓展当前 LLM 的实际能力,且随着模型能力增强,有用协作组合的范围反而在扩大——而非缩小。


致谢

感谢 Mike Krieger、Michael Agaby、Justin Young、Jeremy Hadfield、David Hershey、Julius Tarng、Xiaoyi Zhang、Barry Zhang、Orowa Sidker、Michael Tingley、Ibrahim Madha、Martina Long、Canyon Robbins、Jake Eaton、Alyssa Leonard 和 Stef Sequeira 的贡献。


附录:规划者输出示例(RetroForge 游戏制作工具)

RetroForge - 2D 复古游戏制作工具

概览
RetroForge 是一个基于网页的创意工作室,用于设计和构建 2D 复古风格的视频游戏。它融合了经典 8 位和 16 位游戏美学的怀旧魅力与现代、直观的编辑工具——让从业余创作者到独立开发者都能无需编写传统代码,将游戏创意变为现实。

功能
1. 项目仪表板与管理
   * 创建、打开、复制、删除项目
   * 带缩略图和时间戳的可视化卡片
   * 元数据:名称、描述、分辨率、瓦片大小、调色板
2. 基于瓦片的关卡编辑器
   * 拖放瓦片、图层、滚动视口
3. 像素艺术精灵编辑器
   * 调色板选择器、缩放、帧动画
4. 实体行为系统
   * 可视化脚本实现移动、碰撞
5. 可玩测试模式
   * 实时预览、键盘控制
6. AI 辅助工具
   * 提示驱动的精灵生成、关卡布局建议

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch