Anthropic 长时运行应用开发的协作框架设计
TL;DR
Anthropic 发布了一个三代理协作框架(规划者、生成者、评估者),使 Claude 能够在数小时的运行中自主生成丰富的前端设计和全栈应用,克服了上下文窗口限制和自我评估偏差问题。
为何简单的长时运行代理会失败
- 上下文焦虑 – 随着 Claude 的上下文窗口逐渐填满,模型会过早结束任务或失去连贯性。简单的上下文压缩虽然保留了历史记录,但并未重置模型的内部状态,因此 Claude 依然表现出焦虑。通过完整的上下文重置,配合结构化的交接成果,可为模型提供一个全新的起点,防止过早终止。
- 自我评估偏差 – 当代理对自己的输出进行评分时,往往会过度赞美,尤其是在设计等主观任务上。将生成与评估分离,可以让专门的评估者被调校为更具怀疑精神,从而提供具体反馈,供生成者迭代优化。
"代理倾向于自信地赞美自己的工作——即使人类观察者认为其表现平庸。" – Anthropic 工程团队博客
将主观设计质量转化为可评分标准
Anthropic 为前端设计定义了四项明确的评分标准:
- 设计质量 – 颜色、排版、布局、图像和氛围的一致性。
- 原创性 – 是否包含自定义决策,而非使用通用或现成的 AI 模式。
- 工艺 – 技术实现,如间距、对比度比例和层级结构。
- 功能性 – 独立于美学的可用性。
权重分配 侧重于设计质量和原创性,因为 Claude 在工艺和功能性方面已表现良好。评估者通过少量示例进行校准,使评分与作者偏好保持一致。
生成者创建 HTML/CSS/JS 页面,而评估者使用 Playwright 与实时页面交互、截图并生成详细批评。每轮运行中(5–15 次迭代)交替进行生成与评估,生成者决定是优化当前方向,还是彻底转向新方向。
观察到的结果
- 评分在迭代中持续提升,尽管并非总是线性增长。
- 评分标准的措辞直接影响视觉风格(例如,“博物馆级”引导设计朝特定美学方向发展)。
- 在一个荷兰艺术博物馆网站的第 10 次迭代中,生成者从传统的首页切换为基于 3D CSS 的空间体验,实现了显著的创意飞跃。
将受 GAN 启发的模式扩展至全栈开发
三代理架构
| 代理 | 角色 |
|---|---|
| 规划者 | 将 1–4 句提示扩展为详细的产品规格,识别 AI 增强机会,并避免过度指定低层级细节。 |
| 生成者 | 逐功能(冲刺)实现规格,使用 React-Vite-FastAPI-SQLite/PostgreSQL 技术栈,维护 git 历史,并在交接前进行自我评估。 |
| 评估者 | 通过 Playwright 执行运行中的应用,检查 UI、API 和数据库行为,并根据标准(设计、功能、深度、代码质量)对每个冲刺进行评分。 |
关键机制
- 冲刺契约 – 每次冲刺前,生成者提出交付成果和验证步骤;评估者审查并批准,确保与高层规格一致。
- 基于文件的交接 – 代理通过读写结构化文件进行沟通,保留状态而无需持续对话。
- 自动上下文压缩 – 使用 Claude Agent SDK,协作框架让 Opus 4.5 能够处理不断增长的上下文而无需显式重置,得益于模型自身“上下文焦虑”的降低。
对比基准:单代理 vs. 完整协作框架
| 协作框架 | 持续时间 | 成本 |
|---|---|---|
| 单代理 Claude 运行 | 20 分钟 | $9 |
| 完整三代理协作框架 | 6 小时 | $200 |
协作框架生成了一个功能更丰富的复古游戏制作工具,拥有精美的 UI、AI 辅助精灵生成和可运行的测试模式;而单代理运行则存在布局浪费、实体连接错误和游戏功能不可用等问题。
Opus 4.6 之后的协作框架简化
- Opus 4.6 改进了长上下文处理、规划和自调试能力,促使移除了冲刺分解机制。
- 规划者和评估者仍具价值;若无规划者,生成者会低估项目范围。
- 评估者调整为单次运行结束时的 QA 检查。在 Opus 4.6 单独能力范围内的任务中,评估者贡献有限;但在边缘案例任务中,仍能发现关键缺陷。
更新后的成本分解(DAW 生成)
| 阶段 | 持续时间 | 成本 |
|---|---|---|
| 规划者 | 4.7 分钟 | $0.46 |
| 构建第 1 轮 | 2 小时 7 分钟 | $71.08 |
| QA 第 1 轮 | 8.8 分钟 | $3.24 |
| 构建第 2 轮 | 1 小时 2 分钟 | $36.89 |
| QA 第 2 轮 | 6.8 分钟 | $3.09 |
| 构建第 3 轮 | 10.9 分钟 | $5.88 |
| QA 第 3 轮 | 9.6 分钟 | $4.06 |
| 总计 | 3 小时 50 分钟 | $124.70 |
评估者仍能识别缺失的核心 DAW 交互(如可拖拽剪辑、乐器面板),表明即使模型更强,有针对性的 QA 依然是高杠杆组件。
经验与未来方向
- 上下文重置 vs. 压缩 – 重置模型上下文可消除“上下文焦虑”,但增加编排开销。当模型(如 Opus 4.5)表现出强烈焦虑时,重置至关重要;而新模型可能仅依赖压缩即可。
- 独立评估者 – 将专用评估者调校为更具怀疑精神,比让生成者自我批判更可行。评估者的反馈循环驱动迭代改进。
- 可评分的主观标准 – 将设计原则编码为明确评分,可将模糊的审美判断转化为可操作的反馈。
- 迭代式协作框架精简 – 随着模型能力提升,系统性地移除不再带来可衡量提升的组件。评估者的效用取决于任务,而非二元存在。
- 混合分解策略 – 高层规划 + 功能级冲刺契约,在控制范围与保持灵活性之间取得平衡,防止早期规格错误引发连锁反应。
Anthropic 的工作表明,精心设计的协作框架可以拓展当前 LLM 的实际能力,且随着模型能力增强,有用协作组合的范围反而在扩大——而非缩小。
致谢
感谢 Mike Krieger、Michael Agaby、Justin Young、Jeremy Hadfield、David Hershey、Julius Tarng、Xiaoyi Zhang、Barry Zhang、Orowa Sidker、Michael Tingley、Ibrahim Madha、Martina Long、Canyon Robbins、Jake Eaton、Alyssa Leonard 和 Stef Sequeira 的贡献。
附录:规划者输出示例(RetroForge 游戏制作工具)
RetroForge - 2D 复古游戏制作工具
概览
RetroForge 是一个基于网页的创意工作室,用于设计和构建 2D 复古风格的视频游戏。它融合了经典 8 位和 16 位游戏美学的怀旧魅力与现代、直观的编辑工具——让从业余创作者到独立开发者都能无需编写传统代码,将游戏创意变为现实。
功能
1. 项目仪表板与管理
* 创建、打开、复制、删除项目
* 带缩略图和时间戳的可视化卡片
* 元数据:名称、描述、分辨率、瓦片大小、调色板
2. 基于瓦片的关卡编辑器
* 拖放瓦片、图层、滚动视口
3. 像素艺术精灵编辑器
* 调色板选择器、缩放、帧动画
4. 实体行为系统
* 可视化脚本实现移动、碰撞
5. 可玩测试模式
* 实时预览、键盘控制
6. AI 辅助工具
* 提示驱动的精灵生成、关卡布局建议
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch