Raven:递归自我改进的“框架之框架”
Raven 声称能提供什么
Raven 将自己定位为“框架之框架”,能够为 AI 智能体实现递归自我改进(RSI)。 它在一个 Host Agent 下捆绑了四个内置智能体——Research、Code、Design 和 On-call——能够编排复杂、多步骤的工作流。该平台基于 EverOS 构建,提供跨会话的持久记忆,并包含一个 Curator 组件,可在轮次之间修改智能体的规划、能力、记忆和行动模块。
“Raven 是框架之框架,专为递归自我改进(RSI)而构建。” – Raven README
端到端项目展示
Raven 展示了三个不同项目的完整自主交付:
- THRESHOLD 游戏 – 一个在 Godot 4 中历时四天构建的第一人称射击游戏,涉及 42 个规划-开发-验证循环。交付物包括可玩游戏、海报、演示文稿和网站。
- Raven RSI 基准测试 – 一个自我改进的流水线,在七轮中运行了 172 次 nano-chat 预训练实验,在 20 分钟、单 GPU 预算内将验证 bits-per-byte(
val_bpb)降低了 5.8%。它还执行了溃坝 CFD 模拟(误差从 1e0 降至 1.36e-10)以及八轮 FEA 极限载荷二分搜索。 - 产品发布套件 – 一个基于浏览器的物理迷你游戏、一个 16 页概览、双语海报和一份 README,全部由 Raven 生成。
每个展示都包含视频演示、网站链接和可下载的幻灯片,展示了 Raven 在无需人工干预的情况下,驱动一组专业智能体从简报走向最终交付物的能力。
内置智能体的基准测试性能
Raven 的四个核心智能体在特定领域的基准测试上进行了评估:
- Raven-Research – 在 DeepResearch Mixed 基准测试中排名具有竞争力(准确率、token 使用量和成本)。
- Raven-Code – 在 SWE-bench Pro、SWE-bench Verified、WorkBuddy-Code Reward 和 SWE-Refactor 上取得了最先进的分数。它还在 DataAgentBench(Pass@1 = 0.8762)上名列前茅,用于数据分析任务。
- Raven-Design – 在 PresentBench 上领先幻灯片生成,并在 ArtifactsBench 视觉设计指标上得分很高。
- Raven-Oncall – 在 AI4AI 和 AI4S 内部基准测试上优于 Claude Code,为无人值守工作流自动化提供更高质量和更低成本。
这些结果在仓库中以静态图像呈现;README 未提供原始数字或底层评估脚本的链接。
运行时自我进化架构
Raven 的智能体循环分为四个解耦的策略模块:
| 模块 | 作用 |
|---|---|
| 记忆 | 决定智能体每轮看到的信息。 |
| 规划 | 为当前迭代生成计划。 |
| 能力 | 选择智能体可以调用的工具或外部服务。 |
| 行动 | 执行所选操作并判断其结果。 |
Curator 可以为特定智能体重写这些模块中的任何一个,从而有效地改变智能体的提示、工具集、技能和判断代码。更改仅在通过验证检查后才会安装,失败的检查会将智能体回滚到之前的版本。Curator 作为实验性组件随仓库提供,而不是打包的二进制文件。
Persona 首先生成:用户描述所需的助手,Curator 组装一个主导角色以及从内置套件中抽取的专家子智能体。由此产生的框架定义了任务分工、工具访问和验证标准。
“只需描述一次你的需求。Raven 会组装助手,在你工作时不断改进它,之后只需一句话就能让它再次投入工作。”
第三方智能体的集成
Raven 可以通过三种机制编排外部智能体:
- ACP(智能体通信协议)
- CLI 包装器
- OpenAI 兼容 API
包含 13 个第三方智能体的预设(例如 Claude Code、GitHub Copilot、Qwen Code),允许用户在单个工作流中混合内置和外部能力。
安装和使用
Raven 提供多种安装路径:
- 一行脚本 适用于 Linux/macOS/WSL2:
curl -fsSL https://raven.evermind.ai/install.sh | bash - PowerShell 脚本 适用于原生 Windows。
- Docker compose 用于容器化部署。
- 可编辑源码检出 用于开发(
./install.sh)。
安装后,命令 raven web 会启动一个基于浏览器的 UI,用户可以在其中创建任务、监控子智能体、检查记忆和浏览技能。
Hacker News 上的社区反应
HN 讨论突出了几个主题:
- 对星标数量的怀疑 – 用户质疑一个相对不知名的仓库如何积累了数千个 GitHub 星标。
- 对“一个提示,一个结果”说法的批评 – 评论者认为,现实世界的产品开发需要迭代提示和引导,这可能限制完全自主框架的实用性。
- 对 RSI 的澄清 – 一条评论指出,“RSI”代表 递归自我改进,而不是“重复性劳损”。
- 与现有元框架的比较 – 用户提到了类似项目,如 Omnigent、Paseo 和 DeepSeek Harness,并要求进行比较基准测试。
- 性能担忧 – 一些人指出编码基准测试的改进有限(例如,SWE-bench Verified 上提高了 0.8%),并质疑 token 效率。
- 积极印象 – 少数评论者称赞了 README 的视觉设计和令人印象深刻的 THRESHOLD 展示。
总体而言,该讨论反映了对自我进化多智能体平台概念的热情,以及对完全自主 AI 项目交付炒作的谨慎态度。
核心系统总结
| 系统 | 功能 |
|---|---|
| 智能体编排 | 管理基于 DAG 的任务依赖和并行执行。 |
| Evolver | 诊断失败,测试候选框架更改,并采用优于基线的改进。 |
| EverOS 记忆 | 提供跨会话的长期、Markdown 原生记忆。 |
| SkillForge | 从 SkillCorpus 检索超过 114k 个精选技能,用于按需专业知识。 |
| 主动性 | 监控事件并调度操作以预测用户需求。 |
许可和引用
Raven 在 Apache 2.0 许可下发布。用户在学术工作中使用 Raven 时,被要求引用技术报告(v1,2026 年 9 月)。
本文综合了 Raven GitHub 仓库和上述 Hacker News 讨论线程中公开可用的信息。未引入额外数据或未公开的细节。
Sources
相关
- 项目
- 项目
- 项目
- 项目