Raven:递归自我改进的“框架之框架”

Raven 声称能提供什么

Raven 将自己定位为“框架之框架”,能够为 AI 智能体实现递归自我改进(RSI)。 它在一个 Host Agent 下捆绑了四个内置智能体——Research、Code、Design 和 On-call——能够编排复杂、多步骤的工作流。该平台基于 EverOS 构建,提供跨会话的持久记忆,并包含一个 Curator 组件,可在轮次之间修改智能体的规划、能力、记忆和行动模块。

“Raven 是框架之框架,专为递归自我改进(RSI)而构建。” – Raven README

端到端项目展示

Raven 展示了三个不同项目的完整自主交付:

  1. THRESHOLD 游戏 – 一个在 Godot 4 中历时四天构建的第一人称射击游戏,涉及 42 个规划-开发-验证循环。交付物包括可玩游戏、海报、演示文稿和网站。
  2. Raven RSI 基准测试 – 一个自我改进的流水线,在七轮中运行了 172 次 nano-chat 预训练实验,在 20 分钟、单 GPU 预算内将验证 bits-per-byte(val_bpb)降低了 5.8%。它还执行了溃坝 CFD 模拟(误差从 1e0 降至 1.36e-10)以及八轮 FEA 极限载荷二分搜索。
  3. 产品发布套件 – 一个基于浏览器的物理迷你游戏、一个 16 页概览、双语海报和一份 README,全部由 Raven 生成。

每个展示都包含视频演示、网站链接和可下载的幻灯片,展示了 Raven 在无需人工干预的情况下,驱动一组专业智能体从简报走向最终交付物的能力。

内置智能体的基准测试性能

Raven 的四个核心智能体在特定领域的基准测试上进行了评估:

  • Raven-Research – 在 DeepResearch Mixed 基准测试中排名具有竞争力(准确率、token 使用量和成本)。
  • Raven-Code – 在 SWE-bench Pro、SWE-bench Verified、WorkBuddy-Code Reward 和 SWE-Refactor 上取得了最先进的分数。它还在 DataAgentBench(Pass@1 = 0.8762)上名列前茅,用于数据分析任务。
  • Raven-Design – 在 PresentBench 上领先幻灯片生成,并在 ArtifactsBench 视觉设计指标上得分很高。
  • Raven-Oncall – 在 AI4AI 和 AI4S 内部基准测试上优于 Claude Code,为无人值守工作流自动化提供更高质量和更低成本。

这些结果在仓库中以静态图像呈现;README 未提供原始数字或底层评估脚本的链接。

运行时自我进化架构

Raven 的智能体循环分为四个解耦的策略模块:

模块 作用
记忆 决定智能体每轮看到的信息。
规划 为当前迭代生成计划。
能力 选择智能体可以调用的工具或外部服务。
行动 执行所选操作并判断其结果。

Curator 可以为特定智能体重写这些模块中的任何一个,从而有效地改变智能体的提示、工具集、技能和判断代码。更改仅在通过验证检查后才会安装,失败的检查会将智能体回滚到之前的版本。Curator 作为实验性组件随仓库提供,而不是打包的二进制文件。

Persona 首先生成:用户描述所需的助手,Curator 组装一个主导角色以及从内置套件中抽取的专家子智能体。由此产生的框架定义了任务分工、工具访问和验证标准。

“只需描述一次你的需求。Raven 会组装助手,在你工作时不断改进它,之后只需一句话就能让它再次投入工作。”

第三方智能体的集成

Raven 可以通过三种机制编排外部智能体:

  • ACP(智能体通信协议)
  • CLI 包装器
  • OpenAI 兼容 API

包含 13 个第三方智能体的预设(例如 Claude Code、GitHub Copilot、Qwen Code),允许用户在单个工作流中混合内置和外部能力。

安装和使用

Raven 提供多种安装路径:

  • 一行脚本 适用于 Linux/macOS/WSL2:curl -fsSL https://raven.evermind.ai/install.sh | bash
  • PowerShell 脚本 适用于原生 Windows。
  • Docker compose 用于容器化部署。
  • 可编辑源码检出 用于开发(./install.sh)。

安装后,命令 raven web 会启动一个基于浏览器的 UI,用户可以在其中创建任务、监控子智能体、检查记忆和浏览技能。

Hacker News 上的社区反应

HN 讨论突出了几个主题:

  • 对星标数量的怀疑 – 用户质疑一个相对不知名的仓库如何积累了数千个 GitHub 星标。
  • 对“一个提示,一个结果”说法的批评 – 评论者认为,现实世界的产品开发需要迭代提示和引导,这可能限制完全自主框架的实用性。
  • 对 RSI 的澄清 – 一条评论指出,“RSI”代表 递归自我改进,而不是“重复性劳损”。
  • 与现有元框架的比较 – 用户提到了类似项目,如 Omnigent、Paseo 和 DeepSeek Harness,并要求进行比较基准测试。
  • 性能担忧 – 一些人指出编码基准测试的改进有限(例如,SWE-bench Verified 上提高了 0.8%),并质疑 token 效率。
  • 积极印象 – 少数评论者称赞了 README 的视觉设计和令人印象深刻的 THRESHOLD 展示。

总体而言,该讨论反映了对自我进化多智能体平台概念的热情,以及对完全自主 AI 项目交付炒作的谨慎态度。

核心系统总结

系统 功能
智能体编排 管理基于 DAG 的任务依赖和并行执行。
Evolver 诊断失败,测试候选框架更改,并采用优于基线的改进。
EverOS 记忆 提供跨会话的长期、Markdown 原生记忆。
SkillForge 从 SkillCorpus 检索超过 114k 个精选技能,用于按需专业知识。
主动性 监控事件并调度操作以预测用户需求。

许可和引用

Raven 在 Apache 2.0 许可下发布。用户在学术工作中使用 Raven 时,被要求引用技术报告(v1,2026 年 9 月)。


本文综合了 Raven GitHub 仓库和上述 Hacker News 讨论线程中公开可用的信息。未引入额外数据或未公开的细节。

Sources

相关

  • 项目
  • 项目
  • 项目
  • 项目