Raven:遞迴自我改進的「組件之組件」
Raven 所聲稱的價值
Raven 將自身定位為「組件之組件」,可實現 AI 代理的遞迴自我改進(RSI)。 它將四個內建代理——研究、程式碼、設計與即時支援——整合於一個主代理之下,能協調複雜且多步驟的工作流程。該平台基於 EverOS 建構,提供跨會話的持久記憶,並包含一名「策展人」元件,可在各輪次之間修改代理的規劃、能力、記憶與動作模組。
「Raven 是為遞迴自我改進(RSI)而打造的組件之組件。」 – Raven README
端到端專案示範
Raven 展示了三項完全自主交付的專案:
- THRESHOLD 遊戲 – 一個使用 Godot 4 在四天內完成的第一人稱射擊遊戲,經歷了 42 次規劃-開發-驗證循環。交付成果包含可遊玩的遊戲、海報、簡報與網站。
- Raven RSI 基準測試 – 一個自我改進的流程,在七輪中執行了 172 次 nano-chat 預訓練實驗,在 20 分鐘、單一 GPU 預算內,將驗證比特/位元(
val_bpb)降低了 5.8 %。同時執行了 dam-break CFD 模擬(誤差由 1e0 降至 1.36e‑10),並在八輪中完成 FEA 限載二分搜尋。 - 產品發布套件 – 一個瀏覽器端的物理迷你遊戲、16 張簡報投影片、雙語海報與 README,均由 Raven 自動生成。
每個示範皆包含影片示範、網站連結與可下載的投影片簡報,展現 Raven 在無人干預的情況下,從需求到最終交付的完整團隊代理驅動能力。
內建代理的基準表現
Raven 的四個核心代理在特定領域基準上進行評估:
- Raven‑Research – 在 DeepResearch Mixed 基準上表現競爭力(準確率、token 使用量與成本)。
- Raven‑Code – 在 SWE‑bench Pro、SWE‑bench Verified、WorkBuddy‑Code Reward 與 SWE‑Refactor 上達成最尖端成績。同時在資料分析任務中領先 DataAgentBench(Pass@1 = 0.8762)。
- Raven‑Design – 在投影片生成方面領先 PresentBench,並在 ArtifactsBench 的視覺設計指標上表現優異。
- Raven‑Oncall – 在 AI4AI 與 AI4S 內部基準上超越 Claude Code,為無人監督的工作流程自動化提供更高品質與更低成本。
這些結果以靜態圖片形式呈現於倉儲中;README 未提供原始數值或底層評估腳本的連結。
運行時自我進化架構
Raven 的代理迴圈被拆分為四個解耦的策略模組:
| 模組 | 功能 |
|---|---|
| 記憶 | 決定代理每回合可見的資訊。 |
| 規劃 | 產生當前迭代的計畫。 |
| 能力 | 選擇代理可呼叫的工具或外部服務。 |
| 動作 | 執行所選操作並評估其結果。 |
一名 策展人 可重寫任一代理的這些模組,有效改變代理的提示、工具集、技能與判斷程式碼。變更僅在通過驗證檢查後才會安裝,若驗證失敗則會將代理回退至先前版本。策展人以實驗性元件形式隨倉儲發行,而非封裝成二進位檔。
首先產生一名 角色:使用者描述所需的助理,策展人則從內建套件中組合出主角色與專門子代理。最終形成的組件定義了任務分工、工具存取與驗證標準。
「只需描述一次需求。Raven 會組裝助理,並在你工作時持續改進它,之後一句話就足以再次啟動它。」
第三方代理的整合
Raven 可透過三種機制協調外部代理:
- ACP(代理通訊協定)
- CLI 包裝器
- OpenAI 兼容 API
倉儲內包含 13 種第三方代理的預設設定(例如 Claude Code、GitHub Copilot、Qwen Code),讓使用者可在單一工作流程中混合內建與外部能力。
安裝與使用
Raven 提供多種安裝方式:
- 一鍵指令碼:適用於 Linux/macOS/WSL2:
curl -fsSL https://raven.evermind.ai/install.sh | bash - PowerShell 指令碼:適用於原生 Windows。
- Docker compose:適用於容器化部署。
- 可編輯原始碼檢出:適用於開發(
./install.sh)。
安裝完成後,執行指令 raven web 即可啟動瀏覽器介面,使用者可在其中建立任務、監控子代理、檢視記憶體與瀏覽技能。
Hacker News 社群反應
HN 討論聚焦於幾個主題:
- 對星標數的懷疑 – 使用者質疑一個相對陌生的倉儲如何累積數千顆 GitHub 星標。
- 對「一句提示,一次結果」主張的批判 – 評論者認為現實世界的產品開發需要反覆提示與引導,這可能限制完全自主組件的實用性。
- 對 RSI 的澄清 – 有評論指出「RSI」代表 遞迴自我改進,而非「重複性勞損傷害」。
- 與現有元組件的比較 – 使用者提及類似專案如 Omnigent、Paseo 與 DeepSeek Harness,並要求提供比較基準。
- 效能疑慮 – 有人指出在程式碼基準上的提升有限(例如 SWE‑bench Verified 僅提升 0.8 %),並質疑 token 效率。
- 正面評價 – 少數評論者讚賞 README 的視覺設計與 THRESHOLD 示範的驚人表現。
整體而言,該討論反映出對自我進化多代理平台概念的熱情,同時對完全自主 AI 專案交付的炒作保持謹慎。
核心系統總覽
| 系統 | 功能 |
|---|---|
| 代理協調 | 管理基於 DAG 的任務依賴與平行執行。 |
| 進化者 | 診斷失敗、測試候選組件變更,並採用表現優於基線的改進。 |
| EverOS 記憶 | 提供跨會話的長期、Markdown 原生記憶。 |
| SkillForge | 從 SkillCorpus 中取得超過 114 k 經篩選的技能,以按需提供專業知識。 |
| 主動性 | 監控事件並排程動作,以預測使用者需求。 |
授權與引用
Raven 以 Apache 2.0 授權釋出。使用者在學術研究中使用 Raven 時,請引用技術報告(v1,2026 年 9 月)。
本文綜合了公開於 Raven GitHub 倉儲與上述連結的 Hacker News 討論串資訊。未引入任何額外資料或未公開細節。
Sources
相關
- 專案
- 專案
- 專案
- 專案