Raven:遞迴自我改進的「組件之組件」

Raven 所聲稱的價值

Raven 將自身定位為「組件之組件」,可實現 AI 代理的遞迴自我改進(RSI)。 它將四個內建代理——研究、程式碼、設計與即時支援——整合於一個主代理之下,能協調複雜且多步驟的工作流程。該平台基於 EverOS 建構,提供跨會話的持久記憶,並包含一名「策展人」元件,可在各輪次之間修改代理的規劃、能力、記憶與動作模組。

「Raven 是為遞迴自我改進(RSI)而打造的組件之組件。」 – Raven README

端到端專案示範

Raven 展示了三項完全自主交付的專案:

  1. THRESHOLD 遊戲 – 一個使用 Godot 4 在四天內完成的第一人稱射擊遊戲,經歷了 42 次規劃-開發-驗證循環。交付成果包含可遊玩的遊戲、海報、簡報與網站。
  2. Raven RSI 基準測試 – 一個自我改進的流程,在七輪中執行了 172 次 nano-chat 預訓練實驗,在 20 分鐘、單一 GPU 預算內,將驗證比特/位元(val_bpb)降低了 5.8 %。同時執行了 dam-break CFD 模擬(誤差由 1e0 降至 1.36e‑10),並在八輪中完成 FEA 限載二分搜尋。
  3. 產品發布套件 – 一個瀏覽器端的物理迷你遊戲、16 張簡報投影片、雙語海報與 README,均由 Raven 自動生成。

每個示範皆包含影片示範、網站連結與可下載的投影片簡報,展現 Raven 在無人干預的情況下,從需求到最終交付的完整團隊代理驅動能力。

內建代理的基準表現

Raven 的四個核心代理在特定領域基準上進行評估:

  • Raven‑Research – 在 DeepResearch Mixed 基準上表現競爭力(準確率、token 使用量與成本)。
  • Raven‑Code – 在 SWE‑bench Pro、SWE‑bench Verified、WorkBuddy‑Code Reward 與 SWE‑Refactor 上達成最尖端成績。同時在資料分析任務中領先 DataAgentBench(Pass@1 = 0.8762)。
  • Raven‑Design – 在投影片生成方面領先 PresentBench,並在 ArtifactsBench 的視覺設計指標上表現優異。
  • Raven‑Oncall – 在 AI4AI 與 AI4S 內部基準上超越 Claude Code,為無人監督的工作流程自動化提供更高品質與更低成本。

這些結果以靜態圖片形式呈現於倉儲中;README 未提供原始數值或底層評估腳本的連結。

運行時自我進化架構

Raven 的代理迴圈被拆分為四個解耦的策略模組:

模組 功能
記憶 決定代理每回合可見的資訊。
規劃 產生當前迭代的計畫。
能力 選擇代理可呼叫的工具或外部服務。
動作 執行所選操作並評估其結果。

一名 策展人 可重寫任一代理的這些模組,有效改變代理的提示、工具集、技能與判斷程式碼。變更僅在通過驗證檢查後才會安裝,若驗證失敗則會將代理回退至先前版本。策展人以實驗性元件形式隨倉儲發行,而非封裝成二進位檔。

首先產生一名 角色:使用者描述所需的助理,策展人則從內建套件中組合出主角色與專門子代理。最終形成的組件定義了任務分工、工具存取與驗證標準。

「只需描述一次需求。Raven 會組裝助理,並在你工作時持續改進它,之後一句話就足以再次啟動它。」

第三方代理的整合

Raven 可透過三種機制協調外部代理:

  • ACP(代理通訊協定)
  • CLI 包裝器
  • OpenAI 兼容 API

倉儲內包含 13 種第三方代理的預設設定(例如 Claude Code、GitHub Copilot、Qwen Code),讓使用者可在單一工作流程中混合內建與外部能力。

安裝與使用

Raven 提供多種安裝方式:

  • 一鍵指令碼:適用於 Linux/macOS/WSL2:curl -fsSL https://raven.evermind.ai/install.sh | bash
  • PowerShell 指令碼:適用於原生 Windows。
  • Docker compose:適用於容器化部署。
  • 可編輯原始碼檢出:適用於開發(./install.sh)。

安裝完成後,執行指令 raven web 即可啟動瀏覽器介面,使用者可在其中建立任務、監控子代理、檢視記憶體與瀏覽技能。

Hacker News 社群反應

HN 討論聚焦於幾個主題:

  • 對星標數的懷疑 – 使用者質疑一個相對陌生的倉儲如何累積數千顆 GitHub 星標。
  • 對「一句提示,一次結果」主張的批判 – 評論者認為現實世界的產品開發需要反覆提示與引導,這可能限制完全自主組件的實用性。
  • 對 RSI 的澄清 – 有評論指出「RSI」代表 遞迴自我改進,而非「重複性勞損傷害」。
  • 與現有元組件的比較 – 使用者提及類似專案如 Omnigent、Paseo 與 DeepSeek Harness,並要求提供比較基準。
  • 效能疑慮 – 有人指出在程式碼基準上的提升有限(例如 SWE‑bench Verified 僅提升 0.8 %),並質疑 token 效率。
  • 正面評價 – 少數評論者讚賞 README 的視覺設計與 THRESHOLD 示範的驚人表現。

整體而言,該討論反映出對自我進化多代理平台概念的熱情,同時對完全自主 AI 專案交付的炒作保持謹慎。

核心系統總覽

系統 功能
代理協調 管理基於 DAG 的任務依賴與平行執行。
進化者 診斷失敗、測試候選組件變更,並採用表現優於基線的改進。
EverOS 記憶 提供跨會話的長期、Markdown 原生記憶。
SkillForge 從 SkillCorpus 中取得超過 114 k 經篩選的技能,以按需提供專業知識。
主動性 監控事件並排程動作,以預測使用者需求。

授權與引用

Raven 以 Apache 2.0 授權釋出。使用者在學術研究中使用 Raven 時,請引用技術報告(v1,2026 年 9 月)。


本文綜合了公開於 Raven GitHub 倉儲與上述連結的 Hacker News 討論串資訊。未引入任何額外資料或未公開細節。

Sources

相關

  • 專案
  • 專案
  • 專案
  • 專案