Raven: 再帰的自己改善のためのハーネスのハーネス
Ravenが提供すると主張するもの
Ravenは、AIエージェントの再帰的自己改善(RSI)を可能にする「ハーネスのハーネス」として位置づけられています。 ホストエージェントの下に、研究、コード、デザイン、オンコールの4つの組み込みエージェントを束ね、複雑で多段階のワークフローを調整できます。このプラットフォームはEverOSに基づいており、セッション間で永続的なメモリを提供し、エージェントの計画、能力、メモリ、アクションモジュールをラウンド間で変更できるCuratorコンポーネントを備えています。
"Ravenは、再帰的自己改善(RSI)のために作られたハーネスのハーネスです。" – Raven README
終端から終端までのプロジェクト実演
Ravenは、3つの異なるプロジェクトを完全に自律的に実行する様子を示しています:
- THRESHOLDゲーム – 4日間でGodot 4で開発された1人称シューティングゲーム。42回の計画・開発・検証サイクルを経て、プレイ可能なゲーム、ポスター、プレゼンテーション、ウェブサイトを含む成果物を提供。
- Raven RSIベンチマーク – 172回のナノチャット事前学習実験を7ラウンドで実行する自己改善パイプライン。20分、単一GPUの予算内で検証ビット/バイト(
val_bpb)を5.8%削減。また、ダム破壊CFDシミュレーション(誤差を1e0から1.36e‑10に低下)と、8ラウンドにわたるFEA限界荷重二分探索も実施。 - プロダクトローンチキット – ブラウザベースの物理ミニゲーム、16スライドの概要、バイリンガルポスター、READMEをすべてRavenが生成。
各実演には動画デモ、ウェブサイトリンク、ダウンロード可能なスライド資料が含まれており、Ravenが人間の介入なしに専門エージェントチームを要件から最終成果物まで導く能力を示しています。
組み込みエージェントのベンチマーク性能
Ravenの4つのコアエージェントは、ドメイン固有のベンチマークで評価されています:
- Raven‑Research – DeepResearch Mixedベンチマーク(精度、トークン使用量、コスト)で競争力のある順位。
- Raven‑Code – SWE‑bench Pro、SWE‑bench Verified、WorkBuddy‑Code Reward、SWE‑Refactorで最先端のスコアを達成。データ分析タスクではDataAgentBench(Pass@1 = 0.8762)でトップ。
- Raven‑Design – スライド生成においてPresentBenchでリードし、ArtifactsBenchの視覚的デザインメトリクスでも高いスコア。
- Raven‑Oncall – AI4AIおよびAI4Sの内部ベンチマークでClaude Codeを上回り、未監視のワークフロー自動化においてより高品質かつ低コストを実現。
これらの結果はリポジトリ内の静的画像として提示されています。READMEには原始的な数値や評価スクリプトへのリンクが提供されていません。
ランタイム自己進化アーキテクチャ
Ravenのエージェントループは、4つの独立した戦略モジュールに分かれています:
| モジュール | 役割 |
|---|---|
| メモリ | エージェントが各ターンでどの情報を視認するかを決定。 |
| 計画 | 現在のイテレーションの計画を生成。 |
| 能力 | エージェントが呼び出せるツールや外部サービスを選択。 |
| アクション | 選択された操作を実行し、その結果を評価。 |
Curatorは、特定のエージェントに対してこれらのモジュールのいずれかを再書き換えでき、エージェントのプロンプト、ツールセット、スキル、判断コードを効果的に変更します。変更は検証チェックを通過した後のみインストールされ、失敗した場合はエージェントは以前のバージョンに戻ります。Curatorはリポジトリ内に実験的コンポーネントとして提供され、パッケージ化されたバイナリとして提供されていません。
Personaが最初に生成されます:ユーザーは望むアシスタントの特徴を説明し、Curatorが組み込みエージェントから選ばれたリーダー役と専門サブエージェントを構成します。結果として得られるハーネスは、タスクの分担、ツールアクセス、検証基準を定義します。
*"一度だけ必要なことを説明するだけでよい。Ravenはアシスタントを組み立て、あなたが作業している間も改善し続け、その後、単一の文で再び働かせることができる。"
第三者エージェントの統合
Ravenは以下の3つのメカニズムで外部エージェントを調整できます:
- ACP(エージェント通信プロトコル)
- CLIラッパー
- OpenAI互換API
Claude Code、GitHub Copilot、Qwen Codeなど13種類の第三者エージェント用プリセットが含まれており、1つのワークフロー内で組み込み機能と外部機能を混合して使用できます。
インストールと使用方法
Ravenは複数のインストール方法を提供しています:
- ワンライナー スクリプト(Linux/macOS/WSL2用):
curl -fsSL https://raven.evermind.ai/install.sh | bash - PowerShell スクリプト(ネイティブWindows用)
- Docker compose(コンテナ化デプロイ用)
- 編集可能なソースチェックアウト(開発用)(
./install.sh)
インストール後、raven webコマンドでブラウザベースのUIが起動し、タスクの作成、サブエージェントの監視、メモリの確認、スキルの閲覧が可能になります。
Hacker Newsでのコミュニティの反応
HNの議論では以下のテーマが強調されました:
- スター数に対する懐疑論 – 比較的未知のリポジトリがなぜ数千のGitHubスターを獲得できたのか疑問視された。
- 「1つのプロンプト、1つの結果」の主張に対する批判 – 実際の製品開発には反復的なプロンプト操作と調整が必要であり、完全自律的なハーネスの実用性に限界があると指摘された。
- RSIの説明 – コメントで「RSI」は「再帰的自己改善」の略であり、「繰り返し筋肉痛(repetitive strain injury)」ではないと明確化された。
- 既存のメタハーネスとの比較 – Omnigent、Paseo、DeepSeek Harnessなどの類似プロジェクトが参照され、比較ベンチマークの必要性が問われた。
- パフォーマンスへの懸念 – コーディングベンチマークでの成果が限定的(例:SWE‑bench Verifiedで0.8%の改善)であり、トークン効率について疑問が呈された。
- 肯定的な印象 – 一部のコメントではREADMEの視覚的デザインとTHRESHOLD実演のインパクトに称賛が寄せられた。
全体として、このスレッドは自己進化型マルチエージェントプラットフォームの概念に対する熱意と、完全自律的AIプロジェクト配信のブームに対する慎重さの両方を反映しています。
システム要約
| システム | 機能 |
|---|---|
| エージェントオーケストレーション | DAGベースのタスク依存関係と並列実行を管理。 |
| Evolver | 失敗の診断、候補となるハーネス変更のテスト、ベースラインを上回る改善の採用。 |
| EverOSメモリ | セッション間で永続的な、Markdownネイティブなメモリを提供。 |
| SkillForge | SkillCorpusから114,000以上のキュレートされたスキルをオンデマンドで取得。 |
| 能動性 | イベントを監視し、ユーザーのニーズを予測してアクションをスケジュール。 |
ライセンスと引用
RavenはApache 2.0ライセンスの下でリリースされています。学術的な使用においては、技術報告書(v1、2026年9月)を引用するよう求められています。
この記事は、上記のRaven GitHubリポジトリおよびHacker Newsの議論スレッドで公開されている情報に基づいてまとめられています。追加のデータや非公開の詳細は一切含まれていません。
Sources
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト