alexisfox7/PRO-LONG

Programmatic memory for long-horizon LLM agents: the harness appends everything to one log, and the agent searches it with code. 97.4% on ARC-AGI-3 (arXiv:2607.20064)

解決する課題

PRO-LONG は、LLMエージェントにおける長期間推論の課題に対処し、特に ARC-AGI-3 ゲームセットに見られるような複雑なタスクに特化しています。モデルのコンテキストウィンドウに依存せず、恒久的でプログラム可能なメモリを提供することで、長期間にわたるアクションのシーケンスにおいて、進捗の喪失や重要な観察の忘却を防ぎます。

動作方法

モデルのコンテキストウィンドウに依存するのではなく、PRO-LONG は最小限のメモリ追加として、すべての観察、アクション、結果を記録する構造化された log.txt ファイルを使用します。エージェントは grep や Python などのツールを使って、この履歴をプログラム的に取得・推論できるため、全履歴をプロンプトに押し込む必要がありません。このアプローチは非常に短いシステムプロンプト(約30行)を使用し、複雑なサブエージェントや専用の検索システムを回避します。

対象ユーザー

長期間推論タスクを解く能力を持つ LLM エージェントを開発・研究している開発者や研究者、特に ARC-AGI-3 ベンチマークに焦点を当てている人向けです。

主な特徴

  • 顕著なパフォーマンス向上:標準的なコーディングエージェントと比較して、ARC-AGI-3 公開ゲームセットで 18 パーセンテージポイント向上。
  • トークン効率性:専用のハーネスと同等またはそれを上回る性能を発揮しながら、課金対象トークン数を 4.2~5.8 倍削減。
  • 高い正確性:Fable 5 で best@2 が 97.4% を達成。
  • 柔軟なバックエンド:Docker コンテナを介して OpenAI Codex と Claude Code CLI の両方のバックエンドをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト