augmentcode/augment-swebench-agent

The #1 open-source SWE-bench Verified implementation

何を解決するか

このプロジェクトは、SWE-bench Verifiedベンチマークに見られる複雑なソフトウェアエンジニアリングタスクを解決するためのコーディングエージェントを提供します。単純なコーディング課題とは異なり、これらのタスクはエージェントが全体のコードベースをナビゲートし、リグレッションテストに基づいて反復処理し、現実のGitHubの問題の複雑さに対処する必要があります。

動作方法

エージェントは主にClaude 3.7 Sonnetをドライバーとして使用し、Anthropicからフォークされたアーキテクチャに基づいています。bashコマンドの実行、ファイル編集、複雑な問題解決のための「順次思考」プロセスといったツールを実行します。正確性を向上させるために、OpenAIのo1を活用した多数決アンサンブル方式を採用しており、エージェントが生成した複数の候補解を分析し、最も優れたものを選択します。

対象ユーザー

ソフトウェアエンジニアリングベンチマーク用の即時利用可能なベースラインエージェントが必要な開発者やAI研究者、あるいは独自のコーディングエージェントを構築・テストするためのシンプルで拡張可能なフレームワークを探している人向けです。

特徴

  • 統合ツールセット: bash実行、ファイル操作、順次思考の内蔵機能を備えています。
  • アンサンブルロジック: 複数の候補解から最も品質の高いものを多数決で選択します。
  • Docker統合: コードの安全かつ隔離された実行を保証するため、Dockerコンテナ内で動作します。
  • 柔軟なモード: 個人用のインタラクティブCLIと、SWE-benchでの大規模評価用の非インタラクティブモードの両方をサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch