akitaonrails/llm-coding-benchmark
Simple benchmark to test the most popular open source and commercial LLMs with automated OpenCode
解決する課題
このプロジェクトは、大規模言語モデル(LLM)の自律的コーディング能力を標準化されたフレームワークでベンチマークする方法を提供します。具体的には、要件定義に基づいて固定されたRuby on Railsアプリケーションを構築する能力をテストし、単なるファイル数やテスト数ではなく、技術的正確性、API準拠、プロダクション準備度を評価します。
動作方法
ベンチマークランナーは opencode ツールを使用して、ローカル(Ollama)およびクラウドモデルのさまざまな環境でコーディング実行を実行します。プロセスは通常、初期構築フェーズと、ローカル起動、Dockerビルド、Docker Compose機能を検証する検証フェーズの2段階で構成されます。その後、8つの次元(出力物、エラー処理、アーキテクチャなど)にわたる0〜100点の包括的評価基準を使用して結果を分析します。プロジェクトには、ローカルモデルのウォームアップを実行してコンテキストウィンドウの制限を確認するツールや、生成されたプロジェクトを検証するランタイムバリデータも含まれます。
対象ユーザー
AI研究者、開発者、LLM評価者向けです。具体的には、実際のソフトウェアエンジニアリングタスクを用いて、異なる最先端モデルやエージェントハーネス(例:Claude CodeやCodex)の実世界でのコーディングパフォーマンス、コスト、速度を比較したい方々に最適です。
主な特徴
- マルチハーネステスト:
opencode、Claude Code、Codexなどの異なる実行環境でのパフォーマンスを比較可能。 - 厳格な評価基準:8次元の詳細な監査基準を用いて、「ベンチマーク破壊」パターン(例:架空のAPIやその仮想テスト)を特定。
- ハードウェアプロファイル:AMDサーバーとNVIDIAワークステーションなど、異なるハードウェア構成に応じた個別設定をサポートし、VRAMとコンテキストウィンドウを管理。
- オーケストレーション分析:マルチエージェントプランナー/エグゼキューターのパターンが品質向上に寄与するか、単にコストと時間を増加させるだけかを評価。
- シム統合:
deepclaudeシムを使用して、DeepSeek V4 ProなどのモデルをClaude Codeの自律ループ内でベンチマーク可能に。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト