akitaonrails/llm-coding-benchmark

Simple benchmark to test the most popular open source and commercial LLMs with automated OpenCode

解決する課題

このプロジェクトは、大規模言語モデル(LLM)の自律的コーディング能力を標準化されたフレームワークでベンチマークする方法を提供します。具体的には、要件定義に基づいて固定されたRuby on Railsアプリケーションを構築する能力をテストし、単なるファイル数やテスト数ではなく、技術的正確性、API準拠、プロダクション準備度を評価します。

動作方法

ベンチマークランナーは opencode ツールを使用して、ローカル(Ollama)およびクラウドモデルのさまざまな環境でコーディング実行を実行します。プロセスは通常、初期構築フェーズと、ローカル起動、Dockerビルド、Docker Compose機能を検証する検証フェーズの2段階で構成されます。その後、8つの次元(出力物、エラー処理、アーキテクチャなど)にわたる0〜100点の包括的評価基準を使用して結果を分析します。プロジェクトには、ローカルモデルのウォームアップを実行してコンテキストウィンドウの制限を確認するツールや、生成されたプロジェクトを検証するランタイムバリデータも含まれます。

対象ユーザー

AI研究者、開発者、LLM評価者向けです。具体的には、実際のソフトウェアエンジニアリングタスクを用いて、異なる最先端モデルやエージェントハーネス(例:Claude CodeやCodex)の実世界でのコーディングパフォーマンス、コスト、速度を比較したい方々に最適です。

主な特徴

  • マルチハーネステストopencode、Claude Code、Codexなどの異なる実行環境でのパフォーマンスを比較可能。
  • 厳格な評価基準:8次元の詳細な監査基準を用いて、「ベンチマーク破壊」パターン(例:架空のAPIやその仮想テスト)を特定。
  • ハードウェアプロファイル:AMDサーバーとNVIDIAワークステーションなど、異なるハードウェア構成に応じた個別設定をサポートし、VRAMとコンテキストウィンドウを管理。
  • オーケストレーション分析:マルチエージェントプランナー/エグゼキューターのパターンが品質向上に寄与するか、単にコストと時間を増加させるだけかを評価。
  • シム統合deepclaude シムを使用して、DeepSeek V4 ProなどのモデルをClaude Codeの自律ループ内でベンチマーク可能に。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト