akitaonrails/llm-coding-benchmark
Simple benchmark to test the most popular open source and commercial LLMs with automated OpenCode
解決的問題
本專案提供一個標準化框架,用於評估大型語言模型(LLM)的自主編碼能力。它特別測試模型根據需求文件建構固定 Ruby on Rails 應用程式的功能,評估重點在技術正確性、API 相容性與生產就緒性,而非單純的檔案數量或測試數量。
如何運作
基準測試執行器使用 opencode 工具在本地(Ollama)與雲端模型等多種環境中執行編碼任務。該過程通常分為兩個階段:初始建構階段與驗證階段,後者檢查本地啟動、Docker 建構與 Docker Compose 功能。隨後,根據八個維度(包括交付成果、錯誤處理與架構)的 0-100 分綜合評分體系分析結果。專案亦包含用於預熱本地模型以驗證上下文視窗限制的工具,以及用於探測生成專案執行時狀態的執行時驗證器。
適用對象
專為 AI 研究人員、開發者與 LLM 評估者設計,他們希望使用具體的軟體工程任務,比較不同前沿模型與代理框架(如 Claude Code 或 Codex)在真實世界中的編碼效能、成本與速度。
主要亮點
- 多框架測試:支援在
opencode、Claude Code 與 Codex 等不同執行環境中進行效能對比。 - 嚴格評分體系:採用詳細的 8 維度審計標準,識別「破壞基準」的模式,例如虛構的 API 與偽造這些虛構 API 的測試。
- 硬體設定支援:支援針對不同硬體環境(如 AMD 伺服器 vs. NVIDIA 工作站)的獨立設定,以管理顯存與上下文視窗。
- 編排分析:評估多代理規劃器/執行器模式是否真正提升品質,還是僅增加成本與時間。
- 適配器整合:利用
deepclaude適配器,使 DeepSeek V4 Pro 等模型能在 Claude Code 的自主循環中進行基準測試。
相關
- 專案
- 專案
- 專案
- 專案