akitaonrails/llm-coding-benchmark
Simple benchmark to test the most popular open source and commercial LLMs with automated OpenCode
解决的问题
该项目提供了一个标准化框架,用于评估大型语言模型(LLM)的自主编码能力。它特别测试模型基于需求文档构建固定 Ruby on Rails 应用程序的能力,评估重点在于技术正确性、API 兼容性以及生产就绪性,而非简单的文件数量或测试数量。
如何工作
基准测试运行器使用 opencode 工具在本地(Ollama)和云模型等多种环境中执行编码任务。该过程通常分为两个阶段:初始构建阶段和验证阶段,后者检查本地启动、Docker 构建和 Docker Compose 功能。随后,基于八个维度(包括交付成果、错误处理和架构)的 0-100 分综合评分体系对结果进行分析。项目还包含用于预热本地模型以验证上下文窗口限制的工具,以及用于探测生成项目运行时状态的运行时验证器。
适用人群
专为 AI 研究人员、开发者和 LLM 评估者设计,他们希望使用具体的软件工程任务,比较不同前沿模型和代理框架(如 Claude Code 或 Codex)在真实世界中的编码性能、成本和速度。
主要亮点
- 多框架测试:支持在
opencode、Claude Code 和 Codex 等不同执行环境中进行性能对比。 - 严格评分体系:采用详细的 8 维度审计标准,识别“破坏基准”的模式,例如虚构的 API 和伪造这些虚构 API 的测试。
- 硬件配置支持:支持针对不同硬件环境(如 AMD 服务器 vs. NVIDIA 工作站)的独立配置,以管理显存和上下文窗口。
- 编排分析:评估多代理规划器/执行器模式是否真正提升质量,还是仅增加成本和时间。
- 适配器集成:利用
deepclaude适配器,使 DeepSeek V4 Pro 等模型能够在 Claude Code 的自主循环中进行基准测试。
相关
- 项目
- 项目
- 项目
- 项目