akitaonrails/llm-coding-benchmark
Simple benchmark to test the most popular open source and commercial LLMs with automated OpenCode
해결하는 문제
이 프로젝트는 대규모 언어 모델(LLM)의 자율적 코딩 능력을 표준화된 프레임워크로 평가하는 방법을 제공합니다. 구체적으로, 명세에 따라 고정된 Ruby on Rails 애플리케이션을 구축하는 능력을 테스트하며, 단순한 파일 수나 테스트 수가 아니라 기술적 정확성, API 준수, 프로덕션 준비도를 평가합니다.
작동 방식
벤치마크 러너는 opencode 도구를 사용하여 로컬(Ollama) 및 클라우드 모델에서 다양한 환경에서 코딩 실행을 수행합니다. 일반적으로 초기 빌드 단계와 로컬 부팅, Docker 빌드, Docker Compose 기능을 검증하는 검증 단계로 구성됩니다. 이후 8개의 차원(예: 결과물, 오류 처리, 아키텍처 등)에 걸쳐 0~100점의 종합 평가 체계를 사용하여 결과를 분석합니다. 프로젝트에는 로컬 모델을 워밍업하여 컨텍스트 창 한계를 확인하는 도구와 생성된 프로젝트를 탐색하는 런타임 검증기가 포함되어 있습니다.
대상 사용자
AI 연구자, 개발자, LLM 평가자에게 적합합니다. 구체적으로, 실제 소프트웨어 엔지니어링 작업을 기반으로 다양한 최첨단 모델과 에이전트 허브(Claude Code, Codex 등)의 실제 코딩 성능, 비용, 속도를 비교하고자 하는 분들입니다.
주요 특징
- 다중 허브 테스트:
opencode, Claude Code, Codex 등 다양한 실행 환경에서 성능을 비교 가능. - 엄격한 평가 체계: 8차원의 세부 감사 기준을 사용하여 '벤치마크 파괴' 패턴(예: 허구의 API, 그 허구를 모킹하는 테스트)을 식별.
- 하드웨어 프로파일: AMD 서버와 NVIDIA 워크스테이션 등 다양한 하드웨어 구성에 맞는 별도 설정을 지원하여 VRAM과 컨텍스트 창을 관리.
- 오케스트레이션 분석: 다중 에이전트 플래너/실행자 패턴이 품질 향상에 기여하는지, 아니면 단지 비용과 시간만 증가시키는지 평가.
- 시ม 통합:
deepclaude시م을 활용해 DeepSeek V4 Pro와 같은 모델을 Claude Code의 자율 루프 내에서 벤치마크 가능하게 함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트