BigCodeArena: 코드 생성 평가를 엔드 투 엔드로 코드 실행과 함께 판단

Hugging Face는 실시간 코드 실행을 통합한 최초의 인간-인-루프 평가 플랫폼인 BigCodeArena를 소개했습니다. 이 플랫폼은 기존 벤치마크의 한계를 극복하고, 사용자가 생성된 코드를 실행·테스트·상호작용하여 실제로 동작하는지 확인할 수 있게 하며, 정적 코드 분석에 의존하지 않습니다.

BigCodeArena 평가 플랫폼

BigCodeArena는 생성된 코드가 자동으로 실행되는 격리된 샌드박스 환경을 제공함으로써 Chatbot Arena 프레임워크를 확장합니다. 이를 통해 사용자는 소스 코드를 읽는 수준을 넘어 실제 프로그램 동작을 관찰할 수 있습니다.

실시간 실행 및 상호작용

사용자는 코딩 과제를 제출하고 두 모델을 나란히 비교할 수 있습니다. 플랫폼은 인터랙티브 테스트를 지원하여 웹 앱에서 버튼을 클릭하고, 생성된 게임을 플레이하며, 코드를 편집해 수정 사항을 테스트할 수 있게 합니다. 또한 다중 턴 대화를 지원해 사용자가 요구사항을 다듬거나 여러 차례 상호작용을 통해 버그 수정을 요청할 수 있습니다.

언어 및 프레임워크 지원

현재 플랫폼은 10개의 프로그래밍 언어와 8개의 실행 환경을 지원합니다:

  • Languages: Python, JavaScript, TypeScript, HTML, C, C++, Java, Go, Rust, 및 Markdown.
  • Web Frameworks: React, Vue, 및 Core Web (vanilla HTML/CSS/JS).
  • Python Frameworks: Streamlit, Gradio, 및 PyGame.
  • Other: Mermaid(다이어그램용) 및 컴파일 언어용 범용 인터프리터/런너.

커뮤니티 평가 인사이트

2025년 2월 이후, BigCodeArena는 500명 이상의 사용자로부터 14,000건 이상의 대화를 수집했으며, 4,700건 이상의 고품질 선호 투표를 얻었습니다.

실제 현장의 프로그래밍 트렌드

사용자 활동을 통해 가장 많이 테스트되는 코딩 시나리오를 확인할 수 있습니다:

  • Web Design (36%): 반응형 웹사이트 및 인터랙티브 대시보드.
  • Problem Solving (23%): 알고리즘 및 자료 구조.
  • Game Development (16%): 물리와 그래픽이 포함된 인터랙티브 게임.
  • Scientific Computing (14%): 데이터 분석 및 수치 시뮬레이션.
  • Creative Coding (8%)Diagram Creation (3%).

Python이 가장 지배적인 언어이며(4,000건 이상의 대화), 그 다음으로 JavaScript/TypeScript(3,359건)와 HTML(1,601건)이 뒤를 잇습니다.

모델 성능 및 Elo 순위

Bradley‑Terry 모델을 사용해 쌍별 비교를 Elo 평점으로 집계한 결과, 커뮤니티는 명확한 성능 계층을 식별했습니다:

  • Top Tier: o3-minio1-mini가 모든 환경과 언어에서 가장 높은 Elo 평점과 강력한 견고성을 지속적으로 보이며 선두를 달립니다. Claude-3.5‑Sonnet이 그 뒤를 잇습니다.
  • Mid Tier: GPT-4o, o1, 그리고 Gemini-2.0‑Pro/Flash가 경쟁력 있는 중간 그룹을 형성합니다.
  • Open Source Models: Qwen2.5 변형과 Llama-3.3‑70B는 현재 최첨단 상용 모델에 뒤처져 있습니다.

특정 강점도 확인되었습니다: Gemini-2.0‑Pro는 Rust에서 특히 강력했으며, o3-mini는 React, Streamlit, PyGame과 같은 다양한 프레임워크에서 가장 일관된 성능을 보여주었습니다.

새로운 벤치마크: BigCodeReward와 AutoCodeArena

크라우드소싱 데이터를 보완하기 위해 Hugging Face는 코드 품질 평가 방식을 개선하는 두 개의 새로운 벤치마크를 발표했습니다.

BigCodeReward

BigCodeReward는 LLM이 코드에 대한 보상 모델 역할을 수행하는 능력을 평가합니다. 데이터에 따르면 모델에 실행 결과(스크린샷이나 로그 등)를 제공하면 인간 선호와의 정렬이 크게 향상됩니다. 예를 들어, 실행 결과를 제공했을 때 GPT‑4o의 정확도가 54.6%에서 63.8%로 상승했습니다.

AutoCodeArena

AutoCodeArena는 600개의 대표 프롬프트로 구성된 자동화된 벤치마크입니다. 자동 LLM 심판(Claude‑3.7‑Sonnet)을 사용해 실행 결과를 GPT‑4.1 기준선과 비교 평가합니다. 초기 결과는 다음과 같습니다:

  • GPT-5가 큰 차이로 새로운 최첨단을 달성했습니다.
  • Claude‑Opus‑4Claude‑Sonnet‑4가 강력한 2위 계층을 형성합니다.
  • Qwen3‑Coder, Kimi‑K2, 그리고 GLM‑4.5가 선두 오픈 모델로, 중간 계층 상용 시스템과의 격차를 좁히고 있습니다.

오픈 소스 기여

BigCode 프로젝트의 투명성 목표에 맞춰 다음 리소스가 공개되었습니다:

  • Codebase: 전체 평가 파이프라인 및 Gradio 애플리케이션 소스가 GitHub에 공개되었습니다.
  • Crowdsourced Data: 14,000개의 원시 대화와 4,700개의 선호 투표가 Hugging Face 컬렉션을 통해 제공됩니다.
  • Datasets: BigCodeReward와 AutoCodeArena 데이터셋이 연구용으로 공개되었습니다.

SUMMARY: Hugging Face는 사용자가 생성된 코드를 실시간으로 실행하고 상호작용할 수 있게 함으로써 코드 생성 모델을 평가하는 인간-인-루프 플랫폼인 BigCodeArena를 출시했습니다.

TITLE: BigCodeArena: 코드 생성 평가를 엔드 투 엔드로 코드 실행과 함께 판단

Sources