BigCodeArena:端到端评估代码生成的执行
Hugging Face 推出了 BigCodeArena,这是首个将人类参与环节与实时代码执行相结合的代码生成模型评估平台。该平台通过让用户运行、测试并交互生成的代码,以判断其是否真正可用,克服了传统基准测试只能依赖静态代码分析的局限性。
BigCodeArena 评估平台
BigCodeArena 在 Chatbot Arena 框架的基础上扩展,提供了隔离的沙箱环境,自动执行生成的代码。这使用户能够超越仅阅读源代码,直接观察实际的程序行为。
实时执行与交互
用户可以提交编码任务并并排比较两个模型。平台支持交互式测试,允许用户在网页应用中点击按钮、玩生成的游戏,并编辑代码以测试修改。它还支持多轮对话,使用户能够在多次交互中细化需求或请求修复错误。
语言与框架支持
平台目前支持 10 种编程语言和 8 种执行环境:
- 语言: Python, JavaScript, TypeScript, HTML, C, C++, Java, Go, Rust, and Markdown.
- Web 框架: React, Vue, and Core Web (vanilla HTML/CSS/JS).
- Python 框架: Streamlit, Gradio, and PyGame.
- 其他: Mermaid for diagrams and general-purpose interpreters/runners for compiled languages.
社区评估洞察
自 2025 年 2 月起,BigCodeArena 已收集超过 14,000 场对话,来自 500 多位用户,产生了 4,700 多条高质量偏好投票。
实际编程趋势
用户活动显示出最常被测试的编码场景:
- 网页设计 (36%):响应式网站和交互式仪表盘。
- 问题解决 (23%):算法和数据结构。
- 游戏开发 (16%):带有物理和图形的交互式游戏。
- 科学计算 (14%):数据分析和数值模拟。
- 创意编码 (8%) 和 图表创建 (3%)。
Python 是最主导的语言(超过 4,000 场对话),其次是 JavaScript/TypeScript(3,359)和 HTML(1,601)。
模型表现与 Elo 排名
使用 Bradley-Terry 模型将成对比较聚合为 Elo 评分,社区识别出明确的性能层级:
- 顶层:o3-mini 和 o1-mini 始终以最高的 Elo 评分领跑,并在所有环境和语言中表现出强大的鲁棒性。Claude-3.5-Sonnet 紧随其后。
- 中层:GPT-4o、o1 和 Gemini-2.0-Pro/Flash 组成竞争激烈的中间组。
- 开源模型:Qwen2.5 系列和 Llama-3.3-70B 目前落后于前沿的专有模型。
还注意到具体的优势:Gemini-2.0-Pro 在 Rust 上表现尤为突出,而 o3-mini 在诸如 React、Streamlit 和 PyGame 等多种框架中展现出最一致的性能。
新基准:BigCodeReward 与 AutoCodeArena
为补充众包数据,Hugging Face 发布了两个新基准,以提升代码质量评估的方式。
BigCodeReward
BigCodeReward 评估大型语言模型作为代码奖励模型的能力。数据表明,向模型提供执行结果(如截图或日志)显著提升了它们与人类偏好的对齐程度。例如,在提供执行输出后,GPT-4o 的准确率从 54.6% 提升至 63.8%。
AutoCodeArena
AutoCodeArena 是一个包含 600 条代表性提示的自动化基准。它使用自动化 LLM 评审(Claude-3.7-Sonnet)将执行结果与 GPT-4.1 基线进行评估。初步结果显示:
- GPT-5 以显著优势树立了新的最先进水平。
- Claude-Opus-4 和 Claude-Sonnet-4 组成强劲的第二层。
- Qwen3-Coder、Kimi-K2 和 GLM-4.5 是领先的开源模型,缩小了与中层专有系统的差距。
开源贡献
为配合 BigCode 项目的透明度目标,以下资源已公开:
- 代码库:完整的评估流水线和 Gradio 应用源码已在 GitHub 上提供。
- 众包数据:14,000 条原始对话和 4,700 条偏好投票可通过 Hugging Face Collection 获取。
- 数据集:已发布 BigCodeReward 和 AutoCodeArena 数据集供研究使用。
SUMMARY: Hugging Face 推出了 BigCodeArena,这是一款人类参与的平台,通过让用户实时执行并交互生成的代码来评估代码生成模型。
TITLE: BigCodeArena:端到端评估代码生成的执行