FrontierCS/Frontier-CS

A benchmark for evaluating LLMs on open-ended CS problems. Exploring the Next Frontier of Computer Science.

解决的问题

Frontier-CS 解决了当前 AI 编码基准的饱和问题。尽管许多模型在教科书式问题上得分很高,但在实际工程和研究挑战中往往表现不佳。该项目提供了一组未解决、开放性且多样化的计算机科学问题,需要深厚的专业知识,无法通过简单的模式匹配解决。

如何工作

Frontier-CS 作为一个严格的 AI 评估框架。它提供三个主要问题类别:

  • 研究问题:系统和机器学习领域的高层次挑战(例如 FlashAttention)。
  • 算法问题:具有可验证连续评分的复杂算法任务。
  • Frontier-CS 2.0:专为通过 Harbor 代理评估框架进行迭代交互而设计的代理原生任务。

该系统支持使用 Docker 的本地评估、通过 SkyPilot 的云评估,以及通过 Python API 集成到其他工作流中。它还支持“无界”评分,这对算法演化框架非常有用。

适用人群

  • AI 研究人员:开发能够进行复杂推理和编码的 LLM 或代理的研究者。
  • MLOps 工程师:测试前沿模型在特定计算机科学领域极限的工程师。
  • 代理开发者:需要在可验证、高难度任务上测试的自主代理开发者。

亮点

  • 未解决的挑战:聚焦于尚未有解决方案达到满分的问题。
  • 代理原生评估:与 Harbor 集成,允许代理在试验过程中通过 submit.sh 接收迭代反馈。
  • 多样化领域:涵盖系统、机器学习、算法和安全领域。
  • 可验证评分:使用连续评分而非二元通过/失败,支持逐步改进的追踪。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目