FrontierCS/Frontier-CS
A benchmark for evaluating LLMs on open-ended CS problems. Exploring the Next Frontier of Computer Science.
解決的問題
Frontier-CS 解決了當前 AI 程式碼基準的飽和問題。儘管許多模型在教科書式問題上得分很高,但在實際工程與研究挑戰中往往表現不佳。本專案提供一組未解決、開放式且多樣化的電腦科學問題,需要深厚專業知識,無法透過簡單的模式匹配解決。
如何運作
Frontier-CS 作為嚴謹的 AI 評估框架。提供三個主要問題類別:
- 研究問題:系統與機器學習領域的高階挑戰(例如 FlashAttention)。
- 演算法問題:具備可驗證連續評分的複雜演算法任務。
- Frontier-CS 2.0:專為透過 Harbor 代理評估框架進行迭代互動而設計的代理原生任務。
系統支援使用 Docker 的本機評估、透過 SkyPilot 的雲端評估,以及透過 Python API 集成至其他工作流程。同時支援「無界」評分,對演算法演化框架極具價值。
適用對象
- AI 研究人員:開發能進行複雜推理與程式撰寫的 LLM 或代理的研究者。
- MLOps 工程師:測試前沿模型在特定電腦科學領域極限的工程師。
- 代理開發者:需要在可驗證、高難度任務上測試的自主代理開發者。
亮點
- 未解決的挑戰:聚焦於尚未有解法達成滿分的問題。
- 代理原生評估:與 Harbor 集成,讓代理在試驗過程中透過
submit.sh接收迭代反饋。 - 多樣化領域:涵蓋系統、機器學習、演算法與安全領域。
- 可驗證評分:使用連續評分而非二元通過/失敗,支援逐步改善的追蹤。
相關
- 專案
- 專案
- 專案
- 專案
- 專案