FrontierCS/Frontier-CS

A benchmark for evaluating LLMs on open-ended CS problems. Exploring the Next Frontier of Computer Science.

何を解決するか

Frontier-CSは、現在のAIコーディングベンチマークの飽和状態に対処します。多くのモデルが教科書形式の問題では高いスコアを記録できるようになっていますが、実際のエンジニアリングや研究課題ではしばしば困難に直面します。このプロジェクトは、深い専門知識を要し、単純なパターンマッチングでは解決できない、未解決でオープンエンドかつ多様なコンピュータサイエンスの問題セットを提供します。

仕組み

Frontier-CSはAIに対する厳格な評価フレームワークとして機能します。3つの主要な問題トラックを提供します:

  • 研究課題:システムやMLにおける高レベルな課題(例:FlashAttention)。
  • アルゴリズム課題:検証可能な連続スコアリングが可能な複雑なアルゴリズムタスク。
  • Frontier-CS 2.0:Harborエージェント評価フレームワークを介した反復的インタラクションに特化したエージェントネイティブタスク。

このシステムはDockerを用いたローカル評価、SkyPilotを介したクラウドベース評価、および他のワークフローへの統合を可能にするPython APIをサポートしています。また、「無制限スコアリング」も可能で、これはアルゴリズム進化フレームワークに有用です。

対象ユーザー

  • AI研究者:複雑な推論とコーディングが可能なLLMやエージェントを開発する人。
  • MLOpsエンジニア:先端モデルの専門的CS分野における限界をテストする人。
  • エージェント開発者:検証可能で高難易度のタスクでテストが必要な自律エージェントを開発する人。

特徴

  • 未解決の課題:まだ完全スコアを達成した解が存在しない問題に焦点を当てます。
  • エージェントネイティブ評価:Harborとの統合により、試行中にsubmit.shを通じてエージェントが反復的フィードバックを受けられます。
  • 多様な分野:システム、機械学習、アルゴリズム、セキュリティをカバーします。
  • 検証可能なスコアリング:二値の合格/不合格ではなく連続スコアリングを使用し、段階的な改善の追跡が可能になります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト