FrontierCS/Frontier-CS
A benchmark for evaluating LLMs on open-ended CS problems. Exploring the Next Frontier of Computer Science.
해결하는 문제
Frontier-CS는 현재 AI 코드 벤치마크의 포화 상태를 해결합니다. 많은 모델이 교과서 스타일 문제에서는 높은 점수를 기록하지만, 실제 엔지니어링 및 연구 과제에서는 종종 어려움을 겪습니다. 이 프로젝트는 깊은 전문 지식이 필요하며 단순한 패턴 매칭으로는 해결할 수 없는, 해결되지 않은, 개방형이며 다양한 컴퓨터 과학 문제 세트를 제공합니다.
작동 방식
Frontier-CS는 AI에 대한 엄격한 평가 프레임워크로 작동합니다. 세 가지 주요 문제 트랙을 제공합니다:
- 연구 문제: 시스템 및 ML 분야의 고수준 도전 과제 (예: FlashAttention).
- 알고리즘 문제: 검증 가능한 연속 점수를 제공하는 복잡한 알고리즘 작업.
- Frontier-CS 2.0: Harbor 에이전트 평가 프레임워크를 통해 반복적 상호작용을 위한 전용 에이전트 네이티브 작업.
시스템은 Docker를 사용한 로컬 평가, SkyPilot를 통한 클라우드 기반 평가, 그리고 다른 워크플로우에 통합 가능한 Python API를 지원합니다. 또한 "무한한" 점수 시스템을 제공하여 알고리즘 진화 프레임워크에 유용합니다.
대상 사용자
- AI 연구자: 복잡한 추론과 코딩이 가능한 LLM 또는 에이전트를 개발하는 사람.
- MLOps 엔지니어: 선도적인 모델이 전문적인 CS 영역에서 얼마나 한계에 도달하는지 테스트하는 사람.
- 에이전트 개발자: 검증 가능하고 고난이도 작업에서 테스트가 필요한 자율 에이전트를 개발하는 사람.
주요 특징
- 해결되지 않은 과제: 아직 완벽한 점수를 달성한 해답이 존재하지 않는 문제에 집중합니다.
- 에이전트 네이티브 평가: Harbor과의 통합을 통해 시험 중
submit.sh를 통해 에이전트가 반복적 피드백을 받을 수 있습니다. - 다양한 분야: 시스템, 머신러닝, 알고리즘, 보안을 포함합니다.
- 검증 가능한 점수: 이진적 통과/실패가 아닌 연속 점수를 사용하여 점진적인 개선 추적이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트