aaron-for-value/VeriRun
Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.
해결하는 문제
VeriRun은 실행 가능한 코드와 AI 에이전트를 평가하기 위한 분산 런타임을 제공합니다. 대규모로 신뢰할 수 없는 모델 생성 코드를 실행하는 문제를 해결하고, 결과가 재현 가능하고 복구 가능하며 안전하도록 보장합니다. 특히 인프라 실패(예: 시간 초과 또는 OOM)와 실제 모델 실패(예: 잘못된 코드)를 분리하여 오해를 불러일으키는 벤치마크 점수를 방지합니다.
작동 방식
VeriRun은 실행을 일련의 버전이 지정된 불변 매니페스트로 취급하는 증거 우선 인프라를 구현합니다. 의도와 지속적인 상태를 관리하는 제어 플레인과 재시도 가능한 시도를 처리하는 실행 플레인을 사용합니다. 안전을 보장하기 위해 다이제스트 고정 Docker 컨테이너와 보안 경계를 위한 gVisor가 포함된 Kubernetes 작업을 포함한 격리된 실행 계층을 사용합니다. EvalPlus 및 LiveCodeBench와 같은 기존 벤치마크를 대체하지 않고 통합하여 그 아래의 오케스트레이션 및 격리 계층으로 작동합니다.
대상 사용자
LLM 또는 AI 에이전트를 구축하는 연구자와 개발자를 위해 설계되었으며, 실행 가능한 평가를 실행하고 사후 훈련 루프에 대한 온라인 보상을 계산할 수 있는 신뢰할 수 있고 재현 가능한 방법이 필요합니다.
주요 기능
- 불변 출처: 모든 결과는 사용된 특정 벤치마크, 프롬프트, 모델 개정 및 런타임 정책에 연결됩니다.
- 구조화된 실패 의미론: 오류를 컴파일 오류, 테스트 실패, 시간 초과, OOM 및 인프라 실패로 명확하게 분류합니다.
- 지속적인 제어 플레인: PostgreSQL 및 S3 호환 스토리지를 사용하여 멱등성 결과와 실패로부터의 복구를 보장합니다.
- 격리된 실행: Kubernetes 및 gVisor를 사용하는 보안 중심 런타임을 제공하여 신뢰할 수 없는 코드를 안전하게 실행합니다.
- 결정적 재생: 모델을 다시 호출하지 않고 고정된 후보를 재검증할 수 있어 일관성을 보장합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트