aaron-for-value/VeriRun
Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.
解決する課題
VeriRunは、実行可能なコードとAIエージェントを評価するための分散ランタイムを提供します。大規模な信頼できないモデル生成コードの実行という課題に対処し、結果が再現可能で、回復可能で、安全であることを保証します。具体的には、インフラストラクチャの障害(タイムアウトやOOMなど)と実際のモデルの障害(不正確なコードなど)を分離し、誤解を招くベンチマークスコアを防ぎます。
仕組み
VeriRunは、実行を一連のバージョン管理された不変のマニフェストとして扱う、エビデンスファーストのインフラストラクチャを実装しています。インテントと永続的な状態を管理するコントロールプレーンと、再試行可能な試行を処理する実行プレーンを使用します。安全性を確保するために、ダイジェスト固定のDockerコンテナや、セキュアな境界を提供するgVisorを備えたKubernetesジョブなど、分離された実行層を採用しています。EvalPlusやLiveCodeBenchなどの既存のベンチマークを置き換えるのではなく統合し、その下のオーケストレーションと分離層として機能します。
対象ユーザー
LLMやAIエージェントを構築する研究者や開発者向けに設計されており、実行可能な評価を実行し、ポストトレーニングループのオンライン報酬を計算するための、信頼性が高く再現可能な方法を必要としています。
ハイライト
- 不変の来歴: すべての結果は、使用された特定のベンチマーク、プロンプト、モデルリビジョン、ランタイムポリシーにリンクされています。
- 構造化された障害セマンティクス: エラーをコンパイルエラー、テスト失敗、タイムアウト、OOM、インフラストラクチャ障害に明確に分類します。
- 永続的なコントロールプレーン: PostgreSQLとS3互換ストレージを使用して、冪等な結果と障害からの回復を保証します。
- 分離された実行: KubernetesとgVisorを使用したセキュリティ重視のランタイムを提供し、信頼できないコードを安全に実行します。
- 決定論的なリプレイ: 凍結された候補をモデルを再呼び出しせずに再検証でき、一貫性を保証します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト