aaron-for-value/VeriRun

Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.

解決する課題

VeriRunは、実行可能なコードとAIエージェントを評価するための分散ランタイムを提供します。大規模な信頼できないモデル生成コードの実行という課題に対処し、結果が再現可能で、回復可能で、安全であることを保証します。具体的には、インフラストラクチャの障害(タイムアウトやOOMなど)と実際のモデルの障害(不正確なコードなど)を分離し、誤解を招くベンチマークスコアを防ぎます。

仕組み

VeriRunは、実行を一連のバージョン管理された不変のマニフェストとして扱う、エビデンスファーストのインフラストラクチャを実装しています。インテントと永続的な状態を管理するコントロールプレーンと、再試行可能な試行を処理する実行プレーンを使用します。安全性を確保するために、ダイジェスト固定のDockerコンテナや、セキュアな境界を提供するgVisorを備えたKubernetesジョブなど、分離された実行層を採用しています。EvalPlusやLiveCodeBenchなどの既存のベンチマークを置き換えるのではなく統合し、その下のオーケストレーションと分離層として機能します。

対象ユーザー

LLMやAIエージェントを構築する研究者や開発者向けに設計されており、実行可能な評価を実行し、ポストトレーニングループのオンライン報酬を計算するための、信頼性が高く再現可能な方法を必要としています。

ハイライト

  • 不変の来歴: すべての結果は、使用された特定のベンチマーク、プロンプト、モデルリビジョン、ランタイムポリシーにリンクされています。
  • 構造化された障害セマンティクス: エラーをコンパイルエラー、テスト失敗、タイムアウト、OOM、インフラストラクチャ障害に明確に分類します。
  • 永続的なコントロールプレーン: PostgreSQLとS3互換ストレージを使用して、冪等な結果と障害からの回復を保証します。
  • 分離された実行: KubernetesとgVisorを使用したセキュリティ重視のランタイムを提供し、信頼できないコードを安全に実行します。
  • 決定論的なリプレイ: 凍結された候補をモデルを再呼び出しせずに再検証でき、一貫性を保証します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト