aaron-for-value/VeriRun

Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.

解决的问题

VeriRun 提供了一个用于评估可执行代码和 AI 代理的分布式运行时。它解决了大规模运行不可信模型生成代码的挑战,确保结果可复现、可恢复且安全。它明确区分了基础设施故障(如超时或内存不足)和实际模型故障(如错误代码),防止产生误导性的基准分数。

工作原理

VeriRun 实现了一种证据优先的基础设施,将执行视为一系列版本化、不可变的清单。它使用控制平面来管理意图和持久状态,并使用执行平面来处理可重试的尝试。为了确保安全,它采用了隔离的执行层,包括摘要固定的 Docker 容器和带有 gVisor 的 Kubernetes 作业,以提供安全边界。它与 EvalPlus 和 LiveCodeBench 等现有基准集成,而不是取代它们,充当其下的编排和隔离层。

适用对象

它专为构建 LLM 或 AI 代理的研究人员和开发人员设计,他们需要一种可信赖、可复现的方式来运行可执行评估,并为后训练循环计算在线奖励。

亮点

  • 不可变来源:每个结果都链接到所使用的特定基准、提示、模型版本和运行时策略。
  • 结构化失败语义:将错误明确分类为编译错误、测试失败、超时、内存不足和基础设施故障。
  • 持久控制平面:使用 PostgreSQL 和兼容 S3 的存储,确保幂等结果和故障恢复。
  • 隔离执行:提供使用 Kubernetes 和 gVisor 的安全运行时,安全执行不可信代码。
  • 确定性重放:允许在不重新调用模型的情况下重新验证冻结的候选,确保一致性。

相关

  • 项目
  • 项目
  • 项目
  • 项目