adrida/tracer

TRACER: replace 90%+ of your LLM classification calls with a traditional ML model. Formal parity guarantees. Self-improving.

解决的问题

TRACER 通过将「简单」输入路由到快速、轻量的传统机器学习模型(代理模型),仅将「困难」或不确定的输入延迟到昂贵的 LLM,从而降低基于 LLM 的分类流水线的成本和延迟。这使得开发者能够在显著降低 API 成本和推理时间的同时,保持教师 LLM 的质量。

工作原理

TRACER 使用嵌入、代理模型和接受门的流水线:

  1. Fit:在现有的 LLM 分类轨迹(输入-标签对)上训练一系列候选传统机器学习模型(如逻辑回归或梯度提升树)。
  2. Gate:附加一个学习到的接受门,用于预测代理模型是否与教师 LLM 一致。
  3. Calibrate:调整接受门阈值,以满足特定的目标一致性(例如,与 LLM 保持 95% 一致)。
  4. Guard:如果代理模型在保留数据上无法达到质量标准,则阻止部署。
  5. Flywheel:LLM 处理的每个延迟输入都会生成新的轨迹,用于重新训练代理模型,从而随着时间推移提高覆盖范围。

适用人群

使用 LLM 构建分类系统的开发者和 ML 工程师,希望在不牺牲准确性的前提下降低运营成本和延迟。

亮点

  • 成本效率:可将 90% 以上的流量路由到传统 ML,大幅减少 LLM API 调用。
  • 自我改进:采用持续学习飞轮机制,延迟调用会反馈到训练集中,实现模型持续优化。
  • 形式化一致性保证:确保代理模型在定义的阈值内与教师 LLM 输出保持一致。
  • 可观测性:包含「watch」功能,可将 LLM 调用记录为本地或通过 Tracer Cloud 的 OpenTelemetry GenAI span。
  • 多语言支持:提供 Python 库和 JavaScript/Node.js 集成,支持可观测性和路由。

相关

  • 项目
  • 项目
  • 项目
  • 项目