adrida/tracer

TRACER: replace 90%+ of your LLM classification calls with a traditional ML model. Formal parity guarantees. Self-improving.

何を解決するか

TRACERは、"簡単な"入力を高速で軽量な従来のMLモデル(サロゲート)にルーティングし、"難しい"または不確実な入力のみを高コストなLLMに延期することで、LLMベースの分類パイプラインのコストとレイテンシを削減します。これにより、開発者は教師モデル(teacher LLM)の品質を維持しつつ、APIコストと推論時間を大幅に削減できます。

仕組み

TRACERは、埋め込み(embeddings)、サロゲートモデル、およびアセプターゲートのパイプラインを使用します:

  1. Fit:既存のLLM分類トレース(入力-ラベルペア)上で、複数の候補となる従来のMLモデル(ロジスティック回帰や勾配ブースティング木など)を訓練します。
  2. Gate:サロゲートが教師LLMと一致するかを予測する学習済みのアセプターを付加します。
  3. Calibrate:特定のターゲットパリティ(例:LLMと95%一致)を満たすようにアセプターの閾値を調整します。
  4. Guard:保留データ上でサロゲートが品質基準を満たせない場合、デプロイを防止します。
  5. Flywheel:LLMによって処理されたすべての延期された入力は新しいトレースとなり、サロゲートの再適合に使用され、時間とともにカバレッジが向上します。

対象ユーザー

LLMを用いた分類システムを構築している開発者やMLエンジニアで、精度を損なうことなく運用コストとレイテンシを削減したい方。

特徴

  • コスト効率:90%以上のトラフィックを従来のMLにルーティング可能で、LLM API呼び出しを大幅に削減。
  • 自己改善型:延期された呼び出しをトレーニングデータにフィードバックする継続的学習のフライホイールを採用。
  • 形式的なパリティ保証:定義された閾値内でサロゲートが教師LLMの出力と一致することを保証。
  • 可視性:OpenTelemetry GenAIスパンとしてLLM呼び出しをローカルまたはTracer Cloud経由で記録する「watch」機能を提供。
  • 多言語対応:PythonライブラリとJavaScript/Node.js統合により、観測性とルーティングをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト