wisent-ai/ster

解決する課題

Sterは、オープンウェイト言語モデルの動作を制御・変更するために設計されたネイティブRust製ツールキットです。大規模な計算リソースや複雑な分散学習環境を必要とせずに、モデルの出力を特定の特性(真実性など)に向けて精密に誘導したり、パフォーマンス向上のために重みをファインチューニングしたりする問題を解決します。

動作原理

SterはCandleランタイム上に構築されたカスタムLlamaデコーダーループを使用し、モデルの内部隠れ状態と相互作用します。主に以下の2つのメカニズムを通じて機能します:

  1. 活性化誘導: トランスフォーマー層から隠れ状態を読み取り、対照的な例(正と負のテキストのペア)から「方向」を学習します。これらの方向は、生成中に残差ストリームに追加され、モデルを望ましい特性に向けて押し出します。
  2. ファインチューニング: 教師ありファインチューニング、直接選好最適化(DPO)、グループ相対方策最適化(GRPO)など、さまざまな目的関数を使用して低ランクアダプタ(LoRA)を訓練します。Bradley-Terry報酬モデルの訓練も可能です。

対象ユーザー

オープンウェイトモデル(特にLlamaファミリー)を扱い、表現の読み取り、活性化誘導、効率的なローカルファインチューニングを実行したい開発者や研究者を対象としています。

ハイライト

  • ネイティブRust実装: Candleを使用して構築され、高いパフォーマンスとCPU、Metal、CUDAをサポートします。
  • 対照的学習: 誘導のための対照的ペアセットを合成、検査、評価するためのツール。
  • 柔軟なチューニング: ローカルトレーニングのためのLoRA、DPO、IPO、GRPO目的関数に対応。
  • cedores: アダプタをベース重みにマージするか、生成中に凍結された成果物として適用する機能。
  • 統合ワークフロー: 方向の訓練、ベクトルの評価、誘導された生成の実行のための完全なCLI。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト