wisent-ai/ster
解決する課題
Sterは、オープンウェイト言語モデルの動作を制御・変更するために設計されたネイティブRust製ツールキットです。大規模な計算リソースや複雑な分散学習環境を必要とせずに、モデルの出力を特定の特性(真実性など)に向けて精密に誘導したり、パフォーマンス向上のために重みをファインチューニングしたりする問題を解決します。
動作原理
SterはCandleランタイム上に構築されたカスタムLlamaデコーダーループを使用し、モデルの内部隠れ状態と相互作用します。主に以下の2つのメカニズムを通じて機能します:
- 活性化誘導: トランスフォーマー層から隠れ状態を読み取り、対照的な例(正と負のテキストのペア)から「方向」を学習します。これらの方向は、生成中に残差ストリームに追加され、モデルを望ましい特性に向けて押し出します。
- ファインチューニング: 教師ありファインチューニング、直接選好最適化(DPO)、グループ相対方策最適化(GRPO)など、さまざまな目的関数を使用して低ランクアダプタ(LoRA)を訓練します。Bradley-Terry報酬モデルの訓練も可能です。
対象ユーザー
オープンウェイトモデル(特にLlamaファミリー)を扱い、表現の読み取り、活性化誘導、効率的なローカルファインチューニングを実行したい開発者や研究者を対象としています。
ハイライト
- ネイティブRust実装: Candleを使用して構築され、高いパフォーマンスとCPU、Metal、CUDAをサポートします。
- 対照的学習: 誘導のための対照的ペアセットを合成、検査、評価するためのツール。
- 柔軟なチューニング: ローカルトレーニングのためのLoRA、DPO、IPO、GRPO目的関数に対応。
- cedores: アダプタをベース重みにマージするか、生成中に凍結された成果物として適用する機能。
- 統合ワークフロー: 方向の訓練、ベクトルの評価、誘導された生成の実行のための完全なCLI。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト