DiScoFormer: 分布にわたる密度とスコアのための単一トランスフォーマー
DiScoFormer: 分布にわたる密度とスコアのための単一トランスフォーマー
DiScoFormer(Density and Score Transformer)は、与えられたデータ点のセットから分布の密度とスコアを推定するように設計されたトランスフォーマーベースのモデルです。従来の方法とは異なり、モデルを新しい分布ごとに再トレーニングする必要なく、単一のフォワードパスで両方の推定値を提供します。
技術的アーキテクチャとメカニズム
DiScoFormerは、密度用とスコア用の2つの専用出力ヘッドを持つ共有トランスフォーマーバックボーンを使用します。このアーキテクチャは、スコアが対数密度の勾配であるという数学的関係を活用しています。
クロスアテンションとKDEの一般化
このモデルは、既存のデータ点の場所だけでなく、任意の任意の点において密度とスコアを評価するためにクロスアテンションを利用します。研究者たちは解析的に、単一のアテンションヘッドの重みがほぼガウシアンカーネルであることを示し、これによりトランスフォーマーアーキテクチャはカーネル密度推定(KDE)の厳密な一般化となっています。KDEはすべての点に対して単一の固定帯域幅を使用するのに対し、DiScoFormerは複数のスケールを学習し、データに適応させます。
外部分布適応のための整合性損失
スコアヘッドは対数密度ヘッドの勾配と一致しなければならないため、その間の不一致はラベルフリーの整合性損失として機能します。推論時に、モデルはコンテキストを固定したままこの整合性損失に対して勾配ステップを取ることで、外部分布の入力に適応することができ、その際に真の密度またはスコアラベルは必要ありません。
トレーニング方法論
DiScoFormerはガウス混合モデル(GMM)を使用してトレーニングされました。GMMは普遍的な密度近似器であり、Exactな監督のために閉形式の密度とスコアを提供するため選ばれました。モデルにほぼ無制限の例を提供するため、各トレーニングバッチごとに新しいGMMがサンプリングされました。
パフォーマンスとベンチマーク
DiScoFormerは、すべてのテスト済みメトリクスにおいてカーネル密度推定(KDE)を上回り、次元数が増えるにつれて性能差が広がります。
- 高次元精度: 100次元において、DiScoFormerはスコア誤差を約6.5倍、密度誤差を37倍以上削減し、最もよくチューニングされたKDEと比較しています。
- 一般化: トレーニング中に見なかった分布においても、Student-t分布やラプラス分布などの非ガウス形状、およびトレーニング中に遭遇したより多くのモードを持つ混合分布においても、モデルは正確性を保ちます。
- 効率: KDEは非常に小さなデータセットでは依然として高速ですが、DiScoFormerはサンプル数が増えるにつれてより良いスケーラビリティを示し、高次元においてKDEと同じメモリ制限に苦しむことはありません。
機械学習と科学へのインプリケーション
スコア推定は、生成モデリング(拡散ベースの画像ジェネレーターなど)、ベイズ推論、および科学計算(例えばプラズマシミュレーション)において重要なコンポーネントです。DiScoFormerは、事前に訓練されたプラグイン型推定器を提供し、特定の問題ごとにモデルを再トレーニングする必要をなくすことで、これらの多様な分野における計算コストを潜在的に削減します。