DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布
DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布
DiScoFormer(密度與分數 Transformer)是一種基於 Transformer 的模型,旨在從給定的資料點集合估計分布的密度與分數。與傳統方法不同,它能在單次前向傳遞中同時提供這兩個估計,而無需為每遇到的新分布重新訓練模型。
技術架構與機制
DiScoFormer 使用共享的 Transformer 主幹,並有兩個專門的輸出頭:一個用於密度,另一個用於分數。此架構利用了分數是對數密度梯度的數學關係。
交叉注意力與 KDE 泛化
該模型利用交叉注意力在任意任意點(而不僅僅是現有資料點的位置)評估密度與分數。研究者從理論上表明,單一注意力頭的權重幾乎是高斯核,使得 Transformer 架構成為核密度估計(KDE)的嚴格泛化。儘管 KDE 對所有點使用單一固定帶寬,DiScoFormer 會學習多個尺度並根據資料進行適應。
用於分布外適應的一致性損失
由於分數頭必須與對數密度頭的梯度匹配,兩者之間的任何差異都可作為無標籤的一致性損失。在推理期間,模型可以透過在固定上下文的情況下對此一致性損失進行梯度下降步驟來適應分布外的輸入,而不需要真實標籤的密度或分數。
訓練方法
DiScoFormer 使用高斯混合模型(GMM)進行訓練。選擇 GMM 是因為它們是通用的密度近似器,並提供封閉形式的密度與分數以進行精確監督。為了為模型提供幾乎無限的範例,訓練的每個批次都會抽取一個新的 GMM。
效能與基準測試
DiScoFormer 在所有測試的指標上均優於核密度估計(KDE),且隨著維度增加,性能差距會擴大。
- 高維度準確性:在 100 維度下,DiScoFormer 的分數誤差約減少 6.5 倍,密度誤差減少超過 37 倍,相較於最佳手動調整的 KDE。
- 泛化能力:該模型在訓練期間未見過的分布上仍能保持準確,包括非高斯形狀,如 Student-t 和 Laplace 分布,以及比訓練期間遇到的更多模態的混合分布。
- 效率:儘管 KDE 在非常小的資料集上仍然更快,但 DiScoFormer 隨著樣本數增加而擴展得更好,且在高維度下不會遭遇與 KDE 相同的記憶體限制。
對機器學習與科學的影響
分數估計是生成模型(例如擴散基礎圖像生成器)、貝葉斯推斷以及科學計算(例如等離子體模擬)中的關鍵組成部分。DiScoFormer 提供了一個預訓練的即插即用估計器,消除了為每個特定問題重新訓練模型的需求,從而在這些多樣化的領域中潛在地降低計算成本。
摘要: DiScoFormer 是一種新的基於 Transformer 的模型,能在單次前向傳遞中從一組資料點估計分布的密度與分數,且無需為新分布重新訓練。
標題: DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布