TITLE: DiScoFormer: 用于密度和得分的单一Transformer,跨越分布
DiScoFormer: 用于密度和得分的单一Transformer,跨越分布
DiScoFormer(密度和得分Transformer)是一种基于Transformer的模型,旨在从给定的一组数据点估计分布的密度和得分。与传统方法不同,它在一次前向传播中提供这两个估计,而无需为每遇到的新分布重新训练模型。
技术架构与机制
DiScoFormer 使用共享的Transformer骨干网络和两个专门的输出头:一个用于密度,一个用于得分。此架构利用了得分是对数密度梯度的数学关系。
交叉注意力与KDE泛化
该模型利用交叉注意力在任意任意点(而不仅仅是现有数据点的位置)评估密度和得分。研究者从理论上表明,单个注意力头的权重几乎是高斯核,使得Transformer架构成为核密度估计(KDE)的严格泛化。虽然KDE对所有点使用单一固定带宽,但DiScoFormer学习多个尺度并将其适应于数据。
用于分布外适应的一致性损失
由于得分头必须匹配对数密度头的梯度,两者之间的任何差异都可作为无标签的一致性损失。在推理过程中,模型可以通过在保持上下文固定的情况下在此一致性损失上进行梯度步骤来适应分布外输入,而不需要真实密度或得分标签。
训练方法论
DiScoFormer 使用高斯混合模型(GMMs)进行训练。选择GMM是因为它们是通用的密度近似器,并且提供闭形式的密度和得分以进行精确监督。为了为模型提供几乎无限的示例,每个训练批次都会抽取一个新的GMM。
性能与基准
DiScoFormer 在所有测试的指标上均优于核密度估计(KDE),随着维度的增加,性能差距会扩大。
- 高维精度:在100维下,DiScoFormer 将得分误差降低约6.5倍,密度误差降低超过37倍,优于最佳手动调优的KDE。
- 泛化能力:该模型在训练过程中未见过的分布上仍然保持准确,包括非高斯形状(如Student-t和拉普拉斯分布),以及比训练过程中遇到的更多模式的混合分布。
- 效率:虽然KDE在非常小的数据集上仍然更快,但DiScoFormer在更多样本时具有更好的可扩展性,并且不会在高维情况下遭受与KDE相同的内存限制。
对机器学习和科学的影响
得分估计是生成建模(如基于扩散的图像生成器)、贝叶斯推断和科学计算(例如等离子体模拟)中的关键组成部分。DiScoFormer 提供了一种预训练的插件式估计器,消除了为每个特定问题重新训练模型的需求,从而可能在这些不同领域降低计算成本。