Anthropic 研究:分散式表示、組合與疊加

Anthropic 的研究指出,神經網路中的分散式表示可以分為兩個截然不同的概念:組合(composition)與疊加(superposition)。雖然兩者都能讓網路表示資訊,但它們運作的原理不同,並在函數如何進行線性計算以及網路如何泛化方面,產生了根本性的權衡與張力。

分散式表示在機械解釋性中的角色

將表示分解為獨立組件對於理解神經網路以及克服「維度災難」至關重要。透過分析模型如何表示數據,研究人員可以從不透明的權重轉向分析師真正可以理解的獨立成分分析。

組合 vs. 疊加:概念框架

Anthropic 將「組合」與「疊加」區分為在神經元集合中表示資訊的兩種不同方式。這兩種分散式表示的概念在泛化能力以及可以從中線性計算出的函數類型方面,具有不同的特性。

組合

組合涉及透過結合不同的獨立特徵來表示一個概念。例如,如果一個網路需要表示不同顏色的形狀,它可能會為「紅色」和「正方形」使用一組獨立的神經元,並將它們結合起來表示「紅色正方形」。

疊加

疊加是一種機制,讓網路能表示比其維度(神經元數量)更多的特徵,方法是將特徵視為空間中的方向,而非單一神經元。這使得網路能夠將比傳統局部編碼(local code)更多的資訊壓縮進較少數量的神經元中。

分析表示編碼

為了說明這些差異,Anthropic 引用了 Thorpe (1989) 的研究。Thorpe 對「局部」、「半局部」、「半分散」與「高度分散」編碼的範例——傳統上被視為從局部到分散的光譜——可以被重新想像為在兩個不同維度上的變化:疊加與組合。

透過專注於二進位激活(binary activations),該研究簡化了可能性空間,同時保持了足夠豐富的環境,以探索這兩種機制如何相互作用,以及網路如何表示特徵。

Sources

相關