對比語言模型(CLM)用於快速代理決策
對比語言模型(CLMs)透過將動作選擇視為檢索問題而非生成問題,實現高速代理決策。透過使用對比學習目標,將狀態與動作嵌入對齊於共享空間,CLM-8B 在電腦使用、遊戲和工具調用任務中表現可與 Jev 相媲美,同時將延遲降低最多 9 倍。
架構:分離的狀態與動作編碼器
CLM 以雙編碼器架構取代標準的自回歸(AR)生成流程。系統由狀態編碼器與動作編碼器組成,兩者均使用凍結的 LLM 骨幹,後接可訓練的 MLP 投影頭(約 20M 參數)。
- 機制:兩個編碼器將各自的輸入映射至共享嵌入空間。狀態-動作對的分數由其嵌入之間的餘弦相似度計算得出。
- 推理效率:由於狀態與動作是分離的,其嵌入可獨立快取。在動作集固定的環境中(例如 Super Mario),模型只需在每一步重新計算狀態嵌入,重用快取的動作嵌入。這將計算成本從多次前向傳播降低至每步一次傳播。
- 擴展性:在約 1,000 個候選動作的情況下,CLM 報告比 Jev 快 13 倍。
訓練流程與擴展定律
CLM 以三個不同階段訓練,逐步優化狀態-動作對齊:
- 預訓練:模型在約 60M 個 Nemotron Q&A 對上訓練,使用雙向 InfoNCE 損失,其中問題視為狀態,答案視為動作。這建立了廣泛的語義表示。
- 中段訓練:模型接觸到由 Gemini 2.5 Flash-Lite 生成的約 30M 個合成難負例。這些是語義相近但錯誤的答案,旨在提升細粒度區分能力。
- 後訓練:模型在 Agent Data Protocol(ADP)資料集的約 1M 個代理軌跡,以及 Endless-Terminals 和 LiteCoder-Terminal-SFT 的終端追蹤上訓練,以適應代理環境中的表示空間。
為防止後訓練期間發生災難性遺忘,團隊使用資料重播的共同訓練,混合 40% 的 Nemotron DQA 範例與 60% 的代理軌跡。
擴展定律:測試對比損失與訓練計算量、資料集大小、投影頭大小和編碼器大小呈冪律關係。擴展編碼器大小帶來最強的性能提升。最佳投影頭大小($N^*$)隨訓練詞元數量($D^{1.02}$)線性增長,平均約每參數 310 個詞元。
性能與基準測試
CLM-8B 展現出強大的驗證能力,特別是在作為獎勵模型,從其他模型(例如 Opus 5 或 Fable 5)採樣的多個候選解中選擇最佳解時。
- 代理編碼:CLM 在 DeepSWE(81.6%)和 Terminal Bench 2.1(87.6%)上達到當前最佳(SOTA)表現。
- 延遲:在 H100 GPU 上,CLM 在驗證任務上的推理速度比 Jev 快 4-6 倍。
- 泛化能力:預訓練重塑了模型的表示,使其進入一個有用的決策空間,能正確地將正確答案的排名高於基線 LLM 嵌入(例如 Qwen3-8B)。
社群見解與技術批判
技術使用者之間的討論突顯了對 CLM 方法的幾個關鍵觀點:
- 驗證 vs. 生成:一些使用者指出,DeepSWE 上的高分是透過作為驗證者(從多個候選解中選擇最佳者)實現的,而非從頭生成解。
- 歸納偏見:批評者認為,雖然餘弦相似度在獨立編碼向量上的應用對大 K 的語義動作匹配(如 WikiRacing)有效,但在「類型化決策」負載(如日期運算或否定鏈)上可能表現不佳。
- 術語使用:對於使用「System One」一詞描述該模型存在反對意見,使用者認為 Kahneman 框架描述的是人類認知過程,而非用於 AI 模型的速度分類。
- 硬體效率:在單一 RTX 4090 上約一小時內即可訓練投影頭,使此架構對使用消費級硬體的開發者尤其具有吸引力。
"我認為這種方法真的很棒,它確實暗示我們可能能夠使用現代 LLM 來處理輸入,然後以非常快速、非 AR 的方式提取模型的下一個代理步驟,其結果與傳統 AR 解碼相比也相當優異。"
未來路線圖
該專案正擴展至多模態 CLM-35B,目前正處於訓練中。未來目標包括將架構擴展至支援影像與影片,以應用於機器人與電腦使用任務,並進一步擴展硬負例挖掘與代理後訓練的資料配方。
Sources
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch