解除 LLM 瓶頸:多流架構的興起

多年來,大型語言模型 (LLMs) 的基本架構一直保持著驚人的靜態性。從 ChatGPT 的早期階段到如今最先進的自主代理 (autonomous agents),核心互動模式始終是訊息的序列交換。無論是代理與使用者互動、呼叫工具,還是進行「思維鏈」(chain-of-thought) 的內部對話,一切都在單一、線性的計算流中發生。

這種序列特性造成了顯著的運作瓶頸。在標準的對話式模型中,代理在閱讀時無法採取行動(生成輸出);在寫作時無法對新資訊做出反應;且在同時進行行動或閱讀時無法思考。這種「走走停停」的節奏限制了 AI 代理的流暢度與效率,特別是在需要即時反應能力的複雜程式碼編寫或電腦使用應用程式中。

多流方法:將思考與行動並行化

A 來自 Max Planck Institute for Intelligent Systems 的新研究論文,題為 "Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs," 提出了一種模型微調方式的根本性轉變。研究人員建議,不再針對序列訊息格式進行指令微調 (instruction-tuning),而是針對多個並行的計算流進行模型微調。

在此架構中,不同的角色——例如使用者、系統、模型的內部思考,以及工具輸出——被拆分為獨立的流。在語言模型的每一次前向傳播 (forward pass) 期間,系統會同時從多個輸入流中讀取,並在多個輸出流中生成 token。至關重要的是,這些流在因果關係上仍依賴於先前的時間步 (timesteps),以確保模型在打破線性限制的同時,仍能保持連貫性。

並行流的核心優勢

從單一流轉向多流格式,相較於傳統的 LLM 互動,提供了幾項系統性的改進:

1. 增強可用性與反應能力

透過解耦輸入與輸出程序,模型幾乎可以立即開始「思考」——通常在輸入的第一個 token 到達後僅一個時間步之後。這消除了在等待完整訊息被處理完畢後才能開始回應所產生的延遲。

2. 提升模型安全性

關注點分離 (separation of concerns) 是安全系統設計的基石。研究人員認為,多流模型透過隔離不同類型的數據來提升安全性。社群討論指出,可學習的流嵌入 (stream embeddings) 可能在此扮演關鍵角色,使模型對於旨在洩露秘密或繞過系統提示詞 (system prompts) 的對抗性攻擊更具韌性。

3. 運作效率與可監控性

並行化自然會帶來更好的效率。此外,由於思考、行動與輸入被拆分為不同的流,人類操作員或自動化監控工具將變得更容易追蹤模型的內部推理過程,而不會與最終輸出糾纏在一起。

技術影響與未來方向

雖然結果令人期待,但社群注意到目前的研究是基於在有限指令數據上訓練的相對較小模型。如論文中所述:

"However, our models are nevertheless relatively small and trained on tiny amounts of instruction examples, compared to the scale of modern instruction data and multiple post-training stages used to reinforce the default message-based format."

儘管有此限制,技術觀察家建議這種方法可以有效地擴展,並可能與 LLM 開發中的其他新興趨勢結合。例如,「思考流」可能純粹在嵌入空間 (embedding space) 中運作(類似於 Meta 的 Coconut),從而無需為內部推理提供語言模型頭 (language model head)。也有推測認為,這種架構可以讓模型更直接地在位元組 (bytes) 上運作,從而繞過與 tokenization 相關的一些傳統挑戰。

結論

Multi-Stream LLMs 代表了從「聊天機器人」範式向真正的「代理式」(agentic) 架構的轉變。透過將思考、輸入與輸出視為並行程序而非一系列的輪次,我們正趨向於能夠即時推理與行動的系統,這能反映出人類智能中更流暢的認知過程。

Sources