Subquadratic 與 1200 萬 Token 上下文窗口的追求
大型語言模型 (LLM) 的領域長期以來一直受限於「上下文窗口」(context window) 的掙扎——即模型在單次提示中能處理多少資訊的限制。雖然業界領導者已將這些限制推向 100 萬或 200 萬 token,但一個新進者 Subquadratic 聲稱已透過 1200 萬 token 的窗口打破了這一天花板。
這一躍進代表了 AI 如何處理海量數據集的潛在範式轉移,允許攝取整個程式碼庫、數千頁的文檔或詳盡的法律檔案,而無需進行激進的 RAG (Retrieval-Augmented Generation) 或複雜的分塊策略。
Subquadratic 的承諾
Subquadratic 的核心價值主張是能夠在巨大的 12M token 跨度內保持連貫性與檢索準確度。在實際應用中,這將允許開發者將整個企業級規模的專案餵給模型,使 AI 能夠理解深層的架構依賴關係,而這些關係在較小的窗口或碎片化的檢索方法中往往會丟失。
對許多人來說,這被視為 AI 數據壓縮與處理的一個根本性演進。正如一位觀察者所言,這種突破的影響可以與圖像領域引入 JPG 格式相提並論——一種在不犧牲輸出實用性的情況下,更有效地處理大量數據的方法。
技術懷疑與「黑箱」問題
儘管有著雄心勃勃的聲稱,技術社群仍保持謹慎。主要的爭議點在於缺乏正式的技術報告、白皮書或開源權重。在 AI 研究領域,這種規模的聲稱通常會伴隨著「大海撈針」(needle-in-a-haystack) 測試或對實現次二次方縮放 (subquadratic scaling) 所使用的注意力機制 (attention mechanism) 的詳細解釋。
Hacker News 上的社群成員表達了顯著的懷疑,幾位用戶表示,他們只會在模型卡 (model card) 或經過同行評審的論文發布後才會相信這些聲稱。缺乏透明度通常歸因於風險投資 (VC) 資助的初創公司性質,在這種情況下,專有技術優勢被嚴密守護以維持投資估值。
對底層架構的推測
雖然 Subquadratic 並未披露其方法論,但專家推測該技術可能依賴於先進的注意力機制。一種理論建議使用具有基於內容粒度的原生稀疏注意力 (native sparse attention),類似於在 DeepSeek 架構中看到的做法。透過避免標準自注意力 (self-attention) 的二次方成本——即計算需求隨序列長度呈指數級增長——Subquadratic 可能正在利用線性或對數縮放方法來處理 12M token 的負載。
海量上下文的實用性
除了技術可行性之外,對於大多數使用場景,12M token 窗口是否真的必要,也存在爭議。例如,Claude Code 等工具的使用者指出,100 萬 token 通常對於大多數編碼任務已足夠。
這為 LLM 設計的未來提出了一個關鍵問題:目標是無限擴展上下文窗口,還是改進模型管理該上下文的效率?海量窗口的潛在替代方案包括:
- Context Compaction: 總結之前的互動以節省空間。
- Memory Tools: 實施外部數據庫,讓模型可以動態查詢。
- Dynamic Windowing: 根據任務的複雜度調整上下文大小。
結論
Subquadratic 對 1200 萬 token 窗口的聲稱是一個大膽的斷言,可能會重新定義 AI 記憶的邊界。然而,直到該公司超越行銷聲稱並為其成就提供技術基礎,它仍然是一個投機性的里程碑。企業專有秘密與科學驗證的需求之間的緊張關係,繼續成為當開發 AI 軍備競賽的定義性特徵。