Poolside 的 Model Factory、Laguna S 與開放模型:Eiso Kant 談如何為 AGI 構建程式碼模型

Poolside 的 Model Factory、Laguna S 與開放模型:Eiso Kant 談如何為 AGI 構建程式碼模型

Model Factory 實現快速實驗

Poolside 的 Model Factory 透過整合串流數據、版本化程式碼與自動化代理,將模型開發週期從數月縮短至數週。 團隊已從六個月的模型週期,轉向為 Laguna XS2 和 Laguna S 等模型提供五至八週的發布週期。 他們每月進行 10,000 到 20,000 次實驗,對機器的信任程度高到前一天所做的更改可以在下一次運行中直接採用。 代理(Agents)負責編寫程式碼、啟動訓練任務、評估結果並修改流水線,縮小了人工參與的環節。 不可變數據與版本化程式碼提供了完美的再現性,允許任何實驗都能精確地重新執行。

Laguna S 優先考慮持續性而非原始智能

Laguna S 透過驗證、回溯和持續推理而非單純依賴規模來實現強大性能。 該模型總參數為 1,180 億,其中 80 億為活躍參數,可運行於 DGX Spark 上,運行速度約為每秒 30-40 個 tokens。 應用研究共同負責人 Peng 表示,Laguna S 的進步「並非來自更高的智能,而是來自不同的行為、更多的驗證、減少對既定事實的假設、不輕言勝利,以及更強的持續性」。 該模型可以獨立解決 Erdos 397 問題,並透過不斷嘗試與錯誤,在不依賴外部函式庫的情況下處理複雜的程式設計任務。

開放權重與開放研究有所不同

僅發布模型權重並不足以實現複製;真正的開放需要分享研究細節。 給予某人權重並不能讓他們重現你的工作,因為底層的研究、數據混合與訓練流水線仍然是隱藏的。 因此,Poolside 發布技術報告來詳細說明模型是如何構建的,包括數據來源、優化器選擇和訓練程序。 他們將開放研究視為一種有意義的貢獻,讓其他人可以從數以萬計的實驗中學習。

全球人才策略避開灣區競爭

Poolside 在灣區之外建立了一個分散式團隊,以獲取全球專業知識並避免人才爭奪戰。 從第一天起,創辦人就決定不在灣區招聘任何研究人員,而是從美國中部到塞爾維亞、台灣和新加坡進行全球搜尋。 他們在巴黎和倫敦開設了辦公室,同時在美國保持業務,因為他們相信最好的創新想法不會侷限於單一區域。 這種全球化方法為團隊帶來了韌性與持續性,多年來離職人數極少。

模型構建主要是工程問題

基礎模型開發中超過 90% 的工作是工程,而非理論突破。 Poolside 早期的觀點是,模型構建最終 90% 是工程,研究人員大部分時間花在編寫程式碼、檢查數據和執行實驗上。 該公司將此過程視為一個工業化系統,其中每個組件——數據流水線、分散式訓練、可靠性——都有其自身的機制。

數據與運算效率驅動進步

提高數據質量或運算效率佔據了模型構建的大部分進展。 Eiso 估計,90% 的模型構建可以簡化為兩個槓桿:更好的數據或更好的運算效率。 諸如低精度訓練(Laguna S 使用 FP8)和更聰明的網絡技術等進步,從現有硬體中榨取了更多能力。 更好的數據涉及過濾、清洗、轉換,以及創建在訓練早期教導模型進行推理的課程。

串流數據與再現性加速研究

將數據直接餵入訓練並維護不可變數據集,可以實現快速且值得信賴的實驗。 Poolside 不是在每次運行前都實體化完整的數據集,而是即時(just-in-time)串流數據,因此在其他數據仍在傳輸時即可開始訓練。 數據層被視為不可變,程式碼則是版本化的,這讓研究人員可以將每個 token 追溯到其確切的來源和程式碼版本。 這種再現性將早期的 YOLO 式運行轉變為嚴謹的科學實驗,每次嘗試都是一次乾淨的消融實驗(ablation)。

代理自動化 Model Factory

代理現在負責編寫程式碼、啟動訓練任務、評估結果並修改流水線,減少了人工參與的時間。 走在辦公室裡,Eiso 看到研究人員的螢幕上充滿了正在編寫程式碼、提交任務、檢查結果並調整訓練基礎設施的代理。 這些代理同時運作於預訓練與後訓練流水線以及合成數據生成,並開始影響架構決策。 這種自動化創造了遞歸自我改進(recursive self-improvement)的早期跡象,即系統改進其自身的訓練過程。

強化學習將提前介入

Eiso 預期強化學習將移至預訓練階段,以便更早教導推理能力。 他持有一個非主流的觀點,即 RL 將越來越早進入預訓練,而不是作為一個獨立的後訓練階段。 早期的 RL 可以在模型仍在接觸原始網頁文本時就誘導出推理能力,將下一個 token 預測轉化為一個思考過程。

下一個 Token 預測未能充分利用網絡知識

目前的預訓練從網絡中提取的資訊太少;需要更好的方法將原始文本轉化為推理。 Eiso 主張,下一個 token 預測的預訓練是不夠的,我們從網絡中榨取出的東西還遠遠不夠。 研究正在進行中,旨在利用網絡作為一種方式,在訓練早期教導模型思考,超越純粹的統計預測。

視覺模態優先於音訊

Poolside 將視覺理解視為語言之後的下一步,推遲了音訊工作。 模型目前缺乏視覺理解能力,但團隊認為這非常重要,並已開始著手構建。 音訊並非近期重點,因為 Eiso 不認為它能讓系統更接近 AGI,他更傾向於將運算資源投入到語言和視覺上。

Poolside 的命名與雄心

Poolside 這個名字提醒著創辦人們永遠不要降低雄心,這靈感來自會議上的一次偶遇。 在與一位潛在合作夥伴的早期對話中,首席科學家建議移步到餐廳的池畔(poolside),這個名字便留了下來,作為追求艱難道路而非輕易接受收購協議的提醒。 它象徵著在構建基礎模型時,拒絕對雄心進行「向下取整」。

融資與投資者的懷疑

儘管許多投資者仍懷疑 AGI 的可行性,Poolside 仍籌集了 5 億美元。 在融資輪期間,大部分投資者對話仍在試圖解釋這些模型不僅僅是隨機鸚鵡,而且會持續改進。 儘管對於 AGI 是否為現實的近期前景存在懷疑,資金仍被成功籌集。

過度限制開放模型的風險

過早限制開放模型的發布可能會導致權力集中並阻礙創新。 Eiso 寧願看到有 100 家基礎模型公司,也不願看到只有 5 家的世界,即使 Poolside 是其中之一。 他警告說,限制開放發布的監管或安全考量可能會意外創造出兩三家 AI 公司的寡頭壟斷,就像香菸廣告禁令鞏固了少數菸草公司一樣。

硬體瓶頸與 RL 的牆鐘時間

儘管硬體有所進步,受限於批次大小(batch size)的強化學習牆鐘時間(wall-clock time)仍是一個主要瓶頸。 由於 RL 任務是有限的,增加批次大小很困難,因此擴展 RL 的運算規模並不會遵循與預訓練相同的曲線。 Eiso 將此視為 Poolside 目前最大的瓶頸之一,並期待能夠在不同晶片之間分離預填充(prefill)與解碼(decode)的技術,以提高 RL 的效率。

從零開始訓練而非蒸餾

Poolside 從零開始訓練模型,而不是簡單地蒸餾更大的模型,以保留完整的研究控制權。 蒸餾會隱藏從訓練過程中學到的經驗,使得改進 Model Factory 變得更加困難。 從零開始訓練讓團隊能夠研究每個數量級下的穩定性、數據混合和優化器行為,並將這些洞察回饋給系統。

招聘涵蓋所有模型構建職能

該公司為預訓練、後訓練、架構、評估和工程職位招募研究人員和工程師。 Poolside 在模型構建的全譜系中進行招聘,尋求能夠對實驗和基礎設施負起責任的高主動性(high-agency)人才。 憑藉不到 70 名研究人員和約 35 名工程師,每一次招聘對 Model Factory 的速度和能力都有著巨大的影響。

Sources