Thinking Machines Inkling 發布說明 / 新功能
Thinking Machines Inkling 發布說明 / 新功能
Thinking Machines 已發布 Inkling,這是一個巨大的 1 兆參數開放模型,能夠原生處理圖像、文字和音訊輸入。此發布具有重要意義,因為它提供了一個具備 100 萬個 token 上下文窗口的大規模多模態開放模型,並具備代理推理能力。
模型架構與功能
Inkling 是一個僅解碼器的多模態混合專家模型(MoE)。它採用了一種稀疏架構,總參數達到 975 億,其中在單次推理過程中有 41 億個參數是活躍的,從而實現更快的計算。
主要架構特徵
- 相對注意力: 而不是使用旋轉位置嵌入 (RoPE),Inkling 使用相對注意力,其中每個注意力層通過每個 token、每個頭的相對特徵投射直接在注意力 logits 中學習位置。
- 混合注意力: 模型採用全局注意力與滑動窗口注意力交替的混合方案,比例為 5:1,最終層使用全局注意力以獲得豐富的特徵表示。
- 短卷積 (SConv): 在隱藏狀態上應用一維卷積以處理局部表示,減少注意力和 MoE 模組的計算負載。
- 帶有共享專家的 MoE: 路由器在 256 個專家中執行 top-k 選擇,選擇 6 個路由專家和 2 個始終活躍的共享專家。
多模態處理
與依賴為每種模態使用單獨編碼器的模型不同,Inkling 使用相對簡單的多模態塔:
- 視覺: 階層 MLP 修補器逐步將像素合併為嵌入。該架構支援視訊處理的時間維度。
- 音訊: 音訊通過離散化的梅爾頻譜圖進行轉換,其中 100ms 的區塊被分類到梅爾頻譜圖箱中,然後進行嵌入。
推理與部署
Inkling 提供兩種主要格式:一種是需要 2 TB VRAM 的完整 BF16 檢查點,另一種是經良好校準的 NVFP4 變體,需要 600 GB VRAM。
支援的框架
- Transformers: 透過
transformers庫(版本 5.14.0+)中的any-to-anypipeline 提供第零天支援。使用者可以指定reasoning_effort級別,範圍從none到max。 - 高效能引擎: 模型在 SGLang(包含一個用於速度的自訂實作)、vLLM(針對生產服務優化)和 llama.cpp(透過 GGUF quants 進行本地部署)中受到支援。
- 本地部署: Unsloth 提供了 1-bit 精度量化,與原始模型相比可減少 95% 的 VRAM 消耗。
效能與基準測試
Inkling 在推理、代理和多模態基準測試中展現出具競爭力的效能。雖然它在許多領域表現出高熟練度,但效能會根據具體任務和推理努力程度而有所不同。
推理與事實性
在純文字推理 (HLE) 中,Inkling 得分 29.7%,落後於 Claude Fable 5 (53.3%) 和 GPT 5.6 Sol (47.2%) 等模型。然而,在 AIME 2026 的數學推理上,Inkling 展現出強大的能力,得分達到 97.1%。
代理與多模態效能
- 編碼: 在 SWEBench Verified 上,Inkling 達成 77.6%,與 Gemini 3.1 Pro (80.6%) 和 Claude Fable 5 (95.0%) 等模型具有競爭力。
- 視覺: 在 MMMU Pro (Standard 10) 上,Inkling 得分 73.3%。
- 音訊: 在 VoiceBench 上,Inkling 得到 91.4% 的分數。
後訓練與研究工具
Thinking Machines 為希望透過微調或強化學習適應模型的開發者提供以下工具:
- Tinker: 一個用於後訓練開放權重模型的管理工具,包含用於蒸餾和強化學習的配方書。
- OpenEnv: 一個用於使用 ECHO 算法訓練模型的代理強化學習環境工具,該算法允許模型在不需要單獨驗證器的情況下預測環境。
- 知識蒸餾: Inkling 可以使用 GOLD 演算法作為教師模型,以匹配不同分詞器的 token logits,來訓練較小的設備端模型。