AI 與前沿技術彙報 – 模型縮放、代理路由器及真實世界機器人

TL;DR: 開源 LLMs 正變得更快且更大,智慧路由器正在為編碼代理降低推理成本,而多家新創正在建設基礎設施,將 AI 代理從模擬移至真實世界機器人。

開源模型縮放與性能

  • Maple‑Preview 是一個 20B 三元權重 LLM,能解決 IMO 級問題,並在 Mac Mini M4 上以 200+ tokens/s 運行,聲稱比 Gemma 4 和 Qwen 3.5 快 5–16× @deepgrove_ai
  • DeepSeek V4 Flash 繼續在前沿模型領域佔據主導地位,使用者報告在單張 RTX 4090 上於 250k 上下文長度本地運行時,解碼速度達 247 tokens/s,且為 12 tokens/s @elliotarledge@analogalok
  • Mach‑1 Additive 推出一個 35B 模型,權重以 1.7 bits 儲存,在僅 7 GB 空間內達到全精度效能的 95 %,並在筆電上最高可達 120 tokens/s @syzygyeng
  • Qwen 3.8‑MaxDeepSeek V4 Flash 0731 已皆獲得社區升級,提升代理基準分數與上下文窗口(最高達 1 M tokens) @RimonR23@analogalok
  • DeepSeek flash 正經歷 API 容量壓力,503 錯誤促使使用者暫時切換供應商 @hqmank@opencode@cline

智慧模型路由器於編碼代理

  • Not Diamond Code 被宣傳為「全球最強的智慧模型路由器」,能根據每輪選擇最佳模型,承諾在不損失品質的情況下降低 20–65 % 成本 @tomas_hk
  • Freebuff 的廣告資助編碼代理 聲稱能提供與訂閱服務相同的能力,同時每年節省 $2,400,強調 token 牆與訂閱開銷的隱形成本 @xiathis
  • Aakash Gupta 說明為何降級至較便宜的模型常常適得其反:快取失效與重複讀取上下文會增加總支出,而階層級路由則能在整體成本降低時保留昂貴模型 @aakashgupta
  • Warp Agent CLI 提供完整的 shell 存取與編碼代理的自動路由功能,實現無縫編排與雲端交接 @zachlloydtweets
  • Dillon Loomis 建議使用 Andrej Karpathy 的 LLM Council 框架來提升代理輸出,指出設置時間不到一分鐘,並優於「奉承」模型的結果 @DillonLoomis

連結 AI 代理與實體機器人

  • InvLambda 的 Second Contact 建構一個遙測網路,大規模產生真實世界機器人數據,解決具身 AI 的模擬到真實鴻溝 @timeless243
  • PrismaXAI 提供一個基礎設施層,連結機器人、人類與資料,將每次遙測作業轉為 Vision‑Language‑Action 模型的訓練資料,並為實體 AI 建立成長迴路 @ThuyTrang108@ThuyTrang108
  • Pandroid 是一個設計用於具身數據收集的易於上手硬體平台;可透過 SSH 連接至任何模型或編碼代理,以進行真實世界互動 @pantographPBC
  • Wall‑E 風格的桌面伴侶AI 群體 展示了分佈式實體代理,它們在無人形外形下同步行為,凸顯嵌入式系統在協調機器人方面的潛力 @ardchain@ardchain
  • Atlas 在 CES 被宣佈為量產產品而非原型,標示從研究示範向可銷售的人形機器人轉變 @Shred_0x
  • Sony 的 AIBOFigure 的 $25k 清潔機器人 說明 AI 驅動機器人如何進入消費與企業領域,取代重複性勞動並提供長期數據收集效益 @DN_degen@Deniscrppig

新興工具、基準與社群資源

  • Hermes Agent v0.20.0 新增語音串流、有依據的引用以及代理間協議,展示生產就緒代理框架的成熟度 @IBuzovskyi
  • DeepGrove 的 Maple‑PreviewDeepSeek flash 的效能指標正被公開分享,鼓勵可重現性與社群基準測試 @deepgrove_ai@analogalok
  • PostTrainBench 及其擴充版 PostTrainBench+ 評估 LLMs 的自動化後訓練;Locus 系統在 Qwen 3 模型上優於人類訓練的基準線 @intology
  • 代理自我提升調查 與 Schmidhuber 團隊的論文提供了現代 LLM/工具呼叫代理的歷史脈絡,強調腳手架與自我修改的重要性 @RobertTLange@_akhaliq
  • AI Search 的未審查 Minimax H3Minimax H3 文字編碼器 凸顯對較少過濾模型變體的持續興趣,以供研究目的使用 @aisearchio@aisearchio

市場與投資訊號

  • Microsoft 與 Google 持續加碼投資 AI,Azure 作為 OpenAI 的骨幹,Google 的 TPUs 與 Gemini 模型推動企業採用 @itsmichaelluu@emollick
  • NVIDIA 強調多模型代理是穩健 AI 系統的關鍵,暗示未來硬體‑軟體共同設計趨勢 @nvidia
  • 投資者情緒 對機器人與 AI 基礎設施保持看漲,如 Azure 支援的 Microsoft 到光學收發器製造商及可選量子公司的股票選擇所示 @itsmichaelluu.

所有陳述均直接來源於所引用的 Twitter 貼文,並反映所指示作者的觀點。

SUMMARY: 近期貼文凸顯開源 LLM 縮放激增、為編碼代理提供的智慧模型路由,以及連結 AI 代理與實體機器人的新硬體/軟體管線。

TITLE: AI 與前沿技術彙報 – 模型縮放、代理路由器及真實世界機器人

相關