AI 與前沿科技週報 – 本地模型進展、代理式 AI 激增,以及人形機器人里程碑

簡要重點

本地大型語言模型如今已能在消費級 GPU 上以每秒數百個 token 的速度運行,這類速度過去僅見於雲端服務;同時,如 Grok、Dot Reflex 及 Anthropic 的圖形基礎代理系統等代理式 AI 正被部署為 24 小時不間斷的自主工作者。另一方面,人形機器人已超越人類短跑紀錄,凸顯出物理 AI 的整體加速趨勢。


本地前沿模型達成消費級效能

  • FreeToken 讓 7530 億參數的 GLM‑5.2 在單一 96 GB GPU 上以 14.9 tok/s 運行,並讓 35B 的 Qwen 模型在 8 GB GPU 上達到 39.3 tok/s,方法是將大部分模型從系統記憶體流式傳輸。此技術依賴混合專家(Mixture‑of‑Experts)路由機制,僅保留每 token 少數活躍參數,使龐大的檢查點轉化為桌面硬體可負荷的工作負載 @akshay_pachaar
  • Kimi‑V3(16B 稀疏 MoE)每 token 僅激活約 3B 參數,在單一 GPU(4–8 GB VRAM)上運行,其多模態基準表現可與 GPT‑4o‑mini 相媲美 @N01ennn
  • Ornith‑1.5(35B)僅激活約 3B 參數,在中等 GPU 上達成約 30 tok/s,高階顯卡則可達 150 tok/s,使其成為本地程式設計與代理任務的強力候選者 @Oluwaphilemon1
  • DeepSeek‑V4‑Flash‑Vision‑Exp 加入多模態代理功能,表現接近 Opus‑4.8,同時仍能適配現有的 DeepSeek‑V4‑Flash 檢查點 @deepseek_ai
  • Qwen 3.8 27B 在社群驅動的內核與預測解碼改進後,於 Apple Silicon 上獲得 3 倍解碼速度提升,證明密集模型透過專注工程仍可實現本地可用性 @0xkydo

代理式 AI 系統邁向持續、自主的工作流程

  • Grok 4.6(SpaceXAI)現提供雲端「代理」服務,可 24 小時運行,自動登入真實帳號、執行點擊操作並回傳完成工作。使用者報告此機器人可自動清理郵件並執行例行任務,無需監督,但提醒需注意支出上限與人工審核需求 @RetroChainer@testingcatalog@MPxbt
  • Dot Reflex(基於 Qwen 3‑14B)在準確率上超越原生 Qwen 基礎模型 32.9 點,宏觀 F1 分數提升 39.2 點,並將在 Dot 平台推出,同時釋出開源程式碼庫 @usedotai
  • Anthropic 展示圖形基礎代理系統,目前已撰寫其 30 % 的程式碼,強調「代理圖」已成為主流工程範式 @0xwhrrari
  • 開源代理系統正快速擴散:OpenHands 將 Kimi 轉化為可自主編輯檔案與執行命令的程式設計代理 @gippp69;CopilotKit 提供免費框架,可將代理嵌入 Slack/Teams @cyrilXBT;Grok Bot 的 1 小時課程教導如何組建由首席幕僚管理的多機器人團隊 @0xMorlex@RoundtableSpace
  • FreeToken 架構亦有利於代理系統,透過將常用專家快取於 GPU 記憶體,必要時回退至 CPU,降低多步驟代理工作負載的延遲 @akshay_pachaar

人形機器人達成人類級速度與複雜任務

  • 一臺北京研發的人形機器人以 9.39 秒完成 100 公尺賽跑,打破尤塞恩·博爾特 9.58 秒的世界紀錄,突顯中國機器人技術的快速進展 @Reuters@XH_Lee23@WHRGFUN
  • 2026 年世界人形機器人競賽(WHRG 2026)將有超過 2000 台機器人來自 666 支隊伍,機器人現已能短跑、跳高與同步舞蹈 @business@XRoboHub@WHRGFUN
  • Unitree 的 G1 與 Dobot Atom 機器人可透過學習廣播畫面來打網球,利用外部動作捕捉技術實時追蹤球體與執行擊球動作 @TheHumanoidHub
  • Symbiosis Robotics 的 Direct Perception Control 模型,讓一個人形駕駛者能自主操控卡丁車,展現端到端的感知至行動流程,跳過傳統的階層式控制架構 @XRoboHub

代理工作負載服務的最新研究

  • 阿里巴巴/字節跳動的新論文指出,LLM 推理已不再是代理應用的主要瓶頸;相反地,工具整合、記憶體管理與網路延遲才是關鍵。透過任務感知配置與狀態卸載等優化,可將延遲降低最多達 4.5 倍 @rohanpaul_ai
  • 加州大學柏克萊分校的「FreeToken」論文對 LLM 服務工作負載進行了一整年的分析,發現請求模式逐漸轉向更長的輸入與更短的輸出,且簡單的 FIFO/LRU 快取策略甚至優於更複雜的政策 @1a1a11a

總體而言,前沿 AI 領域正朝三個方向匯聚:(1) 巨型模型透過巧妙的 MoE 路由與系統記憶體流式傳輸,變得可在本地運行;(2) 代理式 AI 正從實驗性聊天機器人轉型為完全自主的雲端工作者;(3) 人形機器人正從示範走向以性能為導向的競賽,速度紀錄已超越人類基準。這些趨勢顯示,無論是軟體還是硬體生態系統,都必須迅速調整,以支援跨雲端至邊緣的持續、高吞吐量 AI 工作負載。

相關