AI 與前沿科技週報 – Grok 4.7、MiMo‑v2.6‑Pro、快速本地推理與實體 AI 更新
簡要重點
SpaceXAI 的 Grok 4.7 模型以與 Grok 4.6 相當的價格推出,具備強大的程式設計與法律基準表現,而 MiMo‑v2.6‑Pro 則登上人工智慧指數頂端;兩者皆伴隨著一連串更快的本地推理堆疊(Husky、Wally、Qwen‑3.8‑27B)以及對實體 AI 所需真實世界空間資料的重新關注(Vangrid、Axis Robotics)。
Grok 4.7 – SpaceXAI 的新代理模型
- Grok 4.7 被定位為完全代理型模型,專為長程程式設計、工程與知識工作任務優化,並以 Cursor 工作流程資料進行新訓練,同時在雙用途生物與越獄探測上加強安全性@cb_doge。
- 基準表現亮點包括 CursorBench 4.0 得分達 46.3 %(較前次的 40.4 % 提升),DeepSWE v1.1 得分達 71.0 %(較前次的 65.2 % 提升),以及 19.6 % 的 Legal Agent Benchmark——幾乎是前代最佳模型的三倍@cb_doge@cb_doge。
- 定價為每百萬輸入 token 2 美元,每百萬輸出 token 6 美元,與 Grok 4.6 相同,但在許多任務上速度提升約一倍@aimlapi@MarioNawfal。
- 模型可透過 Grok Build 終端機、Cursor IDE 及主要模型閘道(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks)取得@cb_doge@testingcatalog。
- SpaceXAI 的官方模型卡強調,該模型絕不會被悄悄降級,此說法亦獲得社群評論的呼應@XFreeze。
MiMo‑v2.6‑Pro – 開源權重排行榜競爭者
- MiMo‑v2.6‑Pro 被宣佈為人工智慧指數上表現最佳的開源權重模型,排名第六,並在多項任務上與 Claude Opus 5 和 GPT‑5.6 Sol 表現相當@testingcatalog@cline。
- 模型透過 ClinePass 平台分發,並由 testing‑catalog 帳號強調其在視覺場景生成基準上的成本效益表現@testingcatalog@aimlapi。
- 有使用者聲稱該模型解決了 100 個長期存在的數學問題,但其推文也承認此說法過度誇大@kimmonismus。
更快的本地推理引擎
- Husky(模型特定推理)聲稱速度比 Apple 的 MLX‑Woof 快達 4.5 倍,並可在 MacBook 上達到每秒 730 個 token,實現私密且高效率的本地 AI@0xSigil。
- Wally(跨平台運行)發布多個前沿模型的效能快照,例如 GLM‑5.3 Flash 在未指定硬體上達 380 tok/s,Qwen‑3.8‑27B 達 485 tok/s@RunAnywhereAI。
- Qwen‑3.8‑27B 在一個月的引擎改進後,於 M5 Max MacBook Pro 上實現 6 倍速度提升,達每秒約 120 個 token,適用於代理子任務@adrgrondin。
- Qwen‑Image‑2.1 在 vLLM‑Omni 中獲得即時支援,可搭配 7.1 B DiT 模型與 Qwen‑3‑VL‑8B 進行透明影像的生成與編輯@vllm_project。
- 開源推理週由 Tim Dettmers 宣佈,將釋出專注於在消費級硬體上運行前沿 AI 的框架與論文,包含自動模型壓縮與長時間 token 流處理@Tim_Dettmers。
實體 AI 與真實世界空間資料
- Vangrid 正在建立去中心化的資料捕捉網路,將多角度手機影片轉換為設備端的密集點雲與高斯斑點,提供可驗證的三維幾何結構,用於機器人與世界模型訓練@Sainoleno@cxmrondlls@Trathoa。
- 該專案籌集 900 萬美元,並提供 10 萬美元的獎金池給頂尖貢獻者,強調鏈上來源證明與隱私優先處理@reduansheikh11。
- Axis Robotics(及其相關評論)強調需要大規模、真實世界的機器人軌跡;其平台透過遠端操作會話進行眾包,以產生訓練資料,目前已累積超過 94,000 名貢獻者與超過 200 萬次錄製會話@kishanchiku@Real_TShelby。
- 多位分析師指出,實體 AI 的瓶頸在於高品質、即時更新的空間資料,而非模型規模,使 Vangrid 與 Axis 成為未來具身智能的關鍵基礎設施@jitusorkar12@hasibs00。
代理信用與 AI 驅動的金融
- Agentics Credit 引入代理信用評分(ACS),範圍為 300 至 850,用以評估 AI 交易代理的獲利能力、回撤、一致性與風險,需達 580 分以上才能取得即時資金存取權@cryptob28811588@MadMagicSOL@0xRiRoyal。
- 該系統透過獎勵紙上交易表現,建立可驗證的績效紀錄,再授予鏈上信用,旨在為去中心化金融生態系統中的自主代理建立聲譽層@nguyenthambt@tianyi_peng。
- 社群貼文將專有代理工具(Claude Code、Codex CLI)的成本與輕量級開源框架如 Pi 進行比較,顯示在相近基準得分下,API 使用成本可低達一半@analogalok。
新興模型與工具公告
- Meta 的 Muse AI 據報導在發布後下載量超越 ChatGPT、Grok 與 Claude,顯示新代理助理的快速採用@Cointelegraph。
- Perplexity Computer 新增透過 MiniMax H3 與 ByteDance Seedance 2.5 的影片生成功能,擴展 AI 協助創意工作流程的多模態能力@perplexity_ai。
- Pollo MCP 為 ChatGPT、Claude 與 Cursor 提供影像與影片生成外掛,新用戶可獲得 40 點的入門獎勵@TaliaAariz@ayzalnooor24521。
- 開源模型釋出 包括阿里巴巴的 Qwen‑Image‑2.1(量化版)與 Yandex 的 Alice AI Foundation 80B‑A3B 基礎模型,皆已開放供社群實驗@plotarmordev@yandexcom。
重點總結: 本週前沿 AI 生態的發展由兩大趨勢交會定義:(1) 更強大、以代理為導向的模型(Grok 4.7、MiMo‑v2.6‑Pro)持續推出,且定價適合大規模採用;(2) 推動低延遲、本地推理與真實世界資料管道(Husky、Wally、Vangrid、Axis),使這些模型能於實體環境與設備端工作負載中運作。同時,生態系統也正朝向 AI 代理的可信度與經濟模型成熟發展,如 Agentics Credit 的聲譽評分機制,以及對 API 工具成本效率的日益關注。