AI 與前沿科技週報 – Muse Spark 1.3、Gemini 3.8 Flash、Qwen 3.8 與機器人技術進展

TL;DR:Meta 的 Muse Spark 1.3 在保持成本效益的同時,進一步提升代理與科學推理能力;Google 的 Gemini 3.8 Flash 以適中價格實現強大的編碼與代理性能提升;Qwen 3.8‑Max 與 Qwen 3.8‑Flash 在效能與速度上均有顯著進步;NVIDIA 展示了可在邊緣硬體上即時運行的機器人策略。


Meta Muse Spark 1.3 – 更快、更具代理能力,價格依然低廉

  • Muse Spark 1.3(max)在 Artificial Analysis Intelligence Index 上取得 62 分,僅次於 Claude 的頂級版本,而 xhigh 版本取得 61 分,與 GPT‑5.6 Sol(max)及 Grok 4.6(high)並列 @ArtificialAnlys
  • 性能提升來自更高的推理詞元使用量,在 Tau3‑Bench Banking 上提升 12 分,在 Terminal‑Bench 2.1 上提升 5 分,相比 1.2 版本 @ArtificialAnlys
  • 每項任務成本上升至 $0.55(xhigh 版本),但仍低於 GPT‑5.6 Sol 的 $0.95,使 Muse Spark 站上智慧與成本的帕累托前緣 @ArtificialAnlys
  • 科學推理能力在 CritPt(+8 分)、GPQA Diamond(+4 分)等多項基準上提升,僅在 AA‑LCR 與 AA‑Omniscience 上因更高棄權率出現小幅退步 @ArtificialAnlys
  • 模型細節:1 M token 上下文視窗,支援多模態(文字、影像、影片),定價與 1.2 版相同,透過 Meta 的 API 與 Muse Code 可取得 @ArtificialAnlys

Google Gemini 3.8 Flash – 以 $0.58 / 任務實現代理與編碼飛躍

  • Gemini 3.8 Flash(high)在 Artificial Analysis Intelligence Index 上取得 59 分,較 3.7 Flash 提升 3 分,與 GPT‑5.6 Sol(xhigh)持平 @ArtificialAnlys@OfficialLoganK@Google
  • 這項提升來自 Tau3‑Bench Banking 上 12 分 的躍升與 Terminal‑Bench v2.1 編碼表現的改善 @ArtificialAnlys
  • 定價維持在 $0.75 / M token 輸入(折扣後),每項智慧指數任務成本為 $0.58,是此智慧等級中價格最低的模型 @ArtificialAnlys
  • 輸出速度約為每秒 300 token,高推理任務的時間為 2.5 分鐘,略慢於 Claude Fable 5.1(medium) @ArtificialAnlys
  • 上下文視窗仍為 1 M token;多模態支援包含文字、影像、影片與語音 @ArtificialAnlys

Qwen 模型更新 – 更大上下文、本地推理更快

  • Qwen 3.8‑Max‑0902(2.4 T 參數)現提供 1 M token 上下文,並在企業、科學與長程任務上表現更強;定價為 $2 / M token 輸入,$6 / M token 輸出 @Alibaba_Qwen
  • Qwen 3.8‑Flash 透過 MTP 技術,在 RTX PRO 6000 上實現 1.7 倍 的本地推理速度提升(170 token/s),且無準確度損失 @UnslothAI
  • Qwen 3.8‑27B 在單一 RTX 3090 上,使用 EXL3 壓縮與預測解碼技術,於 256 K token 上下文下可達 ~65 token/s,使消費級硬體上執行長文件代理任務成為可能 @Oluwaphilemon1

Perplexity 的 Lily 引擎 – 為裝置內 LLM 提供混合運算

  • Perplexity 開源了 Lily,一個針對 Apple silicon 上的 Qwen 3.6‑35B‑A3B 調校的本地推理引擎,實現不拖慢混合 AI 任務的裝置內運算 @perplexity_ai

機器人與實體 AI – 即時邊緣策略與資料迴圈

  • NVIDIA 展示了一個可內建運行的 緊湊型機器人策略(Jetson AGX Thor T5000),在 2.13 秒的動作中可於 1.53 秒 內重新規劃,並在硬體評估前,於 120 個語言條件操控任務中完成封閉迴圈模擬 @NVIDIARobotics
  • NVIDIA 的 Cosmos 3 Edge 策略達成類似即時表現,突顯語言條件機器人控制在邊緣端的可行性 @NVIDIARobotics@NVIDIARobotics
  • Axis Robotics 報告了一個反饋迴圈,人類修正的失敗資料(而非靜態大型資料集)驅動機器人策略的持續改進,強調快速失敗至資料管道的價值 @0xALTF4
  • World Labs 的 Atlas 可從少量手機照片重建環境,實現「真實 → 模擬 → 真實」的訓練管道,大幅降低機器人適應的資料收集成本 @IlirAliu_@MTSlive

AI 代理的安全與工具鏈

  • NVIDIA 新開源的程式庫可在執行前掃描 AI 代理的 技能以發現安全風險,應對來自 GitHub 的惡意工具安裝日益增長的威脅 @gregisenberg
  • SpaceXAI 的 Grok Bot 使用手冊詳述了將單一機器人轉化為 24/7 多代理工作流程的 7 步架構,包含持久化工作區、首席路由委派與僅限人類批准的信任層 @adiix_official
  • GitHub 的 AI 相關程式庫總覽(由 Greg Isenberg 提供)介紹了開源工具,適用於 AI 驅動的 CRM、影片編輯與 CapCut 替代方案,皆旨在擴展代理能力 @gregisenberg

圖像編輯基準 – 專用模型崛起

  • Artificial Analysis 圖像編輯競賽場 現已將 MAI‑Image‑2.6‑Preview 排名為總體領先者,在場景/風格編輯與基於推理的變換上表現卓越 @ArtificialAnlys
  • GPT Image 2(high) 在物件級編輯上領先,而 Seedream 5.0 Pro 則在保留身份的編輯上佔優;成本效益高的選項如 MAI‑Image‑2.5‑Flash 提供 $20 / 1 000 張圖像,遠低於 GPT Image 2(high)的 $211 @ArtificialAnlys

總結要點: AI 前沿正快速迭代大型多模態模型,提升代理推理能力並強化成本效率(Muse Spark 1.3、Gemini 3.8 Flash)。同時,模型擴張(Qwen 3.8)與本地推理優化(Lily、EXL3)正使長上下文工作負載更普及。在機器人領域,邊緣就緒策略與資料導向的反饋迴圈正推動實體 AI 從模擬走向現實部署,而安全工具與多代理架構則致力於讓這些強大代理更安全、更易用。