AI 與前沿科技週報:Gemini 4 Argon 發布、多代理進展,以及實體 AI 數據計畫

TL;DR: Google 的 Gemini 4 Argon 模型推出,具備業界領先的 100 萬 token 輸出視窗與具競爭力的定價,同時一連串多代理與實體 AI 專案(Delvetown、Axis Robotics、Vangrid、Boreal‑H3、ExplorationBench)展現該領域正朝長遠推理、代理工作流程與現實世界資料迴路轉變。

Gemini 4 Argon – Google 的新前沿模型

  • 模型能力:Gemini 4 Argon 支援 100 萬 token 的輸出限制(由 64K 提升),支援多模態輸入(文字、影像、影片、語音),以及 100 萬 token 的上下文視窗。該模型定位於複雜的軟體工程、法律、金融與資安工作流程中的深度推理@GoogleAI。
  • 性能指標:在 Artificial Analysis Intelligence Index 上,Argon 得分 53(與 GPT‑6 Astra 相同),並在代理基準測試中領先(AutomationBench‑AA 上達 77.5%,超越 Claude Sonnet 5.5)。幻覺率為 15%,是得分 45 以上的模型中最低者@ArtificialAnlys。
  • 定價與推出:初始發售價為每 100 萬 token 輸入 $2、輸出 $10,享有 50 % 折扣(實際每任務 $1.99)與 95 % 快取折扣。目前僅限 Fairwind 計畫中的可信 cyber‑defender 合作夥伴使用,未來將擴大開放@_philschmid@GoogleAI。
  • 開發者存取:Google 宣布將「盡快」提供開發者存取,並強調該模型支援長時間解碼續寫功能,可產生超過請求逾時時間的回應@_philschmid。

多代理生態系統與工具

  • Delvetown:一個實驗性多代理社會,允許人類與 AI 代理共存、觀察,並原型化人類與 AI 共存的激勵對齊機制。它作為代理生態研究的開放世界環境@deepfates。
  • Claude Opus 5.5 對 GPT‑6.1 發布影片測試:Motion 展示兩模型在相同提示下製作產品發布影片,顯示前沿模型之間的創造力輸出相當@motion_so。
  • OrcaRouter 提示分析:開源系統提示針對 12 個程式碼代理工具(Claude Code、Codex、Cursor 等)揭示各工具的「秘密配方」與模型無關元件@OrcaRouter。
  • Skill Manager:一個 UI 層,讓開發者可切換程式碼代理技能的開關、分組,並執行 AI 驅動的問題掃描,提升 Claude Code、Codex、Cursor 等工具的上下文效率@camsoft2000。
  • JEV 決策引擎:多則推文(Sili Naihin、Bober_smart、S ᜰ)指出,JEV 大幅降低決策成本(例如每 1,000 決策僅需 $0.044,遠低於 GPT‑6 的 $12.18),實現低成本、類型化決策層,可卸載高 token 的 LLM 呼叫@silennai@Bober_smart@He1s_Sammy。
  • Claude Code 工作流程提示:建議使用者將 Opus 5.5 作為主要模型,將例行任務委派給 Sonnet 5.5,並保留 Fable 5.1 作為計畫驗證的諮詢子代理@mirku21。

前沿影片生成

  • Boreal‑H3:Creatify Labs 發布針對廣告優化的影片模型,達成 85.3 % 的參考保真度與 83 % 的身份匹配,同時將生成時間與成本減少約 20 %。系統使用封閉迴路反饋機制,迭代提升資料收集、強化學習與推論優化@Creatify_Labs。
  • Minimax H3 步驟減少:Stable Diffusion Tutorials 強調一個 LoRA 可將影片生成壓縮至四次推論步驟,且品質損失極小@SD_Tutorial。
  • MiniMax‑H3 360° LoRA:360° 等距影片 LoRA 可在 VR 平台上實現沉浸式影片播放@wildmindai。

ExplorationBench – 測量 AI 探索能力

  • 腾訊 Hy、復旦大學與清華大學的研究人員推出 ExplorationBench,一個評估系統提出假設、設計實驗並從結果中學習能力的基準。在十種前沿模型的測試中,發現反饋迴路能大幅改善表現(最佳結果在四輪後達 89 % 成功率),且僅具備規則意識並不足以保證任務成功@TencentHunyuan。

實體 AI 數據平台

  • Axis Robotics:強調其資料引擎能將成功的機器人行為轉化為可重複使用的「專家」模型,近期實驗顯示成功率從 22 % 提升至 52 %,特定專家甚至達近 100 % 成功率,每任務計算成本僅 $5–$10@iam_islandboi@Nahid_2027@destinydou_。
  • Vangrid:建立去中心化的空間資料網路,讓貢獻者透過智慧型手機捕捉現實環境,轉換為點雲與高斯點以訓練實體 AI 模型。目前已報告超過 100 萬次捕捉與 42.3 萬個活躍節點@eric_ho@REALJOSHUATIMI@BryanQuartz。
  • PRISM (Amazon FAR):引入可擴展的真實→模擬→真實管道,將四段真實影片擴展為 256 種反事實變體,訓練單一策略以跨物件與佈局泛化@Z1hanW。

開源模型存取與基礎設施

  • GLM‑5.3 Flash:RunInfra 發布核心重寫,於 Vercel AI Gateway 上實現每秒 670 token 的速度,支援 100 萬 token 上下文與 FP8,定價為每 100 萬 token $0.11/$0.45,並享有 95 % 快取折扣@runinfrai。
  • DeepSeek Harness:現已支援 macOS 與 Windows,簡化 DeepSeek 模型的本地部署@DeepSeekHarness。
  • 本地 AI 伺服器堆疊:一位使用者描述使用 DGX‑Spark 基於 vLLM 的伺服器,透過 Tailscale 共享,提供統一的 OpenAI 兼容端點,可讓私人網路中的任何裝置同時服務多個模型(例如 GLM 5.3‑Flash)@sudoingX。
  • OpenBMB OPD 研究:提出 One‑Shot OPD,顯示大多數來自同策略蒸餾的提升來自單一查詢的狀態覆蓋,而非資料集大小,突顯後訓練流程中的資料效率@OpenBMB。

社群驅動的模型發布

  • 開放權重推進:AI Search 宣布 Ideogram 4.5 將以開放權重發布,使本地執行的模型性能超越 GPT‑Image 2.5@aisearchio。
  • 模型連續性擔憂:一則推文警告,若中國實驗室(Qwen、DeepSeek、Zai、MiniMax、Moonshot)停止發布開放權重,社群可能失去對前沿模型的獨立存取權@superalesha。

其他前沿更新

  • Stable Diffusion 影片生成 LoRA 減少影片生成的推論步驟@SD_Tutorial。
  • ExplorationBench 強調反饋迴路與動態基準任務對真正 AI 探索能力的重要性@TencentHunyuan。
  • Ollama 新增本地決策模型,如 Nimble,用於即時路由與內容審核任務@ollama。
  • Mercury Voice 帶來類似擴散的快速語音生成,擴展代理語音能力@StefanoErmon。
  • NeurIPS OASIS 論文 改進低比特注意力殘差,提升長上下文推論的穩健性,為前沿模型帶來顯著優化@Michael_Huang_W。

所有陳述均直接源自所引用推文;未添加任何外部推測。