AI 與前沿技術週報 – 智能體模型、免費雲端推論與全新機器人基準測試

TL;DR – 一波智能體 AI 的發佈(Claude Code 2.1.228、Grok Bot、Nemotron 3.5 Lightning)以及免費雲端推論選項(DeepSeek V4 Flash、Qwen 3.6)正在加速從對話式助手向全天候、工具調用型智能體的轉型,同時新的機器人數據集(Dyna-2)和開源智能體模型(Smaug-Agentic、Ling-3.0-tiny)正在推動具身智能(Embodied AI)向前發展。

Claude Code 2.1.228 – 強化 CLI 能力

Claude Code 2.1.228 隨附 18 項 CLI 變更,旨在加強安全性並提高搜尋速度。本地命令現在優先於同步技能,以防止意外覆蓋,且 grep 命令現在使用 ripgrep 以進行更快速的專案範圍搜尋 @ClaudeCodeLog

Grok Bot – 全天候 AI 隊友

SpaceXAI 展示了 Grok Bot,這是一套持續運行的 AI 智能體套件,可在專用電腦上運行並在用戶不在時繼續工作。這些機器人可以跨應用程式操作、處理多步驟任務、互相傳送訊息,並隨著時間學習用戶偏好 @pengzheng_@poteto@cb_doge@haider1。此次發佈被定位為從對話式編碼助手向「智能體團隊」的轉型,這些團隊可以管理日曆、交付代碼,甚至訂購午餐。

NVIDIA Nemotron 3.5 Lightning – 高吞吐量智能體模型

NVIDIA 宣佈了 Nemotron 3.5 Lightning,這是一個擁有 30B MoE 架構、3B 激活參數的模型,專為全天候智能體設計。它在 Jetson AGX Thor 上可提供 ~115 tokens/s 的速度,並可在 Ollama、LM Studio、OpenRouter 和 NVIDIA 的 NeMo Switchyard 等平台上以開源權重提供 @NVIDIARobotics@ollama@nvidia@lmstudio@sudoingX@OpenRouter。基準測試聲稱對於智能體工作負載,吞吐量高出達 4 倍,任務完成速度快 30%。

AMD 上的免費雲端推論 – DeepSeek V4 Flash 與 Qwen 3.6

AMD 的 Token Factory 提供 DeepSeek V4 Flash、Qwen 3.6 35B、MiniCPM 5 和 MiniCPM-V46 的每日免費使用額度,每天重置為 10 美元的額度上限 @slash1sol@zefirium。此舉反映了 NVIDIA 的策略,即透過發放推論額度來引導開發者進入特定的晶片生態系統。

利用人類影片擴展機器人技術 – Dyna-2

Dyna-2 證明了在超過 100 萬小時的人類影片上進行預訓練可以提高機器人的任務表現,即使是在未見過的任務上也是如此。數據集顯示,隨著數據從 1k 擴展到 1M 小時,泛化能力會變得更好,這為軟體規模化的機器人技術指明了方向 @Logical_Girll@Lindon_Gao@RoboStrategy

Gemini 4 洩露 – 野心勃勃的智能體路線圖

一項洩露消息顯示 Gemini 4 正在進行預訓練,目標是在 8 月底/9 月初發佈,重點在於推理、編碼、自主智能體和長期任務 @vepsi__@pankajkumar_dev@ZypherHQ。該路線圖聲稱可能超越目前的頂尖模型,儘管性能聲稱仍未得到證實。

開源智能體模型 – Smaug-Agentic 與 Ling-3.0-tiny

兩個值得關注的開源發佈針對智能體編碼:

  • Smaug-Agentic 基於 Kimi K3 構建,改進了智能體編碼,並在開源排行榜上僅次於 Claude Opus 5 @bindureddy@bindureddy
  • Ling-3.0-tiny 是一個 7.9B 模型(1.3B 激活),針對推理、工具使用和智能體工作進行了優化,在 DGX Spark 上具有 100 tok/s 的吞吐量,在 M4 Pro MacBook 上具有 90 tok/s 的速率 @TeksEdge

Unsloth Desktop – 本地訓練與推論中心

Unsloth Desktop 提供一個開源桌面應用程式,可在 macOS、Windows 和 Linux 上本地運行並訓練模型。它支持 MLX、diffusion、audio、GGUF,並透過與 OpenAI 相容的 API 整合了 Claude Code 和 Codex @UnslothAI

檢索工程 – 讓智能體更快

五個工程團隊(Uber、Anthropic、Dropbox、Microsoft、Cursor)分享了具體的檢索層改進措施,以較低的成本減少了 35% 的檢索失敗,證明了更聰明的索引比單純的模型擴展更能提升智能體性能 @undefinedKi

多智能體系統的知識圖譜迴圈

一位 Anthropic 工程師詳細介紹了一種工作流程,使用 Claude 的 SDK、沙盒化工具執行和自動「夢境」(基於日誌的模型重放)來為多智能體迴圈構建知識圖譜,從而加速智能體推理並降低失敗成本 @0xCodila

金融與研究領域的智能體自動化

  • Prodigy Research 聲稱其基礎模型在量化金融領域優於 Claude Fable 和 GPT-5.6 Sol,在其 YC 訓練期間實現了 >100% 的實盤回報 @michaelwangelo
  • 一種 Citadel 風格的 AI 研究管線現在使用自主 AI 智能體將 6-8 週的學術金融研究壓縮至 2-3 小時 @MrFamilyOffice

新興的智能體經濟平台

SolAgents V1 已在 Solana 上推出,為 AI 智能體提供了一個可以進行交易、賺取收益並建立聲譽的市場,標誌著第一個運行的「智能體經濟」 @EleZeus_MIMA

基於瀏覽器的行動智能體

ARCTERMINAL 瀏覽器自動化平台使 AI 智能體 (ANIMA) 能夠在 Web 環境中執行動作,將 AI 從解釋轉向執行 @cryptohouse0x


所有項目均引用自原始 X 貼文;未引入額外主張。

相關