AI & 前沿技术综述 – 智能体模型、免费云端推理与新机器人基准测试

TL;DR – 一波智能体 AI 的发布(Claude Code 2.1.228, Grok Bot, Nemotron 3.5 Lightning)和免费云端推理选项(DeepSeek V4 Flash, Qwen 3.6)正在加速从聊天式助手向全天候、工具调用型智能体的转变,同时新的机器人数据集(Dyna-2)和开源智能体模型(Smaug-Agentic, Ling-3.0-tiny)正在推动具身智能的发展。

Claude Code 2.1.228 – 强化 CLI 能力

Claude Code 2.1.228 带来了 18 项 CLI 变更,旨在加强安全性并提高搜索速度。本地命令现在优先于同步技能,防止意外覆盖,且 grep 命令现在使用 ripgrep 进行更快速的全局项目搜索 @ClaudeCodeLog

Grok Bot – 全天候 AI 队友

SpaceXAI 发布了 Grok Bot,这是一套持久性 AI 智能体套件,可以在专用计算机上运行并在用户不在时继续工作。这些机器人可以在不同应用之间操作,处理多步骤任务,互相发送消息,并随着时间的推移学习用户偏好 @pengzheng_@poteto@cb_doge@haider1。此次发布被定位为从对话式编程助手向“智能体团队”的转型,这些团队可以管理日历、交付代码,甚至订购午餐。

NVIDIA Nemotron 3.5 Lightning – 高吞吐量智能体模型

NVIDIA 宣布了 Nemotron 3.5 Lightning,这是一个拥有 30B MoE 参数、3B 激活参数的模型,专为全天候智能体设计。它在 Jetson AGX Thor 上可提供约 115 tokens/s 的速度,并已在 Ollama、LM Studio、OpenRouter 和 NVIDIA 的 NeMo Switchyard 等平台上开放权重 @NVIDIARobotics@ollama@nvidia@lmstudio@sudoingX@OpenRouter。基准测试声称对于智能体工作负载,吞吐量可提高达 4 倍,任务完成速度提高 30%。

AMD 上的免费云端推理 – DeepSeek V4 Flash & Qwen 3.6

AMD 的 Token Factory 提供 DeepSeek V4 Flash、Qwen 3.6 35B、MiniCPM 5 和 MiniCPM-V46 的每日免费使用额度,每天以 10 美元的额度重置 @slash1sol@zefirium。此举模仿了 NVIDIA 通过发放推理额度来引导开发者转向特定芯片生态系统的策略。

通过人类视频扩展机器人规模 – Dyna-2

Dyna-2 证明了在超过 100 万小时的人类视频上进行预训练可以提高机器人的任务性能,即使是在未见过的任务上也是如此。数据显示,随着数据规模从 1k 扩展到 1M 小时,泛化能力会更好,这为软件规模的机器人技术指明了方向 @Logical_Girll@Lindon_Gao@RoboStrategy

Gemini 4 泄露 – 野心勃勃的智能体路线图

泄露消息表明 Gemini 4 正在进行预训练,目标发布时间为 8 月底/9 月初,重点在于推理、编程、自主智能体和长期任务 @vepsi__@pankajkumar_dev@ZypherHQ。该路线图声称可能实现对当前顶级模型的跨越式提升,尽管性能声明尚未得到证实。

开源智能体模型 – Smaug-Agentic & Ling-3.0-tiny

两个值得关注的开源发布针对智能体编程:

  • Smaug-Agentic 基于 Kimi K3 构建,改进了智能体编程,在开源排行榜上仅次于 Claude Opus 5 @bindureddy@bindureddy
  • Ling-3.0-tiny 是一个 7.9B 模型(1.3B 激活),针对推理、工具使用和智能体工作进行了优化,在 DGX Spark 上的吞吐量为 100 tok/s,在 M4 Pro MacBook 上的速率为 90 tok/s @TeksEdge

Unsloth Desktop – 本地训练与推理中心

Unsloth Desktop 提供了一个开源桌面应用,可以在 macOS、Windows 和 Linux 上本地运行和训练模型。它支持 MLX、diffusion、audio、GGUF,并通过兼容 OpenAI 的 API 集成了 Claude Code 和 Codex @UnslothAI

检索工程 – 让智能体更快

五个工程团队(Uber, Anthropic, Dropbox, Microsoft, Cursor)分享了具体的检索层改进方案,这些改进以较低的成本将检索失败率降低了 35%,证明了更智能的索引比单纯的模型扩展更能提升智能体性能 @undefinedKi

用于多智能体系统的知识图谱循环

一位 Anthropic 工程师详细介绍了一种工作流,利用 Claude 的 SDK、沙盒化工具执行和自动“梦境”(基于日志的模型重放)为多智能体循环构建知识图谱,从而加速智能体推理并降低失败成本 @0xCodila

金融与研究领域的智能体自动化

  • Prodigy Research 声称其基础模型在量化金融方面优于 Claude Fable 和 GPT-5.6 Sol,在其 YC 训练期间实现了 >100% 的实盘回报 @michaelwangelo
  • 一个 Citadel 风格的 AI 研究流水线现在使用自主 AI 智能体将 6-8 周的学术金融研究压缩至 2-3 小时 @MrFamilyOffice

新兴的智能体经济平台

SolAgents V1 已在 Solana 上推出,为可以进行交易、赚钱和建立声誉的 AI 智能体提供了一个市场,标志着第一个运行中的“智能体经济”的出现 @EleZeus_MIMA

基于浏览器的动作智能体

ARCTERMINAL 浏览器自动化平台使 AI 智能体 (ANIMA) 能够在 Web 环境中执行操作,使 AI 从解释转向执行 @cryptohouse0x


所有项目均引用自原始 X 帖子;未引入额外主张。

相关