AI 与前沿科技简报 – 本地模型进展、代理型 AI 爆发,以及人形机器人里程碑

概要

本地大型语言模型现在可以在消费级 GPU 上以此前仅在云服务中才能见到的每秒令牌数(tok/s)速度运行,而像 Grok、Dot Reflex 和 Anthropic 基于图结构的代理系统等代理型 AI 正被部署为全天候自主工作的智能体。与此同时,人形机器人已超越人类短跑纪录,凸显出物理 AI 的整体加速趋势。


本地前沿模型达到消费级性能

  • FreeToken 实现了在单张 96 GB GPU 上运行 7530 亿参数的 GLM‑5.2,速度达 14.9 tok/s,同时在 8 GB GPU 上运行 350 亿参数的 Qwen 模型,速度达到 39.3 tok/s,方法是将模型的大部分内容从系统内存流式加载。该方法依赖于专家混合(Mixture‑of‑Experts)路由机制,每令牌仅激活少数参数,使庞大的检查点变为桌面硬件可处理的工作负载 @akshay_pachaar
  • Kimi‑V3(160 亿参数稀疏 MoE)每令牌仅激活约 30 亿参数,在单张 GPU(4–8 GB VRAM)上运行时,其多模态基准得分与 GPT‑4o‑mini 相当 @N01ennn
  • Ornith‑1.5(350 亿参数)每令牌激活约 30 亿参数,在中等 GPU 上实现约 30 tok/s 的速度,在高端显卡上可达约 150 tok/s,使其成为本地编程和代理任务的有力候选者 @Oluwaphilemon1
  • DeepSeek‑V4‑Flash‑Vision‑Exp 增加了多模态代理能力,性能接近 Opus‑4.8,同时仍可适配现有的 DeepSeek‑V4‑Flash 检查点 @deepseek_ai
  • Qwen 3.8 27B 在社区驱动的内核与推测性解码优化后,于 Apple Silicon 上实现 3 倍解码速度提升,证明密集模型通过专注工程优化也能在本地实用 @0xkydo

代理型 AI 系统转向持久、自主的工作流

  • Grok 4.6(SpaceXAI)现作为基于云的“代理”提供,可全天候运行,登录真实账户,执行点击操作并返回完成的工作。用户报告称该机器人可在无人监督下清理收件箱并完成常规任务,但提醒需注意预算限制和人工审批需求 @RetroChainer@testingcatalog@MPxbt
  • Dot Reflex(基于 Qwen 3‑14B)在准确率上比原生 Qwen 基础模型高出 32.9 个百分点,在宏平均 F1 上高出 39.2 个百分点,并将通过 Dot 平台发布,同时开放源代码仓库 @usedotai
  • Anthropic 展示了基于图结构的代理系统,目前已负责编写其 30% 的代码,强调“代理图”已成为主导的工程范式 @0xwhrrari
  • 开源代理系统正迅速普及:OpenHands 将 Kimi 转化为可自主编辑文件并运行命令的编程代理 @gippp69;CopilotKit 提供免费框架,可将代理嵌入 Slack/Teams @cyrilXBT;Grok Bot 的 1 小时课程教授如何组建由首席助理管理的多机器人团队 @0xMorlex@RoundtableSpace
  • FreeToken 的架构也提升了代理性能,通过将常用专家缓存至 GPU 内存,并在需要时回退至 CPU,从而降低多步骤代理工作负载的延迟 @akshay_pachaar

人形机器人实现人类级速度与复杂任务

  • 一款北京研发的人形机器人跑完 100 米仅用 9.39 秒,打破了尤塞恩·博尔特 9.58 秒的世界纪录,凸显中国机器人技术的快速进步 @Reuters@XH_Lee23@WHRGFUN
  • 2026 年世界人形机器人大赛(WHRG 2026)将有来自 666 支队伍的超过 2000 台机器人参赛,机器人现已能冲刺、跳高并完成同步舞蹈表演 @business@XRoboHub@WHRGFUN
  • Unitree 的 G1 和 Dobot Atom 机器人可通过学习电视转播画面来打网球,利用外部动作捕捉系统实现实时球体追踪与击球动作执行 @TheHumanoidHub
  • Symbiosis Robotics 的 Direct Perception Control 模型使一个人形机器人可自主操控卡丁车,展示了端到端感知到动作的流程,绕过了传统的分层控制架构 @XRoboHub

代理型工作负载服务的新兴研究

  • 阿里巴巴/字节跳动的一篇新论文指出,LLM 推理已不再是代理型应用的主要瓶颈;相反,工具集成、内存管理与网络延迟成为主导因素。诸如任务感知调度与状态卸载等优化手段可将延迟降低高达 4.5 倍 @rohanpaul_ai
  • 加州大学伯克利分校的“FreeToken”论文对 LLM 服务工作负载进行了长达一年的分析,发现请求模式正转向更长输入与更短输出,且简单的 FIFO/LRU 缓存策略可优于更复杂的策略 @1a1a11a

总体来看,前沿 AI 领域正朝着三个方向汇聚:(1)通过巧妙的 MoE 路由与系统内存流式传输,巨型模型正变得可在本地运行;(2)代理型 AI 正从实验性聊天机器人转向全自主的云端工作者;(3)人形机器人正从演示走向以性能为导向的竞争,其速度纪录已超越人类基准。这些趋势表明,软件与硬件生态系统都必须迅速适应,以支持从云端到边缘的持续、高吞吐量 AI 工作负载。

相关