AI 与前沿科技速览 – Muse Spark 1.3、Gemini 3.8 Flash、Qwen 3.8 及机器人学进展
TL;DR:Meta 的 Muse Spark 1.3 在保持高性价比的同时提升了智能体和科学推理能力,Google 的 Gemini 3.8 Flash 以适中的价格带来了强大的编码和智能体能力提升,Qwen 3.8‑Max 和 Qwen 3.8‑Flash 在性能和速度上均有提升,NVIDIA 展示了可在边缘硬件上实时运行的机器人策略。
Meta Muse Spark 1.3 – 更快、更强的智能体能力、依然便宜
- Muse Spark 1.3 (max) 在 Artificial Analysis 智能指数上得分为 62,仅次于 Claude 的顶级变体,而 xhigh 变体得分为 61,与 GPT‑5.6 Sol (max) 和 Grok 4.6 (high) 持平 @ArtificialAnlys。
- 性能提升得益于更高的推理 token 使用量,与 1.2 版本相比,在 Tau3‑Bench Banking 上实现了 12 分的跃升,在 Terminal‑Bench 2.1 上提升了 5 分 @ArtificialAnlys。
- xhigh 变体的单任务成本上升至 $0.55(仍比 GPT‑5.6 Sol 的 $0.95 便宜),并使 Muse Spark 稳居智能与成本对比的帕累托前沿 @ArtificialAnlys。
- 科学推理在 CritPt(+8 分)、GPQA Diamond(+4 分)及其他基准测试中均有改善,而由于更高的弃权率,在 AA‑LCR 和 AA‑Omniscience 上仅出现轻微的性能回退 @ArtificialAnlys。
- 模型详情:1 M token 上下文窗口,多模态(文本、图像、视频),定价与 1.2 版本保持一致,可通过 Meta 的 API 和 Muse Code 使用 @ArtificialAnlys。
Google Gemini 3.8 Flash – 智能体与编码的飞跃,单任务成本 $0.58
- Gemini 3.8 Flash (high) 在 Artificial Analysis 智能指数上达到 59 分,比 3.7 Flash 提升 3 分,与 GPT‑5.6 Sol (xhigh) 持平 @ArtificialAnlys@OfficialLoganK@Google。
- 这一跃升得益于在 Tau3‑Bench Banking 上 12 分的提升以及更出色的 Terminal‑Bench v2.1 编码得分 @ArtificialAnlys。
- 定价维持在 $0.75 / M token 输入(折扣价),单智能指数任务成本为 $0.58,是同等智能水平下最便宜的模型 @ArtificialAnlys。
- 输出速度约为 300 tokens/s,在高推理强度下每任务耗时 2.5 分钟,略慢于 Claude Fable 5.1 (medium) @ArtificialAnlys。
- 上下文窗口保持为 1 M tokens;多模态支持包括文本、图像、视频和语音 @ArtificialAnlys。
Qwen 模型更新 – 更大上下文,更快本地推理
- Qwen 3.8‑Max‑0902(2.4 T 参数)现提供 1 M token 上下文,并在企业、科学和长周期任务上具有更强的性能;定价为 $2 / M token 输入,$6 / M token 输出 @Alibaba_Qwen。
- Qwen 3.8‑Flash 借助 MTP 在 RTX PRO 6000 上实现了 1.7 倍的本地推理速度提升(170 tokens/s),且无精度损失 @UnslothAI。
- Qwen 3.8‑27B 使用 EXL3 压缩和投机解码,可在单张 RTX 3090 上以 ~65 tokens/s 的速度处理 256 K token 上下文,使得在消费级硬件上运行长文档智能体任务成为可能 @Oluwaphilemon1。
Perplexity 的 Lily 引擎 – 针对端侧 LLM 的混合计算
- Perplexity 开源了 Lily,这是一个专为 Apple 芯片上的 Qwen 3.6‑35B‑A3B 调优的本地推理引擎,实现了不会成为混合 AI 任务瓶颈的端侧计算 @perplexity_ai。
机器人学与物理 AI – 实时边缘策略与数据闭环
- NVIDIA 展示了一种在机载(Jetson AGX Thor T5000)上运行的紧凑型机器人策略,能够在 2.13 秒的运动中实现 1.53 秒的重新规划,并在硬件评估前对 120 个语言条件操作任务进行了闭环仿真 @NVIDIARobotics。
- NVIDIA 的 Cosmos 3 Edge 策略实现了类似的实时性能,突显了在边缘侧进行语言条件机器人控制的可行性 @NVIDIARobotics@NVIDIARobotics。
- Axis Robotics 报告了一种反馈循环,其中由人工纠正的失败数据(而非静态的大型数据集)推动了机器人策略的持续改进,强调了快速“从失败到数据”流程的价值 @0xALTF4。
- World Labs 的 Atlas 能够通过几张手机照片重建环境,实现了“从现实到仿真再到现实”的训练流程,大幅降低了机器人适应性的数据收集成本 @IlirAliu_@MTSlive。
AI 智能体的安全与工具
- 一个新的 NVIDIA 仓库可在执行前扫描 AI 智能体的技能安全风险,以应对来自 GitHub 的恶意工具安装日益增长的威胁 @gregisenberg。
- SpaceXAI 的 Grok Bot 实践指南详细介绍了将单个机器人转变为 24/7 多智能体工作流的 7 步架构,包括持久化工作空间、首席路由器委派以及用于仅限人工审批的信任层 @adiix_official。
- GitHub 的 AI 相关仓库精选(由 Greg Isenberg 整理)重点介绍了用于 AI 驱动的 CRM、视频编辑以及 CapCut 替代方案的开源工具,所有这些都旨在扩展智能体能力 @gregisenberg。
图像编辑基准测试 – 专用模型崛起
- Artificial Analysis 图像编辑竞技场现在将 MAI‑Image‑2.6‑Preview 列为总榜首,它在场景/风格编辑和基于推理的转换方面表现出色 @ArtificialAnlys。
- GPT Image 2 (high) 在对象级编辑方面领先,而 Seedream 5.0 Pro 在保持身份特征的编辑方面占据主导地位;像 MAI‑Image‑2.5‑Flash 这样高性价比的选项提供 $20 / 1 000 张图片的价格,而 GPT Image 2 (high) 则为 $211 @ArtificialAnlys。
总体要点: AI 前沿正在经历大型多模态模型的快速迭代,这些模型在提升智能体推理能力的同时,也在不断优化成本效率(Muse Spark 1.3、Gemini 3.8 Flash)。与此同时,模型规模的扩大(Qwen 3.8)和本地推理优化(Lily、EXL3)使长上下文工作负载得以普及。在机器人学领域,边缘就绪的策略和以数据为中心的反馈循环正推动物理 AI 从仿真走向现实世界的部署,而安全工具和多智能体框架则旨在使这些强大的智能体更安全、更易用。