AI 与前沿科技简报 – Grok 4.7、MiMo‑v2.6‑Pro、快速本地推理及物理 AI 更新

概要

SpaceXAI 的 Grok 4.7 模型以与 Grok 4.6 相当的价格发布,其在编码和法律基准测试中表现强劲;MiMo‑v2.6‑Pro 登上人工智能指数榜首;两者均伴随着一系列更快的本地推理栈(Husky、Wally、Qwen‑3.8‑27B)以及对物理 AI 所需真实世界空间数据的重新关注(Vangrid、Axis Robotics)。


Grok 4.7 – SpaceXAI 的新型代理模型

  • Grok 4.7 被定位为一个完全代理化的模型,专为长周期编码、工程和知识型任务优化,经过 Cursor 工作流数据的新训练,并在双重用途生物和越狱探测方面增强了安全性@cb_doge。
  • 基准测试亮点包括 CursorBench 4.0 得分为 46.3 %(较之前的 40.4 % 提升),DeepSWE v1.1 得分为 71.0 %(较之前的 65.2 % 提升),以及 19.6 % 的 Legal Agent Benchmark——几乎比前代最佳模型高出三倍@cb_doge@cb_doge。
  • 定价为每百万输入 token 2 美元,每百万输出 token 6 美元,与 Grok 4.6 保持一致,同时在许多任务上实现了约两倍的速度提升@aimlapi@MarioNawfal。
  • 该模型可通过 Grok Build 终端、Cursor IDE 以及主要模型网关(OpenRouter、Vercel、Cloudflare、Snowflake、Databricks)获取@cb_doge@testingcatalog。
  • SpaceXAI 的官方模型卡片强调,该模型永远不会被无声降级,这一说法也在社区评论中得到呼应@XFreeze。

MiMo‑v2.6‑Pro – 开源权重排行榜竞争者

  • MiMo‑v2.6‑Pro 被宣布为人工智能指数上表现最佳的开源权重模型,排名第六,多项任务上与 Claude Opus 5 和 GPT‑5.6 Sol 表现相当@testingcatalog@cline。
  • 该模型通过 ClinePass 平台分发,并由 testing‑catalog 账号突出展示其在视觉场景生成基准测试中的高性价比表现@testingcatalog@aimlapi。
  • 有用户声称该模型解决了 100 个长期存在的数学问题,但该推文也承认这一说法被夸大了@kimmonismus。

更快的本地推理引擎

  • Husky(模型特定推理)声称相比 Apple 的 MLX‑Woof 最多提升 4.5 倍速度,可在 MacBook 上实现 730 tokens / s 的性能,支持私有、高性能的本地 AI@0xSigil。
  • Wally(随处运行)发布了多个前沿模型的性能快照,例如 GLM‑5.3 Flash 在未指明硬件上达到 380 tok/s,Qwen‑3.8‑27B 达到 485 tok/s@RunAnywhereAI。
  • Qwen‑3.8‑27B 在经过一个月的引擎优化后,于 M5 Max MacBook Pro 上实现 6 倍速度提升,代理子任务的推理速度达到约 120 tok/s@adrgrondin。
  • Qwen‑Image‑2.1 已在 vLLM‑Omni 中获得日初支持,可使用 7.1 B DiT 模型与 Qwen‑3‑VL‑8B 配合生成和编辑透明图像@vllm_project。
  • Tim Dettmers 宣布将举办“开源推理周”,发布专注于在消费级硬件上运行前沿 AI 的框架和论文,包括自动模型压缩和长时间运行的 token 流@Tim_Dettmers。

物理 AI 与真实世界空间数据

  • Vangrid 正在构建一个去中心化的采集网络,将多角度手机视频转化为设备端的密集点云和高斯斑点,为机器人和世界模型训练提供可验证的三维几何结构@Sainoleno@cxmrondlls@Trathoa。
  • 该项目已融资 900 万美元,并为顶尖贡献者提供 10 万美元奖金池,强调链上溯源和隐私优先处理@reduansheikh11。
  • Axis Robotics(及相关评论)强调需要大规模、真实世界的机器人轨迹;其平台通过众包远程操作会话生成训练数据,目前已汇集超过 94,000 名贡献者和超过 200 万次录制会话@kishanchiku@Real_TShelby。
  • 多位分析师指出,物理 AI 的瓶颈在于高质量、实时更新的空间数据,而非模型规模,这使得 Vangrid 和 Axis 成为未来具身智能的关键基础设施@jitusorkar12@hasibs00。

代理信用与 AI 驱动金融

  • Agentics Credit 推出代理信用评分(ACS),范围为 300–850,评估 AI 交易代理的盈利能力、回撤、一致性和风险,要求评分达到 580 才能接入实时资金@cryptob28811588@MadMagicSOL@0xRiRoyal。
  • 该系统通过奖励模拟交易表现来建立可验证的业绩记录,再授予链上信用,旨在为 DeFi 生态系统中的自主代理创建声誉层@nguyenthambt@tianyi_peng。
  • 社区帖子将专有代理工具(Claude Code、Codex CLI)的成本与轻量级开源框架(如 Pi)进行比较,显示在相当的基准得分下,API 使用成本可降低高达 2 倍@analogalok。

新兴模型与工具发布

  • 据报道,Meta 的 Muse AI 在发布后下载量超过 ChatGPT、Grok 和 Claude,表明新型代理助手的快速采用@Cointelegraph。
  • Perplexity Computer 通过 MiniMax H3 和 ByteDance Seedance 2.5 增加了视频生成功能,扩展了 AI 辅助创意工作流的多模态能力@perplexity_ai。
  • Pollo MCP 为 ChatGPT、Claude 和 Cursor 提供图像和视频生成插件,新用户可获得 40 积分的入门激励@TaliaAariz@ayzalnooor24521。
  • 开源模型发布 包括阿里巴巴的 Qwen‑Image‑2.1(量化版)和 Yandex 的 Alice AI Foundation 80B‑A3B 基础模型,均已向社区开放用于实验@plotarmordev@yandexcom。

核心观点: 本周前沿 AI 领域由两个交汇趋势定义:(1)更强大、面向代理的模型(Grok 4.7、MiMo‑v2.6‑Pro)不断发布,定价面向大规模采用;(2)向低延迟、本地推理和真实世界数据管道(Husky、Wally、Vangrid、Axis)的推进,使这些模型能够在物理环境和设备端工作负载中发挥作用。与此同时,生态系统正围绕 AI 代理的信任与经济展开成熟,体现在 Agentics Credit 的声誉评分机制,以及对 API 工具成本效率的日益关注。