AI 与前沿科技简报:Gemini 4 Argon 发布、多智能体进展及物理 AI 数据项目
TL;DR: Google 的 Gemini 4 Argon 模型推出,具备行业领先的 100 万 token 输出窗口和具有竞争力的定价,同时一系列多智能体和物理 AI 项目(Delvetown、Axis Robotics、Vangrid、Boreal‑H3、ExplorationBench)展示了该领域正转向长周期推理、智能体工作流和现实世界数据循环。
Gemini 4 Argon – Google 的新前沿模型
- 模型能力:Gemini 4 Argon 支持 100 万 token 的输出上限(从 64K 提升),支持多模态输入(文本、图像、视频、语音),上下文窗口达 100 万 token。该模型定位为在复杂软件工程、法律、金融和网络安全工作流中实现深度推理@GoogleAI。
- 性能指标:在 Artificial Analysis Intelligence Index 上,Argon 得分为 53(与 GPT‑6 Astra 相同),在智能体基准测试中领先(AutomationBench‑AA 上得分为 77.5%,优于 Claude Sonnet 5.5)。幻觉率仅为 15%,是得分 45 以上的模型中最低的@ArtificialAnlys。
- 定价与发布:初始发布价格为每 100 万 token 输入 $2、输出 $10,享有 50 % 折扣(实际每任务 $1.99)和 95 % 缓存折扣。该模型目前仅限 Fairwind 计划中的可信网络安全合作伙伴使用,后续将扩大可用范围@_philschmid@GoogleAI。
- 开发者访问:Google 宣布将“尽快”提供开发者访问,并强调该模型的长解码续写功能,可实现超出请求超时限制的响应@_philschmid。
多智能体生态系统与工具
- Delvetown:一个实验性多智能体社会,允许人类与 AI 智能体共存、观察,并原型化人类与 AI 共存的激励对齐机制。它作为一个开放世界环境,用于智能体生态研究@deepfates。
- Claude Opus 5.5 与 GPT‑6.1 发布视频测试:Motion 展示了两个模型在相同提示下生成产品发布视频,展示了前沿模型之间相当的创造性输出@motion_so。
- OrcaRouter 提示分析:开源系统提示用于 12 个编码智能体工具(Claude Code、Codex、Cursor 等),揭示每个工具的“秘密配方”和模型无关组件@OrcaRouter。
- 技能管理器:一个 UI 层,允许开发者开启/关闭编码智能体技能、分组并运行 AI 驱动的问题扫描,提升 Claude Code、Codex、Cursor 等工具的上下文效率@camsoft2000。
- JEV 决策引擎:多位用户(Sili Naihin、Bober_smart、S ᜰ)报告称,JEV 显著降低决策成本(例如每 1000 次判断仅 $0.044,而 GPT‑6 为 $12.18),实现低成本、类型化的决策层,从而减轻高 token 消耗的 LLM 调用负担@silennai@Bober_smart@He1s_Sammy。
- Claude Code 工作流技巧:建议用户将 Opus 5.5 作为主模型,将常规任务委派给 Sonnet 5.5,并保留 Fable 5.1 作为计划验证的咨询子智能体@mirku21。
前沿视频生成
- Boreal‑H3:Creatify Labs 发布了一个针对广告优化的视频模型,实现 85.3 % 的参考保真度和 83 % 的身份匹配率,同时将生成时间和成本降低约 20 %。该系统采用闭环反馈机制,迭代优化数据收集、强化学习和推理优化@Creatify_Labs。
- Minimax H3 步骤减少:Stable Diffusion Tutorials 强调一个 LoRA 可将视频生成压缩至四步推理,且质量损失极小@SD_Tutorial。
- MiniMax‑H3 360° LoRA:一个 360° 等距视频 LoRA,支持在 VR 平台上实现沉浸式视频播放@wildmindai。
ExplorationBench – 测量 AI 探索能力
- 腾讯 Hy、复旦大学和清华大学的研究人员推出了 ExplorationBench,一个评估系统提出假设、设计实验并从结果中学习能力的基准。对十种前沿模型的测试发现,反馈循环能显著提升性能(最佳运行在四轮后达到 89 % 成功率),且仅具备规则意识并不保证任务成功@TencentHunyuan。
物理 AI 数据平台
- Axis Robotics:强调一个数据引擎,可将成功的机器人行为转化为可复用的“专家”模型。近期实验显示成功率从 22 % 提升至 52 %,某些专家在每任务 $5–$10 计算成本下接近 100 % 成功@iam_islandboi@Nahid_2027@destinydou_。
- Vangrid:构建一个去中心化的空间数据网络,贡献者通过智能手机捕捉现实环境,将其转换为点云和高斯点以训练物理 AI 模型。目前已报告超过 100 万次捕捉和 42.3 万个活跃节点@eric_ho@REALJOSHUATIMI@BryanQuartz。
- PRISM (Amazon FAR):引入一个可扩展的“真实→模拟→真实”管道,将四段真实视频扩展为 256 个反事实变体,训练单一策略以在不同物体和布局间泛化@Z1hanW。
开源模型访问与基础设施
- GLM‑5.3 Flash:RunInfra 发布内核重写版本,在 Vercel AI Gateway 上实现 670 tok/s 的吞吐量,支持 100 万 token 上下文和 FP8,定价为每 100 万 token 输入 $0.11、输出 $0.45,并享有 95 % 缓存折扣@runinfrai。
- DeepSeek Harness:现已支持 macOS 和 Windows,简化 DeepSeek 模型的本地部署@DeepSeekHarness。
- 本地 AI 服务栈:一位用户描述了一个基于 DGX‑Spark 的 vLLM 服务器,通过 Tailscale 共享,暴露统一的 OpenAI 兼容端点,可向私有网络中的任意设备提供多个模型(如 GLM 5.3‑Flash)服务@sudoingX。
- OpenBMB OPD 研究:提出 One‑Shot OPD,表明大多数基于策略蒸馏的收益来自单个查询的状态覆盖,而非数据集大小,突显了后训练流水线中的数据效率@OpenBMB。
社区驱动的模型发布
- 开放权重推动:AI Search 宣布 Ideogram 4.5 将以开放权重发布,使本地运行的模型性能超越 GPT‑Image 2.5@aisearchio。
- 模型连续性担忧:一条推文警告,如果中国实验室(Qwen、DeepSeek、Zai、MiniMax、Moonshot)停止发布开放权重,社区可能将失去对前沿模型的独立访问权@superalesha。
其他前沿动态
- Stable Diffusion 视频生成 LoRA 降低了视频生成的推理步骤@SD_Tutorial。
- ExplorationBench 强调反馈循环和动态基准任务对真正 AI 探索能力的重要性@TencentHunyuan。
- Ollama 增加本地决策模型,如 Nimble,用于实时路由和内容审核任务@ollama。
- Mercury Voice 带来扩散加速语音生成,扩展了智能体语音能力@StefanoErmon。
- NeurIPS OASIS 论文 改进了低比特注意力残差,提升长上下文推理的鲁棒性,为前沿模型带来显著性能增益@Michael_Huang_W。
所有陈述均直接源自引用推文;未添加任何外部推测。