归档 · 11 个实验室 · 3,048 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

401

NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微调

NVIDIA NeMo AutoModel 提供 3.4‑3.7 倍更高的训练吞吐量和 29‑32% 更低的 GPU 内存占用,用于微调 Mixture-of-Experts 模型。它基于 Hugging Face Transformers v5,加入 Expert Parallelism、DeepEP 与 TransformerEngine 内核,仅需一次 import 更改即可使用。

402

Mistral AI 推出细粒度管理控制、范围限定的 API 密钥和多账号连接器

Mistral AI 宣布了新的连接器功能——包括 GA 管理控制、范围限定的 API 密钥、多账号连接器、Debugger、以及在 Workflows 和 Vibe Code 中的集成——旨在提高企业级 AI 工作负载的安全性和可靠性。

403

OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片

OpenAI 和 Broadcom 推出了 Jalapeño,这是一个专为 LLM 推理优化的定制 AI 加速器,旨在提升每瓦性能并降低计算成本。

404

Hugging Face FFASR 排行榜:远场 ASR 基准测试

Hugging Face 与 Treble Technologies 推出了 FFASR 排行榜,这是首个由社区驱动的开放基准测试,旨在量化在真实声学环境下近场与远场自动语音识别 (ASR) 之间的性能差距。

405

GPT-5 Pro 在免疫学中:解决 T 细胞专门化之谜

免疫学家 Derya Unutmaz 使用 GPT-5 Pro 解决了一个关于脱氧葡萄糖如何影响 T 细胞专门化的三年之谜,展示了该模型生成新颖生物学见解和预测未发表实验结果的能力。

406

OpenAI 与 Appia 基金会:为先进 AI 建立共享标准

OpenAI 协助成立了 Appia 基金会,旨在制定开放的模块化规范,将国际 AI 标准转化为实用的评估标准,以确保组织和司法辖区之间的互操作性。

407

Mistral OCR 4 发布说明 / 新功能介绍

Mistral AI 发布了 Mistral OCR 4,这是一款高性能文档解析模型,支持 170 种语言,并提供包含边界框、区块分类和置信度分数的结构化输出。

408

Qwen-AgentWorld 发布:面向七个领域的语言世界模型及其对通用代理的影响

Qwen 发布了 Qwen‑AgentWorld,这是一款能够模拟七种代理环境的语言世界模型,并通过可控仿真和统一的下一状态预测提升通用代理。

409

vLLM-Omni TTS 推理工程

vLLM-Omni 通过应用解耦延迟和吞吐量瓶颈的模型特定优化,为 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型设计了 TTS 推理,显著提升了音频吞吐量并降低了端到端延迟。

410

在 Transformers.js 中实验跨源存储 API

Hugging Face 展示了 Transformers.js 如何使用实验性的跨源存储 API,通过哈希缓存模型和 Wasm 资源,从而消除跨来源的重复下载。

411

Omio 对话式旅行与 AI 原生运营

Omio 正在利用 OpenAI 模型从基于搜索的旅行规划转向对话式商务,并将产品开发时间降至之前水平的约 20%。

412

Hugging Face huggingface_hub 发布自动化

Hugging Face 通过使用开源工具和 open-weights models 实现 AI 驱动、人机协同的 CI/CD 流水线,已将 huggingface_hub 的发布周期从 4-6 周转变为每周一次。

413

PP-OCRv6 发布:支持 50 种语言的 OCR,参数量从 1.5M 到 34.5M

PaddlePaddle 发布了 PP-OCRv6,这是一款可扩展的 OCR 模型系列,支持 50 种语言,参数量从 1.5M 到 34.5M。

414

Daybreak:保护世界上每个组织的工具

OpenAI 宣布 Daybreak 的扩展,发布了更新的 Codex Security 插件、GPT‑5.5‑Cyber 的完整版本、网络合作伙伴计划以及 Patch the Planet 倡议,以帮助防御者以机器速度查找、验证和修补漏洞。

415

OpenAI Patch the Planet 计划

OpenAI 已推出 Patch the Planet,这是一项与 Trail of Bits 合作的 Daybreak 计划,利用 AI 辅助的安全研究和人工审查来识别并修补关键开源软件中的漏洞。

416

Hugging Face 本地模型用于 OpenClaw PR 分类

Hugging Face 展示了如何在代理框架中部署本地模型(如 Gemma 4 和 Qwen 3.6),实现对 OpenClaw 仓库的 GitHub issue 与 pull request 的实时、零成本分类。

417

OpenAI Codex-maxxing 用于长期工作

OpenAI 发布了一篇白皮书,详细阐述了将 Codex 用作持久工作区,以管理复杂的多提示工作流和长期项目的策略。

418

三星电子部署 ChatGPT Enterprise 和 Codex

三星电正在向韩国所有员工以及全球 Device eXperience (DX) 部门的所有员工部署 ChatGPT Enterprise 和 Codex,以提升研发、制造和企业职能方面的生产力。

419

MosaicLeaks:解决深度研究代理中的隐私泄漏问题

Hugging Face 推出 MosaicLeaks 基准以及 Privacy-Aware Deep Research (PA-DR) 训练方法,以防止研究代理通过外部网络查询泄露企业私有数据。

420

ChatGPT Enterprise 使用分析和支出控制更新

OpenAI 为 ChatGPT Enterprise 引入了信用使用分析和更新的支出控制,帮助组织跟踪信用消耗并在规模上管理 AI 成本。

421

提升 ChatGPT 的健康智能

OpenAI 已使用 GPT-5.5 Instant 更新了 ChatGPT,该模型展示了可与前沿 Thinking 模型相媲美的健康智能,并在生产健康流量中将事实错误问题降低了 71%。

422

OpenAI o3 Deep Research 用于罕见遗传病诊断

研究人员使用 OpenAI o3 Deep Research 通过 AI 辅助研究工作流在 376 例未解决的罕见儿童遗传病病例中实现了 4.8% 的额外诊断产出。

423

Hugging Face 在代理工具上的开源模型基准测试

Hugging Face 引入了一个新的基准测试框架,用于评估不同模型规模和库版本如何影响使用软件工具的编码代理的效率和成功率。

424

Hugging Face PEFT:评估 LoRA 的替代方案

Hugging Face 对 PEFT 库的基准测试表明,虽然 LoRA 广受欢迎,但其他参数高效微调技术如 OFT 和 Lily 在内存效率和测试准确率方面,依据任务的不同,可能超越它。

425

Anthropic 项目 Fetch 第二阶段

Claude Opus 4.7 展示了自主执行机器人控制任务的能力,速度约为人类团队的 20 倍,标志着向物理自主 AI 的转变。

426

Grok for Word 发布说明

xAI 发布了 Grok for Word,这是一款免费的 Microsoft 365 插件,使用户能够生成结构化文档、进行网络和 X 研究,并从外部连接器集成数据。

427

Grok 模型现已在 Databricks Agent Bricks 上可用

xAI 已将 Grok 模型集成到 Databricks Agent Bricks 平台,允许企业在具有受控访问权限的 Lakehouse 数据上构建 AI 代理。

428

Strands Robots 与 LeRobot 集成:从 Hugging Face Hub 数据集到实体机器人部署

Hugging Face 宣布了 Strands Robots SDK 与 LeRobot 的集成,使用户能够记录机器人演示、将数据推送至 Hub、在仿真中运行策略,并仅通过更改一个参数即可将相同代码部署到实体 SO-101 机器人,同时通过基于 Zenoh 的网格协同多个机器人。

429

OpenAI AI 化学家:使用 GPT-5.4 改进 Chan-Lam 耦合反应

OpenAI 与 Molecule.one 使用 GPT-5.4 和 Maria AI 代理,自动识别并验证了一种利用 TEMPO 提高一元磺酰胺 Chan-Lam 耦合反应产率的方法。

430

GLM-5.2:为长时任务而生

GLM-5.2 由 Z.AI 在 Hugging Face 上发布,提供坚实的 1M token 上下文、通过 IndexShare 与 MTP 改进的架构、算力层级控制,并在长时编码基准上展现出强劲的开源性能。

431

Agentic 资源发现(ARD)规范与 Hugging Face 实现

Hugging Face 推出了 Agentic 资源发现(ARD)规范的参考实现,这是一项开放标准,允许 AI 代理在运行时动态搜索并集成工具、技能和其他代理。

432

OpenAI 推出 LifeSciBench 用于评估生命科学领域的自主 AI

OpenAI 已发布 LifeSciBench,这是一项包含 750 项专家撰写任务的基准,旨在衡量 AI 系统如何处理复杂的、真实的生命科学研究工作流,而非仅仅进行事实回忆。

433

Anthropic 在首尔开设新办公室以拓展韩国人工智能生态系统

Anthropic 已在首尔开设新办公室,并与韩国科学技术信息通信部签署谅解备忘录,以推进人工智能安全并扩大 Claude 在韩国企业及研究机构中的应用。

434

Grok 4.3 在 Amazon Bedrock 上发布

xAI 已在 Amazon Bedrock 上正式发布 Grok 4.3,该模型拥有 100 万 token 的上下文窗口,并在前沿模型中实现了最低的幻觉率。

435

Google DeepMind AI 加速的英国住宅建设规划

Google DeepMind 正与英国政府合作,开发一款基于 Gemini 的 AI 规划原型,旨在将住宅规划申请的处理时间减半。

436

DeepMind AI 控制路线图公告

DeepMind 发布了其 AI 控制路线图,这是一套深度防御框架,将内部 AI 代理视为内部威胁,并添加监控、监督和响应层,以保障日益强大的代理安全。

437

Qwen 机器人套件:用于导航、操作和世界建模的统一基础模型

Qwen 推出了 Qwen‑Robot 套件——三个基础模型(RobotNav、RobotManip、RobotWorld),将语言转化为导航、操作和世界预测动作,实现跨数十种形态的统一代理机器人系统。

438

vLLM 语义路由器 Fusion 原语实现可编程的多模型服务

vLLM 为其语义路由器引入了 Fusion 原语,使可编程的多模型面板、评判和合成成为一等的服务模式。

439

OpenAI 部署模拟:使用真实对话回放进行发布前风险预测

OpenAI 推出了部署模拟,这是一种在发布前使用候选模型回放真实用户对话,以预测不良行为率并改进安全评估的方法。

440

Qwen-RobotWorld: 面向具身代理的无限世界

Qwen-RobotWorld 是一个统一的世界模型,使用自然语言作为通用动作接口,以实现跨场景的物理泛化,覆盖 20 多种机器人形态。

441

Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化

Qwen-RobotManip 是一个视觉-语言-动作(VLA)基础模型,使用统一的对齐框架和人类到机器人数据合成管道,实现了在多种机器人形态和分布外任务上的最先进的泛化能力。

442

Qwen-RobotNav:面向代理系统的可扩展导航模型

Qwen-RobotNav 是一个基于 Qwen3-VL 的统一导航模型,通过将视觉上下文视为可控的推理时接口,实现了在五个导航领域的最先进性能。

443

Anthropic Claude Code 使用报告 2026 年 6 月 – 关于代理式编程、专业能力与劳动力影响的发现

Anthropic 分析了约 40 万次 Claude Code 会话(2025 年 10 月至 2026 年 4 月),发现用户负责规划任务而 Claude 负责执行,成功率与各职业的专业软件工程师相当,而领域专业知识——而非编程技能——是决定更高成功率与更高任务价值的关键因素。

444

Grok for PowerPoint 发布说明

xAI 发布了 Grok for PowerPoint,这是一个免费的 Microsoft 365 插件,允许用户使用 Grok 的 AI 能力生成演示文稿、研究内容并应用样式。

445

Grok Imagine Video 1.5 发布说明

xAI 发布了 Grok Imagine Video 1.5,这是一款图像转视频模型,具备更优的运动表现、物理真实感以及集成音频生成能力,且生成速度更快。

446

Grok Build Agent Dashboard 发布

xAI 在 Grok Build 中引入了 Agent Dashboard,这是一个集中式的管理界面,允许开发者同时监控、分派和与多个并行的编码会话进行交互。

447

OpenAI 合作伙伴网络公告

OpenAI 已推出 OpenAI 合作伙伴网络,这是一个由 1.5 亿美元投资支持的全球生态系统,旨在帮助企业识别使用案例、重新设计工作流程并大规模部署 AI 解决方案。

448

OpenAI 学院课程:工作中的 AI 采纳

OpenAI 已推出三门新课程——AI 基础、应用 AI 基础和代理与工作流——帮助组织建立 AI 流畅度,并从单个任务改进转向结构化的、由代理协助的工作流。

449

MiniMax M3 vLLM 支持:面向 1M Token 多模态推理的 Day-0 部署

vLLM 已发布对 MiniMax M3 系列模型的 Day-0 支持,借助 MiniMax Sparse Attention (MSA) 实现高效的 1M Token 上下文服务和原生多模态推理。

450

Preply 与 OpenAI:用 AI 个性化语言学习

Preply 已集成 OpenAI API,打造课程洞察工具,将 1:1 人工辅导课程转化为通过自动化反馈和针对性练习实现的个性化学习旅程。