101

为什么专业化在 AI 系统中是不可避免的

基于 Goldfeder 等人 2026 年的研究,专业化是 AI 性能的结构性必要条件,因为有限的资源使得集中能力比广泛的通用性更有效。

102

OpenAI Signals: 全球 ChatGPT 采用趋势分析

OpenAI Signals 数据表明,ChatGPT 使用在全球范围内正在深化和扩展,用户在注册六个月后每日消息量增加 50%,执行的任务种类翻倍。

103

Hugging Face 社区评估与 Every Eval Ever (EEE) 集成

Hugging Face 已将社区评估与 Every Eval Ever (EEE) 项目集成,实现标准化评估结果的跨平台发布,并在模型页面与详细技术记录之间建立直接链接。

104

OpenAI 核心转储流行病学:修复一个 18 年前的 libunwind 错误

OpenAI 在其 Rockset 数据基础设施中识别并解决了两种不同的崩溃人群,包括一次静默硬件故障和 GNU libunwind 中罕见的 18 年前竞争条件。

105

Inside Genebench-Pro: 基因组 AI 基准测试的案例研究

OpenAI 的 Genebench-Pro 提供了一个专门的基准,用于评估 AI 模型在复杂基因组任务上的表现,涵盖体细胞肿瘤学、功能基因组学和种群遗传学中的十个详细案例研究。

106

OpenAI 推出 GeneBench-Pro 用于计算生物学推理

OpenAI 已发布 GeneBench-Pro,这是一个研究级基准,旨在评估 AI 代理在计算生物学中的高级科学判断和迭代分析能力。

107

TITLE: DiScoFormer: 用于密度和得分的单一Transformer,跨越分布

SUMMARY: DiScoFormer 是一种新的基于Transformer的模型,能够在一次前向传播中从一组数据点估计分布的密度和得分,而无需为新分布重新训练模型。

108

OpenAI 绘制欧洲 AI 劳动力机遇报告 2026

OpenAI 的 2026 年报告将其 AI 职业转型框架扩展到欧盟,发现约 12% 的欧盟就业可能因 AI 而增长,14% 面临更高的近期自动化潜力,27% 可能重组,47% 的变化不那么迫切。

109

vLLM Semantic Router: 通过微智能体协作提升模型性能

vLLM 引入了 Semantic Router,这是一个服务层原语,它将单个模型 API 调用转换为微智能体的有限协作,以在复杂基准上超越前沿模型。

110

HP Inc. 和 OpenAI 战略合作伙伴关系

HP Inc. 正在使用 OpenAI Frontier 平台扩大其与 OpenAI 的战略合作伙伴关系,以在客户支持、安全和软件开发领域部署 AI 代理和工作流。

111

GPT-5.6 Sol 预览:功能、防护措施和可用性

OpenAI 预览了 GPT-5.6 Sol,其旗舰下一代模型,与 Terra 和 Luna 一同发布,强调了增强的编码、生物学和网络安全能力,配备增强的防护措施,并面向可信合作伙伴进行有限发布。

112

Hugging Face Jobs: 使用单个命令部署 vLLM 服务器

Hugging Face 现在允许用户通过 HF Jobs 使用单个命令在其基础设施上部署私有的 OpenAI 兼容 vLLM 端点,为测试、评估和批量生成提供了一种按秒计费的替代方案。

113

OpenAI Codex 代理 AI 采用与影响

OpenAI 报告称,通过 Codex,知识工作从短暂的聊天机器人互动转向长期的代理 AI 任务,非开发者采用率自 2025 年 8 月以来增长了高达 189 倍。

114

Gemini 3.5 Flash 计算机使用集成

Google DeepMind 将计算机使用作为原生工具集成到 Gemini 3.5 Flash 中,使代理能够在浏览器、移动设备和桌面环境中看到、推理并采取行动。

115

NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微调

NVIDIA NeMo AutoModel 提供 3.4‑3.7 倍更高的训练吞吐量和 29‑32% 更低的 GPU 内存占用,用于微调 Mixture-of-Experts 模型。它基于 Hugging Face Transformers v5,加入 Expert Parallelism、DeepEP 与 TransformerEngine 内核,仅需一次 import 更改即可使用。

116

OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片

OpenAI 和 Broadcom 推出了 Jalapeño,这是一个专为 LLM 推理优化的定制 AI 加速器,旨在提升每瓦性能并降低计算成本。

117

Hugging Face FFASR 排行榜:远场 ASR 基准测试

Hugging Face 与 Treble Technologies 推出了 FFASR 排行榜,这是首个由社区驱动的开放基准测试,旨在量化在真实声学环境下近场与远场自动语音识别 (ASR) 之间的性能差距。

118

GPT-5 Pro 在免疫学中:解决 T 细胞专门化之谜

免疫学家 Derya Unutmaz 使用 GPT-5 Pro 解决了一个关于脱氧葡萄糖如何影响 T 细胞专门化的三年之谜,展示了该模型生成新颖生物学见解和预测未发表实验结果的能力。

119

OpenAI 与 Appia 基金会:为先进 AI 建立共享标准

OpenAI 协助成立了 Appia 基金会,旨在制定开放的模块化规范,将国际 AI 标准转化为实用的评估标准,以确保组织和司法辖区之间的互操作性。

120

Qwen-AgentWorld 发布:面向七个领域的语言世界模型及其对通用代理的影响

Qwen 发布了 Qwen‑AgentWorld,这是一款能够模拟七种代理环境的语言世界模型,并通过可控仿真和统一的下一状态预测提升通用代理。

121

Omio 对话式旅行与 AI 原生运营

Omio 正在利用 OpenAI 模型从基于搜索的旅行规划转向对话式商务,并将产品开发时间降至之前水平的约 20%。

122

Hugging Face huggingface_hub 发布自动化

Hugging Face 通过使用开源工具和 open-weights models 实现 AI 驱动、人机协同的 CI/CD 流水线,已将 huggingface_hub 的发布周期从 4-6 周转变为每周一次。

123

在 Transformers.js 中实验跨源存储 API

Hugging Face 展示了 Transformers.js 如何使用实验性的跨源存储 API,通过哈希缓存模型和 Wasm 资源,从而消除跨来源的重复下载。

124

vLLM-Omni TTS 推理工程

vLLM-Omni 通过应用解耦延迟和吞吐量瓶颈的模型特定优化,为 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型设计了 TTS 推理,显著提升了音频吞吐量并降低了端到端延迟。

125

PP-OCRv6 发布:支持 50 种语言的 OCR,参数量从 1.5M 到 34.5M

PaddlePaddle 发布了 PP-OCRv6,这是一款可扩展的 OCR 模型系列,支持 50 种语言,参数量从 1.5M 到 34.5M。

126

OpenAI Patch the Planet 计划

OpenAI 已推出 Patch the Planet,这是一项与 Trail of Bits 合作的 Daybreak 计划,利用 AI 辅助的安全研究和人工审查来识别并修补关键开源软件中的漏洞。

127

Daybreak:保护世界上每个组织的工具

OpenAI 宣布 Daybreak 的扩展,发布了更新的 Codex Security 插件、GPT‑5.5‑Cyber 的完整版本、网络合作伙伴计划以及 Patch the Planet 倡议,以帮助防御者以机器速度查找、验证和修补漏洞。

128

Hugging Face 本地模型用于 OpenClaw PR 分类

Hugging Face 展示了如何在代理框架中部署本地模型(如 Gemma 4 和 Qwen 3.6),实现对 OpenClaw 仓库的 GitHub issue 与 pull request 的实时、零成本分类。

129

OpenAI Codex-maxxing 用于长期工作

OpenAI 发布了一篇白皮书,详细阐述了将 Codex 用作持久工作区,以管理复杂的多提示工作流和长期项目的策略。

130

三星电子部署 ChatGPT Enterprise 和 Codex

三星电正在向韩国所有员工以及全球 Device eXperience (DX) 部门的所有员工部署 ChatGPT Enterprise 和 Codex,以提升研发、制造和企业职能方面的生产力。

131

MosaicLeaks:解决深度研究代理中的隐私泄漏问题

Hugging Face 推出 MosaicLeaks 基准以及 Privacy-Aware Deep Research (PA-DR) 训练方法,以防止研究代理通过外部网络查询泄露企业私有数据。

132

ChatGPT Enterprise 使用分析和支出控制更新

OpenAI 为 ChatGPT Enterprise 引入了信用使用分析和更新的支出控制,帮助组织跟踪信用消耗并在规模上管理 AI 成本。

133

提升 ChatGPT 的健康智能

OpenAI 已使用 GPT-5.5 Instant 更新了 ChatGPT,该模型展示了可与前沿 Thinking 模型相媲美的健康智能,并在生产健康流量中将事实错误问题降低了 71%。

134

OpenAI o3 Deep Research 用于罕见遗传病诊断

研究人员使用 OpenAI o3 Deep Research 通过 AI 辅助研究工作流在 376 例未解决的罕见儿童遗传病病例中实现了 4.8% 的额外诊断产出。

135

Hugging Face 在代理工具上的开源模型基准测试

Hugging Face 引入了一个新的基准测试框架,用于评估不同模型规模和库版本如何影响使用软件工具的编码代理的效率和成功率。

136

Hugging Face PEFT:评估 LoRA 的替代方案

Hugging Face 对 PEFT 库的基准测试表明,虽然 LoRA 广受欢迎,但其他参数高效微调技术如 OFT 和 Lily 在内存效率和测试准确率方面,依据任务的不同,可能超越它。

137

Strands Robots 与 LeRobot 集成:从 Hugging Face Hub 数据集到实体机器人部署

Hugging Face 宣布了 Strands Robots SDK 与 LeRobot 的集成,使用户能够记录机器人演示、将数据推送至 Hub、在仿真中运行策略,并仅通过更改一个参数即可将相同代码部署到实体 SO-101 机器人,同时通过基于 Zenoh 的网格协同多个机器人。

138

OpenAI AI 化学家:使用 GPT-5.4 改进 Chan-Lam 耦合反应

OpenAI 与 Molecule.one 使用 GPT-5.4 和 Maria AI 代理,自动识别并验证了一种利用 TEMPO 提高一元磺酰胺 Chan-Lam 耦合反应产率的方法。

139

GLM-5.2:为长时任务而生

GLM-5.2 由 Z.AI 在 Hugging Face 上发布,提供坚实的 1M token 上下文、通过 IndexShare 与 MTP 改进的架构、算力层级控制,并在长时编码基准上展现出强劲的开源性能。

140

Agentic 资源发现(ARD)规范与 Hugging Face 实现

Hugging Face 推出了 Agentic 资源发现(ARD)规范的参考实现,这是一项开放标准,允许 AI 代理在运行时动态搜索并集成工具、技能和其他代理。

141

OpenAI 推出 LifeSciBench 用于评估生命科学领域的自主 AI

OpenAI 已发布 LifeSciBench,这是一项包含 750 项专家撰写任务的基准,旨在衡量 AI 系统如何处理复杂的、真实的生命科学研究工作流,而非仅仅进行事实回忆。

142

Google DeepMind AI 加速的英国住宅建设规划

Google DeepMind 正与英国政府合作,开发一款基于 Gemini 的 AI 规划原型,旨在将住宅规划申请的处理时间减半。

143

DeepMind AI 控制路线图公告

DeepMind 发布了其 AI 控制路线图,这是一套深度防御框架,将内部 AI 代理视为内部威胁,并添加监控、监督和响应层,以保障日益强大的代理安全。

144

Qwen 机器人套件:用于导航、操作和世界建模的统一基础模型

Qwen 推出了 Qwen‑Robot 套件——三个基础模型(RobotNav、RobotManip、RobotWorld),将语言转化为导航、操作和世界预测动作,实现跨数十种形态的统一代理机器人系统。

145

vLLM 语义路由器 Fusion 原语实现可编程的多模型服务

vLLM 为其语义路由器引入了 Fusion 原语,使可编程的多模型面板、评判和合成成为一等的服务模式。

146

OpenAI 部署模拟:使用真实对话回放进行发布前风险预测

OpenAI 推出了部署模拟,这是一种在发布前使用候选模型回放真实用户对话,以预测不良行为率并改进安全评估的方法。

147

Qwen-RobotWorld: 面向具身代理的无限世界

Qwen-RobotWorld 是一个统一的世界模型,使用自然语言作为通用动作接口,以实现跨场景的物理泛化,覆盖 20 多种机器人形态。

148

Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化

Qwen-RobotManip 是一个视觉-语言-动作(VLA)基础模型,使用统一的对齐框架和人类到机器人数据合成管道,实现了在多种机器人形态和分布外任务上的最先进的泛化能力。

149

Qwen-RobotNav:面向代理系统的可扩展导航模型

Qwen-RobotNav 是一个基于 Qwen3-VL 的统一导航模型,通过将视觉上下文视为可控的推理时接口,实现了在五个导航领域的最先进性能。

150

OpenAI 合作伙伴网络公告

OpenAI 已推出 OpenAI 合作伙伴网络,这是一个由 1.5 亿美元投资支持的全球生态系统,旨在帮助企业识别使用案例、重新设计工作流程并大规模部署 AI 解决方案。