归档 · 11 个实验室 · 869 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

101

DeepInfra 与 Hugging Face 推理提供商集成

Hugging Face 已将 DeepInfra 添加为支持的推理提供商,使得可以直接通过 Hub 和客户端 SDK 访问超过 100 种模型的无服务器访问,包括 DeepSeek V4 和 Kimi-K2.6。

102

NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性

NVIDIA 发布了 Nemotron 3 Nano Omni,这是一款全模态模型,能够跨文本、图像、视频和音频进行长上下文推理,并在文档智能和视频理解基准测试中提供了业界领先的准确率。

103

# OpenAI 隐私过滤器:构建可扩展的 PII 检测 Web 应用

OpenAI 已发布 Privacy Filter,这是一个开源的 15亿参数 PII 检测器,能够在 128k 上下文窗口中标记八类敏感数据。

104

DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文

DeepSeek-V4 引入了由混合 CSA/HCA 注意力机制驱动的 1M-token 上下文窗口,专门针对长程 Agent 工作负载和工具使用轨迹进行了优化。

105

使用 Transformers.js 在 Chrome 扩展程序中

Hugging Face 提供了一份关于在清单 V3 下将 Transformers.js 集成到 Chrome 扩展程序的技术指南,展示了由 Gemma 4 E2B 驱动的后台托管模型架构。

106

QIMMA:质量优先的阿拉伯语大型语言模型排行榜

Hugging Face 及其合作伙伴推出了 QIMMA,这是一款全新的阿拉伯语 LLM 排行榜,采用严格的质量验证流水线,以确保基准测试真实反映语言能力。

107

Hugging Face:AI 与网络安全的未来

Hugging Face 认为,开源 AI 模型和工具对于网络安全防御至关重要,以抵御像 Mythos 这样的自主漏洞发现系统带来的风险。

108

Hugging Face transformers-to-mlx Skill and Test Harness

Hugging Face 发布了一个 Skill 和一个非 Agent 测试框架,旨在简化从 transformers 库到 mlx-lm 的语言模型移植过程,同时保持高质量的代码质量和评审信号。

109

使用 Sentence Transformers 进行多模态嵌入与重排序模型的训练与微调

Hugging Face 发布了一篇关于使用 Sentence Transformers 训练和微调多模态嵌入及重排序模型的指南,展示了任务特定微调如何提升诸如视觉文档检索等检索任务的性能。

110

Ecom-RLVE: 自适应可验证环境用于电子商务对话代理

Hugging Face 推出 EcomRLVE-GYM,一个使用八个可验证的多回合环境并具有自适应难度缩放的框架,用于训练电子商务代理,以弥合对话流畅性与实际任务完成之间的差距。

111

VAKRA 基准测试分析:智能体推理、工具使用与失败模式

Hugging Face 发布了 VAKRA 基准测试,这是一个以工具为基础的可执行套件,用于评估 AI 智能体在 8,000 多个 API 和文档源上的组合推理能力,揭示了在工具选择、多跳推理和策略遵循方面的普遍失败。

112

HCompany HoloTab 发布

HCompany 已发布 HoloTab,这是一款由 Holo3 模型驱动的 Chrome 扩展程序,允许用户通过自然语言描述或录制的例程来自动化网页任务。

113

Waypoint-1.5 发布说明

Hugging Face 和 Overworld 发布了 Waypoint-1.5,这是一款实时视频世界模型,能够让高保真交互式生成环境在消费级 GPU 上本地运行。

114

Safetensors 加入 PyTorch 基金会

Safetensors 已转为 PyTorch 基金会和 Linux 基金会旗下的基金会托管项目,以确保供应商中立的治理和社区驱动的开发。

115

Gemma 4 发布:开源多模态模型,支持本地设备

Gemma 4 是 Google DeepMind 推出的全新开源多模态系列,已在 Hugging Face 上发布,支持图像、音频、视频,拥有最高 256 K 上下文,并可在发布首日即与 transformers、llama.cpp、MLX、Rust 和 WebGPU 兼容。

116

Falcon Perception 与 Falcon OCR 发布

Hugging Face 和 TII 推出 Falcon Perception,这是一种 0.6B 参数的早期融合 Transformer,用于开放词汇定位;以及 Falcon OCR,这是一种 0.3B 参数的高吞吐量文档理解模型。

117

Gradio Server:将自定义前端与 Gradio 后端集成

Hugging Face 推出 gradio.Server,这是一款 FastAPI 扩展,允许开发者使用任意自定义前端框架,同时保留 Gradio 的排队、API 基础设施以及 ZeroGPU 支持。

118

Granite 4.0 3B Vision 发布说明 / 新功能

IBM 发布了 Granite 4.0 3B Vision,这是一款针对企业文档理解进行优化的紧凑多模态模型,具备高精度表格提取、图表推理和键值对提取功能。

119

OpenMed CodonRoBERTa 多物种 mRNA 语言模型发布

OpenMed 发布了一个端到端的蛋白质工程流水线,包含 CodonRoBERTa-large-v2(困惑度 4.10,CAI 0.404)以及一个在 55 GPU 小时内训练完成、成本为 165 美元的 25 物种密码子优化模型套件。

120

TRL v1.0 发布说明 / 新功能

Hugging Face 发布了 TRL v1.0,这是一款实现了超过 75 种方法的稳定后训练库,采用双轨稳定模型,以在快速实验迭代和生产级可靠性之间取得平衡。

121

Hugging Face OpenClaw 迁移指南

Hugging Face 提供两种方法——Inference Providers 和本地 llama.cpp 设置——将 OpenClaw 代理从受限的 Claude 模型迁移到开源替代方案。

122

EVA 端到端语音代理评估框架

EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。

123

领域特定嵌入微调与 NVIDIA Nemotron – 一天内完成

NVIDIA 与 Hugging Face 发布了一个单 GPU、一天内完成的流水线,可在合成领域数据上微调 Llama‑Nemotron‑Embed‑1B‑v2 模型,实现超过 10% 的检索提升,且在真实企业数据集上提升最高达 26%。

124

Hugging Face 开源现状:2026 年春季

Hugging Face 报告称,2025 年开源 AI 生态系统出现大幅扩张,特点是中国在模型下载量上超越美国,且机器人领域迅速崛起成为最大的数据集类别。

125

Holotron-12B 高吞吐量计算机使用代理

H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。

126

Hugging Face 存储桶发布

Hugging Face 推出了 Storage Buckets,这是一种可变的、类似 S3 的对象存储系统,基于 Xet,能够高效处理如检查点和处理后数据等中间机器学习产物。

127

让 Token 持续流动:来自 16 个开源 RL 库的经验教训

Hugging Face 调查了 16 个开源 RL 库,发现异步 RL 训练将推理和训练分离到不同的 GPU 池,使用 rollout 缓冲区,并以异步方式推送权重;Ray 主导编排,NCCL 广播是常用的权重同步方式。

128

LeRobot v0.5.0 发布说明 / 新功能

Hugging Face 发布了 LeRobot v0.5.0,提供了完整的 Unitree G1 人形机器人支持、新的 VLA 策略如 Pi0-FAST 和 Wall-X,以及显著的数据集性能优化。

129

Ulysses 序列并行用于百万标记上下文训练

Hugging Face 已将 Ulysses 序列并行集成到 Accelerate、Transformers 和 TRL 中,使得通过在多 GPU 上分布注意力计算,能够训练拥有百万标记上下文的 LLM。

130

将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化

Hugging Face 与 NXP 提供了一份在 i.MX 95 SoC 上部署视觉-语言-动作(VLA)模型的技术指南,强调数据集一致性、架构分解以及异步推理,以实现实时机器人控制。

131

Hugging Face 模块化 Diffusers 发布

Hugging Face 推出了 Modular Diffusers,这是一种可组合的框架,允许用户通过混合搭配可重用块来构建扩散管道,而无需从头编写完整的管道。

132

PRX 第三部分:在 24 小时内训练文本到图像模型

Hugging Face 与 Photoroom 展示了使用 32 块 H200 GPU、约 1500 美元预算,在 24 小时内训练出的文本到图像模型,结合了像素空间训练、Token 路由和表征对齐。

133

Transformer 中的专家混合(MoEs)

Hugging Face 重新设计了 transformers 库,通过全新的权重加载重构、可插拔的专家后端以及原生的专家并行,使专家混合(MoEs)成为一等公民。

134

使用 Unsloth 和 Hugging Face Jobs 训练 AI 模型

Hugging Face 已将 Unsloth 与 Hugging Face Jobs 集成,以实现快速、低成本的 LLM 微调,专为像 LiquidAI/LFM2.5-1.2B-Instruct 这样的小模型进行优化。

135

GGML 与 llama.cpp 加入 Hugging Face

GGML,llama.cpp 的创建者,已加入 Hugging Face,为本地 AI 推理提供可持续资源,并简化 Transformers 库与本地模型部署之间的集成。

136

IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障

IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。

137

Gradio 6 gr.HTML:一次性 Web 应用开发

Gradio 6 引入了对 gr.HTML 的增强支持,支持自定义模板、作用域 CSS 和 JavaScript 交互,使得能够在单个 Python 文件中创建复杂的网页组件。

138

Hugging Face CUDA 内核代理技能

Hugging Face 推出了一项代理技能,使 Claude、Codex 等编码代理能够编写、基准测试并集成用于 transformers 和 diffusers 库的可投入生产的 CUDA 内核。

139

OpenEnv: 在真实环境中评估使用工具的智能体

Hugging Face 和 Meta 推出了 OpenEnv,这是一个开源框架,用于针对真实系统和像 Calendar Gym 这样的生产级环境评估 AI 智能体,以弥合研究与生产可靠性之间的差距。

140

Transformers.js v4 发布说明 / 新功能

Hugging Face 发布了 Transformers.js v4,引入了全新用 C++ 重写的 WebGPU 运行时,以在浏览器和服务器端运行时实现硬件加速,并提供了一个独立的 tokenizers 库。

141

SyGra 2.0.0 Studio 发布

SyGra 2.0.0 引入了 Studio,一个用于设计和执行合成数据生成工作流的可视化交互式环境,无需手动编辑 YAML 文件。

142

Hugging Face 社区评估

Hugging Face 推出了社区评估,这是一套去中心化的系统,可在 Hub 上直接报告和汇总模型基准分数,以提升透明度和可复现性。

143

H Company Holo2-235B-A22B 预览版发布

H Company 已发布 Holo2-235B-A22B 预览版,这是一款在 Screenspot‑Pro 和 OSWorld G 基准上实现了最新技术水平表现的 UI 本地化模型。

144

全球开源 AI 生态系统的未来:从 DeepSeek 到 AI+

Hugging Face 分析了开源如何成为中国 AI 组织的主导策略,已从孤立的模型突破转向模型、硬件和基础设施的可扩展、集成生态系统。

145

文本到图像模型的训练设计:消融实验的经验教训

由于 429 Too Many Requests 错误,提供的 Hugging Face 关于文本到图像模型训练设计的源材料不可用。

146

介绍 Daggr:以可视化检查方式以编程方式链式连接 AI 应用

Hugging Face 发布了 Daggr,这是一款开源的 Python 库,允许开发者以编程方式将 Gradio 应用、机器学习模型和自定义函数串联成工作流,并自动生成可视化画布用于调试和状态管理。

147

Hugging Face Upskill:通过 Agent Skills 将专家能力转移到更小的模型

Hugging Face 推出了 upskill,这是一款利用 Claude Opus 4.5 等高能力模型生成经过验证的“代理技能”,以提升更小或开源模型在复杂任务(如 CUDA 内核开发)上的性能和 token 效率的工具。

148

中国开源 AI 生态系统的架构选择:从 DeepSeek R1 到硬件优先、MoE 驱动的格局

DeepSeek R1 开源发布一年后,中国 AI 社区的焦点从追求最大单模型性能转向构建灵活、成本效益高且硬件感知的 AI 系统。混合专家(Mixture‑of‑Experts,MoE)成为默认架构,通过在每次请求中仅激活部分专家,使超大模型保持可负担。多模态竞争爆发,文本‑到‑图像、视频、音频、3‑D 与智能体等开源发布均配套完整工具链。小模型(≤30 B)因易于本地部署和微调而激增,大型 MoE 模型则充当蒸馏的教师网络。Apache 2.0 与 MIT 许可证成为主流,消除法律摩擦,加速商业落地。硬件优先思路兴起:发布时附带针对国产芯片(华为 Ascend、寒武纪、昆仑等)的量化、推理与服务栈,训练流水线也公开文档。竞争优势已从原始模型规模转向系统设计、部署效率以及开源生态的深度融合。

149

Alyah:阿联酋方言基准用于阿拉伯语大型语言模型

Hugging Face 与合作伙伴推出了 Alyah,这是一套手工收集的 1,173 条样本基准,旨在评估阿拉伯语大型语言模型在阿联酋方言下的语言和文化能力。

150

GPT-OSS Agentic RL 训练:一次实践回顾

Hugging Face 和 LinkedIn 研究人员详细阐述了为使 GPT-OSS 模型实现稳定的 agentic 强化学习所需的工程修复,重点关注 MoE 路由、注意力 sink 和内存效率。