归档 · 11 个实验室 · 869 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

51

Profiling in PyTorch (Part 3): Attention is all you profile

Hugging Face 的《PyTorch 分析指南 (第 3 部分)》展示了不同的注意力实现如何在 PyTorch 分析器追踪中呈现,揭示了朴素、原地、math、高效、flash 和 cuDNN 后端的性能权衡。

52

Hugging Face 原生速度 vLLM Transformers 建模后端

Hugging Face 通过在运行时动态应用推理专用的层融合,更新了 transformers vLLM 后端,使其吞吐量能够匹配或超过自定义 vLLM 实现。

53

Hugging Face 与 Amazon SageMaker Studio 集成

Hugging Face 推出了与 Amazon SageMaker AI 的深度链接集成,使开发者能够通过一次点击,从模型发现直接进入 SageMaker Studio 进行微调或部署。

54

Foundry 托管计算上的 Hugging Face 模型

Microsoft Foundry 现在整合了一个经过策划、每周刷新的 Hugging Face 开放权重模型目录,可以通过一键部署到 Foundry 托管计算上,以实现企业级运营化。

55

Hugging Face 和 SkyPilot 集成以实现零弹出 AI 存储

Hugging Face 和 SkyPilot 已集成,使 AI 工作负载能够在任何云提供商上运行,并且读取存储在 Hugging Face Hub 上的模型和数据集时产生零弹出费用。

56

LeRobot v0.6.0 release notes / what's new

LeRobot v0.6.0 引入了世界模型策略、扩展的 VLA 模型库、统一的奖励模型 API,以及具有 DAgger 式人机回环纠正功能的新部署 CLI。

57

PRX 数据策略:通过 VLM 重新标注和 Mosaic 流式传输扩展预训练

Photoroom 详细说明了 PRX 的数据管道,强调使用长 VLM 生成的标注、混合 Lance 和 Mosaic 数据碎片存储策略以及高质量 JPEG 编码,以优化一个 7B 参数模型。

58

Hugging Face Kernels 重大更新

Hugging Face 宣布其 Kernels 项目的重大更新,引入了新的 kernel 仓库类型、受信任的发布者和代码签名、改造的 CLIs、更广泛的框架支持以及面向代理的 kernel 开发基础。

59

Hugging Face 和 Cerebras 使用 Gemma 4 的实时语音 AI

Hugging Face 和 Cerebras 开发了一个使用 Gemma 4 31B 的开放级联语音到语音管道,以实现自然的低延迟语音 AI 交互。

60

ScarfBench: 用于企业 Java 框架迁移的 AI Agent 基准测试

IBM Research 推出 ScarfBench,一个开放的基准,用于评估 AI Agent 迁移企业 Java 应用跨 Spring、Jakarta EE 和 Quarkus 框架的能力。

61

为什么专业化在 AI 系统中是不可避免的

基于 Goldfeder 等人 2026 年的研究,专业化是 AI 性能的结构性必要条件,因为有限的资源使得集中能力比广泛的通用性更有效。

62

Hugging Face 社区评估与 Every Eval Ever (EEE) 集成

Hugging Face 已将社区评估与 Every Eval Ever (EEE) 项目集成,实现标准化评估结果的跨平台发布,并在模型页面与详细技术记录之间建立直接链接。

63

TITLE: DiScoFormer: 用于密度和得分的单一Transformer,跨越分布

SUMMARY: DiScoFormer 是一种新的基于Transformer的模型,能够在一次前向传播中从一组数据点估计分布的密度和得分,而无需为新分布重新训练模型。

64

Hugging Face Jobs: 使用单个命令部署 vLLM 服务器

Hugging Face 现在允许用户通过 HF Jobs 使用单个命令在其基础设施上部署私有的 OpenAI 兼容 vLLM 端点,为测试、评估和批量生成提供了一种按秒计费的替代方案。

65

NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微调

NVIDIA NeMo AutoModel 提供 3.4‑3.7 倍更高的训练吞吐量和 29‑32% 更低的 GPU 内存占用,用于微调 Mixture-of-Experts 模型。它基于 Hugging Face Transformers v5,加入 Expert Parallelism、DeepEP 与 TransformerEngine 内核,仅需一次 import 更改即可使用。

66

Hugging Face FFASR 排行榜:远场 ASR 基准测试

Hugging Face 与 Treble Technologies 推出了 FFASR 排行榜,这是首个由社区驱动的开放基准测试,旨在量化在真实声学环境下近场与远场自动语音识别 (ASR) 之间的性能差距。

67

在 Transformers.js 中实验跨源存储 API

Hugging Face 展示了 Transformers.js 如何使用实验性的跨源存储 API,通过哈希缓存模型和 Wasm 资源,从而消除跨来源的重复下载。

68

Hugging Face huggingface_hub 发布自动化

Hugging Face 通过使用开源工具和 open-weights models 实现 AI 驱动、人机协同的 CI/CD 流水线,已将 huggingface_hub 的发布周期从 4-6 周转变为每周一次。

69

PP-OCRv6 发布:支持 50 种语言的 OCR,参数量从 1.5M 到 34.5M

PaddlePaddle 发布了 PP-OCRv6,这是一款可扩展的 OCR 模型系列,支持 50 种语言,参数量从 1.5M 到 34.5M。

70

Hugging Face 本地模型用于 OpenClaw PR 分类

Hugging Face 展示了如何在代理框架中部署本地模型(如 Gemma 4 和 Qwen 3.6),实现对 OpenClaw 仓库的 GitHub issue 与 pull request 的实时、零成本分类。

71

MosaicLeaks:解决深度研究代理中的隐私泄漏问题

Hugging Face 推出 MosaicLeaks 基准以及 Privacy-Aware Deep Research (PA-DR) 训练方法,以防止研究代理通过外部网络查询泄露企业私有数据。

72

Hugging Face 在代理工具上的开源模型基准测试

Hugging Face 引入了一个新的基准测试框架,用于评估不同模型规模和库版本如何影响使用软件工具的编码代理的效率和成功率。

73

Hugging Face PEFT:评估 LoRA 的替代方案

Hugging Face 对 PEFT 库的基准测试表明,虽然 LoRA 广受欢迎,但其他参数高效微调技术如 OFT 和 Lily 在内存效率和测试准确率方面,依据任务的不同,可能超越它。

74

Strands Robots 与 LeRobot 集成:从 Hugging Face Hub 数据集到实体机器人部署

Hugging Face 宣布了 Strands Robots SDK 与 LeRobot 的集成,使用户能够记录机器人演示、将数据推送至 Hub、在仿真中运行策略,并仅通过更改一个参数即可将相同代码部署到实体 SO-101 机器人,同时通过基于 Zenoh 的网格协同多个机器人。

75

GLM-5.2:为长时任务而生

GLM-5.2 由 Z.AI 在 Hugging Face 上发布,提供坚实的 1M token 上下文、通过 IndexShare 与 MTP 改进的架构、算力层级控制,并在长时编码基准上展现出强劲的开源性能。

76

Agentic 资源发现(ARD)规范与 Hugging Face 实现

Hugging Face 推出了 Agentic 资源发现(ARD)规范的参考实现,这是一项开放标准,允许 AI 代理在运行时动态搜索并集成工具、技能和其他代理。

77

PyTorch 性能分析(第 2 部分):从 nn.Linear 到融合的 MLP

摘要:Hugging Face 解释了如何通过分析 GPU 内核融合、`torch.compile` 的影响以及使用 `kernels` 库的手工调优内核来优化 PyTorch 中的多层感知机(MLP)。

78

Hugging Face Spaces agents.md 实现自动化 3D 多媒体流水线

一个编程智能体通过串联两个现有的 Space,自动构建了一个以 3D Gaussian splats 形式展示巴黎古迹的静态 Hugging Face Space,展示了 `agents.md` 如何将任何 Space 转化为多媒体流水线中可组合的构建模块。

79

将 GitHub CI 迁移到 Hugging Face Jobs

Hugging Face 提供了一种在无服务器 Hugging Face Jobs 基础设施上运行 GitHub Actions 的方法,实现 GPU 加速的 CI,并将 CPU 作业运行时间降低多达 30%。

80

OpenEnv: 标准化开源 AI 的 Agentic RL 环境

摘要: Hugging Face 已将 OpenEnv 过渡到一个社区协调项目,以充当 agentic 强化学习环境的互操作层。

81

NVIDIA Nemotron 3.5 内容安全发布

NVIDIA 发布了 Nemotron 3.5 Content Safety,这是一个拥有 4B 参数的多模态、多语言安全模型,具有自定义策略执行功能和可选的推理轨迹,适用于企业级 AI。

82

Hugging Face hf CLI 针对智能体优化重构,降低了 Token 使用量并提升了成功率

Hugging Face 宣布对 hf CLI 进行了针对智能体优化的重构,将 Token 使用量降低了高达 6 倍,并提高了 Claude Code 和 Codex 等编程智能体的成功率。

83

TITLE: 直接偏好优化:超越聊天机器人

SUMMARY: 提供的源材料是来自 Hugging Face 的 429 限流错误页面,且不包含有关直接偏好优化的任何技术内容。

84

Hugging Face 速率限制阻止访问 'Adding MCP Tools to Reachy Mini' 文章

Hugging Face 指向博客文章 'Adding MCP Tools to Reachy Mini' 的链接返回 429 速率限制错误,因此无内容可供摘要。

85

Holo3.1: 快速 & 本地计算机使用代理

由于 429 速率限制错误,提供的 Holo3.1 源材料不可用,且未提供任何技术细节。

86

JetBrains Mellum2 发布

JetBrains 宣布发布了 Mellum2,这是一款 12B Mixture-of-Experts(MoE)模型,但提供的源材料是错误页面,未包含任何技术细节。

87

超越 LLM:为什么可扩展的企业级 AI 采用取决于智能体逻辑 – 摘要

由于无法检索 Hugging Face 关于“Beyond LLMs: Why Scalable Enterprise AI Adoption Depends on Agent Logic”的文章,因此无法对其技术细节进行摘要。

88

PyTorch 性能分析:torch.profiler 初学者指南

Hugging Face 提供了使用 torch.profiler 识别瓶颈、了解 CPU-GPU 调度链以及分析 torch.compile 对内核执行影响的完整指南。

89

Reachy Mini 本地语音后端集成

Hugging Face 为 Reachy Mini 发布了一个本地语音到语音管道,使机器人能够使用级联的 VAD、STT、LLM 和 TTS 堆栈完全在本地处理对话。

90

TRL 中的 Delta Weight Sync 实现极低带宽下的万亿参数模型训练

Hugging Face 宣布在 TRL 中推出 Delta Weight Sync 功能。通过仅通过 Hugging Face Buckets 传输稀疏权重变化,该功能将异步 RL 训练中的权重同步带宽降低了 100 倍以上,从而实现了无需共享集群的解耦训练。

91

Hugging Face AI Agent Glossary: Defining Harness, Scaffold, and Agent Architecture

Hugging Face 为 AI 代理提供了一套标准化的词汇表,将代理定义为模型、用于执行的 harness 以及用于行为定义的 scaffolding 的组合。

92

OlmoEarth v1.1 发行说明 / 新功能

Hugging Face 和 AllenAI 发布了 OlmoEarth v1.1,这是一个地球观测模型系列,可将计算成本降低最高可达 3 倍,同时保持与 v1 相似的性能。

93

Ettin 重排序器系列 v1 发布说明

Hugging Face 发布了 Ettin 重排序器系列,六个参数规模从 17M 到 1B 的 CrossEncoder 重排序器,均通过 mxbai-rerank-large-v2 蒸馏而成,达到了检索重排序的最新水平的质量和速度。

94

PaddleOCR 3.5 发布说明 / 新功能

PaddleOCR 3.5 引入 Hugging Face Transformers 作为支持的推理后端,使 OCR 和文档解析模型能够更顺畅地集成到基于 PyTorch 的工作流中。

95

Granite 嵌入多语言 R2 发布:开放的 Apache 2.0 多语言嵌入,支持 32K 上下文

IBM Granite 发布了两款 Apache 2.0 多语言嵌入模型——granite-embedding-97m-multilingual-r2(97M)和 granite-embedding-311m-multilingual-r2(311M),具备 32K 令牌上下文、支持 200 多种语言,并在子 100M 检索得分中名列前茅。

96

解锁连续批处理中的异步性

Hugging Face 展示了如何在连续批处理中使用 CUDA 流和事件重叠 CPU 和 GPU 工作,使得 8B 模型生成 8K tokens 的 LLM 推理时间缩短约 22%。

97

AWS 上基础模型训练与推理的构建模块

Hugging Face 阐述了在 AWS 上的四层架构框架——包括基础设施、资源编排、机器学习软件栈和可观测性,以支持预训练、后训练和推理阶段不断演进的扩展规律。

98

vLLM V1 迁移:确保强化学习中的后端正确性

ServiceNow AI 通过修复日志概率语义、运行时默认设置、权重更新路径,并实现 fp32 lm_head,使 vLLM V0 与 V1 在强化学习 rollout 生成方面实现了等价。

99

Hugging Face 开放 ASR 排行榜:使用私有数据集对抗 Benchmaxxing

Hugging Face 在开放 ASR 排行榜中引入了来自 Appen Inc. 和 DataoceanAI 的私有评估数据集,以防止测试集污染并提供更可靠的真实场景 ASR 性能衡量。

100

IBM Granite 4.1 LLMs 发行说明 / 技术概览

IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的 LLMs(3B、8B、30B),通过严格的数据策划和多阶段强化学习管道实现高性能。