51

超越LLMs:为什么可扩展的企业AI采用依赖于Agent Logic

由于提供的源材料遇到了 429 Too Many Requests 错误而不可用,因此不包含有关 Agent Logic 或企业 AI 采用的任何技术内容。

52

PyTorch 性能分析:torch.profiler 初学者指南

Hugging Face 提供了使用 torch.profiler 识别瓶颈、了解 CPU-GPU 调度链以及分析 torch.compile 对内核执行影响的完整指南。

53

Reachy Mini 本地语音后端集成

Hugging Face 为 Reachy Mini 发布了一个本地语音到语音管道,使机器人能够使用级联的 VAD、STT、LLM 和 TTS 堆栈完全在本地处理对话。

54

TRL 中的 Delta Weight Sync 实现极低带宽下的万亿参数模型训练

Hugging Face 宣布在 TRL 中推出 Delta Weight Sync 功能。通过仅通过 Hugging Face Buckets 传输稀疏权重变化,该功能将异步 RL 训练中的权重同步带宽降低了 100 倍以上,从而实现了无需共享集群的解耦训练。

55

Hugging Face AI Agent Glossary: Defining Harness, Scaffold, and Agent Architecture

Hugging Face 为 AI 代理提供了一套标准化的词汇表,将代理定义为模型、用于执行的 harness 以及用于行为定义的 scaffolding 的组合。

56

OlmoEarth v1.1 发行说明 / 新功能

Hugging Face 和 AllenAI 发布了 OlmoEarth v1.1,这是一个地球观测模型系列,可将计算成本降低最高可达 3 倍,同时保持与 v1 相似的性能。

57

Ettin 重排序器系列 v1 发布说明

Hugging Face 发布了 Ettin 重排序器系列,六个参数规模从 17M 到 1B 的 CrossEncoder 重排序器,均通过 mxbai-rerank-large-v2 蒸馏而成,达到了检索重排序的最新水平的质量和速度。

58

PaddleOCR 3.5 发布说明 / 新功能

PaddleOCR 3.5 引入 Hugging Face Transformers 作为支持的推理后端,使 OCR 和文档解析模型能够更顺畅地集成到基于 PyTorch 的工作流中。

59

Granite 嵌入多语言 R2 发布:开放的 Apache 2.0 多语言嵌入,支持 32K 上下文

IBM Granite 发布了两款 Apache 2.0 多语言嵌入模型——granite-embedding-97m-multilingual-r2(97M)和 granite-embedding-311m-multilingual-r2(311M),具备 32K 令牌上下文、支持 200 多种语言,并在子 100M 检索得分中名列前茅。

60

解锁连续批处理中的异步性

Hugging Face 展示了如何在连续批处理中使用 CUDA 流和事件重叠 CPU 和 GPU 工作,使得 8B 模型生成 8K tokens 的 LLM 推理时间缩短约 22%。

61

AWS 上基础模型训练与推理的构建模块

Hugging Face 阐述了在 AWS 上的四层架构框架——包括基础设施、资源编排、机器学习软件栈和可观测性,以支持预训练、后训练和推理阶段不断演进的扩展规律。

62

vLLM V1 迁移:确保强化学习中的后端正确性

ServiceNow AI 通过修复日志概率语义、运行时默认设置、权重更新路径,并实现 fp32 lm_head,使 vLLM V0 与 V1 在强化学习 rollout 生成方面实现了等价。

63

Hugging Face 开放 ASR 排行榜:使用私有数据集对抗 Benchmaxxing

Hugging Face 在开放 ASR 排行榜中引入了来自 Appen Inc. 和 DataoceanAI 的私有评估数据集,以防止测试集污染并提供更可靠的真实场景 ASR 性能衡量。

64

IBM Granite 4.1 LLMs 发行说明 / 技术概览

IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的 LLMs(3B、8B、30B),通过严格的数据策划和多阶段强化学习管道实现高性能。

65

DeepInfra 与 Hugging Face 推理提供商集成

Hugging Face 已将 DeepInfra 添加为支持的推理提供商,使得可以直接通过 Hub 和客户端 SDK 访问超过 100 种模型的无服务器访问,包括 DeepSeek V4 和 Kimi-K2.6。

66

NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性

NVIDIA 发布了 Nemotron 3 Nano Omni,这是一款全模态模型,能够跨文本、图像、视频和音频进行长上下文推理,并在文档智能和视频理解基准测试中提供了业界领先的准确率。

67

# OpenAI 隐私过滤器:构建可扩展的 PII 检测 Web 应用

OpenAI 已发布 Privacy Filter,这是一个开源的 15亿参数 PII 检测器,能够在 128k 上下文窗口中标记八类敏感数据。

68

DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文

DeepSeek-V4 引入了由混合 CSA/HCA 注意力机制驱动的 1M-token 上下文窗口,专门针对长程 Agent 工作负载和工具使用轨迹进行了优化。

69

使用 Transformers.js 在 Chrome 扩展程序中

Hugging Face 提供了一份关于在清单 V3 下将 Transformers.js 集成到 Chrome 扩展程序的技术指南,展示了由 Gemma 4 E2B 驱动的后台托管模型架构。

70

QIMMA:质量优先的阿拉伯语大型语言模型排行榜

Hugging Face 及其合作伙伴推出了 QIMMA,这是一款全新的阿拉伯语 LLM 排行榜,采用严格的质量验证流水线,以确保基准测试真实反映语言能力。

71

Hugging Face:AI 与网络安全的未来

Hugging Face 认为,开源 AI 模型和工具对于网络安全防御至关重要,以抵御像 Mythos 这样的自主漏洞发现系统带来的风险。

72

Ecom-RLVE: 自适应可验证环境用于电子商务对话代理

Hugging Face 推出 EcomRLVE-GYM,一个使用八个可验证的多回合环境并具有自适应难度缩放的框架,用于训练电子商务代理,以弥合对话流畅性与实际任务完成之间的差距。

73

Hugging Face transformers-to-mlx Skill and Test Harness

Hugging Face 发布了一个 Skill 和一个非 Agent 测试框架,旨在简化从 transformers 库到 mlx-lm 的语言模型移植过程,同时保持高质量的代码质量和评审信号。

74

使用 Sentence Transformers 进行多模态嵌入与重排序模型的训练与微调

Hugging Face 发布了一篇关于使用 Sentence Transformers 训练和微调多模态嵌入及重排序模型的指南,展示了任务特定微调如何提升诸如视觉文档检索等检索任务的性能。

75

深入了解 VAKRA:智能体的推理、工具使用与失败模式

IBM Research 推出了 VAKRA,这是一个可执行的基准测试,用于评估 AI 智能体在 API 和文档之间的组合推理能力,揭示了尽管在孤立工具调用方面取得了进展,但在工具使用和策略遵循方面仍存在显著差距。

76

HCompany HoloTab 发布

HCompany 已发布 HoloTab,这是一款由 Holo3 模型驱动的 Chrome 扩展程序,允许用户通过自然语言描述或录制的例程来自动化网页任务。

77

Waypoint-1.5 发布说明

Hugging Face 和 Overworld 发布了 Waypoint-1.5,这是一款实时视频世界模型,能够让高保真交互式生成环境在消费级 GPU 上本地运行。

78

Safetensors 加入 PyTorch 基金会

Safetensors 已转为 PyTorch 基金会和 Linux 基金会旗下的基金会托管项目,以确保供应商中立的治理和社区驱动的开发。

79

Gemma 4 发布:开源多模态模型,支持本地设备

Gemma 4 是 Google DeepMind 推出的全新开源多模态系列,已在 Hugging Face 上发布,支持图像、音频、视频,拥有最高 256 K 上下文,并可在发布首日即与 transformers、llama.cpp、MLX、Rust 和 WebGPU 兼容。

80

Falcon Perception 与 Falcon OCR 发布

Hugging Face 和 TII 推出 Falcon Perception,这是一种 0.6B 参数的早期融合 Transformer,用于开放词汇定位;以及 Falcon OCR,这是一种 0.3B 参数的高吞吐量文档理解模型。

81

Gradio Server:将自定义前端与 Gradio 后端集成

Hugging Face 推出 gradio.Server,这是一款 FastAPI 扩展,允许开发者使用任意自定义前端框架,同时保留 Gradio 的排队、API 基础设施以及 ZeroGPU 支持。

82

Granite 4.0 3B Vision 发布说明 / 新功能

IBM 发布了 Granite 4.0 3B Vision,这是一款针对企业文档理解进行优化的紧凑多模态模型,具备高精度表格提取、图表推理和键值对提取功能。

83

OpenMed CodonRoBERTa 多物种 mRNA 语言模型发布

OpenMed 发布了一个端到端的蛋白质工程流水线,包含 CodonRoBERTa-large-v2(困惑度 4.10,CAI 0.404)以及一个在 55 GPU 小时内训练完成、成本为 165 美元的 25 物种密码子优化模型套件。

84

TRL v1.0 发布说明 / 新功能

Hugging Face 发布了 TRL v1.0,这是一款实现了超过 75 种方法的稳定后训练库,采用双轨稳定模型,以在快速实验迭代和生产级可靠性之间取得平衡。

85

Hugging Face OpenClaw 迁移指南

Hugging Face 提供两种方法——Inference Providers 和本地 llama.cpp 设置——将 OpenClaw 代理从受限的 Claude 模型迁移到开源替代方案。

86

EVA 端到端语音代理评估框架

EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。

87

领域特定嵌入微调与 NVIDIA Nemotron – 一天内完成

NVIDIA 与 Hugging Face 发布了一个单 GPU、一天内完成的流水线,可在合成领域数据上微调 Llama‑Nemotron‑Embed‑1B‑v2 模型,实现超过 10% 的检索提升,且在真实企业数据集上提升最高达 26%。

88

Hugging Face 开源现状:2026 年春季

Hugging Face 报告称,2025 年开源 AI 生态系统出现大幅扩张,特点是中国在模型下载量上超越美国,且机器人领域迅速崛起成为最大的数据集类别。

89

Holotron-12B 高吞吐量计算机使用代理

H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。

90

让 Token 持续流动:来自 16 个开源 RL 库的经验教训

Hugging Face 调查了 16 个开源 RL 库,发现异步 RL 训练将推理和训练分离到不同的 GPU 池,使用 rollout 缓冲区,并以异步方式推送权重;Ray 主导编排,NCCL 广播是常用的权重同步方式。

91

Hugging Face 存储桶发布

Hugging Face 推出了 Storage Buckets,这是一种可变的、类似 S3 的对象存储系统,基于 Xet,能够高效处理如检查点和处理后数据等中间机器学习产物。

92

Ulysses 序列并行用于百万标记上下文训练

Hugging Face 已将 Ulysses 序列并行集成到 Accelerate、Transformers 和 TRL 中,使得通过在多 GPU 上分布注意力计算,能够训练拥有百万标记上下文的 LLM。

93

LeRobot v0.5.0 发布说明 / 新功能

Hugging Face 发布了 LeRobot v0.5.0,提供了完整的 Unitree G1 人形机器人支持、新的 VLA 策略如 Pi0-FAST 和 Wall-X,以及显著的数据集性能优化。

94

将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化

Hugging Face 与 NXP 提供了一份在 i.MX 95 SoC 上部署视觉-语言-动作(VLA)模型的技术指南,强调数据集一致性、架构分解以及异步推理,以实现实时机器人控制。

95

Hugging Face 模块化 Diffusers 发布

Hugging Face 推出了 Modular Diffusers,这是一种可组合的框架,允许用户通过混合搭配可重用块来构建扩散管道,而无需从头编写完整的管道。

96

PRX 第三部分:在 24 小时内训练文本到图像模型

Hugging Face 与 Photoroom 展示了使用 32 块 H200 GPU、约 1500 美元预算,在 24 小时内训练出的文本到图像模型,结合了像素空间训练、Token 路由和表征对齐。

97

Transformer 中的专家混合(MoEs)

Hugging Face 重新设计了 transformers 库,通过全新的权重加载重构、可插拔的专家后端以及原生的专家并行,使专家混合(MoEs)成为一等公民。

98

使用 Unsloth 和 Hugging Face Jobs 训练 AI 模型

Hugging Face 已将 Unsloth 与 Hugging Face Jobs 集成,以实现快速、低成本的 LLM 微调,专为像 LiquidAI/LFM2.5-1.2B-Instruct 这样的小模型进行优化。

99

GGML 与 llama.cpp 加入 Hugging Face

GGML,llama.cpp 的创建者,已加入 Hugging Face,为本地 AI 推理提供可持续资源,并简化 Transformers 库与本地模型部署之间的集成。

100

IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障

IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。