超越LLMs:为什么可扩展的企业AI采用依赖于Agent Logic
由于提供的源材料遇到了 429 Too Many Requests 错误而不可用,因此不包含有关 Agent Logic 或企业 AI 采用的任何技术内容。
PyTorch 性能分析:torch.profiler 初学者指南
Hugging Face 提供了使用 torch.profiler 识别瓶颈、了解 CPU-GPU 调度链以及分析 torch.compile 对内核执行影响的完整指南。
Reachy Mini 本地语音后端集成
Hugging Face 为 Reachy Mini 发布了一个本地语音到语音管道,使机器人能够使用级联的 VAD、STT、LLM 和 TTS 堆栈完全在本地处理对话。
TRL 中的 Delta Weight Sync 实现极低带宽下的万亿参数模型训练
Hugging Face 宣布在 TRL 中推出 Delta Weight Sync 功能。通过仅通过 Hugging Face Buckets 传输稀疏权重变化,该功能将异步 RL 训练中的权重同步带宽降低了 100 倍以上,从而实现了无需共享集群的解耦训练。
Hugging Face AI Agent Glossary: Defining Harness, Scaffold, and Agent Architecture
Hugging Face 为 AI 代理提供了一套标准化的词汇表,将代理定义为模型、用于执行的 harness 以及用于行为定义的 scaffolding 的组合。
OlmoEarth v1.1 发行说明 / 新功能
Hugging Face 和 AllenAI 发布了 OlmoEarth v1.1,这是一个地球观测模型系列,可将计算成本降低最高可达 3 倍,同时保持与 v1 相似的性能。
Ettin 重排序器系列 v1 发布说明
Hugging Face 发布了 Ettin 重排序器系列,六个参数规模从 17M 到 1B 的 CrossEncoder 重排序器,均通过 mxbai-rerank-large-v2 蒸馏而成,达到了检索重排序的最新水平的质量和速度。
PaddleOCR 3.5 发布说明 / 新功能
PaddleOCR 3.5 引入 Hugging Face Transformers 作为支持的推理后端,使 OCR 和文档解析模型能够更顺畅地集成到基于 PyTorch 的工作流中。
Granite 嵌入多语言 R2 发布:开放的 Apache 2.0 多语言嵌入,支持 32K 上下文
IBM Granite 发布了两款 Apache 2.0 多语言嵌入模型——granite-embedding-97m-multilingual-r2(97M)和 granite-embedding-311m-multilingual-r2(311M),具备 32K 令牌上下文、支持 200 多种语言,并在子 100M 检索得分中名列前茅。
解锁连续批处理中的异步性
Hugging Face 展示了如何在连续批处理中使用 CUDA 流和事件重叠 CPU 和 GPU 工作,使得 8B 模型生成 8K tokens 的 LLM 推理时间缩短约 22%。
AWS 上基础模型训练与推理的构建模块
Hugging Face 阐述了在 AWS 上的四层架构框架——包括基础设施、资源编排、机器学习软件栈和可观测性,以支持预训练、后训练和推理阶段不断演进的扩展规律。
vLLM V1 迁移:确保强化学习中的后端正确性
ServiceNow AI 通过修复日志概率语义、运行时默认设置、权重更新路径,并实现 fp32 lm_head,使 vLLM V0 与 V1 在强化学习 rollout 生成方面实现了等价。
Hugging Face 开放 ASR 排行榜:使用私有数据集对抗 Benchmaxxing
Hugging Face 在开放 ASR 排行榜中引入了来自 Appen Inc. 和 DataoceanAI 的私有评估数据集,以防止测试集污染并提供更可靠的真实场景 ASR 性能衡量。
IBM Granite 4.1 LLMs 发行说明 / 技术概览
IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的 LLMs(3B、8B、30B),通过严格的数据策划和多阶段强化学习管道实现高性能。
DeepInfra 与 Hugging Face 推理提供商集成
Hugging Face 已将 DeepInfra 添加为支持的推理提供商,使得可以直接通过 Hub 和客户端 SDK 访问超过 100 种模型的无服务器访问,包括 DeepSeek V4 和 Kimi-K2.6。
NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性
NVIDIA 发布了 Nemotron 3 Nano Omni,这是一款全模态模型,能够跨文本、图像、视频和音频进行长上下文推理,并在文档智能和视频理解基准测试中提供了业界领先的准确率。
# OpenAI 隐私过滤器:构建可扩展的 PII 检测 Web 应用
OpenAI 已发布 Privacy Filter,这是一个开源的 15亿参数 PII 检测器,能够在 128k 上下文窗口中标记八类敏感数据。
DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文
DeepSeek-V4 引入了由混合 CSA/HCA 注意力机制驱动的 1M-token 上下文窗口,专门针对长程 Agent 工作负载和工具使用轨迹进行了优化。
使用 Transformers.js 在 Chrome 扩展程序中
Hugging Face 提供了一份关于在清单 V3 下将 Transformers.js 集成到 Chrome 扩展程序的技术指南,展示了由 Gemma 4 E2B 驱动的后台托管模型架构。
QIMMA:质量优先的阿拉伯语大型语言模型排行榜
Hugging Face 及其合作伙伴推出了 QIMMA,这是一款全新的阿拉伯语 LLM 排行榜,采用严格的质量验证流水线,以确保基准测试真实反映语言能力。
Hugging Face:AI 与网络安全的未来
Hugging Face 认为,开源 AI 模型和工具对于网络安全防御至关重要,以抵御像 Mythos 这样的自主漏洞发现系统带来的风险。
Ecom-RLVE: 自适应可验证环境用于电子商务对话代理
Hugging Face 推出 EcomRLVE-GYM,一个使用八个可验证的多回合环境并具有自适应难度缩放的框架,用于训练电子商务代理,以弥合对话流畅性与实际任务完成之间的差距。
Hugging Face transformers-to-mlx Skill and Test Harness
Hugging Face 发布了一个 Skill 和一个非 Agent 测试框架,旨在简化从 transformers 库到 mlx-lm 的语言模型移植过程,同时保持高质量的代码质量和评审信号。
使用 Sentence Transformers 进行多模态嵌入与重排序模型的训练与微调
Hugging Face 发布了一篇关于使用 Sentence Transformers 训练和微调多模态嵌入及重排序模型的指南,展示了任务特定微调如何提升诸如视觉文档检索等检索任务的性能。
深入了解 VAKRA:智能体的推理、工具使用与失败模式
IBM Research 推出了 VAKRA,这是一个可执行的基准测试,用于评估 AI 智能体在 API 和文档之间的组合推理能力,揭示了尽管在孤立工具调用方面取得了进展,但在工具使用和策略遵循方面仍存在显著差距。
HCompany HoloTab 发布
HCompany 已发布 HoloTab,这是一款由 Holo3 模型驱动的 Chrome 扩展程序,允许用户通过自然语言描述或录制的例程来自动化网页任务。
Waypoint-1.5 发布说明
Hugging Face 和 Overworld 发布了 Waypoint-1.5,这是一款实时视频世界模型,能够让高保真交互式生成环境在消费级 GPU 上本地运行。
Safetensors 加入 PyTorch 基金会
Safetensors 已转为 PyTorch 基金会和 Linux 基金会旗下的基金会托管项目,以确保供应商中立的治理和社区驱动的开发。
Gemma 4 发布:开源多模态模型,支持本地设备
Gemma 4 是 Google DeepMind 推出的全新开源多模态系列,已在 Hugging Face 上发布,支持图像、音频、视频,拥有最高 256 K 上下文,并可在发布首日即与 transformers、llama.cpp、MLX、Rust 和 WebGPU 兼容。
Falcon Perception 与 Falcon OCR 发布
Hugging Face 和 TII 推出 Falcon Perception,这是一种 0.6B 参数的早期融合 Transformer,用于开放词汇定位;以及 Falcon OCR,这是一种 0.3B 参数的高吞吐量文档理解模型。
Gradio Server:将自定义前端与 Gradio 后端集成
Hugging Face 推出 gradio.Server,这是一款 FastAPI 扩展,允许开发者使用任意自定义前端框架,同时保留 Gradio 的排队、API 基础设施以及 ZeroGPU 支持。
Granite 4.0 3B Vision 发布说明 / 新功能
IBM 发布了 Granite 4.0 3B Vision,这是一款针对企业文档理解进行优化的紧凑多模态模型,具备高精度表格提取、图表推理和键值对提取功能。
OpenMed CodonRoBERTa 多物种 mRNA 语言模型发布
OpenMed 发布了一个端到端的蛋白质工程流水线,包含 CodonRoBERTa-large-v2(困惑度 4.10,CAI 0.404)以及一个在 55 GPU 小时内训练完成、成本为 165 美元的 25 物种密码子优化模型套件。
TRL v1.0 发布说明 / 新功能
Hugging Face 发布了 TRL v1.0,这是一款实现了超过 75 种方法的稳定后训练库,采用双轨稳定模型,以在快速实验迭代和生产级可靠性之间取得平衡。
Hugging Face OpenClaw 迁移指南
Hugging Face 提供两种方法——Inference Providers 和本地 llama.cpp 设置——将 OpenClaw 代理从受限的 Claude 模型迁移到开源替代方案。
EVA 端到端语音代理评估框架
EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。
领域特定嵌入微调与 NVIDIA Nemotron – 一天内完成
NVIDIA 与 Hugging Face 发布了一个单 GPU、一天内完成的流水线,可在合成领域数据上微调 Llama‑Nemotron‑Embed‑1B‑v2 模型,实现超过 10% 的检索提升,且在真实企业数据集上提升最高达 26%。
Hugging Face 开源现状:2026 年春季
Hugging Face 报告称,2025 年开源 AI 生态系统出现大幅扩张,特点是中国在模型下载量上超越美国,且机器人领域迅速崛起成为最大的数据集类别。
Holotron-12B 高吞吐量计算机使用代理
H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。
让 Token 持续流动:来自 16 个开源 RL 库的经验教训
Hugging Face 调查了 16 个开源 RL 库,发现异步 RL 训练将推理和训练分离到不同的 GPU 池,使用 rollout 缓冲区,并以异步方式推送权重;Ray 主导编排,NCCL 广播是常用的权重同步方式。
Hugging Face 存储桶发布
Hugging Face 推出了 Storage Buckets,这是一种可变的、类似 S3 的对象存储系统,基于 Xet,能够高效处理如检查点和处理后数据等中间机器学习产物。
Ulysses 序列并行用于百万标记上下文训练
Hugging Face 已将 Ulysses 序列并行集成到 Accelerate、Transformers 和 TRL 中,使得通过在多 GPU 上分布注意力计算,能够训练拥有百万标记上下文的 LLM。
LeRobot v0.5.0 发布说明 / 新功能
Hugging Face 发布了 LeRobot v0.5.0,提供了完整的 Unitree G1 人形机器人支持、新的 VLA 策略如 Pi0-FAST 和 Wall-X,以及显著的数据集性能优化。
将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化
Hugging Face 与 NXP 提供了一份在 i.MX 95 SoC 上部署视觉-语言-动作(VLA)模型的技术指南,强调数据集一致性、架构分解以及异步推理,以实现实时机器人控制。
Hugging Face 模块化 Diffusers 发布
Hugging Face 推出了 Modular Diffusers,这是一种可组合的框架,允许用户通过混合搭配可重用块来构建扩散管道,而无需从头编写完整的管道。
PRX 第三部分:在 24 小时内训练文本到图像模型
Hugging Face 与 Photoroom 展示了使用 32 块 H200 GPU、约 1500 美元预算,在 24 小时内训练出的文本到图像模型,结合了像素空间训练、Token 路由和表征对齐。
Transformer 中的专家混合(MoEs)
Hugging Face 重新设计了 transformers 库,通过全新的权重加载重构、可插拔的专家后端以及原生的专家并行,使专家混合(MoEs)成为一等公民。
使用 Unsloth 和 Hugging Face Jobs 训练 AI 模型
Hugging Face 已将 Unsloth 与 Hugging Face Jobs 集成,以实现快速、低成本的 LLM 微调,专为像 LiquidAI/LFM2.5-1.2B-Instruct 这样的小模型进行优化。
GGML 与 llama.cpp 加入 Hugging Face
GGML,llama.cpp 的创建者,已加入 Hugging Face,为本地 AI 推理提供可持续资源,并简化 Transformers 库与本地模型部署之间的集成。
IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障
IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。