归档 · 11 个实验室 · 869 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

251

ScreenEnv 发布:部署全栈桌面代理

Hugging Face 发布了 ScreenEnv,这是一款 Python 库,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 代理。

252

Hugging Face 异步机器人推理

Hugging Face 引入了异步机器人推理,将动作预测与执行解耦,减少机器人空闲时间,并实现任务完成时间最高约 2 倍的加速。

253

Hugging Face Gradio MCP 服务器集成

Hugging Face 已将模型上下文协议(MCP)集成到 Gradio(v5.28.0),使 Hugging Face Spaces 成为一个庞大的 MCP 服务器库,为 LLM 提供图像编辑、转录等新能力。

254

为 AMD MI300 创建自定义内核

Hugging Face 与 AMD 合作开发了针对 MI300X 的开源优化内核,显著提升了在 VLLM 中使用 FP8 推理 Llama 3.1 405B 的性能。

255

Reachy Mini:开源桌面机器人用于 AI 开发

Hugging Face 与 Pollen Robotics 推出了 Reachy Mini,这是一款开源、可编程的桌面机器人,起价 $399,旨在用于人机交互和 AI 实验。

256

Hugging Face 高效多模态数据管道

Hugging Face 引入了一个五阶段的多模态数据管道优化流程,采用平衡背包打包策略,以最小化 GPU 空闲时间和填充浪费。

257

SmolLM3 发布:多语言、长上下文 3B 推理模型

Hugging Face 发布了 SmolLM3,这是一款 3B 参数模型,性能优于 Llama-3.2-3B 和 Qwen2.5-3B,具备双模式推理和 128k 上下文窗口。

258

Hugging Face 生产基础设施警报策略

Hugging Face 在其生产环境中使用针对 NAT 网关吞吐量、日志归档成功率和 Kubernetes API 健康状况的专门警报,以保持稳定性和成本效益。

259

NeurIPS 2025 E2LM 竞赛:语言模型的早期训练评估

Hugging Face 与合作伙伴宣布 E2LM 竞赛,旨在开发能够在 LLM 训练早期检测推理和科学知识信号的基准。

260

使用 Sentence Transformers 训练和微调稀疏嵌入模型

Hugging Face 推出了使用 Sentence Transformers 库训练和微调稀疏嵌入模型的全面指南,旨在提升混合搜索和检索性能。

261

NVIDIA Llama Nemotron Nano VL 发布

NVIDIA 已发布 Llama Nemotron Nano VL,这是一款 8B 视觉语言模型,针对高精度智能文档处理和 OCR 任务进行了优化。

262

Gemma 3n 发布说明:多模态本地 AI

Google 的 Gemma 3n 现已在开源生态系统中发布,具备原生多模态(文本、图像、音频、视频)以及为本地硬件执行而设计的内存高效架构。

263

SGLang Transformers 后端集成

SGLang 现在支持 Hugging Face Transformers 作为后端,使任何兼容 Transformers 的模型都能实现高性能推理,而无需原生 SGLang 支持。

264

使用 QLoRA 在消费级硬件上微调 FLUX.1-dev

Hugging Face 演示了如何使用 QLoRA 和 diffusers 库微调 FLUX.1-dev 模型,将单个消费级 GPU 的峰值显存使用降低至 10 GB 以下。

265

Groq 与 Hugging Face 推理提供商的集成

Hugging Face 已将 Groq 添加为受支持的推理提供商,使用户能够直接通过 Hub 使用 LPU 高速推理,针对如 Llama 4 和 QWQ-32B 等模型。

266

优化大语言模型性能:解决长提示阻塞和解码慢速问题

Hugging Face 探讨了长提示如何阻塞请求队列并减慢 token 生成,提出请求并行预填充和分离预填充作为降低延迟的解决方案。

267

Featherless AI 与 Hugging Face 推理提供商的集成

Hugging Face 已将 Featherless AI 添加为受支持的推理提供商,实现对庞大开源文本和对话模型目录的无服务器访问。

268

Hugging Face Kernel Hub 发布

Hugging Face 推出了 Kernel Hub,一个集中式仓库,可直接在 Python 应用中加载预编译、优化的计算内核,从而在无需本地编译的情况下加速 GPU 操作。

269

NVIDIA Isaac GR00T N1.5:LeRobot SO-101 手臂的后训练

NVIDIA 已发布 Isaac GR00T N1.5,这是一款面向类人机器人推理与技能的开放基础模型,可针对特定机器人形体(如 LeRobot SO-101 手臂)进行后训练。

270

Hugging Face 与 NVIDIA 推出训练集群即服务

Hugging Face 与 NVIDIA 推出了 Training Cluster as a Service,这一合作旨在为研究机构提供灵活、按需访问大规模 NVIDIA GPU 集群的能力,以训练基础模型。

271

Hugging Face ScreenSuite 发布

Hugging Face 发布了 ScreenSuite,这是一套综合评估 GUI 代理的工具,统一了 13 项基准,用于评估视觉语言模型(VLM)在感知、定位和行动能力方面的表现。

272

nanoVLM 中的 KV 缓存实现

Hugging Face 在 nanoVLM 仓库中从头实现了 KV 缓存,使其视觉语言模型的生成速度提升了 38%。

273

在 Arm CPU 上的实时 AI 声音生成

Arm 与 Hugging Face 展示了一款使用 Stable Audio Open 的个人声音生成工具,实现了面向音乐制作工作流的实时、设备端音频创作。

274

Holo1 与 Surfer-H:用于 GUI 自动化的开源 Action VLM

H 公司发布了 Holo1,这是一系列旨在实现精确 GUI 定位的 Action 视觉语言模型,以及 Surfer-H,这是一款模块化网页代理,在真实任务中实现了 92.2% 的准确率,成本为每任务 $0.13。

275

Hugging Face TRL:共置 vLLM 以实现高效 GRPO 训练

Hugging Face 在 TRL 中引入共置 vLLM,使训练和推理能够共享同一 GPU,消除空闲时间并在 GRPO 训练期间提升吞吐量。

276

SmolVLA:在 Lerobot 社区数据上训练的高效视觉-语言-动作模型

Hugging Face 推出 SmolVLA,这是一款紧凑的 450M 参数开源视觉-语言-动作模型,利用社区共享数据,在仿真和真实机器人任务中超越了更大的模型。

277

Hugging Face CodeAgents + Structure:通过结构化生成提升代理可靠性

Hugging Face 的研究表明,通过强制 CodeAgents 在结构化 JSON 格式中生成 thoughts 和代码,能够在消除解析错误并强制显式推理的情况下,使有能力的模型的性能平均提升 2 到 7 个百分点。

278

Liger GRPO 与 TRL 集成

用户报告指出,在使用 Liger GRPO 损失函数、DeepSpeed ZeRO-3 和 Qwen2.5-0.5B-Instruct 模型的 bf16 精度时出现形状不匹配错误。

279

Hugging Face Python 版 Tiny Agents

Hugging Face 推出了 Python 版 Tiny Agents,这是一种轻量级的代理框架,基于模型上下文协议(MCP),能够让大型语言模型以最少的代码与外部工具交互。

280

Dell Enterprise Hub 更新:本地部署 AI 模型和应用程序

Dell 与 Hugging Face 更新了 Dell Enterprise Hub,提供完整的优化模型套件和可直接部署的 AI 应用程序,适用于 Dell AI 服务器和 AI PC。

281

Falcon-H1:混合头语言模型的高效与性能

Hugging Face 与 TII UAE 推出了 Falcon-H1 系列,这是一套包含六个开源混合头模型(0.5B 至 34B),它们将 Transformer 注意力与 Mamba-2 状态空间模型相结合,以实现高性能、低内存占用和更快的推理。

282

Falcon-Arabic:阿拉伯语语言模型的突破

技术创新研究所(TII)发布了 Falcon-Arabic,这是一款拥有 7B 参数的模型,在通用知识、语法和推理方面,超越了更大的阿拉伯语大型语言模型,覆盖现代标准阿拉伯语和地区方言。

283

nanoVLM:用于训练视觉语言模型的极简 PyTorch 工具包

Hugging Face 发布了 nanoVLM,这是一款轻量级、纯 PyTorch 的工具包,旨在为初学者和研究者简化视觉语言模型(VLM)的训练和理解。

284

Hugging Face Diffusers 量化后端

Hugging Face Diffusers 集成了多个量化后端,包括 bitsandbytes、torchao、Quanto、GGUF 和 FP8 分层转型,以降低大型扩散模型(如 FLUX.1-dev)的内存占用。

285

Microsoft 与 Hugging Face 扩大在 Azure AI Foundry 上的合作

Microsoft 与 Hugging Face 已扩大合作,将超过 10,000 个开源模型集成到 Azure AI Foundry 中,实现多种 AI 模态的安全企业级部署。

286

Falcon-Edge:强大、通用且可微调的 1.58 位 LLM

Hugging Face 与 Falcon-LLM 团队发布了 Falcon-Edge,这是一系列 1.58 位(三元)语言模型,参数规模分别为 1B 和 3B,支持通过全新的预训练范式进行推理和微调。

287

Hugging Face Transformers:标准化模型定义以实现生态系统互操作性

Hugging Face 正在将 Transformers 库定位为模型定义的中心枢纽,以确保 Transformers 支持的任何架构都能自动兼容更广泛的机器学习生态系统,包括推理引擎和训练框架。

288

Hugging Face 与 Kaggle 的模型访问集成

Hugging Face 与 Kaggle 推出了一个集成,可直接在 Kaggle 笔记本和模型页面中提升 Hugging Face 模型的可发现性和可用性。

289

Hugging Face 推理端点:快速 Whisper 转录

Hugging Face 在推理端点上推出了新的 OpenAI Whisper 部署选项,实现了高达 8 倍的转录速度提升,同时不牺牲准确性。

290

Hugging Face 视觉语言模型 2025 更新

Hugging Face 提供了对 2024‑2025 年间视觉语言模型(VLM)演进的全面概述,重点阐述了任意到任意架构、推理模型以及面向机器人领域的视觉‑语言‑动作(VLA)模型的兴起。

291

LeRobot 社区数据集:构建机器人领域的 ImageNet

Hugging Face 正在通过 LeRobot 推动社区驱动的努力,创建一个多样化、开源的机器人数据集库,以解决机器人策略的泛化挑战。

292

使用 Gradio 构建 MCP 服务器

Hugging Face 已将模型上下文协议(MCP)集成到 Gradio 中,使开发者只需更改一个参数即可将 Python 函数转换为 LLM 可访问的工具。

293

Qwen-3 对话模板分析

Qwen-3 模型引入了一种复杂的对话模板,支持可选推理、通过滚动检查点实现的动态上下文管理,以及改进的工具参数序列化。

294

英特尔 AutoRound:面向 LLM 和 VLM 的高级仅权重量化

英特尔推出了 AutoRound,这是一种仅权重的后训练量化方法,使用有符号梯度下降实现对 LLM 和 VLM 的高精度低位量化(INT2-INT8)。

295

Llama Guard 4 与 Llama Prompt Guard 2 发布

Meta 已发布 Llama Guard 4,这是一款 12B 多模态安全模型,以及 Llama Prompt Guard 2,一系列用于检测提示注入和越狱的分类器。

296

PipelineRL:通过飞行中权重更新优化大语言模型强化学习

Hugging Face 和 ServiceNow Research 已开源 PipelineRL,这是一种实验性的强化学习实现,使用飞行中权重更新来消除推理吞吐量与在策略数据收集之间的权衡。

297

Hugging Face 小型代理:用 50 行代码构建基于 MCP 的代理

Hugging Face 演示了如何使用模型上下文协议(MCP)和 InferenceClient 构建功能性 AI 代理,将核心代理逻辑简化为一个简单的 while 循环。

298

微调 olmOCR 以实现忠实的文档提取

TNG 已发布了一个微调版的 olmOCR-7B-0225-preview,能够保留页眉和页脚,使其适用于发票解析等业务应用。

299

优化大型语言模型性能:并发请求的预填充与解码

Hugging Face(通过 TNG)解释了如何通过连续批处理和分块预填充等策略管理 token 生成的预填充和解码阶段,以优化 GPU 利用率并将 token 吞吐量提升至最高 50%。

300

HELMET:全面评估长上下文语言模型

Hugging Face 和 Princeton 的研究人员推出了 HELMET,这是一套综合基准,旨在用多样化、可控且可靠的真实世界评估取代针在稻草堆等合成测试,以评估长上下文语言模型。