Parquet 内容定义分块用于高效数据去重
Hugging Face 推出 Parquet 内容定义分块(CDC),现已在 PyArrow 和 Pandas 中可用,使得在 Xet 存储层上对 Parquet 文件进行高效去重成为可能,显著降低上传和下载时间。
使用 Diffusers 和 PEFT 的 Flux 快速 LoRA 推理
Hugging Face 推出了一套针对 Flux.1-Dev 的优化方案,通过结合热切换、torch.compile 和 FP8 量化,实现 LoRA 推理最高 2.23 倍的加速。
TimeScope:长视频大型多模态模型理解的新基准
Hugging Face 推出 TimeScope,这是一项开源基准,通过在时长从 1 分钟到 8 小时的内容中插入视频针,评估视觉语言模型的时间理解能力。
NVIDIA NIM 与 Hugging Face 的集成
NVIDIA 已将 NVIDIA NIM 扩展至支持 Hugging Face 上的超过 100,000 个 LLM,提供一个统一的 Docker 容器,实现模型分析、后端选择和性能优化的自动化,以实现快速部署。
Arc 虚拟细胞挑战指南
Arc 虚拟细胞挑战要求参与者训练模型,以预测通过 CRISPR 对基因沉默对细胞转录组的影响,使用包含 30 万条单细胞 RNA 测序数据的数据集。
Gradio 5.38.0 MCP 服务器改进
Gradio 5.38.0 版为其模型上下文协议(MCP)服务器功能引入了五项关键更新,包括无缝的本地文件支持、实时进度通知以及自动化的 OpenAPI 规范转换。
Hugging Face FutureBench:评估 AI 代理在未来事件预测中的表现
Hugging Face 推出了 FutureBench,这是一项通过要求 AI 代理预测未来真实世界事件来评估其推理和综合能力的基准,从而有效消除数据污染。
Consilium:多LLM协作平台
Consilium 是一个多LLM平台,通过结构化辩论和研究,使多个 AI 模型达成共识,既可作为 Gradio 界面,也可作为 MCP 服务器进行集成。
Ettin Suite:SoTA 配对编码器和解码器
Hugging Face 推出 Ettin,这是一套配对的仅编码器和仅解码器模型(参数范围 17M-1B),在相同的数据和配方下训练,以提供对架构性能的受控比较。
Hugging Face Hub 从 Git LFS 迁移到 Xet
Hugging Face 已将 500,000 个仓库和 20 PB 数据从 Git LFS 迁移到 Xet,这是一种为 AI 工作负载而设计的内容寻址存储系统。
Kimina-Prover:在大规模形式推理模型上应用测试时强化学习搜索
Hugging Face 宣布推出 Kimina-Prover-72B,这是一款面向 Lean 4 的最先进定理证明模型,凭借新颖的测试时强化学习(TTRL)搜索框架,在 miniF2F 基准上实现了 92.2% 的通过率。
构建 Hugging Face MCP 服务器
Hugging Face 已发布官方的模型上下文协议(MCP)服务器,使 AI 助手能够通过单一 URL 动态访问 Hugging Face Hub 和数千个基于 Gradio 的 AI 应用程序。
ScreenEnv 发布:部署全栈桌面代理
Hugging Face 发布了 ScreenEnv,这是一款 Python 库,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 代理。
Hugging Face 异步机器人推理
Hugging Face 引入了异步机器人推理,将动作预测与执行解耦,减少机器人空闲时间,并实现任务完成时间最高约 2 倍的加速。
Hugging Face Gradio MCP 服务器集成
Hugging Face 已将模型上下文协议(MCP)集成到 Gradio(v5.28.0),使 Hugging Face Spaces 成为一个庞大的 MCP 服务器库,为 LLM 提供图像编辑、转录等新能力。
为 AMD MI300 创建自定义内核
Hugging Face 与 AMD 合作开发了针对 MI300X 的开源优化内核,显著提升了在 VLLM 中使用 FP8 推理 Llama 3.1 405B 的性能。
Reachy Mini:开源桌面机器人用于 AI 开发
Hugging Face 与 Pollen Robotics 推出了 Reachy Mini,这是一款开源、可编程的桌面机器人,起价 $399,旨在用于人机交互和 AI 实验。
Hugging Face 高效多模态数据管道
Hugging Face 引入了一个五阶段的多模态数据管道优化流程,采用平衡背包打包策略,以最小化 GPU 空闲时间和填充浪费。
SmolLM3 发布:多语言、长上下文 3B 推理模型
Hugging Face 发布了 SmolLM3,这是一款 3B 参数模型,性能优于 Llama-3.2-3B 和 Qwen2.5-3B,具备双模式推理和 128k 上下文窗口。
Hugging Face 生产基础设施警报策略
Hugging Face 在其生产环境中使用针对 NAT 网关吞吐量、日志归档成功率和 Kubernetes API 健康状况的专门警报,以保持稳定性和成本效益。
NeurIPS 2025 E2LM 竞赛:语言模型的早期训练评估
Hugging Face 与合作伙伴宣布 E2LM 竞赛,旨在开发能够在 LLM 训练早期检测推理和科学知识信号的基准。
使用 Sentence Transformers 训练和微调稀疏嵌入模型
Hugging Face 推出了使用 Sentence Transformers 库训练和微调稀疏嵌入模型的全面指南,旨在提升混合搜索和检索性能。
NVIDIA Llama Nemotron Nano VL 发布
NVIDIA 已发布 Llama Nemotron Nano VL,这是一款 8B 视觉语言模型,针对高精度智能文档处理和 OCR 任务进行了优化。
Gemma 3n 发布说明:多模态本地 AI
Google 的 Gemma 3n 现已在开源生态系统中发布,具备原生多模态(文本、图像、音频、视频)以及为本地硬件执行而设计的内存高效架构。
SGLang Transformers 后端集成
SGLang 现在支持 Hugging Face Transformers 作为后端,使任何兼容 Transformers 的模型都能实现高性能推理,而无需原生 SGLang 支持。
使用 QLoRA 在消费级硬件上微调 FLUX.1-dev
Hugging Face 演示了如何使用 QLoRA 和 diffusers 库微调 FLUX.1-dev 模型,将单个消费级 GPU 的峰值显存使用降低至 10 GB 以下。
Groq 与 Hugging Face 推理提供商的集成
Hugging Face 已将 Groq 添加为受支持的推理提供商,使用户能够直接通过 Hub 使用 LPU 高速推理,针对如 Llama 4 和 QWQ-32B 等模型。
优化大语言模型性能:解决长提示阻塞和解码慢速问题
Hugging Face 探讨了长提示如何阻塞请求队列并减慢 token 生成,提出请求并行预填充和分离预填充作为降低延迟的解决方案。
Featherless AI 与 Hugging Face 推理提供商的集成
Hugging Face 已将 Featherless AI 添加为受支持的推理提供商,实现对庞大开源文本和对话模型目录的无服务器访问。
Hugging Face Kernel Hub 发布
Hugging Face 推出了 Kernel Hub,一个集中式仓库,可直接在 Python 应用中加载预编译、优化的计算内核,从而在无需本地编译的情况下加速 GPU 操作。
NVIDIA Isaac GR00T N1.5:LeRobot SO-101 手臂的后训练
NVIDIA 已发布 Isaac GR00T N1.5,这是一款面向类人机器人推理与技能的开放基础模型,可针对特定机器人形体(如 LeRobot SO-101 手臂)进行后训练。
Hugging Face 与 NVIDIA 推出训练集群即服务
Hugging Face 与 NVIDIA 推出了 Training Cluster as a Service,这一合作旨在为研究机构提供灵活、按需访问大规模 NVIDIA GPU 集群的能力,以训练基础模型。
Hugging Face ScreenSuite 发布
Hugging Face 发布了 ScreenSuite,这是一套综合评估 GUI 代理的工具,统一了 13 项基准,用于评估视觉语言模型(VLM)在感知、定位和行动能力方面的表现。
nanoVLM 中的 KV 缓存实现
Hugging Face 在 nanoVLM 仓库中从头实现了 KV 缓存,使其视觉语言模型的生成速度提升了 38%。
在 Arm CPU 上的实时 AI 声音生成
Arm 与 Hugging Face 展示了一款使用 Stable Audio Open 的个人声音生成工具,实现了面向音乐制作工作流的实时、设备端音频创作。
Holo1 与 Surfer-H:用于 GUI 自动化的开源 Action VLM
H 公司发布了 Holo1,这是一系列旨在实现精确 GUI 定位的 Action 视觉语言模型,以及 Surfer-H,这是一款模块化网页代理,在真实任务中实现了 92.2% 的准确率,成本为每任务 $0.13。
Hugging Face TRL:共置 vLLM 以实现高效 GRPO 训练
Hugging Face 在 TRL 中引入共置 vLLM,使训练和推理能够共享同一 GPU,消除空闲时间并在 GRPO 训练期间提升吞吐量。
SmolVLA:在 Lerobot 社区数据上训练的高效视觉-语言-动作模型
Hugging Face 推出 SmolVLA,这是一款紧凑的 450M 参数开源视觉-语言-动作模型,利用社区共享数据,在仿真和真实机器人任务中超越了更大的模型。
Hugging Face CodeAgents + Structure:通过结构化生成提升代理可靠性
Hugging Face 的研究表明,通过强制 CodeAgents 在结构化 JSON 格式中生成 thoughts 和代码,能够在消除解析错误并强制显式推理的情况下,使有能力的模型的性能平均提升 2 到 7 个百分点。
Liger GRPO 与 TRL 集成
用户报告指出,在使用 Liger GRPO 损失函数、DeepSpeed ZeRO-3 和 Qwen2.5-0.5B-Instruct 模型的 bf16 精度时出现形状不匹配错误。
Hugging Face Python 版 Tiny Agents
Hugging Face 推出了 Python 版 Tiny Agents,这是一种轻量级的代理框架,基于模型上下文协议(MCP),能够让大型语言模型以最少的代码与外部工具交互。
Dell Enterprise Hub 更新:本地部署 AI 模型和应用程序
Dell 与 Hugging Face 更新了 Dell Enterprise Hub,提供完整的优化模型套件和可直接部署的 AI 应用程序,适用于 Dell AI 服务器和 AI PC。
Falcon-H1:混合头语言模型的高效与性能
Hugging Face 与 TII UAE 推出了 Falcon-H1 系列,这是一套包含六个开源混合头模型(0.5B 至 34B),它们将 Transformer 注意力与 Mamba-2 状态空间模型相结合,以实现高性能、低内存占用和更快的推理。
Falcon-Arabic:阿拉伯语语言模型的突破
技术创新研究所(TII)发布了 Falcon-Arabic,这是一款拥有 7B 参数的模型,在通用知识、语法和推理方面,超越了更大的阿拉伯语大型语言模型,覆盖现代标准阿拉伯语和地区方言。
nanoVLM:用于训练视觉语言模型的极简 PyTorch 工具包
Hugging Face 发布了 nanoVLM,这是一款轻量级、纯 PyTorch 的工具包,旨在为初学者和研究者简化视觉语言模型(VLM)的训练和理解。
Hugging Face Diffusers 量化后端
Hugging Face Diffusers 集成了多个量化后端,包括 bitsandbytes、torchao、Quanto、GGUF 和 FP8 分层转型,以降低大型扩散模型(如 FLUX.1-dev)的内存占用。
Microsoft 与 Hugging Face 扩大在 Azure AI Foundry 上的合作
Microsoft 与 Hugging Face 已扩大合作,将超过 10,000 个开源模型集成到 Azure AI Foundry 中,实现多种 AI 模态的安全企业级部署。
Falcon-Edge:强大、通用且可微调的 1.58 位 LLM
Hugging Face 与 Falcon-LLM 团队发布了 Falcon-Edge,这是一系列 1.58 位(三元)语言模型,参数规模分别为 1B 和 3B,支持通过全新的预训练范式进行推理和微调。
Hugging Face Transformers:标准化模型定义以实现生态系统互操作性
Hugging Face 正在将 Transformers 库定位为模型定义的中心枢纽,以确保 Transformers 支持的任何架构都能自动兼容更广泛的机器学习生态系统,包括推理引擎和训练框架。
Hugging Face 与 Kaggle 的模型访问集成
Hugging Face 与 Kaggle 推出了一个集成,可直接在 Kaggle 笔记本和模型页面中提升 Hugging Face 模型的可发现性和可用性。