Hugging Face 推理端点:快速 Whisper 转录
Hugging Face 在推理端点上推出了新的 OpenAI Whisper 部署选项,实现了高达 8 倍的转录速度提升,同时不牺牲准确性。
Hugging Face 视觉语言模型 2025 更新
Hugging Face 提供了对 2024‑2025 年间视觉语言模型(VLM)演进的全面概述,重点阐述了任意到任意架构、推理模型以及面向机器人领域的视觉‑语言‑动作(VLA)模型的兴起。
LeRobot 社区数据集:构建机器人领域的 ImageNet
Hugging Face 正在通过 LeRobot 推动社区驱动的努力,创建一个多样化、开源的机器人数据集库,以解决机器人策略的泛化挑战。
使用 Gradio 构建 MCP 服务器
Hugging Face 已将模型上下文协议(MCP)集成到 Gradio 中,使开发者只需更改一个参数即可将 Python 函数转换为 LLM 可访问的工具。
英特尔 AutoRound:面向 LLM 和 VLM 的高级仅权重量化
英特尔推出了 AutoRound,这是一种仅权重的后训练量化方法,使用有符号梯度下降实现对 LLM 和 VLM 的高精度低位量化(INT2-INT8)。
Llama Guard 4 与 Llama Prompt Guard 2 发布
Meta 已发布 Llama Guard 4,这是一款 12B 多模态安全模型,以及 Llama Prompt Guard 2,一系列用于检测提示注入和越狱的分类器。
PipelineRL:通过飞行中权重更新优化大语言模型强化学习
Hugging Face 和 ServiceNow Research 已开源 PipelineRL,这是一种实验性的强化学习实现,使用飞行中权重更新来消除推理吞吐量与在策略数据收集之间的权衡。
Hugging Face 小型代理:用 50 行代码构建基于 MCP 的代理
Hugging Face 演示了如何使用模型上下文协议(MCP)和 InferenceClient 构建功能性 AI 代理,将核心代理逻辑简化为一个简单的 while 循环。
微调 olmOCR 以实现忠实的文档提取
TNG 已发布了一个微调版的 olmOCR-7B-0225-preview,能够保留页眉和页脚,使其适用于发票解析等业务应用。
优化大型语言模型性能:并发请求的预填充与解码
Hugging Face(通过 TNG)解释了如何通过连续批处理和分块预填充等策略管理 token 生成的预填充和解码阶段,以优化 GPU 利用率并将 token 吞吐量提升至最高 50%。
HELMET:全面评估长上下文语言模型
Hugging Face 和 Princeton 的研究人员推出了 HELMET,这是一套综合基准,旨在用多样化、可控且可靠的真实世界评估取代针在稻草堆等合成测试,以评估长上下文语言模型。
Cohere 与 Hugging Face 推理提供商的集成
Hugging Face 已将 Cohere 添加为受支持的推理提供商,使用户能够在 Hub 上直接对广泛的 Cohere 和 Cohere Labs 模型进行无服务器推理。
Gradio 框架概述:超越 UI 库的能力
Hugging Face 详细说明了 Gradio 如何演变为一个提供通用 API 访问、服务器端渲染以及专用机器学习资源管理的综合 AI 框架。
Hugging Face 与 Protect AI 安全合作伙伴关系:6 个月进展报告
Hugging Face 与 Protect AI 已扫描 447 万个模型版本,遍及 141 万个仓库,识别出 35.2 万个不安全或可疑问题,通过 Guardian 扫描技术提升了开源 AI 的安全性。
Hugging Face 收购 Pollen Robotics,扩展开源机器人硬件
Hugging Face 收购了 Pollen Robotics,以将开源类人硬件与 LeRobot 软件生态系统整合,首款产品为 Reachy 2 机器人。
Visual Salamandra 7B 发布
Hugging Face 的语言技术实验室发布了 Visual Salamandra,这是一款拥有 70 亿参数的多模态模型,在扩展 Salamandra LLM 的基础上支持图像和视频,并重点关注欧洲语言的多样性。
Hugging Face 与 Cloudflare FastRTC 集成
Hugging Face 与 Cloudflare 合作,为 FastRTC 开发者免费提供 Cloudflare 全球 TURN 服务器网络的访问权限,简化低延迟实时音视频 AI 应用的部署。
阿拉伯排行榜:阿拉伯指令遵循与 AraGen 更新
Hugging Face 与 Inception 宣布推出 Arabic-Leaderboards Space,提供首个公开的阿拉伯指令遵循(Arabic IFEval)基准以及更新的 AraGen-03-25 生成式排行榜。
Llama 4 Maverick 与 Scout 发布说明
Meta 已发布 Llama 4 Maverick 和 Llama 4 Scout,这两款原生多模态的混合专家(MoE)模型拥有 17B 的活跃参数,并支持最高达 1000 万 token 的上下文窗口。
Gradio 100 万用户里程碑与开发哲学
Hugging Face 的 Gradio 已突破 100 万月活开发者,通过优先使用低层原语而非高层抽象,并专注于机器学习细分领域,实现了增长。
Hugging Face NLP 课程转向 LLM 课程
Hugging Face 正在将其 NLP 课程重新命名并扩展为 LLM 课程,以纳入现代大语言模型研究、微调和推理模型,同时保留经典 NLP 基础。
高效请求排队以优化大语言模型性能
TNG Technology Consulting GmbH 概述了一种通过在上游 LLM-Server 中实现公平调度和基于指标的回压来优化 LLM 性能的策略,以防止大流量用户阻塞其他用户。
Hugging Face 使用 Infisical 的机密管理扩展
Hugging Face 迁移至 Infisical,以在多云环境中实现机密管理的集中化,消除机密散乱,并通过自动化的 Kubernetes 集成和 RBAC 提升安全性。
文本生成推理 (TGI) Intel Gaudi 集成
Hugging Face 已将 Intel Gaudi 硬件支持直接集成到 Text Generation Inference (TGI) 主代码库中,为在 Intel AI 加速器上运行 LLM 提供了生产就绪的服务解决方案。
使用 Sentence Transformers 训练和微调重新排序模型
Hugging Face 通过 Sentence Transformers 提供了完整的指南和框架,用于训练和微调 Cross Encoder 重新排序模型,以优化特定领域的检索性能。
Gradio 数据框更新:新功能和增强
Hugging Face 已更新 Gradio 中的 gr.Dataframe 组件,新增多单元格选择、列固定、搜索与过滤功能,并提升了可访问性。
Hugging Face 推理端点分析更新
Hugging Face 更新了其推理端点分析仪表板,加入实时指标、可自定义时间范围以及详细的副本生命周期视图,以提升监控和调试能力。
Open R1:在本地运行 OlympicCoder 7B 进行编码
Hugging Face 提供了一份指南,介绍如何使用 LM Studio 和 Continue VS Code 扩展在本地部署 OlympicCoder 7B 模型,以实现可与 Claude 3.7 Sonnet 和 GPT-4o 在 LiveCodeBench 上竞争的编码性能。
Hugging Face 对白宫 AI 行动计划信息请求的回应
Hugging Face 主张开源和开放科学在 AI 开发中的根本作用,认为开源模型在性能和效率方面正日益匹配甚至超越闭源商业系统。
NVIDIA GTC 2025 物理 AI 发布:Cosmos Transfer、物理 AI 数据集和 Isaac GR00T N1
NVIDIA 已发布用于可控世界场景生成的 Cosmos Transfer、一个 15TB 物理 AI 数据集以及 Isaac GR00T N1,这是首个用于通用人形机器人推理的开放基础模型。
Hugging Face Xet 存储集成
Hugging Face 已开始将仓库从 LFS 迁移到 Xet 存储,利用内容定义分块技术显著缩短了海量 AI 模型和数据集的上传与下载时间。
Gemma 3 发行说明 / 新功能
Google 发布了 Gemma 3,这是一个多模态、多语言的开放权重 LLM 家族,参数规模从 1B 到 27B,上下文窗口可达 128k 标记。
Open R1 Update #3: OlympicCoder 和代码推理洞察
Hugging Face 推出 OlympicCoder,一组在 IOI 问题上优于前沿模型的代码推理模型,并附带新数据集和训练推理模型的技术经验。
LeRobot L2D: 世界上最大的开源自动驾驶数据集
Hugging Face 和 Yaak 发布了 Learning to Drive (L2D),这是一个多模态自动驾驶数据集,包含来自 30 个德国城市的超过 5,000 小时的驾驶数据,以实现端到端的空间智能训练。
边缘上的LLM推理:通过React Native运行本地LLM
Hugging Face 提供了一份全面的指南,使用 React Native 和 llama.rn 在 Android 和 iOS 上本地运行量化的 GGUF 模型,构建注重隐私的移动应用。
Aya Vision: 使用 8B 和 32B 模型推进多语言多模态
Cohere For AI 发布了 Aya Vision,这是一系列支持 23 种语言的开放权重视觉语言模型(8B 和 32B),在多语言多模态任务中表现优于更大的模型。
Hugging Face 与 JFrog 合作以增强 AI 模型安全
Hugging Face 已将 JFrog 的扫描器集成到 Hugging Face Hub,以减少误报并在各种序列化格式中检测模型权重内的恶意代码。
Hugging Face 和 IISc 合作开源 Vaani 数据集
Hugging Face 与印度科学院(IISc)和 ARTPARK 合作,提供对 Vaani 的全球访问,Vaani 是一个旨在代表印度语言多样性的大规模多模态多语言数据集。
FastRTC: 用于 Python 的实时通信库
Hugging Face 发布了 FastRTC,这是一个旨在通过处理 WebRTC 和 WebSocket 通信层来简化实时音视频 AI 应用开发的 Python 库。
Hugging Face 远程 VAEs 用于推理端点
Hugging Face 推出了一项实验功能,将 VAE 解码过程委托给远程端点,以降低消费级 GPU 上高分辨率图像和视频合成的显存需求。
SigLIP 2 发布说明 / 新特性
Google 发布了 SigLIP 2,这是一个多语言视觉语言编码器系列,在零样本分类、图像-文本检索和 VLM 迁移性能方面在所有规模上均优于原始 SigLIP。
SmolVLM2: 让每台设备都能理解视频
Hugging Face 发布了 SmolVLM2,这是一系列高效的视觉和视频语言模型,参数规模为 2.2B、500M 和 256M,旨在使从手机到服务器的设备能够进行本地视频理解。
PaliGemma 2 Mix 发布说明
Google 已发布 PaliGemma 2 mix,这是一系列在包括 OCR、标题生成和目标检测在内的多样化任务上微调的视觉语言模型,以展示 PaliGemma 2 预训练检查点的潜力。
Hugging Face 添加 Hyperbolic、Nebius AI Studio 和 Novita 作为 Serverless 推理提供商
Hugging Face 已将 Hyperbolic、Nebius AI Studio 和 Novita 集成作为 Serverless 推理提供商,通过 Hub 和客户端 SDK 直接扩展对 DeepSeek-R1 和 FLUX.1 等模型的访问。
Hugging Face Open LLM Leaderboard 更新:集成 Math-Verify 以改进数学评估
Hugging Face 使用 Math-Verify 重新评估了 Open LLM Leaderboard 上的 3,751 个模型,以修复解析错误和格式严格性,导致 MATH-Hard 排名发生显著变动。
Hugging Face 将 Fireworks.ai 集成作为推理提供商
Hugging Face 已在 Hub 上添加 Fireworks.ai 作为受支持的推理提供商,使得如 DeepSeek-R1 和 Llama-3.2-90B-Vision-Instruct 等模型能够在 HF 生态系统中进行无服务器推理。
Hugging Face: 优化 10亿次分类的成本和延迟
Hugging Face 提供了一个框架和基准,用于降低大规模编码器模型推理的成本,表明 NVIDIA L4 GPU 和优化的批次大小可以以低至 253.82 美元处理 10亿 次文本分类。
Hugging Face 视频数据集脚本
Hugging Face 推出了一套开源视频数据集脚本,旨在简化高质量、过滤后的数据集的创建,用于微调视频生成模型。
Hugging Face Xet支持的仓库:通过块级聚合加速Hub传输
Hugging Face 正在引入一个基于块的去重系统,使用 xet-core 和 hf_xet,通过块级聚合将上传和下载速度提高 2-3 倍。
Open R1 Update #2: OpenR1-Math-220k 数据集和推理洞察
Hugging Face 介绍了 OpenR1-Math-220k,这是一个旨在重建 DeepSeek R1 蒸馏管道的大规模数学推理数据集,同时分享了社区关于 GRPO 和 Chain-of-Thought 长度控制的见解。