Hugging Face 开源现状:2026 年春季
开源 AI 生态系统经历了快速增长,用户、模型和数据集仓库的数量几乎翻倍。截至 2025 年,Hugging Face 已增长至 1300 万用户、超过 200 万公开模型以及超过 50 万公开数据集,标志着从被动消费向通过创建微调模型、适配器和基准测试进行主动参与的转变。
生态系统集中度与企业采纳
尽管整体增长,生态系统仍高度集中:0.01% 的模型(下载量最高的前 200 个)占全部下载量的 49.6%,而约一半的模型下载量不足 200 次。
企业对开源的采纳正在增加,超过 30% 的《财富》500 强公司现在在 Hugging Face 上拥有已验证账户。大型科技公司的投资显而易见,NVIDIA 成为最重要的贡献者。报告指出,开源产物产生的下游价值往往超过生产成本,为组织提供了比完全封闭系统更大的灵活性和更低的成本。
地理格局转变与中国 AI 的崛起
中国在月度和总体模型下载量上均已超越美国。过去一年,中国模型占全部下载量的 41%。这一转变因 DeepSeek 的 R1 模型在 2025 年 1 月的病毒式发布而加速,导致包括百度(2024 年零发布,2025 年超过 100 次发布)、字节跳动和腾讯在内的组织大量开放发布。
尽管美国和西欧仍通过 Meta、Google 等大型实验室继续贡献,但中国组织的仓库增长轨迹明显更陡。此外,个人和非隶属开发者的下载份额自 2022 年的 17% 上升至 39%,他们通常专注于基础模型的量化和适配。
国家主权与 AI 计划
开源权重模型日益被视为国家主权的工具,使政府能够在本土硬件上部署 AI 并在本地数据上进行微调。
- 韩国: 于 2025 年年中启动国家主权 AI 计划,确定了包括 LG AI Research、SK Telecom、Naver Cloud、NC AI 和 Upstage 在内的国家冠军企业。
- 欧洲: 瑞士的 Swiss AI 计划以及多项欧盟资助项目优先实现类似目标,英国则遵循“公共资金,公共代码”原则。
模型受欢迎度与技术趋势
受欢迎度转变
社区关注已从以美国为主的格局(Meta 的 Llama 系列)转向国际混合,其中中国的 DeepSeek‑R1 目前位居最受喜爱模型之首。
派生模型
阿里巴巴的 Qwen 系列获得了大规模采用,派生模型超过 113,000 个(若包括所有标记 Qwen 的模型则超过 200,000 个),超过了 Google 与 Meta 的派生模型总和。
可访问性与模型规模
由于成本和延迟的限制,小模型的下载和部署率显著高于大系统。虽然下载模型的平均规模从 2023 年的 8.27 亿参数上升至 2025 年的 208 亿参数(受 MoE 和量化驱动),但中位数规模仅从 3.26 亿增长到 4.06 亿参数,幅度有限。
新兴子社区
机器人
机器人是 Hugging Face 增长最快的子社区。机器人数据集从 2024 年的 1,145 个增长至 2025 年的 26,991 个,成为 Hub 上最大的数据集类别,超越文本生成。关键进展包括 LeRobot 库和 Learning to Drive(L2D)多模态数据集。
AI for Science
开源模型正日益应用于蛋白质折叠、分子动力学和药物发现。虽然前沿 AI 公司设有专门的科学团队,但当前社区的主要关注点在于文献发现和大规模跨学科协作。
计算与硬件优化
开发正转向跨硬件兼容性。虽然 NVIDIA GPU 仍占主导地位,但对 AMD 硬件的支持正在扩大,Hugging Face 于 2025 年推出 Kernel Hub,以优化针对 NVIDIA 与 AMD 的内核。同时,中国模型正明确支持国产芯片架构,以降低对国外云基础设施的依赖。