351

Hugging Face Judge Arena: 将 LLM 作为评估器进行基准测试

Hugging Face 推出了 Judge Arena,这是一个通过人类投票来确定哪些 LLM 在评估其他 AI 生成的响应方面最有效的众包平台。

352

面向研究者的 Hugging Face Hub 数据集共享

Hugging Face Hub 提供一个综合平台,用于托管和共享大规模 ML 数据集,集成了用于探索、安全和社区参与的工具。

353

Hugging Face PyCharm 集成

Hugging Face 已将其 Hub 直接集成到 PyCharm Professional 中,允许开发人员在不离开 IDE 的情况下发现、插入和管理机器学习模型。

354

Argilla 2.4 发布说明 / 新功能

Argilla 2.4 引入了一个无需编码的 UI,用于导入 Hugging Face Hub 数据集,以通过人工反馈构建微调和评估数据集。

355

通用辅助生成:使用任意助手模型实现更快解码

Hugging Face 与 Intel Labs 推出了通用辅助生成(UAG),这是一种通过允许任何小模型充当助手(不受其分词器限制)来将大语言模型推理加速 1.5 倍至 2.0 倍的方法。

356

Digital Green Farmer.chat:通过 LLM‑as‑a‑Judge 加强 RAG

Digital Green 为 Farmer.chat(基于 RAG 的农业聊天机器人)实现了 LLM‑as‑a‑Judge 评估框架,以客观衡量 RAG 准确性并在 34 万条查询中优化模型选择。

357

Aya Expanse 发布:推动多语言大语言模型性能提升

Hugging Face 和 Cohere For AI 已发布 Aya Expanse,这是一系列 8B 和 32B 开源权重模型,创下了多语言性能的新最先进基准。

358

HUGS 发布:零配置、硬件优化的开源 LLM 推理

Hugging Face 推出 HUGS,这是一项零配置、硬件优化的开源 LLM 推理服务,支持 NVIDIA、AMD,未来还将支持 AWS Inferentia 和 Google TPU,使企业能够在内部托管模型,并提供兼容 OpenAI 的 API。

359

CinePile 2.0 发布:对抗性细化提升视频问答数据集质量

CinePile 2.0 引入了对抗性细化流水线,将薄弱的 QA 对升级为依赖视觉的问题,发布了改进后的数据集和完整代码,并展示了商业和开源视频‑LLM 的显著性能提升。

360

SynthID 文本集成于 Transformers v4.46.0

Google DeepMind 与 Hugging Face 已将 SynthID Text 集成到 Transformers v4.46.0 中,提供了一种对 AI 生成文本添加不可感知水印并通过训练分类器进行检测的方法。

361

在 Hugging Face 推理端点上部署语音到语音

Hugging Face 提供了一份指南,说明如何使用自定义 Docker 镜像在 Inference Endpoints 上部署其 Speech-to-Speech(S2S)流水线,以应对高计算需求并降低延迟。

362

Outlines-core 0.1.0 发布说明 / 新功能

Hugging Face 和 dottxt 已发布 outlines-core 0.1.0,这是 Outlines 核心算法的 Rust 移植版,用于结构化生成,提升了索引编译速度和可移植性。

363

Stable Diffusion 3.5 Large 与 Diffusers 的集成

Hugging Face 已将 Stable Diffusion 3.5 Large(一个 8B 参数模型,提供标准版和时间步蒸馏版)集成到 Diffusers 库中。

364

Hugging Face 与 Protect AI 合作,为模型安全添加 Guardian 扫描器

Hugging Face 与 Protect AI 合作,将 Guardian 扫描器嵌入 Hub,自动检测危险的模型序列化漏洞,提升整个机器学习社区的安全性。

365

Transformers.js v3 发行版添加了 WebGPU 加速、扩展的模型支持以及服务器端 JavaScript 兼容性

Transformers.js v3 添加了 WebGPU 加速、新的量化格式、支持 120 种模型架构,并兼容 Node.js/Deno/Bun,使得在浏览器和 JavaScript 运行时实现快速的设备端推理成为可能。

366

Keras 中的 Llama 3.2

通过 keras-hub,Keras 完全支持 Llama 3.2,用户可以加载 Hugging Face 检查点,并在 JAX、PyTorch 或 TensorFlow 后端上运行模型。

367

Hugging Face Transformers 梯度累积修复

Hugging Face 已更新 Transformers Trainer,通过纠正跨批次的损失平均方式,确保梯度累积在数学上等同于完整批次训练。

368

Gradio 5 安全审查

Hugging Face 与 Trail of Bits 合作,对 Gradio 5 进行全面安全审计,修复了所有已识别的漏洞,确保机器学习应用默认安全。

369

AMD EPYC Turin CPU 实现比 Genoa 高出 2 倍的 LLM 推理吞吐量

AMD 第五代 EPYC Turin CPU 的 LLM 推理吞吐量约为 Genoa 的两倍,为 Hugging Face 工作负载实现更低的延迟和更高的吞吐量。

370

使用 Hugging Face 和 Dask 扩展 AI 数据处理规模

Hugging Face 和 Dask 通过分布式计算和多 GPU 并行推理,实现了 AI 数据处理从小规模本地样本到数亿行的扩展。

371

Gradio 5 发布说明

Hugging Face 已发布 Gradio 5,这是一款面向生产环境的框架,可使用 Python 构建高性能、可扩展且安全的机器学习 Web 应用程序。

372

Hugging Face Transformers 4.45.0 动态投机解码

Hugging Face 与 Intel Labs 在 Transformers 4.45.0 中引入了动态投机解码,通过根据模型置信度动态调整草稿 token 数量,实现了最高 **2.7 倍** 的文本生成加速。

373

在 Hugging Face Hub 上改进 Parquet 去重

Hugging Face 正在优化其存储架构以提升 Parquet 文件去重效率,提出基于内容定义的行组,以在数据集更新时降低存储开销。

374

Open FinLLM Leaderboard 发布 – 金融语言模型的全面零样本基准

Hugging Face 推出了 Open FinLLM Leaderboard,这是一项覆盖七大类、共 40 项金融专用任务的零样本基准,用于评估大型语言模型在真实金融场景中的准备程度。

375

中国人工智能全球扩张分析

中国人工智能公司正因国内市场饱和、激烈的价格战和监管压力而加速国际扩张,目标市场包括东南亚、中东以及西方消费市场。

376

BenCzechMark:面向捷克语 LLM 的综合评估套件

Hugging Face 与学术合作伙伴发布了 BenCzechMark,这是首个面向捷克语模型的综合评估套件,包含 9 个类别的 50 项任务,并采用新颖的基于对决的计分机制。

377

将顶点着色网格转换为纹理网格

Hugging Face 推出了一种方法和 InstantTexture 库,用于将顶点着色的 3D 网格转换为 UV 映射的纹理网格,以提升应用兼容性。

378

Llama 3.2 发布说明:多模态视觉与设备端小型语言模型

Meta 已发布 Llama 3.2,推出 11B 与 90B 规模的多模态视觉能力,以及针对设备端部署优化的轻量级 1B 与 3B 纯文本模型。

379

Hugging Face 每日论文功能指南

Hugging Face 的每日论文页面提供了一个由社区策划的 AI 研究中心,具备作者认领、论文提交以及研究者与开发者之间直接互动的工具。

380

FineVideo 数据集发布

Hugging Face 已发布 FineVideo,这是一套高质量的开放视频数据集,包含 43,000 条视频(3,400 小时),提供丰富的结构化注释,用于视频理解和生成式 AI 训练。

381

使用 Optimum-Intel 和 OpenVINO GenAI 优化与部署 Hugging Face 模型

Hugging Face 与 Intel 提供了一套简化的工作流,使用 Optimum-Intel 和 OpenVINO GenAI 在 Intel 硬件上优化并部署 Transformers 模型,专注于边缘和客户端的 C++ 与 Python 环境。

382

微调 LLM 至 1.58 位:使用 BitNet 的极端量化

Hugging Face 证明,现有的 LLM(如 Llama 3 8B)可以通过动态热身量化策略微调至 1.58 位三值精度,从而显著降低内存和能耗,同时保持强劲的性能。

383

Hugging Face 数据集 SQL 控制台

Hugging Face 推出了基于浏览器的 SQL 控制台,使用 DuckDB WASM 提供支持,使用户能够直接在 Hub 上查询、过滤和转换数据集,无需后端依赖。

384

HuggingChat 社区工具发布

Hugging Face 在 HuggingChat 上推出了社区工具,使用户能够将任何公开的 Hugging Face Space 集成作为工具,供大型语言模型直接在聊天界面中使用。

385

Accelerate 1.0.0 发布候选版公告

Accelerate 1.0.0 发布候选版加入了 FP8、DeepSpeed 多模型、torch.compile 以及全新的数据加载器/流水线特性,同时为大规模训练和推理稳定了 API。

386

Hugging Face 与 TruffleHog 合作进行秘密扫描

Hugging Face 已与 Truffle Security 合作,将 TruffleHog 的秘密扫描功能集成到其自动化管道中,并为用户提供一个原生扫描器,以主动扫描其自身的账户数据。

387

LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度

Hugging Face 发布了 LeRobotDataset 视频编码格式,将机器人视觉数据压缩至原始大小约 14%,同时保持加载速度和训练性能不变。

388

Hugging Face 博客文章突显五个被低估的 Hub 工具及一个免费语义搜索用例

Hugging Face 宣布了五个被低估的 Hub 工具——ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas,并展示了如何将它们组合成一个免费、自动更新的 Reddit 数据语义搜索应用。

389

Hugging Face 训练效率:使用 Flash Attention 2 的打包

Hugging Face 引入了面向边界的打包用于指令微调示例,在配合 Flash Attention 2 使用时,可实现最高 2 倍的训练吞吐量提升和 20% 的峰值内存降低。

390

在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B

Hugging Face 提供了一份指南,介绍如何使用文本生成推理(TGI)和 A3 机器系列在 Google Cloud Vertex AI 上以编程方式部署 Meta Llama 3.1 405B 的 FP8 量化版本。

391

Hugging Face Infini-Attention 复现分析

Hugging Face 对 Infini-Attention 的复现尝试发现,尽管可以改进门控收敛,但随着记忆压缩的增加,方法的性能会下降,且仍不如 Ring Attention、YaRN 或 RoPE scaling 可靠。

392

ggml 简介

ggml 是一个轻量级的 C/C++ 机器学习库,针对 Transformer 推理和跨多种硬件后端的设备端 LLM 执行进行了优化。

393

Hugging Face 统一工具使用 API

Hugging Face 已推出统一的工具使用 API,使开发者能够使用相同的代码在 Mistral、Cohere、NousResearch 和 Llama 模型之间实现工具调用。

394

Falcon Mamba 7B 发布说明

技术创新研究所(TII)发布了 Falcon Mamba 7B,这是首个大规模纯状态空间语言模型(SSLM),其性能可与最先进的 Transformer 模型相匹配,同时消除了基于注意力的内存扩展问题。

395

Hugging Face 收购 XetHub 以升级 Hub 存储和协作

Hugging Face 收购 XetHub,以用更高效的存储后端取代 Git LFS,实现增量更新、万亿参数模型支持以及对海量 AI 数据集的更佳协作。

396

Hugging Face TextImage Augmentation 管道发布

Hugging Face 和 Albumentations AI 发布了一个 TextImage Augmentation 管道,能够联合修改文档图像及其文本,实现真实的合成数据生成,并在有限的文档数据集上对视觉‑语言模型进行稳健的微调。

397

Hugging Face 2024 安全功能亮点

Hugging Face 详细阐述了其 2024 年的安全格局,推出了一套面向所有用户的默认防护措施以及面向 Enterprise Hub 用户的高级治理控制。

398

Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope

Google 发布了 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器,扩展了开源大语言模型的能力、审查工具和可解释性资源。

399

Quanto 量化削减 Transformer 扩散管线的内存占用

Hugging Face 的量化(Quanto)将 Transformer 扩散模型的 GPU 内存从约 12 GB 降至约 5 GB,且对延迟和质量的影响极小。

400

Hugging Face NVIDIA NIM API(无服务器)发布与停用

Hugging Face 为 Enterprise Hub 用户推出了 NVIDIA NIM API(无服务器),通过兼容 OpenAI 的 API,实现了在 NVIDIA DGX Cloud H100 GPU 上按需付费的开源大语言模型无服务器推理。