✷ 归档 · 11 个实验室 · 869 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
Transformers.js v3 发行版添加了 WebGPU 加速、扩展的模型支持以及服务器端 JavaScript 兼容性
Transformers.js v3 添加了 WebGPU 加速、新的量化格式、支持 120 种模型架构,并兼容 Node.js/Deno/Bun,使得在浏览器和 JavaScript 运行时实现快速的设备端推理成为可能。
Keras 中的 Llama 3.2
通过 keras-hub,Keras 完全支持 Llama 3.2,用户可以加载 Hugging Face 检查点,并在 JAX、PyTorch 或 TensorFlow 后端上运行模型。
Hugging Face Transformers 梯度累积修复
Hugging Face 已更新 Transformers Trainer,通过纠正跨批次的损失平均方式,确保梯度累积在数学上等同于完整批次训练。
Gradio 5 安全审查
Hugging Face 与 Trail of Bits 合作,对 Gradio 5 进行全面安全审计,修复了所有已识别的漏洞,确保机器学习应用默认安全。
AMD EPYC Turin CPU 实现比 Genoa 高出 2 倍的 LLM 推理吞吐量
AMD 第五代 EPYC Turin CPU 的 LLM 推理吞吐量约为 Genoa 的两倍,为 Hugging Face 工作负载实现更低的延迟和更高的吞吐量。
使用 Hugging Face 和 Dask 扩展 AI 数据处理规模
Hugging Face 和 Dask 通过分布式计算和多 GPU 并行推理,实现了 AI 数据处理从小规模本地样本到数亿行的扩展。
Gradio 5 发布说明
Hugging Face 已发布 Gradio 5,这是一款面向生产环境的框架,可使用 Python 构建高性能、可扩展且安全的机器学习 Web 应用程序。
Hugging Face Transformers 4.45.0 动态投机解码
Hugging Face 与 Intel Labs 在 Transformers 4.45.0 中引入了动态投机解码,通过根据模型置信度动态调整草稿 token 数量,实现了最高 **2.7 倍** 的文本生成加速。
在 Hugging Face Hub 上改进 Parquet 去重
Hugging Face 正在优化其存储架构以提升 Parquet 文件去重效率,提出基于内容定义的行组,以在数据集更新时降低存储开销。
Open FinLLM Leaderboard 发布 – 金融语言模型的全面零样本基准
Hugging Face 推出了 Open FinLLM Leaderboard,这是一项覆盖七大类、共 40 项金融专用任务的零样本基准,用于评估大型语言模型在真实金融场景中的准备程度。
中国人工智能全球扩张分析
中国人工智能公司正因国内市场饱和、激烈的价格战和监管压力而加速国际扩张,目标市场包括东南亚、中东以及西方消费市场。
BenCzechMark:面向捷克语 LLM 的综合评估套件
Hugging Face 与学术合作伙伴发布了 BenCzechMark,这是首个面向捷克语模型的综合评估套件,包含 9 个类别的 50 项任务,并采用新颖的基于对决的计分机制。
将顶点着色网格转换为纹理网格
Hugging Face 推出了一种方法和 InstantTexture 库,用于将顶点着色的 3D 网格转换为 UV 映射的纹理网格,以提升应用兼容性。
Llama 3.2 发布说明:多模态视觉与设备端小型语言模型
Meta 已发布 Llama 3.2,推出 11B 与 90B 规模的多模态视觉能力,以及针对设备端部署优化的轻量级 1B 与 3B 纯文本模型。
Hugging Face 每日论文功能指南
Hugging Face 的每日论文页面提供了一个由社区策划的 AI 研究中心,具备作者认领、论文提交以及研究者与开发者之间直接互动的工具。
FineVideo 数据集发布
Hugging Face 已发布 FineVideo,这是一套高质量的开放视频数据集,包含 43,000 条视频(3,400 小时),提供丰富的结构化注释,用于视频理解和生成式 AI 训练。
使用 Optimum-Intel 和 OpenVINO GenAI 优化与部署 Hugging Face 模型
Hugging Face 与 Intel 提供了一套简化的工作流,使用 Optimum-Intel 和 OpenVINO GenAI 在 Intel 硬件上优化并部署 Transformers 模型,专注于边缘和客户端的 C++ 与 Python 环境。
微调 LLM 至 1.58 位:使用 BitNet 的极端量化
Hugging Face 证明,现有的 LLM(如 Llama 3 8B)可以通过动态热身量化策略微调至 1.58 位三值精度,从而显著降低内存和能耗,同时保持强劲的性能。
Hugging Face 数据集 SQL 控制台
Hugging Face 推出了基于浏览器的 SQL 控制台,使用 DuckDB WASM 提供支持,使用户能够直接在 Hub 上查询、过滤和转换数据集,无需后端依赖。
HuggingChat 社区工具发布
Hugging Face 在 HuggingChat 上推出了社区工具,使用户能够将任何公开的 Hugging Face Space 集成作为工具,供大型语言模型直接在聊天界面中使用。
Accelerate 1.0.0 发布候选版公告
Accelerate 1.0.0 发布候选版加入了 FP8、DeepSpeed 多模型、torch.compile 以及全新的数据加载器/流水线特性,同时为大规模训练和推理稳定了 API。
Hugging Face 与 TruffleHog 合作进行秘密扫描
Hugging Face 已与 Truffle Security 合作,将 TruffleHog 的秘密扫描功能集成到其自动化管道中,并为用户提供一个原生扫描器,以主动扫描其自身的账户数据。
LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度
Hugging Face 发布了 LeRobotDataset 视频编码格式,将机器人视觉数据压缩至原始大小约 14%,同时保持加载速度和训练性能不变。
Hugging Face 博客文章突显五个被低估的 Hub 工具及一个免费语义搜索用例
Hugging Face 宣布了五个被低估的 Hub 工具——ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas,并展示了如何将它们组合成一个免费、自动更新的 Reddit 数据语义搜索应用。
Hugging Face 训练效率:使用 Flash Attention 2 的打包
Hugging Face 引入了面向边界的打包用于指令微调示例,在配合 Flash Attention 2 使用时,可实现最高 2 倍的训练吞吐量提升和 20% 的峰值内存降低。
在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B
Hugging Face 提供了一份指南,介绍如何使用文本生成推理(TGI)和 A3 机器系列在 Google Cloud Vertex AI 上以编程方式部署 Meta Llama 3.1 405B 的 FP8 量化版本。
Hugging Face Infini-Attention 复现分析
Hugging Face 对 Infini-Attention 的复现尝试发现,尽管可以改进门控收敛,但随着记忆压缩的增加,方法的性能会下降,且仍不如 Ring Attention、YaRN 或 RoPE scaling 可靠。
ggml 简介
ggml 是一个轻量级的 C/C++ 机器学习库,针对 Transformer 推理和跨多种硬件后端的设备端 LLM 执行进行了优化。
Hugging Face 统一工具使用 API
Hugging Face 已推出统一的工具使用 API,使开发者能够使用相同的代码在 Mistral、Cohere、NousResearch 和 Llama 模型之间实现工具调用。
Falcon Mamba 7B 发布说明
技术创新研究所(TII)发布了 Falcon Mamba 7B,这是首个大规模纯状态空间语言模型(SSLM),其性能可与最先进的 Transformer 模型相匹配,同时消除了基于注意力的内存扩展问题。
Hugging Face 收购 XetHub 以升级 Hub 存储和协作
Hugging Face 收购 XetHub,以用更高效的存储后端取代 Git LFS,实现增量更新、万亿参数模型支持以及对海量 AI 数据集的更佳协作。
Hugging Face TextImage Augmentation 管道发布
Hugging Face 和 Albumentations AI 发布了一个 TextImage Augmentation 管道,能够联合修改文档图像及其文本,实现真实的合成数据生成,并在有限的文档数据集上对视觉‑语言模型进行稳健的微调。
Hugging Face 2024 安全功能亮点
Hugging Face 详细阐述了其 2024 年的安全格局,推出了一套面向所有用户的默认防护措施以及面向 Enterprise Hub 用户的高级治理控制。
Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope
Google 发布了 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器,扩展了开源大语言模型的能力、审查工具和可解释性资源。
Quanto 量化削减 Transformer 扩散管线的内存占用
Hugging Face 的量化(Quanto)将 Transformer 扩散模型的 GPU 内存从约 12 GB 降至约 5 GB,且对延迟和质量的影响极小。
Hugging Face NVIDIA NIM API(无服务器)发布与停用
Hugging Face 为 Enterprise Hub 用户推出了 NVIDIA NIM API(无服务器),通过兼容 OpenAI 的 API,实现了在 NVIDIA DGX Cloud H100 GPU 上按需付费的开源大语言模型无服务器推理。
LAVE:使用大型语言模型对 Docmatix 进行零样本 VQA 评估
Hugging Face 推出 LAVE(大型语言模型辅助的 VQA 评估),旨在解决传统 VQA 指标的僵硬性,在对 Docmatix 数据集的零样本性能评估中实现了约 50% 的准确率提升。
Llama 3.1 发布说明:多语言、长上下文和 405B 模型
Meta 已发布 Llama 3.1,提供 8B、70B 和 405B 大小的模型,具备 128K 上下文长度、对 8 种语言的多语言支持,以及允许合成数据生成的宽松许可证。
使用 Core ML 运行 Mistral 7B
Hugging Face 演示了如何在 Mac 上使用 WWDC 24 推出的新 Core ML 功能运行 Mistral 7B,并通过 4 位块状量化将模型大小压缩至 4GB 以下。
Docmatix 数据集发布
Hugging Face 发布了 Docmatix,这是一套文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万个问答对,规模比之前的数据集提升了 240 倍。
TGI Multi-LoRA:一次部署,服务 30 个模型
Hugging Face 在文本生成推理(TGI)中引入了 Multi-LoRA 服务,使组织能够部署单一基础模型并动态提供数十个专用微调适配器,从而降低成本和运营复杂性。
Argilla SDK 聊天机器人(使用 distilabel)– 端到端教程
Hugging Face 发布了一个教程,展示如何使用 distilabel 生成的合成数据、微调的嵌入、lancedb 向量存储以及在 Spaces 部署的 Gradio 应用来构建 Argilla 2.0 聊天机器人。
SmolLM 发布:高性能小语言模型
Hugging Face 推出了 SmolLM,这是一个由最先进的小语言模型(135M、360M 和 1.7B 参数)组成的家族,这些模型是在精心策划的高质量数据集上训练而成的。
NuminaMath 7B TIR 获得 AIMO 进步奖 – 技术回顾
NuminaMath 7B TIR 通过解答 50 道隐藏数学题中的 29 道,赢得了首届 AIMO 进步奖,展示了两阶段微调方案、大规模高质量数学数据以及自洽+工具集成推理推断策略的强大威力。
Hugging Face 使用 Presidio 进行 PII 检测实验
Hugging Face 正在尝试将 Microsoft Presidio 集成到 Dataset Hub,以提供自动 PII 检测报告,帮助从业者识别和缓解 ML 数据集中的隐私风险。
TRL 为视觉语言模型添加直接偏好优化支持
Hugging Face 在 TRL 库中为视觉语言模型添加了直接偏好优化(DPO)支持,使得可以使用偏好数据对 Idefics‑2 等模型进行微调,并通过 bfloat16 量化和 LoRA 适配器在单个 GPU 上完成训练。
Hugging Face 与 KerasHub 集成
Hugging Face 与 KerasHub 现在共享模型保存格式,使 KerasHub 用户能够直接加载来自 Hugging Face Hub 的超过 30 万个 Transformers 库模型。
Google Cloud TPU 在 Hugging Face 推理端点和 Spaces 上的使用
Hugging Face 已将 Google Cloud TPU v5e 支持集成到推理端点和 Spaces 中,使用户能够使用成本效益高且性能强大的硬件部署和扩展 AI 模型。
Banque des Territoires、Polyconseil 与 Hugging Face 为 EduRénov 项目部署主权 RAG 解决方案
Hugging Face、Polyconseil 与 Banque des Territoires 推出了一套主权、开源的 RAG 系统,用于自动化法国 EduRénov 学校改造项目的邮件支持,确保数据驻留,同时在公共政策领域扩展生成式 AI 的规模。
Hugging Face 数据集中心搜索功能更新
Hugging Face 引入了四个全新搜索过滤器——模态、规模、格式和库兼容性,以提升 Dataset Hub 上超过 180,000 个公共数据集的可发现性。