归档 · 11 个实验室 · 869 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

551

aMUSEd:高效文本到图像生成

Hugging Face 发布了 aMUSEd,这是一款基于遮罩图像建模(MIM)的高效非扩散文本到图像模型,也是对 Google 的 MUSE 的公开复现。

552

Hugging Face SDXL Dreambooth LoRA 高级训练指南

Hugging Face 引入了一个用于 SDXL Dreambooth LoRA 的高级训练脚本,结合了 Pivotal Tuning 和 Prodigy 优化器,以提升概念捕获和图像质量。

553

投机解码实现 Whisper 推理速度提升 2×

Hugging Face 证明,投机解码将 Whisper 转录延迟减半,同时保持输出和准确性完全一致。

554

2023 年开放大语言模型回顾

Hugging Face 2023 年回顾显示,开源 LLM 发布激增,出现了更小但性能更强的模型,以及新颖的微调技术,极大拓宽了访问渠道和社区参与度。

555

专家混合(MoE)解释

专家混合(MoE)通过在每个 token 上仅激活部分神经网络专家,使 Transformer 模型能够在扩展参数规模的同时保持高效的预训练和更快的推理。

556

Mixtral 8x7B 发布说明

Mistral AI 已发布 Mixtral 8x7B,这是一款 Mixture of Experts(MoE)模型,在大多数基准测试中超越 Llama 2 70B 并匹配 GPT-3.5 的性能,同时在 Apache 2.0 许可证下保持商业宽松。

557

SetFitABSA:少样本方面情感分析

Hugging Face 和 Intel Labs 推出了 SetFitABSA,这是一种无需提示、少样本的方面情感分析框架,在数据稀缺的情况下能够超越更大的生成模型如 Llama 2 和 T5 的表现。

558

Optimum-NVIDIA 发布说明

Hugging Face 发布了 Optimum-NVIDIA,这是一款通过 FP8 量化和 TensorRT-LLM 在 NVIDIA 平台上将 LLM 推理加速至最高 28 倍的推理库。

559

Hugging Face LoRA 动态加载加速推理 300% 并降低延迟

Hugging Face 宣布了一套动态 LoRA 加载系统,将热身时间从 25 秒降低至 3 秒,使 LoRA 推理速度提升最高达 300%,并将总响应时间从 35 秒缩短至 13 秒。

560

Hugging Face 与 AMD 为 LLM 提供 GPU 加速

Hugging Face 与 AMD 已将针对 AMD Instinct GPU 的开箱即用支持集成到 Transformers 库和 Text Generation Inference 中,实现了无需更改代码即可进行高性能 LLM 执行。

561

Hugging Face Open LLM Leaderboard DROP 基准分析

Hugging Face 在发现有缺陷的归一化和停止令牌配置导致大多数模型得分异常低后,已将 DROP 基准从 Open LLM Leaderboard 中移除。

562

SDXL 和 Stable Diffusion 使用 Latent Consistency LoRAs 的快速推理

Hugging Face 推出 LCM LoRAs,一种使 SDXL 和 Stable Diffusion 模型能够在 4 到 8 步内生成高质量图像的方法,显著降低推理时间。

563

Prodigy-HF 集成发布说明

Explosion 已发布 Prodigy-HF,一个插件,使得可以在标注数据上直接微调 Hugging Face Transformer 模型,并能够直接将数据集上传到 Hugging Face Hub。

564

在 AWS Inferentia2 上使用 optimum-neuron 部署 Llama 2

Hugging Face 已将 optimum-neuron 与 AWS Neuron SDK 集成,以在 AWS Inferentia2 加速器上部署 Llama 2 模型,实现高性能文本生成。

565

比较 RoBERTa、Llama 2 和 Mistral 在灾难推文分类中的 LoRA 应用

一项比较研究表明,在使用低秩适应(LoRA)进行微调时,较小的 RoBERTa 模型在灾难推文的二分类任务中优于 Llama 2 和 Mistral 7B。

566

Hugging Face Hub 存储区域

Hugging Face 为 Enterprise Hub 客户引入了存储区域,使组织能够选择其模型和数据集的存储位置,以提高监管合规性和数据传输性能。

567

个人 Copilot: 训练你自己的编码助手

Hugging Face 展示了如何通过在特定代码库上使用 QLoRA 和全量微调技术微调 StarCoder 来创建个性化编码助手 HugCoder。

568

Hugging Face 与 Renumics Spotlight 集成以实现可扩展的数据检查

Hugging Face 已与 Renumics Spotlight 集成,以实现机器学习数据集的交互式、一行代码可视化和检查,包括对多模态数据和模型结果的支持。

569

优化 Stable Diffusion XL (SDXL) 的推理速度与内存占用

Hugging Face 探索了 Stable Diffusion XL (SDXL) 的多种优化技术,展示了如何将内存占用从 28GB 降低到低至 11.47GB,并将推理延迟从 72.2 秒降低到大约 10.3 秒。

570

使用 Hugging Face Inference Endpoints 部署嵌入模型

Hugging Face 通过 Inference Endpoints 引入 Text Embeddings Inference (TEI),为部署开源嵌入模型以用于 RAG 和语义搜索提供了一种高性能、成本效益高的方式。

571

The N 实现细节 of RLHF with PPO – Hugging Face 博客摘要

Hugging Face 博客文章复现了 OpenAI 的 2019 年 RLHF 代码库,匹配了其学习曲线,并详细说明了 N 项实现细节,包括一个关键的 PyTorch Adam 优化器差异,导致更新更加激进。

572

Gradio-Lite: 完全在浏览器中运行的无服务器 Gradio

Hugging Face 推出 Gradio-Lite (@gradio/lite),这是一个使用 Pyodide 在网页浏览器中直接运行 Gradio 应用的 JavaScript 库,消除了对服务器端基础设施的需求。

573

使用 ONNX Runtime 加速 Hugging Face 模型

Hugging Face 和 ONNX Runtime 使超过 130,000 个模型实现性能加速,包括相比 PyTorch,whisper-tiny 模型的延迟降低高达 74.30%。

574

Hugging Face Chat Templates

Hugging Face 引入了基于 Jinja 的聊天模板系统,以确保聊天模型接收到的输入格式与其训练时完全一致,从而防止性能隐形下降。

575

在 Cloud TPU v5e 上使用 JAX 加速 Stable Diffusion XL 推理

Hugging Face Diffusers 现在支持在 Cloud TPU v5e 上使用 JAX 来服务 Stable Diffusion XL (SDXL),相比 TPU v4 提供最高 2.4 倍的每美元性能。

576

通过 Hugging Face Inference API 部署 AI Comic Factory

Hugging Face 提供了一个使用 Inference API 部署 AI Comic Factory 私有实例的指南,利用 Llama-2 和 SDXL 1.0 模型。

577

通过 TRL 使用 DDPO 微调 Stable Diffusion

Hugging Face 已将去噪扩散策略优化 (DDPO) 集成到 TRL 库中,使得使用强化学习实现 Stable Diffusion 模型与人类偏好的对齐成为可能。

578

Hugging Face 伦理与社会更新 夏季 2023

Hugging Face 详细介绍了其在 2023 年夏季在美国、欧盟和英国影响 AI 监管的努力,同时通过公开倡导和技术研究推进开源伦理。

579

Hugging Face 指南:无代码训练 LLaMA 2 聊天机器人

Hugging Face 使用 Spaces、AutoTrain 和 ChatUI 提供无代码工作流,使非工程师能够微调 LLaMA 2 并将其部署为功能聊天应用。

580

Amazon SageMaker 上的 Llama 2 基准测试

Hugging Face 分析了 Amazon SageMaker 上 Llama 2 的 60 种部署配置,以确定成本、吞吐量和延迟的最佳设置。

581

Hugging Face 专业版推理

Hugging Face 为专业版用户推出了推理服务,提供了针对策划的最先进模型的加速 API 端点,并提高了免费推理 API 的速率限制。

582

Rocket Money x Hugging Face: 在生产环境中扩展易变的 ML 模型

Rocket Money 使用 Hugging Face 的 Inference API 将其交易分类系统扩展到每月超过十亿笔交易,以替换遗留的基于正则表达式的系统。

583

Introduction to 3D Gaussian Splatting

3D 高斯溅射是一种光栅化技术,能够从少量图像中学习并实时渲染出逼真的 3D 场景。

584

Hugging Face 目标检测排行榜

Hugging Face 发布了一个目标检测排行榜,使用 COCO 风格的指标对开源模型进行排名,并发表了一篇博客,解释了如何计算平均精度(Average Precision,AP)和平均召回率(Average Recall,AR),以及哪些因素可能影响结果。

585

在生产环境中优化LLM:精度、注意力和架构

Hugging Face 概述了高效 LLM 部署的关键技术,重点在于降低精度的量化、用于内存效率的 Flash Attention,以及如 RoPE、ALiBi、MQA 和 GQA 等架构优化。

586

使用 PyTorch FSDP 微调 Llama 2 70B

Hugging Face 演示了如何使用 PyTorch Fully Sharded Data Parallelism (FSDP) 和 Accelerate 来微调 Llama 2 70B,以克服 CPU RAM 瓶颈并优化 VRAM 使用。

587

介绍 Würstchen:用于图像生成的快速扩散

Würstchen 是一种快速且高效的文本到图像扩散模型,通过实现 42x 空间压缩来显著降低训练和推理成本。

588

Hugging Face Transformers 量化概览

Hugging Face 原生支持 bitsandbytes 和 auto-gptq 量化方案,以在较小的设备上实现大型模型推理以及高效的适配器微调。

589

SafeCoder vs. 闭源代码助手

Hugging Face 推出 SafeCoder,一个基于开源 StarCoder 模型的企业级代码助手,相较于闭源替代方案,它优先考虑透明度、定制化和数据隐私。

590

使用 T2I-Adapters 进行 SDXL 的高效可控生成

Hugging Face 和 TencentARC 推出 T2I-Adapter-SDXL,这是一个轻量级的即插即用模型,能够使用外部信号(如草图和深度图)对 Stable Diffusion XL(SDXL)的生成进行精确控制,其计算开销相比 ControlNet 显著降低。

591

Falcon 180B 发布说明

TII 发布了 Falcon 180B,这是目前公开可用的最大语言模型,拥有 1800 亿参数,在 3.5 万亿个 token 上训练,以与专有模型如 PaLM-2 竞争。

592

Fetch 案例研究:使用 Amazon SageMaker 和 Hugging Face 将 ML 处理延迟降低 50%

Fetch 通过将其机器学习 (ML) 管道迁移到 Amazon SageMaker 和 Hugging Face,将收据扫描的 ML 处理延迟降低了 50%,并将文档理解模型的准确性提高了 200%。

593

AudioLDM 2 优化指南:使用 Hugging Face Diffusers 减少推理时间

Hugging Face 演示了如何将 AudioLDM 2 的推理时间降低超过 10 倍,通过代码和模型优化将 10 秒音频样本的生成时间降低到不到 1 秒。

594

Hugging Face Hub Git 身份验证更改

Hugging Face 在 2023 年 10 月 1 日弃用了基于密码的 Git 身份验证,要求用户切换到个人访问令牌或 SSH 密钥以提高安全性。

595

Code Llama 发行说明

Code Llama 是一系列基于 Llama 2 的开放访问模型,专门用于代码任务,支持填充以及最多 100,000 token 的长上下文窗口。

596

Hugging Face AutoGPTQ 与 Transformers 集成

Hugging Face 已将 AutoGPTQ 库集成到 Transformers 中,实现了将 LLM 量化为 8、4、3 或 2 位精度,从而在 4 位精度下实现极低精度损失的同时减少内存需求。

597

IDEFICS: 最先进的视觉语言模型的开放复现

Hugging Face 发布了 IDEFICS,这是一个基于 Flamingo 架构的开放访问视觉语言模型,支持 9B 和 80B 参数规模的交错图像和文本输入。

598

Hugging Face SafeCoder 公告

Hugging Face 已推出 SafeCoder,这是一种自托管的企业级代码助手解决方案,使公司能够在其自身安全基础设施内构建和部署专有的 Code LLM。

599

Hugging Face Hub 在 AWS Marketplace

Hugging Face 将其 Hub 与 AWS Marketplace 集成,使组织能够直接通过其 AWS 账户为诸如 Inference Endpoints 和 AutoTrain 之类的托管服务付费。

600

使用 BentoML 部署 DeepFloyd IF

Hugging Face 演示了如何使用 BentoML 部署 DeepFloyd IF 文本到图像模型,使其多阶段像素扩散架构能够在多个 GPU 上独立扩展。