使用开源大语言模型的宪法 AI
Hugging Face 推出了一套端到端的配方和 llm-swarm 工具,以在开源模型上实现宪法 AI(CAI),实现基于用户自定义原则的可扩展自我对齐,无需昂贵的人类反馈。
企业场景排行榜:评估大型语言模型在真实业务场景中的表现
Hugging Face 与 Patronus AI 联合推出了企业场景排行榜,用于在六个真实业务任务上评估语言模型,超越学术基准,衡量实际企业价值。
使用 Optimum Intel 在 Intel Xeon 上加速 StarCoder
Hugging Face 与 Intel 通过结合 8 位量化和辅助生成,在第 4 代 Intel Xeon 处理器上实现了 StarCoder-15B 模型超过 7 倍的推理加速。
Hugging Face 幻觉排行榜发布及初步发现
Hugging Face 推出了幻觉排行榜,以在多个开源数据集上对大型语言模型的事实性和忠实性错误进行基准测试,提供透明的排名,帮助模型选择和研究。
AI 安全 LLM 安全排行榜
Hugging Face 和 Secure Learning Lab 发布了 LLM 安全排行榜,基于 DecodingTrust 框架评估 LLM 在八个关键安全维度上的可信度。
Hugging Face 与 Google Cloud 战略合作伙伴关系
Hugging Face 与 Google Cloud 已达成战略合作伙伴关系,通过将开源模型与 Google Cloud 的 AI 基础设施和硬件相结合,推动机器学习的民主化。
开源 LLM 作为 LangChain 代理
Hugging Face 展示了开源 LLM,特别是 Mixtral-8x7B,已经能够驱动代理工作流,并在通用推理任务中超越 GPT-3.5。
微调 Wav2Vec2-BERT 以用于低资源自动语音识别
Hugging Face 演示了如何微调 Meta 的 Wav2Vec2-BERT 模型,以在低资源语言上进行自动语音识别(ASR),实现了与 Whisper-large-v3 相当的性能,同时显著更快且更高效。
PatchTSMixer 已加入 Hugging Face Transformers – 发布与快速入门指南
PatchTSMixer 是 IBM Research 推出的轻量级 MLP‑Mixer 时间序列模型,现已在 Hugging Face Transformers 中发布,提供最先进的预测能力,同时显著降低内存和运行时间成本。
使用直接偏好优化方法对大型语言模型进行偏好调优 – DPO、IPO 与 KTO 的实证比较
Hugging Face 在两个 7B 对话模型上评估了 DPO、IPO 与 KTO 对齐方法,结果表明只要对 β 超参数进行适当调优,DPO 始终优于其他方法。
使用 ONNX Runtime 和 Olive 加速 SD Turbo 与 SDXL Turbo 推理
Hugging Face 和 Microsoft 通过使用 ONNX Runtime 和 Olive 引入优化,使得相较于 PyTorch,SDXL Turbo 的吞吐量提升最高可达 229%,SD Turbo 可提升 120%。
在 Hugging Face Spaces 上使用 Gradio 运行 ComfyUI 工作流
Hugging Face 提供了一份指南,帮助将复杂的 ComfyUI 工作流转换为 Gradio 应用,实现免费、无服务器的 Hugging Face Spaces ZeroGPU 部署。
Hugging Face 排行榜模板:实现 Vectara HHEM 排行榜
Hugging Face 已发布开源排行榜模板,使开发者能够构建动态的 LLM 评估榜单,正如 Vectara 新推出的 Hughes 幻觉评估模型(HHEM)排行榜所示。
Unsloth 和 Hugging Face TRL 集成以实现更快的 LLM 微调
Unsloth 是一个轻量级库,可将 LLM 微调速度提高最高 2.7 倍,并将内存使用量降低最高 74%,相比 QLoRA 精度无损(0% 下降)。
aMUSEd:高效文本到图像生成
Hugging Face 发布了 aMUSEd,这是一款基于遮罩图像建模(MIM)的高效非扩散文本到图像模型,也是对 Google 的 MUSE 的公开复现。
Hugging Face SDXL Dreambooth LoRA 高级训练指南
Hugging Face 引入了一个用于 SDXL Dreambooth LoRA 的高级训练脚本,结合了 Pivotal Tuning 和 Prodigy 优化器,以提升概念捕获和图像质量。
投机解码实现 Whisper 推理速度提升 2×
Hugging Face 证明,投机解码将 Whisper 转录延迟减半,同时保持输出和准确性完全一致。
2023 年开放大语言模型回顾
Hugging Face 2023 年回顾显示,开源 LLM 发布激增,出现了更小但性能更强的模型,以及新颖的微调技术,极大拓宽了访问渠道和社区参与度。
专家混合(MoE)解释
专家混合(MoE)通过在每个 token 上仅激活部分神经网络专家,使 Transformer 模型能够在扩展参数规模的同时保持高效的预训练和更快的推理。
Mixtral 8x7B 发布说明
Mistral AI 已发布 Mixtral 8x7B,这是一款 Mixture of Experts(MoE)模型,在大多数基准测试中超越 Llama 2 70B 并匹配 GPT-3.5 的性能,同时在 Apache 2.0 许可证下保持商业宽松。
SetFitABSA:少样本方面情感分析
Hugging Face 和 Intel Labs 推出了 SetFitABSA,这是一种无需提示、少样本的方面情感分析框架,在数据稀缺的情况下能够超越更大的生成模型如 Llama 2 和 T5 的表现。
Optimum-NVIDIA 发布说明
Hugging Face 发布了 Optimum-NVIDIA,这是一款通过 FP8 量化和 TensorRT-LLM 在 NVIDIA 平台上将 LLM 推理加速至最高 28 倍的推理库。
Hugging Face LoRA 动态加载加速推理 300% 并降低延迟
Hugging Face 宣布了一套动态 LoRA 加载系统,将热身时间从 25 秒降低至 3 秒,使 LoRA 推理速度提升最高达 300%,并将总响应时间从 35 秒缩短至 13 秒。
Hugging Face 与 AMD 为 LLM 提供 GPU 加速
Hugging Face 与 AMD 已将针对 AMD Instinct GPU 的开箱即用支持集成到 Transformers 库和 Text Generation Inference 中,实现了无需更改代码即可进行高性能 LLM 执行。
Hugging Face Open LLM Leaderboard DROP 基准分析
Hugging Face 在发现有缺陷的归一化和停止令牌配置导致大多数模型得分异常低后,已将 DROP 基准从 Open LLM Leaderboard 中移除。
SDXL 和 Stable Diffusion 使用 Latent Consistency LoRAs 的快速推理
Hugging Face 推出 LCM LoRAs,一种使 SDXL 和 Stable Diffusion 模型能够在 4 到 8 步内生成高质量图像的方法,显著降低推理时间。
Prodigy-HF 集成发布说明
Explosion 已发布 Prodigy-HF,一个插件,使得可以在标注数据上直接微调 Hugging Face Transformer 模型,并能够直接将数据集上传到 Hugging Face Hub。
在 AWS Inferentia2 上使用 optimum-neuron 部署 Llama 2
Hugging Face 已将 optimum-neuron 与 AWS Neuron SDK 集成,以在 AWS Inferentia2 加速器上部署 Llama 2 模型,实现高性能文本生成。
比较 RoBERTa、Llama 2 和 Mistral 在灾难推文分类中的 LoRA 应用
一项比较研究表明,在使用低秩适应(LoRA)进行微调时,较小的 RoBERTa 模型在灾难推文的二分类任务中优于 Llama 2 和 Mistral 7B。
Hugging Face Hub 存储区域
Hugging Face 为 Enterprise Hub 客户引入了存储区域,使组织能够选择其模型和数据集的存储位置,以提高监管合规性和数据传输性能。
个人 Copilot: 训练你自己的编码助手
Hugging Face 展示了如何通过在特定代码库上使用 QLoRA 和全量微调技术微调 StarCoder 来创建个性化编码助手 HugCoder。
Hugging Face 与 Renumics Spotlight 集成以实现可扩展的数据检查
Hugging Face 已与 Renumics Spotlight 集成,以实现机器学习数据集的交互式、一行代码可视化和检查,包括对多模态数据和模型结果的支持。
优化 Stable Diffusion XL (SDXL) 的推理速度与内存占用
Hugging Face 探索了 Stable Diffusion XL (SDXL) 的多种优化技术,展示了如何将内存占用从 28GB 降低到低至 11.47GB,并将推理延迟从 72.2 秒降低到大约 10.3 秒。
使用 Hugging Face Inference Endpoints 部署嵌入模型
Hugging Face 通过 Inference Endpoints 引入 Text Embeddings Inference (TEI),为部署开源嵌入模型以用于 RAG 和语义搜索提供了一种高性能、成本效益高的方式。
The N 实现细节 of RLHF with PPO – Hugging Face 博客摘要
Hugging Face 博客文章复现了 OpenAI 的 2019 年 RLHF 代码库,匹配了其学习曲线,并详细说明了 N 项实现细节,包括一个关键的 PyTorch Adam 优化器差异,导致更新更加激进。
Gradio-Lite: 完全在浏览器中运行的无服务器 Gradio
Hugging Face 推出 Gradio-Lite (@gradio/lite),这是一个使用 Pyodide 在网页浏览器中直接运行 Gradio 应用的 JavaScript 库,消除了对服务器端基础设施的需求。
使用 ONNX Runtime 加速 Hugging Face 模型
Hugging Face 和 ONNX Runtime 使超过 130,000 个模型实现性能加速,包括相比 PyTorch,whisper-tiny 模型的延迟降低高达 74.30%。
Hugging Face Chat Templates
Hugging Face 引入了基于 Jinja 的聊天模板系统,以确保聊天模型接收到的输入格式与其训练时完全一致,从而防止性能隐形下降。
在 Cloud TPU v5e 上使用 JAX 加速 Stable Diffusion XL 推理
Hugging Face Diffusers 现在支持在 Cloud TPU v5e 上使用 JAX 来服务 Stable Diffusion XL (SDXL),相比 TPU v4 提供最高 2.4 倍的每美元性能。
通过 Hugging Face Inference API 部署 AI Comic Factory
Hugging Face 提供了一个使用 Inference API 部署 AI Comic Factory 私有实例的指南,利用 Llama-2 和 SDXL 1.0 模型。
通过 TRL 使用 DDPO 微调 Stable Diffusion
Hugging Face 已将去噪扩散策略优化 (DDPO) 集成到 TRL 库中,使得使用强化学习实现 Stable Diffusion 模型与人类偏好的对齐成为可能。
Hugging Face 伦理与社会更新 夏季 2023
Hugging Face 详细介绍了其在 2023 年夏季在美国、欧盟和英国影响 AI 监管的努力,同时通过公开倡导和技术研究推进开源伦理。
Hugging Face 指南:无代码训练 LLaMA 2 聊天机器人
Hugging Face 使用 Spaces、AutoTrain 和 ChatUI 提供无代码工作流,使非工程师能够微调 LLaMA 2 并将其部署为功能聊天应用。
Amazon SageMaker 上的 Llama 2 基准测试
Hugging Face 分析了 Amazon SageMaker 上 Llama 2 的 60 种部署配置,以确定成本、吞吐量和延迟的最佳设置。
Hugging Face 专业版推理
Hugging Face 为专业版用户推出了推理服务,提供了针对策划的最先进模型的加速 API 端点,并提高了免费推理 API 的速率限制。
Rocket Money x Hugging Face: 在生产环境中扩展易变的 ML 模型
Rocket Money 使用 Hugging Face 的 Inference API 将其交易分类系统扩展到每月超过十亿笔交易,以替换遗留的基于正则表达式的系统。
Introduction to 3D Gaussian Splatting
3D 高斯溅射是一种光栅化技术,能够从少量图像中学习并实时渲染出逼真的 3D 场景。
Hugging Face 目标检测排行榜
Hugging Face 发布了一个目标检测排行榜,使用 COCO 风格的指标对开源模型进行排名,并发表了一篇博客,解释了如何计算平均精度(Average Precision,AP)和平均召回率(Average Recall,AR),以及哪些因素可能影响结果。
在生产环境中优化LLM:精度、注意力和架构
Hugging Face 概述了高效 LLM 部署的关键技术,重点在于降低精度的量化、用于内存效率的 Flash Attention,以及如 RoPE、ALiBi、MQA 和 GQA 等架构优化。
使用 PyTorch FSDP 微调 Llama 2 70B
Hugging Face 演示了如何使用 PyTorch Fully Sharded Data Parallelism (FSDP) 和 Accelerate 来微调 Llama 2 70B,以克服 CPU RAM 瓶颈并优化 VRAM 使用。