通过结构化生成提升提示一致性
Hugging Face 与 Dottxt 的研究表明,使用结构化生成来约束 LLM 输出可以降低性能差异,并提升在不同提示格式和示例顺序下的排名一致性。
StarCoder2-15B-Instruct-v0.1 发布说明 / 新功能
Hugging Face 推出 StarCoder2-15B-Instruct-v0.1,这是首个使用完全透明且宽松的流水线进行全自我对齐的代码大语言模型,在 HumanEval 上超越了 CodeLlama-70B-Instruct。
Hugging Face 开放链式思考排行榜
Hugging Face 推出了开放链式思考排行榜,用于衡量链式思考提示在各种大型语言模型上对复杂推理任务所带来的特定准确率提升。
全能型(JAT)多用途变压器代理
Hugging Face 推出全能型(JAT),一种基于单一 Transformer 的代理,能够在 Atari、BabyAI、Meta-World 和 MuJoCo 环境中执行多样的序列决策任务。
开放医学-LLM 排行榜:在医疗领域对大型语言模型进行基准评估
Hugging Face 推出了开放医学-LLM 排行榜,一个标准化平台,用于在多样化医学数据集上评估和比较 LLM 的性能,以提升可靠性和患者安全。
Meta Llama 3 发布说明
Meta 发布了 Llama 3,这是一款开放获取的 LLM 系列,提供 8B 和 70B 参数模型,具备改进的分词器,并在 15 万亿 token 上进行训练。
Ryght 案例研究:使用 Hugging Face 构建生命科学生成式 AI 平台
Ryght 已推出 Ryght Preview,这是一款面向医疗保健和生命科学的企业级生成式 AI 平台,利用 Hugging Face 的专家支持、TGI 和 TEI,提供安全、灵活且高性能的 AI 副驾驶。
在 Hugging Face 端点上运行隐私保护推理
Hugging Face 与 Zama 已实现通过 Hugging Face 端点部署全同态加密(FHE)模型,使用户能够在加密数据上进行机器学习推理,而无需解密。
LiveCodeBench 排行榜:无污染的代码 LLM 评估
Hugging Face 推出了 LiveCodeBench 排行榜,这是一项由加州大学伯克利分校、麻省理工学院和康奈尔大学的研究人员开发的新基准,用于评估 LLM 的代码生成和推理能力,并通过时间窗口问题集防止基准污染。
Gradio 重载模式加速 AI 应用开发
Gradio 的重载模式使开发者能够在不重启服务器的情况下即时将源代码更改应用到 AI 应用中,显著降低开发延迟。
Idefics2 8B 视觉语言模型发布 – 架构、数据与性能
Hugging Face 发布了 Idefics2,这是一款 8B 开源视觉语言模型,在 VQA 和 OCR 基准测试中优于其他 8B 模型,并可通过 🤗 Transformers 进行微调。
视觉语言模型概述
Hugging Face 提供了一份关于视觉语言模型(VLM)的综合指南,详细阐述了它们的架构、开源选项、评估基准,以及通过 TRL 库进行微调的全新实验性支持。
Hugging Face 与 Google Cloud Vertex AI 模型花园集成
Hugging Face 推出了 “Deploy on Google Cloud”,使用户能够通过 Hugging Face Hub 或 Vertex Model Garden 将数千个开源基础模型部署到 Vertex AI 或 Google Kubernetes Engine(GKE)。
CodeGemma 发布说明 / 新功能
Google 已发布 CodeGemma,这是一系列基于 Gemma 的开放获取代码专用大语言模型(LLM),在额外的 5000 亿代码、数学和英文数据令牌上进行训练。
Hugging Face 公共政策项目概览及提交材料
Hugging Face 宣布了一项全面的公共政策项目,为美国、欧盟和英国的政策制定者提供详细的立场文件、证词和评论信,体现了其跨职能的负责任开放承诺以及塑造 AI 监管的努力。
Hugging Face 与 Wiz 研究合作伙伴关系,致力于 AI 安全
Hugging Face 与 Wiz 合作,整合先进的漏洞管理和云安全姿态管理,以保护其平台及更广泛的 AI/ML 生态系统。
使用 Hugging Face 数据集查看器 API 和 DuckDB-NSQL-7B 的 Text2SQL
Hugging Face 演示了如何使用 DuckDB-NSQL-7B 模型和 Dataset Viewer API,将自然语言问题转换为 SQL 查询,从而分析超过 120,000 个开放数据集。
使用 🤗 Optimum Intel 在 Xeon 上加速 SetFit 推理
Hugging Face 演示了如何通过 🤗 Optimum Intel 库的后训练静态量化,在 Intel Xeon CPU 上实现 SetFit 模型最高 7.8 倍的推理吞吐量提升。
Hugging Face 与 Cloudflare Workers AI 集成
Hugging Face 将 Cloudflare Workers AI 集成,以为流行的开源模型提供无服务器 GPU 推理,使开发者能够以按请求付费的定价模式部署 AI 应用。
Pollen-Vision:机器人零样本视觉模型的统一接口
Hugging Face 与 Pollen Robotics 团队发布了 pollen-vision,这是一款开源库,整合了零样本视觉模型,使机器人能够在三维空间中检测并定位未知物体。
Hugging Face Transformers:开源机器学习入门指南
Hugging Face 提供了一份全面的入门指南,帮助使用 Transformers 库和 Hub 部署并运行开源机器学习模型,例如微软的 Phi-2。
嵌入量化:二进制与标量技术,实现更快、更便宜的检索
Hugging Face 宣布了二进制和 int8 嵌入量化,将内存削减 32 倍或 4 倍,并将检索速度提升至最高 45 倍,同时保持原始性能的 96%–99%。
Hugging Face 与 Lighthouz AI 推出 Chatbot Guardrails Arena
Hugging Face 与 Lighthouz AI 已推出 Chatbot Guardrails Arena,这是一款社区驱动的压力测试平台,旨在评估 LLM 及其防护栏的数据隐私和安全性。
GaLore:在消费级硬件上推进大模型训练
GaLore 通过低秩梯度投影,将优化器状态的内存需求降低超过 82.5%,从而在消费级 GPU 上实现十亿参数模型的训练。
Cosmopedia:大规模合成数据用于LLM预训练
Hugging Face 推出 Cosmopedia,这是用于 LLM 预训练的最大公开合成数据集,包含 3000 万个文件和 2500 亿个 token,由 Mixtral-8x7B-Instruct-v0.1 生成。
Phi-2 在 Intel Meteor Lake 上:本地 LLM 推理
Hugging Face 演示了如何使用 OpenVINO 和 Optimum Intel 通过 4 位量化在 Intel Meteor Lake(Core Ultra)处理器上本地运行 Microsoft Phi-2 模型。
Quanto:Optimum 的 PyTorch 量化后端
Hugging Face 推出 Quanto,这是一款多功能且设备无关的 PyTorch 量化后端,适用于 Optimum,旨在简化跨任何模态的低精度模型部署。
Hugging Face 在 DGX 云上训练
Hugging Face 推出了 Train on DGX Cloud,这是一项面向 Enterprise Hub 组织的无代码服务,可使用 NVIDIA H100 和 L40S GPU 对开源模型进行微调。
WebSight 数据集与 Sightseer 模型
Hugging Face 推出了 WebSight,这是一套包含 200 万截图到 HTML 配对的合成数据集,以及 Sightseer,这是一种能够将网页截图转换为功能性 HTML 代码的视觉语言模型。
使用 Optimum Intel 与 fastRAG 的 CPU 优化嵌入
Hugging Face 和 Intel 推出了一种在 Xeon CPU 上使用 Optimum Intel 和 fastRAG 加速嵌入模型的方法,通过 int8 量化实现最高 4.5 倍的延迟降低和 4 倍的吞吐量提升。
ConTextual:文本丰富场景中的多模态推理基准
Hugging Face 与 UCLA 的研究人员推出了 ConTextual,这是一套数据集和排行榜,旨在评估大型多模态模型(LMM)在复杂、文本丰富的图像中如何对文本和视觉线索进行联合推理。
Hugging Face 与 Argilla 实现社区协同数据集构建
Hugging Face 与 Argilla 引入了一套简化的工作流,利用 Hugging Face Spaces 和 Argilla 让社区能够协同构建高质量的开源数据集。
Intel Gaudi 2 AI 加速器上的文本生成管道
Hugging Face 推出了一款针对 Intel Gaudi 2 AI 加速器的定制文本生成管道,通过 Optimum Habana 实现了 Llama 2 模型(7b、13b 和 70b)的简化部署。
StarCoder2 与 The Stack v2 发布
BigCode 已发布 StarCoder2,这是一系列透明训练的开源代码大语言模型,参数规模分别为 3B、7B 和 15B,基于全新的大规模 Stack v2 数据集。
Hugging Face TTS Arena:文本转语音模型基准测试
Hugging Face 推出了 TTS Arena,这是一款众包的并排比较工具和排行榜,使用 Elo 评分系统客观衡量文本转语音模型的质量。
AI 水印 101:工具与技术
Hugging Face 提供了关于 AI 水印技术在图像、文本和音频方面的全面概述,以对抗深度伪造并确保内容来源。
Matryoshka 嵌入模型简介
Matryoshka 嵌入模型支持可变尺寸的嵌入,可在不显著降低性能的情况下进行截断,从而在存储、速度和准确性之间实现灵活的权衡。
在 Hugging Face 上微调 Gemma 模型
Hugging Face 提供了一份指南,介绍如何使用参数高效微调(PEFT)和低秩适配(LoRA)在 GPU 和 Cloud TPU 上定制 Google 的 Gemma 模型。
Hugging Face 和 Haize Labs 推出红队抗性排行榜
Hugging Face 和 Haize Labs 已推出红队抗性(RTR)基准,用于评估 LLM 在特定安全违规类别下对高质量、类人对抗提示的鲁棒性。
Google Gemma 开源大语言模型发布
Google 已发布 Gemma,这是一系列基于 Gemini 的开放获取大型语言模型,提供 2B 和 7B 参数规模的基础版和指令微调版。
开放 Ko-LLM 排行榜
Hugging Face 和 Upstage 推出了 Open Ko-LLM 排行榜,旨在通过使用私有测试集防止数据污染,为韩语大语言模型提供公平、透明的评估生态系统。
Hugging Face PEFT 新 LoRA 合并方法
Hugging Face 为 PEFT 库引入了多种新的合并方法,使用户能够在同一基础模型上即时组合多个 LoRA 适配器,以合成新的能力。
使用开源 LLM 的合成数据降低定制模型的成本、延迟和碳排放
Hugging Face 展示了使用开源 LLM 生成合成数据并微调小型 RoBERTa 模型,可将推理成本从 $3061 降至 $2.7,延迟从数秒降至 0.13 s,CO₂ 排放从约 1 t 降至 0.12 kg,同时在金融情感分类上匹配 GPT‑4 的准确率。
AMD 普适 AI 开发者大赛
AMD 与 Hugging Face 合作推出了普适 AI 开发者大赛,为开发者提供免费使用 AMD 硬件的机会以及现金奖励,以在生成式 AI、机器人 AI 和 PC AI 领域构建 AI 应用。
Hugging Face TGI 消息 API 发布
Hugging Face 在 1.4.0 版本开始推出了用于文本生成推理(TGI)的消息 API,实现了对开放式大语言模型的 OpenAI 聊天完成 API 兼容性。
SegMoE:Segmind 扩散专家混合模型
SegMoE 是一个框架,通过在 Stable Diffusion 架构中用稀疏 MoE 层替换前馈层,以创建混合专家(MoE)扩散模型,从而提升对提示词的理解。
NPHardEval 排行榜:通过计算复杂度评估大语言模型推理能力
Hugging Face 推出了 NPHardEval 排行榜,这是一项使用计算复杂度类别来定量衡量大语言模型逻辑推理能力的动态基准。
PatchTST 在 Hugging Face 中的集成
Hugging Face 已集成 PatchTST,这是一种基于 Transformer 的模型,利用时间序列分块和通道独立性来提升长期预测并实现迁移学习。
Hugging Face 文本生成推理(Text Generation Inference)现已支持 AWS Inferentia2
Hugging Face 宣布通过 Amazon SageMaker 在 AWS Inferentia2 上正式推出文本生成推理(Text Generation Inference),实现成本效益高、吞吐量大的大语言模型(LLM)服务,成为 GPU 部署的替代方案。
使用开源大语言模型的宪法 AI
Hugging Face 推出了一套端到端的配方和 llm-swarm 工具,以在开源模型上实现宪法 AI(CAI),实现基于用户自定义原则的可扩展自我对齐,无需昂贵的人类反馈。