✷ 归档 · 11 个实验室 · 869 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
Hugging Face 教育计划 2022 启动
Hugging Face 于 2022 年 4 月宣布了一项多轨教育计划,目标是在 2023 年底前向 500 万人教授机器学习,为学习者、教师以及更广泛的公众提供免费资源。
Hugging Face Hub 碳排放追踪
Hugging Face 引入了工具,以跟踪、报告和基于 CO2 排放量过滤机器学习模型,从而提升 AI 领域的环境透明度。
Lewis Tunstall 访谈 – Hugging Face 机器学习专家
Hugging Face 宣布了对机器学习工程师 Lewis Tunstall 的详细访谈,重点介绍了他在 Transformers 库上的工作、新出版的《NLP with Transformers》一书以及不断扩展的 Hugging Face 课程。
Habana Labs 与 Hugging Face 的变压器模型训练合作伙伴关系
Habana Labs 与 Hugging Face 已将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 库集成,以加速在 Habana Gaudi 处理器上进行变压器模型的训练。
Hugging Face Transformers 设计哲学
Hugging Face 为 Transformers 库采用了“一模型文件”政策,刻意摒弃 DRY(不要重复自己)原则,以优先保证可读性、社区贡献以及静态机器学习模型的稳定性。
Decision Transformer 在 Hugging Face Transformers 中的集成
Hugging Face 已将 Decision Transformer——一种将强化学习视为条件序列建模问题的离线强化学习方法——集成到 transformers 库和 Hugging Face Hub 中。
机器学习专家:访谈 Margaret Mitchell
Dr. Margaret Mitchell 讨论了伦理 AI 的关键作用、用于提高透明度的 Model Cards 的开发,以及机器学习开发中多样性和包容性的必要性。
Hugging Face AI Research Residency Program Announcement
Hugging Face 推出了为期 9 个月的 AI Research Residency Program,旨在帮助有志向的研究人员与 Hugging Face Science Team 合作,开发机器学习技术并发布开源工作。
使用自定义数据集微调 SegFormer 进行语义分割
Hugging Face 提供了一份技术指南,介绍如何使用 Transformers 库微调 SegFormer 模型,以便为自动驾驶人行道导航等自定义用例执行像素级图像分类。
使用 Hugging Face 数据集进行图像搜索
Hugging Face 展示了如何通过结合 datasets 库、CLIP 嵌入和 FAISS 来构建图像搜索应用,以实现高效的相似性搜索。
使用 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 推理
Hugging Face 提供了一份关于如何使用 AWS Inferentia 和 Neuron SDK 来加速 BERT 推理的指南,在 Amazon SageMaker 上实现了 5-6ms 的延迟。
在 Hugging Face Transformers 中使用约束束搜索引导文本生成
Hugging Face 将约束束搜索引入了 Transformers 库,允许用户在保持语言连贯性的同时,将特定的词汇或短语强制加入到生成的文本中。
BERT 101: 理解Transformer的双向编码器表示
BERT是由Google AI Language开发的基于Transformer的双向模型,通过在巨大数据集上进行无监督预训练,在11+项常见NLP任务上实现了最先进的性能。
使用 Hugging Face Transformers 微调视觉 Transformer (ViT) 进行图像分类
Hugging Face 提供了一个使用 datasets 和 transformers 库微调 Vision Transformer (ViT) 模型进行图像分类的指南,并以 beans 数据集为例演示了该过程。
使用 Python 开始进行情感分析
Hugging Face 提供了一份关于如何使用 Python 实现情感分析的全面指南,利用了来自 Hugging Face Hub 的预训练模型、用于微调的 Trainer API 以及无代码工具 AutoNLP。
使用 Transformers 中的 Wav2Vec2 对大文件进行自动语音识别
Hugging Face 通过利用 Wav2Vec2 的 Connectionist Temporal Classification (CTC) 架构来实现一种步长技术,从而在任意长度的音频文件和实时推理中实现高质量的 ASR。
Hugging Face Hub Search API 更新
Hugging Face 为 `huggingface_hub` 库引入了新的程序化搜索功能,包括 `ModelSearchArguments` 和 `ModelFilter`,以简化用户在不离开 IDE 的情况下查找模型和数据集的方式。
Stable-Baselines3 与 Hugging Face Hub 的集成
Hugging Face 已集成 Stable-Baselines3,允许用户直接从 Hugging Face Hub 托管、共享和加载 PyTorch 深度强化学习模型。
Hugging Face Infinity CPU 性能案例研究
Hugging Face Infinity 在 Intel Ice Lake Xeon CPU 上实现的吞吐量比 vanilla Transformers 高出多达 800%,并具有毫秒级延迟,从而实现了在 CPU 基础设施上进行具有成本效益的实时 Transformer 部署。
在 Hugging Face Transformers 中使用 n-grams 增强 Wav2Vec2
Hugging Face 已将 pyctcdecode 库集成到 Transformers 库中,使 Wav2Vec2 模型能够通过 n-gram 语言模型进行增强,从而显著减少拼写错误和词错率 (WER)。
使用 Hugging Face Transformers 在 Amazon SageMaker 上部署 GPT-J 6B
Hugging Face 提供了一种在 Amazon SageMaker 上部署 EleutherAI 的 GPT-J 6B 模型的方法,通过使用 torch.save 将模型加载时间从超过三分钟降低到不到八秒。
使用 AutoNLP 和 Prodigy 进行主动学习
Hugging Face 展示了如何通过结合 AutoNLP 自动化训练框架与 Prodigy 标注工具,为命名实体识别 (NER) 构建主动学习流水线。
Hugging Face 收购 Gradio
Hugging Face 已收购 Gradio,旨在将其易于构建的机器学习演示和 GUI 集成到其生态系统中,从而扩大非技术用户对机器学习的可访问性。
Perceiver IO: 一种适用于任何模态的可扩展、全注意力模型
Perceiver IO 是一种基于 Transformer 的架构,通过使用潜空间将计算量与输入大小解耦,使其能够处理文本、图像、音频、视频和点云,而不会产生二次方扩展问题。
从零开始训练 CodeParrot
Hugging Face 推出了 CodeParrot,这是一个基于 GPT-2 的模型,从零开始在清理后的 2000 万 Python 文件数据集上进行训练,以实现 Python 代码自动补全。
Hugging Face 雪球大战 ML-Agents 环境
Hugging Face 已发布 Snowball Fight 1vs1,这是其首个基于 Unity ML-Agents 构建的自定义深度强化学习环境,并托管在 Hugging Face Spaces 上。
Hugging Face Optimum 用于 Graphcore IPU 集成
Hugging Face 已将 Optimum 库与 Graphcore Intelligence Processing Units (IPUs) 集成,以加速 Transformer 模型,并从优化的 BERT 实现开始。
Hugging Face Data Measurements Tool
Hugging Face 发布了 Data Measurements Tool,这是一个开源的 Python 库和无代码界面,旨在帮助开发者分析、策划和比较机器学习数据集,以实现更负责任的 AI 开发。
使用 Intel 技术加速 PyTorch 分布式微调
Hugging Face 展示了如何通过在 Intel Xeon 可扩展 CPU 服务器集群上使用 Intel Extension for PyTorch 和 oneCCL 分布式微调作业来加速 PyTorch 训练。
为低资源自动语音识别微调 XLS-R
Hugging Face 提供了一份关于如何使用 Transformers 库微调跨语言语音表示模型 XLS-R,以实现低资源自动语音识别 (ASR) 的技术指南。
在现代 CPU 上扩展类 BERT 模型推理 - 第 2 部分
Hugging Face 探索了 Intel Ice Lake Xeon CPU 上类 BERT 模型的软件级优化,展示了内存分配器、并行化库和贝叶斯优化如何能显著降低推理延迟。
Hugging Face 课程第二部分及社区活动发布
Hugging Face 于 2021 年 11 月 15 日宣布发布 Hugging Face 课程的第二部分,并举办了一场包含技术演讲和动手实践项目的社区活动。
大语言模型:一个新的摩尔定律?
Hugging Face 批评了模型规模呈指数级增长的趋势(例如拥有 530B 参数的 Megatron-Turing NLG),并提倡使用蒸馏和微调等务实、高效的替代方案。
Hugging Face 使用 10 亿训练对开发的句子嵌入模型
Hugging Face 通过使用 JAX/Flax 和 TPU 基础设施,在多达 10 亿个句子对上进行训练,开发出了最先进的通用句子嵌入模型。
Hugging Face: 机器学习即代码时代
Hugging Face 主张通过采用 MLOps、利用通用型 Transformer 架构,并优先考虑生产部署而非沙盒实验,将机器学习视为一门软件工程学科。
为遥感和卫星图像微调 CLIP
研究人员利用 RSICD 数据集和其他卫星图像对 OpenAI 的 CLIP 模型进行了微调,从而显著提高了遥感应用中的文本到图像检索性能。
Hugging Face Spaces 与 Gradio 集成
Hugging Face 已将 Gradio 集成到 Spaces 中,允许用户使用 Inference API 或自定义模型检查点轻松地托管和展示机器学习模型演示。
使用 Streamlit 在 Hugging Face Spaces 上托管模型和数据集
Hugging Face Spaces 通过与 Streamlit 集成,允许用户快速构建并托管机器学习模型和数据可视化的交互式演示。
Hugging Face Summer 2021 Update
Hugging Face 宣布了一系列 Hub 增强功能,包括用于 ML 演示托管的 Spaces Beta、TensorBoard 集成以及用于硬件加速的 Optimum 库的发布。
Hugging Face Optimum 发布
Hugging Face 推出了 Optimum,这是一个开源工具包,旨在针对各种硬件平台优化 Transformer 模型的生产性能。
Hugging Face 与 Graphcore 合作推出针对 IPU 优化的 Transformers
Hugging Face 与 Graphcore 达成合作伙伴关系,通过 Hardware Partner Program 和 Optimum 库将 Intelligence Processing Units (IPUs) 集成到 Hugging Face 生态系统中,以加速 Transformer 模型的部署。
Hugging Face DeDLOC: 通过互联网进行语言模型的协作训练
Hugging Face 推出了 DeDLOC,这是一种分布式训练方法,通过适应不同的网络和硬件约束,使志愿者能够协作式地在互联网上预训练大型语言模型。
spaCy 与 Hugging Face Hub 集成
Hugging Face 已将 spaCy 集成到 Hugging Face Hub,使用户能够通过统一平台共享、发现和部署 spaCy 流水线。
使用 Amazon SageMaker 轻松部署 Hugging Face 模型
Hugging Face 与 Amazon SageMaker 推出了新的推理深度学习容器(DLC)和推理工具包,以简化 Transformer 模型部署到生产就绪的端点。
Sentence Transformers 集成至 Hugging Face Hub
Hugging Face 已将 Sentence Transformers 集成到 Hub 中,为 100 多种语言提供了 90 多个预训练模型,并提供了用于特征提取和句子相似度的新交互式小部件。
使用 GPT-Neo 和 Hugging Face Accelerated Inference API 进行少样本学习
Hugging Face 探讨了使用开源 GPT-Neo 模型和 Accelerated Inference API 应用少样本学习,以实现在无需大量标注数据的情况下实现任务泛化。
使用 & 混合 Hugging Face 模型与 Gradio 2.0
Gradio 2.0 使机器学习开发者能够以单行代码加载和部署 Hugging Face 模型为 GUI,支持并行和串行模型组合。
在 CPU 上扩展 BERT 推理 (第 1 部分)
Hugging Face 探索了现代 CPU 上 BERT 推理的硬件级优化,证明了通过使用基于 NUMA 感知亲和性的多个独立模型实例并将其绑定到特定物理核心,可以实现吞吐量的线性扩展。
Hugging Face Accelerate 库发布
Hugging Face 发布了 Accelerate,这是一个 PyTorch 库,允许用户在任何设备配置(包括多 GPU 和 TPU)上运行原始训练脚本,而无需重写样板代码。
通过 Hugging Face 和 Amazon SageMaker 进行 BART 和 T5 的摘要生成分布式训练
Hugging Face 和 Amazon SageMaker 已经集成,以提供优化的深度学习容器和专用的 HuggingFace 估计器,从而简化 BART 和 T5 等 Transformers 模型的分布式训练。