归档 · 11 个实验室 · 3,062 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

2851

OpenAI 通过人类反馈对书籍进行总结 (2021)

OpenAI 提出了一种技术,该技术将人类反馈的强化学习与递归任务分解相结合,以生成整本书的摘要,从而解决了在难以评估的任务上监督人工智能的对齐挑战。

2852

Hugging Face Optimum 发布

Hugging Face 推出了 Optimum,这是一个开源工具包,旨在针对各种硬件平台优化 Transformer 模型的生产性能。

2853

Hugging Face 与 Graphcore 合作推出针对 IPU 优化的 Transformers

Hugging Face 与 Graphcore 达成合作伙伴关系,通过 Hardware Partner Program 和 Optimum 库将 Intelligence Processing Units (IPUs) 集成到 Hugging Face 生态系统中,以加速 Transformer 模型的部署。

2854

TruthfulQA: 衡量模型如何模仿人类的谬误

OpenAI 推出了 TruthfulQA,这是一个旨在衡量语言模型是否在 38 个类别中模仿常见的人类误解和谬误的基准测试。

2855

Helen Toner 加入 OpenAI 董事会

OpenAI 于 2021 年 9 月 8 日任命 AI 政策与全球战略专家 Helen Toner 为其董事会成员,以加强其对安全且负责任的 AI 部署的承诺。

2856

OpenAI Codex: 用于代码生成的 GPT-3 后裔

OpenAI Codex 是 GPT-3 的后裔,它在自然语言和数十亿行公开源代码上进行了训练,能够根据英语指令生成可运行的代码。

2857

OpenAI Triton 1.0 发布

OpenAI 发布了 Triton 1.0,这是一种开源的类 Python 语言和编译器,允许研究人员在无需深厚 CUDA 知识的情况下编写高效的 GPU 内核。

2858

Hugging Face DeDLOC: 通过互联网进行语言模型的协作训练

Hugging Face 推出了 DeDLOC,这是一种分布式训练方法,通过适应不同的网络和硬件约束,使志愿者能够协作式地在互联网上预训练大型语言模型。

2859

spaCy 与 Hugging Face Hub 集成

Hugging Face 已将 spaCy 集成到 Hugging Face Hub,使用户能够通过统一平台共享、发现和部署 spaCy 流水线。

2860

使用 Amazon SageMaker 轻松部署 Hugging Face 模型

Hugging Face 与 Amazon SageMaker 推出了新的推理深度学习容器(DLC)和推理工具包,以简化 Transformer 模型部署到生产就绪的端点。

2861

评估在代码上训练的大语言模型:OpenAI Codex

OpenAI 推出了 Codex,这是一个在 GitHub 代码上进行微调的 GPT 模型,它在单次尝试中解决了 28.8% 的 HumanEval 问题,通过重复采样,成功率可达 70.2%。

2862

Sentence Transformers 集成至 Hugging Face Hub

Hugging Face 已将 Sentence Transformers 集成到 Hub 中,为 100 多种语言提供了 90 多个预训练模型,并提供了用于特征提取和句子相似度的新交互式小部件。

2863

OpenAI 研究:通过精选数据集微调改进语言模型行为

OpenAI 研究人员发现,通过在少于 100 个样本的精选小规模数据集上进行微调,可以显著提高模型对特定行为价值观的遵循程度,且不会损害下游任务的性能。

2864

使用 GPT-Neo 和 Hugging Face Accelerated Inference API 进行少样本学习

Hugging Face 探讨了使用开源 GPT-Neo 模型和 Accelerated Inference API 应用少样本学习,以实现在无需大量标注数据的情况下实现任务泛化。

2865

Anthropic Series A 融资,旨在开发可靠的通用 AI 系统

Anthropic 已筹集 12400 万美元的 A 轮融资,以开发可控、可解释且鲁棒的大规模 AI 系统。

2866

使用 & 混合 Hugging Face 模型与 Gradio 2.0

Gradio 2.0 使机器学习开发者能够以单行代码加载和部署 Hugging Face 模型为 GUI,支持并行和串行模型组合。

2867

OpenAI 学者计划 2021:最终项目

OpenAI 公布了 2021 年学者计划的最终项目,展示了来自多元化研究者群体的规模定律、奖励建模和强化学习等方向的研究。

2868

Will Hurd 加入 OpenAI 董事会

OpenAI 任命前美国国会议员 Will Hurd 加入其董事会,以将公共政策专业知识与技术 AI 开发相结合。

2869

在 CPU 上扩展 BERT 推理 (第 1 部分)

Hugging Face 探索了现代 CPU 上 BERT 推理的硬件级优化,证明了通过使用基于 NUMA 感知亲和性的多个独立模型实例并将其绑定到特定物理核心,可以实现吞吐量的线性扩展。

2870

Hugging Face Accelerate 库发布

Hugging Face 发布了 Accelerate,这是一个 PyTorch 库,允许用户在任何设备配置(包括多 GPU 和 TPU)上运行原始训练脚本,而无需重写样板代码。

2871

通过 Hugging Face 和 Amazon SageMaker 进行 BART 和 T5 的摘要生成分布式训练

Hugging Face 和 Amazon SageMaker 已经集成,以提供优化的深度学习容器和专用的 HuggingFace 估计器,从而简化 BART 和 T5 等 Transformers 模型的分布式训练。

2872

理解 BigBird 的块稀疏注意力机制

BigBird 引入了块稀疏注意力机制,将 Transformer 的计算复杂度从二次方降低到线性,从而能够处理长达 4096 个 token 的序列。

2873

GPT-3 API 生态系统与应用增长

OpenAI 报告称,超过 300 个应用和数万名开发者正在使用 GPT-3 在各行各业每天生成平均 45 亿个单词。

2874

Amazon SageMaker 与 Hugging Face 的合作伙伴关系

Hugging Face 与 Amazon 建立了合作伙伴关系,通过专门的深度学习容器 (DLCs) 和 Python SDK 扩展将 Hugging Face Transformers 集成到 Amazon SageMaker 中,以加速 NLP 模型的训练和部署。

2875

在 Google Cloud Run 上部署 Hugging Face Transformers 情感分析流水线

一位社区成员演示了如何使用 DistilBERT 模型在 Google Cloud Run 上提供 Hugging Face 情感分析流水线服务,实现了低于 5 秒的延迟并保持了极低的每月成本。

2876

用 Hugging Face Transformers 微调 Wav2Vec2 以进行英语 ASR

Hugging Face 提供了一份详细的指南,介绍如何使用 Connectionist Temporal Classification(CTC)损失来微调 Wav2Vec2 预训练语音模型,以实现英语自动语音识别(ASR)。

2877

Hugging Face 阅读:长程 Transformer

Hugging Face 分析了四种关键架构——Longformer、Compressive Transformer、Linformer 和 Performer——旨在将标准 Transformer 自注意力的二次方内存和时间复杂度降低为线性复杂度。

2878

CLIP 中的多模态神经元

OpenAI 在 CLIP 中发现了神经元,无论概念是以字面、符号还是概念形式呈现,这些神经元都会对同一概念做出响应,这反映了人类大脑中的多模态神经元。

2879

Hugging Face: 构建神经网络的简单注意事项

Hugging Face 提供了一个构建和调试神经网络的框架,通过优先考虑数据分析、简单的基准测试和严谨的实现检查,而不是盲目的超参数调优。

2880

使用 Hugging Face Transformers 和 Ray 进行检索增强生成

Hugging Face 已将 Ray 集成到检索增强生成 (RAG) 模型的文档检索机制中,实现了检索调用 2 倍的加速,并提高了分布式微调的可扩展性。

2881

Hugging Face PyTorch / XLA TPU 集成

Hugging Face 已将 PyTorch / XLA 集成,以使用现有的 Hugging Face Trainer 接口使 PyTorch 用户能够在 Cloud TPU 上训练和扩展 transformer 模型。

2882

理解大语言模型的能力、局限性及其社会影响

OpenAI 总结了一场多学科研讨会,探讨了与 GPT-3 及其他大语言模型相关的技术边界和社会风险。

2883

Hugging Face Transformers v4.2.0 TensorFlow 性能与推理服务更新

Hugging Face Transformers v4.2.0 为 TensorFlow 模型引入了显著的计算性能提升,并通过使用 SavedModel 格式通过 TensorFlow Serving 简化了部署流程。

2884

OpenAI 将 Kubernetes 扩展至 7,500 个节点

OpenAI 将单个 Kubernetes 集群扩展至 7,500 个节点,为机器学习研究提供了一个简单且可扩展的基础设施,并克服了网络、API server 负载和监控方面的挑战。

2885

Hugging Face Transformers 通过 DeepSpeed 和 FairScale 实现 ZeRO 集成

Hugging Face Transformers v4.2.0 引入了对 DeepSpeed 和 FairScale 的 ZeRO 优化的实验性支持,使得能够以更高的批次大小训练更大的模型,并降低 GPU 显存需求。

2886

Hugging Face 加速推理 API 优化

Hugging Face 通过结合高层库优化、基于 Rust 的分词以及硬件特定编译,在其加速推理 API 中实现了 transformer 推理 100 倍的加速。

2887

CLIP: 连接文本与图像

OpenAI 推出了 CLIP,这是一种通过自然语言监督来学习视觉概念的神经网络,从而能够在各种不同数据集上实现 zero-shot 图像分类。

2888

DALL·E: 从文本创建图像

OpenAI 推出了 DALL·E,这是一个拥有 120 亿参数的 transformer 模型,通过将图像和文本视为单一的 token 流,能够从文本描述中生成多样化的图像。

2889

OpenAI 组织架构更新 2020年12月

OpenAI 宣布了研究副总裁 Dario Amodei 的离职,并任命 Mira Murati 为研究、产品和合作伙伴高级副总裁,以更好地整合安全与产品开发。

2890

利用预训练语言模型检查点构建编码器-解码器模型 – Hugging Face 博客摘要

Hugging Face 的这篇博客文章解释了如何使用预训练的 BERT、RoBERTa 或 GPT2 检查点来热启动编码器-解码器模型,表明这种方法可以在降低训练成本的同时,达到大型预训练 seq2seq 模型的性能水平。

2891

将 fairseq WMT19 翻译系统移植到 🤗 Transformers

Hugging Face 将 fairseq WMT19 翻译模型(en‑ru, ru‑en, de‑en, en‑de)移植到 🤗 Transformers 库,使用户能够使用标准的 Transformers API 加载并运行这些高质量的翻译模型。

2892

Hugging Face Transformers 与 Ray Tune 集成

Hugging Face Transformers 3.1 引入了与 Ray Tune 的集成,使用户能够轻松实现诸如基于种群的训练 (Population-Based Training) 和贝叶斯优化 (Bayesian Optimization) 等先进的超参数调优算法。

2893

基于 Transformer 的 Encoder-Decoder 模型 Hugging Face 博客文章 2020

Hugging Face 2020 年的博客文章解释了基于 Transformer 的 encoder-decoder 架构,详细介绍了它如何通过 encoder 和 decoder stack、self-attention、cross-attention 和自回归生成将输入序列映射为变长输出,并展示了如何结合 🤗Transformers 库使用它。

2894

OpenAI 将 GPT-3 技术授权给 Microsoft

OpenAI 已将其 GPT-3 语言模型技术授权给 Microsoft,以便集成到 Microsoft 的产品和服务中,同时为第三方开发者保留了独立的 API 访问权限。

2895

Hugging Face pytorch_block_sparse 发布

Hugging Face 发布了 pytorch_block_sparse,这是一个提供 BlockSparseLinear 模块的库,通过减少内存消耗并提高相对于标准 PyTorch 稀疏矩阵的计算效率,从而创建更小、更快的语言模型。

2896

生成式语言建模用于自动定理证明

OpenAI 推出 GPT-f,这是一种基于 Transformer 的语言模型,专为 Metamath 形式化语言设计,成功向主 Metamath 库贡献了新证明。

2897

从人类反馈中学习摘要生成

OpenAI 表明,基于人类反馈的强化学习(RLHF)使得较小的语言模型在文本摘要任务中能够显著优于仅通过监督学习训练的更大模型。

2898

OpenAI 学者计划 2020 最终项目

OpenAI 公布了 2020 学者计划的最终项目,展示了在神经网络可解释性、强化学习、语义解析和医学 AI 方面的研究成果。

2899

Reformer: 使用内存高效的 Transformers 推动语言建模的极限

Reformer 模型由 Hugging Face 在 2020 年 7 月提出,通过结合 LSH 自注意力、局部自注意力、分块前馈层、可逆残差和轴向位置编码,使得在少于 8 GB RAM 的情况下能够训练长度达五十万标记的序列。

2900

OpenAI Procgen and MineRL 竞赛

OpenAI 正在共同组织两项 NeurIPS 2020 竞赛,使用 Procgen Benchmark 和 MineRL 来推进强化学习的样本效率和泛化能力。