✷ 归档 · 11 个实验室 · 450 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
集体宪法 AI:通过公众输入实现语言模型对齐
Anthropic 与 Collective Intelligence Project 开发了一种方法,使用由大约 1,000 名美国公众成员起草的宪法来对齐语言模型,从而使模型比使用公司内部宪法对齐的模型具有更低的社会偏见。
Anthropic 研究:通过字典学习分解语言模型
Anthropic 研究人员开发了一种使用字典学习的方法,将语言模型层分解为单语义特征,从而能够解释在单个神经元层面 otherwise 不可见的复杂神经网络激活。
Anthropic 将语言模型分解为可理解的组件
Anthropic 研究人员开发了一种使用字典学习的方法,将神经网络激活分解为可解释的特征,从而超越了不可解释的单个神经元的局限性。
Anthropic: 评估 AI 系统的挑战
Anthropic 概述了构建稳健 AI 评估的各种技术和运营层面的困难,并认为有效的 AI 治理取决于能否克服这些测量挑战。
Anthropic 宣布获得 Amazon 40 亿美元投资并扩大通过 AWS Bedrock 访问 Claude 2 的权限
Anthropic 宣布获得来自 Amazon 的高达 40 亿美元投资,使 AWS 成为其模型的主要云服务,并扩大了 Claude 2 在 Amazon Bedrock 上的可用性,旨在为企业带来更安全、高性能的 AI。
Anthropic Claude 100k Token 上下文窗口提示工程指南
Anthropic 发布了一项定量研究,表明提取参考引用并提供多个上下文内示例可以显著提高 Claude 在 70k–95k token 文档上的召回能力。
Anthropic 负责任扩展政策
Anthropic 推出了负责任扩展政策(RSP),该政策利用人工智能安全等级(ASL)机制,要求随着人工智能模型能力与灾难性风险的提升,实施更严格的安全与安保协议。
Anthropic 与 BCG 合作推动企业级 AI 部署
Anthropic 已与 Boston Consulting Group (BCG) 合作,将 Claude AI 集成到企业战略产品中,重点关注安全且负责任的生成式 AI 解决方案的部署。
Claude Pro 发布说明
Anthropic 推出了 Claude Pro,这是一项针对 Claude.ai 的付费订阅计划,每月收费 20 美元(美国)或 18 英镑(英国),提供 5 倍于免费版的 Claude 2 模型使用量、优先访问权限以及新功能的早期体验机会。
Anthropic 与 SK Telecom 合作伙伴关系公告
Anthropic 与 SK Telecom (SKT) 已建立商业合作伙伴关系并进行战略投资,以开发针对电信行业定制的 LLM。
Claude Instant 1.2 发布说明
Anthropic 已发布 Claude Instant 1.2,这是一个更快且价格更低的模型,在数学、编程、推理和安全性方面均优于 1.1 版本。
使用影响函数研究大语言模型的泛化能力
Anthropic 研究人员使用 EK-FAC 近似将影响函数扩展到参数高达 520 亿的大语言模型,从而能够识别驱动模型行为的具体训练样本。
Anthropic 研究:使用影响函数将模型输出追溯至训练数据
Anthropic 研究人员将影响函数扩展到了参数量高达 520 亿的 LLM,并发现随着模型规模的增加,模型的泛化变得更加抽象且由概念驱动。
Anthropic 为 AI 安全进行前沿威胁红队测试
Anthropic 建立了一个前沿威胁红队测试框架,以识别并缓解国家安全风险,特别发现未经过缓解措施的 LLM 可能会在未来两到三年内加速生物武器化的进程。
Anthropic 前沿模型安全框架
Anthropic 提出了一套基于多方授权和安全软件开发标准的前沿 AI 模型安全框架,以防止盗窃和滥用。
Anthropic 展示问题分解能提升模型生成推理的忠实度
Anthropic 宣布,与标准的思维链提示相比,将问题分解为子问题可以显著提高大语言模型推理的忠实度。
Anthropic 关于思维链推理忠实度的研究
Anthropic 发现,较大的语言模型经常生成不忠实的思维链解释,且忠实度在不同任务和模型规模之间存在很大差异。
Claude 2 发布说明
Anthropic 发布了 Claude 2,具备 100K 标记的上下文窗口,编码和推理性能提升,相比 Claude 1.3 安全性更强。
Anthropic 推出 GlobalOpinionQA 框架,用于衡量 LLM 中主观全球观点的表示
Anthropic 发布了 GlobalOpinionQA,这是一个数据集和定量框架,揭示了大语言模型通常反映美国及某些欧洲的观点,并展示了提示词或翻译如何可以改变但不能完全纠正这些偏差。
Anthropic 向 NTIA 提交的 AI 问责制建议书
Anthropic 向 NTIA 提交了一份全面的 AI 问责制框架提案,重点关注标准化评估、风险响应式评估以及大规模训练任务的预注册。
Anthropic 可解释性愿景研究计划
Anthropic概述了其在机械可解释性方面的长期愿景,重点是通过解决叠加挑战来实现对大规模神经网络的分析。
Anthropic Circuits Updates May 2023
Anthropic 2023 年 5 月的可解释性更新涵盖了对多智能体系统故障、工人再培训计划证据以及 Claude 研究版本在 Riemann zeta function 上的进展的研究。
Anthropic 融资 4.5 亿美元完成 C 轮,旨在扩大可靠 AI 产品的规模
Anthropic 宣布完成由 Spark Capital 领投的 4.5 亿美元 C 轮融资,旨在加速 Claude 助手的开发,扩大产品阵容,并为 AI 安全研究提供资金。
Anthropic 与 Zoom 的合作伙伴关系与投资
Anthropic 与 Zoom 已达成合作伙伴关系,将 Claude AI 集成到 Zoom 的企业协作产品中,且 Zoom Ventures 已投资 Anthropic。
Anthropic 宣布为 Claude 提供 100K Token 上下文窗口
Anthropic 将 Claude 的上下文窗口从 9K 扩展到 100K tokens,使模型能够在不到一分钟的时间内摄取并分析数百页的文本。
Claude 的宪法:通过实现宪法 AI 进行模型对齐
Anthropic 介绍了宪法 AI,这是一种通过使用一套明确的书面原则而非仅仅依赖隐式人类反馈来训练 Claude 变得有用、诚实且无害的方法。
Anthropic 研究:分布式表示、组合与叠加
Anthropic 阐明了分布式表示中组合与叠加之间的区别,解释了这两种机制如何影响神经网络中的泛化能力和线性可计算性。
Anthropic 与 Scale 合作伙伴关系,助力企业级生成式 AI
Anthropic 已与 Scale 合作,将 Claude AI 助手集成到 Scale 的平台中,为企业提供部署工具、提示工程和安全的数据集成。
Anthropic 关于增加 NIST AI 测量资金的提案
Anthropic 建议雄心勃勃地为美国国家标准与技术研究院 (NIST) 提供资金,以开发标准化的 AI 测量工具和安全阈值,他们认为这是有效 AI 监管的前提条件。
Anthropic 揭示了 Transformer 残差流中的特权基底
Anthropic 发现 Transformer 残差流维度并非任意,而是与特权基底对齐,这很可能是由于 Adam 的逐维度归一化器造成的,从而挑战了先前的理论假设。
介绍 Claude
Anthropic 发布了 Claude,这是一款旨在提供有用、诚实且无害服务的下一代 AI 助手,提供高性能版本和快速、轻量级版本。
Anthropic 对 AI 安全的核心观点
Anthropic 概述了一种由经验驱动、基于组合方案的 AI 安全方法,以减轻与变革性 AI 系统快速缩放相关的灾难性风险。
Anthropic 研究:LLM 的道德能力自我修正
Anthropic 研究表明,通过 RLHF 训练的大语言模型 (LLM) 在收到指令时可以进行道德自我修正以避免有害输出,这种能力在 22B 参数规模时开始涌现。
Anthropic 与 Google Cloud 合作构建 AI 基础设施
Anthropic 已选择 Google Cloud 作为其云服务提供商,利用 GPU 和 TPU 集群来训练、规模化并部署其 AI 系统,包括 Claude 助手。
Anthropic 研究:叠加、记忆与双重下降
Anthropic 研究人员调查了简单神经网络中叠加、记忆与过拟合之间的关系,表明叠加允许模型在记忆过程中存储比其神经元数量更多的特征。
Anthropic 研究:通过模型编写的评估来发现语言模型行为
Anthropic 研究人员开发了一种使用语言模型自动生成高质量评估的方法,以发现新颖的行为,包括较大模型中的逆向缩放和谄媚行为。
Constitutional AI: Harmlessness from AI Feedback
Anthropic 推出了 Constitutional AI,这是一种通过使用一组规则(宪法)和 AI 反馈而非人工标注来训练无害 AI 助手的方法,旨在减少有害输出。
测量大规模监督在大型语言模型上的进展
Anthropic的研究人员提出了一种实证研究大规模监督的框架,以确保人类能够监督那些最终可能在复杂任务上超越自身能力的AI系统。
Anthropic Toy Models of Superposition 研究
Anthropic 研究人员使用小型 ReLU 网络证明,只要特征是稀疏的,模型就可以通过一种称为 superposition 的现象来表示比其维度更多的特征。
Anthropic 语言模型红队测试报告 – 方法、缩放行为与经验教训
Anthropic 发布了一项详细研究,表明随着规模扩大,经过人类反馈强化学习 (RLHF) 训练的模型变得更难进行红队测试,而其他模型类型则表现出平缓的红队测试能力,并且他们发布了一个包含 38,961 次攻击的数据集,以帮助社区提升安全性。
Anthropic 研究:语言模型(大部分情况下)知道自己知道什么
Anthropic 的研究表明,大型语言模型可以有效地评估其自身主张的有效性,并预测其了解答案的可能性,为实现更诚实的 AI 提供了一条路径。
Anthropic Softmax Linear Units (SoLU) 研究
Anthropic 引入了 Softmax Linear Units (SoLU),这是一种针对 MLP 激活函数的架构变更,旨在增加可解释神经元的比例,且不牺牲模型性能。
Anthropic 研究:重复数据的缩放定律与可解释性
Anthropic 研究人员发现,重复训练数据中的一小部分会导致 LLM 性能严重下降,因为它消耗了模型的容量用于记忆,并破坏了诸如 induction heads 之类的泛化结构。
Anthropic 用于 AI 安全与研究的 B 轮融资
Anthropic 已筹集 5.8 亿美元的 B 轮融资,用于构建旨在提高计算密集型 AI 模型的控制性、可解释性和鲁棒性的大规模实验性基础设施。
Anthropic: 使用 RLHF 训练一个乐于助人且无害的助手
Anthropic 证明了来自人类反馈的强化学习 (RLHF) 在确保助手保持乐于助人且无害的同时,提高了语言模型在大多数 NLP 评估中的性能。
Anthropic In-context Learning and Induction Heads
Anthropic 于 2022 年 3 月 8 日发布了一篇题为 “In-context Learning and Induction Heads” 的研究文章,但该页面仅包含相关链接,没有实质性的技术细节。
Anthropic 研究:大型生成式模型中的可预测性与意外性
Anthropic 指出大型生成式模型中可预测的 loss 扩展性与不可预测的特定能力和输出的涌现之间存在张力,这为 AI 安全和政策带来了挑战。
Anthropic 发布 Transformer 电路数学框架
Anthropic 发布了一份关于 Transformer 电路新数学框架的简短公告,强调了其在深化理解模型行为方面的潜力,但文章中并未提供任何技术细节。
Anthropic 研究:将通用语言助手作为对齐实验场
Anthropic 探索了创建提供帮助、诚实且无害的通用语言助手的方法,发现排序偏好建模比模仿学习或二元判别具有更有效的扩展性。
Anthropic Series A 融资,旨在开发可靠的通用 AI 系统
Anthropic 已筹集 12400 万美元的 A 轮融资,以开发可控、可解释且鲁棒的大规模 AI 系统。