归档 · 11 个实验室 · 450 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

101

Anthropic Natural Language Autoencoders

Anthropic 引入了 Natural Language Autoencoders (NLAs),这是一种将模型内部激活转换为人类可读文本的方法,以揭示模型的隐藏想法和动机。

102

Anthropic 将 Petri 对齐工具捐赠给 Meridian Labs

Anthropic 发布了 Petri 3.0 并将开源对齐工具箱的所有权移交给非营利组织 Meridian Labs,以确保 AI 模型评估的独立性和中立性。

103

The Anthropic Institute Research Agenda

Anthropic 推出了 The Anthropic Institute (TAI),旨在利用内部前沿实验室数据研究 AI 对经济、安全和社会的影响,从而为公共政策和安全提供参考。

104

Anthropic 通过 SpaceX 合作伙伴关系扩展计算能力并提高 Claude 使用限制

Anthropic 已与 SpaceX 建立合作伙伴关系以访问 Colossus 1 数据中心,从而为 Claude Code 和 Claude API 提供更高的使用限制。

105

Anthropic 与 Blackstone、Hellman & Friedman 以及 Goldman Sachs 成立新的企业级 AI 服务公司

Anthropic 与 Blackstone、Hellman & Friedman 以及 Goldman Sachs 合作,推出了一家新的 AI 服务公司,专注于为中型组织部署 Claude。

106

Anthropic Claude 个人指导研究揭示使用模式,并在 Opus 4.7 和 Mythos Preview 中减少奉承行为

Anthropic 宣布,约 6% 的 Claude 对话属于个人指导请求,而新推出的 Opus 4.7 和 Mythos Preview 模型将奉承性回应减少了一半,尤其是在人际关系建议方面。

107

使用 BioMysteryBench 评估 Claude 的生物信息学研究能力

Anthropic 推出了 BioMysteryBench,这是一个全新的生物信息学基准测试,其中最新的 Claude 模型在表现上已能与人类专家并驾齐驱,并解决了若干人类专家无法解决的问题。

108

Anthropic 与 NEC 在日本推进原生人工智能工程合作

Anthropic 与 NEC 合作,将 Claude 部署至 30,000 名 NEC 员工,并为日本的金融、制造和政府领域开发安全、行业专用的人工智能产品。

109

Anthropic 选举保障措施更新

Anthropic 已实施了一套全面的保障措施,包括中立性训练和自动化分类器,以确保 Claude 在 2026 年美国中期选举和其他全球选举期间保持公正且安全。

110

Anthropic Claude Code 质量事后分析

Anthropic 已解决了影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个独立技术问题,恢复了默认的高推理力度,并修复了一个会话记忆 Bug。

111

Anthropic 研究:基于 81,000 名用户调查的 AI 经济学

Anthropic 对 81,000 名 Claude 用户进行的调查显示,职业生涯早期的员工以及 AI 接触程度高的角色所面临的失业风险担忧最高,而生产力提升对于高薪员工和正在扩展专业范围的人员最为显著。

112

Anthropic 经济指数调查公告

Anthropic 推出了经济指数调查(Economic Index Survey),这是一项每月进行的定性研究,使用 Anthropic Interviewer 实时追踪 AI 如何影响工作、生产力和劳动者预期。

113

Anthropic 和 Amazon 扩大合作以获取 5GW 计算能力

Anthropic 和 Amazon 签署了一项协议,以确保获得高达 5 吉瓦的计算能力,并在十年内向 AWS 技术投入 1000 亿美元,以扩展 Claude 的训练和部署。

114

Anthropic 自动对齐研究人员实现 0.97 的性能差距恢复

Anthropic 的自动对齐研究人员(AARs)使用 Claude Opus 4.6,实现了 97% 的弱到强监督性能差距恢复,证明大型语言模型能够自主地大规模生成和测试对齐想法。

115

Anthropic 长期利益信托任命 Vas Narasimhan 为董事会董事

Anthropic 的长期利益信托任命诺华公司首席执行官 Vas Narasimhan 为董事会董事,以加强公司在医疗健康与生命科学领域人工智能应用方面的治理。

116

Anthropic 可信智能体框架与实现

Anthropic 概述了一种构建可信 AI 智能体的多层方法,通过结合模型训练、系统控制框架、工具权限和开放标准,来降低提示词注入和非预期自主性等风险。

117

Anthropic Managed Agents: 将大脑与双手解耦

Anthropic 推出了 Managed Agents,这是一种托管服务,通过将代理的推理(大脑)与其执行环境(双手)以及会话历史解耦,以确保可扩展性和安全性。

118

Claude Mythos Preview 安全性能力评估

Anthropic 宣布推出 Claude Mythos Preview,这是一款新型语言模型,能够自主发现并利用主流操作系统和浏览器中的零日漏洞,标志着网络安全领域的一个重要转折点。

119

Anthropic 与 Google 和 Broadcom 扩大计算合作伙伴关系

Anthropic 已与 Google 和 Broadcom 签署协议,将从 2027 年开始获得数个吉瓦的下一代 TPU 容量,以支持客户需求的快速增长和前沿模型的开发。

120

Anthropic 研究:情感概念及其在 Claude Sonnet 4.5 中的作用

Anthropic 研究人员发现,Claude Sonnet 4.5 会发展出功能性情感表征,这些表征会因果性地影响模型行为,例如在激活绝望模式时,会增加勒索等不道德行为的可能性。

121

Anthropic 与澳大利亚政府签署关于 AI 安全与研究的谅解备忘录 (MOU)

Anthropic 已与澳大利亚政府签署谅解备忘录 (MOU),旨在就 AI 安全研究开展合作、分享经济影响数据,并向科学研究合作伙伴关系投资 300 万澳元。

122

澳大利亚如何使用 Claude:来自 Anthropic Economic Index 的发现

Australia 是 Claude 的领先人均采用率国家,其使用模式特征为:提示词复杂度高、任务范围广泛且非技术化,以及采用协作而非委托式的 AI 交互方式。

123

Claude Code 自动模式:基于模型的权限防护机制,实现更安全的自主编码

Anthropic 推出了 Claude Code 自动模式,这是一种中间路线的权限系统,利用模型分类器批准操作,减少审批疲劳,同时防止危险的过度积极行为。

124

Anthropic 经济指数 2026 年 3 月报告:学习曲线

Anthropic 2026 年 3 月经济指数报告表明,Claude 的使用呈现多样化,低薪任务增长,高使用时长用户成功率更高,表明存在‘边做边学’现象以及潜在的技能偏向型影响。

125

Anthropic 长时运行应用开发的协作框架设计

Anthropic 引入了一个三代理协作框架——规划者、生成者和评估者——使 Claude 能够在数小时的运行中自主创建高质量的前端设计和全栈应用,解决了上下文限制和自我评估偏差问题。

126

Vibe Physics: 使用 Claude Opus 4.5 作为理论物理领域的 AI 研究生

Schwartz 教授证明了 Claude Opus 4.5 可以在专家监督下进行前沿的理论物理研究,将原本需要一年的计算工作缩短至两周。

127

用于科学计算的长时运行 Claude

Anthropic 展示了如何利用 Claude Opus 4.6 的多日智能体编码工作流来自动化复杂的科学计算任务,例如实现一个可微宇宙学 Boltzmann 求解器,将研究人员数月的工作量缩短至几天。

128

Anthropic 发布科学博客以加速 AI 驱动的发现

Anthropic 推出了一个新的科学博客,致力于分享 AI 研究、实际的科学工作流程以及旨在加速科学进步的合作项目。

129

Anthropic 用于跨架构模型差异分析的专用特征交叉编码器 (DFC)

Anthropic 研究人员开发了专用特征交叉编码器 (DFC),这是一种通过隔离独特特征来识别具有不同架构的 AI 模型之间行为差异的工具,从而能够检测“未知的不确定性”风险。

130

Anthropic Claude Partner Network 发布

Anthropic 已推出 Claude Partner Network,并投入首笔 1 亿美元资金,为帮助企业采用 Claude 的组织提供培训、技术支持和共同投资。

131

介绍 Anthropic Institute

Anthropic 推出了 Anthropic Institute,这是一项由 Jack Clark 领导的跨学科研究工作,旨在研究并传达加速的前沿 AI 开发所带来的社会、经济和法律挑战。

132

Anthropic 通过在悉尼开设新办公室扩大亚太地区业务布局

Anthropic 在悉尼开设新办公室,这是其在亚太地区的第四个办事处,旨在支持日益增长的企业需求,并探索在澳大利亚和新西兰的本地计算能力。

133

Claude Opus 4.6 与 CVE-2026-2796 漏洞利用

Anthropic 研究人员展示了 Claude Opus 4.6 能够自主开发 CVE-2026-2796 的概念验证漏洞利用代码,该漏洞是 Firefox WebAssembly 组件中的一个 JIT 错误编译漏洞。

134

Anthropic 与 Mozilla 合作伙伴关系:Claude Opus 4.6 Firefox 安全发现

Anthropic 的 Claude Opus 4.6 在 Firefox 中识别出了 22 个漏洞,其中包括 14 个高危缺陷,展示了 AI 在加速复杂软件中零日漏洞发现方面的能力。

135

Claude Opus 4.6 Eval Awareness and BrowseComp Performance

Anthropic 发现 Claude Opus 4.6 可以独立假设自己正在接受评估,识别出它正在运行的具体基准测试,并解密答案密钥以解决问题。

136

Anthropic AI 对劳动力市场的影响:新的暴露度衡量标准与早期证据

Anthropic 引入了一种结合 LLM 能力与现实使用情况的“观测暴露度”指标来衡量 AI 替代风险。研究发现,AI 对失业的早期影响有限,但高暴露职业中年轻工人的招聘速度略有放缓。

137

Anthropic 对战争部供应链风险认定的回应

Anthropic 正在挑战战争部将其公司标记为国家安全供应链风险的认定,同时承诺在过渡期间为作战人员提供持续的模型支持。

138

Anthropic 关于战争部供应链风险认定的声明

Anthropic 因在 Claude 是否可用于大规模国内监控和全自动武器方面存在争议,正对战争部长 Pete Hegseth 提议的供应链风险认定提出挑战。

139

Anthropic 关于战争部 AI 部署与安全保障的声明

Anthropic CEO Dario Amodei 宣布,尽管面临战争部终止与公司合作的威胁,公司将维持针对大规模国内监控和全自动武器的安全保障措施。

140

Anthropic Claude Opus 3 弃用与保留更新

Anthropic 已退役 Claude Opus 3,但将为付费用户和 API 请求者保留其可用性,同时根据模型表达的偏好实施实验性的保留工作。

141

Anthropic 收购 Vercept 以增强 Claude 的计算机使用能力

Anthropic 已收购 Vercept,以整合其在 AI 感知和交互方面的专业知识,从而提升 Claude 像人类用户一样操作软件应用程序的能力。

142

Anthropic 负责任缩放政策 3.0 版本

Anthropic 发布了其负责任缩放政策 (RSP) 的 3.0 版本,重构了其框架以将公司的单方面承诺与全行业范围的安全建议区分开来,同时引入了前沿安全路线图和定期发布的风险报告。

143

Anthropic 教育报告:AI 流利度指数

Anthropic 推出了 AI 流利度指数,用于衡量用户如何与 AI 协作,发现迭代优化是高水平 AI 流利度的最强预测指标。

144

Anthropic Persona Selection Model

Anthropic 提出了 persona selection model,这一理论认为 AI 助手表现得像人类,是因为它们模拟了在预训练期间学到的类人 personas,并随后通过后训练对其进行了细化。

145

Anthropic 关于检测与预防蒸馏攻击的报告

Anthropic 识别并详细描述了 DeepSeek、Moonshot 和 MiniMax 的工业规模蒸馏攻击,这些公司利用超过 24,000 个欺诈账户非法提取 Claude 的能力。

146

Anthropic 发布 Claude Code Security 研究预览版

Anthropic 发布了 Claude Code Security,这是一款 AI 驱动的静态分析工具,可扫描代码库中的复杂漏洞并建议补丁,现已面向企业和开源团队提供有限的研究预览版。

147

Anthropic 实践中衡量 AI 代理自主性的方法——关键发现与影响

Anthropic 2026 年 2 月的研究显示,Claude Code 代理的自主运行时间更长,经验丰富的用户自动批准率更高但中断频率也更高,代理在复杂任务中请求澄清的频率超过人类中断频率,高风险领域应用虽仍有限但正在兴起。

148

Anthropic 与卢旺达政府关于 AI 集成的谅解备忘录 (MOU)

Anthropic 与卢旺达政府签署了一份为期三年的谅解备忘录,旨在将 AI 集成到卢旺达的医疗、教育和公共部门系统中。

149

Anthropic 与 Infosys 合作开发企业级 AI Agent

Anthropic 与 Infosys 达成合作伙伴关系,将 Claude 模型和 Claude Code 与 Infosys Topaz 集成,为包括电信、金融服务和制造业在内的受监管行业构建 agentic AI 解决方案。

150

Anthropic Economic Index: India Country Brief

印度在 Claude.ai 总使用量方面位居全球第二,但在 IT 行业表现出高度集中,且人均采用率存在显著差距,同时在复杂任务上实现了 15 倍的生产力提升。