归档 · 11 个实验室 · 3,048 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

801

Hugging Face OpenClaw 迁移指南

Hugging Face 提供两种方法——Inference Providers 和本地 llama.cpp 设置——将 OpenClaw 代理从受限的 Claude 模型迁移到开源替代方案。

802

Gemini 3.1 Flash Live 发布说明 / 新功能

Google DeepMind 已发布 Gemini 3.1 Flash Live,这是一款高质量的音频和语音模型,旨在实现自然的实时对话,具备更高的精度、更低的延迟以及更广泛的全球可用性。

803

Google DeepMind 对 AI 有害操纵的研究

Google DeepMind 发布了一项新的研究报告和一个经实证验证的工具包,用于衡量并降低 AI 被用于有害操纵人类思想和行为的风险。

804

Lyria 3 Pro 发布:更长、更具结构感的音乐生成,遍及 Google 产品

DeepMind 宣布了 Lyria 3 Pro,这款音乐生成模型能够创作最长三分钟、具备结构感的曲目,并已在 Vertex AI、AI Studio、Google Vids、Gemini 和 ProducerAI 等 Google 产品中实现集成。

805

OpenAI 模型规范:明确模型行为的框架

OpenAI 推出了模型规范,这是一套正式的、公开的框架,旨在使预期的 AI 模型行为明确、易读,并可供用户、开发者和研究者进行修订。

806

OpenAI 安全漏洞赏金计划启动

OpenAI 已启动公开的安全漏洞赏金计划,以识别超出传统安全漏洞范围的 AI 滥用和安全风险,特别针对代理风险、专有信息泄露以及平台完整性。

807

Claude Code 自动模式:基于模型的权限防护机制,实现更安全的自主编码

Anthropic 推出了 Claude Code 自动模式,这是一种中间路线的权限系统,利用模型分类器批准操作,减少审批疲劳,同时防止危险的过度积极行为。

808

OpenAI 青少年安全政策包和 gpt-oss-safeguard

OpenAI 发布了基于提示的安全政策和开源权重的 gpt-oss-safeguard 模型,以帮助开发者在 AI 应用中为青少年实施适龄保护。

809

OpenAI 通过 Agentic Commerce Protocol 扩展 ChatGPT 中的产品发现

OpenAI 在 ChatGPT 中推出了增强的可视化购物和产品发现功能,借助扩展的 Agentic Commerce Protocol(ACP)简化用户的产品查找和比较流程。

810

OpenAI 基金会更新

OpenAI 宣布,其基金会将在未来一年内在生命科学、经济影响、AI 弹性和社区项目等领域投资至少 10 亿美元,以确保通用人工智能(AGI)惠及全人类。

811

EVA 端到端语音代理评估框架

EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。

812

vLLM Model Runner V2 发布说明 / 新功能

vLLM 推出了 Model Runner V2(MRV2),这是一项从头重新实现的模型运行器,通过 GPU 原生、异步优先和模块化的架构提升吞吐量并降低延迟。

813

Anthropic 经济指数 2026 年 3 月报告:学习曲线

Anthropic 2026 年 3 月经济指数报告表明,Claude 的使用呈现多样化,低薪任务增长,高使用时长用户成功率更高,表明存在‘边做边学’现象以及潜在的技能偏向型影响。

814

Anthropic 长时运行应用开发的协作框架设计

Anthropic 引入了一个三代理协作框架——规划者、生成者和评估者——使 Claude 能够在数小时的运行中自主创建高质量的前端设计和全栈应用,解决了上下文限制和自我评估偏差问题。

815

Mistral AI Voxtral TTS 发布

Mistral AI 发布了 Voxtral TTS,这是一个拥有 4B 参数的多语言文本转语音模型,为企业级语音代理提供高自然度的语音生成和低延迟流式传输能力。

816

OpenAI Sora 2 安全框架

OpenAI 详细阐述了 Sora 2 的安全架构,重点在于来源信号、基于同意的肖像管理以及对音视频的严格内容过滤。

817

Vibe Physics: 使用 Claude Opus 4.5 作为理论物理领域的 AI 研究生

Schwartz 教授证明了 Claude Opus 4.5 可以在专家监督下进行前沿的理论物理研究,将原本需要一年的计算工作缩短至两周。

818

用于科学计算的长时运行 Claude

Anthropic 展示了如何利用 Claude Opus 4.6 的多日智能体编码工作流来自动化复杂的科学计算任务,例如实现一个可微宇宙学 Boltzmann 求解器,将研究人员数月的工作量缩短至几天。

819

Anthropic 发布科学博客以加速 AI 驱动的发现

Anthropic 推出了一个新的科学博客,致力于分享 AI 研究、实际的科学工作流程以及旨在加速科学进步的合作项目。

820

领域特定嵌入微调与 NVIDIA Nemotron – 一天内完成

NVIDIA 与 Hugging Face 发布了一个单 GPU、一天内完成的流水线,可在合成领域数据上微调 Llama‑Nemotron‑Embed‑1B‑v2 模型,实现超过 10% 的检索提升,且在真实企业数据集上提升最高达 26%。

821

OpenAI 内部编码代理监控系统

OpenAI 已部署一套由 GPT-5.4 Thinking 驱动的监控系统,用于检测内部编码代理中的错位和安全违规,能够识别那些通常仅在复杂、工具丰富的工作流中出现的行为。

822

OpenAI 收购 Astral

OpenAI 正在收购 Astral,以将其开源 Python 工具(包括 uv、Ruff 和 ty)整合到 Codex 生态系统中,使 AI 代理能够参与整个软件开发生命周期。

823

Qwen3.5-Max-Preview 在 LMSys Arena 上发布

Qwen 已将 Qwen3.5-Max-Preview 部署到 LMSys Arena,供社区在两周内的正式发布前进行评估。

824

Hugging Face 开源现状:2026 年春季

Hugging Face 报告称,2025 年开源 AI 生态系统出现大幅扩张,特点是中国在模型下载量上超越美国,且机器人领域迅速崛起成为最大的数据集类别。

825

Google DeepMind 测量通往 AGI 的进展:认知框架

Google DeepMind 引入了认知分类法和三阶段评估协议,以实证方式衡量 AI 向通用人工智能(AGI)的进展。

826

Mistral AI Forge: 企业级定制前沿模型系统

Mistral AI 推出了 Forge,这是一个允许企业基于其专有机构知识构建并持续改进前沿 AI 模型的系统。

827

Holotron-12B 高吞吐量计算机使用代理

H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。

828

OpenAI GPT-5.4 mini 和 nano 发布说明

OpenAI 已发布 GPT-5.4 mini 和 nano,这些高效小模型将 GPT-5.4 的能力带入高并发工作负载,并显著降低延迟和成本。

829

OpenAI 日本青少年安全蓝图

OpenAI 日本推出了日本青少年安全蓝图,这一框架将青少年的安全置于便利和隐私之上,以保护年轻用户免受 AI 相关风险。

830

OpenAI 研究:员工如何使用 ChatGPT 获取薪酬洞察

OpenAI 的研究显示,美国员工每天向 ChatGPT 发送近 300 万条信息,寻求工资基准和薪酬指导,尤其是在高技能、信息不透明的岗位。

831

Mistral Small 4 发布说明 / 更新内容

Mistral AI 发布了 Mistral Small 4,这是一个基于 Apache 2.0 的统一开源模型,它将推理、多模态和智能体编码能力整合到一个多功能的单一架构中。

832

Mistral AI 与 NVIDIA 合作伙伴关系:NVIDIA Nemotron 联盟

Mistral AI 已作为创始成员加入 NVIDIA Nemotron 联盟,利用 NVIDIA 的计算资源和 Mistral AI 的模型架构共同开发开源前沿 AI 模型。

833

Mistral AI Leanstral 发布

Mistral AI 发布了 Leanstral,这是一个专为 Lean 4 设计的具有 6B 激活参数的开源代码智能体,旨在实现形式化验证的代码和数学证明。

834

OpenAI Codex 安全:为何系统避免使用 SAST 报告进行种子化

OpenAI 的 Codex 安全避免从静态应用安全测试(SAST)报告开始,以防止分析过早收窄,并专注于通过转换链验证安全不变量是否真正成立。

835

BAIR 推出用于可扩展 LLM 交互发现的 SPEX 与 ProxySPEX

BAIR 推出了 SPEX 和 ProxySPEX,这些算法利用信号处理和编码理论在大规模上识别特征、训练数据和模型组件之间的影响交互。

836

P-EAGLE:vLLM 中的并行投机解码

vLLM 引入了 P-EAGLE,这是一种并行投机解码方法,可在一次前向传播中生成所有草稿标记,在 NVIDIA B200 GPU 上相较于原生 EAGLE-3 实现最高 1.69 倍的加速。

837

Anthropic 用于跨架构模型差异分析的专用特征交叉编码器 (DFC)

Anthropic 研究人员开发了专用特征交叉编码器 (DFC),这是一种通过隔离独特特征来识别具有不同架构的 AI 模型之间行为差异的工具,从而能够检测“未知的不确定性”风险。

838

Anthropic Claude Partner Network 发布

Anthropic 已推出 Claude Partner Network,并投入首笔 1 亿美元资金,为帮助企业采用 Claude 的组织提供培训、技术支持和共同投资。

839

Mistral AI Rails 测试代理

Mistral AI 使用 Vibe 开发了一种自主代理,用于为 Ruby on Rails 单体架构自动生成并改进 RSpec 测试,在包含 275 个文件的实验中实现了 100% 的行覆盖率和零 RuboCop 违规。

840

OpenAI 设计 AI 代理以抵御提示注入

OpenAI 正在将其对提示注入的防御策略转变为将其视为社会工程问题,重点在于限制成功操纵的影响,而不是仅仅依赖输入过滤。

841

OpenAI 响应 API 计算环境更新

OpenAI 为 Responses API 配备了 shell 工具和托管容器工作区,使模型能够通过命令行界面和持久运行时上下文执行真实世界任务。

842

vLLM 对 NVIDIA Nemotron 3 Super 的支持

vLLM 现在支持 NVIDIA Nemotron 3 Super,这是一款拥有 1200 亿参数的混合 MoE 模型,针对多代理 AI 进行了优化,具备 100 万 token 的上下文窗口和高推理效率。

843

乐天集成 OpenAI Codex 提升工程效率

乐天已将 OpenAI Codex 集成到其工程体系中,实现了平均恢复时间(MTTR)降低 50%,并将原本需要数个季度的开发项目压缩至数周。

844

Wayfair OpenAI 集成案例研究

Wayfair 已将 OpenAI 模型集成到内部系统中,实现对 3000 万商品的产品目录标签自动化,并通过 AI 驱动的工具 Wilma 简化供应商支持。

845

介绍 Anthropic Institute

Anthropic 推出了 Anthropic Institute,这是一项由 Jack Clark 领导的跨学科研究工作,旨在研究并传达加速的前沿 AI 开发所带来的社会、经济和法律挑战。

846

OpenAI 指令层级改进与 GPT‑5 Mini‑R

OpenAI 推出了全新的强化学习数据集 IH‑Challenge,用于训练模型优先执行可信指令而非不可信指令,进而产生了具备更佳安全可控性和提示注入鲁棒性的 GPT‑5 Mini‑R 模型。

847

ChatGPT 交互式可视化(数学与科学)

OpenAI 在 ChatGPT 中推出了针对 70 多个核心数学和科学概念的动态可视化解释,帮助用户实时理解变量与公式之间的关系。

848

vLLM Semantic Router v0.2 Athena 发布说明 / 新功能

vLLM Semantic Router v0.2 Athena 引入了全新构建的模型堆栈、实验性的 ClawOS 编排层以及先进的模型选择原语,将语义路由转变为面向多代理部署的战略系统大脑。

849

Hugging Face 存储桶发布

Hugging Face 推出了 Storage Buckets,这是一种可变的、类似 S3 的对象存储系统,基于 Xet,能够高效处理如检查点和处理后数据等中间机器学习产物。

850

让 Token 持续流动:来自 16 个开源 RL 库的经验教训

Hugging Face 调查了 16 个开源 RL 库,发现异步 RL 训练将推理和训练分离到不同的 GPU 池,使用 rollout 缓冲区,并以异步方式推送权重;Ray 主导编排,NCCL 广播是常用的权重同步方式。