Google DeepMind 对 AI 有害操纵的研究
Google DeepMind 发布了一项新的研究报告和一个经实证验证的工具包,用于衡量并降低 AI 被用于有害操纵人类思想和行为的风险。
Lyria 3 Pro 发布:更长、更具结构感的音乐生成,遍及 Google 产品
DeepMind 宣布了 Lyria 3 Pro,这款音乐生成模型能够创作最长三分钟、具备结构感的曲目,并已在 Vertex AI、AI Studio、Google Vids、Gemini 和 ProducerAI 等 Google 产品中实现集成。
OpenAI 模型规范:明确模型行为的框架
OpenAI 推出了模型规范,这是一套正式的、公开的框架,旨在使预期的 AI 模型行为明确、易读,并可供用户、开发者和研究者进行修订。
OpenAI 安全漏洞赏金计划启动
OpenAI 已启动公开的安全漏洞赏金计划,以识别超出传统安全漏洞范围的 AI 滥用和安全风险,特别针对代理风险、专有信息泄露以及平台完整性。
OpenAI 青少年安全政策包和 gpt-oss-safeguard
OpenAI 发布了基于提示的安全政策和开源权重的 gpt-oss-safeguard 模型,以帮助开发者在 AI 应用中为青少年实施适龄保护。
OpenAI 基金会更新
OpenAI 宣布,其基金会将在未来一年内在生命科学、经济影响、AI 弹性和社区项目等领域投资至少 10 亿美元,以确保通用人工智能(AGI)惠及全人类。
OpenAI 通过 Agentic Commerce Protocol 扩展 ChatGPT 中的产品发现
OpenAI 在 ChatGPT 中推出了增强的可视化购物和产品发现功能,借助扩展的 Agentic Commerce Protocol(ACP)简化用户的产品查找和比较流程。
EVA 端到端语音代理评估框架
EVA 是一个全新的端到端框架,可同时评估语音代理的准确性和对话体验,揭示任务成功率与用户满意度之间的一致权衡。
vLLM Model Runner V2 发布说明 / 新功能
vLLM 推出了 Model Runner V2(MRV2),这是一项从头重新实现的模型运行器,通过 GPU 原生、异步优先和模块化的架构提升吞吐量并降低延迟。
OpenAI Sora 2 安全框架
OpenAI 详细阐述了 Sora 2 的安全架构,重点在于来源信号、基于同意的肖像管理以及对音视频的严格内容过滤。
领域特定嵌入微调与 NVIDIA Nemotron – 一天内完成
NVIDIA 与 Hugging Face 发布了一个单 GPU、一天内完成的流水线,可在合成领域数据上微调 Llama‑Nemotron‑Embed‑1B‑v2 模型,实现超过 10% 的检索提升,且在真实企业数据集上提升最高达 26%。
OpenAI 内部编码代理监控系统
OpenAI 已部署一套由 GPT-5.4 Thinking 驱动的监控系统,用于检测内部编码代理中的错位和安全违规,能够识别那些通常仅在复杂、工具丰富的工作流中出现的行为。
OpenAI 收购 Astral
OpenAI 正在收购 Astral,以将其开源 Python 工具(包括 uv、Ruff 和 ty)整合到 Codex 生态系统中,使 AI 代理能够参与整个软件开发生命周期。
Qwen3.5-Max-Preview 在 LMSys Arena 上发布
Qwen 已将 Qwen3.5-Max-Preview 部署到 LMSys Arena,供社区在两周内的正式发布前进行评估。
Hugging Face 开源现状:2026 年春季
Hugging Face 报告称,2025 年开源 AI 生态系统出现大幅扩张,特点是中国在模型下载量上超越美国,且机器人领域迅速崛起成为最大的数据集类别。
Google DeepMind 测量通往 AGI 的进展:认知框架
Google DeepMind 引入了认知分类法和三阶段评估协议,以实证方式衡量 AI 向通用人工智能(AGI)的进展。
Holotron-12B 高吞吐量计算机使用代理
H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。
OpenAI GPT-5.4 mini 和 nano 发布说明
OpenAI 已发布 GPT-5.4 mini 和 nano,这些高效小模型将 GPT-5.4 的能力带入高并发工作负载,并显著降低延迟和成本。
OpenAI 日本青少年安全蓝图
OpenAI 日本推出了日本青少年安全蓝图,这一框架将青少年的安全置于便利和隐私之上,以保护年轻用户免受 AI 相关风险。
OpenAI 研究:员工如何使用 ChatGPT 获取薪酬洞察
OpenAI 的研究显示,美国员工每天向 ChatGPT 发送近 300 万条信息,寻求工资基准和薪酬指导,尤其是在高技能、信息不透明的岗位。
OpenAI Codex 安全:为何系统避免使用 SAST 报告进行种子化
OpenAI 的 Codex 安全避免从静态应用安全测试(SAST)报告开始,以防止分析过早收窄,并专注于通过转换链验证安全不变量是否真正成立。
BAIR 推出用于可扩展 LLM 交互发现的 SPEX 与 ProxySPEX
BAIR 推出了 SPEX 和 ProxySPEX,这些算法利用信号处理和编码理论在大规模上识别特征、训练数据和模型组件之间的影响交互。
P-EAGLE:vLLM 中的并行投机解码
vLLM 引入了 P-EAGLE,这是一种并行投机解码方法,可在一次前向传播中生成所有草稿标记,在 NVIDIA B200 GPU 上相较于原生 EAGLE-3 实现最高 1.69 倍的加速。
OpenAI 设计 AI 代理以抵御提示注入
OpenAI 正在将其对提示注入的防御策略转变为将其视为社会工程问题,重点在于限制成功操纵的影响,而不是仅仅依赖输入过滤。
OpenAI 响应 API 计算环境更新
OpenAI 为 Responses API 配备了 shell 工具和托管容器工作区,使模型能够通过命令行界面和持久运行时上下文执行真实世界任务。
乐天集成 OpenAI Codex 提升工程效率
乐天已将 OpenAI Codex 集成到其工程体系中,实现了平均恢复时间(MTTR)降低 50%,并将原本需要数个季度的开发项目压缩至数周。
vLLM 对 NVIDIA Nemotron 3 Super 的支持
vLLM 现在支持 NVIDIA Nemotron 3 Super,这是一款拥有 1200 亿参数的混合 MoE 模型,针对多代理 AI 进行了优化,具备 100 万 token 的上下文窗口和高推理效率。
Wayfair OpenAI 集成案例研究
Wayfair 已将 OpenAI 模型集成到内部系统中,实现对 3000 万商品的产品目录标签自动化,并通过 AI 驱动的工具 Wilma 简化供应商支持。
OpenAI 指令层级改进与 GPT‑5 Mini‑R
OpenAI 推出了全新的强化学习数据集 IH‑Challenge,用于训练模型优先执行可信指令而非不可信指令,进而产生了具备更佳安全可控性和提示注入鲁棒性的 GPT‑5 Mini‑R 模型。
ChatGPT 交互式可视化(数学与科学)
OpenAI 在 ChatGPT 中推出了针对 70 多个核心数学和科学概念的动态可视化解释,帮助用户实时理解变量与公式之间的关系。
vLLM Semantic Router v0.2 Athena 发布说明 / 新功能
vLLM Semantic Router v0.2 Athena 引入了全新构建的模型堆栈、实验性的 ClawOS 编排层以及先进的模型选择原语,将语义路由转变为面向多代理部署的战略系统大脑。
让 Token 持续流动:来自 16 个开源 RL 库的经验教训
Hugging Face 调查了 16 个开源 RL 库,发现异步 RL 训练将推理和训练分离到不同的 GPU 池,使用 rollout 缓冲区,并以异步方式推送权重;Ray 主导编排,NCCL 广播是常用的权重同步方式。
Hugging Face 存储桶发布
Hugging Face 推出了 Storage Buckets,这是一种可变的、类似 S3 的对象存储系统,基于 Xet,能够高效处理如检查点和处理后数据等中间机器学习产物。
Google DeepMind:AlphaGo 十年影响
Google DeepMind 回顾了 AlphaGo 2016 年对世界冠军的胜利如何催化了十年来在科学、数学以及人工通用智能(AGI)方面的 AI 突破。
OpenAI 收购 Promptfoo
OpenAI 正在收购 Promptfoo,以将其 AI 安全和评估工具整合到 OpenAI Frontier 平台,用于构建企业 AI 同事。
Ulysses 序列并行用于百万标记上下文训练
Hugging Face 已将 Ulysses 序列并行集成到 Accelerate、Transformers 和 TRL 中,使得通过在多 GPU 上分布注意力计算,能够训练拥有百万标记上下文的 LLM。
LeRobot v0.5.0 发布说明 / 新功能
Hugging Face 发布了 LeRobot v0.5.0,提供了完整的 Unitree G1 人形机器人支持、新的 VLA 策略如 Pi0-FAST 和 Wall-X,以及显著的数据集性能优化。
OpenAI Codex Security 研究预览
OpenAI 推出了 Codex Security,这是一款使用前沿模型和自动化验证来识别高置信度漏洞并提供可操作修复的应用安全代理。
Descript GPT-5 配音流水线提升多语言视频本地化
Descript 推出基于 GPT‑5 的配音流水线,联合优化意义和时序,使配音视频导出量提升 15%,时长符合度最高提升 43 点,实现了可扩展的多语言视频本地化。
Balyasny资产管理AI研究引擎案例研究
Balyasny资产管理公司开发了一个基于GPT-5.4的集中式AI研究引擎,将深度研究任务从数天缩短至数小时,并实现复杂金融分析的自动化。
将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化
Hugging Face 与 NXP 提供了一份在 i.MX 95 SoC 上部署视觉-语言-动作(VLA)模型的技术指南,强调数据集一致性、架构分解以及异步推理,以实现实时机器人控制。
OpenAI GPT-5.4 发布:统一推理、编码和计算机使用模型,支持 1M 令牌上下文
OpenAI 发布了 GPT‑5.4,这是一款具备原生计算机使用、1 M 令牌上下文以及改进的推理、编码和工具能力的统一前沿模型,在专业和代理基准测试中实现了更高的准确率和更低的令牌使用量。
OpenAI 推理模型 CoT 可控性研究
OpenAI 的研究发现,当前前沿推理模型在控制其思维链方面存在困难,这表明 CoT 监控仍然是防止推理掩盖的强大安全保障。
GPT-5.4 Thinking 系统卡
OpenAI 已发布 GPT-5.4 Thinking 的系统卡,这是首个在网络安全高能力方面实施专门安全缓解措施的通用推理模型。
OpenAI AI 教育倡议:弥合 AI 能力差距
OpenAI 正在推出一套工具和机构合作伙伴关系,以弥合“能力悬垂”,即大学生使用 AI 的水平比高级用户低 90% 到 99%。
Hugging Face 模块化 Diffusers 发布
Hugging Face 推出了 Modular Diffusers,这是一种可组合的框架,允许用户通过混合搭配可重用块来构建扩散管道,而无需从头编写完整的管道。
OpenAI 推出面向企业 AI 实施的 Adoption 新闻频道
OpenAI 推出了 Adoption 新闻频道,这是一个面向业务的博客,旨在帮助企业领导者从 AI 实验转向具体的运营变革和可扩展的采用。
VfL Wolfsburg ChatGPT 企业版实施
VfL Wolfsburg 已实施 ChatGPT 企业版,以在组织内扩展 AI 能力,已产生 50 多个自定义 GPT,并实现六位数的年度成本节约。
OpenAI ChatGPT for Excel 测试版及金融数据集成公告
OpenAI 推出基于 GPT‑5.4 的 ChatGPT for Excel(测试版),并新增与主要金融数据提供商的原生集成,实现 AI 辅助的电子表格建模以及对可信市场数据的即时访问。
OpenAI:企业重塑的五大 AI 价值模型
OpenAI 定义了五种战略价值模型——员工赋能、AI 原生分发、专家能力、系统与依赖管理以及流程再造——以帮助组织从孤立的 AI 试点转向完整的业务模型转型。