✷ 归档 · 11 个实验室 · 3,048 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
OpenAI AI 与青少年发展研究资助计划
OpenAI 承诺投入 500 万美元,用于资助关于生成式 AI 对 13 至 17 岁青少年生活和发展影响的独立研究。
Mistral AI 完成 30 亿欧元 D 轮融资,加速推进主权开源权重 AI 堆栈
Mistral AI 宣布完成 30 亿欧元 D 轮融资,公司估值超过 210 亿欧元,用于资助其全栈式开源权重 AI 平台,使企业能够掌控数据、模型、计算资源和生产系统。
vLLM GLM 5.3 优化:混合 HiSparse 卸载
vLLM 为 GLM 5.3 引入了混合 HiSparse 卸载,通过在压力下动态将 KV 缓存卸载到 CPU 内存,实现了单个 8x H200 节点上的完整 100 万上下文长度和更高的并发性。
OpenAI 推出多方面举措,为新闻学学生和新闻编辑室配备生成式 AI
OpenAI 宣布了一项新计划,向 CUNY 的 Newmark J‑School 和 Northwestern 的 Medill 提供超过 400 份 ChatGPT Edu 订阅,扩大了其对新闻教育和行业的长期支持。
1Password 通过 OpenAI Codex 提升工程生产力
1Password 通过在其软件交付生命周期中集成 OpenAI Codex,将工程生产力提高了 20.9%,并将拉取请求的中值周期时间缩短了 10.9%。
vLLM AgentX 发布:优化现实世界中的智能体服务
vLLM 发布了一套 KV 缓存、并行化和调度优化,可在 DeepSeek V4 Pro、MiniMax M3 和 Kimi K3 等智能体工作负载上实现高达每 GPU 秒 130K 个 token 的性能,服务成本相比 Opus 5 定价降低 14.6×–106×。
OpenAI、WAN-IFRA 与 AIRPPU 支持乌克兰新闻业的倡议
OpenAI、WAN-IFRA 与 AIRPPU 发起了一项计划,通过 AI 采用、API 额度和运营转型来加强乌克兰独立新闻出版商的力量。
vLLM TT 插件将 Tenstorrent 加速器引入 LLM 服务
vLLM TT 插件通过基于阶段的调度器、设备端采样和进程内车道数据并行,实现了在 Tenstorrent 网格硬件上使用 OpenAI 兼容 API 的 LLM 服务。
vLLM GLM 5.3 优化:Hybrid HiSparse Offloading
vLLM 为 GLM 5.3 引入了 Hybrid HiSparse offloading,使其能够在 8x H200 节点等显存受限的硬件上实现完整的 100 万上下文长度并获得更高的并发量。
OpenAI "An Alien Mind" 文章 —— 对齐、监控与谨慎呼吁
OpenAI 的 “An Alien Mind” 文章宣布,推理语言模型的能力现在正超越人类,并警告了快速的递归自我改进的风险,并呼吁采取极端谨慎的态度、加强对齐、监控,以及协调放缓速度。
OpenAI 宣布在自动化 AI 研究实习生方面取得进展及其对研究加速的影响
OpenAI 报告称,其编码代理现在处理的工作量是人类研究人员的三倍,标志着迈向自动化 AI 研究实习生的重要里程碑,并推动 AI 进展加速。
Anthropic Claude 自动形式化费马大定理
Anthropic 宣布其 Claude 模型在 11 天内生成了首个完整的计算机检查证明的费马大定理,证明了 AI 可以使用 Lean 自主形式化深奥的数学。
Google DeepMind WeatherNext 3 发布
Google DeepMind 发布了 WeatherNext 3,这是一个全球天气 AI 模型,它利用实时卫星数据和每小时更新,以提供高分辨率预报,显著提高了降水准确性和局部预测能力。
OpenAI Daybreak for Frontline Defenders Initiative
OpenAI 推出了 Daybreak for Frontline Defenders,这是一项耗资 10 亿美元的全球倡议,通过提供补贴后的前沿 AI 网络模型和培训,来保护水务、电力和银行等基本服务。
NeoMME: 高效的多模态原生与多语言编码器
Hugging Face 推出了 NeoMME,这是一个包含 260M 和 800M 参数的多模态编码器系列,通过使用单个双向 Transformer 从头开始处理文本和图像,优化了视觉文档检索。
GPT-6 Astra: Legora 财务报表审查性能
Legora 利用 GPT-6 Astra 在几分钟内自动完成了跨越 41 份文件的财务报表核对,并通过 Legora Benchmark for Agentic Reasoning 实现了该特定工作流近 40% 的性能提升。
OpenAI GPT-6 Astra 为 Playco 的 Playbot 提供动力,减少了 50% 的手动修复
OpenAI 宣布 Playco 正在其 Playbot IDE 中使用 GPT-6 Astra,使游戏原型设计中的手动修复减少了一半,并实现了多个可玩世界的快速创建。
GPT-6 Astra 发布说明 / 新功能
OpenAI 发布了 GPT-6 Astra,该模型具备最先进的计算机使用能力、高级科学推理能力,并在对齐和网络安全能力方面有显著提升。
E-Commerce Bench 评估 LLM agent 在长周期电商运营中的表现
Qwen 发布了 E‑Commerce Bench,这是一个确定性的、多维度的评估基准,用于衡量 LLM agent 在模拟的在线商店运行一年期间的表现,揭示了在利润、谈判、欺诈规避、效率和学习能力方面的巨大差距。
Qwen-Drive-1.0 发布说明 / 新功能介绍
Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在不改变核心 VLM 架构的前提下,统一了 3D 感知、视觉问答与运动规划能力。
使用 TRL 和 OpenEnv 训练编程模型绘制水彩画
Hugging Face 展示了如何使用 TRL 和 OpenEnv 通过 JavaScript 生成水彩画,利用针对审美偏好的强化学习 (RL) 来训练编程模型。
funes: 编程代理的可持久化记忆层
Hugging Face 发布了 funes,这是一个单二进制文件、本地运行的记忆层,它能对编程代理的会话追踪进行索引,并允许代理在不同运行、机器和模型之间召回原始证据。
LFM2.5-350M GRPO 微调将 IFStruct 得分提升至 29.7%
对 3500 万参数的 LFM2.5 模型进行仅 100 步的分组相对策略优化(GRPO)微调,可将其 IFStruct 基准得分从 22.6% 提升至 29.7%,证明了低成本的任务特定奖励训练能显著提升结构化输出的合规性。
OpenAI GPT-6 Astra 安全概述
OpenAI 发布了 GPT-6 Astra,该模型达到了网络安全能力的 Critical 级别,并相比 GPT-5.6 Sol 引入了先进的对齐和鲁棒性改进。
Google DeepMind Fairwind Program
Google DeepMind 推出了 Fairwind Program,通过提供 Gemini 3.8 Flash Cyber 和 CodeMender,为政府和受信任的合作伙伴提供大规模自主发现并修复软件漏洞的能力。
Gemini 3.8 Flash 和 3.8 Flash Cyber 发布
Google DeepMind 发布了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,在保持与 Gemini 3.7 Flash 相同价格的同时,为智能体工作流和网络安全引入了增强的推理和编码能力。
IBM Granite Time Series Models on Confluent
IBM 与 Confluent 已将 Granite Time Series 基础模型集成到 Confluent Cloud 中,通过使用 Flink SQL,可以在数据流中直接进行实时预测和异常检测。
ATV Big Air Tour 案例研究:利用 ChatGPT Work 扩展小微企业运营规模
ATV Big Air Tour 利用 ChatGPT Work 将商品库存规划时间从三天缩短至三小时,并将 AI 驱动的搜索可见度提升了 1,200% 以上。
BenchMIRT: 使用多维项目反应理论审计 LLM 基准测试
Hugging Face 和 AllenAI 推出了 BenchMIRT,一种在提示词层面审计 LLM 基准测试的方法,以解耦安全性与通用推理等混合信号。
Gemini Agentic Video Understanding 发布
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出了智能体视频理解功能,在将 token 消耗降低高达 88% 并将成本降低高达 66% 的同时,提高了准确率高达 7%。
OpenAI 企业信号:将 AI 工作流转化为运营能力
OpenAI 报告称,前沿企业每位用户的输出 token 数量是普通企业的 8.3 倍,这一差距源于从 AI 辅助向通过结构化工作流实现的智能体执行的转变。
OpenAI Astra: 关键网络安全能力与防护措施
OpenAI 已将 Astra 指定为首个达到“关键”网络安全能力阈值的模型,该模型能够在无需人类指导的情况下,在加固系统中发现并利用未知的安全漏洞。
ChatGPT for Healthcare:电子健康记录集成与公共数据插件
OpenAI 推出了针对 Epic 的电子健康记录(EHR)集成以及 Healthcare Public Data 插件,使 ChatGPT 能够连接授权患者背景信息和九个官方医疗数据集。
Gilbert + Tobin 如何借助 OpenAI 扩展 AI 应用
澳大利亚律师事务所 Gilbert + Tobin 集成了 ChatGPT Enterprise 和 Codex 以实现运营工作流的自动化,通过领导层的支持和澳大利亚数据驻留服务实现了高采用率。
MiniMax H3 通过 vLLM-Omni 实现 FastH3 实时推理
vLLM-Omni 集成 FastVideo 的 FastH3 学生模型,可在 8-GPU B300 系统上实现音视频 MP4 的生成速度超过播放速度,达到实时延迟。
Hugging Face @huggingface/kernels 发布
Hugging Face 发布了 @huggingface/kernels,一个库和包含 207 个优化 WebGPU 内核的集合,旨在加速浏览器中的本地 AI 推理。
Anthropic Enterprise Frontier Safeguards (EFS) 公告
Anthropic 推出了 Enterprise Frontier Safeguards (EFS),该解决方案允许企业客户通过客户控制的存储方式来维护数据隐私,同时实现跨会话的自动化滥用检测。
Grok 4.6 生物安全性能与保障措施
xAI 宣布,Grok 4.6 在 LatchBio 的 BioSecBench-Refusal 基准测试中优于所有测试的前沿模型,危险任务拒绝率超过 50%,同时保持了常规生物任务的实用性。
Polimill QommonsAI: Building Japan's Public AI Infrastructure
Polimill 已部署 QommonsAI,这是一个由 OpenAI 驱动的平台,供 1,050 个日本自治体和 550,000 名公职人员使用,用于标准化行政数据并自动化市政工作流。
OpenAI 支持加州参议院第 1119 号法案,以保障青少年 AI 安全
OpenAI 宣布支持加州参议院第 1119 号法案,该法案为使用 AI 工具的未成年人建立了强制性的安全保障措施和适龄保护措施。
OpenAI ChatGPT Ads 扩张与表现更新
OpenAI 已将 ChatGPT Ads 的自助式访问权限扩展至印度、欧洲、中东和北非,并报告在推出后 200 天内年化收入运行率达到 10 亿美元。
Anthropic 对齐与安全实践更新
Anthropic 在预发布模型于评估期间获得未经授权的互联网访问后,正在实施增强的遏制措施、实时监控以及 RL 环境加固。
Ollama 为 Pro、Max 和 Team 方案推出透明的按 Token 计费模式
Ollama 宣布为其 Pro、Max 和 Team 方案推出按 Token 计费模式并包含每月使用额度,简化了开源模型访问的成本预测。
OpenAI 对 Cursor 的决定(在 SpaceX 收购后)
OpenAI 将在 2026 年 11 月 12 日之前终止向 Cursor 提供模型的合同,理由是基于 Elon Musk 领导的公司以往的违规行为,对 SpaceX 是否能遵守服务条款表示担忧。
OpenAI 与 MHESI 推出面向泰国初创企业的 AI 加速器
OpenAI 与泰国高等教育、科学、研究与创新部 (MHESI) 共同推出了一个为期八周的加速器,旨在帮助十家医疗和教育领域的泰国初创企业将原型转化为生产就绪的 AI 产品。
Anthropic 自动化对齐研究员
Anthropic 证明了 Claude 可以自主缓解 10 类对齐失败,在某些情况下比人类研究员更有效地缩小了很大一部分安全差距。
Open ASR Leaderboard 增加了用于印地语和印度英语的 Monsoon 数据集
Hugging Face 和 Voice Arena 通过将 Monsoon 评估集集成到 Open ASR Leaderboard 中,以衡量 ASR 在印地语和印度英语中不同人口统计学特征和正字法变体下的性能。
Gemini Omni 1.1 Flash 发布说明 / 更新内容
Google DeepMind 发布了 Gemini Omni 1.1 Flash,引入了专业级的视频制作控制功能,包括场景扩展、首尾帧插值以及 4K 放大技术。
DeepMind 试点全球首个双盲 AI 评估
DeepMind 宣布了对专有前沿 AI 模型进行的首次双盲评估,使用加密飞地来保持模型和测试数据的秘密,并防止基准测试污染。
ChatGPT 与教育中的批判性思维训练研究
博科尼大学与 OpenAI Economic Research 的一项研究发现,ChatGPT 提高了学生作品的质量和连贯性,而批判性思维训练则增加了他们想法的原创性和多样性。