✷ 归档 · 11 个实验室 · 3,048 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
如何使用 ChatGPT Work 处理日常任务
OpenAI 于 2026 年 4 月 23 日的 Academy 文章解释了 ChatGPT Work 如何将现有工作材料(如日历、电子邮件、文档和电子表格)转化为团队可以审查和编辑的初稿简报、摘要、幻灯片、工作簿、计划和流程文档。
使用 Transformers.js 在 Chrome 扩展程序中
Hugging Face 提供了一份关于在清单 V3 下将 Transformers.js 集成到 Chrome 扩展程序的技术指南,展示了由 Gemma 4 E2B 驱动的后台托管模型架构。
xAI Grok Voice Think Fast 1.0 发布
xAI 发布了 grok-voice-think-fast-1.0,这是一款专为复杂企业工作流、高吞吐量工具调用和低延迟实时推理而设计的旗舰级语音模型。
Anthropic Claude Code 质量事后分析
Anthropic 已解决了影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个独立技术问题,恢复了默认的高推理力度,并修复了一个会话记忆 Bug。
ChatGPT for Clinicians 发布
OpenAI 推出了 ChatGPT for Clinicians,这是一款面向经验证的美国医疗提供者的免费版 ChatGPT,旨在自动化文档编写、医学研究和临床工作流程。
Google DeepMind 去耦合 DiLoCo
Google DeepMind 推出了去耦合 DiLoCo,这是一种分布式训练架构,能够在远程数据中心使用低带宽和混合不同代的硬件实现具有韧性的异步 LLM 训练。
在 ChatGPT 中引入工作区代理 – OpenAI 研究预览
OpenAI 在 ChatGPT 中推出了工作区代理,使团队能够创建共享的、云端运行的 AI 代理,在遵守组织控制的前提下,跨工具自动化多步骤工作流。
ChatGPT 中的工作区代理:概述与构建方法
OpenAI 在 ChatGPT 中推出了工作区代理,通过结合触发器、流程和工具集成,实现可重复的结构化工作流自动化,使团队能够共享一致的 AI 驱动任务。
OpenAI Responses API WebSocket 模式发布
OpenAI 为 Responses API 引入了 WebSocket 支持,通过消除冗余的 API 开销,使推理速度提升至每秒 4,000 令牌,并将代理工作流的延迟降低了最高 40%。
Qwen3.6-27B 发布说明 / 新功能
Qwen 发布了 Qwen3.6-27B,这是一款密集的 270 亿参数多模态模型,在所有主要的代理式编码基准上均优于更大的 Qwen3.5-397B-A17B。
OpenAI 隐私过滤器发布
OpenAI 已发布 Privacy Filter,这是一款开源权重、拥有 15 亿参数的模型,旨在高吞吐、上下文感知地检测并编辑非结构化文本中的个人可识别信息(PII)。
vLLM FP8 KV-Cache 和 Attention 量化更新
vLLM 已优化 FP8 KV-cache 和 attention 量化,在 Hopper 和 Blackwell 架构上降低了解码延迟和内存占用,同时保持了接近基准的准确性。
Anthropic 研究:基于 81,000 名用户调查的 AI 经济学
Anthropic 对 81,000 名 Claude 用户进行的调查显示,职业生涯早期的员工以及 AI 接触程度高的角色所面临的失业风险担忧最高,而生产力提升对于高薪员工和正在扩展专业范围的人员最为显著。
Anthropic 经济指数调查公告
Anthropic 推出了经济指数调查(Economic Index Survey),这是一项每月进行的定性研究,使用 Anthropic Interviewer 实时追踪 AI 如何影响工作、生产力和劳动者预期。
Google DeepMind 与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,加速 AI 转型
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 建立合作伙伴关系,通过提供对 Gemini 等前沿模型的早期访问、共同开发行业特定的 AI 解决方案,以及将领导层与客户 CEO 对接,以加速企业 AI 转型。
ChatGPT Images 2.0 发布
OpenAI 发布了 ChatGPT Images 2.0,这是对其图像生成能力的重大更新,具备更高的精度、多语言文本渲染以及增强的风格写实性。
QIMMA:质量优先的阿拉伯语大型语言模型排行榜
Hugging Face 及其合作伙伴推出了 QIMMA,这是一款全新的阿拉伯语 LLM 排行榜,采用严格的质量验证流水线,以确保基准测试真实反映语言能力。
vLLM v0.20.0 为混合 SSM 模型添加了分离式服务
vLLM v0.20.0 引入了针对混合 SSM‑FA 模型的分离式预填充/解码服务,通过双描述符视图和三描述符卷积状态传输实现高效的 KV 传输。
Hugging Face:AI 与网络安全的未来
Hugging Face 认为,开源 AI 模型和工具对于网络安全防御至关重要,以抵御像 Mythos 这样的自主漏洞发现系统带来的风险。
# 将 Codex 扩展到全球企业 – OpenAI 公告
OpenAI 宣布,Codex 使用量从每周超过 300 万开发者增长到超过 400 万开发者,并推出了 Codex Labs 以及全球系统集成商合作伙伴计划,以帮助企业在软件开发生命周期及更广泛的范围内采用 Codex。
GRASP:面向更长视野的世界模型梯度规划
BAIR 引入了 GRASP,这是一种基于梯度的规划器,通过将轨迹提升到虚拟状态并将梯度限制在动作上,从而规避对抗性的状态输入敏感性,实现了在学习到的世界模型中稳健的长视野规划。
Hyatt 部署 ChatGPT Enterprise 以提升全球运营
Hyatt 已集成 ChatGPT Enterprise,为其全球企业和酒店员工提供 GPT 5.4 和 Codex 的访问权限,以自动化手动任务并改善客人体验。
Anthropic 和 Amazon 扩大合作以获取 5GW 计算能力
Anthropic 和 Amazon 签署了一项协议,以确保获得高达 5 吉瓦的计算能力,并在十年内向 AWS 技术投入 1000 亿美元,以扩展 Claude 的训练和部署。
Qwen3.6-Max-Preview 发布说明 / 新功能
Qwen3.6-Max-Preview 是 Qwen 推出的专有预览模型,在代理式编码、世界知识和指令遵循方面相较于 Qwen3.6-Plus 有所提升。
xAI Grok Speech to Text and Text to Speech APIs
xAI 发布了独立的 Grok Speech to Text (STT) 和 Text to Speech (TTS) API,基于驱动 Grok Voice 和 Tesla 车辆的技术,提供高精度转录和富有表现力的语音生成功能。
OpenAI Codex 2026年4月更新
OpenAI 更新了 Codex,使其支持后台电脑使用、长期任务自动化和记忆功能,将其从代码生成器扩展为完整的软件开发生命周期合作伙伴。
GPT-Rosalind: OpenAI 在生命科学领域的前沿推理模型
OpenAI 已推出 GPT-Rosalind,一个针对生物学、药物发现和转化医学优化的推理模型,以加速早期研究工作流程。
Hugging Face transformers-to-mlx Skill and Test Harness
Hugging Face 发布了一个 Skill 和一个非 Agent 测试框架,旨在简化从 transformers 库到 mlx-lm 的语言模型移植过程,同时保持高质量的代码质量和评审信号。
使用 Sentence Transformers 进行多模态嵌入与重排序模型的训练与微调
Hugging Face 发布了一篇关于使用 Sentence Transformers 训练和微调多模态嵌入及重排序模型的指南,展示了任务特定微调如何提升诸如视觉文档检索等检索任务的性能。
OpenAI 可信网络访问计划
OpenAI 已推出 Trusted Access for Cyber,一个向防御者提供可扩展的先进网络能力和 1000 万美元 API 积分的计划,旨在增强全球数字韧性。
Ecom-RLVE: 自适应可验证环境用于电子商务对话代理
Hugging Face 推出 EcomRLVE-GYM,一个使用八个可验证的多回合环境并具有自适应难度缩放的框架,用于训练电子商务代理,以弥合对话流畅性与实际任务完成之间的差距。
Gemini 3.1 Flash TTS 发行说明 / 新功能
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一种具有自然语言音频标签的文本转语音模型,可在 70+ 种语言中精确控制语音风格、节奏和表达。
VAKRA 基准测试分析:智能体推理、工具使用与失败模式
Hugging Face 发布了 VAKRA 基准测试,这是一个以工具为基础的可执行套件,用于评估 AI 智能体在 8,000 多个 API 和文档源上的组合推理能力,揭示了在工具选择、多跳推理和策略遵循方面的普遍失败。
OpenAI Agents SDK 更新
OpenAI 已为 Agents SDK 发布了更新的功能,引入了模型原生 harness 和原生沙箱执行,以提高代理在生产环境中的可靠性和性能。
HCompany HoloTab 发布
HCompany 已发布 HoloTab,这是一款由 Holo3 模型驱动的 Chrome 扩展程序,允许用户通过自然语言描述或录制的例程来自动化网页任务。
Qwen3.6-35B-A3B 发布说明
Qwen 发布了 Qwen3.6-35B-A3B,这是一款开源的混合专家模型,拥有 350 亿总参数和 30 亿活跃参数,在代理式编码和多模态推理方面可与更大的密集模型竞争。
OpenAI 扩大 Trusted Access for Cyber 并发布用于防御性网络安全的 GPT‑5.4‑Cyber
OpenAI 将其 Trusted Access for Cyber 项目扩展到数千名已验证的防御者,并发布了 GPT‑5.4‑Cyber,这是一款针对防御性网络安全工作进行微调、更加宽容的模型。
vLLM 韩国 Meetup 2026 总结
2026 年在首尔举办的 vLLM 韩国 Meetup 突出展示了 vLLM 向统一推理基础设施的演进,呈现了社区增长、硬件集成进展、生产栈特性以及在开源和企业轨道中的真实部署策略。
Anthropic 自动对齐研究人员实现 0.97 的性能差距恢复
Anthropic 的自动对齐研究人员(AARs)使用 Claude Opus 4.6,实现了 97% 的弱到强监督性能差距恢复,证明大型语言模型能够自主地大规模生成和测试对齐想法。
Anthropic 长期利益信托任命 Vas Narasimhan 为董事会董事
Anthropic 的长期利益信托任命诺华公司首席执行官 Vas Narasimhan 为董事会董事,以加强公司在医疗健康与生命科学领域人工智能应用方面的治理。
Gemini Robotics-ER 1.6 发布说明 / 新功能
Google DeepMind 发布了 Gemini Robotics-ER 1.6,这是一款以推理为先的模型,提升了空间推理、多视角理解以及仪表读取能力,以支持自主机器人任务。
Cloudflare Agent Cloud 与 OpenAI 集成
Cloudflare Agent Cloud 现在集成了 OpenAI 前沿模型,包括 GPT-5.4 和 Codex,使企业能够在边缘部署可扩展的、生产就绪的 AI 代理。
ChatGPT 适用于客户成功团队
OpenAI 已推出一份指南,供客户成功团队使用 ChatGPT 通过将零散的客户上下文合成为结构化的行动计划和沟通内容来降低运营开销。
OpenAI 中的人工智能应用
OpenAI 通过类似 ChatGPT 和 Codex 的直接访问产品以及通过 OpenAI API 为开发者提供的可组合构建块提供 AI 能力。
ChatGPT 用于研究指南
OpenAI 已发布一份关于使用 ChatGPT 加速研究过程的指南,介绍了两种不同的方法:Search 用于快速定位,Deep Research 用于多步骤调查。
OpenAI 对 Axios 开发者工具妥协的响应
OpenAI 在第三方供应链攻击导致 Axios 库暴露 GitHub Actions 工作流后,正在轮换其 macOS 代码签名证书,尽管未发现用户数据被盗或软件受损的证据。
OpenAI 学院:面向销售团队的 ChatGPT
OpenAI 发布了一份指南,帮助销售团队使用 ChatGPT 加速账户研究、个性化外联并协调内部交易管理。
使用 ChatGPT 分析数据 – OpenAI Academy
OpenAI Academy 发布了一份指南,展示了如何在聊天界面以及 Excel 或 Google Sheets 中直接使用 ChatGPT 进行数据分析,概述了上传数据、提问、生成可视化和确保结果可信的步骤。
OpenAI 医疗保健提示模板
OpenAI 发布了一个医疗保健页面,提供用于临床任务的填空提示模板,例如选择诊断检查、生成鉴别诊断、制定评估和计划、记录就诊、为患者提供咨询、协调护理交接、总结指南以及检索临床参考文献。
面向运营团队的 ChatGPT
OpenAI 已推出一份指南,供运营团队使用 ChatGPT 作为‘随时待命的首席助理’,以减少协作摩擦并标准化运营工作流程。