DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文
DeepSeek-V4 引入了由混合 CSA/HCA 注意力机制驱动的 1M-token 上下文窗口,专门针对长程 Agent 工作负载和工具使用轨迹进行了优化。
vLLM DeepSeek V4 支持:高效长上下文注意力
vLLM 现已支持 DeepSeek V4-Pro 和 V4-Flash,实现了一种新注意力机制,使上下文长度可达一百万 token,并显著节省 KV 缓存内存。
OpenAI GPT-5.5 系统卡
OpenAI 已发布 GPT-5.5,这是一个针对复杂真实世界任务和工具使用进行优化的模型,具有增强的任务理解能力和更强大的安全框架。
OpenAI GPT-5.5 发布说明
OpenAI 已发布 GPT-5.5 和 GPT-5.5 Pro,在保持 GPT-5.4 延迟不变的同时,显著提升了代理式编码、计算机使用和科学研究能力。
如何使用 ChatGPT Work 处理日常任务
OpenAI 于 2026 年 4 月 23 日的 Academy 文章解释了 ChatGPT Work 如何将现有工作材料(如日历、电子邮件、文档和电子表格)转化为团队可以审查和编辑的初稿简报、摘要、幻灯片、工作簿、计划和流程文档。
使用 Transformers.js 在 Chrome 扩展程序中
Hugging Face 提供了一份关于在清单 V3 下将 Transformers.js 集成到 Chrome 扩展程序的技术指南,展示了由 Gemma 4 E2B 驱动的后台托管模型架构。
ChatGPT for Clinicians 发布
OpenAI 推出了 ChatGPT for Clinicians,这是一款面向经验证的美国医疗提供者的免费版 ChatGPT,旨在自动化文档编写、医学研究和临床工作流程。
Google DeepMind 去耦合 DiLoCo
Google DeepMind 推出了去耦合 DiLoCo,这是一种分布式训练架构,能够在远程数据中心使用低带宽和混合不同代的硬件实现具有韧性的异步 LLM 训练。
在 ChatGPT 中引入工作区代理 – OpenAI 研究预览
OpenAI 在 ChatGPT 中推出了工作区代理,使团队能够创建共享的、云端运行的 AI 代理,在遵守组织控制的前提下,跨工具自动化多步骤工作流。
ChatGPT 中的工作区代理:概述与构建方法
OpenAI 在 ChatGPT 中推出了工作区代理,通过结合触发器、流程和工具集成,实现可重复的结构化工作流自动化,使团队能够共享一致的 AI 驱动任务。
OpenAI Responses API WebSocket 模式发布
OpenAI 为 Responses API 引入了 WebSocket 支持,通过消除冗余的 API 开销,使推理速度提升至每秒 4,000 令牌,并将代理工作流的延迟降低了最高 40%。
Qwen3.6-27B 发布说明 / 新功能
Qwen 发布了 Qwen3.6-27B,这是一款密集的 270 亿参数多模态模型,在所有主要的代理式编码基准上均优于更大的 Qwen3.5-397B-A17B。
vLLM FP8 KV-Cache 和 Attention 量化更新
vLLM 已优化 FP8 KV-cache 和 attention 量化,在 Hopper 和 Blackwell 架构上降低了解码延迟和内存占用,同时保持了接近基准的准确性。
OpenAI 隐私过滤器发布
OpenAI 已发布 Privacy Filter,这是一款开源权重、拥有 15 亿参数的模型,旨在高吞吐、上下文感知地检测并编辑非结构化文本中的个人可识别信息(PII)。
Google DeepMind 与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,加速 AI 转型
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 建立合作伙伴关系,通过提供对 Gemini 等前沿模型的早期访问、共同开发行业特定的 AI 解决方案,以及将领导层与客户 CEO 对接,以加速企业 AI 转型。
ChatGPT Images 2.0 发布
OpenAI 发布了 ChatGPT Images 2.0,这是对其图像生成能力的重大更新,具备更高的精度、多语言文本渲染以及增强的风格写实性。
QIMMA:质量优先的阿拉伯语大型语言模型排行榜
Hugging Face 及其合作伙伴推出了 QIMMA,这是一款全新的阿拉伯语 LLM 排行榜,采用严格的质量验证流水线,以确保基准测试真实反映语言能力。
# 将 Codex 扩展到全球企业 – OpenAI 公告
OpenAI 宣布,Codex 使用量从每周超过 300 万开发者增长到超过 400 万开发者,并推出了 Codex Labs 以及全球系统集成商合作伙伴计划,以帮助企业在软件开发生命周期及更广泛的范围内采用 Codex。
vLLM v0.20.0 为混合 SSM 模型添加了分离式服务
vLLM v0.20.0 引入了针对混合 SSM‑FA 模型的分离式预填充/解码服务,通过双描述符视图和三描述符卷积状态传输实现高效的 KV 传输。
Hugging Face:AI 与网络安全的未来
Hugging Face 认为,开源 AI 模型和工具对于网络安全防御至关重要,以抵御像 Mythos 这样的自主漏洞发现系统带来的风险。
GRASP:面向更长视野的世界模型梯度规划
BAIR 引入了 GRASP,这是一种基于梯度的规划器,通过将轨迹提升到虚拟状态并将梯度限制在动作上,从而规避对抗性的状态输入敏感性,实现了在学习到的世界模型中稳健的长视野规划。
Hyatt 部署 ChatGPT Enterprise 以提升全球运营
Hyatt 已集成 ChatGPT Enterprise,为其全球企业和酒店员工提供 GPT 5.4 和 Codex 的访问权限,以自动化手动任务并改善客人体验。
Qwen3.6-Max-Preview 发布说明 / 新功能
Qwen3.6-Max-Preview 是 Qwen 推出的专有预览模型,在代理式编码、世界知识和指令遵循方面相较于 Qwen3.6-Plus 有所提升。
OpenAI Codex 2026年4月更新
OpenAI 更新了 Codex,使其支持后台电脑使用、长期任务自动化和记忆功能,将其从代码生成器扩展为完整的软件开发生命周期合作伙伴。
GPT-Rosalind: OpenAI 在生命科学领域的前沿推理模型
OpenAI 已推出 GPT-Rosalind,一个针对生物学、药物发现和转化医学优化的推理模型,以加速早期研究工作流程。
OpenAI 可信网络访问计划
OpenAI 已推出 Trusted Access for Cyber,一个向防御者提供可扩展的先进网络能力和 1000 万美元 API 积分的计划,旨在增强全球数字韧性。
Ecom-RLVE: 自适应可验证环境用于电子商务对话代理
Hugging Face 推出 EcomRLVE-GYM,一个使用八个可验证的多回合环境并具有自适应难度缩放的框架,用于训练电子商务代理,以弥合对话流畅性与实际任务完成之间的差距。
Hugging Face transformers-to-mlx Skill and Test Harness
Hugging Face 发布了一个 Skill 和一个非 Agent 测试框架,旨在简化从 transformers 库到 mlx-lm 的语言模型移植过程,同时保持高质量的代码质量和评审信号。
使用 Sentence Transformers 进行多模态嵌入与重排序模型的训练与微调
Hugging Face 发布了一篇关于使用 Sentence Transformers 训练和微调多模态嵌入及重排序模型的指南,展示了任务特定微调如何提升诸如视觉文档检索等检索任务的性能。
Gemini 3.1 Flash TTS 发行说明 / 新功能
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一种具有自然语言音频标签的文本转语音模型,可在 70+ 种语言中精确控制语音风格、节奏和表达。
VAKRA 基准测试分析:智能体推理、工具使用与失败模式
Hugging Face 发布了 VAKRA 基准测试,这是一个以工具为基础的可执行套件,用于评估 AI 智能体在 8,000 多个 API 和文档源上的组合推理能力,揭示了在工具选择、多跳推理和策略遵循方面的普遍失败。
OpenAI Agents SDK 更新
OpenAI 已为 Agents SDK 发布了更新的功能,引入了模型原生 harness 和原生沙箱执行,以提高代理在生产环境中的可靠性和性能。
HCompany HoloTab 发布
HCompany 已发布 HoloTab,这是一款由 Holo3 模型驱动的 Chrome 扩展程序,允许用户通过自然语言描述或录制的例程来自动化网页任务。
Qwen3.6-35B-A3B 发布说明
Qwen 发布了 Qwen3.6-35B-A3B,这是一款开源的混合专家模型,拥有 350 亿总参数和 30 亿活跃参数,在代理式编码和多模态推理方面可与更大的密集模型竞争。
OpenAI 扩大 Trusted Access for Cyber 并发布用于防御性网络安全的 GPT‑5.4‑Cyber
OpenAI 将其 Trusted Access for Cyber 项目扩展到数千名已验证的防御者,并发布了 GPT‑5.4‑Cyber,这是一款针对防御性网络安全工作进行微调、更加宽容的模型。
vLLM 韩国 Meetup 2026 总结
2026 年在首尔举办的 vLLM 韩国 Meetup 突出展示了 vLLM 向统一推理基础设施的演进,呈现了社区增长、硬件集成进展、生产栈特性以及在开源和企业轨道中的真实部署策略。
Gemini Robotics-ER 1.6 发布说明 / 新功能
Google DeepMind 发布了 Gemini Robotics-ER 1.6,这是一款以推理为先的模型,提升了空间推理、多视角理解以及仪表读取能力,以支持自主机器人任务。
Cloudflare Agent Cloud 与 OpenAI 集成
Cloudflare Agent Cloud 现在集成了 OpenAI 前沿模型,包括 GPT-5.4 和 Codex,使企业能够在边缘部署可扩展的、生产就绪的 AI 代理。
ChatGPT 适用于客户成功团队
OpenAI 已推出一份指南,供客户成功团队使用 ChatGPT 通过将零散的客户上下文合成为结构化的行动计划和沟通内容来降低运营开销。
面向运营团队的 ChatGPT
OpenAI 已推出一份指南,供运营团队使用 ChatGPT 作为‘随时待命的首席助理’,以减少协作摩擦并标准化运营工作流程。
OpenAI 中的人工智能应用
OpenAI 通过类似 ChatGPT 和 Codex 的直接访问产品以及通过 OpenAI API 为开发者提供的可组合构建块提供 AI 能力。
使用 ChatGPT 分析数据 – OpenAI Academy
OpenAI Academy 发布了一份指南,展示了如何在聊天界面以及 Excel 或 Google Sheets 中直接使用 ChatGPT 进行数据分析,概述了上传数据、提问、生成可视化和确保结果可信的步骤。
OpenAI AI 基础概览
OpenAI 的 AI 基础页面解释了什么是 AI,大型语言模型如何工作,推理模型与非推理模型的区别,以及如何为初学者选择合适的工具。
ChatGPT 面向财务团队
OpenAI 的 ChatGPT 面向财务团队,于 2026 年 4 月 10 日推出,展示了财务专业人士如何利用 AI 来简化报告、预测和沟通,同时保持判断。
ChatGPT 给管理者:优化人员管理工作流程
OpenAI 已推出一份指南和一套资源,供管理者使用 ChatGPT 自动化重复的行政任务,并更好地准备高风险的人员管理对话。
使用 ChatGPT 创建图像:AI 图像生成指南
OpenAI 提供了一份完整指南,介绍如何通过自然语言提示和迭代编辑,使用 ChatGPT 生成并精炼可投入生产的图像。
OpenAI 与 ChatGPT 的研究:搜索和深度研究功能
OpenAI 推出了两种不同的网页集成方式——Search 和 Deep Research,以应对从快速事实检索到代理式、多步骤技术分析的所有需求。
使用 ChatGPT 进行头脑风暴:结构化思考伙伴框架
OpenAI 提供了一份指南,介绍如何将 ChatGPT 用作结构化思考伙伴,以扩展选项集合、为想法添加结构,并通过宽到窄的工作流程对计划进行压力测试。
OpenAI Academy 金融服务资源
OpenAI 通过 OpenAI Academy 发布了一套专门资源,帮助银行、资产管理公司和保险公司在受监管的金融环境中评估、部署和扩展 AI。
在 ChatGPT 中处理文件
OpenAI 详细说明了用户如何在 ChatGPT 对话中直接上传文件进行分析、编辑和内容生成,并包括与第三方应用的集成。