IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障
IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。
使用 Lyria 3 的 Gemini 音乐生成
Google DeepMind 已将 Lyria 3 生成音乐模型集成到 Gemini 应用中,使用户能够通过文本提示或图像、视频上传创建 30 秒的 AI 生成曲目。
Gradio 6 gr.HTML:一次性 Web 应用开发
Gradio 6 引入了对 gr.HTML 的增强支持,支持自定义模板、作用域 CSS 和 JavaScript 交互,使得能够在单个 Python 文件中创建复杂的网页组件。
OpenAI 推出 EVMbench
OpenAI 与 Paradigm 已发布 EVMbench,这是一项用于评估 AI 代理检测、修补和利用高危智能合约漏洞能力的基准测试。
Google DeepMind 人工智能国家合作伙伴计划:印度扩展
Google DeepMind 正在与印度政府部门和机构建立新的合作伙伴关系,以扩大前沿 AI 模型在科学、教育、农业和能源安全方面的获取。
Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能
Qwen 3.5‑397B‑A17B 是一个拥有 3970 亿参数的多模态模型,每个令牌仅激活 170 亿参数,在语言、编码、推理和视觉任务上实现最先进的性能,同时推理速度比前代提升最高可达 19 倍。
GPT-5.2 在理论物理学中推导出新结果
OpenAI 宣布,GPT-5.2 Pro 以及一个支撑版的 GPT-5.2 被用于在半共线区间推导出关于非零胶子树振幅的新理论物理结果。
ChatGPT 锁定模式和提升风险标签
OpenAI 引入了锁定模式和提升风险标签,以缓解提示注入攻击,并为用户提供更大的数据泄露风险控制。
OpenAI 通过混合信用系统扩展对 Codex 和 Sora 的访问
OpenAI 实施了一个实时访问引擎,将速率限制与可购买的信用系统相结合,以防止 Codex 和 Sora 用户出现硬性停止。
OpenAI GABRIEL:使用 GPT 扩大社会科学研究规模
OpenAI 发布了 GABRIEL,这是一款开源的 Python 工具包,利用 GPT 将非结构化文本和图像转化为社会科学研究的定量测量。
Hugging Face CUDA 内核代理技能
Hugging Face 推出了一项代理技能,使 Claude、Codex 等编码代理能够编写、基准测试并集成用于 transformers 和 diffusers 库的可投入生产的 CUDA 内核。
Gemini 3 Deep Think 更新
Google DeepMind 已更新 Gemini 3 Deep Think,这是一种专门的推理模式,在数学、物理和化学奥林匹克中达到金牌水平表现,并已通过 Gemini API 向特定用户开放。
GPT-5.3-Codex-Spark 发布说明
OpenAI 已发布 GPT-5.3-Codex-Spark,这是一款小型、低延迟模型,针对实时编码协作进行优化,并在 Cerebras 硬件上实现每秒超过 1,000 个 token 的输出。
OpenEnv: 在真实环境中评估使用工具的智能体
Hugging Face 和 Meta 推出了 OpenEnv,这是一个开源框架,用于针对真实系统和像 Calendar Gym 这样的生产级环境评估 AI 智能体,以弥合研究与生产可靠性之间的差距。
OpenAI Harness Engineering:利用 Codex 实现零手写代码开发
OpenAI 使用 Codex 开发了一个内部软件产品,实现了零行手写代码,通过从手动编码转向环境设计和代理编排,将开发时间缩短约 10 倍。
Qwen-Image-2.0 发布:专业信息图表与写实渲染
Qwen-Image-2.0 是一款统一的图像生成与编辑模型,支持 1k-token 指令用于专业信息图表,并具备原生 2K 分辨率实现高保真写实渲染。
Gemini Deep Think 实现跨数学、物理和计算机科学的自主研究
Gemini Deep Think 为自主和协作代理提供动力,解决研究级别的数学、物理和计算机科学问题,产出可发表的成果并破解未解猜想。
OpenAI 将 ChatGPT 集成到 GenAI.mil 为战争部
OpenAI 正在将定制版 ChatGPT 部署到 GenAI.mil,为战争部的 300 万名人员提供安全、非机密的生成式 AI 能力,以支持行政和运营工作。
Transformers.js v4 发布说明 / 新功能
Hugging Face 发布了 Transformers.js v4,引入了全新用 C++ 重写的 WebGPU 运行时,以在浏览器和服务器端运行时实现硬件加速,并提供了一个独立的 tokenizers 库。
OpenAI 本地化方法与 OpenAI for Countries 计划
OpenAI 通过 OpenAI for Countries 计划推出了本地化 AI 系统框架,使各国能够将前沿模型适配到本地语言、法律和文化规范,同时遵守全球安全红线。
SyGra 2.0.0 Studio 发布
SyGra 2.0.0 引入了 Studio,一个用于设计和执行合成数据生成工作流的可视化交互式环境,无需手动编辑 YAML 文件。
GPT-5 降低细胞自由蛋白合成的成本
OpenAI 与 Ginkgo Bioworks 在闭环自主实验室系统中使用 GPT-5,将细胞自由蛋白合成成本降低了 40%,试剂成本降低了 57%。
OpenAI 可信访问(网络安全)
OpenAI 推出了 Trusted Access for Cyber,这是一个基于身份的框架,为安全专业人员提供对 GPT-5.3-Codex 的优先访问,以加速网络防御和漏洞修复。
OpenAI Frontier 平台发布
OpenAI 推出了 Frontier,这是一款端到端平台,旨在帮助企业构建、部署和管理具备共享业务上下文、安全执行环境和集成治理的 AI 代理。
GPT-5.3-Codex 发布说明 / 新功能
OpenAI 发布了 GPT-5.3-Codex,这是一款代理式编码模型,在性能、推理和速度上相较 GPT-5.2-Codex 有所提升,能够自主执行复杂、长期的技术任务。
GPT-5.3-Codex 系统卡片
OpenAI 已发布 GPT-5.3-Codex,这是一款将 GPT-5.2-Codex 性能与 GPT-5.2 推理相结合的代理式编码模型,可处理复杂的长期技术任务。
OpenAI Codex 应用服务器架构与集成
OpenAI 推出了 Codex 应用服务器,这是一种基于 JSON-RPC 的协议和进程,向各种客户端公开 Codex 代理框架,实现 IDE、网页运行时和终端界面之间一致的代理体验。
Hugging Face 社区评估
Hugging Face 推出了社区评估,这是一套去中心化的系统,可在 Hub 上直接报告和汇总模型基准分数,以提升透明度和可复现性。
H Company Holo2-235B-A22B 预览版发布
H Company 已发布 Holo2-235B-A22B 预览版,这是一款在 Screenspot‑Pro 和 OSWorld G 基准上实现了最新技术水平表现的 UI 本地化模型。
全球开源 AI 生态系统的未来:从 DeepSeek 到 AI+
Hugging Face 分析了开源如何成为中国 AI 组织的主导策略,已从孤立的模型突破转向模型、硬件和基础设施的可扩展、集成生态系统。
文本到图像模型的训练设计:消融实验的经验教训
由于 429 Too Many Requests 错误,提供的 Hugging Face 关于文本到图像模型训练设计的源材料不可用。
OpenAI Sora Feed 哲学
OpenAI 详细阐述了 Sora 动态的设计原则和安全框架,重点在于以创意为驱动的排序、个性化推荐以及多层次的安全防护。
Qwen3-Coder-Next 发布:高效能代理式编码模型
Qwen3-Coder-Next 是一款基于混合注意力和 MoE 架构的开源权重模型,在 SWE-Bench Verified 上取得超过 70% 的成功率,性能可与参数量大 10‑20 倍的模型相媲美。
Snowflake 与 OpenAI 的企业智能合作伙伴关系
OpenAI 与 Snowflake 已签署 2 亿美元协议,将包括 GPT-5.2 在内的 OpenAI 前沿模型直接集成到 Snowflake AI Data Cloud,以实现安全、基于数据的 AI 代理和应用的创建。
OpenAI Codex 应用发布 – 多代理桌面界面,适用于 macOS 和 Windows
OpenAI 推出了适用于 macOS 的 Codex 桌面应用(Windows 支持已于 2026 年 3 月加入),这是一款统一界面,允许开发者并行运行、监督并协作多个 AI 代理,使用可复用的技能进行扩展,并自动化重复性任务。
Project Genie:Google DeepMind 的交互式世界模型原型
Google DeepMind 推出了 Project Genie,这是一款由 Genie 3 驱动的实验性研究原型,允许用户创建、探索并重新混合交互式实时生成的环境。
OpenAI内部数据代理内部揭秘
OpenAI 开发了一个定制的内部 AI 数据代理,使员工能够使用自然语言在 600 PB 数据上进行复杂的数据分析,采用多层上下文系统和自学习推理循环。
OpenAI 在 ChatGPT 中停用 GPT-4o、GPT-4.1 和 o4-mini
OpenAI 将于 2026 年 2 月 13 日在 ChatGPT 中停用 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,因为使用已转向 GPT-5.2。
大成公司 ChatGPT Enterprise 实施
大成公司已将 ChatGPT Enterprise 部署为其人才发展战略的核心组成部分,以扩展人类潜能并重塑建筑行业的劳动力能力。
介绍 Daggr:以可视化检查方式以编程方式链式连接 AI 应用
Hugging Face 发布了 Daggr,这是一款开源的 Python 库,允许开发者以编程方式将 Gradio 应用、机器学习模型和自定义函数串联成工作流,并自动生成可视化画布用于调试和状态管理。
Qwen3-ASR 和 Qwen3-ForcedAligner 发布
Qwen 已开源 Qwen3-ASR(1.7B 和 0.6B)以及 Qwen3-ForcedAligner-0.6B,提供业界领先的多语言语音识别和非自回归时间戳预测,遵循 Apache 2.0 许可证。
OpenAI 欧盟经济蓝图 2.0
OpenAI 已推出欧盟经济蓝图 2.0,推出了培训 20,000 家中小企业的项目、青年安全资助,并扩大政府合作,以弥合欧洲的 AI 能力悬垂。
OpenAI EMEA 青年与福祉资助计划 2026
OpenAI 启动了价值 50 万欧元的 EMEA 青年与福祉资助计划,旨在为在欧洲、中东和非洲地区从事 AI 安全、福祉和青少年发展工作的非政府组织和研究人员提供资金。
Hugging Face Upskill:通过 Agent Skills 将专家能力转移到更小的模型
Hugging Face 推出了 upskill,这是一款利用 Claude Opus 4.5 等高能力模型生成经过验证的“代理技能”,以提升更小或开源模型在复杂任务(如 CUDA 内核开发)上的性能和 token 效率的工具。
OpenAI AI Agent 链接安全
OpenAI 通过仅允许 AI 代理自动获取已通过独立网络索引验证为公开的 URL 来实施一个系统,以防止基于 URL 的数据外泄。
中国开源 AI 生态系统的架构选择:从 DeepSeek R1 到硬件优先、MoE 驱动的格局
DeepSeek R1 开源发布一年后,中国 AI 社区的焦点从追求最大单模型性能转向构建灵活、成本效益高且硬件感知的 AI 系统。混合专家(Mixture‑of‑Experts,MoE)成为默认架构,通过在每次请求中仅激活部分专家,使超大模型保持可负担。多模态竞争爆发,文本‑到‑图像、视频、音频、3‑D 与智能体等开源发布均配套完整工具链。小模型(≤30 B)因易于本地部署和微调而激增,大型 MoE 模型则充当蒸馏的教师网络。Apache 2.0 与 MIT 许可证成为主流,消除法律摩擦,加速商业落地。硬件优先思路兴起:发布时附带针对国产芯片(华为 Ascend、寒武纪、昆仑等)的量化、推理与服务栈,训练流水线也公开文档。竞争优势已从原始模型规模转向系统设计、部署效率以及开源生态的深度融合。
Alyah:阿联酋方言基准用于阿拉伯语大型语言模型
Hugging Face 与合作伙伴推出了 Alyah,这是一套手工收集的 1,173 条样本基准,旨在评估阿拉伯语大型语言模型在阿联酋方言下的语言和文化能力。
PVH 和 OpenAI 时尚合作伙伴关系
由于服务器错误,PVH 和 OpenAI 合作的提供的源材料不可用,且无法检索到任何技术细节。
GPT-OSS Agentic RL 训练:一次实践回顾
Hugging Face 和 LinkedIn 研究人员详细阐述了为使 GPT-OSS 模型实现稳定的 agentic 强化学习所需的工程修复,重点关注 MoE 路由、注意力 sink 和内存效率。
OpenAI Prism 发布
OpenAI 推出了 Prism,这是一款免费、AI 原生的 LaTeX 工作空间,基于 GPT-5.2,旨在将科学写作、协作和推理整合到单一环境中。