501

IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障

IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。

502

使用 Lyria 3 的 Gemini 音乐生成

Google DeepMind 已将 Lyria 3 生成音乐模型集成到 Gemini 应用中,使用户能够通过文本提示或图像、视频上传创建 30 秒的 AI 生成曲目。

503

Gradio 6 gr.HTML:一次性 Web 应用开发

Gradio 6 引入了对 gr.HTML 的增强支持,支持自定义模板、作用域 CSS 和 JavaScript 交互,使得能够在单个 Python 文件中创建复杂的网页组件。

504

OpenAI 推出 EVMbench

OpenAI 与 Paradigm 已发布 EVMbench,这是一项用于评估 AI 代理检测、修补和利用高危智能合约漏洞能力的基准测试。

505

Google DeepMind 人工智能国家合作伙伴计划:印度扩展

Google DeepMind 正在与印度政府部门和机构建立新的合作伙伴关系,以扩大前沿 AI 模型在科学、教育、农业和能源安全方面的获取。

506

Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能

Qwen 3.5‑397B‑A17B 是一个拥有 3970 亿参数的多模态模型,每个令牌仅激活 170 亿参数,在语言、编码、推理和视觉任务上实现最先进的性能,同时推理速度比前代提升最高可达 19 倍。

507

GPT-5.2 在理论物理学中推导出新结果

OpenAI 宣布,GPT-5.2 Pro 以及一个支撑版的 GPT-5.2 被用于在半共线区间推导出关于非零胶子树振幅的新理论物理结果。

508

ChatGPT 锁定模式和提升风险标签

OpenAI 引入了锁定模式和提升风险标签,以缓解提示注入攻击,并为用户提供更大的数据泄露风险控制。

509

OpenAI 通过混合信用系统扩展对 Codex 和 Sora 的访问

OpenAI 实施了一个实时访问引擎,将速率限制与可购买的信用系统相结合,以防止 Codex 和 Sora 用户出现硬性停止。

510

OpenAI GABRIEL:使用 GPT 扩大社会科学研究规模

OpenAI 发布了 GABRIEL,这是一款开源的 Python 工具包,利用 GPT 将非结构化文本和图像转化为社会科学研究的定量测量。

511

Hugging Face CUDA 内核代理技能

Hugging Face 推出了一项代理技能,使 Claude、Codex 等编码代理能够编写、基准测试并集成用于 transformers 和 diffusers 库的可投入生产的 CUDA 内核。

512

Gemini 3 Deep Think 更新

Google DeepMind 已更新 Gemini 3 Deep Think,这是一种专门的推理模式,在数学、物理和化学奥林匹克中达到金牌水平表现,并已通过 Gemini API 向特定用户开放。

513

GPT-5.3-Codex-Spark 发布说明

OpenAI 已发布 GPT-5.3-Codex-Spark,这是一款小型、低延迟模型,针对实时编码协作进行优化,并在 Cerebras 硬件上实现每秒超过 1,000 个 token 的输出。

514

OpenEnv: 在真实环境中评估使用工具的智能体

Hugging Face 和 Meta 推出了 OpenEnv,这是一个开源框架,用于针对真实系统和像 Calendar Gym 这样的生产级环境评估 AI 智能体,以弥合研究与生产可靠性之间的差距。

515

OpenAI Harness Engineering:利用 Codex 实现零手写代码开发

OpenAI 使用 Codex 开发了一个内部软件产品,实现了零行手写代码,通过从手动编码转向环境设计和代理编排,将开发时间缩短约 10 倍。

516

Qwen-Image-2.0 发布:专业信息图表与写实渲染

Qwen-Image-2.0 是一款统一的图像生成与编辑模型,支持 1k-token 指令用于专业信息图表,并具备原生 2K 分辨率实现高保真写实渲染。

517

Gemini Deep Think 实现跨数学、物理和计算机科学的自主研究

Gemini Deep Think 为自主和协作代理提供动力,解决研究级别的数学、物理和计算机科学问题,产出可发表的成果并破解未解猜想。

518

OpenAI 将 ChatGPT 集成到 GenAI.mil 为战争部

OpenAI 正在将定制版 ChatGPT 部署到 GenAI.mil,为战争部的 300 万名人员提供安全、非机密的生成式 AI 能力,以支持行政和运营工作。

519

Transformers.js v4 发布说明 / 新功能

Hugging Face 发布了 Transformers.js v4,引入了全新用 C++ 重写的 WebGPU 运行时,以在浏览器和服务器端运行时实现硬件加速,并提供了一个独立的 tokenizers 库。

520

OpenAI 本地化方法与 OpenAI for Countries 计划

OpenAI 通过 OpenAI for Countries 计划推出了本地化 AI 系统框架,使各国能够将前沿模型适配到本地语言、法律和文化规范,同时遵守全球安全红线。

521

SyGra 2.0.0 Studio 发布

SyGra 2.0.0 引入了 Studio,一个用于设计和执行合成数据生成工作流的可视化交互式环境,无需手动编辑 YAML 文件。

522

GPT-5 降低细胞自由蛋白合成的成本

OpenAI 与 Ginkgo Bioworks 在闭环自主实验室系统中使用 GPT-5,将细胞自由蛋白合成成本降低了 40%,试剂成本降低了 57%。

523

OpenAI 可信访问(网络安全)

OpenAI 推出了 Trusted Access for Cyber,这是一个基于身份的框架,为安全专业人员提供对 GPT-5.3-Codex 的优先访问,以加速网络防御和漏洞修复。

524

OpenAI Frontier 平台发布

OpenAI 推出了 Frontier,这是一款端到端平台,旨在帮助企业构建、部署和管理具备共享业务上下文、安全执行环境和集成治理的 AI 代理。

525

GPT-5.3-Codex 发布说明 / 新功能

OpenAI 发布了 GPT-5.3-Codex,这是一款代理式编码模型,在性能、推理和速度上相较 GPT-5.2-Codex 有所提升,能够自主执行复杂、长期的技术任务。

526

GPT-5.3-Codex 系统卡片

OpenAI 已发布 GPT-5.3-Codex,这是一款将 GPT-5.2-Codex 性能与 GPT-5.2 推理相结合的代理式编码模型,可处理复杂的长期技术任务。

527

OpenAI Codex 应用服务器架构与集成

OpenAI 推出了 Codex 应用服务器,这是一种基于 JSON-RPC 的协议和进程,向各种客户端公开 Codex 代理框架,实现 IDE、网页运行时和终端界面之间一致的代理体验。

528

Hugging Face 社区评估

Hugging Face 推出了社区评估,这是一套去中心化的系统,可在 Hub 上直接报告和汇总模型基准分数,以提升透明度和可复现性。

529

H Company Holo2-235B-A22B 预览版发布

H Company 已发布 Holo2-235B-A22B 预览版,这是一款在 Screenspot‑Pro 和 OSWorld G 基准上实现了最新技术水平表现的 UI 本地化模型。

530

全球开源 AI 生态系统的未来:从 DeepSeek 到 AI+

Hugging Face 分析了开源如何成为中国 AI 组织的主导策略,已从孤立的模型突破转向模型、硬件和基础设施的可扩展、集成生态系统。

531

文本到图像模型的训练设计:消融实验的经验教训

由于 429 Too Many Requests 错误,提供的 Hugging Face 关于文本到图像模型训练设计的源材料不可用。

532

OpenAI Sora Feed 哲学

OpenAI 详细阐述了 Sora 动态的设计原则和安全框架,重点在于以创意为驱动的排序、个性化推荐以及多层次的安全防护。

533

Qwen3-Coder-Next 发布:高效能代理式编码模型

Qwen3-Coder-Next 是一款基于混合注意力和 MoE 架构的开源权重模型,在 SWE-Bench Verified 上取得超过 70% 的成功率,性能可与参数量大 10‑20 倍的模型相媲美。

534

Snowflake 与 OpenAI 的企业智能合作伙伴关系

OpenAI 与 Snowflake 已签署 2 亿美元协议,将包括 GPT-5.2 在内的 OpenAI 前沿模型直接集成到 Snowflake AI Data Cloud,以实现安全、基于数据的 AI 代理和应用的创建。

535

OpenAI Codex 应用发布 – 多代理桌面界面,适用于 macOS 和 Windows

OpenAI 推出了适用于 macOS 的 Codex 桌面应用(Windows 支持已于 2026 年 3 月加入),这是一款统一界面,允许开发者并行运行、监督并协作多个 AI 代理,使用可复用的技能进行扩展,并自动化重复性任务。

536

Project Genie:Google DeepMind 的交互式世界模型原型

Google DeepMind 推出了 Project Genie,这是一款由 Genie 3 驱动的实验性研究原型,允许用户创建、探索并重新混合交互式实时生成的环境。

537

OpenAI内部数据代理内部揭秘

OpenAI 开发了一个定制的内部 AI 数据代理,使员工能够使用自然语言在 600 PB 数据上进行复杂的数据分析,采用多层上下文系统和自学习推理循环。

538

OpenAI 在 ChatGPT 中停用 GPT-4o、GPT-4.1 和 o4-mini

OpenAI 将于 2026 年 2 月 13 日在 ChatGPT 中停用 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,因为使用已转向 GPT-5.2。

539

大成公司 ChatGPT Enterprise 实施

大成公司已将 ChatGPT Enterprise 部署为其人才发展战略的核心组成部分,以扩展人类潜能并重塑建筑行业的劳动力能力。

540

介绍 Daggr:以可视化检查方式以编程方式链式连接 AI 应用

Hugging Face 发布了 Daggr,这是一款开源的 Python 库,允许开发者以编程方式将 Gradio 应用、机器学习模型和自定义函数串联成工作流,并自动生成可视化画布用于调试和状态管理。

541

Qwen3-ASR 和 Qwen3-ForcedAligner 发布

Qwen 已开源 Qwen3-ASR(1.7B 和 0.6B)以及 Qwen3-ForcedAligner-0.6B,提供业界领先的多语言语音识别和非自回归时间戳预测,遵循 Apache 2.0 许可证。

542

OpenAI 欧盟经济蓝图 2.0

OpenAI 已推出欧盟经济蓝图 2.0,推出了培训 20,000 家中小企业的项目、青年安全资助,并扩大政府合作,以弥合欧洲的 AI 能力悬垂。

543

OpenAI EMEA 青年与福祉资助计划 2026

OpenAI 启动了价值 50 万欧元的 EMEA 青年与福祉资助计划,旨在为在欧洲、中东和非洲地区从事 AI 安全、福祉和青少年发展工作的非政府组织和研究人员提供资金。

544

Hugging Face Upskill:通过 Agent Skills 将专家能力转移到更小的模型

Hugging Face 推出了 upskill,这是一款利用 Claude Opus 4.5 等高能力模型生成经过验证的“代理技能”,以提升更小或开源模型在复杂任务(如 CUDA 内核开发)上的性能和 token 效率的工具。

545

OpenAI AI Agent 链接安全

OpenAI 通过仅允许 AI 代理自动获取已通过独立网络索引验证为公开的 URL 来实施一个系统,以防止基于 URL 的数据外泄。

546

中国开源 AI 生态系统的架构选择:从 DeepSeek R1 到硬件优先、MoE 驱动的格局

DeepSeek R1 开源发布一年后,中国 AI 社区的焦点从追求最大单模型性能转向构建灵活、成本效益高且硬件感知的 AI 系统。混合专家(Mixture‑of‑Experts,MoE)成为默认架构,通过在每次请求中仅激活部分专家,使超大模型保持可负担。多模态竞争爆发,文本‑到‑图像、视频、音频、3‑D 与智能体等开源发布均配套完整工具链。小模型(≤30 B)因易于本地部署和微调而激增,大型 MoE 模型则充当蒸馏的教师网络。Apache 2.0 与 MIT 许可证成为主流,消除法律摩擦,加速商业落地。硬件优先思路兴起:发布时附带针对国产芯片(华为 Ascend、寒武纪、昆仑等)的量化、推理与服务栈,训练流水线也公开文档。竞争优势已从原始模型规模转向系统设计、部署效率以及开源生态的深度融合。

547

Alyah:阿联酋方言基准用于阿拉伯语大型语言模型

Hugging Face 与合作伙伴推出了 Alyah,这是一套手工收集的 1,173 条样本基准,旨在评估阿拉伯语大型语言模型在阿联酋方言下的语言和文化能力。

548

PVH 和 OpenAI 时尚合作伙伴关系

由于服务器错误,PVH 和 OpenAI 合作的提供的源材料不可用,且无法检索到任何技术细节。

549

GPT-OSS Agentic RL 训练:一次实践回顾

Hugging Face 和 LinkedIn 研究人员详细阐述了为使 GPT-OSS 模型实现稳定的 agentic 强化学习所需的工程修复,重点关注 MoE 路由、注意力 sink 和内存效率。

550

OpenAI Prism 发布

OpenAI 推出了 Prism,这是一款免费、AI 原生的 LaTeX 工作空间,基于 GPT-5.2,旨在将科学写作、协作和推理整合到单一环境中。