✷ 归档 · 11 个实验室 · 3,048 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
OpenAI 停止 SWE-bench Verified 评估
OpenAI 已停止报告 SWE-bench Verified 分数,因为有缺陷的测试用例和训练数据污染使该基准无法可靠衡量前沿模型的编码能力。
OpenAI 前沿联盟合作伙伴公告
OpenAI 已推出前沿联盟,与麦肯锡、波士顿咨询集团(BCG)、BCG X、埃森哲和凯捷合作,帮助企业使用前沿平台部署和扩展 AI 同事。
Anthropic 教育报告:AI 流利度指数
Anthropic 推出了 AI 流利度指数,用于衡量用户如何与 AI 协作,发现迭代优化是高水平 AI 流利度的最强预测指标。
Anthropic Persona Selection Model
Anthropic 提出了 persona selection model,这一理论认为 AI 助手表现得像人类,是因为它们模拟了在预训练期间学到的类人 personas,并随后通过后训练对其进行了细化。
Ollama 0.17: OpenClaw AI 助手简化设置
Ollama 0.17 为 OpenClaw 引入了单命令安装流程,OpenClaw 是一款能够在本地硬件上管理电子邮件、日历和即时通讯应用的个人 AI 助手。
Anthropic 关于检测与预防蒸馏攻击的报告
Anthropic 识别并详细描述了 DeepSeek、Moonshot 和 MiniMax 的工业规模蒸馏攻击,这些公司利用超过 24,000 个欺诈账户非法提取 Claude 的能力。
OpenAI 首次证明提交
OpenAI 已提交针对 First Proof 研究级数学挑战的证明尝试,内部模型可能已解决至少十个问题中的五个。
使用 Unsloth 和 Hugging Face Jobs 训练 AI 模型
Hugging Face 已将 Unsloth 与 Hugging Face Jobs 集成,以实现快速、低成本的 LLM 微调,专为像 LiquidAI/LFM2.5-1.2B-Instruct 这样的小模型进行优化。
GGML 与 llama.cpp 加入 Hugging Face
GGML,llama.cpp 的创建者,已加入 Hugging Face,为本地 AI 推理提供可持续资源,并简化 Transformers 库与本地模型部署之间的集成。
Anthropic 发布 Claude Code Security 研究预览版
Anthropic 发布了 Claude Code Security,这是一款 AI 驱动的静态分析工具,可扫描代码库中的复杂漏洞并建议补丁,现已面向企业和开源团队提供有限的研究预览版。
Gemini 3.1 Pro 发布说明
Google DeepMind 推出了 Gemini 3.1 Pro,这是一款在复杂任务上推理能力显著提升的新模型,现已通过 Gemini API、Vertex AI、Gemini 应用和 Notebook LM 以预览形式提供。
OpenAI 对齐项目资助
OpenAI 宣布向 The Alignment Project 提供 750 万美元的资助,该基金由英国人工智能安全研究所(UK AISI)管理,旨在扩大对 AI 对齐与安全的独立研究规模。
OpenAI for India 计划
OpenAI 已推出 “OpenAI for India”,这是一项全国性计划,与 Tata Group 及其他机构合作,构建主权 AI 基础设施,加速企业采用,并在全国范围内扩大 AI 技能提升。
IBM 与加州大学伯克利分校使用 IT-Bench 与 MAST 诊断企业代理故障
IBM 研究院和加州大学伯克利分校推出了 MAST(多代理系统故障分类法),用于诊断企业 IT 代理为何失败,揭示前沿模型主要受孤立的验证错误影响,而开源模型则面临级联的系统性崩溃。
使用 Lyria 3 的 Gemini 音乐生成
Google DeepMind 已将 Lyria 3 生成音乐模型集成到 Gemini 应用中,使用户能够通过文本提示或图像、视频上传创建 30 秒的 AI 生成曲目。
Gradio 6 gr.HTML:一次性 Web 应用开发
Gradio 6 引入了对 gr.HTML 的增强支持,支持自定义模板、作用域 CSS 和 JavaScript 交互,使得能够在单个 Python 文件中创建复杂的网页组件。
OpenAI 推出 EVMbench
OpenAI 与 Paradigm 已发布 EVMbench,这是一项用于评估 AI 代理检测、修补和利用高危智能合约漏洞能力的基准测试。
Anthropic 实践中衡量 AI 代理自主性的方法——关键发现与影响
Anthropic 2026 年 2 月的研究显示,Claude Code 代理的自主运行时间更长,经验丰富的用户自动批准率更高但中断频率也更高,代理在复杂任务中请求澄清的频率超过人类中断频率,高风险领域应用虽仍有限但正在兴起。
Google DeepMind 人工智能国家合作伙伴计划:印度扩展
Google DeepMind 正在与印度政府部门和机构建立新的合作伙伴关系,以扩大前沿 AI 模型在科学、教育、农业和能源安全方面的获取。
Anthropic 与卢旺达政府关于 AI 集成的谅解备忘录 (MOU)
Anthropic 与卢旺达政府签署了一份为期三年的谅解备忘录,旨在将 AI 集成到卢旺达的医疗、教育和公共部门系统中。
Anthropic 与 Infosys 合作开发企业级 AI Agent
Anthropic 与 Infosys 达成合作伙伴关系,将 Claude 模型和 Claude Code 与 Infosys Topaz 集成,为包括电信、金融服务和制造业在内的受监管行业构建 agentic AI 解决方案。
Anthropic Economic Index: India Country Brief
印度在 Claude.ai 总使用量方面位居全球第二,但在 IT 行业表现出高度集中,且人均采用率存在显著差距,同时在复杂任务上实现了 15 倍的生产力提升。
Ollama 为 Claude Code 添加了子代理 (Subagents) 和网页搜索功能
Ollama 现在支持在 Claude Code 中使用子代理和网页搜索,允许模型运行并行任务并访问实时信息,而无需 MCP 服务器或 API 密钥。
Anthropic 在印度扩大业务,设立班加罗尔办事处并建立战略合作伙伴关系
Anthropic 在班加罗尔开设了新办事处,并启动了涵盖企业、教育和农业领域的合作伙伴关系,以扩大负责任 AI 的应用并增强印地语系语言能力。
Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能
Qwen 3.5‑397B‑A17B 是一个拥有 3970 亿参数的多模态模型,每个令牌仅激活 170 亿参数,在语言、编码、推理和视觉任务上实现最先进的性能,同时推理速度比前代提升最高可达 19 倍。
GPT-5.2 在理论物理学中推导出新结果
OpenAI 宣布,GPT-5.2 Pro 以及一个支撑版的 GPT-5.2 被用于在半共线区间推导出关于非零胶子树振幅的新理论物理结果。
ChatGPT 锁定模式和提升风险标签
OpenAI 引入了锁定模式和提升风险标签,以缓解提示注入攻击,并为用户提供更大的数据泄露风险控制。
OpenAI 通过混合信用系统扩展对 Codex 和 Sora 的访问
OpenAI 实施了一个实时访问引擎,将速率限制与可购买的信用系统相结合,以防止 Codex 和 Sora 用户出现硬性停止。
OpenAI GABRIEL:使用 GPT 扩大社会科学研究规模
OpenAI 发布了 GABRIEL,这是一款开源的 Python 工具包,利用 GPT 将非结构化文本和图像转化为社会科学研究的定量测量。
Hugging Face CUDA 内核代理技能
Hugging Face 推出了一项代理技能,使 Claude、Codex 等编码代理能够编写、基准测试并集成用于 transformers 和 diffusers 库的可投入生产的 CUDA 内核。
Anthropic 任命 Chris Liddell 为董事会成员
Anthropic 已任命前 Microsoft 和 General Motors 的 CFO 以及前白宫副幕僚长 Chris Liddell 加入其董事会,以加强对 AI 社会影响的治理与监督。
Anthropic 与 CodePath 合作,推动 AI 集成的计算机科学教育
Anthropic 正与 CodePath 合作,将 Claude 和 Claude Code 整合进美国最大的大学计算机科学项目的课程中,为社区学院、州立学校和 HBCU 的超过 20,000 名学生提供前沿 AI 工具的使用权。
Gemini 3 Deep Think 更新
Google DeepMind 已更新 Gemini 3 Deep Think,这是一种专门的推理模式,在数学、物理和化学奥林匹克中达到金牌水平表现,并已通过 Gemini API 向特定用户开放。
GPT-5.3-Codex-Spark 发布说明
OpenAI 已发布 GPT-5.3-Codex-Spark,这是一款小型、低延迟模型,针对实时编码协作进行优化,并在 Cerebras 硬件上实现每秒超过 1,000 个 token 的输出。
OpenEnv: 在真实环境中评估使用工具的智能体
Hugging Face 和 Meta 推出了 OpenEnv,这是一个开源框架,用于针对真实系统和像 Calendar Gym 这样的生产级环境评估 AI 智能体,以弥合研究与生产可靠性之间的差距。
Anthropic 向 Public First Action 捐赠 2000 万美元以支持 AI 治理
Anthropic 向跨党派的 501(c)(4) 组织 Public First Action 捐赠了 2000 万美元,该组织致力于促进 AI 安全措施、公众教育以及美国在 AI 政策方面的领导地位。
Anthropic Series G 轮融资与企业级增长
Anthropic 已筹集 300 亿美元的 Series G 轮融资,投后估值 3800 亿美元,旨在扩展其前沿研究、产品开发和基础设施。
OpenAI Harness Engineering:利用 Codex 实现零手写代码开发
OpenAI 使用 Codex 开发了一个内部软件产品,实现了零行手写代码,通过从手动编码转向环境设计和代理编排,将开发时间缩短约 10 倍。
Anthropic 承诺承担数据中心电价上涨的费用
Anthropic 已承诺承担因其数据中心运营而导致的电网升级和需求驱动的电价上涨费用,以保护美国纳税人。
Qwen-Image-2.0 发布:专业信息图表与写实渲染
Qwen-Image-2.0 是一款统一的图像生成与编辑模型,支持 1k-token 指令用于专业信息图表,并具备原生 2K 分辨率实现高保真写实渲染。
Gemini Deep Think 实现跨数学、物理和计算机科学的自主研究
Gemini Deep Think 为自主和协作代理提供动力,解决研究级别的数学、物理和计算机科学问题,产出可发表的成果并破解未解猜想。
OpenAI 将 ChatGPT 集成到 GenAI.mil 为战争部
OpenAI 正在将定制版 ChatGPT 部署到 GenAI.mil,为战争部的 300 万名人员提供安全、非机密的生成式 AI 能力,以支持行政和运营工作。
Transformers.js v4 发布说明 / 新功能
Hugging Face 发布了 Transformers.js v4,引入了全新用 C++ 重写的 WebGPU 运行时,以在浏览器和服务器端运行时实现硬件加速,并提供了一个独立的 tokenizers 库。
OpenAI 本地化方法与 OpenAI for Countries 计划
OpenAI 通过 OpenAI for Countries 计划推出了本地化 AI 系统框架,使各国能够将前沿模型适配到本地语言、法律和文化规范,同时遵守全球安全红线。
SyGra 2.0.0 Studio 发布
SyGra 2.0.0 引入了 Studio,一个用于设计和执行合成数据生成工作流的可视化交互式环境,无需手动编辑 YAML 文件。
GPT-5 降低细胞自由蛋白合成的成本
OpenAI 与 Ginkgo Bioworks 在闭环自主实验室系统中使用 GPT-5,将细胞自由蛋白合成成本降低了 40%,试剂成本降低了 57%。
OpenAI 可信访问(网络安全)
OpenAI 推出了 Trusted Access for Cyber,这是一个基于身份的框架,为安全专业人员提供对 GPT-5.3-Codex 的优先访问,以加速网络防御和漏洞修复。
OpenAI Frontier 平台发布
OpenAI 推出了 Frontier,这是一款端到端平台,旨在帮助企业构建、部署和管理具备共享业务上下文、安全执行环境和集成治理的 AI 代理。
GPT-5.3-Codex 系统卡片
OpenAI 已发布 GPT-5.3-Codex,这是一款将 GPT-5.2-Codex 性能与 GPT-5.2 推理相结合的代理式编码模型,可处理复杂的长期技术任务。
GPT-5.3-Codex 发布说明 / 新功能
OpenAI 发布了 GPT-5.3-Codex,这是一款代理式编码模型,在性能、推理和速度上相较 GPT-5.2-Codex 有所提升,能够自主执行复杂、长期的技术任务。