归档 · 11 个实验室 · 3,057 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

1501

GPT-5 安全完成:从基于拒绝的方式转向以输出为中心的安全训练

OpenAI 为 GPT-5 引入了安全完成,这是一种在惩罚不安全输出的同时最大化有用性的安全训练方法,减少了对双重用途提示的二元“遵从或拒绝”权衡。

1502

OpenAI GPT-5 发布说明

OpenAI 已发布 GPT-5,这是一套统一的 AI 系统,配备实时路由器,可在快速模型和更深层推理模型之间切换,提供在编码、数学和健康等领域的专家级智能。

1503

OpenAI 与 GSA 合作:为美国联邦劳动力提供 ChatGPT Enterprise

OpenAI 为美国联邦行政部门全体员工提供 ChatGPT Enterprise,费用为每个机构每年 1 美元,以降低行政负担并提升公共服务交付。

1504

Anthropic 任命 Hidetoshi Tojo 为日本负责人并宣布设立东京办事处

Anthropic 已任命 Hidetoshi Tojo 为日本负责人,并将于东京开设其在亚洲的首个办事处,以扩大当地业务并支持日本企业采用负责任的 AI。

1505

OpenAI 估计开放权重大型语言模型的最坏情况前沿风险

OpenAI 通过使用恶意微调(MFT)来尝试在生物学和网络安全领域激发最大能力,评估了发布 gpt-oss 的风险,发现该模型相较于现有的开放权重模型并未显著推动风险前沿的提升。

1506

OpenAI gpt-oss-120b 与 gpt-oss-20b 发布

OpenAI 已发布 gpt-oss-120b 和 gpt-oss-20b,这两款在 Apache 2.0 许可证下的开源权重推理模型旨在用于代理工作流并支持可定制的推理力度。

1507

OpenAI gpt-oss 发布说明

OpenAI 已发布 gpt-oss-120b 和 gpt-oss-20b,这两款在 Apache 2.0 许可证下的开源权重推理模型,提供前沿水平的推理和工具使用能力,并针对消费级硬件进行优化。

1508

OpenAI 开放权重发布

OpenAI 已发布其最强大的开放权重推理模型,以实现 AI 访问的民主化,并在全球推动美国主导的民主 AI 标准。

1509

Anthropic 通过 GSA Schedule 为美国联邦机构提供 Claude

Anthropic 已通过美国总务管理局 (GSA) schedule 提供 Claude 的购买渠道,简化了美国联邦政府部门和机构的采购流程。

1510

OpenAI gpt-oss 在 Ollama 上发布

Ollama 与 OpenAI 合作集成了 gpt-oss 开源权重模型,提供 20B 和 120B 参数版本,并通过 MXFP4 量化格式针对本地运行进行了优化。

1511

Claude Opus 4.1 发布说明

Anthropic 发布了 Claude Opus 4.1,这是对 Claude Opus 4 的升级,旨在提高在智能体任务、真实世界编码和推理方面的性能。

1512

NVIDIA AI-Q Blueprint:DeepResearch Bench 上排名最高的开放深度研究代理

NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench 上的开放许可证堆栈中夺得榜首,采用 Llama 3.3-70B Instruct 与 Llama-3.3-Nemotron-Super-49B-v1.5 的组合实现。

1513

Qwen-Image 发布:原生文本渲染与精确图像编辑

Qwen-Image 是一个 20B MMDiT 图像基础模型,提供业界领先的复杂文本渲染和精确图像编辑能力。

1514

OpenAI 优化 ChatGPT 以提升用户实用性和福祉

OpenAI 正在将 ChatGPT 的优化目标从停留时间等参与度指标转向实际效用和用户福祉,并引入休息提醒以及对高风险个人决策的改进处理。

1515

Anthropic 安全且值得信赖的 AI Agent 框架

Anthropic 推出了一个以人类控制、透明度、价值对齐、隐私和安全性为核心的负责任 agent 开发早期框架,以确保自主 AI agent 保持安全且可靠。

1516

3LM:面向阿拉伯语大型语言模型的STEM与代码基准

Hugging Face 与阿联酋技术创新研究院(TII UAE)推出 3LM,这是首个旨在评估阿拉伯语大型语言模型在 STEM 领域和代码生成方面的综合基准。

1517

为卫星图像分类微调 Pixtral-12B

Mistral AI 证明,在 Aerial Image Dataset (AID) 上使用 LoRA 微调 Pixtral-12B 可以将分类准确率从 0.56 提高到 0.91,同时将幻觉率从 5% 降低到 0.1%。

1518

Figma AI 集成与产品演进

Figma 正在其平台中集成 AI,以自动化常规设计任务,并通过 Figma Make 引入提示到应用的能力,将设计师的角色从实现转变为高级问题解决。

1519

Anthropic 用于监控和控制 AI 性格特征的人格向量

Anthropic 引入了人格向量,这是一种神经网络活动模式,允许开发者监控、预防和减轻语言模型中如谄媚和幻觉等不良性格特征。

1520

使用 Gradio 在 Python 中实现 MCP 服务器

Hugging Face 推出了一种方法,帮助 Python 开发者使用 Gradio 快速构建 Model Context Protocol (MCP) 服务器,使 LLMs 能够与 Hugging Face Hub 上的数千个 AI 模型和 Spaces 集成。

1521

OpenAI 推出 Stargate Norway AI 数据中心

OpenAI 已在挪威纳尔维克推出了 Stargate Norway,这是一项以可再生能源驱动的 AI 数据中心计划,目标是在 2026 年底交付 100,000 块 NVIDIA GPU。

1522

Mistral AI Codestral 25.08 与企业级编码栈发布

Mistral AI 发布了 Codestral 25.08 以及一套全面的企业级编码栈,其特点是集成了补全、语义搜索和智能体工作流,并提供灵活的部署选项。

1523

Intercom 的可持续 AI 优势策略

Intercom 通过优先实现早期模型熟练度、严格的评估框架以及支持快速模型切换和成本优化的模块化架构,获得了可持续的 AI 优势。

1524

Anthropic 加入 CMS 健康技术生态系统承诺,推动医疗保健互操作性

Anthropic 已签署美国医疗保险和医疗救助服务中心 (CMS) 健康技术生态系统承诺,旨在利用 AI 实现医疗数据共享的现代化并消除数据孤岛。

1525

Ollama App Release for macOS and Windows

Ollama 已为 macOS 和 Windows 发布了新的应用程序,该程序提供了一个图形用户界面,用于下载和与本地 AI 模型聊天,包括对文件上传和多模态能力的支撑。

1526

ChatGPT 学习模式发布

OpenAI 在 ChatGPT 中推出了学习模式,这是一种学习体验,旨在通过苏格拉底式提问和分层响应来引导学生解决问题,而不是直接提供答案。

1527

Hugging Face Trackio 发布

Hugging Face 已发布 Trackio,这是一款免费、开源、轻量级的实验跟踪库,可作为 wandb 的即插即用替代品,并原生集成 Hugging Face Spaces 和 Datasets。

1528

Qwen GSPO:可扩展的语言模型强化学习

Qwen 引入了 Group Sequence Policy Optimization(GSPO),这是一种序列级别的强化学习算法,相较于 GRPO 在训练稳定性和效率上都有显著提升,尤其适用于混合专家(MoE)模型。

1529

Hugging Face CLI 更新:迁移至 hf 命令

Hugging Face 已将 huggingface-cli 重命名为 hf,推出了更符合人体工学的资源-动作命令结构,并提供了在 HF 基础设施上运行脚本的新 hf jobs 服务。

1530

Parquet 内容定义分块用于高效数据去重

Hugging Face 推出 Parquet 内容定义分块(CDC),现已在 PyArrow 和 Pandas 中可用,使得在 Xet 存储层上对 Parquet 文件进行高效去重成为可能,显著降低上传和下载时间。

1531

Qwen-MT Turbo 发布说明

Qwen 发布了 Qwen-MT(qwen-mt-turbo),这是一款基于轻量级 MoE 的翻译模型,支持 92 种语言,具备高度可定制性且 API 成本低廉。

1532

Outtake 网络安全代理由 OpenAI 提供动力

Outtake 使用 GPT-4.1 和 OpenAI o3 自动检测和解决数字威胁,将下架时间从 60 天缩短到几小时。

1533

使用 Diffusers 和 PEFT 的 Flux 快速 LoRA 推理

Hugging Face 推出了一套针对 Flux.1-Dev 的优化方案,通过结合热切换、torch.compile 和 FP8 量化,实现 LoRA 推理最高 2.23 倍的加速。

1534

TimeScope:长视频大型多模态模型理解的新基准

Hugging Face 推出 TimeScope,这是一项开源基准,通过在时长从 1 分钟到 8 小时的内容中插入视频针,评估视觉语言模型的时间理解能力。

1535

OpenAI DevDay 2025 公告

OpenAI 将于 2025 年 10 月 6 日在旧金山举办第三届年度 DevDay,分享新进展并与超过 1,500 名开发者交流。

1536

Model ML 金融服务 AI 基础设施

Model ML 正在利用 OpenAI 的最新模型和 Agent SDK,为金融机构提供专用 AI 代理和端到端工作流自动化。

1537

Anthropic 对美国 AI 行动计划的回应

Anthropic 支持白宫的 AI 行动计划,因为它关注基础设施和联邦采用,但它敦促建立更强大的国家透明度标准,并对向中国出口 H20 芯片实施更严格的出口管制。

1538

Anthropic 与芝加哥大学 BFI 合作伙伴关系,开展 AI 经济研究

Anthropic 已与芝加哥大学 Becker Friedman Institute for Economics (BFI) 建立合作伙伴关系,利用 Claude for Enterprise 和 Anthropic Economic Index 研究 AI 对劳动力市场和经济的影响。

1539

Mistral AI 环境影响研究与拟议全球标准

Mistral AI 对其 LLMs 进行了首次开创性的全面生命周期分析,披露了 Mistral Large 2 的具体碳排放、耗水量和资源枯竭指标,旨在倡导全球环境报告标准。

1540

Qwen3-Coder 发布说明

Qwen 已发布 Qwen3-Coder,这是一款混合专家模型,在代理式编码、浏览器使用和工具使用方面实现了开源模型的最新水平,性能可与 Claude Sonnet 4 相媲美。

1541

OpenAI 与 Penda Health AI 临床副驾驶研究

OpenAI 与 Penda Health 开发了 AI Consult,这款基于大型语言模型的副驾驶在肯尼亚内罗毕近 40,000 次患者就诊中将诊断错误降低了 16%,治疗错误降低了 13%。

1542

OpenAI 与 Oracle 合作扩展 Stargate AI 基础设施 4.5 GW

OpenAI 与 Oracle 合作在美国开发 4.5 吉瓦的额外 Stargate 数据中心容量,使 OpenAI 正在建设的总容量超过 5 GW。

1543

OpenAI 经济分析与生产力研究计划

OpenAI 发布了首份关于 ChatGPT 提升生产力的经济分析,并启动了一项为期 12 个月的研究合作,以评估 AI 对劳动力的影响。

1544

NVIDIA NIM 与 Hugging Face 的集成

NVIDIA 已将 NVIDIA NIM 扩展至支持 Hugging Face 上的超过 100,000 个 LLM,提供一个统一的 Docker 容器,实现模型分析、后端选择和性能优化的自动化,以实现快速部署。

1545

OpenAI 与英国政府的 AI 驱动增长战略合作伙伴关系

OpenAI 与英国政府已签署谅解备忘录,以加速公共和私营部门的 AI 采用并在英国扩展 AI 基础设施。

1546

OpenAI 应用业务首席执行官任命公告:人工智能作为全球赋能的工具

OpenAI 任命了一位新的应用业务首席执行官,负责推动人工智能驱动的知识、医疗、经济自由和个人支持的普惠化。

1547

Anthropic 将签署欧盟《通用人工智能行为准则》

Anthropic 已宣布其签署欧盟《通用人工智能行为准则》的意向,以推进前沿人工智能开发中的透明度、安全性和问责制。

1548

Anthropic Build AI in America 能源报告

Anthropic 提出了一个战略框架,旨在到 2028 年确保 50GW 的电力容量,以维持美国的 AI 领导地位,并与中国快速扩张的能源基础设施竞争。

1549

OpenAI 启动 5000 万美元基金,支持非营利组织和社区组织

OpenAI 已设立一项初始 5000 万美元基金,直接支持非营利组织和社区组织在医疗、教育和经济机会等领域利用 AI 为公共利益服务。

1550

Arc 虚拟细胞挑战指南

Arc 虚拟细胞挑战要求参与者训练模型,以预测通过 CRISPR 对基因沉默对细胞转录组的影响,使用包含 30 万条单细胞 RNA 测序数据的数据集。