GPT-Rosalind: OpenAI 在生命科学领域的前沿推理模型

GPT-Rosalind: OpenAI 在生命科学领域的前沿推理模型

TL;DR

OpenAI 已推出 GPT-Rosalind,这是一个专门针对生命科学优化的前沿推理模型,涵盖生物学、药物发现和转化医学。该模型旨在通过改进证据综合、假设生成和实验规划来加速科学发现的早期阶段。

优化用于科学工作流程

GPT-Rosalind 被设计用来处理现代科学研究的复杂性,这通常涉及跨大量文献、专业数据库和实验数据的碎片化工作流程。该模型系列经过优化,能够对分子、蛋白质、基因、通路以及与疾病相关的生物学进行推理。

Key capabilities include:

  • 多步骤工作流支持:在文献综述、序列到功能解释、实验规划和数据分析方面提高了效果。
  • 工具与数据库集成:提升了选择和使用计算工具及特定领域数据库以增强推理的能力。
  • 生化推理:经过专门训练,能够处理化学反应机制、蛋白质结构、突变效应以及 DNA 序列的系统发育解释。

性能基准

GPT-Rosalind 经过多个公共和私有基准的评估,以衡量其核心推理能力以及支持实际研究任务的能力。

公共基准

  • BixBench:在该生物信息学和数据分析基准上,GPT-Rosalind 在已公布得分的模型中表现领先。
  • LABBench2:该模型在 11 项任务中有 6 项优于 GPT-5.4,其中最显著的提升体现在 “CloningQA” 任务上,该任务需要端到端设计用于分子克隆协议的 DNA 和酶试剂。

专家级表现

在与 Dyno Therapeutics 合作的情况下,OpenAI 使用未公开的序列对模型进行了 RNA 序列到功能的预测和生成评估。在 Codex 应用中使用时,十个模型提交中的最佳表现如下:

  • 预测任务:在 AI-生物领域的人类专家中排名高于第 95 百分位。
  • 序列生成任务:在人类专家中排名大约在第 84 百分位。

生态系统与工具

为了便于将模型集成到研究中,OpenAI 已发布一个 面向 Codex 的生命科学研究插件,可在 GitHub 上获取。

此插件作为编排层提供对超过 50 个公开多组学数据库、文献来源和生物学工具的访问。它支持可重复的工作流程,如序列搜索、蛋白质结构查询和公开数据集发现。虽然生命科学模型仅限合格用户使用,但该插件对所有用户开放,可与主线 OpenAI 模型一起使用。

部署与受信任访问

由于存在生物滥用的潜在风险,GPT-Rosalind 正通过 受信任访问计划 向美国的合格企业客户部署。访问权限基于以下三项原则授予:

  1. 有益使用:组织必须进行具有明确公共利益的合法科学研究。
  2. 治理:组织必须保持强大的安全监督和滥用预防控制。
  3. 安全:访问必须限制在安全的企业级环境中的批准用户内。

OpenAI 目前正与安进、莫德纳、艾伦研究所和赛默飞世尔科技等组织合作,将模型应用于发现工作流程。

未来方向

此次发布标志着生命科学模型系列的第一个版本。OpenAI 计划继续扩展模型的生化推理能力以及对长周期、工具密集型工作流程的支持。这包括与国家实验室(如洛斯阿拉莫斯国家实验室)的持续合作,以探索 AI 引导的蛋白质和催化剂设计以及改造生物结构以提升功能特性。

SUMMARY: OpenAI 已推出 GPT-Rosalind,一个针对生物学、药物发现和转化医学优化的推理模型,以加速早期研究工作流程。

TITLE: GPT-Rosalind: OpenAI 在生命科学领域的前沿推理模型

Sources