GPT-Rosalind: OpenAI 的生命科學前沿推理模型

GPT-Rosalind: OpenAI 的生命科學前沿推理模型

TL;DR

OpenAI 已推出 GPT-Rosalind,一個專門針對生命科學優化的前沿推理模型,涵蓋生物學、藥物發現與轉譯醫學。該模型旨在透過改進證據綜合、假設生成與實驗規劃來加速科學發現的早期階段。

針對科學工作流程的優化

GPT-Rosalind 經過設計,能夠處理現代科學研究的複雜性,這種複雜性常涉及大量文獻、專門資料庫與實驗數據之間的零散工作流程。該模型系列經過優化,能夠對分子、蛋白質、基因、通路以及與疾病相關的生物學進行推理。

主要能力包括:

  • 多步驟工作流程支援:在文獻評論、序列至功能解釋、實驗規劃與資料分析方面的效能得到提升。
  • 工具與資料庫整合:提升選擇並使用計算工具與領域特定資料庫以增強推理的能力。
  • 生化推理:經過專門訓練,以處理化學反應機制、蛋白質結構、突變效應以及 DNA 序列的系統發生學解釋。

效能基準

GPT-Rosalind 針對數個公開與非公開基準進行評估,以測量其核心推理能力以及支援真實世界研究任務的能力。

公開基準

  • BixBench:在這個生物資訊與資料分析基準上,GPT-Rosalind 在已發布分數的模型中表現領先。
  • LABBench2:該模型在 11 項任務中有 6 項優於 GPT-5.4,最顯著的改進出現在「CloningQA」任務,該任務需要端到端設計 DNA 與酶試劑,用於分子克隆協議。

專家級表現

OpenAI 與 Dyno Therapeutics 合作,使用未公開的序列對模型進行 RNA 序列至功能的預測與生成評估。在 Codex 應用程式中使用時,最佳的十個模型提交表現如下:

  • 預測任務:在 AI-生物領域中,人類專家的表現排名高於第 95 個百分位。
  • 序列生成任務:人類專家的表現排名約在第 84 個百分位。

生態系統與工具

為了促進模型在研究中的整合,OpenAI 已發布 生命科學研究插件 for Codex,可在 GitHub 上取得。

此插件作為編排層、提供對超過 50 個公開多組學資料庫、文獻來源與生物工具的存取。它支援可重複的工作流程,例如序列搜尋、蛋白質結構查詢與公開資料集探索。雖然生命科學模型僅限合格使用者使用,但該插件對所有使用者開放,可與主要的 OpenAI 模型一起使用。

部署與受信任存取

由於存在生物濫用的潛在風險,GPT-Rosalind 正透過 受信任存取計畫 面向美國的合格企業客戶部署。存取權授予基於以下三項原則:

  1. 有益使用:組織必須進行具有明確公共利益的合法科學研究。
  2. 治理:組織必須維持強大的安全監督與防止濫用的控制機制。
  3. 安全:存取必須限制在安全的企業級環境中的已核准使用者內。

OpenAI 目前正與 Amgen、Moderna、Allen Institute 及 Thermo Fisher Scientific 等組織合作,將模型應用於發現工作流程。

未來方向

此版本標誌著生命科學模型系列的第一個發布。OpenAI 計畫繼續擴展模型的生化推理能力,並支援長期且工具密集的工作流程。這包括與國家實驗室的持續合作,例如洛斯阿拉莫斯國家實驗室,以探索 AI 引導的蛋白質與催化劑設計,以及修改生物結構以改善其功能特性。

摘要: OpenAI 已推出 GPT-Rosalind,一個針對生物學、藥物發現與轉譯醫學優化的推理模型,以加速早期研究工作流程。

標題: GPT-Rosalind: OpenAI 的生命科學前沿推理模型

Sources