GPT-Rosalind: OpenAI 的生命科學前沿推理模型
GPT-Rosalind: OpenAI 的生命科學前沿推理模型
TL;DR
OpenAI 已推出 GPT-Rosalind,一個專門針對生命科學優化的前沿推理模型,涵蓋生物學、藥物發現與轉譯醫學。該模型旨在透過改進證據綜合、假設生成與實驗規劃來加速科學發現的早期階段。
針對科學工作流程的優化
GPT-Rosalind 經過設計,能夠處理現代科學研究的複雜性,這種複雜性常涉及大量文獻、專門資料庫與實驗數據之間的零散工作流程。該模型系列經過優化,能夠對分子、蛋白質、基因、通路以及與疾病相關的生物學進行推理。
主要能力包括:
- 多步驟工作流程支援:在文獻評論、序列至功能解釋、實驗規劃與資料分析方面的效能得到提升。
- 工具與資料庫整合:提升選擇並使用計算工具與領域特定資料庫以增強推理的能力。
- 生化推理:經過專門訓練,以處理化學反應機制、蛋白質結構、突變效應以及 DNA 序列的系統發生學解釋。
效能基準
GPT-Rosalind 針對數個公開與非公開基準進行評估,以測量其核心推理能力以及支援真實世界研究任務的能力。
公開基準
- BixBench:在這個生物資訊與資料分析基準上,GPT-Rosalind 在已發布分數的模型中表現領先。
- LABBench2:該模型在 11 項任務中有 6 項優於 GPT-5.4,最顯著的改進出現在「CloningQA」任務,該任務需要端到端設計 DNA 與酶試劑,用於分子克隆協議。
專家級表現
OpenAI 與 Dyno Therapeutics 合作,使用未公開的序列對模型進行 RNA 序列至功能的預測與生成評估。在 Codex 應用程式中使用時,最佳的十個模型提交表現如下:
- 預測任務:在 AI-生物領域中,人類專家的表現排名高於第 95 個百分位。
- 序列生成任務:人類專家的表現排名約在第 84 個百分位。
生態系統與工具
為了促進模型在研究中的整合,OpenAI 已發布 生命科學研究插件 for Codex,可在 GitHub 上取得。
此插件作為編排層、提供對超過 50 個公開多組學資料庫、文獻來源與生物工具的存取。它支援可重複的工作流程,例如序列搜尋、蛋白質結構查詢與公開資料集探索。雖然生命科學模型僅限合格使用者使用,但該插件對所有使用者開放,可與主要的 OpenAI 模型一起使用。
部署與受信任存取
由於存在生物濫用的潛在風險,GPT-Rosalind 正透過 受信任存取計畫 面向美國的合格企業客戶部署。存取權授予基於以下三項原則:
- 有益使用:組織必須進行具有明確公共利益的合法科學研究。
- 治理:組織必須維持強大的安全監督與防止濫用的控制機制。
- 安全:存取必須限制在安全的企業級環境中的已核准使用者內。
OpenAI 目前正與 Amgen、Moderna、Allen Institute 及 Thermo Fisher Scientific 等組織合作,將模型應用於發現工作流程。
未來方向
此版本標誌著生命科學模型系列的第一個發布。OpenAI 計畫繼續擴展模型的生化推理能力,並支援長期且工具密集的工作流程。這包括與國家實驗室的持續合作,例如洛斯阿拉莫斯國家實驗室,以探索 AI 引導的蛋白質與催化劑設計,以及修改生物結構以改善其功能特性。
摘要: OpenAI 已推出 GPT-Rosalind,一個針對生物學、藥物發現與轉譯醫學優化的推理模型,以加速早期研究工作流程。
標題: GPT-Rosalind: OpenAI 的生命科學前沿推理模型