OpenAI 與 Retro Biosciences:以 GPT-4b micro 加速生命科學
OpenAI 與 Retro Biosciences 開發了 GPT-4b micro,這是 GPT-4o 的專門微型版本,旨在用於蛋白質工程。與 Retro Biosciences 合作,該模型被用於重新設計參與幹細胞重編程的蛋白質,產生的重新設計蛋白質在幹細胞重編程標誌物的表達上比野生型對照高出超過 50 倍,且顯示出增強的 DNA 損傷修復能力。
GPT-4b micro:用於蛋白質工程的專門模型
GPT-4b micro 是一個自縮小版 GPT-4o 初始化的自訂模型,並在包含蛋白質序列、生物文本以及已標記的 3D 結構資料的資料集上進一步訓練。此架構使模型能同時處理結構化蛋白質與具有本質無序區域的蛋白質,例如 Yamanaka 因子。
技術訓練與資料增強
為了提升可控性與彈性,訓練資料加入了以下增強內容:
- Contextual Information:蛋白質的文字描述。
- Co-evolutionary Homologous Sequences:相關蛋白質序列的資料。
- Interaction Groups:已知相互作用蛋白質的資訊。
此增強提升了訓練範例的有效上下文長度。在推論時,模型支援高達 64,000 個 token 的提示,這樣的上下文大小在蛋白質序列模型中前所未有。
規模定律與驗證
OpenAI 觀察到類似於語言模型的規模定律,即較大的模型與資料集會在困惑度與下游基準測試上帶來可預測的提升。然而,由於 in silico 評估往往不足以證明實際效用,模型的能力透過與 Retro Biosciences 合作的濕實驗室實驗進行驗證。
AI 輔助的 Yamanaka 因子重新設計
Yamanaka 因子(OCT4、SOX2、KLF4 與 MYC,或稱 OSKM)是將成年細胞重新編程為多能幹細胞的關鍵。然而,標準的 OSKM 重編程通常效率低下,轉換率低於 0.1%,且過程需三週或更長時間。
克服設計空間挑戰
傳統的「定向演化」篩選受限於可能變異體的數量,例如 SOX2(317 個胺基酸)與 KLF4(513 個胺基酸)的變異體約為 10^1000。先前的學術研究,無論是數千個突變體或是長達 15 年的嵌合蛋白研究,僅取得有限的進展。
RetroSOX 與 RetroKLF 篩選結果
透過使用人類成纖維細胞的濕實驗室篩選平台,Retro Biosciences 利用 GPT-4b micro 提出「RetroSOX」序列。結果顯示:
- High Hit Rate:模型超過 30% 的建議在關鍵多能性標誌物的表達上優於野生型 SOX2,而傳統篩選的命中率通常低於 10%。
- Deep Sequence Edits:成功的變異體平均比野生型多出超過 100 個胺基酸。
- Accelerated Reprogramming:結合最佳的 RetroSOX 與 RetroKLF 變異體,使早期(SSEA-4)與晚期(TRA-1-60、NANOG)標誌物顯著提升,且晚期標誌物出現的時間比野生型 OSKM 混合物提前數天。
跨細胞類型與遞送方式的驗證
為了測試臨床潛力,團隊使用 mRNA 遞送(取代病毒載體)以及來自三位中年(超過 50 歲)人類捐贈者的間充質基質細胞(MSCs)進行測試。結果包括:
- Rapid Expression:在 7 天內,超過 30% 的細胞表達多能性標誌物(SSEA4 與 TRA-1-60)。
- High Activation:至第 12 天,超過 85% 的細胞激活內源性 OCT4、NANOG、SOX2 與 TRA-1-60 的表達。
- Stability:產生的 iPSC 能分化為三個主要胚層,且保持健康的染色體核型與基因組穩定性。
增強的 DNA 損傷修復與復原
除了重編程效率外,研究人員還透過檢視這些工程變異體恢復老化細胞年輕特徵的能力,特別是 DNA 損傷(老化的標誌)來探討其復原潛力。
在使用 $\gamma$-H2AX 免疫染色量化雙股斷裂的 DNA 損傷測試中,接受 RetroSOX/KLF 雜湊處理的細胞 $\gamma$-H2AX 強度顯著低於使用標準 OSKM 或螢光對照重編程的細胞。此結果顯示,工程變異體比原始 Yamanaka 因子更有效降低 DNA 損傷,暗示有望開發更佳的細胞復原療法。