Anthropic Claude Opus 4.7 化學版本發布:NMR 預測與結構解析
簡要重點
Claude Opus 4.7 在正向預測準確度上達到或超越專用 NMR 工具(如 ChemDraw 和 MestReNova)的水準,並能從 1D NMR 譜圖與分子式中提出正確的分子結構,顯示通用型大語言模型如今已具備與傳統譜圖分析競爭的能力。
為何 NMR 對化學至關重要
化學家依賴 NMR 光譜來推斷分子結構,因為大多數小分子無法直接觀測。解析 NMR 譜圖需要將每個峰與特定原子對應,這是一項耗時的步驟,會拖慢合成研究進程。自動化此步驟將加速新藥開發、材料設計,以及許多依賴快速結構驗證的領域。
正向預測表現
結論: Opus 4.7 在 ¹H 化學位移上的平均絕對誤差(MAE)最低(±0.079 ppm),在 ¹³C 位移上與 MestReNova 持平(±1.37 ppm),優於舊版 Claude 模型,並與專用軟體表現相當。
- 基準資料集: 來自後截止 ChemRxiv 預印本的 20 種新化合物,涵蓋四種不同骨架家族,每種都帶來獨特的 NMR 挑戰。
- 方法: 每個工具接收 SMILES 字串與溶劑資訊,並預測完整的 ¹H 和 ¹³C 譜圖。Claude 模型針對每種化合物進行三次查詢,結果取平均。
- 誤差指標: 若峰落在 ±0.20 ppm(¹H)或 ±1.0 ppm(¹³C)範圍內,即視為正確。Opus 4.7 在此範圍內的峰比例最高。
- 峰形與分裂: 除了化學位移準確度,Opus 4.7 比 ChemDraw 或 MestReNova 更常重現實驗分裂模式,且在約 80 % 的情況下預測次峰間距在半赫茲以內(對比傳統工具僅 26–35 %)。
*圖 1. 選取的骨架家族,用以探測不同的 NMR 挑戰。
*圖 2. 各工具在 ¹H(左)與 ¹³C(右)位移上的平均絕對誤差(深色)與均方根誤差(淺色)。
反向預測(結構解析)
結論: Opus 4.7 僅憑譜圖與分子式,正確識別出全部八種簡單分子;當額外提供反應起始物的 SMILES 作為提示時,七個較複雜目標中有四個在每次運行中均成功解析。
- 任務設計: 15 種文獻化合物提供其精確分子式、¹H 與 ¹³C 譜圖,對七個最困難案例還提供反應起始物的 SMILES。
- 輸出: 對每道題目,Claude 回傳最多三個排序後的候選結構,並進行三次查詢。
- 結果: 簡單目標(單環或兩片段)成功解析率達 100 %。對於結構密集的目標,當提供起始物背景資訊時,成功率為 100 %(四個化合物)或 66 %(兩個化合物)。
*圖 3. 各反向預測問題的成功次數;綠色邊框 = 僅譜圖 + 分子式,藍色邊框 = 譜圖 + 分子式 + 起始物提示。
當前研究的限制
結論: 基準測試規模小且範圍狹窄,因此結果僅具參考價值,而非定論。
- 資料集規模: 僅測試 20 種正向預測與 15 種反向預測化合物,每種代表單一骨架類別。
- 輸入限制: 最困難的反向任務需提供起始物 SMILES;若無此提示,模型難以收斂至單一結構。
- 化學多樣性: 某些雜環 NH 系統、立體化學資訊,以及 2D NMR 實驗(COSY、HSQC、HMBC)未納入評估。
- 溶劑覆蓋範圍: 測試僅限 DMSO‑d₆、CDCl₃ 和 D₂O;其他常見氘代溶劑尚未評估。
- 可擴展性: 在 20–30 個骨架家族中處理數百種化合物的表現仍為開放問題。
Claude 在化學領域的未來發展路徑
結論: Anthropic 將優先解決四個瓶頸——結構數位化、反應推理、機制解釋與文獻理解,以擴展 Claude 在譜圖分析以外的應用。
- 結構萃取: 將手繪草圖、專利圖像與簡報圖片轉換為機器可讀格式(SMILES、InChI),並生成系統性 IUPAC 名稱。
- 合成規劃: 提出、評估與批判合成路徑,包含試劑選擇、選擇性預測與副產物預測。
- 機制洞察: 以化學家易懂的語言,用電子推移箭頭、中間體結構與過渡態推理,解釋反應途徑。
- 文獻挖掘: 解析方法章節、補充資訊與專利,無論命名慣例或圖形表示為何,皆能提取相關化學資料。
這些領域成熟度各異;譜圖分析最為成熟,因此最先進行基準測試,而逆合成與機制推理仍處於規劃階段。
如何合作
Anthropic 正擴展其 AI for Science 計畫,以支援可受益於 Claude 多模態推理的化學專案。有興趣合作的研究人員可透過計畫頁面申請,或致電 scienceblog@anthropic.com 聯絡。
參考文獻
Sources
- OriginalMaking Claude a chemist
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch