InternLM/Intern-S1

A Scientific Multimodal Foundation Model

解決的問題

Intern-S 系列提供了一系列專門為科學智能和長程智能體任務設計的多模態基座模型。它解決了開源模型在處理複雜科學推理、解釋專業模態(如分子式和蛋白質序列)以及執行多步科學工作流方面的能力差距。

工作原理

該系列在不同的模型版本中採用了多種縮放和訓練策略:

  • 視覺預訓練: 像 Intern-S2-Preview-397B 這樣的模型直接從原始科學文獻頁面中學習,在沒有中間解析的情況下對符號語義和視覺關係進行建模。
  • 強化學習 (RL): 模型在 20 多個科學領域使用大規模多任務 RL,並在沙盒環境中透過黑盒智能體 RL 來提高通用推理和長程任務執行能力。
  • 架構變體: 該系列包括使用 STE 路由和分組路由以保持穩定性的兆級混合專家 (MoE) 模型 (Intern-S1-Pro),以及利用共享權重 MTP 和 CoT 壓縮來加速 Token 生成的高效中型模型 (Intern-S2-Preview-35B)。
  • 專業模態: 模型使用動態分詞器和傅立葉位置編碼 (FoPE) 來原生理解分子式、蛋白質序列和長異構時間序列訊號。

適用對象

  • 科學研究人員: 需要化學、材料科學、生命科學和地球科學 AI 助手的人員。
  • AI 開發人員: 構建用於科學工作流的長程智能體的工程師。
  • 機器學習研究人員: 研究專業領域多模態縮放和強化學習的研究人員。

亮點

  • 廣泛的科學覆蓋範圍: 在生物分子交互作用設計、材料晶體結構生成和化合物合成規劃方面具有專業能力。
  • 高效率: 35B 模型透過任務縮放,在核心科學任務上實現了與兆級模型相當的性能。
  • 海量訓練數據: Intern-S1 在 5 兆個 Token 上進行了預訓練,其中超過 2.5 兆個 Token 專門用於科學領域。
  • 多樣化的模型庫: 提供從輕量級 (Intern-S1-mini) 到兆級參數 MoE (Intern-S1-Pro) 的各種規模。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案