InternLM/Intern-S1
A Scientific Multimodal Foundation Model
解决的问题
Intern-S 系列提供了一系列专门为科学智能和长程智能体任务设计的多模态基座模型。它解决了开源模型在处理复杂科学推理、解释专业模态(如分子式和蛋白质序列)以及执行多步科学工作流方面的能力差距。
工作原理
该系列在不同的模型版本中采用了多种缩放和训练策略:
- 视觉预训练: 像 Intern-S2-Preview-397B 这样的模型直接从原始科学文献页面中学习,在没有中间解析的情况下对符号语义和视觉关系进行建模。
- 强化学习 (RL): 模型在 20 多个科学领域使用大规模多任务 RL,并在沙盒环境中通过黑盒智能体 RL 来提高通用推理和长程任务执行能力。
- 架构变体: 该系列包括使用 STE 路由和分组路由以保持稳定性的万亿级混合专家 (MoE) 模型 (Intern-S1-Pro),以及利用共享权重 MTP 和 CoT 压缩来加速 Token 生成的高效中型模型 (Intern-S2-Preview-35B)。
- 专业模态: 模型使用动态分词器和傅里叶位置编码 (FoPE) 来原生理解分子式、蛋白质序列和长异构时间序列信号。
适用对象
- 科学研究人员: 需要化学、材料科学、生命科学和地球科学 AI 助手的人员。
- AI 开发人员: 构建用于科学工作流的长程智能体的工程师。
- 机器学习研究人员: 研究专业领域多模态缩放和强化学习的研究人员。
亮点
广泛的科学覆盖范围: 在生物分子相互作用设计、材料晶体结构生成和化合物合成规划方面具有专业能力。
高效率: 35B 模型通过任务缩放,在核心科学任务上实现了与万亿级模型相当的性能。
海量训练数据: Intern-S1 在 5 万亿 Token 上进行了预训练,其中超过 2.5 万亿 Token 专门用于科学领域。
多样化的模型库: 提供从轻量级 (Intern-S1-mini) 到万亿参数 MoE (Intern-S1-Pro) 的各种规模。
相关
- 项目
- 项目
- 项目
- 项目
- 项目