InternLM/Intern-S1
A Scientific Multimodal Foundation Model
해결하는 문제
Intern-S 시리즈는 과학적 인텔리전스 및 장기적 에이전트 작업을 위해 특별히 설계된 멀티모달 파운데이션 모델 컬렉션을 제공합니다. 이는 오픈 소스 모델이 복잡한 과학적 추론을 처리하고, 전문적인 모달리티(분자식 및 단백질 서열 등)를 해석하며, 다단계 과학 워크플로를 실행하는 능력의 격차를 해결합니다.
작동 방식
이 시리즈는 다양한 모델 버전에 걸쳐 여러 스케일링 및 학습 전략을 채택합니다:
- 시각적 사전 학습: Intern-S2-Preview-397B와 같은 모델은 가공되지 않은 과학 문헌 페이지에서 직접 학습하여, 중간 파싱 없이 기호적 의미론과 시각적 관계를 모델링합니다.
- 강화 학습 (RL): 모델은 20개 이상의 과학 분야에 걸친 대규모 멀티태스크 RL과 샌드박스 환경에서의 블랙박스 에이전트 RL을 사용하여 일반적인 추론 및 장기적 작업 실행 능력을 향상시킵니다.
- 아키텍처 변형: 이 시리즈에는 안정성을 위해 STE 라우팅과 그룹화 라우팅을 사용하는 조 단위의 Mixture-of-Experts (MoE) 모델 (Intern-S1-Pro)과, 토큰 생성을 가속화하기 위해 공유 가중치 MTP 및 CoT 압축을 활용하는 효율적인 중간 규모 모델 (Intern-S2-Preview-35B)이 포함됩니다.
- 전문 모달리티: 모델은 동적 토크나이저와 Fourier Position Encoding (FoPE)을 사용하여 분자식, 단백질 서열 및 긴 이질적 시계열 신호를 네이티브하게 이해합니다.
대상
- 과학 연구자: 화학, 재료 과학, 생명 과학 및 지구 과학을 위한 AI 어시스턴트가 필요한 연구자.
- AI 개발자: 과학적 워크플로를 위한 장기적 에이전트를 구축하는 엔지니어.
- ML 연구자: 전문 분야를 위한 멀티모달 스케일링 및 강화 학습을 연구하는 연구자.
하이라이트
- 광범위한 과학적 커버리지: 생체 분자 상호작용 설계, 재료 결정 구조 생성 및 화합물 합성 계획에 특화된 역량.
- 높은 효율성: 35B 모델은 태스크 스케일링을 통해 핵심 과학 작업에서 조 단위 모델에 필적하는 성능을 달성합니다.
- 방대한 학습 데이터: Intern-S1은 5조 개의 토큰으로 사전 학습되었으며, 그 중 2.5조 개 이상이 과학 분야에 특화되어 있습니다。
- 다양한 모델 zoo: 경량 모델 (Intern-S1-mini)부터 조 단위 파라미터의 MoE (Intern-S1-Pro)까지 다양한 크기를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트