allenai/OLMo-core
PyTorch building blocks for the OLMo ecosystem
해결하는 문제
OLMo-core는 OLMo 제품군 대규모 언어 모델을 개발, 학습 및 추론하는 데 필요한 기초 빌딩 블록과 학습 인프라를 제공합니다. 공식 스크립트와 최적화된 하드웨어 커널과의 통합을 통해 고성능 모델 학습 프로세스를 단순화합니다.
작동 방식
이 라이브러리는 핵심 모델링 및 학습 프레임워크 역할을 합니다. FlashAttention, TransformerEngine, fused-linear loss를 위한 Liger-Kernel, float8 학습을 위한 torchao를 포함하여 메모리와 속도를 최적화하기 위해 여러 고성능 백엔드와 통합됩니다. 또한 grouped_gemm를 통해 Mixture-of-Experts (MoE) 모델을 지원합니다. 사용자는 torchrun 또는 Beaker CLI를 통해 공식 스크립트를 사용하여 학습을 시작할 수 있으며, Hugging Face Transformers, vLLM 또는 라이브러리 자체 내장 생성 도구를 통해 추론을 수행할 수 있습니다.
대상 사용자
이 프로젝트는 대규모 언어 모델을 처음부터 학습시키거나 기존 OLMo 체크포인트의 학습(annealing)을 계속하는 AI 연구자 및 엔지니어를 위해 설계되었습니다.
주요 특징
- 공식 학습 스크립트: OLMo-2 및 OLMo-3 모델 제품군을 위한 즉시 사용 가능한 스크립트 포함
- 하드웨어 최적화: float8 학습 및 저메모리 fused-linear loss 지원
- 유연한 추론: vLLM 및 Hugging Face Transformers와 같은 업계 표준 도구와 호환 가능
- MoE 지원: dropless mixture-of-experts 모델 기능 포함
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트