sapientinc/HRM-Text
HRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.
해결하는 문제
HRM-Text는 처음부터 기반 모델을 사전 학습하는 데 따르는 높은 컴퓨팅 및 데이터 비용 문제를 해결합니다. 기존 스케일링 법칙이 제안하는 것보다 훨씬 적은 컴퓨팅(130600배 감소)과 데이터(150900배 감소)를 사용하여 1B 매개변수 텍스트 생성 모델을 생성할 수 있게 해주며, 훨씬 낮은 비용(약 $1,000)으로 기반 모델 사전 학습을 접근 가능하게 만듭니다.
작동 방식
이 프로젝트는 작업 완료 및 잠재 공간 추론으로 강화된 계층적 순환 아키텍처(HRM)를 구현합니다. 이 프레임워크는 훈련을 최적화하기 위해 여러 고성능 구성 요소를 활용합니다:
- 아키텍처: 표준 Transformer 래퍼 및 여러 재귀적 기준 모델을 포함하여 다양한 구성을 지원하는 계층적 순환 모델입니다.
- 훈련 파이프라인: 분산 훈련을 위해 PyTorch FSDP2를 사용하고, 어텐션 경로를 위해 FlashAttention 3 커널을 사용하며, 효율성을 높이기 위해 PrefixLM 시퀀스 패킹을 사용합니다.
- 데이터 처리: 사전 학습 코퍼스의 정제, 토큰화 및 계층적 샘플링을 위해 동반되는
data_io파이프라인과 통합됩니다. - 도구: 추론을 위한 컴파일된 생성 엔진, 표준 벤치마크(예: MMLU 및 GSM8k)를 위한 평가 스크립트, 체크포인트를 Hugging Face Transformers 형식으로 내보내는 변환 도구가 포함되어 있습니다.
대상 사용자
대규모 LLM에 일반적으로 필요한 막대한 인프라와 컴퓨팅 예산 없이도 자체 기반 모델을 처음부터 사전 학습하려는 AI 연구원 및 개발자를 위해 설계되었습니다.
주요 특징
- 극한의 효율성: 16개의 H100 GPU에서 약 46시간 만에 $1,500 미만으로 1B 모델을 사전 학습합니다.
- 고성능: 추론 및 지식 작업 전반에 걸쳐 경쟁력 있는 벤치마크 결과(예: XL 모델의 GSM8k 84.7%)를 달성합니다.
- 전체 라이프사이클 지원: 데이터 준비 및 사전 학습부터 평가 및 SFT(지도 미세 조정)에 이르기까지 완전한 파이프라인을 제공합니다.
- 유연한 아키텍처: 다양한 모델 크기(B부터 XXL까지)와 다양한 순환 및 Transformer 기반 아키텍처를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트