facebookresearch/PhysicsLM4
Physics of Language Models: Part 4.2, Canon Layers at Scale where Synthetic Pretraining Resonates in Reality
해결하는 문제
이 프로젝트는 언어 모델의 물리학 시리즈의 연구 코드와 데이터를 제공하며, 대규모 언어 모델(LLM)의 아키텍처를 개선하기 위한 "Canon 레이어" 설계에 초점을 맞춥니다. 합성 사전 훈련 실험과 실제 성능 사이의 격차를 메우고, 특정 아키텍처 변경이 모델의 능력과 지식 저장 능력을 어떻게 향상시킬 수 있는지 보여줍니다.
작동 방식
이 리포지토리는 몇 가지 핵심적인 아키텍처 변경을 구현하고, 그 결과를 재현할 수 있는 도구를 제공합니다:
- Canon 레이어: Transformer 기반 모델(예: Llama)과 선형 모델(예: GLA, GDN, Mamba2) 모두에 적용 가능한 "Canon-ABCD" 및 "Canon-AbCd" 레이어를 구현합니다.
- 모델 구현:
LlamaCanon과 같은 Hugging Face 호환 모델을 제공하며, QK-norm 및 부분 RoPE 지원을 포함합니다. - 최적화된 훈련: 효율적인 사전 훈련을 위해 Meta의 Lingua 코드베이스를 수정한 버전을 사용하며, z-loss 및 기타 안정성 향상 기능을 통합합니다.
- 합성 및 실제 데이터: 합성 데이터셋(Depo, Brevo, Capo, Mano, Lano) 생성기와 실제 평가 벤치마크(다단계, Babilong)를 제공하여 모델의 지식 검색 및 저장 능력을 테스트합니다.
대상 사용자
이 프로젝트는 LLM의 기본 아키텍처 설계, 스케일링 법칙, 모델이 계층적 구조를 학습하고 지식을 저장하는 방식(물리학)에 관심이 있는 AI 연구자 및 실무자에게 주로 대상입니다.
주요 특징
- 아키텍처 혁신: Transformer 및 선형 모델 양쪽에 Canon 레이어를 도입합니다.
- 포괄적인 벤치마크: 16개의 Llama 기반 모델과 48개의 선형 모델에 대한 학습 레시피 및 가중치를 제공합니다.
- 크로스오버 검증: 합성 사전 훈련 결과를 실제 사전 훈련 환경에서 검증합니다.
- 통합성: Hugging Face 및 Meta의 Lingua 프레임워크와 원활하게 통합됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트