lucidrains/x-transformers
A concise but complete full-attention transformer with a set of promising experimental features from various papers
해결하는 문제
다양한 학술 논문에서 제안한 실험적 기능들을 직접 구현하지 않고도 모델에 쉽게 통합할 수 있도록, 간결하고 기능이 풍부한 Transformer 아키텍처의 구현을 제공합니다.
작동 방식
간단한 키워드 인자로 구성 가능한 유연한 래퍼와 모듈(XTransformer, TransformerWrapper, Encoder, Decoder)을 제공합니다. 전체 인코더-디코더, 디코더 전용(GPT 유사), 인코더 전용(BERT 유사), 비전 트랜스포머(ViT) 설정을 모두 지원합니다. 메모리 효율성과 속도를 높이는 Flash Attention과 같은 고급 최적화를 통합하고, 이미지 캡셔닝 및 언어-비전 모델(PaLI 등)과 같은 다중 모달 작업도 지원합니다.
대상 사용자
다양한 Transformer 변종, 정규화 기법, 어텐션 메커니즘을 실험하여 모델 성능이나 효율성을 향상시키고자 하는 AI 연구자 및 머신러닝 엔지니어.
주요 특징
- 다양한 아키텍처 지원: 인코더 전용, 디코더 전용, 전체 인코더-디코더 구성 지원.
- 실험적 어텐션 기능: 지속적 메모리 KV, 메모리 토큰(레지스터 토큰), 토크 헤드 어텐션, 스파스 top-k 어텐션 포함.
- 고급 정규화: RMSNorm, SimpleRMSNorm, ScaleNorm, L2 정규화된 임베딩 구현.
- 효율성 최적화: Flash Attention 및 다중 쿼리/그룹 쿼리 어텐션(1개의 KV 헤드) 통합 지원.
- 피드포워드 개선: GLU 변종(GELU, Swish), ReLU², 바이어스 없는 피드포워드 레이어 지원.
- 비전 통합: 이미지 분류 및 다중 모달 작업용
ViTransformerWrapper포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트