volotat/mini-AGI
Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data.
해결하는 문제
mini-AGI는 훈련 후 동결되는 기존 대규모 언어 모델(LLM)의 한계를 극복하도록 설계되었습니다. 모델이 새 데이터로 훈련될 때 이전 지식을 잃는 "파괴적 망각" 문제를 해결합니다. 또한 하드웨어 장벽을 해결하여 사용자가 필요에 따라 디스크에서 VRAM으로 가중치를 이동하여 단일 소비자급 GPU(8GB VRAM)에서 언어 모델을 처음부터 훈련할 수 있게 합니다.
작동 방식
이 프로젝트는 지속적 학습을 가능하게 하는 독특한 아키텍처를 가진 바이트 수준 언어 모델을 구현합니다.
페이징 시스템: 8GB VRAM에 맞추기 위해 모델은 전문가(가중치 및 Adam 모멘트)를 디스크의 파일로 저장하고, 모델이 다가오는 텍스트에 필요할 것으로 예측하는 것에 따라 VRAM(작업 세트)으로 페이징합니다.
전문가가 있는 순환 블록: 고정된 레이어 스택 대신 두 개의 밀집 전주곡 블록과 최대 24회 적용되는 순환 블록을 사용합니다. 블록을 적용할 때마다 공유 풀에서 상위 8개 전문가를 선택합니다.
적응형 깊이: 중지 헤드가 문자가 처리를 중지하는 시점을 결정합니다. 간단한 문자는 계산 행이 적고 복잡한 문자는 더 많이 필요합니다.
지속적 학습 메커니즘: 망각을 방지하기 위해 모델은 전문가와 비교하여 "트렁크"(임베딩, 어텐션, 라우터 및 중지 헤드)에 훨씬 낮은 학습률을 사용합니다. 이는 업데이트를 라우팅이 선택한 특정 전문가로 제한하여 모델의 나머지를 보존합니다.
바이트 수준 처리: 256바이트 값으로 작동하여 토크나이저가 필요 없으며 모든 파일 유형을 읽을 수 있습니다.
대상 사용자
현장 훈련 및 지속적 학습에 관심이 있고 적절한 하드웨어 설정(최소 8GB VRAM GPU를 갖춘 PC 또는 노트북)에 액세스할 수 있는 개발자 및 AI 연구자.
하이라이트
- 지속적 학습: 파괴적 망각 없이 단일 데이터 스트림에서 학습할 수 있습니다.
- 디스크 기반 가중치 저장: 매개변수 수는 VRAM이 아닌 디스크 공간에 의해 제한됩니다.
- 자체 조립 아키텍처: 모델은 기존 전문가의 재조합을 통해 새 전문가를 성장시키고 사용하지 않는 전문가를 정리합니다.
- 엔드투엔드 훈련: 훈련과 읽기는 동일한 프로세스이며 별도의 미세 조정 체제가 없습니다.
- 직접 파일 읽기: 사용자는 모델을 자신의 파일이나 디렉토리로 지정하여 특정 지식을 가르칠 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트