EvolvingLMMs-Lab/NEO
NEO Series: Native Vision-Language Models from First Principles
What it solves
NEO는 모듈형 시각-언어 모델(VLMs)의 한계를 해결하기 위해 픽셀과 단어의 처리 방식을 통합하는 네이티브 아키텍처를 구축합니다. 높은 시각적 인지 성능을 유지하면서 방대한 양의 이미지-텍스트 데이터에 대한 의존도를 낮추어, 네이티브 VLM을 더 쉽게 접근 가능하고 민주화하는 것을 목표로 합니다.
How it works
NEO는 인코더 프리(encoder-free) 밀집 모델 아키텍처를 활용합니다. 서로 다른 모달리티를 위해 별도의 구성 요소를 사용하는 대신, 픽셀-단어 인코딩, 정렬, 추론을 모두 단일 통합 시스템 내에서 처리하는 네이티브 VLM primitive를 사용합니다. 이를 통해 모델이 처음부터 강력한 시각적 인지 능력을 개발할 수 있습니다.
Who it’s for
이 프로젝트는 멀티모달 모델을 연구하는 AI 연구자 및 개발자를 위해 설계되었습니다. 특히 확장 가능하고 비용 효율적이며 인코더 프리(encoder-free) 네이티브 시각-언어 아키텍처에 관심이 있는 분들을 대상으로 합니다.
Highlights
- Native Architecture: 인코더 프리(encoder-free) 밀집 모델에서 픽셀-단어 인코딩, 정렬 및 추론을 통합합니다.
- Superior Efficiency: 일반적인 이미지-텍스트 데이터의 10% 미만을 사용하면서도 최상위권 모듈형 VLMs에 필적하는 성능을 달성합니다.
- Scalable Roadmap: 재사용 가능한 구성 요소를 사용하여 강력한 네이티브 인코더 프리(encoder-free) 네이티브 시각-언어 VLM을 구축할 수 있는 경로를 제공합니다.
- Comprehensive Model Zoo: 다양한 학습 단계(NEO and NEO-ov)에 걸쳐 2B 및 9B 파라미터 크기의 모델을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch