EvolvingLMMs-Lab/NEO
NEO Series: Native Vision-Language Models from First Principles
What it solves
NEO 解决了模组化视觉语言模型 (VLMs) 的局限性,通过创建一个统一像素与文字处理方式的原生架构。其目标是让原生 VLMs 更易于获取并实现民主化,在维持视觉感知高表现的同时,减少对海量图文数据的依赖。
How it works
NEO 利用了无编码器密集模型架构。它不使用针对不同模态的独立组件,而是采用一种原生 VLM primitive,在单一统一系统中处理像素-文字编码、对齐与推理。这使得模型能够从零开始发展出强大的视觉感知能力。
Who it’s for
此项目是为从事多模态模型研究与开发的 AI 研究人员与开发人员设计的,特别是那些对可扩展、具成本效益且无编码器原生视觉语言架构感兴趣的人士。
Highlights
Native Architecture: 在无编码器密集模型中统一了像素-文字编码、对齐与推理。
Superior Efficiency: 在使用不到典型图文数据的 10% 时,实现性能与顶级模组化 VLMs 相当。
Scalable Roadmap: 为构建强大的原生无编码器 VLMs 提供了一条路径。
Comprehensive Model Zoo: 在不同训练阶段 (NEO and NEO-ov) 提供 2B 和 9B 参数规模的模型。
相关
- 项目
- 项目
- 项目
- Dispatch
- Dispatch