EvolvingLMMs-Lab/NEO

NEO Series: Native Vision-Language Models from First Principles

What it solves

NEO 解決了模組化視覺語言模型 (VLMs) 的局限性,透過建立一個統一像素與文字處理方式的原生架構。其目標是讓原生 VLMs 更易於取得並實現民主化,在維持視覺感知高表現的同時,減少對海量圖文數據的依賴。

How it works

NEO 利用了無編碼器密集模型架構。它不使用針對不同模態的獨立組件,而是採用一種原生 VLM 原語,在單一統一系統中處理像素-文字編碼、對齊與推理。這使得模型能夠從零開始發展出強大的視覺感知能力。

Who it’s for

此專案是為從事多模態模型研究與開發的 AI 研究人員與開發者設計的,特別是那些對可擴展、具成本效益且無編碼器的原生視覺語言架構感興趣的人士。

Highlights

  • Native Architecture: 統一了無編碼器密集模型中的像素-文字編碼、對齊與推理。
  • Superior Efficiency: 在使用不到典型圖文數據的 10% 時,實現了與頂尖模組化 VLMs 相當的性能。
  • Scalable Roadmap: 為建立強大的原生無編碼器 VLMs 提供了一條路徑。
  • Comprehensive Model Zoo: 在不同訓練階段 (NEO and NEO-ov) 提供 2B 和 9B 參數規模的模型。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • Dispatch