EvolvingLMMs-Lab/NEO
NEO Series: Native Vision-Language Models from First Principles
What it solves
NEOは、モジュール式視覚言語モデル (VLMs) の限界を解決します。ピクセルと単語の処理方法を統一するネイティブなアーキテクチャを構築することで、これに対処します。ネイティブなVLMをより身近で民主的なものにし、高い視覚的知覚性能を維持しながら、膨大な画像-テキストデータの依存度を大量に削減することを目指しています。
How it works
NEOは、エンコーダーフリーの密なモデルアーキテクチャを利用しています。異なるモダリティのために個なる成分を使用する代わりに、ネイティブなVLM primitive を用いて、ピクセル-単語のエンコーディング、アライメント、および推論をすべて単一の統一されたシステム内で処理します。これにより、モデルはゼロから強力な視覚的知覚を発展させることができます。
Who it’s for
このプロジェクトは、マルチモーダルモデルに取り組むAI研究者や開発者、特にスケーラブルでコスト効率の高い、エンコーダーフリーのネイティブな視覚言語アーキテクチャに関心がある人々を対象としています。
Highlights
- Native Architecture: エンコーダーフリーの密なモデルにおいて、ピクセル-単語のエンコーディング、アライメント、および推論を統一します。
- Superior Efficiency: 典型的な画像-テキストデータの10%未満を使用しながら、トップティアのモジュール式VLMの性能に匹敵する性能を実現します。
- Scalable Roadmap: 再利用可能なコンポーネントを使用して、強力なネイティブなエンコーダーフリーVLMを構築するためのパスを提供します。
- Comprehensive Model Zoo: さまざまなトレーニング段階 (NEO and NEO-ov) において、2Bおよび9Bパラメータサイズのモデルを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- Dispatch