EvolvingLMMs-Lab/NEO

NEO Series: Native Vision-Language Models from First Principles

What it solves

NEOは、モジュール式視覚言語モデル (VLMs) の限界を解決します。ピクセルと単語の処理方法を統一するネイティブなアーキテクチャを構築することで、これに対処します。ネイティブなVLMをより身近で民主的なものにし、高い視覚的知覚性能を維持しながら、膨大な画像-テキストデータの依存度を大量に削減することを目指しています。

How it works

NEOは、エンコーダーフリーの密なモデルアーキテクチャを利用しています。異なるモダリティのために個なる成分を使用する代わりに、ネイティブなVLM primitive を用いて、ピクセル-単語のエンコーディング、アライメント、および推論をすべて単一の統一されたシステム内で処理します。これにより、モデルはゼロから強力な視覚的知覚を発展させることができます。

Who it’s for

このプロジェクトは、マルチモーダルモデルに取り組むAI研究者や開発者、特にスケーラブルでコスト効率の高い、エンコーダーフリーのネイティブな視覚言語アーキテクチャに関心がある人々を対象としています。

Highlights

  • Native Architecture: エンコーダーフリーの密なモデルにおいて、ピクセル-単語のエンコーディング、アライメント、および推論を統一します。
  • Superior Efficiency: 典型的な画像-テキストデータの10%未満を使用しながら、トップティアのモジュール式VLMの性能に匹敵する性能を実現します。
  • Scalable Roadmap: 再利用可能なコンポーネントを使用して、強力なネイティブなエンコーダーフリーVLMを構築するためのパスを提供します。
  • Comprehensive Model Zoo: さまざまなトレーニング段階 (NEO and NEO-ov) において、2Bおよび9Bパラメータサイズのモデルを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch