bytedance/Lance

A 3B-active-parameter native unified multimodal model for image and video understanding, generation, and editing.

何を解決するか

Lanceは、複数のマルチモーダルタスクを処理できる単一で効率的なモデルを構築するという課題に対処します。異なるニーズに応じて別々のモデルを使用するのではなく、画像および動画の理解、生成、編集を統合したフレームワークを提供します。

動作方法

Lanceは、30億のアクティブパラメータを持つネイティブな統合マルチモーダルモデルです。最大128台のA100 GPUを用いた予算内で、段階的なマルチタスク手法に基づいてゼロから訓練されました。テキストから画像生成(T2I)、テキストから動画生成(T2V)、画像から動画生成(I2V)、画像/動画の編集、視覚的理解(キャプション生成および質問応答)など、幅広いタスクをサポートしています。

対象ユーザー

このプロジェクトは、主に研究用のアーティファクトであり、統合マルチモーダルモデリングを研究している研究者や開発者を対象としています。特に、比較的小さなモデルサイズと限られた計算リソースで、画像および動画タスクにおいて高いパフォーマンスを達成したいと考えている人向けです。

主な特徴

  • 統合された機能: 1つのモデルで画像/動画の生成、編集、理解をサポート。
  • 効率的なスケーリング: ベンチマークで競争力を持つのに3Bのアクティブパラメータのみを必要とする。
  • 多様なタスク対応: テキストから動画(T2V)、画像から動画(I2V)、テキストから画像(T2I)、複数ターンの一貫性編集を処理可能。
  • 研究用に最適化: ファインチューニングコードを含み、vLLM-Omniによってサポートされています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト