OpenGVLab/Ask-Anything

[CVPR2024 Highlight][VideoChatGPT] ChatGPT with video understanding! And many more supported LMs such as miniGPT4, StableLM, and MOSS.

解決する課題

Ask-Anything (VideoChat ファミリー) は、ビデオや画像の内容について自然言語で対話する方法を提供します。複雑なビデオ理解の課題を解決し、ユーザーがビデオの視覚的コンテンツに基づいて質問を行い、詳細な回答を受け取れるようにします。

仕組み

このプロジェクトは、異なる大規模言語モデル (LLM) バックエンドを利用した、いくつかのバージョンの VideoChat を実装しています。ビデオおよび画像チャット用に指示チューニングされた、エンドツーエンドのチャットボットアプローチを提供します。また、ChatGPT、StableLM、MOSS といった外部 LLM との明示的な通信に加え、MiniGPT-4 を介した Vicuna との暗黙的な通信もサポートしています。

対象者

マルチモーダル AI を研究している研究者や開発者、特にビデオ理解、ビデオ言語モデル、および視覚メディアのためのエンドツーエンドの対話型 AI に興味がある方を対象としています。

ハイライト

  • 複数のモデルバリアント: VideoChat、VideoChat2、VideoChat3 を含み、高解像度データ用の VideoChat2_HD や高速化のための VideoChat2_phi3 などの特化型バージョンも備えています。
  • 指示チューニング: 効果的なチューニングのために、200万件の多様な指示データを含む大規模なデータセットを使用しています。
  • 幅広い LLM サポート: ChatGPT、StableLM、MOSS、Vicuna を含む様々なバックエンドと互換性があります。
  • 包括的なベンチマーク: ビデオ理解のための包括的なベンチマークである MVBench を含んでいます。
  • 長尺ビデオのサポート: LangChain と Whisper を組み込み、1分以上のビデオを処理できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト