OpenGVLab/VideoChat-Flash

[ICLR2026] VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

何を解決するか

VideoChat-Flashは、3時間に及ぶ超長動画を処理する際の高速かつ高精度な推論を維持しながら、計算効率の悪さという課題に対処します。長文脈動画モデリングにおける計算の非効率性を解消するために、動画フレームを表現するためのトークン数を削減します。

動作方法

このプロジェクトは、各動画フレームをわずか16トークンに圧縮する階層的圧縮アーキテクチャを実装しています。このアプローチにより、最大10,000フレームの巨大な入力を処理しつつ、従来のバージョンよりも5〜10倍高速に動作します。動画エンコーダー(InternVideo)と大規模言語モデル(Qwen)を組み合わせて構築されています。

対象ユーザー

このモデルは、長時間動画理解、時系列局所化、高効率動画分析に特化したマルチモーダル大規模言語モデル(MLLM)の研究開発に従事する研究者や開発者向けです。

主な特徴

  • 超長文脈対応:最大3時間の動画を処理可能。
  • 高い効率性:フレームを16トークンに圧縮し、推論速度を大幅に向上。
  • 優れた検索性能:10,000フレームにおける「針の山の中の針」評価で99.1%の精度を達成。
  • 多様なモデル選択肢:2Bおよび7Bの複数のモデルサイズと、超長動画入力用や短期時系列理解用の専用バージョンを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト