Visual Salamandra 7B リリース
Visual Salamandra は、Salamandra 大規模言語モデル(LLM)を拡張し、画像と動画を処理できる 70 億パラメータのマルチモーダルモデルです。ヨーロッパ言語の表現をマルチモーダル枠組み内で優先的に扱う、コンパクトで効率的なビジョン・言語アラインメントソリューションを提供するよう設計されています。
技術アーキテクチャとビジョン・言語アラインメント
Visual Salamandra は、視覚モダリティとテキストモダリティのギャップを埋めるためにレイト・フュージョンアーキテクチャを採用しています。システムは Salamandra Instructed 7B モデルを基盤とし、以下のコンポーネントを統合しています。
- Vision Encoder: Google's SigLIP-So400m エンコーダーで、384x384 の解像度で 14 パッチの画像を処理します。
- Projector: カスタムトレーニングされた 2 層の多層パーセプトロン (MLP) で、エンコーダーからの画像埋め込みを LLM の潜在空間にマッピングします。
- Backbone: Salamandra Instructed 7B 基礎モデル。
4段階トレーニングプロセス
モデルは、堅牢なアラインメントと汎化を確保するために構造化された 4 段階のトレーニングパイプラインで開発されました。
- Projector Pre-training: 初期フェーズでは、MLP プロジェクタのトレーニングに専念し、画像特徴を LLM の潜在空間に合わせます。
- High-Quality Vision Pretraining: エンコーダー、プロジェクタ、LLM が、再キャプションされた画像や OCR データなどの洗練されたデータセットを用いて共同トレーニングを行います。
- Instruction Tuning: モデルは、光学文字認識 (OCR) やビジュアル質問応答 (VQA) などの実体化されたビジョンタスクを通じてユーザー指示に従うようにトレーニングされます。
- Full Multimodal Tuning: 最終フェーズでは、テキストのみの例、単一画像、複数画像、動画データを組み込むことで、実世界シナリオへの汎化を最適化します。
このプロセスを支えるために、ラボは 610 万件の指示チューニングインスタンス(うち 84 万2千件はテキストのみのサンプル)を使用し、LLaVA Next、Cambrian、AI2D などのデータセットから数学的推論、文書理解、ビジュアルグラウンディングの向上を図りました。
多言語サポートとヨーロッパ言語への焦点
Visual Salamandra は、言語的多様性をマルチモーダル指示チューニングフレームワークに直接組み込みます。ヨーロッパ言語に焦点を当てることで、マルチモーダル AI 研究において過小評価されている言語のリソース格差を埋め、支配的な言語と同等の指示チューニングとビジョンタスクのアラインメントの恩恵を受けられるようにします。
機能と応用例
Visual Salamandra は、多様な入力から文脈的に正確な応答を理解・生成できます。主な応用例は以下の通りです。
- Visual Question Answering (VQA): 画像や動画に関する質問に対し、文脈を考慮した回答を提供します。
- Optical Character Recognition (OCR): 図表、シーン、文書からテキストを転写します。
- Document and Chart Understanding: 埋め込まれたテキストを含むグラフィックコンテンツや複雑なビジュアル文書を解析します。
- Mathematical Reasoning: ビジュアルに基づく数学問題を解きます。
- Instruction-based Image Interaction: 詳細な指示に基づくローカリゼーションタスクや画像キャプション生成を行います。
- Video Analysis: モデルのアーキテクチャは、イベント検出、マルチモーダルストーリーテリング、動画要約などの将来的な展開をサポートします。
制限事項と倫理的考慮点
機能は多いものの、Visual Salamandra には以下のような既知の制限があります。
- Hallucinations: 視覚入力が曖昧な場合、モデルは妥当だが誤った回答を生成することがあります。
- OCR Complexity: 密集した文書レイアウトや高度に複雑な OCR タスクに対処する際、性能は依然として課題があります。
- Bias: フィルタリングされライセンスされたデータセットで訓練されているものの、モデルは依然としてバイアスや不正確さを示す可能性があります。
Visual Salamandra は、研究および非商用利用向けに Apache License Version 2.0 の下でリリースされています。
SUMMARY: Hugging Face の Language Technologies Lab は、ヨーロッパの言語多様性に焦点を当て、Salamandra LLM を拡張して画像と動画をサポートする 70 億パラメータのマルチモーダルモデル、Visual Salamandra をリリースしました。
TITLE: Visual Salamandra 7B リリース