SmolVLM 256M と 500M リリースノート
Hugging Face は SmolVLM-256M と SmolVLM-500M をリリースしました。これらは、制約されたデバイス、コンシューマー ラップトップ、ブラウザベースの推論向けに設計された新しい軽量 Vision Language Model (VLM) です。256M モデルは現在世界最小の VLM ですが、17 か月前にリリースされた Idefics 80B モデルを上回る性能を示しています。
モデル バリアントと機能
2 つのモデル サイズが利用可能で、それぞれベース モデルと命令ファインチューン版として提供されます:
- SmolVLM-256M: 利用可能な最小の VLM で、画像および短いビデオのキャプション生成、ドキュメント Q&A (PDF とスキャン済みテキスト)、チャートおよび図を含む基本的な視覚的推論が可能です。
- SmolVLM-500M: 5 億パラメータ モデルで、より高いパフォーマンス ヘッドルームとプロンプトに対する堅牢性を提供し、すぐに使える本番利用に適しています。MMMU と DocVQA のパフォーマンスをより大きなモデルに近づけます。
SmolVLM 2B からの技術的改善
Hugging Face は、マルチモーダル性能を維持しながらフットプリントを削減するために、いくつかの設計トレードオフと最適化を実装しました:
ビジョン エンコーダーの最適化
SmolVLM 2B で使用されている SigLIP 400M SO エンコーダーの代わりに、これらのモデルは SigLIP base patch-16/512 (93M パラメータ) エンコーダーを使用します。テストの結果、より大きなエンコーダーはわずかな改善しかもたらさないことが示されました。小さいエンコーダーはまた、より高い解像度で画像を処理し、オーバーヘッドを最小限に抑えながら視覚的理解を向上させます。
データ ミックスの更新
トレーニング データは The Cauldron と Docmatix から取得し、MathWriting を追加しました。データの割合は次のように調整され、強調されました:
- Document Understanding: 41%
- Image Captioning: 14%
トークナイゼーションの強化
効率を向上させるため、モデルは現在 4096 ピクセル/トークン の割合で画像をエンコードします。これは 2B バージョンの 1820 ピクセル/トークンから増加しました。さらに、サブイメージ セパレーターのマルチトークン文字列を単一トークンに置き換える特別なトークンが導入されました(例: <row_1_col_1> から <row_6_col_6> までを単一トークンにマッピング)。これにより、トレーニングの安定性と結果の品質が向上しました。
エコシステムと統合
ColSmolVLM を用いたマルチモーダル検索
ColBERT 風の検索アーキテクチャを使用して、チームは ColSmolVLM 256M と 500M を開発しました。これらのモデルは、サイズの 10 倍のモデルに匹敵する性能を持ちながら最先端のマルチモーダル検索速度を提供し、検索可能なデータベースを構築するために必要なコストと時間を削減します。
SmolDocling を用いたドキュメント処理
IBM とのパートナーシップにより、Hugging Face はこれらのモデルを Docling に統合しています。初期の結果によると、256M モデルはドキュメント レイアウトとテーブル理解において非常に効果的であることが示されています。
デプロイとフレームワーク サポート
SmolVLM-256M と 500M は既存の SmolVLM コードと互換性があり、次のフレームワークをサポートします:
- Transformers: 推論とファインチューニングのための直接ロード。
- MLX: Apple Silicon に最適化。
- ONNX: WebGPU デモとブラウザベースの推論用のチェックポイントが提供されます。
- TRL: アライメントと Direct Preference Optimization (DPO) に対応。