mbzuai-oryx/LLaVA-pp
🔥🔥 LLaVA++: Extending LLaVA with Phi-3 and LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
What it solves
LLaVA++ は、LLaVA 1.5 モデルの視覚的能力を拡張するために、LLaMA-3 や Phi-3 のような、より現代的で強力な大規模言語モデル (LLMs) と統合しています。これにより、指示に従う能力や、学術的なタスク指向の視覚的タスクにおけるパフォーマンスが向上します。
How it works
このプロジェクトは、LLaVA の視覚的アーキテクチャを Phi-3 Mini Instruct (3.8B) と LLaMA-3 Instruct (8B) と統合するためのフレームワークを提供します。LCS-558K データセットでの事前学習、および LLaVA-Instruct-665K データセットでの LoRA またはフルファインチューニング (S2 ファインチューニングを含む) を用いたファインチューニングを含む、複数のトレーニングステージをサポートしています。
Who it’s for
最新の LLM バックボーンに基づいたマルチモーダル AI モデルを使用またはトレーニングしたい、マルチモーダル AI 分野の開発者や研究者。
Highlights
- LLaMA-3 Instruct 8B と Phi-3 Mini Instruct 3.8B の統合。
- LoRA、フルファインチューニング、および S2 ファインチューニング手法のサポート。
- Model-Zoo に事前学習済みおよびファインチューニング済みモデルの重みを公開。
- モデルの事前学習およびファインチューニング用のスクリプトを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト