OpenEnvision/Awesome-Multimodal-Modeling
Awesome Multimodal Modeling [Covers MLLM, UMM, and NMM]
📚 Awesome‑Multimodal‑Modeling 는 무엇인가요?
Awesome‑Multimodal‑Modeling 는 큐레이팅된, 커뮤니티가 유지하는 리스트로, 다중 모달 기계학습 모델의 전체적인 풍경을 조사합니다 — 이미지 + 텍스트와 같이 여러 유형의 데이터를 처리하는 시스템을 말합니다. 이 리포지토리는 단일 모델의 코드를 포함하지 않습니다. 대신, 현대 연구가 다중 모달 아키텍처에 대해 어떻게 생각하는지를 반영하는 명확한 분류 체계에 논문, 모델 컬렉션, 리소스를 정리합니다.
🎯 목표 및 대상 독자
- 목표: 연구자, 학생, 엔지니어가 어떤 모델이 존재하는지, 아키텍처상의 차이점은 무엇인지, 그리고 구현은 어디에서 찾을 수 있는지 (대부분 Hugging Face에서) 한 곳에서 확인할 수 있도록 하는 것입니다. 또한 나중에 출간될 단기적인 "서베이 페퍼"의 진행 상황도 추적합니다.
- 대상 독자: 초기 융합 모델(예: CLIP)에서 최신의 네이티브 다중 모달 모델(스クラ치에서 훈련된 모델)로의 진화를 이해하고 싶은 사람, 그리고 즉시 사용 가능한 모델 컬렉션을 찾는 개발자들입니다.
🗂️ 리스트의 구조
| 섹션 | 포함 내용 |
|---|---|
| 1️⃣ 소개 및 정의 | 네 가지 모델 패밀리에 대한 정확하고 아키텍처 중심의 정의: • Traditional (2023년 이전의 융합 중심) • 다중 모달 대규모 언어 모델 (MLLMs) – 사전 훈련된 비전 인코더 + 사전 훈련된 LLM을 연결한 모델 • 통합 다중 모달 모델 (UMMs) – 하나의 프레임워크로 다양한 모달리티에서 이해 및 생성이 가능한 모델 • 네이티브 다중 모달 모델 (NMMs) – 모든 모달리티에 대해 스クラ치에서 훈련된 모델 (초기 융합 또는 후기 융합) |
| 2️⃣ Traditional Multimodal Models | 다중 모달 표현, 정렬, 사전 훈련에 관한 논문 (예: CLIP, ALIGN, ViLBERT, BLIP) |
| 3️⃣ MLLMs | 시각 어댑터 유형 기반 분류 (MLP 프로젝터, Q‑Former, 크로스 어텐션, 하이브리드). LLaVA, Qwen‑VL, InternVL, MiniCPM‑V, CogVLM 등 주목할 만한 모델 목록 |
| 4️⃣ Unified Multimodal Models (UMMs) | 생성 파라다임(디퓨전 기반, 자기회귀, 하이브리드)과 "어떤 모달리티에서 어떤 모달리티로든 변환 가능한" 능력 기반 분류 |
| 5️⃣ Native Multimodal Models (NMMs) | 설계 분석, 스케일링 법칙 논의, 구체적인 초기 융합(예: Emu3) 및 후기 융합 예시 |
| 6️⃣ 폐쇄형 모델 | 2023–2026년 사이의 프로퍼리에타리 다중 모달 시스템의 시계열 목록 |
| 7️⃣ 리소스 | 관련 awesome 리스트, 서베이 슬라이드, 코드 리포지토리, 도구 링크 |
🔧 기여 방법
- PR 환영 – 리포지토리는 간단한 검증 규칙 세트를 사용합니다 (항목은 신뢰할 수 있는 출처가 있어야 하며, 분류에 부합하고 일관된 형식을 가져야 함). 항목 템플릿은 How to Contribute 섹션을 참조하세요.
- 모델 동물원 – 유지보수 팀은 Hugging Face에 두 가지 컬렉션(UMM Zoo 및 NMM Zoo)을 운영하며, 오픈소스 구현으로 직접 링크합니다.
📢 최근 소식 (2026년 Q3 기준)
- Hugging Face에 새로운 두 가지 모델 컬렉션 출시: Unified Multimodal Model Zoo 및 Native Multimodal Model Zoo.
- 2026년 4월 런칭 후 하루 만에 100⭐ 달성.
- 본 분류 기반의 포괄적인 서베이 페퍼가 곧 출간될 예정입니다.
📚 왜 중요한가요?
다중 모달 AI는 빠르게 발전하고 있으며, 논문에서는 종종 겹치는 용어를 사용합니다 (예: "다중 모달 LLM", "통합 모델"). 이 리스트는 용어의 표준화와 연구 및 제품 개발에 중요한 아키텍처 차이점의 강조를 제공합니다:
- 이해 vs. 생성 능력
- 모델이 사전 훈련된 백본을 재사용하는지, 아니면 스クラ치에서 훈련되는지
- 융합 전략(초기 vs. 후기)과 그에 따른 확장성에 미치는 영향
단일하고 잘 정리된 참조 자료를 갖는 것은 시간 절약, 혼란 감소, 그리고 초보자가 자신의 사용 사례에 적합한 모델 패밀리를 선택하는 데 도움을 줍니다.
📄 라이선스
이 리스트는 CC0 1.0 (공공 영역) 라이선스로 배포되며, 누구나 제한 없이 복사, 재편집, 재배포할 수 있습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch