Modelmap: Hugging Face 모델 아키텍처의 인터랙티브 시각화

Modelmap은 Hugging Face에 호스팅된 모든 모델의 네트워크 아키텍처를 인터랙티브하고 애니메이션화된 시각화로 제공하기 위해 설계된 도구입니다. Hugging Face 모델 ID를 입력하면, 실제 모델 가중치를 다운로드할 필요 없이 모델 네트워크의 생생한 지도를 생성할 수 있습니다.

아키텍처 매핑의 기술적 구현

Modelmap은 meta-device 인스턴스화와 traced fake forward pass의 조합을 사용하여 아키텍처 그래프를 생성합니다. 이 접근 방식은 실제 가중치 없이도 모델의 구조적 레이아웃과 텐서 모양을 결정할 수 있게 해주어, 시각화 프로세스를 거의 즉각적이고 대역폭 효율적으로 만듭니다.

  • Meta-device Instantiation: 도구는 meta-device 상에서 모델 구조를 인스턴스화하며, 이를 통해 실제 파라미터에 대한 메모리를 할당하지 않고도 아키텍처를 정의할 수 있습니다.
  • Traced Fake Forward Pass: 도구는 시뮬레이션된 forward pass의 trace를 수행하여 네트워크를 통해 흐르는 텐서의 정확한 모양을 결정합니다.

지원되는 모델 유형 및 기능

Modelmap은 클래식 레퍼런스 아키텍처부터 현대적인 대규모 언어 모델(LLMs)에 이르기까지 광범위한 아키텍처를 지원합니다. 사용자는 또한 동일한 인터페이스를 사용하여 두 가지 다른 모델을 나란히 비교할 수 있습니다.

레퍼런스 아키텍처

Modelmap은 다음과 같은 여러 기초 모델에 대한 시각화에 즉각적인 액세스를 제공합니다:

  • GPT-2 (124M): 클래식한 decoder-only 아키텍처.
  • BERT (base-uncased): 오리지널 양방향 encoder-only transformer.
  • T5/Qwen3-8B: Grouped-Query Attention (GQA), RMSNorm, 그리고 gated MLP 레이어를 특징으로 하는 현대적인 dense LLMs.
  • DeepSeek-V3.1 (671B): multi-head latent attention을 갖춘 거대한 Mixture-of-Experts (MoE) 모델.
  • Qwen3-235B-A22B: 레이어당 128개의 전문가를 가진 MoE 모델.

고급 모델 카테고리

이 도구는 vision tower가 LLM으로 입력되는 Qwen2.5-VL-3B-Instruct와 같은 vision-language 모델과 Qwen3.8-27B 및 Muse-Glimmer-30B와 같은 다양한 image-text-to-text 모델도 지원합니다.

사용자 경험 및 액세스 제어

Modelmap은 모델 구조를 디버깅하고 이해하는 데 간소화된 경험을 제공합니다. 사용자는 실제로 이 도구를 사용하여 아키텍처를 기반으로 모델 서빙 비용을 추정할 수 있습니다.

  • Public Repositories: 모든 공개 Hugging Face 저장소는 즉시 시각화할 수 있습니다.
  • Gated Repositories: gated 모델의 경우, 사용자는 Hugging Face token을 제공하여 아키텍처 맵에 액세스할 수 있습니다.
  • Comparison Tool: 이 도구에는 사용자들이 두 모델(예: Qwen2.5-7B vs Qwen3-8B)의 아키텍처를 직접 구조적으로 비교할 수 있도록 하는 비교 기능(⌘K로 실행)이 포함되어 있습니다.

커뮤니티 피드백

커뮤니티는 fine-tunes 및 LoRAs를 디버깅하는 데 이 도구의 유의성을 언급했습니다. 일부 사용자는 이전에 디버깅 목적으로 Claude와 같은 LLM을 사용하여

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트