Modelmap: Hugging Face 模型架構的互動式視覺化工具

Modelmap 是一款旨在為 Hugging Face 上託管的任何模型提供互動式、動畫化的網路架構視覺化工具。透過輸入 Hugging Face 模型 ID,使用者無需下載實際的模型權重,即可生成該模型網路的動態地圖。

架構映射的技術實作

Modelmap 使用 meta-device 實例化與追蹤式虛擬前向傳播(traced fake forward passes)的組合來生成其架構圖。這種方法允許工具在沒有實際權重的情況下,確定模型的結構佈局與張量形狀(tensor shapes),使視覺化過程幾乎是即時的且具備頻寬效率。

  • Meta-device 實例化: 工具在 meta-device 上實例化模型結構,這使其能夠在不為實際參數分配記憶體的情況下定義架構。
  • Traced Fake Forward Pass: 工具執行模擬前向傳播的追蹤,以確定張量在流經網路時的確切形狀。

支援的模型類型與功能

Modelmap 支援廣泛的架構,包括經典的參考架構與現代的大語言模型(LLMs)。使用者也可以使用相同的介面並排比較兩個不同的模型。

參考架構

Modelmap 提供對數個基礎模型的即時視覺化存取,例如:

  • GPT-2 (124M): 經典的僅解碼器(decoder-only)架構。
  • BERT (base-uncased): 最初的雙向僅編碼器(bidirectional encoder-only)Transformer。
  • T5/Qwen3-8B: 具備 Grouped-Query Attention (GQA)、RMSNorm 與閘控式 MLP 層的現代密集型 LLM。
  • DeepSeek-V3.1 (671B): 具備多頭潛在注意力機制(multi-head latent attention)的海量混合專家模型(Mixture-of-Experts, MoE)。
  • Qwen3-235B-A22B: 每層擁有 128 個專家的 MoE 模型。

進階模型類別

該工具也支援視覺語言模型,例如 Qwen2.5-VL-3B-Instruct(其中視覺塔會輸入至 LLM),以及各種影像-文字-轉-文字模型,如 Qwen3.8-27B 與 Muse-Glimmer-30B。

使用者體驗與存取控制

Modelmap 為除錯與理解模型結構提供了流暢的體驗。使用者甚至可以使用該工具根據其架構來估算提供模型服務的成本。

  • 公開儲存庫: 任何公開的 Hugging Face 儲存庫都可以立即進行視覺化。
  • 受限存取儲存庫: 對於受限存取模型,使用者可以提供 Hugging Face token 以獲得架構地圖的存取權限。
  • 比較工具: 該工具包含一個比較功能(透過 ⌘K 觸發),允許使用者視覺化兩個模型的架構(例如 Qwen2.5-7B 與 Qwen3-8B)以進行直接的結構比較。

社群回饋

社群注意到該工具對於除錯 fine-tunes 與 LoRAs 非常有用,因為部分使用者先前曾依賴 Claude 等 LLM 來「走訪模型架構」以進行除錯目的。

"I’ve had Claude walk model architectures to debug Loras and fine tunes, but this is delightful"

其他使用者也指出了類似的工具如 hfviewer.com,並提到設計美學上的差異。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案