Hugging Face 的電腦視覺現況

Hugging Face 已擴展其生態系統,支援八個核心電腦視覺任務、超過 3,000 個模型以及超過 100 個資料集。此擴展透過提供標準化的推論、訓練與部署工具,讓 Transformer 為基礎以及傳統卷積架構的電腦視覺更加民主化。

核心視覺任務與模型支援

Hugging Face 支援八個核心電腦視覺任務,每個任務在 Hub 上皆至少有 10 個模型檢查點可供使用:

  • 影像分類
  • 影像分割
  • (零樣本)目標偵測
  • 影片分類
  • 深度估計
  • 影像對影像合成
  • 無條件影像生成
  • 零樣本影像分類

除了這些核心任務外,生態系統還支援交叉的視覺-語言任務,包括影像轉文字(OCR 與影像說明產生)、文字轉影像、文件問答以及視覺問答。此函式庫支援多樣的架構,包括以 Transformer 為基礎的模型如 ViT、Swin 與 DETR,以及純卷積架構如 ResNet、ConvNeXt 與 RegNet。

推論與訓練框架

簡化推論的 Pipelines

Hugging Face Pipelines 提供一個標準化介面,以在七個視覺任務上執行推論。這讓使用者能以一致的 API 實作複雜任務,例如深度估計或視覺問答,而不必關注底層模型。

訓練與微調

Trainer API(位於 Transformers 函式庫)提供對影像分類、影像分割、影片分類、目標偵測與深度估計的無縫支援。對於 Trainer 未支援的任務,只要模型包含損失計算,仍可進行微調。

為支援研究與自訂預訓練,Hugging Face 提供範例腳本,涵蓋自監督預訓練策略(例如 MAE)與對比式影像-文字預訓練(例如 CLIP)。

生態系統整合與工具

資料集與增強

Hugging Face Hub 提供超過 100 個視覺資料集,包括 ImageNet-1k、LAION-400M 與 COYO-700M。這些資料集與 datasets 函式庫整合,便於載入,且相容於增強函式庫如 Kornia 與 Albumentations。

專門函式庫:timm 與 Diffusers

  • timm(PyTorch Image Models): Hugging Face 已將 timm 函式庫中超過 200 個模型整合至 Hub。
  • Diffusers: 這個模組化工具箱提供預訓練的擴散模型,用於諸如根據自然語言輸入生成影像的任務(例如 Stable Diffusion)。

無程式碼訓練:AutoTrain

AutoTrain 提供無程式碼的解決方案,以訓練最先進的模型。目前主要聚焦於電腦視覺的影像分類,同時也支援透過公開排行榜自動進行模型評估。

零樣本視覺模型

Hugging Face 支援多種模型,能在無特定任務訓練資料的情況下執行視覺任務:

  • CLIP: 透過自然語言提示實現零樣本影像分類。
  • OWL-ViT: 支援以語言條件的零樣本目標偵測以及以影像條件的一次樣本目標偵測。
  • CLIPSeg: 提供以語言條件的零樣本以及以影像條件的一次樣本影像分割。
  • X-CLIP: 使影片分類具備零樣本泛化能力。

技術哲學與部署

統一的使用者體驗

不論是哪種模態,Hugging Face 都採用一致的設計哲學。視覺模型使用前處理器(類似於 NLP 的 tokenizer)來準備資料,確保從 from_pretrained() 下載到 push_to_hub() 上傳的工作流程,在 PyTorch 與 TensorFlow 之間保持一致。

部署選項

視覺模型可透過 Hugging Face Inference Endpoints 部署,該服務原生支援影像分類、目標偵測與影像分割。對於其他任務,亦提供自訂處理程式。生態系統亦提供使用 TF Serving 在 Kubernetes 或 Vertex AI 上部署 TensorFlow 視覺模型的指引。

SUMMARY: Hugging Face 已擴展其生態系統,支援 8 個核心電腦視覺任務、超過 3,000 個模型以及 100 多個資料集,整合了 Transformer 與卷積架構。

TITLE: Hugging Face 的電腦視覺現況

Sources