為衛星影像分類進行 Pixtral-12B 微調
在衛星影像上對 Pixtral-12B 進行微調,能顯著提升其分類複雜視覺場景的能力,將整體準確度從 0.56 提高到 0.91。這證明了透過低秩適應 (LoRA) 進行領域特定適應,比提示工程 (prompt engineering) 對於專業視覺領域更有效。
為了高效模型適應的 LoRA 微調
低秩適應 (LoRA) 透過在模型的權重中注入小型、可訓練的秩分解矩陣,實現了大型視覺語言模型 (VLMs) 的高效適應。這種方法避免了修改完整模型的需要,使其比完整重新訓練更具資源效率。
LoRA 在提示工程或少樣本範例 (few-shot examples) 不足時特別有用。雖然複雜的提示詞可能難以維護且會產生不一致的結果,但基於 LoRA 的微調使用一組精選的範例,能更可靠地引導模型走向專業知識、特定語氣或領域特定詞彙。
衛星影像的應用
衛星影像是一個專業的視覺領域,用於政府、國防、農業和氣候科學,執行如追蹤森林砍伐和監測環境變化等任務。由於這些影像包含獨特的模式和語義,通用型視覺模型在沒有特定專業化之前,往往難以提取可靠的見解。
個案研究:航空影像數據集 (AID)
為了評估微調的影響,Mistral AI 使用了航空影像數據集 (AID),這是一個用於將衛星影像分類為詳細場景類別的公開領域基準測試。該數據集包含 30 個類別,包括細微的區別,例如「密集住宅區」與「中等住宅區」。
Pixtral-12B 的基準效能
使用傳統的分類設定,包含 8,000 個訓練樣本和 2,000 個測試樣本,基礎 Pixtral-12B 模型使用強制執行結構化 JSON 輸出的系統提示詞,取得了合理的基準結果。然而,該模型面臨兩個主要的限制:
- 模糊的類別區分:模型在處理具有細微視覺差異的類別時感到困難。例如,它將「Playground」和「Stadium」都錯誤地分類為「Stadium」,因為它未能捕捉到運動場周圍是否有座位。
- 幻覺 (Hallucinations):由於語言模型並未被明確限制在標籤集中,它偶爾會幻覺出不存在或無效的類別名稱,幻覺率為 5%。
微調過程與實作
Pixtral-12B 是使用 Mistral 的微調 API 和 LaPlateforme UI 進行微調的。策略涉及為給定的系統提示詞和輸入影像提供正確的標籤作為助手回應。
關鍵超參數建議包括:
- 學習率 (Learning Rate):從較小的值開始,以避免錯過最佳權重。
- 批次大小 (Batch Size):使用適合計算資源的大小,以獲得穩定的梯度。
- Epochs:從單個 epoch 開始,並監控過擬合 (overfitting) 的情況。
在 LaPlateforme 上,引擎會根據數據集大小和內部基準測試自動計算最佳的批次大小。
結果與效能提升
微調導致所有類別的分類指標大幅提升。關鍵的改進包括:
- 準確度:整體準確度從 0.56 提高到 0.91。
- 幻覺:幻覺率從 5% 降低到 0.1%。
- 成本效益:這些結果是在預算有限(10 美元或更低)以及使用包含 30 個類別、共 8,000 個樣本的相對較小數據集下實現的。
對專業化 VLMs 的更廣泛影響
Pixtral-12B 在衛星影像上的成功,顯示了 LoRA 微調對於其他在通用 VLM 訓練集中代表性不足的高專業化視覺數據,是一種具擴展性且具成本效益的方法。潛在的應用包括醫療影像說明、古代手稿轉錄,以及來自監控影像的詳細報告。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch