Hugging Face CFM 案例研究:利用 LLM 洞見微調小型模型
資本基金管理(CFM)透過使用大型語言模型(LLMs)為較小、更高效的模型標註訓練資料,成功優化了金融數據的命名實體識別(NER)。此方法使準確度提升最高 6.4%,相較於僅依賴大型 LLMs 進行推論,營運成本降低最高 80倍。
LLM 輔助標註工作流程
CFM 利用結合 LLM 自動化與人工驗證的管線來建構高品質的資料集以供微調。該過程包括以下步驟:
合成標籤生成
CFM 使用 Hugging Face Inference Endpoints 部署了 Llama 3.1-70b-Instruct。為確保輸出結構化且準確,團隊使用了特定的系統提示詞,將模型定義為金融專家,並實作了 Pydantic schema,以強制模型返回包含原始擷取的公司名稱及其標準化版本的 JSON。
處理來自 Financial News and Stock Price Integration Dataset (FNSPID) 的 900,000 筆樣本約需 8 小時,成本約為 $70。
人類參與的迴圈優化
為確保 ground truth 的可靠性,CFM 使用了 Argilla,這是一個開源的資料標註平台。團隊根據透過模糊匹配建立的公司叢集,抽樣了 2,714 則標題。
透過使用預先計算的 Llama 標籤作為起點,人工標註者將每個樣本所花費的時間從 30 秒減少到 5-10 秒。對 2,714 個樣本進行完整標註約需 8 小時。
零樣本效能比較
在微調之前,CFM 在零樣本設定下評估了多個模型,以在經過策劃的資料集上建立效能基準:
| 模型 | F1-Score (零樣本) |
|---|---|
| Llama 3.1-70b | 95% |
| Llama 3.1-8b | 88% |
| GLiNER | 87% |
| SpanMarker | 47% |
儘管 Llama 3.1-70b 提供了最高的準確度,但其運算需求顯著高於緊湊模型。
對緊湊模型進行微調的影響
在 LLM 輔助且經過人工驗證的資料集上對較小的模型進行微調,產生的效能提升可與最大的 LLMs 相媲美,同時大幅降低成本。
效能提升
微調改變了較小模型的效能:
- GLiNER-medium-news 從 87.0% 提升至 93.4% F1 分數。
- SpanMarker 從 47.0% 提升至 90.1% F1 分數。
成本與效率
經微調的小型模型與大型 LLMs 之間的成本差異十分顯著:
- Llama 3.1-70b 的推論成本至少為每小時 $8。
- Compact models (GPU) 的成本約為每小時 $0.50(便宜 16 倍)。
- Compact models (CPU) 的成本約為每小時 $0.10(便宜 80 倍)。
弱監督 vs. 人工標註資料
CFM 比較了在人工標註資料上微調 GLiNER 的結果與由 Llama 3.1-70b 生成的合成資料(弱監督)的結果。
- 準確度: 在人工標註資料上訓練的模型在資料量增加時始終能達成更高的 F1 分數。
- 權衡: 對於 1,000 筆樣本,人工標註花費 3 小時並得到 F1 分數 0.915,而 Llama 3.1-70b 推論僅需 2 分鐘並得到 F1 分數 0.895。
該研究結論指出,雖然 LLM 輔助標註在擴展方面效率極高,但人工驗證對於達到最高準確度仍然至關重要。