Hugging Face CFM 案例研究:利用 LLM 洞見微調小型模型

資本基金管理(CFM)透過使用大型語言模型(LLMs)為較小、更高效的模型標註訓練資料,成功優化了金融數據的命名實體識別(NER)。此方法使準確度提升最高 6.4%,相較於僅依賴大型 LLMs 進行推論,營運成本降低最高 80倍。

LLM 輔助標註工作流程

CFM 利用結合 LLM 自動化與人工驗證的管線來建構高品質的資料集以供微調。該過程包括以下步驟:

合成標籤生成

CFM 使用 Hugging Face Inference Endpoints 部署了 Llama 3.1-70b-Instruct。為確保輸出結構化且準確,團隊使用了特定的系統提示詞,將模型定義為金融專家,並實作了 Pydantic schema,以強制模型返回包含原始擷取的公司名稱及其標準化版本的 JSON。

處理來自 Financial News and Stock Price Integration Dataset (FNSPID) 的 900,000 筆樣本約需 8 小時,成本約為 $70。

人類參與的迴圈優化

為確保 ground truth 的可靠性,CFM 使用了 Argilla,這是一個開源的資料標註平台。團隊根據透過模糊匹配建立的公司叢集,抽樣了 2,714 則標題。

透過使用預先計算的 Llama 標籤作為起點,人工標註者將每個樣本所花費的時間從 30 秒減少到 5-10 秒。對 2,714 個樣本進行完整標註約需 8 小時。

零樣本效能比較

在微調之前,CFM 在零樣本設定下評估了多個模型,以在經過策劃的資料集上建立效能基準:

模型 F1-Score (零樣本)
Llama 3.1-70b 95%
Llama 3.1-8b 88%
GLiNER 87%
SpanMarker 47%

儘管 Llama 3.1-70b 提供了最高的準確度,但其運算需求顯著高於緊湊模型。

對緊湊模型進行微調的影響

在 LLM 輔助且經過人工驗證的資料集上對較小的模型進行微調,產生的效能提升可與最大的 LLMs 相媲美,同時大幅降低成本。

效能提升

微調改變了較小模型的效能:

  • GLiNER-medium-news 從 87.0% 提升至 93.4% F1 分數。
  • SpanMarker 從 47.0% 提升至 90.1% F1 分數。

成本與效率

經微調的小型模型與大型 LLMs 之間的成本差異十分顯著:

  • Llama 3.1-70b 的推論成本至少為每小時 $8。
  • Compact models (GPU) 的成本約為每小時 $0.50(便宜 16 倍)。
  • Compact models (CPU) 的成本約為每小時 $0.10(便宜 80 倍)。

弱監督 vs. 人工標註資料

CFM 比較了在人工標註資料上微調 GLiNER 的結果與由 Llama 3.1-70b 生成的合成資料(弱監督)的結果。

  • 準確度: 在人工標註資料上訓練的模型在資料量增加時始終能達成更高的 F1 分數。
  • 權衡: 對於 1,000 筆樣本,人工標註花費 3 小時並得到 F1 分數 0.915,而 Llama 3.1-70b 推論僅需 2 分鐘並得到 F1 分數 0.895。

該研究結論指出,雖然 LLM 輔助標註在擴展方面效率極高,但人工驗證對於達到最高準確度仍然至關重要。

Sources