以機器學習提升客戶服務效能

Hugging Face 展示了一個工作流程,透過機器學習自動化客戶服務,過濾並優先處理不滿的客戶回饋。透過將商業問題映射為文字分類任務並微調預訓練的 Transformer 模型,組織可以大幅減少人工工作量,同時確保緊急投訴得到回應。

將客戶服務映射至 NLP 任務

為了自動化客戶訊息的優先排序,問題被建模為 文字分類任務。具體而言,目標是將收到的訊息分類為五種情感類別之一:非常不滿、不滿、中立、滿意或非常滿意。

此方法讓客戶支援團隊能專注於最不滿的客戶,目標是回覆 100% 的緊急訊息,同時過濾掉中立或正面的回饋。

資料集選擇與整理

模型效能高度依賴訓練資料的品質與相關性。雖然建議在實務應用中使用公司內部資料,Hugging Face 在此模擬中使用了 amazon_reviews_multi 資料集。

資料集評估標準

  • Quality:資料必須符合預期的實際使用情境,且保持多樣性與無偏見。
  • Size:較大的資料集通常能帶來更好的效能。

在多個選項中,選擇了 amazon_reviews_multi,因為它提供了細緻的情感標籤(1-5 星),可直接對應到五個所需的情感類別;而其他資料集如 Amazon polarity 只提供二元標籤。

模型選擇與微調

在此實作中,選擇了 microsoft/deberta-v3-base 模型。DeBERTa 在 GLUE 與 SuperGLUE 等基準測試中排名靠前,這些測試評估文字分類能力。

技術實作流程

  1. Preprocessing:使用 datasets 套件,將 review_body 進行斷詞,並限制最大長度為 128 個 token。標籤 (1-5) 會轉換為 0-4 的範圍,以符合模型需求。
  2. Training:使用 Hugging Face 的 Trainer API 微調模型,超參數如下:
    • Epochs:2
    • Learning Rate:2e-5
    • Warmup Steps:200
    • Evaluation Strategy:每 5,000 步
  3. Metrics:初始評估使用標準準確率。模型在驗證集上於 50,000 步後達到約 61.8% 的準確率。

針對使用情境的特定評估

如果商業目標具體,標準的準確率可能會產生誤導。為了更好衡量模型在客戶服務上的效用,Hugging Face 實作了一個自訂指標,聚焦於「非常不滿」類別。

將「非常不滿」與「不滿」兩個標籤皆視為需要回應的目標,模型在測試集上取得以下結果:

  • Recall for very unsatisfied customers:約 95%(正確捕捉到的非常不滿訊息比例)。
  • False Positive Rate:約 12%(將滿意訊息錯誤標記為不滿的比例)。

商業影響模擬

在每日 10,000 筆訊息(其中 500 筆為非常負面)的情境下,該系統可將人工工作量從 10,000 筆減少至約 1,700 筆。這代表 降低 83% 的人工努力,且僅錯過 5% 的最緊急投訴。

生產環境最佳化

一旦模型達到可接受的效能,Hugging Face 建議以下幾條路徑進行生產最佳化:

  • Hardware and Precision:使用最佳化的 GPU 並將精度降低至 float16。
  • Accelerator Libraries:使用 ONNX Runtime、量化或類似 NVIDIA Triton 的推論伺服器。
  • Hugging Face Optimum:一個開源庫,旨在簡化 Transformers 模型的最佳化。
  • Inference API:即插即用的解決方案,可在生產環境中提供機器學習任務服務,且不需深厚的技術基礎設施知識。

Sources