以機器學習提升客戶服務效能
Hugging Face 展示了一個工作流程,透過機器學習自動化客戶服務,過濾並優先處理不滿的客戶回饋。透過將商業問題映射為文字分類任務並微調預訓練的 Transformer 模型,組織可以大幅減少人工工作量,同時確保緊急投訴得到回應。
將客戶服務映射至 NLP 任務
為了自動化客戶訊息的優先排序,問題被建模為 文字分類任務。具體而言,目標是將收到的訊息分類為五種情感類別之一:非常不滿、不滿、中立、滿意或非常滿意。
此方法讓客戶支援團隊能專注於最不滿的客戶,目標是回覆 100% 的緊急訊息,同時過濾掉中立或正面的回饋。
資料集選擇與整理
模型效能高度依賴訓練資料的品質與相關性。雖然建議在實務應用中使用公司內部資料,Hugging Face 在此模擬中使用了 amazon_reviews_multi 資料集。
資料集評估標準
- Quality:資料必須符合預期的實際使用情境,且保持多樣性與無偏見。
- Size:較大的資料集通常能帶來更好的效能。
在多個選項中,選擇了 amazon_reviews_multi,因為它提供了細緻的情感標籤(1-5 星),可直接對應到五個所需的情感類別;而其他資料集如 Amazon polarity 只提供二元標籤。
模型選擇與微調
在此實作中,選擇了 microsoft/deberta-v3-base 模型。DeBERTa 在 GLUE 與 SuperGLUE 等基準測試中排名靠前,這些測試評估文字分類能力。
技術實作流程
- Preprocessing:使用
datasets套件,將review_body進行斷詞,並限制最大長度為 128 個 token。標籤 (1-5) 會轉換為 0-4 的範圍,以符合模型需求。 - Training:使用 Hugging Face 的
TrainerAPI 微調模型,超參數如下:- Epochs:2
- Learning Rate:2e-5
- Warmup Steps:200
- Evaluation Strategy:每 5,000 步
- Metrics:初始評估使用標準準確率。模型在驗證集上於 50,000 步後達到約 61.8% 的準確率。
針對使用情境的特定評估
如果商業目標具體,標準的準確率可能會產生誤導。為了更好衡量模型在客戶服務上的效用,Hugging Face 實作了一個自訂指標,聚焦於「非常不滿」類別。
將「非常不滿」與「不滿」兩個標籤皆視為需要回應的目標,模型在測試集上取得以下結果:
- Recall for very unsatisfied customers:約 95%(正確捕捉到的非常不滿訊息比例)。
- False Positive Rate:約 12%(將滿意訊息錯誤標記為不滿的比例)。
商業影響模擬
在每日 10,000 筆訊息(其中 500 筆為非常負面)的情境下,該系統可將人工工作量從 10,000 筆減少至約 1,700 筆。這代表 降低 83% 的人工努力,且僅錯過 5% 的最緊急投訴。
生產環境最佳化
一旦模型達到可接受的效能,Hugging Face 建議以下幾條路徑進行生產最佳化:
- Hardware and Precision:使用最佳化的 GPU 並將精度降低至 float16。
- Accelerator Libraries:使用 ONNX Runtime、量化或類似 NVIDIA Triton 的推論伺服器。
- Hugging Face Optimum:一個開源庫,旨在簡化 Transformers 模型的最佳化。
- Inference API:即插即用的解決方案,可在生產環境中提供機器學習任務服務,且不需深厚的技術基礎設施知識。