Hugging Face CFM 案例研究:利用 LLM 见解对小模型进行微调

Capital Fund Management (CFM) 通过使用大型语言模型(LLMs)为更小、更高效的模型标注训练数据,成功优化了金融数据的命名实体识别(NER)。该方法将准确率提高了最高 6.4%,并将运营成本降低了最高 80倍,相较于仅依赖大型 LLMs 进行推理。

LLM 辅助标注工作流程

CFM 利用结合 LLM 自动化和人工验证的管道来创建用于微调的高质量数据集。该过程包括以下步骤:

合成标签生成

CFM 使用 Hugging Face Inference Endpoints 部署了 Llama 3.1-70b-Instruct。为了确保输出结构化且准确,团队使用了一个特定的系统提示,将模型定义为金融专家,并实施了一个 Pydantic 模式,以强制模型返回包含原始提取的公司名称及其归一化版本的 JSON。

处理来自金融新闻和股票价格整合数据集(FNSPID)的 900,000 个样本大约需要 8 小时,成本约为 70 美元。

人机协同细化

为了确保地面真实可靠,CFM 使用了 Argilla,一个开源的数据标注平台。团队根据通过模糊匹配创建的公司聚类抽取了 2,714 条标题。

通过将预计算的 Llama 标签作为起点,人工标注者将每个样本所花费的时间从 30 秒降低到 5-10 秒。对 2,714 个样本的全部标注工作在大约 8 小时内完成。

零样本性能对比

在微调之前,CFM 在零样本设置下评估了若干模型,以在精心策划的数据集上建立性能基线:

模型 零样本 F1-Score
Llama 3.1-70b 95%
Llama 3.1-8b 88%
GLiNER 87%
SpanMarker 47%

虽然 Llama 3.1-70b 提供了最高的准确率,但其计算需求显著高于紧凑模型。

微调对紧凑模型的影响

在 LLM 辅助的人工验证数据集上对较小的模型进行微调,在显著降低成本的同时,其性能提升可与最大的 LLMs 相媲美。

性能提升

微调改变了较小模型的性能:

  • GLiNER-medium-news 从 87.0% 提高到 93.4% F1 分数。
  • SpanMarker 从 47.0% 提高到 90.1% F1 分数。

成本与效率

经过微调的小模型与大型 LLMs 之间的成本差异十分显著:

  • Llama 3.1-70b 的推理成本至少为每小时 8 美元。
  • 紧凑模型 (GPU) 的成本大约为每小时 0.50 美元(便宜 16 倍)。
  • 紧凑模型 (CPU) 的成本大约为每小时 0.10 美元(便宜 80 倍

弱监督 vs. 人工标注数据

CFM 将基于人工标注数据的 GLiNER 微调结果与由 Llama 3.1-70b 生成的合成数据(弱监督)进行了比较。

  • 准确率: 在数据集规模增加的情况下,基于人工标注数据训练的模型始终能够获得更高的 F1 分数。
  • 权衡: 对于 1,000 个样本,人工标注花费了 3 小时,得到 F1 分数为 0.915;而 Llama 3.1-70b 推理仅用了 2 分钟,得到 F1 分数为 0.895。

该研究得出结论:虽然 LLM 辅助标注在扩展方面效率极高,但人工验证对于实现最高准确率仍然至关重要。

Sources