Hugging Face CFM 案例研究:利用 LLM 见解对小模型进行微调
Capital Fund Management (CFM) 通过使用大型语言模型(LLMs)为更小、更高效的模型标注训练数据,成功优化了金融数据的命名实体识别(NER)。该方法将准确率提高了最高 6.4%,并将运营成本降低了最高 80倍,相较于仅依赖大型 LLMs 进行推理。
LLM 辅助标注工作流程
CFM 利用结合 LLM 自动化和人工验证的管道来创建用于微调的高质量数据集。该过程包括以下步骤:
合成标签生成
CFM 使用 Hugging Face Inference Endpoints 部署了 Llama 3.1-70b-Instruct。为了确保输出结构化且准确,团队使用了一个特定的系统提示,将模型定义为金融专家,并实施了一个 Pydantic 模式,以强制模型返回包含原始提取的公司名称及其归一化版本的 JSON。
处理来自金融新闻和股票价格整合数据集(FNSPID)的 900,000 个样本大约需要 8 小时,成本约为 70 美元。
人机协同细化
为了确保地面真实可靠,CFM 使用了 Argilla,一个开源的数据标注平台。团队根据通过模糊匹配创建的公司聚类抽取了 2,714 条标题。
通过将预计算的 Llama 标签作为起点,人工标注者将每个样本所花费的时间从 30 秒降低到 5-10 秒。对 2,714 个样本的全部标注工作在大约 8 小时内完成。
零样本性能对比
在微调之前,CFM 在零样本设置下评估了若干模型,以在精心策划的数据集上建立性能基线:
| 模型 | 零样本 F1-Score |
|---|---|
| Llama 3.1-70b | 95% |
| Llama 3.1-8b | 88% |
| GLiNER | 87% |
| SpanMarker | 47% |
虽然 Llama 3.1-70b 提供了最高的准确率,但其计算需求显著高于紧凑模型。
微调对紧凑模型的影响
在 LLM 辅助的人工验证数据集上对较小的模型进行微调,在显著降低成本的同时,其性能提升可与最大的 LLMs 相媲美。
性能提升
微调改变了较小模型的性能:
- GLiNER-medium-news 从 87.0% 提高到 93.4% F1 分数。
- SpanMarker 从 47.0% 提高到 90.1% F1 分数。
成本与效率
经过微调的小模型与大型 LLMs 之间的成本差异十分显著:
- Llama 3.1-70b 的推理成本至少为每小时 8 美元。
- 紧凑模型 (GPU) 的成本大约为每小时 0.50 美元(便宜 16 倍)。
- 紧凑模型 (CPU) 的成本大约为每小时 0.10 美元(便宜 80 倍。
弱监督 vs. 人工标注数据
CFM 将基于人工标注数据的 GLiNER 微调结果与由 Llama 3.1-70b 生成的合成数据(弱监督)进行了比较。
- 准确率: 在数据集规模增加的情况下,基于人工标注数据训练的模型始终能够获得更高的 F1 分数。
- 权衡: 对于 1,000 个样本,人工标注花费了 3 小时,得到 F1 分数为 0.915;而 Llama 3.1-70b 推理仅用了 2 分钟,得到 F1 分数为 0.895。
该研究得出结论:虽然 LLM 辅助标注在扩展方面效率极高,但人工验证对于实现最高准确率仍然至关重要。