为卫星图像分类微调 Pixtral-12B

在卫星图像上微调 Pixtral-12B 可以显著提高其分类复杂视觉场景的能力,将整体准确率从 0.56 提高到 0.91。这表明,通过低秩自适应 (LoRA) 进行领域特定适配比提示工程在专业视觉领域更有效。

用于高效模型适配的 LoRA 微调

低秩自适应 (LoRA) 通过在模型的权重中注入小的、可训练的秩分解矩阵,实现了大型视觉语言模型 (VLMs) 的高效适配。这种方法避免了修改整个模型的需要,使其比全量重新训练更具资源效率。

LoRA 在提示工程或少样本示例不足时特别有用。虽然复杂的提示词可能难以维护并产生不一致的结果,但基于 LoRA 的微调使用一小组精心挑选的示例,引导模型更可靠地转向专业知识、特定语气或领域特定词汇。

在卫星图像中的应用

卫星图像是一个专业的视觉领域,广泛应用于政府、国防、农业和气候科学,用于诸如追踪森林砍伐和监测环境变化等任务。由于这些图像包含独特的模式和语义,通用的视觉模型在没有特定专业化的情况下,往往难以提取可靠的见解。

案例研究:航空图像数据集 (AID)

为了评估微调的影响,Mistral AI 使用了 Aerial Image Dataset (AID),这是一个用于将卫星图像分类为详细场景类别的公共领域基准数据集。该数据集包含 30 个类别,包括细微的差别,例如“密集住宅区”与“中等住宅区”。

Pixtral-12B 的基准性能

使用传统的分类设置,包含 8,000 个训练样本和 2,000 个测试样本,基础 Pixtral-12B 模型在使用强制执行结构化 JSON 输出的系统提示词下,取得了合理的基准结果。然而,该模型面临两个主要限制:

  1. 类别区分模糊:模型在处理具有细微视觉差异的类别时表现挣扎。例如,它将“Playground”和“Stadium”都错误地分类为“Stadium”,因为它未能捕捉到运动场周围座位的存在。
  2. 幻觉:由于语言模型没有被明确约束在标签集内,它偶尔会幻觉出不存在或无效的类别名称,幻觉率为 5%。

微调过程与实现

Pixtral-12B 是使用 Mistral 的微调 API 和 LaPlateforme UI 进行微调的。该策略涉及为给定的系统提示词和输入图像提供正确的标签作为助手回复。

关键超参数建议包括:

  • Learning Rate:从较小的值开始,以避免错过最优权重。
  • Batch Size:使用适合计算资源的尺寸以获得稳定的梯度。
  • Epochs:从单个 epoch 开始并监测是否过拟合。

在 LaPlateforme 上,引擎会自动根据数据集大小和内部基准测试计算最佳的 batch size。

结果与性能提升

微调使得所有类别的分类指标都大幅提升。关键改进包括:

  • Accuracy:整体准确率从 0.56 提高到 0.91。
  • Hallucinations:幻觉率从 5% 降低到 0.1%。
  • Cost-Efficiency:这些结果是在 10 美元或更少的有限预算下,通过涵盖 30 个类别的 8,000 个样本的相对较小的数据集实现的。

对专业化 VLMs 的更广泛影响

Pixtral-12B 在卫星图像上的成功表明,LoRA 微调是一种可扩展且具有成本效益的方法,适用于其他在通用 VLM 训练集中代表性不足的高度专业化视觉数据。潜在应用包括医学图像描述、古代手稿转录以及来自监控图像的详细报告。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch