PRX 数据策略:通过 VLM 重新标注和 Mosaic 流式传输扩展预训练

PRX 数据策略:通过 VLM 重新标注和 Mosaic 流式传输扩展预训练

Photoroom 已发布了用于训练 PRX(一个 7B 参数模型)的数据策略的详细说明。核心方法包括从公开和内部来源组装多样化的语料库,使用视觉语言模型(VLM)重新为所有图像生成标注以确保高保真描述,并利用双格式存储系统在数据集探索与训练吞吐量之间取得平衡。

预训练原则:广度胜过完美

在预训练阶段,Photoroom 将覆盖范围和多样性置于单张图像美学之上。目标是让模型在视觉世界的广泛分布中学习视觉概念、构图和光照。

  • 多样性 vs. 品味:团队认为,在预训练阶段过度为了美学而过滤会缩小分布并使模型失去基本的构图多样性。对生成结果的打磨被推迟到在较小、经过策划的数据集上的微调和偏好对齐。
  • 务实来源:数据通过混合公开和内部数据集组装,在可用的情况下利用现有的策划(NSFW 和 PII 过滤)来加速过程。
  • 标注哲学:长而准确的标注至关重要。通过描述图像中的一切——包括徽标、文本或工件——这些元素成为有条件的、可控制的属性,而不是无条件的噪声。

数据基础设施:Lance 和 Mosaic 数据碎片(MDS)

Photoroom 采用两种不同的数据格式来处理数据集的生命周期:Lance 用于策划,MDS 用于流式传输。

Lance 用于探索

Lance 被用作一种列式数据格式,用于构建和探索包含数十亿行的数据集。它支持廉价的谓词下推、标量索引和向量搜索,使团队能够:

  • 数据分析:分析分辨率分布以设定截止值(例如,丢弃低于 384² 像素的图像)。
  • 交互式浏览:通过自定义 UI 使用全文搜索和最近邻相似度搜索,以定性评估多样性并发现诸如非照片内容之类的问题。
  • 碎片管理:团队指出,过度碎片化 Lance 表(例如,每个碎片 100k 行)会减慢查询速度。将其压缩到大约每个碎片一百万行可显著提升性能。

MDS 用于训练

Mosaic 数据碎片(MDS)用于分布式训练,提供确定的可恢复洗牌、弹性 mid-epoch 检查点以及多个流的加权混合。为了优化管道:

  • 即时潜在表示:不是预先计算文本潜在表示,Photoroom 在训练过程中使用 Qwen3-VL 编码器计算它们。这减小了 MDS 碎片的大小,并允许在不重写太字节数据的情况下进行编码器交换,在 7B 规模下仅造成 3–4% 的吞吐量损失。
  • JPEG 编码:所有图像以质量 92 存储为 JPEG。经验测试表明,这在感知上与 PNG 区分不大,且不会对生成图像的质量产生负面影响,同时将存储需求降低了 3–10×。

VLM 重新标注策略

Photoroom 发现,长而详细的标注能显著提升样本质量。在基准测试中,一个在 Qwen2.5-VL-7B 标注上训练的小型扩散模型在 FID、CMMD 和 DINO-MMD 指标上优于一个在较短的 LLaVA-1.5-LLaMA3-8B 标注上训练的模型。

标注器选择

在对几个候选者进行基准测试后,Photoroom 选择了 Qwen3-VL-8B 作为主要标注器。选择基于质量和吞吐量的平衡:

  • 性能:Qwen3.5-9B 在指标上表现最佳,但 Qwen3-VL-8B 接近且速度显著更快(每 H200 GPU 20 张图像/秒)。
  • 提示:团队使用了一个密集的系统提示,要求生成一个流畅的 100–200 词段落,专注于精确的视觉 grounding,而不进行猜测或解释。

数据集精炼和去重

生成 VLM 标注后,Photoroom 应用了轻度过滤和去重来精炼语料库,而无需重写整个数据集。

基于标注的过滤

与使用昂贵的像素级分类器不同,Photoroom 在纯文本模式下使用 Qwen3-8B 将标注分类为“视觉”、“文本”或“NSFW”。这种方法在计算上高效(″200 captions/s per GPU),并能有效删除截图、文档和信息图。

感知哈希去重

为了删除近似重复项,团队实现了一种基于 DCT 的感知哈希。如果两张图像的汉明距离为零,则视为重复。如果在不同分辨率之间存在重复,则保留最高分辨率的副本。

跳过列表机制

为了避免在每次过滤或去重遍历时重写巨大的 MDS 语料库,Photoroom 在数据加载器中实现了 跳过列表功能。每个碎片的侧车文件列出要跳过的索引,使团队能够在加载时动态排除数据(例如,用户退出或质量问题)。

宽高比分桶

为了保持每张图像的计算量恒定并避免浪费的填充或裁剪,Photoroom 使用宽高比分桶:

  1. 分辨率层级:根据像素数量,图像被分配到层级(512px、1024px、2048px、4096px)。
  2. 宽高比桶:在每个层级内,图像会被对齐到 13 个补丁对齐的形状之一(AR 0.5 到 2.0),以保持恒定的补丁令牌预算。
  3. 处理:图像使用 Lanczos 过滤器进行调整大小,并存储在以分辨率和宽高比为键的目录树中,以便单独流式传输。

SUMMARY: Photoroom 详细说明了 PRX 的数据管道,强调使用长 VLM 生成的标注、混合 Lance 和 Mosaic 数据碎片存储策略以及高质量 JPEG 编码,以优化一个 7B 参数模型。

TITLE: PRX 数据策略:通过 VLM 重新标注和 Mosaic 流式传输扩展预训练

Sources