Hugging Face伦理与社会通讯 #6:数据质量的重要性
TL;DR
Hugging Face指出,高质量数据不仅仅关乎数量或准确性,而是要“适合其预期用途”。在整个AI开发生命周期中优先考虑数据质量对于提升模型性能、确保包容性代表、实现治理以及解决AI研究中的可重复性危机至关重要。
定义高质量数据
数据质量取决于数据与当前具体任务需求的匹配程度。Hugging Face倡导“安全即设计”方法,即在开发的最早阶段进行深思熟虑的数据选择。高质量数据的关键维度包括:
- 相关性:数据必须直接适用于问题。无关数据会引入噪声,掩盖模式,导致性能下降。
- 完整性(全面性):数据集必须捕获真实世界场景的全部广度和多样性,以避免偏见和被忽视的问题。
- 时效性(当前性/新鲜度):数据必须反映当前的实际情况,尤其是在快速演变的领域,以防系统失效或产生危险。
- 偏差缓解:数据选择必须积极避免编码有害的社会偏见、刻板印象或对边缘化群体的低代表性。
数据质量对AI结果的影响
在数据质量上的投入是构建有效且伦理的AI系统的根本要求。其收益在多个关键领域中得到体现:
模型性能与效率
更高的数据质量直接关联模型结果的提升。细致的清洗——去除噪声、纠正错误、统一格式——可提升准确率。此外,更干净且体积更小的数据集能够训练出更紧凑、参数高效的模型,从而在训练和推理时消耗更少的计算资源和能源。
代表性与包容性
高质量数据必须能够代表所有社会群体和语言,以缓解文化偏见。Hugging Face指出,训练数据常常过度代表主导群体,导致偏斜的呈现和有害的刻板印象。为此,实验室推动参与式数据收集和社区倡议,例如“Data is Better Together”项目以及面向非洲语言的Masakhane项目。
治理、问责与可重复性
关于数据来源、许可证和预处理的透明度对有效的AI治理至关重要。清晰的数据来源文档能够支持外部审计和验证。在学术界,严格的数据质量和文档记录是应对“可重复性与可复制性危机”的必要手段,确保研究成果能够被其他研究者审查并进一步构建。
适应性与泛化
为了确保模型在不同情境下的泛化,数据必须涵盖广泛的文化、环境和极端案例。这需要持续的策展以及反馈回路的实现,以在真实世界环境变化时识别“数据漂移”和性能下降。
文档与合成数据的作用
高质量文档
文档与数据本身同等重要。Hugging Face倡导使用数据集卡片(以及数据声明、数据表格、数据营养标签等方法),以提供数据来源、组成、处理步骤和原始用途的全面概览。这提升了可用性、协作性和透明度。
合成数据的考量
虽然合成数据是一种成本高效且可扩展的真实数据替代方案(如Cosmopedia项目所示),但它也伴随风险。如果生成算法存在偏见,合成数据也会带有同样的偏见。过度依赖合成数据还可能导致“模型崩溃”,即模型过度适配合成模式。Hugging Face建议审慎使用合成数据,辅以真实数据,并通过水印等方式明确标记生成内容。
Hugging Face的数据质量实践
Hugging Face在其各项目中采用多种技术策略,以保持高水平的数据标准:
- 过滤与去重:使用如DataTrove等工具,实验室去除冗余条目和无关噪声,这在FineWeb-Edu数据集的创建中得以体现。
- 负责任的多模态创建:针对OBELICS数据集,Hugging Face实现了选择退出过滤(通过如Spawning的API),以尊重创作者权益,将图像冗余限制为每张图像最多十次出现,并使用开源分类器排除NSFW内容。
- 多样化代码选择:在The Stack V2中,实验室专注于对代码库的精心挑选,以确保涵盖广泛的编程语言和框架,采用自动化和人工质量检查相结合的方式。
- 人类反馈整合:实验室使用如Argilla的标注工具来纳入利益相关者的反馈,这些反馈用于改进UltraFeedback数据集以及后续的Notus模型。