SyGra:低代码框架用于LLM和SLM数据生成

SyGra 是一个低代码/无代码框架,旨在简化大型语言模型(LLM)和小型语言模型(SLM)数据集的创建、转换和对齐。通过将重点从编写复杂的工程脚本转向提示工程,SyGra 使团队能够快速生成模型训练和对齐所需的高质量、领域特定数据。

核心能力与解决的数据挑战

SyGra 通过提供灵活的工作流,解决数据准备流水线中的常见瓶颈,适用于多种复杂场景:

  • 数据集转换与增强:将现有知识库转换为问答格式,将简单数据集转化为复杂推理任务,并将浅层问题扩展为深入的多轮或重推理查询。
  • 模型对齐数据:从监督微调(SFT)数据集中生成直接偏好优化(DPO)所需的偏好对。
  • **领域特定策划:对海量语料进行过滤与策划,以用于领域特定的中期训练,并通过质量过滤自动剔除低质量样本。
  • 多模态与跨语言处理:将 PDF 和图像转换为结构化文档以供问答系统使用,并在不同语言之间翻译或适配数据集(例如德语到英语)。
  • 上下文优化:将小块上下文扩展为适用于检索增强生成(RAG)流水线的大上下文数据集。
  • 推理增强:推动模型产生更好的“思考标记”,提升逐步解决问题的能力。

技术架构与集成

SyGra 既实现为 Python 库,也提供完整的框架,可直接集成到现有机器学习工作流中。

关键技术特性

  • 推理后端支持:框架可无缝对接多种推理后端,包括 vLLM、Hugging Face TGI、Triton 和 Ollama。
  • 低代码界面:通过即插即用的方式创建数据集,降低繁重的工程工作量。
  • 灵活生成:系统设计能够适配多种使用场景,从简单的问答生成到复杂的 DPO 与多语言任务。

对模型开发的影响

通过自动化数据策划与转换的繁重工作,SyGra 旨在降低人工投入,加速 AI 模型的开发周期。框架为开发团队提供四大主要收益:

  1. 加速对齐:更快准备用于 SFT、DPO 和 RAG 流水线的数据。
  2. 工程效率:通过即插即用工作流减少编写自定义脚本的时间。
  3. 提升鲁棒性:通过更丰富的数据多样性和结构,提高模型在领域特定和复杂任务上的表现。
  4. 降低人工策划:减少手动数据清洗和标注的开销。

SUMMARY: SyGra 是 ServiceNow AI 开发的低代码/无代码框架,旨在简化大型语言模型(LLM)和小型语言模型(SLM)数据集的创建、转换和对齐。

TITLE: SyGra:低代码框架用于LLM和SLM数据生成

Sources