SyGra 2.0.0 Studio 发布

SyGra 2.0.0 引入了 Studio,这是一个交互式的可视化环境,旨在将合成数据生成从手动编辑 YAML 文件和使用终端的过程转变为一种透明、可视化的创作方式。Studio 允许用户在画布上组合工作流,预览数据集,并通过内联变量提示来调整提示词,同时通过生成相应的图配置和任务执行器脚本,保持与底层 SyGra 平台的全方位兼容性。

可视化工作流设计与组合

SyGra Studio 通过拖拽式界面实现合成数据流水线的创建。用户可以利用各种节点类型和配置选项来构建复杂的逻辑:

  • LLM 节点: 用户可以选择已配置的模型(例如 gpt-4o-mini),编写提示词,并定义输出变量(例如,将结果存储在 story_body 中)。
  • 高级逻辑: 该环境支持结构化输出、工具附件、Lambda 节点以及用于可重用逻辑或分支行为的 Subgraph 节点。
  • 动态提示词: 在提示词编辑器中输入 { 会立即显示所有可用的状态变量,从而实现对来自先前节点的数据的无缝引用。
  • 多 LLM 设置: 详情面板提供了对模型参数和并行生成设置的访问权限。

数据源集成与验证

Studio 通过为数据源配置和验证提供引导式表单,简化了合成数据生成的初始阶段:

  • 支持的连接器: 用户可以连接到 Hugging Face、本地文件系统或 ServiceNow 数据源。
  • 即时预览: 在输入 repo_id、split 或文件路径等参数后,用户可以预览样本行,以确保在执行前数据是正确的。
  • 自动变量映射: 来自数据源的列名会自动转换为状态变量(例如, {prompt}{genre}),从而消除了手动连接和猜测。

执行、可观测性与调试

SyGra Studio 提供实时监控和调试工具,以确保合成数据运行的质量和成本:

  • 实时流式传输: 在工作流运行期间,Execution 面板会实时流式传输节点状态、Token 使用量、延迟和成本。
  • 可观测性: 详细的日志和执行历史存储在 .executions/runs/*.json 中,允许用户将结果与之前的执行进行比较。
  • 调试工具: 界面包含内联日志、断点和基于 Monaco 的代码编辑器,以便进行快速迭代。
  • 运行配置: Run 对话框允许用户在不修改底层 YAML 配置的情况下,调整批处理大小、记录计数、重试行为和 Temperature。

模型支持与集成

Studio 支持广泛的模型提供商和自定义端点,以确保生成的灵活性:

  • 引导式配置: 用户可以验证来自 OpenAI、Azure OpenAI、Ollama、Vertex、Bedrock、vLLM 以及自定义端点的模型。
  • 基础设施兼容性: 由于 Studio 生成的与写入 tasks/examples/ 的相同的 YAML/JSON 产物,因此可视化设计与 CLI 的执行引擎完全兼容。

示例用例:Glaive Code Assistant

SyGra Studio 可以执行现有的工作流,例如 Glaive Code Assistant。这一特定工作流摄取 glaiveai/glaive-code-assistant-v2 数据集,并采用由条件边连接的两个 LLM 节点(generate_answercritique_answer)组成的循环。该过程会持续循环,直到 critique 节点返回 "NO MORE FEEDBACK",从而生成可用于模型训练或评估的合成数据。

Sources

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch
  • 项目