SyGra 2.0.0 Studio 发布
SyGra 2.0.0 引入了 Studio,这是一个交互式的可视化环境,旨在将合成数据生成从手动编辑 YAML 文件和使用终端的过程转变为一种透明、可视化的创作方式。Studio 允许用户在画布上组合工作流,预览数据集,并通过内联变量提示来调整提示词,同时通过生成相应的图配置和任务执行器脚本,保持与底层 SyGra 平台的全方位兼容性。
可视化工作流设计与组合
SyGra Studio 通过拖拽式界面实现合成数据流水线的创建。用户可以利用各种节点类型和配置选项来构建复杂的逻辑:
- LLM 节点: 用户可以选择已配置的模型(例如
gpt-4o-mini),编写提示词,并定义输出变量(例如,将结果存储在story_body中)。 - 高级逻辑: 该环境支持结构化输出、工具附件、Lambda 节点以及用于可重用逻辑或分支行为的 Subgraph 节点。
- 动态提示词: 在提示词编辑器中输入
{会立即显示所有可用的状态变量,从而实现对来自先前节点的数据的无缝引用。 - 多 LLM 设置: 详情面板提供了对模型参数和并行生成设置的访问权限。
数据源集成与验证
Studio 通过为数据源配置和验证提供引导式表单,简化了合成数据生成的初始阶段:
- 支持的连接器: 用户可以连接到 Hugging Face、本地文件系统或 ServiceNow 数据源。
- 即时预览: 在输入
repo_id、split 或文件路径等参数后,用户可以预览样本行,以确保在执行前数据是正确的。 - 自动变量映射: 来自数据源的列名会自动转换为状态变量(例如,
{prompt}、{genre}),从而消除了手动连接和猜测。
执行、可观测性与调试
SyGra Studio 提供实时监控和调试工具,以确保合成数据运行的质量和成本:
- 实时流式传输: 在工作流运行期间,Execution 面板会实时流式传输节点状态、Token 使用量、延迟和成本。
- 可观测性: 详细的日志和执行历史存储在
.executions/runs/*.json中,允许用户将结果与之前的执行进行比较。 - 调试工具: 界面包含内联日志、断点和基于 Monaco 的代码编辑器,以便进行快速迭代。
- 运行配置: Run 对话框允许用户在不修改底层 YAML 配置的情况下,调整批处理大小、记录计数、重试行为和 Temperature。
模型支持与集成
Studio 支持广泛的模型提供商和自定义端点,以确保生成的灵活性:
- 引导式配置: 用户可以验证来自 OpenAI、Azure OpenAI、Ollama、Vertex、Bedrock、vLLM 以及自定义端点的模型。
- 基础设施兼容性: 由于 Studio 生成的与写入
tasks/examples/的相同的 YAML/JSON 产物,因此可视化设计与 CLI 的执行引擎完全兼容。
示例用例:Glaive Code Assistant
SyGra Studio 可以执行现有的工作流,例如 Glaive Code Assistant。这一特定工作流摄取 glaiveai/glaive-code-assistant-v2 数据集,并采用由条件边连接的两个 LLM 节点(generate_answer 和 critique_answer)组成的循环。该过程会持续循环,直到 critique 节点返回 "NO MORE FEEDBACK",从而生成可用于模型训练或评估的合成数据。
Sources
- OriginalIntroducing SyGra Studio
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- 项目