ianarawjo/ChainForge

An open-source visual programming environment for battle-testing prompts to LLMs.

解决的问题

ChainForge 解决了系统性测试和比较 LLM 提示词的困难。它不再依赖于与单个模型的临时聊天,而是提供了一个结构化环境,用于对提示词变体、不同模型以及各种模型设置进行实战测试,以确定哪种组合能产生最高质量的响应。

工作原理

它使用一个可视化数据流环境(基于 ReactFlow 和 Flask 构建),用户可以在其中创建节点链。该系统利用“组合力量”,通过计算输入变量的笛卡尔积,自动在多个选定的 LLM 上生成并运行提示词的所有可能排列。然后,用户可以应用基于 Python 的评估节点对响应进行评分,并使用可视化节点绘制结果(例如,使用箱线图或直方图)。

适用人群

它专为需要超越手动测试,采用更严格、可扩展的方法来评估 LLM 行为并优化提示词模板的提示词工程师和 AI 研究人员而设计。

亮点

  • 多模型查询:将相同的提示词排列同时发送到多个 LLM。
  • 组合测试:自动测试提示词模板和输入变量的所有组合。
  • 集成 RAG 支持:包含用于上传、分块、检索和重排的基于浏览器和服务器端的节点。
  • 可视化评估:内置工具,用于可视化 LLM 响应中的数值和布尔指标。
  • GenAI 辅助:功能包括创建合成数据表和生成评估函数的起始代码。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目