ianarawjo/ChainForge

An open-source visual programming environment for battle-testing prompts to LLMs.

解決的問題

ChainForge 解決了系統性地測試和比較 LLM 提示詞的困難。它不再依賴於與單一模型的臨時聊天,而是提供了一個結構化環境,用於對提示詞變體、不同模型以及各種模型設定進行實戰測試,以確定哪種組合能產生最高品質的回應。

運作原理

它使用一個視覺化資料流環境(基於 ReactFlow 和 Flask 建置),使用者可以在其中建立節點鏈。該系統利用「組合力量」,透過計算輸入變數的笛卡爾積,自動在多個選定的 LLM 上生成並執行提示詞的所有可能排列。然後,使用者可以應用基於 Python 的評估節點對回應進行評分,並使用視覺化節點繪製結果(例如,使用箱線圖或直方圖)。

適用對象

它專為需要超越手動測試,採用更嚴格、可擴展的方法來評估 LLM 行為並最佳化提示詞模板的提示詞工程師和 AI 研究者而設計。

亮點

  • 多模型查詢:將相同的提示詞排列同時傳送至多個 LLM。
  • 組合測試:自動測試提示詞模板和輸入變數的所有組合。
  • 整合 RAG 支援:包含用於上傳、分塊、檢索和重新排序的基於瀏覽器端和伺服器端的節點。
  • 視覺化評估:內建工具,用於視覺化 LLM 回應中的數值和布林指標。
  • GenAI 輔助:功能包括建立合成資料表和產生評估函式的起始程式碼。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案