ianarawjo/ChainForge

An open-source visual programming environment for battle-testing prompts to LLMs.

해결하는 문제

ChainForge는 LLM 프롬프트를 체계적으로 테스트하고 비교하는 어려움을 해결합니다. 단일 모델과의 즉흥적인 채팅에 의존하는 대신, 프롬프트 변형, 다양한 모델, 및 여러 모델 설정을 배틀 테스트하여 가장 높은 품질의 응답을 생성하는 조합을 결정하기 위한 구조화된 환경을 제공합니다.

작동 방식

ReactFlow와 Flask로 구축된 시각적 데이터 플로우 환경을 사용하여 사용자가 노드 체인을 생성할 수 있습니다. 시스템은 "조합적 힘"을 활용하여 입력 변수의 직적산을 취함으로써 선택된 여러 LLM에 걸쳐 프롬프트의 모든 가능한 순열을 자동으로 생성하고 실행합니다. 그런 다음 사용자는 Python 기반 평가 노드를 적용하여 응답에 점수를 매기고, 시각화 노드를 사용하여 결과를 플롯할 수 있습니다(예: 상자 수염 그림 또는 히스토그램).

대상 사용자

수동 테스트를 넘어 LLM 동작을 평가하고 프롬프트 템플릿을 최적화하기 위해 더 엄격하고 확장 가능한 접근 방식이 필요한 프롬프트 엔지니어와 AI 연구자를 위해 설계되었습니다.

하이라이트

  • 멀티 모델 쿼리: 동일한 프롬프트 순열을 여러 LLM에 동시에 전송합니다.
  • 조합 테스트: 프롬프트 템플릿과 입력 변수의 모든 조합을 자동으로 테스트합니다.
  • 통합 RAG 지원: 업로드, 청킹, 검색, 재랭킹을 위한 브라우저 기반 및 서버 측 노드를 포함합니다.
  • 시각적 평가: LLM 응답의 수치 및 불리언 메트릭을 시각화하기 위한 내장 도구.
  • GenAI 지원: 합성 데이터 테이블 생성 및 평가 함수용 시작 코드 생성 기능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트