ryoiki-tokuiten/Deepthink

Using LLMs for iteratively exploring the solution search space at scale.

해결하는 문제

Iterative Studio (Deepthink)는 복잡한 문제 해결을 위한 "테스트 시 컴퓨팅"을 확장하도록 설계되었습니다. 여러 다각적인 전략과 가설을 병렬로 탐색하는 다중 에이전트 파이프라인을 통해 LLM이 비판-수정 사이클 중 반복적인 실수를 반복하는 "인지 루프"에 빠지는 것을 방지합니다.

작동 방식

이 시스템은 여러 전문 모드로 작동합니다:

  • Deepthink 모드: 전략 생성기가 여러 병렬 접근 브랜치를 생성하는 고도화된 루프를 사용합니다. 동시에 가설 생성기는 특정 불확실성을 독립적으로 테스트합니다. 인지 루프를 깨기 위해 "구조화된 솔루션 풀 에이전트"가 임의의 구조화된 노이즈(오류가 있는 아티팩트 또는 대안 논리 조각 등)를 주입하여 모델이 일반적으로 무시할 경로를 고려하도록 강제합니다. 최종적으로 판별자가 이러한 병렬 실행 중에서 최고의 결과를 선택합니다.
  • Adaptive Deepthink 모드: 오케스트레이터 주도 워크플로우로, 다양한 전략 탐색을 관리합니다. 제한된 내부 수정 루프와 전략 생성, 가설 테스트, 성공한 브랜치 상태 저장을 위한 도구를 사용합니다.
  • Contextual 모드: 더 간단한 3에이전트 협업(메인 생성자, 반복 에이전트, 메모리 에이전트)으로, 반복적 개선과 장기적 역사 압축에 초점을 맞추어 긴 세션 동안 고품질 출력을 유지합니다.

모든 모드는 코드나 아티팩트의 실행과 검증에 사용할 수 있는 보안된 사ンド박스 가상 환경과 통합되어 있습니다.

대상 사용자

어려운 벤치마크나 엔지니어링 과제를 해결하기 위해 고인퍼런스 시간 계산 전략과 다중 에이전트 오케스트레이션을 구현하여 LLM의 추론 능력을 한계까지 끌어내고자 하는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 병렬 전략 탐색: 문제에 대해 여러 다른 접근 방식을 동시에 실행하여 최적의 해결책을 찾습니다.
  • 인지 루프 방지: 구조화된 노이즈 주입을 통해 에이전트가 반복적인 오류 패턴에 빠지는 것을 방지합니다.
  • 로봇 사ند박스: 실시간 작업 실행 및 검증을 위한 통합된 보안 가상 환경입니다.
  • 가설 테스트: 독립된 에이전트가 핵심 불확실성을 테스트하여 메인 실행 브랜치에 집중된 맥락을 제공합니다.
  • 다중 제공자 지원: 모든 주요 LLM 제공자 및 로컬 모델과 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트