thiswillbeyourgithub/wdoc
Summarize and query from a lot of heterogeneous documents. Any LLM provider, any filetype, advanced RAG, advanced summaries, scriptable, etc
해결하는 문제
wdoc는 대규모이고 다양한 종류의 문서 컬렉션을 처리하기 위해 설계된 검색 증강 생성(RAG) 시스템입니다. PDF, 오디오 녹음, 영상 강의, Anki 플래시카드와 같은 다양한 파일 형식을 동시에 쿼리하고 요약하는 문제를 해결하며, 환상( hallucination )을 방지하기 위해 출처가 명시된 답변과 저자의 사고 과정을 반영한 상세한 요약을 제공합니다.
작동 방식
고정확도와 정밀도를 보장하기 위해 다단계 파이프라인을 사용합니다.
- 검색: 문서는 임베딩을 통해 검색되며, 사용자 검색어를 확장하기 위해 다중 쿼리 리트리버를 자주 사용합니다.
- 평가: '약한' LLM(Eve the Evaluator)이 초기 검색 결과에서 관련 없는 문서를 필터링합니다.
- 추출: '강한' LLM(Anna the Answerer)이 남은 각 문서에서 관련 정보를 추출합니다.
- 집약: '조합기' LLM(Carl the Combiner)이 개별 답변을 통합하여 최종 마크다운 응답을 생성합니다. 최적화를 위해 시파이(scipy)의 계층적 클러스터링을 사용하여 의미적 유사성에 따라 답변을 배치한 후 결합합니다.
요약 기능은 텍스트를 청크로 나누고, 강력한 LLM(Sam the Summarizer)이 논리적 들여쓰기를 유지하며 상세한 요약을 생성하여 청크 간의 맥락을 유지합니다.
대상 사용자
광범위하고 다양한 정보 원천을 다루며, 대규모 문서 컬렉션에서 확실하고 출처가 명시된 답변이 필요한 연구자, 학생, 전문가를 위한 시스템입니다.
주요 특징
- 다양한 파일 형식 지원: Anki 컬렉션, YouTube 영상, 오디오 파일(무음 제거 기능 포함), PDF(최적의 파싱을 위한 15가지 로더 지원), 웹 페이지 등 15가지 이상의 파일 형식을 지원합니다.
- 유연한 LLM 통합: LiteLLM를 통해 100개 이상의 LLM과 다양한 임베딩 엔진과 호환되며, 개인정보 보호를 위해 로컬 모델도 사용 가능합니다.
- 출처가 명시된 답변: 모든 답변은 고유한 문서 해시와 연결되어 사용자가 주장의 정당성을 검증할 수 있습니다.
- 상세한 요약: 고급 요약이 아닌 저자의 사고 과정과 추론을 압축하는 데 중점을 둡니다.
- 다양한 배포 옵션: CLI 도구, Python 라이브러리, Docker를 통한 Gradio 기반 웹 인터페이스로 제공됩니다.
- 웹 검색: DuckDuckGo를 통한 웹 검색에 대한 초기 지원 기능이 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트