Future-House/paper-qa
High accuracy RAG for answering questions from scientific documents with citations
What it solves
PaperQA2는 과학 논문을 위해 설계된 고정밀 검색 증강 생성(RAG) 시스템입니다. PDF, 텍스트 파일, Office 문서와 같은 복잡한 문서에서 정확하고 근거가 명확한 답변을 추출하는 문제를 해결하며, 응답에 본문 인용을 포함하고 제공된 소스의 검증된 증거에 기반하도록 보장합니다.
How it works
PaperQA2는 에이전트형 RAG 워크플로를 사용하여 쿼리와 답변을 반복적으로 정제할 수 있습니다. 프로세스는 일반적으로 세 단계로 진행됩니다:
- Paper Search: 시스템은 키워드 쿼리를 생성해 후보 논문을 찾고, 논문을 청크화하여 검색 인덱스에 임베딩합니다.
- Gather Evidence: 사용자 쿼리를 임베딩하고, 상위 문서 청크를 순위 매긴 뒤, 쿼리 컨텍스트에서 이 청크들의 점수 요약을 생성합니다. 이후 LLM이 재점수를 매겨 가장 관련성 높은 요약을 선택합니다.
- Generate Answer: 최적의 요약을 프롬프트에 넣어 최종 근거 기반 답변을 생성합니다.
Semantic Scholar와 Crossref와 같은 서비스를 통합해 메타데이터를 가져오고, LiteLLM을 사용해 다양한 LLM 제공자를 지원합니다.
Who it’s for
이 도구는 연구원, 과학자 및 대량의 과학 논문을 다루면서 질문 응답, 요약, 모순 탐지를 고정밀 및 검증 가능한 인용과 함께 수행해야 하는 모든 사람을 위한 것입니다.
Highlights
- Agentic RAG: 언어 에이전트를 사용해 검색 및 증거 수집을 반복적으로 정제합니다.
- Multimodal Support: Docling 및 Nvidia nemotron-parse와 같은 모델 기반 리더를 활용해 PDF의 표, 그림, 수식 등을 파싱할 수 있습니다.
- Grounded Responses: 정확한 본문 인용이 포함된 답변을 제공합니다.
- Metadata Awareness: 인용 횟수와 저널 품질 데이터를 자동으로 가져와 검색을 강화합니다.
- Flexible Configuration: 고품질, 빠른 처리, 모순 탐지 등 다양한 사용 사례에 맞춘 설정이 번들로 제공되며, LiteLLM을 통해 여러 LLM 제공자를 지원합니다.