Future-House/paper-qa

High accuracy RAG for answering questions from scientific documents with citations

What it solves

PaperQA2 是为科学文献设计的高精度检索增强生成(RAG)系统。它解决了从 PDF、文本文件和 Office 文档等复杂文档中提取精确、基于证据的答案的难题,确保响应包含正文引用,并基于提供来源的验证证据。

How it works

PaperQA2 使用代理式 RAG 工作流,能够迭代地细化查询和答案。该过程通常分为三个阶段:

  1. Paper Search:系统生成关键词查询以寻找候选论文,然后将论文切块并嵌入搜索索引。
  2. Gather Evidence:将用户查询嵌入,排名最高的文档块,并在查询上下文中创建这些块的得分摘要。随后 LLM 重新评分并选择最相关的摘要。
  3. Generate Answer:将最佳摘要放入提示中生成最终的基于证据的答案。

它集成了 Semantic Scholar 和 Crossref 等服务获取元数据,并使用 LiteLLM 兼容各种 LLM 提供商。

Who it’s for

此工具面向研究人员、科学家以及任何需要处理大量科学论文、进行问答、摘要和矛盾检测且要求高精度和可验证引用的人群。

Highlights

  • Agentic RAG:使用语言代理人迭代细化搜索和证据收集。
  • Multimodal Support:能够解析 PDF 中的表格、图形和数学公式,使用如 Docling 和 Nvidia nemotron-parse 等模型阅读器。
  • Grounded Responses:提供带有精确正文引用的答案。
  • Metadata Awareness:自动获取引用次数和期刊质量数据以提升检索效果。
  • Flexible Configuration:包含针对不同使用场景的预设配置(如高质量、快速或矛盾检测),并通过 LiteLLM 支持多种 LLM 提供商。