Future-House/paper-qa
High accuracy RAG for answering questions from scientific documents with citations
What it solves
PaperQA2 是为科学文献设计的高精度检索增强生成(RAG)系统。它解决了从 PDF、文本文件和 Office 文档等复杂文档中提取精确、基于证据的答案的难题,确保响应包含正文引用,并基于提供来源的验证证据。
How it works
PaperQA2 使用代理式 RAG 工作流,能够迭代地细化查询和答案。该过程通常分为三个阶段:
- Paper Search:系统生成关键词查询以寻找候选论文,然后将论文切块并嵌入搜索索引。
- Gather Evidence:将用户查询嵌入,排名最高的文档块,并在查询上下文中创建这些块的得分摘要。随后 LLM 重新评分并选择最相关的摘要。
- Generate Answer:将最佳摘要放入提示中生成最终的基于证据的答案。
它集成了 Semantic Scholar 和 Crossref 等服务获取元数据,并使用 LiteLLM 兼容各种 LLM 提供商。
Who it’s for
此工具面向研究人员、科学家以及任何需要处理大量科学论文、进行问答、摘要和矛盾检测且要求高精度和可验证引用的人群。
Highlights
- Agentic RAG:使用语言代理人迭代细化搜索和证据收集。
- Multimodal Support:能够解析 PDF 中的表格、图形和数学公式,使用如 Docling 和 Nvidia nemotron-parse 等模型阅读器。
- Grounded Responses:提供带有精确正文引用的答案。
- Metadata Awareness:自动获取引用次数和期刊质量数据以提升检索效果。
- Flexible Configuration:包含针对不同使用场景的预设配置(如高质量、快速或矛盾检测),并通过 LiteLLM 支持多种 LLM 提供商。