Future-House/paper-qa

High accuracy RAG for answering questions from scientific documents with citations

What it solves

PaperQA2 是為科學文獻設計的高精度檢索增強生成(RAG)系統。它解決了從 PDF、文字檔與 Office 文件等複雜文件中提取精確、具根據的答案的挑戰,確保回應包含內文引用,且基於提供來源的驗證證據。

How it works

PaperQA2 使用代理式 RAG 工作流程,能迭代地精煉查詢與答案。流程通常分為三個階段:

  1. Paper Search:系統產生關鍵字查詢以找尋候選論文,然後將論文切塊並嵌入搜尋索引。
  2. Gather Evidence:將使用者查詢嵌入,排序最高的文件切塊,並在查詢上下文中產生這些切塊的得分摘要。接著 LLM 重新評分並選取最相關的摘要。
  3. Generate Answer:將最佳摘要放入提示詞,產生最終的具根據答案。

它整合了 Semantic Scholar 與 Crossref 等服務以取得中繼資料,並使用 LiteLLM 以相容各種 LLM 供應商。

Who it’s for

此工具適用於研究人員、科學家,以及任何需要處理大量科學論文、執行問答、摘要與矛盾偵測且要求高精度與可驗證引用的人士。

Highlights

  • Agentic RAG:使用語言代理人迭代精煉搜尋與證據收集。
  • Multimodal Support:能解析 PDF 中的表格、圖形與數學方程式,使用如 Docling 與 Nvidia nemotron-parse 等模型閱讀器。
  • Grounded Responses:提供帶有精確內文引用的答案。
  • Metadata Awareness:自動取得引用次數與期刊品質資料以增強檢索。
  • Flexible Configuration:內含不同使用情境的預設設定(如高品質、快速或矛盾偵測),並透過 LiteLLM 支援多種 LLM 供應商。