Future-House/paper-qa
High accuracy RAG for answering questions from scientific documents with citations
What it solves
PaperQA2 是為科學文獻設計的高精度檢索增強生成(RAG)系統。它解決了從 PDF、文字檔與 Office 文件等複雜文件中提取精確、具根據的答案的挑戰,確保回應包含內文引用,且基於提供來源的驗證證據。
How it works
PaperQA2 使用代理式 RAG 工作流程,能迭代地精煉查詢與答案。流程通常分為三個階段:
- Paper Search:系統產生關鍵字查詢以找尋候選論文,然後將論文切塊並嵌入搜尋索引。
- Gather Evidence:將使用者查詢嵌入,排序最高的文件切塊,並在查詢上下文中產生這些切塊的得分摘要。接著 LLM 重新評分並選取最相關的摘要。
- Generate Answer:將最佳摘要放入提示詞,產生最終的具根據答案。
它整合了 Semantic Scholar 與 Crossref 等服務以取得中繼資料,並使用 LiteLLM 以相容各種 LLM 供應商。
Who it’s for
此工具適用於研究人員、科學家,以及任何需要處理大量科學論文、執行問答、摘要與矛盾偵測且要求高精度與可驗證引用的人士。
Highlights
- Agentic RAG:使用語言代理人迭代精煉搜尋與證據收集。
- Multimodal Support:能解析 PDF 中的表格、圖形與數學方程式,使用如 Docling 與 Nvidia nemotron-parse 等模型閱讀器。
- Grounded Responses:提供帶有精確內文引用的答案。
- Metadata Awareness:自動取得引用次數與期刊品質資料以增強檢索。
- Flexible Configuration:內含不同使用情境的預設設定(如高品質、快速或矛盾偵測),並透過 LiteLLM 支援多種 LLM 供應商。