DeepXiv/deepxiv_sdk

Talk to research papers like talking to authors - Python package with AI agent for arXiv papers

DeepXiv SDK – 全文論文與網路上的代理搜尋

是什麼deepxiv-sdk 是一個 Python 套件(附帶 CLI 工具),讓您提出自然語言問題,並獲得 基於真實來源 的答案。此服務會檢索全文 arXiv 論文(或快取網頁),讓 LLM 閱讀相關段落,並以串流方式回傳包含真實 arXiv ID 或 URL 作為引用的答案。

為何重要 – 多數 LLM 驅動的搜尋工具僅返回連結清單或從摘要中合成內容。DeepXiv 增加了 資料層,讓自主代理能基於研究論文的實際內容進行推理,使輸出可驗證,適用於後續工作流程(例如文獻回顧、自動報告或 RAG 管道)。


核心功能

功能 你將獲得
代理 ask deepxiv ask "…" 發送查詢,服務選擇工具、讀取來源並串流回傳帶引用的答案。兩種後端:arxiv(全文論文)和 --web(Google 快取頁面)。
真實引用 答案包含真實的 arXiv ID 或 URL;服務從不偽造識別碼。
進階式閱讀 CLI 輔助工具(searchpaper --brief/--head/--section)可讓您檢索候選、快速瀏覽元資料,並僅閱讀所需段落,節省 token。
細粒度過濾 可組合作者、機構、會議、年份、類別、引用次數、日期範圍等條件,使用 AND 邏輯實現精確檢索。
代理整合 提供 Reader 類與範例 MCP 伺服器包裝器,展示如何將 ask 作為工具暴露給自主代理。
多努力模式 `--effort default
串流 / JSON 輸出 答案串流輸出至 stdout;元資料(進度、配額)輸出至 stderr--json 回傳單一 JSON 物件。
速率限制 免費自動註冊金鑰:1,000 次/日一般呼叫(無代理呼叫)。註冊帳戶:10,000 次/日一般呼叫 + 30 次/日代理呼叫。
支援來源 arXiv(全文)、Google 快取網頁、PubMed Central、bioRxiv/medRxiv。

快速開始(CLI)

pip install deepxiv-sdk            # 安裝套件與 CLI
# 註冊帳戶以取得金鑰
deepxiv config --token YOUR_KEY
# 在 arXiv 論文中進行簡單提問
deepxiv ask "DEER 在 HumanEval 上報告了多大的加速"
# 在網路上進行相同查詢
deepxiv ask "Anthropic Claude API 定價層級" --web

答案顯示在 stdout;引用印在 stderr。重導向 > answer.md 可僅捕獲答案。

快速開始(Python)

from deepxiv_sdk import Reader
reader = Reader()                     # 從設定檔/環境變數讀取金鑰
res = reader.agent_search(
    "DEER 在 HumanEval 上報告了多大的加速",
    source="arxiv", effort="default"
)
print(res["answer"])                 # 串流答案文字
print(res["sources"])                # 檢索結果集(字典清單)

SDK 還提供非代理輔助工具(searchpapertrending 等),回傳結構化 JSON。


何時使用

  • 需要從最新論文中取得可驗證數據、方法細節或基準結果的研究助理。
  • 必須引用來源的自主代理(例如,必須避免幻覺的 RAG 管道)。
  • 希望建構簡單 HTTP 後端(Reader 包裝 REST API)的工具開發者,無需自行處理原始 arXiv 下載。

已知限制與注意事項

  • 代理呼叫需要註冊金鑰;自動註冊金鑰無法用於 ask
  • 努力等級不改變初始召回率 – 提高 --effort 會增加更多閱讀回合,但無法檢索首次檢索中遺漏的論文。
  • 網路後端僅讀取快取頁面正文;未快取頁面僅提供其搜尋片段,輸出中會標記。
  • 答案截斷 – 若達到 --max-answer-tokens,回應將標記為 answer_truncated;呼叫方應視為不完整。
  • 覆蓋範圍 – 僅索引開放存取文獻(arXiv、PMC、bioRxiv/medRxiv)。訂閱制論文不可用。

許可與支援


總結

DeepXiv SDK 提供一個即開即用、具備引用感知的搜尋層,彌補了 LLM 推理與科學論文實際內容之間的差距。特別適用於建構可信的研究助理,或任何必須以可驗證來源支持答案的 AI 系統。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案