DeepXiv/deepxiv_sdk

Talk to research papers like talking to authors - Python package with AI agent for arXiv papers

DeepXiv SDK – 全文论文与网络上的代理搜索

是什么deepxiv-sdk 是一个 Python 包(附带 CLI 工具),允许您提出自然语言问题并获得 基于真实来源 的答案。该服务检索全文 arXiv 论文(或缓存网页),让 LLM 阅读相关部分,并流式返回包含真实 arXiv ID 或 URL 作为引用的答案。

为何重要 – 大多数 LLM 驱动的搜索工具仅返回链接列表或从摘要中合成内容。DeepXiv 增加了 数据层,使自主代理能够基于研究论文的实际内容进行推理,从而输出可验证的内容,适用于下游工作流(例如文献综述、自动报告或 RAG 管道)。


核心功能

功能 你将获得
代理 ask deepxiv ask "…" 发送查询,服务选择工具、读取来源并流式返回带引用的答案。两种后端:arxiv(全文论文)和 --web(Google 缓存页面)。
真实引用 答案包含真实的 arXiv ID 或 URL;服务从不伪造标识符。
渐进式阅读 CLI 辅助工具(searchpaper --brief/--head/--section)可让你检索候选、快速浏览元数据,并仅阅读所需部分,节省 token。
细粒度过滤 可组合作者、机构、会议、年份、类别、引用次数、日期范围等条件,使用 AND 逻辑实现精确检索。
代理集成 提供 Reader 类和示例 MCP 服务器包装器,展示如何将 ask 作为工具暴露给自主代理。
多努力模式 `--effort default
流式 / JSON 输出 答案流式输出至 stdout;元数据(进度、配额)输出至 stderr--json 返回单个 JSON 对象。
速率限制 免费自动注册令牌:1,000 次/日通用调用(无代理调用)。注册账户:10,000 次/日通用调用 + 30 次/日代理调用。
支持来源 arXiv(全文)、Google 缓存网页、PubMed Central、bioRxiv/medRxiv。

快速开始(CLI)

pip install deepxiv-sdk            # 安装包与 CLI
# 注册账户以获取令牌
deepxiv config --token YOUR_KEY
# 在 arXiv 论文中进行简单提问
deepxiv ask "DEER 在 HumanEval 上报告了多大的加速"
# 在网络上进行相同查询
deepxiv ask "Anthropic Claude API 定价层级" --web

答案显示在 stdout;引用打印在 stderr。重定向 > answer.md 可仅捕获答案。

快速开始(Python)

from deepxiv_sdk import Reader
reader = Reader()                     # 从配置/环境变量读取令牌
res = reader.agent_search(
    "DEER 在 HumanEval 上报告了多大的加速",
    source="arxiv", effort="default"
)
print(res["answer"])                 # 流式答案文本
print(res["sources"])                # 检索结果集(字典列表)

SDK 还提供非代理辅助工具(searchpapertrending 等),返回结构化 JSON。


何时使用

  • 需要从最新论文中获取可验证数据、方法细节或基准结果的研究助手。
  • 必须引用来源的自主代理(例如,必须避免幻觉的 RAG 管道)。
  • 希望构建简单 HTTP 后端(Reader 包装 REST API)的工具开发者,无需自行处理原始 arXiv 下载。

已知限制与注意事项

  • 代理调用需要注册令牌;自动注册令牌不能用于 ask
  • 努力级别不改变初始召回率 – 提高 --effort 会增加更多阅读轮次,但无法检索首次检索中遗漏的论文。
  • 网络后端仅读取缓存页面正文;未缓存页面仅提供其搜索片段,输出中标记。
  • 答案截断 – 若达到 --max-answer-tokens,响应将标记为 answer_truncated;调用方应视为不完整。
  • 覆盖范围 – 仅索引开放获取文献(arXiv、PMC、bioRxiv/medRxiv)。订阅制论文不可用。

许可与支持


总结

DeepXiv SDK 提供了一个开箱即用、具备引用意识的搜索层,弥合了 LLM 推理与科学论文实际内容之间的差距。特别适用于构建可信的研究助手,或任何必须用可验证来源支持答案的 AI 系统。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目