DeepXiv/deepxiv_sdk

Talk to research papers like talking to authors - Python package with AI agent for arXiv papers

DeepXiv SDK – 전체 텍스트 논문 및 웹 기반 에이전트 검색

무엇인가요deepxiv-sdk는 자연어 질문을 할 수 있고, 실제 출처에 근거한 답변을 제공하는 Python 패키지(보조 CLI 포함)입니다. 서비스는 전체 텍스트 arXiv 논문(또는 캐시된 웹 페이지)을 검색하고, LLM이 관련 섹션을 읽은 후, 실제 arXiv ID나 URL을 인용으로 포함한 답변을 스트리밍 방식으로 반환합니다.

왜 중요한가요 – 대부분의 LLM 기반 검색 도구는 링크 목록이나 초록에서 합성만 제공합니다. DeepXiv는 자율 에이전트가 연구 논문의 실제 내용을 추론할 수 있도록 데이터 계층을 추가하여, 출력이 검증 가능하고, 후속 워크플로우(예: 문헌 리뷰, 자동 보고서, RAG 파이프라인)에 적합하게 만듭니다.


핵심 기능

기능 제공되는 기능
에이전트 ask deepxiv ask "…"로 쿼리를 보내면, 서비스가 도구를 선택하고, 출처를 읽고, 인용된 답변을 스트리밍합니다. 두 가지 백엔드: arxiv (전체 텍스트 논문) 및 --web (Google 캐시 페이지).
실제 인용 답변에는 실제 arXiv ID나 URL이 포함되며, 서비스는 식별자를 위조하지 않습니다.
진행형 읽기 CLI 헬퍼(search, paper --brief/--head/--section)를 통해 후보를 검색하고, 메타데이터를 스캔하며, 필요한 섹션만 읽을 수 있어 토큰을 절약할 수 있습니다.
세밀한 필터 저자, 기관, 회의, 연도, 카테고리, 인용 횟수, 날짜 범위 등을 AND 논리로 조합하여 정확한 검색이 가능합니다.
에이전트 통합 Reader 클래스와 예제 MCP 서버 래퍼를 통해 ask를 자율 에이전트용 도구로 노출하는 방법을 보여줍니다.
다중 노력 모드 `--effort default
스트리밍 / JSON 출력 답변은 stdout으로 스트리밍되며, 메타데이터(진행 상황, 할당량)는 stderr로 출력됩니다. --json은 단일 JSON 객체를 반환합니다.
레이트 제한 무료 자동 등록 토큰: 하루 1,000회 일반 호출(에이전트 호출 불가). 등록 계정: 하루 10,000회 일반 호출 + 30회 에이전트 호출.
지원되는 출처 arXiv(전체 텍스트), Google 캐시 페이지, PubMed Central, bioRxiv/medRxiv.

빠른 시작 (CLI)

pip install deepxiv-sdk            # 패키지 및 CLI 설치
# 토큰을 얻기 위해 계정 등록
deepxiv config --token YOUR_KEY
# arXiv 논문 기반 간단한 질문
deepxiv ask "DEER는 HumanEval에서 어떤 성능 향상을 보고합니까"
# 웹 기반 동일한 질의
deepxiv ask "Anthropic Claude API 가격 계층" --web

답변은 stdout에 출력되며, 인용은 stderr에 출력됩니다. > answer.md로 리다이렉트하면 답변만 캡처할 수 있습니다.

빠른 시작 (Python)

from deepxiv_sdk import Reader
reader = Reader()                     # 설정 파일 또는 환경 변수에서 토큰 읽기
res = reader.agent_search(
    "DEER는 HumanEval에서 어떤 성능 향상을 보고합니까",
    source="arxiv", effort="default"
)
print(res["answer"])                 # 스트리밍된 답변 텍스트
print(res["sources"])                # 검색 결과 세트 (사전 리스트)

SDK는 비에이전트 헬퍼(search, paper, trending 등)도 제공하며, 구조화된 JSON을 반환합니다.


언제 사용할지

  • 최신 논문에서 검증 가능한 수치, 방법 세부 정보, 벤치마크 결과가 필요한 연구 보조자.
  • 출처를 인용해야 하는 자율 에이전트(예: 환각을 피하는 RAG 파이프라인).
  • HTTP 기반 백엔드를 간단히 구축하고 싶은 도구 개발자(Reader는 REST API를 래핑함). 직접 arXiv 다운로드를 처리할 필요 없음.

알려진 제한 및 주의사항

  • 에이전트 호출은 등록된 토큰이 필요합니다. 자동 등록 토큰은 ask에 사용할 수 없습니다.
  • 노력 수준은 초기 검색 정확도를 변경하지 않습니다. --effort를 높여도 첫 번째 검색 라운드에서 놓친 논문은 추가 읽기로 복구할 수 없습니다.
  • 웹 백엔드는 캐시된 페이지 본문만 읽습니다. 캐시되지 않은 페이지는 검색 스니펫만 제공되며, 출력에서 표시됩니다.
  • 답변 자르기--max-answer-tokens에 도달하면 answer_truncated로 표시됩니다. 호출자는 불완전한 것으로 간주해야 합니다.
  • 카버리지 – 인덱싱되는 것은 오픈 액세스 문헌뿐입니다(arXiv, PMC, bioRxiv/medRxiv). 구독 전용 논문은 사용 불가능합니다.

라이선스 및 지원


결론

DeepXiv SDK는 LLM 추론과 과학 논문의 실제 내용 사이의 갭을 메우는 즉시 사용 가능한 인용 인식 검색 계층을 제공합니다. 신뢰할 수 있는 연구 보조자 구축이나, 답변을 검증 가능한 출처로 뒷받침해야 하는 모든 AI 시스템에 특히 유용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트