Scry 출시: 혼잡 통행료 기반의 프로그래밍 가능한 인터넷 검색

Scry는 에이전트가 실시간 다중 소스 웹 코퍼스에 대해 임의의 제한된 SQL 스타일 쿼리를 실행할 수 있도록 지원합니다

핵심 요약: Scry는 단일 MCP 엔드포인트(https://mcp.scry.io)를 제공하여 ChatGPT, Claude, Codex, Cursor 및 모든 MCP 호환 클라이언트가 4160억 개의 행을 포함하는 43개의 공개 데이터 소스에 대해 읽기 전용 쿼리를 실행할 수 있게 하며, 각 쿼리의 선언된 실행 시간에 따라 가격이 책정됩니다.

Scry가 실제로 제공하는 것

  • 프로그래밍 방식 검색: 에이전트는 구문 일치, 시간 창, 조인 및 벡터 구성을 지원하는 SQL 방언을 사용하여 Reddit, Hacker News, LessWrong, arXiv, Stack Exchange, Wikipedia, 예측 시장 및 기타 여러 소스를 쿼리할 수 있습니다.
  • 실시간 스키마 검색: GET /v1/scry/schema는 모든 관계, 해당 열, 행 수 및 최신성 지연을 설명하는 기계 판독 가능한 계약을 반환합니다. 에이전트는 이 카탈로그에서 관계를 선택해야 하며, 사용할 수 없는 이름은 생략됩니다.
  • 행 수준 출처: 결과는 소스 고유 식별자와 타임스탬프를 유지하여 원본 문서까지 추적할 수 있습니다.
  • 제한된 실행: 각 쿼리는 마감 시간, 메모리 상한 및 행 제한 내에서 실행됩니다. 에이전트는 x-scry-explain: 1 헤더를 통해 실행 계획을 요청하여 비용을 지불하기 전에 예상 행 수, 바이트 및 컴퓨팅 자원을 확인할 수 있습니다.
  • 벡터 기본 요소: 임베딩은 일급 값입니다. scry_centroid, scry_contrast_axis_balanced, scry_cosine_similarity와 같은 함수를 통해 에이전트는 벡터에 대한 산술 연산을 수행하고 사용자 지정 의미론적 축을 따라 코퍼스의 순위를 매길 수 있습니다.
  • 재순위 지정: x-scry-rerank 헤더(또는 /v1/scry/rerank 엔드포인트)를 사용하면 에이전트가 로컬 LLM을 사용하여 이미 가져온 행의 순서를 무료로 다시 지정할 수 있습니다.

2026년 9월 11일 기준 규모 및 최신성

  • 쿼리 가능한 행: 43개 소스에 걸쳐 약 1610억 개의 행을 즉시 쿼리할 수 있습니다.
  • 총 보유 자산: 4160억 개의 행, 일일 수집 속도 +326억 개(분당 약 2270만 개).
  • 주요 소스 분석 (선택된 예시):
    • Reddit 댓글: 270억 개의 행 (2005년부터 현재까지 거의 완전한 아카이브).
    • Hacker News 항목: 4500만 개의 행, 15분 이내에 새로 고침.
    • Common Crawl 페이지: 208억 개의 행의 추출된 텍스트.
    • OpenAlex 연구물: 5억 1100만 개의 행의 학술 메타데이터.
    • 코드 및 종속성 그래프: GitHub 이벤트, deps.dev 및 패키지 레지스트리에 걸쳐 439억 개의 행.
  • 비공개 소스: 2550억 개의 행이 보유 자산으로 계산되지만 특별한 액세스 권한 없이는 쿼리할 수 없습니다.

가격 모델 – "혼잡 통행료"

등급 비용 대상 사용자
연구원 $0 (5달러 가입 크레딧 포함) 비영리, 개인 연구원
후원자 월 $100 (이월 가능) 취미 활동가 및 소규모 팀
월 $2,000부터 상업적 용도, 전용 용량
에이전트 선언된 초당 $0.05 자율 에이전트를 위한 종량제

에이전트는 쿼리 헤더(x-scry-max-seconds)에 선언한 시간에 대해서만 요금이 청구됩니다. 이 모델은 소스의 행 예산 중 큰 부분을 소비하는 지나치게 광범위한 스캔을 억제하여 원시 데이터 양이 아닌 혼잡도에 따라 가격을 책정합니다.

연결 방법

  1. ChatGPTDeveloper mode를 활성화하고 https://mcp.scry.io를 가리키는 scry라는 플러그인을 추가한 후 로그인합니다.
  2. ClaudeSettings → Connectors에서 동일한 URL로 사용자 지정 커넥터를 추가합니다.
  3. 개발자 – 대시보드에서 API 키를 받아 HTTP API(https://api.scry.io/v1/scry/query)를 사용하거나 모든 MCP 클라이언트(Claude Code, Codex, Cursor)를 사용합니다.

일반적인 요청 (curl 예시):

curl -s https://api.scry.io/v1/scry/query \
  -H "Authorization: Bearer $SCRY_API_KEY" \
  -H "Content-Type: text/plain" \
  --data "SELECT hn_id, title FROM hackernews.items WHERE hn_id >= (SELECT max(hn_id) FROM hackernews.story_scores WHERE observed_on >= today() - 7) - 100000 ORDER BY hn_id DESC LIMIT 20"

Scry의 강력함을 보여주는 쿼리 예시

  • 좋아요보다 북마크를 더 많이 하는 팔로워가 적은 계정 찾기 (2억 400만 개의 트윗 수정본에 대해 4.9초).
  • 두 문장 사이의 대조 축을 사용하여 LessWrong의 정렬 드리프트 측정 (약 0.1초).
  • Elon Musk, Sam Altman, Eliezer Yudkowsky의 공통 팔로워 식별 (290만 개의 행에 대해 171ms).
  • Scaling LawsChinchilla를 모두 인용하는 논문 찾기 (0.1초, 195개 일치).
  • Hacker News에서 반복되는 불화 감지 (4670만 개의 행에 대해 1.6초).

이 예시들은 단일 선언적 문장이 수십 번의 수동 스크래핑 및 후처리 단계를 어떻게 대체할 수 있는지 보여줍니다.

Hacker News 커뮤니티 피드백

codexon: “Reddit 댓글은 어떻게 스크래핑했나요? 비싼 라이선스가 필요하지 않나요?” – 게시물은 라이선스 세부 정보를 공개하지 않으며, 댓글은 데이터 출처에 대한 일반적인 우려를 강조합니다.

ashkankiani: “가격 책정이 알고리즘 트레이딩을 연상시킵니다. Wikipedia처럼 P2P를 통해 데이터셋을 배포할 수 있나요?” – 쿼리 측 혼잡을 줄이기 위해 오픈 소스 배포에 대한 열망을 시사합니다.

vova_hn2: “가격 모델을 이해하기 어렵습니다. ‘쿼리 시간 초’가 정의되지 않았습니다.” – 새로운 가격 책정 용어에 대해 더 명확한 문서화가 필요함을 확인합니다.

DylanMerigaud: “쿼리에 대한 혼잡 통행료는 혁신적으로 들립니다.” – 경제 모델에 대한 긍정적인 반응입니다.

MrDrMcCoy: “이것이 더 작은 검색 엔진을 보완하고 Google/Bing의 지배력을 깰 수 있을까요?” – 잠재적인 생태계 영향을 강조합니다.

전반적인 정서는 열광적이지만 데이터 라이선스, 가격 책정 메커니즘 및 기본 코퍼스의 잠재적인 오픈 배포에 대한 더 명확한 설명을 요구하고 있습니다.

Scry가 중요한 이유

  • 진정한 프로그래밍 방식의 연구 가능: 에이전트는 더 이상 페이지별로 스크래핑을 이어 붙일 필요가 없으며, 웹에 단일하고 구성 가능한 쿼리를 요청하여 구조화되고 출처가 풍부한 결과를 받을 수 있습니다.
  • 중복 크롤링 감소: 원시 소스 테이블을 노출함으로써 Scry는 각 다운스트림 도구가 자체 크롤러를 유지할 필요를 없애 대역폭 및 저장 비용을 절감합니다.
  • 경제적 인센티브 도입: 혼잡 통행료는 낭비적이고 대량의 스캔을 억제하여 자원 사용을 얻은 통찰력의 가치와 일치시킵니다.
  • 공익 인프라: 비영리 연구원을 위한 무료 등급은 대규모 데이터 분석의 장벽을 낮추고, 상업적 참여는 서비스 자금을 조달합니다.

사용자를 위한 다음 단계

  1. 무료 연구원 계정에 가입하여 API 키를 받으세요.
  2. 실시간 스키마(/v1/scry/schema)를 검색하고 사용 가능한 관계를 탐색하세요.
  3. x-scry-explain 헤더를 사용하여 쿼리를 프로토타이핑하고 실행 전 비용을 측정하세요.
  4. MCP 엔드포인트를 LLM 기반 에이전트나 분석 파이프라인에 통합하세요.

모든 성능 수치(예: Hacker News 텍스트 GB당 0.86초)는 2026년 9월 11일 실시간 프로덕션 시스템에서 측정되었으며 일반적인 부하 상태에서의 단일 서버 실행을 반영합니다.

Sources

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch
  • Dispatch