Scry 发布:具有拥塞定价的可编程互联网搜索

Scry 使智能体能够在实时、多源的网络语料库上运行任意、有界的 SQL 风格查询

要点: Scry 提供了一个单一的 MCP 端点 (https://mcp.scry.io),允许 ChatGPT、Claude、Codex、Cursor 以及任何兼容 MCP 的客户端在 43 个公共数据源(涵盖 4160 亿行数据)上执行只读查询,定价基于每个查询声明的执行时间。

Scry 实际提供的功能

  • 程序化搜索:智能体可以使用支持短语匹配、时间窗口、连接和向量组合的 SQL 方言查询 Reddit、Hacker News、LessWrong、arXiv、Stack Exchange、Wikipedia、预测市场以及许多其他来源。
  • 实时模式发现GET /v1/scry/schema 返回一个机器可读的契约,描述了每个关系、其列、行数和新鲜度延迟。智能体必须从该目录中选择关系;不可用的名称将被省略。
  • 行级溯源:结果保留了源原生的标识符和时间戳,从而能够追溯到原始文档。
  • 有界执行:每个查询都在截止时间、内存上限和行数上限下运行。智能体可以通过 x-scry-explain: 1 标头请求执行计划,以在付费前查看估计的行数、字节数和计算量。
  • 向量原语:嵌入是第一类值。诸如 scry_centroidscry_contrast_axis_balancedscry_cosine_similarity 等函数允许智能体对向量执行算术运算,并沿自定义语义轴对语料库进行排名。
  • 重排序x-scry-rerank 标头(或 /v1/scry/rerank 端点)允许智能体使用本地 LLM 免费对已获取的行进行重新排序。

截至 2026-09-11 的规模和新鲜度

  • 可查询行数:约 1610 亿行数据可在 43 个来源中立即查询。
  • 总持有资产:4160 亿行,每日摄入率为 +326 亿行(≈2270 万行/分钟)。
  • 关键来源细分(精选示例):
    • Reddit 评论:270 亿行(2005 年至今近乎完整的存档)。
    • Hacker News 条目:4500 万行,在 15 分钟内刷新。
    • Common Crawl 页面:208 亿行提取文本。
    • OpenAlex 作品:5.11 亿行学术元数据。
    • 代码和依赖图:跨 GitHub 事件、deps.dev 和包注册表的 439 亿行数据。
  • 未公开来源:2550 亿行数据计入持有资产,但未经特殊访问无法查询。

定价模型 – “拥塞定价”

层级 费用 目标受众
研究员 $0(包含 $5 注册额度) 非商业、个人研究人员
赞助者 $100 / 月(可结转) 业余爱好者和小团队
团队 $2,000 / 月起 商业用途,专用容量
智能体 $0.05 / 声明秒数 自主智能体按使用付费

智能体仅需为其在查询标头 (x-scry-max-seconds) 中声明的时间付费。 这种模式抑制了会消耗源行预算大部分份额的过度广泛扫描,有效地对拥塞而非原始数据量进行定价。

如何连接

  1. ChatGPT – 启用 Developer mode,添加一个名为 scry 的插件,指向 https://mcp.scry.io,然后登录。
  2. Claude – 在 Settings → Connectors 下添加一个具有相同 URL 的自定义连接器。
  3. 开发者 – 使用 HTTP API (https://api.scry.io/v1/scry/query) 配合仪表板中的 API 密钥,或使用任何 MCP 客户端(Claude Code, Codex, Cursor)。

典型请求(curl 示例):

curl -s https://api.scry.io/v1/scry/query \
  -H "Authorization: Bearer $SCRY_API_KEY" \
  -H "Content-Type: text/plain" \
  --data "SELECT hn_id, title FROM hackernews.items WHERE hn_id >= (SELECT max(hn_id) FROM hackernews.story_scores WHERE observed_on >= today() - 7) - 100000 ORDER BY hn_id DESC LIMIT 20"

展示 Scry 强大功能的示例查询

  • 查找书签多于点赞的低关注账号(在 2.04 亿条推文修订版上耗时 4.9 秒)。
  • 使用两个立场句子之间的对比轴衡量 LessWrong 上的对齐漂移(≈0.1 秒)。
  • 识别 Elon Musk、Sam Altman 和 Eliezer Yudkowsky 的共同关注者(在 290 万行数据上耗时 171 毫秒)。
  • 定位同时引用了 Scaling LawsChinchilla 的论文(0.1 秒,195 个匹配项)。
  • 检测 Hacker News 上的反复争论(在 4670 万行数据上耗时 1.6 秒)。

这些示例展示了单个声明性语句如何取代数十个手动抓取和后处理步骤。

来自 Hacker News 的社区反馈

codexon: “你是如何抓取 Reddit 评论的?这不需要昂贵的许可吗?” – 该帖子未披露许可细节;该评论强调了关于数据溯源的普遍担忧。

ashkankiani: “定价让我想起了算法交易。你能像 Wikipedia 那样通过 P2P 分发数据集吗?” – 建议通过开源分发来减少查询端的拥塞。

vova_hn2: “定价模型很难理解;‘查询时间秒数’未定义。” – 证实了这种新颖的定价术语可能需要更清晰的文档。

DylanMerigaud: “查询的拥塞定价听起来很有创新性。” – 对该经济模型的积极评价。

MrDrMcCoy: “这能补充较小的搜索引擎并打破 Google/Bing 的垄断吗?” – 强调了潜在的生态系统影响。

总体情绪是热情的,但呼吁对数据许可、定价机制以及底层语料库的潜在开放分发进行更清晰的解释。

为什么 Scry 很重要

  • 实现真正的程序化研究:智能体不再需要拼凑逐页抓取的内容;它们可以向网络提出单个、可组合的查询,并获得结构化、溯源丰富的结果。
  • 减少冗余爬取:通过公开原始源表,Scry 消除了每个下游工具维护自己爬虫的需求,从而降低了带宽和存储成本。
  • 引入经济激励:拥塞定价抑制了浪费性的、大容量的扫描,使资源使用与所获得洞察的价值保持一致。
  • 公共利益基础设施:为非商业研究人员提供的免费层级降低了大规模数据分析的门槛,而商业合作则为服务提供资金。

用户的后续步骤

  1. 注册免费研究员账户以获取 API 密钥。
  2. 检索实时模式 (/v1/scry/schema) 并探索可用关系。
  3. 使用 x-scry-explain 标头原型化查询,以便在执行前评估成本。
  4. 将 MCP 端点集成到您的 LLM 驱动的智能体或分析管道中。

所有性能数据(例如,每 GB Hacker News 文本 0.86 秒)均在 2026-09-11 的实时生产系统上测量,并反映了典型负载下的单服务器执行情况。

Sources

相关

  • 项目
  • Dispatch
  • 项目
  • Dispatch
  • Dispatch