1broseidon/ketch

Fast, stateless CLI for web search and scrape. Built for AI agents.

解决的问题

Ketch 是一个无状态的 CLI 工具,旨在简化人类和 AI 代理获取研究数据的过程。它通过将 Web 搜索、代码搜索、库文档和 Web 抓取整合到一个二进制文件中,消除了管理多个提供方 SDK、认证密钥和不同响应格式的需要。

工作原理

Ketch 作为多种研究表面的统一接口运行:

  • Web 搜索:与 Brave、DuckDuckGo、SearXNG、Exa、Firecrawl、Keenable、Tavily、Parallel 和 SerpBase 等提供方集成。
  • 代码搜索:通过 Grep、Sourcegraph 或 GitHub Code Search 搜索开源软件(OSS)源码。
  • 库文档:通过 Context7 访问经过筛选、版本感知的文档。
  • 抓取/爬取:将 HTML 页面和文本型 PDF 转换为干净的 Markdown。内置纯 Go PDF 解析器,并支持无头 Chrome 以处理 JS 渲染页面。

它提供结构化 JSON 输出(--json)和文档化的退出码,使脚本控制流和 AI 代理集成高度可预测。还具备本地页面缓存功能,以加速重复请求。

适用人群

  • AI 代理开发者:希望使用单一工具为代理提供研究能力,而无需编写各提供方的胶水代码的人。
  • 研究人员和开发者:偏好使用快速终端工具从网络提取干净内容或搜索代码的人。

特色亮点

  • 统一接口:一个二进制文件支持搜索、代码和文档。
  • 代理就绪:结构化 JSON 输出、稳定退出码,以及用于与 Claude Code 等代理直接集成的 MCP 服务器实现。
  • JS 渲染回退:自动检测 JS Shell 页面,并使用无头 Chrome 重新获取。
  • 排名融合搜索--multi 标志允许跨多个后端进行联邦搜索,并使用 Reciprocal Rank Fusion 去重和排序结果。
  • PDF 提取:内置 PDF 文本提取功能,支持外部 OCR 转换器。
  • Cookie 支持:可使用 Netscape cookies.txt 文件绕过同意墙或访问认证内容。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目