1broseidon/ketch
Fast, stateless CLI for web search and scrape. Built for AI agents.
解決的問題
Ketch 是一個無狀態的 CLI 工具,旨在簡化人類與 AI 代理取得研究資料的過程。它透過將 Web 搜尋、程式碼搜尋、函式庫文件與 Web 抓取整合至單一二進位檔中,消除管理多個提供者 SDK、驗證金鑰與不同回應格式的需要。
工作原理
Ketch 作為多種研究介面的統一介面運作:
- Web 搜尋:與 Brave、DuckDuckGo、SearXNG、Exa、Firecrawl、Keenable、Tavily、Parallel 和 SerpBase 等提供者整合。
- 程式碼搜尋:透過 Grep、Sourcegraph 或 GitHub Code Search 搜尋開源軟體(OSS)原始碼。
- 函式庫文件:透過 Context7 存取經過篩選、具版本感知的文件。
- 抓取/爬取:將 HTML 頁面與文字型 PDF 轉換為乾淨的 Markdown。內建純 Go PDF 解析器,並支援無頭 Chrome 以處理 JS 渲染頁面。
提供結構化 JSON 輸出(--json)與文件化退出碼,使腳本控制流程與 AI 代理整合高度可預測。亦具備本地頁面快取功能,以加速重複請求。
適用對象
- AI 代理開發者:希望使用單一工具為代理提供研究能力,而無需撰寫各提供者膠水程式碼的人。
- 研究者與開發者:偏好使用快速終端工具從網路提取乾淨內容或搜尋程式碼的人。
特色亮點
- 統一介面:一個二進位檔支援搜尋、程式碼與文件。
- 代理就緒:結構化 JSON 輸出、穩定退出碼,以及用於與 Claude Code 等代理直接整合的 MCP 伺服器實作。
- JS 渲染回退:自動偵測 JS Shell 頁面,並使用無頭 Chrome 重新取得。
- 排名融合搜尋:
--multi標誌允許跨多個後端進行聯邦搜尋,並使用 Reciprocal Rank Fusion 去重與排序結果。 - PDF 提取:內建 PDF 文字提取功能,支援外部 OCR 轉換器。
- Cookie 支援:可使用 Netscape
cookies.txt檔案繞過同意牆或存取驗證內容。
相關
- 專案
- 專案
- 專案
- 專案
- 專案