1broseidon/ketch
Fast, stateless CLI for web search and scrape. Built for AI agents.
何を解決するか
Ketch は、人間と AI エージェントの両方の研究データ収集プロセスを簡素化するステートレス CLI ツールです。複数のプロバイダ SDK や認証キー、異なる応答形式を管理する必要を排除し、Web 検索、コード検索、ライブラリドキュメント、Web スクレイピングを1つのバイナリに統合しています。
動作方法
Ketch はさまざまな研究インターフェースを統合するインターフェースとして機能します:
- Web 検索:Brave、DuckDuckGo、SearXNG、Exa、Firecrawl、Keenable、Tavily、Parallel、SerpBase などのプロバイダと統合されています。
- コード検索:Grep、Sourcegraph、または GitHub Code Search を通じてオープンソースソフトウェア(OSS)のソースコードを検索します。
- ライブラリドキュメント:Context7 を通じて、バージョン対応のカスタマイズされたドキュメントにアクセスします。
- スクレイピング/クローリング:HTML ページやテキストベースの PDF をクリーンな Markdown に変換します。純粋な Go による PDF パーサーを内蔵しており、JS レンダリングされたページにはヘッドレス Chrome をサポートしています。
構造化された JSON 出力(--json)とドキュメント化された終了コードを提供し、スクリプト制御フローおよび AI エージェント統合において非常に予測可能になります。また、ローカルページキャッシュ機能により、繰り返しリクエストの速度を向上させます。
対象ユーザー
- AI エージェント開発者:エージェントに研究機能を提供するための単一ツールを求める人。各プロバイダごとのグルーコードを書く必要がありません。
- 研究者および開発者:Web からクリーンなコンテンツを抽出したり、コードを検索したりする際に、高速なターミナルベースのツールを好む人。
特徴
- 統合インターフェース:検索、コード、ドキュメントのための1つのバイナリ。
- エージェント対応:構造化された JSON 出力、安定した終了コード、Claude Code などのエージェントと直接統合可能な MCP サーバー実装。
- JS レンダリングのフォールバック:自動的に JS シェルページを検出し、ヘッドレス Chrome を使って再取得します。
- ランク統合検索:
--multiフラグにより、複数のバックエンドでフェデレーテッド検索が可能。Reciprocal Rank Fusion を使って重複を排除し、結果をランク付けします。 - PDF 抽出:外部 OCR コンバーターとの互換性を備えた、内蔵のテキスト抽出機能。
- クッキー対応:Netscape の
cookies.txtファイルを使用して、同意壁を回避したり、認証済みコンテンツにアクセスしたりできます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト