0xSero/ai-data-extraction
extract all your personal data history from cursor, codex, claude-code, windsurf, and trae
何を解決するか
さまざまなAIコーディングアシスタントから、完全な会話履歴、コードのコンテキスト、およびツール使用データを抽出する方法を提供します。これにより、開発者や研究者が、機械学習のトレーニングやファインチューニングのために、高品質で現実的なインタラクションデータを収集することが可能になります。
仕組み
このツールキットは、特定のAIツール(Cursor、Claude Code、Windsurf、Gemini CLIなど)に合わせて調整された一連のPythonスクリプトで構成されています。これらのスクリプトは、オペレーティングシステムを自動的に検出し、一般的なインストールおよび保存パスを検索し、SQLiteデータベースやJSONLファイルを含むさまざまな形式からデータを解析します。抽出されたデータは、ユーザーメッセージ、AIの応答、コードスニペット、および提案されたdiffを含む、タイムスタンプ付きのJSONL形式に標準化されます。
対象者
自身のAIコーディングインタラクションからトレーニングデータセットを作成したいMLエンジニアや研究者、およびAI支援による開発履歴をアーカイブしたいユーザー向けに設計されています。
ハイライト
- 幅広いツールサポート: Cursor、Claude Code、Codex、Trae、Windsurf、Continue、Gemini CLI、およびOpenCodeからデータを抽出します。
- 深いコンテキスト抽出: テキストだけでなく、ファイルパス、行番号、コードのdiff、およびツールの実行結果もキャプチャします。
- プライバシーツール:
openai/privacy-filterモデルを使用して、メールアドレスやシークレットなどの機密情報を伏せ字にするオプションのプライバシーフィルターが含まれています。 - トレーニング準備完了: 直接的なファインチューニングやUnslothライブラリとの統合のための例を提供します。
- スキル合成: 抽出されたコーパスからLLMを使用して再利用可能な「Agent Skills」を合成するユーティリティが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト