0xSero/ai-data-extraction

extract all your personal data history from cursor, codex, claude-code, windsurf, and trae

何を解決するか

さまざまなAIコーディングアシスタントから、完全な会話履歴、コードのコンテキスト、およびツール使用データを抽出する方法を提供します。これにより、開発者や研究者が、機械学習のトレーニングやファインチューニングのために、高品質で現実的なインタラクションデータを収集することが可能になります。

仕組み

このツールキットは、特定のAIツール(Cursor、Claude Code、Windsurf、Gemini CLIなど)に合わせて調整された一連のPythonスクリプトで構成されています。これらのスクリプトは、オペレーティングシステムを自動的に検出し、一般的なインストールおよび保存パスを検索し、SQLiteデータベースやJSONLファイルを含むさまざまな形式からデータを解析します。抽出されたデータは、ユーザーメッセージ、AIの応答、コードスニペット、および提案されたdiffを含む、タイムスタンプ付きのJSONL形式に標準化されます。

対象者

自身のAIコーディングインタラクションからトレーニングデータセットを作成したいMLエンジニアや研究者、およびAI支援による開発履歴をアーカイブしたいユーザー向けに設計されています。

ハイライト

  • 幅広いツールサポート: Cursor、Claude Code、Codex、Trae、Windsurf、Continue、Gemini CLI、およびOpenCodeからデータを抽出します。
  • 深いコンテキスト抽出: テキストだけでなく、ファイルパス、行番号、コードのdiff、およびツールの実行結果もキャプチャします。
  • プライバシーツール: openai/privacy-filterモデルを使用して、メールアドレスやシークレットなどの機密情報を伏せ字にするオプションのプライバシーフィルターが含まれています。
  • トレーニング準備完了: 直接的なファインチューニングやUnslothライブラリとの統合のための例を提供します。
  • スキル合成: 抽出されたコーパスからLLMを使用して再利用可能な「Agent Skills」を合成するユーティリティが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト