0xSero/ai-data-extraction
extract all your personal data history from cursor, codex, claude-code, windsurf, and trae
它解决了什么问题
它提供了一种从各种AI编程助手提取完整对话历史、代码上下文和工具使用数据的方法。这使得开发者和研究人员能够收集高质量的真实世界交互数据,用于机器学习训练和微调。
它如何工作
该工具包由一系列针对特定AI工具(如Cursor、Claude Code、Windsurf和Gemini CLI)定制的Python脚本组成。这些脚本会自动检测操作系统,搜索常见的安装和存储路径,并解析多种格式的数据,包括SQLite数据库和JSONL文件。提取的数据随后被标准化为带时间戳的JSONL格式,包含用户消息、AI回复、代码片段和建议的diff。
适用人群
专为希望从自身AI编程交互中创建训练数据集的机器学习工程师和研究人员设计,也适用于希望归档其AI辅助开发历史的用户。
主要特点
- 广泛的工具支持:支持从Cursor、Claude Code、Codex、Trae、Windsurf、Continue、Gemini CLI和OpenCode提取数据。
- 深度上下文提取:不仅捕获文本,还包含文件路径、行号、代码diff和工具执行结果。
- 隐私保护工具:包含一个可选的隐私过滤器,使用
openai/privacy-filter模型来隐藏敏感信息,如电子邮件和密钥。 - 训练就绪:提供直接微调的示例,并支持与Unsloth库集成。
- 技能合成:包含一个实用工具,可使用LLM从提取的语料库中合成可重用的「Agent技能」。
相关
- 项目
- 项目
- 项目
- 项目