xming521/WeClone
🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.
解决的问题
WeClone 提供了一个端到端的工作流,用于创建一个模仿特定人物聊天风格和性格的数字分身。它解决了手动编写复杂提示词来模拟角色的问题,转而使用真实的聊天记录来微调大型语言模型 (LLM)。
工作原理
该系统遵循四个步骤的流程:
- 数据导出与预处理:导入聊天记录(目前支持 Telegram),并使用 Microsoft Presidio 过滤敏感的私人信息(如电话号码和电子邮件),以及使用自定义的黑名单来移除不需要的内容。
- 微调:使用 LLaMA Factory 在基础模型(默认为 Qwen2.5-VL-7B-Instruct)上执行监督微调 (SFT),采用 LoRA 或 QLoRA 等方法,将用户特定的对话“风味”注入模型中。
- 推理:微调后的模型通过 API 或基于浏览器的网页聊天演示来提供服务。
- 部署:通过 AstrBot 或 LangBot 等聊天机器人框架,将分身集成到 Telegram、Discord、Slack 或 WeChat 等通讯平台中。
适用人群
希望基于真实对话数据创建自己或他人个性化 AI 版本的用户,以及探索基于角色的 LLM 微调的研究人员。
亮点
- 端到端工作流:涵盖从原始数据导出到最终机器人部署的所有环节。
- 多模态支持:支持使用图像模态数据进行微调,以更好地捕捉对话上下文。
- 注重隐私:包含内置的 PII(个人身份信息)过滤功能,在训练前确保数据安全。
- 灵活部署:兼容多个 IM 平台和现有的 LLM 机器人框架。
相关
- 项目
- 项目
- 项目
- 项目
- 项目