xming521/WeClone
🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.
What it solves
WeClone 提供一个端到端的流水线,根据个人的实际聊天记录创建其数字化身。用户可以通过在导出的消息数据上微调大型语言模型(LLM),克隆某人的说话风格和个性,从而创建一个模仿特定人物“对话口味”的聊天机器人。
How it works
项目实现完整的工作流:
- Data Export & Preprocessing:支持从 Telegram(包括图片)导出聊天记录,正在构建对 WhatsApp、Discord、Slack 的支持。使用 Microsoft Presidio 过滤敏感私人信息(电话号码、电子邮件等),并允许自定义阻止列表。
- Fine-tuning:默认使用 Qwen2.5-VL-7B-Instruct 模型,采用 LoRA(Low-Rank Adaptation)方法进行监督微调(SFT)。并与 LLaMA Factory 集成进行模型训练。
- Deployment:微调后的模型可以部署为 API 服务器,或集成到 AstrBot、LangBot 等聊天机器人框架,以在 Discord、Telegram、Slack 等平台上使用。
Who it’s for
- Individuals 想要创建数字孪生或能够以自己或亲人语气说话的个性化 AI 助手。
- Researchers 正在实验人格驱动的 LLM 微调和多模态(文本和图像)聊天数据的研究人员。
Highlights
- End-to-End Pipeline:覆盖从数据导出和清洗到训练和部署的全部环节。
- Multimodal Support:支持使用图像数据进行微调,以更好捕捉沟通风格。
- Privacy-Focused:内置 PII(个人可识别信息)过滤,保护训练期间的敏感数据。
- ** uma**
- Flexible Deployment:兼容各种聊天机器人框架和消息平台,通过 OpenAI 兼容的 API 服务器进行部署。