xming521/WeClone
🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.
What it solves
WeClone 提供一條端對端的管線,根據個人的實際聊天紀錄建立其數位化身。使用者可以透過對大型語言模型(LLM)在匯出的訊息資料上進行微調,克隆某人的說話風格與個性,從而打造出模仿特定人物「對話口味」的聊天機器人。
How it works
此專案實作完整的工作流程:
- Data Export & Preprocessing:支援從 Telegram(含影像)匯出聊天記錄,並正在建置對 WhatsApp、Discord、Slack 的支援。使用 Microsoft Presidio 來過濾敏感私人資訊(電話號碼、電子郵件等),亦可自訂封鎖清單。
- Fine-tuning:預設使用 Qwen2.5-VL-7B-Instruct 模型,採用 LoRA(Low-Rank Adaptation)方法進行監督式微調(SFT)。並與 LLaMA Factory 整合以進行模型訓練。
- Deployment:微調後的模型可部署為 API 伺服器,或整合至 AstrBot、LangBot 等聊天機器人框架,供 Discord、Telegram、Slack 等平台使用。
Who it’s for
- Individuals 想要建立數位分身或能以自己或親友語氣說話的個人化 AI 助理。
- Researchers 正在探索以人格驅動的 LLM 微調與多模態(文字與影像)聊天資料的研究者。
Highlights
- End-to-End Pipeline:涵蓋從資料匯出與清理到訓練與部署的全部流程。
- Multimodal Support:支援使用影像資料微調,以更好捕捉溝通風格。
- Privacy-Focused:內建 PII(個人可識別資訊)過濾,保護訓練期間的敏感資料。
- ** uma**
- Flexible Deployment:相容各種聊天機器人框架與訊息平台,透過 OpenAI 相容的 API 伺服器進行部署。