xming521/WeClone

🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.

What it solves

WeClone 提供一條端對端的管線,根據個人的實際聊天紀錄建立其數位化身。使用者可以透過對大型語言模型(LLM)在匯出的訊息資料上進行微調,克隆某人的說話風格與個性,從而打造出模仿特定人物「對話口味」的聊天機器人。

How it works

此專案實作完整的工作流程:

  1. Data Export & Preprocessing:支援從 Telegram(含影像)匯出聊天記錄,並正在建置對 WhatsApp、Discord、Slack 的支援。使用 Microsoft Presidio 來過濾敏感私人資訊(電話號碼、電子郵件等),亦可自訂封鎖清單。
  2. Fine-tuning:預設使用 Qwen2.5-VL-7B-Instruct 模型,採用 LoRA(Low-Rank Adaptation)方法進行監督式微調(SFT)。並與 LLaMA Factory 整合以進行模型訓練。
  3. Deployment:微調後的模型可部署為 API 伺服器,或整合至 AstrBot、LangBot 等聊天機器人框架,供 Discord、Telegram、Slack 等平台使用。

Who it’s for

  • Individuals 想要建立數位分身或能以自己或親友語氣說話的個人化 AI 助理。
  • Researchers 正在探索以人格驅動的 LLM 微調與多模態(文字與影像)聊天資料的研究者。

Highlights

  • End-to-End Pipeline:涵蓋從資料匯出與清理到訓練與部署的全部流程。
  • Multimodal Support:支援使用影像資料微調,以更好捕捉溝通風格。
  • Privacy-Focused:內建 PII(個人可識別資訊)過濾,保護訓練期間的敏感資料。
  • ** uma**
  • Flexible Deployment:相容各種聊天機器人框架與訊息平台,透過 OpenAI 相容的 API 伺服器進行部署。