xming521/WeClone

🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.

解決する課題

WeClone は、特定の人物のチャットスタイルと性格を模倣するデジタルアバターを作成するためのエンドツーエンドのパイプラインを提供します。手動で複雑なプロンプトを作成してペルソナをシミュレートする問題を解決し、代わりに実際のチャット履歴を使用して大規模言語モデル (LLM) をファインチューニングします。

仕組み

システムは 4 つのステップで構成されています:

  1. データエクスポートと前処理:チャット記録(現在 Telegram をサポート)をインポートし、Microsoft Presidio を使用して機密性の高い個人情報(電話番号やメールアドレスなど)をフィルタリングし、カスタムブロックリストを使用して不要なコンテンツを削除します。
  2. ファインチューニング:LLaMA Factory を使用して、ベースモデル(デフォルトは Qwen2.5-VL-7B-Instruct)で LoRA や QLoRA などの手法を用いて教師ありファインチューニング (SFT) を実行し、ユーザー固有の会話の「フレーバー」をモデルに注入します。
  3. 推論:ファインチューニングされたモデルは、API またはブラウザベースのウェブチャットデモを通じて提供されます。
  4. デプロイメント:AstrBot や LangBot などのチャットボットフレームワークを介して、Telegram、Discord、Slack、WeChat などのメッセージングプラットフォームにアバターを統合できます。

対象者

実際の会話データに基づいて自分自身や他人のパーソナライズされた AI バージョンを作成したいユーザー、およびペルソナベースの LLM ファインチューニングを研究する研究者。

ハイライト

  • エンドツーエンドのワークフロー:生データのエクスポートから最終的なボットのデプロイメントまでをカバーします。
  • マルチモーダルサポート:画像モーダルデータを使用したファインチューニングをサポートし、会話のコンテキストをより適切に捉えます。
  • プライバシー重視:組み込みの PII(個人識別情報)フィルタリングを含み、トレーニング前にデータを保護します。
  • 柔軟なデプロイメント:複数の IM プラットフォームおよび既存の LLM ボットフレームワークと互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト