xming521/WeClone

🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.

해결하는 문제

WeClone은 특정 인물의 채팅 스타일과 성격을 모방하는 디지털 아바타를 만들기 위한 엔드투엔드 파이프라인을 제공합니다. 페르소나를 시뮬레이션하기 위해 복잡한 프롬프트를 수동으로 작성하는 문제를 해결하고, 대신 실제 채팅 기록을 사용하여 대형 언어 모델(LLM)을 파인튜닝합니다.

작동 방식

이 시스템은 4단계 프로세스를 따릅니다:

  1. 데이터 내보내기 및 전처리: 채팅 기록(현재 Telegram 지원)을 가져오고, Microsoft Presidio를 사용하여 민감한 개인 정보(예: 전화번호 및 이메일)를 필터링하며, 사용자 지정 차단 목록을 사용하여 원치 않는 콘텐츠를 제거합니다.
  2. 파인튜닝: LLaMA Factory를 사용하여 기본 모델(기본값은 Qwen2.5-VL-7B-Instruct)에서 LoRA 또는 QLoRA와 같은 방법으로 지도 파인튜닝(SFT)을 수행하여 사용자 특유의 대화 "맛"을 모델에 주입합니다.
  3. 추론: 파인튜닝된 모델은 API 또는 브라우저 기반 웹 채팅 데모를 통해 제공됩니다.
  4. 배포: AstrBot 또는 LangBot과 같은 챗봇 프레임워크를 통해 Telegram, Discord, Slack 또는 WeChat과 같은 메시징 플랫폼에 아바타를 통합할 수 있습니다.

대상 사용자

실제 대화 데이터를 기반으로 자신이나 타인의 개인화된 AI 버전을 만들고자 하는 사용자와 페르소나 기반 LLM 파인튜닝을 탐구하는 연구원.

주요 특징

  • 엔드투엔드 워크플로우: 원시 데이터 내보내기부터 최종 봇 배포까지 모든 것을 다룹니다.
  • 멀티모달 지원: 이미지 모달 데이터를 사용한 파인튜닝을 지원하여 대화 맥락을 더 잘 파악합니다.
  • 프라이버시 중심: 훈련 전 데이터를 보호하기 위해 내장된 PII(개인 식별 정보) 필터링을 포함합니다.
  • 유연한 배포: 여러 IM 플랫폼 및 기존 LLM 봇 프레임워크와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트