Emericen/tiny-qwen

A minimal PyTorch re-implementation of Qwen 3.8

해결하는 문제

PyTorch를 사용하여 Qwen 모델 아키텍처(특히 Qwen 3.8)의 최소한의 읽기 쉬운 재구현을 제공하며, 더 복잡한 Hugging Face 코드베이스의 대안이 됩니다. 또한 메모리 사용량을 줄이기 위해 양자화를 통해 모델을 실행할 수 있는 도구도 포함되어 있습니다.

작동 방식

이 프로젝트는 PyTorch로 Qwen 아키텍처를 구현하고, 모델을 로드하고 추론을 실행하기 위한 ModelProcessor 클래스를 제공합니다. Hugging Face 리포지토리, 로컬 디렉터리, 또는 OpenAI 호환 API 엔드포인트에서 모델을 로드할 수 있습니다. 메모리 사용량을 줄이기 위해 내장된 int4 양자화 지원이 포함되어 있습니다.

대상 사용자

Qwen 모델의 깔끔하고 이해하기 쉬운 구현을 원하거나, 자신의 하드웨어에서 int4 양자화를 사용해 Qwen 모델을 실행하고 싶은 개발자 및 연구자.

주요 특징

  • Qwen 3.8의 최소한의 PyTorch 재구현.
  • 모델 크기를 줄이기 위한 내장된 int4 양자화 지원.
  • 빠른 배포를 위한 단일 파일 에이전트 하네스 포함.
  • 로컬 실행과 원격 OpenAI 호환 API 엔드포인트 모두 지원.
  • 라이브러리 사용 예제에서 보여주듯이 텍스트 및 이미지의 멀티모달 입력을 지원.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch