Emericen/tiny-qwen

A minimal PyTorch re-implementation of Qwen 3.8

何を解決するか

PyTorch を使用して Qwen モデルアーキテクチャ(特に Qwen 3.8)の最小限で読みやすい再実装を提供し、より複雑な Hugging Face のコードベースの代替として機能します。また、量子化を用いてメモリ使用量を低減するためのツールも含まれています。

動作方法

このプロジェクトは PyTorch で Qwen アーキテクチャを実装し、モデルの読み込みと推論実行用の Model および Processor クラスを提供します。Hugging Face リポジトリ、ローカルディレクトリ、または OpenAI互換の API エンドポイントからモデルを読み込むことができます。メモリ使用量を削減するために、int4 量子化の組み込みサポートも提供しています。

対象ユーザー

Qwen モデルの明確で理解しやすい実装を求める開発者や研究者、または自前のハードウェア上で int4 量子化を用いて Qwen モデルを実行したい人。

特徴

  • Qwen 3.8 の最小限の PyTorch 再実装。
  • モデルサイズを削減するための組み込み int4 量子化サポート。
  • クイックデプロイ用の単一ファイルのエージェントハーネスを含む。
  • ローカル実行とリモートの OpenAI互換 API エンドポイントの両方をサポート。
  • ライブラリの使用例に示すように、テキストと画像のマルチモーダル入力をサポート。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch