Emericen/tiny-qwen
A minimal PyTorch re-implementation of Qwen 3.8
何を解決するか
PyTorch を使用して Qwen モデルアーキテクチャ(特に Qwen 3.8)の最小限で読みやすい再実装を提供し、より複雑な Hugging Face のコードベースの代替として機能します。また、量子化を用いてメモリ使用量を低減するためのツールも含まれています。
動作方法
このプロジェクトは PyTorch で Qwen アーキテクチャを実装し、モデルの読み込みと推論実行用の Model および Processor クラスを提供します。Hugging Face リポジトリ、ローカルディレクトリ、または OpenAI互換の API エンドポイントからモデルを読み込むことができます。メモリ使用量を削減するために、int4 量子化の組み込みサポートも提供しています。
対象ユーザー
Qwen モデルの明確で理解しやすい実装を求める開発者や研究者、または自前のハードウェア上で int4 量子化を用いて Qwen モデルを実行したい人。
特徴
- Qwen 3.8 の最小限の PyTorch 再実装。
- モデルサイズを削減するための組み込み int4 量子化サポート。
- クイックデプロイ用の単一ファイルのエージェントハーネスを含む。
- ローカル実行とリモートの OpenAI互換 API エンドポイントの両方をサポート。
- ライブラリの使用例に示すように、テキストと画像のマルチモーダル入力をサポート。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch