Emericen/tiny-qwen
A minimal PyTorch re-implementation of Qwen 3.8
解决的问题
使用 PyTorch 提供 Qwen 模型架构(特别是 Qwen 3.8)的最小且易于阅读的重新实现,作为更复杂的 Hugging Face 代码库的替代方案。同时包含通过量化降低内存需求的工具。
如何工作
该项目在 PyTorch 中实现了 Qwen 架构,并提供了 Model 和 Processor 类用于加载和运行推理。支持从 Hugging Face 仓库、本地目录或连接到 OpenAI 兼容 API 端点加载模型。为减少内存使用,内置了 int4 量化支持。
适用人群
希望获得清晰、易懂的 Qwen 模型实现,或希望在自己硬件上使用 int4 量化运行 Qwen 模型的开发者和研究人员。
主要亮点
- Qwen 3.8 的最小 PyTorch 重新实现。
- 内置 int4 量化支持,以减小模型大小。
- 包含单文件代理框架,便于快速部署。
- 支持本地执行和远程 OpenAI 兼容 API 端点。
- 支持多模态输入(文本和图像),如库使用示例所示。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch