Emericen/tiny-qwen

A minimal PyTorch re-implementation of Qwen 3.8

解决的问题

使用 PyTorch 提供 Qwen 模型架构(特别是 Qwen 3.8)的最小且易于阅读的重新实现,作为更复杂的 Hugging Face 代码库的替代方案。同时包含通过量化降低内存需求的工具。

如何工作

该项目在 PyTorch 中实现了 Qwen 架构,并提供了 ModelProcessor 类用于加载和运行推理。支持从 Hugging Face 仓库、本地目录或连接到 OpenAI 兼容 API 端点加载模型。为减少内存使用,内置了 int4 量化支持。

适用人群

希望获得清晰、易懂的 Qwen 模型实现,或希望在自己硬件上使用 int4 量化运行 Qwen 模型的开发者和研究人员。

主要亮点

  • Qwen 3.8 的最小 PyTorch 重新实现。
  • 内置 int4 量化支持,以减小模型大小。
  • 包含单文件代理框架,便于快速部署。
  • 支持本地执行和远程 OpenAI 兼容 API 端点。
  • 支持多模态输入(文本和图像),如库使用示例所示。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch