OpenAI gpt-oss 在 Ollama 上发布
Ollama 与 OpenAI 合作,将 gpt-oss 开源权重模型引入 Ollama 平台,实现了最先进的推理和智能体模型(agentic models)的本地运行。此次发布推出了两种参数规模的模型——20B 和 120B——旨在满足多样化的开发者使用场景和高推理任务需求。
核心能力与特性
gpt-oss 模型原生支持智能体工作流(agentic workflows)和透明的推理过程。关键特性包括:
- 智能体能力: 模型原生支持函数调用(function calling)、python 工具调用以及结构化输出。Ollama 还提供可选的内置网络搜索功能,通过实时信息来增强模型能力。
- 全思维链(Full Chain-of-Thought): 用户可以完全访问模型的内部推理过程,旨在提高输出的可信度并简化调试过程。
- 可配置的推理强度: 推理强度可以在低、中、高设置之间进行调节,以便根据具体使用场景在延迟和性能之间取得平衡。
- 定制化与许可: 模型可以通过参数微调进行完全微调,并根据宽松的 Apache 2.0 许可发布,允许在没有 copyleft 限制的情况下进行商业部署和实验。
模型变体与硬件要求
提供两个版本的 gpt-oss,以适应不同的性能和硬件约束:
- gpt-oss-20b: 一个 200 亿参数的模型,针对低延迟和专门的本地使用场景进行了优化。
- gpt-oss-120b: 一个 1200 亿参数的模型,专为通用型、高推理能力的生产任务而设计。
技术实现:MXFP4 量化
为了减少内存占用,OpenAI 对混合专家模型(MoE)的权重采用了 MXFP4 量化格式,这些权重占总参数量的 90% 以上。在这种格式下,每个参数被量化为 4.25 bits。
这种量化技术使得硬件访问更加便捷:
- 20B 模型可以在内存仅为 16GB 的系统上运行。
- 120B 模型可以适配单块 80GB 的 GPU。
Ollama 为其引擎开发了新的内核(kernels)以原生支持 MXFP4 格式,从而避免了额外的转换过程。Ollama 与 OpenAI 合作,将这些实现与参考版本进行了基准测试,以确保质量对等。
NVIDIA 硬件加速
Ollama 与 NVIDIA 合作,针对 NVIDIA GeForce RTX 和 RTX PRO GPU 优化了 gpt-oss 的性能。这一合作伙伴关系确保了使用 RTX 系列 PC 的用户能够准确地充分利用 gpt-oss 模型的全部能力。
部署
可以通过最新版本的 Ollama 应用程序或通过终端使用以下命令进行部署:
ollama run gpt-oss:20b
ollama run gpt-oss:120b
Sources
- OriginalOpenAI gpt-oss
相关
- 项目
- Dispatch
- Dispatch
- Dispatch
- Dispatch