Ollama 上的 IBM Granite 3.0 模型
IBM Granite 3.0 模型现已可通过 Ollama 运行,提供了一系列在 Apache 2.0 许可下发布的稠密(dense)和混合专家(Mixture of Experts, MoE)模型。此次发布允许开发者为基于工具的使用场景、RAG 以及低延迟的端侧应用部署高性能、开放权重的模型。
Dense Models: High Performance and Benchmark Rivalry
Granite 3.0 稠密模型提供 2B 和 8B 参数规模的版本。这些纯文本 LLM 在超过 12 万亿 token 的数据上进行了训练,与之前的版本相比,在速度和性能方面都有显著提升。
Granite 8B Instruct 模型在 OpenLLM Leaderboard v1 和 OpenLLM Leaderboard v2 基准测试中,其性能表现足以与 Llama 3.1 8B Instruct 相媲美。
Mixture of Experts (MoE) Models: Optimized for Low Latency
IBM 在 Granite 系列中引入了首批混合专家(MoE)模型,提供 1B 和 3B 参数规模的版本。这些模型在超过 10 万亿 token 的数据上进行了训练。
由于采用了 MoE 架构,这些模型专为低延迟使用而设计,非常适合部署在端侧应用或需要即时推理的场景中。
Core Capabilities and Use Cases
IBM Granite 3.0 系列旨在支持基于工具的使用场景和检索增强生成(RAG)。其核心能力包括:
- Content Processing: 摘要生成、文本分类和文本提取。
- Technical Tasks: 代码生成、翻译、缺陷修复和函数调用(function-calling)。
- Question Answering: 通用问答和多语言对话使用场景。
Deployment via Ollama
用户可以使用以下 Ollama 命令运行这些模型:
- Dense 2B:
ollama run granite3-dense - Dense 8B:
ollama run granite3-dense:8b - MoE 1B:
ollama run granite3-moe - MoE 3B:
ollama run granite3-moe:3b
Sources
- OriginalIBM Granite 3.0 models
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch