Ollama 上的 IBM Granite 3.0 模型

IBM Granite 3.0 模型现已可通过 Ollama 运行,提供了一系列在 Apache 2.0 许可下发布的稠密(dense)和混合专家(Mixture of Experts, MoE)模型。此次发布允许开发者为基于工具的使用场景、RAG 以及低延迟的端侧应用部署高性能、开放权重的模型。

Dense Models: High Performance and Benchmark Rivalry

Granite 3.0 稠密模型提供 2B 和 8B 参数规模的版本。这些纯文本 LLM 在超过 12 万亿 token 的数据上进行了训练,与之前的版本相比,在速度和性能方面都有显著提升。

Granite 8B Instruct 模型在 OpenLLM Leaderboard v1 和 OpenLLM Leaderboard v2 基准测试中,其性能表现足以与 Llama 3.1 8B Instruct 相媲美。

Mixture of Experts (MoE) Models: Optimized for Low Latency

IBM 在 Granite 系列中引入了首批混合专家(MoE)模型,提供 1B 和 3B 参数规模的版本。这些模型在超过 10 万亿 token 的数据上进行了训练。

由于采用了 MoE 架构,这些模型专为低延迟使用而设计,非常适合部署在端侧应用或需要即时推理的场景中。

Core Capabilities and Use Cases

IBM Granite 3.0 系列旨在支持基于工具的使用场景和检索增强生成(RAG)。其核心能力包括:

  • Content Processing: 摘要生成、文本分类和文本提取。
  • Technical Tasks: 代码生成、翻译、缺陷修复和函数调用(function-calling)。
  • Question Answering: 通用问答和多语言对话使用场景。

Deployment via Ollama

用户可以使用以下 Ollama 命令运行这些模型:

  • Dense 2B: ollama run granite3-dense
  • Dense 8B: ollama run granite3-dense:8b
  • MoE 1B: ollama run granite3-moe
  • MoE 3B: ollama run granite3-moe:3b

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch