Ollama 多模态引擎发布

Ollama 发布了一个全新的多模态引擎,旨在使其视觉模型成为其生态系统中的一等公民。此次更新提高了本地推理的可靠性和准确性,并为未来支持语音、图像生成、视频生成以及扩展工具支持等模态奠定了基础。

支持的多模态模型

Ollama 的新引擎支持多种高性能视觉模型的本地运行,包括:

  • Meta Llama 4 (包括 109B 参数的混合专家模型 Llama 4 Scout)
  • Google Gemma 3
  • Qwen 2.5 VL
  • Mistral Small 3.1

关键技术能力

通用理解与推理

新引擎支持复杂的视觉推理和多图分析。例如,Llama 4 Scout 可以分析视频帧以识别地点(例如旧金山的 Ferry Building),并提供基于位置的推理,例如计算到其他地标的距离。

Gemma 3 支持多图输入,允许用户同时输入多张图片或通过后续提示词来识别图片间的共同元素,或对不同视觉主体之间的关系进行推理。

文档扫描与 OCR

Qwen 2.5 VL 被用于高精度的字符识别和文档扫描。这包括理解并将垂直书写的中文春联翻译成英文的能力。

架构改进

模型模块化

为了提高可靠性并简化集成,Ollama 已转向自包含的模型架构。此前,依赖 ggml/llama.cpp 意味着文本解码器和视觉编码器被拆分为独立的模型并分别执行,需要在编排层中使用特定于模型的逻辑。

在新引擎中,每个模型都是完全自包含的,并暴露与其训练对齐的专用投影层。这种隔离性防止了对多个文件的修补或使用级联 if 语句的需求,使得模型创建者可以在实现代码时无需担心其他模型的回归风险。

推理准确性

Ollama 实现了元数据处理,以处理产生大量 token 的大尺寸图像。通过管理因果注意力机制并确定将图像嵌入拆分为批次的最佳边界,Ollama 确保图像处理遵循模型的原始设计和训练,从而防止因图像拆分错误而导致的输出质量下降。

内存管理与优化

Ollama 引入了多项针对内存的特定优化,以提高性能并降低资源消耗:

  • 图像缓存: 处理过的图像会被缓存以加速后续提示词的处理,只要图像在使用中,就会保留在缓存中。
  • 硬件集成: Ollama 与硬件制造商(NVIDIA, AMD, Qualcomm, Intel)以及 Microsoft 协作,通过检测硬件元数据来进行更准确的内存估算。
  • KV Cache 优化: 因果注意力机制在单个模型级别进行配置。例如,Gemma 3 利用滑动窗口注意力机制来优化上下文长度分配并提高并发性。
  • Llama 4 支持: 对于 Llama 4 Scout and Maverick,Ollama 实现了分块注意力机制、针对长上下文的注意力微调、特定的 2D 旋转嵌入以及混合专家模型 (MoE) 支持。

未来路线图

Ollama 正在为平台开发进一步的增强功能,包括:

  • 支持更长的上下文长度
  • 集成思考与推理能力
  • 支持流式响应的工具调用
  • 启用“计算机使用”能力

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch