Ollama 通过 Z-Image Turbo 和 FLUX.2 Klein 增加了实验性图像生成功能

TL;DR

Ollama 在 macOS 上发布了实验性的图像生成支持,提供了两个模型——Z-Image Turbo(6B 参数,写实且支持双语)和 FLUX.2 Klein(4B/9B 参数,强大的文本渲染能力)——以便用户可以直接从终端生成并预览图像。

macOS 上的即时可用性

Ollama 的新 run 命令会创建图像并将其保存到当前工作目录。支持内联图像显示的终端(例如 Ghostty, iTerm2)可以立即显示结果。Windows 和 Linux 的支持将在未来的版本中发布。

ollama run x/z-image-turbo "your prompt"

Z-Image Turbo 模型

来源: Alibaba 的 Tongyi Lab 大小: 6B 参数 许可证: Apache 2.0(开源权重,允许商业用途)

  • 写实输出: 擅长写实的摄影照片、肖像和场景。
  • 双语文本渲染: 能够准确地在图像中绘制英文和中文字符。

示例提示词和结果

  • 写实肖像:"Young woman in a cozy coffee shop, natural window lighting, wearing a cream knit sweater, holding a ceramic mug, soft bokeh background…"
  • 中国书法:"Traditional Chinese calligraphy brush painting style, the characters "山高水长" written in elegant black ink on rice paper…"
  • 创意构图:"Surreal double exposure portrait, woman's silhouette filled with blooming cherry blossom trees…"

所有示例都在博客文章中内联渲染,并可以使用相同的提示词通过 ollama run x/z-image-turbo 命令进行重现。

FLUX.2 Klein 模型

来源: Black Forest Labs 大小: 4B (Apache 2.0) 和 9B (FLUX Non-Commercial License v2.1) 核心优势: 在生成的图像中提供可靠且可读的文本,适用于 UI 原型设计和排版设计。

示例提示词和结果

  • 文本渲染:"A neon sign reading "OPEN 24 HOURS" in a rainy city alley at night, reflections on wet pavement."
  • 产品摄影:"Matte black coffee tumbler on wooden desk, morning sunlight casting long shadows, steam rising, commercial product shot."

这两个提示词都展示了模型在复杂场景中放置清晰、易读文本的能力。

配置选项

Ollama 提供了终端命令来微调生成过程:

  • 图像位置: 图像被写入当前目录;请提前切换目录以存储到其他位置。
  • 图像尺寸: 使用 /set width/set height 来调整维度;较小的尺寸生成速度更快且占用内存更少。
  • 步数 (Number of steps): 控制迭代次数;较少的步数可以加快生成速度,但会牺牲细节,而过多的步数可能会引入伪影。
  • 随机种子 (Random seed): 设置种子可以获得可重复的输出,便于迭代设计工作。
  • 负面提示词 (Negative prompts): 指定不希望出现的元素,以引导模型避开它们。

以上显示的所有图像和提示词均直接取自 Ollama 官方博客文章,日期为 2026-01-20。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目