Ollama 0.35 添加对 Jev 风格决策模型的原生支持
TL;DR
Ollama 0.35 现在通过新的 /v1/systemone 端点支持 Jev 风格的决策模型,可在本地设备上实现快速、类型化的决策,且无需额外费用。
新的 API 端点用于类型化决策
结论: /v1/systemone 端点允许开发者向本地模型发送一段文本 状态 和一组命名问题,单次请求即可获得结构化回答。该设计遵循 TypeSafe 的 Jev API,消除了网络往返,降低了延迟和成本。
POST http://localhost:11434/v1/systemone
{
"model": "nimble",
"state": "我们的结账页面自上午 9 点起返回 500 错误。",
"questions": {
"label": {
"type": "choice",
"instructions": "哪个标签最适合这个工单?",
"criteria": {"billing": null, "bug": null, "account": null}
}
}
}
响应返回所选答案、每项选择的概率以及置信度分数,同时附带令牌使用统计信息。
几乎即时的本地推理
结论: 在本地运行决策模型可消除网络延迟;Ollama 报告在 Apple M5 Max 上,90 亿参数的 nimble 模型每决策耗时 91 毫秒,足以用于实时游戏或内容审核。
博客文章演示了一个类似吃豆人风格的移动决策,模型在 91 毫秒内以 0.65 的概率选择“左”方向。
当前可用的决策模型
结论: Ollama 0.35 随附三种决策模型系列:
nimble– 由 Bespoke Labs 提供的开源 90 亿参数模型。tev1– 由 Together AI 提供的实验性 40 亿参数模型。tev1:0.8b– 由 Together AI 提供的实验性 0.80 亿参数模型。
Bespoke Labs 发布的基准测试显示,在 13 个公开数据集(共 3,880 次决策)上的平均准确率。博客文章链接至完整的评估结果和可复现的基准测试套件。
示例工作流
结论: 开始使用只需升级至 Ollama 0.35,拉取一个决策模型,并发出 curl 请求(或使用 TypeSafe 的 Python SDK)。示例请求对支持工单进行分类,路由至团队,检测退款请求,并评分紧急程度,返回包含选择、概率和置信度值的结构化 JSON。
ollama pull nimble
curl http://localhost:11434/v1/systemone -d '{
"model": "nimble",
"state": {"ticket": "我被重复收费了。请退还多付的款项。"},
"questions": {
"team": {"type": "choice", "instructions": "哪个团队应处理此工单?", "criteria": {"billing": "付款和退款", "technical": "错误和集成", "other": "以上都不是"}},
"refund": {"type": "noul", "instructions": "客户是否明确要求退款?"},
"urgency": {"type": "score", "instructions": "此工单有多紧急?", "criteria": ["常规", "不久", "紧急"]}
}
}'
响应包含高置信度的账单标签(0.985 的概率)、近乎确定的退款标志(0.997)以及映射到“不久”类别的 0.815 紧急程度评分。
发展路线图与未来增强
结论: Ollama 计划通过 MLX 实现更快的 Apple Silicon 推理,并增加更多本地和云端的专用模型。
所有性能数据、模型名称和基准引用均直接来自 2026 年 9 月 29 日发布的 Ollama 博客文章。