Ollaya:Jev 风格决策模型的本地推理
Ollaya 是一个开源推理引擎,旨在本地运行决策模型。与逐个 token 生成文本的传统大语言模型(LLM)不同,决策模型可以在单次前向传递中针对文本或 JSON 输入提供经过校准的类型化答案,从而实现毫秒级的延迟。
高性能本地决策推理
Ollaya 允许用户在自己的硬件上运行决策模型,确保敏感数据(如客户工单和电子邮件)保持私密。该系统针对速度进行了优化,在 NVIDIA RTX 4090 上通过 HTTP API 对 Laya 模型进行五个问题的请求,端到端耗时约为 10ms。
性能基准
在 NVIDIA RTX 4090 上通过 HTTP API 进行五个问题请求的中位延迟如下:
| 模型 | 中位延迟 |
|---|---|
| laya:multilingual | 8.1 ms |
| laya:en | 9.6 ms |
| gliclass | 14.7 ms |
| nli | 20.4 ms |
| decider:0.8b | 155 ms |
| decider:2b | 190 ms |
作为对比,TypeSafe 托管 API 的中位请求延迟为 236–276 ms(包含网络开销)。
TypeSafe API 兼容性
Ollaya 是 TypeSafe API 的直接替代品,支持 /v1/systemone 和 /v1/models 端点。这使得官方 TypeSafe Python SDK (v0.7.1) 无需修改即可工作,只需更新 TYPESAFE_BASE_URL 和 TYPESAFE_API_KEY 环境变量即可。
请求与响应示例
典型的请求要求模型将输入字符串(例如:“我可以获取上个月的发票吗?”)分类到一组预定义的标准中(例如:发票、退款、其他)。
请求:
{
"model": "laya",
"state": "Can I get an invoice for last month?",
"questions": {
"intent": {
"type": "choice",
"instructions": "What does the customer want?",
"criteria": {
"invoice": "Needs an invoice or receipt",
"refund": "Wants money back",
"other": "Anything else"
}
}
}
}
响应:
{
"model": "laya:en",
"answers": {
"intent": {
"type": "choice",
"choice": "invoice",
"confidence": 0.9547,
"probabilities": {
"invoice": 0.9698,
"refund": 0.0172,
"other": 0.013
}
}
},
"usage": {
"input_tokens": 43,
"output_tokens": 0
}
}
模型支持与部署
Ollaya 提供对来自 Convai Innovations 的 Laya 模型的访问,包括英语专用模型、多语言模型和路由模型。
平台可用性
Ollaya 以桌面应用程序、命令行工具和 Docker 镜像的形式分发。它支持以下硬件配置:
- Linux (x86-64/ARM64): 在 x86-64 上完全支持 NVIDIA GPU 加速 (CUDA 13)。
- Windows: 通过 WSL 2 支持 NVIDIA GPU 加速。
- macOS (Apple Silicon): 仅支持 CPU 执行。
- Docker: amd64 镜像支持 NVIDIA GPU 加速。
社区见解与技术讨论
Hacker News 上的社区成员讨论了 Ollaya 的实用性和定位。虽然一些人称赞其易于设置以及能够使用旧硬件(例如 GTX 970),但另一些人质疑 Laya 与 Jev 相比的实际决策质量。
"有人真正看到过 Laya 比 Jev 更好或结果相当的情况吗?根据我的经验,Laya 的表现明显更差。它的置信度较低,并且在处理更复杂的查询时经常做出错误的决定。" — @handle
其他讨论集中在决策模型与传统分类器或重排序器之间的区别。一些用户建议,如果决策模型变得突出,主流 LLM 运行器 Ollama 最终可能会实现对它们的原生支持。
此外,社区还发布了一个用于 Ollaya API 的 Web UI,以补充该工具:ollaya-web-ui。
Sources
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch