ollaya-dev/ollaya

Run open decision models locally: pull and serve Laya, decider, NLI and GLiClass behind a TypeSafe-compatible API. Ollama for decision models.

解决的问题

Ollaya 提供了一种在本地运行「决策模型」的方法。与生成文本的标准 LLM 不同,决策模型旨在读取状态(如邮件或工单),并在一次前向传播中返回针对特定类型问题的校准概率(例如请求是否紧急,或用户是否感到沮丧)。这使得无需文本生成即可实现快速、精确且校准的分类和路由。

工作原理

Ollaya 作为一个本地守护进程运行,负责管理和提供这些模型。它使用类似于 Ollama 的 CLI,允许用户执行 pull、run 和 create 模型操作。它支持多种推理引擎,包括 ONNX Runtime(适用于 CPU 和 NVIDIA GPU)以及 llama.cpp(适用于 CPU、CUDA 和 Metal 上的 GGUF 模型)。

为确保效率,Ollaya 发布了小型 ONNX 图,指向 Hugging Face 上的原始权重文件,并通过 sha256 进行验证。它还支持「Modelfiles」,可将特定问题集烘焙到自定义模型中。

适用人群

需要在不产生文本生成开销的前提下,实现快速、校准的分类、意图检测和安全防护的开发者,用于构建代理或自动化工作流。

主要亮点

  • 与 TypeSafe 兼容:与 TypeSafe 的 /v1/systemone API 完全兼容,允许现有客户端无缝切换至本地托管。
  • 代理集成:内置 MCP 服务器,支持与 Claude Code、Claude Desktop 和 Cursor 的集成。
  • laya Router:内置路由器,可检测语言和脚本,并将请求路由至同语言模型。
  • 高性能:可实现极低延迟(例如,在 RTX 4090 上对五个问题的响应时间为 8-10ms)。
  • 灵活的权重格式:支持 ONNX 和 GGUF 格式,可直接从作者的 Hugging Face 仓库拉取权重。

相关

  • 项目
  • 项目
  • 项目
  • 项目