ollaya-dev/ollaya

Run open decision models locally: pull and serve Laya, decider, NLI and GLiClass behind a TypeSafe-compatible API. Ollama for decision models.

解決的問題

Ollaya 提供了一種在本地執行「決策模型」的方法。與產生文字的標準 LLM 不同,決策模型旨在讀取狀態(如電子郵件或工單),並在一次前向傳播中返回針對特定類型問題的校準機率(例如請求是否緊急,或使用者是否感到不滿)。這使得無需文字生成即可實現快速、精確且校準的分類與路由。

工作原理

Ollaya 作為一個本地守護程序運作,負責管理與提供這些模型。它使用類似於 Ollama 的 CLI,允許使用者執行 pull、run 和 create 模型操作。它支援多種推理引擎,包括 ONNX Runtime(適用於 CPU 和 NVIDIA GPU)以及 llama.cpp(適用於 CPU、CUDA 和 Metal 上的 GGUF 模型)。

為確保效率,Ollaya 發布小型 ONNX 圖,指向 Hugging Face 上的原始權重檔案,並透過 sha256 進行驗證。它也支援「Modelfiles」,可將特定問題集烘焙至自訂模型中。

適用對象

需要在不產生文字生成開銷的前提下,實現快速、校準的分類、意圖檢測與安全防護的開發者,用於建構代理或自動化工作流程。

主要亮點

  • 與 TypeSafe 兼容:與 TypeSafe 的 /v1/systemone API 完全相容,允許現有客戶端無縫切換至本地託管。
  • 代理整合:內建 MCP 伺服器,支援與 Claude Code、Claude Desktop 和 Cursor 的整合。
  • laya Router:內建路由器,可偵測語言與腳本,並將請求路由至同語言模型。
  • 高效率:可實現極低延遲(例如,在 RTX 4090 上對五個問題的回應時間為 8-10ms)。
  • 靈活的權重格式:支援 ONNX 和 GGUF 格式,可直接從作者的 Hugging Face 倉庫拉取權重。

相關

  • 專案
  • 專案
  • 專案
  • 專案