ollaya-dev/ollaya

Run open decision models locally: pull and serve Laya, decider, NLI and GLiClass behind a TypeSafe-compatible API. Ollama for decision models.

何を解決するか

Ollayaはローカルで「意思決定モデル」を実行する方法を提供します。標準的なLLMがテキストを生成するのに対し、意思決定モデルは状態(メールやチケットなど)を読み取り、特定の型付き質問(たとえば、リクエストが緊急かどうか、またはユーザーが不満かどうか)に対する校正済み確率を1回のフォワードパスで返すように設計されています。これにより、テキスト生成の必要なく、高速かつ正確で校正された分類とルーティングが可能になります。

動作方法

Ollayaはこれらのモデルを管理・提供するローカルデーモンとして動作します。Ollamaに似たCLIを提供し、ユーザーはpull、run、createコマンドでモデルを操作できます。複数の推論エンジンをサポートしており、ONNX Runtime(CPUおよびNVIDIA GPU用)とllama.cpp(CPU、CUDA、Metal用のGGUFモデル用)が利用可能です。

効率性を確保するため、OllayaはHugging Face上のオリジナル重みファイルを参照する小さなONNXグラフを公開し、sha256で検証します。また、「Modelfiles」をサポートし、特定の質問セットをカスタムモデルに埋め込むこともできます。

対象ユーザー

テキスト生成のオーバーヘッドなしに、高速で校正された分類、意図検出、セーフティガードを必要とするエージェントや自動ワークフローを開発する開発者。

主な特徴

  • TypeSafe互換性: TypeSafeの/v1/systemone APIとワイヤー同一であり、既存のクライアントがローカルホスティングに切り替えることが可能。
  • エージェント統合: Claude Code、Claude Desktop、Cursorとの統合を可能にするMCPサーバーを内蔵。
  • laya Router: 言語とスクリプトを検出する組み込みルーターで、同じ言語のモデルにリクエストをルーティング。
  • 高パフォーマンス: 非常に低遅延(例:RTX 4090で5つの質問で8〜10ms)。
  • 柔軟な重み形式: ONNXおよびGGUF形式をサポートし、作者のHugging Faceリポジトリから重みを直接取得。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト