ollaya-dev/ollaya
Run open decision models locally: pull and serve Laya, decider, NLI and GLiClass behind a TypeSafe-compatible API. Ollama for decision models.
何を解決するか
Ollayaはローカルで「意思決定モデル」を実行する方法を提供します。標準的なLLMがテキストを生成するのに対し、意思決定モデルは状態(メールやチケットなど)を読み取り、特定の型付き質問(たとえば、リクエストが緊急かどうか、またはユーザーが不満かどうか)に対する校正済み確率を1回のフォワードパスで返すように設計されています。これにより、テキスト生成の必要なく、高速かつ正確で校正された分類とルーティングが可能になります。
動作方法
Ollayaはこれらのモデルを管理・提供するローカルデーモンとして動作します。Ollamaに似たCLIを提供し、ユーザーはpull、run、createコマンドでモデルを操作できます。複数の推論エンジンをサポートしており、ONNX Runtime(CPUおよびNVIDIA GPU用)とllama.cpp(CPU、CUDA、Metal用のGGUFモデル用)が利用可能です。
効率性を確保するため、OllayaはHugging Face上のオリジナル重みファイルを参照する小さなONNXグラフを公開し、sha256で検証します。また、「Modelfiles」をサポートし、特定の質問セットをカスタムモデルに埋め込むこともできます。
対象ユーザー
テキスト生成のオーバーヘッドなしに、高速で校正された分類、意図検出、セーフティガードを必要とするエージェントや自動ワークフローを開発する開発者。
主な特徴
- TypeSafe互換性: TypeSafeの
/v1/systemoneAPIとワイヤー同一であり、既存のクライアントがローカルホスティングに切り替えることが可能。 - エージェント統合: Claude Code、Claude Desktop、Cursorとの統合を可能にするMCPサーバーを内蔵。
- laya Router: 言語とスクリプトを検出する組み込みルーターで、同じ言語のモデルにリクエストをルーティング。
- 高パフォーマンス: 非常に低遅延(例:RTX 4090で5つの質問で8〜10ms)。
- 柔軟な重み形式: ONNXおよびGGUF形式をサポートし、作者のHugging Faceリポジトリから重みを直接取得。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト