Ollaya: Jevスタイルの意思決定モデルのローカル推論
Ollayaは、ローカルで意思決定モデルを実行するためのオープンソースの推論エンジンです。従来の大規模言語モデル(LLM)がトークン単位でテキストを生成するのに対し、意思決定モデルは、テキストやJSON入力に関する特定の質問に対して、校正された型付きの答えを1回のフォワードパスで提供し、ミリ秒単位の遅延を実現します。
高性能なローカル意思決定推論
Ollayaはユーザーが自前のハードウェア上で意思決定モデルを実行できるようにし、顧客チケットやメールなど機密性の高いデータが外部に漏れるのを防ぎます。システムは高速性を最適化しており、NVIDIA RTX 4090上でHTTP API経由で5つの質問を処理する際のエンドツーエンド遅延は約10msです。
パフォーマンスベンチマーク
NVIDIA RTX 4090上でHTTP API経由の5質問リクエストの中央値遅延は以下の通りです:
| モデル | 中央値遅延 |
|---|---|
| laya:multilingual | 8.1 ms |
| laya:en | 9.6 ms |
| gliclass | 14.7 ms |
| nli | 20.4 ms |
| decider:0.8b | 155 ms |
| decider:2b | 190 ms |
比較として、TypeSafeのホスティングAPIの中央値リクエスト遅延は236–276msであり、ネットワークオーバーヘッドを含んでいます。
TypeSafe API互換性
OllayaはTypeSafeのAPIの即時置き換え可能であり、/v1/systemoneおよび/v1/modelsエンドポイントを提供します。これにより、公式のTypeSafe Python SDK(v0.7.1)は、TYPESAFE_BASE_URLおよびTYPESAFE_API_KEY環境変数を更新するだけで、変更なしに動作します。
例:リクエストとレスポンス
一般的なリクエストでは、モデルに入力文字列(例:"Can I get an invoice for last month?")を、事前に定義された基準(例:invoice、refund、other)に分類させるように依頼します。
リクエスト:
{
"model": "laya",
"state": "Can I get an invoice for last month?",
"questions": {
"intent": {
"type": "choice",
"instructions": "What does the customer want?",
"criteria": {
"invoice": "Needs an invoice or receipt",
"refund": "Wants money back",
"other": "Anything else"
}
}
}
}
レスポンス:
{
"model": "laya:en",
"answers": {
"intent": {
"type": "choice",
"choice": "invoice",
"confidence": 0.9547,
"probabilities": {
"invoice": 0.9698,
"refund": 0.0172,
"other": 0.013
}
}
},
"usage": {
"input_tokens": 43,
"output_tokens": 0
}
}
モデルサポートとデプロイ
OllayaはConvai InnovationsのLayaモデル(英語専用、多言語、ルーター用)にアクセスできるようにします。
プラットフォームの利用可能状況
Ollayaはデスクトップアプリ、コマンドラインツール、Dockerイメージとして配布されています。以下のハードウェア構成をサポートしています:
- Linux (x86-64/ARM64): x86-64ではNVIDIA GPUアクセラレーション(CUDA 13)を完全サポート。
- Windows: WSL 2経由でNVIDIA GPUアクセラレーションをサポート。
- macOS (Apple Silicon): CPUのみの実行。
- Docker: amd64イメージでNVIDIA GPUアクセラレーションを提供。
コミュニティの洞察と技術的議論
Hacker Newsのコミュニティメンバーは、Ollayaの有用性と位置づけについて議論しました。一部のユーザーはセットアップの容易さや古いハードウェア(例:GTX 970)の利用を称賛しましたが、他のユーザーはLayaの実際の意思決定品質がJevと比較してどうなのか疑問を呈しました。
"LayaがJevと比べてより良い、または同等の結果を出したのを見たことがある人はいますか?私の経験では、Layaは著しく劣っています。自信がなく、複雑なクエリでは頻繁に誤った判断を下します。"
他の議論では、意思決定モデルと従来の分類器や再ランク機構との違いに焦点が当てられました。一部のユーザーは、意思決定モデルが主流になると、主なLLMランナーであるOllamaが最終的にそれらのネイティブサポートを実装する可能性があると示唆しました。
さらに、コミュニティが開発したOllaya API用のWeb UIもリリースされました:ollaya-web-ui。
Sources
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch