Ollama 0.35、Jevスタイルの意思決定モデルをネイティブサポート

TL;DR

Ollama 0.35は、新しい/v1/systemoneエンドポイントを介してJevスタイルの意思決定モデルをサポートし、追加費用なしでデバイス上で高速かつ型付きの意思決定を可能にします。

型付き意思決定のための新しいAPIエンドポイント

結論: /v1/systemoneエンドポイントにより、開発者はテキストの状態と名前付き質問のセットをローカルモデルに送信し、単一のリクエストで構造化された回答を受け取ることができます。この設計はTypeSafeのJev APIに従い、ネットワークのラウンドトリップを排除し、レイテンシとコストを削減します。

POST http://localhost:11434/v1/systemone
{
  "model": "nimble",
  "state": "Our checkout has returned 500 errors since 9am.",
  "questions": {
    "label": {
      "type": "choice",
      "instructions": "Which label fits this ticket?",
      "criteria": {"billing": null, "bug": null, "account": null}
    }
  }
}

応答は、選択された回答、選択肢ごとの確率、信頼スコア、およびトークン使用統計を返します。

ほぼ瞬時のローカル推論

結論: 意思決定モデルをローカルで実行することでネットワークレイテンシが排除されます。Ollamaは、Apple M5 Max上の90億パラメータのnimbleモデルで意思決定あたり91ミリ秒を報告しており、リアルタイムのゲームプレイやコンテンツモデレーションに十分な速度です。

ブログ投稿では、モデルが91ミリ秒で0.65の確率で「左」を選択するPac-Manスタイルの移動決定を示しています。

現在利用可能な意思決定モデル

結論: Ollama 0.35には3つの意思決定モデルファミリが同梱されています:

  • nimble – Bespoke Labs製のオープンソースの90億パラメータモデル。
  • tev1 – Together AI製の実験的な40億パラメータモデル。
  • tev1:0.8b – Together AI製の実験的な0.8億パラメータモデル。

Bespoke Labsが公開したベンチマークでは、13の公開データセット(3,880の意思決定)にわたる平均精度を示しています。ブログでは、完全な評価結果と再現性のためのベンチマークスイートへのリンクを提供しています。

ワークフローの例

結論: 始めるには、Ollama 0.35へのアップグレード、意思決定モデルのプル、curlリクエストの発行(またはTypeSafeのPython SDKの使用)のみが必要です。例のリクエストは、サポートチケットを分類し、チームにルーティングし、返金リクエストを検出し、緊急度をスコアリングし、選択肢、確率、信頼値を含む構造化JSONを返します。

ollama pull nimble
curl http://localhost:11434/v1/systemone -d '{
  "model": "nimble",
  "state": {"ticket": "I was charged twice. Please refund the extra payment."},
  "questions": {
    "team": {"type": "choice", "instructions": "Which team should handle this ticket?", "criteria": {"billing": "Payments and refunds", "technical": "Bugs and integrations", "other": "None of the above"}},
    "refund": {"type": "noul", "instructions": "Does the customer explicitly ask for a refund?"},
    "urgency": {"type": "score", "instructions": "How urgent is this ticket?", "criteria": ["Routine", "Soon", "Urgent"]}
  }
}'

応答には、高信頼の請求ラベル(確率0.985)、ほぼ確実な返金フラグ(0.997)、および「Soon」カテゴリにマッピングされた緊急度スコア0.815が含まれます。

ロードマップと今後の機能拡張

結論: Ollamaは、MLXを介したAppleシリコンでの高速推論と、ローカルおよびクラウドの両方でより専門的なモデルの追加により、意思決定モデルのサポートを拡張する予定です。


すべてのパフォーマンス数値、モデル名、ベンチマーク参照は、2026年9月29日付のOllamaブログ投稿から直接引用されています。

Sources