Ollama 0.35, Jev 스타일 의사 결정 모델에 대한 기본 지원 추가
TL;DR
Ollama 0.35는 이제 새로운 /v1/systemone 엔드포인트를 통해 Jev 스타일 의사 결정 모델을 지원하며, 추가 비용 없이 기기에서 빠르고 유형화된 결정을 내릴 수 있습니다.
유형화된 결정을 위한 새로운 API 엔드포인트
결론: /v1/systemone 엔드포인트를 통해 개발자는 텍스트 상태와 명명된 질문 세트를 로컬 모델에 보내고 단일 요청으로 구조화된 답변을 받을 수 있습니다. 이 설계는 TypeSafe의 Jev API를 따르며 네트워크 왕복을 제거하여 지연 시간과 비용을 낮춥니다.
POST http://localhost:11434/v1/systemone
{
"model": "nimble",
"state": "Our checkout has returned 500 errors since 9am.",
"questions": {
"label": {
"type": "choice",
"instructions": "Which label fits this ticket?",
"criteria": {"billing": null, "bug": null, "account": null}
}
}
}
응답은 선택된 답변, 선택별 확률, 신뢰도 점수와 함께 토큰 사용 통계를 반환합니다.
거의 즉각적인 로컬 추론
결론: 의사 결정 모델을 로컬에서 실행하면 네트워크 지연이 제거됩니다. Ollama는 Apple M5 Max에서 90억 매개변수 nimble 모델에 대해 결정당 91ms를 보고하며, 실시간 게임 플레이나 콘텐츠 조정에 충분히 빠릅니다.
블로그 게시물은 모델이 91ms 만에 0.65 확률로 "left"를 선택하는 Pac-Man 스타일 이동 결정을 보여줍니다.
현재 사용 가능한 의사 결정 모델
결론: Ollama 0.35에는 세 가지 의사 결정 모델 제품군이 포함되어 있습니다:
nimble– Bespoke Labs의 오픈 소스 90억 매개변수 모델.tev1– Together AI의 실험적 40억 매개변수 모델.tev1:0.8b– Together AI의 실험적 8억 매개변수 모델.
Bespoke Labs가 발표한 벤치마크는 13개의 공개 데이터 세트(3,880개의 결정)에서 평균 정확도를 보여줍니다. 블로그는 전체 평가 결과와 재현 가능한 벤치마크 스위트에 대한 링크를 제공합니다.
예제 워크플로우
결론: 시작하려면 Ollama 0.35로 업그레이드하고, 의사 결정 모델을 가져오고, curl 요청(또는 TypeSafe의 Python SDK 사용)만 하면 됩니다. 예제 요청은 지원 티켓을 분류하고, 팀에 라우팅하고, 환불 요청을 감지하고, 긴급도를 점수화하여 선택, 확률 및 신뢰도 값이 포함된 구조화된 JSON을 반환합니다.
ollama pull nimble
curl http://localhost:11434/v1/systemone -d '{
"model": "nimble",
"state": {"ticket": "I was charged twice. Please refund the extra payment."},
"questions": {
"team": {"type": "choice", "instructions": "Which team should handle this ticket?", "criteria": {"billing": "Payments and refunds", "technical": "Bugs and integrations", "other": "None of the above"}},
"refund": {"type": "noul", "instructions": "Does the customer explicitly ask for a refund?"},
"urgency": {"type": "score", "instructions": "How urgent is this ticket?", "criteria": ["Routine", "Soon", "Urgent"]}
}
}'
응답에는 높은 신뢰도의 청구 레이블(0.985 확률), 거의 확실한 환불 플래그(0.997), "곧" 범주에 매핑된 긴급도 점수 0.815가 포함됩니다.
로드맵 및 향후 개선 사항
결론: Ollama는 MLX를 통한 더 빠른 Apple Silicon 추론과 더 전문화된 모델을 로컬 및 클라우드 모두에 추가하여 의사 결정 모델 지원을 확장할 계획입니다.
모든 성능 수치, 모델 이름 및 벤치마크 참조는 2026년 9월 29일자 Ollama 블로그 게시물에서 직접 가져온 것입니다.