Ollaya: Jev 스타일 의사결정 모델을 위한 로컬 추론

Ollaya는 의사결정 모델을 로컬에서 실행하기 위해 설계된 오픈 소스 추론 엔진입니다. 텍스트를 토큰 단위로 생성하는 기존의 거대 언어 모델(LLM)과 달리, 의사결정 모델은 텍스트나 JSON 입력에 대한 특정 질문에 대해 보정되고 유형화된 답변을 단일 순방향 패스로 제공하여 밀리초 단위의 지연 시간을 구현합니다.

고성능 로컬 의사결정 추론

Ollaya를 사용하면 사용자가 자신의 하드웨어에서 의사결정 모델을 실행할 수 있어 고객 티켓이나 이메일과 같은 민감한 데이터의 개인정보를 보호할 수 있습니다. 이 시스템은 속도에 최적화되어 있으며, NVIDIA RTX 4090에서 HTTP API를 통해 Laya 모델에 5개의 질문을 요청할 경우 종단 간 약 10ms가 소요됩니다.

성능 벤치마크

NVIDIA RTX 4090에서 HTTP API를 통한 5개 질문 요청의 중앙값 지연 시간은 다음과 같습니다:

모델 중앙값 지연 시간
laya:multilingual 8.1 ms
laya:en 9.6 ms
gliclass 14.7 ms
nli 20.4 ms
decider:0.8b 155 ms
decider:2b 190 ms

비교를 위해 TypeSafe 호스팅 API의 경우 네트워크 오버헤드를 포함하여 236–276ms의 중앙값 요청 지연 시간을 보입니다.

TypeSafe API 호환성

Ollaya는 TypeSafe API를 대체할 수 있는 드롭인(drop-in) 솔루션으로, /v1/systemone 및 /v1/models 엔드포인트를 제공합니다. 이를 통해 공식 TypeSafe Python SDK(v0.7.1)를 수정 없이 사용할 수 있으며, TYPESAFE_BASE_URL 및 TYPESAFE_API_KEY 환경 변수만 업데이트하면 됩니다.

요청 및 응답 예시

일반적인 요청은 입력 문자열(예: "지난달 청구서를 받을 수 있을까요?")을 미리 정의된 기준(예: 청구서, 환불, 기타)으로 분류하도록 모델에 지시합니다.

요청:

{
  "model": "laya",
  "state": "Can I get an invoice for last month?",
  "questions": {
    "intent": {
      "type": "choice",
      "instructions": "What does the customer want?",
      "criteria": {
        "invoice": "Needs an invoice or receipt",
        "refund": "Wants money back",
        "other": "Anything else"
      }
    }
  }
}

응답:

{
  "model": "laya:en",
  "answers": {
    "intent": {
      "type": "choice",
      "choice": "invoice",
      "confidence": 0.9547,
      "probabilities": {
        "invoice": 0.9698,
        "refund": 0.0172,
        "other": 0.013
      }
    }
  },
  "usage": {
    "input_tokens": 43,
    "output_tokens": 0
  }
}

모델 지원 및 배포

Ollaya는 영어 전용, 다국어 및 라우터 모델을 포함하여 Convai Innovations의 Laya 모델에 대한 액세스를 제공합니다.

플랫폼 가용성

Ollaya는 데스크톱 앱, 명령줄 도구 및 Docker 이미지로 배포됩니다. 다음과 같은 하드웨어 구성을 지원합니다:

  • Linux (x86-64/ARM64): x86-64에서 NVIDIA GPU 가속(CUDA 13)을 포함한 전체 지원.
  • Windows: WSL 2를 통한 NVIDIA GPU 가속 지원.
  • macOS (Apple Silicon): CPU 전용 실행.
  • Docker: amd64 이미지에 대해 NVIDIA GPU 가속 사용 가능.

커뮤니티 인사이트 및 기술 토론

Hacker News의 커뮤니티 회원들은 Ollaya의 유용성과 포지셔닝에 대해 논의했습니다. 일부는 설정의 용이성과 구형 하드웨어(예: GTX 970)를 사용할 수 있는 점을 칭찬했지만, 다른 이들은 Jev와 비교했을 때 Laya의 실제 의사결정 품질에 의문을 제기했습니다.

"Laya가 Jev보다 더 좋거나 동일한 결과를 내는 것을 본 적이 있나요? 제 경험상 Laya는 성능이 상당히 떨어집니다. 자신감이 부족하고 더 복잡한 쿼리에서 종종 잘못된 결정을 내립니다." — @handle

다른 토론에서는 의사결정 모델과 기존 분류기 또는 재순위 지정기(re-ranker) 간의 차이에 초점을 맞췄습니다. 일부 사용자는 의사결정 모델이 중요해지면 주요 LLM 러너인 Ollama가 결국 이에 대한 기본 지원을 구현할 수도 있다고 제안했습니다.

또한, Ollaya API를 보완하기 위해 커뮤니티에서 개발한 웹 UI가 출시되었습니다: ollaya-web-ui.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch