ollaya-dev/ollaya

Run open decision models locally: pull and serve Laya, decider, NLI and GLiClass behind a TypeSafe-compatible API. Ollama for decision models.

해결하는 문제

Ollaya는 로컬에서 "의사결정 모델"을 실행할 수 있는 방법을 제공합니다. 일반적인 LLM이 텍스트를 생성하는 반면, 의사결정 모델은 상태(이메일이나 티켓 등)를 읽고 특정 유형의 질문(예: 요청이 긴급한지, 사용자가 불만이 있는지 등)에 대한 보정된 확률을 단일 프로퍼그로 반환하도록 설계되었습니다. 이를 통해 텍스트 생성 없이도 빠르고 정확하며 보정된 분류와 라우팅이 가능합니다.

작동 방식

Ollaya는 이러한 모델을 관리하고 제공하는 로컬 데몬으로 작동합니다. Ollama와 유사한 CLI를 제공하여 사용자가 pull, run, create 명령어로 모델을 조작할 수 있습니다. ONNX Runtime( CPU 및 NVIDIA GPU용)과 llama.cpp(GGUF 모델의 CPU, CUDA, Metal용)을 포함한 여러 추론 엔진을 지원합니다.

효율성을 보장하기 위해 Ollaya는 Hugging Face에 있는 원본 가중치 파일을 참조하는 작은 ONNX 그래프를 공개하며, sha256를 통해 검증합니다. 또한 "Modelfiles"를 지원하여 특정 질문 세트를 커스텀 모델에 내장할 수 있습니다.

대상 사용자

텍스트 생성의 오버헤드 없이 빠르고 보정된 분류, 의도 탐지, 안전성 보호가 필요한 에이전트나 자동 워크플로우를 개발하는 개발자.

주요 특징

  • TypeSafe 호환성: TypeSafe의 /v1/systemone API와 와이어 수준에서 동일하므로 기존 클라이언트가 로컬 호스팅으로 전환할 수 있습니다.
  • 에이전트 통합: Claude Code, Claude Desktop, Cursor와의 통합을 위한 MCP 서버를 포함합니다.
  • laya Router: 언어와 스크립트를 감지하여 동일 언어 모델로 요청을 라우팅하는 내장 라우터입니다.
  • 고성능: 매우 낮은 지연 시간(예: RTX 4090에서 5개 질문에 대해 8~10ms)을 제공합니다.
  • 유연한 가중치 형식: ONNX 및 GGUF 형식을 지원하며, 작가의 Hugging Face 리포지토리에서 직접 가중치를 다운로드합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트