RunanywhereAI/wally

Get up and running with GLM-5.3-flash, DeepSeek, Qwen, Gemma and other open source frontier models.

해결하는 문제

Wally는 사용자가 자신의 하드웨어에서 오픈소스 AI 모델을 로컬로 실행하거나, 로컬 머신에 리소스가 부족할 경우 호스팅된 버전을 사용할 수 있도록 해주는 터미널 기반 도구입니다. 복잡한 설정이나 로컬 사용을 위한 API 키 없이도 텍스트, 비전, 음성, 임베딩 등 다양한 AI 모달리티의 다운로드, 관리, 상호작용을 간소화합니다.

작동 방식

Wally는 llama.cpp, MLX, Sherpa-ONNX, ONNX Runtime 등의 여러 AI 백엔드에 대한 통합 인터페이스로 작동합니다. 하드웨어(예: Apple Silicon GPU, Windows ARM64 NPU)와 모델 형식에 따라 최적의 엔진을 자동으로 선택합니다. 사용자는 카탈로그나 Hugging Face GGUF 파일에서 모델을 가져와 간단한 CLI 명령어로 실행할 수 있습니다. 호스팅된 모델의 경우, 요금제 기반 접근을 제공하는 RunAnywhere 콘솔과 통합됩니다.

대상 사용자

개발자 및 고급 사용자에게 적합하며, 터미널에서 LLM 및 기타 AI 모델을 빠르고 프라이버시 중심으로 실행하고 싶은 사람, 또는 Claude Code, Claude Desktop, JetBrains IDE(Clion, RustRover)와 같은 개발 도구에 AI 모델을 통합하고 싶은 사람들을 위한 도구입니다.

주요 기능

  • 다중 모달리티 지원: LLM, 비전-언어 모델(VLM), 텍스트-음성(TTS), 음성-텍스트(STT), 임베딩, 이미지 생성을 지원합니다.
  • 하이브리드 로컬/클라우드: 단일 CLI로 로컬 실행과 호스팅 모델 간을 시ーム리스하게 전환 가능합니다.
  • 하드웨어별 최적화: Apple의 Metal/MLX, Qualcomm의 Hexagon NPU와 같은 전용 하드웨어를 활용합니다.
  • 도구 통합: 인기 있는 코딩 에이전트 및 IDE에 모델을 한 번의 명령어로 연결할 수 있습니다.
  • OpenAI 호환 API: 다른 애플리케이션을 위해 로컬에서 HTTP 엔드포인트로 모델을 제공할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트