RunanywhereAI/wally

Get up and running with GLM-5.3-flash, DeepSeek, Qwen, Gemma and other open source frontier models.

何を解決するか

Wally は、ユーザーが自前のハードウェア上でオープンソースのAIモデルをローカルに実行するか、ローカルマシンにリソースが不足している場合はホストされたバージョンを使用できるようにするターミナルベースのツールです。テキスト、ビジョン、音声、埋め込みなど、さまざまなAIモダリティのダウンロード、管理、インタラクションを、複雑な設定やローカル用のAPIキーなしで簡素化します。

動作方法

Wally は、llama.cpp、MLX、Sherpa-ONNX、ONNX Runtime などの複数のAIバックエンドに対する統合インターフェースとして機能します。ハードウェア(例:Apple Silicon GPU、Windows ARM64 NPU)とモデル形式に基づいて、最適なエンジンを自動的に選択します。ユーザーはカタログやHugging FaceのGGUFファイルからモデルを取得し、シンプルなCLIコマンドで実行できます。ホストモデルの場合、メーター制のアクセスを提供するRunAnywhereコンソールと統合されています。

対象ユーザー

開発者やパワーユーザー向けに設計されており、ターミナルからLLMやその他のAIモデルを高速かつプライバシー重視で実行したい人、またClaude Code、Claude Desktop、JetBrains IDE(CLion、RustRover)などのコーディングツールにAIモデルを統合したい人向けです。

特徴

  • マルチモーダル対応:LLM、ビジョン言語モデル(VLM)、音声合成(TTS)、音声認識(STT)、埋め込み、画像生成を対応。
  • ハイブリッドローカル/クラウド:1つのCLIでローカル実行とホストモデルの間をシームレスに切り替え可能。
  • ハードウェア固有の最適化:AppleのMetal/MLX、QualcommのHexagon NPUなどの専用ハードウェアを活用。
  • ツール統合:1つのコマンドで人気のコーディングエージェントやIDEにモデルを接続可能。
  • OpenAI互換API:他のアプリケーション向けに、ローカルでHTTPエンドポイントとしてモデルを提供可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト