FlashML-org/FreeToken

FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.

何を解決するか

FreeToken は、ゲーミングPCやノートPCなどのエッジデバイス上で、最大290Bパラメータ以上の巨大なMixture-of-Experts(MoE)モデルをインタラクティブな速度で実行できるように設計されています。GPU、CPU、ホストメモリを統合的かつ柔軟なプラットフォームとして扱うことで、エッジデバイスのメモリと帯域幅の制限を克服します。

動作方法

エンジンは複数の最適化技術を用いてハードウェア効率を最大化します:

  • 帯域幅適応実行: CPU-GPU同時実行のための $q^\star$ ポリシーにより、データ移動を最適化します。
  • エキスパートキャッシュ: グローバルなLRU(最近使用されていない)エキスパートキャッシュと、FTW高速重みフォーマットにより、モデル重みへのアクセスを高速化します。
  • 意味論的意識キャッシュ: KVキャッシュと再帰状態に意味論的アンカー・チェックポイントを使用し、エージェントコンテキストの編集(ツール呼び出しなど)時に重複した再計算を防ぎます。
  • エラスティックメモリ: 実行時中にVRAMをエキスパートキャッシュとKVメモリの間で動的に再割り当て可能で、再起動不要です。
  • 量子化サポート: MXFP4、NVFP4、FP8、BF16など複数のフォーマットをサポートし、メモリ使用量を削減します。

対象ユーザー

NVIDIA RTX 30、40、50シリーズGPUを搭載したコンシューマー機で、クラウドインフラに頼らずに先端規模のオープンウェイトMoEモデルをローカルで実行したい開発者やAI愛好家です。

主な特徴

  • エッジネイティブランタイム: コンシューマー機向けに最適化されており、ダブルバッファリングされたプリフィルストリーミングとグラフ互換実行をサポートします。
  • 広範なモデル対応: DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2などに対応しています。
  • API互換性: AnthropicおよびOpenAI互換APIを提供し、Claude CodeやDeepSeek Harnessなどのコードエージェントとの統合が容易です。
  • クロスプラットフォーム: WindowsおよびLinux用デスクトップアプリまたはCLIとして利用可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト