Moonshot AI は需要の高まりにより Kimi K3 のサブスクリプションを一時停止

Moonshot AI はサービス品質を保護するため新規サブスクリプションを一時停止

Moonshot AI は、需要が会社の現在のコンピューティング容量を限界まで押し上げたため、Kimi K3 モデルの新規サブスクリプションを一時停止しました。同社は、現在のメンバーのコンピューティング リソースを優先することで既存加入者の体験を保護することを目的としていると述べました。

既に Kimi サービスを利用しているユーザーはこの停止の影響を受けません。この決定は、技術コミュニティの一部から顧客中心のアプローチと見なされており、ユーザーに通知せずに負荷を管理するために使用制限をこっそり削減(nerfing)する業界の慣行と対照的です。

技術アーキテクチャとパフォーマンス

ハイブリッド アテンション メカニズム

Kimi K3 は、RNN と線形アテンション レイヤーを多数組み込んだハイブリッド アーキテクチャを利用しています。技術的な観察によると、このモデルはフル アテンション レイヤーよりも約3倍多くの RNN/線形アテンション レイヤーを使用しています。この設計は、長文脈タスクにおいて高い効率を発揮すると理論化されており、xLSTMs のアーキテクチャと類似していると考えられています。

コーディングとエージェント的機能

Kimi K3 は、ワンショット推論ではなく、ツールを使用し反復呼び出しでコードを改良するエージェント的コーディングフォームにおいて強いパフォーマンスを示します。マルチエージェント ゲーム コーディング評価では、Kimi K3 はエージェント的コーディングで 3 位にランクインし、Sol と Fable を除いてはトップでした。一方、ワンショット コーディングでは 19 位にとどまりました。

ユーザーは以下の具体的な強みを報告しています:

  • コード レビュー: PR とコード レビューの実施において高い品質を提供します。
  • 分析的トーン: 他のフロンティア モデルと比較して、冷静かつ慎重なトーンを示します。
  • 複雑なリサーチ: 5 時間で 12 の異なるロールを使って 54,000 ワードのレポートを生成する例のように、広範なレポートのためのマルチエージェント ワークフローを処理する能力。
  • 検閲: 一部のユーザーは、Kimi K3 が Anthropic のモデルと比較して顕著に検閲が少ないことを指摘しています。

ユーザー エクスペリエンスと運用上の課題

レイテンシと速度

Moonshot AI のインフラストラクチャの現在の過負荷により、ユーザーは大きなレイテンシを報告しています。コード レビューなど比較的簡単なタスクは「永遠にかかる」と表現され、一部の複雑なプロンプトは日次のクォータに達するまでに最大 12 分かかることがあります。

価格とクォータ

ユーザーのフィードバックから、異なるサブスクリプション階層間で価値に大きな格差があることが示唆されています:

  • $20 プラン: 非常に制限の厳しいレート リミットがあると報告されており、一部のユーザーは数日で週間予算を使い果たしています。
  • 上位プラン: $100 プランおよび $200 プランのユーザーは、モデルが Claude Opus の能力と comparable であるが、しばしば "slop phrasing" にかかりにくいと報告しています。
  • サードパーティ推論: Kimi K3 は SiliconFlow などのアグリゲータを通じて利用可能ですが、コストは DeepSeek などの競合他社よりも大幅に高くなることがあります(たとえば、非キャッシュ入力トークンのコストが 3 倍、出力トークンのコストが 5 倍)。

モデルの可用性に関するコミュニティの視点

Kimi K3 の人気の急増により、クローズド モデル ラボとオープン ウェイト モデルの持続可能性について広範な議論が巻き起こっています。コメント者は、オープン ウェイト モデルではユーザーが自分のハードウェアやさまざまな推論プロバイダーを利用できることを指摘し、主要なラボがインフラストラクチャの障害に直面してもトークンの可用性を確保できると述べています。コミュニティからは、Moonshot AI にモデルをオープンソース化して容量制約を緩和し、アクセシビリティを広げるよう求める声が上がっています。

Sources

関連