Inception Labs Mercury 2.5リリース:260Kコンテキストを備えた高速・低コストの拡散型LLM

Mercury 2.5は低遅延・拡散型言語モデルの基準を引き上げる

ポイント: Inception LabsのMercury 2.5は、Mercury 2に比べて40 %の知能向上を達成し、一般向けNVIDIA GPUで1,107 トークン / 秒の速度、260 Kトークンのコンテキスト、そして出荷価格が1Mトークンあたり$0.04という組み合わせにより、現在市場に存在する最も高速かつ低コストのプロダクショングレードの拡散型LLMとなっています。


Mercury 2との主な進化

  • 品質: Inceptionは「知能」が40 %向上したと主張しており、GPT‑5.6 Luna (Low)、Gemini 3.5 Flash‑Lite、Claude Haiku 4.5といったコスト最適化された最先端モデルと同等の水準に達しています。
  • 速度: ベンチマークでは、広く利用可能なNVIDIA GPUで1,107 トークン / 秒を達成しており、コミュニティユーザーが「信じられないほど高速」と評するほど、繰り返し確認されています。
  • コンテキスト窓: モデルは最大260 Kトークンをサポートしており、非常に長いフォーマットの対話や広範なリトリーブ増強生成(RAG)パイプラインを可能にしています。
  • 価格: 標準出荷価格は1Mトークンあたり$0.20(入力)および$0.75(出力)ですが、導入割引により**80 %**の割引が適用され、$0.04(入力)および$0.15(出力)まで低下します。
  • 新機能: 調整可能な推論、並列ツール呼び出し、スキーマに整合したJSON出力により、複雑なエージェントワークフローに適しています。

「Mercury 2.5は市場で最も能力の高い拡散型LLMです。私たちの知る限り、これまでに訓練された最大の拡散型言語モデルです。」 – Inception Labsブログ


実際のプロダクション利用事例

検索エージェントとRAGパイプライン

  • Mercury 2.5は、1回の検索リクエストで数十回のモデル呼び出し(クエリの再書き換え、再ランク付け、事実の構造化、要約、回答の検証など)を処理しながら、1つのユーザーインタラクション内で完結できます。
  • ユーザーは、複数の推論ステップを必要とする場合でも、モデルの遅延がエンドツーエンドの検索体験をスムーズに保っていると報告しています。

音声エージェント

  • OpenCallのAI電話エージェントは、本番トラフィックで中央値のモデル応答遅延が約170 msを達成しています。
  • Mercury 2.5に移行後、OpenCallのP99遅延は数分から1秒に低下し、P50遅延は0.4 sから0.2 s未満に改善され、競合プロバイダーを上回りました。

    「通話者が感じる一時停止は遅延そのものですが、Mercury 2.5のおかげでその一時停止は無視できるレベルになりました。」 – Oliver Silverstein, OpenCall CEO

コーディングサブエージェントとアシスタント

  • Augment CodeはMercury 2.5をコンテキスト圧縮とツール検索に使用しています。圧縮の遅延は**82 %低下(150 s → 27 s)し、コストは90 %**削減されながら品質は維持されています。
  • モデルは数回のプロンプトで1秒未満で完全なWebアプリを生成でき、迅速なプロトタイピングに適していることを示しています。

Hacker Newsからのコミュニティフィードバック

コメント投稿者 洞察 / 指摘 関連性
networked IP保護のガードレールにより拒否メッセージが返されたが、モデルは回復してターンを完了した。 低レベルのデバッグに干渉する可能性のある組み込みセーフティフィルターを示している。
Sphax 「広く利用可能なGPU」という主張からオープンウェイトリリースを期待したが、モデルはクローズドソースのまま。 開発者向けのライセンス期待を明確にしている。
gertlabs Mercury 2.5プレビューをテスト;汎用チャットでは古いオープンウェイトモデルと同等と評価したが、ツール利用およびエージェント型コーディング性能は弱いと指摘。 先端モデルとの比較においてバランスの取れた現実世界の評価を提供している。
irthomasthomas 高いトークンスループット(1.1 k t/s)が、LLMコンソーシアムにおけるマルチモデルジャッジシステムの遅延ペナルティを相殺できることを指摘。 エンセムアーキテクチャにおける戦略的優位性を示している。
mrinterweb 速度だけでは不十分であり、正確性は単なるスループットよりも重要だと主張。 質 vs 速度のトレードオフを考慮するよう読者に思い出させている。
schopra909 拡散型が離散トークン生成に理論的な限界があることを論じ、将来のハイブリッド「ループ型」拡散アプローチを提案。 Mercury 2.5をLLMにおける拡散の広範な研究トレンドの中で位置づけている。
piterrro Mercury 2.5をベクトルストア結果のバイナリ再ランカーとして使用;速度と決定論的な出力フォーマットを称賛。 低遅延リトリーブの実用的なユースケースを示している。
trefoiled OpenRouterでの体験を「奇妙に高速」と評し、ベンチマークの主張を裏付けている。 トークン/秒という指標の主観的検証。

全体的な感情:ユーザーは速度とコストに感銘を受けているが、推論の正確性とツール利用はトップクラスのモデルに比べてまだ劣っていると指摘している。


Mercury VoiceとMercury Routerのプレビュー

  • Mercury Voice: 音声アシスタント向けに最適化された拡散型LLMで、最初のトークン到達時間 <170 msを実現。
  • Mercury Router: 入力プロンプトを分類し、品質・速度・コストの観点から最も適切なモデル(オープンまたはクローズド)にルーティングするdLLM。

これらのプレビューは、Mercuryエコシステムを純粋なテキスト生成から超え、リアルタイム音声インタラクションとマルチモデルオーケストレーションをターゲットとしています。


はじめ方

  • APIアクセス: Inception API、Baseten、OpenRouterがすべてMercury 2.5を提供しています。
  • 無料トライアル: 100 Mトークンの無料トライアルが利用可能です。
  • エンタープライズ: 専用容量、オートスケーリング、コンプライアンス制御、カスタムデータ保持設定が提供されています。
  • YC特典: Y Combinator参加企業は、50万ドル相当のデプロイメントクレジットを取得できます。

今後の展望

Inception Labsは、今後数か月以内にリリース予定のより大きな拡散モデルの訓練をすでに開始しており、速度やトークン効率を損なうことなくさらなる能力向上を約束しています。同社は、拡散型LLMの発展に貢献したいと考える参加者を歓迎しています。


まとめ

Mercury 2.5は、拡散型言語モデルが最先端レベルのトークンスループットを達成しつつ、コスト効率が良く低遅延であることを実証しています。検索、音声、コーディングアシスタントといったプロダクションワークロードに適しています。リリースは速度と価格面で好意的に受け入れられていますが、コミュニティのフィードバックから、推論の正確性とツール利用は最新のプロプライエタリモデルと競合するにはまだ改善の余地があると指摘されています。

Sources

関連