Fireworks AI Ember-1 リリース

Ember-1 は推論品質を損なわずにトークンオーバーヘッドを削減

Fireworks Research は Ember-1 をリリースしました。この専用モデルは、Kimi K3 の品質を維持しつつ、35% から 50% 少ないトークンで処理できるように設計されています。このモデルは、長時間の推論トレースがコストとレイテンシを増加させるため、特に複数ターンの対話でコンテキストが二次的に増大するエージェントワークロードや自動コード生成に最適化されています。

Ember-1 は、推論モデルにおける「過剰な思考」問題を解決するために開発されました。Kimi K3 のようなモデルは、生成トークンの90%以上を内部推論に費やしますが、Fireworks Research は、その多くが冗長であることを発見しました。Ember-1 は、重要な自己反省やエラー回復を維持しつつ、生産性のないループを排除することで、より効率的な学習を実現。これにより、大幅に小さなトークン量で同等の精度を達成しています。

学習手法とインフラストラクチャ

Ember-1 は Fireworks Serverless Training を使用して構築され、GPU のプロビジョニングを管理することなく、研究チームが迅速に反復開発が可能になりました。開発プロセスでは、50 以上の学習実験と 200 回以上の評価が行われました。

トークンの節約が多様なワークロードにわたって有効であることを保証するため、モデルは以下のタスクの包括的なコレクションで訓練されました:

  • 数学とコード生成
  • 指示の遵守と会話
  • 検索とツール利用
  • ソフトウェアエンジニアリング(単独問題および拡張された対話)

学習は、タスクフィードバックに基づくポリシー内計画と学習に焦点を当て、モデルが観測や結果に適応できるようにしながら、過剰な推論に戻らないようにしました。

パフォーマンスベンチマークとパレート前線

Fireworks は Specialized Intelligence Index (SII) と複数の業界ベンチマークを使用して Ember-1 を評価しました。その結果、Ember-1 はいくつかのカテゴリにおいて、コストとパフォーマンスの最適なバランス(パレート前線)を確立していることが示されています。

ベッドサイドベンチ(臨床ケース)

Doximity の Bedside Bench(500 件の医師検証済み臨床ケースから構成)において、Ember-1 は GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 など他のモデルを上回り、タスクあたりのコストが最も低くなりました。

業界標準コードベンチマーク

Ember-1 は、Kimi K3 と比較して、さまざまな推論努力設定(Low、High、Max)で優れたパフォーマンスを示しました。いくつかのケースでは、Ember-1 はパス率を向上させながらコストを削減しました:

ベンチマーク K3 Max パス率 Ember-1 パス率 K3 Max と比較したトークン/コスト削減
Terminal Bench 2.1 77.6% 80.9% -51.9% トークン / -$23.1 USD
SWE-bench Verified 86.0% 93.2% -15.5% トークン / -$68.1 USD
SWE-Interact 13.3% 21.3% -32.5% トークン / -$60.8 USD
DeepSWE 1.1 62.8% 66.4% -23.7% トークン / -$126.9 USD
τ-2 Bench Airline 64% 66% -5.9% トークン / -$0.3 USD

実世界での検証と本番環境への影響

カスタマーアブルテスト

コード作業に特化した2つの顧客での本番環境テストでは、Ember-1 はタスクあたり約35%のトークン使用量を削減しながら、同等の品質を維持しました。これにより、タスク完了や成功確率などの下流指標が改善または安定しました。

内部開発者テスト

Fireworks は自社の開発者による日常的なコード作業に Ember-1 を内部導入しました。同社は、導入が「目に見えない」ほどであり、トークン消費量が大幅に削減されたにもかかわらず、開発者が品質の低下に気づかなかったと報告しています。

コミュニティおよび開発者からのフィードバック

発表後、開発者コミュニティからモデルの位置づけとアクセス性に関するいくつかの意見が寄せられました:

  • 価格に関する懸念:一部のユーザーは、モデルが少ないトークンで動作する一方で、トークン単価がベースの Kimi K3 モデルよりも高くなる可能性があると指摘。これにより、一部のユーザーにとっては総コストの削減が相殺される可能性があると述べました。
  • 重みの公開性:Ember-1 はオープンな重みに基づいていますが、最終的なチューニングされたモデルはオープン重みとしてリリースされていないため、「オープン」という性質について議論が続いています。
  • Prefill と Decode:一部の技術的批判者は、エージェントコードでは、コストの大部分が Decode(出力)ではなく、Prefill(入力)に発生することが多いと指摘。Ember-1 のトークン削減は Decode に最も効果的であるため、実際のコスト削減効果は限定的である可能性があると述べました。

"K3 をよりコスト最適化する方法は、今や考えさせることを減らすことではなく、効率的に考える能力を学んだ Ember-1 を使うことだ。"

Ember-1 は現在、Fireworks Serverless 上で Research Preview リリースとして利用可能です。

Sources

関連