DeepSeek Elastic Compute (DSec) インフラストラクチャ

DeepSeek Elastic Compute (DSec) は、分離されたステートフルな実行環境を提供することで、大規模なエージェント学習と評価を可能にするプロダクションサンドボックスプラットフォームです。これは、大規模なバースト時に数百万のサンドボックスを管理し、異種混合の分離要件を処理し、リソース利用率を最適化しながら長期的なインタラクション全体で状態を維持するという課題を解決します。

高密度サンドボックス管理

DSecは、メモリ共有、再利用、および最適化されたCPUスケジューリングの組み合わせを通じて、高密度な実行を実現します。DSecの単一のプロダクションスケールユニットは、約160のCPUノード、30,000コア、250 TBのDRAMで構成されています。このインフラストラクチャは、以下のパフォーマンス指標をサポートしています。

  • 同時サンドボックス数: ピーク時の同時実行数は約380,000インスタンスに達します。
  • 1日の処理量: 単一のスケールユニットで1日あたり約300万のサンドボックスインスタンスを処理します。
  • 作成レート: このプラットフォームは、毎秒5,000インスタンスを超える作成レートを維持します。

統合されたサンドボックスバックエンド

異なる分離および機能要件に対応するため、DSecは統合されたSDKを通じて複数のサンドボックスバックエンドを公開しています。これにより、システムはタスクに基づいて適切なレベルの分離を選択できます。

  • FnCall: 軽量な関数呼び出しタスク用。
  • Containers: 標準的な分離環境用。
  • Container-based microVMs: より強力な分離用。
  • Full-VMs: 最も厳格な分離要件用。

分散イメージ配布とストレージ

DSecは、クラスター全体に分散されたファイルシステムであるFire-Flyer File System (3FS) を利用して、オンデマンドでイメージデータをロードします。このアプローチにより、環境セットアップのオーバーヘッドが削減され、再利用が制限された大規模なイメージコーパスに関連するイメージ配布のボトルネックが最小限に抑えられます。

強化学習 (RL) フレームワークとの共同設計

DSecは、GPUトレーニングループを最適化するために、強化学習フレームワークと共同設計されています。ステートフルなロールアウト実行(エージェントが環境と対話する場所)と、プリエンプティブル(中断可能)なGPUトレーニングを分離します。この調整により、プラットフォームはロールアウトの状態を保持しながらアイドルリソースを再利用できるため、報酬ハッキングなどのエージェントの不正な動作を軽減できます。

コミュニティと業界の視点

業界のオブザーバーや開発者は、DSecとGoogleのAxプロジェクトの類似性を指摘しており、エージェントAIに必要なインフラストラクチャの並行的な進化を示唆しています。コミュニティの議論では、コアあたり12個のサンドボックスという比率が特に印象的であると指摘されており、運用の規模が強調されています。

"Within one scale unit, the platform spans nearly 160 CPU nodes with 30K cores and ∼250 TB of DRAM... peak concurrency reaching ∼380K and a creation rate exceeding 5,000 instances per second." — @handle

さらに、セキュリティ専門家は、モデルの能力が向上するにつれて、モデルが環境から脱出するのを防ぐ安全で分離されたサンドボックスの必要性が、安全なAI展開のための重要な要件になりつつあると強調しています。

Sources

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト