nicklashansen/dreamer4
Unofficial implementation of the Dreamer 4 world model in PyTorch.
解決する課題
このプロジェクトは、Dreamer 4世界モデルの非公式なPyTorch実装を提供し、研究者が環境のダイナミクスを予測するためのスケーラブルなアーキテクチャを実験・拡張できるようにします。元の論文はMinecraftにおける離散的なアクションに焦点を当てていましたが、この実装では、複数のタスクにわたる連続制御用にモデルを適応させています。
仕組み
Dreamer 4は、主に2つのコンポーネントに分割されたブロック因果トランスフォーマーアーキテクチャを利用しています:
- Causal Tokenizer: 画像パッチと潜在トークンをエンコードし、低次元の投影を通じて圧縮することで、フレームを逐次的にデコードできるようにします。
- Interactive Dynamics Model: アクション、ノイズレベル、ステップサイズ、およびトークナイザーの表現のシーケンス上で動作し、ショートカット強制目的関数を使用して表現のノイズを除去します。
対象者
世界モデル、強化学習、および連続制御タスクに取り組んでいるAI研究者や開発者、特にJAXよりもPyTorchを好む方向けに設計されています。
ハイライト
- マルチタスク対応: DMControlとMMBenchの30の連続制御タスクでトレーニング済み。
- 包括的なデータセット: エキスパートデータおよび混合品質データの7,200の軌跡(360万フレーム)を含む。
- インタラクティブなインターフェース: トレーニングされた世界モデルとリアルタイムで対話するためのウェブベースのUIを提供。
- すぐに使えるチェックポイント: HuggingFace経由で、事前トレーニング済みのトークナイザーとダイナミクスモデルの重きを提供。
関連
- プロジェクト
AMAP-ML/DreamX-WorldDreamX-Worldは、イベントプロンプトを通じてユーザーが環境を探索・変換できる高精細で制御可能なシミュレーションを生成する汎用的なインタラクティブな世界モデルです。
- プロジェクト
next-state/open-dreamerOpen Dreamer は JAX/Flax による Dreamer 4 世界モデルパイプラインの実装で、Minecraft プレイ動画データ上で動画トークナイザーとアクション条件付き潜在動力学モデルのトレーニングコードを提供し、ロールアウト生成と FVD 評価のツールも含む。ライブブラウザデモと、トレーニング済みチェックポイントを実行するための別途推論リポジトリも提供している。
- プロジェクト
sooftware/conformerCNNとTransformerを組み合わせ、局所的および大域的な音声依存関係を捉えることで音声認識を向上させるConformerアーキテクチャのPyTorch実装。
- プロジェクト
johnmarktaylor91/torchlensTorchLens is a Python library for capturing, visualizing, and intervening on the full computational graph of any PyTorch model (and preview support for other frameworks). It records every activation and gradient, provides rich per‑operation metadata, lets you query or filter tensors, draw PDF graphs, compute receptive/projective fields, and replay or modify the graph for “what‑if” experiments. The tool is validated on >11 600 architectures, with ~89 % algorithmically verified for faithful capture.
- プロジェクト