Seedance 2.5 リリースノート: 長編ストーリーテリングとマルチモーダル参照
Seedance 2.5はAIビデオをクリップ生成から完全なクリエイティブワークフローへシフト
ByteDanceは公式にSeedance 2.5を発表しました。これは次世代のビデオ作成モデルで、短いクリップの生成から完全なクリエイティブ作品の制作へと進化させることを目的としています。Seedance 2.0の統合マルチモーダルオーディオビデオ共同生成アーキテクチャに基づいて構築され、バージョン2.5は長編ストーリーテリング、マルチモーダル参照、および正確な編集機能において重要なブレークスルーをもたらします。
30秒シングルパス生成とマルチラウンド拡張
Seedance 2.5はシングルパスビデオ生成の容量を15秒から30秒に拡張します。以前のモデルがしばしば単一の瞬間を延長していたのに対し、Seedance 2.5は単一の生成内で論理的に結びついた複数のショットを組織し、設定、展開、転換点、解決を含むナラティブアークを作成できます。
長編ストーリーテリングにおける主要な機能には以下が含まれます:
- マルチラウンド拡張: ユーザーは既存の出力に後続のショットを追加し、キャラクター、環境、ナラティブペースの一貫性を保ちながら、マルチミニットコンテンツの作成を可能にします。
- 継続性の向上: モデルはカメラ移動間のトランジションを滑らかにし、カット間での被写体の安定性を維持します。
- シネマティック最適化: AIビデオの「人工的」な外観を減らすため、モデルはオブジェクトのテクスチャ、肌と目の特徴、照明、および彩度を最適化します。
クリエイティブコントロールのための高度なマルチモーダル参照
Seedance 2.5はシングルパスで大量の参照素材を許容します―最大30枚の画像、10本のビデオクリップ、および10本のオーディオクリップ。これにより、複数の被写体とショット変更を含む複雑なシーンにおいて、クリエイターの意図をより正確に捉えることができます。
具体的な参照ブレークスルーには以下が含まれます:
- キャラクターとシーンの安定性: モデルはグループストーリーテリングシナリオでも、複数のキャラクターの外観と声を同時に保持できます。
- クレイレンダー参照: ユーザーはテクスチャレスの3Dモデルを使用して空間構造、キャラクターのポーズ、動きのパス、およびカメラアングルを定義できます。モデルはこれらの構造を最終ビデオにレンダリングし、正確なブロッキングと構図を確保します。
- 物理的照明コントロール: クレイレンダーからの空間情報を活用することで、モデルは方向、色温度、シャドウ投影を含む照明効果を物理法則に従って生成します。
タイムスタンプレベル編集とプロフェッショナルツール
Seedance 2.5は反復生成のコストを削減し、クリエイティブ効率を向上させる正確な編集機能を導入します。
- タイムスタンプコントロール: ユーザーはプロンプトを使用して、生成中の特定の時間枠におけるナラティブ、カメラ視点、およびリズムを制御できます。生成後、特定のクリップ内のキャラクターまたはプロット要素に対してターゲットを絞った修正を加えることができ、継続性を維持します。
- グリーンスクリーン編集: モデルは被写体を保持したまま背景を置き換えることができ、新しい環境の物理法則に従って被写体がどのように反応するかをシミュレートします(例:髪の動きと照明の相互作用)。
- カメラパースペクティブ編集: ユーザーは既存のクリップ内のカメラ動作(FPVムーブやウィップパンなど)をキャラクターやアクションを変更せずに調整できます。
教育と製造における業界応用
エンターテイメントを超えて、Seedance 2.5は専門的な制作ワークフローに統合されています:
- 教育: モデルはDoubao Learningアプリなどのプラットフォームを通じて、歴史的背景と科学的原則を没入型ビジュアルに変換し、指導ビデオを作成します。
- 産業製造: Seedance 2.5はロボットの知覚と操作スキルを訓練するための合成ビデオデータを生成し、クレイレンダーから高品質なフォトリアリスティックな組み立てシーケンスを作成します。
- 自動運転: モデルは極端な天候や複雑な交通などの「ロングテール」シナリオをシミュレートし、自律システムのための多様なトレーニングサンプルを提供します。
コミュニティの洞察と批判的視点
Seedance 2.5の技術的能力は称賛されていますが、Hacker Newsでのコミュニティディスカッションではいくつかの争点と観察が指摘されています:
技術的および美的批判
一部のユーザーは、高品質であるにもかかわらず、ビデオがまだ「AIらしい」特徴を示していることに気付きました。例えば、不自然な顔の表情や、話した後にキャラクターがぎこちなく停止する傾向があります。あるユーザーは、出力が不自然な動きを伴う「フラッシュカットサラダ」であり、時にアニメのように見えると述べました。
市場ポジショニング
観察者は、ByteDanceがハイアクションと特殊効果ショットに焦点を当てているのは、視覚的スペクタクルを好む中国映画市場の特定の需要を反映していると指摘しています。これは、西洋の映画製作者がしばしば挙げる対話重視のパフォーマンスキャプチャ(v2v)の需要とは対照的です。
アクセシビリティとコスト
ユーザーは、Seedance 2.5が以前のバージョンよりもはるかに高価であると報告しており、一部ではDreaminaプラットフォームでの30秒生成が約15ドル(1440クレジット)かかると見積もっています。
"品質はかなり高いですが、観察されるのは、これらのモデルの方向性が中国と西洋の使用需要に大きく関連しているということです。具体的には、彼らはアクション/ハイエフェクトショットのためのt2vに immensely 集中しています。"
利用可能状況
Seedance 2.5は現在Jimeng AIとDoubao Proで段階的に展開されています。APIアクセスはBytePlus ModelArkを介してリリースされる予定です。