Seedance 2.5 릴리스 노트: 장편 스토리텔링 및 멀티모달 참조
Seedance 2.5는 AI 비디오를 클립 생성에서 완전한 창의적 워크플로우로 전환합니다
ByteDance는 공식적으로 Seedance 2.5를 출시했습니다. 이는 짧은 클립 생성을 넘어 완전한 창작물의 생산으로 나아가도록 설계된 차세대 비디오 생성 모델입니다. Seedance 2.0의 통합 멀티모달 오디오-비디오 공동 생성 아키텍처를 기반으로 구축된 버전 2.5는 장편 스토리텔링, 멀티모달 참조, 정밀 편집 기능에서 상당한 돌파구를 도입했습니다.
30초 단일 패스 생성 및 다중 라운드 확장
Seedance 2.5는 단일 패스 비디오 생성 용량을 15초에서 30초로 확장합니다. 이전 모델이 종종 단일 순간을 확장했던 것과 달리, Seedance 2.5는 단일 생성 내에서 여러 논리적으로 연결된 샷을 조직하여 설정, 발전, 전환점, 결말을 특징으로 하는 내러티브 아크를 만들 수 있습니다.
장편 스토리텔링의 주요 기능에는 다음과 같은 것이 포함됩니다:
- 다중 라운드 확장: 사용자는 캐릭터, 환경, 내러티브 페이스의 일관성을 유지하면서 기존 출력에 후속 샷을 추가하여 멀티분 콘텐츠를 만들 수 있습니다.
- 향상된 연속성: 모델은 카메라 움직임 간의 전환을 더 부드럽게 만들고 컷 간 주제의 안정성을 유지합니다.
- 시네마틱 최적화: AI 비디오의 "인공적" 느낌을 줄이기 위해 모델은 객체 텍스처, 피부 및 눈 특징, 조명, 채도 포화도를 최적화합니다.
고급 멀티모달 참조를 통한 창의적 제어
Seedance 2.5는 단일 패스에서 최대 30개의 이미지, 10개의 비디오 클립, 10개의 오디오 클립까지 대량의 참조 자료를 허용합니다. 이를 통해 모델은 여러 주제와 샷 변경이 포함된 복잡한 장면에서 창작자의 의도를 더 잘 포착할 수 있습니다.
특정 참조 돌파구에는 다음이 포함됩니다:
- 캐릭터 및 장면 안정성: 모델은 그룹 스토리텔링 시나리오에서도 여러 캐릭터의 외모와 목소리를 동시에 유지할 수 있습니다.
- 클레이 렌더 참조: 사용자는 텍스처가 없는 3D 모델을 사용하여 공간 구조, 캐릭터 포즈, 움직임 경로, 카메라 각도를 정의할 수 있습니다. 모델은 이러한 구조를 최종 비디오로 렌더링하여 정확한 블로킹과 구성을 보장합니다.
- 물리적 조명 제어: 클레이 렌더의 공간 정보를 활용하여 모델은 방향, 색온도, shadow projection을 포함한 물리 법칙을 따르는 조명 효과를 생성합니다.
타임스탬프 수준 편집 및 전문 도구
Seedance 2.5는 반복 생성 비용을 줄이고 창의적 효율성을 높이기 위한 정밀 편집 기능을 도입합니다.
- 타임스탬프 제어: 사용자는 생성 중에 특정 시간 프레임에 대한 내러티브, 카메라 perspectiva, 리듬을 프롬프트로 제어할 수 있습니다. 생성 후, 특정 클립 내의 캐릭터 또는 플롯 요소에 대한 타겟 수정을 연속성을 유지하면서 수행할 수 있습니다.
- 그린 스크린 편집: 모델은 배경을 교체하면서 주요 대상은 그대로 유지하여, 대상가 새로운 환경의 물리 규칙에 어떻게 반응하는지 시뮬레이션할 수 있습니다(예: 머리카락 움직임 및 조명 상호작용).
- 카메라 perspectiva 편집: 사용자는 캐릭터나 행동을 변경하지 않고 기존 클립에서 카메라 움직임(예: FPV 이동 또는 휘팬)을 조정할 수 있습니다.
교육 및 제조 분야의 산업 응용
오락 외에도 Seedance 2.5는 특수 생산 워크플로에 통합되고 있습니다:
- 교육: 모델은 Doubao Learning 앱과 같은 플랫폼을 통해 역사적 맥락과 과학 원리를 교육용 비디오의 몰입형 시각으로 변환합니다.
- 산업 제조: Seedance 2.5는 로봇 percep와 조작 기술을 훈련하기 위한 합성 비디오 데이터를 생성하고, 클레이 렌더로부터 고급 포토리얼리스틱 어셈블리 시퀀스를 만듭니다.
- 자율 주행: 모델은 극한 날씨와 복잡한 교통과 같은 "롱테일" 시나리오를 시뮬레이션하여 자율 시스템을 위한 다양한 훈련 샘플을 제공합니다.
커뮤니티 인사이트 및 비판적 관점
Seedance 2.5의 기술적Capabilities이 칭찬을 받았음에도 불구하고, Hacker News에서의 커뮤니티 토론은 여러 논란점과 관찰을 강조합니다:
기술 및 미적 비판
일부 사용자는 높은 품질에도 불구하고 비디오가 여전히 "AI-like" 특성을 보인다고 지적했습니다. 예를 들어, 비자연적인 얼굴 표현이나 발언 후 캐릭터가 어색하게 멈추는 경향 등이 있습니다. 한 사용자는 출력이 비자연적인 움직임이 가끔 애니메이션처럼 보이는 "플래시 컷 샐러드"라고 설명했습니다.
시장 포지셔닝
관찰자들은 ByteDance의 고액션 및 특수 효과 샷에 대한 집중이 시각적 스펙터클을 선호하는 중국 영화 시장의 특정 요구를 반영한다고 제안했습니다. 이는 서양 영화 제작자들이 자주 언급하는 대화 중심의 퍼포먼스 캡처(v2v) 요구와는 다릅니다.
접근성 및 비용
사용자들은 Seedance 2.5가 이전 버전보다 훨씬 비싸다고 보고했으며, 일부는 Dreamina 플랫폼에서 30초 생성 비용이 약 $15(1440 크레딧)라고 추정했습니다.
"품질은 꽤 높지만, 이 모델들의 방향이 중국 vs 서양의 사용 수요와 크게 연관되어 있다는 관찰이 있습니다. 구체적으로, 그들은 액션/고효과 샷에 대한 t2v에 immensely 집중하고 있습니다."}
가용성
Seedance 2.5는 현재 Jimeng AI와 Doubao Pro에서 점진적으로 출시되고 있습니다. API 액세스는 BytePlus ModelArk를 통해 출시될 예정입니다.