Gemini Omni: Google DeepMind의 멀티모달 비디오 생성으로의 도약
생성형 AI의 지형은 정적인 이미지 생성에서 동적이고 제어 가능한 비디오 합성으로 이동하고 있습니다. Google DeepMind의 최신 출시작인 Gemini Omni는 추론과 생성 사이의 간극을 메우기 위한 중요한 시도를 나타냅니다. 텍스트-비디오 생성에 주로 집중했던 이전 모델들과 달리, Gemini Omni는 사용자가 "anything from anything"을 생성할 수 있도록 하는 멀티모달 크리에이티브 엔진으로 자리매김하고 있으며, 반복적이고 대화형인 비디오 편집에 큰 비중을 두고 있습니다.
Gemini Omni의 핵심은 비디오를 일회성 결과물이 아닌, 살아있는 프로젝트로 취급하도록 설계되었다는 점입니다. Gemini의 추론 능력과 고급 생성형 비디오 도구를 통합함으로써, 사용자가 환경, 동작 또는 미학적 요소의 특정 부분을 변경하면서 장면의 일관성을 유지하며 단계별로 자신의 비전을 구체화할 수 있는 워크플로우를 가능하게 합니다.
Gemini Omni의 핵심 역량
Gemini Omni는 AI가 비디오 데이터 및 사용자의 의도와 상호작용하는 방식에 있어 몇 가지 혁신을 도입합니다:
대화형 반복 편집
완벽한 결과를 얻기 위해 단 하나의 복잡한 프롬프트에 의존하는 대신, Gemini Omni는 자연스러운 다회차 대화(multi-turn conversations)를 허용합니다. 사용자는 전체 샷의 일관성을 잃지 않으면서 장면을 구축하고 카메라 각도를 변경하거나 특정 객체를 보이지 않게 만드는 등의 미세 조정을 할 수 있습니다. 이러한 "Nano Banana for video" 방식은 AI를 단순한 생성기에서 협업 편집기로 변모시킵니다.
멀티모달 참조
Omni의 가장 강력한 기능 중 하나는 여러 입력 유형을 하나의 출력으로 합성하는 능력입니다. 사용자는 다음과 같은 요소를 제공할 수 있습니다:
- Images: 스케치나 사진을 구조적 또는 스타일적 가이드로 사용.
- Video: 한 클립에서 동작이나 관점(perspective)을 다른 캐릭터나 환경으로 전송.
- Audio: 트랙의 비트에 맞춰 시각적 변화를 동기화하거나 특정 화면상의 동작에 의해 트리거되는 사운드 효과를 추가.
- Text: 복잡한 서사적 변화를 지시하거나 동기화된 화면 텍스트를 추가.
세계 지식 및 물리 법칙 통합
DeepMind는 Gemini Omni가 물리 법칙(중력, 유체 역학, 운동 에너지)과 실세계 지식(역사, 과학, 수학)에 대한 직관적인 이해를 활용하여 더 믿을 수 있는 장면을 생성한다고 주장합니다. 이는 단백질 구조를 설명하는 클레이메이션(claymation)부터 복잡한 marble-run 시뮬레이션에 이르기까지 다양한 예시를 통해 입증됩니다.
기술적 비판 및 실세계의 한계
홍보 자료는 매끄러운 경험을 제시하지만, Hacker News의 기술 커뮤니티는 모델의 현재 상태에 관한 몇 가지 비판적인 지점을 제기했습니다.
"물리"의 간극
실세계의 물리 법칙을 따른다는 주장에도 불구하고, 일부 사용자는 데모에서 눈에 띄는 오류를 발견했습니다. 한 관찰자는 marble rolling 비디오에서 구슬이 가끔 "이유 없이 위로 튀어 오르거나" 에너지원 없이 가속화되는 것을 지적했습니다. 또 다른 개발자는 강체 시뮬레이션(rigid body simulations) 전문가로서, 젠가(Jenga) 타워가 무너지는 것과 같이 벽돌이 붕괴 과정에서 형태가 변하거나 사라지는 불연속적인 물리 현상을 모델이 여전히 어려워한다는 점을 언급했습니다.
공간 이해력
비판가들은 모델이 깊은 공간 이해력이 부족하다고 주장합니다. 한 사용자는 객체가 시야에서 벗어났다가 다시 나타날 때 기하학적 구조가 자주 변한다는 점을 지적하며, 이는 모델이 3D 공간의 구조적 이해보다는 "예쁜" 픽셀을 우선시한다는 것을 시사합니다. 이는 훈련 방법론이 너무 광범위하여 인간 예술가가 사용하는 계층적 학습(composition $\rightarrow$ perspective $\rightarrow$ light)이 부족하다는 제안으로 이어졌습니다.
성능 및 접근성
초기 사용자들은 출시 과정에서 상당한 마찰을 겪었습니다. 사용량 제한으로 인해 일부 사용자는 모델을 시도해 볼 수도 없었으며, 랜딩 페이지의 자동 재생 비디오의 과도한 사용으로 인해 브라우저가 충돌하는 현상도 보고되었습니다. Additionally, 일부 사용자는 Gemini Omni Flash를 경쟁 모델인 Seedance 2.0와 비교했을 때 원시 출력 품질 측면에서 불리하게 평가했습니다.
더 넓은 영향: 윤리 및 산업
Gemini Omni와 같은 도구의 등장은 디지털 진위성(authenticity)과 창작 예술에 대한 더 넓은 비판적 논의를 불러일으킵니다.
"So it's really good, and we have reason to believe, never again, anything that happens in a video. 비디오에서 일어나는 일은 다시는 믿을 수 없게 될 것입니다. 인증할 수 있는 슈퍼-프로덕트가 어디선가 나타나지 않는 한 말이죠."
이에 대응하기 위해, Google은 AI 생성 콘텐츠가 검증될 수 있도록 Omni의 출력물에 SynthID 디지털 워터마킹과 C2PA Content Credentials를 통합했습니다. Google은 디지털 진위성(authenticity)을에 대한 논의가 지속되고자 합니다.
결론
Gemini Omni는 상상력과 고해상도 비디오 생성 사이의 장벽이 사실상 존재하지 않는 미래를 향를한 하나의 대담한 단계입니다. 멀티모달 합성 및 대화형 제어 기능은 뛰어나지만, 여전히 생성형 AI의 고전적인 난제인 엄격한 물리 법칙 준수 및 진정한 공간 일관성 유지라는 과제에 직면해 있습니다. 이 모델이 연구실의 돌파구에서 Google Flow와 YouTube Shorts의 크리에이터를 위한 도구로 이동함에 따라, 초점은 "비디오를 생성할 수 있는가"에서 "세상의 구조적 무결성을 유지할 수 있는가"로 이동할 것 같습니다.