Gemini Omni Flash 출시

Gemini Omni Flash 출시

Google DeepMind은 고품질 비디오의 생성 및 대화형 편집을 가능하게 하는 네이티브 멀티모달 모델인 Gemini Omni Flashを発表했습니다. 이 모델은 Gemini의 추론 능력과 창의적 생성을 통합하여, 사용자가 실제 세계 지식과 물리법칙에 기반한 비디오 콘텐츠를 제작할 수 있도록 합니다.

대화형 비디오 편집

Gemini Omni Flash는 이전 턴을 기반으로 하는 자연어 지시를 사용하여 사용자가 비디오를 편집할 수 있게 합니다. 이 모델은 여러 번의 편집에 걸쳐 캐릭터, 물리법칙, 장면 연속성의 일관성을 유지합니다.

  • 환경 변형: 사용자는 비디오 내 특정 요소 또는 전체 세계를 변경할 수 있습니다(예: 조각품을 거품으로 변환).
  • 행동 재이미지화: 모델은 기존 행동을 수정하고, 새로운 캐릭터나 객체를 추가하거나, 기록된 비디오 내 특정 순간을 변환할 수 있습니다.
  • 반복적 개선: 사용자는 원본 장면의 맥락을 잃지 않고 다중 턴 대화를 통해 환경, 카메라 각도, 스타일 또는 특정 세부 사항을 조정할 수 있습니다.

지식 기반 비디오 생성

Gemini Omni Flash는 Gemini의 내부 역사, 과학, 문화적 맥락 지식을 활용하여 단순한 패턴 매칭을 넘어 의미 있는 스토리텔링으로 나아갑니다.

  • 향상된 물리학: 모델은 운동 에너지, 중력, 유체 역학에 대한 직관적인 이해를 보여 주어, 연쇄 반응 트랙 위에서 구슬이 굴러가는 것과 같은 보다 현실적인 움직임을 생성합니다.
  • 복잡한 시각적 설명자: Omni는 짧은 프롬프트로부터 교육용 콘텐츠를 생성할 수 있으며, 예를 들어 단백질 접힘을 설명하는 클레이메이션 스타일의 스톱모션 비디오가 있습니다.
  • 맥락 기반 창의성: 모델은 언어와 이미지를 결합하여 복잡한 지시를 따를 수 있으며, 예를 들어 특정 시각적 마커와 동반 음악이 있는 알파벳을 나타내는 26개 항목의 빠른 순서를 생성할 수 있습니다.

멀티모달 입력 통합

Gemini Omni Flash는 다음 입력들의 어떤 조합으로부터도 단일 통합된 비디오 출력을 합성할 수 있습니다:

  • 텍스트: 장면과 스타일에 대한 자연어 설명.
  • 이미지: 특정 비전과의 시각적 정렬을 보장하기 위한 캐릭터, 장면 또는 그림의 참조 이미지.
  • 비디오: 시작점 또는 스타일 참조로 사용되는 기존 비디오 클립.
  • 오디오: 출시 시 음성 참조가 지원되며, 향후 릴리스를 위해 다른 오디오 입력 유형이 계획되어 있습니다.

디지털 아바타 및 안전

개인화된 콘텐츠 제작을 가능하게 하기 위해, 사용자는 자신의 목소리를 사용하여 자신과 apariencia와 소리가 같은 비디오를 생성하는 아바타 기능을 활용할 수 있습니다.

책임감 있는 AI 개발을 보장하기 위해, Google은 다음과 같은 보호 조치를 구현했습니다:

  • SynthID 워터마킹: Gemini Omni가 생성한 모든 비디오는 AI 출처를 확인하기 위해 imperceptible(불가시) 디지털 워터마크를 포함합니다.
  • 검증 도구: 사용자는 Gemini 앱, Google Search, 그리고 Chrome의 Gemini를 통해 AI 생성 콘텐츠를 확인할 수 있습니다.
  • 제어된 오디오 편집: 비디오 내 오디오 및 음성을 편집하는 기능은 책임감 있는 배포를 보장하기 위해 현재 추가 테스트 중입니다.

가용성

Gemini Omni Flash는 다음 플랫폼으로 단계적으로 출시되고 있습니다:

  • 구독자: Google AI Plus, Pro, Ultra 전 세계 구독자는 Gemini 앱과 Google Flow를 통해 이용할 수 있습니다.
  • YouTube 사용자: 2026년 5월 17일 주부터 YouTube Shorts 및 YouTube Create 앱 사용자에게 무료로 단계적으로 제공됩니다.
  • 개발자: 개발자 및 기업 고객을 위한 API 접근은 앞으로 몇 주 내에 제공될 예정입니다.

Sources