Invideo AI와 OpenAI 모델 통합

Invideo AI는 OpenAI 모델군을 통합하여 자연어 프롬프트만으로도 전문 품질의 비디오를 제작할 수 있게 하였으며, 제작 시간을 하루에서 30분 이하로 단축했습니다. 이 시스템은 전통적인 수동 타임라인과 복잡한 소프트웨어를 대체하고, 기획, 스크립팅, 자산 생성 등을 담당하는 AI 기반 오케스트레이션 레이어를 제공합니다.

다중 에이전트 비디오 제작 아키텍처

Invideo AI는 다중 에이전트 시스템을 활용하여 특정 OpenAI 모델을 제작 워크플로의 개별 역할에 할당함으로써 각 작업에 최적의 창의적 결과를 보장합니다:

  • OpenAI o3: 플래너이자 오케스트레이터 역할을 합니다. 콘텐츠의 목적, 톤, 대상 플랫폼을 고려하여 전체 창의적 계획을 수립하고 워크플로를 조정합니다.
  • GPT-4.1: 내러티브를 구조화하고 다듬는 역할을 담당하며, 창의적 계획을 최적화된 페이싱과 톤을 갖춘 스크립트로 변환합니다.
  • Search-augmented GPT models: 스크립트를 최신 컨텍스트와 관련 인사이트로 풍부하게 만들기 위해 연구를 수행합니다.
  • Moderation API: 콘텐츠 전략가 역할을 하여 자료를 안전성, 톤, 브랜드 및 플랫폼 기준에 맞는지 검토합니다.
  • gpt-image-1: 브랜드 자산, 컷어웨이 비주얼 및 배경을 생성합니다.
  • OpenAI text-to-speech: 다양한 언어와 톤으로 인간과 같은 내레이션을 제공합니다.

플랫폼별 최적화

시스템은 사용자가 자연어 명령을 통해 특정 청중 및 플랫폼에 맞게 콘텐츠를 최적화할 수 있게 합니다. 예를 들어, TikTok용 "hook"을 요청하면 GPT-4.1이 페이싱과 톤을 조정하고, text-to-speech와 gpt-image-1 모델은 각각 보이스오버를 미세 조정하고 고전환 시각 자료를 선택합니다.

이 오케스트레이션을 통해 특정 포맷과 성과 목표에 맞춘 완전한 콘텐츠 전략을 제작할 수 있으며, 예를 들어 도시 통근자를 대상으로 하는 제품 광고의 음악과 이미지를 조정하는 것이 가능합니다.

비즈니스 영향 및 규모

Invideo AI는 현재 5천만 명 이상의 사용자를 지원하며, 이들은 매월 700만 개 이상의 비디오(짧은 형식 콘텐츠, 설명 영상, 광고 등)를 제작합니다. 제작 과정을 자동화함으로써 사용자는 제작 시간을 10배 줄였다고 보고했으며, 일부 사용자는 전문 수준의 창의적 결과물 덕분에 매출이 두 배로 증가했습니다.

"OpenAI의 모델은 우리가 구축하는 방식의 기반입니다," 라고 invideo AI의 공동 창업자이자 CEO인 Sanket Shah가 말했습니다. "이 모델들은 사용자에게 전문 품질의 비디오를 제공하고 전통적인 한계를 뛰어넘게 합니다."

향후 개발

Invideo AI는 OpenAI 모델 출시와 일치하도록 제품 로드맵을 발전시킵니다. 팀은 새로운 모델 반복이 의사결정 속도, 페이싱, 톤 판단 및 오디오·비주얼 자산의 현실성을 어떻게 향상시킬 수 있는지 지속적으로 평가합니다.

Sources