jd-opensource/JoyAI-VL-Interaction

JoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System

해결하는 문제

대부분의 AI 모델은 턴 기반으로 동작하여 사용자 프롬프트를 받은 후에야 응답합니다. JoyAI-VL-Interaction은 시각-언어 모델이 장면에 "존재"하도록 만들어, 비디오 스트림을 지속적으로 감시하고 언제 말할지, 침묵할지, 또는 복잡한 작업을 다른 에이전트에게 위임할지를 적극적으로 결정함으로써 이 문제를 해결합니다. 이를 통해 사용자 트리거 없이 실시간 이벤트 기반의 상호작용이 가능해집니다.

작동 방식

이 시스템은 8B 규모의 시각 우선 모델(JoyAI-VL-8B)을 기반으로 하며, 시각 입력을 바탕으로 1초마다 결정을 내립니다. 예측 가능한 프레임에는 적은 토큰을, 장면 전환에는 많은 토큰을 사용하는 예측형 비디오 코덱인 AdaCodec을 사용하여 토큰 예산을 관리합니다. 모델은 400만 개 이상의 시간 동기화된 상호작용 샘플로 훈련되었으며 강화 학습을 통해 개선되었습니다. 전체 배포 스택에는 추론, 스트리밍용 WebUI, ASR(음성 인식), TTS(음성 합성), 그리고 작업 위임을 위한 백그라운드 에이전트 등 5개의 플러그인 서비스가 포함되어 있습니다.

대상 사용자

실시간 AI 어시스턴트, 모니터링 시스템, 또는 프로액티브한 시각 인식과 1초 미만의 응답 시간이 필요한 인터랙티브 비디오 애플리케이션을 개발하는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 실시간 존재감: 시각 이벤트에 1초 미만으로 응답 가능.
  • 시각 트리거 기반 프로액티브성: 프롬프트를 기다리지 않고 보는 내용에 따라 대화를 시작할 수 있음.
  • 에이전트 위임: 어려운 하위 작업을 백그라운드 모델이나 API에 위임하면서도 스트림 모니터링을 계속할 수 있음.
  • 오픈 스택: 모델 가중치, 훈련 레시피, 시간 동기화된 상호작용 데이터, 완전한 배포 가능한 시스템을 제공.
  • 통합된 기능: 실시간 스트리밍 상호작용과 오프라인 비디오 이해를 모두 처리할 수 있는 단일 모델.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch