jd-opensource/JoyAI-VL-Interaction
JoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System
解决的问题
大多数AI模型都是回合制的,意味着只有在收到用户提示后才会响应。JoyAI-VL-Interaction通过创建一个‘在场’的视觉语言模型来解决这一问题——它持续监控视频流,并主动决定何时发言、保持沉默,或将复杂任务委派给其他智能体,从而实现无需用户触发的实时、事件驱动的交互。
工作原理
该系统基于一个8B规模的视觉优先模型(JoyAI-VL-8B),每秒根据视觉输入做出决策。它使用一种名为AdaCodec的预测性视频编码器,通过在可预测帧上减少token消耗、在场景变化时增加token消耗来管理token预算。该模型在超过四百万个时间对齐的交互样本上进行训练,并通过强化学习进行优化。完整的部署栈包含五个可插拔服务:推理服务、用于流媒体的WebUI、ASR(语音识别)、TTS(语音合成),以及用于任务委派的后台智能体。
适用人群
本项目适用于开发实时AI助手、监控系统或需要主动视觉感知和亚秒级响应时间的交互式视频应用的开发者和研究人员。
核心亮点
- 实时在场:能够在不到一秒内响应视觉事件。
- 视觉触发的主动性:可根据所见内容主动发起对话,而无需等待用户提示。
- 智能体委派:可在继续监控流的同时,将复杂子任务交由后台模型或API处理。
- 开源架构:提供模型权重、训练配方、时间对齐的交互数据以及完整的可部署系统。
- 统一能力:单一模型即可同时处理实时流交互与离线视频理解。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch