chengyi-ai/native-subtitle-quote-image

保留视频内嵌字幕,精确取帧并生成 3:4 社交长图的 Agent Skill

解决的问题

该项目自动化生成高质量的3:4社交媒体引用图片,从视频帧中提取内容。它解决了手动截取、裁剪和格式化视频字幕以适应Instagram或X等平台的视觉美观布局的难题,确保生成的图片保持专业、紧凑的视觉风格,避免不自然的间距或过大的字幕条。

工作原理

该工具作为一项「代理技能」运行,可集成到AI代理中。它通过帧提取、字幕定位和渲染的流程,处理本地视频或在线视频(通过 yt-dlp)。提供两种不同模式:

  • 原生模式:保留视频的原始像素,捕获已“烧录”到帧中的字幕。不进行OCR或重绘。
  • 脚本模式:将JSON脚本中验证过的文本渲染到真实视频帧上,明确标记为后期制作字幕。

系统使用 Pillow 进行图像操作,使用 FFmpeg(通过 imageio-ffmpeg)进行精确的帧提取。包含一个布局引擎,可根据提供的行数自动调整主图像与字幕条之间的比例。

适用人群

  • 希望将视频亮点转化为可分享引用卡片的内容创作者和社交媒体经理。
  • 希望为其代理添加视频转图像处理能力的AI代理开发者。
  • 需要为视频叙事保持一致、紧凑视觉风格的用户。

核心亮点

  • 双字幕模式:严格区分原生烧录字幕与脚本生成的叠加字幕,确保真实性。
  • 代理就绪:作为即插即用的技能提供,适用于兼容的AI代理(如 Codex)。
  • 自动化工作流:支持从 yt-dlp 获取URL到最终视觉质量保证(QA)的全流程。
  • 紧凑布局引擎:实现特定设计规则,最大化主图像的突出性,最小化字幕条之间的空白空间。

相关

  • 项目
  • 项目
  • 项目
  • 项目