chengyi-ai/native-subtitle-quote-image

保留视频内嵌字幕,精确取帧并生成 3:4 社交长图的 Agent Skill

解決的問題

本專案自動化生成高品質的3:4社交媒體引用圖片,從影片幀中提取內容。它解決了手動截取、裁切和格式化影片字幕,以適應Instagram或X等平台視覺美觀佈局的難題,確保生成的圖片保持專業、緊湊的視覺風格,避免不自然的間距或過大的字幕條。

工作原理

該工具作為一項「代理技能」運行,可整合到AI代理中。它透過幀提取、字幕定位和渲染的流程,處理本機影片或線上影片(透過 yt-dlp)。提供兩種不同模式:

  • 原生模式:保留影片的原始畫素,捕獲已「燒錄」到幀中的字幕。不進行OCR或重繪。
  • 腳本模式:將JSON腳本中驗證過的文字渲染到真實影片幀上,明確標記為後期製作字幕。

系統使用 Pillow 進行影像操作,使用 FFmpeg(透過 imageio-ffmpeg)進行精確的幀提取。包含一個佈局引擎,可根據提供的行數自動調整主影像與字幕條之間的比例。

適用對象

  • 希望將影片亮點轉化為可分享引用卡片的內容創作者與社群媒體經理。
  • 希望為其代理添加影片轉影像處理能力的AI代理開發者。
  • 需要為影片敘事保持一致、緊湊視覺風格的使用者。

核心亮點

  • 雙字幕模式:嚴格區分原生燒錄字幕與腳本生成的疊加字幕,確保真實性。
  • 代理就緒:作為即插即用的技能提供,適用於相容的AI代理(如 Codex)。
  • 自動化工作流程:支援從 yt-dlp 取得URL到最終視覺品質保證(QA)的全流程。
  • 緊湊佈局引擎:實現特定設計規則,最大化主影像的突出性,最小化字幕條之間的空白空間。

相關

  • 專案
  • 專案
  • 專案
  • 專案