chengyi-ai/native-subtitle-quote-image

保留视频内嵌字幕,精确取帧并生成 3:4 社交长图的 Agent Skill

何を解決するか

このプロジェクトは、動画フレームから高品質な3:4のソーシャルメディア引用画像を自動生成します。InstagramやXなどのプラットフォーム向けに、手動でキャプチャ・クロップ・フォーマットする作業を省き、視覚的に魅力的なレイアウトを保ちつつ、不自然な余白や巨大な字幕バーを回避するプロフェッショナルでコンパクトなスタイルを実現します。

動作方法

このツールはAIエージェントに統合可能な「エージェントスキル」として動作します。ローカル動画またはオンライン動画(yt-dlp経由)を、フレーム抽出 → 字幕位置調整 → レンダリングというワークフローで処理します。2つの異なるモードを提供します:

  • ネイティブモード:動画の元のピクセルを保持し、すでにフレームに焼き込まれた字幕をそのまま利用。OCRや再描画は行いません。
  • スクリプトモード:JSONスクリプトから検証済みのテキストを実際の動画フレームにレンダリングし、後処理による字幕であることを明確にします。

システムは画像操作に Pillow、正確なフレーム抽出には FFmpegimageio-ffmpeg を介して)を使用。提供された行数に応じて、メイン画像と字幕バーの比率を自動調整するレイアウトエンジンを備えています。

対象ユーザー

  • 動画のハイライトを共有可能な引用カードに変換したいコンテンツクリエイターおよびソーシャルメディアマネージャー。
  • エージェントに動画から画像への処理機能を追加したいAIエージェント開発者。
  • 動画ベースのストーリーテリングに一貫性のあるコンパクトなビジュアルスタイルが必要なユーザー。

特徴

  • 二重字幕モード:ネイティブな焼き込み字幕とスクリプトベースのオーバーレイを厳密に分離し、本物性を維持。
  • エージェント対応:Codex などの互換性のあるAIエージェントで即時利用可能なスキルとして提供。
  • 自動ワークフローyt-dlp によるURL取得から最終的なビジュアル品質保証(QA)までをサポート。
  • コンパクトレイアウトエンジン:メイン画像の強調と字幕バー間の無駄なスペースを最小限に抑える特定のデザインルールを実装。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト