Mr-funny/hbg-classical-poem-silk-video

Agent Skill for turning Chinese classical poems into vertical Chinese-art videos with ImageGen stills, Docker I2V, calligraphy captions, retained ambience, BGM and final MP4 QA.

何であるか

hbg‑classical‑poem‑silk‑video は、AI コーディングエージェント(Codex や Claude Code など)用の エージェントスキル(プラグイン)であり、中国古典詩を縦長(1080 × 1920)の「絹映像」と呼ばれる高品質な中国画風アニメーションに変換します。このスキルは詩を解析し、シーンに分割。内部の ImageGen モデルで静止した中国画風フレームを生成し、それらを Gemini ベースの 画像→動画(I2V)Docker コンテナ に供給。水の波紋、鳥、馬の足音などの動きを追加。筆跡風の字幕を重ね、AI 生成された環境音とオプションの背景音楽をミックス。最終的に QA チェック済みの MP4 を出力します。


どう入手するか

リポジトリにはコマンドラインから直接実行可能な install.sh スクリプトが含まれています。このスクリプトはユーザーのエージェント(Codex または Claude Code)を検出し、スキルファイルをエージェントのグローバル skills ディレクトリ(デフォルトは ~/.codex/skills/classical-poem-silk-video)にコピーします。ワンライナー例:

curl -fsSL https://raw.githubusercontent.com/Mr-funny/hbg-classical-poem-silk-video/main/install.sh | sh

手動でリポジトリをクローンし、skill/classical-poem-silk-video フォルダを適切な場所にコピーすることもできます。


スキルの実行方法

インストール後、自然言語でエージェントに指示します。例:

$classical-poem-silk-video を使って《枫桥夜泊》を制作する。
四句詩は一行一景にし、画面の色調を詩の意味に合わせて変化させる。カメラは固定し、月光、水紋、烏鴉、霜霧、漁火が画の中に自然に動くようにする。
AI 環境音を保持し、毛筆字が一文字ずつ出現。シーン間は自然なクロスフェードでつなぐ。

エージェントは以下の手順を実行します:

  1. 解析 – 詩の時代、季節、イメージ、感情の推移を特定。
  2. ストーリーボード作成 – 短い詩は1行1シーン、長い詩は2行1シーンで構成。
  3. 中国画スタイルの選択 – 詩の雰囲気に応じて墨絵、工筆、青緑、馬乗りなどから選択。
  4. 静止フレーム生成 – エージェント内蔵の ImageGen モデルを使用。縦書き字幕用の安全領域を確保。
  5. Gemini I2V Docker コンテナgemini-flow-suite)を呼び出し、フレームをアニメーション化。カメラは固定し、意図したオブジェクトのみを動かすように注意深くモーションプロンプトを設計。
  6. 字幕の追加 – Ma Shan Zheng ブラシフォントを使用(右列から左列へ)。文字ごとに出現。
  7. 音声ミキシング – モデル生成の環境音を保持。オプションでユーザー提供のBGMを重ね、クロスフェードと同期。
  8. クロスフェードトランジション(動画・音声両方)を適用し、最終的に QA スクリプトを実行。黒フレーム、音声ギャップ、正しいフレーム数、視覚的一貫性(例:余分な鳥、変形した馬の脚など)をチェック。

結果は、1080 × 1920、30 fps、H.264 + AAC の MP4 で、共有可能になります。


主な技術要素

コンポーネント 機能
詩解析器 時代、場所、季節、イメージ、行動、感情の変化を抽出。
ストーリーボードエンジン 行をグループ化(≤4行 → 1行1シーン;それ以上 → 2行1シーン)。
スタイルセレクター 墨絵、工筆、青緑、馬乗りなど、中国画のDNAを統一しつつスタイルを切り替え。
静止フレーム生成機 エージェント内蔵の ImageGen モデルを呼び出し、縦書き字幕用の安全領域を確保。
Docker I2V Gemini Flow Suite コンテナ(gemini-flow-suite)を実行し、局所的な動きを制御した短い動画クリップに変換。
モーションプロンプトテンプレート カメラ固定、局所的な動き領域、安定した終了、幻覚防止ルールの4段階プロンプト。絵の意図を歪めない。
字幕レンダラー SIL‑OFL Ma Shan Zheng ブラシフォントを使用。縦2段組、文字ごとの出現。
音声ミキサー モデル生成環境音を保持。ユーザー提供のBGMをオプションでミックスし、クロスフェードと同期。
最終QAスクリプト ffprobeffmpeg フィルタ(blackdetectsilencedetectvolumedetect)およびオプションのタイムスタンプ TSV を使用。動きの一貫性、フレームの整合性、エンコード仕様を検証。

どんな人に向いているか

  • SNS(Weibo、Douyin、Bilibili)向けにAI生成で文化的に正確な短い動画を作りたい コンテンツクリエイター
  • 古典詩のアニメーション図解を探している 教育者
  • マルチモーダル生成(テキスト → 画像 → 動画 → 音声)を実演できる準備済みスキルが必要な AIエージェント開発者
  • 制御された画像→動画生成のプロンプト工学に興味のある 研究者

ライセンスと準拠

  • すべてのスクリプト、スキル定義、ドキュメントは MIT ライセンス の下で公開。
  • 同梱された Ma Shan Zheng フォントは SIL Open Font License 1.1 の下で提供。
  • このスキルは、シークレットトークン、クッキー、ユーザー提供メディアを一切扱わない。ユーザーが提供する詩のテキストとオプションのBGMのみを処理。

クイックスタートチェックリスト

  1. 上記のワンライナーでスキルをインストール。
  2. Docker が実行中で、gemini-flow-suite イメージが利用可能か確認(READMEに従う)。
  3. skill/classical-poem-silk-video/scripts/check_prerequisites.sh を実行し、環境を検証。
  4. エージェントに、お好みの詩の動画生成を依頼。
  5. MP4 が生成されたら、オプションで final_media_qa.sh を実行し、品質を確認。

例の出力

リポジトリには、詩 《钱塘湖春行》(8行 → 4シーン)のフル長例が含まれています。最終的な動画(約32秒、1080 × 1920)は Releases ページにあり、docs/article.md で解説されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト