ningzimu/image-to-editable-ppt-skill

Codex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.

解決する課題

このプロジェクトは、編集不可能な画像、PDF、および画像ベースのPowerPointプレゼンテーションを、完全に編集可能な .pptx ファイルに変換する方法を提供します。スクリーンショットやフラットな画像ファイルしかない場合に、スライドを手動で作り直さなければならない問題を解決し、ユーザーがテキストを編集したり、単純な図形を移動させたり、ビジュアル資産を独立して管理したりすることを可能にします。

仕組み

このシステムは、マルチエージェントのコラボレーションプロセスを使用してスライドを再構成します。「再構成 $ ightarrow$ 自己チェック $ ightarrow$ 修正」というループに従うことで、出力が可能な限りオリジナルに近いものになるようにします。

主な技術的ステップは以下の通りです:

  • Normalization: 入力はページごとのタスクに変換されます。
  • Text Recovery: OCR(具体的にはサードパーティのトークンを介した PaddleOCR-VL)を使用して、正確な座標、フォントサイズ、グループ化を測定し、ネイティブなテキストボックスを復元します。
  • Visual Reconstruction: 単純な幾何学的図形はPowerPointの図形として復元され、複雑なビジュアル要素は独立した画像資産として抽出されます。
  • uma image backend: 組み込みの画像生成ツール(Codex image_gen.imagegen など)を優先し、画像編集や資産抽出にはOpenAI互換APIをフォールバックとして使用します。
  • Parallel Processing: マルチページドキュメントの場合、メインエージェントは「ページワーカー」(サブエージェント)にタスクを割り当て、ページを並行して処理します。

対象ユーザー

静的なスライド画像やPDFを、さらなる修正のために編集可能なプレゼンテーションに変換する必要があるユーザー、特にビジュアルデザインのレイアウトとテキストを維持しながら、コンテンツを編集する能力を取り戻したいと考えているユーザーを対象としています。

ハイライト

  • 幅広い入力サポート: 単一の画像、複数の画像、マルチページPDF、および画像ベースの .pptx ファイルを処理します。
  • 測定に基づくテキスト: OCRを使用して、テキストのサイズと位置が視覚的な推定ではなく、実際の測定値に基づいていることを保証します。
  • ハイブリッド再構成戦略: 複雑なページに対して、編集可能なテキスト、ネイティブなPPT図形、および独立した画像資産を組み合わせます。
  • マルチエージェントワークフロー: 再構成と検証の高度な反復ループを採用して精度を向上させます。
  • ノートの保持: .pptx 入力から最終的な出力まで、元のページノートを自動的にコピーします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト