ningzimu/image-to-editable-ppt-skill
Codex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.
解決する課題
このプロジェクトは、編集不可能な画像、PDF、および画像ベースのPowerPointプレゼンテーションを、完全に編集可能な .pptx ファイルに変換する方法を提供します。スクリーンショットやフラットな画像ファイルしかない場合に、スライドを手動で作り直さなければならない問題を解決し、ユーザーがテキストを編集したり、単純な図形を移動させたり、ビジュアル資産を独立して管理したりすることを可能にします。
仕組み
このシステムは、マルチエージェントのコラボレーションプロセスを使用してスライドを再構成します。「再構成 $ ightarrow$ 自己チェック $ ightarrow$ 修正」というループに従うことで、出力が可能な限りオリジナルに近いものになるようにします。
主な技術的ステップは以下の通りです:
- Normalization: 入力はページごとのタスクに変換されます。
- Text Recovery: OCR(具体的にはサードパーティのトークンを介した PaddleOCR-VL)を使用して、正確な座標、フォントサイズ、グループ化を測定し、ネイティブなテキストボックスを復元します。
- Visual Reconstruction: 単純な幾何学的図形はPowerPointの図形として復元され、複雑なビジュアル要素は独立した画像資産として抽出されます。
- uma image backend: 組み込みの画像生成ツール(Codex
image_gen.imagegenなど)を優先し、画像編集や資産抽出にはOpenAI互換APIをフォールバックとして使用します。 - Parallel Processing: マルチページドキュメントの場合、メインエージェントは「ページワーカー」(サブエージェント)にタスクを割り当て、ページを並行して処理します。
対象ユーザー
静的なスライド画像やPDFを、さらなる修正のために編集可能なプレゼンテーションに変換する必要があるユーザー、特にビジュアルデザインのレイアウトとテキストを維持しながら、コンテンツを編集する能力を取り戻したいと考えているユーザーを対象としています。
ハイライト
- 幅広い入力サポート: 単一の画像、複数の画像、マルチページPDF、および画像ベースの
.pptxファイルを処理します。 - 測定に基づくテキスト: OCRを使用して、テキストのサイズと位置が視覚的な推定ではなく、実際の測定値に基づいていることを保証します。
- ハイブリッド再構成戦略: 複雑なページに対して、編集可能なテキスト、ネイティブなPPT図形、および独立した画像資産を組み合わせます。
- マルチエージェントワークフロー: 再構成と検証の高度な反復ループを採用して精度を向上させます。
- ノートの保持:
.pptx入力から最終的な出力まで、元のページノートを自動的にコピーします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト