ningzimu/image-to-editable-ppt-skill
Codex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.
解決的問題
本專案提供了一種將不可編輯的圖像、PDF 和基於圖像的 PowerPoint 簡報轉換為完全可編輯的 .pptx 檔案的方法。它解決了在只有螢幕截圖或扁平圖像檔案時必須手動重新製作投影片的問題,使用戶能夠獨立編輯文本、移動簡單圖形並管理視覺資產。
工作原理
該系統使用多智能體協作流程來重構投影片。它遵循「重構 $ ightarrow$ 自檢 $ ightarrow$ 修正」的循環,以確保輸出結果盡可能接近原件。
關鍵技術步驟包括:
- Normalization: 輸入被轉換為逐頁任務。
- Text Recovery: 使用 OCR(具體是透過第三方 token 使用 PaddleOCR-VL)來測量精確的座標、字體大小和分組,從而還原原生文本框。
- Visual Reconstruction: 簡單的幾何圖形被還原為 PowerPoint 圖形,而複雜的視覺元素則作為獨立的圖像資產被提取。
- uma image backend: 優先使用內建的圖像生成工具(如 Codex
image_gen.imagegen),並在圖像編輯和資產提取時回退到相容 OpenAI 的 API。 - Parallel Processing: 對於多頁文件,主智能體將任務分發給「頁面工作者」(子智能體)以並行處理頁面。
適用對象
需要將靜態投影片圖像或 PDF 轉換為可進一步修改的編輯版簡報的用戶,特別是那些希望在保留視覺設計佈局和文本的同時,重新獲得編輯內容能力的用戶。
亮點
- 廣泛的輸入支援:處理單張圖像、多張圖像、多頁 PDF 和基於圖像的
.pptx檔案。 - 測量驅動的文本:使用 OCR 確保文本大小和位置基於實際測量值而非視覺估計。
- 混合重構策略:針對複雜頁面結合了可編輯文本、原生 PPT 圖形和獨立的圖像資產。
- 多智能體工作流:採用複雜的重構與驗證迭代循環來提高準確性。
- 備註保留:自動將
.pptx輸入中的原始頁面備註複製到最終輸出中。
相關
- 專案
- 專案
- 專案
- 專案
- 專案