ningzimu/image-to-editable-ppt-skill
Codex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.
解决的问题
本项目提供了一种将不可编辑的图像、PDF 和基于图像的 PowerPoint 演示文稿转换为完全可编辑的 .pptx 文件的方法。它解决了在只有截图或扁平图像文件时必须手动重新制作幻灯片的问题,使用户能够独立编辑文本、移动简单形状并管理视觉资产。
工作原理
该系统使用多智能体协作流程来重构幻灯片。它遵循“重构 $ ightarrow$ 自检 $ ightarrow$ 修正”的循环,以确保输出结果尽可能接近原件。
关键技术步骤包括:
- Normalization: 输入被转换为逐页任务。
- Text Recovery: 使用 OCR(具体是通过第三方 token 使用 PaddleOCR-VL)来测量精确的坐标、字体大小和分组,从而恢复原生文本框。
- Visual Reconstruction: 简单的几何形状被还原为 PowerPoint 形状,而复杂的视觉元素则作为独立的图像资产被提取。
- uma image backend: 优先使用内置的图像生成工具(如 Codex
image_gen.imagegen),并在图像编辑和资产提取时回退到兼容 OpenAI 的 API。 - Parallel Processing: 对于多页文档,主智能体将任务分发给“页面工作者”(子智能体)以并行处理页面。
适用对象
需要将静态幻灯片图像或 PDF 转换为可进一步修改的编辑版演示文稿的用户,特别是那些希望在保留视觉设计布局和文本的同时,重新获得编辑内容能力的用户。
亮点
- 广泛的输入支持:处理单张图像、多张图像、多页 PDF 和基于图像的
.pptx文件。 - 测量驱动的文本:使用 OCR 确保文本大小和位置基于实际测量值而非视觉估计。
- 混合重构策略:针对复杂页面结合了可编辑文本、原生 PPT 形状和独立的图像资产。
- 多智能体工作流:采用复杂的重构与验证迭代循环来提高准确性。
- 备注保留:自动将
.pptx输入中的原始页面备注复制到最终输出中。
相关
- 项目
- 项目
- 项目
- 项目
- 项目