ningzimu/image-to-editable-ppt-skill
Codex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.
해결하는 문제
이 프로젝트는 편집할 수 없는 이미지, PDF 및 이미지 기반 PowerPoint 프레젠테이션을 완전히 편집 가능한 .pptx 파일로 변환하는 방법을 제공합니다. 스크린샷이나 평면 이미지 파일만 있을 때 슬라이드를 수동으로 다시 만들어야 하는 문제를 해결하여, 사용자가 텍스트를 편집하고, 단순한 도형을 이동시키며, 시각적 자산을 독립적으로 관리할 수 있도록 합니다.
작동 방식
시스템은 멀티 에이전트 협업 프로세스를 사용하여 슬라이드를 재구성합니다. 출력물이 원본과 최대한 가깝게 유지되도록 "재구성 $ ightarrow$ 자가 점검 $ ightarrow$ 수정" 루프를 따릅니다.
주요 기술 단계는 다음과 같습니다:
- Normalization: 입력 데이터는 페이지별 작업으로 변환됩니다.
- Text Recovery: OCR(구체적으로 서드파티 토큰을 통한 PaddleOCR-VL)을 사용하여 정확한 좌표, 글꼴 크기 및 그룹화를 측정하여 네이티브 텍스트 상자를 복원합니다.
- Visual Reconstruction: 단순한 기하학적 도형은 PowerPoint 도형으로 복원되며, 복잡한 시각적 요소는 독립적인 이미지 자산으로 추출됩니다.
- uma image backend: 내장된 이미지 생성 도구(Codex
image_gen.imagegen등)를 우선적으로 사용하며, 이미지 편집 및 자산 추출을 위해 OpenAI 호환 API를 보조적으로 사용합니다. - Parallel Processing: 다중 페이지 문서의 경우, 메인 에이전트가 "페이지 워커"(서브 에이전트)에 작업을 할당하여 페이지를 동시에 처리합니다.
대상 사용자
정적인 슬라이드 이미지 또는 PDF를 추가 수정을 위해 편집 가능한 프레젠테이션으로 변환해야 하는 사용자, 특히 시각적 디자인의 레이아웃과 텍스트를 유지하면서 콘텐츠를 편집할 수 있는 기능을 되찾고자 하는 사용자에게 적합합니다.
주요 특징
- 폭넓은 입력 지원: 단일 이미지, 여러 이미지, 다중 페이지 PDF 및 이미지 기반
.pptx파일을 처리합니다. - 측정 기반 텍스트: OCR을 사용하여 텍스트 크기와 위치가 시각적 추정이 아닌 실제 측정값을 기반으로 하도록 보장합니다.
- 하이브리드 재구성 전략: 복잡한 페이지를 위해 편집 가능한 텍스트, 네이티브 PPT 도형 및 독립적인 이미지 자산을 결합합니다.
- 멀티 에이전트 워크플로우: 재구성 및 검증의 정교한 반복 루프를 채택하여 정확도를 높입니다.
- 노트 보존:
.pptx입력에서 최종 출력까지 원본 페이지 노트를 자동으로 복사합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트