Image-to-Editable-PPT-Skill完全解析:把图片PPT、PDF变成可编辑PowerPoint的终极指南
【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill
Image-to-Editable-PPT-Skill是一个专为 Codex 打造的 AI Skill:把图片、PDF、图片版 PPT 转成可编辑 PowerPoint。图片式幻灯片"看得见却改不动"的痛点,它帮你一次解决——文字恢复为原生文本框,简单几何恢复为 PPT 形状,复杂视觉元素拆成独立图片资产,逐对象自由编辑。
一图看懂:它是怎么把图片"变活"的
这个 Skill 的转换效果到底如何?先看一张信息图页面:
转换前——一张图片,所有内容都"焊死"在像素里:
转换后——文字变成可编辑文本框,数字、图表标签和图标变成可选中对象:
这就是"对象级重建":它不是给图片盖一层透明文字,而是把页面拆成三类对象分别重建——
- 可读文字→ 原生文本框,可直接改字、改字号、改颜色
- 简单几何(矩形、圆形、线条、箭头) → PowerPoint 形状,可移动、缩放、改样式
- 复杂视觉元素(照片、插画、图标) → 带来源记录的独立图片资产,可整体移动和替换
核心特点:哪些功能值得关注
- 输入格式广:单张图片、多张图片、多页 PDF、图片版
.pptx,统一输出可编辑.pptx;PDF 和图片版 PPT 保留原页码顺序,.pptx输入的页面备注还会原样复制。 - 测量驱动的文字还原:文字大小与位置不靠目测,而是依赖 OCR 实测的框坐标与字号,同级文字字号自动保持一致。
- 多页并行加速:多页输入由主 agent 分派给多个 page worker 并发重建,单页则由主 agent 本地执行同一套流程。
- 原生表格重建:普通行列表格可重建为 PowerPoint 原生表格,保留可编辑单元格、行列尺寸、矩形合并与基础样式。
- 完整曲线支持:原生曲线路径、虚线样式和端点箭头,可在 PowerPoint 中"编辑顶点"整体调整曲度。
更多转换前后对比,可以直接浏览仓库 README.md 中的示例图集,以及 docs/workflow.md 的能力边界说明。
一键安装:最短上手步骤
推荐方式:直接把这句话发给你的 agent,由它自动完成安装:
安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill安装后,转换所需的editppt命令行工具、环境检查和配置都由 AI 在执行过程中自动处理,你不需要手动敲任何命令。
手动方式:从 Releases 下载image-to-editable-ppt-skill-v*.zip,解压后将image-to-editable-ppt文件夹放入 agent 的 skills 目录(Codex 为~/.codex/skills/image-to-editable-ppt),再重启 agent。详细步骤见 docs/installation.md。
推荐配置:3 个免费 OCR Token + 完全访问权限
首次使用前,有两个"1 分钟配置"能显著提升体验:
1️⃣ 申请免费 OCR Token(强烈推荐)
Skill 通过百度 PaddleOCR-VL 校正文字的框坐标、字号和字号分组。你只需到百度 AI Studio 申请一个 Access Token——个人使用的免费额度完全够用。首次转换时 AI 会主动询问一次,把 Token 发给它即可,一次配置长期生效。
不配置也能跑,但会退化为内置离线检测(只知文字在哪、多大,不识别内容),文字还原质量会打折扣。
2️⃣ 在 Codex 中开启"完全访问权限"
本 Skill 运行时间长,会自动执行 OCR、图片生成/编辑、文件读写和长时间轮询。"请求批准"或"替我审批"模式可能频繁打断甚至让流程停住:
快速开始:一句话就能触发转换
安装完成后,在 Codex 对话框中直接发送(图片、PDF、.pptx可直接粘贴、附加或提供本地路径):
$image-to-editable-ppt 把这张图片转成可编辑 PPT。 $image-to-editable-ppt 把 <path-to-deck.pdf> 转成可编辑 PPT。多页输入同样适用。转换完成后,你会在独立任务目录output/image-to-editable-ppt/{job-id}/下拿到:
| 产物 | 说明 |
|---|---|
final/{origin}_edited.pptx | 最终可编辑 PowerPoint 文件 |
final/validation.json | 最终 deck 校验结果 |
final/run_summary.json | 本次转换摘要 |
pages/page_NNN/ | 每页的重建工作区(源图、预览图、资产等) |
幕后工作流:AI 在后台做了什么
了解流程能让你更好地判断转换质量。一次转换的完整链路如下(详细说明见 docs/workflow.md):
- 归一化输入:创建独立任务目录,把输入统一拆成
pages/page_NNN/source.png。 - OCR 文字标注:为每页生成文字框坐标、实测字号和字号分组。
- 页面分派:单页由主 agent 本地重建;多页按并发槽位分派给 page worker 并行处理。
- 逐页重建 + 自检循环:重建 → 对照源图自检 → 页面内修正,直到结果足够接近原图。
- 状态记录:所有分派、页面结果、接受状态都通过
editpptCLI 记录,进度随时可查。 - 最终组装与校验:
editppt run finalize按页顺序重建最终.pptx并运行 deck 级校验(页数、媒体完整性、备注哈希等)。
使用提醒:成本、边界与效果预期
⚠️费 token 是它的特性,不是缺陷:每页都会经历多轮"重建→自检→修正",转换成本可能是生成图片 PPT 的 2–3 倍,单页复原时间可能超过 10 分钟。推荐 ChatGPT Pro 用户使用,Plus 用户请先拿单页试水。
几个需要知道的边界:
- 不能保证 100% 复刻:部分元素和文字位置可能有轻微偏移,照片、插画等复杂视觉通常只能作为整体图片移动。
- 视觉相似 ≠ 可编辑:判断质量时,除了预览图,还应打开 PPTX 查看文字是否可编辑、资产是否可分离。
- 它只做"重建",不做"创作":从大纲或想法生成全新 PPT 请使用 codex-ppt skill;没有强烈可编辑需求时,直接让图像编辑能力改那一页图片更轻量。
- 效果不保证 gpt-5.5 以下模型的表现;多页任务还需要 agent 环境支持 page worker 分派。
写在最后
Image-to-Editable-PPT-Skill把"图片 PPT 改不动"这件事变成了"发一句话、等十几分钟、拿到逐对象可编辑的 PPTX"。第一次使用建议:先用单张图片跑通完整流程,确认效果和耗时符合预期,再上多页任务。
想深入了解设计理念与对象级重建的细节,推荐阅读 docs/design.md;遇到问题时,docs/faq.md 覆盖了额度、权限、OCR、转换中断等高频疑问。
【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考