← 查看文章

PPT

GordenSuperPPTSkills:先把 PPT 做成图,再拆回可编辑

深拆 GordenSun/GordenSuperPPTSkills:它把图片生成、视觉拆层和 PPTX 重组合成一条完整生产线。

GordenSuperPPTSkills:先把 PPT 做成图,再拆回可编辑

AI 做 PPT 这事,挺邪门。

你说它不会吧,它会。给个主题,等一会儿,一份 PPT 就出来了。封面、目录、正文页、结尾页,一个不少。

你说它会吧,又总觉得哪里差口气。

普通 PPTX 倒是能编辑,问题是长得太老实。三栏卡片、圆角矩形、浅色渐变,像模板市场里刚批发回来的,还没拆吊牌。

整页图片就不一样了。信息图、光影、复杂结构,一下子都有了。看着像那么回事。可它也是有脾气的:你想改一个错字,它不理你;你想挪一个图标,它也不理你;老板说“把这两个模块换一下”,那基本就是重开一局。

所以 PPT 这玩意,麻烦就在这里:能改的不好看,好看的不好改。

GordenSuperPPTSkills 就是冲着这个毛病来的。它没有硬装成“一步生成完美 PPTX”的神器,而是走了条笨路:先把 PPT 做成图,再把图拆开,拼回可编辑 PPTX。

笨是笨了点,但有时候笨办法反而靠谱。

1. 这个仓库里到底有什么

仓库地址在这里:

https://github.com/GordenSun/GordenSuperPPTSkills

拉下来一看,里面放了三个 Skill:

GordenImagePPTGen
GordenImage2PPTX
GordenSuperPPTSkill

名字挺长,别被吓住。

GordenImagePPTGen 负责先把 PPT 做成图片。你给主题、内容、页数和风格,它生成每页 PNG,再合成一份图片型 PPTX。

GordenImage2PPTX 负责反过来,把一张 PPT 图片或截图,尽量还原成可编辑 PPTX。

GordenSuperPPTSkill 就是总入口。它把前两个串起来:先生成图片版 PPT,再逐页还原。

整套链路大概是这样:

内容 → 图片版 PPT → 分层还原 → 可编辑 PPTX

这就不是普通 PPT 模板了。它更像一条小型生产线。

2. 它先承认一个现实

很多 AI PPT 工具喜欢把话说满。

好像只要你说“做一份 PPT”,它就应该顺手完成内容理解、视觉设计、文件生成、对象分层、可编辑结构,外加一点审美。

听着挺美。

但现实里这几件事根本不是一种能力。

图像模型很会画整页视觉稿。你让它做一页科技风信息图,它能把背景、卡片、箭头、图标、图表揉在一起,看着有模有样。

PPTX 又是另一回事。PPTX 不是一张图,它是一堆对象:文本框、图片、形状、坐标、层级、字体、颜色。你想改字,字就得是文本框;你想挪图标,图标就得是一个独立对象。

Gorden 这套 Skill 的取舍很朴素:别一开始就逼模型用 PPT 原生元素做设计。先让它把画面做出来,再想办法把画面拆回可编辑结构。

像先做视觉稿,再切图还原。

只不过这里切图的人,也是一半 AI,一半脚本。

3. 第一段:先出图片版 PPT

先看 GordenImagePPTGen

它的 SKILL.md 里把流程拆成五步:

A1 确认需求
A2 写 outline.json
A3 为每页写 prompt
A4 调 imagegen 出图
A5 用 compose_pptx.py 合成图片型 PPTX

最后一步不神秘。compose_pptx.py 就是把每页 PNG 放进 PPTX,一页一张全幅图。

麻烦在前面。

它会先写 outline.json,把每一页的主题、内容、视觉框架、页面文字拆清楚。然后每页再生成一个 prompt。这个 prompt 不能只写“高级、科技、商务、简洁”,那种话听着像需求,其实啥也没说。

它要写清楚颜色、版式、标题、模块文字、图表形式、字号层级。

仓库里还有一条反复强调的规矩:不能生成空模板。

这条别小看。

很多 AI PPT 预览起来挺唬人,仔细一看全是占位符。标题是 Your Title Here,卡片是 lorem ipsum,图表也像刚从素材库里借来的。看完你会发现,活儿还在自己手里,只是多了一份心理安慰。

GordenImagePPTGen 不让它这么混。每页必须有真实文字,不能是 lorem,不能是占位符,也不能是只有框架没有内容的空壳。

所以它会要求把内容先做厚:导语、模块、重点数字、底部总结横幅,能安排的都先安排上。内容太薄,模型只能靠装饰撑场面,最后就容易花。

说白了,这一步是在给 AI 写施工单,少让它自由发挥。

哪里放标题,哪里放模块,哪里放图表,哪些字必须原样出现,都先说清楚。你不说清楚,它当然会自己发挥。AI 一发挥,通常就开始热闹。

4. 第二段:把图片拆回 PPTX

GordenImage2PPTX 是这套东西里更有意思的部分。

它没有走那种一眼就能看穿的捷径:把原图塞进 PPT,再在上面盖几个文本框。那样看着也算“可编辑”,但底图里的旧文字还在。你一改字,就像墙上贴了两张小广告。

它要求把一张 PPT 图片拆成四层:

背景图
框架图
图标和装饰
普通文字

背景图只保留底色、渐变、纹理和大面积背景。文字、图标、卡片、框架都要擦掉。

框架图管页面骨架。容器、卡片、标题条、分隔线、连接线、图表骨架、坐标轴、趋势线,都放在这里。

图标和装饰单独拎出来。小图标、装饰元素、艺术字,都作为图片元素处理。

普通文字则用视觉能力识别,再写成 PPT 文本框。内容、位置、字号、颜色、粗细和对齐方式都要记下来。

最后按顺序叠回去:

背景 → 框架 → 图标 → 文本

这样拼出来的 PPTX,才有一点编辑余地。改文字时,不会碰到底图里的旧字;挪图标时,也不用拖着整张页面一起走。框架默认还是一张透明图,但它至少已经和文字分开了。

图片 PPT 拆回 PPTX 的四层结构

5. 那些脚本,才是真干活的地方

如果一篇文章只写“它用 AI 把图片转 PPT”,那就跟没说差不多。

仓库里干苦活的,是这些脚本:

probe_palette.py
chroma_key.py
slice_grid.py
compose_pptx.py
layout_guard.py
placement_qa.py
visual_compare_qa.py

probe_palette.py 先看原图里有没有绿色。因为后面经常要用绿幕抠图,如果页面本来就有很多绿,再拿绿色当底色,就很容易把正经内容一起抠掉。

chroma_key.py 负责抠透明。框架图和图标图先生成在纯色背景上,再把这个纯色去掉,留下透明 PNG。

slice_grid.py 负责切图标。模型把一堆图标排成表,脚本再把它们切成一个个小图。

compose_pptx.py 负责合成。背景放底下,框架盖上去,图标按坐标摆回去,文字再写成文本框。

layout_guard.py 看坐标和字号有没有明显离谱。

placement_qa.py 会在源图和预览图上画框,方便看文本和图标有没有偏。

visual_compare_qa.py 生成并排图、叠图和差异图,用来判断还原得像不像。

这套分工很清楚:模型负责看图、画图、识别;脚本负责抠图、切片、坐标、合成和检查。

一个会脑补,一个会干苦活。

这组合就比单靠一句 prompt 稳得多。

6. 用一页截图走一遍

假设你手里有一页科技风 PPT 截图。

白底,右上角有淡淡网格。中间三张卡片,卡片上方有蓝色标题条。每张卡片里有图标、标题和两行说明。底部还有一条绿色总结横幅。

这套 Skill 大概会这样跑。

先探色。页面如果没什么绿色,就用绿色做抠图底色;页面如果本来就绿油油的,它会换成品红或紫色。

然后生成干净背景。它会以这张截图为目标,擦掉文字、图标、卡片和框架,只保留底色、网格和光影。这个背景以后就是 PPT 最底层。

接着提取框架。三张卡片、标题条、分隔线、底部横幅都进框架图;文字和图标不要进来。框架图先生成在纯色底上,再用 chroma_key.py 抠成透明的 frame.png

图标也要单独处理。它会先看哪些元素已经被框架图覆盖了,免得重复。剩下的图标和装饰被排成一个网格图,抠底以后用 slice_grid.py 切成独立 PNG。

文字最后处理。AI 读取源图里的普通文字,记录坐标、字号、颜色和粗细。艺术字不走普通文本框,因为普通文本框很难还原那种造型。

最后合成。背景在底层,frame.png 盖上去,图标按坐标放回去,文字写成文本框。预览发现偏了,就改 layout.json;框架少了一条线,就重出框架图。

听起来一板一眼。

但图片还原这事,本来就没什么仙气。靠的是一层一层拆,一层一层对。

7. 怎么装,怎么用

把这个 GitHub 地址给 AI:

https://github.com/GordenSun/GordenSuperPPTSkills

然后说:

帮我安装这个仓库里的 GordenSuperPPTSkill、GordenImagePPTGen 和 GordenImage2PPTX。

想从内容直接生成可编辑 PPT,可以这样说:

使用 GordenSuperPPTSkill,基于下面这份内容生成一份 8 页左右的可编辑 PPTX。
风格:科技商务,信息密度高,但不要花哨。

只想出图片版 PPT:

使用 GordenImagePPTGen,把下面内容做成 6 页图片格式 PPT。
每页必须包含真实文字,不要占位符。

已有 PPT 截图,想还原成可编辑 PPTX:

使用 GordenImage2PPTX,把这张图片还原成可编辑 PPTX。
请严格按背景、框架、图标、文字四层流程处理。

这里别想得太轻松。README 里也写了,它主要面向 Codex,因为要用 imagegen 和 GPT 视觉能力。图片转可编辑 PPTX 还比较耗额度。

普通聊天窗口大概率跑不稳。最好是有文件系统、有图片生成、有脚本执行能力的 Agent 环境。

8. 如果自己写一套类似的 Skill

这套 Skill 真要抄,别盯着 PPT 本身,先抄它拆任务的方法。

第一,分阶段。

不要只写“帮我生成一个 PPT”。可以拆成:

阶段 A:生成图片版成品
阶段 B:把图片拆层还原为可编辑结构

第二,每个阶段都留下东西。

outline.json
prompts/NN-*.md
imagegen-manifest.json
slides/NN-*.png
layout.json
preview/slide_*.png
editable.pptx

这些文件不是摆设。它们让你知道每一步做了什么,坏了也知道从哪里修。没有中间产物,失败时只能互相瞪眼。

写类似 Skill 时可以复用的五个环节

第三,让 AI 留证据。

Gorden 这套 Skill 要求写 manifest,记录每页图片从哪里生成、复制到哪里、用的 prompt 是哪一个。这不是繁文缛节,是防止 Agent 偷懒。

Agent 很会走近路。没有真的调用图片模型,它可能用程序画一张差不多的;没有真的提取图标,它可能直接裁原图;没有真的做框架层,它可能拿原图当背景再盖文字。

你不写死,它就敢干。

第四,把禁止项说清楚。

这个仓库里有大量禁止项:不能用 SVG / HTML / Canvas 冒充 imagegen,不能用代码在生成图上补字,不能拿原图当背景再盖文字,不能用 PPT shapes 重画框架。

这些话看着唠叨,但确实有用。AI 很少主动走最麻烦也最正确的路,它多半走顺手的路。

第五,把 QA 写进流程。

生成完以后不能只随便看一眼,检查也得写死:

生成预览
画 bbox
做视觉对比
检查 manifest
不合格就回到对应步骤

写到这一步,这个 Skill 才比较像能反复用的东西。

9. 我的判断

这套东西我最想记下来的,不是“AI 能做豪华 PPT”。漂亮图现在已经不稀奇了。

它有意思的地方,是不装。

图片生成就是图片生成,PPTX 编辑就是 PPTX 编辑。它把这两件事拆开,先拿到视觉上能看的稿,再用分层、抠图、切片、坐标、文本框和 QA,把它一点点还原成可编辑结构。

这条路不省事,耗额度,也耗耐心。可复杂任务有时候就不能指望一口吃完。先得到一个看得过去的结果,再把它拆成能维护的结构,这个思路挺实用。

写 Skill 也一样。

少写几句“请认真设计”,多写清楚每一步的输入、输出、禁止项和验收证据。AI 才有机会老老实实干活。