让 AI 做产品片,别从一句高级科技感开始
我见过很多 AI 产品片,问题都差不多。
画面有了。
字幕有了。
配音也有了。
可它看起来还是像 PPT:几张卡片挪来挪去,一点光效,一点粒子,再配一段很端着的旁白。不能说完全没用,但离正式产品片差一口气。
这口气不是靠一句“更高级”补上的。
产品片要先回答几个很土的问题:
产品到底给谁用?
用户的痛点是什么?
这条片子要证明什么?
有哪些真实截图、功能、流程可以当证据?
参考片的镜头语法是什么?
配音像不像人说话?
字幕有没有漏?
最终视频有没有黑屏、静音、冻帧?
siuserxiaowei/reference-driven-cinematic-video-skill 做的就是这套事。
它不是一个“视频模板”。它更像一套 Codex 制片流程:先理解产品,再拆参考片,再定视觉载体、口播、字幕、动效路线,最后跑质量检查。
这个仓库不大。GitHub API 在 2026 年 7 月 17 日返回的是 39 个 star,open issues 是 0。但它很适合拿来学 Skill 写法,因为它把“做一条产品片”拆得很细。

1. 先把产品 brief 补齐
很多人给 AI 做视频,只给一段产品介绍。
比如:
我们是一款 AI 知识库工具,可以帮助团队提升效率。
请做一个 40 秒产品介绍片。
这段话太薄了。
它没有用户,没有场景,没有证据,没有疑虑,也没有素材清单。模型只能把它改写成广告腔,然后做几张“效率提升”的抽象画面。
这个 Skill 的第一步叫 Product Brief Expansion。
它要求先整理:
product:产品是什么
audience:谁会看
promise:这条片子的中心承诺
proof:有什么截图、流程、数据、功能、案例
objections:观众会怀疑什么
missing assets:缺哪些素材
这一步要先做。
因为视频不是把文字排到屏幕上。视频要拿画面说话。如果产品没有截图、没有流程、没有真实证据,后面再多动效也只是装饰。
这个 Skill 还会在 brief 薄的时候要求做 research sidecar,补 claim ledger、category context、visual proof board。简单说,就是先把能说的和不能说的分清楚。
没有证据的 claim,要降级。
这句话写进 Skill,比写一百句“请不要夸张宣传”有用。
2. 参考视频要拆,不是照抄
它的第二个重点是 Reference Audit。
如果用户给了参考视频,Skill 会要求先跑:
scripts/analyze_reference_video.py
这个脚本基于 FFmpeg,输出 probe、音量、静音、contact sheet 和关键帧。然后再写参考片分析:
时间
分辨率
帧率
音频情况
镜头列表
构图
字体
色彩
转场
声音事件
这一步和普通“参考一下这个风格”差别很大。
很多 AI 看到参考视频,只会学一个表面词:赛博、科技、极简、电影感。
这个 Skill 让 Codex 先写 shot grammar。
比如参考片用了曲面屏,它不会只写“做一个曲面屏效果”,而是会继续看:屏幕占画面多大、镜头怎么推、文字在哪个时刻出现、光线从哪里来、转场是硬切还是扫光。
它还明确说:学习参考视频的视觉结构,不要照抄里面的品牌和内容。
这句边界也该写。
不写的话,AI 很容易把“参考”理解成“复刻到侵权边缘”。
3. 它把视觉载体选得很具体
正式产品片最怕满屏都是幻灯片。
一个标题。
三个卡片。
几个图标。
慢慢淡入淡出。
这套东西不是不能用,但用多了就像模板。
reference-driven-cinematic-video 要求先选 primary visual carrier。
也就是这条片子主要靠什么画面成立:
曲面屏
产品 render
UI macro
代码流
数据流
动效字体
网页动效
这比“高级科技感”更具体。
比如你选曲面屏,那画面就要让屏幕成为主角,不能只在角落放一个小 UI。README 里甚至写了曲面屏风格标准:真实 bent mesh,主屏占画面 65-85% 宽度,产品场景先预合成为 16:9 texture,再贴到曲面屏上。
这些要求看着细,其实是在帮 AI 避开“假科技感”。
假科技感最爱堆东西。
真要做得像产品片,反而要少一点:一个主视觉载体,一条清楚运动路线,一组能证明产品的画面。
4. 配音和字幕是质量门,不是顺手加
这个 Skill 对配音写得很认真。
它的 voice-and-captions 规则里有几个判断很实在:
- 用户自己的声音要有干净样本。
- 默认 TTS 不能冒充用户音色。
- macOS
say不允许作为最终成片。 - 中文口播要短,少广告腔。
- 有旁白就默认要字幕。
这几条很接地气。
很多产品片栽在配音上。画面还行,一开口就露馅:播音腔、广告腔、语速怪、停顿怪。观众不一定能说出哪里错,但会觉得廉价。
这个 Skill 让 Codex 先出 10-15 秒样音,听感不行就调脚本、语速、音高和混音。
流程的用处就在这里。
不要等到“生成完再说”。配音要提前变成一道门。
5. 质量检查脚本是这套 Skill 的硬骨头
我最喜欢的是 scripts/quality_check_video.py。
这个脚本会检查:
decode
streams
audio_loudness
subtitles
black_frames
silence
freezes
artifacts
它还会生成 contact sheet 和 quality-report.json。
README 里有一个明确规则:低于 80 分默认只能叫 draft。
这句话很硬,但我喜欢。
视频生成最烦的是“看起来已经完成”。文件有了,能播放,似乎就可以交付。可里面可能有长黑屏、音频太小、字幕没烧进去、开头几秒静音、某个画面冻住。
这些问题如果靠人肉拖进播放器检查,容易漏。
quality_check_video.py 不会替你判断审美,但它能抓底线问题。
这很适合写进 Skill:AI 可以有创作空间,但交付前必须过检查。

6. 怎么装、怎么用
仓库地址在这里:
https://github.com/siuserxiaowei/reference-driven-cinematic-video-skill
把这个地址交给 AI,然后说:
帮我安装 reference-driven-cinematic-video 这个 Codex Skill。
使用时,不要只给一句口号。
你最好给它这些东西:
产品说明
官网或文档
功能清单
目标用户
已有截图或录屏
参考视频
配音要求
目标时长
可以这样问:
用 reference-driven-cinematic-video。
产品:一个面向团队的 AI 知识库工具。
资料:官网链接、产品截图、功能列表。
参考视频:本地 reference.mp4。
目标:40 秒以内,中文配音,带字幕,偏科技但不要 PPT 感。
请先扩展产品 brief,再分析参考视频,写分镜和口播。
如果缺素材,先列出来。最后生成成片并跑质量检查。
这个请求才像它的主场。
你给的信息越薄,它越应该先问问题,而不是急着渲染。
7. 公开反馈不多,先看源码价值
这个仓库公开讨论不多,我没有找到足够扎实的一手使用长评。
所以这篇不写“用户都说好”。目前能确定的是:仓库 README、SKILL.md、reference 文档和脚本都在,整体设计很完整,适合当作视频类 Skill 的写法案例。
这类小仓库,重点不一定是热度,结构更值得看。
它把很多人嘴里的“高级产品片”,拆成了可以执行的几道门。
8. 如果自己实现一套,该怎么写
你可以照它的结构,写一个更轻量的产品视频 Skill。
最小版本大概是:
适用场景:
从产品说明和参考视频生成 30-60 秒产品介绍片。
输入:
- 产品 brief
- 官网/文档
- 功能清单
- 参考视频
- 产品截图/录屏
- 配音要求
- 目标时长和平台
工作流:
1. 扩展产品 brief
2. 列 claim ledger:哪些能说,哪些证据不足
3. 分析参考视频:镜头、色彩、节奏、声音
4. 选择主视觉载体
5. 写口播和分镜
6. 生成或整理素材
7. 生成视频
8. 烧字幕
9. 跑质量检查
10. 低于质量线只标 draft
关键约束:
- 没证据的 claim 要降级
- 有旁白就要字幕
- 默认 TTS 不能说成用户音色
- 成片必须检查黑屏、静音、冻帧、字幕和解码
如果只想做内部 demo,可以把流程压缩。
但如果要给客户、产品发布、官网首屏用,质量闸门最好保留。
9. 我的判断
这个 Skill 的价值在一个词:制片。
它没有把视频生产当成一个 prompt。它把它拆成 brief、研究、参考片、视觉载体、配音、字幕、动效和验收。
这对写 Skill 很有参考意义。
复杂任务不要只写“请生成最终结果”。你要把中间的门写出来。
产品片尤其如此。
画面能动,不等于片子能用。
如果你只是想用:
准备好产品资料和参考视频,再让 AI 安装这个 Skill。第一次可以先做 30 秒以内,不要一上来追求长片。
如果你想学着写:
把“看起来高级”改成可执行检查项:主视觉载体、证据、配音、字幕、质量报告。
你可以这样写自己的 Skill
适用场景:从产品说明和参考视频生成一条正式产品介绍片。
触发条件:用户给产品 brief、官网、文档、功能清单、参考视频,或抱怨视频像 PPT。
输入:产品信息、参考视频、素材、配音要求、目标时长和平台。
输出:成片 MP4、字幕、contact sheet、质量报告、用到的素材和来源。
工作流:扩展 brief,拆参考片,定视觉载体,写口播和分镜,生成动效,烧字幕,跑质检。
关键约束:没有证据的产品 claim 要降级;配音要先过样音;有旁白就要字幕;低于质量线不能叫 final。
可选工具:FFmpeg、Remotion、Three.js、HyperFrames、Motion Canvas、TTS 或配音 API。
可改造方向:把质量闸门迁移到其他视频 Skill,尤其是自动检查黑屏、静音、冻帧、字幕和音量。


