1. 从463条AI视频里提炼Skill我到底在解决什么问题先说说这个项目的由来。过去大半年我一直在做AI视频相关的内容从脚本生成、分镜设计、提示语撰写到后期拼接前前后后跑了四百多条片子。做到第一百条左右的时候我发现一个很要命的问题每次做新视频我几乎都在重复造轮子。同一个人物特写缓慢推镜的效果我可能在三个月内写了七八遍提示语每次措辞都略有不同出来的效果也飘忽不定。更麻烦的是团队里其他人接手我的活儿根本不知道我当时为什么那么写只能凭感觉重来一遍。这就是我决定把这463个AI视频反向拆解成Skill和提示语模版的直接动机。所谓Skill你可以理解成一套可复用的能力封装——它把某个具体任务的操作流程、参数配置、判断逻辑打包在一起下次遇到同类需求直接调用就行不用从零思考。而提示语模版则是Skill里最核心的那层表达层决定了AI到底怎么理解你的意图。这个项目能做什么简单讲它把散落在463条视频里的可复用经验抽出来变成结构化的、能直接抄的模版库。适合谁三类人一是刚入门AI视频、不知道怎么下手的创作者二是做批量内容、需要稳定产出的运营团队三是想把AI视频能力集成到自己工具链里的开发者。哪怕你完全不懂代码只要会复制粘贴、会改几个关键词就能用起来。我把它全部开源了放在公开的代码托管平台上。原因很简单这东西的价值不在于我藏着而在于大家一起用、一起改、一起补。下面我会把整个拆解思路、Skill的结构设计、提示语模版的写法、实操流程、踩过的坑全部摊开讲。2. 整体设计思路为什么是Skill而不是一堆散装提示语2.1 散装提示语的三个致命伤一开始我也是提示语收藏夹流派看到好的就存下来分类靠文件夹检索靠记忆。做到两百多条的时候这套体系彻底崩了。我总结出散装提示语的三个致命伤第一上下文丢失。一条提示语单独看是完整的但它往往依赖特定的模型版本、特定的分辨率、特定的参考图风格。你换个模型同样的提示语出来的东西完全不是一回事但你不知道问题出在哪。第二参数与表达混在一起。比如镜头缓慢推进是表达层运动强度0.3是参数层。散装提示语里这俩经常揉在一句话里想复用表达、只改参数就得手动拆拆着拆着就改错了。第三没有判断逻辑。真正做视频的时候你会遇到如果人物脸部占比大就降低运动强度否则容易糊这类条件判断。散装提示语没法承载这种逻辑只能靠人脑记。2.2 Skill的分层结构设计所以我设计Skill的时候强制做了三层分离意图层这个Skill是干什么的一句话说清楚比如生成人物中近景的情绪特写镜头。表达层具体的提示语模版用占位符标记可变部分比如{人物描述}、{情绪关键词}、{光线氛围}。参数层与表达层解耦的数值配置包括运动强度、帧率、时长、采样步数等每一项都标注了推荐范围和适用条件。这么分的好处是你换模型的时候只需要动参数层你想改风格的时候只需要动表达层你想组合新能力的时候把几个Skill的意图层拼起来就行。我实测下来这套结构让复用效率至少提升了三倍——以前改一条提示语要十分钟现在改占位符两分钟搞定。2.3 为什么选择开源而不是做成付费产品有人问我这东西做成付费模版包不是能赚钱吗我想过但放弃了。原因有两个一是AI视频这个领域变化太快模型三个月一迭代闭门造车的东西很快就过时开源能让它持续被修正二是463条视频的经验里有大量是踩坑记录这些负面经验比正面模版更值钱而负面经验只有在社区里流通才能发挥最大价值。开源不是做慈善是让这套东西活得更久。3. 463条视频怎么拆核心细节与实操要点3.1 拆解前的准备工作别急着动手拆先把素材整理清楚。我当时做的是把463条视频按镜头类型和内容主题两个维度打标签。镜头类型包括特写、中景、全景、空镜、转场内容主题包括人物、风景、产品、抽象概念。两个维度交叉大概能分出二十多个格子每个格子里有十几到几十条视频。这一步的注意事项不要按好看程度打标签要按可复用程度。有些视频效果炸裂但它是特定素材特定模型的偶然产物拆出来也没法复用有些视频平平无奇但它的提示语结构非常标准反而值得拆。我踩过的坑就是一开始按好看程度筛结果拆出来的模版全是一次性的。3.2 逐条拆解的四步法对每条视频我走的是固定四步还原提示语把当时用的提示语原文找出来找不到的就根据成片反推。反推的时候重点看构图、光线、运动轨迹这三个要素。标记可变部分把提示语里跟具体内容绑定的词换成占位符。比如一个穿红裙子的女孩换成{主体描述}黄昏暖光换成{光线氛围}。提取参数把运动强度、时长、帧率这些数值单独拎出来记录当时的取值和效果反馈。写判断备注用一句话说明什么情况下用这个Skill效果好什么情况下别用。这四步里第四步最容易被忽略但恰恰是最有价值的。比如我有一条快速推镜的Skill备注里写着主体边缘复杂时慎用容易产生拖影这条备注帮我省了至少五次返工。3.3 提示语模版的占位符设计规范占位符设计是有讲究的不能随便起名。我定的规范是用大括号包裹如{主体描述}方便程序解析。占位符名称用中文降低非技术用户的理解成本。每个占位符在Skill文档里必须有独立的说明包括填什么、长度建议、常见错误。举个例子{光线氛围}这个占位符我的说明是填光线方向和质感的组合词建议2到4个词比如侧逆光、柔和、暖调常见错误是只写好看的光这种模糊描述会让模型自由发挥结果不可控。提示占位符不是越多越好。我一开始设计了一个有十二个占位符的Skill结果没人愿意用因为填起来太累。后来压缩到四到六个使用率立刻上来了。3.4 参数层的取值范围怎么定参数取值不是拍脑袋定的是跑出来的。以运动强度为例我在同一个Skill下用0.1到1.0的步长0.1各跑了五条记录拖影、变形、卡顿的出现频率最后得出0.2到0.4最稳0.5以上需要主体简单的结论。这个过程很枯燥但它是Skill能不能被信任的关键。表格里我把几个核心参数的实测结论列出来参数名推荐范围超出范围的典型问题适用条件运动强度0.2-0.4拖影、边缘撕裂主体边缘简单时可用到0.5采样步数20-30低于20细节糊高于30收益递减与模型版本相关单镜时长3-5秒超过5秒后半段容易崩长镜头需拆成多段帧率24或30非标准帧率易出现抖动与输出平台匹配这张表是我拆了四百多条视频后最硬的干货直接抄就行但要注意模型迭代后需要重新验证。4. Skill和提示语模版的完整实操流程4.1 从零搭建一个Skill的完整步骤假设你要做一个产品展示旋转镜头的Skill完整流程是这样的第一步找三到五条同类视频作为参考样本确认它们的效果稳定、风格一致。第二步还原这些视频的提示语找出共同结构。第三步把共同结构里的具体词替换成占位符形成表达层模版。第四步把参数拎出来跑一轮参数扫描确定推荐范围。第五步写意图层描述和判断备注。第六步实际用这个Skill做一条新视频验证效果。第七步根据验证结果微调然后归档。这七步里第六步是分水岭。很多人做完前五步就以为完事了结果Skill从没被真正用过。我的经验是任何没经过实战验证的Skill都不算完成必须跑通至少一条新视频才算数。4.2 提示语模版的填写示例拿一个实际模版举例表达层长这样{主体描述}{动作描述}{镜头类型}{光线氛围}{风格关键词}画面稳定细节清晰填写示例一位穿深色外套的中年男性缓慢转头看向镜头中近景特写侧逆光柔和暖调写实电影感画面稳定细节清晰你看占位符填完之后整条提示语读起来是通顺的没有拼接感。这是判断模版设计好不好的一个土办法填完读一遍如果读起来别扭说明占位符位置或数量有问题。4.3 参数配置的实操记录参数配置我建议单独存一个配置文件不要写在提示语里。我用的是简单的键值对格式{ skill_name: 产品展示旋转镜头, motion_strength: 0.3, sampling_steps: 25, duration: 4, fps: 30, notes: 主体为规则几何体时效果最佳复杂曲面需降低运动强度 }这么存的好处是你可以批量替换参数做对比测试也可以把参数配置直接喂给自动化脚本。我实测下来把参数独立出来后做A/B测试的效率提升了不止一倍。4.4 批量生成时的组织方式如果你要批量做视频别一条一条手动跑。我的做法是把Skill列表和对应的参数配置整理成一张表用脚本读取表格逐行生成。表格长这样Skill名称主体描述动作描述运动强度时长产品旋转无线耳机缓慢旋转0.34人物特写年轻女性微笑0.23脚本读一行生成一条跑完整个表格就是一批视频。这套流程我用来做过一次三十条的产品视频从配置到出片大概两小时比手动快太多了。注意批量生成时一定要先跑一条测试确认参数没问题再全量跑。我有一次没测试就跑了五十条结果运动强度设错了全部返工血的教训。5. 常见问题与排查技巧实录5.1 提示语模版复用后效果不稳定怎么办这是最高频的问题。原因通常有三个一是模型版本变了二是参考图风格变了三是占位符填的内容跨度太大。排查顺序是先固定其他变量只换模型版本跑一遍再固定模型只换参考图跑一遍最后检查占位符填写是否超出了建议范围。我遇到过最隐蔽的一次是占位符里填了一个特别长的描述导致模型注意力被分散画面主体反而糊了。后来我在规范里加了一条单个占位符填写不超过十五个字。5.2 参数扫描太耗时怎么优化参数扫描确实费时间但可以优化。我的做法是先用粗粒度扫一遍比如运动强度从0.1到0.5步长0.2找出大致区间再在区间内用细粒度扫步长0.05。这样能把扫描次数从几十次降到十次以内。另外扫描的时候不用跑完整时长跑前两秒就能看出大部分问题能省不少算力。5.3 Skill数量多了怎么管理463条视频拆下来我最终整理出大概六十多个Skill。数量一多检索就成了问题。我的管理方式是三层分类第一层按镜头类型分第二层按内容主题分第三层按风格分。每个Skill有一个唯一编号编号规则是镜头类型缩写-主题缩写-序号比如CU-PER-003表示特写-人物-第三条。这套编号看起来麻烦但用起来检索极快强烈建议一开始就定好规则。5.4 常见问题速查表问题现象可能原因排查动作解决方向画面拖影运动强度过高降低到0.3以下或简化主体边缘主体变形占位符描述冲突检查描述是否自相矛盾精简描述后半段崩坏单镜时长过长拆成多段每段控制在5秒内风格漂移模型版本变化固定版本重跑更新Skill备注细节模糊采样步数不足提高到25以上注意收益递减这张表是我实际排查时最常用的基本覆盖了八成以上的问题。剩下两成通常是素材本身的问题换素材就能解决。5.5 几个容易被忽略的避坑技巧第一个技巧给每个Skill写反例。也就是明确写出这个Skill不适合什么场景。正面描述谁都会写反例才是真正防止误用的关键。第二个技巧定期回访旧Skill。模型迭代后三个月前的Skill可能已经失效我每个月会抽十条旧Skill重跑验证失效的就标记归档。第三个技巧保留原始视频和提示语的对应关系。别只存拆解后的模版原始对应关系是你后续追溯问题的唯一依据。6. 开源之后的一些实际体会项目开源之后收到最多的反馈是占位符设计思路很实用这让我挺意外的因为我原本以为大家更关注具体模版。后来想明白了模版会过时但设计思路不会。这也是我坚持把拆解方法写清楚、而不是只丢一堆模版出来的原因。另一个体会是开源真的能加速迭代。我自己拆的时候有些Skill的备注写得很粗糙社区里有人用了之后回来补充了更细的适用条件这些补充让Skill的可用性提升了一大截。所以如果你也在做类似的事情我的建议是尽早开源别等完美了再放出来因为完美永远等不到。最后分享一个我最近在试的扩展方向把这套Skill结构和自动化工作流结合起来让Skill不仅能被人调用还能被程序按条件自动选择。比如根据素材特征自动匹配最合适的Skill这一步还在摸索等跑通了再单独写一篇。