MiniMax H3 的提示词难写难在很多人的第一反应是把它当成文本模型写一整段“画面感很强”的自然语言。最近我把一套针对视频生成场景的 Prompt Skill 整理出来并结合官方示例和社区里常见的提示词规范做了 A/B 实测。结论很简单在 MiniMax H3 上结构化模板的“听话程度”明显高于整段自然描写尤其是镜头运动、动作顺序和人物一致性这三类需求。如果你正在本地部署 MiniMax H3或者在 ComfyUI 里用参考模式生成视频同时又被“模型总是不按提示执行”困扰下面这套方法应该对你有用。先说清楚这篇文章不是官方文档。官方有没有放出一份完整的 Prompt 规范我目前没有拿到全文也不乱猜。我做的事是把官方示例和社区里比较主流的写法拆开再用 A/B 实测反向验证哪些规则真正有效。你拿去落地时最好结合自己手里的模型版本和整合包实际测一遍。1. MiniMax H3 提示词为什么会“不听话”1.1 它更像在执行分镜头而不是在读小说视频模型的提示词处理方式和文本模型不一样。文本模型会把提示词转成语义列表逐条当成指令执行视频模型必须把文字映射到画面、时间和运动三个维度上。这几个维度之间经常打架。MiniMax H3 在提示词理解上的表现其实不算弱。你说“她端着咖啡杯”它会生成咖啡杯你说“傍晚室内”光色也会偏暖。真正出问题的通常是执行优先级。当一条提示词里同时存在主体、环境、动作、镜头、风格五类信息时模型会自己排顺序。以我的实际测试来看最常见的结果是主体和环境优先命中动作其次镜头运动最容易被忽略风格则看模型版本。所以你会看到一种很典型的失败画面人很对场景也对但镜头几乎固定动作只做了一半。这时不要立刻怀疑模型能力先怀疑提示词结构。1.2 把提示词拆成五个维度而不是一段话我现在的习惯是任何生成需求都先拆成五个维度主体人/物外貌、服装、表情、位置。动作主体从状态 A 到状态 B 的变化按时间顺序拆。环境背景、时间、光线、天气。镜头景别、机位、运镜。风格写实、动画、色调、材质、后期效果。这个拆分步骤看起来很基础但非常容易忽略。很多“不听话”的问题根源是五个维度混在一个长句里。比如“镜头缓慢推进她慢慢站起来”模型可能会把“缓慢”分配给“她”结果镜头直接固定。更常见的情况是“她看着窗外镜头慢慢后退”模型把“慢慢”分配给主体镜头没后退人物反而多了一个慢慢转身的动作。我实际测试后的建议是镜头运动描述单独成段并且不要和人物动作共用形容词。你要写镜头就写“镜头缓慢推进”要写人物动作就写“动作她站起来”两个模块不要混。2. 提示词规范里值得优先遵守的四条规则2.1 动作按时间顺序编号不要用从句MiniMax H3 这类模型对时间顺序的理解主要来自文本中出现动作的先后。如果你写“她低头看咖啡然后抬头看向窗外最后微笑”大多数情况下模型会按顺序执行。但如果你用从句式写法比如“看向窗外的她放下咖啡杯后微笑”模型经常会把“看向窗外”和“放下咖啡杯”合并成同一个动作或者只保留其中一个。更稳定的写法是1. 她低头看咖啡杯 2. 她抬头看向窗外 3. 她嘴角微微上扬不要小看这个“1. 2. 3.”。我在 A/B 测试里对比过带编号和不带编号动作完成度有明显差距。带编号时模型会把每个条目当作独立时间节点不带编号时动作动词之间容易发生粘连。这里要注意一个边界编号不是给得越细越好。如果你把一个动作拆成十个步骤比如“眼睛眨一下、睫毛动一下、嘴角抖一下”模型反而会丢失关键动作。我的经验是一个镜头里的动作不要超过三个最好是两到三个。2.2 一个镜头只保留一个主动作视频模型和文字模型不一样它生成的是连续帧。每个镜头里如果有多个运动模型要对运动轨迹做融合。融合一旦出错就会出现“动作做了但画面怪”“动作跳到一半就停住”“镜头莫名其妙加速”这类现象。我在实际测试中发现MiniMax H3 在单主动作场景下的稳定性最好。比如“她站起来”这个镜头通常很稳。但如果你写“她站起来转身走到窗边拨开窗帘看外面”前两个动作大概率能对上后两个动作就可能被压缩成模糊的“移动”或者干脆丢失。所以更稳妥的写法是一个镜头只保留一个主动作如果要连续动作就分成多个镜头段落。每个镜头给一个明确的动作目标。比如镜头 1她站起来。镜头 2她走向窗边。镜头 3她拨开窗帘看向窗外。你会发现这样组合出来的视频反而更完整。因为模型在每个镜头内只需要处理一个运动目标时间线不容易冲突。2.3 否定句尽量少用改成肯定描述文本模型对“不要”的理解很直接视频模型要弱很多。我在 MiniMax H3 上测试“不要出现文字、不要水印、不要面部变形”这类负面提示时发现效果不稳定。有时候能去掉有时候依然会出现。这不是说负面提示完全没用而是说它的优先级不高而且不同版本、不同整合包的处理方式不一样。更稳定的做法是把“不要出现文字”改成“画面干净无字幕背景简洁”把“不要面部变形”改成“面部自然五官清晰”。也就是把否定需求转成肯定描述让模型有明确的可执行目标。如果用 ComfyUI 的负面提示词节点可以同时写两条一条是“不想出现的内容”一条是“想出现的替代内容”。但不要只依赖负面提示词前提是在正面提示词里已经写清楚了主体和动作。2.4 参考模式下一定要写锚点很多人在全参考模式或 ref2va 这类参考能力下会写“保持人物外观与参考图一致”。这句话对但对模型来说太笼统。它不会自动知道“保持一致”具体保的是什么。我建议在参考模式下把主体锚点写具体人物外观以参考图为准 发型中长发自然披肩 服装白色针织衫 表情平静目光向下 位置窗前坐在椅子上这样模型要做的不是“猜测保持哪些特征”而是“参考图负责外貌文字负责当前状态”减少人物漂移的概率。如果参考图本身的构图和动作已经明确你甚至可以不写外貌只写环境和动作。写太多反而会干扰参考图的信息。3. 我做的 Prompt Skill 长什么样3.1 模板结构我把它做成了一个可以直接复用的结构化文本分成六个区块。你可以在任何支持多行提示词的 MiniMax H3 工作流里粘贴使用。【镜头】 景别中景 机位平视固定机位 运镜缓慢推近 【主体】 人物一位穿白色针织衫的年轻女性 发型中长发自然披肩 位置坐在窗边双手端着咖啡杯 表情平静目光下垂 【动作】 1. 她低头看咖啡杯 2. 她抬头看向窗外 3. 她嘴角微微上扬 【环境】 时间傍晚 光照暖黄灯光窗外微光 场景冬季室内木桌绿植 【风格】 写实浅景深暖色调电影感 【负面】 多人、文字、水印、面部变形、五官扭曲这个结构的核心不是好看而是信息隔离。镜头、主体、动作、环境、风格分开模型在解析时不需要从长句里做语义竞争。为了让你能直接导出成技能文件我也整理了一份 JSON 版本{ skill_name: minimax_h3_video_prompt, version: 1.0, description: