这次 BSAI 第 58 期要看的是围绕 MiniMAX H3 整理的一套官方 SKILL 三段式专业提示词模板。这个东西的核心价值很简单不用折腾复杂参数把提示词按固定三段结构填进去就能在 MiniMAX H3 上直出电影级特效画面。标题里写了“免 API 免推理”先解释一下并不是说模型不需要推理而是指官方在线服务和提示词模板已经把部署、鉴权、参数调参这些门槛都消化掉了用户只需要提交文字剩下的交给平台端模型完成。如果你关心的是“提示词怎么写才能出电影级特效”“三段式模板到底是什么结构”“本地 ComfyUI 能不能跑 MiniMAX H3”“官方 API 怎么调用、批量任务怎么做”这篇文章可以直接收藏。全文按“在线使用 - 模板拆解 - 本地部署 - API 调用 - 性能观察 - 排错清单”的顺序展开所有配置和代码都给可直接复制的通用模板实际路径、端口、模型名需要按你的环境替换。MiniMAX H3 对很多视频创作者来说不算陌生它最突出的能力是文生视频和图生视频尤其是画面动态、镜头调度和风格化渲染。社区里传播最多的用法集中在“超燃战斗打斗中文提示词模板”“ref2va 全能参考模式”“导演台”这几类场景。简单说这个项目解决的是“提示词工程”层面的问题同样的模型用普通描述和用三段式 SKILL 模板出片质感和镜头语言会差很多。1. MiniMAX H3 核心能力速览先把最关键的规格信息放在最前面方便你快速判断这东西适不适合你。能力项说明项目类型AI 视频生成模型 官方专业提示词模板模型规模社区讨论称约 33B 级别公开资料未完全确认主要功能文生视频、图生视频、ref2va 全能参考模式、导演台提示词方案官方 SKILL 三段式结构模板API 支持支持需参考 MiniMAX 官方文档申请鉴权免 API 免推理特指官方在线创作平台用户不需要自己搭 API key 和推理环境本地部署社区已有 ComfyUI 整合包热词中出现过 3060 尝试记录批量任务可通过 API 脚本批量提交建议做任务队列和失败重试主要门槛在线版需要网络环境本地版需要足够显存具体以本机实测为准适合人群短视频创作者、AI 特效爱好者、ComfyUI 玩家、API 自动化开发者需要注意一点目前网络上关于 MiniMAX H3 的“免 API 免推理”宣传更多是站在使用者的角度说的。也就是说用户直接用官方页面把模板贴进去就能出片不需要像本地部署那样去下模型权重、配置 CUDA 环境。如果你是想自己部署 ComfyUI 整合包那仍然需要显存和推理环境只是显卡门槛已经比早期视频模型低了不少。2. MiniMAX H3 到底是什么两条使用路线在动手之前先理清 MiniMAX H3 的两种主流使用方式。因为它们的前提条件、成本和结果都不一样很多文章混在一起写容易把人绕晕。2.1 在线创作路线这条路线对应标题里的“免 API 免推理”。MiniMAX 官方提供了在线创作平台用户在网页端选择文生视频或图生视频把三段式提示词粘贴进去设置分辨率、时长、运动强度等参数点击生成即可。官方平台内部已经完成了模型推理、资源调度和结果渲染用户不需要准备显卡也不需要安装任何依赖。在线路线的优点是零门槛写提示词就能跑。缺点是可控性受限不能自定义模型层参数也不方便做大批量自动化。适合做创意验证、短视频素材、一次性灵感测试。2.2 ComfyUI 本地部署路线社区里已经有了 MiniMAX H3 的 ComfyUI 整合包热词里也出现了“comfyui minimax h3 整合包”和“comfyui minimax h3 3060”这些关键词。这说明本地部署是可行的并且有人在 3060 这类消费级显卡上做过尝试。本地路线的优点是可控性强、批量任务方便、隐私数据不出本地而且可以通过 ComfyUI 节点把 MiniMAX H3 和 ControlNet、LoRA、视频修复等能力串成完整工作流。缺点是门槛高需要安装 ComfyUI、下载模型权重、配置显卡驱动和依赖库。从社区反馈来看本地部署的显存压力主要集中在生成视频片段时的推理阶段分辨率越高、帧数越多显存占用越大。3060 用户更稳妥的做法是先跑低分辨率和短视频片段确认通过后再逐步上调。具体显存数字需要以你本机的实际测试为准不要轻信网上的“6G 显存随便跑”这类说法。3. 适用场景与使用边界MiniMAX H3 和它的三段式 SKILL 提示词模板适合解决这么几类问题短视频创作者需要稳定的电影级画面风格不想每次重新调参。开发者在做视频生成的自动化批量任务需要把提示词结构固定成模板。ComfyUI 玩家希望把 H3 模型引入自己的本地工作流配合 ref2va 做参考视频生成。对提示词工程感兴趣的研究者想分析“主体 镜头 风格”三段式结构对出片质量的影响。同时也要把使用边界说清楚。MiniMAX H3 本质是生成式 AI 视频模型生成内容的质量和稳定性并不完美复杂运动、多人交互、手部细节、文字呈现都可能出现崩坏。你是要拿它做快速创意验证、分镜预演、短视频素材而不是把它当作可以商用的无人工审核内容生产线。所有生成结果在对外发布或商用前建议做人工复核。合规方面必须重视涉及真实人物肖像、声音、品牌、受版权保护的素材、影视剧画面时你需要确认自己有合法授权不得用生成内容制作虚假信息、欺诈内容或冒充他人本地部署时涉及私有数据要注意存储和传输安全。官方 API 调用时要遵守服务条款和调用频率限制。4. 官方在线使用免 API 免推理的工作流先演示在线创作路线。你不需要安装任何软件只需要打开 MiniMAX 官方创作平台的页面找到 MiniMAX H3 模型的入口。4.1 开启在线创作页面进入官方平台后选择模型为 MiniMAX H3模式按需选择文生视频或图生视频。如果你上传了一张参考图希望模型按照参考图的角色、构图和风格生成视频片段就选择图生视频并联动 ref2va 参考模式。ref2va 全能参考模式是 MiniMAX H3 的亮点之一它的作用是让模型在生成时严格参考输入图片或视频的角色一致性、场景一致性和风格一致性。使用 ref2va 时提示词模板里要减少对角色外观的冗长描述把“角色一致性”的职责交给参考输入提示词重点写镜头运动、氛围和特效。需要注意的是不同的参考模式对提示词写法有不同的要求。比如用“人物一致性参考”时正文提示词不需要再写“金发红唇蓝眼”这类外貌细节而用“运动参考”时模板第二段镜头语言就要更具体。建议首次使用时参考官方提示词编写规范热词中提到有“ref2va 全能参考模式提示词编写规范”按规范调整能把失败率降到最低。4.2 把三段式提示词粘贴进输入框在线平台一般会有一个“导演台”风格的控制面板包含提示词输入框、负向提示词输入框、参数设置区。我们把下面这个三段式模板当作基线先跑通流程{ prompt_section_1: 烈焰燃烧的废弃都市一名穿深色战甲的角色站在高台中央风卷起火星与灰烬, prompt_section_2: 镜头从远景快速推到角色面部随后绕角色逆时针旋转半周低机位仰拍运动速度由快转慢, prompt_section_3: 电影级光影体积光穿透烟雾橙红色调粒子特效高对比度超现实战斗氛围8K 细节 }把三段内容合并成一个完整 prompt 粘贴进主提示词框或者按平台提供的分段字段分别填写。不同平台对分段输入的支持不一样MiniMAX 官方如果支持分段字段就尽量分开填这样模型在语义理解上更容易把“主体描述”“镜头语言”“风格渲染”拆开处理。4.3 提交生成与结果确认设置视频分辨率、时长、运动强度等参数。第一次建议用平台默认参数生成一个短视频片段来验证模板效果。提交后等待几十秒到几分钟不等具体取决于平台排队情况和服务端负载。判断是否成功的标准很简单画面没有明显花屏、主体一致、镜头运动符合第二段描述、风格接近第三段描述。如果第一条 prompt 生成的画面风格不对优先检查是不是第三段风格描述太模糊如果镜头运动完全没体现优先检查第二段是否使用了具体镜头术语比如“推镜头”“摇摄”“跟随”“低机位仰拍”。如果平台出现类似“api error: 529 overloaded. this is a server-side issue, usually temporary”的提示说明是服务端过载属于暂时性问题换时间重试即可不是你的提示词写错了。5. 三段式官方 SKILL 提示词模板拆解三段式结构是 MiniMAX H3 官方 SKILL 的核心。它把一条完整提示词拆成“主体与场景 - 镜头语言 - 风格与特效”三个语义层每一层都对应模型生成时的不同控制维度。下面逐段拆解。5.1 第一段主体与场景第一段负责告诉模型“画什么”。包括主体是谁、场景在哪里、光线氛围如何、有哪些关键道具或元素。这段写得越具体主体出现错误就越少。关键是主体数量不要贪多。好的第一段通常控制一到两个核心主体空间关系明确不要在一个画面里塞十个角色、五辆车、三座建筑。MiniMAX H3 在复杂多人场景下仍然会出现角色混淆所以主次分明是第一段最重要的原则。示例一个戴银色头盔的战士双手持燃烧能量剑站在废弃体育馆中央地面布满裂痕四周有倒塌的看台和浓烟空中漂浮火星。5.2 第二段镜头语言第二段负责告诉模型“怎么拍”。镜头语言在视频生成里非常有效包括景别、机位、运动方式、运动速度、视角变化。强烈建议使用电影摄影专业术语而不是“拍摄很好看的画面”这种模糊描述。MiniMAX H3 对“推、拉、摇、移、跟、环绕、低机位、过肩镜头”这类术语理解力较强。示例镜头从体育馆入口缓慢推进经过废墟和火焰最终停在战士正面随后以战士为圆心进行 90 度环绕最后切到低机位仰拍镜头运动由缓到急。一个通用的第二段写作公式是“景别 - 机位 - 运动路线 - 运动速度 - 结束画面”。把它按顺序写清楚镜头语言就不会乱。5.3 第三段风格与特效第三段负责告诉模型“用什么画风渲染”。这里可以写光影风格、色彩方案、画质关键词、物理特效、艺术流派参考。常见有效关键词包括体积光、丁达尔效应、电影感、高对比度、暗色调、粒子特效、慢镜头感、超现实、8K、景深、动态模糊。要注意关键词不要堆砌过猛风格关键词控制在 15 到 30 个之间即可太多反而会互相干扰。示例电影级光影暗色主调橙红火光作为点缀色体积光穿透烟尘火焰粒子飞散画面带有慢镜头感高对比度电影级画质细节。5.4 一个完整中文模板示例把三段拼起来就是一个可直接提交的完整模板第一段一个穿黑色战术风衣的青年站在摩天大楼天台边缘雨水打湿衣物楼底是霓虹闪烁的赛博朋克街道远处有悬浮车划过。 第二段镜头从背后过肩视角缓慢推向青年背影随后切换到正面大特写再拉远成全景最后以无人机俯冲视角快速向下推进运动速度先慢后快。 第三段赛博朋克霓虹风蓝紫主调体积光穿过雨雾地面反射彩色灯光超现实科技氛围电影级光影高对比度8K 细节。如果你想要“超燃战斗打斗”风格把第一段主体改成战斗动作第二段镜头改成快速推拉和环绕第三段强调爆炸、冲击波、粒子特效即可。社区里流行的中文提示词模板基本都是这个思路换风格就是换三段里的关键词组合。5.5 负面提示词与参数建议在支持负向提示词的平台或 ComfyUI 工作流中建议固定一组通用负面词低质量模糊变形肢体扭曲多余手指画面抖动字幕水印文字logo横线失真噪点曝光过度参数方面从社区常见实践看第一次测试建议分辨率不超过默认推荐的最高档视频长度从短片段开始运动强度设中等。等画面稳定后再逐步提高分辨率、延长视频时长。分段生成时把每一段都当作独立片段第一段确认主体正确第二段确认镜头运动合理第三段确认风格到位。如果直接一步到位生成完整长视频一旦出错排错成本会很高。6. ComfyUI 本地部署与提示词接入如果你选择本地部署路线社区已经出现了 MiniMAX H3 的 ComfyUI 整合包。下面给出一套通用接入思路具体节点名称和文件路径要以整合包作者文档为准。6.1 环境准备本地部署的通用前置条件包括一台安装了 NVIDIA 显卡驱动的电脑操作系统建议 Windows 10/11 或 Linux。ComfyUI 主程序建议用官方最新版本。MiniMAX H3 模型权重文件放在 ComfyUI 的 models 目录下对应子目录。整合包如果自带依赖环境可以直接运行启动脚本如果没有需要安装 Python 3.10 及以上、PyTorch 带 CUDA 版本。这里不写死版本号因为不同整合包依赖差异很大。检查环境时重点确认两点nvidia-smi 能看到显卡且显存足够Python 环境中 torch.cuda.is_available() 返回 True。6.2 工作流加载打开整合包或 ComfyUI 后把 MiniMAX H3 的 workflow JSON 文件直接拖入浏览器画布。如果你的整合包是自定义节点形式确认 custom_nodes 目录下已经放好了 H3 对应的节点插件。典型工作流结构大致是{ nodes: [ { type: LoadMiniMAXH3Model, model_name: minimax-h3-33b.ckpt }, { type: CLIPTextEncode, text: 第一段第二段第三段合并后的完整提示词 }, { type: MiniMAXH3Ref2Va, reference_mode: character, ref_image: 参考图路径 }, { type: MiniMAXH3Sampler, width: 1024, height: 576, frames: 24, batch_size: 1 }, { type: VAEDecode, vae: h3-vae }, { type: SaveVideo, filename_prefix: minimax_h3_output } ] }这个 JSON 只是节点结构和参数位置的示意不代表真实插件接口实际使用时请以整合包自带的 workflow 为准。重点是把三段式提示词填到提示词编码节点的文本框中其他节点保持默认。6.3 模型节点参数在 ComfyUI 里跑 MiniMAX H3最容易影响结果的是采样器节点里的“步数”“分辨率”“帧数”和“批量大小”。第一次建议把所有参数调低分辨率不要拉满帧数先跑 12 到 24 帧步数按默认批量大小固定为 1。确认流程跑通后再把帧数和分辨率往上加。批量大小设为 2 或更高时显存占用会成倍增长3060 这类显卡很容易直接爆显存建议全程保持 batch_size1。如果你想在本地跑批量任务建议把输出节点换成“有条件保存图片/视频”的节点让工作流在遇到失败时能跳过并继续下一个提示词而不是整个队列卡死。7. 接口 API 调用与批量任务MiniMAX H3 支持官方接口调用适合把提示词模板接入你自己的自动化脚本。下面给出通用 RESTful API 调用示例接口地址、鉴权字段、参数名需要以官方最新文档为准不要照抄不存在的路径。7.1 接口调用通用模板使用前先准备好三样东西API Key 或 Access Token、模型名称、提示词内容。一般的调用流程是携带鉴权 headerPOST 一个 JSON 请求体服务端返回任务 ID然后用任务 ID 轮询结果。7.2 Python 调用示例import requests API_URL https://api.minimaxi.com/v1/text_to_video API_KEY 你的_API_KEY headers { Authorization: fBearer {API_KEY}, Content-Type: application/json } payload { model: MiniMAX-H3, prompt: 第一段... 第二段... 第三段..., negative_prompt: 低质量模糊变形水印, width: 1024, height: 576, frames: 24, batch_size: 1 } response requests.post(API_URL, jsonpayload, headersheaders, timeout60) print(response.status_code) print(response.json())这个示例是标准 POST JSON 格式的模板具体字段名要按官方接口文档调整。返回结果里的任务 ID 用于后续查询生成进度一般在提交后 10 秒到几分钟内可查询到结果。7.3 批量任务目录与队列设计如果你要做批量视频生成最稳妥的结构是“输入提示词文件 - 脚本逐个提交 - 记录任务状态 - 失败重试 - 输出汇总”。下面是一个目录结构建议minimax_h3_batch/ ├── prompts/ │ ├── case_01.json │ ├── case_02.json │ └── case_03.json ├── outputs/ │ ├── case_01.mp4 │ ├── case_02.mp4 │ └── case_03.mp4 ├── logs/ │ ├── submit.log │ └── retry.log └── batch_submit.py批量脚本的通用逻辑是先读取 prompts 目录下所有 JSON 文件逐个提交任务把任务 ID 写入日志每隔一段时间查询一次任务状态如果服务端返回 529 过载错误或超时就把该任务放入重试队列等待 5 到 10 秒后重新尝试。批量任务最容易踩的坑是任务并发过高触发限流。官方服务一般有 QPS 限制建议把并发数控制在 1 到 2 个任务间隔 5 到 10 秒提交一次。宁可慢一点也不要因为频率过高导致账号被临时封禁或限流。8. 资源占用与性能观察MiniMAX H3 的资源占用对你选择在线版还是本地版、用哪种参数组合影响很大。这里给出一个通用的观察方法而不是编造具体数字。在线使用时你不需要关心本地显存但要注意任务排队时间和服务端过载问题。如果频繁遇到 529 错误说明服务端压力较大优先减少提交频率或者避开高峰时段。本地部署时重点观察几个指标显存占用Windows 下用任务管理器查看“专用 GPU 内存”Linux 下用 nvidia-smi 连续观察。VRAM 峰值在生成开始到结束期间显存一般是“初始加载模型 - 推理过程 - 释放”三段式变化峰值通常出现在推理中段。内存占用加载大模型时系统内存同样会被大量占用需要关注页面文件的设置。温度与降频长时间跑批量任务时显卡温度升高会触发降频导致生成速度变慢。要降低显存占用从高到低依次是降低批量大小到 1、降低视频帧数、降低分辨率、减少参考图分辨率、使用 stream 推理模式如果模型支持。这里特别提醒视频生成模型的本地部署与图像模型完全不同。图像模型 6G 显存可以舒服跑 SD 1.5但视频生成需要额外缓存多帧特征显存压力成倍增长。3060 用户如果只是听说“整合包能做”就直接拉高分辨率很容易在生成阶段报 CUDA out of memory。正确的做法是先跑最低参数确认稳定后逐步增加并记录每次生成的显存峰值。如果你在 ComfyUI 里跑批量任务建议在脚本里加入显存占用日志每个任务结束后记录当时显存空闲值这样能提前发现任务队列里的累积显存泄漏。9. 常见问题与排查方法下表整理了 MiniMAX H3 使用过程中最常见的几类问题覆盖官方在线、API 调用和 ComfyUI 本地部署三条路线。问题现象可能原因排查方式解决方案在线网页提交后长时间不返回结果服务端任务队列拥挤观察是否有排队提示或任务状态轮询等待或降低提交频率避开高峰时间API 返回 529 overloaded服务端过载属于暂时性错误查看错误描述是否提示 server-side issue等待 5 到 10 秒后重试减少并发数生成的视频主体一致性差第一段主体描述过于复杂检查是否在 prompt 中塞入了太多角色和道具精简主体到一到两个使用 ref2va 参考模式保持一致性镜头运动完全不符合预期第二段没有使用具体镜头术语检查是否写了“好看的镜头”这类模糊描述改写为“推镜头”“低机位仰拍”“环绕拍摄”等专业术语风格混乱、颜色杂乱第三段风格关键词过多或互相冲突检查是否同时堆砌了多个冲突风格把风格关键词限制在 15 到 30 个主调统一ComfyUI 加载模型报显存不足显卡显存不够或 batch_size 过高nvidia-smi 观察显存占用batch_size 调整为 1降低分辨率和帧数关闭其他占用显存的程序ComfyUI 启动后页面打不开端口被占用或服务未启动查看控制台日志和端口监听状态更换端口或结束占用进程后重启本地部署生成视频非常慢显卡较老或 CPU 参与推理检查torch.cuda.is_available()是否为 True确认 PyTorch 是 CUDA 版本避免在没有 CUDA 的环境中运行批量任务中途卡住单个任务生成失败但没有失败重试机制查看日志中最后一个成功任务脚本加入超时控制和失败重试队列本地部署缺少模型文件模型权重未下载或路径不对检查 models 目录下文件大小和扩展名按整合包说明放置正确权重并重启 ComfyUI这里要特别强调 529 错误。热词里出现的“api error: 529 overloaded. this is a server-side issue, usually temporary”是服务端过载的错误返回属于暂时性问题不是你账号或提示词的问题。遇到后不要反复重试轰炸等待 10 到 30 秒再试更有效。10. 最佳实践与合规提醒最后一部分给出工程化使用建议和合规边界。这些内容来自社区实践和通用 AI 视频工具使用规范建议直接收藏。第一次使用先做最小化验证。把提示词模板缩短到一句话的核心主体参数全部默认生成一个最短视频片段。确认流程跑通后再逐步增加三段式提示词的复杂度。不要一开始就冲高分辨率和长时长。保留一套“最小可运行配置”。把工作中最常用的三段式模板、参数组合、负面提示词存成文件放到固定目录里。这样无论是官方在线提交、API 调用还是 ComfyUI 工作流都能直接复用同一套提示词基线减少反复调整成本。模型文件、输入参考图、输出视频分目录管理。目录结构参考 7.3 节尽量做到每个任务独立成文件。批量任务一定要加日志和失败重试。日志记录每次提交的任务 ID、请求时间、返回状态和失败原因失败时自动重试 2 到 3 次仍失败则记录到失败清单避免任务静默丢失。接口服务要限制访问范围。如果你把 MiniMAX H3 API 封装成自己的服务不要让 API Key 直接暴露在前端在服务端配置访问白名单对请求频率做限制防止被刷接口。合规问题必须放在前面。MiniMAX H3 生成的视频内容来自模型训练数据和你的输入提示词生成结果不构成你随意使用的理由。涉及真实人物肖像时需要获得本人授权涉及品牌 Logo、影视角色、音乐版权素材时需要确认有合法使用权任何生成内容都不能用于制作虚假信息、欺诈、诽谤或冒充他人内容。本地部署时涉及企业内部数据要注意隐私保护不要把敏感数据提交给非私有的外部服务。发布或商用前做效果复核。AI 视频生成不一定能完全避免字幕乱码、人物表情僵硬、动作物理不协调的问题。对外发布前打包检查一遍成片质量尤其是字幕、人脸、品牌 Logo 这几个最容易被观众注意到的区域。11. 总结与下一步MiniMAX H3 这套三段式官方 SKILL 提示词模板最值得尝试的点是它把复杂的视频生成控制拆成了“主体场景 - 镜头语言 - 风格特效”三层既适合在线快速出片也适合接入 ComfyUI 本地工作流和 API 批量任务。相比直接写一大段无序 prompt三段式结构更容易定位问题画面主体不对改第一段镜头不动改第二段风格不对改第三段。最先应该验证的功能是用 5.4 节的完整模板在官方在线平台生成一个短视频片段检查主体、镜头运动和风格是否符合预期。如果在线流程跑通再去考虑本地部署或 API 批量任务。最容易踩的坑有三个一是把提示词写得过于复杂一个画面塞多个主体导致一致性崩坏二是第二段镜头描述用了“好看”“炫酷”这类模糊词模型无法理解具体动作三是本地部署时不看显存占用直接拉满参数导致 CUDA out of memory。后续可以继续扩展的方向包括把三段式模板做成配置化 JSON批量生成不同风格的分镜在 ComfyUI 中把 ref2va 参考模式和三段式提示词组合成更完整的角色一致性工作流通过 API 把 MiniMAX H3 接入到自己的内容生产平台实现“输入脚本 - 自动分镜 - 自动生成视频素材”的流水线。整套流程建议先收藏备用下一篇可以继续拆 H3 的 ref2va 参考模式在角色一致性上的更细参数。