就在上个月MiniMax 放开了 H3 的权重一个多月里围绕它长出来的衍生模型已经超过三百个。这些模型出自不同团队解决的问题却很集中都是让生成出来的视频更贴近手里那条参考片。复刻这件事容易失控的环节就那么几处衍生模型也大致照这几处分了工。一、衍生模型都在改什么速度是最先被动手的地方。少步蒸馏现在是主流做法把几十步的采样压到几步。海马云开源的 RH Lightning 在同一批 4 张 RTX 6000D 上生成 5 秒视频BF16 五十步原本要 348.8 秒蒸馏后降到 43 秒完整方案跑完 28.7 秒精度仍保持 BF16。fal 的做法更直接五秒 720p 压到 3 秒出片吞吐约为官方接口的 35 倍后来的 Turbo 版把延迟进一步压到 1.4 秒。镜头一多人物走样和商品变形就冒出来多镜头长叙事向来是废片最集中的地方。海马云的 RH Enhanced 用一套长程记忆机制在跨帧维度上做增强厂商公布的 2000 组对照里16 镜以上的人物崩坏率下降六成以上。腾讯联合新加坡国立大学和香港理工大学做的 H3-World 换了个思路把每一条动作指令绑定到它该生效的那几帧总共只调整了 0.199% 的参数。身份和物件这一类数量最多。角色适配器让同一个人在多个镜头里保持同一张脸画质适配器专门修掉过锐和硬光带来的塑料感。有社区作者把官方放出的几条权重分支融合成一个模型文生视频、图生视频、参考生视频、视频生视频都收进同一个工作流省掉在节点之间来回切换。运镜这一类的做法是把镜头语言拆成开关。Camera Motion 把推、拉、摇、移、环绕、升降、航拍、手持等九类运镜拆成独立选项另外配了五十多条提示词。动作类用真实武打素材训练物理类专门处理碰撞、堆叠、掉落违反重力的情况。社区里流传的一套配方把武打、物理、运镜三只适配器按 0.5、0.3、0.8 的强度叠起来。分辨率这一类是被开源边界逼出来的。放出来的 H3-Base 只负责 768p画面要更清楚得靠超分RH Upscale 在十三个参测配置里综合得分第一分五档人脸类素材单独占一档。二、H3 这个基座做得怎么样前面这些模型能长出来靠的是 H3 本身留出的余地。H3 是 33B 的单流稠密 Transformer文字、图像、视频、音频的 token 进同一条序列。其中两个设计取向值得单独说。音画同源这一处最直接。画面和 32kHz 立体声在同一次前向里生成配音和音效不需要另起一条管线去对口型。参考则被当成一等的输入。全模态参考模式下一次生成最多能喂 9 张图、3 段视频、3 段音频分别用来锁定人物长相、动作风格和音色。参考给得越具体留给模型自己决定的部分就越少。权重放开后下载量很快突破 2400 万次这个数字多少能说明地基的成色。开源也有它的边界。H3-Base 负责生成 768p 音视频把多模态指令翻译成模型可读表示的 Context-IR、把结果重生成到 2K 的 Regenerate-2K都留在官方接口一侧第三方衍生模型的输出上限因此停在 768p。三、单点能力凑不成一条流程把这些模型挨个试一遍会发现每一个都只处理一处问题。加速的不管身份管身份的不管运镜超分的补不了长镜头里的走样。真正决定一条片子能不能用的是这些能力怎么排。排的关键在顺序。先用参考图把身份和物件锚住再用脚本写清每一段的动作和镜头生成之后逐帧核对。顺序对了问题在生视频之前就暴露出来返工的成本是几张图。顺序错了问题要等成片才暴露返工的成本是一整条片子。锚点的密度是能量化的。只给首尾两张图一条 15 秒的片子中间有四百多帧全由模型决定。把参考帧加密到每秒一张每一段自由发挥的窗口压到二十多帧模型要做的事情从一个完整片段的创作变成一个夹在两个确定画面之间的小填空。核对方式也跟着变从整体看片子变成逐张看图哪一秒的商品不对扫一遍就能定位。四、咔嗒爆的分镜复刻流程流程分四步每一步对应一处容易失控的地方。时长校验把范围框在 4 到 15 秒时间框架先定下来。商品图走参考帧逻辑官方建议用白底多角度图图越清楚成片里的商品越不容易变样。按秒截取的分镜图留住原爆款的构图和节奏同时把画面里的商品换成新的。这一层产出的十几张锚点会先做核对商品有没有换对是重点不满意可以重新生成也可以手动补一张。脚本环节把每一段的主体动作、身体细节、表情、产品展示、镜头变化和光影变化分开写起止时间可改最后一个分镜的结束时间不超过 15 秒。四步走完模型要自由决定的部分已经很少。生成之后再用剪辑工具过一遍删掉不满意的镜头把原爆款的音频拆出来铺到新片上一条复刻片就成型了。五、把多个模型接进同一条流程咔嗒爆接入的模型里MiniMax H3 和 Seedance 2.5 是两条主力线另外还接入了其他几款视频模型比如阿里的Wan-3.0等。各家的长处不一样有的在单镜画质和口型同步上更稳有的在多镜头参考和音画同源上有优势能够适应不同的生片需求。平台按片子的类型和镜头要求调度同一个复刻需求可以换模型重跑前后的流程保持不变。同一个脚本在 H3 和 Seedance 2.5 上跑出来的片子风格和节奏会有差别多试一版能选的空间就大一些。前面那些衍生模型收窄的能力也是通过这套流程接进来的哪一项需要补就配哪一类模型。模型还在持续更新新的一批接进来之后能覆盖的片子类型会更多。