Model Optimizer 支持矩阵完全解读哪些模型能量化、能剪枝、能蒸馏【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-OptimizerModel OptimizerModelOpt是 NVIDIA 开源的统一模型优化库把量化Quantization、剪枝Pruning、蒸馏Distillation、神经网络架构搜索NAS、推测解码Speculative Decoding和稀疏化六大技术整合到一个库里把 Hugging Face / PyTorch / ONNX 模型压缩后部署到 TensorRT-LLM、TensorRT、vLLM 等推理框架。很多新手最关心的问题就是我的模型到底支不支持这些优化本文带你一次看懂官方的 7 张支持矩阵。️ 一分钟总览七大技术各自支持什么先给结论官方把支持矩阵分散在各示例目录的 README 中入口汇总在 README.md 的 Model Support Matrix 章节技术一句话说明典型支持范围矩阵文档LLM/VLM 量化PTQ 压缩 2x~4x提速推理Llama、Qwen、DeepSeek、Kimi、GLM、Nemotron 等examples/hf_ptq/README.md扩散模型量化图像/视频生成加速FLUX、SDXL、SD3 等examples/diffusers/README.md剪枝移除冗余权重缩小参数量MinitronMegatron、PuzzletronHF、FastNASCVexamples/pruning/README.md蒸馏小模型模仿大模型行为Nemotron、Llama 3/4、Gemma 2/3、Phi 3、Qwen2 等examples/llm_distill/README.md推测解码训练草稿模块减少解码延迟Medusa / EAGLE1/2/3Llama 2/3、Mistral、Phi 3、Qwen 等examples/speculative_decoding/README.md量化感知训练QAT/QAD几步训练找回量化损失的精度Qwen、Nemotron ChatML 等FSDP2/DDP/DeepSpeedexamples/llm_qat/README.mdONNX / Windows 量化传统模型与 Windows 平台见下表docs/source/guides/0_support_matrix.rst 总原则格式越新NVFP4/FP8要求的 GPU 越新剪枝/蒸馏不挑格式挑框架Minitron 走 MegatronPuzzletron 走 Hugging Face。 量化支持矩阵LLM/VLM 哪些模型能打这是用户量最大的一张表摘自 examples/hf_ptq/README.md✅ 表示官方已验证模型FP8INT8 SmoothQuantINT4 AWQW4A8NVFP4Llama 3.x✅❌✅✅✅Llama 4✅❌❌❌✅Mixtral✅❌✅❌✅Qwen 2 / 2.5✅✅✅✅✅Qwen 3 / 3.5 MOE / Next✅---✅DeepSeek V3、R1、V3.1----✅Kimi K2 / K3----✅GLM-4.7✅---✅Nemotron-3✅❌❌❌✅Qwen-VL 系列VLM✅---✅几个新手容易踩的坑NVFP4 需要 Blackwell GPU TensorRT-LLM ≥ 1.2且官方推荐用nvfp4_mlp_only/nvfp4_experts_only等部分量化配置保精度——只量化 MLP/专家层保留敏感注意力层的高精度。VLM 默认只量化语言侧视觉编码器保持高精度Qwen3-VL 等可选配 FP8 视觉编码器 recipe。量化精度算法Max / MSE / Local Hessian的选择会直接影响权重量化后的分布下面这张图直观展示了三种算法下缩放权重的差异扩散模型量化SDXL、FLUX 全格式覆盖图像生成模型的支持矩阵同样齐全examples/diffusers/README.md 显示 FLUX、SD3、SDXL、SDXL-Turbo、SD2.1全部支持 FP8、INT8 SmoothQuant、INT4 AWQ、W4A8、NVFP4含 SVDQuant其中 SD3/SDXL 还支持 Cache Diffusion 加速。下面的对比图就是 SDXL 量化后生成质量的参考样例格式 × GPU 硬性要求Linux来自 docs/source/guides/0_support_matrix.rst 的 Feature Support Matrix量化格式量化粒度最低 GPU 代际可部署到NVFP4 (W4A4)Per-Block 权重激活Blackwell 及以后TensorRT、TensorRT-LLMFP8 (W8A8)Per-Tensor 权重激活Ada 及以后TensorRT*、TensorRT-LLMINT8 SmoothQuantPer-channel 权重 / Per-Tensor 激活Ampere 及以后TensorRT*、TensorRT-LLMINT4 AWQ (W4A16)块状 INT4 权重Ampere 及以后TensorRT、TensorRT-LLMW4A8实验性INT4 权重 FP8 激活Ada 及以后TensorRT-LLM*Windows 平台的矩阵与 Linux 略有差异如 ONNX FP8/INT8 用 Max 校准、部署到 ORT-CUDA/ORT-DML同样在该文档的 Windows 标签页中。✂️ 剪枝支持矩阵三个算法三种玩法剪枝矩阵按算法而非按模型列出examples/pruning/README.md这点和量化矩阵完全不同算法适用模型剪枝约束方式MinitronMegatron-coreM-Bridge / M-LM上的稠密 / MoE / Mamba 混合 LLM含 VLM 语言侧自动指定params、active_params、memory_mb目标手动hidden_size、ffn_hidden_size、num_layers、MoE 专家数等PuzzletronHugging Face 稠密 / MoE / 混合模型与 VLM指定target_memory/num_params/target_latency_seconds按层搜索 FFN 宽度、KV 头数、MoE 专家数等异构剪枝FastNAS计算机视觉模型flops、params两个实用提示想用Minitron但模型只在 HF 上只要 Megatron-Bridge 支持该架构就可以导入后再剪。剪枝后精度掉太多官方标准动作是剪枝 蒸馏两阶段把精度找回来。下面是 Qwen3-8B 上 Minitron vs Puzzletron 剪枝蒸馏后的 MMLU 结果对比绿色为蒸馏后虚线为教师模型Puzzletron 还能画出压缩率-精度权衡曲线帮你决定该剪到多狠 蒸馏支持矩阵谁可以当学生蒸馏矩阵examples/llm_distill/README.md列出的是已验证可跑通的模型但不受限于此NemotronMamba 混合、Llama 3/4、Gemma 2/3、Phi 3、Qwen 2 均 ✅。内置损失函数包括mtd.LogitsDistillationLoss()标准 KL 散度mtd.MGDLoss()面向 2D 卷积输出的掩码生成蒸馏mtd.MFTLoss()带 MiniFineTuning 阈值修正的 KL 损失蒸馏效果如何下面这张图展示了剪枝后的 Nemotron-3-Nano-30B 模型在知识蒸馏过程中MMLU、GPQA、LiveCodeBench 等 9 项基准随训练 token 数逐步逼近教师模型的过程⚡ 推测解码与 QAT 支持矩阵推测解码examples/speculative_decoding/README.md按草稿算法支持模型MedusaEAGLE1/2EAGLE3Llama 2 / 3 / 3.1✅✅✅Mistral、Phi 3✅✅✅Qwen 1.5 / 2 / 2.5 / 3✅✅✅Kimi K2.5 / K2.6--✅量化感知训练 QAT/QADexamples/llm_qat/README.md支持 Qwen 2/2.5/3/3.5 稠密模型与 Nemotron ChatML 模型内置 recipe 覆盖 NVFP4W4A4FP8 KV、FP8W8A8、INT4 权重-only 及混合精度训练后端推荐 FSDP2examples/llm_qat/configs/accelerate/ 下有现成配置。量化后精度不理想时QAD量化感知蒸馏几轮训练即可拉回下图是 Qwen3.6-35B-A3B 的 W4A4 NVFP4 QAD 六个基准的恢复过程 新手决策清单我的模型该怎么优化只是想缩小、加速、不想训练→ 查 LLM 量化矩阵Llama/Qwen/DeepSeek 首选 NVFP4新卡或 FP8Hopper老卡用 INT4 AWQ。要大幅缩参数→ 模型在 Megatron 生态走 Minitron纯 HF 模型走 Puzzletron剪完接一轮蒸馏。量化掉点→ 开 QAT/QAD 训练几轮或用 AutoQuantize 自动分配混合精度。延迟敏感长文本生成→ Llama/Qwen 系列训练 EAGLE3 推测解码模块。做图像生成→ SDXL/FLUX 直接 FP8 或 NVFP4还能叠加 Cache Diffusion。想深入看 YAML 配方recipes体系可以浏览 modelopt_recipes/general/ptq/ 与 modelopt_recipes/model_type/量化核心 API 在 modelopt/torch/quantization/剪枝核心 API 在 modelopt/torch/prune/。⚠️ 注意带 * 号的功能为实验性支持✅ 仅代表官方已验证不代表其他模型不能跑——社区实践中很多未列出的模型也能成功量化。具体行为以 docs/source/guides/0_support_matrix.rst 和各示例 README 的最新版本为准。【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-Optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考