
新手入门NVIDIA Model Optimizer一文看懂5大模型压缩技术全景图【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-OptimizerNVIDIA Model Optimizer简称 ModelOpt是一个开源的模型压缩与推理加速库它将量化、剪枝、蒸馏、投机解码、稀疏化5大SOTA模型优化技术整合到统一的 Python API 中。你只需输入一个 Hugging Face / PyTorch / ONNX 模型经过几行代码的压缩优化就能导出可直接部署到 TensorRT-LLM、vLLM、SGLang、TensorRT 的量化检查点在不损失太多精度的前提下把模型体积缩小 2~4 倍、推理速度成倍提升。本文面向新手一张全景图带你看懂这5大模型压缩技术分别是什么、怎么配合、去哪找示例。 一键安装30秒跑通第一步Model Optimizer 已正式发布到 PyPI一条命令即可安装pip install -U nvidia-modelopt[all]如果你使用 NVIDIA 官方容器镜像如 PyTorch、TensorRT-LLM、NeMo 镜像则已预装 Model Optimizer升级版本即可。新手建议从 examples/hf_ptq/ 目录下的 LLM 量化示例开始那是全仓库最成熟的入门路径。 核心工作流输入 → 优化 → 导出Model Optimizer 的使用逻辑非常清晰可以概括为三步步骤说明示例1. 输入加载 HF、PyTorch 或 ONNX 模型AutoModelForCausalLM.from_pretrained(...)2. 优化用 Python API 组合量化、剪枝、蒸馏等技术mtq.quantize(model, NVFP4_CFG, forward_loop)3. 导出导出统一 HF 格式检查点直接部署TRT-LLM / vLLM / SGLang五大技术都围绕这条流水线展开下面逐一拆解。️ 全景图5大模型压缩技术一图看懂技术核心思路主要收益示例入口量化 Quantization把 16 位权重降到 FP8/INT8/NVFP4 等低精度体积↓2~4x推理加速examples/hf_ptq/剪枝 Pruning删除冗余参数、注意力头、MoE 专家参数量/内存↓examples/pruning/蒸馏 Distillation让小模型模仿大模型小模型逼近大模型精度examples/llm_distill/投机解码 Speculative Decoding草稿模型猜多个 token主模型一次验证生成延迟大幅↓examples/speculative_decoding/稀疏化 Sparsity只存储非零参数及位置如 2:4 结构存储/算力↓examples/llm_sparsity/1️⃣ 量化压缩模型体积 2~4 倍的第一选择量化是最常用的模型压缩手段——把 BF16 权重转成 NVFP4、FP8、INT8、INT4 等低精度格式。训练后量化PTQ不需要任何重训练只需 128~512 个校准样本就能标定缩放因子精度通常很稳健。内置 SmoothQuant、AWQ、SVDQuant、Double Quantization 等成熟算法新手推荐先用NVFP4_MLP_ONLY_CFG这类保守配置只量化 MLP 层在精度和压缩率间取得平衡AutoQuantize更进一步自动搜索每层的最佳精度分配NVFP4/FP8/BF16 混合在给定有效位宽预算下最大化精度上图展示了 AutoQuantize 的量化精度权衡有效位宽越接近 8纯 BF16精度越接近原始模型而在 5~6 bit 区间自动混合精度分配能显著优于全部层一刀切的默认 NVFP4 量化。 相关资源示例脚本 examples/hf_ptq/hf_ptq.py、量化算法实现 modelopt/torch/quantization/、官方教程 docs/source/guides/1_quantization.rst2️⃣ 剪枝删掉模型里没用的部分剪枝直接移除冗余参数从隐藏维度、FFN 宽度、注意力头数到 MoE 专家数量都可以裁。Model Optimizer 提供三种互补方法Minitron基于激活幅值适合 GPT/Mamba/MoE 模型支持手动指定目标维度也支持指定目标参数量后自动搜索Puzzletron基于混合整数规划MIP的 NAS 搜索算法为 LLM/VLM 找异构最优子网FastNAS面向计算机视觉模型的快速子网搜索 相关资源examples/pruning/含 Minitron vs Puzzletron 完整对比教程、examples/puzzletron/、实现代码 modelopt/torch/prune/3️⃣ 蒸馏让小模型学会大模型的本事知识蒸馏让一个较小的学生模型去模仿较大教师模型的输出行为从而以更低的部署成本获得接近大模型的精度。Model Optimizer 把蒸馏封装成一组简单的包装器给定教师和学生模型几行代码即可启动训练。蒸馏还常与量化联用即QAD量化感知蒸馏用教师模型监督量化后的学生模型几轮训练即可找回 PTQ 损失掉的精度——这是 Qwen3.6-35B-A3B 在 W4A4 NVFP4 下恢复多基准精度的关键手段。 相关资源examples/llm_distill/、端到端 QAD 教程 examples/megatron_bridge/tutorials/Qwen3.6-35B-A3B/、实现代码 modelopt/torch/distill/4️⃣ 投机解码先猜后验一次多吐几个 token自回归生成的瓶颈在于一个 token 一次前向。投机解码用一个轻量草稿模型如 EAGLE、Medusa先预测 γ 个候选 token主模型再在一次前向中并行验证——猜对了就能一步接受多个 token显著降低生成延迟。Model Optimizer 提供端到端的草稿模块训练流水线支持在线、离线、流式三种训练模式训练好后可直接部署。官方示例中 Llama-3.2-1B 作为草稿模块配合基座模型训练README 里附有支持矩阵和预训练投机模块检查点。 相关资源examples/speculative_decoding/、实现代码 modelopt/torch/speculative/5️⃣ 稀疏化只存非零参数2:4 结构化稀疏意味着每 4 个权重里只有 2 个非零配合支持稀疏加速的硬件可进一步提升吞吐。Model Optimizer 支持两条路径PTS训练后稀疏化用 SparseGPT 方法在校集上直接把权重剪成 2:4 结构无需训练SAT稀疏感知训练在微调中维持稀疏模式 相关资源examples/llm_sparsity/、实现代码 modelopt/torch/sparsity/ 技术怎么组合官方实战配方真正的高手玩法是多技术叠加。官方公布的两个典型案例Nemotron-3-Nano-30B-A3B剪枝 两阶段蒸馏 FP8 量化达到2.6× vLLM 吞吐、2.6× 内存缩减Qwen3.6-35B-A3BNVFP4 W4A4 PTQ QAD达到1.30× vLLM 吞吐、3.1× 检查点体积缩减且精度基本追平 BF16图中可以看到无论是以7B 参数量还是78k MiB 内存为目标单纯剪枝灰色柱后模型精度远低于教师模型而剪枝后再蒸馏绿色柱就能把 MMLU 分数拉回到接近甚至超过原始大模型的水平——这正是压缩恢复组合拳的价值。仓库还内置了 modelopt_recipes/ 配方库按模型类型Qwen、Llama、Gemma、Nemotron 等组织好现成的 PTQ/QAD 配置新手可以直接取用。 压缩之后导出与部署Model Optimizer 的杀手锏是统一导出 API量化/压缩后的模型一键导出为统一 HF 检查点格式TensorRT-LLMPython/C 后端、vLLM、SGLang 均可直接加载部署无需手动改格式。扩散模型同样受益examples/diffusers/ 提供了 PTQ、QAT、QAD 和Cache Diffusion免训练缓存加速——下图中 SDXL 通过缓存加速在 11 步生成原本 20 步时画质几乎无损速度提升 1.6 倍以上。 部署指南docs/source/deployment/含 TensorRT-LLM、ONNX Runtime、统一 HF 导出三篇 新手学习路线与资源导航你想做的事去哪里第一次量化一个 LLMexamples/hf_ptq/含 FP4/FP8/AWQ 三个 Notebook量化扩散模型examples/diffusers/剪枝 蒸馏组合实验examples/pruning/从零训练投机解码草稿模型examples/speculative_decoding/现成压缩配方modelopt_recipes/各技术官方文档docs/source/guides/查模型支持矩阵docs/source/guides/0_support_matrix.rst核心库源码modelopt/torch/一句话总结NVIDIA Model Optimizer 把量化、剪枝、蒸馏、投机解码、稀疏化五大模型压缩技术装进了一个统一 API——新手从 PTQ 示例起步进阶尝试剪枝蒸馏量化组合拳最后统一导出到 TensorRT-LLM/vLLM 部署整条链路官方都配好了开箱即用的脚本和配方。Happy optimizing! 【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-Optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考