U²-Net 是一种为显著性目标检测设计的两层嵌套 U 型结构网络它通过创新的RSU 残差子块在不依赖预训练骨干网络的情况下从零训练即可达到 SOTA 性能并因其出色的细节捕捉能力成为rembg等背景移除工具的核心模型。一、要解决什么问题显著性目标检测Salient Object Detection, SOD的目标是分割出图像中最吸引人的目标或区域。传统方法通常依赖在 ImageNet 上预训练的骨干网络如 VGG、ResNet来提取特征但这存在两个问题一是预训练模型参数量大、计算成本高二是预训练任务图像分类与分割任务之间存在目标域差异。U²-Net 的出发点很直接能否设计一个无需预训练、从零训练就能达到 SOTA 的轻量级网络为此作者提出了一种两层嵌套的 U 型结构让网络在编码器和解码器的每一个阶段内部都嵌入一个小的 U-Net从而在多个尺度上反复进行局部细节与全局语义的融合。二、核心架构2.1 整体结构U²-Net 的整体是一个经典的编码器-解码器Encoder-Decoder架构由 6 个编码器阶段E1–E6、5 个解码器阶段D1–D5和一个显著性图融合模块组成。编码器每个阶段通过下采样逐步降低分辨率、增加通道数捕获从局部细节到全局语义的多尺度特征。解码器通过上采样逐步恢复分辨率并与编码器对应阶段的特征进行跳跃连接Skip Connection以保留空间细节。2.2 核心创新RSU 模块U²-Net 最核心的创新是RSUResidual U-block模块。每个编码器和解码器阶段都由一个 RSU 模块构成而每个 RSU 模块内部又是一个小型的 U 型结构。RSU 模块由三部分组成组件作用输入层收集局部特征并变换通道数U 型编码-解码结构提取和编码多尺度上下文信息残差连接将输入特征与 U 型结构输出相加残差连接的形式化表达为H_RSU(X) U(F(X)) F(X)其中F(X)提取局部上下文特征U(F(X))提取多尺度特征两者相加使 RSU 同时保留局部细节和多尺度全局信息。RSU 模块的参数用RSU-L(C_in, M, C_out)表示其中L是编码器层数层数越大对大尺度信息的处理能力越强M是中间层通道数。这种设计使得 U²-Net 可以灵活控制每个阶段的感受野和容量。2.3 与 U-Net 的关键区别维度U-NetU²-Net结构单层 U 型两层嵌套 U 型跳跃连接编码器→解码器直接拼接每个 RSU 内部也有跳跃连接预训练常依赖 ImageNet 预训练无需预训练从零训练参数量较小原始约44M较大多尺度融合单一尺度层次多尺度重复融合三、性能表现3.1 基准数据集U²-Net 在6 个常用 SOD 基准数据集上进行了评估数据集图像数DUT-OMRON5,168DUTS-TE5,019HKU-IS4,447ECSSD1,000PASCAL-S850SOD3003.2 关键指标原始 U²-Net 模型大小为176.3 MB在多个数据集上达到与预训练骨干网络方法相当甚至更优的性能。与 U-Net 相比U²-Net 实现了92.77% 的召回率U-Net 为 85.21%损失降低了约 3.75 个百分点。3.3 轻量化版本U²-NetP作者还提出了轻量版U²-NetP与 U²-Net 架构相同但减少了各阶段特征图数量如 En_5 从 512 降至 64参数量大幅压缩适合边缘部署和实时应用。四、应用场景4.1 背景移除与抠图这是 U²-Net 最广泛的应用。rembg是一个基于 U²-Net 的 Python 背景移除库通过 ONNX Runtime 运行预训练的 U²-Net 模型输入图像输出RGBA 格式的抠图结果默认模型即为u2net。它支持 CPU、CUDA、CoreML 等多种后端。4.2 图像编辑与自动抠图一项专利将 U²-Net 与 Swin Transformer 级联构建端到端自动抠图网络U²-Net 负责生成三分图trimap的语义分割Swin Transformer 负责精细抠图最终得到 alpha matte 用于前景替换和图像编辑。4.3 医疗图像分割U²-Net 被广泛应用于医疗影像分割包括皮肤病变分割用于肿瘤区域的精准识别显微镜图像显著性检测改进版本模型大小从 168 MB 降至72.5 MB减少 56.85%预测精度从 92.24% 提升至97.13%细胞幻灯片分析改进版在 600 张临床细胞幻灯片上达到 mIoU88.3%相比原始 U²-Net 提升33.2%4.4 航拍与红外图像U²-Net 生成的显著图可用于红外航拍图像的行人检测增强。在 ComNet 数据集上显著图通过通道替换或加权融合方式增强热红外图像使行人目标区域更加突出。4.5 农业无人机影像基于 U²-Net 的水稻丛影像去背模型可用于无人机空拍影像的去背处理去除土壤、杂草等背景噪声突出作物区域。4.6 工业检测U²-Net 被用于卫星图像中低层建筑的提取配合 Focal Loss 解决前景像素与背景像素严重不平衡的问题。五、改进与变体原始 U²-Net 参数量较大约 44M在实时或边缘部署场景下计算成本较高。学术界和工业界提出了大量改进方案改进方向代表方法核心思路轻量化MNSEg-Net用紧凑残差 U-Net 块替代原始 RSU参数量从 44M 降至2.46MFLOPs 降低一个数量级以上注意力增强SCCA-U2Net在特征提取阶段引入分离坐标通道注意力F1-score 提升 0.8%多尺度融合U²-Net_MFF多尺度特征信息融合精度、召回率、MIoU、F1 均有提升深度可分离卷积DPSAU2-Net用残差深度可分离 U 块增强局部纹理提取在多个医疗数据集上超越 TransUNetGhost 卷积显微镜 SOD 改进用 Ghost 卷积和简单金字塔池化实现轻量化六、训练策略6.1 损失函数原始 U²-Net 使用BCE Loss并对每个解码器阶段的输出都进行深度监督形成多级损失融合。具体做法是将 d0–d6 共 7 个输出分别与标签计算 BCE Loss然后加权求和。改进工作引入了更丰富的损失组合例如SSIM Loss IoU Loss BCE Loss的融合以及Dice Loss Focal BCE Loss的加权组合。6.2 优化器与超参数使用Adam 优化器初始学习率1e-3betas(0.9, 0.999)。训练时进行数据增强包括随机颜色变换、裁剪、翻转、仿射变换等。七、口述总结“U²-Net 是 2020 年发表在 Pattern Recognition 上的显著性目标检测网络核心创新是两层嵌套的 U 型结构和RSU 残差子块。传统 SOD 方法依赖 ImageNet 预训练骨干U²-Net 证明从零训练也能达到 SOTA。它的整体是编码器-解码器每个阶段都由 RSU 模块构成而 RSU 内部又是一个小的 U-Net通过残差连接把局部细节和多尺度上下文融合起来。在 DUT-OMRON、DUTS-TE 等 6 个基准数据集上它用 176MB 的模型达到与预训练方法相当的性能。工程上最出名的应用是rembg库它是 Python 生态里最常用的背景移除工具默认模型就是 U²-Net。后来大量工作对它做轻量化改进比如把参数量从 44M 降到 2.46M同时保持分割精度。面试里如果被追问我会强调RSU 是 U²-Net 的灵魂它让网络在每个尺度上都做一次完整的编码-解码而不是只在最顶层做一次。”八、一句话收束U²-Net 的本质是把 U-Net 的“一次融合”变成“层层嵌套的多次融合”。每一次 RSU 内部的编码-解码都在不同尺度上重新审视图像使得网络无需预训练就能同时把握“整体在哪里”和“边缘长什么样”。这也是它成为rembg默认模型、并在医疗、农业、航拍等领域广泛落地的根本原因。