文章目录一、镜面检测介绍二、术语表 glossary三、镜面检测模型1.通用型语义分割 / 边缘检测模型EGNet、MINet、LDF、VST2.经典语义分割骨干网络PSPNet、DANet、UperNet3.显著目标检测 (Salient Object Detection, SOD)4.玻璃检测 (glass detection)5.专用镜面检测模型(Mirror Detection)MirrorNet、VCNet、SATNet、CSFwinformer四、镜面检测数据集1.MSD(Mirror Segmentation Dataset2019)简单场景2.PMD(Progressive Mirror Detection Dataset2020)复杂真实场景3.VMD (Video Mirror Dataset)视频镜面检测数据集4.RGBD-Mirror dataset五、组内发表的相关论文1.CSFwinformer2.VMD-NetVideo Mirror Detection3. 《Glass Makes Blurs: Learning the Visual Blurriness for Glass Surface Detection》4.Visual Chirality Cue六、镜面检测的方法 (新老对比)一、镜面检测介绍镜面检测(Mirror Detection) 属于 计算机视觉(Computer Vision) 领域中的 **图像语义分割(Image Semantic Segmentation) ** 、物体检测(Object Detection)、纹理分析(Texture Analysis)的子领域。领域论文1.镜面检测(Mirror Detection)2.玻璃检测(Glass Detection)3.语义分割(Semantic Segementation)4.目标检测(Object Detection)5.纹理分析(Texture Analysis)二、术语表 glossary镜面和玻璃的区别镜面是反射玻璃是透射缩写英文全称中文释义拓展GDDglass detection dataset玻璃检测数据集GSDglass surface dataset玻璃表面数据集MSDMirror Segmentation Dataset镜像分割数据集PMDProgressive Mirror Detection dataset渐进镜面检测数据集CAMOcamouflaged object images dataset伪装目标图片数据集visual detection task视觉检测任务object detection目标检测Object detection is the task that aims to detect and locate the object in the images or videos,which has attracted considerable research attention in recent years.CODConfusing object detection混淆目标检测general object detection一般目标检测salient object detection显著目标检测mirror detection镜面检测glass detection玻璃检测camouflaged object detection伪装目标检测MAEMean Absolute Error平均绝对误差BERBoundary Error Rate边界误差率MAEMean Absolute Error平均绝对误差backbone骨干(网络)mirror detection镜面检测glass detection玻璃检测generalization泛化性quantitative comparision定量比较FPSframes per second每秒帧数IoUIntersection over Union交并比交集与并集的比率。它是用来衡量两个集合重叠程度的一种指标。通常用于图像分割和目标检测中评估预测结果与真实标签的匹配程度F β F_βFβ​F-beta scoreFβ 分数综合精确率和召回率的指标β 用于调整两者权重Accaccuracy rate准确率benchmark datasets基准数据集refine细化characteristics特性distortion失真clue线索三、镜面检测模型1.通用型语义分割 / 边缘检测模型EGNet、MINet、LDF、VST并非专门针对镜面检测任务设计被用于镜面检测任务的基准对比体现镜面检测任务对通用模型的挑战。2.经典语义分割骨干网络PSPNet、DANet、UperNet常作为下游任务(包括镜面检测)的基础框架用于验证任务特异性改进的必要性3.显著目标检测 (Salient Object Detection, SOD)(1)AFNet(CVPR 2019)2019年CVPR发表的经典显著目标检测模型通过注意力机制增强显著区域特征提取是该领域早期代表性方法之一。(2)EGNet(ICCV 2019)全称为 “Edge-Guided Network”2019年ICCV提出强调边缘信息对显著目标检测的引导作用通过融合边缘与区域特征提升分割精度。(3)MINet(CVPR 2020)2020年CVPR模型专注于多尺度信息融合通过精细化处理不同层级特征增强显著目标的细节捕捉能力。(4)GateNet(ECCV 2020)2020年ECCV模型引入门控机制动态调整特征权重更精准区分显著目标与背景在F β F_βFβ​和边界误差(BER)指标上表现突出。(5)VST(ICCV 2021)2021年ICCV模型通过 “视觉 - 语义转换” 思路结合语义信息增强显著目标识别在IoU和像素准确率(Acc)上有明显提升。(6)RCSBNet(WACV 2022)2022年WACV模型注重 “区域 - 上下文 - 边界” 协同学习在细节分割和边界精度上针对性优化平均绝对误差(MAE)表现较好。(7)ICON(TPAMI 2022)2022年TPAMI发表的先进模型集成多任务学习 (如同时学习显著目标和边缘)在Acc和F β F_βFβ​上表现均衡。(8)ABiU-Net(TCSVT 2023)2023年TCSVT模型基于U-Net架构改进引入注意力和双向特征融合在F β F_βFβ​和MAE指标上达到较高水平。其中RGB-D显著目标检测方法BBSNet、VST4.玻璃检测 (glass detection)(1)GDNet(CVPR 2020)2020年CVPR发表的玻璃检测专用模型是该领域早期的代表性方法之一在玻璃检测的 IoU、F β F_βFβ​等指标上表现突出为后续研究奠定了基础。(2)GSDNet(CVPR 2021)2021年CVPR提出的玻璃检测模型针对玻璃的光学特性(如反射、透明性)优化了特征提取流程在 GDD和HSO数据集上的性能优于同期部分方法。(3)PGSNNet(TIP 2022)2022年发表于TIP (IEEE Transactions on Image Processing)的玻璃检测模型属于该领域的先进方法通过精细化的网络设计提升了玻璃检测的边界精度和整体分割性能。(4)RGB-T(TIP 2023)2023年TIP提出的多模态玻璃检测模型融合了 RGB 图像与热成像(Thermal)数据试图通过多模态信息增强玻璃检测的鲁棒性不过在HSO数据集上的部分指标未完全覆盖。5.专用镜面检测模型(Mirror Detection)MirrorNet、VCNet、SATNet、CSFwinformer模型名称领域提出时间原理MirrorNet(First)镜面2019 (ICCV)利用镜内外在颜色/纹理等内容不连续做上下文对比逐级细化分割。缺陷上下文不足PMDNet镜面2020 (CVPR)显式建模镜框/边界利用反射镜内外物理对应关系与关系对比确定镜面位置PDNet镜面2021 (CVPR)借助深度图利用镜内外深度不连续进行分割缺点深度不可靠需要额外设备SANet镜面2022 (CVPR)学习镜子与周围物体之间的语义关联来定位镜面VCNet(谭鑫)镜面2022(IEEE-TPAMI)Visual Chirality Cue借助反射内容的视觉手性作为镜面线索SATNet镜面2023 (AAAI)基于Transformer利用真实物体与其镜中反射之间的松散对称性VMD-Net(谭鑫)镜面2023 (CVPR)视频镜面CSFwinformer(王森)镜面2024 (TIP)跨空间-频率窗口TransfromerSFWA对齐空间/频域纹理DWA做全局建模CMCC跨模态对比融合空间-频率特征(跨模态)、图像纹理特征GDNet玻璃2020 (CVPR)面向真实场景玻璃检测的基线与数据集基于RGB线索学习玻璃区域VBNet玻璃2024利用视觉模糊性作为玻璃检测线索四、镜面检测数据集1.MSD(Mirror Segmentation Dataset2019)简单场景4018张 (训练3063 / 测试955)。包含3063张训练图像和955张测试图像场景相对简单与真实应用场景存在一定差距。该数据集是镜面分割任务的基础数据集之一用于评估模型在常规场景下的分割能力。2.PMD(Progressive Mirror Detection Dataset2020)复杂真实场景5667张 (训练5096 / 测试571)。是一个聚焦复杂真实场景的镜面检测数据集包含5096张训练图像和571张测试图像场景多样且具有挑战性。该数据集在镜面检测研究中被广泛用于评估模型在复杂场景下的性能。3.VMD (Video Mirror Dataset)视频镜面检测数据集包含269个视频、14988帧图像覆盖真实生活场景如家居、商业空间等每帧都有像素级的镜面区域标注。用于视频镜面检测任务的基准测试4.RGBD-Mirror dataset用于RGB-D 镜面分割任务的专业数据集。包含3049组RGB图像、深度图及像素级镜面真值掩码。五、组内发表的相关论文1.CSFwinformerCSFwinformer: Cross-Space-Frequency Window Transformer for Mirror Detection跨空间频率窗口转换器用于镜面检测1.代码https://github.com/wangsen99/CSFwinformer2.原理设计了一种跨模态学习方法该方法同时捕捉空间频率特征来探索图像纹理和检测镜面区域。对齐 - 扩张 - 融合(1)SFWASpatial-Frequency Window Alignment空间频率窗口对齐模块在窗口内对图像中的空间特征和频率特征进行对齐并计算窗口单位的跨模态特征亲和力以减少计算负载(2)DWADilated Window Attention扩展窗口注意解决SFWA模块的局部特征建模问题DWA模块通过膨胀卷积(dilated convolution)来扩展感受野从而提取全球上下文特征。通过不同大小的膨胀窗口DWA能够连接不同的窗口区域捕捉镜面区域的全局信息从而提高镜面检测的准确性 。(3)CMCCCross-Modality Context Contrast跨模态上下文对比模块跨模态融合空间信息和频率信息3.实验结果CSFwinformer在PMD、MSD、RGBD-Mirror三套镜面数据集上优于SOTA并在镜面检测上显著地提高了SAM的性能2.VMD-NetVideo Mirror Detection《Learning to Detect Mirrors from Videos via Dual Correspondences》3. 《Glass Makes Blurs: Learning the Visual Blurriness for Glass Surface Detection》4.Visual Chirality Cue六、镜面检测的方法 (新老对比)对比传统方法和最新方法的不同。传统方法主要依赖手工特征比如颜色、纹理、边缘特征或者利用镜面内外的内容差异。这些方法在复杂场景中容易失效因为手工特征难以捕捉高层语义。而最新方法基于深度学习尤其是CNN和Transformer能够自动学习更复杂的特征。在最新的方法中注意到Transformer的应用越来越广泛比如SATNet和CSFwinformer它们利用自注意力机制处理长距离依赖甚至结合频率域信息。另外多模态输入也是一个趋势比如结合深度信息PDNet或偏振光信息这些在传统方法中很少见。