Saliency as Pseudo-Pixel Supervision for Weakly and Semi-Supervised Semantic
#利用显著性作为伪像素监督的弱监督和半监督语义分割#
一、研究动机
-
目标对象覆盖稀疏
因为我们只知道图像中有“狗”,但没有明确狗的位置,模型在学习过程中可能只关注狗的某些特征明显的部位,比如耳朵、尾巴或身体的一部分,而忽略其他部位。这种情况下,模型的输出可能是狗的一些散乱区域,而不是完整的狗轮廓。 -
目标边界不准确
由于没有详细的边界信息,模型只能大致识别出狗的大体区域,但很难精确区分出狗和周围草地的边界。因此,模型可能会输出一个模糊的狗的形状,其中边缘区域较为不清晰,导致难以区分出狗的边缘和周围环境。 -
非目标对象的共生像素
假设草地上还有一个水盆,而水盆和狗经常同时出现在图片中,模型可能会认为水盆也是狗的一部分。因此,模型可能会将一些草地或水盆区域误分为“狗”的一部分,即把非目标对象的像素也包含在了分割结果中。
二、论文的主要贡献
1. EPS++ 框架的改进点
EPS++主要创新点在于改进了**显式伪像素监督(EPS)**框架,通过结合不同的弱监督信号来生成更精准的伪标签:
- 图像级标签:用于识别图像中的主要对象类别(例如有无“狗”),帮助定位目标对象。
- 显著性检测模型生成的显著性图:显著性检测模型擅长发现图像中显著的区域,通过显著性图可以获得更清晰的边界信息,如狗的边缘轮廓。
这种多信号组合利用了标签的对象信息和显著性图的边界信息的互补性。这样,模型可以更准确地定位对象,同时也能更清楚地识别目标边界。
2. 联合训练策略
- 联合训练策略是为了更好地整合图像级标签与显著性图的优势,通过这两种信息的结合提高模型的分割效果。这种策略可以帮助模型在识别目标类别和精细化目标边界方面都做得更好。
3. 不一致区域丢弃(IRD)策略
- IRD策略专门设计来处理显著性图中的错误。例如,如果显著性图对某些非目标区域(如草地上的水盆)误判为“狗”的一部分,IRD策略能够识别出这些不一致的区域并进行丢弃。
- 相较于原始EPS,IRD策略通过减少超参数的数量,让处理更加简单、高效,从而增强了整体模型的性能。
4. 实验效果与推广性
- 通过改进的伪掩模质量,EPS++模型不仅能获取准确的目标边界,同时还剔除了不相关的共生像素,提高了语义分割的精度。
- EPS++在多个基准数据集上均取得了最新的最优性能,表明在弱监督语义分割方面取得显著进展。
- 此外,EPS++还能够扩展至半监督语义分割,说明该模型具备较好的适应性。
三、论文算法理解

-
输入图像:
- 首先,将输入的图像传入一个骨干网络(backbone network),生成定位图(Localization maps)。
-
定位图生成:
- 骨干网络生成 (C+1)×H×W的定位图,其中 C 是类别数,H 和 W是图像的高度和宽度。定位图表示了每个类别在图像中不同区域的存在概率。
-
伪掩模生成:
- 生成的定位图会被用于伪掩模生成模块(Pseudo-mask generation),从而生成一个初步的伪掩模,标注图像中目标对象的大致区域。
-
显著性检测与显著性损失(Saliency Loss):
- 利用一个现成的显著性检测模型生成显著性图(Saliency map),显著性图通常用于定位图像中的显著区域。
- 通过精炼模块(Refine module)对前景图进行细化处理,得到精炼前景图(Refined foreground map)和估计前景图(Estimated foreground map)。
- 使用异或(XOR)操作来对比显著性图与精炼后的前景图,从而识别出不一致区域。这些不一致区域反映了显著性检测模型和定位图之间的差异,用于计算显著性损失 LsalL_{sal}Lsal,帮助改进伪掩模的精度。
-
分类损失(Classification Loss):
- 计算每个类别的概率,并与图像级标签进行比较,得到分类损失 LclsL_{cls}Lcls。图像级标签为每个类别标记是否存在,例如,1 表示目标类别存在,0 表示不存在。
- 分类损失帮助模型更好地识别图像中的各个类别。
-
联合训练策略:
- 整个框架通过显著性损失和分类损失的联合训练,以充分利用显著性图和图像级标签的互补信息,从而改进伪掩模的质量,使得模型能够更准确地捕获目标边界并排除共生像素。
-
EPS++框架的优势
EPS++框架则同时利用了定位图和显著性图的优势:
-
定位图:图像分类器生成的定位图可以识别出狗这一具体对象的类别。虽然它在边界上可能不够精确,但它能够告诉模型哪些像素是属于“狗”的,有助于区别狗和狗窝。
-
显著性图:显著性检测模型生成的显著性图可以帮助模型获得更加细致的边界信息,例如狗的轮廓。尽管它不区分狗和狗窝,但在狗的边缘信息上非常准确。
-
四、论文创新点
A. IRD(不一致区域丢弃)是一种新策略
用于解决显著性图中的系统性错误。IRD的目标是通过识别和忽略显著性图中不准确的区域,来提高伪像素监督的质量。以下是对IRD的逐步解释:
-
识别不一致区域:
- 在语义分割任务中,显著性图通常被用来区分前景和背景,但显著性图可能包含错误的区域,影响模型的学习。
- IRD通过比较估计的前景图和显著性图来检测错误区域。
- 估计的前景图是基于图像级标签生成的,对显著性图中的错误更有鲁棒性(即,受显著性图的错误影响较小),因为它携带了目标对象的身份信息。
- 如果某些区域在显著性图和估计的前景图之间存在不匹配(例如,一个区域在显著性图中显示为前景,但在估计的前景图中却显示为背景),则这些区域被标记为不一致区域。
-
忽略不一致区域的反馈:
- 在模型训练时,通常会利用显著性损失来监督显著性图和估计的前景图的对齐程度。但对于这些被标记为不一致的区域,IRD策略选择忽略显著性损失的反馈,不对这些区域施加损失。
- 这意味着,不一致区域在显著性损失计算中被丢弃,从而减少系统性错误的影响。
-
IRD的作用:
- 提高伪像素监督的质量:通过忽略不一致区域的损失反馈,IRD策略可以让模型专注于那些显著性图和前景图匹配良好的区域。这避免了模型受到系统性错误的误导,提高了伪掩模的准确性。
- 减少显著性图错误的影响:IRD帮助模型在处理包含错误的显著性图时更加稳健,避免了因显著性图中的系统性错误而影响整个分割任务的质量。

B. 改进的显式伪像素监督
显著性图提供了目标轮廓的信息,因此有助于目标边界的检测。为实现更好的监督效果,研究人员将显著性图和类别级定位图进行匹配,并生成了一个估计的前景图。这个估计的前景图是通过合并各个目标类别的定位图计算得到的。文中的公式:

C.伪标签生成联合训练
假设我们有一幅显著性图,其中某些像素的显著性值为 1(表示前景),其余像素的值为 0(表示背景)。如果我们预测的显著性图中有一些误差,比如将某些背景像素错误地标记为前景,或者将前景像素标记为背景,那么这种误差就会被 损失捕捉到。通过最小化
,模型可以学习更好地预测显著性图。

假设我们有一张图像,并且图像可能属于多个类别,例如“猫”和“狗”。如果真实标签是 y=[1,0](表示该图像属于“猫”但不属于“狗”),而模型的预测为 y^=[0.8,0.3],那么分类损失 就会根据实际标签和预测结果的差距计算损失,从而指导模型的优化

D.语义分割的流程
1. 弱监督语义分割 (Weakly Supervised Semantic Segmentation, WSSS)
在弱监督语义分割中,缺乏精细的像素级标注,所以使用分类网络生成的伪掩模作为像素级监督,来训练分割网络。具体而言:
- 网络结构:分割网络包括主干网络和解码器部分。EPS++ 采用常用的 DeepLab-LargeFOV 和 DeepLab-ASPP 架构,主干可以选择 VGG16 或 ResNet101。
- 伪掩模的生成:利用分类网络的输出生成粗糙的像素级掩模。这些伪掩模为分割网络提供了像素级监督信号,但由于来自分类网络的掩模并不精确,训练的分割网络准确性会受到一定的影响。
这种方法允许在没有完全像素标注的情况下训练分割模型,但伪掩模中的噪声也可能限制模型的精度。
2. 半监督语义分割 (Semi-Supervised Semantic Segmentation, SSSS)
在半监督语义分割中,训练数据包括少量精细标记数据和大量粗略标记数据,即强监督和弱监督的结合。为此,引入了双分支架构:
- 双分支模块:参考 Luo 和 Yang 的双分支方法,半监督语义分割网络分为强监督分支和弱监督分支。共享主干提取特征后分为两个并行分支——强监督分支负责处理精细标注的图像,而弱监督分支则使用弱监督(粗略的伪掩模)。
- 双分支设计优势:双分支结构缓解了 WSSS 中单分支方法的两个限制
- 弱监督带来的噪声降低了准确性;
- 仅用精细标记训练会影响泛化能力。 通过双分支策略,模型可以利用少量精细标记数据来提升准确性,同时通过弱监督来提高泛化能力。
- EPS++的应用:EPS++ 替代原本使用的 DSRG 方法,用于生成弱监督分支的伪掩模。EPS++生成的伪掩模用于弱分支的训练,而强分支则使用精细标记数据,模型的其余部分与双分支方法一致。
3. 总结分析
EPS++的创新点在于利用双分支结构,将弱监督和强监督相结合,以提升语义分割的准确性和泛化能力。通过将 EPS++ 引入半监督语义分割任务,可以利用弱监督数据生成更精细的伪掩模,有效提升了弱监督分支的表现。双分支方法通过共享主干来提升整体特征表达的质量,从而在精细标记数据和粗略标记数据上都能有较好的表现。

五、实验结果
SA.优化边界不匹配的问题


SB.优化共生问题

图 8 是 PASCAL VOC 2012 和 PASCAL CONTEXT 数据集之间的“共生矩阵”。这个矩阵表示了不同目标类别(如火车、船、人等)与背景类别(如平台、轨道、道路等)之间的共生比率。每个矩阵单元表示该目标类别和背景类别同时出现的比例,这可以帮助我们理解背景对目标检测的影响。
具体理解方式
-
矩阵中的值:每个单元格的值表示目标和背景类别之间的共生比率。例如,“train”和“track”单元格中的值为 0.7,这意味着在包含“track”(轨道)的样本中,70% 也包含了“train”(火车),表明这两者有很强的共生关系。
-
颜色深浅:颜色越深,共生比率越高,表示该目标类别和背景类别更频繁地一起出现。例如,“train”和“platform”、“train”和“track”单元格的颜色最深,显示出很强的共生关系。
-
高共生比率的含义:高共生比率意味着模型更可能在“track”附近识别出“train”,因为它们经常一起出现。这种现象虽然可以帮助模型识别目标,但也可能导致错误分类或偏差。例如,在其他没有轨道的情况下,模型可能会因为缺乏这种上下文而无法识别火车。
EPS++的作用
通过了解这些共生关系,EPS++ 在训练时可以更好地处理这些上下文干扰,从而提高弱监督语义分割的准确性。
SC.VS SOTA



「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!
更多推荐




所有评论(0)