代码地址:GitHub - wenwenmin/scASDC: scASDC is an attention enhanced structural deep clustering method for scRNA-seq cell clustering


摘要

单细胞RNA测序(scRNA-seq)数据分析对于理解细胞异质性具有关键意义。然而,scRNA-seq数据固有的高稀疏性和复杂噪声模式对传统聚类方法提出了严峻挑战。为应对这些问题,我们提出了一种深度聚类方法——注意力增强的结构化深度嵌入图聚类(scASDC),该方法融合了多个先进模块,以提升聚类的准确性与鲁棒性。

本文方法采用多层图卷积网络(GCN),以捕捉细胞之间的高阶结构关系,构成图自编码器模块。为缓解GCN中常见的过平滑问题,引入了基于ZINB(零膨胀负二项分布)的自编码器模块,从数据中提取内容信息,并学习基因表达的潜在表示。这些模块通过注意力融合机制进行集成,确保在GCN的每一层中能够有效结合基因表达特征与结构信息。

此外,还引入了自监督学习模块,以增强所学习嵌入表示的鲁棒性。大量实验结果表明,scASDC在聚类任务中优于现有的多种先进方法,提供了一种稳健而有效的单细胞聚类解决方案。

该方法为更精确、具有生物意义的单细胞RNA测序数据分析提供了新途径,有助于深入理解细胞异质性及其相关生物过程。

引言

细胞聚类是单细胞RNA测序(scRNA-seq)数据分析中最关键的任务之一 [1,2]。然而,由于测序技术的限制,scRNA-seq数据通常表现出高稀疏性和复杂的噪声模式 [3,4]。传统的聚类方法(如k-means和层次聚类)[5–7] 依赖相似度度量,对于存在上述挑战的单细胞数据聚类任务而言,往往难以达到理想效果。

为更好地捕捉scRNA-seq数据的独特特性,近年来,基于深度学习的聚类算法应运而生并被广泛应用 [8],典型代表包括DESC [9]、scDCC [10] 和 scDeepCluster [11]。这些方法通常借助自编码器学习数据的低维表示,从而有助于聚类与分布建模。然而,它们多数集中于基因表达信息,常忽视细胞之间的关系,即数据中的结构信息。在高度稀疏和噪声背景下,若仅依赖基因表达进行聚类,往往难以获得鲁棒的结果。因此,结合基因表达特征与结构信息对于实现稳健的细胞聚类至关重要。

为克服上述局限,近年来研究者尝试引入图结构方法,以捕捉细胞间的关系,从而提升聚类性能 [12–14]。如scGNN [15]、scGAE [16]、scTAG [17] 和 scDSC [18] 等方法,均借助图卷积网络(GCNs)提取结构信息,有效提高了聚类精度。然而,这类方法在处理大规模数据时容易出现过平滑(over-smoothing)问题,导致基因表达矩阵中关键特征的丢失 [19]。

针对上述问题,本文提出了一种创新方法,称为注意力增强的结构化深度嵌入图聚类(scASDC)。该方法通过多层图卷积网络(GCN)捕捉单细胞数据中的高阶结构关系,构成图自编码器模块。为缓解GCN中的过平滑问题,引入基于ZINB(零膨胀负二项分布)的自编码器模块,从数据中提取内容信息,并学习基因表达的潜在表示 [20]。通过将这两个模块结合,方法利用注意力融合机制集成基因表达与结构信息,显著增强聚类性能。

方法的核心由四个模块组成:

  1. ZINB自编码器模块:对预处理后的scRNA-seq数据矩阵进行低维嵌入,提取数据内容信息并学习潜在表示,解码器可重建基因表达矩阵及其分布特征;

  2. 图自编码器模块:基于单细胞RNA数据构建细胞图,利用多层GCN提取细胞之间的高阶结构关系;

  3. 注意力融合模块:在每一层GCN中,迭代融合ZINB编码器和图自编码器的输出,使特征表示与结构信息充分结合;

  4. 自监督学习模块:将ZINB和图自编码器整合至统一框架中,支持端到端训练,增强嵌入表达的鲁棒性和任务适应性。

最终,系统通过自监督策略实现模块间的同步优化,使所学习的表示在细胞聚类等下游任务中更加鲁棒且有效。


主要贡献如下:

  • 提出了一种新型单细胞深度图聚类方法scASDC,融合GCN提取的结构信息与ZINB建模的基因表达表示,有效提升聚类性能;

  • 引入注意力融合机制,在多层网络中动态聚焦关键特征,增强结构与内容信息的整合,同时加入自监督模块,提高所学嵌入表示的鲁棒性与精度;

  • 在六个scRNA-seq数据集上与七种主流方法进行对比实验,结果表明scASDC在聚类表现上明显优于现有最先进技术。

模型


(1)基于ZINB的自编码器模块

该自编码器模块由对称的编码器与解码器组成。具体而言,假设编码器共有 L 层,第 l 层的输出表示为:

其中,激活函数 ϕ可根据实际应用灵活选取,本文中采用 ReLU函数。需要注意的是,第一层的输入为预处理后的基因表达矩阵 Xˉ,而最后一层的输出为重建的基因表达矩阵,其维度与原始输入矩阵一致。

为了更好地捕捉数据的全局概率结构,将 ZINB(零膨胀负二项分布)模型 融入自编码器的解码器结构中。具体地,在自编码器的最后一层输出上接三个独立的全连接层,用以估计ZINB分布的三个参数:丢失概率 π离散度参数 θ 和 均值参数 μ

在此基础上,ZINB模型使用上述三个参数来模拟原始scRNA-seq数据的分布,并重建其生成过程:

为了引导模型学习更有效的潜在表达,希望重建的ZINB分布尽可能逼近原始数据分布。因此,定义该模块的最终损失函数为ZINB分布的负对数似然(Negative Log-Likelihood, NLL)


(2)图自编码器模块(Graph Autoencoder Module)

为有效捕捉细胞之间的结构信息,引入了以图卷积网络(GCN)为基础的图自编码器模块。该模块以 K近邻图(KNN图) A 作为输入,在提取结构信息的同时,实现内容信息与结构信息的异构融合。

具体而言,假设图自编码器共有 L 层,第 l层的输出表达如下:

为了获得更加丰富和鲁棒的特征表示,在每一层引入 注意力融合模块(attention fusion module),将 ZINB自编码器的输出 Hl−1与 GCN模块的输出 Zl−1进行融合,得到新的异构嵌入表示:

其中,α 是一个可调的加权参数,Fatt表示注意力融合操作,其具体实现将在后续“注意力融合模块”中详细介绍。

为了让网络进一步学习更具判别力的高阶表示并降低噪声干扰,使用融合后的表示 Rl−1 作为GCN的输入,进行特征提取:

需要注意的是,图自编码器第一层的输入 R0为预处理后的基因表达矩阵 Xˉ。在图卷积网络中,选择中间层的输出作为后续聚类分析的表示基础。

随后,对该中间层输出进行 softmax 运算,以预测样本在各个聚类中心的概率分布:

在该分布表示中,元素 zij∈Zpre可理解为第 i个样本属于第 j个聚类中心的概率,用于端到端模型训练以及后续的自监督模块(self-supervised module)

为引导模型朝更可靠的方向优化学习,使用以下两个重构误差作为图自编码器模块的损失函数:


3)注意力融合模块

注意力机制将一个查询(query)和一组键-值对(key-value pairs)映射为一个输出,其中查询、键、值和输出都是向量。具体来说,我们首先计算查询与键的点积,接着应用 softmax 函数以获得值的相关权重,然后将值与该权重相乘,得到最终的输出结果。为了简化计算,实际应用中通常会同时处理一组键-值对,将向量运算转化为矩阵运算。注意力机制的具体计算方法如下:

其中,Q、K、V分别表示查询矩阵、键矩阵和值矩阵。在此基础上,引入了多头注意力机制(multi-head attention mechanism),该机制能够同时在数据的不同位置从各个子空间中捕捉信息,从而确保注意力融合表示具有更丰富且更具鲁棒性的特征信息。具体而言,该方法对Q、K、V执行M次不同的注意力操作,然后并行地执行注意力函数,连接这些结果,并再次进行投影以获得最终输出。第i个注意力操作表示如下:

假设注意力模块共有L层,则其第l层的输出表示为:

4)自监督模块

自监督模块使用了传统的DEC的自监督机制:

实验


总的来说也是在SDCN的基础上演变的方法。

Logo

「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!

更多推荐