为何深度会破坏GCN,以及储备池计算曾承诺以何种方式取而代之
GCN消息传递通过将归一化邻接矩阵、特征矩阵和可训练权重矩阵相乘来更新每个节点,因此感受野随深度增长[1][5]。基础性工作通过其他方式拓宽了感受野:H-GCN将结构相似的节点粗化为超节点再细化还原,报告了最高5.9%的准确率提升,且在标签稀缺时增益更大[6];而N-GCN在不同距离的随机游走节点对上训练多个GCN实例,提升了Cora、Citeseer、Pubmed和PPI的基线表现[7]。这些是在深度之外绕行的架构设计,而非对深度本身的修复。
储备池计算提供了另一条路径:保持循环权重固定且随机,将谱半径设于1以下以实现收缩动力学,仅训练读出层[1][2]。GraphESN率先将这一思路用于节点嵌入,FDGNN堆叠了储备池层,Bianchi等人加入了池化,MRGNN则将消息传递限制在邻域半径内以保持局部多样性[1]。该论文自身的诊断是,这些模型仍缺乏结构化的卷积机制,因此多跳聚合不精确,且其收缩动力学使其偏向短期依赖[1]。这正是RGC-Net所针对的空白。
RGC-Net 在更新规则中究竟改变了什么
RGC-Net 在储备池框架内嵌入了分层图卷积机制,使用固定的、不可训练的储备池权重,以及一个泄漏积分器来平衡保留的过去状态与新输入 [1]。泄漏积分器的既定目的是控制初始节点嵌入在聚合过程中保留多少,从而保持节点个性而非让嵌入坍缩 [1]。论文将其归纳为三个假设:储备池动力学能够执行图卷积,且效果与传统图卷积相当或更优;泄漏积分器能防止过平滑;不可训练参数带来更快的收敛速度和更低的资源消耗 [1]。
可训练对应模型TRGC-Net实现了固定权重与可训练权重的直接对比,作者称这是基于储备池的图学习中首次系统性对比[1]。这一点之所以重要,是因为储备池文献一直朝着相反方向发展:AFRICO利用扩展卡尔曼滤波器自适应调整输入权重和状态反馈权重,并报告称相较于固定输出反馈的回声状态网络,归一化均方误差最多降低88%[2]。RGC-Net检验了这种自适应对于图卷积而言是否必要,其答案是取决于数据集,而非普遍适用[1]。
分类增益、生成增益,以及固定储备池胜出之处
在图分类任务中,论文报告RGC-Net优于GCN和GAT并取得了最先进的结果,其更快的收敛归因于需要优化的参数更少以及输入无关的储层映射带来的正则化效应[1]。在脑图演化预测中,基于Transformer的模型(GCN-Transformer、RGC-Net-Transformer、TRGC-Net-Transformer)在所有数据集上均优于RBGM和EvoGraphNet,而RBGM和EvoGraphNet在更大的SLIM160数据集上出现了内存溢出错误,作者将此归因于内存开销大的基于边的卷积[1]。在Simulated数据集上,RGC-Net在MAE、Frobenius距离、MAE节点强度和特征向量中心性方面略优于TRGC-Net,表明固定储层在不发生过拟合的情况下捕获了所需的动力学;在EMCI-AD上,TRGC-Net在介数中心性方面取得了小幅提升;在SLIM160上两者均保持了可扩展性,其中RGC-Net取得了最低的Frobenius距离和MAE节点强度[1]。
作者得出的解释是一种权衡:固定储备池在较小或较不复杂的图上倾向于效率、可扩展性和鲁棒性,而可训练储备池在复杂或不规则连通性上带来边际增益,但计算成本更高、训练更慢[1]。值得注意的是,在EMCI-AD上,没有任何生成模型优于恒等函数,作者将此归因于各时间点之间的连通性分布高度相似[1]。这是一个有用的负面结果:它标志着一个任务本身可能不会奖励任何学习到的映射的情形。
收敛更快不等于计算更省
论文的第三个假设仅得到其自身测量结果的部分支持。RGC-Net-Transformer比GCN-Transformer占用了更多内存,但整体训练速度更快,因为它收敛所需的轮数更少;然而,其每轮训练时间略慢于GCN-Transformer,这与RGC-Net层相对于GCN层更高的时间和内存开销相一致[1]。作者明确表示,不可训练的储层权重在资源消耗方面并未展现出相对于传统GCN的显著效率提升[1]。
这一区分对于如何解读结果至关重要。更快的实际时钟收敛可能源于更少的优化步数,而非每步计算更廉价,论文将这两个量分开讨论,而非混为一谈[1]。作者还指出,RGC-Net 不具备置换不变性,这可能影响其在节点顺序变化或同构结构图上的表现,并且相对于传统 GCN,它引入了两个额外的超参数(泄漏率和迭代次数)[1]。这些是架构层面的代价,而一个头条准确率数字并不能体现这些。
过度平滑论断的适用边界及其度量方式
论文自身的结论仅限于其所测试的任务:图分类和时间脑图生成,并将节点分类和边预测明确列为未来工作[1]。它并未证明固定随机储层权重在所有图类型上或极深网络中优于可训练的GCN,作者也指出在部署到资源受限设备之前还需要进一步优化[1]。更广泛的深度文献则沿着另一条路线发展,竞争性工作通过表示演化控制以及初始残差加恒等映射来处理深度GNN退化问题,而非储层动力学[3]。
另一个局限在于度量方式。Zhang等人认为,基于类狄利克雷能量的主流过度平滑度量存在局限,并提出有效秩作为一种更稳健的指标,从理论上证明了消息传递GNN中特征秩会衰减[5]。他们还提醒,有效秩大并不保证性能好,而且一定程度的平滑可能是有益的[5]。RGC-Net报告了过度平滑的缓解,但所提供材料未说明使用了哪种度量,因此该主张应理解为与论文自身的评估相一致,而非在某种标准过度平滑度量上经过独立验证的降低[1][5]。在其他图领域上的验证在所提供的证据中也较为薄弱:R-GNN展示了循环图架构在甲骨文字体分类上以88.2%的Top-1准确率运行,并使用残差GRU融合局部和全局特征[4],但那是不同的任务族,并未检验RGC-Net特定的固定储层设计。
关于这些来源
本研究页面基于7项研究(6篇同行评审,1篇预印本)——发表于2018年至2026年间,其中5项来自2024年及以后,合计被引用514次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又是从超过5亿篇文献的数据库中检索到的111篇论文中筛选而来。
本文引用的文献
基于蓄水池的图卷积网络。
RGC-Net将固定随机储备池权重与泄漏积分器集成到结构化图卷积中,报告了最先进的图分类和脑图演化结果,具有更快的收敛速度和缓解过平滑问题,同时仅部分支持资源效率提升,并指出了排列不变性和超参数成本问题[1]。
自适应状态反馈回声状态网络用于时序序列学习。
AFRICO通过扩展卡尔曼滤波器自适应调整回声状态网络的输入权重和状态反馈权重,相较于固定输出反馈的ESN,归一化均方误差最多降低88%,这与固定储备池的前提相悖[3]。
控制深度图神经网络中的表示演化
竞争性工作将深度GNN退化视为表示演化问题,利用初始残差连接和恒等映射来实现更深的图网络,而非储备池动力学[4]。
R-GNN:用于甲骨文文字分类的循环图神经网络
R-GNN将CNN局部特征与图卷积块及残差GRU相结合,用于甲骨文字体分类,达到88.2%的Top-1准确率,并在另一类任务上展示了循环图架构[5]。
我们是否在正确地测量图神经网络中的过度平滑?
Zhang等人认为,类狄利克雷的过度平滑度量存在局限性,并提出有效秩作为一种更稳健的指标,同时警告称大秩并不能保证良好性能,且一定程度的平滑可能是有益的[6]。
用于半监督节点分类的层次图卷积网络
H-GCN利用粗化和细化层来扩大感受野而不增加深度,报告称准确率提升最高达5.9%,且在标注样本稀缺时获得显著增益[8]。
N-GCN:用于半监督节点分类的多尺度图卷积
N-GCN在随机游走节点对上以不同距离训练多个GCN实例,并在Cora、Citeseer、Pubmed和PPI上改进了最先进的基线[10]。
