预算问题:为何穷举式与值均匀故障注入无法扩展
软件实现的故障注入之所以有吸引力,是因为它不依赖特定硬件,并且可在开发早期应用,但在现代DNN中对所有可能故障进行穷举式注入活动是不可行的[1]。统计故障注入通过仅注入选定的子集,并利用经典抽样理论在期望置信水平和误差范围内估计完整故障总体,从而降低成本[1]。数据感知的一次性方法(SFI)和后来的迭代方法(IFI)等最先进方法在层和位级别组织采样,但它们并未明确按值范围组织注入活动[1]。SFI最初是为权重故障注入提出的,在激活故障上表现较差,因为激活值的分布更加异质且依赖于输入;IFI可能在早期迭代中将大量注入花费在影响很小或没有影响的位上,而其迭代性质使总运行时间难以预测[1]。
成本问题并非DNN所独有。在针对安全微控制器的激光故障注入活动中,对空间位置进行穷举搜索是不可行的,研究人员利用光束诱导电流测量来定位触发器位置,将搜索空间缩减了6.6至375倍[6]。该工作确立了通过对器件进行画像以找到敏感位置可以大幅降低活动成本,但它针对的是硬件安全而非DNN可靠性,并且依赖的是物理测量而非统计抽样理论[6]。TreeFI将类似的洞见带入了DNN故障注入:对值分布进行画像以找到敏感区间,然后据此分配注入[1]。
值依赖的位翻转效应:现有SFI方法忽视的结构
推动TreeFI的关键实证观察是:对于固定的比特位,比特翻转对模型精度的影响在很大程度上取决于原始激活值[1]。论文中的图2在一个具有代表性的ResNet8激活层上展示了这一点,每个比特位进行了65,536次单比特故障注入:对于比特30(指数最高有效位)和比特27,某些激活范围在比特翻转时几乎没有或完全没有精度下降,而其他范围则表现出强烈下降[1]。对于权重故障也观察到了同样的值依赖行为,尽管该图聚焦于激活值[1]。这意味着针对同一层和同一比特位的两次故障注入可能产生截然不同的结果,因为被破坏的值属于不同的值范围[1]。
这种值依赖性与其他关于位级故障敏感性的更广泛证据相一致。在用于片上推理的量化神经网络中,最高有效位会产生最大的误差,而相同有效级别的不同位之间,误差幅度的变异性可能差异极大——许多密集层MSB权重具有高误差影响,而许多则影响较低[5]。该工作还指出,位有效性的单调性此前已被用于指导故障注入活动[5]。TreeFI对此进行了扩展:它从值分布本身学习数据驱动的区间,而非假设固定的位有效性排序,并利用这些区间对采样进行分层[1]。
从回归树区间到分层分配:TreeFI 如何工作
TreeFI分两个阶段运行。首先,离线表征阶段使用加权直方图收集每个目标层的值分布,然后利用按层–位对训练的一维回归树,将值轴划分为具有相似局部位翻转效应的区间[1]。这些树在所选位翻转的局部效应发生显著变化的位置设置分裂点,并利用直方图计数以确保学习到的分裂点有足够的观测值支撑;在实验中,每层–位对的树最多包含约15个叶节点[1]。每个区间获得一个风险评分,该评分由原始值与位翻转值之间平均对数距离导出,并通过sigmoid函数映射[1]。其次,故障注入活动按照标准分层抽样原则,根据区间频率和风险估计的不确定性将注入按比例分配到各区间[1]。最终故障率估计将区间级实测故障率按每个区间在无故障执行期间出现的频率加权后进行组合[1]。
该设计与既有统计故障注入方法的一个具体区别在于:TreeFI利用值轴本身来指导采样,而现有方法只是在各层或位位置上分配注入,并未按值范围进行显式组织[1]。区间结果的加权组合也是一个关键差异——若没有它,所有区间将等权贡献,即便某些区间的出现频率远高于其他区间[1]。该方法在针对目标置信水平和误差范围的同时,保留了一次性、预先预算 campaigns 的优势[1]。
在ResNet8及更远模型上的验证:针对穷举注入与预算缩减的准确性
在ResNet8上,穷举式激活故障注入是可行的,TreeFI在相同实验设置下比最先进的统计故障注入基线提供了更准确的估计[1]。这是论文中最有力的验证,因为它对比的是真实穷举参考,而不仅仅是与其他采样方法进行比较[1]。在使用CIFAR-10和ImageNet评估的CNN和Transformer模型上,TreeFI将所需的注入预算最多减少了72.1倍,激活故障的平均减少量为44.9倍,执行权重实验的平均减少量为11.2倍[1]。结果还表明,在更大规模的激活故障实验中,TreeFI保留了主要的逐层和逐位故障率趋势,因此即使穷举验证不可行,它仍然有用[1]。
权重故障验证的范围更窄:它仅覆盖CNN模型和一个6层DeiT-Tiny子集[1]。论文并未声称相同的预算缩减能够推广到所有架构或所有权重故障场景[1]。与先前统计方法的比较是明确的:SFI和IFI是当前最先进的基线方法,而TreeFI在相同实验设置下于ResNet8激活故障上优于它们[1]。论文并未报告在所有模型上针对所有故障类型的直接对比,因此优越性主张的范围仅限于所测试的配置[1]。
证据止步之处:故障模型、精度格式与未经验证的扩展
实验研究聚焦于激活值和权重中的FP32单比特故障[1]。论文明确指出,该方法本身更具通用性——它仅需要一个定义比特翻转如何修改值的故障模型,以及一个可收集并可划分的值分布——并且相同的区间学习与分层分配原则可以扩展到FP16、bfloat16或量化整数表示[1]。然而,通过实验验证这一点被留作未来工作[1]。因此,结论并不涵盖其他精度格式、其他故障模型(如多比特故障或固定故障),也不涵盖软件故障注入设置之外的硬件架构[1]。
更广泛的故障注入文献中包含的方法与其说是相互竞争,不如说是互补的。例如,面向硬件在环测试中故障检测与分类的混合深度学习方法达到了较高精度(平均分类准确率98.8%),但其解决的是故障诊断问题,而非注入故障下的可靠性估计[2]。定向比特翻转对抗权重攻击表明,在ResNet-18中仅翻转8800万个权重比特中的27个,就能以100%的攻击成功率将某一类别的所有图像误分类为另一类别,这展示了权重故障中极端的值与位置依赖性[3]。这些工作进一步印证了故障效应具有高度结构化的特征,但它们并未提供可与TreeFI相比的统计估计框架[2][3]。故障注入加速的竞争性方法,例如面向数字集成电路的异质时空图学习,针对的是门级注入而非DNN值分布[4]。悬而未决的问题是,TreeFI的区间学习原理能否迁移至这些相邻场景,以及当故障模型或数值格式发生变化时,其预算缩减效果是否依然成立[1]。
关于这些来源
本研究页面基于6项研究(5项同行评审,1项预印本)——发表于2015年至2026年间,其中3项发表于2024年或之后——这些研究是从通过质量筛选的7项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的24篇论文中筛选而来。
本文引用的文献
TreeFI:面向深度神经网络的值感知统计故障注入
TreeFI引入了值感知的统计故障注入方法,该方法将每一层的值分布划分为具有相似位翻转行为的回归树区间,并根据区间频率和风险不确定性来分配注入次数,在ResNet8及其他CNN/Transformer模型上实现了高达72.1倍的预算缩减,同时保持了置信度和误差裕度。
基于混合深度学习方法的汽车软件系统硬件在环测试智能故障检测与分类
这项关于混合CNN-LSTM故障检测与分类用于硬件在环汽车软件测试的基础性工作实现了98.8%的平均分类准确率,但其解决的是故障诊断问题,而非注入故障下的统计可靠性估计。
T-BFA:定向比特翻转对抗权重攻击。
这篇关于定向比特翻转对抗性权重攻击的先驱研究表明,翻转ResNet-18中8800万个权重比特中的27个,就能以100%的攻击成功率将某一类别的所有图像误分类为另一类别,从而确立了权重故障中极端的值和位置依赖性。
面向可靠性的数字集成电路多类故障注入加速:基于异质时空图学习
这种竞争性方法使用异质时空图学习来加速面向可靠性的数字集成电路多类故障注入,其目标是门级注入而非DNN值分布。
高效且具有韧性的片上推理神经网络
这项关于面向片上推理的高效且具有弹性的神经网络的验证工作表明,在量化模型中,MSB故障产生的误差最大,而且相同权重的不同位之间的敏感度差异很大,这支持了TreeFI所利用的值相关故障行为。
关于利用OBIC测量降低激光故障注入活动复杂性的研究
这项关于降低激光故障注入活动复杂度的竞争性工作,利用光束诱导电流测量来识别触发器位置,将搜索空间缩小了6.6至375倍,从而确立了在硬件安全背景下,对敏感位置进行画像可以大幅降低活动成本。
