FS-B6 — 硬件架构度量 SPFM/LFM:为什么是两个百分比、两个分母,以及它们如何一一对应到"烧器件的故障"和"悄悄坏掉的哨兵"
本质与导读
专家养成 · 模块一(功能安全)· B 阶第 6 讲。上一讲 FS-B5 把共因项 算成了一个"行为等同单点故障"的一阶项,并在结尾留了个悬念:这个 该进 FMEDA 的哪一栏、算单点还是潜伏?今天正面回答——把 FS-B1 的失效率分配、FS-B2 的诊断覆盖率 DC、FS-B5 的 ,全部归位到 SPFM 与 LFM 这两个硬件架构度量里。核心问题只有一个:为什么一个安全目标要用两个百分比来度量,而且它们的分母还不一样?答案不是标准的任意规定,而是"故障通往危害有且只有两条路"的物理必然。
开篇:硬约束——一个 ASIL D 器件为什么必须同时报两个数
到 FS-B5 为止,我们手里已经有了一堆分立的量:每个失效模式的失效率 (FS-B1)、每个安全机制的诊断覆盖率 DC(FS-B2)、冗余通道的共因地板 (FS-B5)。但 ISO 26262-5 验收一个硬件时,不看这一堆散数,它看两个聚合百分比:SPFM(单点故障度量)、LFM(潜伏故障度量),ASIL D(据 ISO 26262-5:2018 Table 4/5)。
为什么是两个,而不是一个"总安全度"?新手最常见的直觉是"把所有没被覆盖的故障加起来算一个覆盖率不就行了"。这个直觉错在:它把两类物理上完全不同的故障混成了一锅。一类故障单枪匹马就能在 FTTI 内(FS-A3)把器件烧穿、把扭矩打飞——它的危害是即时的;另一类故障是某个安全机制自己悄悄坏了,平时毫无症状,只有等第二个独立故障到来时才暴露——它的危害是潜伏的、要等一个搭档才发作。这两类故障要赶的钟根本不是同一个(FS-A3 已经讲过:一个是 FTTI 微秒/毫秒,一个是 MPFDTI 驾驶循环/上电自检),它们的危险性、缓解手段、验收门槛都不同。把它们平均成一个数,等于用一把尺量两件事——而 FS-A3 早就论证过这是不允许的。
所以本讲的硬约束是:故障通往危害只有两条物理路径(一步到位 vs 需要搭档),ISO 26262 于是必须用两个度量、两个分母去分别封顶这两条路。SPFM 守第一条,LFM 守第二条。 下面先把故障按"到危害的路径"切开,再看这两个百分比的分子分母各自装的是什么、为什么分母不同,最后用一个 worked example 把三讲的散数拼成两个可验收的数。
中段一:第一性分类——不是按"坏没坏",而是按"到危害要走几步"
要理解两个度量,先得看清 FMEDA 分类故障的那把刀切在哪。它切的不是"故障严不严重",而是"这个故障从发生到违背安全目标(SG),要走几步、需不需要别的故障配合"。按这条因果路径,一个安全相关硬件元件的总失效率 被划成互斥的几份:
- 安全故障(Safe Fault):根本不会导致 SG 违背的故障(比如失效模式恰好落在安全侧)。它对两个度量的分子都贡献 0。
- 单点故障 SPF(Single-Point Fault):该失效模式没有任何安全机制覆盖,一旦发生就直接违背 SG。一步到位。
- 残余故障 RF(Residual Fault):该失效模式有 SM 覆盖,但覆盖率不是 100%——那没被覆盖的 一份漏网,同样一步到位违背 SG。RF 就是 SPF 打了个折的版本:。
- 多点故障 MPF(Multiple-Point Fault):单独发生不会违背 SG,只有和另一个独立故障叠加才会。它又按"被不被察觉"分三小类:MPF-detected(被 SM 检出)、MPF-perceived(被驾驶员察觉)、MPF-latent(潜伏:既没检出也没察觉)。
这个分类的第一性在于:SPF 和 RF 是"独行侠"——自己就能杀死 SG;MPF 是"需要搭档"——必须等第二个故障。 而"独行侠"归 SPFM 管、"潜伏的搭档"归 LFM 管。分类一旦这么切,两个度量的形状就被逼出来了。注意一个关键约束:这几类是互斥划分,,一份失效率只能进一栏。这个"守恒"是后面两个分母不同的根源。完整分类树与判据见 硬件失效模式分类。
中段二:SPFM——守"独行侠",分母是全部,物理对应烧器件的那一下
SPFM 度量架构对"一步到位"故障的抵抗力。分子装的就是两类独行侠——SPF 和 RF:
分子分母各是什么、为什么这么摆,要从"它想回答什么问题"倒推。SPFM 问的是:在这个元件的全部失效率里,有多大比例会单枪匹马地违背 SG? 所以分母是全部安全相关失效率 (含安全故障),分子是那些无人拦截(SPF)或拦不干净(RF)的一步到位故障。 减去这个比例,就是"被安全机制挡下或本就安全"的比例——越接近 1,架构对单点越硬。
它的物理对应正是 FS-A3 讲的 FTTI 轴。SPF/RF 是那种"器件一坏、扭矩就飞、母线就过压"的故障,危害的倒计时是 SCSOA / 母线能量定死的微秒到毫秒(FS-A3)。SM 要在 FTTI 内检出并反应,才算真覆盖——所以 SPFM 里的那个 DC,量的是"够不够快挡下即时危害",赶的是 FTTI 这口钟。 这也解释了为什么 FS-B5 那个共因项 落在这里: 行为等同一个单点故障(冗余对它零增益),它一击违背 SG,所以它进 SPF/RF 分子、拉低 SPFM——共因不是潜伏问题,是即时问题。这就是 FS-B5 结尾那个悬念的答案。
这里藏着一个专家才会盯的陷阱:安全故障 在分母里、却不在分子里,所以往设计里堆"安全故障"能白白抬高 SPFM。 一个失效率巨大但失效模式全在安全侧的元件,能把 SPFM 稀释得很好看,却没真正提升安全。这正是为什么 ISO 不许只看 SPFM/LFM 两个比例,还要另算一个绝对值 PMHF(,ASIL D)——比例可以被分母灌水,绝对失效率不能。度量能被 game,是 FMEDA 评审的重点核查项,详见 FMEDA 深度。
中段三:LFM——守"潜伏的哨兵",分母为何要挖掉 SPF 和 RF
LFM 度量架构对"潜伏"故障的抵抗力。它只盯 MPF 里那个既没检出、也没察觉的 latent 部分:
分子好懂——潜伏的那一份。要害在分母为什么是 ,而不是全部 。这一步是本讲最容易被当口诀背下来、其实有硬因果的地方。
因为潜伏故障和单点故障在定义上互斥(中段一的守恒):一个"自己就能违背 SG"的独行侠(SPF/RF),按定义就不可能是"需要第二个故障才发作"的潜伏多点故障——它压根等不到第二个故障,自己先把 SG 干掉了。所以计算"潜伏比例"时,分母里必须把这些独行侠挖掉——它们不属于"可能潜伏"的那个池子。若不挖,等于把已经算过一次账(在 SPFM 里)的 SPF/RF 又塞进 LFM 分母,一是逻辑上重复计数(double jeopardy),二是会用一大堆无关故障把 LFM 分母灌大、虚高这个百分比。分母挖掉 SPF/RF,本质是让 LFM 只在"真正可能潜伏"的故障群里算比例——这不是标准的洁癖,是互斥分类的数学后果。
它的物理对应是 FS-A3 的第二根轴 MPFDTI。潜伏故障典型就是某个安全机制自己悄悄坏了:主通道还在正常跑,系统表面无恙,这个坏掉的哨兵只有等被它保护的对象也坏时才暴露——两故障叠加击穿 SG。它要赶的钟不是 FTTI,而是"第二个独立故障统计上到来之前"(FS-A3 里的驾驶循环 / 上电自检,小时级)。所以 LFM 里的那个 DC,量的是"上电自检 / 周期自检能不能在下一个故障来临前查出哨兵已死",赶的是 MPFDTI 这口慢钟。 同一个词"诊断覆盖率",在 SPFM 里赶 FTTI、在 LFM 里赶 MPFDTI——两个度量、两口钟、两种覆盖,这是 FS-B2 那个 DC 概念在本讲里裂成两半的地方。
中段四:worked example——把三讲的散数拼成两个可验收的百分比
给一个安全相关硬件元件(取电流采样链为例),总失效率 。按中段一逐栏分配(数字取整便于核账):
- 安全故障 (失效模式落安全侧)。
- 无 SM 覆盖 (一小撮失效模式确实无诊断)。
- 有主 SM 覆盖的安全相关部分 ,主 SM 对单点的诊断覆盖率 :
- 漏网的残余故障 ;
- 被覆盖、降级为多点故障的池子 。
- 对上述 MPF 池的潜伏检测(第二层自检 / 上电自检)覆盖率 :
- 潜伏残留 ;
- 被检出的多点故障 。
先做守恒自检(避免算错): ✓,一分不多一分不少。
代入 SPFM:
,险过 ASIL D 单点门。注意它卡得多紧:只要 SPF 从 0.5 涨到 1.5 FIT(比如漏了一个失效模式没上 SM),SPFM 就掉到 98.5%,ASIL D 当场不合格——单点度量对"漏诊断"极其敏感,这是它的设计意图。
代入 LFM(分母挖掉 SPF+RF):
,过 ASIL D 潜伏门。
读这两个数要读出它们的独立性:SPFM 靠的是主 SM 的 (赶 FTTI),LFM 靠的是自检的 (赶 MPFDTI)——动其中一个不动另一个。把主 SM 做到 99.9% 能救 SPFM,却一点不改善 LFM;反过来加一层上电自检能拉高 LFM,对 SPFM 毫无帮助。这正是"两个分母"在工程上的落点:它们把你的诊断投资拆成两个独立的旋钮,分别对准两条物理路径——你得同时拧到位,而不能拿一个补另一个。
中段五:两个度量还是不够——它们量"比例",PMHF 量"绝对量"
有了 SPFM/LFM,为什么 FS-B1 还要费劲算 PMHF?因为 SPFM/LFM 是比例,而比例对"总量"是盲的。中段二已经点出安全故障能灌水分母;更根本的是:一个 、SPFM 99% 的元件,残余危险率是 ;一个 、同样 SPFM 99% 的元件,残余危险率是 ——同一个百分比,绝对风险差 10 倍。比例达标不等于绝对失效率达标。
所以 ISO 26262-5 用三个数从三个角度封顶同一件事,缺一不可:
- SPFM——单点路径的相对抵抗力(架构够不够覆盖一步到位故障);
- LFM——潜伏路径的相对抵抗力(自检够不够在第二故障前抓出死哨兵);
- PMHF——把两条路径的残余危险率加总成一个绝对 FIT 值(,ASIL D),堵住"比例好看但总量爆表"的漏洞。
三者的关系是:SPFM/LFM 管结构(每一栏占比对不对),PMHF 管总量(加起来的绝对危险率够不够低)。 一个架构可能三者全过,也可能 SPFM/LFM 漂亮却 PMHF 超标(总失效率太高)、或 PMHF 达标却 LFM 不足(潜伏没管好)。验收必须三个数一起看——这也是为什么 FMEDA 表最后一定同时输出这三列,而不是挑一个好看的报。三者如何从同一张 FMEDA 表一次算出,见 FIT/FMEDA 计算。
落到工程结论:从失效模式到两个百分比的分配流程 + 三条准则
把方法拼成可执行流程。给定一个安全相关硬件元件的失效模式清单:
- 逐模式分栏:每个失效模式先判安全/安全相关;安全相关的判有无 SM——无 SM 整份进 SPF,有 SM 则按 把 划 RF、其余划 MPF 池。分栏必须互斥、且各栏加总回等于总 (守恒自检)。
- 对 MPF 池做潜伏分析:用第二层诊断 / 上电自检的 把 MPF 池切成 detected/perceived 与 latent 两份;latent 那份是 LFM 分子。
- 算三个数:SPFM(分母全 )、LFM(分母挖掉 SPF+RF)、PMHF(残余危险率绝对加总),对照 ASIL 门槛(D:99% / 90% / 10 FIT)。
- 归位共因:FS-B5 的 按"等同单点"进 SPF/RF、拉低 SPFM——别错记成潜伏。
- 不达标先动对旋钮:SPFM 差 → 加/提主 SM 的 (赶 FTTI);LFM 差 → 加上电/周期自检(赶 MPFDTI);PMHF 差 → 降总 (换更可靠器件 / 减元件),别指望调百分比救绝对量。
带走三条准则:
- 两个度量对应两条物理路径,不能互相替代。 SPFM 守"一步到位烧器件"的故障(FTTI 轴),LFM 守"哨兵悄悄坏、等第二故障"的潜伏故障(MPFDTI 轴)。它们是 FS-A3 两根时间轴在 FMEDA 里的像。
- LFM 分母挖掉 SPF+RF 是互斥分类的数学后果,不是口诀。 独行侠等不到第二个故障,不属于"可能潜伏"的池子;不挖就重复计数、灌大分母、虚高 LFM。
- 比例达标 ≠ 绝对安全,必须叠 PMHF。 安全故障能灌水 SPFM 分母,总失效率能让漂亮的百分比掩盖爆表的绝对风险。SPFM/LFM 管结构、PMHF 管总量,三个数一起看才是验收。
承上启下:今天把 FS-B1 的失效…
承上启下:今天把 FS-B1 的失效率、FS-B2 的 DC、FS-B5 的 全部归位——SPF/RF 喂 SPFM(FTTI 轴)、MPF-latent 喂 LFM(MPFDTI 轴)、残余绝对量喂 PMHF,三个数封顶同一个 SG。但这三个数只是概率证据。FS-B3 的 FTA 给的是逻辑证据、fault injection 给的是实测证据,三类证据性质完全不同,却要在同一棵 GSN 树上组装成一句"SG 已满足"。下一讲 FS-B7 拆三类证据如何在 Safety Case 的 GSN 树里闭合——概率(SPFM/LFM/PMHF)+ 逻辑(FTA 最小割集)+ 实测(FI)各自证明什么、如何互补、缺一环为何 Safety Case 不成立。预热可读 Safety Case 与 GSN。
延伸阅读
- FMEDA 深度 — 本讲 deep 底座:SPFM/LFM/PMHF 三数一次算出、安全故障灌水陷阱、评审核查项
- FIT/FMEDA 计算 — 从失效模式清单到三个度量的整表算例
- 硬件失效模式分类 — safe/SPF/RF/MPF(detected/perceived/latent)完整分类树与判据
- ISO 26262-5 硬件开发 — Annex C 度量公式与 Table 4/5 门槛的标准条款
- FMEDA/FI 验证矩阵 — DC 假设如何被 fault injection 实测闭环
- 功能安全工程师指南(模块 hub)