Quantile 敏感层分析算法 量化术语百科词条¶
词条类别:敏感层分析算法
英文名称:quantile
应用领域:量化敏感层分析、模型量化精度调优
1. 概述¶
Quantile(分位数)是一种基于稳健统计量的敏感层分析算法。它利用分位数和四分位距描述激活主体分布与尾部的相对关系,降低极少数异常值对敏感度指标的支配,从而对线性层进行排序;核心特征是对离群点相对稳健,适合与 Std、Kurtosis 等指标交叉验证。
2. 词条介绍¶
Std 等基于极值与标准差的指标容易受离群点主导,导致单层分数被极端值放大。Quantile 观察到,用四分位数(第 1/4、第 3/4 分位数)描述激活分布的主体宽度,可以降低离群点对单层分数的主导影响,使敏感度排序更稳健。
从量化流程中的定位看,该算法承担的是决策辅助,而不是直接改变模型权重或激活。它通过统计分布特征、比较量化前后差异或分析注意力行为等方式,构造可比较的层级、模块级或注意力头级指标,把“哪些位置更值得保护”转化为可排序或可筛选的结果,从而为局部回退、混合精度或压缩保留策略提供依据。
2.1 核心思想¶
Quantile 的核心思想是“用四分位数刻画主体分布”:计算激活的下四分位数 $Q_1$(第 1/4 分位数)与上四分位数 $Q_3$(第 3/4 分位数),用四分位距 $\text{IQR} = Q_3 - Q_1$ 描述主体分布宽度,结合绝对幅度构造分数,对离群点相对稳健。
该比值对整体线性缩放近似不变,因此适合比较同一模型中单位和绝对幅值不同的层。
2.2 工作机制¶
Quantile 指标先用 $Q_1$ 和 $Q_3$ 描述中间 50% 激活样本的跨度,即 IQR。IQR 对单个极端值不敏感,因而可以较稳定地刻画“主体分布有多宽”。与此同时,分子仍保留绝对最大值,并用它近似对称 INT8 MinMax 量化的整体动态范围。两者相除后,得到的是“由极值决定的量化步长,相对于主体分布宽度有多大”的无量纲比例。
这意味着该指标并非完全忽略离群点:恰恰相反,它让极值只出现在分子、让稳健的主体尺度出现在分母,从而突出“少数尾部把量化范围拉得远大于主体宽度”的层。当该比值较高时,主体数据可能只占据较少整数码,MinMax 类量化更容易损失分辨率。由于分位数和极值都来自校准激活,样本覆盖与抽样仍会影响排序。
2.3 数学描述¶
四分位距:
$$ \text{IQR} = Q_3 - Q_1 $$
敏感度分数:
$$ \text{score} = \frac{2 \times \max(|\text{max_value}|, |\text{min_value}|)}{254 \times (Q_3 - Q_1)} $$
- $Q_1$:激活的第 1/4 分位数
- $Q_3$:激活的第 3/4 分位数
- $\text{IQR}$:四分位距
- $\max(|\text{max_value}|, |\text{min_value}|)$:激活绝对值的最大值
- $\text{score}$:敏感度分数
解读:激活绝对值的最大值越大,score 越大(量化步长相对越大、误差越显著);IQR 越大,score 越小(主体分布越分散、相对误差越小)。
令 $a=\max(|x_{min}|,|x_{max}|)$,对称 INT8 的完整实数范围宽度为 $2a$,跨 254 个相邻间隔,因此:
$$ S\approx\frac{2a}{254},\qquad \text{score}=\frac{S}{Q_3-Q_1}. $$
这样分数具有无量纲性质:若所有激活整体乘以常数 $c$,$S$ 与 IQR 都乘以 $|c|$,score 基本不变。它衡量的是分布形状与尾部相对主体的比例,而非绝对幅值。
2.4 关键性质¶
- 线性层粒度:以线性变换的输入激活为统计对象,形成层间相对敏感度排序。
- 主体尺度稳健:IQR 对少量离群点相对稳健,但完整 score 仍通过 abs-max 主动保留对长尾风险的敏感性。
- 主体分布刻画:用 IQR 描述激活主体分布宽度。
- 尾部相对主体度量:分母 IQR 稳健描述主体,分子 abs-max 刻意保留对离群尾部的敏感性。
从误差与适用边界看,单个偶发异常值仍会拉高分数,这是该指标检测尾部风险的一部分,但也意味着校准噪声会造成误报。分位数抽样过稀还可能扭曲 $Q_1/Q_3$,所以它适合做快速相对筛选而非绝对误差预测。
2.5 适用场景¶
- 激活分布尾部较重、希望降低离群点对单层分数主导影响的场景。
- 需要更稳健的线性层敏感度排序的场景。
更具体地说,这类算法适合在需要把有限的高精度或保留预算分配给少数关键位置时使用。应先固定待分析模型、对象范围和指标;若指标依赖量化结果,再固定量化基线;若指标依赖数据,再固定校准数据。这样得到的排序才具有可比较性,后续才能可靠地指导局部保护策略。
2.6 使用限制¶
- score 的具体阈值需结合模型与业务精度要求判断。
- 仅用于
linear范围分析,不适用于layer/attn范围。
这些限制意味着分析结果具有明确的上下文依赖:模型结构或分析范围发生变化后,原有排序通常不应直接复用;对于数据依赖型或量化差异型指标,校准数据和量化基线变化同样会影响结果。正式固化局部保护策略前,建议在最终配置附近重新运行一次分析。
3. 关联词条¶
可以从“同类方法、前后处理关系和应用对象”三个方向理解本词条与其他算法的关系。下面的关联项既用于横向比较不同技术路线,也用于帮助定位该算法在完整量化方案中的位置。
- Std:同类算法,同为
linear范围分析指标,侧重范围与离散度比值。 - Kurtosis:同类算法,同为
linear范围分析指标,关注尖峰分布。 - MSE Layer Wise:配套术语,
layer范围分析指标,可用于块级评估。
4. 参考文档¶
参考文档优先列出算法原始论文或权威出处,并补充仓库内对应使用指南。需要进一步理解参数选择时,可先阅读使用指南,再回到原论文核对算法假设和推导。