|
| 1 | +# RMSNorm 为什么能工作 |
| 2 | + |
| 3 | +RMSNorm 把 D 维向量除以其均方根(再乘可学增益 g): |
| 4 | + |
| 5 | +$$\mathrm{RMSNorm}(x) = \frac{x}{\mathrm{RMS}(x)}\,g, \qquad |
| 6 | +\mathrm{RMS}(x) = \sqrt{\frac{\|x\|^2}{D}}$$ |
| 7 | + |
| 8 | +设输入 x 的分量近似 iid、零均值、分量方差 σ²。RMSNorm 能成立依赖 |
| 9 | +长度平方 ‖x‖² ~ σ²χ²(D) 给出的两个数字 |
| 10 | +(演示见 `web-tools/noise-ops-demo` 面板二「长度平方」模式): |
| 11 | + |
| 12 | +## 1. 校准性(期望层面,精确) |
| 13 | + |
| 14 | +RMS 是分量方差的良好估计:E[‖x‖²/D] = σ²(长度平方的均值 = 分量方差 × D)。 |
| 15 | + |
| 16 | +更进一步,归一化后分量的方差**精确**为 1,不需要任何近似—— |
| 17 | +由分量的交换对称性(E[x_i²/‖x‖²] 对 i 相同,且对 i 求和为 1): |
| 18 | + |
| 19 | +$$E\!\left[\frac{x_i^2}{\|x\|^2}\right] = \frac{1}{D} |
| 20 | +\;\Longrightarrow\; |
| 21 | +E\!\left[\left(\frac{x_i}{\mathrm{RMS}(x)}\right)^{\!2}\right] = 1$$ |
| 22 | + |
| 23 | +注意 RMS(x) 本身是随机变量,但对称性使该恒等式与分布细节无关 |
| 24 | +(各分量 iid 即可,甚至不需要高斯假设)。 |
| 25 | + |
| 26 | +"精确为 1"是期望意义(跨分量/跨样本平均); |
| 27 | +单个样本的归一化质量由下一节的稳定性保证。 |
| 28 | + |
| 29 | +## 2. 稳定性(单样本层面,渐近) |
| 30 | + |
| 31 | +RMS 逐样本几乎恒定。由 Var(‖x‖²) = 2Dσ⁴,‖x‖²/D 的相对标准差为 √(2/D); |
| 32 | +开方传到 RMS 上(delta 方法)再减半: |
| 33 | + |
| 34 | +$$\frac{\mathrm{std}(\mathrm{RMS})}{\mathbb E[\mathrm{RMS}]} \approx \frac{1}{\sqrt{2D}}$$ |
| 35 | + |
| 36 | +| D | 64 | 1024 | 4096 | |
| 37 | +|---|---|---|---| |
| 38 | +| RMS 相对涨落 | 8.8% | 2.2% | 1.1% | |
| 39 | + |
| 40 | +D 越大,每个样本被除以的因子越接近同一个常数 σ——这就是 |
| 41 | +"高维向量长度集中"(‖x‖ ≈ σ√D)在归一化中的表现: |
| 42 | +RMSNorm 在高维几乎等价于除以一个常数,却又对分量尺度的真实变化 |
| 43 | +(σ 漂移)保持自校准——这正是它比"固定除数"更鲁棒的原因。 |
| 44 | + |
| 45 | +## 3. 与注意力分数的联动:一条方差恒 1 的链 |
| 46 | + |
| 47 | +pre-norm 架构的 attention 分支:x → RMSNorm → W_Q/W_K 投影 → 点积 → ÷√H。 |
| 48 | +逐环看分量方差(投影与点积的规则推导见 |
| 49 | +[attention-score-distribution.md](attention-score-distribution.md) §1–§2): |
| 50 | + |
| 51 | +| 环节 | 运算 | 情形 | 方差流 | |
| 52 | +|---|---|---|---| |
| 53 | +| RMSNorm | x / √(‖x‖²/D) | — | σ² → **1**(精确) | |
| 54 | +| 投影 q = W_Q A,k = W_K B | H×D 矩阵,σ_w² = 1/D | 一方固定 | 1 → **1** | |
| 55 | +| 点积 s = q·k | H 维求和 | 双方随机 | → H | |
| 56 | +| 缩放 | s / √H | — | → **1** | |
| 57 | + |
| 58 | +即注意力分数的方差稳定为 1,且每一环都不随维度失控: |
| 59 | +RMSNorm 把上游任意尺度的输入先归一,投影保持方差, |
| 60 | +点积的膨胀被 √H 缩放精确抵消。 |
| 61 | + |
| 62 | +两个严格性注记: |
| 63 | + |
| 64 | +- RMSNorm 后分量不再是高斯,且因共享 RMS 因子有 O(1/D) 的弱相关; |
| 65 | + 方差链分析只依赖二阶矩(E[x_i²]、分量近似不相关),结论不受影响。 |
| 66 | +- LayerNorm 同理(先减均值再多一步中心化,方差结论相同)。 |
| 67 | + |
| 68 | +## 4. 演示对应 |
| 69 | + |
| 70 | +- `web-tools/noise-ops-demo` 面板一「x²」模式:看 E[x²] = σ²(平方的均值 = 方差本身); |
| 71 | +- 面板二「长度平方 ‖x‖²」模式:看卡方分布与长度集中(均值 Dσ²、相对涨落 √(2/D)); |
| 72 | +- 面板二「投影点积」模式:看 ÷√H 后分数方差恒为 σ⁴(σ=1 时即 1), |
| 73 | + 拖 H 只剩形状变化——就是 §3 链条末环的直观演示。 |
0 commit comments