Skip to content

Commit 832e995

Browse files
committed
docs: 重构方差链文档,将RMSNorm原理独立并链接
1 parent 51cf5db commit 832e995

3 files changed

Lines changed: 86 additions & 34 deletions

File tree

docs/attention-score-distribution.md

Lines changed: 9 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -50,7 +50,14 @@ $$\mathbb E[s] = 0, \qquad \mathrm{Var}(s) = H\,(D\sigma_w^2\sigma^2)^2 = H D^2
5050
| q = W_Q A(线性投影) | 一方固定(W 给定,A 随机) | σ_w² = 1/D | 分量方差不变(σ² → σ²) |
5151
| s = q·k(点积) | 双方随机(q、k 都来自数据) | ÷ √H | 分数方差归一(Hσ⁴ → σ⁴) |
5252

53-
## 3. 训练后:奇异值谱决定一切
53+
## 3. 上游:σ² 从哪里来
54+
55+
实际网络中 attention 的输入 A、B 来自上游层输出,其分量方差 σ² 并不随意:
56+
pre-norm 架构里它们先经过 RMSNorm 归一到 1(原理见
57+
[rmsnorm.md](rmsnorm.md)),再经 σ_w² = 1/D 的投影保持——
58+
所以实际分数方差恒为 1,而不依赖输入尺度。整条方差链见 rmsnorm.md §3。
59+
60+
## 4. 训练后:奇异值谱决定一切
5461

5562
把两次投影合并:s = Aᵀ M B,其中 M = W_QᵀW_K 是 D×D 矩阵、rank(M) ≤ H。
5663
对 M 做 SVD(M = Σ σ_i u_i v_iᵀ),由于 u_i、v_i 各自正交,
@@ -71,7 +78,7 @@ $$s = \sum_{i=1}^{r} \sigma_i\,\xi_i\eta_i, \qquad
7178
初始化时 σ_w²=1/D 的谱是"平"的典型样本:E‖M‖_F² = D²·H·σ_w⁴ = H(σ_w=1/√D),
7279
平均到 H 个方向各摊 ~1,与 §1 的 Var(s) = Hσ⁴ 一致。
7380

74-
## 4. 演示
81+
## 5. 演示
7582

7683
`web-tools/noise-ops-demo` 面板二「投影点积(attention 分数)」模式:
7784
参数 D(输入维)、H(头维)、σ²(输入分量方差),σ_w² = 1/D 固定;

docs/rmsnorm.md

Lines changed: 73 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,73 @@
1+
# RMSNorm 为什么能工作
2+
3+
RMSNorm 把 D 维向量除以其均方根(再乘可学增益 g):
4+
5+
$$\mathrm{RMSNorm}(x) = \frac{x}{\mathrm{RMS}(x)}\,g, \qquad
6+
\mathrm{RMS}(x) = \sqrt{\frac{\|x\|^2}{D}}$$
7+
8+
设输入 x 的分量近似 iid、零均值、分量方差 σ²。RMSNorm 能成立依赖
9+
长度平方 ‖x‖² ~ σ²χ²(D) 给出的两个数字
10+
(演示见 `web-tools/noise-ops-demo` 面板二「长度平方」模式):
11+
12+
## 1. 校准性(期望层面,精确)
13+
14+
RMS 是分量方差的良好估计:E[‖x‖²/D] = σ²(长度平方的均值 = 分量方差 × D)。
15+
16+
更进一步,归一化后分量的方差**精确**为 1,不需要任何近似——
17+
由分量的交换对称性(E[x_i²/‖x‖²] 对 i 相同,且对 i 求和为 1):
18+
19+
$$E\!\left[\frac{x_i^2}{\|x\|^2}\right] = \frac{1}{D}
20+
\;\Longrightarrow\;
21+
E\!\left[\left(\frac{x_i}{\mathrm{RMS}(x)}\right)^{\!2}\right] = 1$$
22+
23+
注意 RMS(x) 本身是随机变量,但对称性使该恒等式与分布细节无关
24+
(各分量 iid 即可,甚至不需要高斯假设)。
25+
26+
"精确为 1"是期望意义(跨分量/跨样本平均);
27+
单个样本的归一化质量由下一节的稳定性保证。
28+
29+
## 2. 稳定性(单样本层面,渐近)
30+
31+
RMS 逐样本几乎恒定。由 Var(‖x‖²) = 2Dσ⁴,‖x‖²/D 的相对标准差为 √(2/D);
32+
开方传到 RMS 上(delta 方法)再减半:
33+
34+
$$\frac{\mathrm{std}(\mathrm{RMS})}{\mathbb E[\mathrm{RMS}]} \approx \frac{1}{\sqrt{2D}}$$
35+
36+
| D | 64 | 1024 | 4096 |
37+
|---|---|---|---|
38+
| RMS 相对涨落 | 8.8% | 2.2% | 1.1% |
39+
40+
D 越大,每个样本被除以的因子越接近同一个常数 σ——这就是
41+
"高维向量长度集中"(‖x‖ ≈ σ√D)在归一化中的表现:
42+
RMSNorm 在高维几乎等价于除以一个常数,却又对分量尺度的真实变化
43+
(σ 漂移)保持自校准——这正是它比"固定除数"更鲁棒的原因。
44+
45+
## 3. 与注意力分数的联动:一条方差恒 1 的链
46+
47+
pre-norm 架构的 attention 分支:x → RMSNorm → W_Q/W_K 投影 → 点积 → ÷√H。
48+
逐环看分量方差(投影与点积的规则推导见
49+
[attention-score-distribution.md](attention-score-distribution.md) §1–§2):
50+
51+
| 环节 | 运算 | 情形 | 方差流 |
52+
|---|---|---|---|
53+
| RMSNorm | x / √(‖x‖²/D) || σ² → **1**(精确) |
54+
| 投影 q = W_Q A,k = W_K B | H×D 矩阵,σ_w² = 1/D | 一方固定 | 1 → **1** |
55+
| 点积 s = q·k | H 维求和 | 双方随机 | → H |
56+
| 缩放 | s / √H ||**1** |
57+
58+
即注意力分数的方差稳定为 1,且每一环都不随维度失控:
59+
RMSNorm 把上游任意尺度的输入先归一,投影保持方差,
60+
点积的膨胀被 √H 缩放精确抵消。
61+
62+
两个严格性注记:
63+
64+
- RMSNorm 后分量不再是高斯,且因共享 RMS 因子有 O(1/D) 的弱相关;
65+
方差链分析只依赖二阶矩(E[x_i²]、分量近似不相关),结论不受影响。
66+
- LayerNorm 同理(先减均值再多一步中心化,方差结论相同)。
67+
68+
## 4. 演示对应
69+
70+
- `web-tools/noise-ops-demo` 面板一「x²」模式:看 E[] = σ²(平方的均值 = 方差本身);
71+
- 面板二「长度平方 ‖x‖²」模式:看卡方分布与长度集中(均值 Dσ²、相对涨落 √(2/D));
72+
- 面板二「投影点积」模式:看 ÷√H 后分数方差恒为 σ⁴(σ=1 时即 1),
73+
拖 H 只剩形状变化——就是 §3 链条末环的直观演示。

web-tools/noise-ops-demo/README.md

Lines changed: 4 additions & 32 deletions
Original file line numberDiff line numberDiff line change
@@ -138,36 +138,8 @@ $$\mathrm{Var}(x\cdot y) = D\,\sigma_x^2\sigma_y^2$$
138138
两种缩放因子 1/D 与 1/√D 的分野,本质就是点积中"一方固定还是双方皆随机";
139139
面板二的两种点积模式可直接对比这两种情形(理论方差与蒙特卡洛实测同屏显示)。
140140

141-
### 4. 附:RMSNorm 为什么能工作
141+
### 4. 附:RMSNorm 与注意力分数
142142

143-
RMSNorm 把 D 维向量除以其均方根(再乘可学增益 g):
144-
145-
$$\mathrm{RMSNorm}(x) = \frac{x}{\mathrm{RMS}(x)}\,g, \qquad
146-
\mathrm{RMS}(x) = \sqrt{\frac{\|x\|^2}{D}}$$
147-
148-
它能成立依赖 §2 长度平方给出的两个数字:
149-
150-
**① 校准性(期望层面,精确)**:RMS 是分量方差的良好估计,
151-
因为 E[‖x‖²/D] = σ²(长度平方的均值 = 分量方差 × D)。
152-
更进一步,归一化后分量的方差**精确**为 1,不需要任何近似——
153-
由分量的交换对称性(E[x_i²/‖x‖²] 对 i 相同,且对 i 求和为 1):
154-
155-
$$E\!\left[\frac{x_i^2}{\|x\|^2}\right] = \frac{1}{D}
156-
\;\Longrightarrow\;
157-
E\!\left[\left(\frac{x_i}{\mathrm{RMS}(x)}\right)^{\!2}\right] = 1$$
158-
159-
注意 RMS(x) 本身是随机变量,但对称性使该恒等式与分布细节无关
160-
(各分量 iid 即可,甚至不需要高斯假设)。
161-
162-
**② 稳定性(单样本层面,渐近)**:RMS 逐样本几乎恒定。
163-
由 Var(‖x‖²) = 2Dσ⁴,‖x‖²/D 的相对标准差为 √(2/D);
164-
开方传到 RMS 上(delta 方法)再减半,相对标准差 ≈ 1/√(2D):
165-
166-
| D | 64 | 1024 | 4096 |
167-
|---|---|---|---|
168-
| RMS 相对涨落 | 8.8% | 2.2% | 1.1% |
169-
170-
D 越大,每个样本被除以的因子越接近同一个常数 σ——这就是
171-
"高维向量长度集中"(‖x‖ ≈ σ√D)在归一化中的表现:
172-
RMSNorm 在高维几乎等价于除以一个常数,却又对分量尺度的真实变化
173-
(σ 漂移)保持自校准——这正是它比"固定除数"更鲁棒的原因。
143+
RMSNorm 的原理(校准性 + 稳定性)及它与注意力分数的方差链联动
144+
(RMSNorm → 分量方差归一 → 投影保持 → 点积 → ÷√H → 分数方差恒 1),
145+
已移至独立文档:[`docs/rmsnorm.md`](../../docs/rmsnorm.md)

0 commit comments

Comments
 (0)