科普 入门 🗓 2025-05-10 ⏱ 阅读需约 15 分钟

Transformer:从 Attention 到缩放点积

用直觉的方式拆解自注意力机制:Q、K、V 到底在算什么,为什么要除以根号 d,信息又是怎样在序列里流动的。

注意力在做一件什么事

一句话:让每个词去“看”句子里其它所有词,按相关程度加权地汇总信息。相关度高的词贡献多,无关的词贡献少。

Q、K、V 的分工

每个词被投影成三组向量:Query(我在找什么)、Key(我能提供什么)、Value(我携带的实际信息)。用 Query 和所有 Key 做点积得到相关分数,归一化后去加权对应的 Value。

scores = Q · Kᵀ / √d
weights = softmax(scores)
output  = weights · V

为什么要除以根号 d

维度越高,点积的数值越容易变大,softmax 会被推向极端、梯度变小。除以 √d 把分数缩放回合理区间,让训练更稳定——这就是“缩放点积注意力”里“缩放”二字的由来。

注意力机制让模型学会“看重点”,检索增强让它学会“查资料”。

理解了这一层,多头注意力、位置编码、残差连接,都只是在这个核心之上的工程化包装。

← 返回科普笔记