科普
入门
🗓 2025-05-10
⏱ 阅读需约 15 分钟
Transformer:从 Attention 到缩放点积
用直觉的方式拆解自注意力机制:Q、K、V 到底在算什么,为什么要除以根号 d,信息又是怎样在序列里流动的。
注意力在做一件什么事
一句话:让每个词去“看”句子里其它所有词,按相关程度加权地汇总信息。相关度高的词贡献多,无关的词贡献少。
Q、K、V 的分工
每个词被投影成三组向量:Query(我在找什么)、Key(我能提供什么)、Value(我携带的实际信息)。用 Query 和所有 Key 做点积得到相关分数,归一化后去加权对应的 Value。
scores = Q · Kᵀ / √d
weights = softmax(scores)
output = weights · V
为什么要除以根号 d
维度越高,点积的数值越容易变大,softmax 会被推向极端、梯度变小。除以 √d 把分数缩放回合理区间,让训练更稳定——这就是“缩放点积注意力”里“缩放”二字的由来。
注意力机制让模型学会“看重点”,检索增强让它学会“查资料”。
理解了这一层,多头注意力、位置编码、残差连接,都只是在这个核心之上的工程化包装。