论文导读 · NLP · 2026-09-19
Transformer 导读:让词与上下文直接交流
从 Query、Key、Value 的分工,理解注意力如何组织上下文信息。
论文解决什么问题
Vaswani 等人在 2017 年提出 Transformer,用注意力机制构建序列转换模型。原始论文讨论的是编码器—解码器架构,并以机器翻译等任务验证方法。阅读时应保留这个任务背景,不能把论文结论直接当作所有现代大模型的实验结果。
一个计算过程
Q 表示查询,K 用来计算匹配程度,V 提供需要汇总的信息。缩放点积注意力先计算 QKᵀ/√d,再通过 softmax 得到权重,最后加权汇总 V。多头机制在不同投影空间并行执行这一过程;位置信息另行加入,帮助模型区分顺序。
本站练习:先算一次加权和
假设两个位置的权重是 0.25 和 0.75,值向量分别是 [2, 0] 和 [0, 4]。加权结果就是 [0.5, 3]。接着把权重交换,观察结果如何变化。这个练习只演示汇总步骤,并不模拟一个训练好的语言模型,也不能说明两个词之间真实的语义关系。
阅读时给自己留三个问题
第一,当前图中的 Q、K、V 分别来自哪一段输入?第二,哪些位置允许互相看到,哪些位置被遮蔽?第三,输出的形状是否与后续层兼容?把这三个问题写在图边上,通常比先背下所有模块名称更有帮助。
不要把示意图当作实验
本文的图仅用于理解信息流。本站没有复现论文训练,也没有发布新的性能对比。继续阅读原文时,可以先看模型结构,再看训练设置和评价指标,最后回到摘要;这样更容易分清架构设计、实验条件与作者结论各自的边界。