未来技术的尽头
← 返回文章目录

论文导读 · NLP · 2026-09-19

Transformer 导读:让词与上下文直接交流

从 Query、Key、Value 的分工,理解注意力如何组织上下文信息。

本站绘制:Q 与 K 计算权重,再汇总 V 的简化流程;非论文原图。
本站绘制:Q 与 K 计算权重,再汇总 V 的简化流程;非论文原图。

论文解决什么问题

Vaswani 等人在 2017 年提出 Transformer,用注意力机制构建序列转换模型。原始论文讨论的是编码器—解码器架构,并以机器翻译等任务验证方法。阅读时应保留这个任务背景,不能把论文结论直接当作所有现代大模型的实验结果。

一个计算过程

Q 表示查询,K 用来计算匹配程度,V 提供需要汇总的信息。缩放点积注意力先计算 QKᵀ/√d,再通过 softmax 得到权重,最后加权汇总 V。多头机制在不同投影空间并行执行这一过程;位置信息另行加入,帮助模型区分顺序。

本站练习:先算一次加权和

假设两个位置的权重是 0.25 和 0.75,值向量分别是 [2, 0] 和 [0, 4]。加权结果就是 [0.5, 3]。接着把权重交换,观察结果如何变化。这个练习只演示汇总步骤,并不模拟一个训练好的语言模型,也不能说明两个词之间真实的语义关系。

阅读时给自己留三个问题

第一,当前图中的 Q、K、V 分别来自哪一段输入?第二,哪些位置允许互相看到,哪些位置被遮蔽?第三,输出的形状是否与后续层兼容?把这三个问题写在图边上,通常比先背下所有模块名称更有帮助。

不要把示意图当作实验

本文的图仅用于理解信息流。本站没有复现论文训练,也没有发布新的性能对比。继续阅读原文时,可以先看模型结构,再看训练设置和评价指标,最后回到摘要;这样更容易分清架构设计、实验条件与作者结论各自的边界。

参考与延伸阅读

本文为本站整理的中文导读与学习笔记,非原文转载。示意图由本站绘制。