“小明告诉小李,他明天出发”中的“他”可能指谁?模型需要结合前后文判断关联,而不能只看“他”附近的一个字。读完本文,可以手算一组简化的注意力权重,检查权重是否归一,并说明词语顺序为什么需要被明确表示。Transformer 把句子拆成 token 后,通过注意力让每个位置读取其他位置的信息。注意力并非人工写死的关键词表。本篇用两个向量展示计算,再解释位置信息为什么是区分语序的关键。文章目录两个词相同,调换顺序为什么会改变意思核心概念与工作机制最小示例验证结果常见误区与适用边界总结两个词相同,调换顺序为什么会改变意思“猫追狗”和“狗追猫”包含同样三个词,顺序不同,动作的发出者就变了。如果模型只统计词袋,两句话几乎没有区别。注意力负责计算位置之间的关联,位置信息负责告诉模型每个 token 在序列中的位置;两者共同支持对句子结构的理解。部分输入作用token 向量每个位置的符号表示提供可计算的语义特征查询与键当前读者位置和被读取位置计算关联分数注意力权重所有分数的归一化结果决定信息汇聚比例位置信息token 所处的序号或相对距离区分相同词集合的不同顺序核心概念与工作机制查询、键和值。对一个位置,查询向量表示“我需要什么信息”,其他位置的键向量用于比较相关性,值向量提供最终被汇聚的信息。实际模型通过可训练参数得到这些向量,不是直接把词典释义拿来相乘。缩放点积与 softmax。