Positional Encoding(位置编码)
Positional Encoding让模型知道词的位置
亦作、亦称:位置编码 · PE
位置编码(Positional Encoding)为 Transformer 等无递归结构的模型注入 token 在序列中的顺序信息。由于自注意力本身对输入排列具有置换不变性,必须通过显式位置信号区分「猫追狗」与「狗追猫」。
常见形式
原始 Transformer 使用正弦/余弦固定编码;现代 LLM 多采用可学习位置嵌入或 RoPE(旋转位置编码),后者支持一定程度的长度外推,是 LLaMA、Qwen 等模型的标配。
作用机制
位置信息可与词嵌入相加或相乘后送入注意力层,使 Query/Key 的点积隐含相对距离。长上下文模型通过调整 RoPE 底数或采用 ALiBi、NTK 插值等扩展策略突破训练长度。
实践注意
切换上下文长度或微调基座时,位置编码策略不兼容会导致性能骤降。部署时需确认推理框架与训练时采用同一套位置方案。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「让模型知道词的位置」
- 「Transformer 的位置信息」
- 「没有它模型不知道顺序」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
TensorFlow 中的计算图是什么?
TensorFlow 计算图将运算表示为有向无环图中的节点,边表示张量依赖;1.x 需先建图再用 Session 执行,2.x 默认即时执行但可用 tf.function 编译为图。
- 中级概念查看详解 →
TensorFlow Lite 是什么?适用于哪些场景?
TensorFlow Lite 是 TensorFlow 的移动端与嵌入式推理引擎,通过转换与量化压缩模型,在 Android、iOS、树莓派等边缘设备上低延迟运行深度学习模型。
- 中级概念查看详解 →
TensorFlow 中的 Variable 是什么?有何重要性?
TensorFlow 的 tf.Variable 是可训练的可变张量,用于存储模型权重和偏置;优化器通过 apply_gradients 更新 Variable,是训练中被学习的参数载体。
- 中级概念查看详解 →
什么是深度学习?与传统机器学习方法有何区别?
深度学习是机器学习子集,用多层神经网络自动学习层次特征表示;区别于传统 ML 需手工特征,深度学习可端到端从原始数据学习,但依赖更多数据与算力。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Positional Encoding」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
