Positional Encoding(位置编码)

Positional Encoding

让模型知道词的位置

亦作、亦称:位置编码 · PE

位置编码(Positional Encoding)为 Transformer 等无递归结构的模型注入 token 在序列中的顺序信息。由于自注意力本身对输入排列具有置换不变性,必须通过显式位置信号区分「猫追狗」与「狗追猫」。

常见形式

原始 Transformer 使用正弦/余弦固定编码;现代 LLM 多采用可学习位置嵌入或 RoPE(旋转位置编码),后者支持一定程度的长度外推,是 LLaMA、Qwen 等模型的标配。

作用机制

位置信息可与词嵌入相加或相乘后送入注意力层,使 Query/Key 的点积隐含相对距离。长上下文模型通过调整 RoPE 底数或采用 ALiBi、NTK 插值等扩展策略突破训练长度。

实践注意

切换上下文长度或微调基座时,位置编码策略不兼容会导致性能骤降。部署时需确认推理框架与训练时采用同一套位置方案。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「让模型知道词的位置」
  • 「Transformer 的位置信息」
  • 「没有它模型不知道顺序」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    注意力机制与 Transformer 架构

    详解 Self-Attention、Multi-Head Attention 和 Transformer 的编码器-解码器结构

  2. 2

    AI Agent 评测与基准测试:MiroEval、ViGoR 与智能体能力评估体系

    系统梳理 AI Agent 评测的核心方法论、2026 年最新基准(MiroEval、ViGoR-Bench、Act Wisely),以及如何科学评估智能体的多模态推理、工具使用和元认知能力

  3. 3

    3D 视觉:点云、NeRF、3D 重建

    从 2D 到 3D,掌握三维视觉的核心技术

外部参考

维基百科:查看「Positional Encoding」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。