Physical Prompting(物理提示)
Physical Prompting像给 LLM 写 prompt 一样,给机器人做一次物理演示
亦作、亦称:物理提示 · Physical Prompting · 物理提示学习 · 机器人 In-Context Learning · robot ICL
Physical Prompting(物理提示) 把 LLM 的 In-Context Learning 搬到物理世界——给机器人做一次物理演示(而非文本 prompt),它就能即时学会新任务,无需重新训练。GEN-1.5(2026-08)是首个公开实现,核心机制是推理时根据演示奖励结构动态调整策略的 ICRL Head。
机制:ICRL 如何在推理时适应
Physical Prompting 的核心是 In-Context Reinforcement Learning(ICRL)——把 LLM 的 In-Context Learning 与强化学习的奖励信号结合:
- 轨迹编码器:将单次演示(视觉+本体感觉)压缩为「任务意图向量」,同时提取演示中的奖励结构(成功动作=正奖励,失败动作=负奖励)
- ICRL Head:推理时接收当前观测、任务意图和奖励结构,动态调整策略输出——相似于演示中的成功状态则倾向输出类似动作,相似于失败状态则避开
- 骨干权重不变:整个适应过程不更新策略骨干权重,适应完全发生在推理时(毫秒级前向传播)
与 LLM ICL 的关键差异:输入维度爆炸(视觉+本体感觉+触觉 vs 文本 token)、动作空间连续(关节角度 vs 离散词表)、物理约束不可违抗(碰撞/伤人 vs 错误单词)。
GEN-1.5:首个公开实现
Generalist AI 于 2026-08-19 发布 GEN-1.5,相比 2026-04 的 GEN-1(仍需每任务约 1 小时数据)实现 one-shot learning:
- 数据需求:数秒单次演示(vs GEN-1 的 1 小时 / 传统微调的数千条)
- 部署时间:秒级(vs 天级)
- sim-to-real gap:部分内化到预训练(100 万+ 小时仿真数据),性能差距从传统方法的 30-40% 降至 15-20%
架构三组件:多模态编码器(视觉+本体感觉→任务意图向量)、策略骨干(大规模 Transformer)、ICRL Head(推理时动态适应)。
与 Fine-Tuning 的边界:互补而非替代
Physical Prompting 与 Fine-Tuning 解决不同象限的问题:
- Fine-Tuning 适合:任务固定、周期长、精度要求高(亚毫米级)。例如汽车焊接——任务数月不变,愿意花一周训练换长期高精度。
- Physical Prompting 适合:任务多变、周期短、精度要求适中(毫米级)。例如柔性分拣——每天处理不同零件,无法为每个新零件花一周训练。
成本-收益交叉点:任务数量少且执行次数多时 Fine-Tuning 单位成本更低;任务数量多且执行次数少时 Physical Prompting 零固定成本优势显现。
2026 年实际部署中两者常组合使用:Fine-Tuning 训练任务特定基础策略,Physical Prompting 在该策略上做即时适应。
当前边界与局限性
Physical Prompting 在 2026 年仍处于早期阶段,存在多个未解决局限:
- 演示质量敏感:包含错误动作的演示导致策略输出显著下降,缺乏自动化质量评估工具
- 长序列任务误差累积:ICRL 的「浅层适应」在超过 20 步的任务中成功率显著下降
- 缺乏可解释性:失败时难以诊断原因(演示质量?ICRL 范围?预训练偏差?)
- 硬件依赖:GEN-1.5 主要支持 Generalist AI 自家硬件平台,跨平台迁移成本高
- 安全验证不足:推理时适应机制缺乏形式化安全保证
适用判据:任务可在 5 秒内完整演示、精度要求毫米级以上(非亚毫米级)、任务变化频率 > 每周一次、每任务执行次数 < 1000 次——满足至少两个条件时值得优先评估。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「像给 LLM 写 prompt 一样,给机器人做一次物理演示」
- 「看一次就会,不重新训练」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级开放查看详解 →
Physical Prompting 与传统 Fine-Tuning 在机器人学习中的架构差异是什么?如何判断你的场景该用哪种方法?
考察候选人能否从机制层面区分 Physical Prompting(推理时适应,不更新权重)与传统 Fine-Tuning(训练时更新权重),理解两者的成本-收益交叉点,并给出基于任务特征的结构化决策框架。
- 高级开放查看详解 →
具身智能数据瓶颈的三个维度是什么?为什么数据瓶颈取代 sim-to-real 成为商业化核心约束?
考察候选人能否从仿真数据 gap、真实世界数据稀缺、跨具身迁移失败三个维度分析具身智能商业化的核心约束,以及理解数据瓶颈如何取代 sim-to-real 成为 2026 年具身智能赛道的主要矛盾。
- 中级概念查看详解 →
Momenta R7 随 100 万+ 量产车部署:世界基础模型如何走通「数据飞轮」的商业化闭环?
世界模型正从实验室走向量产:Momenta R7 世界基础模型随超过 100 万辆量产车部署,用存量车队数据反哺训练(poolId P014);蚂蚁 Robbyant 独立融资标志具身智能进入资本叙事阶段(poolId P015);WAIC 2026 上海电气展示工业具身落地(poolId P013)。
- 高级概念查看详解 →
VLA(Vision-Language-Action)如何将视觉语言对齐到动作空间?
VLA 把视觉和语言 token 通过预训练 LLM backbone 映射到离散或连续动作空间,关键是动作 tokenizer 和对齐损失。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
Physical Prompting:机器人如何用一次演示学会新任务
2026 年 8 月 Generalist AI 发布 GEN-1.5,机器人只需一次数秒的物理演示即可学会新任务,无需梯度更新或微调——这种范式被称为 Physical Prompting。本文从「传统微调为什么在机器人上成本过高」出发,建立 in-context reinforcement learning 的直观心智模型,拆解 GEN-1.5 的架构与能力边界,并给出评估这套范式是否适用于你的场景的决策框架。
- 2
具身智能(一):从模拟到现实的 Sim-to-Real
2026 年 4 月,Google DeepMind 发布 Gemini Robotics-ER 1.6,与 Boston Dynamics Spot 合作演示工业巡检能力,标志着物理 AI 从「移动+操作」正式进化到「感知+理解物理状态」。本文系统梳理物理 AI 的技术架构、工业落地场景、实际部署案例和未来趋势。
- 3
具身智能(二):机器人大脑与行为控制
2026 年具身智能(Embodied AI)迎来爆发元年:Figure 02 人形机器人进入汽车工厂流水线,Google Gemini Robotics-ER 1.6 实现工业巡检,Tesla Optimus 开始在仓库部署。本文系统梳理具身智能的技术全景——从世界模型建模、视觉-语言-动作(VLA)模型,到 Sim-to-Real 迁移和真实机器人部署,帮你建立完整的具身智能知识体系。
外部参考
维基百科:查看「Physical Prompting」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
