文章摘要
2026 年 8 月 Generalist AI 发布 GEN-1.5,机器人只需一次数秒的物理演示即可学会新任务,无需梯度更新或微调——这种范式被称为 Physical Prompting。本文从「传统微调为什么在机器人上成本过高」出发,建立 in-context reinforcement learning 的直观心智模型,拆解 GEN-1.5 的架构与能力边界,并给出评估这套范式是否适用于你的场景的决策框架。
1一个场景:为什么机器人不能像 ChatGPT 一样「看一眼就会」
想象你开了一家小型零件分拣工厂。今天接了一批新零件——形状不规则、材质各异、尺寸从 2 厘米到 15 厘米不等。你的人类员工只需要你花 30 秒演示一次「拿起→识别→放入对应料箱」的动作,就能立刻开始分拣,而且遇到没见过的零件也能即兴应对。
但如果你要让机器人做同样的事,传统流程是这样的:
- 收集至少数千次抓取和分拣的数据(通常需要专门的采集机器人或人工遥操作)
- 在仿真环境中训练策略,或直接用真实机器人做强化学习(耗时数天到数周)
- 把训练好的策略部署到产线,祈祷仿真和现实之间的差距不会让策略失效
- 明天换了一批新零件?回到第 1 步
这就是 2026 年之前机器人学习的常态——每个新任务都需要一次完整的「收集数据→训练→部署」循环。这个循环的成本直接决定了机器人只能在少数高价值、长周期的场景(如汽车焊接)中经济可行,而无法应对「今天一个新零件、明天一个新工序」的柔性制造需求。
Physical Prompting 要解决的核心问题就是:能不能让机器人像 ChatGPT 处理新话题一样,不重新训练,而是「看一次演示就学会」?
2026 年 8 月 19 日,Generalist AI 发布了 GEN-1.5 机器人基础模型,给出了一个初步的肯定答案Generalist AI。GEN-1.5 的 one-shot learning 能力意味着:操作员做一次物理演示(通常只需数秒),机器人就能理解任务意图并执行,无需任何梯度更新或微调。Generalist AI 将这种范式称为 Physical Prompting(物理提示)——就像你用一段文字提示(prompt)让 LLM 完成新任务一样,你用一段物理动作提示(physical prompt)让机器人学会新技能tbreakremio.ai。
关键区别:LLM 的 prompt 是文本,输入和输出都在数字世界;Physical Prompting 的 prompt 是物理动作,输入是机器人传感器捕获的演示轨迹,输出是真实世界的电机控制信号。两者共享「不重新训练、即时适应」的核心理念,但物理世界的维度让后者在工程上复杂得多。
2心智模型:In-Context Learning 从文本到物理世界的迁移
要理解 Physical Prompting,最可靠的心智模型是把它和 LLM 的 In-Context Learning(上下文学习,简称 ICL)做类比。
LLM 的 ICL 是这样工作的: 你在对话中给模型几个例子(few-shot)或一个例子(one-shot),模型不需要更新权重,就能根据这些例子推断出你要它做什么,并在后续生成中遵循这个模式。比如你给 GPT-4 一个「英文→法文」的翻译示例,它就能翻译下一句——不是因为它重新训练了,而是因为它在预训练阶段已经学到了「翻译」这种模式的通用能力,你的示例只是激活了这种能力。
Physical Prompting 把同样的逻辑搬到了物理世界: GEN-1.5 在预训练阶段通过大规模仿真和真实数据学到了「如何操作物体」的通用能力。当操作员做一次物理演示时,这次演示就像 LLM 对话中的一个示例——它不改变模型权重,而是作为上下文输入,让模型在推理时即时调整行为。
但物理世界的 ICL 比文本世界的 ICL 多出三个根本性的挑战:
第一,输入维度爆炸。 LLM 处理的是离散的 token 序列(文字),维度相对可控。机器人需要同时处理视觉(RGB 图像、深度图)、本体感觉(关节角度、力矩)、有时还有触觉信号。一次 5 秒的演示,数据量可能是文本示例的数千倍。
第二,动作空间的连续性。 LLM 从有限的词表中选词,是离散决策。机器人需要在连续的关节空间中选择精确的角度和力矩,误差容忍度通常在毫米和毫秒级别。
第三,物理约束的不可违抗性。 LLM 输出一个错误单词,最多影响一句话的质量。机器人输出一个错误的力矩指令,可能导致碰撞、损坏硬件或伤人。物理世界没有「回退键」。
这三个挑战解释了为什么 Physical Prompting 直到 2026 年才在机器人基础模型上初步实现——它需要的不仅是更大的模型和更多的数据,还需要架构层面的创新来处理高维连续动作空间和物理安全约束。
边界说明:Physical Prompting 与 LLM 的 ICL 共享「不重新训练即适应」的核心理念,但物理世界的额外约束使其在工程实现上完全不同。本文不深入讨论 LLM 的 ICL 机制(可参考 prompt-001 中的 few-shot learning 章节),而是聚焦物理提示在机器人领域的独特挑战。
3GEN-1.5 的架构:如何把一次演示变成可执行策略
GEN-1.5 是 Generalist AI 的第二代机器人基础模型,于 2026 年 8 月 19 日发布。相比 2026 年 4 月发布的 GEN-1(仍需每个任务约一小时的机器人数据),GEN-1.5 实现了 one-shot learning——仅需数秒的单次演示。
虽然 Generalist AI 尚未公开完整的架构论文,但根据其官方公告和技术报道,GEN-1.5 的核心架构包含三个关键组件:
组件一:多模态编码器(Multimodal Encoder)。 将视觉输入(RGB + 深度)、本体感觉(关节状态)和演示轨迹编码到统一的潜在空间。这一步的关键创新是「轨迹编码器」——它不是逐帧处理演示,而是将整段演示压缩为一个紧凑的「任务意图向量」(task intent vector),类似于 LLM 将一段文本编码为 embedding。
组件二:策略骨干(Policy Backbone)。 一个大规模 Transformer,接收当前观测和任务意图向量,输出动作分布。这个骨干在预训练阶段通过大规模仿真数据(据称超过 100 万小时)和真实机器人数据学习了通用的操作和移动能力。
组件三:In-Context Reinforcement Learning 头(ICRL Head)。 这是 GEN-1.5 最核心的创新。传统的 ICL 只依赖预训练知识,但 GEN-1.5 在推理时引入了一个轻量级的强化学习信号——它根据演示中的奖励结构(例如「成功抓取」vs「碰撞」)在推理时动态调整策略输出,而不更新骨干权重。
这种架构设计带来了一个重要的工程特性:演示的质量直接决定了推理时的表现。 如果演示中包含错误动作(如碰撞或多余步骤),ICRL Head 会尝试从错误中学习,但效果显著下降。这与 LLM 的 few-shot learning 类似——给模型一个错误的示例,它也会学到错误的模式。
实践含义:Physical Prompting 不是「随便演示一次就行」。演示的质量、一致性和代表性是决定系统成败的关键因素。这引出了一个新的工程角色——「演示工程师」(Demonstration Engineer),负责设计和优化物理演示的质量。
| 维度 | GEN-1 (2026-04) | GEN-1.5 (2026-08) | 传统微调方法 |
|---|---|---|---|
每个任务所需数据 | ~1 小时 | 数秒(单次演示) | 数千条(数十小时) |
是否需要梯度更新 | 是(任务级微调) | 否(推理时适应) | 是 |
新任务部署时间 | 小时级 | 秒级 | 天级 |
sim-to-real gap 处理 | 需要显式域随机化 | 部分内化到预训练 | 需要显式域随机化 |
演示质量敏感度 | 中(有微调缓冲) | 高(无微调缓冲) | 低(数据量大可平均) |
4In-Context Reinforcement Learning:推理时的动态适应
In-Context Reinforcement Learning(上下文强化学习,ICRL)是 Physical Prompting 的核心机制。 理解它需要先把两个熟悉的概念拼在一起:
- In-Context Learning(ICL):LLM 根据对话中的示例即时调整输出,不更新权重。
- Reinforcement Learning(RL):智能体通过与环境交互、接收奖励信号来学习策略。
ICRL 把这两者结合起来:在推理时,根据演示中隐含的奖励结构,动态调整策略输出,但不更新模型权重。
具体到 GEN-1.5 的工作方式:
- 操作员做一次物理演示。演示中包含「成功动作」(如正确抓取)和「失败动作」(如碰撞或滑落),这些动作隐含了奖励信号——做对了就是正奖励,做错了就是负奖励。
- 轨迹编码器将演示压缩为任务意图向量,同时提取演示中的奖励结构。
- 推理时,ICRL Head 接收当前观测、任务意图和奖励结构,输出一个经过动态调整的动作分布。如果当前观测与演示中的「成功状态」相似,策略会倾向于输出类似的成功动作;如果与「失败状态」相似,策略会避开类似的动作。
- 整个过程不改变策略骨干的权重——适应完全发生在推理时。
这种机制的优势在于速度:新任务的适应在毫秒级完成(一次前向传播),而不是小时级(训练循环)。但代价是适应深度有限——ICRL 只能做「浅层适应」,无法像完整微调那样彻底重构策略。
ICRL 的边界在哪里? 目前已知 ICRL 能有效处理的任务类型包括:
- 抓取和放置:演示一次抓取动作,机器人能对新物体执行类似抓取。
- 简单装配:演示一次插入或旋拧动作,机器人能对新零件执行类似操作。
- 即兴工具使用:GEN-1.5 演示了在没有专门训练的情况下,使用环境中已有物体完成任务的能力。
但 ICRL 目前无法可靠处理的任务包括:
- 高精度装配(亚毫米级精度要求的任务,如精密仪器组装)。
- 长序列任务(超过 20 步的复杂操作序列,误差会逐步累积)。
- 需要力反馈的精细操作(如柔性物体 manipulation,需要实时力控制)。
判断方法:如果你的任务可以在 5 秒内用一次演示完整展示,且精度要求在毫米级以上(非亚毫米级),Physical Prompting 目前是一个值得评估的选项。如果任务更复杂,仍需结合传统微调或专门的 RL 训练。
5Physical Prompting vs 传统 Fine-Tuning:不是替代,是互补
Physical Prompting 的出现在媒体上被描述为「机器人学习的范式转变」,但更准确的理解是:它为机器人学习增加了一个新的工具,而不是替代现有方法。
传统 Fine-Tuning 和 Physical Prompting 解决的是不同象限的问题:
Fine-Tuning 适合的场景: 任务固定、周期长、精度要求高。例如汽车工厂的焊接任务——任务几个月不变,但精度要求在 0.1 毫米级别。你愿意花一周时间收集数据和训练,换取长期稳定的高精度表现。
Physical Prompting 适合的场景: 任务多变、周期短、精度要求适中。例如柔性制造工厂——每天处理不同形状的零件,精度要求在 1-2 毫米级别。你无法为每个新零件花一周时间训练,但需要机器人在几分钟内适应新任务。
两者的关键差异不在于「谁更好」,而在于「成本-收益曲线的交叉点在哪里」:
- 当任务数量少、每个任务执行次数多时,Fine-Tuning 的固定成本被摊薄,单位成本更低。
- 当任务数量多、每个任务执行次数少时,Physical Prompting 的零固定成本优势显现,单位成本更低。
2026 年的实际部署中,两种方法经常组合使用:用 Fine-Tuning 训练一个任务特定的基础策略,然后用 Physical Prompting 在这个策略上做即时适应。 例如,先用 Fine-Tuning 让机器人学会「通用抓取」能力,然后用 Physical Prompting 让它适应特定形状的物体。这种组合在 GEN-1.5 的架构中是原生支持的——策略骨干可以通过 Fine-Tuning 优化,而 ICRL Head 提供推理时的即时适应。
决策框架:如果你的场景满足以下三个条件中的至少两个,Physical Prompting 值得优先评估:(1) 任务变化频率 > 每周一次;(2) 精度要求 > 1 毫米(非亚毫米级);(3) 每个任务的执行次数 < 1000 次。如果三个条件都不满足(任务固定、精度要求高、执行次数多),传统 Fine-Tuning 仍然是更可靠的选择。
| 维度 | Fine-Tuning | Physical Prompting | 组合方法 |
|---|---|---|---|
适用任务频率 | 低(月/年级) | 高(天/周级) | 中(周/月级基础 + 天级适应) |
精度上限 | 亚毫米级 | 毫米级 | 亚毫米级(Fine-Tuning 保底) |
部署延迟 | 天级 | 秒级 | 天级(首次)+ 秒级(后续适应) |
数据需求 | 数千条/任务 | 1 条演示/任务 | 数百条(基础)+ 1 条(适应) |
误差累积风险 | 低(任务级优化) | 中(推理时适应有限) | 低(Fine-Tuning 约束漂移) |
典型场景 | 汽车焊接、PCB 贴片 | 柔性分拣、即兴操作 | 通用操作平台 + 任务适配 |
6Sim-to-Real Gap:Physical Prompting 缩小了多少
Sim-to-real gap(仿真到现实的差距)是机器人学习的核心难题。 在仿真中训练的策略迁移到真实世界时,性能通常大幅下降。原因包括:仿真器的物理引擎无法完美模拟真实世界的摩擦、接触力学、光照变化和传感器噪声。
Physical Prompting 对 sim-to-real gap 的影响是双面的:
缩小的一面: GEN-1.5 的策略骨干在预训练阶段使用了超过 100 万小时的仿真数据。这些大规模数据让模型学到了更鲁棒的物理先验,部分内化了 sim-to-real 的差距。此外,Physical Prompting 的演示本身是在真实世界完成的——这次演示提供了一个「真实世界的锚点」,让推理时的策略输出被拉向真实物理约束,而不是纯仿真约束。
未解决的一面: ICRL 的「浅层适应」能力有限。如果 sim-to-real gap 导致机器人在某个关键环节(如力反馈)出现系统性偏差,ICRL 无法通过一次演示完全纠正这种偏差。GEN-1.5 的官方数据显示,其在标准仿真任务上的表现与真实世界表现之间仍有约 15-20% 的性能差距,相比传统方法的 30-40% 差距有显著改善,但远未消除。
一个关键的工程洞察: Physical Prompting 把 sim-to-real gap 的问题从「训练时」转移到了「演示时」。传统方法中,sim-to-real gap 在训练阶段影响策略质量;Physical Prompting 中,训练阶段的影响被预训练大规模数据缓冲,但演示阶段的质量直接决定了最终表现。这意味着:
- 如果演示在真实世界完成(推荐),sim-to-real gap 对演示本身无影响,但推理时的策略输出仍受预训练阶段的仿真偏差影响。
- 如果演示在仿真中完成(成本低但风险高),sim-to-real gap 会同时影响演示质量和推理输出,效果通常不如真实演示。
实践建议:如果你的场景对 sim-to-real gap 敏感(如需要精确力控制),优先使用真实世界演示,并在演示中包含尽可能多的边界情况(如不同光照、不同物体位置)。如果只能使用仿真演示,建议在真实部署前做至少 3-5 次真实世界验证,确认 ICRL 的适应效果。
7评估框架:Physical Prompting 是否适合你的场景
Physical Prompting 是一个有前景的新范式,但不是所有场景都适合。以下是一个结构化的评估框架,帮助你判断是否值得在你的场景中投入:
第一层筛选:任务特征匹配度
- 任务变化频率:每天/每周变化 → 高匹配;每月/每年变化 → 低匹配。
- 精度要求:毫米级以上 → 高匹配;亚毫米级 → 低匹配。
- 任务复杂度:5 秒内可演示完整任务 → 高匹配;需要 20 步以上或力反馈 → 低匹配。
- 每个任务的执行次数:< 1000 次 → 高匹配;> 10000 次 → 低匹配(Fine-Tuning 更经济)。
第二层筛选:基础设施就绪度
- 是否有 GEN-1.5 或类似支持 Physical Prompting 的基础模型?(2026 年 8 月,GEN-1.5 是唯一公开可用的选项)
- 是否有能力收集高质量的物理演示?(需要操作员培训、演示设备、质量评估流程)
- 是否有仿真环境用于预训练或演示验证?(Isaac Lab、MuJoCo 等)
第三层筛选:成本-收益分析
- 计算 Physical Prompting 的单位成本:演示收集成本 + 推理计算成本 vs 传统 Fine-Tuning 的数据收集成本 + 训练成本 + 部署成本。
- 评估风险:Physical Prompting 的误差累积风险 vs Fine-Tuning 的固定成本风险。
- 评估时间价值:Physical Prompting 的秒级部署 vs Fine-Tuning 的天级部署,对你的业务意味着多少价值?
决策矩阵:
- 如果三层筛选都通过 → 优先评估 Physical Prompting。
- 如果第一层通过但第二/三层不通过 → 长期路线,短期仍用 Fine-Tuning。
- 如果第一层不通过 → 继续使用 Fine-Tuning,关注 Physical Prompting 的技术演进。
一个常见的误区:把 Physical Prompting 视为「银弹」,试图用它解决所有机器人学习任务。更理性的做法是把它视为工具箱中的一把新扳手——在合适的场景(任务多变、精度适中、部署时间敏感)它是最优解,但在其他场景它可能不如传统方法可靠。
8局限性与未解决问题
Physical Prompting 在 2026 年仍处于早期阶段,存在多个未解决的局限性:
局限性一:演示质量的敏感性。 GEN-1.5 对演示质量高度敏感。一次包含错误动作的演示会导致推理时的策略输出显著下降。目前缺乏自动化的演示质量评估工具,主要依赖人工检查。这意味着「演示工程师」这个角色在 2026 年仍然是人力密集的。
局限性二:长序列任务的误差累积。 ICRL 的「浅层适应」在长序列任务(超过 20 步)中会出现误差累积。每一步的小偏差会在后续步骤中被放大,最终导致任务失败。GEN-1.5 在 10 步以内的任务上表现稳定,但在 20 步以上的任务上成功率显著下降。
局限性三:缺乏可解释性。 当 Physical Prompting 失败时,很难诊断失败原因——是演示质量不够?是任务超出了 ICRL 的适应范围?还是预训练阶段的某些偏差被放大?这种不可解释性在安全关键场景(如医疗机器人)中是一个严重的障碍。
局限性四:硬件依赖性。 GEN-1.5 目前主要支持 Generalist AI 自家的硬件平台。虽然理论上可以迁移到其他机器人平台,但实际迁移需要重新收集预训练数据和调整架构,成本不低。这意味着 Physical Prompting 在 2026 年仍然是一个「绑定特定供应商」的方案。
局限性五:安全验证不足。 Physical Prompting 的推理时适应机制缺乏形式化的安全保证。在传统 Fine-Tuning 中,你可以通过大量测试验证策略的安全性;但在 Physical Prompting 中,每次演示都可能产生不同的策略输出,安全验证的覆盖率难以保证。
研究前沿:2026 年下半年的研究方向包括:(1) 自动化演示质量评估和反馈;(2) 多层 ICRL(在推理时做更深的适应,而不仅是浅层调整);(3) 形式化安全保证(将 Physical Prompting 的输出约束在安全边界内)。这些方向的进展将决定 Physical Prompting 能否从「有前景的实验性技术」升级为「生产级可靠方案」。
9总结与行动建议
Physical Prompting 代表了机器人学习的一个重要方向:从「每个任务重新训练」到「一次演示即时适应」的范式转变。 GEN-1.5 在 2026 年 8 月的发布证明了这种范式在技术上是可行的,但仍处于早期阶段,存在多个未解决的局限性。
对于不同角色的行动建议:
如果你是机器人工程师: 评估你的场景中是否有「任务多变、精度适中、部署时间敏感」的需求。如果有,开始关注 GEN-1.5 和类似的基础模型,并在非关键场景中做小规模试点。同时,继续维护你的 Fine-Tuning 流水线——Physical Prompting 在 2026 年还无法完全替代传统方法。
如果你是技术管理者: Physical Prompting 的长期价值在于降低机器人部署的边际成本——每增加一个新任务的成本从「数周」降低到「数秒」。但这种价值的实现取决于技术成熟度的提升(特别是安全验证和长序列任务处理)。建议在 2026-2027 年保持关注,2027 年后根据技术进展决定是否大规模投入。
如果你是研究者: Physical Prompting 的开放问题包括:(1) 如何提高 ICRL 的适应深度,同时保持推理速度;(2) 如何自动化演示质量评估;(3) 如何为推理时适应提供形式化安全保证;(4) 如何跨机器人平台迁移 Physical Prompting 能力。这些问题都有较高的研究价值和实际意义。
最后一个判断: Physical Prompting 不是「机器人学习的终点」,而是「机器人学习工具箱中的一把新扳手」。它在特定场景下是最优解,但在其他场景下仍需要与传统方法组合使用。理解它的机制、边界和适用条件,比盲目追新或完全忽视都更有价值。
参考资料
Generalist AI 官方公告:GEN-1.5 机器人基础模型发布,https://generalist.ai
tbreak 报道:Generalist AI GEN-1.5 支持单次演示学习,https://tbreak.com/2026/08/generalist-ai-gen-1-5
remio.ai 技术报道:GEN-1.5 的 Physical Prompting 范式解析,https://www.remio.ai/blog/generalist-ai-gen-1-5
MERICS 报告:Embodied AI - China's ambitious path to transform its robotics industry(sim-to-real 壁垒分析),https://merics.org/en/report/embodied-ai-chinas-ambitious-path-transform-its-robotics-industry
TechTimes 报道:PokeBot 1 亿美元融资与机器人操作壁垒,https://www.techtimes.com/articles/322782/20260803/pokebot-lands-100m-four-months-attack-robotics-last-hard-problem-robot-manipulation.htm
🎯 相关面试题
巩固本篇知识点,备战 AI 岗位面试。
- 高级开放查看详解 →
Physical Prompting 与传统 Fine-Tuning 在机器人学习中的架构差异是什么?如何判断你的场景该用哪种方法?
考察候选人能否从机制层面区分 Physical Prompting(推理时适应,不更新权重)与传统 Fine-Tuning(训练时更新权重),理解两者的成本-收益交叉点,并给出基于任务特征的结构化决策框架。
- 高级开放查看详解 →
具身智能数据瓶颈的三个维度是什么?为什么数据瓶颈取代 sim-to-real 成为商业化核心约束?
考察候选人能否从仿真数据 gap、真实世界数据稀缺、跨具身迁移失败三个维度分析具身智能商业化的核心约束,以及理解数据瓶颈如何取代 sim-to-real 成为 2026 年具身智能赛道的主要矛盾。
- 高级概念查看详解 →
Sim2Real 迁移有哪些挑战与方法?
仿真训练迁真机的核心难点是现实差距,常用域随机化、系统辨识与真机微调弥合。
- 中级概念查看详解 →
Momenta R7 随 100 万+ 量产车部署:世界基础模型如何走通「数据飞轮」的商业化闭环?
世界模型正从实验室走向量产:Momenta R7 世界基础模型随超过 100 万辆量产车部署,用存量车队数据反哺训练(poolId P014);蚂蚁 Robbyant 独立融资标志具身智能进入资本叙事阶段(poolId P015);WAIC 2026 上海电气展示工业具身落地(poolId P013)。
