💡

文章摘要

2026 年 8 月 Generalist AI 发布 GEN-1.5,机器人只需一次数秒的物理演示即可学会新任务,无需梯度更新或微调——这种范式被称为 Physical Prompting。本文从「传统微调为什么在机器人上成本过高」出发,建立 in-context reinforcement learning 的直观心智模型,拆解 GEN-1.5 的架构与能力边界,并给出评估这套范式是否适用于你的场景的决策框架。

1一个场景:为什么机器人不能像 ChatGPT 一样「看一眼就会」

想象你开了一家小型零件分拣工厂。今天接了一批新零件——形状不规则、材质各异、尺寸从 2 厘米到 15 厘米不等。你的人类员工只需要你花 30 秒演示一次「拿起→识别→放入对应料箱」的动作,就能立刻开始分拣,而且遇到没见过的零件也能即兴应对。

但如果你要让机器人做同样的事,传统流程是这样的:

  1. 收集至少数千次抓取和分拣的数据(通常需要专门的采集机器人或人工遥操作)
  2. 在仿真环境中训练策略,或直接用真实机器人做强化学习(耗时数天到数周)
  3. 把训练好的策略部署到产线,祈祷仿真和现实之间的差距不会让策略失效
  4. 明天换了一批新零件?回到第 1 步

这就是 2026 年之前机器人学习的常态——每个新任务都需要一次完整的「收集数据→训练→部署」循环。这个循环的成本直接决定了机器人只能在少数高价值、长周期的场景(如汽车焊接)中经济可行,而无法应对「今天一个新零件、明天一个新工序」的柔性制造需求。

Physical Prompting 要解决的核心问题就是:能不能让机器人像 ChatGPT 处理新话题一样,不重新训练,而是「看一次演示就学会」?

2026 年 8 月 19 日,Generalist AI 发布了 GEN-1.5 机器人基础模型,给出了一个初步的肯定答案Generalist AI。GEN-1.5 的 one-shot learning 能力意味着:操作员做一次物理演示(通常只需数秒),机器人就能理解任务意图并执行,无需任何梯度更新或微调。Generalist AI 将这种范式称为 Physical Prompting物理提示——就像你用一段文字提示(prompt)让 LLM 完成新任务一样,你用一段物理动作提示(physical prompt)让机器人学会新技能tbreakremio.ai

关键区别:LLM 的 prompt 是文本,输入和输出都在数字世界;Physical Promptingprompt 是物理动作,输入是机器人传感器捕获的演示轨迹,输出是真实世界的电机控制信号。两者共享「不重新训练、即时适应」的核心理念,但物理世界的维度让后者在工程上复杂得多。

图表加载中…

2心智模型:In-Context Learning 从文本到物理世界的迁移

要理解 Physical Prompting,最可靠的心智模型是把它和 LLM 的 In-Context Learning(上下文学习,简称 ICL)做类比。

LLM 的 ICL 是这样工作的: 你在对话中给模型几个例子(few-shot)或一个例子(one-shot),模型不需要更新权重,就能根据这些例子推断出你要它做什么,并在后续生成中遵循这个模式。比如你给 GPT-4 一个「英文→法文」的翻译示例,它就能翻译下一句——不是因为它重新训练了,而是因为它在预训练阶段已经学到了「翻译」这种模式的通用能力,你的示例只是激活了这种能力。

Physical Prompting 把同样的逻辑搬到了物理世界: GEN-1.5 在预训练阶段通过大规模仿真和真实数据学到了「如何操作物体」的通用能力。当操作员做一次物理演示时,这次演示就像 LLM 对话中的一个示例——它不改变模型权重,而是作为上下文输入,让模型在推理时即时调整行为。

但物理世界的 ICL 比文本世界的 ICL 多出三个根本性的挑战:

第一,输入维度爆炸。 LLM 处理的是离散的 token 序列(文字),维度相对可控。机器人需要同时处理视觉(RGB 图像、深度图)、本体感觉(关节角度、力矩)、有时还有触觉信号。一次 5 秒的演示,数据量可能是文本示例的数千倍。

第二,动作空间的连续性。 LLM 从有限的词表中选词,是离散决策。机器人需要在连续的关节空间中选择精确的角度和力矩,误差容忍度通常在毫米和毫秒级别。

第三,物理约束的不可违抗性。 LLM 输出一个错误单词,最多影响一句话的质量。机器人输出一个错误的力矩指令,可能导致碰撞、损坏硬件或伤人。物理世界没有「回退键」。

这三个挑战解释了为什么 Physical Prompting 直到 2026 年才在机器人基础模型上初步实现——它需要的不仅是更大的模型和更多的数据,还需要架构层面的创新来处理高维连续动作空间和物理安全约束。

边界说明:Physical Prompting 与 LLM 的 ICL 共享「不重新训练即适应」的核心理念,但物理世界的额外约束使其在工程实现上完全不同。本文不深入讨论 LLM 的 ICL 机制(可参考 prompt-001 中的 few-shot learning 章节),而是聚焦物理提示在机器人领域的独特挑战。

图表加载中…

3GEN-1.5 的架构:如何把一次演示变成可执行策略

GEN-1.5 是 Generalist AI 的第二代机器人基础模型,于 2026 年 8 月 19 日发布。相比 2026 年 4 月发布的 GEN-1(仍需每个任务约一小时的机器人数据),GEN-1.5 实现了 one-shot learning——仅需数秒的单次演示。

虽然 Generalist AI 尚未公开完整的架构论文,但根据其官方公告和技术报道,GEN-1.5 的核心架构包含三个关键组件:

组件一:多模态编码器(Multimodal Encoder)。 将视觉输入(RGB + 深度)、本体感觉(关节状态)和演示轨迹编码到统一的潜在空间。这一步的关键创新是「轨迹编码器」——它不是逐帧处理演示,而是将整段演示压缩为一个紧凑的「任务意图向量」(task intent vector),类似于 LLM 将一段文本编码为 embedding

组件二:策略骨干(Policy Backbone)。 一个大规模 Transformer,接收当前观测和任务意图向量,输出动作分布。这个骨干在预训练阶段通过大规模仿真数据(据称超过 100 万小时)和真实机器人数据学习了通用的操作和移动能力。

组件三:In-Context Reinforcement Learning 头(ICRL Head)。 这是 GEN-1.5 最核心的创新。传统的 ICL 只依赖预训练知识,但 GEN-1.5 在推理时引入了一个轻量级的强化学习信号——它根据演示中的奖励结构(例如「成功抓取」vs「碰撞」)在推理时动态调整策略输出,而不更新骨干权重。

这种架构设计带来了一个重要的工程特性:演示的质量直接决定了推理时的表现。 如果演示中包含错误动作(如碰撞或多余步骤),ICRL Head 会尝试从错误中学习,但效果显著下降。这与 LLM 的 few-shot learning 类似——给模型一个错误的示例,它也会学到错误的模式。

实践含义:Physical Prompting 不是「随便演示一次就行」。演示的质量、一致性和代表性是决定系统成败的关键因素。这引出了一个新的工程角色——「演示工程师」(Demonstration Engineer),负责设计和优化物理演示的质量。

维度GEN-1 (2026-04)GEN-1.5 (2026-08)传统微调方法

每个任务所需数据

~1 小时

数秒(单次演示)

数千条(数十小时)

是否需要梯度更新

是(任务级微调)

否(推理时适应)

新任务部署时间

小时级

秒级

天级

sim-to-real gap 处理

需要显式域随机化

部分内化到预训练

需要显式域随机化

演示质量敏感度

中(有微调缓冲)

高(无微调缓冲)

低(数据量大可平均)

4In-Context Reinforcement Learning:推理时的动态适应

In-Context Reinforcement Learning(上下文强化学习,ICRL)是 Physical Prompting 的核心机制。 理解它需要先把两个熟悉的概念拼在一起:

  • In-Context Learning(ICL):LLM 根据对话中的示例即时调整输出,不更新权重。
  • Reinforcement Learning(RL):智能体通过与环境交互、接收奖励信号来学习策略

ICRL 把这两者结合起来:在推理时,根据演示中隐含的奖励结构,动态调整策略输出,但不更新模型权重。

具体到 GEN-1.5 的工作方式:

  1. 操作员做一次物理演示。演示中包含「成功动作」(如正确抓取)和「失败动作」(如碰撞或滑落),这些动作隐含了奖励信号——做对了就是正奖励,做错了就是负奖励。
  2. 轨迹编码器将演示压缩为任务意图向量,同时提取演示中的奖励结构。
  3. 推理时,ICRL Head 接收当前观测、任务意图和奖励结构,输出一个经过动态调整的动作分布。如果当前观测与演示中的「成功状态」相似,策略会倾向于输出类似的成功动作;如果与「失败状态」相似,策略会避开类似的动作。
  4. 整个过程不改变策略骨干的权重——适应完全发生在推理时。

这种机制的优势在于速度:新任务的适应在毫秒级完成(一次前向传播),而不是小时级(训练循环)。但代价是适应深度有限——ICRL 只能做「浅层适应」,无法像完整微调那样彻底重构策略

ICRL 的边界在哪里? 目前已知 ICRL 能有效处理的任务类型包括:

  • 抓取和放置:演示一次抓取动作,机器人能对新物体执行类似抓取。
  • 简单装配:演示一次插入或旋拧动作,机器人能对新零件执行类似操作。
  • 即兴工具使用:GEN-1.5 演示了在没有专门训练的情况下,使用环境中已有物体完成任务的能力。

但 ICRL 目前无法可靠处理的任务包括:

  • 高精度装配(亚毫米级精度要求的任务,如精密仪器组装)。
  • 长序列任务(超过 20 步的复杂操作序列,误差会逐步累积)。
  • 需要力反馈的精细操作(如柔性物体 manipulation,需要实时力控制)。

判断方法:如果你的任务可以在 5 秒内用一次演示完整展示,且精度要求在毫米级以上(非亚毫米级),Physical Prompting 目前是一个值得评估的选项。如果任务更复杂,仍需结合传统微调或专门的 RL 训练。

图表加载中…

5Physical Prompting vs 传统 Fine-Tuning:不是替代,是互补

Physical Prompting 的出现在媒体上被描述为「机器人学习的范式转变」,但更准确的理解是:它为机器人学习增加了一个新的工具,而不是替代现有方法。

传统 Fine-TuningPhysical Prompting 解决的是不同象限的问题:

Fine-Tuning 适合的场景: 任务固定、周期长、精度要求高。例如汽车工厂的焊接任务——任务几个月不变,但精度要求在 0.1 毫米级别。你愿意花一周时间收集数据和训练,换取长期稳定的高精度表现。

Physical Prompting 适合的场景: 任务多变、周期短、精度要求适中。例如柔性制造工厂——每天处理不同形状的零件,精度要求在 1-2 毫米级别。你无法为每个新零件花一周时间训练,但需要机器人在几分钟内适应新任务。

两者的关键差异不在于「谁更好」,而在于「成本-收益曲线的交叉点在哪里」:

  • 当任务数量少、每个任务执行次数多时,Fine-Tuning 的固定成本被摊薄,单位成本更低。
  • 当任务数量多、每个任务执行次数少时,Physical Prompting 的零固定成本优势显现,单位成本更低。

2026 年的实际部署中,两种方法经常组合使用:Fine-Tuning 训练一个任务特定的基础策略,然后用 Physical Prompting 在这个策略上做即时适应。 例如,先用 Fine-Tuning 让机器人学会「通用抓取」能力,然后用 Physical Prompting 让它适应特定形状的物体。这种组合在 GEN-1.5 的架构中是原生支持的——策略骨干可以通过 Fine-Tuning 优化,而 ICRL Head 提供推理时的即时适应。

决策框架:如果你的场景满足以下三个条件中的至少两个,Physical Prompting 值得优先评估:(1) 任务变化频率 > 每周一次;(2) 精度要求 > 1 毫米(非亚毫米级);(3) 每个任务的执行次数 < 1000 次。如果三个条件都不满足(任务固定、精度要求高、执行次数多),传统 Fine-Tuning 仍然是更可靠的选择。

维度Fine-TuningPhysical Prompting组合方法

适用任务频率

低(月/年级)

高(天/周级)

中(周/月级基础 + 天级适应)

精度上限

亚毫米级

毫米级

亚毫米级(Fine-Tuning 保底)

部署延迟

天级

秒级

天级(首次)+ 秒级(后续适应)

数据需求

数千条/任务

1 条演示/任务

数百条(基础)+ 1 条(适应)

误差累积风险

低(任务级优化)

中(推理时适应有限)

低(Fine-Tuning 约束漂移)

典型场景

汽车焊接、PCB 贴片

柔性分拣、即兴操作

通用操作平台 + 任务适配

6Sim-to-Real Gap:Physical Prompting 缩小了多少

Sim-to-real gap(仿真到现实的差距)是机器人学习的核心难题。 在仿真中训练的策略迁移到真实世界时,性能通常大幅下降。原因包括:仿真器的物理引擎无法完美模拟真实世界的摩擦、接触力学、光照变化和传感器噪声。

Physical Prompting 对 sim-to-real gap 的影响是双面的:

缩小的一面: GEN-1.5 的策略骨干在预训练阶段使用了超过 100 万小时的仿真数据。这些大规模数据让模型学到了更鲁棒的物理先验,部分内化了 sim-to-real 的差距。此外,Physical Prompting 的演示本身是在真实世界完成的——这次演示提供了一个「真实世界的锚点」,让推理时的策略输出被拉向真实物理约束,而不是纯仿真约束。

未解决的一面: ICRL 的「浅层适应」能力有限。如果 sim-to-real gap 导致机器人在某个关键环节(如力反馈)出现系统性偏差,ICRL 无法通过一次演示完全纠正这种偏差。GEN-1.5 的官方数据显示,其在标准仿真任务上的表现与真实世界表现之间仍有约 15-20% 的性能差距,相比传统方法的 30-40% 差距有显著改善,但远未消除。

一个关键的工程洞察: Physical Prompting 把 sim-to-real gap 的问题从「训练时」转移到了「演示时」。传统方法中,sim-to-real gap 在训练阶段影响策略质量;Physical Prompting 中,训练阶段的影响被预训练大规模数据缓冲,但演示阶段的质量直接决定了最终表现。这意味着:

  • 如果演示在真实世界完成(推荐),sim-to-real gap 对演示本身无影响,但推理时的策略输出仍受预训练阶段的仿真偏差影响。
  • 如果演示在仿真中完成(成本低但风险高),sim-to-real gap 会同时影响演示质量和推理输出,效果通常不如真实演示。

实践建议:如果你的场景对 sim-to-real gap 敏感(如需要精确力控制),优先使用真实世界演示,并在演示中包含尽可能多的边界情况(如不同光照、不同物体位置)。如果只能使用仿真演示,建议在真实部署前做至少 3-5 次真实世界验证,确认 ICRL 的适应效果。

7评估框架:Physical Prompting 是否适合你的场景

Physical Prompting 是一个有前景的新范式,但不是所有场景都适合。以下是一个结构化的评估框架,帮助你判断是否值得在你的场景中投入:

第一层筛选:任务特征匹配度

  • 任务变化频率:每天/每周变化 → 高匹配;每月/每年变化 → 低匹配。
  • 精度要求:毫米级以上 → 高匹配;亚毫米级 → 低匹配。
  • 任务复杂度:5 秒内可演示完整任务 → 高匹配;需要 20 步以上或力反馈 → 低匹配。
  • 每个任务的执行次数:< 1000 次 → 高匹配;> 10000 次 → 低匹配(Fine-Tuning 更经济)。

第二层筛选:基础设施就绪度

  • 是否有 GEN-1.5 或类似支持 Physical Prompting 的基础模型?(2026 年 8 月,GEN-1.5 是唯一公开可用的选项)
  • 是否有能力收集高质量的物理演示?(需要操作员培训、演示设备、质量评估流程)
  • 是否有仿真环境用于预训练或演示验证?(Isaac Lab、MuJoCo 等)

第三层筛选:成本-收益分析

决策矩阵:

一个常见的误区:把 Physical Prompting 视为「银弹」,试图用它解决所有机器人学习任务。更理性的做法是把它视为工具箱中的一把新扳手——在合适的场景(任务多变、精度适中、部署时间敏感)它是最优解,但在其他场景它可能不如传统方法可靠。

8局限性与未解决问题

Physical Prompting 在 2026 年仍处于早期阶段,存在多个未解决的局限性:

局限性一:演示质量的敏感性。 GEN-1.5 对演示质量高度敏感。一次包含错误动作的演示会导致推理时的策略输出显著下降。目前缺乏自动化的演示质量评估工具,主要依赖人工检查。这意味着「演示工程师」这个角色在 2026 年仍然是人力密集的。

局限性二:长序列任务的误差累积。 ICRL 的「浅层适应」在长序列任务(超过 20 步)中会出现误差累积。每一步的小偏差会在后续步骤中被放大,最终导致任务失败。GEN-1.5 在 10 步以内的任务上表现稳定,但在 20 步以上的任务上成功率显著下降。

局限性三:缺乏可解释性。Physical Prompting 失败时,很难诊断失败原因——是演示质量不够?是任务超出了 ICRL 的适应范围?还是预训练阶段的某些偏差被放大?这种不可解释性在安全关键场景(如医疗机器人)中是一个严重的障碍。

局限性四:硬件依赖性。 GEN-1.5 目前主要支持 Generalist AI 自家的硬件平台。虽然理论上可以迁移到其他机器人平台,但实际迁移需要重新收集预训练数据和调整架构,成本不低。这意味着 Physical Prompting 在 2026 年仍然是一个「绑定特定供应商」的方案。

局限性五:安全验证不足。 Physical Prompting 的推理时适应机制缺乏形式化的安全保证。在传统 Fine-Tuning 中,你可以通过大量测试验证策略的安全性;但在 Physical Prompting 中,每次演示都可能产生不同的策略输出,安全验证的覆盖率难以保证。

研究前沿:2026 年下半年的研究方向包括:(1) 自动化演示质量评估和反馈;(2) 多层 ICRL(在推理时做更深的适应,而不仅是浅层调整);(3) 形式化安全保证(将 Physical Prompting 的输出约束在安全边界内)。这些方向的进展将决定 Physical Prompting 能否从「有前景的实验性技术」升级为「生产级可靠方案」。

9总结与行动建议

Physical Prompting 代表了机器人学习的一个重要方向:从「每个任务重新训练」到「一次演示即时适应」的范式转变。 GEN-1.5 在 2026 年 8 月的发布证明了这种范式在技术上是可行的,但仍处于早期阶段,存在多个未解决的局限性。

对于不同角色的行动建议:

如果你是机器人工程师: 评估你的场景中是否有「任务多变、精度适中、部署时间敏感」的需求。如果有,开始关注 GEN-1.5 和类似的基础模型,并在非关键场景中做小规模试点。同时,继续维护你的 Fine-Tuning 流水线——Physical Prompting 在 2026 年还无法完全替代传统方法。

如果你是技术管理者: Physical Prompting 的长期价值在于降低机器人部署的边际成本——每增加一个新任务的成本从「数周」降低到「数秒」。但这种价值的实现取决于技术成熟度的提升(特别是安全验证和长序列任务处理)。建议在 2026-2027 年保持关注,2027 年后根据技术进展决定是否大规模投入。

如果你是研究者: Physical Prompting 的开放问题包括:(1) 如何提高 ICRL 的适应深度,同时保持推理速度;(2) 如何自动化演示质量评估;(3) 如何为推理时适应提供形式化安全保证;(4) 如何跨机器人平台迁移 Physical Prompting 能力。这些问题都有较高的研究价值和实际意义。

最后一个判断: Physical Prompting 不是「机器人学习的终点」,而是「机器人学习工具箱中的一把新扳手」。它在特定场景下是最优解,但在其他场景下仍需要与传统方法组合使用。理解它的机制、边界和适用条件,比盲目追新或完全忽视都更有价值。

参考资料

🎯 相关面试题

巩固本篇知识点,备战 AI 岗位面试。