Generalist AI发布GEN-1.5:机器人只需看一次3-12秒演示即可学会新任务,物理AI进入一次学习时代
发布时间:2026年08月24日 14:00:00概述Generalist AI发布第三代机器人基础模型GEN-1.5,该模型展现出一次学习能力:将3-12秒的感觉运动演示数据放入30秒上下文窗口,机器人即可立即执行新任务,无需梯度更新或微调。在10项任务上一次学习平均成功率59%,10步梯度更新后达83%。这是首个在大规模物理技能一次学习中展现该能力的模型。
Generalist AI发布GEN-1.5:机器人只需看一次3-12秒演示即可学会新任务,物理AI进入一次学习时代
8 月 24 日,机器人基础模型公司 Generalist AI 发布其第三代机器人基础模型 GEN-1.5。该模型最引人注目的能力,是把语言模型中的『上下文学习』迁移到了物理世界——只要把 3 至 12 秒的感觉运动演示数据放入 30 秒上下文窗口,机器人即可立即执行此前从未见过的新任务,整个过程不需要任何梯度更新或微调。在 10 项任务上,一次学习平均成功率达 59%(±10%);若额外进行 10 步梯度更新(约 5 分钟数据、50 次演示),成功率可跃升至 83%(±9%)。这是首个在大规模物理技能一次学习中展现该能力的模型,Generalist 自身将其类比为 GPT-3 在文本领域点燃的上下文学习时刻。
一次学习的三类数字:一次、1步、10步
GEN-1.5 的关键数据按学习深度分层,对应不同部署成本:
| 学习模式 | 数据量 / 步数 | 成功率 | 适用场景 |
|---|---|---|---|
| 一次学习(one-shot) | 3–12 秒演示放入 30 秒上下文 | 59%(±10%) | 即时部署、零额外训练成本 |
| 1 步梯度更新 | 约 1 分钟数据 | 在保留任务上 66.5% | 防止学新忘旧 |
| 10 步梯度更新 | 约 5 分钟数据 / 50 次演示 | 83%(±9%) | 高可靠性生产任务 |
这三档数字共同构成 GEN-1.5 的产品边界:一次学习解决了『能不能立刻上手』,10 步梯度更新解决了『能不能稳定投产』。Generalist 在发布中坦承,目前任务仍以简单短程操作为主,成功率数字『适度』而非惊艳——这是少见的不把 demo 当产品卖的城市级诚实。
物理提示:从8个月预训练中涌现的能力
Generalist 把 GEN-1.5 的一次学习机制命名为 physical prompting(物理提示),直接对标 GPT-3 的 in-context learning。其工程意义在于这套能力并非靠专门架构拼出:
- 无专门架构设计:模型结构沿用通用机器人基础模型范式;
- 无元学习循环:未引入 MAML、Reptile 等显式元学习目标;
- 无辅助目标:未额外加模仿学习或对比学习损失;
- 能力来源:从 8 个多月连续预训练 中自然涌现。
也就是说,一次学习不是被设计出来的,而是被『喂』出来的——这与语言模型中上下文学习涌现的路径高度同构,进一步支持『规模 + 长时间连续预训练 → 涌现行为』在物理 AI 同样成立。
三项延伸能力:组合泛化、零样本仿真到真实、人到机器人
GEN-1.5 还展现了三项超出主任务的能力,每一项都对应一类实际部署需求:
组合泛化:把两个独立任务的演示链入上下文,模型能自动生成两段演示之间的桥接动作,完成从未被单独演示过的组合任务。这对应产线上『已知技能拼接成新工序』的诉求。
零样本仿真到真实迁移:演示录制于仿真环境,但预训练数据中不含任何仿真数据,模型仍能直接在真实机器人上执行。这打破了以往『仿真训练—真实部署』必须共享数据域的强假设,意味着仿真可作为演示采集的低成本前端,而无需污染预训练分布。
人到机器人的上下文学习:模型可从人类操作视频中提取行为模式并迁移到机械臂执行。NVIDIA 资深科学家 Jim Fan 公开评论指出,GEN-1.5 的错误恢复能力应归因于训练数据保留了人类操作中的失误片段,而非按惯例修剪掉——『学会从错误中恢复』正是机器人能否走出实验室的关键。
手持夹爪:遥操作数据采集方式的终结信号
一个被低估的细节是,GEN-1.5 配套演示采集已转向手持夹爪:研究员直接手持一个轻量化夹爪录制感觉运动数据,而非依赖传统遥操作主手或 VR 设备。这一转变的工程含义有三层:
- 采集成本下降一个数量级:手持夹爪可由非工程师批量录制,演示库扩张速度不再受遥操作设备数量瓶颈限制;
- 数据分布更接近真实人类操作:包含自然抖动、试探、纠错等真实人类操作特征,直接对应 GEN-1.5 错误恢复能力的来源;
- 标志着遥操作数据采集方式的终结:当手持夹爪能把 3–12 秒演示喂给一次学习模型时,传统遥操作主手在『新技能录入』环节的存在意义被结构性削弱。
融资与边界:4亿美元后的『适度』目标
Generalist AI 于今年 6 月完成 4 亿美元融资,GEN-1.5 是融资后首个重大模型里程碑。公司在发布中明确承认:
- 当前任务仍以简单、短程操作为主,复杂长程任务的可靠性尚不足以直接投产;
- 59% / 83% 的成功率是『适度』而非『惊艳』,发布目的是公开能力边界以推动社区协作;
- 一次学习与 10 步梯度更新的组合,被定位为通向通用机器人能力的中间站,而非终点。
一句话总结:GEN-1.5 用 3–12 秒演示喂出 59% 的一次学习成功率、10 步梯度更新拉到 83%,并伴随手持夹爪宣告遥操作采集时代走向终结——物理 AI 第一次复刻了 GPT-3 式的『上下文学习涌现』,即便任务仍简单、成功率仍适度,方向已经清楚。