内容概览
这场 YC Robotics Club 分享以一个反复落空的预言开场:过去十年,每次算法、仿真或遥操作数据取得突破,人们都会宣布“明年机器人就会被解决”,但截至 2026 年中,通用家用机器人仍未到来。演讲者首先归纳真实世界物理、动作表示、感知运动能力和机体漂移等基础障碍,随后展示五条互补路径:MAM 用短期视觉记忆与长期文本记忆支持长时程任务和错误适应;R&B Encore 自动筛选简洁、非平凡且能预测动作的具身推理;Sim-to-Real 通过大规模仿真强化学习训练单一灵巧策略,并以目标位姿序列提示新任务;Rerun 主张机器人应用公司先用遥操作验证商业价值,再建立评测、数据和运营闭环;General Instinct 则通过蒸馏、双 Transformer 与少步流匹配降低世界动作模型延迟。共同结论是:机器人进展不能只看精彩演示,还要看感知、控制、恢复、评测、成本和现场运营能否形成持续迭代系统。
更多内容
机器人能力演进脉络
从历次“明年解决机器人”的乐观预期,到本次分享提出的研究与商业化路径。
- 约十年前 AlphaGo 出现后,业界认为算法已经具备,只需扩大规模即可解决机器人问题。
- MuJoCo 等仿真环境展示了机器人可在数千次迭代中学会行走,再次强化了短期突破预期。
- ALOHA 与低成本遥操作数据收集成为新的突破点,展示浇花、修车、制作咖啡和剃须等任务。
- 截至 2026 年 7 月,部分机器人仍只能预订,通用家用机器人尚未出现,但高质量演示大量涌现。
- 本次分享分别提出多尺度记忆、具身推理自举、统一目标位姿策略、应用公司闭环和世界动作模型加速。
综合洞察
跨越多场分享后可以归纳出的共同模式与隐含结论。
- 机器人智能的核心稀缺资源不是任意数量的数据,而是与具体机体、失败状态和业务目标对齐的数据。MAM 的记忆标注、R&B Encore 的动作预测评分、Sim-to-Real 的扰动训练和 Rerun 的现场反馈都在优化数据的相关性,而非只追求规模。
- 文本是一种实用但过渡性的机器人中间表示:它易监督、易调试、能复用互联网预训练先验,却可能限制非语言化的记忆与连续推理。多位演讲者都把潜在空间表示视为值得探索的后续方向。
- 可靠性来自覆盖变化与失败,而不是只优化理想轨迹。随机外力产生恢复能力,记忆阻止重复犯错,现场部署揭示实验室无法预见的故障,机体漂移则要求持续校准或再学习。
- 通用基础模型与垂直应用公司并非替代关系。基础模型降低能力门槛,应用公司则通过客户环境、评测标准、硬件维护、交付和数据闭环,把通用能力转化为可持续业务。
- 当前系统的瓶颈经常位于模型之外:触觉硬件不足、位姿跟踪遮挡、执行器老化、评测样本昂贵和物理数据基础设施都会限制最终表现。
关键方案对比
演讲中明确出现的模型、数据与创业路径差异。
- 无记忆策略只看当前观测,容易无限重复动作;多尺度记忆策略同时跟踪近期视觉细节和长期任务进度,并能根据先前失败调整行为。
- 穷举式推理会引入冗余、干扰和延迟;选择性推理仅保留对当前机体和动作预测真正有用的内容。
- 遥操作模仿受机体差异和力反馈不足限制;仿真强化学习可大规模生成交互经验并直接优化奖励,但受仿真覆盖范围和现实感知模块制约。
- 机器人基础模型公司追求跨任务通用能力;机器人应用公司从单一付费场景出发,依靠部署、运营、数据和客户知识建立壁垒。
- 视觉动作模型更小、更快,通常直接由当前观测预测动作;世界动作模型显式学习未来视觉与运动学,表示更丰富但扩散推理成本更高。
技术细节
模型结构、训练机制、控制频率与系统瓶颈等可复用信息。
- MAM 的短期编码器以 ViT 为基础加入时间注意力层,处理多帧后丢弃除当前图像外的令牌;长期记忆则由高层策略循环生成文本草稿,并在下一步重新输入。
- MAM 当前通过监督微调训练高层记忆,需要人工预先定义并标注应追踪的信息;后续方向是直接在记忆空间使用强化学习,学习保存与召回内容。
- R&B Encore 的验证分数包含简洁性、非平凡性和动作预测能力;评分后的推理轨迹被重采样为与机体和动作对齐的合成训练集。
- Sim-to-Real 策略输入包括本体感觉、当前物体位姿、可抓取区域包围盒和当前目标位姿,使用 LSTM 输出整只手与机械臂的关节位置目标。
- Sim-to-Real 同时控制 22 自由度手和 7 自由度机械臂,控制频率为 60 Hz;目标序列由 FoundationPose 和 SAM 从第三人称人类视频中提取。
- 训练目标通过随机采样位置与旋转生成首个目标,后续目标相对前一目标最多移动约 10 厘米并旋转最多 90 度。
- Rerun 强调物理数据具有多模态、多速率、事件分段、三维语义和嵌套结构,底层存储必须支持记录、查询、检查、训练加载和大规模数据目录。
- 世界动作模型在流匹配中对未来潜变量加噪,再学习速度场以反向恢复干净状态;分类器自由引导会让条件与无条件路径重复执行扩散 Transformer。
- General Instinct 将视频和动作建模拆分为两个 Transformer,以交叉注意力把视频隐藏状态传给动作模型,并把原本约 50 至 100 步的流匹配采样蒸馏到约 1 至 3 步。
- 其报告的推理目标是在 Jetson Thor 上约 500 毫秒生成一个包含 16 个动作的分块,但转录未提供独立基准条件或精度数据。