精华速览
上海交通大学助理教授穆尧创办SeeAct AI观行智能,提出具身智能终局将从“被训练”走向“奖励驱动的自我进化”。穆尧曾主导RoboTwin基准,GitHub获超2900星,谷歌学术引用超5000次。他认为当前具身智能竞争集中在数据与模型规模,但真正缺失的是“经验规模化”——机器人在交互中自主产生、评价并复用经验的能力。SeeAct AI计划交付包含端侧算力、基础模型与Agent系统的软硬一体方案,目标让策略在陌生场景中约48小时自主提升至可用状态,从而终结传统项目制交付模式。
要点透视
- 穆尧现任上海交通大学长聘教轨助理教授,谷歌学术引用超过5000次,入选国家级青年人才计划。
- 其主导的RoboTwin基准在GitHub获超2900颗星,蚂蚁集团LingBot-VA、生数科技Motubrain等均在该基准上刷新成绩。
- 穆尧于2026年创办SeeAct AI观行智能,核心方向为“具身自我进化”,即奖励驱动的递归自我改进。
- 他提出具身智能Scaling三层框架:Scale up Data、Scale up Model,以及当前最欠缺的Scale up Experience(经验规模化)。
- SeeAct AI计划交付端侧算力平台、基础模型(含World Model、Policy Model、Reward Model)及完整Agent System,以工控机等软硬一体形式落地。
- 其目标是在新场景中约48小时内让策略自主提升至用户可用状态,替代传统项目制交付。
- 技术路线上,穆尧团队采用离散扩散VLA,以兼容PPO、GRPO等强化学习方法,并推进多任务多场景联合强化学习。
- 行业信号方面,Physical Intelligence的π*0.6和π0.7已开始严肃讨论经验数据进入模型,但走纯真机路线。
文章拆解
穆尧的创业选择建立在一个长期技术判断之上:具身智能的瓶颈正从“数据不够”转向“经验不够”。过去几年,人类演示数据采集方式快速进步,UMI、手持夹爪等方案让百万小时数据不再遥远,但这些数据主要教会机器人“人会怎么做”,而非“机器人自己遇到失败该怎么办”。穆尧将这一缺口定义为Experience Scaling,即机器人通过与环境的自主交互,持续产生、评价并复用经验。这一逻辑与强化学习中的奖励驱动一脉相承,但范围更广——不仅更新底层策略,也更新上层任务规划与记忆。
SeeAct AI的差异化在于将“自我进化”从研究问题转化为可交付系统。其产品包含World Model、Policy Model、Reward Model和Agent System,目标是在陌生场景中约48小时自主提升至可用状态。若实现,将直接冲击具身行业长期依赖工程师驻场、逐场景交付的项目制模式,使标准化产品替代定制化项目成为可能。穆尧认为,只有这样才能产生足够毛利率,让具身企业靠产品而非融资存活。
技术路线上,离散扩散VLA的选择值得关注。相比连续扩散或流匹配,离散扩散保留复杂动作轨迹生成能力,同时因输出为词元预测,更易适配PPO、GRPO等强化学习方法。这为后续奖励驱动优化降低了工程门槛。此外,穆尧提出“少量真机+大量虚拟空间”的数据策略,将物理引擎、World Model和真机自主交互视为三个“平行宇宙”,认为仿真世界不必与真实世界物理参数严格吻合,其规模化本身即可带来智能提升。这一观点尚待更多实证检验。
潜在风险同样明显。首先,递归自我进化在具身领域的可行性仍处早期,社交媒体已有质疑声音,认为概念包装大于实质。其次,仿真到真实的迁移虽在抓取等任务上有验证,但面对钥匙开锁等强物理接触任务,真机反馈仍不可替代。第三,World Model在严格物理规律上存在能力边界,推理时延与异步异频处理也是工程难点。最后,工业场景虽被选为首个验证方向,但其节拍要求和标准化程度能否支撑自进化系统的规模化复制,尚待确认。总体而言,穆尧的方向指向了具身智能从“训练”到“进化”的范式迁移,但这条路径的验证周期和商业化节奏仍充满不确定性。

暂无评论。