摘要:
通过模仿学习赋予人形机器人拟人化运动技能,是构建多样化、高表现力机器人运动能力的重要途径。当前基于模仿学习的方法仍面临显著局限:以对抗运动先验(adversarial motion priors, AMP)为代表的对抗模仿方法虽能保留整体运动风格,却易丢失精细动作细节;而以Mimic为代表的精确模仿方法虽可高保真复现参考动作,却因策略与参考动作强耦合,难以响应实时控制指令。为此,提出一种新颖的模仿学习训练框架,通过观测空间与奖励机制的协同设计,显式解耦运动风格与任务目标,并实现二者高效协同。所提方法仅依赖高层速度指令驱动,成功将策略从“动作复现器”转变为“速度指令控制器”。实验表明,该策略在任意速度指令下均能实现高精度速度跟踪(整体误差< 0.13 m/s或rad/s),同时关键部位的位置和姿态相对原始参考动作的平均动态时间规整(dynamic time warping, DTW)距离分别为0.837与1.135,充分验证了其在精准响应任务指令的同时,有效保留了参考运动的自然风格特征。