Key points are not available for this paper at this time.
近年来,动力学参数上的域随机化作为一种在机器人操作中实现强化学习策略仿真到现实迁移的方法,受到了广泛关注;然而,寻找最优的随机化分布可能十分困难。在本文中,我们提出了 DROPO,这是一种用于估计域随机化分布以实现安全仿真到现实迁移的新方法。与以往的工作不同,DROPO 仅需要有限的、预先收集的离线轨迹数据集,并采用基于似然的方法明确建模参数不确定性以匹配真实数据。我们证明了 DROPO 能够在仿真中恢复动力学参数分布,并找到能够补偿未建模现象的分布。我们还在两个零样本仿真到现实迁移场景中评估了该方法,展示了成功的域迁移以及相较于以往方法的性能提升。
Tiboni et al. (Fri,) 对这一问题进行了研究。
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: