Key points are not available for this paper at this time.
我々は、クロスエンボディメント逆強化学習の問題を研究します。これは、1つまたは複数のエンボディメントにおけるビデオデモンストレーションから報酬関数を学習し、その後、異なるエンボディメント(例:異なるアクション空間、ダイナミクス、サイズ、形状など)に学習した報酬を転送したいというものです。エンボディメント間で転送可能な報酬関数を学習することは、人間のビデオデモンストレーションを通じてロボットにポリシーを教えたり、異なるエンボディメントを持つ別のロボットからポリシーを模倣させるような設定において重要です。しかし、従来の研究は、ほぼ最適なデモンストレーションが利用可能なケースにのみ焦点を当てており、これはしばしば保証が難しいです。それに対して、我々は混合品質のデモンストレーションからのクロスエンボディメント報酬学習の設定を研究します。我々は、従来の研究が混合品質のデータから学習する際に一般化可能な報酬表現を学習するのに苦労していることを示します。その後、人間のフィードバックを活用して表現学習と整合性を高め、効果的なクロスエンボディメント学習を可能にするいくつかの技法を分析します。我々の結果は、異なる表現学習技法がどのように質的に異なる報酬形成行動を導くか、および混合品質、混合エンボディメントデータから学習する際の人間のフィードバックの重要性についての洞察を提供します。
Mattson ら (Sat,) はこの問題を研究しました。