Key points are not available for this paper at this time.
本研究では、強化学習(RL)におけるゼロショット一般化(ZSG)の課題に取り組みます。この課題では、エージェントが追加のトレーニングなしで全く新しい環境に適応しなければなりません。私たちは、環境の重力レベルなどの文脈的手がかりを理解し、活用することが堅牢な一般化にとって重要であると主張し、文脈表現の学習をポリシー学習と直接統合することを提案します。我々のアルゴリズムは、さまざまなシミュレーションドメインで一般化が改善され、ゼロショット設定において以前の文脈学習技術を上回ります。ポリシーと文脈を共同で学習することで、我々の手法は行動特異的な文脈表現を獲得し、見えない環境への適応を可能にします。また、多様な現実世界のタスクにわたって一般化する強化学習システムへの進展を示します。私たちのコードと実験は、https://github.com/tidiane-camaret/contextualᵣlᵦeroₛhot で利用可能です。
Ndir ら(Mon、)はこの問題を研究しました。