Key points are not available for this paper at this time.
我々は、ドメイン知識やオフラインデータから構築されたヒューリスティックを用いて強化学習(RL)アルゴリズムを加速するための枠組みを提供します。タブラ・ラサRLアルゴリズムは、環境との相互作用や連続的な意思決定タスクのホライズンに比例してスケーリングする計算を必要とします。我々の枠組みを使用して、ヒューリスティックガイドによるRLが元のタスクを確実に解決するはるかに短いホライズンのサブ問題を誘発する方法を示します。我々の枠組みは、有限の相互作用予算の下でRLのバイアスと分散を制御するためのホライズンベースの正則化と見なすことができます。理論的には、良いヒューリスティックの特性とそのRL加速への影響を特徴付けます。特に、RLエージェントが過去の知識を超えて外挿することを可能にする改良可能なヒューリスティックという新しい概念を導入します。実証的には、我々の枠組みを利用して、シミュレーションされたロボット制御タスクや手続き生成されたゲームにおいて、いくつかの最先端アルゴリズムを加速させる事例を示します。我々の枠組みは、専門家のデモや探索的データセットを用いてRLをウォームスタートする豊富な文献に補完的であり、RLへの先行知識注入のための原則的な方法を紹介します。
Cheng et al. (Sat,) はこの問題を調査しました。