本稿は、コンピュータサイエンスの視点から強化学習の分野を調査します。これは機械学習に精通した研究者がアクセスできるように書かれています。分野の歴史的背景と現在の広範な研究成果が要約されています。強化学習とは、動的環境との試行錯誤の相互作用を通じて行動を学習するエージェントが直面する問題です。ここで述べられる作業は心理学の作業に類似していますが、具体的な詳細と「強化」という言葉の使用において著しく異なります。論文では、探査と利用のトレードオフ、マルコフ決定理論による分野の基礎の確立、遅延強化からの学習、学習を加速するための経験モデルの構築、一般化と階層の活用、隠れた状態への対処など、強化学習の中心的な問題について議論しています。最後に、いくつかの実装されているシステムの調査と、現在の強化学習手法の実用性に関する評価が含まれています。
Kaelbling et al. (Wed,) はこの質問を研究しました。