Key points are not available for this paper at this time.
物理的なタスクにおける強化学習の適用は非常に困難です。現在の強化学習手法が要求するように、大量の試行を物理的環境でサンプリングすることは一般的に不可能です。本論文は、コストの高い物理的環境である中国最大のオンライン小売プラットフォームの一つ、タオバオにおける商品の検索を改善するために強化学習を使用するプロジェクトについて報告します。タオバオで直接強化学習をトレーニングする代わりに、環境構築アプローチを提案します:過去の顧客行動データから学習したシミュレーター、「バーチャルタオバオ」を構築し、物理的なサンプリングコストなしでバーチャルタオバオでポリシーをトレーニングします。シミュレーションの精度を向上させるために、マッチした分布で顧客特徴を生成するためのGAN-SD(分布シミュレーションのためのGAN)を提案し、より汎用的な顧客行動を生成するためにMAIL(多エージェント逆模倣学習)を提案します。また、シミュレーターの不完全性に過剰適合するのを避けるために、ポリシーモデルを正則化するためのANC(アクションノルム制約)戦略を提案します。実験では、バーチャルタオバオは数億人の実際のタオバオ顧客の記録からトレーニングされています。リアルなタオバオと比較して、バーチャルタオバオは実環境の重要な特性を忠実に再現します。さらに、物理的サンプリングコストがゼロのバーチャルタオバオで純粋にトレーニングされたポリシーが、従来の教師ありアプローチに比べて実世界での性能が顕著に優れていることをオンラインA/Bテストを通じて示します。本研究が複雑な物理的環境における強化学習の適用に新たな視点を提供できることを願っています。
Shi et al. (水曜日) はこの問題を研究しました。