Key points are not available for this paper at this time.
古典的計画アプローチは、可能な場合に与えられた目標状態を達成できる一連の行動を見つけることを保証しますが、環境の動態を支配する論理的な行動意味論を専門家が指定する必要があります。研究者たちは、ラージ・ランゲージ・モデル(LLM)が常識知識と最小限のドメイン情報だけに基づいて計画ステップを直接推測できることを示していますが、そのような計画は実行時に失敗することが多いです。私たちは、古典的計画とLLMの常識推測の強みを組み合わせて、環境そのものとの閉ループ相互作用に基づいて、行動の前提条件と後提条件を学習し、検証します。私たちは、LLM推論を活用して部分的なドメイン知識が与えられた古典的プランナーによって発生した部分的計画をヒューリスティックに完了し、実行後の環境フィードバックに基づいて論理言語でドメインの意味ルールを推論するPSALMを提案します。7つの環境での分析により、専門家がキュレーションした1つの例の計画を使用することで、ヒューリスティックプランナーやルール予測器としてLLMを用いると、ランダム探索よりも環境実行ステップと環境リセットが少なく、ドメインの基礎となる真実の行動意味論を同時に回復できることが示されました。
Zhu et al. (火曜日)はこの問題を研究しました。