Key points are not available for this paper at this time.
부분 관찰 가능 마르코프 결정 과정(POMDPs)은 실제 세계의 결정 및 제어 문제를 위한 유연한 표현을 제공합니다. 그러나 POMDPs는 특히 상태 및 관측 공간이 연속적이거나 혼합일 때 해결하기 notoriously 어렵습니다. 이는 물리 시스템에서 종종 일어나는 경우입니다. 최근의 온라인 샘플링 기반 POMDP 알고리즘은 관측 가능성 가중치로 계획하여 실질적인 효과성을 보여주었지만, 이러한 알고리즘이 사용하는 입자 필터링 기법의 근사 오류를 특징짓는 일반 이론은 제안된 적이 없습니다. 우리의 주요 기여는 어떤 POMDP와 그에 해당하는 유한 샘플 입자 신념 MDP(PB-MDP) 근사 간의 오류를 경계 짓는 것입니다. PB-MDP와 POMDP 사이의 이 기본적인 다리는 어떤 샘플링 기반 MDP 알고리즘을 POMDP에 적응시킬 수 있게 해 줍니다. 이를 위해 해당하는 입자 신념 MDP를 해결함으로써, MDP 알고리즘의 수렴 보장을 POMDP로 확장할 수 있습니다. 실제로, 이는 입자 필터 신념 전이 모델을 MDP 솔버의 생성 모델로 사용하여 구현됩니다. 이는 POMDP에서 관측 밀도 모델에 접근해야 하지만, MDP 솔버의 전이 샘플링 복잡성은 O(C)로 증가하며, 여기서 C는 입자 수입니다. 따라서 희소 샘플링 MDP 알고리즘과 결합했을 때, 이 접근 방식은 상태 및 관측 공간의 크기에 대한 직접적인 이론적 의존성이 없는 POMDP 알고리즘을 생성할 수 있습니다. 우리의 이론적 기여 외에도, 우리는 벤치마크 POMDP에서 다섯 개의 수치 실험을 수행하여 PB-MDP 근사를 사용하여 적응된 간단한 MDP 알고리즘인 Sparse-PFT가 다른 주요 연속 관측 POMDP 솔버와 경쟁력을 가지는 성능을 달성함을 입증합니다.
Lim et al. (금) 이 질문을 연구했습니다.