Key points are not available for this paper at this time.
이 논문은 불확실성 하의 의사결정에서 (부분 관찰 가능한) 마르코프 의사결정 문제에 대한 변량 자유 에너지 공식화를 설명합니다. 우리는 최적 제어가 능동적 추론으로 표현될 수 있음을 보여줍니다. 능동적 추론에서, 행동과 숨겨진 상태에 대한 사후 믿음 모두가 생성 모델 하에서 관찰된 상태의 음의 로그 가능성에 대한 자유 에너지 경계를 최소화합니다. 이 설정에서 보상이나 비용 함수는 상태 전환 및 최종 상태에 대한 이전 믿음에 흡수됩니다. 효과적으로 이것은 최적 제어를 순수 추론 문제로 변환하여 표준 베이지안 필터링 기법의 적용을 가능하게 합니다. 우리는 이후 미래의 숨겨진 상태에 대한 사후 믿음에 기반한 최적 궤적을 고려합니다. 중요하게도, 여기에는 생성 모델에 에이전시 표현을 부여하는 숨겨진 상태로서 제어를 모델링하는 것이 포함됩니다. 이는 숨겨진 제어 상태에 대한 추론이 있는 모델과 없는 모델을 구별하게 됩니다; 즉, 에이전시 없는 모델과 에이전시 기반 모델입니다.
Friston et al. (2012)는 이 질문을 연구했습니다.