Key points are not available for this paper at this time.
La conception d'un contrôle probabiliste est fondée sur le principe qu'un agent rationnel tente d'associer un modèle à une densité de trajectoire de système en boucle fermée désirée arbitrairement. Le cadre a été proposé à l'origine comme une alternative praticable à la conception de contrôle optimal traditionnel, paramétrant le comportement souhaité par des densités de transition et de politique fictives et utilisant la projection d'information comme mesure de proximité. Dans ce travail, nous introduisons une parametrisation alternative du comportement désiré en boucle fermée et explorons des mesures de proximité alternatives entre les densités. Il est ensuite illustré comment les problèmes de contrôle probabilistes associés se résolvent en politiques incertaines ou probabilistes. Notre résultat principal est de montrer que les objectifs de contrôle probabilistes majorisent les objectifs de contrôle optimal conventionnels, stochastiques et sensibles au risque. Cette observation nous permet d'identifier deux itérations fixes probabilistes qui convergent vers les politiques de contrôle optimal déterministes établissant un lien explicite entre les deux formulations. De plus, nous démontrons que la formulation de contrôle optimal sensible au risque est également techniquement équivalente à un problème d'estimation par maximum de vraisemblance sur un modèle de graphe probabiliste où la notion de coûts est directement encodée dans le modèle. Le traitement associé du problème d'estimation coïncide alors avec la formulation de contrôle probabiliste projetée sur les moments. Ainsi, la prise de décision optimale peut être reformulée comme un problème d'inférence itératif. Sur la base de ces idées, nous discutons des directions pour le développement algorithmique.
Tom Lefebvre (Mercredi,) a étudié cette question.