Los puntos clave no están disponibles para este artículo en este momento.
Este estudio considera el problema de los bandits contextuales lineales con contextos independientes y distribuidos de manera idéntica (i. i. d. ). En este problema, los estudios existentes han propuesto algoritmos de Mejor de Ambos Mundos (BoBW) cuyos arrepentimientos satisfacen O (² (T) ) para el número de rondas T en un régimen estocástico con una brecha de suboptimalidad acotada inferiormente por una constante positiva, mientras que satisfacen O (T) en un régimen adversarial. Sin embargo, la dependencia de T tiene margen para mejora, y la suposición de la brecha de suboptimalidad puede relajarse. Para este asunto, este estudio propone un algoritmo cuyo arrepentimiento satisface O ( (T) ) en el contexto cuando la brecha de suboptimalidad está acotada inferiormente. Además, introducimos una condición de margen, una suposición más ligera sobre la brecha de suboptimalidad. Esa condición caracteriza la dificultad del problema vinculada a la brecha de suboptimalidad utilizando un parámetro (0, ]. Luego mostramos que el arrepentimiento del algoritmo satisface O (\ (T) \^1+{2+}T^1{2+}). Aquí, = corresponde al caso en los estudios existentes donde existe una cota inferior en la brecha de suboptimalidad, y nuestro arrepentimiento satisface O ( (T) ) en ese caso. Nuestro algoritmo propuesto se basa en el Seguimiento del Líder Regularizado con la entropía de Tsallis y se refiere como el -Lineal-Contextual (LC) -Tsallis-INF.
Kato et al. (2024) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: