Estudiamos un problema secuencial de asignación de recursos donde un tomador de decisiones selecciona subconjuntos de agentes en cada periodo para maximizar los resultados generales sin conocimiento previo de los efectos a nivel individual. Nuestro marco se aplica a contextos como intervenciones de salud comunitaria, publicidad digital dirigida y programas de retención de personal, donde los efectos de intervención evolucionan dinámicamente. Los agentes pueden mostrar habituación (respuesta disminuida por selección frecuente) o recuperación (respuesta aumentada por selección poco frecuente). El desafío técnico se centra en distribuciones de recompensa no estacionarias que conducen a efectos de intervención que cambian con el tiempo. El problema requiere equilibrar dos objetivos clave en competencia: las recompensas individuales heterogéneas y el compromiso de exploración-explotación en términos de aprendizaje para mejorar decisiones futuras en lugar de maximizar resultados inmediatos. Nuestra contribución introduce el primer marco que incorpora esta forma de recompensas no estacionarias en la literatura de bandits combinatorios de múltiples brazos. Desarrollamos algoritmos con garantías teóricas sobre el arrepentimiento dinámico y demostramos eficacia práctica a través de un estudio de caso de intervención en diabetes. Nuestro algoritmo de intervención comunitaria personalizada logró hasta tres veces más mejora en la inscripción al programa en comparación con enfoques basales, validando el potencial del marco para aplicaciones del mundo real. Este trabajo vincula avances teóricos en aprendizaje adaptativo con desafíos prácticos en intervenciones de cambio conductual a nivel poblacional.
Adams et al. (2025) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: