Los modelos gráficos sirven como herramientas fundamentales para codificar estructuras de dependencia condicional en datos biológicos multivariados, desempeñando los modelos gráficos gaussianos con variables latentes un papel esencial en la captura de dependencias complejas en presencia de variables de confusión no observadas. Sin embargo, las implementaciones prácticas a menudo se enfrentan a dos desafíos críticos: la heterogeneidad sistemática derivada de subpoblaciones no observadas (p. ej., subtipos tumorales, grupos celulares o estratificaciones de pacientes) y los valores atípicos (p. ej., artefactos técnicos o variaciones fenotípicas raras), los cuales pueden distorsionar sustancialmente la estructura de red subyacente. Para abordar estos problemas, ampliamos el modelo gráfico gaussiano con variables latentes integrando un modelo de mezclas, proponiendo un marco de trabajo robusto adaptado a la heterogeneidad de los datos. El método propuesto puede lograr simultáneamente la estimación de la estructura de la red (tras eliminar los efectos compartidos de las variables latentes), la detección de valores atípicos y la identificación de la pertenencia a subgrupos. Se desarrolla un algoritmo computacional eficaz. Amplias evaluaciones experimentales demuestran que el método propuesto ofrece una estimación gráfica fiable en presencia de heterogeneidad, manteniendo la robustez incluso frente a una proporción significativa de valores atípicos. El análisis de heterogeneidad de un conjunto de datos de cáncer de mama ilustra aún más la aplicabilidad práctica del enfoque propuesto y sus sólidas implicaciones biológicas.
Li et al. (Fri,) estudiaron esta cuestión.