En este artículo, presentamos IAFormer, una novedosa arquitectura basada en Transformer que integra de manera eficiente las interacciones entre partículas a través de un mecanismo de atención escasa dinámica. IAFormer tiene dos nuevos mecanismos dentro del modelo. Primero, la matriz de atención depende de cantidades par a par invariantes ante aumentos predefinidos, reduciendo significativamente los parámetros de la red en comparación con los modelos originales de transformadores de partículas. Segundo, IAFormer incorpora el mecanismo de atención escasa utilizando la ''atención diferencial'', de modo que puede priorizar dinámicamente los tokens de partículas relevantes mientras reduce la sobrecarga computacional asociada con los menos informativos. Este enfoque reduce significativamente la complejidad del modelo sin comprometer el rendimiento. A pesar de ser computacionalmente más eficiente en más de un orden de magnitud que la red de Particle Transformer, IAFormer logra un rendimiento de última generación en tareas de clasificación en los conjuntos de datos de top y quark-gluon. Además, empleamos técnicas de interpretabilidad de IA, verificando que el modelo captura efectivamente información físicamente significativa capa por capa a través de su mecanismo de atención escasa, construyendo una salida de red eficiente que es resistente a las fluctuaciones estadísticas. IAFormer resalta la necesidad de atención escasa en el análisis de Transformer para reducir el tamaño de la red mientras mejora su rendimiento.
Waleed Esmail, Ahmed Hammad, Mihoko Nojiri (miércoles,) estudiaron esta pregunta.