Los puntos clave no están disponibles para este artículo en este momento.
Presentamos VILLA, el primer esfuerzo conocido en entrenamiento adversarial a gran escala para el aprendizaje de representaciones de visión y lenguaje (V+L). VILLA consta de dos etapas de entrenamiento: (i) pre-entrenamiento adversarial agnóstico a tareas; seguido de (ii) afinación adversarial específica para tareas. En lugar de añadir perturbaciones adversariales en píxeles de imagen y tokens textuales, proponemos realizar entrenamiento adversarial en el espacio de incrustación de cada modalidad. Para permitir el entrenamiento a gran escala, adoptamos la estrategia de entrenamiento adversarial "libre" y la combinamos con regularización basada en la divergencia KL para promover una mayor invariancia en el espacio de incrustación. Aplicamos VILLA a los modelos V+L de mejor rendimiento actual y logramos un nuevo estado del arte en una amplia gama de tareas, incluyendo Respuesta a Preguntas Visuales, Razonamiento Común Visual, Recuperación de Imagen y Texto, Comprensión de Expresiones Referenciales, Entailment Visual y NLVR2.
Gan et al. (Thu,) estudiaron esta cuestión.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: