Los puntos clave no están disponibles para este artículo en este momento.
Uno de los desafíos más apremiantes para la detección de videos manipulados con rostros es la generalización a métodos de falsificación no vistos durante el entrenamiento, mientras se sigue siendo efectivo bajo corrupciones comunes como la compresión. En este documento, examinamos si podemos abordar este problema aprovechando videos de rostros hablantes reales, que contienen información rica sobre la apariencia y el comportamiento facial natural y están disponibles en grandes cantidades en línea. Nuestro método, denominado RealForensics, consiste en dos etapas. Primero, explotamos la correspondencia natural entre las modalidades visual y auditiva en videos reales para aprender, de manera auto-supervisada y cruzada, representaciones de video temporalmente densas que capturan factores como movimientos faciales, expresión e identidad. Segundo, utilizamos estas representaciones aprendidas como objetivos para ser predichos por nuestro detector de falsificaciones junto con la habitual tarea de clasificación binaria de falsificaciones; esto lo anima a basar su decisión de real/falso en dichos factores. Mostramos que nuestro método logra un rendimiento de última generación en experimentos de generalización y robustez ante manipulaciones cruzadas, y examinamos los factores que contribuyen a su rendimiento. Nuestros resultados sugieren que aprovechar videos naturales y no etiquetados es una dirección prometedora para el desarrollo de detectores de falsificaciones faciales más robustos.
Haliassos et al. (2022) estudiaron esta cuestión.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: