Los puntos clave no están disponibles para este artículo en este momento.
Modelar la compatibilidad en moda es un desafío debido a su complejidad y subjetividad. Los trabajos existentes se centran en predecir la compatibilidad entre imágenes de productos (por ejemplo, una imagen que contenga una camiseta y una imagen que contenga un par de jeans). Sin embargo, estos enfoques ignoran imágenes de `escenas' del mundo real (por ejemplo, selfies); tales imágenes son difíciles de manejar debido a su complejidad, desorden, variaciones en iluminación y pose, etc., pero, por otro lado, podrían proporcionar un contexto clave (por ejemplo, el tipo de cuerpo del usuario o la temporada) para hacer recomendaciones más precisas. En este trabajo, proponemos una nueva tarea llamada `Completa el look', que busca recomendar productos visualmente compatibles basados en imágenes de escenas. Diseñamos un enfoque para extraer datos de entrenamiento para esta tarea y proponemos una forma novedosa de aprender la compatibilidad escena-producto a partir de imágenes de moda o diseño de interiores. Nuestro enfoque mide la compatibilidad tanto global como localmente a través de CNN y mecanismos de atención. Experimentos extensivos muestran que nuestro método logra mejoras de rendimiento significativas sobre sistemas alternativos. También se realiza una evaluación humana y un análisis cualitativo para entender mejor el comportamiento del modelo. Esperamos que este trabajo pueda conducir a aplicaciones útiles que vinculen grandes corpus de escenas del mundo real con productos comprables.
Kang et al. (Sáb,) estudiaron esta cuestión.