Key points are not available for this paper at this time.
Gráficos são uma abstração útil do conteúdo de imagem. Não apenas os gráficos podem representar detalhes sobre objetos individuais em uma cena, mas também podem capturar as interações entre pares de objetos. Apresentamos um método para treinar uma rede neural convolucional de modo que ela receba uma imagem de entrada e produza uma definição de gráfico completa. Isso é feito de forma end-to-end em uma única etapa com o uso de embeddings associativos. A rede aprende a identificar simultaneamente todos os elementos que compõem um gráfico e a juntá-los. Avaliamos no conjunto de dados Visual Genome e demonstramos um desempenho de ponta na desafiadora tarefa de geração de gráficos de cena.
Newell et al. (qui,) estudaram esta questão.