Key points are not available for this paper at this time.
A capacidade de prever estados futuros do ambiente é um pilar central da inteligência. Em sua essência, uma previsão eficaz requer um modelo interno do mundo e uma compreensão das regras pelas quais o mundo muda. Aqui, exploramos os modelos internos desenvolvidos por redes neurais profundas treinadas usando uma perda baseada na previsão de quadros futuros em sequências de vídeo sintéticas, utilizando uma arquitetura CNN-LSTM-deCNN. Mostramos primeiro que essa arquitetura pode alcançar um desempenho excelente em tarefas de previsão de sequências visuais, incluindo um desempenho de ponta em um conjunto de dados padrão de 'bolas quicando' (Sutskever et al., 2009). Usando um erro médio ponderado e perda adversarial (Goodfellow et al., 2014), a mesma arquitetura extrapola com sucesso rotações fora do plano de rostos gerados por computador. Além disso, apesar de ter sido treinada de ponta a ponta para prever apenas informações em nível de pixel, nossas Redes Gerativas Preditivas aprendem uma representação da estrutura latente dos objetos tridimensionais subjacentes. Importante, encontramos que essa representação é naturalmente tolerante a transformações de objetos e generaliza bem para novas tarefas, como a classificação de imagens estáticas. Modelos similares treinados exclusivamente com uma perda de reconstrução não conseguem generalizar tão efetivamente. Argumentamos que a previsão pode servir como uma perda não supervisionada poderosa para aprender representações internas ricas de características de objetos de alto nível.
Lotter et al. (Qui,) estudaram esta questão.