Key points are not available for this paper at this time.
Este trabalho examina se Transformers apenas de decodificador, como o LLaMA, que foram originalmente projetados para grandes modelos de linguagem (LLMs), podem ser adaptados para o campo da visão computacional. Primeiro, "LLaMAfizamos" um ViT padrão passo a passo para alinhar com a arquitetura do LLaMA e descobrimos que aplicar diretamente uma máscara causal à autoatenção traz um problema de colapso de atenção, resultando na falha do treinamento da rede. Sugerimos reposicionar o token de classe atrás dos tokens de imagem com uma técnica de token de classe pós-sequência para superar esse desafio, permitindo que a autoatenção causal capture eficientemente as informações da imagem inteira. Além disso, desenvolvemos uma estratégia de máscara suave que introduz gradualmente uma máscara causal à autoatenção no início do treinamento para facilitar o comportamento de otimização. O modelo adaptado, denominado image LLaMA (iLLaMA), é semelhante ao LLaMA em arquitetura e permite aprendizado supervisionado direto. Sua autoatenção causal aumenta a eficiência computacional e aprende representações complexas ao elevar os rankings do mapa de atenção. O iLLaMA rivaliza com o desempenho de seus equivalentes apenas de codificador, alcançando 75,1% de precisão top-1 no ImageNet com apenas 5,7M de parâmetros. Aumentar o modelo para aproximadamente 310M e pré-treiná-lo no ImageNet-21K melhora ainda mais a precisão para 86,0%. Experimentos extensivos demonstram as propriedades confiáveis do iLLaMA: calibração, viés de forma-textura, compatibilidade de quantização, segmentação ADE20K e aprendizado de transferência CIFAR. Esperamos que nosso estudo possa acender novas perspectivas para o design de modelos visuais na onda dos LLMs. Modelos pré-treinados e códigos estão disponíveis aqui.
Wang et al. (Qua,) estudaram essa questão.