O Ajuste Visual Contínuo (CVIT) permite que Modelos de Linguagem Grande Multimodal (MLLMs) aprendam incrementalmente novas tarefas ao longo do tempo. No entanto, esse processo enfrenta o desafio do esquecimento catastrófico, onde o desempenho nas tarefas aprendidas anteriormente deteriora à medida que o modelo se adapta a novas. Uma abordagem comum para mitigar o esquecimento é a expansão da arquitetura, que introduz módulos específicos da tarefa para evitar interferência. No entanto, métodos existentes frequentemente expandem camadas inteiras para cada tarefa, levando a um sobrecarga significativa de parâmetros e baixo escalonamento. Para superar esses problemas, introduzimos LoRA em LoRA (LiLoRA), um método de expansão de arquitetura altamente eficiente, adaptado para CVIT em MLLMs. LiLoRA compartilha a matriz LoRA A entre tarefas para reduzir redundância, aplica uma decomposição de baixo rank à matriz B para minimizar parâmetros específicos da tarefa e incorpora uma perda de estabilidade regularizada por cosseno para preservar a consistência em representações compartilhadas ao longo do tempo. Experimentos extensivos em um benchmark CVIT diversificado mostram que LiLoRA consistentemente alcança um desempenho superior no aprendizado sequencial de tarefas, enquanto melhora significativamente a eficiência dos parâmetros em comparação com abordagens existentes.
Che et al. (Sex,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: