A Destilação de Conhecimento (KD) em geral e a destilação de características em particular são técnicas promissoras para reduzir a alta demanda computacional de grandes modelos de linguagem (LLMs). No entanto, os métodos tradicionais de KD de características normalmente assumem que o professor e o aluno compartilham o mesmo tamanho oculto, limitando a flexibilidade da arquitetura do aluno. Uma solução comum para esse problema envolve treinar um projetor linear para alinhar seus espaços de características, mas isso introduz parâmetros adicionais que precisam ser aprendidos desde o início e muitas vezes degradam o desempenho em tarefas subsequentes, especialmente em configurações generativas. Para abordar essa questão, neste trabalho, propomos um novo método de destilação de características baseado em tarefas que permite a transferência de conhecimento entre modelos de professor e aluno com diferentes dimensões de camadas ocultas, sem introduzir novos parâmetros. Aproveitando a percepção de que apenas um subconjunto dos componentes de LLM contribui significativamente para uma tarefa subsequente específica, nossa abordagem identifica as unidades ocultas mais relevantes para a tarefa no professor e destila diretamente suas ativações para o aluno. Nosso método é flexível e se integra facilmente com outras estruturas de destilação. Resultados empíricos mostram melhorias consistentes em relação a abordagens anteriores em diversas tarefas, incluindo classificação, seguimento de instruções e sumarização, alcançando até 3% de ganho de desempenho em relação à linha de base da projeção linear.
Saadi et al. (2025) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: