A destilação de conhecimento com múltiplos professores transfere conhecimento de vários grandes modelos professores para um pequeno modelo aluno e tem desempenho satisfatório em muitas tarefas subsequentes. No entanto, ao destilar conhecimento de múltiplos professores, sempre enfrenta problemas severos de ser demorado e extenso em termos de armazenamento para o treinamento e a inferência de múltiplos modelos professores. Apresentamos o MoE-KD, uma estrutura simples, mas eficaz, que produz supervisão para o treinamento do modelo aluno a partir de um único modelo professor, o que resolve os problemas acima e melhora a eficácia. No MoE-KD proposto, múltiplos prompts treináveis são usados para extrair diferentes visões de amostras de um único modelo de linguagem pré-treinado e apenas alguns parâmetros (prompts) precisam ser treinados e armazenados. Para garantir que os sinais de supervisão gerados tenham maior robustez e correção, introduzimos um mecanismo baseado em incerteza e um módulo seletor, que roteia a instância de entrada para seu professor correspondente. Também estendemos o MoE-KD para cenários de aprendizagem ao longo da vida, propondo uma solução leve para o esquecimento catastrófico. Conduzimos experimentos em cenários tradicionais de KD e cenários de aprendizagem ao longo da vida. O MoE-KD gera melhorias de até 1,1% e 140% em precisão e eficiência na destilação de conhecimento e 2,8% de melhorias em média na aprendizagem ao longo da vida, em comparação com métodos de linha de base robustos.
Meng et al. (2026) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: