A medida que los grandes modelos de lenguaje (LLMs) se despliegan cada vez más en el mundo real, la capacidad de "desaprender", o eliminar piezas específicas de conocimiento a posteriori, se ha vuelto esencial por diversas razones, desde regulaciones de privacidad hasta la corrección de contenido obsoleto o dañino. Trabajos anteriores han propuesto benchmarks y algoritmos para el desaprendizaje, y generalmente han asumido que el proceso de entrenamiento y el modelo objetivo son fijos. En este trabajo, investigamos empíricamente cómo las elecciones realizadas durante el tiempo de aprendizaje en la codificación del conocimiento impactan la efectividad del desaprendizaje del conocimiento factual. Nuestros experimentos revelan dos hallazgos clave: (1) aprender con descripciones parafraseadas mejora el rendimiento del desaprendizaje y (2) desaprender una pieza individual de conocimiento de un fragmento de texto es un desafío. Nuestros resultados sugieren que la codificación del conocimiento durante el tiempo de aprendizaje podría desempeñar un papel central en la habilitación de un desaprendizaje confiable a posteriori.
Wu et al. (Wed,) estudiaron esta cuestión.