Los puntos clave no están disponibles para este artículo en este momento.
El auge de los Modelos de Lenguaje Grande (LLMs) ha avanzado significativamente muchas aplicaciones en tareas de ingeniería de software, particularmente en la generación de código. A pesar del rendimiento prometedor, los LLMs son propensos a generar alucinaciones, lo que significa que pueden producir salidas que se desvían de la intención del usuario, exhiben inconsistencias internas o no se alinean con el conocimiento factual, lo que hace que el despliegue de LLMs sea potencialmente arriesgado en una amplia gama de aplicaciones. Los trabajos existentes se centran principalmente en investigar la alucinación en el ámbito de la generación de lenguaje natural (NLG), dejando una brecha en la comprensión de los tipos y la extensión de las alucinaciones en el contexto de la generación de código. Para cerrar esta brecha, realizamos un análisis temático del código generado por LLM para resumir y categorizar las alucinaciones presentes en él. Nuestro estudio estableció una taxonomía completa de alucinaciones en el código generado por LLM, abarcando 5 categorías principales de alucinaciones dependiendo de los objetivos en conflicto y los diferentes grados de desviación observados en la generación de código. Además, analizamos sistemáticamente la distribución de las alucinaciones, explorando variaciones entre diferentes LLMs y su correlación con la corrección del código. Basado en los resultados, propusimos HalluCode, un punto de referencia para evaluar el rendimiento de los LLMs de código en el reconocimiento de alucinaciones. Los experimentos de reconocimiento y mitigación de alucinaciones con HalluCode y HumanEval muestran que los LLMs existentes enfrentan grandes desafíos para reconocer alucinaciones, particularmente en la identificación de sus tipos, y rara vez pueden mitigar alucinaciones. Creemos que nuestros hallazgos arrojarán luz sobre futuras investigaciones sobre la evaluación, detección y mitigación de alucinaciones, pavimentando el camino para construir LLMs de código más efectivos y confiables en el futuro.
Liu et al. (Mon,) estudiaron esta cuestión.