Los puntos clave no están disponibles para este artículo en este momento.
Ha habido afirmaciones generalizadas en la literatura sobre las capacidades emergentes de razonamiento de los Modelos de Lenguaje Grande Preentrenados. Sin embargo, estudios recientes han encontrado que su capacidad de planificar sigue siendo cuestionable. A través de nuestros experimentos usando GPT-2, demostramos empíricamente que el rendimiento de una línea base ajustada finamente sigue siendo deficiente porque viola las precondiciones de las acciones en los planes que genera. Para mejorar las capacidades de planificación de un LLM ajustado finamente, entrenamos un verificador, que puede clasificar acciones como válidas o inválidas en un estado particular. Al tomar muestras aleatorias de acciones del mismo conjunto de datos, generamos ejemplos de acciones inválidas que luego se utilizan para entrenar un verificador que puede verificar la aplicabilidad de las acciones. En presencia de muestreo diverso de un generador y un verificador que puede podar trayectorias inválidas, mostramos ganancias significativas en la tasa de éxito en el dominio Blocksworld. Además, mostramos que ajustar finamente el generador GPT-2 en sí mismo para crear el verificador generaliza mejor que ajustar finamente el GPT-2 base. Por último, investigamos el papel de la temperatura de muestreo que puede usarse para controlar el equilibrio exploración-explotación.
Arora et al. (Fri,) estudiaron esta cuestión.