Los puntos clave no están disponibles para este artículo en este momento.
Los modelos de lenguaje grande (LLMs) han demostrado un rendimiento extraordinario en diversas tareas. Sin embargo, el rendimiento de los LLMs depende en gran medida de la indicación de entrada, lo que ha dado lugar a varios trabajos recientes sobre la optimización de indicaciones. Sin embargo, los trabajos anteriores a menudo requieren la disponibilidad de una puntuación numérica para evaluar la calidad de cada indicación. Desafortunadamente, cuando un usuario humano interactúa con un LLM de caja negra, obtener tal puntuación suele ser inviable e poco confiable. En su lugar, generalmente es significativamente más fácil y más confiable obtener retroalimentación de preferencias de un usuario humano, es decir, mostrar al usuario las respuestas generadas a partir de un par de indicaciones y preguntar al usuario cuál prefiere. Por lo tanto, en este artículo, estudiamos el problema de la optimización de indicaciones con retroalimentación humana (POHF), en el que nuestro objetivo es optimizar la indicación para un LLM de caja negra utilizando solo retroalimentación de preferencias de humanos. Inspirándonos en bandidos de duelo, diseñamos una estrategia teóricamente fundamentada para seleccionar un par de indicaciones para consultar sobre retroalimentación de preferencias en cada iteración, e introducimos nuestro algoritmo llamado POHF automatizado (APOHF). Aplicamos nuestro algoritmo APOHF a diversas tareas, incluyendo la optimización de instrucciones para usuarios, la optimización de indicaciones para modelos generativos de texto a imagen, y la optimización de respuestas con retroalimentación humana (es decir, refinando aún más la respuesta utilizando una variante de nuestro APOHF). Los resultados demuestran que nuestro APOHF puede encontrar eficientemente una buena indicación utilizando un pequeño número de instancias de retroalimentación de preferencias. Nuestro código se puede encontrar en https: //github. com/xqlin98/APOHF.
Lin et al. (Mon,) estudiaron esta pregunta.