Los puntos clave no están disponibles para este artículo en este momento.
Uno de los hallazgos más sorprendentes en la investigación moderna sobre grandes modelos de lenguaje (LLMs) es que aumentar la capacidad computacional durante el entrenamiento conduce a mejores resultados. Sin embargo, se ha prestado menos atención a los beneficios de aumentar la capacidad computacional durante la inferencia. Esta encuesta se centra en estos enfoques en tiempo de inferencia. Exploramos tres áreas bajo un formalismo matemático unificado: algoritmos de generación a nivel de token, algoritmos de meta-generación y generación eficiente. Los algoritmos de generación a nivel de token, a menudo llamados algoritmos de decodificación, operan muestreando un único token a la vez o construyendo un espacio de búsqueda a nivel de token y luego seleccionando una salida. Estos métodos asumen típicamente acceso a los logits de un modelo de lenguaje, distribuciones del siguiente token o puntuaciones de probabilidad. Los algoritmos de meta-generación trabajan con secuencias parciales o completas, incorporando conocimiento del dominio, habilitando retrocesos e integrando información externa. Los métodos de generación eficiente buscan reducir los costos de token y mejorar la velocidad de generación. Nuestra encuesta unifica perspectivas de tres comunidades de investigación: procesamiento de lenguaje natural tradicional, modernos LLMs y sistemas de aprendizaje automático.
Welleck et al. (Mon,) estudiaron esta cuestión.