Los puntos clave no están disponibles para este artículo en este momento.
Los modelos de lenguaje grande (LLMs) son una clase especial de modelos de lenguaje preentrenados obtenidos al escalar el tamaño del modelo, el corpus de preentrenamiento y los cálculos. Los LLMs, debido a su gran tamaño y preentrenamiento en grandes volúmenes de datos de texto, exhiben habilidades especiales que les permiten lograr un rendimiento notable sin ningún entrenamiento específico para tareas en muchas de las tareas de procesamiento de lenguaje natural. La era de los LLMs comenzó con el modelo OpenAI GPT-3, y la popularidad de los LLMs está aumentando exponencialmente después de la introducción de modelos como ChatGPT y GPT-4. Nos referimos a GPT-3 y sus modelos sucesores de OpenAI, incluidos ChatGPT y GPT-4, como modelos de lenguaje grande de la familia GPT-3 (GLLMs). Con la creciente popularidad de los GLLMs, especialmente en la comunidad investigadora, existe una fuerte necesidad de una encuesta comprensiva que resuma el progreso reciente de la investigación en múltiples dimensiones y pueda guiar a la comunidad investigadora con direcciones futuras de investigación perspicaces. Comenzamos el artículo de encuesta con conceptos fundamentales como transformadores, transferencia de aprendizaje, aprendizaje auto-supervisado, modelos de lenguaje preentrenados y modelos de lenguaje grande. Luego presentamos una breve visión general de los GLLMs y discutimos el rendimiento de los GLLMs en varias tareas posteriores, dominios específicos y múltiples idiomas. También discutimos las habilidades de etiquetado de datos y aumento de datos de los GLLMs, la robustez de los GLLMs, la efectividad de los GLLMs como evaluadores y, finalmente, concluimos con múltiples direcciones de investigación futura perspicaces. Para resumir, este artículo de encuesta comprensivo servirá como un buen recurso tanto para personas académicas como de la industria para mantenerse actualizados con la investigación más reciente relacionada con los modelos de lenguaje grande de la familia GPT-3.
Katikapalli Subramanyam Kalyan (Mié,) estudió esta cuestión.