Key points are not available for this paper at this time.
Les modèles de langage de grande taille (LLMs) sont une classe spéciale de modèles de langage préentraînés obtenus par l'augmentation de la taille du modèle, du corpus de préentraînement et des calculs. Les LLMs, en raison de leur grande taille et de leur préentraînement sur de grands volumes de données textuelles, présentent des capacités particulières qui leur permettent d'atteindre des performances remarquables sans aucun entraînement spécifique à la tâche dans de nombreuses tâches de traitement du langage naturel. L'ère des LLMs a commencé avec le modèle OpenAI GPT-3, et la popularité des LLMs augmente de manière exponentielle après l'introduction de modèles comme ChatGPT et GPT4. Nous faisons référence à GPT-3 et à ses modèles successeurs d'OpenAI, y compris ChatGPT et GPT4, comme des modèles de langage de grande taille de la famille GPT-3 (GLLMs). Avec la popularité croissante des GLLMs, en particulier dans la communauté de recherche, il existe un fort besoin d'une enquête complète qui résume les avancées de recherche récentes sur plusieurs dimensions et peut guider la communauté de recherche avec des orientations de recherche futures éclairantes. Nous commençons l'article d'enquête avec des concepts fondamentaux comme les transformateurs, l'apprentissage par transfert, l'apprentissage auto-supervisé, les modèles de langage préentraînés et les modèles de langage de grande taille. Nous présentons ensuite un aperçu bref des GLLMs et discutons des performances des GLLMs dans diverses tâches en aval, domaines spécifiques et plusieurs langues. Nous discutons également des capacités de labellisation des données et d'augmentation des données des GLLMs, de la robustesse des GLLMs, de l'efficacité des GLLMs en tant qu'évaluateurs, et enfin, nous concluons avec plusieurs orientations de recherche futures éclairantes. En résumé, cet article d'enquête complet servira de bonne ressource pour les universitaires et les professionnels de l'industrie afin de rester informés des dernières recherches liées aux modèles de langage de grande taille de la famille GPT-3.
Katikapalli Subramanyam Kalyan (mercredi) a étudié cette question.