Key points are not available for this paper at this time.
Une propriété préoccupante de nos LLM presque magiques concerne la variation des résultats donnés avec la même entrée exacte et des hyperparamètres déterministes. Bien que l'IA ait toujours eu un certain niveau de bruit provenant d'entrées hors des données d'entraînement, nous avons généralement eu des résultats déterministes pour une entrée particulière ; ce n'est plus le cas. Bien que la plupart des praticiens des LLM soient "au courant", nous ne sommes au courant d'aucun travail qui tente de quantifier la stabilité actuelle des LLM. Nous soupçonnons que personne n'a pris la peine de le faire car c'est tout simplement un article trop ennuyeux à réaliser et à écrire. Mais nous l'avons fait et il y a quelques surprises. Quels types de surprises ? Les LLM évalués sont rarement déterministes au niveau de la sortie brute ; ils sont beaucoup plus déterministes au niveau de la sortie/réponse analysée mais restent encore rarement 100% stables sur 5 réexécutions avec la même entrée de données. La variation de précision des LLM n'est pas normalement distribuée. La stabilité varie en fonction de la tâche.
Atil et al. (mar.) ont étudié cette question.