Key points are not available for this paper at this time.
Wir schlagen einen neuen Test vor, um die Multitask-Genauigkeit eines Textmodells zu messen. Der Test umfasst 57 Aufgaben, einschließlich elementarer Mathematik, US-Geschichte, Informatik, Recht und mehr. Um eine hohe Genauigkeit in diesem Test zu erreichen, müssen Modelle über umfangreiches Weltwissen und Problemlösungsfähigkeiten verfügen. Wir stellen fest, dass während die meisten aktuellen Modelle fast zufällige Genauigkeit haben, das größte GPT-3-Modell im Durchschnitt die Zufallsgenauigkeit um fast 20 Prozentpunkte verbessert. Dennoch müssen die besten Modelle in jeder der 57 Aufgaben erhebliche Verbesserungen vornehmen, bevor sie Expertenniveau erreichen können. Modelle zeigen auch unausgeglichene Leistungen und wissen häufig nicht, wann sie falsch liegen. Schlimmer noch, sie haben immer noch eine nahezu zufällige Genauigkeit bei einigen gesellschaftlich wichtigen Themen wie Moral und Recht. Durch die umfassende Bewertung der Breite und Tiefe des akademischen und professionellen Verständnisses eines Modells kann unser Test verwendet werden, um Modelle über viele Aufgaben hinweg zu analysieren und wichtige Mängel zu identifizieren.
Hendrycks et al. (Mon,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: