Key points are not available for this paper at this time.
Trabalhos recentes mostraram que o ajuste fino de grandes modelos de linguagem pré-treinados em uma coleção de tarefas descritas através de instruções, a.k.a. ajuste por instrução, melhora sua generalização em zero e poucos exemplos para tarefas não vistas. No entanto, há uma compreensão limitada das compensações de desempenho das diferentes decisões tomadas durante o processo de ajuste por instrução. Essas decisões incluem a escala e diversidade do benchmark de ajuste por instrução, diferentes estratégias de amostragem de tarefas, ajuste fino com e sem demonstrações, treinamento usando conjuntos de dados especializados para raciocínio e diálogo, e, finalmente, os próprios objetivos de ajuste fino. Neste artigo, caracterizamos o efeito das decisões de ajuste por instrução no desempenho de tarefas subsequentes ao escalar tanto os tamanhos do modelo quanto do benchmark. Para isso, criamos o OPT-IML Bench: um grande benchmark para Aprendizado Meta de Instruções (IML) com 2000 tarefas de NLP consolidadas em categorias de tarefas de 8 benchmarks existentes, e preparamos uma estrutura de avaliação para medir três tipos de generalizações de modelos: para tarefas de categorias totalmente excluídas, para tarefas excluídas de categorias vistas, e para instâncias excluídas de tarefas vistas. Através da lente desta estrutura, apresentamos primeiro insights sobre decisões de ajuste por instrução aplicadas ao OPT-30B e exploramos ainda mais esses insights para treinar o OPT-IML 30B e 175B, que são versões ajustadas por instrução do OPT. O OPT-IML demonstra todas as três habilidades de generalização em ambas as escalas em quatro diferentes benchmarks de avaliação com tarefas e formatos de entrada diversos -- PromptSource, FLAN, Super-NaturalInstructions e UnifiedSKG. Não só ele supera significativamente o OPT em todos os benchmarks, mas também é altamente competitivo com modelos existentes ajustados em cada benchmark específico. Lançamos o OPT-IML em ambas as escalas, juntamente com a estrutura de avaliação OPT-IML Bench.
Iyer et al. (Qui,) estudaram essa questão.