Modelos de raciocínio grande estilo O1/R1 (LRMs) sinalizam um avanço considerável em relação aos LLMs convencionais que seguem instruções. Ao aplicar escalonamento em tempo de teste para gerar caminhos de raciocínio estendidos, eles estabelecem muitos SOTAs em uma ampla gama de tarefas complexas de raciocínio. No entanto, estudos recentes mostram que os LRMs tendem a sofrer de sobrepensamento -- a tendência de complicar excessivamente problemas simples, levando a mudanças excessivas de estratégia e rastros de raciocínio longos e convolutos que dificultam sua interpretabilidade. Para mitigar esse problema, realizamos uma investigação sistemática sobre a eficiência do raciocínio de um conjunto amplo de LRMs e descobrimos um dilema comum: a dificuldade em equilibrar múltiplos objetivos de geração, como correção e brevidade. Com base nessa descoberta, propomos um método de escalonamento em tempo de teste, EDIT (Efficient Dynamic Inference Trimming), que guia eficientemente os LRMs a identificar os caminhos de raciocínio corretos mais curtos em tempo de teste. O EDIT emprega geração orientada por restrições enquanto rastreia conjuntamente distribuições de comprimento e respostas sob diferentes restrições, permitindo selecionar respostas que equilibram de forma ótima concisão e correção. Experimentos extensivos em diversos modelos e conjuntos de dados mostram que o EDIT melhora substancialmente a eficiência do raciocínio, produzindo saídas compactas, mas informativas, que melhoram a legibilidade e a experiência do usuário.
Han et al. (Sun,) estudaram essa questão.