Le raisonnement en chaîne de pensée (CoT) améliore la performance des modèles linguistiques mais mène souvent à un "sur-réflexion" inefficace sur des problèmes simples. Nous identifions que les approches existantes pénalisant directement la longueur du raisonnement échouent à prendre en compte la complexité variable des problèmes. Notre approche construit des récompenses par le biais de comparaisons de longueur et de qualité, guidée par des hypothèses théoriques qui améliorent conjointement l'exactitude de la solution avec la concision. De plus, nous démontrons davantage notre méthode sur des tâches floues où la vérité de référence est indisponible. Des expériences à travers plusieurs benchmarks de raisonnement montrent que notre méthode maintient l'exactitude tout en générant des explications significativement plus concises, enseignant efficacement aux modèles à "pens er quand c'est nécessaire."
Yang et al. (Fri,) ont étudié cette question.