사고 연쇄(Chain of Thought, CoT) 추론은 언어 모델의 성능을 향상시키지만, 종종 간단한 문제에서 비효율적인 "과도한 사고"를 초래합니다. 우리는 기존 접근 방식이 추론 길이를 직접적으로 처벌하는 방식이 서로 다른 문제의 복잡성을 고려하지 못한다는 점을 확인하였습니다. 우리의 접근 방식은 길이와 품질 비교를 통해 보상을 구성하며, 이는 간결성과 함께 해결책의 정확성을 공동으로 향상시키는 이론적 가정을 통해 안내됩니다. 더욱이, 우리는 방법이 진실이 없는 모호한 작업에 대해서도 효과적임을 추가로 입증합니다. 여러 가지 추론 벤치마크에 걸친 실험 결과, 우리의 방법은 정확성을 유지하면서도 훨씬 더 간결한 설명을 생성하여, 모델이 "필요할 때 생각하도록" 효과적으로 학습할 수 있게 합니다.
Yang et al. (2025)는 이 질문을 연구하였습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: