Authors
Loading...
Controlled evaluation reveals format adherence varies despite stable semantic decisions in eight instruction-tuned language models, highlighting that execution robustness is independent of accuracy.
Maiti et al. (2026) studied this question.