Automatic Speech Recognition (ASR) systems often produce transcripts containing disfluencies, filler words (e.g., "um", "uh"), and grammatical errors that reduce readability and downstream task performance. We present Qwen3-Sussurro, a parameter-efficient fine-tuned model for post-processing ASR outputs. Using QLoRA (4-bit quantization with Low-Rank Adaptation) on the Qwen3-1.7B base model, we achieve substantial improvements over zero-shot baselines: +807% BLEU-4 and +237% ROUGE-1, with statistical significance (p < 0.0001). Additionally, our fine-tuned model demonstrates 4.6x faster inference compared to the base model.
Carlo Esposito (2026) studied this question.