This paper presents CrackVision, a bagging ensemble integrating a Bayesian Convolutional Neural Network (BCNN) and Vision Transformer (ViT) for multiclass concrete crack severity classification. Unlike binary detection systems, CrackVision categorizes cracks into four levels None, Low, Medium, High with uncertainty awareness through Monte Carlo dropout. The system was trained on 60,000 augmented crack images and evaluated against standalone models. CrackVision achieved 99.31% accuracy and F1-scores up to 99.94%, improving performance by 2.17% over BCNN and 0.25% over ViT. Confusion matrix analysis confirmed fewer misclassifications than BCNN across all severity levels. Predictive uncertainty estimates enhance reliability for safetycritical deployment. These findings highlight CrackVision’s potential as a robust tool for automated infrastructure monitoring, particularly in disaster-prone regions requiring accurate crack assessment.
Mandap et al. (Sun,) studied this question.