Authors
Loading...
Analysis reveals challenges in generating high-quality captions through deep learning models, highlighting multimodal integration methods.
Chawla et al. (2025) studied this question.