Dual-Encoder Transformers for Image-Text Matching in Vision-Language Multimodal Applications | Synapse