Cross Encoder-Decoder Transformer with Global-Local Visual Extractor for Medical Image Captioning | Synapse