Key points are not available for this paper at this time.
A detecção e a segmentação de texto em cena são dois problemas de pesquisa importantes e desafiadores no campo da visão computacional. Este artigo propõe um método inovador para detecção e segmentação de texto em cena baseado em redes neurais convolucionais (CNNs) em cascata. Neste método, um modelo de extração de região de texto candidata (CTR) baseado em CNN, denominado rede de detecção (DNet), é projetado e treinado usando tanto as bordas quanto as regiões inteiras de texto, com as quais as CTRs grosseiras são detectadas. Um modelo de refinamento de CTR baseado em CNN (denominado rede de segmentação, SNet) é então construído para segmentar precisamente as CTRs grosseiras em texto, a fim de obter as CTRs refinadas. Com DNet e SNet, muito menos CTRs são extraídas do que com abordagens tradicionais, enquanto mais regiões de texto verdadeiro são mantidas. As CTRs refinadas são finalmente classificadas usando um modelo de classificação de CTR baseado em CNN (denominado rede de classificação, CNet) para obter as regiões de texto finais. Todos esses modelos baseados em CNN foram modificados a partir do VGGNet-16. Experimentos extensivos em três conjuntos de dados de referência demonstram que o método proposto alcança desempenho de ponta e supera amplamente outras abordagens de detecção e segmentação de texto em cena.
Tang et al. (Sex,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: