Key points are not available for this paper at this time.
历史手写石刻文献的字符识别是机器学习算法面临的重大挑战,原因在于这些文本的固有复杂性:(1) 由于这些文档已经老化且严重退化,字符会被污迹、变形和杂乱等不必要的伪影重叠。(2) 字符的可读性不高,因为它们在相邻重叠字符的上行和下行延伸导致了虚假笔画的出现。(3) 由于书写的不规则性和多变性,同一字符会有多种变体,可能导致解释上的歧义。本文展示了一个在新编制的EHHKSI(历史手写卡纳达石刻字符)数据集上的历史手写字符识别的用例。针对该数据集进行了以下实验:(a) 各种卷积神经网络(CNN)的迁移学习和(b) 数据增强。通过采用Xception CNN模型结合数据增强,达到了最佳的识别准确率。
HT等人(周二)研究了这个问题。