高质量训练数据是多语种 OCR 的关键。实践中优先采集真实场景数据,并采用半自动标注策略:先利用成熟 OCR 引擎生成初始标注结果,再通过人工修正构建黄金数据集。例如为小语种标注图像时,借助预标注可将人工修正时间大幅缩短。
针对低资源语言标注数据稀缺的问题,可通过合成数据生成框架弥补数据缺口。以波斯文为例,研究者构建了包含多种字体(Naskh、Nastaliq)与多种退化模型的大规模合成图文对数据集,有效支撑了 Transformer 识别模型的训练,使模型能够泛化到复杂的书法风格。
对于许多少数民族文字,可开发支持对应文字输入的众包标注工具,并集成字形校验功能(如藏文字符必须符合堆叠规则),在保证标注质量的同时降低标注成本。