负责对输入图像进行质量增强与几何校正,包括去噪、二值化、倾斜矫正、透视畸变修正、自动裁边等。针对低质量扫描件、手机拍照、复杂光照等场景,预处理模块能够显著提升后续检测与识别的稳定性。部分系统还集成文档方向判断与自动旋转纠正能力,处理横向、竖向乃至翻转的文字图像。
负责从整幅图像中定位文字区域并输出文本框坐标,是多语种 OCR 的入口环节。该模块需要适配不同书写方向(横排、竖排、从右到左)与不同形态(印刷体、手写体、连体字),并处理密集文字、小字、模糊字等困难场景。
负责将检测出的文字区域转换为字符序列,是多语种 OCR 的核心环节。该模块通常按语种或书写系统分组配置模型,例如拉丁语系、CJK(中日韩)语系、阿拉伯语系分别采用针对性训练的识别模型,以适配各自的字形特征与连写规则。
负责对识别结果进行版面还原与结构化组织,识别标题、段落、表格、公式、图注等文档元素,并输出带坐标、带置信度的结构化结果(如 Markdown、JSON 格式)。该模块决定了 OCR 结果能否直接用于 RAG 检索、智能体处理等下游任务。