手写体因书写风格因人而异、笔画连写、字形不规则,识别难度远高于印刷体。传统 OCR 引擎在手写体上表现有限,通常需要专门的手写体识别模型。
视觉语言模型(VLM)在手写体识别上展现出明显优势。根据 DeltOCR Bench 等评测,主流视觉语言模型在手写体识别任务上的准确率已接近甚至超过传统引擎在手写体上的表现,能够处理草书、混合书写系统等复杂手写场景。
对于单行手写文字,可采用 TrOCR 等编码器—解码器识别模型,在行分割后对裁剪的文字行进行识别。这类模型在 IAM 等手写体数据集上微调后,可用于处方笺、笔记、表单等手写内容的识别。