
电商平台海量商品图片中暗藏虚假宣传、违禁词等违规文字,纯人工审核难以全覆盖。本文拆解 OCR 如何提取图片里的文字并结合审核规则完成自动拦截,讲清图片审核背后的技术链路。
电商平台每天会产生数以百万计的图片素材——商品主图、详情页长图、评价晒图,以及用于站内外投放的推广图和广告图。这些图片大多带有文字,有些是正常的商品描述,有些则暗藏违规内容:夸大功效的虚假宣传、广告法明令禁止的绝对化用语、引导用户私下交易的联系方式,甚至涉黄涉暴的不良信息。
传统的人工审核模式面临两个根本性困境。一是量级问题——一个中型电商平台日均图片量可达数万甚至数十万张,纯人工审核需要庞大的审核团队轮班作业,成本高昂且效率有限。二是疲劳问题——审核员长时间重复观看图片,注意力不可避免地下降,漏检率随工作时长递增。
更棘手的是,违规文字并非总以清晰的印刷体呈现。有些商家会刻意改变文字的排版方向或呈现形态来规避检测,这进一步加大了人工审核的难度。
因此,越来越多的电商平台选择引入 OCR(光学字符识别)技术,先由机器完成图片中文字的提取,再将提取结果与违规词库匹配,把有限的审核人力集中到真正需要判断的边界案例上。
OCR 技术模拟了人类阅读文字的过程,但实现方式完全不同。整个识别过程可以分为文本检测和文本识别两个核心阶段。
文本检测阶段的任务是判断图片中哪些区域包含文字。算法会对图片进行扫描,利用深度学习模型识别文字区域的纹理特征、边缘特征和形态学特征,将文字区域从背景中分离出来。这一阶段输出的是一组文字区域的坐标框,每个框对应图片中的一块文字区域。
文本识别阶段则对检测出的每个文字区域进行字符级别的识别。系统先将文字区域进行二值化、去噪等预处理,再通过字符分割将单个字符切分出来,最后利用分类模型对每个字符进行判定。现代 OCR 系统多采用端到端的深度学习架构,将检测和识别整合为统一模型,减少了中间环节的信息损失。
在电商图片审核场景中,OCR 的价值在于将"不可搜索"的图片内容转化为"可搜索"的结构化文本。一旦图片中的文字被提取为文本数据,后续的违规词匹配、语义分析、风险评分等审核环节就可以自动化执行。
OCR 提取文字只是审核链路的第一步。完整的图片审核流程通常包含"OCR 提取—文本匹配—规则判定—结果输出"四个环节。
当一张商品图片上传到平台后,系统首先调用 OCR 接口将图片中的所有文字提取出来,返回文本内容和对应的位置坐标。随后,提取到的文本会与平台维护的违规词库进行匹配。违规词库通常包含多个类别:广告法禁用词(如"最好""第一""国家级"等绝对化用语)、虚假宣传词(如"包治百病""药到病除")、引流话术(如"加微信""私聊优惠")、以及平台自定义的敏感词。
匹配完成后,系统根据命中规则的数量和严重程度进行风险评分。低风险内容可以自动放行,高风险内容进入人工复审队列,由审核员做最终判定。这样一来,全量图片都能被覆盖到,而人工只需要处理被机器标记出来的少量可疑内容,审核资源的使用效率大幅提升。
以大众点评的实践为例,其使用腾讯云通用印刷体 OCR 为客户提供图片内容审核能力,有效识别图片中的不文明信息,大大减少了人工审核工作量。这一实践说明,OCR 技术在内容审核领域已经过大规模验证,能够胜任高并发、高覆盖的审核需求。
电商图片中的文字识别并非总是"标准横排印刷体"的理想状态。其中一类典型难题出在排版方式上——文字本身是清晰的,但被放在了非常规的位置或方向上。
翻转与倾斜:部分商家将文字旋转 90 度、180 度甚至 270 度放置,试图规避只支持正向文字的检测算法。还有一些图片中文字带有倾斜角度,文字行的基线不再水平,同样会增加检测难度。
竖排文字:中文传统竖排版式在部分商品详情图中仍有使用,尤其是茶叶、书法、古籍类商品。竖排文字的行列关系与横排不同,检测算法若按横排的行切分逻辑处理,很容易把一列文字识别成多个碎片。
腾讯云广告文字识别针对这类排版问题做了专项优化,支持中英文、横排和竖排文字识别,支持 90 度、180 度、270 度翻转以及倾斜场景文字识别,召回率和准确率能达到 96% 以上。也就是说,商家即便用旋转、倾斜、竖排等方式给文字"换个摆法",提取环节依然稳定,后续的违规判定不会因为排版变化而失效。
排版之外,还有一类难题出在文字自身:形态不标准,或语种不统一。
手写体与艺术字:部分商家使用手写风格字体或经过艺术化处理的文字来呈现促销信息,这类文字笔画粗细不均、结构变形,识别难度明显高于标准印刷体。
多语种混排:跨境电商与海外代购类商品的图片中,中英文混排很常见,日文、韩文、泰文等外文标签也不少见。违规文字完全可能藏在一行外文说明里,人工审核员即使懂外语,面对海量图片也难以逐一甄别。
这两类场景需要的是覆盖面更广的识别能力。腾讯云通用文字识别(高精度版)用一个接口提供 100+ 个语种识别、手写体识别、印刷体识别的综合能力,平台可以用同一个接口覆盖商品主图、详情页、用户评价等不同来源,也覆盖从中文到多语种的不同文字类型。提取出的文本统一进入违规词匹配引擎,只要命中规则就会被标记,与文字是中文、英文还是其他语种无关。
换句话说,形态和语种都不再是审核的盲区,商家"把手写文案或外文标签当作藏违规词的隐蔽位置"这一做法也就失去了作用。
回到开头那个问题——图片里的违规文字到底是怎么被抓出来的?答案并不只是"把字认出来",而是四个环节依次接力:OCR 先把图片中的文字提取成可检索的文本,违规词库再对这段文本做匹配,风险评分判断命中的数量和严重程度,最后由系统自动放行或转入人工复审。链条上任何一环缺失,违规内容都有机会从缝隙里溜走。
也正因这条链路的存在,商家常用的几种规避手段才相继失效:把文字旋转、倾斜或改成竖排,广告文字识别依然能定位并提取;把手写文案或外文标签当作隐蔽位置,通用文字识别(高精度版)的 100+ 语种与手写体识别能力也能覆盖到。不过,决定最终审核效果的并不只是识别能力,还有违规词库是否完备、风险阈值是否合理,这两项需要平台结合自身品类特点持续维护。
对准备搭建图片审核能力的团队而言,比较稳妥的推进方式是:先通过 API 或 SDK 把 OCR 接入现有审核系统,用每月 1,000 次的免费调用额度跑通"提取—匹配—判定"全流程,确认识别效果后再按调用量选择计费方式。以广告文字识别为例,它对应的预付费资源包名为"图片文字识别(基础版)",1,000 次刊例价 100 元,折算单次 0.10 元,低于后付费 0.12 元/次的起价,调用量稳定的场景优先选资源包;若审核范围还要覆盖多语种、手写体这类难例,可选通用文字识别(高精度版)。采购上也有优惠可用:高精度版在新用户专区 1 千次规格低至 2 折(80 元),而广告文字识别对应的"图片文字识别(基础版)"资源包在当前 文字识别特惠活动 中为 5 折且不限新老用户,两者可结合业务量一并评估。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。