首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >结构化版式 OCR 识别-图文排版文字识别-文字坐标定位识别API接口介绍

结构化版式 OCR 识别-图文排版文字识别-文字坐标定位识别API接口介绍

原创
作者头像
聚美智数
发布2026-09-03 17:38:56
发布2026-09-03 17:38:56
300
举报

前言

支持多场景、多语种、高精度识别能力,在常规文字识别基础上,精准输出每行文字的完整识别内容、置信概率、坐标位置以及四点多边形坐标数据,完整还原原图排版布局,方便开发者完成版式还原、内容矫正、图文二次加工等精细化处理。

通用文字识别被广泛用于文档电子化、图文解析、智能排版、内容抓取等业务,擅长批量提取图片内有效文字内容。

核心能力

  • 支持 URL、Base64、文件三类图像上传途径,适配 JPG/PNG/BMP 等通用图片格式;
  • 适配文档、海报、截图、实拍图等各类通用场景图文识别,支持多语种内容精准解析;
  • 新增文字位置坐标输出能力,补齐普通OCR无法实现版式二次处理的短板;
  • 具备高精度文字检测能力,可完整抓取整图全部文本内容;

API介绍

请求说明

名称

类型

必须

说明

image

String

图片base64

pdf

String

PDF文件的base64

pdfNum

String

需要识别的PDF文件的对应页码,不传默认识别第 1 页

ofd

String

OFD文件的base64

ofdNum

String

需要识别的OFD文件的对应页码,不传默认识别第 1 页

file

String

文件

url

String

文件地址

返回样例

代码语言:javascript
复制
{
  "msg": "成功",// code 对应的描述
  "code": 200,// 详见code返回码说明
  "taskNo": "316942821199035820008485",// 本次请求号
  "data": {
    "resultNum": 2,//识别结果数
    "result": [//识别结果
      {
        "words": "测试第一行",//识别结果字符串
        "location": {//位置数组(坐标0点为左上角)
          "top": 72,//表示定位位置的长方形左上顶点的垂直坐标
          "left": 89,//表示定位位置的长方形左上顶点的水平坐标
          "width": 52,//表示定位位置的长方形的宽度
          "height": 12//表示定位位置的长方形的高度
        },
        "probability": {//表示识别结果中每一行的置信度值
          "average": 0.9956096411,//行置信度平均值
          "min": 0.9842295051,//行置信度最小值
          "variance": 0.00003516419747//行置信度方差
        },
        "vertexesLocation": [//识别结果中每一行的外包四边形点坐标
          {
            "x": 90,//水平坐标(坐标0点为左上角)
            "y": 73//垂直坐标(坐标0点为左上角)
          },
          {
            "x": 142,
            "y": 73
          },
          {
            "x": 142,
            "y": 85
          },
          {
            "x": 90,
            "y": 85
          }
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
            "x": 89,
            "y": 72
          },
          {
            "x": 101,
            "y": 72
          },
          {
            "x": 113,
            "y": 72
          },
          {
            "x": 124,
            "y": 72
          },
          {
            "x": 136,
            "y": 72
          },
          {
            "x": 141,
            "y": 72
          },
          {
            "x": 141,
            "y": 78
          },
          {
            "x": 141,
            "y": 84
          },
          {
            "x": 130,
            "y": 84
          },
          {
            "x": 118,
            "y": 84
          },
          {
            "x": 106,
            "y": 84
          },
          {
            "x": 95,
            "y": 84
          },
          {
            "x": 89,
            "y": 84
          },
          {
            "x": 89,
            "y": 78
          }
        ]

      },
    ],
    "paragraphsResult": [//段落检测结果
      {
        "wordsResultIdx": [//一个段落包含的行序号
          0,
          1
        ],
        "finegrainedVertexesLocation": [//识别结果中每一行的多边形轮廓点坐标
          {
            "x": 89,
            "y": 72
          },
          {
            "x": 101,
            "y": 72
          },
          {
            "x": 113,
            "y": 72
          },
          {
            "x": 124,
            "y": 72
          },
          {
            "x": 136,
            "y": 72
          },
          {
            "x": 141,
            "y": 72
          },
          {
            "x": 141,
            "y": 72
          },
          {
            "x": 141,
            "y": 84
          },
          {
            "x": 141,
            "y": 88
          },
          {
            "x": 141,
            "y": 100
          },
          {
            "x": 141,
            "y": 100
          },
          {
            "x": 129,
            "y": 100
          },
          {
            "x": 117,
            "y": 100
          },
          {
            "x": 104,
            "y": 99
          },
          {
            "x": 92,
            "y": 99
          },
          {
            "x": 89,
            "y": 99
          },
          {
            "x": 89,
            "y": 99
          },
          {
            "x": 89,
            "y": 87
          },
          {
            "x": 89,
            "y": 84
          },
          {
            "x": 89,
            "y": 72
          }
        ]

      }
    ],
    "paragraphsResultNum": 1,//识别结果数,表示 paragraphsResult 的元素个数
    "pdfFileSize": 1//传入PDF文件的总页数,当 pdfFile 参数有效时返回该字段
  }
}

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 前言
  • 核心能力
  • API介绍
    • 请求说明
    • 返回样例
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档