通用文字识别
支持中英文混合、多语言、竖排文字与复杂排版的识别,输出带坐标的文本框或纯文本,适合文档数字化与内容提取。
输入关键词开始搜索,支持产品名、别名、场景与关键词。
文字识别 OCR(Optical Character Recognition)提供从通用文字识别到行业专用票据识别的完整能力,包括身份证、银行卡、营业执照、发票、表格、车牌等数十种场景化接口。OCR 可直接输出结构化字段,免去二次解析,广泛用于信息录入、票据审核与档案数字化。
有大量纸质材料需要录入系统的业务:金融开户、保险理赔、财务报销、物流面单、政务档案、合同管理。相比自建 OCR 模型,API 方式上线快、精度高、无运维成本。
以下参数用于快速比对本产品的核心能力边界。
| 通用识别 | 通用文字识别(高精版/标准版)、手写文字识别 |
|---|---|
| 证件类 | 身份证、银行卡、驾驶证、行驶证、护照、港澳通行证 |
| 票据类 | 增值税发票、火车票、出租车票、机票行程单、定额发票 |
| 企业类 | 营业执照、组织机构代码证、税务登记证 |
| 文档类 | 表格识别、文档结构化、PDF 转 Word |
| 图像类 | 车牌识别、车辆 VIN 码、商品图片文字 |
| 输出格式 | JSON 结构化字段 / 纯文本 / 带坐标文本框 |
| 接入 | HTTP API、SDK(多语言)、控制台在线体验 |
价格为整理时的参考区间,实际以下单页面为准。计费模式:按调用次数计费(阶梯定价) · 资源包(预付费) · 免费额度。
| 套餐 / 规格 | 配置说明 | 参考价格 | 备注 |
|---|---|---|---|
| 通用文字识别 | 按调用次数 | 按量 元/千次 | 阶梯定价 |
| 身份证识别 | 按调用次数 | 按量 元/千次 | 实名认证场景 |
| 发票识别 | 按调用次数 | 按量 元/千次 | 财务报销 |
| 资源包 | 预付费 | 低至 5 折 | 用量大更划算 |
| 免费额度 | 新用户 | 0 | 部分接口赠送 |
省钱提示:长期稳定负载优先包年包月并叠加节省计划;无状态批处理可用抢占式实例,成本可低至按量价的 10%。 查看成本优化指南 →
支持中英文混合、多语言、竖排文字与复杂排版的识别,输出带坐标的文本框或纯文本,适合文档数字化与内容提取。
身份证、银行卡、驾驶证等接口直接返回姓名、证件号、有效期等结构化字段,无需自己写正则解析,显著降低开发工作量与出错率。
增值税发票、火车票、行程单等票据接口可输出金额、税额、发票号码、开票日期等关键字段,是财务自动化报销的核心能力。
支持表格结构还原,输出行列对应关系与单元格内容,可把扫描版表格转成结构化数据,用于数据录入与报表处理。
支持 PDF 与图片文档的版面分析,识别标题、段落、表格、图片等元素并还原阅读顺序,输出可编辑的 Word 或结构化 JSON。
支持蓝牌、绿牌、黄牌等多种车牌类型识别,可用于停车场、园区门禁与物流车辆管理场景。
印刷体在清晰图像上通常可达 95% 以上,票据类结构化字段准确率更高。手写体、模糊或倾斜图像的准确率会下降,建议配合图像预处理提升效果。
部分 OCR 能力支持通过视觉智能开放平台的私有化方案部署。如果需要完全私有化,也可基于开源模型在 PAI 平台上自行训练与部署。
建议分辨率不低于 300 DPI、文字清晰、光照均匀、尽量无倾斜。图片大小与格式需符合接口限制(通常支持 JPG/PNG,单张不超过数 MB)。
国产开源大模型旗舰,全模态能力覆盖
文档转换与媒体处理,让非结构化数据可用
从数据标注到模型训练的全链路 AI 工程平台
一站式大模型应用开发平台,从调用到 Agent 编排