教程中心/OCR 图片文字识别
OCR

OCR 图片文字识别:发送预览、位置标注与结果复核

了解图片何时会发送至百度智能云、浏览器会怎样调整大图,以及为什么合同、票据和证件必须对照原图复核。

打开OCR 图片文字识别 返回全部教程
01
QUICK START

先用起来:四步完成

  1. 1

    选择一张 JPG、PNG、BMP 或 WebP 图片,先检查页面展示的发送预览。

  2. 2

    按需要开启“显示文字位置”,了解图片将发送至第三方识别服务。

  3. 3

    勾选确认后主动点击“开始识别”;不确认、不点击就不会发起识别。

  4. 4

    对照原图修正结果,再复制文字或下载 TXT。

02
UNDERSTAND

图片什么时候会被发送

选择文件后,浏览器会先在本机读取并生成预览,不会立即上传。只有你阅读提示、勾选确认并主动点击“开始识别”后,页面显示的预览版本才会经由本站后端发送至百度智能云 OCR。

标准识别向匿名用户开放,并按用户等级限制短时频率和每日次数;高精度识别需要账户,普通账户一次性赠送 3 次体验,付费会员按每日额度使用。实际剩余次数以接口返回和账户页为准。

本站后端用于隐藏服务端密钥、校验图片和转发识别请求,不会把百度密钥交给浏览器。图片和识别结果不会被本工具箱长期保存,但托管平台与百度智能云仍可能按各自规则处理维持服务、安全和计费所需的信息。

03
UNDERSTAND

支持格式、尺寸与发送预览

当前支持 JPG、PNG、BMP 和 WebP,单次处理一张。原始文件不能超过 30 MiB,发送版本最长边不超过 4096 像素且不超过 5 MiB。

WebP、尺寸过大或体积过大的图片可能先在浏览器中缩放或转为 JPG。页面会明确提示调整,并展示真正准备发送的版本;透明区域、细小文字和压缩细节可能因此发生变化。

04
UNDERSTAND

普通识别和文字位置怎样选

普通识别适合只需要连续文本的场景;开启“显示文字位置”后,服务还会返回文字区域坐标,页面会把识别框叠加到预览图上,便于检查遗漏和阅读顺序。

位置框只是识别服务的估计。表格、多栏排版、旋转文字、艺术字和复杂背景可能造成框选偏移或顺序错误。

05
UNDERSTAND

哪些结果必须人工复核

清晰印刷体通常比手写、公式、艺术字和低清截图稳定,但任何内容都可能出现漏字、错字、标点差异或段落顺序变化。

身份证件、合同、票据、财务数据、医疗资料和法律文件不能只依赖 OCR 结果。复制或下载前应逐项对照原图,必要时交由具备资质的人员确认。

06
FAQ

常见问题

选择图片后就会上传吗?

不会。页面会先在浏览器中准备预览;只有你勾选确认并主动点击“开始识别”后,预览版本才会发送。

为什么发送版本和原图格式不同?

为了满足最长边和 5 MiB 的请求限制,浏览器可能先缩放图片或转为 JPG;页面会标明并展示实际发送版本。

识别结果可以直接用于合同或票据录入吗?

不建议直接使用。关键内容必须对照原图复核,识别结果不能替代人工审核或专业确认。

现在你已经知道怎么用了

打开工具,边做边看。

教程不会替你保存任何输入内容,具体数据仍按工具页面标注的方式处理。

开始使用