近日百度正式开放面向复杂文档处理场景的Unlimited-OCR工具及配套开发教程,支持高分辨率图像解析、多页PDF批量识别与排版还原,开发者可基于该工具快速搭建端到端OCR处理流水线,较传统开发模式效率提升80%,实测复杂场景识别准确率较通用OCR产品高出12个百分点,目前已面向全行业开放商用授权。
某制造企业的数字化工程师李明最近解决了困扰团队半年的难题:此前处理1000份多页工程图纸的识别归档,需要3名员工耗费一周时间,还要手动修正近30%的识别错误,而基于百度新推出的Unlimited-OCR搭建的流水线,整个流程仅需4小时即可完成,错误率降到了2%以下。
随着各行业数字化转型深入,非结构化文档的识别处理已经成为很多企业的核心痛点。IDC统计数据显示,国内企业日常运营产生的信息中,超过75%属于非结构化数据,其中扫描件、高分辨率图纸、多页合同PDF占比超过60%。
传统通用OCR工具普遍存在两大短板:一是处理高分辨率图像时会默认压缩画质,导致小字体、模糊边缘的文字识别准确率骤降;二是多页PDF识别需要手动分页、拼接内容,无法还原原始排版,后续仍需要大量人工校对。大部分企业如果要自研适配复杂场景的OCR流水线,至少需要投入2名算法工程师耗时3个月开发,成本超过20万元,中小团队根本无法负担。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录