OCR 识别大模型求推荐

对 ocr 这块是纯新手小白,想要实现以下需求,需要用到哪些SDK 和大模型呢
最好是 Java 可用的

  1. 数据格式:PDF(结构化 + 扫描版)
  2. 需求概述:识别各级标题、正文、图表(可以是图片格式,通过图表的标题、脚注查询即可)
  3. 应用场景:用户通过检索关键词,定位到哪位文件包含关键信息,以及每个文件出现关键词的原文位置

蹲一个回复

帮顶 我也想要一个识别表格比较好的

坐等大佬回复,我也想看看

插个眼呀,后续关注一下

可以看看这个

感谢 我去看看

Java不知道,但我知道中文的识别百度飞浆ppocr是比较强的

帮顶, 大佬看完也给我们讲讲

mark一下

Tesseract
开源的,英语还可以,中文够呛

按他这文档搞 python 的环境都要了命了 那些什么 eva_decord、detectron2之类的搞死了

我这段时间做这个ocr,中文识别度最好的就是paddle飞浆的,可以将训练后的模型转成onnx在java端运行,但识别速度及效果会降低,最好就是将模型服务在gpu服务器部署,通过api调用。
但只是通用场景的,要达到好的识别效果,最好用自己的数据微调模型。

tesseract得自己训练才好用,它的那个训练数据好老了 :face_holding_back_tears:

同问 如果pdf里面是图片 识别能出来么

百度开源的paddlepaddle/PaddleOCR能力不错,你可以看看,但不是Java的
github上找找有没有java封装的项目
https://paddlepaddle.github.io/PaddleOCR/

可以的

看需求实际上不一定需要ocr,试试pypdf和pymupdf,简单很多,效果我觉得也不错

我们算法团队都搞的不是很好,让我们这小白去弄 感觉更弄不出来

你们可以试试用paddleocr做api,然后在特定场景自己做一些数据标注,在原有的数据集上继续训练。 Java调用paddleocr好像精度没有python调用的好。