对 ocr 这块是纯新手小白,想要实现以下需求,需要用到哪些SDK 和大模型呢
最好是 Java 可用的
- 数据格式:PDF(结构化 + 扫描版)
- 需求概述:识别各级标题、正文、图表(可以是图片格式,通过图表的标题、脚注查询即可)
- 应用场景:用户通过检索关键词,定位到哪位文件包含关键信息,以及每个文件出现关键词的原文位置
对 ocr 这块是纯新手小白,想要实现以下需求,需要用到哪些SDK 和大模型呢
最好是 Java 可用的
蹲一个回复
帮顶 我也想要一个识别表格比较好的
坐等大佬回复,我也想看看
插个眼呀,后续关注一下
可以看看这个
感谢 我去看看
Java不知道,但我知道中文的识别百度飞浆ppocr是比较强的
帮顶, 大佬看完也给我们讲讲
mark一下
Tesseract
开源的,英语还可以,中文够呛
按他这文档搞 python 的环境都要了命了 那些什么 eva_decord、detectron2之类的搞死了
我这段时间做这个ocr,中文识别度最好的就是paddle飞浆的,可以将训练后的模型转成onnx在java端运行,但识别速度及效果会降低,最好就是将模型服务在gpu服务器部署,通过api调用。
但只是通用场景的,要达到好的识别效果,最好用自己的数据微调模型。
tesseract得自己训练才好用,它的那个训练数据好老了 ![]()
同问 如果pdf里面是图片 识别能出来么
百度开源的paddlepaddle/PaddleOCR能力不错,你可以看看,但不是Java的
github上找找有没有java封装的项目
https://paddlepaddle.github.io/PaddleOCR/
可以的
看需求实际上不一定需要ocr,试试pypdf和pymupdf,简单很多,效果我觉得也不错
我们算法团队都搞的不是很好,让我们这小白去弄 感觉更弄不出来
你们可以试试用paddleocr做api,然后在特定场景自己做一些数据标注,在原有的数据集上继续训练。 Java调用paddleocr好像精度没有python调用的好。