大概文件内容长这样
有数学的, 也有专业课的
其实排版已经比较友好了, 99%都是一题一页或者两题一页, 但实在量大, 大概有4000+页
图片可以直接存assets里, 没必要硬用LaTeX复刻
输出用markdown/LaTeX都行
希望精度尽可能高, 不要人工复核
采用了PaddleOCR-VL-1.6, 免费量大, 内容上基本正确, 排版上缺憾比较大
本地预处理一波转换成一题一页, 一题输出一个md文件并带上原题切图, 之后还是自己组织排版
OCR无解(或者说我不太愿意尝试了,太费劲),minerU可以试试
最成熟的方案,让codex直接视觉识别 view picture 然后给你转为markdown
这个可以在网页端做,节省token
开源方案有,minerU,
收费的有 合合
加上模型那块,百度的OCR,你可以都试试
可以试试mineru转成markdown,稍微修改后可以pandoc转格式,传统的ocr排版很难评
可以尝试下这个工具 开源的GitHub能搜到
不知道网页端能输出多长的文件, 这量确实有点大 ![]()
这玩意做不到批量吧, 以前用过, 感觉效果不是很好, 而且好久没更新了 ![]()
用paddleocr-vl试下,他文档中的应用场景就有公式识别
所有多模态都可以啊,调用子代理,每两页一个子代理。转成md格式就行。建议找个便宜的mimo
公式倒是问题不大, 现在挺成熟, 主要可能还是排版? 感觉有点复杂
直接上gemini 3.5 flash,很好用
配合打野某渠道就可以了
看起来是有文字信息的pdf,推荐使用算法和HPD-Parsing PaddlePaddle/HPD-Parsing · Hugging Face 模型来做融合的解析,我实际用来做论文的转写,对于双栏、多分栏的排版处理都是正确的。HPD-Parsing对于公式的识别尤其不错,绝大部分的表格识别都是ok,但是对于2x2左右的小表格识别可能会有点小问题,这个时候就用算法解析得到的表格文本去比对来做筛除了。
以及如果存在图片的嵌入,HPD-Parsing 会留下图片的占位符和图片位置的标注,可以用算法把图片裁出来处理。
我之前跑是使用本地4070ti,现存在开到12个fork头大概占用到8G左右,速度还不错,4页文字较多的论文用时大约30秒左右。
哈哈 确实很久没更新了, 那要不直接用AI吧 有点费token好像
确实, 我一开始就是用AI验证的, 但是量是在有点大, 就还是想想其他办法
现在gemini还有什么地方可以打野吗, 或者说有低价稳定渠道? 5000页花50感觉也可以接受
ppocr的产线有很成熟的版面识别模型,如果你需要定制可以自己微调下模型,
试了一下感觉minerU效果比合合的textin效果好, 但是依旧要调整排版![]()
感觉略好于minerU, 不过排版依旧要调教 ![]()
你主要看重哪部分不好的。公式,图表,表格,还是啥,需要针对的研究,我去年是是 研究 ragflow, 所以深度研究了 PDF录入知识库那块的。 再不行,试试 ragflow的 deepDoc
稍微研究了一下, 可能需要在我本地预处理一下, 一页一个PDF, 一题一个文件可能会方便我整理格式
谢谢佬, 我先跑跑batch怎么样