【开源自荐】pdf目录生成工具,支持扫描版pdf的自动识别

今天在看一个pdf文档,但是原文档没有目录,导致跳转比较麻烦。搜了下,好像没有比较方便快捷的工具可以加目录的,就动手写了个。

核心特性

  • :robot: 智能目录提取:内置高精度算法,一键扫描文档前 50 页并自动识别潜在层级结构。
  • :computer_mouse: 自由拖拽排序:支持通过手柄直接拖拽调整目录顺序,所见即所得。
  • :triangular_ruler: 多层级支持:支持三级目录结构(章、节、点),轻松应对复杂文档。
  • :1234: 页码偏置修正:自适应纸质页码与电子页码的偏差,确保跳转精准无误。
  • :file_folder: 本地化存储:尊重隐私,文件处理完成后自动清理服务器残留。

Update

评论区有佬说有扫描版pdf的需求,所以研究了下,接入了大模型,现在支持扫描版pdf的目录识别了!

Docker 部署

  1. 拉取镜像

docker pull ghcr.io/jiangnan1224/pdf-toc-editor:latest

  1. 运行容器

docker run -d -p 5000:5000 --name pdf-toc-editor ghcr.io/jiangnan1224/pdf-toc-editor:latest

应用截图


体验地址

开源地址

21 Likes

感谢大佬 。

1 Like

看着不错!

1 Like

感谢大帅哥

1 Like

场景比较窄,但是如果真的需要用到的话还是可以解决一下问题的 :grinning_face:

1 Like

强. 读书人有福了。老书, 扫描的,能用吗?

1 Like

扫描的不太行。。没有做ocr,只是读取文件的目录,然后写入到pdf的元数据里面去

感谢分享mark一下 ps要是支持高精度维确的本地和在线的高精度ocr就更好了也不知道支持不支持ocr的方式毕竟不少pdf的都是图片扫描的..

只读取目录那么对于都是图片的来看相当于没有目录了..

感谢大佬分享!

嗯嗯 有时间研究下接入大模型识别下图片,看看效果如何

ps最好有本地的毕竟在线的毕竟昂贵..(同时要是死活连不到在线的那么就..用不了了


佬友这个和我当时做的这个差不多,我是想做一个根据目录拆分PDF的工具来着

大佬解决了我以前很久有的一个困扰,之前 zlib 上下载的一些书没目录感觉很不方便,今天看到这个工具突然感觉问题解决了

感谢大佬

多谢,很实用的工具

感谢分享。这活我之前都是丢给Gemini的,回头试试楼主的工具。

佬是手搓的吗,确实好东西

佬这个看起来很不错呀,ocr使用什么大模型做的啊

我也是从zlib下载书之后没有目录才想起来搞这个的

不是的,大部分都是交给哈基米实现的