关于小微企业自建知识库的疑问

是的,数学公式、化学公式、物理公式等较为复杂的公式还不能完全识别,有一部分是可以。上面也有佬提到了Docling,也可以试试看,或者github上找找这两项的结合方案,目前简单好用的方案貌似就这两个工具,如果有更好的方案也请分享。

不是使用插件的形式嘛,那么如果是我用官方的token 就是配置官方的路径加token嘛

没有用过官方的方案,配置文件中有mineu的url和key的配置,不知道是不是一样配置就可以用。

1 Like

丢失上下文好解决吧。现在我的想法是vitepress跟dify一起。文档本身就可以建个站,dify文档添加metadata(用来关联vitepress文档),召回的时候如果LLM觉得需要更多内容,直接把整个md或者网站塞给他。召回的话,分块的时候适当增加overlap补充前后文内容。如果公式不打算让大模型理解的话,直接转成图片,图片和表格都用小模型生成title。
然后提问的时候我是让LLM先把提问标准化,同时让LLM提供几个关键词,然后语义检索&关键词检索一起,去重排序。

不要用 rag 了,4k 上下文时代的产物,现在 直接 AI 总结 AI 检索就行了。我正在准备写一篇文章讨论 AI 知识库

1 Like

我也蹲一个,这个确实是很实用的,哪里都可以用到

我最近看到一个GBrain,看到相关描述如下,有没有大佬了解过:
LLM Wiki更像是一个由AI编写和维护的百科全书。
它的目标是知识的结构化、可解释性和人类可读性。知识是静态编译的产物,查询时直接阅读已整理好的内容。
适合谁用?

  • • 个人知识库(研究笔记、学习资料)
  • • 小团队文档管理(产品文档、技术手册)
  • • 专业领域研究(学术文献、竞品分析)
    特点是简单、零成本、人类友好。不需要部署,纯Markdown,Git管理。
    GBrain则是一个给AI Agent用的人类大脑。
    它模拟人脑的记忆机制,强调记忆的持久性、关联性和可回忆性。支持复杂推理、多Agent协作、主动记忆召回。
    适合谁用?
  • • 投资人决策支持(管理海量项目和人脉)
  • • 高管个人助理(日程、邮件、决策历史)
  • • 复杂项目管理(跨项目关联、历史回溯)
  • • Agent持久化大脑(让AI真正「记住」用户)
    特点是强大、复杂、需要技术团队支持。
4 Likes

要内部搭建和需要团队内协作管理查看的就考虑一下自部署的B/S架构的项目,只是传文件不需要二次编辑就用fastgpt之类的吧,调优比较麻烦

也可以用开源的 MrDoc、zyplayer-doc 之类的企业级自部署方案,内置的AI还是很不错的,能拿到原始文档数据自己再想做二次处理也可以

感觉其实很简单,只需要三层的Markdown就能解决。
第一层负责做索引凝练信息,第二层保存整理总结过的信息,第三层指向原始信息

现在的Agent都能自己做检索,然后拼一下就OK了。

1 Like

蹲一下,我之前做rag的知识库检索感觉效果不是很好,而且数据也比较乱不是结构化的

请问xls这种数据要怎么处理,再进入知识库呀

MinerU原生支持excel (.xlsx/xls) 格式的解析,能精准读取并将其转换为md格式或者json格式,可以直接用。

2 Likes

gbrain不好用,经常出错,并且它是dream自动整理,你根本不知道它哪一步抽了,只会看到全盘搞砸。。。

蹲个个人的解决方案。之前看到有篇关于SAG的方案,但除了论文自己的实现外没看见过有别的项目用到,最近在尝试自己vibe一个看看实际效果。

现有ai能力,应该比较简单,有个一把梭的方案,把所有数据都存es,然后再根据关键字查。怎么检验存储的数据行不行呢?人根据问题能手动查到,那么ai也一定能。后面就是根据场景优化了。

1 Like

数据量小可以,数据量大了弊端非常大,llm wiki慎用

1 Like

我维护了一个私人的rag知识库,也可以说几句。

1.如果你没有本地部署大模型数据流出是无法避免的,我的知识库是给我生成maldev 的,看了下你这个需求直接notion ai 就行了没必要和我一样:清洗数据+embading+reranker

2.你这个需求其实要是愿意折腾一张5090配合vllm就够了,搭建的时候没有任何的难度:laughing:

  1. 现阶段私人知识库的问题从来不是构建而是维护,构建部分的内容全网到处都是 而维护rag 有各种各样的讨论以及猜想例如graphe rag 什么的。
2 Likes

佬本地部署的哪个模型,我这有6张H20,4张L20,4张5090