惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
V
V2EX
L
LangChain Blog
WordPress大学
WordPress大学
大猫的无限游戏
大猫的无限游戏
T
The Blog of Author Tim Ferriss
Recorded Future
Recorded Future
月光博客
月光博客
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
美团技术团队
博客园 - 【当耐特】
The Cloudflare Blog
罗磊的独立博客
GbyAI
GbyAI
A
About on SuperTechFans
腾讯CDC
宝玉的分享
宝玉的分享
I
InfoQ
V
Visual Studio Blog
Forbes - Security
Forbes - Security
P
Proofpoint News Feed
T
Troy Hunt's Blog
NISL@THU
NISL@THU
Webroot Blog
Webroot Blog
T
Threatpost
博客园 - 三生石上(FineUI控件)
S
Securelist
H
Help Net Security
小众软件
小众软件
L
Lohrmann on Cybersecurity
Cyberwarzone
Cyberwarzone
T
The Exploit Database - CXSecurity.com
量子位
博客园_首页
Scott Helme
Scott Helme
酷 壳 – CoolShell
酷 壳 – CoolShell
雷峰网
雷峰网
J
Java Code Geeks
G
GRAHAM CLULEY
T
Tor Project blog
The GitHub Blog
The GitHub Blog
Cloudbric
Cloudbric
IT之家
IT之家
阮一峰的网络日志
阮一峰的网络日志
Hacker News - Newest:
Hacker News - Newest: "LLM"
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Schneier on Security
Schneier on Security
V
Vulnerabilities – Threatpost
Jina AI
Jina AI

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗 天才程序员想要复活,还有可用的codex公益站么 里斯本丸沉没照进现代了 [富可敌国] [一叶知秋API]友仔们 我们换域名了~~ 记得更新一下哦 有点莫名其妙,被阿里云警告了 从道观回家之前,我和师兄问道 【picpi 皮皮公益站】为了防止有人拿去卖,邀请码发放规则更新。 美国 FAA: 我们需要你,游戏玩家,来当空管吧 vibe时用文言省tok吗? 有没有用? 会降表现吗? Codex CLI 官方这个 imagegen 的 Skill 到底是干啥的?哪有对应工具啊? 求问关于尼区和美区开通Claude 换设备登录telegram国内号码老账号 需要收费咋办? 发现hotmail的额度特别耐用 最近还有能正常用的claude中转站吗? 避雷闲鱼上面的CC中转站 现在cursor的优势是什么呢? OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 谁在吹opencode go套餐啊,又慢量又少 【SamAltman】奥特曼被燃烧瓶袭击后的回应 咸鱼上359买的claude MAX 5x ,美国假家宽,看看能活几天 想问问跳蚤市场开的Pro和Plus 虚拟卡链接求助 [开源插件] 做了一个适合科研佬的GPT插件 【AI小说】拿AI跑了一部小说,佬们看看质量怎么样 总是能在首页看到opus4.6鞭尸推送 这个别名邮箱可以注册gpt 一个人在外地的话,佬们周末都做什么 你们ddg还能行不 获取不到新的邮箱 了····· claude code修复codex windows升级0.120.0 无法打开问题 我现在Zeabur上搭建了CPA服务,怎么再接入new api来做分发 杭州有么有佬友在搞AI应用这块的,四年前端转AI开发 汇丰、渣打两家银行获得香港稳定币牌照 【开源推广】 AIUsage:聚合多个 AI 平台配额与用量的 高颜值 macOS端 CPA看板 APP Newapi吃服务器内存多吗 中行跨境通疑限制无卡连续交易 或为应对盗刷 突然不能用表情回应话题了 codex是不是降额度了 反馈关于 “快问快答”标签的乱象 opencode版本1.4.3 无法上传图片问题 想问一下怎么解决这个问题,就是终端太多? codex更新到0.120.0之后无法加载以前的会话 sub2api怎么部署? 分享一个自用的南京继续教育平台视频自动播放下一集的油猴脚本 zotero9出来了 Claude正在向我推销付费项目,那能让你轻易得逞嘛 甲骨文用脚本开出来4个2+12咋办啊佬们,我还是免费号 各个厂的coding plan lite都绝版了? claude code 20美金账户问题 联通元景套餐续费问题 ai时代下的一些思考(诚邀大家讨论) 出境易GPT订阅pro求助 今年到目前股市的操作。 刚收到短信之前跑路的那家可以兑换了 佬们都用境外服务器做什么呢? 甲骨文4+24 求助领pro时候报错-付款页面出错。请重试。如果问题依然存在,请访问help.openai.com。 cloudflare 浏览器渲染增加了 CDP与mcp支持 SUB2API 导入 rt 时报错显示 Request failed with status code 502 如何解决 讨论一下怎么整理笔记 codex0.120.0更新后无法启动,回退 0.119.0正常使用 冰佬的公益站也不行了吗 三角洲直接给我封了10年 有佬友知道怎么起诉么 88VIP邀请 经过排查大概确定反重力代理报错问题了 【求助】openrouter 今年4月用国内visa卡充值后导致封禁,无法使用外国模型 奥特曼家被炸 自用,高信息量回复收集 求助sub2api分组问题 【新人报道】注册成功了 分享100个codex free账号 招聘 深圳客户端开发(flutter) 20k+
【开源推广】适用于企业自建rag系统的知识库管理平台
hupc (会飞的蹦蹦) · 2026-05-31 · via LINUX DO - 最新话题

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

  • 我的帖子已经打上 开源推广 标签:
  • 我的开源项目完整开源,无未开源部分:
  • 我的开源项目已链接认可 LINUX DO 社区:
  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:
  • 以上选择我承诺是永久有效的,接受社区和佬友监督:

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出


最近在学习rag相关的知识,系统性的梳理了几篇文章,想着做个项目实践一下。正好在公司负责了一堆后台项目,就想着能不能搭个知识库平台,把这些后台系统的文档都作为一个知识库管理起来,省得每个项目查个什么东西还得去翻各种文档。过程中正好可以学习下rag相关的切分策略和检索召回逻辑。

所以,下面的这个项目就诞生了。

项目地址

项目定位

这个项目的愿景是可以用于企业内部自建知识库,但是企业内部的具体情况各不相同,所以这个项目主要做的事情就是以不同知识库管理各种文档,包括PDF,word,Excel,图片等。然后支持多种的切分策略,包括固定长度切分、按结构切分、表格感知切分、父子分层切分、语义切分、聊天记录切分。

重点讲讲聊天记录和表格切分。

聊天记录策略是专门为公司内部沟通场景做的,因为平时会经常和业务人员沟通各种功能和数据的修改和检查,有时候找问题就需要翻之前的聊天记录,就想着把这个也做成知识库,到时候都直接放到知识库里直接就搜出来了。
核心就是把聊天记录按话题切分,通过正则识别消息边界(说话人 + 时间戳),解析每条消息的发言者、时间、内容。
按时间间隔(默认 60 分钟)自动识别话题切换,同一个话题的消息尽量放在一个 chunk 里。
格式化后统一 embedding,保证检索时能按时间、参与者、话题精准命中。

表格切分就是专门处理 Excel、CSV 这类结构化表格文档。
这核心逻辑是按行分批切分:表格数据按 table_rows_per_chunk(默认 20 行)和 max_chars(默认 1200 字符)两个维度控制,哪个先触发就切一批。
每个 chunk 带表头:每批数据前面都会重复表头行,保证 chunk 独立可读,不用依赖上一个 chunk 的表头。

这里还特殊处理了一种FAQ类型的表格,而且有多级合并的情况。
如果检测到表头包含"一级/二级/三级(/四级)"这种层级分类字段,会走专门的 FAQ 渲染模式。
这个是按分类层级分组,同组的行尽量放在一个 chunk 里。渲染成 问题:xxx、一级分类:xxx、答案:xxx 的结构化文本,比原始表格更适合 LLM 理解和检索命中。

处理完每个chunk就类似下面这样:

image

后台管理页面

下面是项目后台管理页面的部分截图。

image

切分配置页面可以实施预览各种文档或者自定义文字,在不同切分策略下的效果。

image

项目里的文档上传和解析切分都归结为“任务”。任务都是异步处理

image
image

图片识别

图片的识别是用OCR和多模态大模型的混合方案。

OCR目前支持百度的paddleOCR(每天有2000的额度)。如果配置了多模态LLM ,会用LLM生成一个图片的语义描述,涵盖图表趋势、流程步骤、关键文字等。然后和OCR识别的文字一起作为文字内容embedding到向量数据库中。
所有的元数据和chunk后的数据都会在postgresql中存一份。如果查询的时候命中了某个chunk,则会关联到某个文档信息,如果是图片则会直接返回一个图片的URL,前端可以直接展示出来。

检索

这是一个检索测试页面,可以选择不同的知识库进行测试,并且支持纯向量检索和混合检索(就是融合了BM25的多路召回),也支持 Rerank 二次排序(接入外部 Rerank 模型)。

image
image

还支持把不同的知识库一键生成可以用于dify的外部知识库。直接选择知识库然后配置到dify的外部知识库就可以了。

image
image

我自己试着把这套系统在公司的几个项目中跑了一下,简单搭个页面或者在dify中搭个智能客服然后再加上外部知识库,能在后台系统中给内部用户用于检索系统功能性的问题。

需要完善的地方:

一个是日志系统需要根据自己的需求完善一下,一般是推荐放到系统侧,能和系统的用户和信息融合到一起,这个平台可以单独作为知识库的服务。

第二个就是权限,这个系统目前没有任何权限设置。倒是预留了PermissionChecker权限插件,可以通过自定义接口来对接企业内部的权限,来控制知识库的权限。毕竟这些都是企业内部的核心资料。
我这边主要是自己负责好多公司后台项目,我都是用自己整理的一些文档和说明。所以没有做什么权限控制,如果是公司用权限还是要做更精细的控制。

以上就是项目的一个大概介绍,如果也有探索rag知识库落地场景的佬可以互相交流一下。

==============================================

2026-06-05T16:00:00Z

更新:

目前更新了一个版本,支持了飞书和企业微信机器人接入,可以直接跟机器人聊天回答知识库内容,也可以接入到群聊里,默认是只有@机器人才会回答问题。

image

Sanc 3

赞一下,有个问题请教一下
我目前了解rag还是按照固定长度拆分,存入,检索时候按照“关键词检索”
比如我导入一本书,我想要第一章的概括,他好像只会检索“第一章”这个关键词的相关拆分,没有办法准确获取第一章完整内容,给大模型概括
我尝试做一个导入后做结构化知识整理,现在卡住了,看见你的拆分方式里有“按结构”,能否实现。

hupc (会飞的蹦蹦) 5

看你描述的场景应该不需要向量检索,你这个场景适合将每一章节切分成一个chunk ,这个需要针对你自己的文章特点调整下切分的逻辑。然后检索时你可以直接用bm25算法,也就是关键词检索,召回整个第一章节的chunk,然后再喂给大模型。

按“结构”拆分这是一个理论概念,它的理论就是把文档按照标题结构切分,这是通用的做法。但是具体到你的场景,你需要根据你的文章中每个章节的结构特点,把每个章节的内容切分成一块。我的项目里的“按结构”切分就是按照标题段落等切分成一个chunk,因为我这边大部分是手写的一些markdown文档,都有比较清晰的目录层级。也需要配合单个chunk的字符数来控制chunk的大小。

我觉得rag的各种切分只是一个思路,并没有一个万能的通用模式能使用各种情况,所以说要根据不同切分策略的思路去应用于自己的文档和需求。比如我的表格切分和聊天记录切分就是根据自己情况定制的一个切分规则。

hupc (会飞的蹦蹦) 6

这个其实就是通用产品和定制的区别,dify是一个通用的agent和工作流搭建平台,知识库只是它的一部分功能,我就是看dify里只有一个固定切分和父子切分,而且不能自定义切分逻辑,所以就自己搭了这么一个平台,可以自己根据自身文档的特点去定制一些符合自己需求的切分策略和检索策略。

然后把这些知识库作为外部知识库接入dify这些工具中。

对机器性能怎么样?之前想部署Ragflow,发现对机器性能要求还挺高的

hupc (会飞的蹦蹦) 9

这个对性能没什么要求,就是有Python和相关的扩展就行。向量化这些都是用的第三方的接口

区别在于fastgpt不好维护,搭建的容器多,但是求稳也行

lwimanutd (lwimanutd) 11

非常实用,刚好有在找类似的需求。

ws0105 (白雾生) 12

这个可以对接到钉钉或者飞书里面吗

hupc (会飞的蹦蹦) 13

不支持直接应用到飞书钉钉,但是有http接口,可以套一层应用放到第三方软件中。

能企业内部系统需求文档做一个完整的知识库,然后可以通过mcp形式(或者其他方式)走工作流开发,这个方向我试了好几个知识库都体验不好,不知道后面有没有好的解决方案;腾讯的ima在应用里面使用返回速度和质量都可以,但是走mcp就很慢很一般了

hupc (会飞的蹦蹦) 15

目前这个项目不支持MCP,对外的就定制了一个dify的接口,然后还有一个http接口进行扩展。
自建知识库的难点是要不断调试查询的准确性和切分的合理性。只要准确性可以了,做一些扩展,比如MCP或者skills等,相对于ima这些标准产品要容易的多。

hupc (会飞的蹦蹦) 16

今天更新了一版,支持接入飞书和企业微信了