惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
雷峰网
雷峰网
S
SegmentFault 最新的问题
博客园 - 【当耐特】
博客园_首页
量子位
爱范儿
爱范儿
博客园 - 叶小钗
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Jina AI
Jina AI
V
V2EX
美团技术团队
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
IT之家
IT之家
Hugging Face - Blog
Hugging Face - Blog
Apple Machine Learning Research
Apple Machine Learning Research
小众软件
小众软件
博客园 - 聂微东
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
The Cloudflare Blog
宝玉的分享
宝玉的分享
WordPress大学
WordPress大学
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

分享创造

分享 KCase 脑图测试用例生成平台(AI 辅助生成测试用例) 标签页囤积症自救:写了个插件 TabRack,主打快速检索、自动分类和 AI 摘要 [file-preview]一个比较全面的在线文件预览组件库-支持 react 和 vue 撸了个 iOS 小应用[极简水印相机],直接免费 做了一个 V2EX Skill 写了个 iOS 打码 App「遮鸭 Maskduck」,纯离线免费 35 岁前端,裁员失业后,我花 1 个月做了个 AI 生图网站 亲身经历猫咪急症,我做了一款猫狗疼痛检测工具,希望能救你家毛孩一命 如何用 AI 做比较酷炫的落地页? 求真!最近 AI 生图的能力强到可怕 开源一个查看 k8s 的菜单栏工具-kubebar Packpour:我做了个专门给 App Store Connect 填多语言元数据的小工具 面对 140 年一遇的超级厄尔尼诺,我做了个全球监测小站 做了一个自动翻译的 Hacker News 客户端 做了一个 AI 头像生成器,可以免费生成 2 次 [送码 50 个] 自己手搓了个高颜值的倒数日 App——拾光机,求 V 友们指点 一个将苹果健康 APP 数据导出的工具,然后把你的数据喂给 AI 分析 我做了一个叫「订阅斩」的 iOS App,专门对付那些悄悄扣钱的订阅 做了个草率的日麻互动漫画,听听反馈 喜欢自己洗车的朋友们,我用 ai 做了一款洗车小程序 -- 洗车志 感谢 V2EX 上各位 NAS🍆 和 Datahoarder 玩家的关注和真实反馈!作为个人开发者,能得到这么多硬核玩家们的讨论,我非常荣幸。 用 AI 开发熊孩子自律的小程序 用 OpenClaw 搭建个人运动助手 今天摸鱼给 NanaAI 也接入了 GPT-Image-2 [Video Companion]一个 chrome 插件,解决大多对视频操作的需求~欢迎使用提 bug AI 时代,做产品简单了,把产品推广出去却变的更难了~ bestskills.dev - Skills 精选和评测站点 免 ROOT 强力卸载安卓广告软件 一个 All In One 的运维工具,支持 SSH、数据库、Redis 管理 [开源] Codeg V0.10:专注于代码生成的多智能体 IDE(cc、codex、gemini、opencode……),新版本重构了工作区,飞一般的体验,支持桌面端、服务器部署
嘿嘿,自己 vibe coding 的项目,已经有 1000 星了
cxd8190102 · 2026-06-12 · via 分享创造

之前在读博的时候,手搓过一个解析小插件,用来辅助我读文献、写论文,处理那些大部头的文山著海。后来毕业之后,发现现在做 RAG 相关的,或者开发知识型 agent 照样用得上,所以我就用 AI 完善了一下,开源出去了: https://github.com/Ontos-AI/knowhere

没想到才过了一个月,就收到了 1000 个 star ,真是太感谢大家了。

简单说一下,Knowhere 是一个文档解析与记忆层工具,它在 RAG 的整体流程中,主要做的是从原始文档到结构化知识的前期准备与管理工作。你可以把它理解为连接“混乱的原始文档”和“AI Agent”之间的一个高级中间件。跟我们常见的 MinerU 这类文档解析工具相比,它算是更新、更进一步的、AI 原生的产品。

区别就在于,MinerU 是传统 GOT-OCR 2.0 架构的代表,它底层是几个模型拼接的:

- 一个模型专门负责排版分析——识别出哪里是文字、哪里是图片、哪里是表格

- 一个模型专门负责文字识别

- 一个模型专门负责表格识别

- 一个模型专门负责公式识别

最后由一套规则把所有结果拼接整合,生成结构化输出。

这样平时在学术论文、技术报告等标准文档上是够用的,但是弊端也有,因为每个模型只管自己那一块嘛,所以任何一个出了问题,整条流水线的结果都会变差。

其次就是,遇到非标准文档(工程图纸、扫描件、手写笔记),各个模型容易水土不服,效果急剧变差。这也是困扰了我很久,并且想要自己动手做工具的起因。

最后就是维护成本高了,每个模型都要单独训练、单独升级、单独部署。

2025 年的时候,纯视觉路线出来了,整个流程被压缩为一步:不需要版面分析、不需要区域分类、不需要独立的文字识别器、表格识别器、公式识别器。一个足够强大的视觉语言模型,直接看着页面图片,输出你想要的任何格式化文本。

听起来是不是过于简化?但还得感谢咱多模态大模型的发展,对于越来越多的文档类型,纯视觉路线已经达到甚至超过了传统 pipeline 的质量,同时大幅降低了系统复杂度。

Knowhere 就是在这个路线上做起来的。

它能把从原始文件——解析与结构化——chunking——embedding——形成记忆,这整个流程的活儿都给你干了,你直接接上就行。

除了省事之外,它还有以下改进:

- 树形结构切分,保留文档的逻辑关联和层级路径,解析结果比传统切片好多了;

- 对构建的章节树、摘要、跨文档链接等信息进行组织,方便 AI 检索和导航;

- 与主流一次性的向量检索不同,它允许 AI 在知识结构中自主导航,实现混合检索;

- 不仅支持文本,还能通过视觉语言模型提取并链接图片和表格中的信息,尤其是难搞的 PDF 和 PPT 、Excel 等;

- 所有返回结果都带来源追踪,确保回答可溯源。

根据我们的测试,使用 Knowhere 处理后的文档,AI 回答准确率从 53%提升至 79%,首次搜索准确率提升了 36%。

如果你在 AI 平台里面使用,Knowhere 起码能为你省下一半的 token ,再也不用看到大的文档就肉疼了。

如果你也在做 agent 开发或知识库类的项目,那不妨尝试一下,希望能帮到各位老哥,谢谢: https://knowhereto.ai/?utm_source=v2ex