惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MongoDB | Blog
MongoDB | Blog
AI
AI
B
Blog RSS Feed
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
T
Threatpost
I
Intezer
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Scott Helme
Scott Helme
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
Threat Research - Cisco Blogs
Google DeepMind News
Google DeepMind News
GbyAI
GbyAI
H
Hackread – Cybersecurity News, Data Breaches, AI and More
S
Schneier on Security
Webroot Blog
Webroot Blog
Recorded Future
Recorded Future
aimingoo的专栏
aimingoo的专栏
L
Lohrmann on Cybersecurity
Simon Willison's Weblog
Simon Willison's Weblog
MyScale Blog
MyScale Blog
Project Zero
Project Zero
L
LangChain Blog
B
Blog
D
DataBreaches.Net
Microsoft Security Blog
Microsoft Security Blog
F
Fortinet All Blogs
美团技术团队
Engineering at Meta
Engineering at Meta
Cisco Talos Blog
Cisco Talos Blog
D
Docker
WordPress大学
WordPress大学
人人都是产品经理
人人都是产品经理
S
Security Affairs
Attack and Defense Labs
Attack and Defense Labs
N
News | PayPal Newsroom
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
量子位
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
W
WeLiveSecurity
V2EX - 技术
V2EX - 技术
TaoSecurity Blog
TaoSecurity Blog
博客园 - Franky
P
Proofpoint News Feed
Jina AI
Jina AI
Google DeepMind News
Google DeepMind News
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
雷峰网
雷峰网
The Hacker News
The Hacker News
G
GRAHAM CLULEY

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
AI产品经理:从文档解析到数据清洗,打造高质量RAG数据集
产品经理小易 · 2025-09-11 · via 人人都是产品经理

在大模型应用落地的过程中,RAG(检索增强生成)正成为连接外部知识与智能问答的关键技术。但真正能跑通的RAG系统,背后依赖的是一套高质量的数据构建流程——从文档解析、内容切分,到数据清洗与结构化,每一步都决定了最终效果。本文将以产品经理视角,拆解打造高质量RAG数据集的完整路径,不仅讲方法,更讲实操,帮助你在AI项目中少踩坑、快落地。

RAG知识库作为大模型的“外挂记忆”,市面上实现的方法多种多样从Dify Agent自主搭建知识库Workflow到Langchain框架定制知识库逻辑以及大部分公司所用的对RAGFlow进行二次开发。但是真正起到决定作用的仍然是投入的数据,这篇文章将从“制定数据集标准”,“整理解析相关文档”,“清理打造结构化数据”三个方向出发。帮助每一位产品经理围绕着自己的产品制定相关策略。

从业务出发,了解数据处理标准;明确了解策略制定出发点

在整个RAG流水线中,数据提取是第一步,也是直接决定知识库质量的非常重要的一环。而且相比于其他步骤来说这一步相对可控。它的目标是保证数据完整、准确、易读。

内容的完整性:不要漏掉和业务相关内容,保证知识库知识的完整性

在搭建RAG知识库时,“内容的完整性”是核心原则之一。它指的是:知识库必须全面覆盖业务场景中的所有关键信息,不能遗漏任何与业务相关的内容,否则AI在回答用户问题时,就可能“答非所问”或“一问三不知”。

RAG系统的本质,是用知识库里的内容来“武装”大模型,让它在回答问题时,能从知识库里找到准确、可靠的信息,再生成答案。如果知识库里缺了某块业务内容,AI就算再聪明,也“巧妇难为无米之炊”,只能凭空编造或给出错误答案。

内容准确:错误的信息,对于大模型就是致命的毒药

在RAG系统中,错误信息如同被注入大模型血脉的“毒药”——它先污染知识库,再随检索进入模型视野,而大模型对检索结果天然“信任”,不加辨别地将其当作事实,于是少量错误便被放大成指数级灾难:一次失效参数、一条过时政策、一处表格误读,都会在生成环节被模型自信地包装成权威答案,直接反噬用户体验与企业信誉,最终让系统“越智能越危险”。

关系完整:没有目录的说明书,大模型真的很难理解

把RAG知识库比作一本“拆散”的说明书:如果把所有段落、图片、表格全部撕下来混在一起丢进抽屉,再聪明的大模型也只能像盲人摸象——它确实“看过”每一页,却永远搞不清哪一步该先拧螺丝、哪一步该后插电源。所谓“关系完整”,就是给这些碎片补上目录、页码、箭头、折痕:让“第3步的螺丝”能一眼找到“第2步的螺母”,让“故障代码E1”立刻定位到“附录的电路图”。缺少这层目录式关联,大模型只能凭字面相似度瞎猜,结果就是把“电池正反面”答成“正反两面都有电池”。因此,没有目录的说明书,大模型真的很难理解——它不缺字,缺的是字与字之间的“血缘”。

元数据完整:数据本身的各类属性也是大模型的重要参考

在RAG知识库里,元数据就像超市货架上的价签、保质期和条形码:它们不是商品本身,却告诉大模型“这袋牛奶产自哪家牧场、哪天到期、该放第几排冷柜”。当用户问“孕妇能喝什么牛奶”时,模型无需把牛奶盒子逐字嚼一遍,只要扫一眼元数据里的“成分、钙含量、适用人群”,就能瞬间筛出低脂高钙、未过期的几款。

若缺少这些属性标签,模型只能像闭着眼在仓库里乱摸,把奶粉当鲜奶、把猫罐头推给孕妇。因此,数据本身的各类属性——时间、来源、格式、权限、语义标签——就是那张让大模型“秒懂”的隐形目录;元数据越完整,模型越能把碎片拼成正确答案,而不是拼出一盘“知识沙拉”。

了解各类文件解析逻辑,达成“成本”,“质量”,“速度”三角

无论哪种文档类型都需要输出一个统一格式,结构化明确,内容完整的RAG数据。每一种数据特性各不相同,需要产品根据“成本”,“质量”,“速度”进行三角思考。得到最适用的处理方法。

Word文档解析逻辑

在 RAG 系统的知识源接入过程中常常需要将 Word 格式的文档内容结构化处理,以便后续向量化、检索与生成。

–「解析流程」(文章会提供一键化工具,这里只是提供一个脚本编写逻辑)

(1) 文本内容解析

使用 “python-docx” 库对 .docx 文件进行解析,提取出正文段落、标题等文本内容,并保持文档原有的结构层级(如段落编号、列表等)。

(2) 图片内容提取与映射管理

将文档中的所有插图、截图等图像内容导出至指定的image_folder 文件夹,并在处理过程中建立 image_map 映射关系: 映射字典的 key:图片在文档中的引用 ID映射字典的 value: HTML 格式的

标签(指向图片路径)

(3) 文档内容再处理与图片嵌入

在遍历文档正文内容时,若检测到图片引用位置,会动态调用image_map 中对应的

标签,将其插入至相应文本段落中,实现图文混排。整个处理过程遵循统一的 HTML 拼接逻辑。

(4) 生成最终HTML格式文档

输出结果为包含富文本结构(文本 + 图片)的 HTML 内容块,方便后续用于:向量化切分分块(RAG文档预处理);检索展示(检索结果高亮/插图还原);页面预览(用户检索结果直观呈现)

PDF文档解析逻辑

构建企业级知识库时,PDF 是极为常见的数据来源。但其天然的“非结构化”特点,相比 Word、HTML 等文档,处理难度和技术复杂度显著更高,原因如下:

  1. Word/HTML/Markdown属于有标记文档(structureddocuments),天生具备结构化标签(如段落、列表、表格等),计算机可直接解析。
  2. PDF则是版面呈现驱动的文件格式,本质上是为“人看”而设计,内容以页面流形式按坐标绘制,不含语义结构信息。

第一步:PDF文本内容提取:

(1)使用如 pdfplumber / PyMuPDF 等工具,对 PDF页面流进行解析(或者直接用OCR+文档解析)

(2) 提取每一页的文字块,并保留其坐标信息(x/y 位置、字体大小、页码等)

(3) 输出为结构化的“段落 + 位置信息”集合,为后续重构文档结构做准备

第二步:版面还原与语义聚合:

(1) 基于字符位置与排版特征,重建段落/标题/列表等结构;

(2) 对换行断句等错误进行修复(如段落跨页断裂、空格消失等);

(3) 利用规则/模型判断内容的逻辑层级(如“二级标题”、“表格行”)

第三步:图文内容同步处理

(1) 检测文档中出现的嵌入图片(如表单截图、流程图等);

(2) 将图片抽取至 image_folder,并建立 ID ↔ 图片HTML 映射;

(3) 在解析出的文本中插入 img 标签,形成图文结合的HTML 片段

第四步:生成统一格式文档片段

(1) 最终输出标准 HTML 文本块,每块表示一个段落/图文片段;

(2) 用于后续向量化切块、RAG 检索调用、富文本问答展示等流程

多模态预料如何处理

1、音频怎么处理(如会议录音、播客等)最小可行做法(先跑通):

(1) 转文字(ASR):先用语音识别(ASR)把整段音频转成文字,自动生成时间戳(如:10:12-10:40)。

(2)切块:每20-40秒切成一段,段与段之间重叠2-3秒,每段都保留开始/结束时间,避免语义被切断(每段保留 {text,start, end, audio_path}四元组,方便后续拼接)。

(3) 构建索引:建立语义索引和关键词索引(方便检索时按关键词/语义快速检索)。

(4)检索流程:用户提问 在索引中检索 找到相关切块>按时间顺序拼接,返回文本答案-附上时间戳跳转,支持“回溯原音频”。

2、视频怎么处理(如课程、直播、产品演示):

最小可行做法(先跑通):先用最低成本跑通“音轨问答”,再按需叠加“画面信息”

(1)抽取音轨:参照音频流程做(ASR 切块 索引),快速覆盖大部分基于口述内容的问题

(2)进阶:补画面信息(两步)

  • 关键帧/关键页:镜头切换检测(如在PPT翻页/镜头切换)时,自动抓一张截图,作为“视觉书签”。
  • OCR识别:对截图做文字识别,提取出标题、要点、表格、代码等。(输出:{timestamp,image_path,ocr_text})

把识别出的文字场块,并和 时间戳、截图地址绑定。

用户提问时,系统既能在音轨文字里找到答案,也能在截图文字里定位关键信息,并能返回“相关画面”。

数据清洗,打造高质量数据集

在RAG(Retrieval-Augmented Generation)知识库的搭建过程中,文档解析只是第一步,它的目标是将非结构化或半结构化的文档内容转化为可处理的文本格式。但解析后的原始文本往往存在大量噪声、冗余、格式混乱、语义不连贯等问题,如果直接用于后续的分块、 embedding 和检索,会严重影响检索的准确性和生成模型的回答质量。

因此,数据清洗(Data Cleaning)是必不可少的一步,它的核心目标是:将解析后的原始文本转化为高质量、结构化、语义清晰的文本数据,为后续的向量化、检索和生成打下坚实基础。

以下是一个适用于RAG知识库的标准数据清洗流程,建议按顺序执行:

1. 格式清理(Format Cleaning)

  • 去除HTML/XML标签、LaTeX命令、页眉页脚、页码、水印
  • 清除PDF解析残留(如“©2023CompanyName”)
  • 统一换行符、空格、制表符(如\n\r→\n)

2. 编码与字符标准化

  • 统一UTF-8编码
  • 全角转半角(如中文括号→英文括号)
  • 去除不可见字符(如零宽空格、BOM头)
  • 统一标点符号(中文句号→英文句号,或反之)

3. 冗余信息过滤

  • 去除版权声明、免责声明、广告、重复段落
  • 删除“目录”、“参考文献”、“致谢”等非正文部分
  • 去除短于N个字符的无意义段落(如“第1章”)

4. 结构恢复(Structure Restoration)

  • 恢复标题层级(如“1.1.2小节”→三级标题)
  • 合并被错误拆分的段落(如跨页段落)
  • 将表格、列表、代码块还原为结构化文本(如Markdown格式)

5. 语义连贯性修复

  • 合并断句(如“如图\n2-1所示”→“如图2-1所示”)
  • 修复OCR错误(如“机哭学习”→“机器学习”)
  • 统一术语(如“NLP”、“自然语言处理”→统一为“自然语言处理”)

6. 语言与分词预处理

  • 中英文之间加空格(如“使用Python进行数据分析”→“使用Python进行数据分析”)
  • 统一术语大小写(如“openai”、“OpenAI”→“OpenAI”)
  • 可选:进行分词、词干提取(视embedding模型而定)

7. 分块前准备(Pre-chunking Preparation)

  • 按标题、段落、句子进行初步切分
  • 保留标题与正文的关联(如“##标题\n正文”)
  • 标记特殊块(如代码块、表格、引用)

当收集到的业务文档根据产品所制定的一系列策略,从文档的整理到文档的解析,从凌乱的数据清洗成结构化的统一格式的数据。知识库的召回率和准确率将会大大提高,祝各位产品都能建立起一套逻辑清晰,输出直击答案的RAG知识库。

本文由 @产品经理小易 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议