
























RAG流程虽看似简单,但其效果上限取决于知识库的质量与结构化程度。本文重点剖析了“录入”这一基础且易被忽视的环节,涵盖数据源选择、知识结构化录入、内容清洗、知识分块、向量化等方面,助您构建稳固可靠的知识库。

RAG 的核心流程看似只有四步——“录入 → 检索 → 增强 → 生成”,但每一步都藏着影响最终效果的关键变量。很多团队在 Demo 阶段觉得“能跑起来就行”,可一旦进入真实业务场景,如提升召回率、减少幻觉、构建可持续迭代的知识库,便常常遇到瓶颈。
究其原因,RAG 的上限不取决于模型,而取决于知识库本身的质量与结构化程度。本文将从最基础、但也是最容易被忽视的环节——“录入”——展开拆解,帮助你构建稳定、可靠、能支撑真实业务的知识库地基。
录入是整个 RAG 流程的起点,它涉及数据质量、结构化程度、语义清晰度等多个维度。它不是简单的信息导入,而是包含 数据源选择 → 结构化录入 → 内容清洗 → 分块策略 → 向量化 的完整链路。
录入质量越高,后续检索越稳定、增强越精准、生成越可信。
录入质量越差,再强的大模型也“巧妇难为无米之炊”。
一个高质量知识库,首先要从正确的数据源开始。常见的数据来源可拆成三大类,各有优势与注意点。
① 内部业务数据:最有价值、最贴近业务场景
包括产品文档、操作手册、业务 SOP、售后记录、CRM 数据等。特点:
注意事项:
这部分数据往往决定了 你的 RAG 是否真的“能用在业务里”。
② 公开数据集:快速补齐知识盲区
平台包括 HuggingFace、Kaggle、OpenML、飞桨 Paddle 等。适用场景:
注意事项:
③ 定向爬虫采集:精准补充领域知识
适用于:
注意事项必须写清楚:
很多 RAG 效果差的根源是:数据虽然导入了,但模型并不“理解”它。结构化录入的核心目标是:→ 给不同格式的原始数据赋予“标准化结构”→ 让机器能识别内容类型、上下文关系与逻辑结构
按数据格式拆解如下:
① 文本类(Text):标签化 + 索引化 + 关联化
常见文本包括:产品文档、知识库文章、业务 SOP、FAQ 等。必须为文本建立统一的标注体系,例如:
结构化后的优势:
这是大多数团队最容易忽视但最重要的环节。
② 表格(Excel/CSV):从“静态数据”升级为“可推理的知识单元”
为什么表格难做 RAG?因为表格天生是二维结构,而模型理解的是线性文本。
结构化步骤包括:
结构化后的价值:
③ 图片:将视觉内容转成可检索的语义资产
包括界面截图、流程图、产品图等。
规范化流程:
结构化后可实现:
统一的结构化目标
最终所有内容都会以 JSON 形式进入清洗流程:
统一结构化后,可做标准化校验、去重、版本管理,是企业级知识库必须具备的能力。
内容清洗是决定数据可用性的关键步骤,目标是让知识既“干净”又“完整”。
拆成两大层级:
① 基础净化层:处理格式噪声
主要包括:
优势:
② 语义降噪层:消除内容噪声
处理逻辑包括:
清洗的核心原则只有一句话:不破坏知识原子性,只移除对语义无贡献的部分。
RAG 的第一大瓶颈往往不是模型,而是 文本块切得不对。分块策略直接决定:
以下是四种主流分块策略(按从简单到智能排序)。
① 固定字符数分块
逻辑最简单:按字数切块,如 500 字一个 chunk。
优点:
优化:规则分隔符 + 重叠区间(10%–20%)这样至少能保证上下文连续性不丢。
② 递归分块(Recursive Text Splitter)
更智能的切法:
核心优势:
适用于:专业文档、长文本问答、政策法规等。
③ 基于格式的分块
适用于有明显结构标记的内容,如:
优势:
④ 语义分块(Embedding 聚类)
最高级的策略:
优势:
适用于:→ 多轮对话意图提取→ 深层逻辑分析→ 高精度企业级知识库
Embedding 模型的作用不是生成答案,而是:把人类语言翻译成机器可计算的向量表达。
流程分为三步:
① 离线阶段:构建向量索引库
每个 chunk 会被转成一组固定维度向量(768/1024/1536 维)。存入向量数据库(FAISS / Milvus / Pinecone 等)。这一步相当于给每段文本分配一个“语义身份证”。
② 在线检索:用“语义钥匙”匹配“知识锁”
当用户提问时:
这里 Embedding 模型的稳定性和表达能力,直接决定召回是否精准。
③ 生成阶段:Embedding 的任务结束
top-k 的内容被原样送入大模型(LLM),由大模型完成:
Embedding 仅负责“找到正确的材料”,不负责最后的“写作”。
补充:国内 Embedding 模型现状
虽然开源界 bge-large-zh 讨论度最高,但在真正落地的企业系统里:
这些商业模型在行业内调用量远高于开源方案,但对个人开发者不可见。
(后续章节:检索/增强/生成 待补充……)
本文由 @cheninx 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。