惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

SecWiki News
SecWiki News
阮一峰的网络日志
阮一峰的网络日志
WordPress大学
WordPress大学
Stack Overflow Blog
Stack Overflow Blog
Google DeepMind News
Google DeepMind News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
Tailwind CSS Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
The Last Watchdog
The Last Watchdog
S
Securelist
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
Tor Project blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
H
Help Net Security
Attack and Defense Labs
Attack and Defense Labs
O
OpenAI News
博客园 - 聂微东
Y
Y Combinator Blog
N
News | PayPal Newsroom
IT之家
IT之家
C
Cybersecurity and Infrastructure Security Agency CISA
Engineering at Meta
Engineering at Meta
L
LangChain Blog
L
Lohrmann on Cybersecurity
Recent Commits to openclaw:main
Recent Commits to openclaw:main
有赞技术团队
有赞技术团队
Hugging Face - Blog
Hugging Face - Blog
C
CERT Recently Published Vulnerability Notes
爱范儿
爱范儿
P
Palo Alto Networks Blog
T
Threat Research - Cisco Blogs
N
News and Events Feed by Topic
G
Google Developers Blog
PCI Perspectives
PCI Perspectives
The Register - Security
The Register - Security
H
Heimdal Security Blog
V
Visual Studio Blog
F
Fortinet All Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Jina AI
Jina AI
TaoSecurity Blog
TaoSecurity Blog
博客园 - Franky
T
The Blog of Author Tim Ferriss
AI
AI
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
博客园 - 叶小钗
The Hacker News
The Hacker News
U
Unit 42
Security Latest
Security Latest
The GitHub Blog
The GitHub Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
RAG原理完全教程(对照图书馆版)
打不死的信心 · 2026-06-24 · via 博客园_首页

这是一个面向普通人的RAG教程。你不需要懂机器学习,也不需要懂数学,只要能理解图书馆,就能理解RAG。


第一章 什么是RAG

RAG全称:

Retrieval-Augmented Generation
检索增强生成

核心思想:

先找资料
再回答问题

而不是:

直接靠模型记忆回答

例如:

用户:

盗窃多少钱判刑?

RAG:

先查刑法库
↓
找到相关条文
↓
交给Qwen
↓
生成答案

第二章 图书馆角色对照表

RAG组件 图书馆角色 职责
原始文档 图书 知识来源
Chunk切分器 拆书员 把书拆成知识卡片
Chunk 知识卡片 最小知识单位
Embedding 分类专家 理解内容并确定语义位置
向量(Vector) 地图坐标 知识卡片的位置
FAISS 馆藏索引系统 根据位置找书
Query 用户借书需求 用户的问题
Q向量 用户当前位置 用户需求在地图上的位置
Similarity Search 测距系统 计算距离
TopK 第一轮候选书 最接近的50本
Reranker 资深馆员 重新排序
Context 顾问桌面 能放下的资料
Qwen/LLM 专家顾问 阅读资料并回答
Prompt 工作制度 规定顾问如何工作

第三章 入库流程(向量化流程)

这是正向流程。

即:

文档
↓
知识库

第一步 拆书

一本书:

中华人民共和国刑法

50万字。

不能直接处理。

于是:

拆书员

开始工作。


拆成:

Chunk1
盗窃罪

Chunk2
诈骗罪

Chunk3
故意伤害罪

Chunk4
抢劫罪

得到:

知识卡片

第二步 Embedding

分类专家开始工作。

读取:

Chunk1

盗窃公私财物,
数额较大的...

Embedding理解:

这是盗窃罪相关

然后生成:

C1

[0.23,-0.81,0.55,...]

这不是答案。

这是:

语义坐标

继续:

Chunk2

诈骗罪

C2

[0.31,-0.66,0.42,...]

所有Chunk都完成。


第三步 保存到FAISS

FAISS保存:

向量
↓
Chunk

例如:

C1
↓
Chunk1

C2
↓
Chunk2

C3
↓
Chunk3

图书馆理解:

坐标
↓
书架位置

例如:

法律区A
第3层
第15本

至此:

知识库建立完成

第四章 什么是Embedding

很多人误解:

Embedding
=
压缩工具

错误。


Embedding真正作用:

理解语义
建立坐标

例如:

偷手机

窃取手机

非法占有他人手机

Embedding会认为:

意思接近

于是坐标靠近。


这才是Embedding最重要的能力。


第五章 查询流程(RAG回答流程)

这是反向流程。

即:

用户问题
↓
答案

第一步 用户提问

用户:

偷手机判几年?

第二步 Embedding生成Q

Embedding再次工作。

注意:

这次不是处理Chunk。

而是处理问题。


问题:

偷手机判几年?

Q

[0.25,-0.80,0.57,...]

这个Q叫:

Query Vector
问题向量

图书馆理解:

用户站在地图上的位置

第三步 FAISS检索

FAISS收到:

Q

开始测距。


例如:

Q ↔ C1 = 0.95

Q ↔ C2 = 0.91

Q ↔ C3 = 0.42

Q ↔ C4 = 0.01

得到:

Top50

图书馆理解:

最接近的50本书

第四步 Reranker

Reranker开始工作。


FAISS返回:

盗窃罪量刑

盗窃罪历史沿革

盗窃罪立案标准

诈骗罪量刑

Reranker发现:

用户问:

判几年

重点应该是:

量刑

于是重新排序:

1 盗窃罪量刑

2 司法解释

3 立案标准

4 历史沿革

得到:

Top8

图书馆理解:

最值得给顾问看的8本书

第五步 Qwen回答

Qwen终于开始工作。

看到:

刑法264条

司法解释

量刑标准

然后总结:

根据刑法264条...

生成最终答案。


第六章 FAISS到底干什么

很多人误解:

FAISS懂法律

错误。


FAISS实际上只懂:

向量

它不知道:

盗窃罪

诈骗罪

Python

是什么意思。


它只知道:

Q

离谁最近

因此:

FAISS
=
仓库管理员

第七章 为什么知识明明在库里却回答不出来

这是RAG最常见问题。


情况1

Embedding理解错问题

例如:

偷手机

没有定位到:

盗窃罪区域

结果:

Q偏了

情况2

FAISS召回失败

正确Chunk没进Top50。


情况3

Reranker排序失败

正确答案排第35名。

最终只保留前8名。


情况4

Qwen理解失败

资料已经给了。

但模型能力不足。


第八章 谁最重要

很多人认为:

Qwen最重要

其实不一定。


法律库、技术文档库、企业知识库:

大约可以理解为:

Chunk切分
≈ 30%

Embedding
≈ 30%

Reranker
≈ 20%

LLM
≈ 20%

所以:

找不到资料

通常不是Qwen的问题。

而是:

Chunk

Embedding

FAISS

Reranker

中的某一步出了问题。


最终一句话总结

RAG其实就是一个图书馆:

拆书员
↓
把书拆成知识卡片

Embedding分类专家
↓
给知识卡片建立语义地图

FAISS管理员
↓
根据用户位置找附近的书

Reranker资深馆员
↓
从候选书中挑最相关的

Qwen专家顾问
↓
阅读这些书并回答用户

理解了这套图书馆模型,你就理解了90%以上的RAG工作原理。

以后遇到:

知识明明在库里
为什么答不出来?

不要先怀疑Qwen。

先检查:

问题
↓
Q向量
↓
FAISS Top50
↓
Reranker Top8

看看正确的那本书,究竟是在什么地方被弄丢了。