惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
有赞技术团队
有赞技术团队
J
Java Code Geeks
H
Hackread – Cybersecurity News, Data Breaches, AI and More
美团技术团队
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Hugging Face - Blog
Hugging Face - Blog
人人都是产品经理
人人都是产品经理
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
C
Check Point Blog
博客园 - 【当耐特】
The GitHub Blog
The GitHub Blog
Recent Announcements
Recent Announcements
The Cloudflare Blog
Microsoft Azure Blog
Microsoft Azure Blog
腾讯CDC
Vercel News
Vercel News
IT之家
IT之家
MyScale Blog
MyScale Blog
博客园_首页
Martin Fowler
Martin Fowler
WordPress大学
WordPress大学
罗磊的独立博客

Mobility

从薅 token 到管 skill:我的 pks 工具落地实践 免费AI视频生成器:我如何用零成本做出带旁白字幕的多场景AI视频 Agnes免费模型真能白嫖视频?我改造了ViMax来试试 教你薅token(二):构建agent无关的skills管理工作流 教你薅token:构建agent无关的AI工作流 用 AI Agent 完成 Hexo 主题迁移:从 Next 到 Butterfly 的全自动化实践 Vercel封禁163邮箱后,我是怎么恢复博客的 用LLM管理安全开发规范:一次llm-wiki实践 Vaadin框架教程:Java工程师的前端开发秘籍 hexo多语言方案总结及最佳实践 知乎增强工具-评论时间精确到秒 怎么理解数据库的四个隔离级别 kubernetes是什么-实用向教程 怎么更科学的用知乎摸鱼 读书笔记《系统之美》,如何面对现实中的复杂问题 分布式系统设计中的通用方法 高并发解决方案很难吗?轻松聊清楚高并发设计 SSP,DSP,RTB,ADX都是什么? 讲讲互联网广告的概念与发展 从redolog,undolog到隔离级别,刨根问底,讲清楚事务和ACID java项目低学习成本使用kubernetes的实践经验 剧变中的2021-一个中年工程师的年终总结 kubernetes环境下做金丝雀发布的一种思路 prometheus教程: 一篇文章讲懂prometheus 实现一个简单的java版本高性能获取ip地址所属国家工具 iterm2配置ssh书签, 实现记住密码和自动登录 怎样做一个好的技术分享 云原生究竟是什么 读书笔记 稻盛和夫《干法》-思考应该怎样去工作 review的个人价值 户口?大厂?高薪?生活?聊聊应届程序员的职业选择
把笔记、微信读书、知乎装进 Obsidian:我基于llm-wiki知识中...
流沙 · 2026-06-26 · via Mobility

前段时间,偶然看到karpathy大神提出的llm-wiki, 有种相见恨晚的感觉。我一直是很喜欢写些东西的,但是写完之后,问题就是大量内容散落在各个地方,一直没有精力对它们进行有效的管理。而看到了llm-wiki后,我就意识到,之前写的那些东西,要开始发挥作用了。

首先, llm-wiki是什么。

llm-wiki 是 Andrej Karpathy 在 最近提出的一个概念:把你过往积累的所有文字材料——笔记、博客、读书摘录、工作日志——作为”语料库”,让 LLM 自动从中提取概念、建立页面、编织交叉引用,最终形成一个结构化的、可持续迭代的个人 Wiki。

它的核心前提很简单:每个人在日常工作和学习中已经产生了大量有结构、有见解的文字,只是它们散落在各处,缺乏关联。llm-wiki 要做的就是用一个 LLM 驱动的流程,把这些散落的珍珠串起来。你负责持续产生和收集内容,LLM 负责组织和管理。

和传统的手动 Wiki 维护不同——建页面、写摘要、加链接,枯燥且难以坚持——llm-wiki 把组织成本降到了几乎为零。你只需要告诉 LLM 你的知识库结构和维护规则(即一个 AGENTS.md 文件),它就能反复执行摄入、更新、审计等操作。我自己实践下来的感受是,看着 AI 把零散笔记变成结构化的交叉引用网络,有一种”债务清零”的快感。

我做的第一件事,就是把之前在notion里写的各种笔记,有开发知识、投资知识,还有各种各样零碎的记录,都导出然后放到了obsidian里。

如何将 Notion 内容导入 Obsidian?

实际操作并不复杂,核心步骤如下:

  1. 导出 Notion 数据:在 Notion 的”设置与成员 → 设置”中,选择”导出所有工作区内容”,格式选 Markdown & CSV。导出后会得到一个 ZIP 包,解压后每个 Notion 页面对应一个 .md 文件,数据库则额外附带 CSV。注意:Notion 免费版每次只能导出一个工作区,如果你有多个工作区,需要分别操作。

  2. 安装 Obsidian Importer 插件:在 Obsidian 社区插件市场搜索”Importer”并安装。这个插件支持从 Notion、Bear、Evernote、OneNote 等多种工具一键导入,会自动处理图片附件和内部链接。启用插件后,用 Cmd+P 打开命令面板,搜索”Importer: Open Importer”,选择 Notion 格式,选中刚才解压的文件夹即可。

  3. 手动导入(备选方案):如果不使用 Importer 插件,直接将解压后的文件夹放入 Obsidian vault 目录即可。Obsidian 原生支持 [[wiki-link]] 格式的内部链接,Notion 导出的 Markdown 中的链接通常已经转换为该格式。

  4. 后续处理:导入后建议将原始文件放入一个专门的子目录(比如 raw/notion-export/),标记为”不可修改”。这样保留了原始数据的完整性——这是 llm-wiki 方法论中很重要的一环:原始素材永不可改,LLM 在此基础上生成结构化知识。如果你的 Notion 中有数据库,CSV 文件可以作为参考保留;如果某些页面嵌入了 Notion 特有的 Block(如日历、看板),导出后这些会丢失交互性,但文本内容会保留。

整个流程走下来,我几千条分散的笔记就这样汇入了 Obsidian,成为了知识中枢的第一批”原料”。

然后将karpathy那篇gist喂给AI, 生成出项目的AGENTS.md文档,AI能够自然的写出llm-wiki所需的摄入、审计等操作。

接着就可以执行了。看着AI不停的生成wiki内容,把我之前的积累分类整理,还是非常舒适的。

再往后,我又做了几件事,就是把知乎的创作和微信读书的笔记也纳入进来。知乎上我写了上千篇回答,微信读书几年读了上百本书,除了笔记之外,这些也是我知识体系的重要组成部分。正好,差不多那段时间,微信读书发布了官方的skill, 我也就顺手用了起来。

如何将知乎创作同步到 Obsidian?

知乎没有提供官方的数据导出 API,这里我用 Playwright 做了浏览器自动化。

操作步骤

  1. 安装 Playwright:pip install playwright && playwright install chromium
  2. 首次运行脚本,在打开的 Chromium 浏览器中扫码或密码登录知乎
  3. 登录成功后脚本自动遍历个人主页,抓取所有回答、文章和想法
  4. 登录状态持久化保存到本地,后续通过 --reuse 参数静默执行,无需再次登录

特点:增量同步,每次只抓取新内容,已有文件不重复处理;按回答/文章/想法分类存放。

如何将微信读书笔记同步到 Obsidian?

微信读书开放了 Agent API Gateway,申请 API Key 后即可调用。

操作步骤

  1. 调用 /user/notebooks 接口获取有笔记的书籍列表
  2. 对每本新书,分别拉取划线和想法内容
  3. 按章节分组,输出为规范的 Markdown 文件

输出格式:书名和作者作为标题,每章划线以引用块形式列出(附带日期),笔记和想法附在对应原文下方。

特点:完全增量同步,脚本维护已同步书籍 ID 的状态文件,每次运行只处理新增的书籍。151 本书的笔记就这样悄无声息地流入了 Obsidian,成为了知识中枢最丰富的一批原料。

到此,内容层的准备基本就完成了。然后我又想,既然我大部分的知识和创作都在这儿了,是不是可以开始蒸馏我这个人了?

这块先搞了一版简单的,就是把拆分出一个和wiki类似的personal流程,也有ingest、lint等流程,区别就是wiki的重点是知识,而personal的重点是我这个人。

知识库 vs 人格蒸馏:两种不同的 AI 处理逻辑

这里有必要解释一下两者的区别——它们共享同一套原始素材,但目标和产出完全不同。

知识库(Wiki):回答”我知道什么”

从笔记、博客和读书摘录中提取客观知识,生成概念页面(如”分布式一致性”)、实体页面(如”Raft 算法”)、来源摘要页面(如”《数据密集型应用设计》读书笔记”),并在它们之间建立密集的交叉引用。目标是让知识变得可查询、可复用,像一个外部化的第二大脑。

人格蒸馏(Personal Model):回答”我是谁”

从创作和阅读中反向推导认知模式、表达风格和价值取向。例如,通过分析技术博客,可以归纳出”论点先行、案例驱动”的表达风格;通过分析知乎回答,可以发现”第一性原理还原”和”量化思维”等反复出现的认知特征。产出不是知识条目,而是一个人的认知图谱——擅长什么、怎么思考、看重什么。

两者的异同

维度 知识库 人格蒸馏
核心问题 我知道什么 我是谁
输入 笔记、博客、读书摘录 一切个人创作和阅读记录
产出 概念/实体/来源页面 + 交叉引用 领域深度/认知特征/表达风格/价值观
方向 向外看:结构化外部知识 向内看:建模个人认知
流程 摄入 → 查询 → Lint → 审计 摄入 → 查询 → Lint → 审计(同构)

两者在流程上高度相似,但一个是向外看,结构化和整理你拥有的知识;一个是向内看,蒸馏和建模你作为个体的认知特征。这种”一体两面”的设计,是我觉得整个系统最有意思的地方。

这块最近还在看网上的女娲等项目,想看看有没有更好的蒸馏人格的方法。

以上就是近期关于知识库的一些实录,有想法欢迎交流。