惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

M
MIT News - Artificial intelligence
罗磊的独立博客
Hugging Face - Blog
Hugging Face - Blog
J
Java Code Geeks
G
Google Developers Blog
美团技术团队
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
腾讯CDC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
The Blog of Author Tim Ferriss
月光博客
月光博客
B
Blog
WordPress大学
WordPress大学
云风的 BLOG
云风的 BLOG
博客园_首页
人人都是产品经理
人人都是产品经理
aimingoo的专栏
aimingoo的专栏
Y
Y Combinator Blog
Jina AI
Jina AI
S
SegmentFault 最新的问题
H
Help Net Security
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
Google DeepMind News
Google DeepMind News

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
卡片笔记的 Embedding 向量可视化实验 - 少数派
2025-10-12 · via 少数派

Matrix 首页推荐 

Matrix 是少数派的写作社区,我们主张分享真实的产品体验,有实用价值的经验与思考。我们会不定期挑选 Matrix 最优质的文章,展示来自用户的最真实的体验和观点。 

文章代表作者个人观点,少数派仅对标题和排版略作修改。


我们知道大模型为了实现文档 / 笔记的 AI 搜索(也就是自然语言搜索),需要把各个文档 / 笔记的文本做向量化 Embedding,得到一个个高维的向量来表示这些笔记,再在上层运用相似度检索或者 RAG 等技术。

而 Embedding 把笔记的文字转成向量的过程中,是需要保持语义接近的文字在向量空间下也是接近的;但是一般的模型转出来的 Embedding 向量都是上千维的,除了程序能读懂,对人来说就是一串冷冷冰冰的数字序列。

然而机器学习领域有一个非常成熟的技术,叫 t-SNE 算法,它是一种用于将高维数据可视化为低维空间(通常是 2 维或 3 维)的技术。 并且可以保证在低维空间中保持高维空间中数据点之间的局部相似性(说人话就是高维空间里面靠近的点在低维空间中也是靠近的);很多论文为了演示各种 Embedding 算法的效果,在展示的时候都是用这个处理成 2 维坐标点的。

而我给自己搭建的一个卡片笔记的应用(cflow)因为需要支持 AI,所以所有笔记本身就有 Embedding 的结果;所以有一天突发奇想,想在二维坐标上画一下我这 3000+ 则笔记,本来是作为一个趣味性功能的,但实现后却不亦乐乎的玩了一晚上~(可能跟这些笔记都是自己一个字一个字写下来的有关)

简要功能介绍

先介绍一下简要的功能:

打开就是显示所有笔记的 Embedding 向量在 t-SNE 计算后的坐标点,支持的交互包括:

  • 点击一个点后,下面显示笔记内容,图上也会通过绿线和蓝线连接显示它引用和被引用的笔记对应的点(也就是双链);
  • 上面第一个输入框可以搜索笔记,并且搜索出来的笔记都会红点高亮(应用内置支持各种搜索宏,可以进行精细化的搜索)。如果点击笔记正文里面的标签,也可以实现快速搜索这个标签的所有笔记。
  • 第二个输入框是可以输入一则新的文字,然后看一下它是在坐标里面的哪个位置(蓝色的点)。

体验效果

最开始我就是在图上找感兴趣的点,点击一下看是哪一则笔记,而且好奇和它有引用关系的笔记的位置在哪里,是远的还是近的;这个「随机复习」倒也是一种挺有意思的体验。

最开始关注的是最外圈一些离群点,这些往往都是当时突发奇想写下的一些闪念,是一些写过后再也没有相关的笔记,比如吐槽评价工作上的某个需求;通过这个,一下子就能找到真正的「孤儿笔记」。

搜索笔记

接来下开始关心那些明显成团的笔记,比如我和老婆下馆子的时候,如果觉得下次还会来,我会写一下对这个饭店的菜品的评价,给下次做参考(真不要以为自己记得住,吃过多次这个亏),这些笔记之间本身没有直接关联,都是描述不同菜品味道和价格的,但是通过算法,他们被聚到了一团,很有意思。

如果我再随手写一段描述,算出来的点也是在附近。

另外我每个月也会写一条叫做「成果清单」的笔记,记录我上个月的一些成果,作为对自己的鼓励,这些笔记之间也是没有关联的,而且内容也不尽相同,但是大部分都被聚成一团了。

上图中仅有的两个离群的点,是我在思考「成果清单」对我的作用的笔记,并不是真正的成果清单本身,所以离群也很合理。

体验了多次按标签粒度来搜索,看看他们在坐标上是怎么表现的;看到基本都聚成团了,说明 Embedding 算法和 t-SNE 模型都是有效的。

而且像上面的 AI,知识管理两团都靠得比较近,说明我知识管理相关的思考的笔记总是多多少少会和 AI 相关;然后我就会继续搜索,比如 #AI 的点在这里,我就好奇 #CODING 相关的笔记都在哪里(发现也在距离 #AI 不远处)。

慢慢地研究一个领域的笔记的点的「邻国」是哪些,一个领域是如何慢慢的「蔓延」到另一个领域的;这一顿研究,就会发现很多「情理之中」的现象,比如 #习惯 和 #上瘾,#逆向思维和 #独立思考 这些笔记就会很近。

但是!也有一些标签被分成了隔得很远的两团,比如 #投资。

仔细看一下两团的笔记,发现左边中间那一团是一些投资理解的笔记,而右下角那一团是我自己开发的一个量化交易框架的笔记,只是一个二级标签挂在了 #投资 这个一级标签下;这就让我不禁思考,这两部分可能确实是不同的领域的东西,标签也打的不太合理。

#投资 的笔记还有一些零散在各个地方的点我也仔细看了一下,也比较合理,因为都是在记录其他领域的笔记的时候(比如心理学,复盘等),想到可以用于投资,随口提了一嘴而已。

再然后,就开始研究那些笔记双链带来的连线了,大部分笔记引用的都是和它比较近的卡片。

但也有不少一下子跨得很远的,这时候我就会细细读一下这些「跨域」的笔记是怎么回事,这部分个人读下来,感觉比那些近的连线更有意思。

探索笔记

接下来就是体验输入一段新的文字,看看它的向量落在哪些笔记附近,这个本质就是低维版本的 AI 搜索(质量肯定低于高维空间下搜索),但是这种可视化的交互的搜索体验,在不忙的时候,当做「玩具」玩玩也是可以的。

还是上面那个成果清单的例子,如果我假装写一个新的成果清单的笔记,但是内容其实不是一个成果,就会发现其实它和「成果清单」离得很远。

但是如果我稍加修改,变成一个看起来像成果的,就里面回到成果清单笔记的团簇里面了。

再举个例子,「爬了华山」是一个成果,而「这是华山」则不是!

但是如果抛开「成果清单」这个背景而言,「好东西」和「吃了好东西」语义上是比较接近的!这句是语义理解的魅力~

「这是华山」和「爬了华山」也是很接近的笔记内容:

其他作用

而且还有一些有趣的玩法,比如我在上一篇文章里面介绍过,cflow 可以为卡片单独创建空间,我建了两个具备 AI 自动化的空间(填写 URL 后保存笔记,AI 会自动按配置的格式和 Prompt 总结内容更新笔记),一个是收藏夹,一个是稍后阅读。

  • 对于收藏夹,一下子就发现了自己收藏的哪个领域的内容比较多;
  • 对于稍后阅读空间,AI 整理完是把卡片变成了一个待办项,通过搜索语法高亮未读的条目,那些和已读条目靠得非常近的,可能就可以不用再读了~

感悟

这个工具体验完,让我震惊的还是:Embedding 真的是机器学习领域顶级的发明。

试想一下,对一个完全不懂机器学习的人说,我有一个魔法,可以把一段话,不定长的若干个字符,经过一个固定的极其精密的数学函数计算,得到一个向量,就可以实现语义相近的文字的向量在高维空间中的距离是很近的。

但是这还不够直观,这个向量通过另一个数学函数计算,可以变成一个二维的坐标点,而那些语义上接进,可能完全没有用到任何相同字符的文字,经过这么一波计算,居然在坐标轴上变成一堆距离很近的点!

> 下载少数派 客户端、关注 少数派公众号,了解更多的新玩意 🆒

> 特惠、好用的硬件产品,尽在 少数派 sspai 官方店铺 🛒