惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
The Blog of Author Tim Ferriss
宝玉的分享
宝玉的分享
The Register - Security
The Register - Security
D
Docker
The Cloudflare Blog
A
About on SuperTechFans
Microsoft Security Blog
Microsoft Security Blog
Recent Announcements
Recent Announcements
月光博客
月光博客
B
Blog RSS Feed
博客园 - 【当耐特】
The GitHub Blog
The GitHub Blog
B
Blog
IT之家
IT之家
美团技术团队
Engineering at Meta
Engineering at Meta
C
Check Point Blog
云风的 BLOG
云风的 BLOG
Last Week in AI
Last Week in AI
G
Google Developers Blog
MongoDB | Blog
MongoDB | Blog
Microsoft Azure Blog
Microsoft Azure Blog
S
SegmentFault 最新的问题
V
V2EX
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Apple Machine Learning Research
Apple Machine Learning Research
U
Unit 42
H
Help Net Security
雷峰网
雷峰网
人人都是产品经理
人人都是产品经理
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
博客园 - Franky
PCI Perspectives
PCI Perspectives
J
Java Code Geeks
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
M
MIT News - Artificial intelligence
腾讯CDC
A
Arctic Wolf
C
CERT Recently Published Vulnerability Notes
量子位
C
CXSECURITY Database RSS Feed - CXSecurity.com
Latest news
Latest news
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
The Hacker News
The Hacker News
有赞技术团队
有赞技术团队
Schneier on Security
Schneier on Security
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派 万字剖析:千问App深度体验报告(2026) - 少数派 在2026年,如何真正防止别人抄袭你的作品 - 少数派 怎么用 50 块搭个 AI 语音助手?我踩了 3 天坑 - 少数派 YeeroAI:让 AI 对话真正成为知识管理的一部分 - 少数派 爬泰山 - 少数派 「旅图显影」 App 更新:这次,我们补上了一点「手感」 - 少数派 假期出门太折磨?我的 23 条经验帮你规划惬意旅行 - 少数派 工作流会变吗 - 少数派 Claude Opus 4.6 怎么用最省钱?我测了 5 种方案 - 少数派 GPT Image 2 让图文并茂不再稀罕 - 少数派 用户侧出发——什么是AI,我要不要学习? - 少数派 找片、转存、整理、播放一条龙!让你的付费网盘值回票价 - 少数派 欢迎试用!日课一问2.0插件 - 少数派 自己做的MDeditor,原本想购买 Typora 试了两次支付不成功,干脆自己做一个 - 少数派 vibe coding了一个 3MB 的小工具,让 ~/Downloads 彻底告别混乱 - 少数派 因为受不了 Mac 的风扇策略,我做了一个风扇控制工具 - 少数派 别只怪模型 - 少数派 Warp 终端的 AI 功能怎么用?我测了一周的体验 - 少数派 AI 写代码老是出 bug?这 5 个配置我后悔没早知道 - 少数派 「新玩意」苹果出相机可能就这样:Sigma BF + 45mm F2.8 DG Contemporary - 少数派 一个面向2030年的AI操作系统是什么样子的:浅谈cola这款有灵魂的Agent - 少数派 别只看写代码 - 少数派 每天解决10个问题,还是一口气攻坚解决400个? - 少数派 AI 交易机器人怎么搭?我用 Claude 跑了一周实盘 - 少数派 Maptoposter Online:把你爱的城市画成艺术海报 - 少数派 Function Calling 怎么用?我测了 3 个模型发现差距真大 - 少数派 Legend Talk:我做了个 AI 圆桌,让 160 位思想家围着你的问题转 - 少数派 如何找到自己的蓝方?在小县城寻找压力测试 - 少数派 语音输入与软件接口|2026年聊AI时,我们都聊些什么(上) - 少数派 混动已经卖爆,纯电又来补刀——钛7闪充版简直“不讲武德” - 少数派 本月玩什么|朋友收藏、识质存在、沙罗周期 - 少数派 为什么要每天坚持输出? - 少数派 Claude API 挂了好几个小时,你的项目有备用方案吗? - 少数派 Function Calling 没你想的复杂——我用它做了个有点用的工具 - 少数派 登录系统立即播放视频或者图片音乐的软件 - 少数派 我为什么创建 FlipHTML5 下载工具 - 少数派 残局没电?多品牌外设电量统一管理软件EasyBluetooth已支持RTSS游戏内显示以及AIDA64 - 少数派 前往通义路的路 - 少数派 太好看了,媲美Sun的个人导航页,NAS部署星云门户 - 少数派 乌黑嘴唇“一键检测”上线了 - 少数派 派早报:Claude AI 接入多个创意软件生态、FILCO 生产方接手品牌等 - 少数派 【更新】BearCLI、Claude 连接器与 MCP 服务器 - 少数派 记了上千条流水,还是看不懂财务?我做了一个让 AI 读懂账本的工作台 - 少数派 MINI R56 升级原厂 Sport 模式 - 少数派 新玩意 | 一棵柠檬树(仿真版) - 少数派 Momenta的“物理AI”野望,需迈过“含摩量”这道关 - 少数派 网页直接投屏控制手机!NAS一键部署PandaScrcpy,流畅丝滑可远程。 - 少数派 众测|邀你一同探索随身 AI 硬件入口 YoooClaw C·ONE - 少数派 2050大会:分享时间是真诚 参会记 - 少数派 iPad 赋能电影创作:国内首部宣纸手绘长片《燃比娃》的幕后故事 - 少数派 AI的审美:我用 8 个大模型给 100 张旅行照片打分 - 少数派 普通人如何破圈?去参加一个本地协会 - 少数派 把极空间的图标全换了,主题DIY全攻略打造你的专属NAS桌面 - 少数派 电子便签墙,帮你实现便签自由 - 少数派 我如何用三个 CLI 工具取代文档创建需求 - 少数派 原来真的有人可以玩一辈子 - 少数派 社区速递 139 | 派友热议三月买了啥、复古单反尼康 Df 体验 - 少数派 06 作品的赏析与评价 - 少数派 TDS REVIEW|索尼 WF-1000XM6 降噪真无线耳机体验 - 少数派 35.98万起售的第二代腾势D9,我看重的不是堆料,而是不凑合 - 少数派 鼠须管 Squirrel 皮肤配置指北 - 少数派 从watch ultra2换到redmi watch6 - 少数派 派早报:阿里巴巴发布视频生成模型 HappyHorse 1.0 等 - 少数派 别迷信1M - 少数派 家人们天塌了!网盘“大封杀”,多个渠道多条路,NAS部署PanHub - 少数派 AI与人勾心斗角!NAS一键部署AI狼人杀,假日休闲必备。 - 少数派 电商必备!Comfyui工作流批量生图插件,一次生成12张!支持Nano banana pro模型 - 少数派 Comfyui工作流配置Gpt-image-2模型教程,0.03/张 - 少数派 OpenClaw第三方APi怎么配置?可使用Gpt-image-2模型 - 少数派 会员社区话题精选 Ep. 103 - 少数派
搜索的又一挑战者:perplexity AI 体验量化对比 - 少数派
2024-05-07 · via 少数派

搜索引擎行业已经很长时间没有什么变化了。

2009 ~ 2023 年,Google 在全球范围桌面端搜索的年度平均市占率达 88.41%1 ,在移动端则是更为恐怖的 95.46%2 。作为对比,同样需要深厚技术积累的芯片行业在同一时期就要精彩得多:Zen 架构让 AMD 市占率从不足 20% 到近年持续高于 30%3 ,高通更是从 C 端寂寂无名到现在可以说是家喻户晓。

除 Google 之外的其他搜索引擎,在不足 10% 的份额里苦苦挣扎

综合各类终端来看,2009 ~ 2023 年间只有 1 年 Google 的全球市占率低于 90%,其他值得一提的搜索引擎,或许是在某些地区凭借本土化壁垒成为地头蛇(例如 Yahoo!、Baidu、Yandex、Naver),或许是靠独特的卖点杀出一条血路(例如 DuckDuckGo),但终究是难以撼动 Google 搜索在全球范围的统治地位。

2022 年 11 月底公开的 ChatGPT 让 GPT 类大语言模型彻底摆脱狗屁不通生成器的印象,实现了可用性上的质变。OpenAI 选择了聊天机器人这种公众较易上手的产品形态来试水,但实际上任何涉及文本的产品或服务都有整合大语言模型的可能,搜索显然是其中之一。

行业内的从业者自然更早就察觉到了这次技术突破及其潜在的商业价值,不乏对此有想法的人提早行动,perplexity AI 的创始团队便是一例。perplexity AI 成立于 2022 年 8 月,创始团队的前司包括 OpenAI、Meta、Quora、Databricks。其核心产品形态是搜索,非登录状态下返回 5 条 URL,并基于 GPT-3.5 + 自己的模型对 URL 内容进行处理并输出摘要。

perplexity AI 搜索效果一例

在将 perplexity AI 作为我的浏览器默认搜索引擎使用超过 1 个月之后,我决定保留这个设置,让它成为我日常的一部分。它实实在在地提升了我的搜索体验,也让我好奇除了一个又一个截图,还有什么其他方法可以对比及呈现不同搜索引擎的质量差异。受一篇利用大语言模型评价文本质量的预印本4启发,我尝试用大语言模型对搜索引擎的效果及质量进行评价,获得了一些还算有点意思的结果。

量化对比搜索引擎用户体验的尝试

简单来说,我先后分别在 perplexity AI(非登录状态)、DuckDuckGo、Google、CN Bing 输入了 40 组关键词,将搜索引擎返回的结果首页截图,将截图上传至 Poe 上的 Claude-3-Opus 进行分析,让它输出对搜索结果质量的评分(0分最差,10分最好),基于这些评分进行统计分析。

本次用户体验量化尝试使用的搜索关键词

搜索引擎以及场景/关键词的选择全部基于我日常的使用习惯。至于为什么选择截图而非直接将 URL 喂给大语言模型,有两个原因:一是大语言模型访问 URL 数量多了之后容易触发搜索引擎的人机验证,我没有能力也无意对此进行突破;二是截图可以对搜索引擎当时返回的结果进行留存,如果想使用其他大语言模型进行质量评价时可以保证输入的一致性,避免不同大语言模型访问同一条 URL 获取不同的搜索结果。

对搜索质量的量化使用了更贴近用户直观搜索体验的3个指标,简要解析如下:

  • 相关性:搜索结果与搜索输入内容的关联度
  • 丰富度:搜索结果来源网站性质的差异程度
  • 可靠度:搜索结果来源网站的可信程度(对于 perplexity AI 同样适用,并非针对其摘要文本与来源网站内容的一致性或摘要是否出现幻觉进行评价)
让我有些意外的统计结果

分析结果显示,perplexity AI 与其他 3 个传统搜索引擎在相关性方面的表现没有什么差别,大家返回的搜索结果和搜索输入的相关性都颇高,即使有一两组关键词可能表现不佳,但总体而言基本不会搜出来毫不相关的内容。

丰富度方面,perplexity AI 和 DuckDuckGo、Google 的得分类似,都要明显高于 CN Bing。CN Bing 可能输得有点冤,但在我的日常使用习惯下,它的表现可能确实如此。不难看出,即使返回 URL 的绝对数量少,perplexity AI 在搜索结果的丰富度上并不逊于搜索巨擘 Google 或者近年已经打出一片天地的 DuckDuckGo。

让我有点惊讶的是可靠度的结果,perplexity AI 在可靠度上的表现竟然是最好的,明显比 CN Bing 要好,甚至比 Google 和 DuckDuckGo 也要更好。这其实有点反直觉,因为我在使用 perplexity AI 的过程中看到过摘要部分内容存在很明显的幻觉,如果从这个角度来看,perplexity AI 的可靠度存疑。后来我仔细查看了大语言模型对搜索结果截图评价的输出,其中“可靠度”相关的描述大多类似“主要结果来自知名网站、百科,但影评等主观性内容会一定程度影响可靠性”,明白了大语言模型对这项指标的评价是针对搜索引擎返回的网站可靠性,前面提到的想法与量化结果的相悖也就可以理解了。

都是幻觉?还是来谈谈感受吧

促使我写这篇文章的动力,是 4 月中旬我在 qBittorrent 里看到一个没见过的客户端,彼时我已经将 perplexity AI 设为了浏览器默认搜索引擎,于是在浏览器地址栏输入了客户端名,按下回车。

虽然点进第一个 GitHub 页面后发现了摘要中的错误,但摘要仍然堪用

这是我第一次体验到在搜索引擎输入内容、点击回车、然后直接获得了我想要的信息,我希望进一步了解更多的时候,再点击页面上的 URL 详细阅读网页内容。与传统搜索引擎“在结果中找有用的信息”相比,perplexity AI 确实在一定程度上更靠近“让有用的信息找人”这个期望。虽然目前 perplexity AI 提供的摘要仍然存在幻觉,但我觉得这是技术进步可以缓解的问题,洗澡水和婴儿的谚语相信大家都很熟悉。

其实无论是上一部分的对比评价,还是上图的例子,都还是以过往搜索输入习惯来使用 perplexity AI 的情况,如果把“关键词(组)”改为成句的自然语言输入,我相信 perplexity AI 的搜索效果能够更上一层楼。

目前我使用搜索引擎的优先级是 perplexity AI > DuckDuckGo > Google > CN Bing, perplexity AI 的使用率大概是 60%,还是有不少时候需要其他搜索引擎提供更多 URL 以便自己探索挖掘,尤其是并未纳入本次量化评价的“学术搜索”场景,非登录状态下的 5 条 URL 对于学术话题搜索而言还是太少了。看到有消息提及 OpenAI 也会推出自己的搜索服务,这让我对这种服务形态更有信心。尽管 perplexity AI 还不够完美,但不妨碍它继续作为我浏览器的默认搜索引擎,让大语言模型加入我信息搜索的流程。

附录:搜索引擎效果量化评价方法细则
以下方法肯定可以通过编程进行自动化,为什么没有这么做?因为我不会...

  1. 打开 Firefox (125.0.2, 64 bit) Private browsing 模式,输入搜索引擎1主页网址
  2. 在搜索引擎搜索框输入“关键词1”,点击回车
  3. 使用 Windows 自带截图功能截取浏览器页面所有内容(包含 tab 栏、地址栏)
  4. 在搜索引擎搜索框输入“关键词2”
  5. 重复步骤 2-4,直至获得搜索引擎1对应 40 个关键词的搜索结果截图
  6. 关闭浏览器
  7. 重复步骤 1-6,直至获得 4 个搜索引擎分别对应 40 个关键词的搜索结果截图
  8. 获得 160 个截图
  9. 在 Poe 中新建一个 Claude-3-Opus 对话,上传同一个搜索引擎对应的多张截图,搭配以下 Prompt:请提取图片的内容,并基于此输出:
    a. 搜索输入的是什么
    b. 搜索引擎是什么
    c. 对搜索输出结果与搜索输入的相关性进行评分,0表示很差,10表示很好
    d. 对搜索输出结果的丰富程度进行评分,0表示很差,10表示很好
    e. 对搜索输出结果的可靠程度进行评分,0表示很差,10表示很好
    f. 将评分结果用4列的表格形式展示,第1列为“搜索输入”,第2列为“相关性”,第3列为“丰富程度”,第4列为“可靠程度”
  10. 如果大语言模型对“搜索输入”识别错误,则进行校正,重新获取评分
  11. 获得同一个搜索引擎对应的 40 个截图的评分,将评分转移至 Excel
  12. 重复步骤 9-11,直至获得一个含有 160 个截图对应评分的 Excel 文件