惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

U
Unit 42
F
Fortinet All Blogs
Martin Fowler
Martin Fowler
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
IT之家
IT之家
Blog — PlanetScale
Blog — PlanetScale
罗磊的独立博客
V
V2EX
Vercel News
Vercel News
Apple Machine Learning Research
Apple Machine Learning Research
J
Java Code Geeks
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
I
InfoQ
Engineering at Meta
Engineering at Meta
WordPress大学
WordPress大学
S
SegmentFault 最新的问题
H
Help Net Security
腾讯CDC
D
Docker
P
Proofpoint News Feed
GbyAI
GbyAI
博客园 - 三生石上(FineUI控件)
aimingoo的专栏
aimingoo的专栏

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
搜索策略产品经理必读系列—第五讲Page Rank算法
搜广推策略James · 2023-03-20 · via 人人都是产品经理

搜索引擎中最早网页搜索结果排序效果比较优的算法就是Google创始人提出的Page Rank算法,作为搜索领域的从业者必须要了解该经典算法的思想。本文结合实际案例一篇讲懂Page Rank算法的基本思想,同时还为大家介绍后续优化后的Page Rank算法。

一、基本假设

在正式介绍Page Rank算法前我们先通过实际生活中的一个案例入手。日常我们写论文时经常会引用别人的论文,某个行业里的经典论文会被大量的论文所引用。如果该论文恰好还被另外一篇经典论文所引用的话,则更加能够凸显出该篇论文的重要性和权威性,其实网页的重要性和权威性也是如此。

于是我们设定以下两大假设。

数量假设:当一个网页被其他网页链接的数量越多,入链数越大,则该网页越重要。

如上图所示,网站“WWW1”被众多网站引用,形成了链接,则说明网站“WWW1”很重要。

  • 质量假设:被高质量的网页链接时,说明被链接的网页质量也很高,权威性也很强。

如上图所示,网站“WWW8”被高质量网站“WWW1”引用,形成了链接,说明网站“WWW8”同样也很权威。PageRank算法的整体思想都是建立在上述假设上的。

二、Page Rank基本算法

基于以上两大假设,我们展开介绍Page Rank算法。首先我们将互联网想象为一个图网络,网络的每一个节点(Node)就是一个个独立的网页,如果两个网页之间存在超链接的关系,则它们两个之间存在一条有方向的边(Edge),每个节点向外链接的节点数被称为该节点的出度。

每个节点的Page Rank值(以下简称PR值)表示该节点的权威性。我们核心是构建一个用户在图网络中的游走模型,基于游走模型来进行PR值的更新迭代。

上面即为Page Rank算法的基本定义,首先节点 ν_1 的PR值是由链接到该节点的其他节点PR值决定的,假设链接节点是 ν_2、ν_3 。链接的其他节点越多则该节点的PR值越大,所以算法迭代使用累加 ∑ 。需要将节点 ν_2、ν_3 的PR值进行累加,此迭代思路对应着上述的“数量假设”。

链接的其他节点PR值越大,则该节点的PR值也越大,对应着上述的“质量假设”。同时 ν_2、ν_3 节点还链接其他节点,用户通过节点 ν_2、ν_3 跳转到节点 ν_1 的概率为 1/O(ν_j ) , O(ν_j ) 为节点 ν_j 的出度。节点 ν_2、ν_3 的PR值分别乘以 1/O(ν_2 )和1/O(ν_3 ) ,再进行累加即为节点 ν_1 的PR值。我们通过该方式不断迭代更新节点的PR值,直到最终整个网络里所有节点的PR值满足收敛条件。

三、具体案例

下面我们通过一个例子来详细介绍Page Rank算法的迭代过程。

初始时4个节点的PR值均为1/4。经过第一次迭代,我们得到了 R_1 =[3/8,5/24,5/24,5/24]^T 。我们可以将上述计算过程变成一个矩阵计算,通过矩阵化的表达,可以快速的计算得到PR值。

首先我们基于各个节点的出度构建一个转移概率矩阵 M ,节点A的出度为3,链接了B、C、D三个节点,我们认为节点A转移到B、C、D节点的概率均为1/3,以此类推我们可以得到一个转移概率矩阵 M 。那么PR的迭代公式就变为: M*R_t=R_(t+1) 。

如上所示 M*R_1=R_2 ,和我们最上方计算的结果完全一致。但是上述Page Rank基本算法应用时会存在以下两大问题:

问题一:很多网站并没有和其他网站建立任何的链接,出度为0。这类网站的出现会导致按照上述算法进行 R_i 迭代,最终所有节点的PR值归于零。

问题二:用户打开某一个网站后,即使该网站链接了其他网站,但是用户还是可能会随机打开其他网站,所以没有链接的其他网站转移概率不应该是0,系统可以设置一个随机概率。

四、Page Rank优化算法

基于Page Rank基本算法存在的两大问题上,科学家们又对Page Rank算法进行了优化,优化后的Page Rank算法可以适用于所有的网络结构,更加贴近于实际用户浏览行为。优化后的算法PR值更新迭代如下:

R_(t+1)=d*M*R_t+(1-d)*E/N

全新迭代公式的业务理解是:用户在浏览网页时有两种情况,第一种情况是以概率 d(0≤d≤1) 完全按照原本的转移概率矩阵进行游走,第二种情况是以概率(1- d )随机访问任何其他的节点,每个节点的链接概率都是1/N, E 是元素1填满的N*N矩阵。

d 又被成为阻尼因子, d 的取值一般由经验决定,正常在0.8-0.9之间。当 d 接近1时,用户随机游走主要依照转移概率矩阵 M 进行;当 d 接近0时,用户随机游走主要以等概率随机访问各个结点。

虽然目前搜索引擎的排序算法已经优化迭代了很多版本,但是Page Rank算法的核心思想仍然在被使用,也应用到了其他领域。Page Rank是从事搜索领域人士必须要了解的算法之一。

本文由 @King James 原创发布于人人都是产品经理。未经许可,禁止转载。

题图来自 Unsplash,基于 CC0 协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。