谷歌PageRank算法

1. 从Google网页排序到PageRank算法

(1)谷歌网页怎么排序?

  • 先对搜索关键词进行分词,如“技术社区”分词为“技术”和“社区”;
  • 根据建立的倒排索引返回同时包含分词后结果的网页;
  • 将返回的网页相关性(类似上篇文章所讲的文本相似度)网页,相关性越高排名越靠前

(2)怎么处理垃圾网页?
那么问题来了,假如有某个垃圾网页中虽然也包含大量的查询词,但却并非满足用户需要的文档,因此,页面本身的重要性在网页排序中也起着很重要的作用。
(3)如何度量网页本身的重要性?
实际上互联网上的每一篇HTML文档除了包含文本、图片、视频等信息外,还包含了大量的链接关系,利用这些链接关系,能够发现某些重要的网页,其中网页是节点,网页间的链接关系是边。

图片来自网络

如上图,某网页1链向网页2,则可以认为网页1觉得网页2有链接价值,是比较重要的网页。某网页被指向的次数越多,则它的重要性越高;越是重要的网页,所链接的网页的重要性也越高。
通过下图我们可以更形象地看出链向网页E的链接远远大于链向网页C的链接,但是网页C的重要性却大于网页E。这是因为网页C被网页B所链接,而网页B有很高的重要性。

图片来自网络

(4)PageRank核心思想
PageRank对网页的排序可以独立于用户搜索进行。如果一个网页被很多其它网页所链接,说明它受到普遍的承认和信赖,那么它的排名就高。这就是 Page Rank 的核心思想。当然 Google 的 Page Rank 算法实际上要复杂得多。比如说,对来自不同网页的链接对待不同,本身网页排名高的链接更可靠,于是给这些链接予较大的权重。
通俗理解,我们可以将互联网中的网页理解成我们现实中的每个人,人与人之间的联系就类似于网页与网页之间联系,一般人的社交影响力是跟其人脉的广度与人脉的质量有关,网页也同理,其重要性也跟网页的被链的数量与质量有关。
具体参考:PageRank算法讲解PageRank算法--从原理到实现

2 PageRank的python实现

2.1 需求

利用PageRank随机浏览模型求如下图个网页的PageRank值。

网页关系

即网页之间的关系如下表格:

链接源ID 链接目标 ID
1 2,3,4,5, 7
2 1
3 1,2
4 2,3,5
5 1,3,4,6
6 1,5
7 5

2.2 Python实现

"""
Created on Sun Jan  8 23:41:29 2017

@author: whenif
"""

import numpy as np
import networkx as nx
import matplotlib.pyplot as plt

def getGm(A):
    ‘‘‘
    功能:求状态转移概率矩阵Gm
    @A:网页链接图的邻接矩阵
    ‘‘‘
    Gm = []
    for i in range(len(A)):
        cnt = 0
        for j in range(len(A[i])):
         if A[i][j] != 0:
             cnt += 1
        tran_prob = 1/cnt#转移概率
        Gm_tmp = []
        for j in range(len(A[i])):
         Gm_tmp.append(tran_prob*A[i][j])
        Gm.append(Gm_tmp)
    Gm = np.transpose(Gm)
    return Gm

def getBaseLev(N):
    ‘‘‘
    功能:计算网页所获得的基本级别(1-P)*e/n
    @N:网页总个数
    ‘‘‘
    P = 0.85
    e = np.ones(N)
    R = [ [(1-P)*i*1/N] for i in e ]
    return R

def getPR(P,Gm,R,PR):
    ‘‘‘
    功能:获取PR值
    @P:加权系数,通常取 0.85 左右,按照超链接进行浏览的概率
    @Gm:状态转移概率矩阵
    @R:网页所获得的基本级别
    @PR:每个网页节点的PageRank值
    ‘‘‘
    #状态转移概率矩阵Gm与PR值相乘矩阵相乘
    Gm_PR = np.dot(Gm,PR)
    #矩阵乘以常数P
    P_Gm_PR = P*Gm_PR
    #矩阵相加
    new_PR = P_Gm_PR+R #PR=P*Gm‘PR+(1-d)*e/n PageRank算法的核心
    return new_PR

def res_vis(A,PR):
    ‘‘‘
    将计算出来的值进行可视化展示
    @A:网页链接图的邻接矩阵
    @PR:每个网页节点最终的PageRank值
    ‘‘‘
    #G=nx.Graph()构造的是无向图, G=nx.DiGraph()构造的是有向图
    #初始化有向图,节点数为7,edge(边)被创造的随机概率
    all_edges = []
    for i in range(7):
        for j in range(len(A)):
            if A[i][j]==1:
                all_edges.append([i+1,j+1])
    #(1)初始化有向图
    G = nx.DiGraph()
    #(2)添加节点
    G.add_nodes_from(range(1,len(A)))
    #(3)添加有向边
    G.add_edges_from(all_edges)
    #(4)添加PR值
    pr = {}
    for i in range(len(PR)):
        pr[i+1] = PR[i][0]
    # (5)画图
    layout = nx.spring_layout(G)
    plt.figure(1)
    nx.draw(G, pos=layout, node_size=[x * 6000 for x in pr.values()],
                                  node_color=‘m‘,with_labels=True)
    plt.show() 

def main():
    #初始化参数
    N = 7 #网页个数
    P = 0.85 #一个加权系数,通常取 0.85 左右,按照超链接进行浏览的概率
    #网页链接图的邻接矩阵,每一列表示一个网页的出度
    A =  np.array([[0,1,1,0,1,1,0],
                   [1,0,1,1,0,0,0],
                   [1,0,0,1,1,0,0],
                   [1,0,0,0,1,0,0],
                   [1,0,0,1,0,1,1],
                   [0,0,0,0,1,0,0],
                   [1,0,0,0,0,0,0]])
    A = np.transpose(A) #转置
    #初始化PR值为0
    new_PR = []
    for i in range(N):
        new_PR.append([0])
    count = 0#迭代计数器
    while True:
        PR = new_PR
        R = getBaseLev(N)
        Gm = getGm(A)
        new_PR = getPR(P,Gm,R,PR)
        count = count +1
        print("第 %s 轮迭代" % count)
        print(str(round(new_PR[0][0],5))
                +"\t" + str(round(new_PR[1][0],5))
                + "\t" + str(round(new_PR[2][0],5))
                + "\t" + str(round(new_PR[3][0],5))
                + "\t" + str(round(new_PR[4][0],5))
                + "\t" + str(round(new_PR[5][0],5))
                + "\t" + str(round(new_PR[6][0],5)))
        #设置迭代条件
        if (    round(PR[0][0],5)==round(new_PR[0][0],5)
            and round(PR[1][0],5)==round(new_PR[1][0],5)
            and round(PR[2][0],5)==round(new_PR[2][0],5)
            and round(PR[3][0],5)==round(new_PR[3][0],5)
            and round(PR[4][0],5)==round(new_PR[4][0],5)
            and round(PR[5][0],5)==round(new_PR[5][0],5)
            and round(PR[6][0],5)==round(new_PR[6][0],5)):
            break
    print("-------------------")
    print("PageRank值已计算完成")
    res_vis(A,new_PR)

if __name__ == ‘__main__‘:
    main()

2.3 结果与分析

(1)迭代结果

第 1 轮迭代
0.02143 0.02143 0.02143 0.02143 0.02143 0.02143 0.02143
第 2 轮迭代
0.06241 0.04025 0.0357  0.02963 0.05846 0.02598 0.02507
......
第 57 轮迭代
0.28026 0.15875 0.13887 0.10821 0.18418 0.06057 0.06907
第 58 轮迭代
0.28026 0.15875 0.13887 0.10821 0.18418 0.06057 0.06907
-------------------
PageRank值已计算完成

  

(2)可视化结果

网页关系可视化结果

其中圆圈编号表示网页ID,圆圈大小表示PR值大小,连线表示网页之间的关系,有带黑色箭头表示出度方向。
(3)结果汇总

名次 PageRank值 网页ID 发出链接ID 被链接ID
1 0.28026 1 2,3,4,5,7 2,3,5,6
2 0.18418 5 1,3,4,6 1,4,6,7
3 0.15875 2 1 1,3,4
4 0.13887 3 1,2 1,4,5
5 0.10821 4 2,3,5 1,5
6 0.06907 7 5 1
7 0.06057 6 1,5 5

(4)结果分析

  • 被链接个数越多其PageRank值越大,当被链接个数相同则发出链接个数越多其PageRank值越大;
  • ID=1的页面的PageRank值是0.28026,占据全体接近三分之一,成为了第1位。从可视化图与结果汇总表格可以看出,因为ID=1页面是链出链接和链入链接最多的页面,也可以理解它是最受欢迎的页面。
    同时需要注意的是在PageRank值排在第3位的ID=2页面,被3个链接所链接,而只有面向ID=1页面发出一个链接,因此(面向ID=1页面的)链接就得到ID=2的所有的PageRank值。

3 应用场景

在数据分析我们经常需要从用户的角度思考问题,如用户购买路径,用户之所以没产生购买,那么到底是在哪个环节出现了问题?基于用户还有许许多多的分析问题,如流失用户分析、流失用户预警、用户信用度分析等。
从基于用户的分析我们可以延伸到用户与信息、用户与商品、用户与用户之间的分析,当然这三点对号入座的便分别是BAT的基因所在,其中人与人之间的分析即是社交关系分析,这也是PageRank适合的领域之一。在不同行业的应用场景不用,如以下应用场景:

  • 微信、微博等应用的社交网络分析,可以实现基于用户的相似度的内容推荐、可以挖掘用户的价值、用户的社交影响力等;电商如京东等可利用用户关系,在一定程度上协助风险控制(抓刷单等)。
  • 在电信行业中利用交往圈数据可以得到用户的社交影响力,从而在一定程度上可以协助垃圾短信等的治理;
  • 文献重要性研究(引用与被引用)
  • ......

后记

数据分析与挖掘很多都是从人出发,逐渐延伸到人与人,甚至是人、人与人在时间与空间上的表现,其中人与人之间的关系可以说是很重要的一环,所以个人觉得PageRank还是有挺大的应用性,在工作中也是深有体会。当然文中只是举了简单的例子并实现,代码可优化的地方应该不少,望各路小伙伴一起交流一起进步。

作者:whenif
链接:http://www.jianshu.com/p/5657910d7df6

时间: 2024-08-26 09:16:24

谷歌PageRank算法的相关文章

PageRank算法和谷歌搜索讲解

吴裕雄 PageRank算法实际上就是Google使用它来计算每个网页价值的算法. Google每次的搜索结果都有成百上千万甚至上亿个相关的查询网页链接.如果将所有的查询结果不加区分,就立即显示给客户看的话,那么用户很有可能看到的就是一些没有多大用的东西,那么Google也就肯定会遭到淘汰的. 那么如何向用户显示对他们有用的网页链接呢?Google想出了一个办法--就是给那成百上千万个网页计算出一个值.这个值呢就叫做PageRank(页面价值得分).通过计算这个值呢,可以区分出每个网页价值有多高

pagerank算法

转自 http://blog.csdn.net/hguisu/article/details/7996185 1. PageRank算法概述 PageRank,即网页排名,又称网页级别.Google左侧排名或佩奇排名. 是Google创始人拉里·佩奇和谢尔盖·布林于1997年构建早期的搜索系统原型时提出的链接分析算法,自从Google在商业上获得空前的成功后,该算法也成为其他搜索引擎和学术界十分关注的计算模型.目前很多重要的链接分析算法都是在PageRank算法基础上衍生出来的.PageRank

【转】深入浅出PageRank算法

原文链接 http://segmentfault.com/a/1190000000711128 PageRank算法 PageRank算法是谷歌曾经独步天下的“倚天剑”,该算法由Larry Page和Sergey Brin在斯坦福大学读研时发明的, 论文点击下载: The PageRank Citation Ranking: Bringing Order to the Web. 本文首先通过一些参考文献引出问题,然后给出了PageRank的几种实现算法, 最后将其推广至在MapReduce框架下

Machine Learning:PageRank算法

1. PageRank算法概述 PageRank,即网页排名,又称网页级别.Google左側排名或佩奇排名.         在谷歌主导互联网搜索之前, 多数搜索引擎採用的排序方法, 是以被搜索词语在网页中的出现次数来决定排序--出现次数越多的网页排在越前面. 这个判据不能说毫无道理, 由于用户搜索一个词语. 通常表明对该词语感兴趣. 既然如此, 那该词语在网页中的出现次数越多, 就越有可能表示该网页是用户所须要的. 可惜的是, 这个貌似合理的方法实际上却行不大通. 由于依照这样的方法, 不论什

[转]PageRank算法

原文引自: 原文引自: http://blog.csdn.net/hguisu/article/details/7996185 感谢 1. PageRank算法概述 PageRank,即网页排名,又称网页级别.Google左侧排名或佩奇排名. 是Google创始人拉里·佩奇和谢尔盖·布林于1997年构建早期的搜索系统原型时提出的链接分析算法,自从Google在商业上获得空前的成功后,该算法也成为其他搜索引擎和学术界十分关注的计算模型.目前很多重要的链接分析算法都是在PageRank算法基础上衍生

基于Neo4j的个性化Pagerank算法文章推荐系统实践

新版的Neo4j图形算法库(algo)中增加了个性化Pagerank的支持,我一直想找个有意思的应用来验证一下此算法效果.最近我看Peter Lofgren的一篇论文<高效个性化Pagerank算法>(Efficient Algorithms for Personalized PageRank)(https://arxiv.org/pdf/1512.04633.pdf),在论文中,有一个比较有趣的示例: 我们想在论文引用网络中进行个性化搜索的尝试,但是要怎样设置个性化PageRank的参数,才

pagerank算法的MapReduce实现

pagerank是一种不容易被欺骗的计算Web网页重要性的工具,pagerank是一个函数,它对Web中(或者至少是抓取并发现其中连接关系的一部分web网页)的每个网页赋予一个实数值.他的意图在于,网页 的pagerank越高,那么它就越重要.并不存在一个固定的pagerank分配算法. 对于pagerank算法的推到我在这里不想做过多的解释,有兴趣的可以自己查看资料看看,这里我直接给出某个网页pagerank的求解公式: P(n)=a/G+(1-a)*求和(P(m)/C(m))     (m属

PageRank算法(python实现)

Python 实现的PageRank算法,纯粹使用python原生模块,没有使用numpy.scipy.这个程序实现还比较原始,可优化的地方较多. #-*- coding:utf-8 -*- import random N = 8 #八个网页 d = 0.85 #阻尼因子为0.85 delt = 0.00001 #迭代控制变量 #两个矩阵相乘 def matrix_multi(A,B): result = [[0]*len(B[0]) for i in range(len(A))] for i

PageRank算法原理及实现

PageRank算法原理介绍 PageRank算法是google的网页排序算法,在<The Top Ten Algorithms in Data Mining>一书中第6章有介绍.大致原理是用户搜索出的多个网页需要按照一定的重要程度(即后面讲的权重)排序,每个网页的权重由所有链接到它的其他网页的权重的加权和,加权系数为每个网页链出的网页数的倒数,也就是说每个网页的权重会平均分配到其链向的所有网页. 例如A链接到B和C,B链接到C,C链接到A,P(X)表示X的权重,如下图所示 则每个节点的权重关