一个小型的网页抓取系统的架构设计

一个小型的网页抓取系统的架构设计

网页抓取服务是互联网中的常用服务，在搜索引擎中spider（网页抓取爬虫）是必需的核心服务。搜索引擎的衡量指标“多、快、准、新”四个指标中，多、快、新都是对spider的要求。搜索引擎公司比如google、baidu都维护者自己负责的spider系统。当然他们的系统很复杂，在这里我们介绍一个小型的网页抓取系统的架构，目标是快速的抓取某个或者几个指定的网站的数据，它的作用有很多，比如做竞品分析，还有其他不可告人的J。

下面这个小型的网页抓取系统，分成下面几个部分：

1）网页种子文件，这个里面配置要抓取的链接是我们抓取服务的起点；

2）链接池，链接的FIFO队列，种子的link会先入这个队列；

3）抓取线程，从链接池中获取链接，并下载网页生成的网页数据放到网页池；

4）网页池，网页的FIFO队列，抓取的网页都会进入到这个pool；

5）抽取线程是系统的核心，它负责根据配置的模板抽取网页中指定的链接与数据，将抽取到个格式化数据入到抽取线程，将抽取出来的新的链接放到链接库；

6）调度线程，负责链接的调度策略，将选择合适的链接放到链接池队列；

系统架构如下：

时间： 2024-08-25 13:45:38

一个小型的网页抓取系统的架构设计的相关文章

一淘搜索网页抓取系统的分析与实现（3）—scrapy+webkit &amp; mysql+django

图 scrapy+webkit: 如结构图③. scrapy不能实现对javascript的处理,所以须要webkit解决问题.开源的解决方式能够选择scrapinghub的scrapyjs或者功能更强大的splash. 关于scrapy+webkit的使用后期进行分析. scrapy+django: 如结构图④. django实现的配置界面主要是对抓取系统的管理和配置,包含:网站feed.页面模块抽取.报表系统的反馈等等. 请直接參考: [1]高速构建实时抓取集群 [2]淘宝摘星文章链接:h

淘搜索之网页抓取系统分析与实现（2）—redis + scrapy

1.scrapy+redis使用 (1)应用这里redis与scrapy一起,scrapy作为crawler,而redis作为scrapy的调度器.如架构图中的②所示.图1 架构图 (2)为什么选择redis redis作为调度器的实现仍然和其特性相关,可见<一淘搜索之网页抓取系统分析与实现(1)--redis使用>(http://blog.csdn.net/u012150179/article/details/38226711)中关于redis的分析. 2.redis实现scrapy sc

一个实用的C#网页抓取类代码分享

一个实用的C# 网页抓取类模拟蜘蛛,类中定义了超多的C#采集文章.网页抓取文章的基础技巧,下面分享代码: using System; using System.Data; using System.Configuration; using System.Net; using System.IO; using System.Text; using System.Collections.Generic; using System.Text.RegularExpressions; using Sys

一个极其简洁的Python网页抓取程序

paip. 混合编程的实现resin4 (自带Quercus ) 配置 php 环境 #---混合编程的类型 1.代码inline 方式 2.使用库/api 解析方式. #----配置resin 支持php resin4默认自动支持php.. 也能手动配置了.web.xml加php的servlet解析..参考Quercus让你的PHP开心在Servlet容器奔跑 #----配置 php.ini路线运行t.php,,看见 Configuration File (php.ini) Path =>

基于Casperjs的网页抓取技术【抓取豆瓣信息网络爬虫实战示例】

CasperJS is a navigation scripting & testing utility for the PhantomJS (WebKit) and SlimerJS (Gecko) headless browsers, written in Javascript. PhantomJS是基于WebKit内核的headless browser SlimerJS则是基于Gecko内核的headless browser Headless browser: 无界面显示的浏览器,可以用于

用Python进行网页抓取

引言从网页中提取信息的需求日益剧增,其重要性也越来越明显.每隔几周,我自己就想要到网页上提取一些信息.比如上周我们考虑建立一个有关各种数据科学在线课程的欢迎程度和意见的索引.我们不仅需要找出新的课程,还要抓取对课程的评论,对它们进行总结后建立一些衡量指标.这是一个问题或产品,其功效更多地取决于网页抓取和信息提取(数据集)的技术,而非以往我们使用的数据汇总技术. 网页信息提取的方式从网页中提取信息有一些方法.使用API可能被认为是从网站提取信息的最佳方法.几乎所有的大型网站,像Twitter.

网页抓取：PHP实现网页爬虫方式小结

来源:http://www.ido321.com/1158.html 抓取某一个网页中的内容,需要对DOM树进行解析,找到指定节点后,再抓取我们需要的内容,过程有点繁琐.LZ总结了几种常用的.易于实现的网页抓取方式,如果熟悉JQuery选择器,这几种框架会相当简单. 一.Ganon 项目地址: http://code.google.com/p/ganon/ 文档: http://code.google.com/p/ganon/w/list 测试:抓取我的网站首页所有class属性值是focus的

用python做网页抓取与解析入门笔记[zz]

(from http://chentingpc.me/article/?id=961) 事情的起因是,我做survey的时候搜到了这两本书:Computational Social Network Analysis和Computational Social Network,感觉都蛮不错的,想下载下来看看,但是点开网页发现这个只能分章节下载,晕,我可没时间一章一章下载,想起了迅雷的下载全部链接,试试看,果真可以把他们一网打尽,但是,sadly,迅雷下载的时候,文件名没办法跟章节名对应起来,晕,我可

网页抓取与处理的一些方法

昨天还是2014,今天就变成了2015.时间总是那么快,这篇文章就作为2015年的一个开始吧. 这篇文章主要介绍一些网页抓取及抓取下来的内容处理. 所需要的jar包点击打开链接,我放在百度云盘里.有需要的可以下载,其他的请自行下载. 百度百科对网页抓取的定义,当然本文并没有介绍的那么多,只是介绍对单个页面的抓取,和模拟提交表单抓取页面,如需深究,请自行baidu or google. 上面的方法直接返回String字符串,只需传入一个链接即可.相信大家都看的懂. 那么获取到的String字符串,

猜你喜欢

Java为什么只能单继承？

就是因为C++里多重继承功能强大但是容易出错,Java才给取消掉了.如果,A和B都继承于C,再写个D继承A和B.那么C里面有个方法,A和B继承过去后都进行了覆盖,那么D到底是该继承A里面的版本呢还是B ...

oracle数据库

一. 表空间,用户及授权 1. 创建表空间 Create tablespace waterboss Datafile 'c:\waterboss.dbf' Size 100m Autoextend o ...

IP设定、域名解析、

1.网络基础知识一台主机如果可以连接公网,比如访问www.baidu.com 那么这台主机必然会有 ipaddress GATEWAY dns ############ipaddress###### ...

站长故事：5000元葬送了我的行业网站梦

最近一直也读一些互联网创业分享类的文章,感慨良多,也由此想到自己的一个行业网站运营失败的情况,其实这个行业网站对我来说,也是互联网上的一次创业.经常听到女汉子们说这样一句话:"女人,谁也还 ...

《大话数据结构》--- 第六章树

树是n个结点的有限集.n = 0时称为空树.在任何一棵非空树中: (1)有且仅有一个特定的称为根(Root)的结点: (2)当n > 1时,其余节点可分为位数个互不相交的有限集,其中每一个集合本 ...

MySQL基本语句——增、删、查、改

1.数据库的创建.修改.删除创建: CREATE {DATABASE | SCHEMA} [IF NOT EXISTS] db_name [create_specification]: 例如: CR ...

jQuery选择器代码详解（五）——实例说明tokenize的解析过程

原创文章,转载请写明出处,多谢! 以下分析基于jQuery-1.10.2.js版本. 下面将以$("div:not(.class:contain('span')):eq(3)")为 ...

【Android】20.3 拍照和视频录制

分类:C#.Android.VS2015: 创建日期:2016-03-13 一.简介 Android提供的Camera有两个典型的版本,一个是在Android 5.0以前提供的,称为Camera:另一 ...

easyUI之datagrid

对于easyUI中的datagrid组件,继承自pannel...,因此有其自己的组件,还有继承过来的属性. 1.width:指定其宽度 2.title:指定标题 3.iconCls:指定图标.见上图 ...

iOS开发多线程篇—NSOperation简单介绍

iOS开发多线程篇—NSOperation简单介绍一.NSOperation简介 1.简单说明 NSOperation的作?:配合使用NSOperation和NSOperationQueue也能实现 ...

listview优化技术

1.在adapter中的getView方法中尽量少使用逻辑 2.尽最大可能避免GC(如果在) 3.滑动的时候不加载图片 4.将ListView的scrollingCache和animateCache设 ...

Windows核心编程01-Windows应用程序

Windows应用程序的类型 -控制台程序Console DOS程序,本身没有窗口,通过Windows DOS窗口执行 -窗口程序拥有自己的窗口,可以与用户交互 -库程序存放代码.数据的程序,执行 ...

fullpage.js jq全屏滚动插件

fullPage.js和fullPage都能实现全屏滚动,二者区别是:fullPage.js需依赖于JQuery库,而fullPage不需要依赖任何一个js库,可以单独使用. (代码演示效果并且可以下 ...

T-SQL查询进阶--变量

概述变量对于一种语言是必不可少的一部分,当然,对于T-SQL来讲也是一样.在简单查询中,往往很少用到变量,但无论对于复杂的查询或存储过程中,变量都是必不可少的一部分. 变量的种类在T-SQL中,变 ...

关于非二进制的补码与反码

关于名称补码应该叫Diminished Radix Complement,而反码则是Radix Complement.最常见的所谓1's complement与2's complement其实是是相 ...

BZOJ3040 最短路（堆优化dijkstra）

这题不是裸的最短路么?但是一看数据范围就傻了.点数10^6,边数10^7.这个spfa就别想了(本来spfa就是相当不靠谱的玩意),看来是要用堆优化dijkstra了.但是,平时写dijkstra时为 ...

HD2AV_F1

文档内容:研究1080P高清视频信号的视频图像格式以及需要转换的AV视频信号的图像格式时间节点:2014/12/12~2014/12/13 一. 视频格式描述 1. 标清数字视频标清 ...

累了上传几张以前处理的照片,刺激刺激视觉.

Fabric chaincode开发调试

由于chaincode开发调试步骤稍多,每次都要查看官方doc有些不便,且偶尔还会遇到官方doc无法访问的情况,故整理一份chaincode开发步骤(环境已经配置好的前提),自用还ok: 首先下载官方 ...

数据类操作之SharedPreferences(保存用户偏好参数)

(一)概述本节给大家介绍的是第二种存储用户数据的方式,使用SharedPreferences(保存用户偏好参数)保存数据, 当我们的应用想要保存用户的一些偏好参数,比如是否自动登陆,是否记住账号密码 ...

专题

随机推荐

© 2024 憋错料 | info#biecuoliao.com | 10 q. 0.022 s.