爬虫其实很简单！——网络爬虫快速实现(一)

今天我来带领大家一起学习编写一个网络爬虫！其实爬虫很简单，没有想象中那么难，也许所有学问都是这样，恐惧源自于无知。废话不多说，现在开始我们的爬虫之旅吧。

爬虫是什么？

我们时常听说编程大牛嘴边一直念叨着“网络爬虫“，那网络爬虫究竟是何方神圣呢？

网络爬虫能够模仿用户浏览网页，并将所想要的页面中的信息保存下来。有些同学不禁要问：“我自己浏览网页，可以手动将数据保存下来啊，为何要写个程序去爬取数据呢？“道理其实很简单，程序能够在短时间内访问成千上万的页面，并且在短时间内将海量数据保存下来，这速度可远远超越了人工手动浏览网页的速度。

爬虫的原理

爬取网页的过程大致分成两个步骤：

爬取网页html文件

爬虫的第一步就是要模拟用户浏览网页，获取需要访问的页面。

模拟用户浏览网页的方法很简单，使用Java类库中的URLConnection类即可，这个类可以发送HTTP请求，并返回请求页的二进制数据，我们只需将返回的二进制数据转换成String类型，这些数据就是请求页的HTML文本！

//设置需要爬取页面的URL
URL url = new URL("http://www.baidu.com");
//建立连接，获取URLConnection对象
        URLConnection connection = url.openConnection();
//将URLConnection对象转换成HttpURLConnection对象
        HttpURLConnection httpConnection = (HttpURLConnection) connection;
        httpConnection.setDoOutput(true);
//获取输出流
        OutputStreamWriter out = new OutputStreamWriter(httpConnection.getOutputStream(), "8859_1");
//刷新输出流，然后关闭流
        out.flush();
        out.close();
        //一旦发送成功，用以下方法就可以得到服务器的回应：
        String sCurrentLine = "";
        String sTotalString = "";
//ResponseCode＝＝200表示请求发送成功！      if(httpConnection.getResponseCode()==200){
//获取服务器返回的输入流
            InputStream l_urlStream = httpConnection.getInputStream();
            BufferedReader l_reader = new BufferedReader(new InputStreamReader(l_urlStream));
            while ((sCurrentLine = l_reader.readLine()) != null) {
                sTotalString += sCurrentLine + "\r\n";
            }
            System.out.println(sTotalString);
            return true;
        }

分析html文件，抽取其中需要的数据

当我们获取到请求页的HTML文本之后就需要在一堆HTML标签中将我们所需要的数据抽取出来。这里给大家提供一个很好用的抽取HTML数据的第三方Jar包：Jsoup！

Jsoup提供了getElementById()、getElementById()等方法，我们能够很方便地将指定标签中的数据抽取出来。除此之外，为了方便实现网络爬虫，Jsoup中已经集成了发送HTTP请求的函数，而且将整个发送请求的过程极度地简化，只需两步就能完成，无需再使用HttpConnection类库在发送HTTP请求前进行一系列复杂的设置，并且Jsoup中返回的就是HTML文本，无需再进行二进制转换成HTML文本的操作。代码如下：

//通过Jsoup获取HTML文本
Document doc = Jsoup.connect("http://10.20.100.5:8080/").get();
//获取HTML中所有的tbody标签
        Elements tbodys = doc.getElementsByTag("tbody");
//获取tbody标签中所有的td标签
        Elements tds = tbodys.get(1).getElementsByTag("td");
//获取td中的文本
        tds.get(0).html();

看完这些相信大家对于网络爬虫已经入门了，能够实现一个最简单的爬虫程序，接下来我会带领大家一步步深入，实现一个更加智能、功能更加强大的爬虫！

如果各位还有什么问题，可以留言，我会尽力解答的。

时间： 2024-08-28 11:29:53

爬虫其实很简单！——网络爬虫快速实现(一)的相关文章

Python简单网络爬虫实战—下载论文名称，作者信息（下）

在Python简单网络爬虫实战—下载论文名称,作者信息(上)中,学会了get到网页内容以及在谷歌浏览器找到了需要提取的内容的数据结构,接下来记录我是如何找到所有author和title的 1.从soup中get到data类 soup中提供了select方法来筛选所需的类.该方法使用方法如下: articlename = soup.select('title') 该语句即将soup中所有的title元素放到articlename中.select也有其他用法 articlename = soup.s

爬虫学习 06.Python网络爬虫之requests模块（2）

爬虫学习 06.Python网络爬虫之requests模块(2) 今日内容 session处理cookie proxies参数设置请求代理ip 基于线程池的数据爬取知识点回顾 xpath的解析流程 bs4的解析流程常用xpath表达式常用bs4解析方法了解cookie和session - 无状态的http协议如上图所示,HTTP协议是无状态的协议,用户浏览服务器上的内容,只需要发送页面请求,服务器返回内容.对于服务器来说,并不关心,也并不知道是哪个用户的请求.对于一般浏览性的网页来说

爬虫学习 05.Python网络爬虫之三种数据解析方式

爬虫学习 05.Python网络爬虫之三种数据解析方式引入回顾requests实现数据爬取的流程指定url 基于requests模块发起请求获取响应对象中的数据进行持久化存储其实,在上述流程中还需要较为重要的一步,就是在持久化存储之前需要进行指定数据解析.因为大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,本次课程中会给大家详细介绍讲解三种聚焦爬虫中的数据解析方式.至此,我们的数据爬取的流程可以修改为: 指定url 基于r

【java爬虫】---爬虫+基于接口的网络爬虫

爬虫+基于接口的网络爬虫上一篇讲了[java爬虫]---爬虫+jsoup轻松爬博客,该方式有个很大的局限性,就是你通过jsoup爬虫只适合爬静态网页,所以只能爬当前页面的所有新闻.如果需要爬一个网站所有信息,就得通过接口,通过改变参数反复调该网站的接口,爬到该网站的所有数据信息. 本博客以爬金色财经新闻信息为对象,去爬取该网站从建站以来发表的所有新闻信息.下面会一步一步讲解.这里重点重点讲思路,最后我会提供完整源码. 第一步:找接口你要获得该网站所有新闻数据,第一步当然是获得接口,通过接口

爬虫学习 08.Python网络爬虫之图片懒加载技术、selenium和PhantomJS

爬虫学习 08.Python网络爬虫之图片懒加载技术.selenium和PhantomJS 引入今日概要图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程今日详情动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http://sc.chinaz.com/中的图片数据 #!/usr/bin/env python # -*- coding:utf-8 -*- import requests from lxml import

爬虫学习 16.Python网络爬虫之Scrapy框架（CrawlSpider）

爬虫学习 16.Python网络爬虫之Scrapy框架(CrawlSpider) 引入提问:如果想要通过爬虫程序去爬取"糗百"全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二:基于CrawlSpider的自动爬取进行实现(更加简洁和高效). 今日概要 CrawlSpider简介 CrawlSpider使用基于CrawlSpider爬虫文件的创建链接提取器规则解析器今日详

爬虫学习 04.Python网络爬虫之requests模块（1）

爬虫学习 04.Python网络爬虫之requests模块(1) 引入 Requests 唯一的一个非转基因的 Python HTTP 库,人类可以安全享用. 警告:非专业使用其他 HTTP 库会导致危险的副作用,包括:安全缺陷症.冗余代码症.重新发明轮子症.啃文档症.抑郁.头疼.甚至死亡. 今日概要基于requests的get请求基于requests模块的post请求基于requests模块ajax的get请求基于requests模块ajax的post请求综合项目练习:爬取国家药品监

一个简单网络爬虫示例(转载)

在学生时期,可能听到网络爬虫这个词会觉得很高大上,但是它的简单实现可能学生都不难懂. 网络爬虫应用,就是把整个互联网真的就当做一张网,像蜘蛛网那样,应用就像一个虫子,在网上面按照一定的规则爬动. 现在互联网应用最广的就是http(s)协议了,本文例子就是基于使用http(s)协议的,只作为示例,不涉及复杂的算法(实际上是最重要的). 设计思路: 程序入口从一个或多个url开始,通过http(s)获取url的内容,对获取到内容处理,获取内容中需要爬取的信息,获取到内容中的url链接,再重复以上步骤

使用python编写简单网络爬虫（一）

总算有时间动手用所学的python知识编写一个简单的网络爬虫了,这个例子主要实现用python爬虫从百度图库中下载美女的图片,并保存在本地,闲话少说,直接贴出相应的代码如下: ------------------------------------------------------------------------------------------- #coding=utf-8 # 导入urllib和re模块 import urllib import re # 定义获取百度图库URL的类