python爬虫——爬取小说 | 探索白子画和花千骨的爱恨情仇(转载)

转载出处:药少敏   ,感谢原作者清晰的讲解思路!

下述代码是我通过自己互联网搜索和拜读完此篇文章之后写出的具有同样效果的爬虫代码:

 1 from bs4 import BeautifulSoup
 2 import requests
 3
 4 if __name__ == ‘__main__‘:
 5     html = requests.get(‘http://www.136book.com/huaqiangu/‘)
 6     soup = BeautifulSoup(html.content, ‘lxml‘)
 7     #获取所有div
 8     soup_texts = soup.find_all(‘div‘, id = ‘book_detail‘, class_= ‘box1‘)
 9
10     f=open(‘F:/huaqiangu.txt‘, ‘w‘)
11
12     #第二个div有用
13     for x in soup_texts[1].find_all(‘a‘):
14         #控制台输出网址,章节标题
15         print(x.get(‘href‘),x.get_text())
16
17         down_html = requests.get(x.get(‘href‘))
18         down_soup = BeautifulSoup(down_html.content, ‘lxml‘)
19         #获取正文
20         down_texts = down_soup.select(‘p‘)
21
22         f.write(‘\n\n‘)
23         #写入章节标题
24         f.write(x.get_text() + ‘\n‘)
25         #写入章节内容
26         for s in down_texts:
27             f.write(s.text)
28
29     f.close()

知识就像碎布,记得“缝一缝”,你才能华丽丽地亮相。


1.Beautiful Soup

1.Beautifulsoup 简介

此次实战从网上爬取小说,需要使用到Beautiful Soup。
Beautiful Soup为python的第三方库,可以帮助我们从网页抓取数据。
它主要有如下特点:

  • 1.Beautiful Soup可以从一个HTML或者XML提取数据,它包含了简单的处理、遍历、搜索文档树、修改网页元素等功能。可以通过很简短地代码完成我们地爬虫程序。
  • 2.Beautiful Soup几乎不用考虑编码问题。一般情况下,它可以将输入文档转换为unicode编码,并且以utf-8编码方式输出,

2.Beautiful Soup安装

win命令行下:

Python

1

pip install beautifusoup4

3.Beautiful Soup基础

大家可以参考文档来学习(中文版的哦):

Python

1

[http://beautifulsoup.readthedocs.io/zh_CN/latest/#id8]

对于本次爬虫任务,只要了解以下几点基础内容就可以完成:
1.Beautiful Soup的对象种类:

  • Tag
  • Navigablestring
  • BeautifulSoup
  • Comment

2.遍历文档树:find、find_all、find_next和children
3.一点点HTML和CSS知识(没有也将就,现学就可以)

2.爬取小说花千骨

1.爬虫思路分析

本次爬取小说的网站为136书屋。

先打开花千骨小说的目录页,是这样的。

我们的目的是找到每个目录对应的url,并且爬取其中地正文内容,然后放在本地文件中。

2.网页结构分析

首先,目录页左上角有几个可以提高你此次爬虫成功后成就感的字眼:暂不提供花千骨txt全集下载。

继续往下看,发现是最新章节板块,然后便是全书的所有目录。我们分析的对象便是全书所有目录。点开其中一个目录,我们便可以都看到正文内容。

按F12打开审查元素菜单。可以看到网页前端的内容都包含在这里。

我们的目的是要找到所有目录的对应链接地址,爬取每个地址中的文本内容。

有耐心的朋友可以在里面找到对应的章节目录内容。有一个简便方法是点击审查元素中左上角箭头标志的按钮,然后选中相应元素,对应的位置就会加深显示。

这样我们可以看到,每一章的链接地址都是有规则地存放在<li>中。而这些<li>又放在<div id=”book_detail” class=”box1″>中。

我不停地强调“我们的目的”是要告诉大家,思路很重要。爬虫不是约pao,蒙头就上不可取。

3.单章节爬虫

刚才已经分析过网页结构。我们可以直接在浏览器中打开对应章节的链接地址,然后将文本内容提取出来。

我们要爬取的内容全都包含在这个<div>里面。

代码整理如下:

Python

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

fromurllibimportrequest

frombs4 importBeautifulSoup

if__name__==‘__main__‘:

# 第8章的网址

url=‘http://www.136book.com/huaqiangu/ebxeew/‘

head={}

# 使用代理

head[‘User-Agent‘]=‘Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19‘

req=request.Request(url,headers=head)

response=request.urlopen(req)

html=response.read()

# 创建request对象

soup=BeautifulSoup(html,‘lxml‘)

# 找出div中的内容

soup_text=soup.find(‘div‘,id=‘content‘)

# 输出其中的文本

print(soup_text.text)

运行结果如下:

这样,单章节内容爬取就大功告成了。

4.小说全集爬虫

单章节爬虫我们可以直接打开对应的章节地址解析其中的文本,全集爬虫我们不可能让爬虫程序在每章节网页内中跑一遍,如此还不如复制、粘贴来的快。

我们的思路是先在目录页中爬取所有章节的链接地址,然后再爬取每个链接对应的网页中的文本内容。说来,就是比单章节爬虫多一次解析过程,需要用到Beautiful Soup遍历文档树的内容。

1.解析目录页

在思路分析中,我们已经了解了目录页的结构。所有的内容都放在一个所有的内容都放在一个<div id=”book_detail” class=”box1″>中。

这儿有两个一模一样的<div id=”book_detail” class=”box1″>。

第一个<div>包含着最近更新的章节,第二个<div>包含着全集内容。

请注意,我们要爬取的是第二个<div>中的内容。

代码整理如下:

执行结果如图:

2.爬取全集内容

将每个解析出来的链接循环代入到url中解析出来,并将其中的文本爬取出来,并且写到本地F:/huaqiangu.txt中。
代码整理如下:

Python

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

fromurllibimportrequest

frombs4 importBeautifulSoup

if__name__==‘__main__‘:

url=‘http://www.136book.com/huaqiangu/‘

head={}

head[‘User-Agent‘]=‘Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19‘

req=request.Request(url,headers=head)

response=request.urlopen(req)

html=response.read()

soup=BeautifulSoup(html,‘lxml‘)

soup_texts=soup.find(‘div‘,id=‘book_detail‘,class_=‘box1‘).find_next(‘div‘)

# 打开文件

f=open(‘F:/huaqiangu.txt‘,‘w‘)

# 循环解析链接地址

forlink insoup_texts.ol.children:

iflink!=‘\n‘:

download_url=link.a.get(‘href‘)

download_req=request.Request(download_url,headers=head)

download_response=request.urlopen(download_req)

download_html=download_response.read()

download_soup=BeautifulSoup(download_html,‘lxml‘)

download_soup_texts=download_soup.find(‘div‘,id=‘content‘)

# 抓取其中文本

download_soup_texts=download_soup_texts.text

# 写入章节标题

f.write(link.text+‘\n\n‘)

# 写入章节内容

f.write(download_soup_texts)

f.write(‘\n\n‘)

f.close()

执行结果显示 [Finished in 32.3s] 。

打开F盘查看花千骨文件。

爬虫成功。备好纸巾,快快去感受尊上和小骨的虐恋吧。

5.总结

代码还有很多改进的地方。例如文本中包含广告的js代码可以去除,还可以加上爬虫进度显示等等。实现这些功能需要包含正则表达式和os模块知识,就不多说了,大家可以继续完善。



码字辛苦,码代码费神,文字和代码同码更是艰辛无比。如果您觉得文章有那么一丢丢价值,请不要吝啬您的赞赏。

知识就像碎布,记得“缝一缝”,你才能华丽丽地亮相。


1.Beautiful Soup

1.Beautifulsoup 简介

此次实战从网上爬取小说,需要使用到Beautiful Soup。
Beautiful Soup为python的第三方库,可以帮助我们从网页抓取数据。
它主要有如下特点:

  • 1.Beautiful Soup可以从一个HTML或者XML提取数据,它包含了简单的处理、遍历、搜索文档树、修改网页元素等功能。可以通过很简短地代码完成我们地爬虫程序。
  • 2.Beautiful Soup几乎不用考虑编码问题。一般情况下,它可以将输入文档转换为unicode编码,并且以utf-8编码方式输出,

2.Beautiful Soup安装

win命令行下:

Python

1

pip install beautifusoup4

3.Beautiful Soup基础

大家可以参考文档来学习(中文版的哦):

Python

1

[http://beautifulsoup.readthedocs.io/zh_CN/latest/#id8]

对于本次爬虫任务,只要了解以下几点基础内容就可以完成:
1.Beautiful Soup的对象种类:

  • Tag
  • Navigablestring
  • BeautifulSoup
  • Comment

2.遍历文档树:find、find_all、find_next和children
3.一点点HTML和CSS知识(没有也将就,现学就可以)

2.爬取小说花千骨

1.爬虫思路分析

本次爬取小说的网站为136书屋。

先打开花千骨小说的目录页,是这样的。

我们的目的是找到每个目录对应的url,并且爬取其中地正文内容,然后放在本地文件中。

2.网页结构分析

首先,目录页左上角有几个可以提高你此次爬虫成功后成就感的字眼:暂不提供花千骨txt全集下载。

继续往下看,发现是最新章节板块,然后便是全书的所有目录。我们分析的对象便是全书所有目录。点开其中一个目录,我们便可以都看到正文内容。

按F12打开审查元素菜单。可以看到网页前端的内容都包含在这里。

我们的目的是要找到所有目录的对应链接地址,爬取每个地址中的文本内容。

有耐心的朋友可以在里面找到对应的章节目录内容。有一个简便方法是点击审查元素中左上角箭头标志的按钮,然后选中相应元素,对应的位置就会加深显示。

这样我们可以看到,每一章的链接地址都是有规则地存放在<li>中。而这些<li>又放在<div id=”book_detail” class=”box1″>中。

我不停地强调“我们的目的”是要告诉大家,思路很重要。爬虫不是约pao,蒙头就上不可取。

3.单章节爬虫

刚才已经分析过网页结构。我们可以直接在浏览器中打开对应章节的链接地址,然后将文本内容提取出来。

我们要爬取的内容全都包含在这个<div>里面。

代码整理如下:

Python

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

fromurllibimportrequest

frombs4 importBeautifulSoup

if__name__==‘__main__‘:

# 第8章的网址

url=‘http://www.136book.com/huaqiangu/ebxeew/‘

head={}

# 使用代理

head[‘User-Agent‘]=‘Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19‘

req=request.Request(url,headers=head)

response=request.urlopen(req)

html=response.read()

# 创建request对象

soup=BeautifulSoup(html,‘lxml‘)

# 找出div中的内容

soup_text=soup.find(‘div‘,id=‘content‘)

# 输出其中的文本

print(soup_text.text)

运行结果如下:

这样,单章节内容爬取就大功告成了。

4.小说全集爬虫

单章节爬虫我们可以直接打开对应的章节地址解析其中的文本,全集爬虫我们不可能让爬虫程序在每章节网页内中跑一遍,如此还不如复制、粘贴来的快。

我们的思路是先在目录页中爬取所有章节的链接地址,然后再爬取每个链接对应的网页中的文本内容。说来,就是比单章节爬虫多一次解析过程,需要用到Beautiful Soup遍历文档树的内容。

1.解析目录页

在思路分析中,我们已经了解了目录页的结构。所有的内容都放在一个所有的内容都放在一个<div id=”book_detail” class=”box1″>中。

这儿有两个一模一样的<div id=”book_detail” class=”box1″>。

第一个<div>包含着最近更新的章节,第二个<div>包含着全集内容。

请注意,我们要爬取的是第二个<div>中的内容。

代码整理如下:

执行结果如图:

2.爬取全集内容

将每个解析出来的链接循环代入到url中解析出来,并将其中的文本爬取出来,并且写到本地F:/huaqiangu.txt中。
代码整理如下:

Python

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

fromurllibimportrequest

frombs4 importBeautifulSoup

if__name__==‘__main__‘:

url=‘http://www.136book.com/huaqiangu/‘

head={}

head[‘User-Agent‘]=‘Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19‘

req=request.Request(url,headers=head)

response=request.urlopen(req)

html=response.read()

soup=BeautifulSoup(html,‘lxml‘)

soup_texts=soup.find(‘div‘,id=‘book_detail‘,class_=‘box1‘).find_next(‘div‘)

# 打开文件

f=open(‘F:/huaqiangu.txt‘,‘w‘)

# 循环解析链接地址

forlink insoup_texts.ol.children:

iflink!=‘\n‘:

download_url=link.a.get(‘href‘)

download_req=request.Request(download_url,headers=head)

download_response=request.urlopen(download_req)

download_html=download_response.read()

download_soup=BeautifulSoup(download_html,‘lxml‘)

download_soup_texts=download_soup.find(‘div‘,id=‘content‘)

# 抓取其中文本

download_soup_texts=download_soup_texts.text

# 写入章节标题

f.write(link.text+‘\n\n‘)

# 写入章节内容

f.write(download_soup_texts)

f.write(‘\n\n‘)

f.close()

执行结果显示 [Finished in 32.3s] 。

打开F盘查看花千骨文件。

爬虫成功。备好纸巾,快快去感受尊上和小骨的虐恋吧。

5.总结

代码还有很多改进的地方。例如文本中包含广告的js代码可以去除,还可以加上爬虫进度显示等等。实现这些功能需要包含正则表达式和os模块知识,就不多说了,大家可以继续完善。



码字辛苦,码代码费神,文字和代码同码更是艰辛无比。如果您觉得文章有那么一丢丢价值,请不要吝啬您的赞赏。

原文地址:https://www.cnblogs.com/wangmantou/p/8478959.html

时间: 2024-10-03 01:57:53

python爬虫——爬取小说 | 探索白子画和花千骨的爱恨情仇(转载)的相关文章

python爬虫爬取csdn博客专家所有博客内容

python爬虫爬取csdn博客专家所有博客内容: 全部过程采取自动识别与抓取,抓取结果是将一个博主的所有 文章存放在以其名字命名的文件内,代码如下 结果如下: 版权声明:本文为博主原创文章,未经博主允许不得转载.

python爬虫爬取美女图片

python 爬虫爬取美女图片 #coding=utf-8 import urllib import re import os import time import threading def getHtml(url): page = urllib.urlopen(url) html = page.read() return html def getImgUrl(html,src): srcre = re.compile(src) srclist = re.findall(srcre,html)

Python爬虫爬取博客园并保存

Python爬虫爬取博客园并保存        爬取博客园指定用户的文章修饰后全部保存到本地 首先定义爬取的模块文件: crawlers_main.py 执行入口 url_manager.py url管理器 download_manager.py 下载模块 parser_manager.py html解析器(解析html需要利用的内容) output_manager.py 输出html网页全部内容文件(包括css,png,js等) crawlers_main.py 执行入口 1 # coding

用Python爬虫爬取广州大学教务系统的成绩(内网访问)

用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code] 在{}之前的部分就是"选择器"."选择器"指明了{}中的"样式"的作用对象,也就是"样式"作用于网页中的哪些元素.可参考:http://www.w3school.com.cn/cssref/css_selectors.asph

python爬虫—爬取英文名以及正则表达式的介绍

python爬虫—爬取英文名以及正则表达式的介绍 爬取英文名: 一.  爬虫模块详细设计 (1)整体思路 对于本次爬取英文名数据的爬虫实现,我的思路是先将A-Z所有英文名的连接爬取出来,保存在一个csv文件中:再读取csv文件当中的每个英文名链接,采用循环的方法读取每一个英文名链接,根据每个英文名链接爬取每个链接中的数据,保存在新的csv文件当中. 需要写一个爬取英文名链接的函数.将爬取的内容保存在csv文件的函数以及读取csv文件内容的函数.爬取英文名详情页内容的函数. 表5.3.1 函数名

python爬虫爬取微博评论案例详解

这篇文章主要介绍了python爬虫爬取微博评论,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧 数据格式:{"name":评论人姓名,"comment_time":评论时间,"comment_info":评论内容,"comment_url":评论人的主页} 以上就是我们需要的信息. 具体操作流程: 我们首相将主页获取完成以后,我们就会发现,其中 的内容带有相

Python爬虫爬取知乎小结

博客首发至Marcovaldo's blog (http://marcovaldong.github.io/) 最近学习了一点网络爬虫,并实现了使用python来爬取知乎的一些功能,这里做一个小的总结.网络爬虫是指通过一定的规则自动的从网上抓取一些信息的程序或脚本.我们知道机器学习和数据挖掘等都是从大量的数据出发,找到一些有价值有规律的东西,而爬虫则可以帮助我们解决获取数据难的问题,因此网络爬虫是我们应该掌握的一个技巧. python有很多开源工具包供我们使用,我这里使用了requests.Be

Python爬虫爬取一篇韩寒新浪博客

网上看到大神对Python爬虫爬到非常多实用的信息,认为非常厉害.突然对想学Python爬虫,尽管自己没学过Python.但在网上找了一些资料看了一下,看到爬取韩寒新浪博客的视频.共三集,第一节讲爬取一篇博客,第二节讲爬取一页博客.第三集讲爬取所有博客. 看了视频.也留下了代码. 爬虫第一步:查看网页源码: 第一篇博客的代码为蓝底的部分<a title="" target="_blank" href="http://blog.sina.com.cn/

Python爬虫爬取数据的步骤

爬虫: 网络爬虫是捜索引擎抓取系统(Baidu.Google等)的重要组成部分.主要目的是将互联网上的网页下载到本地,形成一个互联网内容的镜像备份. 步骤: 第一步:获取网页链接 1.观察需要爬取的多网页的变化规律,基本上都是只有小部分有所变化,如:有的网页只有网址最后的数字在变化,则这种就可以通过变化数字将多个网页链接获取: 2.把获取得到的多个网页链接存入字典,充当一个临时数据库,在需要用时直接通过函数调用即可获得: 3.需要注意的是我们的爬取并不是随便什么网址都可以爬的,我们需要遵守我们的