利用python爬下段子网站的搞笑段子

众所周知,python是写爬虫的利器,今天作者用python写一个小爬虫爬下一个段子网站的众多段子。

目标段子网站为“http://ishuo.cn/”,我们先分析其下段子的所在子页的url特点,可以轻易发现发现为“http://ishuo.cn/subject/”+数字,

经过测试发现,该网站的反扒机制薄弱,可以轻易地爬遍其所有站点。

现在利用python的re及urllib库将其所有段子扒下

import sys
import re
import urllib
#返回html格式
def gethtml(url):
    page=urllib.urlopen(url)
    html=page.read()
    return html

def getmessage(html):
    p=re.compile(r‘<div class="content">(.*)</div><script type="text/javascript">‘)
    #对段子内容进行正则匹配
    message=re.findall(p,html)#返回正则匹配的结果
    return message
fp=open(‘data.txt‘,‘w+‘)
#实际范围比1~7000要大,因为时间原因这里暂定为1~7000
for i in range(1,7000):
   i=str(i)
   web=gethtml(‘http://ishuo.cn/subject/‘+i)
   #该网站段子的链接特点

   message=getmessage(web)

   message2=‘‘.join(message)#将结果转换为字符串类型
   #message2=message2.decode(‘utf8‘,‘strict‘)
   message2=str(message2)
   print message2

   fp.writelines(message2+‘\n‘)
   #将爬下的众多段子写入文件中

fp.close()

  data.txt收录了其中爬下段子的结果:

收录的部分结果如下:

【韩寒】明明下流的人,凑一起就叫上流社会?
日子过不下去的时候,我就得向钱看!只有当日子过滋润了,我才能够向前看!
某公司一群基层员工年底聚会,没有加薪没有升职连年终奖金都被取消了,打算借酒浇愁一回。有人带了瓶酒来,大家一看那酒的名字,眼泪就都扑簌簌地往下掉开了,还有人顿时抱头痛哭了一场。那酒的名字叫老白干。
【段子】群里听到的段子,太乐了:路上听到一大叔情绪激动地打电话:对!国足进3个球了!没错!是男足!没错没错!是和韩国比赛!什么?对方?对对对!对方也是男足!

一女士向闺蜜诉说,他结婚原因:他向我求婚,我说跟我结婚,没门!我还没发昏到那程度!后来,他就用石头把我碰昏了!我就傻了,死心塌地跟他结婚了!闺蜜说:你不告他,反而跟他结婚,真是发昏了!他用什么石头碰的你呀?女士说:他用钻石!
【冷笑话】一男子提着一个皮包,挤上了公共汽车,车上人拥挤,一小偷用刀片割其皮包,窃其财物。一勇敢女子见状偷偷的提醒身边的男士,但由于紧张,说道:“先生,有人要割你的包皮”……
【段子】外交部工作:周一表示不满;周二抗议;周三强烈谴责;周四严正交涉;周五深表遗憾。周六、周日休息。
经考证孔子是经济学家,有其语为证: 三十而立--三十两银子只能站着听课; 四十不惑--四十两就能一直问到没疑问为止; 五十知天命--五十两就能知道明天考试命题; 六十耳顺--六十两老师会说你喜欢听的话,七十而从心所欲-七十两你来不来、学习的怎么样都随便了。
班车上,坐在身边的一位美女同事睡着了,竟然打起呼噜,觉得这样很丢脸,就用手轻推她,只见她喃喃的说:不要了老公,明天吧。
【太尖锐】蒙古国是个纯内陆国,却有个海军部。中国老大哥很好奇地问:”你们连海都没有,搞什么海军部!?”蒙古人回答道:”你们不也有文化部么?!”
一女程序员征婚:SELECT * FROM 男人 WHERE 未婚=true and 有房=true and 有车=true and 条件 in (‘大方’,\‘绅士’,\‘会做家务\‘,\‘帅气\‘,\‘最好还能带孩子’) 一资深的程序员回复:(0 row(s) affected)
【小笑话】孔子,孟子,老子三人同时在猪圈睡了一夜之后,发现母猪怀孕了,经DNA检验证明,肯定不是孔子干的,也不是孟子干的,请问,那是谁干的?
【冷笑话】一妓深夜应召,路遇巡警,巡警大喝:谁?干什么的?女回应:妓者!巡警肃然起敬,柔和问道:那个报社的?女答:“和男晚抱”!大笑而去!
无聊的最高境界是什么?摆渡结果如下: 1、对着镜子,数自己的头发; 2、拿着剃刀等胡子长出来; 3、跟正吸你血的蚊子聊天; 4、看着天花板上的污渍,把它想成山水画; 5、给N年以前的报纸校对错别字; 6、喝一大杯水,然后坐到马桶上去等着。
【经典语录】当我要找我崇拜的人的时候,我就照镜子。 —— 李敖
看过冬奥会冰壶比赛后,一大妈逢人便说:“你看这外国奥运会的志愿者就是不一般啊,擦地每一个都擦得那么认真……”
【胡歌】我眼中的世界从未如此纯净 我的左手边是一面雪白的墙 我的右手边是一面和左手边一样的墙 我的前边有一扇门 从那里出去可以看到更多白花花的墙 虽然已是午夜时分 窗外却分外敞亮 我后边的万家灯火足以照亮此时白白的墙 我是不是疯了?
【冷笑话】:单位有个同事,蒙古人,属于常魂游天外的大神级人物。一年休假回家,假期过了好几天还不回来,领导给打电话,丫在电话里说:领导,我还在呼伦贝尔草原上骑马找我家呢,我家是游牧民族,现在不知道搬到哪里了。#搞笑#
【地名简述】一次历史考试,有一道题是让同学们任选十个国家或地区,并加以简述。 一个学生是这样答的:从前有个柬埔寨,里面有个阿拉伯。一天,他带着墨西哥去爬山,爬到新加坡时,突然来了只头上长着好望角的巴拿马,吓出一身阿富汗,拔腿跑进名古屋急忙关也门,结果碰掉了一颗葡萄牙。
【幽默说婆媳】为什么天底下最难搞的关系是婆媳关系?1.媳妇的别称是“新娘”,一个新的娘突然来到家里,旧的娘心里能好受吗?2.婆婆用了五年的时间教会儿子穿衣服,媳妇用不到五秒钟就能让儿子把衣服脱光,这是一种怎样的心理落差?
在一个泼水节上,大家都开心疯狂的相互泼水,突然有一个人破口大骂:“他妈的,谁在泼我”。旁边的人说他,你干嘛骂人啊,人泼你是对你的祝福啊!这个人气急败坏的说:你知道什么?哪个王八蛋是用开水在泼我!
1、一定要把多余的房子卖掉,#地震#来了才知道,原来不动产也是会动的,而且动起来吓死人。 2、余震就象打麻将,如果半天没什么动静,就绝对是在整大的! 3、看余震的心情就象初恋少女看情人,既怕他不来又怕他乱来!
【冷笑话】1.一居室,求合租,面议。2.小事招魂,大事挖坟。3.我觉得我还可以抢救一下!4.提供鞭尸服务,一次100!5.基因重组中,请稍候二十年6.单挑冥王哈迪斯中,征求组队!7.当你看清这行字的时候:朋友,你踩到我了。8.老子终于不用怕鬼了!9.给爷笑一个,要不爷给你笑一个?
局长发短信给女秘书:想死你了,在国际酒店1203号房,快来!却不小心按了群发键。片刻,回复分至。女秘书:德性,干嘛猴急!女科长:领导,今天不方便,改天吧!男副局长:不知道你也是同志啊?女部下:马上到!对门王姐:今天老公在家,明天行吗?女副局长:你才想起我呀?老婆:回来啊!还浪费那钱!
爱情和婚姻就像老黑熊掰玉米棒子,不要指望你能掰到最大和最好的,要挑自己最喜欢最满意的掰一个,掰到了就不要在去在掰了。要不然就会掰来掰去掰了个最小的最不喜欢的回来。
【小偷也幽默】相对两户人家,一户防盗门,一户普通木门。一天,防盗门这家失窃,发现#小偷#在普通木门门口留下了纸条:你相信我,我也相信你。
[强人语录]:世界上最远的距离.不是生与死.而是我在电信你在网通
世界上最远的距离,不是树与树的距离,而是同根生长的树枝,却无法在风中相依。(~ o ~)~zZ
世界上最远的距离是啥?是两个人到了边境,你过去了,我护照忘带了。。
温总理语录:“一个人不管有多聪明,多能干,背景条件有多好,如果不懂得如何去做人、做事,那么他最终的结局肯定是失败。做人做事是一门艺术,更是一门学问。很多人之所以一辈子都碌碌无为,那是因为他活了一辈子都没有弄明白该怎样去做人做事。”
【极品冷笑话】:刘若英向周杰伦求婚,居然遭拒!!!周董深情地说:“奶茶,我更喜欢优乐美!”
你知道哪两种水果居然有手机?--“萝卜青菜,各有索爱。”
糗事百科:“我站起身来给一孕妇让座,她疑惑地看了看我,忽然明白过来,哭笑不得道:同学,我这是胖!”
有些事,我们总是弄不懂;有些人,我们总是猜不透;有些道,我们总是悟不尽;有些理,我们总是想不通;有些坎,我们总是跨不过;有些伤,我们总是治不好;有些天,我们总是睡不着;有些地,我们总是去不了;有些情,我们总是说不出;有些爱,我们总是得不到。------人生十大困惑
六岁的小孩第一次观赏电视里的芭蕾舞,看到台上演员们踮著脚尖急转时,他禁不住问他的父亲:「他们为什麽不选些高个的女孩来跳呢?」
爱情就像白米饭,浪漫过程就像菜。人饿时,会想着吃饭。但吃完后,更多人喜欢去评论菜好不好吃,而忽略白米饭。
用别人的智慧充实自己,不用别人的智慧贬低自己;用别人的成功激励自己,不用别人的成功折磨自己;用别人的错误提醒自己,不用别人的错误娱乐自己。
【老婆和情人的差别】老婆会告诉男人青菜多少钱一斤,情人会告诉男人夜空有多少颗星星。
【我可以等】狱吏问一个即将被处死的罪犯早餐想吃什么?罪犯说:我想吃桃子。狱吏:你知道,现在是冬天,哪有桃子!罪犯说:没关系,我可以等。

  爬下的段子为编写如聊天机器人、公众号、段子发布点提供了丰富素材。

时间: 2024-10-16 00:15:57

利用python爬下段子网站的搞笑段子的相关文章

最后轻松一夏,周末利用python爬取“陈翔六点半”搞笑视频!

觉得程序员再忙也需要给自己安排一点娱乐时间,对自己好点,自己对自己不好,谁会? 自己娱乐一般会有:跑步.看电影.小视频,而小视频是最家常的娱乐方式,看得最多的小视频是「 陈翔六点半 」,咦! 拍得搞笑,演技也一流,也不乏有内涵!非常推荐大家看看. 时间太贵,我耗不起 正题 先上Python爬取小视频的效果图,duang.duang.duang.想下载什么就是什么,哈哈. 打开浏览器(电脑版,方便调试)输入微博 url 点击输入框,输入「陈翔六点半」,回车搜索 但是发现在这个页面就只用几个视频.滑

python爬取某个网站的图片并保存到本地

python爬取某个网站的图片并保存到本地 #coding:utf-8 import urllib import re import sys reload(sys) sys.setdefaultencoding('gb2312') #获取整个页面的数据 def getHtml (url): page = urllib.urlopen(url) html = page.read() return html #保存图片到本地 def getImg(html): reg = r'src="(.+?\.

python爬虫教程:《利用Python爬取表情包》

python爬虫教程:<利用Python爬取表情包>,微信没有表情包?不用愁!老师带领你使用多线程爬虫一键爬取20w的表情包~ python爬虫教程:<利用Python爬取表情包>,微信没有表情包?不用愁!老师带领你使用多线程爬虫一键爬取20w的表情包~ python爬虫教程:<利用Python爬取表情包>,微信没有表情包?不用愁!老师带领你使用多线程爬虫一键爬取20w的表情包~ python爬虫教程:<利用Python爬取表情包>,微信没有表情包?不用愁!

没有内涵段子可以刷了,利用Python爬取段友之家贴吧图片和小视频(含源码)

由于最新的视频整顿风波,内涵段子APP被迫关闭,广大段友无家可归,但是最近发现了一个"段友"的app,版本更新也挺快,正在号召广大段友回家,如下图,有兴趣的可以下载看看(ps:我不是打广告的,没收广告费的) 同时,之前同事也发了一个贴吧的段子聚居地,客官稍等,马上奉上连接:段友之家?https://tieba.baidu.com/f?ie=... 然后呢,看到上面,确实好多段友在上面,于是乎,我就想爬取他们的图片和小视频,就有了这篇文章的主题: 其实吧,用Python爬取网站数据是最基

利用python爬取海量疾病名称百度搜索词条目数的爬虫实现

实验原因: 目前有一个医疗百科检索项目,该项目中对关键词进行检索后,返回的结果很多,可惜结果的排序很不好,影响用户体验.简单来说,搜索出来的所有符合疾病中,有可能是最不常见的疾病是排在第一个的,而最有可能的疾病可能需要翻很多页才能找到. 实验目的: 为了优化对搜索结果的排序,想到了利用百度搜索后有显示搜索到多少词条,利用这个词条数,可以有效的对疾病排名进行一个优化.从一方面看,某一个疾病在百度的搜索词条数目越多,表示这个词条的信息特别丰富,侧面反映了搜索这个词条的人特别多,从而可以推出这个疾病在

利用Python爬取豆瓣电影

目标:使用Python爬取豆瓣电影并保存MongoDB数据库中 我们先来看一下通过浏览器的方式来筛选某些特定的电影: 我们把URL来复制出来分析分析: https://movie.douban.com/tag/#/?sort=T&range=0,10&tags=%E7%94%B5%E5%BD%B1,%E7%88%B1%E6%83%85,%E7%BE%8E%E5%9B%BD,%E9%BB%91%E5%B8%AE 有3个字段是非常重要的: 1.sort=T 2.range=0,10 3.tag

利用python爬取58同城简历数据

最近接到一个工作,需要获取58同城上面的简历信息(http://gz.58.com/qzyewu/).最开始想到是用python里面的scrapy框架制作爬虫.但是在制作的时候,发现内容不能被存储在本地变量 response 中.当我通过shell载入网页后,虽然内容能被储存在response中,用xpath对我需要的数据进行获取时,返回的都是空值.考虑到数据都在源码中,于是我使用python里的beautifulSoup通过下载源码的方式去获取数据,然后插入到数据库. 需要的python包ur

利用python爬取贝壳网租房信息

最近准备换房子,在网站上寻找各种房源信息,看得眼花缭乱,于是想着能否将基本信息汇总起来便于查找,便用python将基本信息爬下来放到excel,这样一来就容易搜索了. 1. 利用lxml中的xpath提取信息 xpath是一门在 xml文档中查找信息的语言,xpath可用来在 xml 文档中对元素和属性进行遍历.对比正则表达式 re两者可以完成同样的工作,实现的功能也差不多,但xpath明显比re具有优势.具有如下优点:(1)可在xml中查找信息 :(2)支持html的查找:(3)通过元素和属性

利用python爬取天气预报然后发送给微信好友

需要利用微信的api接口,itchat.然后来看一下代码: #!/usr/bin/python #-*- coding:utf-8 -*- import itchat import re import urllib2 import itchat #模拟浏览器 hearders = "User-Agent","Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/60