图片爬取百思不得姐（正则的取法，下载的方法，%s的用法）

# _*_coding:utf-8_*_import urllibimport redef geturl(page=1): #加了page参数    html=urllib.urlopen("http://www.budejie.com/pic/%s"%page).read()     #%s对应后边的%page    reg=‘‘‘<img src="http://mstatic.spriteapp.cn/xx/1/w3/img/lazyload/default.png"                 class="lazy"                 data-original="(.*?)"‘‘‘     #多行正则的取法    reg= re.compile(reg)    photo=re.findall(reg,html)    return photor=0for x in xrange(18):    print ‘获取第%s页‘%x    imglist = geturl(x+1)    for i in imglist:        r += 1   #r要有初始值        print ‘正在下载%s‘%r        urllib.urlretrieve(i,‘img/%s‘%i.split(‘/‘)[-1]) #切片取网址的最后一段    img存图片的文档名称   urllib.urlretrieve(下载的文件，存放地址)表示下载        print ‘%s下载完成‘%rprint ‘全部处理完成，总共抓取%s张图片‘%r

时间： 2024-12-12 08:25:19

图片爬取百思不得姐（正则的取法，下载的方法，%s的用法）的相关文章

[Python_scrapy图片爬取下载]

welcome to myblog Dome地址爬取某个车站的图片 item.py 中 1.申明item 的fields class PhotoItem(scrapy.Item): # define the fields for your item here like: # name = scrapy.Field() image_urls = scrapy.Field() images = scrapy.Field() pass spider 的image.py 导入头文件 from Phot

回车桌面图片爬取

回车桌面图片爬取今天我们就来爬爬这个网站 https://tu.enterdesk.com/ 这个网站能爬的资源还是很多的,但我就写一个例子,其他的可以根据思路去写. 首先还是先来分析下这个网站的图片获取过程我选择的是图库,先随便选择一个标签,我这选宠物吧哟,我们再看看有没有翻页开启F12(开发者工具) 用不习惯火狐,还是开谷歌来看吧那么就访问看看?随便选取一个访问看看是不是能出图片 https://tu.enterdesk.com/chongwu/6.html 结果肯定是可以的啦问

爬虫07 /scrapy图片爬取、中间件、selenium在scrapy中的应用、CrawlSpider、分布式、增量式

目录爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式 1. scrapy图片的爬取/基于管道类实现 2. 中间件的使用 3. selenium在scrapy中的应用 4. CrawlSpider 5. 分布式 5. 增量式爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式 1. scrapy图片的爬取/基于管道类实现爬取流程: 爬虫类中将解析到的图片

Python爬虫新手教程：知乎文章图片爬取器

1. 知乎文章图片爬取器之二博客背景昨天写了知乎文章图片爬取器的一部分代码,针对知乎问题的答案json进行了数据抓取,博客中出现了部分写死的内容,今天把那部分信息调整完毕,并且将图片下载完善到代码中去. 首先,需要获取任意知乎的问题,只需要你输入问题的ID,就可以获取相关的页面信息,比如最重要的合计有多少人回答问题.问题ID为如下标红数字编写代码,下面的代码用来检测用户输入的是否是正确的ID,并且通过拼接URL去获取该问题下面合计有多少答案. import requests import r

千图网_性感美女图片爬取--图片懒加载

#爬取千图网性感美女模块的图片 #第一页:http://sc.chinaz.com/tupian/xingganmeinvtupian.html #第二页:http://sc.chinaz.com/tupian/xingganmeinvtupian_2.html #两种url结构不同,注意可以使用if语句判断 import urllib.request import urllib.parse from lxml import etree import time import os #定义下载图

知乎高颜值图片爬取

.katex { display: block; text-align: center; white-space: nowrap; } .katex-display > .katex > .katex-html { display: block; } .katex-display > .katex > .katex-html > .tag { position: absolute; right: 0px; } .katex { font-style: normal; font

scrapy之360图片爬取

#今日目标 **scrapy之360图片爬取** 今天要爬取的是360美女图片,首先分析页面得知网页是动态加载,故需要先找到网页链接规律, 然后调用ImagesPipeline类实现图片爬取 *代码实现* so.py ``` # -*- coding: utf-8 -*- import scrapy import json from ..items import SoItem class SoSpider(scrapy.Spider): name = 'so' allowed_domains =

糗图-图片爬取

糗图-图片爬取主要思路 1.来到首页,查看主页有用图片存在html的规律 2.编写re提取图片路径 3.右键图片查看请求图片的具体路径 4.拼接图片请求路径 5.查看下一页界面的路径,找到界面请求路径规律 6.work,多界面爬取指定图片爬虫 import requests import re import os headers = { "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.3

妹子图爬取__正则实现

妹子图爬取页面链接正则实现代码: import re import requests import os hehehe = os.getcwd() headers = { 'User-Agent': "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1", 'Referer': 'http://i.meizitu.net'}