爬虫之post请求与请求传参

一.POST请求

class Postspider(scripy.Spider):
    name = "post"
    # allowed_domains = ["www.xxx.com"]
    start_urls = ["https.//fanyi.baidu.com/sug"]

    def start_requests(self):
        data = {
            "kw": "dog"
        }
        for url in self.start_urls:
            yield scrapy.FormRequest(url=url, formdata=data, calback=self.parse)

def parse(self, response):
    print(response.text)

二.请求传参

　　- 在某些情况下，我们爬取的数据不在同一个页面中，例如，我们爬取一个电影网站，电影的名称，评分在一级页面，而要爬取的其他电影详情在其二级子页面中。这时我们就需要用到请求传参。

ex：爬取www.id97.com电影网，将一级页面中的电影名称，类型，评分一级二级页面中的上映时间，导演，片长进行爬取。

import scrapy
from moviePro.items import MovieproItem

class MovieSpider(scrapy.Spider):
    name = ‘movie‘
    allowed_domains = [‘www.id97.com‘]
    start_urls = [‘http://www.id97.com/‘]

    def parse(self, response):
        div_list = response.xpath(‘//div[@class="col-xs-1-5 movie-item"]‘)

        for div in div_list:
            item = MovieproItem()
            item[‘name‘] = div.xpath(‘.//h1/a/text()‘).extract_first()
            item[‘score‘] = div.xpath(‘.//h1/em/text()‘).extract_first()
            #xpath(string(.))表示提取当前节点下所有子节点中的数据值（.）表示当前节点
            item[‘kind‘] = div.xpath(‘.//div[@class="otherinfo"]‘).xpath(‘string(.)‘).extract_first()
            item[‘detail_url‘] = div.xpath(‘./div/a/@href‘).extract_first()
            #请求二级详情页面，解析二级页面中的相应内容,通过meta参数进行Request的数据传递
            yield scrapy.Request(url=item[‘detail_url‘],callback=self.parse_detail,meta={‘item‘:item})

    def parse_detail(self,response):
        #通过response获取item
        item = response.meta[‘item‘]
        item[‘actor‘] = response.xpath(‘//div[@class="row"]//table/tr[1]/a/text()‘).extract_first()
        item[‘time‘] = response.xpath(‘//div[@class="row"]//table/tr[7]/td[2]/text()‘).extract_first()
        item[‘long‘] = response.xpath(‘//div[@class="row"]//table/tr[8]/td[2]/text()‘).extract_first()
        #提交item到管道
        yield item

items.py:

 -*- coding: utf-8 -*-

# Define here the models for your scraped items
#
# See documentation in:
# https://doc.scrapy.org/en/latest/topics/items.html

import scrapy

class MovieproItem(scrapy.Item):
    # define the fields for your item here like:
    name = scrapy.Field()
    score = scrapy.Field()
    time = scrapy.Field()
    long = scrapy.Field()
    actor = scrapy.Field()
    kind = scrapy.Field()
    detail_url = scrapy.Field()

管道文件：

# -*- coding: utf-8 -*-

# Define your item pipelines here
#
# Don‘t forget to add your pipeline to the ITEM_PIPELINES setting
# See: https://doc.scrapy.org/en/latest/topics/item-pipeline.html

import json
class MovieproPipeline(object):
    def __init__(self):
        self.fp = open(‘data.txt‘,‘w‘)
    def process_item(self, item, spider):
        dic = dict(item)
        print(dic)
        json.dump(dic,self.fp,ensure_ascii=False)
        return item
    def close_spider(self,spider):
        self.fp.close()

三、log日志相关

　　- 在使用scrapy crawl spiderFileName运行程序时，在终端里打印输出的就是scrapy的日志信息。

　　- 日志信息的种类：

　　　　　　　　ERROR ：一般错误

　　　　　　　　WARNING : 警告

　　　　　　　　INFO : 一般的信息

　　　　　　　　DEBUG ：调试信息

　　　　　　　　默认的显示级别是DEBUG

　　- 设置日志信息指定输出：

　　　　在settings.py配置文件中，加入LOG_LEVEL = ‘指定日志信息种类’即可。LOG_FILE = ‘log.txt‘则表示将日志信息写入到指定文件中进行存储。

原文地址：https://www.cnblogs.com/qq631243523/p/10471699.html

时间： 2024-11-05 01:02:06

爬虫之post请求与请求传参的相关文章

RestTemplate post请求使用map传参 Controller 接收不到值的解决方案 postForObject方法源码解析.md

结论 post方法中如果使用map传参,需要使用MultiValueMap来传递 RestTemplate 的 postForObject 方法有四个参数 String url => 顾名思义这个参数是请求的url路径 Object request => 请求的body 这个参数需要再controller类用 @RequestBody 注解接收 Class responseType => 接收响应体的类型第四个参数?postForObject 方法多种重构 Map<String

get请求中url传参中文乱码问题--集锦

一:get请求url中带有中文参数,有三种方式进行处理防止中文乱码 1.如果使用tomcat作为服务器,那么修改tomcat配置文件conf/server.xml中,在 <Connector port="8082" protocol="HTTP/1.1" 中加入 URIEncoding="utf-8"的编码集 2.前台需要对中文参数进行编码,调用js方法encodeURI(url),将url编码,然后请求. 后台接受时,需处理Stri

爬虫scrapy组件请求传参,post请求,中间件

post请求在scrapy组件使用post请求需要调用 def start_requests(self): 进行传参再回到 yield scrapy.FormRequest(url=url,formdata=data,callback=self.parse)进行post请求其中FormRequest()为post 请求方式 import scrapy class PostSpider(scrapy.Spider): name = 'post' # allowed_domains = ['ww

爬虫 --- 07. 全站爬取, post请求,cookie, 传参,中间件,selenium

一.全站数据的爬取 - yield scrapy.Request(url,callback):callback回调一个函数用于数据解析 # 爬取阳光热线前五页数据 import scrapy from sunLinePro.items import SunlineproItem class SunSpider(scrapy.Spider): name = 'sun' # allowed_domains = ['www.xxx.com'] start_urls = ['http://wz.sun0

python爬虫---scrapy框架爬取图片,scrapy手动发送请求,发送post请求,提升爬取效率,请求传参(meta),五大核心组件,中间件

# settings 配置 UA USER_AGENT = 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.86 Safari/537.36' 一丶scrapy的图片数据爬取(流数据的爬取) ? scrapy中封装好了一个管道类(ImagesPipeline),基于该管道类可以实现图片资源的请求和持久化存储编码流程: 爬虫文件中解析出图片的地址将

爬虫5 scrapy框架2 全站爬取cnblogs, scarpy请求传参, 提高爬取效率, 下载中间件, 集成selenium, fake-useragent, 去重源码分析, 布隆过滤器, 分布式爬虫, java等语言概念补充, bilibili爬视频参考

1 全站爬取cnblogs # 1 scrapy startproject cnblogs_crawl # 2 scrapy genspider cnblogs www.cnblogs.com 示例: # cnblogs_crawl/cnblogs_crawl/spiders/cnblogs.py import scrapy from cnblogs_crawl.items import CnblogsCrawlItem from scrapy.http import Request class