Python爬虫教程-31-创建 Scrapy 爬虫框架项目

本篇是介绍在 Anaconda 环境下，创建 Scrapy 爬虫框架项目的步骤，且介绍比较详细

Python爬虫教程-31-创建 Scrapy 爬虫框架项目

首先说一下，本篇是在 Anaconda 环境下，所以如果没有安装 Anaconda 请先到官网下载安装
Anaconda 下载地址：https://www.anaconda.com/download/

Scrapy 爬虫框架项目的创建

0.打开【cmd】
1.进入你要使用的 Anaconda 环境
- 1.环境名可以在【Pycharm】的【Settings】下【Project：】下找到
- 2.使用命令：activate 环境名，例如：
  
  activate learn
- 3.进入想要存放 scrapy 项目的目录下 【注意】
- 4.新建项目：scrapy startproject xxx项目名，例如：
  
  scrapy startproject new_project
5.操作截图：
6.在文件资源管理器打开该目录，就会发现生成了好几个文件
7.使用 Pycharm 打开项目所在目录就可以了

这里我们就把项目创建好了，分析一下自动生成的文件的作用

Scrapy 爬虫框架项目的开发

0.使用 Pycharm 打开项目，截图：
项目的开发的大致流程：
- 1.明确需要爬取的目标/产品：编写 item.py
- 2.在 spider 目录下载创建 python 文件制作爬虫：
  - 地址 spider/xxspider.py 负责分解，提取下载的数据
- 3.存储内容：pipelines.py
Pipeline.py 文件
- 对应 pipelines 文件
- 爬虫提取出数据存入 item 后，item 中保存的数据需要进一步处理，比如清洗，去虫，存储等
- Pipeline 需要处理 process_item 函数
- process_item
  - spider 提取出来的 item 作为参数传入，同时传入的还有 spider
  - 此方法必须实现
  - 必须返回一个 Item 对象，被丢弃的 item 不会被之后的 pipeline
_ init _：构造函数
- 进行一些必要的参数初始化
open_spider(spider)：
- spider 对象对开启的时候调用
close_spider(spider)：
- 当 spider 对象被关闭的时候调用
Spider 目录
- 对应的是文件夹 spider 下的文件
- _ init _：初始化爬虫名称，start _urls 列表
- start_requests：生成 Requests 对象交给 Scrapy 下载并返回 response
- parse：根据返回的 response 解析出相应的 item，item 自动进入 pipeline：如果需要，解析 url，url自动交给 requests 模块，一直循环下去
- start_requests：此方法尽能被调用一次，读取 start _urls 内容并启动循环过程
- name：设置爬虫名称
- start_urls：设置开始第一批爬取的 url
- allow_domains：spider 允许去爬的域名列表
- start_request(self)：只被调用一次
- parse：检测编码
- log：日志记录
下一篇文章链接：Python爬虫教程-32-Scrapy 爬虫框架项目 Settings.py 介绍
拜拜

本笔记不允许任何个人和组织转载

原文地址：https://www.cnblogs.com/xpwi/p/9601038.html

时间： 2024-10-17 05:57:31

Python爬虫教程-31-创建 Scrapy 爬虫框架项目的相关文章

MyEclipse&Maven项目管理教程：创建Java Maven依赖项目（转载）

本教程介绍了如何通过MyEclipse Web项目,或者其他任何Maven项目来创建一个通用的Java/Maven项目.这些步骤包括基础的创建和使用Maven依赖.您将学习到: 创建一个Maven实用项目为一个项目添加依赖关系添加实用项目作为一个依赖关系没有MyEclipse?立即下载 1. 创建一个Maven实用项目 Maven实用项目将被现有的Maven项目消耗. (1)创建一个Maven项目支持消耗在本教程中创建的项目. (2)选择File>New>Project,在搜索栏中输入M

在ubuntu上创建scrapy爬虫

下载scrapy 在命令行下输入: sudo apt-get install python-scrapy 或者进入http://scrapy.org下载安装新建项目命令行下进入项目目录,输入scrapy startproject start 新建一个名为start的项目项目结构如下 start/ scrapy.cfg start/ __init__.py items.py pipelines.py settings.py spiders/ __init__.py 各文件的作用如下: scr

Python爬虫教程-30-Scrapy 爬虫框架介绍

从本篇开始学习 Scrapy 爬虫框架 Python爬虫教程-30-Scrapy 爬虫框架介绍框架:框架就是对于相同的相似的部分,代码做到不出错,而我们就可以将注意力放到我们自己的部分了常见爬虫框架: scrapy pyspider crawley Scrapy 是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 可以应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中 Scrapy 官方文档 https://doc.scrapy.org/en/latest/ http://sc

手把手教你如何新建scrapy爬虫框架的第一个项目（下）

前几天小编带大家学会了如何在Scrapy框架下创建属于自己的第一个爬虫项目(上),今天我们进一步深入的了解Scrapy爬虫项目创建,这里以伯乐在线网站的所有文章页为例进行说明. 在我们创建好Scrapy爬虫项目之后,会得到上图中的提示,大意是让我们直接根据模板进行创建Scrapy项目.根据提示,我们首先运行"cd article"命令,意思是打开或者进入到article文件夹下,尔后执行命令"scrapy genspider jobbole blog.jobbole.com&

scrapy爬虫基本实现和爬虫思想

今天分享下scrapy爬虫的基本使用方法,scarpy是一个比较成熟稳定的爬虫框架,方便了爬虫设计,有较强的逻辑性.我们以旅游网站为例进行介绍,一方面是旅游网站多,各个网站的适用情况不同,方便我们的学习.最后有网易云评论的一个爬取思路和不同的实现方法. 话不多说,下面是scrapy的框架: 创建scrapy爬虫的命令可以在cmd中输入 scrapy project XXXX 之后创建蜘蛛文件使用 scrapy genspider xxx "xxxx.com" 接着初始化工作就做完了,下

Python之Scrapy爬虫框架安装及简单使用

题记:早已听闻python爬虫框架的大名.近些天学习了下其中的Scrapy爬虫框架,将自己理解的跟大家分享.有表述不当之处,望大神们斧正. 一.初窥Scrapy Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 可以应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中. 其最初是为了页面抓取 (更确切来说, 网络抓取 )所设计的, 也可以应用在获取API所返回的数据(例如 Amazon Associates Web Services ) 或者通用的网络爬虫. 本文档将

[转载]网络爬虫（12）：爬虫框架Scrapy的第一个爬虫示例入门教程

我们使用dmoz.org这个网站来作为小抓抓一展身手的对象. 首先先要回答一个问题. 问:把网站装进爬虫里,总共分几步? 答案很简单,四步: 新建项目 (Project):新建一个新的爬虫项目明确目标(Items):明确你想要抓取的目标制作爬虫(Spider):制作爬虫开始爬取网页存储内容(Pipeline):设计管道存储爬取内容好的,基本流程既然确定了,那接下来就一步一步的完成就可以了. 1.新建项目(Project) 在空目录下按住Shift键右击,选择“在此处打开命令窗口”,输入一

python爬虫—使用scrapy爬虫框架

问题1.使用scrapy框架,使用命令提示符pip命令下载scrapy后,却无法使用scrapy命令,出现scrapy不是内部或外部命令.也不是可运行的程序解决:一开始,我是把python安装在D:\python,安装了scrapy后他默认都会装在此路径下,然后scrapy在路径D:\python\Scripts路径下,而创建工程也只能在此目录下. 如果想让他在dos下想要命令运行成功的话,就的需要知道他在那里,那么这又得学习到环境变量path的作用.所以这就得在path上添加scrapy的地

python实现爬虫（一）--- Scrapy框架抓取豆瓣书籍信息

Scrapy是一个用python实现都爬虫框架,简单易用,功能强大,只需要在框架的基础上自定义自己的分析规则即可,具体如何新建工程等待都在官方文档上面讲解得非常清楚,官方文档tutorial(http://doc.scrapy.org/en/latest/intro/tutorial.html)请保证下载较新版本的Scrapy(我的是0.24.2,scrapy -v)旧版本会出现一些问题. 下面我使用Scrapy抓取豆瓣上面编程书籍的一些简单信息一.准备爬取的页面如下,新建一个douban工程