利用aiohttp制作异步爬虫

简介
asyncio可以实现单线程并发IO操作，是Python中常用的异步处理模块。关于asyncio模块的介绍，笔者会在后续的文章中加以介绍，本文将会讲述一个基于asyncio实现的HTTP框架——aiohttp，它可以帮助我们异步地实现HTTP请求，从而使得我们的程序效率大大提高。
本文将会介绍aiohttp在爬虫中的一个简单应用。
在原来的项目中，我们是利用Python的爬虫框架scrapy来爬取当当网图书畅销榜的图书信息的。在本文中，笔者将会以两种方式来制作爬虫，比较同步爬虫与异步爬虫(利用aiohttp实现)的效率，展示aiohttp在爬虫方面的优势。
同步爬虫
首先，我们先来看看用一般的方法实现的爬虫，即同步方法，完整的Python代码如下：

输出结果如下：

程序运行了23.5秒，爬取了500本书的信息，效率还是可以的。我们前往目录中查看文件，如下：

异步爬虫
接下来我们看看用aiohttp制作的异步爬虫的效率，完整的源代码如下：

我们可以看到，这个爬虫与原先的一般方法的爬虫的思路和处理方法基本一致，只是在处理HTTP请求时使用了aiohttp模块以及在解析网页时函数变成了协程(coroutine)，再利用aysncio进行并发处理，这样无疑能够提升爬虫的效率。它的运行结果如下：

2.4秒，如此神奇！！！再来看看文件的内容：

总结
综上可以看出，利用同步方法和异步方法制作的爬虫的效率相差很大，因此，我们在实际制作爬虫的过程中，也不妨可以考虑异步爬虫，多多利用异步模块，如aysncio, aiohttp。另外，aiohttp只支持3.5.3以后的Python版本。

当然，本文只是作为一个异步爬虫的例子，并没有具体讲述异步背后的故事，而异步的思想在我们现实生活和网站制作等方面有着广泛的应用，本文到此结束，欢迎大家交流，如果你跟我一样都喜欢python，也在学习python的道路上奔跑，欢迎你加入python学习群：839383765 群内每天都会分享最新业内资料，企业项目案例，分享python免费课程，共同交流学习，让学习变（编）成（程）一种习惯！

原文地址：https://blog.51cto.com/14186420/2373765

时间： 2024-11-09 04:52:08

利用aiohttp制作异步爬虫

利用aiohttp制作异步爬虫的相关文章

深入理解协程（四）：async/await异步爬虫实战

Python实现基于协程的异步爬虫

(转）新手写爬虫v2.5（使用代理的异步爬虫）

利用Python制作王者荣耀出装小助手，引来了老板的注意！

高性能异步爬虫

爬虫-高性能异步爬虫

ArcGIS利用DEM制作简单三维

Windows 环境下运用Python制作网络爬虫

【PhotoShop】利用PS制作唯美咖啡泡