1通过分析搜索关键词对应的网址发现字段名和内容均在网址中网址可简化为www.baidu.com/s?wd=搜索的关键词
根据分析出的规律可通过构造get请求用爬虫实现在百度上自动查询某个关键词
代码如下:
import urllib.request 导入urllib.requestkeywd = ‘高同同‘ 指定关键词keywd_cod = urllib.request.quote(keywd)将关键词进行编码url = ‘https://www.baidu.com/s?wd=‘输入网址url_all = url +keywd_cod构造出最终抓取网址req =urllib.request.Request(url)使用urllib.request.Request构造一个Request对象并赋给变量req
data = urllib.request.urlopen(req).read()通过url.request.urlopen()打开对应的Request对象fandle = open(‘D:/siq/part4/10.html‘,‘wb‘)fandle.write(data)将爬去的内容写到一个html文件中fandle.close()结束 思路总结:1构建对应的url地址,该url包含get请求的字段名称及字段内容等信息并且url地址满足get请求格式“http://网址?字段名1=字段内容1&字段名2=字段内容2”2以对应的url为参数,构建request对象3通过urlopen()打开构建的request对象4读取内容并保存
时间: 2024-10-26 02:32:20