一、介绍
selenium最初是一个自动化测试工具,而爬虫中使用它主要是为了解决requests无法直接执行JavaScript代码的问题。
selenium本质是通过驱动浏览器,完全模拟浏览器的操作,比如跳转、输入、点击、下拉等。来拿到网页渲染之后的结果,可支持多种浏览器。
from selenium import webdriver browser=webdriver.Chrome() browser=webdriver.Firefox() browser=webdriver.PhantomJS() browser=webdriver.Safari() browser=webdriver.Edge()
二、安装
#安装:selenium+chromedriver pip3 install selenium 下载chromdriver.exe放到python安装路径的scripts目录中即可,注意最新版本是2.33,并非2.9 下载链接:http://npm.taobao.org/mirrors/chromedriver/ #验证安装 C:\Users\Administrator>python3 Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32 Type "help", "copyright", "credits" or "license" for more information. >>> from selenium import webdriver >>> driver=webdriver.Chrome() #弹出浏览器 >>> driver.get(‘https://www.baidu.com‘) >>> driver.page_source #注意: selenium3默认支持的webdriver是Firfox,而Firefox需要安装geckodriver 下载链接:https://github.com/mozilla/geckodriver/releases
selenium+Chromedriver
#安装:selenium+phantomjs pip3 install selenium 下载phantomjs,解压后把phantomjs.exe所在的bin目录放到环境变量 下载链接:http://phantomjs.org/download.html #验证安装 C:\Users\Administrator>phantomjs phantomjs> console.log(‘egon gaga‘) egon gaga undefined phantomjs> ^C C:\Users\Administrator>python3 Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32 Type "help", "copyright", "credits" or "license" for more information. >>> from selenium import webdriver >>> driver=webdriver.PhantomJS() #无界面浏览器 >>> driver.get(‘https://www.baidu.com‘) >>> driver.page_source selenium+phantomjs
selenium+phantomjs
三、基本使用
from selenium import webdriver # 驱动浏览器
from selenium.webdriver import ActionChains #滑动验证
from selenium.webdriver.common.by import By #按照什么方式查找,By.ID,By.CSS_SELECTOR,查找标签进而点击
from selenium.webdriver.common.keys import Keys #模拟键盘按键操作
from selenium.webdriver.support import expected_conditions as EC # EC中传的是元组
from selenium.webdriver.support.wait import WebDriverWait #与E联用,等待页面加载某些元素
browser=webdriver.Chrome()
try:
browser.get(‘https://www.baidu.com‘)
input_tag=browser.find_element_by_id(‘kw‘)
input_tag.send_keys(‘美女‘) #python2中输入中文错误,字符串前加个u
input_tag.send_keys(Keys.ENTER) #输入回车
search_button = browser.find_element_by_id(‘su‘) # 找到搜索按钮点击
search_button.click()
wait=WebDriverWait(browser,10)
wait.until(EC.presence_of_element_located((By.ID,‘content_left‘))) #等到id为c ontent_left的元素加载完毕,最多等10秒
print(browser.page_source)
print(browser.current_url)
print(browser.get_cookies())
finally:
browser.close()
四、三种选择器
from selenium import webdriver from selenium.webdriver import ActionChains from selenium.webdriver.common.by import By #按照什么方式查找,By.ID,By.CSS_SELECTOR from selenium.webdriver.common.keys import Keys #键盘按键操作 from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.support.wait import WebDriverWait #等待页面加载某些元素 browser=webdriver.Chrome() browser.get(‘https://www.baidu.com‘) #以下三种方式达到的都是同一种效果:查找id为kw的标签 input_tag1=browser.find_element(By.ID,‘kw‘) #等同于:input_tag1=browser.find_element_by_id(‘kw‘) input_tag2=browser.find_element(By.CSS_SELECTOR,‘#kw‘) #等同于:input_tag2=browser.find_element_by_css_selector(‘#kw‘) input_tag3=browser.find_element(By.XPATH,‘//*[@id="kw"]‘) #等同于:input_tag3=browser.find_element_by_xpath(‘//*[@id="kw"]‘) #注意:browser.find_elements系列与browser.find_element的区别就是,前者是查找多个,后者是只找第一个 div1=browser.find_element(By.CSS_SELECTOR,‘div‘) #找到第一个div标签 div2=browser.find_elements(By.CSS_SELECTOR,‘div‘) #找到所有的div标签,放到列表里 browser.close()