在我们爬取网页过程中经常发現我们想要获得的数据并不能简单的通过解析HTML代码获取,这些数据是通过AJAX异步加载方式或经过JS渲染后才呈现在页面上显示出来
selenuim是一种自動化测试工具,它支持多种浏览器而在爬虫中,我们可以使用它来模拟浏览器浏览页面进而解决Java渲染的问题。
2.1 声明浏览器对象
即告诉程序应该使用哪个浏览器进行操作
成功访问网页后,我们可能需要进行一些操作比如找到搜索框然后输入关键字再敲击回车键。
因此就需要在selenium选择多个元素中查找元素。
selenium选择多个元素查找元素有两种方法
第一种,是指定使用哪种方法去查找元素比如指定依照CSS选择戓者依照xpath去进行查找
下面是详细的元素查找方法
第二种,是直接使用find_element()传入的第一个参数为需要使用的元素查找方法
查找多个元素和查找單个元素的方法基本一致(只需要将查找单个元素的func里加一个s)。
查找多个元素返回的是一个list
元素交互是先获取一个元素,然后对获取的元素调用交互方法
比如说在搜索框内输入文字:
交互动作是将动作附加到交互链中串行执行,需要使用到ActionChains
已经通过元素查找获取到元素後,可能还需要获取这个元素的属性、文本
如果定位到父frame是无法查找到子frame的信息的,因此需要切换到子frame再进行查找同理,在子frame也无法查找到父frame的信息
请求网页时可能会存在AJAX异步加载的情况。而selenium选择多个元素只会加载主网页并不会考虑到AJAX的情况。因此使用时需要等待一些时间,让网页加载完全后再进行操作
使用隐式等待时,如果webdriver没有找到指定的元素将继续等待。超出规定时间后如果还是没又找到指定元素则抛出找不到元素的异常。默认等待时间为0
隐式等待是对整个页面进行等待。
需要特别说明的是:隐性等待对整个driver的周期嘟起作用所以只要设置一次即可。
显示等待包含了等待条件和等待时间
首先判定等待条件是否成立,如果成立则直接返回;如果条件不成立,则等待最长时间为等待时间如果超过等待时间后仍然没有满足等待等待条件,则抛出异常
显式等待是对指定的元素进行等待。
2.10 浏览器的前进/后退
back实现回到前一页面forward实现前往下一页面
选项卡管理就是浏览器的标签。有些时候我们需要在浏览器里增加一个新标簽页或者删除一个标签页就可以使用selenium选择多个元素来实现。
好啦分享就到这里,更多python学习可以关注我们哦