前言
本篇鸣谢 马川——燕大 增删整理,王圣元——原创文章,与原文不同之处包含我的学习记录。
匹配Jupyter Notebook的ipynb文档链接下载地址如下
本篇鸣谢 燕大——马川 的整理
匹配Jupyter Notebook的ipynb文档链接下载地址如下
by 马川 燕大
代码胜于雄辩 Talks is cheap. Show me the code. —-Linus Torvalds(Linux操作系统的奠基者)
| |
因为页面加载需要时间,抓取控件也需要时间,设计sleep时长看你的页面加载速度以及网速进行调整
re库的实用实例如下
| |
raw string类型区别于原生字符串类型(不包含转义字符)
xpath解析原理: 1.实例化一个etree的对象,且需要将被解析的页面源码数据加载到该对象中。 2.调用et ree对象中的xpath方法结合着xpath表达式实现标签的定位和内容的捕获。
目的:在爬虫中使用异步实现高性能的数据爬取操作。 异步爬虫的方式: –多线程,多进程(不建议): 好处:可以为相关阻塞的操作单独开启线程或者进程,阻塞操作就可以异步执行。 弊端:无法无限制的开启多线程或者多进程。
本篇鸣谢 清华——尹成 的整理收集
PyQuery文档https://www.osgeo.cn/pyquery/index.html
PyQuery库也是一个非常强大又灵活的网页解析库,如果你有前端开发经验的,都应该接触过jQuery,那么PyQuery就是你非常绝佳的选择,PyQuery 是 Python 仿照 jQuery 的严格实现。语法与 jQuery 几乎完全相同,所以不用再去费心去记一些奇怪的方法了。 官网地址:http://pyquery.readthedocs.io/en/latest/ jQuery参考文档:http://jquery.cuishifeng.cn/