爬虫学习小心得---Ajax数据爬取

Ajax即Asynchronous Javascript And XML(异步JavaScript和XML)在 2005年被Jesse James Garrett提出的新术语,用来描述一种使用现有技术集合的‘新’方法,包括: HTML 或 XHTML, CSS, JavaScriptDOM, XML, XSLT, 以及最重要的XMLHttpRequest。使用Ajax技术网页应用能够快速地将增量更新呈现在用户界面上,而不需要重载(刷新)整个页面,这使得程序能够更快地回应用户的操作。                                                                                               --------来自百度百科

简言之就是有的网页的数据更改时url不会发生改变,典型的就是网站里翻页按钮的应用,点击翻页按钮不会导致网页刷新,url也不会有参数上的改变,因此想要通过改变url来爬取不同参数的数据就不能实现

(搜索关键词可能有:爬虫爬取url不变的网页)

学习心得

弄懂了之前爬取简单网页是使用的标题头的各部分含义,如:

并且学到了如何通过浏览器开发者工具找到这些参数

F12->Network(网络)->点击按钮->找到新增加的数据->点击Headers(标头)即可查看

这时候要get的url为其中的请求url,但是这个get的结果是json

通过requests.get()之后再返回json,再通过json.get('data')即可查看更改的数据

 但是这样去改变?后边的参数会很麻烦而且容易出错,所以利用urlencode来进行编写

例子如下

PS:通过json返回的数据真是太简洁了,能省不少事

参考资料:Python3-网络爬虫开发实战  崔庆才著


版权声明:本文为vener_原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。