python爬取企业电话_Python爬取天眼查企业数据

作者本机环境:

系统-windows10

编程语言-Python

Python版本-Python3.6.8

解析工具-Xpath(解析工具不唯一,均可,这里只演示xpath)

编写工具-Pycharm

本内容使用Python语言进行编写,而Python也是编写爬虫比较好的一款编程语言,小白可以快速入门,语法比其他编程语言稍简单一些,那么这里使用的Python面向对象去写的这么一个爬虫文件,对天眼查网站进行爬取,页面经过分析是静态网页,内容抓取相对动态网站要简单的多;直接是按照这样一个思路来写代码,分析出不同页面的url进行分页处理,而拿到的列表页要对其每一个详情的url进行提取,提取到之后使用详情url发起请求抓取详情页面。

在这里补充一点,我使用的是Python3.6.8,而大家可以根据自己的情况去选择,这里是使用的普通爬虫requests进行爬取,那么Python还有强大的第三方库Scrapy框架,能够达到更高效,并且在RedisSpider的延伸中对于爬取到的数据存储速度上非常快,因为redis数据库是基于内存进行存储数据的,更是有一个可以去重的这样一个功能;而scrapy内部的去重原理在源码中是有一个set集合进行去重的,了解Python的肯定对这点不陌生——set集合去重

import requests

from lxml import etree

class TianYanCha():

def __init__(self, url):

self.url = url

# 请求头

self.headers = {

"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36",

"Cookie": "aliyungf_tc=AQAAAL9zfjMqLAQAGpXaG0rH+SQSMyir; csrfToken=D4W5eHOZUdVKKtVN8B5RcWil; jsid=SEM-BAIDU-PZ2003-VI-000001; TYCID=ee9c15b0727811eabdfbb3a9464b1d4e; undefined=ee9c15b0727811eabdfbb3a9464b1d4e; ssuid=7522613240; bannerFlag=false; _ga=GA1.2.2024087523.1585567433; _gid=GA1.2.1441861791.1585567433; Hm_lvt_e92c8d65d92d534b0fc290df538b4758=1585567432,1585568902; refresh_page=0; RTYCID=06e1215159ed40e9b936441fe8b79c12; token=9b83740966314eef9746e9fee609fd9a; _utm=8c3b6195c8d347ccab2335d8abd7a664; CT_TYCID=25b749040e3a45c98de53deb2d0d8104; cloud_token=9d4a9eb888e64a1bb4da17049cf08014; Hm_lpvt_e92c8d65d92d534b0fc290df538b4758=1585571475; _gat_gtag_UA_123487620_1=1",

"Content-Type": "application/json; charset=UTF-8",

"Accept-Encoding": "gzip, deflate, br",

}

self.item_list = {} # 存储队列

def zhixing(self):

self.response = requests.get(url=self.url, headers=self.headers).text # 起始URL

# print(self.response)

self.fen1 = etree.HTML(self.response)

self.datas1 = self.fen1.xpath(

'//div[@class="search-result-single "]/div[@class="content"]/div[@class="header"]/a/@href')

# print(self.datas1) # 详情页url

for self.dataaa in self.datas1:

self.urls = self.dataaa # 详情页url地址

# print(self.urls)

def xiang_qing(self):

import time

time.sleep(1)

self.response_content = requests.get(url=self.urls, headers=self.headers).text

self.datalist = etree.HTML(self.response_content)

self.datas = self.datalist.xpath('//div[@class="box -company-box "]')

# 公司数据

for self.data in self.datas:

self.item_list["公司名称"] = self.data.xpath('./div[@class="content"]/div[@class="header"]/h1/text()')

self.item_list['注册资本'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[1]/td[2]/div/text()')

self.item_list['成立日期'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[2]/td[2]/div/text()')

self.item_list['行业'] = self.data.xpath('//*[@id="_container_baseInfo"]/table[2]/tbody/tr[5]/td[4]/text()')

self.item_list['注册地址 '] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[10]/td[2]/text()')

self.item_list['经营范围'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[11]/td[2]/span/text()')

self.item_list['法定代表人'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[1]/tbody/tr[1]/td[1]/div/div[1]/div[2]/div[1]/a/@title')

print(self.item_list)

if __name__ == '__main__':

for i in range(1,100):

url = "https://www.tianyancha.com/search/p"+str(i)+"?key=%E5%9B%BD%E5%AE%B6%E7%94%B5%E7%BD%91" # 分页

tianyancha = TianYanCha(url)

tianyancha.zhixing()

tianyancha.xiang_qing()


版权声明:本文为weixin_36431195原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。