随机User-Agent
fake_useragent库,伪装请求头
获取代理ip
在免费的代理网站爬取代理ip,免费代理的采集也很简单,无非就是:访问页面页面 —> 正则/xpath提取 —> 保存
代理ip网站
雷神代理:https://www.leishenhttp.com
根据网页结果,适用正则表达式匹配
这种方法适合翻页的网页
先获取特定标签
解析
检测代理ip可用性
第一种方法:通过返回的状态码判断
第二种方法:使用requests包来进行验证
第三种方法:使用telnet