python - 如何爬取跳转网站的数据
问题描述
目前在学习一些爬虫的知识,对于一些复杂的网站使用selenium进行爬取。碰到一个问题,我需要爬取的工单网站(不知道密码)需要先通过登录一个鉴权系统,然后鉴权系统页面点击其中的工单系统连接,就会自动免登录跳转到工单系统网站,这种系统的数据我该如何使用爬虫进行抓取?以下是鉴权系统selenium拿到关于工单系统的html
<a href='https://www.haobala.com/link-test001' target='_blank' rel='link-test001' data='1' datasrc='工单系统|||/files/link/test001.gif|||new|||/link-test001'> <img src='https://www.haobala.com/files/link/test001.gif' alt='工单系统' align='absmiddle'><span>工单系统</span></a>
问题解答
回答1:用firefox的扩展selenium ide录制一遍操作。然后导出为python文件。改改运行就可以了。
建议你去读读虫师写的书。
回答2:例如使用requests库作为爬虫的话,先创建session(),A登录,B是跳转的页面即可。
T=requests.session()A=T.post(url=url,data=data)B=T.get(url=url)
创建的T就代表存储的cookie,会一直保留
相关文章:
1. golang - 用IDE看docker源码时的小问题2. 在windows下安装docker Toolbox 启动Docker Quickstart Terminal 失败!3. python - 有哪些预测算法可以根据实时增量数据更新算法并预测后续数据?4. 表单提交验证,没反应,求老师指点5. 求一个python往kafka写json数据的例子6. 在应用配置文件 app.php 中找不到’route_check_cache’配置项7. thinkPHP5中获取数据库数据后默认选中下拉框的值,传递到后台消失不见。有图有代码,希望有人帮忙8. javascript - 如何使用Canvas改变素材的颜色?9. node.js - session怎么存到cookie,然后服务器重启后还能获取。数据库不用mongodb或redis,数据库是mysql10. mysql5.7就没有官方性质的详细配置文件吗?求大神告知

网公网安备