文章详情页

Python抓包并解析json爬虫的完整实例代码

浏览：3日期：2022-07-06 14:38:25

Python抓包并解析json爬虫

在使用Python爬虫的时候，通过抓包url，打开url可能会遇见以下类似网址，打开后会出现类似这样的界面，无法继续进行爬虫：

例如：

需要爬取网页中第二页的数据时，点击F12➡网络(Network)➡XHR，最好点击清除键，如下图：

Python抓包并解析json爬虫的完整实例代码

通过点击“第二页”，会出现一个POST请求（有时会是GET请求），点击POST请求的url，（这里网址以POST请求为例），

如图：

Python抓包并解析json爬虫的完整实例代码

然后复制参数代码

代码展示：

import requestsimport jsonurl = ’https://m.ctrip.com/restapi/soa2/13444/json/getCommentCollapseList?_fxpcqlniredt=09031130211378497389’header={’authority’: ’m.ctrip.com’,’method’: ’POST’,’path’: ’/restapi/soa2/13444/json/getCommentCollapseList?_fxpcqlniredt=09031130211378497389’,’scheme’: ’https’,’accept’: ’*/*’,’accept-encoding’: ’gzip, deflate, br’,’accept-language’: ’zh-CN,zh;q=0.9’,’cache-control’: ’no-cache’,’content-length’: ’278’,’content-type’: ’application/json’,’cookie’: ’__utma=1.1986366783.1601607319.1601607319.1601607319.1; __utmz=1.1601607319.1.1.utmcsr=(direct)|utmccn=(direct)|utmcmd=(none); _RSG=blqD1d4mGX0BA_amPD3t29; _RDG=286710759c35f221c000cbec6169743cac; _RGUID=0850c049-c137-4be5-90b7-0cd67093f28b; MKT_CKID=1601607321903.rzptk.lbzh; _ga=GA1.2.1986366783.1601607319; nfes_isSupportWebP=1; appFloatCnt=8; _gcl_dc=GCL.1601638857.CKzg58XqlewCFQITvAodioIJWw; Session=SmartLinkCode=U155952&SmartLinkKeyWord=&SmartLinkQuary=&SmartLinkHost=&SmartLinkLanguage=zh; Union=OUID=index&AllianceID=4897&SID=155952&SourceID=&createtime=1602506741&Expires=1603111540922; MKT_OrderClick=ASID=4897155952&AID=4897&CSID=155952&OUID=index&CT=1602506740926&CURL=https%3A%2F%2Fwww.ctrip.com%2F%3Fsid%3D155952%26allianceid%3D4897%26ouid%3Dindex&VAL={'pc_vid':'1601607319353.3cid9z'}; MKT_Pagesource=PC; _RF1=218.58.59.72; _bfa=1.1601607319353.3cid9z.1.1602506738089.1602680023977.4.25; _bfi=p1%3D290510%26p2%3D290510%26v1%3D25%26v2%3D24; MKT_CKID_LMT=1602680029515; __zpspc=9.5.1602680029.1602680029.1%232%7Cwww.baidu.com%7C%7C%7C%25E6%2590%25BA%25E7%25A8%258B%7C%23; _gid=GA1.2.1363667416.1602680030; _jzqco=%7C%7C%7C%7C1602680029668%7C1.672451398.1601607321899.1602506755440.1602680029526.1602506755440.1602680029526.undefined.0.0.16.16’,’cookieorigin’: ’https://you.ctrip.com’,’origin’: ’https://you.ctrip.com’,’pragma’: ’no-cache’,’referer’: ’https://you.ctrip.com/’,’sec-fetch-dest’: ’empty’,’sec-fetch-mode’: ’cors’,’sec-fetch-site’: ’same-site’,’user-agent’: ’Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.121 Safari/537.36’}dat = { 'arg': { ’channelType’: 2, ’collapseType’: 0, ’commentTagId’: 0, ’pageIndex’: 1, ’pageSize’: 10, ’poiId’: 75648, ’sortType’: 3, ’sourceType’: 1, ’starType’: 0 }, 'head': { ’auth’: '', ’cid’: '09031117213661657011', ’ctok’: '', ’cver’: '1.0', ’extension’: [], ’lang’: '01', ’sid’: '8888', ’syscode’: '09', ’xsid’: '' }}r = requests.post(url, data=json.dumps(dat), headers=header)s = r.json()print(s)

运行结果：

Python抓包并解析json爬虫的完整实例代码

然后右击结果，再点击Show as JSON：

Python抓包并解析json爬虫的完整实例代码

最后就会出现目标url的响应信息，就可以进行爬取了！！！

总结

到此这篇关于Python抓包并解析json爬虫的文章就介绍到这了,更多相关Python抓包并解析json爬虫内容请搜索好吧啦网以前的文章或继续浏览下面的相关文章希望大家以后多多支持好吧啦网！

Python 编程

上一条：详解Python利用configparser对配置文件进行读写操作下一条：python中not、and和or的优先级与详细用法介绍

相关文章：

1. ASP常用日期格式化函数 FormatDate()2. python 如何在 Matplotlib 中绘制垂直线3. 开发效率翻倍的Web API使用技巧4. python中@contextmanager实例用法5. bootstrap select2 动态从后台Ajax动态获取数据的代码6. CSS3中Transition属性详解以及示例分享7. js select支持手动输入功能实现代码8. 如何通过python实现IOU计算代码实例9. vue使用moment如何将时间戳转为标准日期时间格式10. html中的form不提交（排除）某些input 原创

排行榜

					
					Python数据相关系数矩阵和热力图轻松实现教程
如何在PHP中读写文件
vue-drag-chart 拖动/缩放图表组件的实例代码
PHP正则表达式函数preg_replace用法实例分析
如何使用repr调试python程序
Java xml数据格式返回实现操作
php redis setnx分布式锁简单原理解析
一个 2 年 Android 开发者的 18 条忠告
Django使用channels + websocket打造在线聊天室
Spring Boot 功能整合的实现
Spring @Primary和@Qualifier注解原理解析
				

热门标签