文章详情页

基于python爬取梨视频实现过程解析

浏览：53日期：2022-07-06 08:38:17

目标网址：梨视频

然后我们找到科技这一页：https://www.pearvideo.com/category_8。其实你要哪一页都行，你喜欢就行。嘿嘿…

这是动态网站，所以咱们直奔network 然后去到XHR：

基于python爬取梨视频实现过程解析

找规律，这个应该不难，我就直接贴网址上来咯，想要锻炼的可以找找看哈：

https://www.pearvideo.com/category_loading.jsp?reqType=5&categoryId=8&start=0

这个就是我们要找的目标网址啦，后面的0就代表页数,让打开这个网页发现是静态网页，这最好搞啦，直接上：

基于python爬取梨视频实现过程解析

代码如下：

output;https://www.pearvideo.com/video_1703486https://www.pearvideo.com/video_1703189https://www.pearvideo.com/video_1703161https://www.pearvideo.com/video_1702880https://www.pearvideo.com/video_1702773...

顺利拿到，然后进入播放页面，却发现找不到MP4视频，怎么办？经过我一番努力（扯掉了几十根头发后）发现，它在另外一个网址里面

基于python爬取梨视频实现过程解析

咋办？当然要想办法把这个网址搞到手啦，仔细分析下，发现这个网址非常陌生呀，唯一稍微熟悉点的就是那串数字了，前面我们拿到播放页的网址后面那串数字和这个对比，完全是一模一样的，这样的话那就好搞了，咱们直接用拼接的方式把它接上去就可以了，看代码：

for each in lists: url_num = each.replace(’video_’,'') urls = target+url_num print(urls)`````pythonoutput：https://www.pearvideo.com/videoStatus.jsp?contId=1703486https://www.pearvideo.com/videoStatus.jsp?contId=1703189https://www.pearvideo.com/videoStatus.jsp?contId=1703161https://www.pearvideo.com/videoStatus.jsp?contId=1702880https://www.pearvideo.com/videoStatus.jsp?contId=1702773https://www.pearvideo.com/videoStatus.jsp?contId=1702633...

出来了，好像稍微有点不一样，后面那啥&mrd=***************** 没有，怎么办？没有就不要呗，看过我发的百度图片那篇的朋友都懂，网址里面有些东西是不需要的，纯粹是搞咱们这些玩爬虫的，恶心咱们。不过没办法，毕竟是咱们要去爬人家的数据的。

网址问题解决了，但是点进去一看，发现这东东:

基于python爬取梨视频实现过程解析

恩，很明显，是遇到反爬机制了，这个好搞，要什么给什么就行，代码如下：

headers = { ’User-Agent’: ’Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.111 Safari/537.36’, ’Referer’: ’https://www.pearvideo.com/video_’+ str(url_num) } html = requests.get(urls,headers=headers).text print(html)

基于python爬取梨视频实现过程解析

搞定！！

最后我们看一下MP4能不能播放：

基于python爬取梨视频实现过程解析

西八！404！！恩，这里就稍微有点麻烦了，还得找数据，把里面的时间戳改成 ‘cont-数字‘，感觉写了好多，手都有点累了，我就直接上代码了：

import requestsimport parsel,reimport os target = 'https://www.pearvideo.com/videoStatus.jsp?contId='url = 'https://www.pearvideo.com/category_loading.jsp?reqType=5&categoryId=9&start=0'res = requests.get(url)res.encoding='utf-8'html = parsel.Selector(res.text)lists = html.xpath(’/html/body/li/div/a/@href’).getall()# print(lists[2:])# 提取视频后面的数字，数字是最重要的，需要传给 Referer 和 urlsfor each in lists: url_num = each.replace(’video_’,'') urls = target+url_num # print(urls) headers = { ’User-Agent’: ’Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.111 Safari/537.36’, ’Referer’: ’https://www.pearvideo.com/video_’+ str(url_num) } html = requests.get(urls,headers=headers).text cont = ’cont-’ + str(url_num) # 提取 mp4 视频 srcUrl = re.findall(f’'srcUrl':'(.*?)'’,html)[0] # 替换视频里面的时间戳，改为可以真正播放的数据 new_url = srcUrl.replace(srcUrl.split('-')[0].split('/')[-1],cont) print(new_url) # 使用视频后缀当视频名称 filename = srcUrl.split('/')[-1] # 保存到本地 with open('./images/'+filename,'wb') as f: f.write(requests.get(new_url).content)

基于python爬取梨视频实现过程解析

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持好吧啦网。

Python 编程

上一条：python 读取串口数据的示例下一条：Python eval函数介绍及用法

相关文章：

1. HTML5中一些酷炫又有趣的新特性代码整理汇总2. 什么是ASP？如何打开ASP文件3. python中HTMLParser模块知识点总结4. ASP.NET MVC使用Session会话保持表单状态5. 得到XML文档大小的方法6. Vue如何使用ElementUI对表单元素进行自定义校验及踩坑7. ASP和PHP文件操作速度的对比8. python tkinter实现下载进度条及抖音视频去水印原理9. 使用python和opencv的mask实现抠图叠加10. PHP行为设计模式之策略模式

排行榜

					
					得到XML文档大小的方法
vue使用vue-quill-editor富文本编辑器且将图片上传到服务器的功能
Android Studio给各种控件加边框的操作方法
PHP基础之类和对象11——对象接口
java Matcher匹配头尾截取替换字符串的案例
Java多线程之synchronized关键字的使用
PHP扩展之文本处理（二）——PCRE正则表达式语法13——条件子组
python 如何区分return和yield
JavaScript实现10秒后再次获取验证码
vue基础知识--axios合并请求和slot
什么是ASP？如何打开ASP文件
				

热门标签