文章详情页

python使用XPath解析数据爬取起点小说网数据

浏览：2日期：2022-06-21 15:45:48

1. xpath 的介绍

xpath是一门在XML文档中查找信息的语言

优点：可以在xml中找信息支持HTML的查找可以通过元素和属性进行导航

但是Xpath需要依赖xml的库，所以我们需要去安装lxml的库。

安装lxml库

我们先要安装lxml的库，直接在pycharm里安装即可：

python使用XPath解析数据爬取起点小说网数据

XML的树形结构：

python使用XPath解析数据爬取起点小说网数据

元素-元素-属性-文本

使用XPath选取节点：

nodename: 选取此节点的所有节点 /从根节点选择 // 从匹配选择的当前节点选择文档中的节点，而不考虑他们的位置 . 选择当前节点 .. 选择当前节点的父节点（此处是两个点，浏览器默认显示3个..） /text() 获取当前路径下的文本内容 /@xxx 提取当前路径下标签的属性值选取节点的表达式举例：

python使用XPath解析数据爬取起点小说网数据

2. 爬取起点小说网在浏览器中获取书名和作者测试

在谷歌里安装一个xpath的插件

python使用XPath解析数据爬取起点小说网数据

在html中查找book-mid-info

python使用XPath解析数据爬取起点小说网数据

我们要获取小说的名称：也就是 //div[@class=’book-mid-info’]/h4/a/txt()

python使用XPath解析数据爬取起点小说网数据

再加一个获取作者：

python使用XPath解析数据爬取起点小说网数据

使用xpath获取起点小说网的数据

# 作者：互联网老辛# 开发时间：2021/4/8/0008 8:24import requestsfrom lxml import etreeurl='https://www.qidian.com/rank/yuepiao'headers={’user-agent’:’Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3861.400 QQBrowser/10.7.4313.400’}#发送请求resp=requests.get(url,headers)e=etree.HTML(resp.text) #类型转换，把str转变为class ’lxml.etree._ELementprint(type(e))names=e.xpath(’//div[@class='book-mid-info']/h4/a/text()’)authors=e.xpath(’//p[@class='author']/a[1]/text()’)print(names)print(authors)#名称和作者对应for name,authors in zip(names,authors): print(name,':',authors)

以上就是python使用XPath解析数据爬取起点小说网数据的详细内容，更多关于python XPath解析数据爬取起点小说网的资料请关注好吧啦网其它相关文章！

Python 编程

上一条：python 破解加密zip文件的密码下一条：python 实现德洛内三角剖分的操作

相关文章：

1. CSS Hack大全-教你如何区分出IE6-IE10、FireFox、Chrome、Opera2. 三个不常见的 HTML5 实用新特性简介3. 解析原生JS getComputedStyle4. Xml简介_动力节点Java学院整理5. React实现一个倒计时hook组件实战示例6. 得到XML文档大小的方法7. ASP基础入门第三篇(ASP脚本基础)8. XML解析错误：未组织好的解决办法9. 将properties文件的配置设置为整个Web应用的全局变量实现方法10. html清除浮动的6种方法示例