文章详情页
python 爬虫 解析效率如何提升?
浏览:280日期:2022-06-29 17:26:48
问题描述
现在采用的是在windows 环境下 采用多线程的方式进行爬取,使用beautifulsoup+lxml进行解析.
N个爬取线程->解析队列->1个解析线程->存储队列->1个存储线程
整个执行程序的效率卡在计算密集的解析线程中,如果只是增加解析线程数量的话,反而增加线程切换开销速度变慢。
请问下 有什么办法可以较为明显的提升解析效率?
根据两位大腿的说明 准备采用异步爬取->解析队列->N个解析进程->存储队列->存储线程
准备开工
问题解答
回答1:其实我觉得, 你在前面N个爬取线程 可以换成协程/线程池实现, 因为你在频繁创建线程本省一种性能耗费, 用线程池虽然可以减少这部分的损耗, 但是上下文切换还是无法避免, 所以协程这方面, 应该是比较合适的.1个解析线程 换成 进程池,多开几个进程去计算密集处理, 其余应该可以不用改, 如果还想再搞, 将核心部分用c/c++ 重写咯, 希望可以帮到你
回答2:我的做法是多进程。多进程的好处是当单机性能不够的时候,可以随时切换为分布式爬虫。
回答3:可以网上找下tornade异步爬虫吧,我正在用这个
相关文章:
1. vue.js - android环境下在vue中引入vux.js 报错。2. node.js - npm安装模块时,在cmd上显示的是一条白线,白线前面是一天反斜线转圈圈,然后就出现npm ERR错误了,求帮助,谢谢3. mac连接阿里云docker集群,已经卡了2天了,求问?4. 无法为JSP编译类:无法解析类型java.util.Map $ Entry。从所需的.class文件间接引用它5. javascript - 事件的定义有无函数的区别6. css - width设置为100%之后列表无法居中7. javascript - 如何让双核浏览器默认选择急速模式渲染页面8. docker 17.03 怎么配置 registry mirror ?9. 登录mysql-front出现以下错误10. tp5.0|php8.0 在window系统上写定时任务,执行报错
排行榜

网公网安备