文章详情页

python - scrapy url去重

浏览：170日期：2022-08-24 16:35:16

问题描述

请问scrapy是url自动去重的吗？比如下面这段代码，为什么运行时start_urls里面的重复url会重复爬取了？

class TestSpider(scrapy.Spider): name = 'test' allowed_domains = ['baidu.com'] start_urls = [’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’, ’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’, ’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’,] def parse(self, response):for sel in response.xpath(’//p[@class='grid-list grid-list-spot']/ul/li’): item = TestspiderItem() item[’title’] = sel.xpath(’p[@class='list']/a/text()’)[0].extract() item[’link’] = sel.xpath(’p[@class='list']/a/@href’)[0].extract() yield item

问题解答

回答1：

建一个Url管理器，就不会重复抓取了

回答2：

知道了，改成这样就可以了。

def start_requests(self):

yield scrapy.Request(’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’, self.parse)yield scrapy.Request(’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’, self.parse)yield scrapy.Request(’http://baike.baidu.com/fenlei/%E5%A8%B1%E4%B9%90%E4%BA%BA%E7%89%A9’, self.parse)

Python 编程

上一条：python - 在pyqt中做微信的机器人,要在表格中显示微信好友的名字,却显示不出来,怎么解决?下一条：请教python编码风格和异常处理问题

相关文章：

1. javascript - webpack 多入口文件生成HTML文件；2. docker安装后出现Cannot connect to the Docker daemon.3. nignx - docker内nginx 80端口被占用4. node.js - mongoDB使用$gte的问题5. 计算机 - 我学习了C语言，数据结构和一点点java基础，想自学C++，请问买什么入门书籍好？6. java中关于直接插入排序遇到的问题。7. java - 如图，jsp页面的form中的action是怎么映射到这个位置的？为什么不写dynUser就可以映射到save？8. javascript - npm run build后调用api返回index.html9. docker绑定了nginx端口外部访问不到10. 我在centos容器里安装docker，也就是在容器里安装容器，报错了？

排行榜

					
					docker安装后出现Cannot connect to the Docker daemon.
nignx - docker内nginx 80端口被占用
node.js - mongoDB使用$gte的问题
javascript - webpack 多入口文件生成HTML文件；
docker绑定了nginx端口 外部访问不到
我在centos容器里安装docker，也就是在容器里安装容器，报错了？
java - 如图，jsp页面的form中的action是怎么映射到这个位置的？为什么不写dynUser就可以映射到save？
angular.js - angular内容过长展开收起效果
计算机 - 我学习了C语言，数据结构和一点点java基础，想自学C++，请问买什么入门书籍好？
javascript - npm run build后调用api返回index.html
java中关于直接插入排序遇到的问题。
				

热门标签