文章详情页

简述python Scrapy框架

浏览：77日期：2022-07-13 18:27:22

一、Scrapy框架简介

Scrapy是用纯Python实现一个为了爬取网站数据，提取结构性数据而编写的应用框架，用途非常广泛。利用框架，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容以及各种图片，非常的方便。它使用Twisted这个异步网络库来处理网络通讯，架构清晰，并且包含了各种中间件接口，可以灵活的完成各种需求。Scrapy是Python世界里面最强大的爬虫框架，它比BeautifulSoup更加完善，BeautifulSoup可以说是轮子，而Scrapy则是车子，不需要关注太多的细节。

二、Scrapy原理

1.ScrapyEngine(引擎):负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯，信号数据传递等。

2.Scheduler(调度器):它负责接受引擎发送过来的request请求，并按照定的方式进行整理排列，入队，当引擎需要时，交还给引擎。

3.Downloader(下载器):负责下载ScrapyEngine发送的所有requests请求，并将其获取到的responses交还给ScrapyEngine，由引擎交给Spider来处理。

4.Spider(爬虫):它负责处理所有Responses，从中分析提取数据，获取ltem字段需要的数据，并将需要跟进的URL提交给引擎，再次进入Scheduler。

5.ItemPipeline(管道):它负责处理Spider中获取到的ltem，并进行进行后期处理，详细分析，过滤，存储等的地方。

6.DownloaderMiddlewares(下载中间件):它是一个可以自定义扩展下载功能的组件。

7.SpiderMiddlewares(Spider中间件):它是一个可以自定扩展和操作引擎和Spider中间通信的功能组件比如进入Spider的Responses，和从Spider出去的Requests。

三、创建Scrapy项目

新建项目命令：

scrapy startproject xxx

在开始爬取之前,必须创建一个新的Scrapy项目。进入自定义的项目目录中，运行下列命令:

scrapy startproject xxx

其中，xxx为项目名称,可以看到将会创建一个xxx文件夹，目录结构大致如下:

简述python Scrapy框架

四、创建爬虫

创建爬虫的命令：

scrapy genspider 爬虫名字网站域名

应当注意的是爬虫名字不要和项目名字一-样，网站域名是允许爬虫采集的域名如，baidu. com，zhihu. com。创建后python文件如下:

简述python Scrapy框架

五、总结

Scrapy框架相当于一辆造好的车子，只要我们会开，我们就可以利用这辆车子去到任意想去的地方。通常我们使用的request的方法就相当于在出发前再去造一辆车子，这是相当麻烦的。学好Scrapy，对于网上80%的网站我们都可以进行爬取。

以上就是简述python Scrapy框架的详细内容，更多关于python Scrapy框架的资料请关注好吧啦网其它相关文章！

Python 编程

上一条：PyCharm vs VSCode，作为python开发者，你更倾向哪种IDE呢？下一条：python使用多线程查询数据库的实现示例

相关文章：

1. ASP常用日期格式化函数 FormatDate()2. Python数据相关系数矩阵和热力图轻松实现教程3. 什么是Python变量作用域4. 开发效率翻倍的Web API使用技巧5. bootstrap select2 动态从后台Ajax动态获取数据的代码6. CSS3中Transition属性详解以及示例分享7. js select支持手动输入功能实现代码8. Java xml数据格式返回实现操作9. vue使用moment如何将时间戳转为标准日期时间格式10. python 如何在 Matplotlib 中绘制垂直线

排行榜

					
					Python数据相关系数矩阵和热力图轻松实现教程
如何在PHP中读写文件
vue-drag-chart 拖动/缩放图表组件的实例代码
PHP正则表达式函数preg_replace用法实例分析
Java xml数据格式返回实现操作
php redis setnx分布式锁简单原理解析
Django使用channels + websocket打造在线聊天室
一个 2 年 Android 开发者的 18 条忠告
Spring @Primary和@Qualifier注解原理解析
Vue实现仿iPhone悬浮球的示例代码
vue将data恢复到初始状态 && 重新渲染组件实例
				

热门标签