文章详情页

python中scrapy处理项目数据的实例分析

浏览：74日期：2022-07-04 15:29:04

在我们处理完数据后，习惯把它放在原有的位置，但是这样也会出现一定的隐患。如果因为新数据的加入或者其他种种原因，当我们再次想要启用这个文件的时候，小伙伴们就会开始着急却怎么也翻不出来，似乎也没有其他更好的搜集办法，而重新进行数据整理显然是不现实的。下面我们就一起看看python爬虫中scrapy处理项目数据的方法吧。

1、拉取项目

$ git clone https://github.com/jonbakerfish/TweetScraper.git$ cd TweetScraper/$ pip install -r requirements.txt #add ’--user’ if you are not root$ scrapy list$ #If the output is ’TweetScraper’, then you are ready to go.

2、数据持久化

通过阅读文档，我们发现该项目有三种持久化数据的方式，第一种是保存在文件中，第二种是保存在Mongo中，第三种是保存在MySQL数据库中。因为我们抓取的数据需要做后期的分析，所以，需要将数据保存在MySQL中。

抓取到的数据默认是以Json格式保存在磁盘 ./Data/tweet/ 中的，所以，需要修改配置文件 TweetScraper/settings.py 。

ITEM_PIPELINES = { # ’TweetScraper.pipelines.SaveToFilePipeline’:100,#’TweetScraper.pipelines.SaveToMongoPipeline’:100, # replace `SaveToFilePipeline` with this to use MongoDB ’TweetScraper.pipelines.SavetoMySQLPipeline’:100, # replace `SaveToFilePipeline` with this to use MySQL}#settings for mysqlMYSQL_SERVER = '18.126.219.16'MYSQL_DB = 'scraper'MYSQL_TABLE = 'tweets' # the table will be created automaticallyMYSQL_USER = 'root' # MySQL user to use (should have INSERT access granted to the Database/TableMYSQL_PWD = 'admin123456' # MySQL user’s password

内容扩展：

scrapy.cfg是项目的配置文件

from scrapy.spider import BaseSpiderclass DmozSpider(BaseSpider):name = 'dmoz'allowed_domains = ['dmoz.org']start_urls = [ 'http://www.dmoz.org/Computers/Programming/Languages/Python/Books/', 'http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/']def parse(self, response): filename = response.url.split('/')[-2] open(filename, ’wb’).write(response.body)

到此这篇关于python中scrapy处理项目数据的实例分析的文章就介绍到这了,更多相关python爬虫中scrapy如何处理项目数据内容请搜索好吧啦网以前的文章或继续浏览下面的相关文章希望大家以后多多支持好吧啦网！

Python 编程

上一条：python全栈开发语法总结下一条：Java 基于UDP协议实现消息发送

相关文章：

1. chat.asp聊天程序的编写方法2. WML语言的基本情况3. 匹配模式 - XSL教程 - 44. xpath简介_动力节点Java学院整理5. xml中的空格之完全解说6. jsp+servlet简单实现上传文件功能（保存目录改进）7. 利用CSS制作3D动画8. 小技巧处理div内容溢出9. IE6/IE7/IE8/IE9中tbody的innerHTML不能赋值的完美解决方案10. asp读取xml文件和记数

排行榜

					
					docker容器调用yum报错的解决办法
利用CSS制作3D动画
asp读取xml文件和记数
jsp cookie+session实现简易自动登录
idea自定义快捷键的方法步骤
IE6/IE7/IE8/IE9中tbody的innerHTML不能赋值的完美解决方案
匹配模式 - XSL教程 - 4
解决ajax请求后台,有时收不到返回值的问题
chat.asp聊天程序的编写方法
不使用XMLHttpRequest对象实现Ajax效果的方法小结
xml中的空格之完全解说
				

热门标签