文章详情页

python缺失值的解决方法总结

浏览：9日期：2022-06-17 10:12:32

1、解决方法

（1）忽视元组。

缺少类别标签时，通常这样做(假设挖掘任务与分类有关)，除非元组有多个属性缺失值，否则该方法不太有效。当个属性缺值的百分比变化很大时，其性能特别差。

（2）人工填写缺失值。

一般来说，这种方法需要很长时间，当数据集大且缺少很多值时，这种方法可能无法实现。

（3）使用全局常量填充缺失值。

将缺失的属性值用同一常数(如Unknown或负无限)替换。如果缺失值都是用unknown替换的话，挖掘程序可能会认为形成有趣的概念。因为有同样的价值unknown。因此，这种方法很简单，但不可靠。

（4）使用与给定元组相同类型的所有样本的属性平均值。

（5）使用最可能的值填充缺失值。

可以通过回归、使用贝叶斯形式化的基于推理的工具和决策树的总结来决定。

2、实例

import numpy as np from sklearn.preprocessing import Imputer imp = Imputer(missing_values=’NaN’, strategy=’mean’, axis=0) import numpy as npfrom sklearn.preprocessing import Imputer ###1.使用均值填充缺失值imp = Imputer(missing_values=’NaN’, strategy=’mean’, axis=0)imp.fit([[1, 2], [np.nan, 3], [7, 6]]) X = [[np.nan, 2], [6, np.nan], [7, 6]]print(imp.transform(X)) [[4. 2.] [6. 3.66666667] [7. 6.]]

知识点扩充：

缺失值的处理方法

由于各种各样的原因，真实世界中的许多数据集都包含缺失数据，这些数据经常被编码成空格、nans或者是其他的占位符。但是这样的数据集并不能被scikit - learn算法兼容，因为大多数的学习算法都会默认数组中的元素都是数值，因此素偶有的元素都有自己的代表意义。

使用不完整的数据集的一个基本策略就是舍弃掉整行或者整列包含缺失值的数值，但是这样处理会浪费大量有价值的数据。下面是处理缺失值的常用方法：

1.忽略元组

当缺少类别标签时通常这样做（假定挖掘任务涉及分类时），除非元组有多个属性缺失值，否则该方法不是很有效。当每个属性缺少值的百分比变化很大时，它的性能特别差。

2.人工填写缺失值

一般该方法很费时，并且当数据集很大，缺少很多值时，该方法可能行不通。

3.使用一个全局常量填充缺失值

将缺失的属性值用同一个常数(如“Unknown”或负无穷)替换。如果缺失值都用“unknown”替换，则挖掘程序可能会认为它们形成一个有趣的概念，因为它们都具有相同的值“unknown”。因此，虽然该方法很简单，但是它十分不可靠。

4.使用与给定元组属同一类的所有样本的属性均值

例如：将顾客按照credit_risk分类，则使用具有相同信用度的给定元组的顾客的平均收入替换income中的缺失值。

Python客栈送红包、纸质书

5.使用最可能的值填充缺失值

可以用回归、使用贝叶斯形式化的基于推理的工具或决策树归纳确定。例如，利用数据集中其他顾客的属性，可以构造一颗决策树来预测income的缺失值。

到此这篇关于python缺失值的解决方法总结的文章就介绍到这了,更多相关如何解决python缺失值内容请搜索好吧啦网以前的文章或继续浏览下面的相关文章希望大家以后多多支持好吧啦网！

Python 编程

上一条：Python合并多张图片成PDF下一条：Python激活Anaconda环境变量的详细步骤

相关文章：

1. 利用CSS3新特性创建透明边框三角2. 三个不常见的 HTML5 实用新特性简介3. 纯CSS实现鼠标放上去改变文字内容4. css代码优化的12个技巧5. XHTML 1.0：标记新的开端6. CSS3使用过度动画和缓动效果案例讲解7. CSS 使用Sprites技术实现圆角效果8. HTML <!DOCTYPE> 标签9. 详解盒子端CSS动画性能提升10. CSS3实例分享之多重背景的实现(Multiple backgrounds)

排行榜

					
					Django正则URL匹配实现流程解析
Python安装并操作redis实现流程详解
springboot+vue实现登录功能
使用Docker的NFS-Ganesha镜像搭建nfs服务器的详细过程
解决vue axios跨域 Request Method: OPTIONS问题(预检请求)
Python实现图片指定位置加图片水印（附Pyinstaller打包exe)
XML解析错误：未组织好 的解决办法
python小白切忌乱用表达式
Nginx+php配置文件及原理解析
Python爬虫实例——scrapy框架爬取拉勾网招聘信息
js实现简单五子棋游戏
				

热门标签