Orange_Spotty_Cat

3.4数据预处理（二） - 数据清洗（Data Cleansing）

简介

由于数据源在实际生活中千奇百怪，因此不经任何处理就进入数据库的数据很可能违背数据质量三要素的要求。用这样的数据在进行后续的数据挖掘，其可靠性更加堪忧。虽然在数据挖掘中，均有过程用于处理缺失数据或异常值，但是这不过是在避免建模的过拟合。如若希望尽可能小让缺失值、噪声等脏数据影响数据挖掘的结果，更有效的方法应是提高数据质量，即进行数据清理过程。

一句话解释版本：

数据清洗就是通过缺失值处理，噪声数据光滑，识别删除离散值等方法来提升数据质量的过程。

数据分析与挖掘体系位置

数据清洗是有数据预处理中的一个过程。所以其在数据分析与数据挖掘中的位置如下图所示。

数据清洗的步骤

数据清洗的步骤相对较为简单与清晰，有两个阶段：

第一步：偏差检测（Discrepancy Detection）：即检查导致偏差的因素，并识别离散值与噪声值。

第二部：数据清洗（Data Cleansing）：即处理缺失值与噪声。

偏差检测的方法

偏差检测的目的是为了有效的开展数据清理工作。因此，就需要在此阶段明确缺失值与噪声为何存在，数据的质量如何，数据的字段是如何定义等信息。

数据检测的方法有这样几种：

数据源与字段调研

首先，我们可以了解与数据源相关的问题，以此确定数据的质量、字段的性质。比如，我们可以通过回答这些问题来进行偏差检测：

数据源是什么？有那几张表？表之间的关联关系是什么样的？
数据源表的上下游关系是什么？
数据源中有哪些字段？字段接口的格式是什么样子的？字段是什么类型？可接受值有哪些？

其次，我们可以通过数据描述统计中的指标对数据进行初步探索，比如：

观察字段集中趋势：均值、众数、中位数
观察字段离中趋势：方差、极值、分位数
图表显示：盒型图、散点图

之后，我们可以考虑数据中是否存在依赖，即是否有属性之间存在线性关系或者相关关系。

数据质量调研

质量好的数据有三个属性：唯一性、连续性、一致性。从这三个层面可以检验数据的偏差性。

唯一性检验

即检验数据是否存在重复，给定属性的每个值都要不同于该属性的其他值。就是看有没有重复数据。熟悉数据库的伙伴们会知道，传统关系型数据库中，主键的一个作用就是避免重复并检验重复。设定了主键了表，不能存在重复数据。因此知道主键的是哪个属性的表可以直接通过SQL检测重复，比如，在不考虑效率等因素的傻瓜模式下，table中A是主键，其余字段有B，C。只要对比 select count(*) from table的结果与select count(*) from table group by A的结果是否一致即可，不一致，很可能就是有重复。

连续性检验

即属性的最低与最高值之间没有缺失值，有些值需要是唯一的。一般我在检验连续性时会特别关注这几个点：

NA值的使用
Null值的使用
空值的使用
特殊符号（如？，%）的使用
制定空值的使用（如“Unknown”，“空”，“未知”）

一致性检验

一致性的检验与字段格式的说明有关，这里主要是检查数据的写入格式是否符合统一的规范，是否会存在字段过载等行为。在字段中，主要是一下三种类型：

字符型（如CHAR，VARCHAR）
数值型（如INTEGER，DECIMAL）
日期型（如DATE，TIMESTAMP）

对每个类型，都需要查看字段接口说明，检查格式的统一。

数据清洗的方法

缺失数据填补

填补缺失值的方法有如下3大类：

直接删除：

可以删除带有缺失值的记录，也可直接删除有缺失值的属性。但在实际中不太有效，尤其是在缺失值变化多，跨多个自变量的情况下。

人工填写：

用人手工填写上确实的值，听上去就不实际且费时间。大数据的分析可以直接忽略这个方法。

自动填充：

这个方法是目前用的最为广泛的。顾名思义，用某些值自动填充缺失值。依照自动填充的值不同，可以分为如下几类：

全局常量填充：用同一个常量替换所有的缺值。比如分类型的缺失值可以用“Unknown”填充，数值型的数据可以用“0”、‘空’填充。但是用全局常量填充的方法经常会造成被替换的常量值本身成为了影响模型判断的重要变量，从而影响结果的准确度。
中心度量填充：数据描述统计的知识中，提到数据集中趋势有呈现数据整体趋势的作用。因此，可以通过取属性的平均值、中位数、众数等指标，来填充缺失值。
同组均值填充：这个方法需要参考有缺失值记录的其他属性值。将数据按照其他属性分类做Group By，统计有缺失值一列的平均数或中位数等指标，并用其替换缺失值。用这种方法时，可以参考给定一种类型下的数据的分布，若数据skewness绝对值很大，或许中位数是更好的选择。
最有可能值填充：这种方法其实就是用样本中的已有变量（X）来预测有缺失值的变量（Y）。比如，可以用回归或者朴素贝叶斯等预测缺失值应该填写什么。但是，并不是所有都能适用此种方法。在数据表中，比如如果有缺失值的属性是主键（Primary Key），像是身份证号之类的，就不要企图通过模型预测了。尽管如此，这种方法仍然在数据清理中被应用的最广。

噪声数据光滑

噪声（Noise）是变量自带的随机误差。表现在数据分析中就是值方差/标准差。噪声一般通过盒型图或散点图来识别。

在数据中如果存在噪声过多，可能会因为个别离散值而使整个数据分析挖掘的效果降低。所以，我们希望能通过各种方法光滑数据，去除噪声。方法也有下面3类：

分箱（Binning）：

通过数据周围的值（临近值）来光滑有序数据。首先，将数据排序，其次将数据分入等频的箱中。将箱中的值统一替换成同样的指标值。因此，在分箱操作中，箱的宽度越大，光滑效果越明显。箱可以是等宽，也可自行定义。

这里通过指标的不同，分箱可以分为：

箱均值光滑：即用每个箱中数据的平均值替换箱中每一个值。
箱中位数光滑：即用每个箱中数据的中位数值替换箱中每一个值。
箱边界光滑：即定义箱中的最大和最小值为边界值，用最近的那个边界值替换箱中每一个值。

回归（Regression）：

将有噪声的变量拟合为一条直线（线性回归）或一条曲线（曲线回归）。这里一般的方法就是运用一元线性回归或多元线性回归，拟合出一条线或多维平面。进而使得噪声数据可以被光滑的线或面代替。

离群点分析（Outlier Analysis）：

通过聚类方法检测离群点。落在集群之外的值即为离群点，可以用集群的集中趋势指标代替或直接去除。

数据清洗的工具

除了Python，R，SQL等语言，还有一些工具可以帮助进行数据清洗工作。

数据清洗工具（Data Scrubbing Tool）：检查与纠正数据中错误，用于分析与模糊匹配。如Potter's Wheel.
数据审计工具（Data Auditing Tool）：发现相关性，数据偏差，识别离群点
数据迁移工具（Data Migration Tool）：ETL。

异常的核心类Throwable 无量 java 源码异常处理 exception
java异常的核心是Throwable，其他的如Error和Exception都是继承的这个类里面有个核心参数是detailMessage，记录异常信息，getMessage核心方法，获取这个参数的值，我们可以自己定义自己的异常类，去继承这个Exception就可以了，方法基本上，用父类的构造方法就OK，所以这么看异常是不是很easy package com.natsu;
mongoDB 游标（cursor）实现分页迭代开窍的石头 mongodb
上篇中我们讲了mongoDB 中的查询函数，现在我们讲mongo中如何做分页查询如何声明一个游标 var mycursor = db.user.find({_id:{$lte:5}}); 迭代显示游标数
MySQL数据库INNODB 表损坏修复处理过程 0624chenhong tomcat mysql
最近mysql数据库经常死掉，用命令net stop mysql命令也无法停掉，关闭Tomcat的时候，出现Waiting for N instance(s) to be deallocated 信息。查了下，大概就是程序没有对数据库连接释放，导致Connection泄露了。因为用的是开元集成的平台，内部程序也不可能一下子给改掉的，就验证一下咯。启动Tomcat,用户登录系统，用netstat -
剖析如何与设计人员沟通不懂事的小屁孩工作
最近做图烦死了，不停的改图，改图……。烦，倒不是因为改，而是反反复复的改，人都会死。很多需求人员不知该如何与设计人员沟通，不明白如何使设计人员知道他所要的效果，结果只能是沟通变成了扯淡，改图变成了应付。那应该如何与设计人员沟通呢？我认为设计人员与需求人员先天就存在语言障碍。对一个合格的设计人员来说，整天玩的都是点、线、面、配色，哪种构图看起来协调；哪种配色看起来合理心里跟明镜似的，
qq空间刷评论工具换个号韩国红果果 JavaScript
var a=document.getElementsByClassName('textinput'); var b=[]; for(var m=0;m<a.length;m++){ if(a[m].getAttribute('placeholder')!=null) b.push(a[m]) } var l
S2SH整合之session 灵静志远 spring AOP struts session
错误信息： Caused by: org.springframework.beans.factory.BeanCreationException: Error creating bean with name 'cartService': Scope 'session' is not active for the current thread; consider defining a scoped
xmp标签 a-john 标签
今天在处理数据的显示上遇到一个问题： var html = '<li><div class="pl-nr"><span class="user-name">' + user + '</span>' + text + '</div></li>'; ulComme
Ajax的常用技巧（2）---实现Web页面中的级联菜单 aijuans Ajax
在网络上显示数据，往往只显示数据中的一部分信息，如文章标题，产品名称等。如果浏览器要查看所有信息，只需点击相关链接即可。在web技术中，可以采用级联菜单完成上述操作。根据用户的选择，动态展开，并显示出对应选项子菜单的内容。在传统的web实现方式中，一般是在页面初始化时动态获取到服务端数据库中对应的所有子菜单中的信息，放置到页面中对应的位置，然后再结合CSS层叠样式表动态控制对应子菜单的显示或者隐
天-安-门，好高 atongyeye 情感
我是85后，北漂一族，之前房租1100，因为租房合同到期，再续，房租就要涨150。最近网上新闻，地铁也要涨价。算了一下，涨价之后，每次坐地铁由原来2块变成6块。仅坐地铁费用，一个月就要涨200。内心苦痛。晚上躺在床上一个人想了很久，很久。我生在农
android 动画百合不是茶 android 透明度平移缩放旋转
android的动画有两种 tween动画和Frame动画 tween动画;,透明度,缩放,旋转,平移效果 Animation 动画 AlphaAnimation 渐变透明度 RotateAnimation 画面旋转 ScaleAnimation 渐变尺寸缩放 TranslateAnimation 位置移动 Animation
查看本机网络信息的cmd脚本 bijian1013 cmd
@echo 您的用户名是：%USERDOMAIN%\%username%>"%userprofile%\网络参数.txt" @echo 您的机器名是：%COMPUTERNAME%>>"%userprofile%\网络参数.txt" @echo ___________________>>"%userprofile%\
plsql 清除登录过的用户征客丶 plsql
tools---preferences----logon history---history 把你想要删除的删除 -------------------------------------------------------------------- 若有其他凝问或文中有错误，请及时向我指出，我好及时改正，同时也让我们一起进步。 email ： binary_spac
【Pig一】Pig入门 bit1129 pig
Pig安装 1.下载pig wget http://mirror.bit.edu.cn/apache/pig/pig-0.14.0/pig-0.14.0.tar.gz 2. 解压配置环境变量如果Pig使用Map/Reduce模式，那么需要在环境变量中，配置HADOOP_HOME环境变量 expor
Java 线程同步几种方式 BlueSkator volatile synchronized ThredLocal ReenTranLock Concurrent
为何要使用同步？ java允许多线程并发控制，当多个线程同时操作一个可共享的资源变量时（如数据的增删改查），将会导致数据不准确，相互之间产生冲突，因此加入同步锁以避免在该线程没有完成操作之前，被其他线程的调用，从而保证了该变量的唯一性和准确性。 1.同步方法&
StringUtils判断字符串是否为空的方法（转帖） BreakingBad null StringUtils “”
转帖地址：http://www.cnblogs.com/shangxiaofei/p/4313111.html public static boolean isEmpty(String str) 　　判断某字符串是否为空，为空的标准是 str== null 或 str.length()== 0
编程之美-分层遍历二叉树 bylijinnan java 数据结构算法编程之美
import java.util.ArrayList; import java.util.LinkedList; import java.util.List; public class LevelTraverseBinaryTree { /** * 编程之美分层遍历二叉树 * 之前已经用队列实现过二叉树的层次遍历，但这次要求输出换行，因此要
jquery取值和ajax提交复习记录 chengxuyuancsdn jquery取值 ajax提交
// 取值 // alert($("input[name='username']").val()); // alert($("input[name='password']").val()); // alert($("input[name='sex']:checked").val()); // alert($("
推荐国产工作流引擎嵌入式公式语法解析器-IK Expression comsci java 应用服务器工作 Excel 嵌入式
这个开源软件包是国内的一位高手自行研制开发的，正如他所说的一样，我觉得它可以使一个工作流引擎上一个台阶。。。。。。欢迎大家使用，并提出意见和建议。。。 ----------转帖--------------------------------------------------- IK Expression是一个开源的（OpenSource），可扩展的（Extensible），基于java语言
关于系统中使用多个PropertyPlaceholderConfigurer的配置及PropertyOverrideConfigurer daizj spring
1、PropertyPlaceholderConfigurer Spring中PropertyPlaceholderConfigurer这个类，它是用来解析Java Properties属性文件值，并提供在spring配置期间替换使用属性值。接下来让我们逐渐的深入其配置。基本的使用方法是：(1) <bean id="propertyConfigurerForWZ&q
二叉树:二叉搜索树 dieslrae 二叉树
所谓二叉树,就是一个节点最多只能有两个子节点,而二叉搜索树就是一个经典并简单的二叉树.规则是一个节点的左子节点一定比自己小,右子节点一定大于等于自己(当然也可以反过来).在树基本平衡的时候插入,搜索和删除速度都很快,时间复杂度为O(logN).但是,如果插入的是有序的数据,那效率就会变成O(N),在这个时候,树其实变成了一个链表. tree代码:
C语言字符串函数大全 dcj3sjt126com c function
C语言字符串函数大全函数名: stpcpy 功能: 拷贝一个字符串到另一个用法: char *stpcpy(char *destin, char *source); 程序例: #include <stdio.h> #include <string.h> int main
友盟统计页面技巧 dcj3sjt126com 技巧
在基类调用就可以了, 基类ViewController示例代码 -(void)viewWillAppear:(BOOL)animated { [super viewWillAppear:animated]; [MobClick beginLogPageView:[NSString stringWithFormat:@"%@",self.class]];
window下在同一台机器上安装多个版本jdk，修改环境变量不生效问题处理办法 flyvszhb java jdk
window下在同一台机器上安装多个版本jdk，修改环境变量不生效问题处理办法本机已经安装了jdk1.7，而比较早期的项目需要依赖jdk1.6，于是同时在本机安装了jdk1.6和jdk1.7. 安装jdk1.6前，执行java -version得到 C:\Users\liuxiang2>java -version java version "1.7.0_21&quo
Java在创建子类对象的同时会不会创建父类对象 happyqing java 创建子类对象父类对象
1.在thingking in java 的第四版第六章中明确的说了，子类对象中封装了父类对象， 2."When you create an object of the derived class, it contains within it a subobject of the base class. This subobject is the sam
跟我学spring3 目录贴及电子书下载 jinnianshilongnian spring
一、《跟我学spring3》电子书下载地址：《跟我学spring3》（1-7 和 8-13） http://jinnianshilongnian.iteye.com/blog/pdf 跟我学spring3系列 word原版下载二、源代码下载最新依
第12章 Ajax（上） onestopweb Ajax
index.html <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/
BI and EIM 4.0 at a glance blueoxygen BO
http://www.sap.com/corporate-en/press.epx?PressID=14787 有机会研究下EIM家族的两个新产品~~~~ New features of the 4.0 releases of BI and EIM solutions include: Real-time in-memory computing –
Java线程中yield与join方法的区别 tomcat_oracle java
长期以来，多线程问题颇为受到面试官的青睐。虽然我个人认为我们当中很少有人能真正获得机会开发复杂的多线程应用(在过去的七年中，我得到了一个机会)，但是理解多线程对增加你的信心很有用。之前，我讨论了一个wait()和sleep()方法区别的问题，这一次，我将会讨论join()和yield()方法的区别。坦白的说，实际上我并没有用过其中任何一个方法，所以，如果你感觉有不恰当的地方，请提出讨论。 &nb
android Manifest.xml选项阿尔萨斯 Manifest
结构继承关系 public final class Manifest extends Objectjava.lang.Objectandroid.Manifest 内部类 class Manifest.permission权限 class Manifest.permission_group权限组构造函数 public Manifest () 详细 androi
Oracle实现类split函数的方 zhaoshijie oracle
关键字：Oracle实现类split函数的方项目里需要保存结构数据，批量传到后他进行保存，为了减小数据量，子集拼装的格式，使用存储过程进行保存。保存的过程中需要对数据解析。但是oracle没有Java中split类似的函数。从网上找了一个，也补全了一下。 CREATE OR REPLACE TYPE t_split_100 IS TABLE OF VARCHAR2(100); cr