【阶段二】Python数据分析Pandas工具使用06篇:探索性数据分析:异常数据的检测与处理

本篇的思维导图

【阶段二】Python数据分析Pandas工具使用06篇:探索性数据分析:异常数据的检测与处理_第1张图片

探索性数据分析:异常数据的检测与处理

异常值也称为离群点,就是那些远离绝大多数样本点的特殊群体,通常这样的数据点在数据集中都表现出不合理的特性。如果忽视这些异常值,在某些建模场景下就会导致结论的错误(如线性回归模型、K均值聚类等),所以在数据的探索过程中,有必要识别出这些异常值并处理好它们。通常,异常值的识别可以借助于图形法(如箱线图、正态分布图)。

基于箱线图识别异常

箱线图实际上就是利用数据的分位数识别其中的异常点,该图形属于典型的统计图形,在学术界和工业界都得到广泛的应用。箱线图的形状特征如图所示:

你可能感兴趣的:(python,数据分析,pandas,异常数据的检测与处理,基于箱线图识别异常)