数据分析与挖掘笔记(七)------数据预处理之python主要数据预处理函数

函数名

所属库

功能

使用格式

实例

interpolate

Scipy

一维、高维数据插值。

interpolate是Scipy的一个子库,包含了大量的插值函数,如拉格朗日插值、样条插值、高维插值等。使用前需要用 from scipy.interpolate import * 引入相应的插值函数

 

f = scipy.interpolate.lagrange(x,y)。

这里展示了一维数据的拉格朗日插值的命令,其中x,y为对应的自变量和因变量数据。插值完成后,可以通过f(a)计算新的插值结果。类似的还有样条插值、多维数据插值等。

 

unique

Pandas/Numpy

去除数据中的重复元素,得到单值元素列表。它既是Numpy库的一个函数(np.unique()),也是Series对象的一个方法

[]np.unique(D),D是一维数据,也可以是list、array、Serise;

[]D.unique(), D是Pandas的Serise对象。

数据分析与挖掘笔记(七)------数据预处理之python主要数据预处理函数_第1张图片

isnull

Pandas

判断是否为空值/非空值

D.isnull()/D.notnull()。这里的D要求是Series对象,返回一个布尔Series。可以通过找出D中的空值/非空值。

 

notnull

Pandas

 

PCA

Scikit-Learn

对指标变量矩阵进行主成分分析。使用前需要用from sklearn.decomposition import PCA引入该函数

数据分析与挖掘笔记(七)------数据预处理之python主要数据预处理函数_第2张图片

random

Numpy

生成随机矩阵

random是Numpy的一个子库,可以用该库下的各种函数生成服从特定分布的随机矩阵,抽样时可以使用。

数据分析与挖掘笔记(七)------数据预处理之python主要数据预处理函数_第3张图片

 

你可能感兴趣的:(数据分析)