python数据分析pandas包入门学习(三)汇总和统计描述

本文参考《利用Python进行数据分析》的第五章 pandas入门

pandas拥有一组常用的数学和统计方法。它们大部分属于约简和汇总统计,用于从Series中提取单个值(如sum和mean),或从DataFrame的行或列中提取一个Series。跟对应的Numpy数组方法相比,它们都是基于没有缺失数据的假设而构建的。
python数据分析pandas包入门学习(三)汇总和统计描述_第1张图片

python数据分析pandas包入门学习(三)汇总和统计描述_第2张图片

idxmin()/idxmax():返回最小值最大值的索引
python数据分析pandas包入门学习(三)汇总和统计描述_第3张图片

cumsum():返回列累积和
python数据分析pandas包入门学习(三)汇总和统计描述_第4张图片

describe():产生汇总统计
python数据分析pandas包入门学习(三)汇总和统计描述_第5张图片

python数据分析pandas包入门学习(三)汇总和统计描述_第6张图片

python数据分析pandas包入门学习(三)汇总和统计描述_第7张图片

相关系数和协方差corr(), cov()
协方差cov():表示线性相关的方向,取值正无穷到负无穷。协方差为正值,说明一个变量变大另一个变量也变大;协方差取负值,说明一个变量变大另一个变量变小,取0说明两个变量咩有相关关系。
相关系数corr():不仅表示线性相关的方向,还表示线性相关的程度,取值[-1,1]。也就是说,相关系数为正值,说明一个变量变大另一个变量也变大;取负值说明一个变量变大另一个变量变小,取0说明两个变量没有相关关系。同时,相关系数的绝对值越接近1,线性关系越显著。
下图为计算a列和b列的相关系数corr()和协方差cov():
python数据分析pandas包入门学习(三)汇总和统计描述_第8张图片

corrwith():计算DataFrame的列(axis=0,默认)或行(axis=1)跟另外一个Series或DataFrame之间的相关系数:
python数据分析pandas包入门学习(三)汇总和统计描述_第9张图片

唯一值、值计数以及成员资格
unique():得到Series中的唯一值数值:
python数据分析pandas包入门学习(三)汇总和统计描述_第10张图片

value_counts():计算一个Series中各值出现的频率(默认降序排列):
python数据分析pandas包入门学习(三)汇总和统计描述_第11张图片

isin():判断成员资格,用于选取Series中或DataFrame列中数据的子集:
python数据分析pandas包入门学习(三)汇总和统计描述_第12张图片

python数据分析pandas包入门学习(三)汇总和统计描述_第13张图片








你可能感兴趣的:(python,pandas,读书笔记,python)