Pandas学习：系统性的学会Pandas的基本使用

目录

1、Pandas数据结构

1.1 为什么使用Pandas

1.2 Pandas数据结构

1.2.1 Series

（1）Series的创建

（2）Series的属性

1.2.2 DataFrame

（1）DataFrame的创建

（2）DataFrame的属性

（3）DatatFrame索引的设置

1.2.3 MultiIndex与Panel

（1）MultiIndex

（2）Panel

2、基本数据操作

2.1 索引操作

2.2.1 直接使用行列索引(先列后行)

2.2.2 结合loc或者iloc使用索引

2.2.3 使用ix组合索引（混合索引:下标和名称）

2.2 赋值操作

2.3 排序

2.3.1 DataFrame排序

2.3.2 Series排序

2.4 总结

3、DataFrame运算

3.1 算术运算

3.2 逻辑运算

3.2.1 逻辑运算符号

3.2.2 逻辑运算函数

3.2.3 统计运算

（1）describe

（2）统计函数

（3）累计统计函数

（4）自定义运算

4、Pandas画图

4.1 pandas.DataFrame.plot

`DataFrame.plot(kind='line')`

4.2 pandas.Series.plot

5、文件读取与存储

5.1 CSV

5.1.1 read_csv

5.1.2 to_csv

5.2 HDF5

5.2.1 read_hdf与to_hdf

5.2.2 案例

5.3 JSON

5.3.1 read_json

5.3.2 to_json

6、高级处理-缺失值处理

6.1 如何处理nan

6.2 电影数据的缺失值处理

6.2.1 判断缺失值是否存在

（1）`pd.notnull()`

（2）`pd.isnull()`

6.2.2 存在缺失值nan,并且是np.nan

6.2.3 不是缺失值nan，有默认标记的

7、高级处理-数据离散化

7.1 为什么要离散化

7.2 什么是数据的离散化

7.3 股票的涨跌幅离散化

7.3.1 读取股票的数据

7.3.2 将股票涨跌幅数据进行分组

7.3.3 股票涨跌幅分组数据变成one-hot编码

8、高级处理-合并

8.1 pd.concat实现数据合并

8.2 pd.merge

9、高级处理-交叉表与透视表

9.1 交叉表与透视表什么作用

9.2 案例分析

9.2.1 数据准备

9.2.2 查看效果

9.2.3 使用pivot_table(透视表)实现

10、高级处理-分组与聚合

10.1 什么分组与聚合

10.2 分组API

10.3 星巴克零售店铺数据

10.3.1 数据获取

10.3.2 进行分组聚合

11、电影案例分析

11.1 需求

11.2 实现

11.2.1 问题一：

11.2.2 问题二：

11.2.3 问题三：

1、Pandas数据结构

2008年WesMcKinney开发出的库
专门用于数据挖掘的开源python库
以Numpy为基础，借力Numpy模块在计算方面性能高的优势
基于matplotlib，能够简便的画图
独特的数据结构

1.1 为什么使用Pandas

Numpy已经能够帮助我们处理数据，能够结合matplotlib解决部分数据展示等问题，那么pandas学习的目的在什么地方呢？

（1）增强图表可读性
- 在numpy当中创建学生成绩表样式：
- 返回结果：

array([[92, 55, 78, 50, 50],
       [71, 76, 50, 48, 96],
       [45, 84, 78, 51, 68],
       [81, 91, 56, 54, 76],
       [86, 66, 77, 67, 95],
       [46, 86, 56, 61, 99],
       [46, 95, 44, 46, 56],
       [80, 50, 45, 65, 57],
       [41, 93, 90, 41, 97],
       [65, 83, 57, 57, 40]])

如果数据展示为这样，可读性就会更友好：

（2）便捷的数据处理能力
（3）读取文件方便
（4）封装了Matplotlib、Numpy的画图和计算

1.2 Pandas数据结构

Pandas中一共有三种数据结构，分别为：Series、DataFrame和MultiIndex（老版本中叫Panel ）。

其中Series是一维数据结构，DataFrame是二维的表格型数据结构，MultiIndex是三维的数据结构。

1.2.1 Series

Series是一个类似于一维数组的数据结构，它能够保存任何类型的数据，比如整数、字符串、浮点数等，主要由一组数据和与之相关的索引两部分构成。

（1）Series的创建

# 导入pandas
import pandas as pd

pd.Series(data=None, index=None, dtype=None)

参数：
- data：传入的数据，可以是ndarray、list等
- index：索引，必须是唯一的，且与数据的长度相等。如果没有传入索引参数，则默认会自动创建一个从0-N的整数索引。
- dtype：数据的类型

通过已有数据创建:

（1）指定内容，默认索引：

pd.Series(np.arange(10))

# 运行结果
0    0
1    1
2    2
3    3
4    4
5    5
6    6
7    7
8    8
9    9
dtype: int64

（2）指定索引：

pd.Series([6.7,5.6,3,10,2], index=[1,2,3,4,5])

# 运行结果
1     6.7
2     5.6
3     3.0
4    10.0
5     2.0
dtype: float64

（3）通过字典数据创建

color_count = pd.Series({'red':100, 'blue':200, 'green': 500, 'yellow':1000})
color_count

# 运行结果
blue       200
green      500
red        100
yellow    1000
dtype: int64

（2）Series的属性

为了更方便地操作Series对象中的索引和数据，Series中提供了两个属性index和values：

index：

color_count = pd.Series({'red':100, 'blue':200, 'green': 500, 'yellow':1000})

color_count.index

# 结果
Index(['blue', 'green', 'red', 'yellow'], dtype='object')

values：

color_count.values

# 结果
array([ 200,  500,  100, 1000])

也可以使用索引来获取数据：

color_count[2]

# 结果
100

1.2.2 DataFrame

DataFrame是一个类似于二维数组或表格(如excel)的对象，既有行索引，又有列索引：

行索引，表明不同行，横向索引，叫index，0轴，axis=0
列索引，表名不同列，纵向索引，叫columns，1轴，axis=1

（1）DataFrame的创建

# 导入pandas
import pandas as pd

pd.DataFrame(data=None, index=None, columns=None)

参数：
- index：行标签。如果没有传入索引参数，则默认会自动创建一个从0-N的整数索引。
- columns：列标签。如果没有传入索引参数，则默认会自动创建一个从0-N的整数索引。
通过已有数据创建

举例一：

pd.DataFrame(np.random.randn(2,3))

结果：

举例二：创建学生成绩表

使用np创建的数组显示方式，比较两者的区别。

# 生成10名同学，5门功课的数据
score = np.random.randint(40, 100, (10, 5))#均匀分布

# 结果
array([[92, 55, 78, 50, 50],
       [71, 76, 50, 48, 96],
       [45, 84, 78, 51, 68],
       [81, 91, 56, 54, 76],
       [86, 66, 77, 67, 95],
       [46, 86, 56, 61, 99],
       [46, 95, 44, 46, 56],
       [80, 50, 45, 65, 57],
       [41, 93, 90, 41, 97],
       [65, 83, 57, 57, 40]])

但是这样的数据形式很难看到存储的是什么的样的数据，可读性比较差！！

问题：如何让数据更有意义的显示？

# 使用Pandas中的数据结构
score_df = pd.DataFrame(score)

结果：

给分数数据增加行列索引,显示效果更佳：

增加行、列索引：

# 构造行索引序列
subjects = ["语文", "数学", "英语", "政治", "体育"]

# 构造列索引序列
stu = ['同学' + str(i) for i in range(score_df.shape[0])]

# 添加行索引
data = pd.DataFrame(score, columns=subjects, index=stu)

结果：

（2）DataFrame的属性

（1）shape

data.shape

# 结果
(10, 5)

（2）index

DataFrame的行索引列表

data.index

# 结果
Index(['同学0', '同学1', '同学2', '同学3', '同学4', '同学5', '同学6', '同学7', '同学8', '同学9'], dtype='object')

（3）columns

DataFrame的列索引列表

data.columns

# 结果
Index(['语文', '数学', '英语', '政治', '体育'], dtype='object')

（4）values

直接获取其中array的值

array([[54, 82, 62, 81, 47],
       [50, 58, 73, 72, 48],
       [88, 89, 49, 99, 83],
       [79, 81, 69, 45, 87],
       [87, 64, 62, 74, 85],
       [68, 56, 58, 77, 53],
       [77, 49, 82, 48, 82],
       [96, 49, 67, 94, 71],
       [98, 77, 44, 99, 41],
       [71, 52, 74, 90, 44]])

（5）T

转置

data.T

结果：

（6）head(5)：显示前5行内容

如果不补充参数，默认5行。填入参数N则显示前N行

data.head(5)

结果：

（7）tail(5):显示后5行内容

如果不补充参数，默认5行。填入参数N则显示后N行

data.tail(5)

结果：

（3）DatatFrame索引的设置

现在要将下图的行索引改变，变成下下图所示样子，怎么做呢？

(1)修改行列索引值

stu = ["学同学_" + str(i) for i in range(score_df.shape[0])]

# 必须整体全部修改
data.index = stu

注意：以下修改方式是错误的，说明不能单独修改

# 错误修改方式，不能单个修改
data.index[3] = '学生_3'

（2）重设索引
- reset_index(drop=False)
  - 设置新的下标索引
  - drop:默认为False，不删除原来索引，如果为True,删除原来的索引值

# 重置索引,drop=False
data.reset_index()

结果：

# 重置索引,drop=True
data.reset_index()

结果：

（3）以某列值设置为新的索引
set_index(keys, drop=True)
- keys : 列索引名成或者列索引名称的列表
- drop : boolean, default True.当做新的索引，删除原来的列

设置新索引案例：

1、创建

df = pd.DataFrame({'month': [1, 4, 7, 10],
                    'year': [2012, 2014, 2013, 2014],
                    'sale':[55, 40, 84, 31]})

   month  sale  year
0  1      55    2012
1  4      40    2014
2  7      84    2013
3  10     31    2014

2、以月份设置新的索引

df.set_index('month')
       sale  year
month
1      55    2012
4      40    2014
7      84    2013
10     31    2014

3、设置多个索引，以年和月份

df = df.set_index(['year', 'month'])
df
            sale
year  month
2012  1     55
2014  4     40
2013  7     84
2014  10    31

注：通过刚才的设置，这样DataFrame就变成了一个具有MultiIndex的DataFrame。

1.2.3 MultiIndex与Panel

（1）MultiIndex

MultiIndex是三维的数据结构;

多级索引（也称层次化索引）是pandas的重要功能，可以在Series、DataFrame对象上拥有2个以及2个以上的索引。

（1）multiIndex的特性

打印刚才的df的行索引结果

df
            sale
year  month
2012  1     55
2014  4     40
2013  7     84
2014  10    31

df.index

MultiIndex(levels=[[2012, 2013, 2014], [1, 4, 7, 10]],
           labels=[[0, 2, 1, 2], [0, 1, 2, 3]],
           names=['year', 'month'])

多级或分层索引对象。

index属性
- names:levels的名称
- levels：每个level的元组值

df.index.names
# FrozenList(['year', 'month'])

df.index.levels
# FrozenList([[2012, 2013, 2014], [1, 4, 7, 10]])

（2）multiIndex的创建

arrays = [[1, 1, 2, 2], ['red', 'blue', 'red', 'blue']]
pd.MultiIndex.from_arrays(arrays, names=('number', 'color'))

# 结果
MultiIndex(levels=[[1, 2], ['blue', 'red']],
           codes=[[0, 0, 1, 1], [1, 0, 1, 0]],
           names=['number', 'color'])

（2）Panel

（1）panel的创建
- class pandas.Panel(data=None, items=None, major_axis=None, minor_axis=None)
  - 作用：存储3维数组的Panel结构
  - 参数：
    - data : ndarray或者dataframe
    - items : 索引或类似数组的对象，axis=0
    - major_axis : 索引或类似数组的对象，axis=1
    - minor_axis : 索引或类似数组的对象，axis=2

p = pd.Panel(data=np.arange(24).reshape(4,3,2),
                 items=list('ABCD'),
                 major_axis=pd.date_range('20130101', periods=3),
                 minor_axis=['first', 'second'])

# 结果
<class 'pandas.core.panel.Panel'>
Dimensions: 4 (items) x 3 (major_axis) x 2 (minor_axis)
Items axis: A to D
Major_axis axis: 2013-01-01 00:00:00 to 2013-01-03 00:00:00
Minor_axis axis: first to second

（2）查看panel数据

p[:,:,"first"]
p["B",:,:]

注：Pandas从版本0.20.0开始弃用：推荐的用于表示3D数据的方法是通过DataFrame上的MultiIndex方法。

2、基本数据操作

为了更好的理解这些基本操作，我们将读取一个真实的股票数据。关于文件操作，后面在介绍，这里只先用一下API。

# 读取文件
data = pd.read_csv("./data/stock_day.csv")

# 删除一些列，让数据更简单些，再去做后面的操作
data = data.drop(["ma5","ma10","ma20","v_ma5","v_ma10","v_ma20"], axis=1)

2.1 索引操作

Numpy当中我们已经讲过使用索引选取序列和切片选择，pandas也支持类似的操作，也可以直接使用列名、行名称，甚至组合使用。

2.2.1 直接使用行列索引(先列后行)

获取’2018-02-27’这天的’open’的结果：

# 直接使用行列索引名字的方式（先列后行）
data['open']['2018-02-27']
23.53

# 不支持的操作
# 错误
data['2018-02-27']['open']
# 错误
data[:1, :2]

2.2.2 结合loc或者iloc使用索引

获取从’2018-02-27’到’2018-02-22’，'open’的结果：

# 使用loc:只能指定行列索引的名字
data.loc['2018-02-27':'2018-02-22', 'open']

2018-02-27    23.53
2018-02-26    22.80
2018-02-23    22.88
Name: open, dtype: float64

# 使用iloc可以通过索引的下标去获取
# 获取前3天数据,前5列的结果
data.iloc[:3, :5]

            open    high    close    low
2018-02-27    23.53    25.88    24.16    23.53
2018-02-26    22.80    23.78    23.53    22.80
2018-02-23    22.88    23.37    22.82    22.71

2.2.3 使用ix组合索引（混合索引:下标和名称）

获取行第1天到第4天，[‘open’, ‘close’, ‘high’, ‘low’]这个四个指标的结果：

# 使用ix进行下表和名称组合做引
data.ix[0:4, ['open', 'close', 'high', 'low']]

# 推荐使用loc和iloc来获取的方式
data.loc[data.index[0:4], ['open', 'close', 'high', 'low']]
data.iloc[0:4, data.columns.get_indexer(['open', 'close', 'high', 'low'])]

            open    close    high    low
2018-02-27    23.53    24.16    25.88    23.53
2018-02-26    22.80    23.53    23.78    22.80
2018-02-23    22.88    22.82    23.37    22.71
2018-02-22    22.25    22.28    22.76    22.02

2.2 赋值操作

对DataFrame当中的close列进行重新赋值为1。

# 直接修改原来的值
data['close'] = 1 # 这一列都变成1
# 或者
data.close = 1

2.3 排序

排序有两种形式，一种对于索引进行排序，一种对于内容进行排序:

2.3.1 DataFrame排序

（1）使用df.sort_values(by=, ascending=)
- 单个键或者多个键进行排序,
- 参数：
  - by：指定排序参考的键
  - ascending:默认升序
    - ascending=False:降序
    - ascending=True:升序

如下：

例一：

# 按照开盘价大小进行排序 , 使用ascending指定按照大小排序
data.sort_values(by="open", ascending=True).head()

结果：

例二：

# 按照多个键进行排序
data.sort_values(by=['open', 'high'])

结果：

（2）使用df.sort_index(ascending=)给索引进行排序

这个股票的日期索引原来是从大到小，现在重新排序，从小到大:

# 对索引进行排序
data.sort_index()

结果：

2.3.2 Series排序

（1）使用series.sort_values(ascending=True)进行排序

series排序时，只有一列，不需要参数

data['p_change'].sort_values(ascending=True).head()

2015-09-01   -10.03
2015-09-14   -10.02
2016-01-11   -10.02
2015-07-15   -10.02
2015-08-26   -10.01
Name: p_change, dtype: float64

（2）使用series.sort_index()进行排序

与df一致

# 对索引进行排序
data['p_change'].sort_index().head()

2015-03-02    2.62
2015-03-03    1.44
2015-03-04    1.57
2015-03-05    2.02
2015-03-06    8.51
Name: p_change, dtype: float64

2.4 总结

3、DataFrame运算

3.1 算术运算

（1）add(other)

比如进行数学运算加上具体的一个数字

data['open'].head().add(1)

2018-02-27    24.53
2018-02-26    23.80
2018-02-23    23.88
2018-02-22    23.25
2018-02-14    22.49
Name: open, dtype: float64

（2）sub(other)

整个列减一个数

data.open.head().sub(2)

2018-02-27    21.53
2018-02-26    20.80
2018-02-23    20.88
2018-02-22    20.25
2018-02-14    19.49
Name: open, dtype: float64

3.2 逻辑运算

3.2.1 逻辑运算符号

例如筛选data[“open”] > 23的日期数据
- data[“open”] > 23返回逻辑结果

data["open"] > 23

2018-02-27     True
2018-02-26    False
2018-02-23    False
2018-02-22    False
2018-02-14    False

# 逻辑判断的结果可以作为筛选的依据
data[data["open"] > 23].head()

结果：

完成多个逻辑判断：

data[(data["open"] > 23) & (data["open"] < 24)].head()

3.2.2 逻辑运算函数

（1）query(expr)
- expr:查询字符串

通过query使得刚才的过程更加方便简单，下面是使用的例子：

data.query("open<24 & open>23").head()

结果：

（2）isin(values)

例如判断’open’是否为23.53和23.85：

# 可以指定值进行一个判断，从而进行筛选操作
data[data["open"].isin([23.53, 23.85])]

3.2.3 统计运算

（1）describe

综合分析: 能够直接得出很多统计结果,count, mean, std, min, max 等

# 计算平均值、标准差、最大值、最小值
data.describe()

（2）统计函数

看一下min(最小值), max(最大值), mean(平均值), median(中位数), var(方差), std(标准差),mode(众数)是怎么操作的:

统计函数	描述
sum	求和
mean	平均值
median	中位数
min	最小值
max	最大值
mode	众数
abs	绝对值
prod	乘积
std	标准差
var	方差
idxmax	最大值索引
idxmin	最小值索引

对于单个函数去进行统计的时候，坐标轴还是按照默认列“columns” (axis=0, default)，如果要对行“index” 需要指定(axis=1)。

（1）max()、min()

# 使用统计函数：0 代表列求结果， 1 代表行求统计结果
data.max(axis=0) # 最大值

open                   34.99
high                   36.35
close                  35.21
low                    34.01
volume             501915.41
price_change            3.03
p_change               10.03
turnover               12.56
my_price_change         3.41
dtype: float64

（2）std()、var()

# 方差
data.var(axis=0)

open               1.545255e+01
high               1.662665e+01
close              1.554572e+01
low                1.437902e+01
volume             5.458124e+09
price_change       8.072595e-01
p_change           1.664394e+01
turnover           4.323800e+00
my_price_change    6.409037e-01
dtype: float64

# 标准差
data.std(axis=0)

open                   3.930973
high                   4.077578
close                  3.942806
low                    3.791968
volume             73879.119354
price_change           0.898476
p_change               4.079698
turnover               2.079375
my_price_change        0.800565
dtype: float64

（3）median()：中位数

中位数为将数据从小到大排列，在最中间的那个数为中位数。如果没有中间数，取中间两个数的平均值。

data.median(axis=0)

open               21.44
high               21.97
close              10.00
low                20.98
volume          83175.93
price_change        0.05
p_change            0.26
turnover            2.50
dtype: float64

（4）idxmax()、idxmin()

# 求出最大值的位置
data.idxmax(axis=0)

open               2015-06-15
high               2015-06-10
close              2015-06-12
low                2015-06-12
volume             2017-10-26
price_change       2015-06-09
p_change           2015-08-28
turnover           2017-10-26
my_price_change    2015-07-10
dtype: object


# 求出最小值的位置
data.idxmin(axis=0)

open               2015-03-02
high               2015-03-02
close              2015-09-02
low                2015-03-02
volume             2016-07-06
price_change       2015-06-15
p_change           2015-09-01
turnover           2016-07-06
my_price_change    2015-06-15
dtype: object

（3）累计统计函数

函数	作用
cumsum	计算前1/2/3/…/n个数的和
cummax	计算前1/2/3/…/n个数的最大值
cummin	计算前1/2/3/…/n个数的最小值
cumprod	计算前1/2/3/…/n个数的积

那么这些累计统计函数怎么用？

以上这些函数可以对series和dataframe操作，这里我们按照时间的从前往后来进行累计

排序

# 排序之后，进行累计求和
data = data.sort_index()

对p_change进行求和

stock_rise = data['p_change']

stock_rise.cumsum()

2015-03-02      2.62
2015-03-03      4.06
2015-03-04      5.63
2015-03-05      7.65
2015-03-06     16.16
2015-03-09     16.37
2015-03-10     18.75
2015-03-11     16.36
2015-03-12     15.03
2015-03-13     17.58
2015-03-16     20.34
2015-03-17     22.42
2015-03-18     23.28
2015-03-19     23.74
2015-03-20     23.48
2015-03-23     23.74

那么如何让这个连续求和的结果更好的显示呢？

如果要使用plot函数，需要导入matplotlib.下面是绘图代码：

import matplotlib.pyplot as plt
# plot显示图形, plot方法集成了直方图、条形图、饼图、折线图
stock_rise.cumsum().plot()
# 需要调用show，才能显示出结果
plt.show()

结果：

关于plot，稍后会介绍API的选择。

（4）自定义运算

apply(func, axis=0)
- func:自定义函数
- axis=0:默认是列，axis=1为行进行运算
定义一个对列，最大值-最小值的函数

下面看个例子：

data[['open', 'close']].apply(lambda x: x.max() - x.min(), axis=0)

open     22.74
close    22.85
dtype: float64

特定需求需要用这个。

4、Pandas画图

4.1 pandas.DataFrame.plot

DataFrame.plot(kind='line')
- kind : str，需要绘制图形的种类
  - ‘line’ : 折线图
  - ‘bar’ : 条形图
  - ‘barh’ : 横放的条形图
  - ‘hist’ : 直方图
  - ‘pie’ : 饼图
  - ‘scatter’ : 散点图

关于“barh”的解释：
http://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.DataFrame.plot.barh.html

更多细节：https://pandas.pydata.org/pandas-docs/stable/generated/pandas.DataFrame.plot.html?highlight=plot#pandas.DataFrame.plot

看个例子：

import matplotlib.pyplot as plt
# plot显示图形, plot方法集成了直方图、条形图、饼图、折线图
stock_rise.cumsum().plot(kind="line")
# 需要调用show，才能显示出结果
plt.show()

结果：

4.2 pandas.Series.plot

更多细节：https://pandas.pydata.org/pandas-docs/stable/generated/pandas.Series.plot.html?highlight=plot#pandas.Series.plot

注：使用的时候查看。

5、文件读取与存储

我们的数据大部分存在于文件当中，所以pandas会支持复杂的IO操作，pandas的API支持众多的文件格式，如CSV、SQL、XLS、JSON、HDF5。

注：最常用的HDF5和CSV文件

接下来重点看一下，应用CSV方式、HDF方式和json方式实现文件的读取和存储。

5.1 CSV

5.1.1 read_csv

pandas.read_csv(filepath_or_buffer, sep =',', usecols )
- filepath_or_buffer:文件路径
- sep :分隔符，默认用","隔开
- usecols:指定读取的列名，列表形式

举例：读取之前的股票的数据：

# 读取文件,并且指定只获取'open', 'close'指标
data = pd.read_csv("./data/stock_day.csv", usecols=['open', 'close'])

            open    close
2018-02-27    23.53    24.16
2018-02-26    22.80    23.53
2018-02-23    22.88    22.82
2018-02-22    22.25    22.28
2018-02-14    21.49    21.92

5.1.2 to_csv

DataFrame.to_csv(path_or_buf=None, sep=', ’, columns=None, header=True, index=True, mode='w', encoding=None)
- path_or_buf :文件路径
- sep :分隔符，默认用","隔开
- columns :选择需要的列索引
- header :boolean or list of string, default True,是否写进列索引值
- index:是否写进行索引
- mode:‘w’：重写, ‘a’ 追加

举例：保存读取出来的股票数据
保存’open’列的数据，然后读取查看结果：

# 选取10行数据保存,便于观察数据
data[:10].to_csv("./data/test.csv", columns=['open'])

# 读取，查看结果
pd.read_csv("./data/test.csv")

     Unnamed: 0    open
0    2018-02-27    23.53
1    2018-02-26    22.80
2    2018-02-23    22.88
3    2018-02-22    22.25
4    2018-02-14    21.49
5    2018-02-13    21.40
6    2018-02-12    20.70
7    2018-02-09    21.20
8    2018-02-08    21.79
9    2018-02-07    22.69

会发现将索引存入到文件当中，变成单独的一列数据。如果需要删除，可以指定index参数,删除原来的文件，重新保存一次。

下面例子把index指定为False，那么保存的时候就不会保存行索引了：

# index:存储不会将索引值变成一列数据
data[:10].to_csv("./data/test.csv", columns=['open'], index=False)

当然我们也可以这么做，就是把索引保存到文件中，读取的时候变成了一列，那么可以把这个列再变成索引，如下：

# 把Unnamed: 0这一列，变成行索引
open.set_index(["Unnamed: 0"])

# 把索引名字变成index
open.index.name = "index"

5.2 HDF5

5.2.1 read_hdf与to_hdf

HDF5文件的读取和存储需要指定一个键，值为要存储的DataFrame

（1）pandas.read_hdf(path_or_buf，key =None，** kwargs)
- path_or_buffer:文件路径
- key:读取的键
- return:Theselected object
（2）DataFrame.to_hdf(path_or_buf, key, **kwargs)

5.2.2 案例

读取文件

day_close = pd.read_hdf("./data/day_close.h5")

如果读取的时候出现以下错误

需要安装安装tables模块避免不能读取HDF5文件

pip install tables

存储文件

day_close.to_hdf("./data/test.h5", key="day_close")

再次读取的时候, 需要指定键的名字

new_close = pd.read_hdf("./data/test.h5", key="day_close")

注意：优先选择使用HDF5文件存储

HDF5在存储的时候支持压缩，使用的方式是blosc，这个是速度最快的也是pandas默认支持的
使用压缩可以提磁盘利用率，节省空间
HDF5还是跨平台的，可以轻松迁移到hadoop 上面

5.3 JSON

JSON是我们常用的一种数据交换格式，在前后端的交互经常用到，也会在存储的时候选择这种格式。所以我们需要知道Pandas如何进行读取和存储JSON格式。

5.3.1 read_json

pandas.read_json(path_or_buf=None, orient=None, typ='frame', lines=False)
- path_or_buf : 路径
- orient : string,以什么样的格式显示.下面是5种格式：
  - （1）‘split’ : dict like {index -> [index], columns -> [columns], data -> [values]}
    - split 将索引总结到索引，列名到列名，数据到数据。将三部分都分开了
  - （2）‘records’ : list like [{column -> value}, … , {column -> value}]
    - records 以columns：values的形式输出
  - （3）‘index’ : dict like {index -> {column -> value}}
    - index 以index：{columns：values}…的形式输出
  - （4）‘columns’ : dict like {column -> {index -> value}},默认该格式
    - colums 以columns:{index:values}的形式输出
  - （5）‘values’ : just the values array
    - values 直接输出值
- lines : boolean, default False
  - 按照每行读取json对象
- typ : default ‘frame’，指定转换成的对象类型series或者dataframe

案例：

数据介绍：

这里使用一个新闻标题讽刺数据集，格式为json。is_sarcastic：1讽刺的，否则为0；headline：新闻报道的标题；article_link：链接到原始新闻文章。存储格式为：

{"article_link": "https://www.huffingtonpost.com/entry/versace-black-code_us_5861fbefe4b0de3a08f600d5", "headline": "former versace store clerk sues over secret 'black code' for minority shoppers", "is_sarcastic": 0}
{"article_link": "https://www.huffingtonpost.com/entry/roseanne-revival-review_us_5ab3a497e4b054d118e04365", "headline": "the 'roseanne' revival catches up to our thorny political mood, for better and worse", "is_sarcastic": 0}

读取

orient指定存储的json格式，lines指定按照行去变成一个样本：

json_read = pd.read_json("./data/Sarcasm_Headlines_Dataset.json", orient="records", lines=True)

结果为：

5.3.2 to_json

DataFrame.to_json(path_or_buf=None, orient=None, lines=False)
- 将Pandas 对象存储为json格式
- path_or_buf=None：文件地址
- orient:存储的json形式，{‘split’,’records’,’index’,’columns’,’values’}
- lines:一个对象存储为一行

案例：

存储文件

# 不指定lines=Treu，则保存成一行
json_read.to_json("./data/test.json", orient='records')

结果：

[{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/versace-black-code_us_5861fbefe4b0de3a08f600d5","headline":"former versace store clerk sues over secret 'black code' for minority shoppers","is_sarcastic":0},{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/roseanne-revival-review_us_5ab3a497e4b054d118e04365","headline":"the 'roseanne' revival catches up to our thorny political mood, for better and worse","is_sarcastic":0},{"article_link":"https:\/\/local.theonion.com\/mom-starting-to-fear-son-s-web-series-closest-thing-she-1819576697","headline":"mom starting to fear son's web series closest thing she will have to grandchild","is_sarcastic":1},{"article_link":"https:\/\/politics.theonion.com\/boehner-just-wants-wife-to-listen-not-come-up-with-alt-1819574302","headline":"boehner just wants wife to listen, not come up with alternative debt-reduction ideas","is_sarcastic":1},{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/jk-rowling-wishes-snape-happy-birthday_us_569117c4e4b0cad15e64fdcb","headline":"j.k. rowling wishes snape happy birthday in the most magical way","is_sarcastic":0},{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/advancing-the-worlds-women_b_6810038.html","headline":"advancing the world's women","is_sarcastic":0},....]

修改lines参数为True

# 指定lines=True，则多行存储
json_read.to_json("./data/test.json", orient='records', lines=True)

结果：

{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/versace-black-code_us_5861fbefe4b0de3a08f600d5","headline":"former versace store clerk sues over secret 'black code' for minority shoppers","is_sarcastic":0}
{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/roseanne-revival-review_us_5ab3a497e4b054d118e04365","headline":"the 'roseanne' revival catches up to our thorny political mood, for better and worse","is_sarcastic":0}
{"article_link":"https:\/\/local.theonion.com\/mom-starting-to-fear-son-s-web-series-closest-thing-she-1819576697","headline":"mom starting to fear son's web series closest thing she will have to grandchild","is_sarcastic":1}
{"article_link":"https:\/\/politics.theonion.com\/boehner-just-wants-wife-to-listen-not-come-up-with-alt-1819574302","headline":"boehner just wants wife to listen, not come up with alternative debt-reduction ideas","is_sarcastic":1}
{"article_link":"https:\/\/www.huffingtonpost.com\/entry\/jk-rowling-wishes-snape-happy-birthday_us_569117c4e4b0cad15e64fdcb","headline":"j.k. rowling wishes snape happy birthday in the most magical way","is_sarcastic":0}...

6、高级处理-缺失值处理

在pandas中，缺失值使用NaN来标记，如下图所示：

6.1 如何处理nan

按如下步骤进行：

（1）获取缺失值的标记方式(NaN或者其他标记方式)
（2）如果缺失值的标记方式是NaN
- 判断数据中是否包含NaN：
  - pd.isnull(df),
  - pd.notnull(df)
- 存在缺失值nan:
  - 1、删除存在缺失值的:dropna(axis='rows')
    注：不会修改原数据，需要接受返回值
  - 2、替换缺失值:fillna(value, inplace=True)
    - value:替换成的值
    - inplace:True:会修改原数据，False:不替换修改原数据，生成新的对象
（3）如果缺失值没有使用NaN标记，比如使用"？"
- 先替换‘?’为np.nan，然后继续处理

步骤就是上面的这样，下面通过例子来看看怎么使用pandas处理的：

6.2 电影数据的缺失值处理

电影数据文件获取

# 读取电影数据
movie = pd.read_csv("./data/IMDB-Movie-Data.csv")

6.2.1 判断缺失值是否存在

（1）pd.notnull()

# 判断是否是缺失值，是则返回False
pd.notnull(movie)

# 结果：
Rank    Title    Genre    Description    Director    Actors    Year    Runtime (Minutes)    Rating    Votes    Revenue (Millions)    Metascore
0    True    True    True    True    True    True    True    True    True    True    True    True
1    True    True    True    True    True    True    True    True    True    True    True    True
2    True    True    True    True    True    True    True    True    True    True    True    True
3    True    True    True    True    True    True    True    True    True    True    True    True
4    True    True    True    True    True    True    True    True    True    True    True    True
5    True    True    True    True    True    True    True    True    True    True    True    True
6    True    True    True    True    True    True    True    True    True    True    True    True
7    True    True    True    True    True    True    True    True    True    True    False    True

但是上面这样显然不好观察，我们可以借助np.all()来返回是否有缺失值。np.all()只要有一个就返回False，下面看例子：

np.all(pd.notnull(movie))

# 返回
False

（2）pd.isnull()
这个和上面的正好相反，判断是否是缺失值，是则返回True。

# 判断是否是缺失值，是则返回True
pd.isnull(movie).head()

# 结果：
	Rank	Title	Genre	Description	Director	Actors	Year	Runtime (Minutes)	Rating	Votes	Revenue (Millions)	Metascore
0	False	False	False	False	False	False	False	False	False	False	False	False
1	False	False	False	False	False	False	False	False	False	False	False	False
2	False	False	False	False	False	False	False	False	False	False	False	False
3	False	False	False	False	False	False	False	False	False	False	False	False
4	False	False	False	False	False	False	False	False	False	False	False	False

这个也不好观察，我们利用np.any() 来判断是否有缺失值，若有则返回True，下面看例子：

np.any(pd.isnull(movie))
# 返回
True

6.2.2 存在缺失值nan,并且是np.nan

1、删除

pandas删除缺失值，使用dropna的前提是，缺失值的类型必须是np.nan

# 不修改原数据
movie.dropna()

# 可以定义新的变量接受或者用原来的变量名
data = movie.dropna()

2、替换缺失值

# 替换存在缺失值的样本的两列
# 替换填充平均值，中位数
movie['Revenue (Millions)'].fillna(movie['Revenue (Millions)'].mean(), inplace=True)

替换所有缺失值：

# 这个循环，每次取出一列数据，然后用均值来填充
for i in movie.columns:
    if np.all(pd.notnull(movie[i])) == False:
        print(i)
        movie[i].fillna(movie[i].mean(), inplace=True)

6.2.3 不是缺失值nan，有默认标记的

直接看例子：

数据是这样的：

# 读入数据
wis = pd.read_csv("https://archive.ics.uci.edu/ml/machine-learning-databases/breast-cancer-wisconsin/breast-cancer-wisconsin.data")

以上数据在读取时，可能会报如下错误：

URLError: <urlopen error [SSL: CERTIFICATE_VERIFY_FAILED] certificate verify failed (_ssl.c:833)>

解决办法：

# 全局取消证书验证
import ssl
ssl._create_default_https_context = ssl._create_unverified_context

处理思路分析：

1、先替换‘?’为np.nan
- df.replace(to_replace=, value=)
  - to_replace:替换前的值
  - value:替换后的值

# 把一些其它值标记的缺失值，替换成np.nan
wis = wis.replace(to_replace='?', value=np.nan)

2、再进行缺失值的处理

# 删除
wis = wis.dropna()

3、验证：

np.all(pd.notnull(wis))
# 返回True，说明没有了缺失值

# 或者

np.any(pd.isnull(wis))
# 返回False，说明没有了缺失值

7、高级处理-数据离散化

7.1 为什么要离散化

连续属性离散化的目的是为了简化数据结构，数据离散化技术可以用来减少给定连续属性值的个数。离散化方法经常作为数据挖掘的工具。

7.2 什么是数据的离散化

连续属性的离散化就是在连续属性的值域上，将值域划分为若干个离散的区间，最后用不同的符号或整数值代表落在每个子区间中的属性值。

离散化有很多种方法，这里使用一种最简单的方式去操作：

原始人的身高数据：165，174，160，180，159，163，192，184
假设按照身高分几个区间段：150~165, 165~180,180~195

这样我们将数据分到了三个区间段，对应的标记为矮、中、高三个类别，最终要处理成一个"哑变量"矩阵。

下面通过股票数据的例子来看看，具体是怎么操作的。

7.3 股票的涨跌幅离散化

我们对股票每日的"p_change"这一列进行离散化，下图便是离散化后的结果，当前数据存在哪个区间，则这个区间标记为1，否则为0。

那具体怎么做的呢？接着看：

7.3.1 读取股票的数据

先读取股票的数据，筛选出p_change数据。

data = pd.read_csv("./data/stock_day.csv")
p_change= data['p_change']

7.3.2 将股票涨跌幅数据进行分组

下面是所在区间的个数。

使用的工具：

pd.qcut(data, q)：
- 对数据进行分组，将数据分成q组，一般会与value_counts搭配使用，统计每组的个数
series.value_counts()：统计每个分组中有多少数据。

# 自行分组
qcut = pd.qcut(p_change, 10)
# 计算分到每个组数据个数
qcut.value_counts()

# 运行结果：
(5.27, 10.03]                    65
(0.26, 0.94]                     65
(-0.462, 0.26]                   65
(-10.030999999999999, -4.836]    65
(2.938, 5.27]                    64
(1.738, 2.938]                   64
(-1.352, -0.462]                 64
(-2.444, -1.352]                 64
(-4.836, -2.444]                 64
(0.94, 1.738]                    63
Name: p_change, dtype: int64

自定义区间分组：

pd.cut(data, bins)

# 自己指定分组区间
bins = [-100, -7, -5, -3, 0, 3, 5, 7, 100]
p_counts = pd.cut(p_change, bins)
p_counts.value_counts()

# 运行结果：
(0, 3]        215
(-3, 0]       188
(3, 5]         57
(-5, -3]       51
(7, 100]       35
(5, 7]         35
(-100, -7]     34
(-7, -5]       28
Name: p_change, dtype: int64

7.3.3 股票涨跌幅分组数据变成one-hot编码

什么是one-hot编码
把每个类别生成一个布尔列，这些列中只有一列可以为这个样本取值为1.其又被称为热编码。

把下图中左边的表格转化为使用右边形式进行表示：

下面看看pandas中是怎么实现的：

pandas.get_dummies(data, prefix=None)
- data:array-like, Series, or DataFrame
- prefix:分组名字

下面是例子：

# 得出one-hot编码矩阵
dummies = pd.get_dummies(p_counts, prefix="rise")

运行结果：

8、高级处理-合并

如果你的数据由多张表组成，那么有时候需要将不同的内容合并在一起分析

8.1 pd.concat实现数据合并

pd.concat([data1, data2], axis=1)
- 按照行或列进行合并,axis=0为列索引，axis=1为行索引

比如我们将刚才处理好的one-hot编码与原数据合并:

# 按照行索引进行
pd.concat([data, dummies], axis=1)

结果：

8.2 pd.merge

pd.merge(left, right, how='inner', on=None)
- 可以指定按照两组数据的共同键值对合并或者左右各自
- left: DataFrame
- right: 另一个DataFrame
- on: 指定的共同键
- how:按照什么方式连接，下面的表格是说明

Merge method	SQL Join Name	Description
left	LEFT OUTER JOIN	Use keys from left frame only
right	RIGHT OUTER JOIN	Use keys from right frame only
outer	FULL OUTER JOIN	Use union of keys from both frames
inner	INNER JOIN	Use intersection of keys from both frames

例子：

left = pd.DataFrame({'key1': ['K0', 'K0', 'K1', 'K2'],
                        'key2': ['K0', 'K1', 'K0', 'K1'],
                        'A': ['A0', 'A1', 'A2', 'A3'],
                        'B': ['B0', 'B1', 'B2', 'B3']})

right = pd.DataFrame({'key1': ['K0', 'K1', 'K1', 'K2'],
                        'key2': ['K0', 'K0', 'K0', 'K0'],
                        'C': ['C0', 'C1', 'C2', 'C3'],
                        'D': ['D0', 'D1', 'D2', 'D3']})

内连接：健相同的取上，不同的删掉

# 默认内连接
result = pd.merge(left, right, on=['key1', 'key2'])

结果：

左连接：按左边的数据进行合并

result = pd.merge(left, right, how='left', on=['key1', 'key2'])

结果：

右连接：按右边的数据进行合并

result = pd.merge(left, right, how='right', on=['key1', 'key2'])

外链接：无论健是否相同都取上，对应不上的使用NaN填充。

result = pd.merge(left, right, how='outer', on=['key1', 'key2'])

结果：

9、高级处理-交叉表与透视表

9.1 交叉表与透视表什么作用

探究股票的涨跌与星期几有关？

以下图当中表示，week代表星期几，1,0代表这一天股票的涨跌幅是好还是坏，里面的数据代表比例

可以理解为所有时间为星期一等等的数据当中涨跌幅好坏的比例

交叉表：交叉表用于计算一列数据对于另外一列数据的分组个数(用于统计分组频率的特殊透视表)
- pd.crosstab(value1, value2)
透视表：透视表是将原有的DataFrame的列分别作为行索引和列索引，然后对指定的列应用聚集函数
- data.pivot_table(）
- DataFrame.pivot_table([], index=[])

9.2 案例分析

9.2.1 数据准备

准备两列数据，星期数据以及涨跌幅是好是坏数据
进行交叉表计算

# 寻找星期几跟股票张得的关系
# 1、先把对应的日期找到星期几
date = pd.to_datetime(data.index).weekday
data['week'] = date  # 增加一列

# 2、假如把p_change按照大小去分个类0为界限
data['posi_neg'] = np.where(data['p_change'] > 0, 1, 0)

# 通过交叉表找寻两列数据的关系
count = pd.crosstab(data['week'], data['posi_neg'])

结果：

但是我们看到count只是每个星期日子的好坏天数，并没有得到比例，该怎么去做？

对于每个星期一等的总天数求和，运用除法运算求出比例

# 算数运算，先求和
sum = count.sum(axis=1).astype(np.float32)

# 进行相除操作，得出比例
pro = count.div(sum, axis=0)

结果：

9.2.2 查看效果

使用plot画出这个比例，使用stacked的柱状图

pro.plot(kind='bar', stacked=True)
plt.show()

9.2.3 使用pivot_table(透视表)实现

使用透视表，刚才的过程更加简单

# 通过透视表，将整个过程变成更简单一些
data.pivot_table(['posi_neg'], index='week')

结果：

10、高级处理-分组与聚合

分组与聚合通常是分析数据的一种方式，通常与一些统计函数一起使用，查看数据的分组情况

10.1 什么分组与聚合

下图展示了分组与聚合的概念：

10.2 分组API

DataFrame.groupby(key, as_index=False)
- key:分组的列数据，可以多个

案例:不同颜色的不同笔的价格数据

col =pd.DataFrame({'color': ['white','red','green','red','green'], 'object': ['pen','pencil','pencil','ashtray','pen'],'price1':[5.56,4.20,1.30,0.56,2.75],'price2':[4.75,4.12,1.60,0.75,3.15]})

# 结果：
color    object    price1    price2
0    white    pen    5.56    4.75
1    red    pencil    4.20    4.12
2    green    pencil    1.30    1.60
3    red    ashtray    0.56    0.75
4    green    pen    2.75    3.15

进行分组，对颜色分组，price进行聚合：

# 按color分组，再取出price1列求平均值
col.groupby(['color'])['price1'].mean()
# 和上述一个功能
col['price1'].groupby(col['color']).mean()
# 结果：
color
green    2.025
red      2.380
white    5.560
Name: price1, dtype: float64

# 分组，数据的结构不变
col.groupby(['color'], as_index=False)['price1'].mean()
# 结果：
color    price1
0    green    2.025
1    red    2.380
2    white    5.560

10.3 星巴克零售店铺数据

现在我们有一组关于全球星巴克店铺的统计数据，如果我想知道美国的星巴克数量和中国的哪个多，或者我想知道中国每个省份星巴克的数量的情况，那么应该怎么办？

数据来源：https://www.kaggle.com/starbucks/store-locations/data

10.3.1 数据获取

从文件中读取星巴克店铺数据

# 导入星巴克店的数据
starbucks = pd.read_csv("./data/starbucks/directory.csv")

10.3.2 进行分组聚合

# 按照国家分组，求出每个国家的星巴克零售店数量
count = starbucks.groupby(['Country']).count()

画图显示结果:

count['Brand'].plot(kind='bar', figsize=(20, 8))
plt.show()

假设我们加入省市一起进行分组:

# 设置多个索引，set_index()
starbucks.groupby(['Country', 'State/Province']).count()

结果：

11、电影案例分析

11.1 需求

现在我们有一组从2006年到2016年1000部最流行的电影数据

数据来源：https://www.kaggle.com/damianpanek/sunday-eda/data

问题1：我们想知道这些电影数据中评分的平均分，导演的人数等信息，我们应该怎么获取？
问题2：对于这一组电影数据，如果我们想rating，runtime的分布情况，应该如何呈现数据？
问题3：对于这一组电影数据，如果我们希望统计电影分类(genre)的情况，应该如何处理数据？

11.2 实现

首先获取导入包，获取数据:

%matplotlib inline
import pandas  as pd 
import numpy as np
from matplotlib import pyplot as plt

#文件的路径
path = "./data/IMDB-Movie-Data.csv"
#读取文件
df = pd.read_csv(path)

11.2.1 问题一：

我们想知道这些电影数据中评分的平均分，导演的人数等信息，我们应该怎么获取？

得出评分的平均分

使用mean函数

df["Rating"].mean()

# 结果：
6.723200000000003

得出导演人数信息

求出唯一值，然后进行形状获取

## 导演的人数
# df["Director"].unique().shape[0] # 方法一
np.unique(df["Director"]).shape[0] # 方法二

644

11.2.2 问题二：

对于这一组电影数据，如果我们想Rating的分布情况，应该如何呈现数据？

直接呈现，以直方图的形式

选择分数列数据，进行plot

df["Rating"].plot(kind='hist',figsize=(20,8))
plt.show()

效果：

发现直接通过pandas的plot画图，显示的下标不合适，这个时候我们需要借助matplotlib来改变。

Rating进行分布展示

进行绘制直方图

# 1.添加画布
plt.figure(figsize=(20,8),dpi=100)

# 2.画图
plt.hist(df["Rating"].values,bins=20)
# 2.1 添加刻度线
max_ = df["Rating"].max()
min_ = df["Rating"].min()
x_ticks = np.linspace(min_, max_, num=21)
plt.xticks(x_ticks)
# 2.2添加网格线
plt.grid()

# 3.显示
plt.show()

数据分析：从上图中就可以发现，评分主要分布在5~8分之间

11.2.3 问题三：

对于这一组电影数据，如果我们希望统计电影分类(genre)的情况，应该如何处理数据？

思路分析
- 思路
  - 1、创建一个全为0的dataframe，列索引置为电影的分类，temp_df
  - 2、遍历每一部电影，temp_df中把分类出现的列的值置为1
  - 3、求和

下面接着看：

1、创建一个全为0的dataframe，列索引置为电影的分类，temp_df

# 进行字符串分割
temp_list = [i.split(",") for i in df["Genre"]]
# 获取电影的分类
genre_list = np.unique([i for j in temp_list for i in j]) 

# 增加新的列，创建全为0的dataframe
temp_df = pd.DataFrame(np.zeros([df.shape[0],genre_list.shape[0]]),columns=genre_list)

2、遍历每一部电影，temp_df中把分类出现的列的值置为1

for i in range(1000):
    #temp_list[i] 就是['Action','Adventure','Animation']等
    temp_df.ix[i,temp_list[i]]=1
    
print(temp_df.sum().sort_values()) # 求合并排序，ascending=False为倒序

3、求和,绘图

temp_df.sum().sort_values(ascending=False).plot(kind="bar",figsize=(20,8),fontsize=20,colormap="cool")
plt.show()

结果：

若有用，欢迎点赞，若有错，请指正，谢谢！

你可能感兴趣的:(Pandas学习)

pandas学习一敬德修业－自强不息 pandas 学习
series[ˈsɪəriːz]系列级数创建pandas对象方法及数据访问importpandasaspds1=pd.Series([1,2,3])#默认创建索引print(s1)print(s1.index)s2=pd.Series({‘山东’:1.1,‘北京’:1.2})#隐式指定索引和数据s3=pd.Series(data=[2.4,5.6],index=[‘天津’,‘上海’])#显示指定索
pandas学习二敬德修业－自强不息 pandas 学习 python
genre[ˈʒɒnrə]让column靠乐母操作pandas的index三种方法(重新设置行index,将某列设置为index,将index设置为列)importpandasaspddf=pd.DataFrame({‘地区’:[‘山东’,‘北京’],“⼈⼝”:[1.1,1.2],“省会”:[“济南”,“北京”]})print(df)print(df.index)重新创建一个行级索引df2=df.
pandas学习之concat合并及读写CSV文件 changzoe python python 合并 csv
读取CSV文件读取中文的CSV文件中有中文，用“UTF-8”会出现乱码问题，解决：importpandasaspdimportnumpyasnpdata=pd.read_csv('C:/Users/elenawang/Desktop/csv_res_1.csv',header=None,encoding="gb2312",names=['mobi','loc','time'])详细参数：读取CSV
快速上手Python三剑客--Pandas篇 ~聊音小生。快速上手Python三剑客 Python python pandas
Pandas学习什么是Pandas？Pandas是一个开源的数据分析和数据处理库，它是基于Python编程语言的Pandas提供了易于使用的数据结构和数据分析工具，特别适用于处理结构化数据，如表格型数据（类似于Excel表格）Pandas是数据科学和分析领域中常用的工具之一，它使得用户能够轻松地从各种数据源中导入数据，并对数据进行高效的操作和分析Pandas的数据结构有哪些？Pandas主要引入了
pandas学习笔记（一）坝坝头伯爵学习 python 机器学习
基本数据结构1.Series对于一个Series，其中最常用的属性为值（values）、索引（index）、名字（name），类型（dtype）s=pd.Series(np.random.randn(5),index=['a','b','c','d','e'],name='这是一个Series',dtype='float64')sa-0.152799b-1.208334c0.668842d1.54
5分钟搞定几百张表格转换，Python办公自动化就是这么6！木头里有虫911
最近在参加学习开源社区Datawhale组织的"21天精通Pandas学习"，其中有个练习题做起来很有意思，练习题本身很简单，我在这里稍微引申一下让大家体会一下Pandas处理数据功能的灵活和强大。题目如下：提供2020-04-12到2020-12-31日的美国新冠病毒（COVID-19）各个州的统计数据，原始数据是每一天为一份csv文件，每份csv文件包含了各个州的报告感染人数，死亡人数等数据，
python的pandas数据分析处理基础学习计算衎 python pandas 数据分析
pandas学习一、pandas基础1.什么是pandas？一个开源的python类库：用于数据分析、数据处理、数据可视化高性能容易使用的数据结构容易使用的数据分析工具很方便和其他类库一起使用：numpy：用于数学计算scikit-learn：用于机器学习2.pandas的安装方法一：pip3installpandas方法二：下载使用Python类库集成安装包：anacondalink：https
pandas学习-3 蓝剑狼
Pandas数据结构Series：基本技巧数据查看/重新索引/对齐/添加、修改、删除值#数据查看s=pd.Series(np.random.rand(50))print("1".center(40,'*'))print(s.head(3))print("2".center(40,'*'))print(s.tail())#.head()查看头部数据#.tail()查看尾部数据#默认查看5条#执行结果
pandas学习手札（四）-cumsum函数橘猫吃不胖
cumsum函数的使用Series.cumsum(self,axis=None,skipna=True,*args,**kwargs)ReturncumulativesumoveraDataFrameorSeriesaxis.ReturnsaDataFrameorSeriesofthesamesizecontainingthecumulativesum.cumulative是累计、累积的意思，也就
Python学习笔记4-Pandas CrazyWolf_081c
Pandas学习莫烦python，非常感谢~记录自己在学习python过程中的点滴。Pandas安装Anaconda安装pip安装Pandas基本介绍SeriesDataFramedtype:查看数据中的类型index:查看队列的序号（行）columns:查看数据的名称（列）values:查看数据所有值describe:查看数据的总结transpose:翻转数据（转置）sort_index:对数据
pandas学习笔记------set_index() ACE-Mayer 数据科学 Python 信号处理 python 数据挖掘机器学习
pandas中set_index()方法是专门用来将某一列设置为index的方法。主要参数：keys：需要设置为index的列名drop：TrueorFalse。将某列设置为index后，是否删除原来的该列。默认为True，即删除（Deletecolumnstobeusedasthenewindex.）append：TrueorFalse。新的index设置之后，是否要删除原来的index。默认为
pandas学习笔记-3 Aries_Li
6.pandas数据排序(源码见demo6.py)#!/usr/bin/envpython#encoding:utf-8importpandasaspdmovies=pd.read_csv('https://blog.searchinfogo.com/download/data/data/imdb_1000.csv')print(movies.head())print(movies['title'
Pandas学习毕业了迷茫
1/27这周主要学习了pandas。它是Python用于数据分析的主要模块。内容确实比较多，也可能是自己不怎么熟悉，所以即使看了两三遍视频依然还是有点蒙，在做题的时候完全想不到做法。先来看看本周一些小问题。1.操作中不小心误删除代码，通过Ctrl+z恢复。2.data=pd.DataFrame(np.arange(16).reshape((4,4)),index=["Ohio","Colorado
pandas学习汇总(关于怎样处理数据与分析) hannah2sah #python 数据分析
不知道有没有小伙伴跟我一样，之前也断断续续学习过python相关的知识，可是迟迟就是入不了门，开始是出现了问题，不知道怎么解决问题，动不动就是入门到放弃；后续是认认真真看视频，认认真真“复制”代码，可是还是没学懂，后续发现学习都还是一点一滴的来的，最开始就要从最最最简单的东西开始，从自己熟悉的东西入手，而不是看一些复杂的代码，从懂一行代码开始，再到后续慢慢学会看复杂的代码下面的内容基于《对比exc
pandas整表写入excel指定位置_Pandas学习笔记——读写Excel文件 weixin_39851872
一、环境准备Windows10python3.6.5pandas：可以使用pip进行安装(pipinstallpandas)开发工具：Anaconda或者PyCharm数据准备：从网络获取或自己生成的Excel格式数据二、学习内容使用Pandas读写Excel格式文件三、细节1导入pandasimportpandasaspd2获取数据源(直接获取数据源、先切换目录后获取数据源)读取csv文件数据，
没想到这么齐全！这份 Python 实战干货yyds Python数据挖掘 python 机器学习数据分析及可视化 python 开发语言机器学习人工智能数据分析
今天我分享一些Python学习神器资料，有需要的小伙文末自行免费领取。1.200+Python练手案例：2.Python全套视频教程等：3.浙大Python学习套装：*4.Python实战案例：5.Pandas学习大礼包6.学习手册大礼包Python知识手册网络编程、正则、mysql知识手册爬虫查询手册数据分析知识手册机器学习知识手册深度学习知识手册金融量化知识手册技术交流技术要学会分享、交流，不
2019-12-12 Pandas学习 TonyRecording
1.常用数据类型series一维，带标签(索引)的数组dataframe二维，series容器series对象本质由两个数组构成，一个数组构成对象的键（index）一个数组构成值（values）2.pandas读取外部数据pd.read_csv/excel("文件路径名")
numpy和pandas学习我为什么可以这么菜 Python学习 python
参考视频：【莫烦Python】Numpy&Pandas(数据处理教程)Numpy&Pandas简介运算速度快：numpy和pandas都是采用C语言编写,pandas又是基于numpy,是numpy的升级版本。消耗资源少：采用的是矩阵运算，会比python自带的字典或者列表快好多NumpyNumpy属性ndim：维度shape：行数和列数size：元素个数importnumpyasnp#为了方便使
1、pands库的介绍算法程序员&mlh Pandas库的使用 python
为什么要学习pandas?那么问题来了：numpy已经能够帮助我们处理数据，能够结合matplotlib解决我们数据分析的问题，那么pandas学习的目的在什么地方呢？numpy能够帮我们处理处理数值型数据，但是这还不够，很多时候，我们的数据除了数值之外，还有字符串，还有时间序列等比如：我们通过爬虫获取到了存储在数据库中的数据所以，pandas出现了。什么是Pandas?Pandas的名称来自于面
机器学习-Pandas学习笔记小蒋的技术栈记录机器学习机器学习 pandas 学习
PandasPython的数据分析库，与Numpy配合使用，可以从常见的格式如CSV、JSON等中读取数据。可以进行数据清洗、数据加工工作。数据结构Series，Pandas.Series(data,index,dtype,name,copy)data类型是Numpy的ndarray类型，index指定下标，如果不给默认从0开始，name给series名字数据类型DataFrame，Pandas.
Pandas学习-第三章-索引-2020-12-22 wzz_1c19
问1：分别只使用query和loc选出年龄不超过四十岁且工作部门为Dairy或Bakery的男性。读入数据问2：选出员工ID号为奇数所在行的第1、第3和倒数第2列。问3：按照以下步骤进行索引操作：3.1把后三列设为索引后交换内外两层后面3.2--3.7问没做，sorry。以及Ex2.巧克力数据集也没做，因为问1就把我难住了，不会用.join()和.split()。但其实练习1问3中有几小问也要用到
Pandas学习 Wangthirteen
Pandas介绍Pandas基于Numpy的一个第三方的工具库，Pandas主要是，用于做数据清洗方面的工作，如果是数据量比较大，而且清洗工作不是那么复杂的话，通常几步代码就能搞定Pandas和Numpy一样，也有两个核心的数据结构分别是Series和DateFrameSeriesSeries是一维序列，定长的字典序列，他有两个主要属性，index和valuesindex默认是0.1.2.3...
Pandas学习笔记 WangXinmingg 学习笔记 pandas 学习笔记
Pandas数据分析处理库数据预处理导入一份泰坦尼克号乘客数据df.head()展示读取数据，默认读取前5行df.tail()默认读取后5行df.head(10)读取前10行DataFrame结构Pandas工具包的基础结构，二维矩阵结构，行表示数据样本，列表示特征指标。基本上读取数据返回的都是DataFrame结构。DataFrame能调用的属性很多，具体查看API文档。举例几种：数据索引Pan
Pandas学习笔记 Louis yeap pandas 学习笔记 java python
Pandas学习笔记Pandas是一个流行的Python开源数据分析库，提供了丰富的数据结构和数据处理工具，特别适用于数据清洗、处理、分析和可视化。它是数据科学家、分析师和工程师们在Python生态系统中进行数据处理和分析的重要工具之一。Pandas主要提供两种核心数据结构：Series和DataFrame。Series：Series是一维标记数组，类似于Python中的列表或数组，但附带了标签（
pandas学习笔记—json与dataframe的互相转换 ACE-Mayer 信号处理机器学习数据科学 json python 机器学习数据挖掘
目录1、两类json格式（1）对象格式（2）数组对象格式2、json转dataframe2.1对象格式json2.2数组对象格式json3、dataframe转json3.1df.to_json()方法3.2to_dict()方法1、两类json格式（1）对象格式{"name":"JSON","address":"北京市西城区","age":25}#JSON的对象格式的字符串（2）数组对象格式[{
python笔记手册_Python学习笔记-Pandas学习手册 weixin_39568172 python笔记手册
Pandas手册为什么需要PandasPandas(paneldata&DataAnalysis)是基于Numpy的专门用于数据分析的库，处理大型的结构化表格数据尤其方便。pandas借鉴了R的数据结构，并支持numpy中定义的计算(比如矩阵运算)，另外，底层用Cython和C做了很多速度上的优化。总之，Pandas是数据分析工作者使用Python时最常使用的库。关键缩写和包导入在这个速查手册中，
Python学习笔记4-Pandas Crazy WolfT1 python python python入门
Pandas学习莫烦python，非常感谢~记录自己在学习python过程中的点滴。Pandas安装Anaconda安装pip安装Pandas基本介绍SeriesDataFramedtype:查看数据中的类型index:查看队列的序号（行）columns:查看数据的名称（列）values:查看数据所有值describe:查看数据的总结transpose:翻转数据（转置）sort_index:对数据
百日筑基篇——Pandas学习三（pyhton入门八）星石传说 python篇 pandas 学习
百日筑基篇——Pandas学习三（pyhton入门八）文章目录前言一、数据排序二、字符串处理三、数据合并方法1.merge方法2.concat方法四、分组数据统计五、数据重塑1.stack2.pivot总结前言上一篇文章介绍了一下pandas库中的一些函数，而本章则继续介绍库中的函数在数据处理中的应用。一、数据排序运用sort_values方法，importpandasaspdpath=r"C:\
Pandas学习笔记（1）- Pandas基础 HαLlus python python 数据分析
分享一下近期的Pandas学习笔记~文章目录01Pandas基本功能1-1Series基本功能1-2DataFrame基本功能02Pandas描述性统计2-1基本统计计算2-2统计信息汇总.describe()03Pandas函数应用3-0Python运算符与Pandas方法的映射关系3-1表格函数3-2行列函数官方文档.apply.method(lambdax:*func*)3.3元素函数官方文
pandas学习之开发利器anaconda与Jupyter安装(mac) Antg pandas jupyter macos python anaconda
什么是anaconda一句话:她是一个包管理器和环境管理器,包含了很多数据开发的工具,数据分析必备安装anaconda安装包地址:https://docs.anaconda.com/anaconda/install/下载后一路下一步就好(傻瓜式操作,大概有500M+)运行jupyternotebookjupyter是一个迭代式探索性的开发工具,很方便进行数据分析工作和语法的学习我们直接点击laun
如何用ruby来写hadoop的mapreduce并生成jar包 wudixiaotie mapreduce
ruby来写hadoop的mapreduce，我用的方法是rubydoop。怎么配置环境呢： 1.安装rvm：不说了网上有 2.安装ruby：由于我以前是做ruby的，所以习惯性的先安装了ruby，起码调试起来比jruby快多了。 3.安装jruby： rvm install jruby然后等待安
java编程思想 -- 访问控制权限百合不是茶 java 访问控制权限单例模式
访问权限是java中一个比较中要的知识点,它规定者什么方法可以访问,什么不可以访问一:包访问权限; 自定义包: package com.wj.control; //包 public class Demo { //定义一个无参的方法 public void DemoPackage(){ System.out.println("调用
[生物与医学]请审慎食用小龙虾 comsci 生物
现在的餐馆里面出售的小龙虾,有一些是在野外捕捉的,这些小龙虾身体里面可能带有某些病毒和细菌,人食用以后可能会导致一些疾病,严重的甚至会死亡..... 所以,参加聚餐的时候,最好不要点小龙虾...就吃养殖的猪肉,牛肉,羊肉和鱼,等动物蛋白质
org.apache.jasper.JasperException: Unable to compile class for JSP: 商人shang maven 2.2 jdk1.8
环境： jdk1.8 maven tomcat7-maven-plugin 2.0 原因： tomcat7-maven-plugin 2.0 不知吃 jdk 1.8，换成 tomcat7-maven-plugin 2.2就行，即 <plugin>
你的垃圾你处理掉了吗?GC oloz GC
前序:本人菜鸟，此文研究学习来自网络，各位牛牛多指教　 1.垃圾收集算法的核心思想　　Java语言建立了垃圾收集机制，用以跟踪正在使用的对象和发现并回收不再使用(引用)的对象。该机制可以有效防范动态内存分配中可能发生的两个危险：因内存垃圾过多而引发的内存耗尽，以及不恰当的内存释放所造成的内存非法引用。　　垃圾收集算法的核心思想是：对虚拟机可用内存空间，即堆空间中的对象进行识别
shiro 和 SESSSION 杨白白 shiro
shiro 在web项目里默认使用的是web容器提供的session，也就是说shiro使用的session是web容器产生的，并不是自己产生的，在用于非web环境时可用其他来源代替。在web工程启动的时候它就和容器绑定在了一起，这是通过web.xml里面的shiroFilter实现的。通过session.getSession()方法会在浏览器cokkice产生JESSIONID，当关闭浏览器，此
移动互联网终端淘宝客如何实现盈利小桔子移動客戶端淘客淘寶App
2012年淘宝联盟平台为站长和淘宝客带来的分成收入突破30亿元，同比增长100%。而来自移动端的分成达1亿元，其中美丽说、蘑菇街、果库、口袋购物等App运营商分成近5000万元。可以看出，虽然目前阶段PC端对于淘客而言仍旧是盈利的大头，但移动端已经呈现出爆发之势。而且这个势头将随着智能终端(手机，平板)的加速普及而更加迅猛
wordpress小工具制作 aichenglong wordpress 小工具
wordpress 使用侧边栏的小工具，很方便调整页面结构小工具的制作过程 1 在自己的主题文件中新建一个文件夹(如widget)，在文件夹中创建一个php(AWP_posts-category.php) 小工具是一个类,想侧边栏一样，还得使用代码注册，他才可以再后台使用，基本的代码一层不变 <?php class AWP_Post_Category extends WP_Wi
JS微信分享 AILIKES js
// 所有功能必须包含在 WeixinApi.ready 中进行 WeixinApi.ready(function(Api) { // 微信分享的数据 var wxData = { &nb
封装探讨百合不是茶 JAVA面向对象封装
//封装属性方法将某些东西包装在一起，通过创建对象或使用静态的方法来调用，称为封装；封装其实就是有选择性地公开或隐藏某些信息，它解决了数据的安全性问题，增加代码的可读性和可维护性在 Aname类中申明三个属性，将其封装在一个类中：通过对象来调用例如 1： //属性将其设为私有姓名 name 可以公开
jquery radio/checkbox change事件不能触发的问题 bijian1013 JavaScript jquery
我想让radio来控制当前我选择的是机动车还是特种车，如下所示： <html> <head> <script src="http://ajax.googleapis.com/ajax/libs/jquery/1.7.1/jquery.min.js" type="text/javascript"><
AngularJS中安全性措施 bijian1013 JavaScript AngularJS 安全性 XSRF JSON漏洞
在使用web应用中，安全性是应该首要考虑的一个问题。AngularJS提供了一些辅助机制，用来防护来自两个常见攻击方向的网络攻击。一.JSON漏洞当使用一个GET请求获取JSON数组信息的时候（尤其是当这一信息非常敏感，
[Maven学习笔记九]Maven发布web项目 bit1129 maven
基于Maven的web项目的标准项目结构 user-project user-core user-service user-web src
【Hive七】Hive用户自定义聚合函数(UDAF) bit1129 hive
用户自定义聚合函数，用户提供的多个入参通过聚合计算(求和、求最大值、求最小值)得到一个聚合计算结果的函数。问题：UDF也可以提供输入多个参数然后输出一个结果的运算，比如加法运算add(3，5)，add这个UDF需要实现UDF的evaluate方法,那么UDF和UDAF的实质分别究竟是什么？ Double evaluate(Double a, Double b)
通过 nginx-lua 给 Nginx 增加 OAuth 支持 ronin47
前言：我们使用Nginx的Lua中间件建立了OAuth2认证和授权层。如果你也有此打算，阅读下面的文档，实现自动化并获得收益。SeatGeek 在过去几年中取得了发展，我们已经积累了不少针对各种任务的不同管理接口。我们通常为新的展示需求创建新模块，比如我们自己的博客、图表等。我们还定期开发内部工具来处理诸如部署、可视化操作及事件处理等事务。在处理这些事务中，我们使用了几个不同的接口来认证： &n
利用tomcat-redis-session-manager做session同步时自定义类对象属性保存不上的解决方法 bsr1983 session
在利用tomcat-redis-session-manager做session同步时，遇到了在session保存一个自定义对象时，修改该对象中的某个属性，session未进行序列化，属性没有被存储到redis中。在 tomcat-redis-session-manager的github上有如下说明： Session Change Tracking As noted in the &qu
《代码大全》表驱动法-Table Driven Approach-1 bylijinnan java 算法
关于Table Driven Approach的一篇非常好的文章： http://www.codeproject.com/Articles/42732/Table-driven-Approach package com.ljn.base; import java.util.Random; public class TableDriven { public
Sybase封锁原理 chicony Sybase
昨天在操作Sybase IQ12.7时意外操作造成了数据库表锁定，不能删除被锁定表数据也不能往其中写入数据。由于着急往该表抽入数据，因此立马着手解决该表的解锁问题。无奈此前没有接触过Sybase IQ12.7这套数据库产品，加之当时已属于下班时间无法求助于支持人员支持，因此只有借助搜索引擎强大的
java异常处理机制 CrazyMizzz java
java异常关键字有以下几个，分别为 try catch final throw throws 他们的定义分别为 try： Opening exception-handling statement. catch： Captures the exception. finally： Runs its code before terminating
hive 数据插入DML语法汇总 daizj hive DML 数据插入
Hive的数据插入DML语法汇总1、Loading files into tables语法：1) LOAD DATA [LOCAL] INPATH 'filepath' [OVERWRITE] INTO TABLE tablename [PARTITION (partcol1=val1, partcol2=val2 ...)]解释：1)、上面命令执行环境为hive客户端环境下： hive>l
工厂设计模式 dcj3sjt126com 设计模式
使用设计模式是促进最佳实践和良好设计的好办法。设计模式可以提供针对常见的编程问题的灵活的解决方案。工厂模式工厂模式（Factory）允许你在代码执行时实例化对象。它之所以被称为工厂模式是因为它负责“生产”对象。工厂方法的参数是你要生成的对象对应的类名称。 Example #1 调用工厂方法（带参数） <?phpclass Example{
mysql字符串查找函数 dcj3sjt126com mysql
FIND_IN_SET(str,strlist) 假如字符串str 在由N 子链组成的字符串列表strlist 中，则返回值的范围在1到 N 之间。一个字符串列表就是一个由一些被‘,’符号分开的自链组成的字符串。如果第一个参数是一个常数字符串，而第二个是type SET列，则 FIND_IN_SET() 函数被优化，使用比特计算。如果str不在strlist 或st
jvm内存管理 easterfly jvm
一、JVM堆内存的划分分为年轻代和年老代。年轻代又分为三部分：一个eden,两个survivor。工作过程是这样的：e区空间满了后，执行minor gc，存活下来的对象放入s0, 对s0仍会进行minor gc，存活下来的的对象放入s1中，对s1同样执行minor gc，依旧存活的对象就放入年老代中；年老代满了之后会执行major gc，这个是stop the word模式，执行
CentOS-6.3安装配置JDK-8 gengzg centos
JAVA_HOME=/usr/java/jdk1.8.0_45 JRE_HOME=/usr/java/jdk1.8.0_45/jre PATH=$PATH:$JAVA_HOME/bin:$JRE_HOME/bin CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar:$JRE_HOME/lib export JAVA_HOME
【转】关于web路径的获取方法 huangyc1210 Web 路径
假定你的web application 名称为news,你在浏览器中输入请求路径： http://localhost:8080/news/main/list.jsp 则执行下面向行代码后打印出如下结果： 1、 System.out.println(request.getContextPath()); //可返回站点的根路径。也就是项
php里获取第一个中文首字母并排序远去的渡口数据结构 PHP
很久没来更新博客了，还是觉得工作需要多总结的好。今天来更新一个自己认为比较有成就的问题吧。最近在做储值结算，需求里结算首页需要按门店的首字母A-Z排序。我的数据结构原本是这样的： Array ( [0] => Array ( [sid] => 2885842 [recetcstoredpay] =&g
java内部类 hm4123660 java 内部类匿名内部类成员内部类方法内部类
　在Java中，可以将一个类定义在另一个类里面或者一个方法里面，这样的类称为内部类。内部类仍然是一个独立的类，在编译之后内部类会被编译成独立的.class文件，但是前面冠以外部类的类名和$符号。内部类可以间接解决多继承问题,可以使用内部类继承一个类，外部类继承一个类，实现多继承。 &nb
Caused by: java.lang.IncompatibleClassChangeError: class org.hibernate.cfg.Exten zhb8015
maven pom.xml关于hibernate的配置和异常信息如下，查了好多资料，问题还是没有解决。只知道是包冲突，就是不知道是哪个包....遇到这个问题的分享下是怎么解决的。。 maven pom: <dependency> <groupId>org.hibernate</groupId> <ar
Spark 性能相关参数配置详解－任务调度篇 Stark_Summer spark cache cpu 任务调度 yarn
随着Spark的逐渐成熟完善, 越来越多的可配置参数被添加到Spark中来, 本文试图通过阐述这其中部分参数的工作原理和配置思路, 和大家一起探讨一下如何根据实际场合对Spark进行配置优化。由于篇幅较长，所以在这里分篇组织，如果要看最新完整的网页版内容，可以戳这里：http://spark-config.readthedocs.org/，主要是便
css3滤镜 wangkeheng html css
经常看到一些网站的底部有一些灰色的图标，鼠标移入的时候会变亮，开始以为是js操作src或者bg呢，搜索了一下，发现了一个更好的方法：通过css3的滤镜方法。 html代码： <a href='' class='icon'><img src='utv.jpg' /></a> css代码： .icon{-webkit-filter: graysc