nanashi_F

Pandas数据分析 ——Task06：综合练习

Pandas综合练习

一、2002 年-2018 年上海机动车拍照拍卖
二、2007 年-2019 年俄罗斯机场货运航班运载量
三、新冠肺炎在美国的传播

一、2002 年-2018 年上海机动车拍照拍卖

Date	Total number of license issued	lowest price	avg price	Total number of applicants
日期	颁发许可证总数	最低价格	平均价格	申请人总数
2-Jan	1400	13600	14735	3718
2-Feb	1800	13100	14057	4590
2-Mar	2000	14300	14662	5190

问题
(1) 哪一次拍卖的中标率首次小于 5%？

idf1 = df[df['Total number of license issued'] / df['Total number of applicants'] < 0.05]
print(idf1.index[0])

结果：
159

(2) 按年统计拍卖最低价的下列统计量：最大值、均值、0.75 分位数，要求
显示在同一张表上。(先进行（3）)

group_year = idf2.drop(columns = ['Month', 
     'Total number of license issued','avg price',
      'Total number of applicants']).groupby('Year')
idf3 = pd.DataFrame()
idf3['max'] = group_year['lowest price '].max()
idf3['mean'] = group_year['lowest price '].mean()
idf3['quantile'] = group_year['lowest price '].quantile(0.75)
print(idf3)

结果：

	max	mean	quantile
Year
2002	30800	20316.666667	24300.0
2003	38500	31983.333333	36300.0
2004	44200	29408.333333	38400.0
2005	37900	31908.333333	35600.0
2006	39900	37058.333333	39525.0
2007	53800	45691.666667	48950.0
2008	37300	29945.454545	34150.0
2009	36900	31333.333333	34150.0
2010	44900	38008.333333	41825.0
2011	53800	47958.333333	51000.0
2012	68900	61108.333333	65325.0
2013	90800	79125.000000	82550.0
2014	74600	73816.666667	74000.0
2015	85300	80575.000000	83450.0
2016	88600	85733.333333	87475.0
2017	93500	90616.666667	92350.0
2018	89000	87825.000000	88150.0

(3) 将第一列时间列拆分成两个列，一列为年份（格式为 20××），另一列为
月份（英语缩写），添加到列表作为第一第二列，并将原表第一列删除，
其他列依次向后顺延。

df['Year'] = df['Date'].apply(lambda x:2000 + int(x.split('-')[0]))
df['Month'] = df['Date'].apply(lambda x: x.split('-')[1])
idf2 = df.drop(columns = 'Date')
idf2 = idf2.reindex(columns = ['Year', 'Month', 
     'Total number of license issued', 'lowest price ',
      'avg price', 'Total number of applicants'])
print(idf2.head())

结果：

	Year	Month	…	avg price	Total
0	2002	Jan	…	14735	3718
1	2002	Feb	…	14057	4590
2	2002	Mar	…	14662	5190
3	2002	Apr	…	16334	4806
4	2002	May	…	18357	4665

(4) 现在将表格行索引设为多级索引，外层为年份，内层为原表格第二至第
五列的变量名，列索引为月份。
~~我大概知道是什么形式，但我没弄出来~~

(5) 一般而言某个月最低价与上月最低价的差额，会与该月均值与上月均值
的差额具有相同的正负号，哪些拍卖时间不具有这个特点？

for index in range(202):
    flag = (df.loc[index,'lowest price ']-df.loc[index+1,'lowest price '])*\
    (df.loc[index,'avg price']-df.loc[index+1,'avg price'])
    if flag < 0:
        print(df.loc[index+1]['Date'])

结果：
3-Oct
3-Nov
4-Jun
5-Jan
5-Feb
5-Sep
6-May
6-Sep
7-Jan
7-Feb
7-Dec
12-Oct

(6) 将某一个月牌照发行量与其前两个月发行量均值的差额定义为发行增
益，最初的两个月用 0 填充，求发行增益极值出现的时间。

df['issue gain'] = 0
for index in range(2,203):
    df.loc[index,'issue gain'] = df.loc[index,'Total number of license issued']\
    -(df.loc[index-1,'Total number of license issued']\
    +df.loc[index-2,'Total number of license issued'])/2    
imin = df[df['issue gain']==df['issue gain'].min()]['Date']
imax = df[df['issue gain']==df['issue gain'].max()]['Date']
print("min:",imin.values[0],'\nmax:',imax.values[0])

结果：
min: 8-Apr
max: 8-Jan

二、2007 年-2019 年俄罗斯机场货运航班运载量

Airport name	Year	January	February	March	April	May	June	July	August	September	October	November	December	Whole year	Airport coordinates
机场名称	年	一月	二月	三月	四月	五月	六月	七月	八月	九月	十月	十一月	十二月	全年	机场坐标
Abakan	2019	44.7	66.21	72.7	75.82	100.34	78.38	63.88	73.06	66.74	75.44	110.5	89.8	917.57	“(Decimal(‘91.399735’) Decimal(‘53.751351’))”
Aikhal	2019	0	0	0	0	0	0	0	0	0	0	0	0	0	“(Decimal(‘111.543324’) Decimal(‘65.957161’))”
Loss	2019	0	0	0	0	0	0	0	0	0	0	0	0	0	“(Decimal(‘125.398355’) Decimal(‘58.602489’))”
Amderma	2019	0	0	0	0	0	0	0	0	0	0	0	0	0	“(Decimal(‘61.577429’) Decimal(‘69.759076’))”
Anadyr (Carbon)	2019	81.63	143.01	260.9	304.36	122	106.87	84.99	130	102	118	94	199	1746.76	“(Decimal(‘177.738273’) Decimal(‘64.713433’))”

问题
(1) 求每年货运航班总运量。

group_year = df.groupby('Year')
print(group_year['Whole year'].sum())

结果：

Year
2007	659438.23
2008	664682.46
2009	560809.77
2010	693033.98
2011	818691.71
2012	846388.03
2013	792337.08
2014	729457.12
2015	630208.97
2016	679370.15
2017	773662.28
2018	767095.28
2019	764606.27

(2) 每年记录的机场都是相同的吗？

print(group_year['Airport name'].count())

结果：

Year
2007	292
2008	292
2009	292
2010	292
2011	292
2012	292
2013	292
2014	292
2015	292
2016	292
2017	292
2018	248
2019	251

可见每年记录的机场不是完全相同的

(3) 按年计算 2010 年-2015 年全年货运量记录为 0 的机场航班比例。

idf3 = group_year['Whole year'].agg(rate = lambda x: str(len(x[x == 0])/len(x)*100)+'%')
print(idf3.loc[2010:2015])

结果：

	rate
Year
2010	76.71232876712328%
2011	77.05479452054794%
2012	77.05479452054794%
2013	77.05479452054794%
2014	77.05479452054794%
2015	77.05479452054794%

(4) 若某机场至少存在 5 年或以上满足所有月运量记录都为 0，则将其所有
年份的记录信息从表中删除，并返回处理后的表格

group_name = df.groupby('Airport name')
zerocount = group_name['Whole year'].agg(count = lambda x: len(x[x == 0]))
idf4 = df.set_index('Airport name').drop(zerocount[zerocount['count'] > 5].index)
print(idf4)

结果：

	Year	…	Airport	coordinates
Airport name
Abakan	2019	…	(Decimal(‘91.399735’),	Decimal(‘53.751351’))
Anadyr(Carbon)	2019	…	(Decimal(‘177.738273’),	Decimal(‘64.713433’))
Anapa(Vitjazevo)	2019	…	(Decimal(‘37.341511’),	Decimal(‘45.003748’))
Arkhangelsk(Talagy)	2019	…	(Decimal(‘40.714892’),	Decimal(‘64.596138’))
Astrakhan(Narimanovo)	2019	…	(Decimal(‘47.999896’),	Decimal(‘46.287344’))

[5 rows x 15 columns]

(5) 采用一种合理的方式将所有机场划分为东南西北四个分区，并给出 2017
年-2019 年货运总量最大的区域。
东南西北四个分区不知道怎么分
要是分成东西、东南、西北、东北四个区的话，可以对经纬度分别求均值来分组，再求对应货运总量来比较

(6) 在统计学中常常用秩代表排名，现在规定某个机场某年某个月的秩为该
机场该月在当年所有月份中货运量的排名（例如 *** 机场 19 年 1 月运
量在整个 19 年 12 个月中排名第一，则秩为 1），那么判断某月运量情
况的相对大小的秩方法为将所有机场在该月的秩排名相加，并将这个量
定义为每一个月的秩综合指数，请根据上述定义计算 2016 年 12 个月
的秩综合指数。

df2016 = df.query('Year == 2016').reset_index()
Month = df2016.columns[3:15]
irank = pd.DataFrame(index = Month)
for ix in df2016.index:
    rank = df2016.loc[ix,Month].sort_values(ascending = False).index.to_list()
    irank[ix] = [rank.index(mon)+1 for mon in Month]
print(irank.sum(axis = 1))

结果：

January	3406
February	3076
March	2730
April	2432
May	2276
June	2047
July	1854
August	1527
September	1269
October	1009
November	728
December	422

三、新冠肺炎在美国的传播

美国确证数

UID	iso2	iso3	code3	FIPS	Admin2	Province_State	Country_Region	Lat	Long_	Combined_Key	2020/1/22	2020/1/23	2020/3/17	2020/3/18	2020/3/19	2020/3/20	2020/3/21	2020/3/22	2020/3/23	2020/3/24	2020/3/25	2020/3/26	2020/3/27	2020/3/28	2020/3/29	2020/3/30	2020/3/31	2020/4/1	2020/4/2	2020/4/3	2020/4/4	2020/4/5	2020/4/6	2020/4/7	2020/4/8	2020/4/9	2020/4/10	2020/4/11	2020/4/12	2020/4/13	2020/4/14	2020/4/15	2020/4/16	2020/4/17	2020/4/18	2020/4/19	2020/4/20	2020/4/21	2020/4/22	2020/4/23	2020/4/24	2020/4/25	2020/4/26
84001001	US	USA	840	1001	Autauga	Alabama	US	32.53952745	-86.64408227	"Autauga	Alabama	US"	0	0	0	0	0	0	0	0	0	1	4	6	6	6	6	6	7	8	10	12	12	12	12	12	12	15	17	19	19	19	23	24	26	26	25	26	28	30	32	33	36
84001003	US	USA	840	1003	Baldwin	Alabama	US	30.72774991	-87.72207058	"Baldwin	Alabama	US"	1	1	1	1	1	2	2	2	3	4	4	5	5	10	15	18	19	20	24	28	29	29	38	42	44	56	59	66	71	72	87	91	101	103	109	112	117	123	132	143	147
84001005	US	USA	840	1005	Barbour	Alabama	US	31.868263	-85.3871286	"Barbour	Alabama	US"	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	1	2	2	2	3	3	4	9	9	10	10	11	12	14	15	18	20	22	28	29	30	32
84001007	US	USA	840	1007	Bibb	Alabama	US	32.99642064	-87.1251146	"Bibb	Alabama	US"	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	2	3	3	4	4	4	5	7	8	9	9	11	13	16	17	17	18	22	24	26	28	32	32	34	33	34
84001009	US	USA	840	1009	Blount	Alabama	US	33.98210918	-86.56790593	"Blount	Alabama	US"	0	0	0	0	0	0	0	0	0	0	1	2	4	5	5	5	5	5	6	9	10	10	10	10	10	11	12	12	13	14	16	17	18	20	20	21	22	26	29	31	31

美国死亡数

UID	iso2	iso3	code3	FIPS	Admin2	Province_State	Country_Region	Lat	Long_	Combined_Key	Population	2020/1/22	2020/1/23	2020/3/31	2020/4/1	2020/4/2	2020/4/3	2020/4/4	2020/4/5	2020/4/6	2020/4/7	2020/4/8	2020/4/9	2020/4/10	2020/4/11	2020/4/12	2020/4/13	2020/4/14	2020/4/15	2020/4/16	2020/4/17	2020/4/18	2020/4/19	2020/4/20	2020/4/21	2020/4/22	2020/4/23	2020/4/24	2020/4/25	2020/4/26
84001001	US	USA	840	1001	Autauga	Alabama	US	32.53952745	-86.64408227	"Autauga	Alabama	US"	55869	0	0	0	0	0	0	0	0	0	1	1	1	1	1	1	1	1	1	1	2	2	2	1	1	2	2	2
84001003	US	USA	840	1003	Baldwin	Alabama	US	30.72774991	-87.72207058	"Baldwin	Alabama	US"	223234	1	1	1	1	1	1	1	1	1	1	1	1	1	1	1	1	2	2	2	2	2	2	3	3	3	3	3
84001005	US	USA	840	1005	Barbour	Alabama	US	31.868263	-85.3871286	"Barbour	Alabama	US"	24686	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0
84001007	US	USA	840	1007	Bibb	Alabama	US	32.99642064	-87.1251146	"Bibb	Alabama	US"	22394	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0
84001009	US	USA	840	1009	Blount	Alabama	US	33.98210918	-86.56790593	"Blount	Alabama	US"	57826	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0	0

问题
(1) 用 corr() 函数计算县（每行都是一个县）人口与表中最后一天记录日期
死亡数的相关系数。

print(df2[['Population','2020/4/26']].corr())

结果：

	Population	2020/4/26
Population	1.000000	0.403844
2020/4/26	0.403844	1.000000

(2) 截止到 4 月 1 日，统计每个州零感染县的比例。

group_Province = df1[['Province_State', '2020/4/1']].groupby('Province_State')
idf2 = group_Province['2020/4/1'].agg(rate = lambda x: str(len(x[x == 0])/len(x)*100)+'%')
print(idf2)

结果：

	rate
Province_State
Alabama	11.940298507462686%
Alaska	79.3103448275862%
Arizona	0.0%
Arkansas	29.333333333333332%
California	13.793103448275861%
Colorado	21.875%
Connecticut	0.0%
Delaware	0.0%
District of Columbia	0.0%
Florida	16.417910447761194%
Georgia	12.578616352201259%
Hawaii	20.0%
Idaho	38.63636363636363%
Illinois	48.03921568627451%
Indiana	10.869565217391305%
Iowa	40.4040404040404%
Kansas	60.952380952380956%
Kentucky	44.166666666666664%
Louisiana	6.25%
Maine	25.0%
Maryland	4.166666666666666%
Massachusetts	14.285714285714285%
Michigan	19.27710843373494%
Minnesota	36.7816091954023%
Mississippi	6.097560975609756%
Missouri	39.130434782608695%
Montana	62.5%
Nebraska	75.26881720430107%
Nevada	47.05882352941176%
New Hampshire	10.0%
New Jersey	0.0%
New Mexico	42.42424242424242%
New York	8.064516129032258%
North Carolina	18.0%
North Dakota	54.71698113207547%
Ohio	18.181818181818183%
Oklahoma	37.66233766233766%
Oregon	27.77777777777778%
Pennsylvania	10.44776119402985%
Rhode Island	0.0%
South Carolina	6.521739130434782%
South Dakota	56.060606060606055%
Tennessee	11.578947368421053%
Texas	45.2755905511811%
Utah	48.275862068965516%
Vermont	14.285714285714285%
Virginia	27.06766917293233%
Washington	12.82051282051282%
West Virginia	47.27272727272727%
Wisconsin	31.944444444444443%
Wyoming	34.78260869565217%

(3) 请找出最早出确证病例的三个县。

idf3 = df1.copy()
towns = []
for day in df1.columns[11:]:
    if len(towns) >= 3: break
    town = idf3[idf3[day] > 0]['Admin2']
    if town.shape[0] > 0:
        towns.extend(town.values)
        idf3 = idf3.drop(index = town.index)
print(towns)

结果：
[‘King’, ‘Cook’, ‘Maricopa’, ‘Los Angeles’, ‘Orange’]

(4) 按州统计单日死亡增加数，并给出哪个州在哪一天确诊数增加最大（这
里指的是在所有州和所有天两个指标一起算，不是分别算）。

(5) 现需对每个州编制确证与死亡表，第一列为时间，并且起始时间为该州
开始出现死亡比例的那一天，第二列和第三列分别为确证数和死亡数，
每个州需要保存为一个单独的 csv 文件，文件名为“州名.csv”。

(6) 现需对 4 月 1 日至 4 月 10 日编制新增确证数与新增死亡数表，第一列
为州名，第二列和第三列分别为新增确证数和新增死亡数，分别保存为
十个单独的 csv 文件，文件名为“日期.csv”。

理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
Python中深拷贝与浅拷贝的区别 yuxiaoyu.
转自：http://blog.csdn.net/u014745194/article/details/70271868定义：在Python中对象的赋值其实就是对象的引用。当创建一个对象，把它赋值给另一个变量的时候，python并没有拷贝这个对象，只是拷贝了这个对象的引用而已。浅拷贝：拷贝了最外围的对象本身，内部的元素都只是拷贝了一个引用而已。也就是，把对象复制一遍，但是该对象中引用的其他对象我不复
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
Python编译器鹿鹿~ Python编译器 Python python 开发语言后端
嘿嘿嘿我又来了啊有些小盆友可能不知道Python其实是有编译器的，也就是PyCharm。你们可能会问到这个是干嘛的又不可以吃也不可以穿好像没有什么用，其实你还说对了这个还真的不可以吃也不可以穿，但是它用来干嘛的呢。用来编译你所打出的代码进行运行（可能这里说的有点不对但是只是个人认为）现在我们来说说PyCharm是用来干嘛的。PyCharm是一种PythonIDE，带有一整套可以帮助用户在使用Pyt
一文掌握python面向对象魔术方法（二）程序员neil python python 开发语言
接上篇：一文掌握python面向对象魔术方法（一）-CSDN博客目录六、迭代和序列化：1、__iter__(self):定义迭代器，使得类可以被for循环迭代。2、__getitem__(self,key):定义索引操作，如obj[key]。3、__setitem__(self,key,value):定义赋值操作，如obj[key]=value。4、__delitem__(self,key):定义
一文掌握python常用的list（列表）操作程序员neil python python 开发语言
目录一、创建列表1.直接创建列表：2.使用list()构造器3.使用列表推导式4.创建空列表二、访问列表元素1.列表支持通过索引访问元素，索引从0开始：2.还可以使用切片操作访问列表的一部分：三、修改列表元素四、添加元素1.append()：在末尾添加元素2.insert()：在指定位置插入元素五、删除元素1.del：删除指定位置的元素2.remove()：删除指定值的第一个匹配项3.pop()：
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
自然语言处理_tf-idf _feivirus_ 算法机器学习和数学自然语言处理 tf-idf 逆文档频率词频
importpandasaspdimportmath1.数据预处理docA="Thecatsatonmyface"docB="Thedogsatonmybed"wordsA=docA.split("")wordsB=docB.split("")wordsSet=set(wordsA).union(set(wordsB))print(wordsSet){'on','my','face','sat',
K近邻算法_分类鸢尾花数据集 _feivirus_ 算法机器学习和数学分类机器学习 K近邻
importnumpyasnpimportpandasaspdfromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.metricsimportaccuracy_score1.数据预处理iris=load_iris()df=pd.DataFrame(data=ir
apache ftpserver-CentOS config gengzg apache
<server xmlns="http://mina.apache.org/ftpserver/spring/v1" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation=" http://mina.apache.o
优化MySQL数据库性能的八种方法 AILIKES sql mysql
1、选取最适用的字段属性　　MySQL可以很好的支持大数据量的存取，但是一般说来，数据库中的表越小，在它上面执行的查询也就会越快。因此，在创建表的时候，为了获得更好的性能，我们可以将表中字段的宽度设得尽可能小。例如，在定义邮政编码这个字段时，如果将其设置为CHAR(255),显然给数据库增加了不必要的空间，甚至使用VARCHAR这种类型也是多余的，因为CHAR(6)就可以很
JeeSite 企业信息化快速开发平台 Kai_Ge JeeSite
JeeSite 企业信息化快速开发平台平台简介 JeeSite是基于多个优秀的开源项目，高度整合封装而成的高效，高性能，强安全性的开源Java EE快速开发平台。 JeeSite本身是以Spring Framework为核心容器，Spring MVC为模型视图控制器，MyBatis为数据访问层， Apache Shiro为权限授权层，Ehcahe对常用数据进行缓存，Activit为工作流
通过Spring Mail Api发送邮件 120153216 邮件 main
原文地址：http://www.open-open.com/lib/view/open1346857871615.html 使用Java Mail API来发送邮件也很容易实现，但是最近公司一个同事封装的邮件API实在让我无法接受，于是便打算改用Spring Mail API来发送邮件，顺便记录下这篇文章。【Spring Mail API】 Spring Mail API都在org.spri
Pysvn 程序员使用指南 2002wmj SVN
源文件:http://ju.outofmemory.cn/entry/35762 这是一篇关于pysvn模块的指南. 完整和详细的API请参考 http://pysvn.tigris.org/docs/pysvn_prog_ref.html. pysvn是操作Subversion版本控制的Python接口模块. 这个API接口可以管理一个工作副本, 查询档案库, 和同步两个. 该
在SQLSERVER中查找被阻塞和正在被阻塞的SQL 357029540 SQL Server
SELECT R.session_id AS BlockedSessionID , S.session_id AS BlockingSessionID , Q1.text AS Block
Intent 常用的用法备忘 7454103 .net android Google Blog F#
Intent 应该算是Android中特有的东西。你可以在Intent中指定程序要执行的动作（比如：view,edit,dial），以及程序执行到该动作时所需要的资料。都指定好后，只要调用startActivity()，Android系统会自动寻找最符合你指定要求的应用程序，并执行该程序。下面列出几种Intent 的用法显示网页:
Spring定时器时间配置 adminjun spring 时间配置定时器
红圈中的值由6个数字组成，中间用空格分隔。第一个数字表示定时任务执行时间的秒，第二个数字表示分钟，第三个数字表示小时，后面三个数字表示日，月，年，< xmlnamespace prefix ="o" ns ="urn:schemas-microsoft-com:office:office" /> 测试的时候，由于是每天定时执行，所以后面三个数
POJ 2421 Constructing Roads 最小生成树 aijuans 最小生成树
来源：http://poj.org/problem?id=2421 题意：还是给你n个点，然后求最小生成树。特殊之处在于有一些点之间已经连上了边。思路：对于已经有边的点，特殊标记一下，加边的时候把这些边的权值赋值为0即可。这样就可以既保证这些边一定存在，又保证了所求的结果正确。代码： #include <iostream> #include <cstdio>
重构笔记——提取方法（Extract Method） ayaoxinchao java 重构提炼函数局部变量提取方法
提取方法（Extract Method）是最常用的重构手法之一。当看到一个方法过长或者方法很难让人理解其意图的时候，这时候就可以用提取方法这种重构手法。下面是我学习这个重构手法的笔记：提取方法看起来好像仅仅是将被提取方法中的一段代码，放到目标方法中。其实，当方法足够复杂的时候，提取方法也会变得复杂。当然，如果提取方法这种重构手法无法进行时，就可能需要选择其他
为UILabel添加点击事件 bewithme UILabel
默认情况下UILabel是不支持点击事件的，网上查了查居然没有一个是完整的答案，现在我提供一个完整的代码。 UILabel *l = [[UILabel alloc] initWithFrame:CGRectMake(60, 0, listV.frame.size.width - 60, listV.frame.size.height)]
NoSQL数据库之Redis数据库管理(PHP-REDIS实例) bijian1013 redis 数据库 NoSQL
一.redis.php <?php //实例化 $redis = new Redis(); //连接服务器 $redis->connect("localhost"); //授权 $redis->auth("lamplijie"); //相关操
SecureCRT使用备注 bingyingao secureCRT 每页行数
SecureCRT日志和卷屏行数设置一、使用securecrt时，设置自动日志记录功能。 1、在C:\Program Files\SecureCRT\下新建一个文件夹(也就是你的CRT可执行文件的路径），命名为Logs； 2、点击Options -> Global Options -> Default Session -> Edite Default Sett
【Scala九】Scala核心三：泛型 bit1129 scala
泛型类 package spark.examples.scala.generics class GenericClass[K, V](val k: K, val v: V) { def print() { println(k + "," + v) } } object GenericClass { def main(args: Arr
素数与音乐 bookjovi 素数数学 haskell
由于一直在看haskell，不可避免的接触到了很多数学知识，其中数论最多，如素数，斐波那契数列等，很多在学生时代无法理解的数学现在似乎也能领悟到那么一点。闲暇之余，从图书馆找了<<The music of primes>>和<<世界数学通史>>读了几遍。其中素数的音乐这本书与软件界熟知的&l
Java-Collections Framework学习与总结-IdentityHashMap BrokenDreams Collections
这篇总结一下java.util.IdentityHashMap。从类名上可以猜到，这个类本质应该还是一个散列表，只是前面有Identity修饰，是一种特殊的HashMap。简单的说，IdentityHashMap和HashM
读《研磨设计模式》-代码笔记-享元模式-Flyweight bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ import java.util.ArrayList; import java.util.Collection; import java.util.HashMap; import java.util.List; import java
PS人像润饰&调色教程集锦 cherishLC PS
1、仿制图章沿轮廓润饰——柔化图像，凸显轮廓 http://www.howzhi.com/course/retouching/ 新建一个透明图层，使用仿制图章不断Alt+鼠标左键选点，设置透明度为21%，大小为修饰区域的1/3左右（比如胳膊宽度的1/3），再沿纹理方向（比如胳膊方向）进行修饰。所有修饰完成后，对该润饰图层添加噪声，噪声大小应该和
更新多个字段的UPDATE语句 crabdave update
更新多个字段的UPDATE语句 update tableA a set (a.v1, a.v2, a.v3, a.v4) = --使用括号确定更新的字段范围
hive实例讲解实现in和not in子句 daizj hive not in in
本文转自：http://www.cnblogs.com/ggjucheng/archive/2013/01/03/2842855.html 当前hive不支持 in或not in 中包含查询子句的语法，所以只能通过left join实现。假设有一个登陆表login(当天登陆记录,只有一个uid),和一个用户注册表regusers(当天注册用户，字段只有一个uid)，这两个表都包含
一道24点的10+种非人类解法（2,3,10,10） dsjt 算法
这是人类算24点的方法？！！！事件缘由：今天晚上突然看到一条24点状态，当时惊为天人，这NM叫人啊？以下是那条状态朱明西 : 24点，算2 3 10 10，我LX炮狗等面对四张牌痛不欲生，结果跑跑同学扫了一眼说，算出来了，2的10次方减10的3次方。。我草这是人类的算24点啊。。然后么。。。我就在深夜很得瑟的问室友求室友算刚出完题，文哥的暴走之旅开始了 5秒后
关于YII的菜单插件 CMenu和面包末breadcrumbs路径管理插件的一些使用问题 dcj3sjt126com yii framework
在使用 YIi的路径管理工具时，发现了一个问题。 <?php
对象与关系之间的矛盾：“阻抗失配”效应[转] come_for_dream 对象
概述 “阻抗失配”这一词组通常用来描述面向对象应用向传统的关系数据库（RDBMS）存放数据时所遇到的数据表述不一致问题。C++程序员已经被这个问题困扰了好多年，而现在的Java程序员和其它面向对象开发人员也对这个问题深感头痛。 “阻抗失配”产生的原因是因为对象模型与关系模型之间缺乏固有的亲合力。“阻抗失配”所带来的问题包括：类的层次关系必须绑定为关系模式（将对象
学习编程那点事 gcq511120594 编程互联网
一年前的夏天，我还在纠结要不要改行，要不要去学php？能学到真本事吗？改行能成功吗？太多的问题，我终于不顾一切，下定决心，辞去了工作，来到传说中的帝都。老师给的乘车方式还算有效，很顺利的就到了学校，赶巧了，正好学校搬到了新校区。先安顿了下来，过了个轻松的周末，第一次到帝都，逛逛吧！接下来的周一，是我噩梦的开始，学习内容对我这个零基础的人来说，除了勉强完成老师布置的作业外，我已经没有时间和精力去
Reverse Linked List II hcx2013 list
Reverse a linked list from position m to n. Do it in-place and in one-pass. For example:Given 1->2->3->4->5->NULL, m = 2 and n = 4, return
Spring4.1新特性——页面自动化测试框架Spring MVC Test HtmlUnit简介 jinnianshilongnian spring 4.1
目录 Spring4.1新特性——综述 Spring4.1新特性——Spring核心部分及其他 Spring4.1新特性——Spring缓存框架增强 Spring4.1新特性——异步调用和事件机制的异常处理 Spring4.1新特性——数据库集成测试脚本初始化 Spring4.1新特性——Spring MVC增强 Spring4.1新特性——页面自动化测试框架Spring MVC T
Hadoop集群工具distcp liyonghui160com
1. 环境描述两个集群：rock 和 stone rock无kerberos权限认证，stone有要求认证。 1. 从rock复制到stone，采用hdfs Hadoop distcp -i hdfs://rock-nn:8020/user/cxz/input hdfs://stone-nn:8020/user/cxz/运行在rock端，即源端问题：报版本
一个备份MySQL数据库的简单Shell脚本 pda158 mysql 脚本
　　主脚本（用于备份mysql数据库）：　　该Shell脚本可以自动备份数据库。只要复制粘贴本脚本到文本编辑器中，输入数据库用户名、密码以及数据库名即可。我备份数据库使用的是mysqlump 命令。后面会对每行脚本命令进行说明。　　 1. 分别建立目录“backup”和“oldbackup” 　　#mkdir /backup 　　#mkdir /oldbackup 　
300个涵盖IT各方面的免费资源（中）——设计与编码篇 shoothao IT资源图标库图片库色彩板字体
A. 免费的设计资源 Freebbble:来自于Dribbble的免费的高质量作品。 Dribbble:Dribbble上“免费”的搜索结果——这是巨大的宝藏。 Graphic Burger:每个像素点都做得很细的绝佳的设计资源。 Pixel Buddha:免费和优质资源的专业社区。 Premium Pixels:为那些有创意的人提供免费的素材。
thrift总结 - 跨语言服务开发 uule thrift
官网官网JAVA例子 thrift入门介绍 IBM-Apache Thrift - 可伸缩的跨语言服务开发框架 Thrift入门及Java实例演示 thrift的使用介绍 RPC POM： <dependency> <groupId>org.apache.thrift</groupId>

Pandas数据分析 ——Task06：综合练习

Pandas综合练习

一、2002 年-2018 年上海机动车拍照拍卖

二、2007 年-2019 年俄罗斯机场货运航班运载量

三、新冠肺炎在美国的传播

你可能感兴趣的:(pandas,python,数据分析)