数据解读是数据分析师的基本功,如果不能充分理解数据分析中出现的各类指标及术语,数据分析工作将很难展开。
对于数据分析师来说,了解常用的分析指标和术语是做好数据解读的前提。下面,一起来了解下常用指标及术语。
1. 平均数
平均数是统计学中最常用的统计量,包括算数平均数、几何平均数、调和平均数、加权平均数、指数平均数等。通常我们在生活中所说的平均数就是指算数平均数。
算数平均数是指,在一组数据中所有数据之和再除以这组数据的个数,它是反映数据集中趋势的一项指标。
2. 绝对数与相对数
绝对数也是数据分析中常用指标。统计中常用的总量指标就是绝对数,它是反映客观现象总体在一定时间、地点条件下的总规模、总水平的综合指标。例如一定范围内粮食总产量、工农业总产值、企业单位数等。
相对数又称为相对指标,是通过对两个有联系的指标计算得到的比值,它可以从数量上反映两个相互联系的现象之间的对比关系。相对数的基本计算公式为:
在上面的公式中,基础数值是被用作对比标准的指标数值,简称基数;比较数值是用作与基数对比的指标数值,简称比数。相对数一般是以倍数、百分数等来表示,反映了客观现象之间数量联系的程度。
在使用相对数时需要注意指标之间的可比性,同时要跟总量指标(绝对数)结合使用。
3.百分比与百分点
百分比是一种表达比例、比率或分数数值的方法。它是相对数中的一种,也称为百分率或百分数。通常不会写成分数的形式,而是采用符号“%”来表示,如5%、40%、80%。因为百分比的分母都是100,所以都已1%作为度量单位。
百分点则是指不同时期以百分数的形式表示的相对指标(比如指数、速度、构成等)的变动幅度。
在实际使用中一定要注意区分百分比与百分点,比如本月某商品的转化率为10%,而上月的转化率是8%,那么可以说本月该商品的转化率比上个月提升了两个百分点,而非百分之二或2%。
4. 比例与比率
比例是一个总体中各个部分的数量占总体部分的比重,用于反映总体的构成或结构。例如A公司共有500名员工,男员工260名,女员工240名,那么男员工的比例为260:500,女员工比例为240:500。
比率是指样本或总体中各不同类别数据之间的比值,因为比率不是部分与整体之间的对比关系,所以比率可能大于1。就像前面所说的例子,A公司有男员工260人,女员工240人,那么男员工与女员工的比率为260:240。
5. 频数与频率
频数也称“次数”,指变量值中代表某种特征的数(标志值)出现的次数,频数可以用表或图形来表示。比如A公司有500名员工,其中有260名男员工,240名女员工,那么男员工的频数为260,女员工的频数为240。
频率是指每组中类别次数与总次数的比值,它表示某个类别在总体中出现的频繁程度。频率一般用百分数来表示,把所有组的频率相加等于100%。
还是以A公司的员工为例,260名男员工在500名员工中出现的频率是52%,即(260÷500)×100%;而240名女员工在500名员工中出现的频率为48%,即(240÷500)×100%。
6.倍数与番数
倍数是指一个数除以另一个数所得的商,比如A÷B=C,就可以说A是B的C倍。倍数一般用来表示数量的增长或者上升幅度,不适合用来表示数量的减少或者下降。
番数则是指原来数量的2的n次方,比如说公司今年的利润比去年翻了一番,意思就是今年的利润是去年的两倍(2的1次方),今年的利润比去年翻两番,意思就是今年的利润是去年的4倍(2的2次方)。
7. 同比和环比
同比指的是与历史同时期数据相比较而获得的比值,主要是反映事物发展的相对性。例如A公司Q1销售额同比增长35%,意思就是今年第一季度的销售额比去年第一季度的销售额增加了35%,这就是同比。
环比是指与上一个统计时期的数据进行对比获得的值,主要是用来反映事物逐期发展的情况。例如A公司Q2销售额环比增长20%,表示该公司Q2的销售额比Q1的销售额增长了20%。
在11年移动互联网的风口,马化腾坦言,当年要是没有抓住时机推出微信,那么移动互联网的门票就跟他无缘了。
时势造英雄,对个人而言亦是如此。跟随趋势,找准自己未来发力的赛道,在合适的时间干合适的事,就是抓住自己的未来。
而行业研究就是为了得出面向未来的结论。所以,了解行业趋势,太重要了。
在互联网时代,未来的机会在哪呢?
日前,北京大数据研究院联合大数据分析与应用技术国家工程实验室、北京治数科技有限公司共同发布了《2022年中国大数据产业发展指数报告》。
研究团队在2020年、2021年连续发布大数据产业发展指数的基础上,深入调研了各地大数据政策环境、大数据产业和企业发展状况,基于自身企业库中收录的 7472 家大数据企业数据和相关合作方数据,对全国 31 个省级行政区(不包含港澳台地区)和 150个 重点城市的大数据产业发展情况进行综合评估。以下是从报告中摘录的部分:
产业整体发展持续向好
但差异和分化态势显著
从大数据产业发展省级得分来看,全国 31 个省级行政区(不包含港澳台地区)大数据产业发展水平差异和分化态势显著。
大数据产业发展前20强城市
△大数据产业发展指数城市排名散点图
从梯队和排名变化情况可以看出,城市大数据产业发展水平与城市综合发展水平呈正相关。
第一梯队优势明显,引领大数据产业发展
排名依次为北京、深圳、上海、广州、杭州5个城市。这些城市实力雄厚,大数据产业发展水平处于全国头部,指数排名稳居全国前五。
第二梯队追赶势头强劲,大数据产业规模扩大
排名依次为南京、天津、成都、苏州、合肥、重庆、武汉7个城市。
这些城市大数据产业发展指数相对集中,排名位次变化较大,市场竞争激烈,其中重庆、天津、成都排名上升较快,合肥、苏州、武汉等城市排名有所下滑。
第三梯队发展趋势良好,但仍有较大提升空间
排名依次为无锡、厦门、青岛、西安、珠海、郑州、福州、济南,这些城市大数据产业发展整体趋势较好,具有较大发展潜力和市场空间,需加快追赶步伐。
头部企业情况
*以上截图均来源《2022年中国大数据产业发展指数报告》,如侵删
从各地大数据上市公司市值情况来看,北京以 1.356 万亿元位居榜首,成为全国唯一超万亿元的城市,其次杭州、上海、深圳紧随其后,市值超五千亿元,其中杭州为 0.744 万亿元、上海为 0.578 万亿元、深圳为 0.569 万亿元;
从上市公司净利润来看,北京、杭州、深圳、天津、上海、青岛六个城市净利润超百亿元,其中,北京、天津、上海上升势头强劲,北京超越杭州和深圳,以 379.8 亿元领先于其他城市,天津和上海均跻身百亿净利润企业俱乐部。
大数据遍地开花
如何抓住学习机会?
从《2022年中国大数据产业发展指数报告》中,我们可以看到,现在大数据相关的产业已经在各个城市发展起来,产业规模也不断在扩大,相关行业对人才的需求量也在不断增加!
据《新职业——大数据工程技术人员就业景气现状分析报告》显示,预计2025年前大数据人才需求仍保持 30%-40% 的增速,行业人才需求量达到 250 万 。
不仅招聘需求多,大数据开发人才在各大城市的就业薪资也非常可观。
△数据来源职友集,如侵删
薪资高、缺口大,自然成为职场人的“薪”选择!
任何学习过程都需要一个科学合理的学习路线,才能够有条不紊的完成我们的学习目标。Python+大数据所需学习的内容纷繁复杂,难度较大,为大家整理了一个全面的Python+大数据学习路线图,帮大家理清思路,攻破难关!
Python+大数据学习路线图详细介绍(均为免费视频教程哈)
学前导读:从传统关系型数据库入手,掌握数据迁移工具、BI数据可视化工具、SQL,对后续学习打下坚实基础。
1.大数据数据开发基础MySQL8.0从入门到精通
MySQL是整个IT基础课程,SQL贯穿整个IT人生,俗话说,SQL写的好,工作随便找。本课程从零到高阶全面讲解MySQL8.0,学习本课程之后可以具备基本开发所需的SQL水平。
2022最新MySQL知识精讲+mysql实战案例_零基础mysql数据库入门到高级全套教程
学前导读:学习Linux、Hadoop、Hive,掌握大数据基础技术。
2022版大数据Hadoop入门教程
Hadoop离线是大数据生态圈的核心与基石,是整个大数据开发的入门,是为后期的Spark、Flink打下坚实基础的课程。掌握课程三部分内容:Linux、Hadoop、Hive,就可以独立的基于数据仓库实现离线数据分析的可视化报表开发。
2022最新大数据Hadoop入门视频教程,最适合零基础自学的大数据Hadoop教程
学前导读:本阶段课程以真实项目为驱动,学习离线数仓技术。
数据离线数据仓库,企业级在线教育项目实战(Hive数仓项目完整流程)
本课程会、建立集团数据仓库,统一集团数据中心,把分散的业务数据集中存储和处理 ;目从需求调研、设计、版本控制、研发、测试到落地上线,涵盖了项目的完整工序 ;掘分析海量用户行为数据,定制多维数据集合,形成数据集市,供各个场景主题使用。
大数据项目实战教程_大数据企业级离线数据仓库,在线教育项目实战(Hive数仓项目完整流程)
学前导读:Spark官方已经在自己首页中将Python作为第一语言,在3.2版本的更新中,高亮提示内置捆绑Pandas;课程完全顺应技术社区和招聘岗位需求的趋势,全网首家加入Python on Spark的内容。
1.python入门到精通(19天全)
python基础学习课程,从搭建环境。判断语句,再到基础的数据类型,之后对函数进行学习掌握,熟悉文件操作,初步构建面向对象的编程思想,最后以一个案例带领同学进入python的编程殿堂。
全套Python教程_Python基础入门视频教程,零基础小白自学Python必备教程
2.python编程进阶从零到搭建网站
学完本课程会掌握Python高级语法、多任务编程以及网络编程。
Python高级语法进阶教程_python多任务及网络编程,从零搭建网站全套教程
3.spark3.2从基础到精通
Spark是大数据体系的明星产品,是一款高性能的分布式内存迭代计算框架,可以处理海量规模的数据。本课程基于Python语言学习Spark3.2开发,课程的讲解注重理论联系实际,高效快捷,深入浅出,让初学者也能快速掌握。让有经验的工程师也能有所收获。
Spark全套视频教程,大数据spark3.2从基础到精通,全网首套基于Python语言的spark教程
4.大数据Hive+Spark离线数仓工业项目实战
通过大数据技术架构,解决工业物联网制造行业的数据存储和分析、可视化、个性化推荐问题。一站制造项目主要基于Hive数仓分层来存储各个业务指标数据,基于sparkSQL做数据分析。核心业务涉及运营商、呼叫中心、工单、油站、仓储物料。
全网首次披露大数据Spark离线数仓工业项目实战,Hive+Spark构建企业级大数据平台