奥特曼打小白

Python数据分析入门笔记3——数据预处理之缺失值

系列文章目录

Python数据分析入门笔记1——学习前的准备
Python数据分析入门笔记2——pandas数据读取

Python数据分析入门笔记

系列文章目录
前言
一、数据清理概述
- 1.缺失值的处理方式
- 2.重复值的处理方式
- 3.异常值的处理方式
二、缺失值的检测
- 1.缺失值
- 2.缺失值的检测
三、缺失值的处理
- 1.删除缺失值——dropna()
- 2.填充缺失值——fillna()
- 3.插补缺失值——interpolate()
四、缺失值实用处理流程
- 1. 文件中有缺失值，加载时如何处理？
- 2. 观察缺失数据占比，能否直接删除缺失值？（最好不要删除）
- 3. 能否直接采用填充缺失值的方式处理？
总结
上文答案

前言

学习目标：

认识何为数据清理，为什么要进行数据清理，及常见数据问题的清理方式。
掌握缺失值的检测与处理方式。

一、数据清理概述

在数据分析的过程中，我们经常会发现有缺失的数据，比如上一篇博文中用到的excel文件，
Pandas中的NaN值来自NumPy库，NumPy中缺失值有几种表示形式：NaN，NAN，nan，他们都一样

缺失值和其它类型的数据不同，它毫无意义，NaN不等于0，也不等于空串，

数据清理是数据预处理的一个关键环节。通俗的说，就是检测到数据中的异常部分，如数据的缺失、重复和异常等，然后将这些“脏”数据清理成质量较高的“干净”数据。

常遇到的数据问题：

数据缺失
数据重复
数据异常

先简单介绍一下针对这三种情况的处理方式：

1.缺失值的处理方式

缺失值是指样本数据中，某个或某些属性的值不全。
产生原因：机械故障、人为因素。
影响：若使用存在缺失值的数据进行分析，会降低预测结果的准确率，需通过合适的方式予以处理。

常用处理方式：

删除缺失值——缺失数据占比较低的时候，可以尝试使用删除缺失值。
填充缺失值——适用于样本数量较大的情况。一般将平均数、中位数、众数、缺失值前后的数填充至空缺位置。
插补缺失值——线性插值：简单理解成两个点连线，在连线中间位置取一点加进去；最邻近插值：用于缺失值相邻的值作为插补的值。

2.重复值的处理方式

重复值是指样本数据中某个或某些数据记录完全相同。
产生原因：人工录入、机械故障导致部分数据重复录入，比如录入的时候卡了，或者不小心多录了一个。

常用处理方式：

保留重复值——在分析演变规律、样本不均衡处理、业务规则等场景中，重复值是有价值的，需要保留。
删除重复值——最普遍的处理方式。

3.异常值的处理方式

异常值是指样本数据中处于特定范围之外的个别值，这些值明显偏离它们所属样本的其余观测值。比如，学生成绩单里面，突然出现一个学生的语文成绩是1000分，明显不合常理，那么这个样本数据就属于异常值。
产生原因：人为疏忽、失误或仪器异常。
影响：异常值有可能是真的异常，也有可能是伪异常，需要根据实际情况处理。

常用处理方式：

保留异常值。
删除异常值。
替换异常值——最常用的方式，用指定的值，或根据算法计算出来的值，替换检测出的异常值。

二、缺失值的检测

1.缺失值

Pandas 中的缺失值来自于NumPy，NumPy中缺失值有几种表示形式：NaN，NAN，nan。
缺失值和其它类型的数据不同，它毫无意义，NaN不等于0，也不等于空串。特别注意：NaN,NAN和nan也是互不相等的。

2.缺失值的检测

方法	简介	说明
isnull()	是空吗？	若返回的值为True，说明存在缺失值
notnull()	没有空的吗？	若返回的值为False，说明存在缺失值
isna()	是空吗？	若返回的值为True，说明存在缺失值
notna()	没有空的吗？	若返回的值为False，说明存在缺失值

import pandas as pd
import numpy as np #要使用NaN,NAN或nan都必须导入Numpy库
# 手动创建一个DataFrame或者用上篇方式读取文件
# 注意：手动创建的时候，空值必须用Numpy中的NaN、NAN或者nan占位
df=pd.DataFrame({'序号':['S1','S2','S3','S4'],
                '姓名':['张三','李四','王五','赵六'],
                '性别':['男','男','女','男'],
                '年龄':[15,16,15,14],
                '住址':[np.nan,np.nan,np.nan,np.nan]})
# 判断DataFrame中的缺失值，用isna()方法，True代表这个格子数值为空
df.isna()

对如上DataFrame执行isna()操作后得到如下结果：

我们可以看到，通过isna()方法我们很方便地找到了原有数据中的空值，并且能根据True值的位置定位到NaN值所在的位置。

三、缺失值的处理

为避免包含缺失值的数据对分析预测结果产生一定的影响，缺失值被检测出来后一般不建议保留。

常见处理方法：

删除缺失值dropna()
填充缺失值fillna()
插补缺失值interpolate()

1.删除缺失值——dropna()

pandas中提供了删除缺失值的方法dropna()。
dropna()方法用于删除缺失值所在的一行或一列数据，并返回一个删除缺失值后的新对象。

DataFrame.dropna(axis=0, how=‘any’, thresh=None, subset=None, inplace=False)

参数说明：

参数	说明	取值及解释
axis	表示是否删除包含缺失值的行或列	0或’index’，代表按行删。 1或’columns’，代表按列删。
how	表示删除缺失值的方式	any，当任何值为NaN值时便删除整行或整列。 all，当所有值都为NaN值时便删除整行或整列。
thresh	表示保留至少有N个非NaN值的行或列	数值，如thresh=3，那么只要这行或这列有3个及以上的非空值，就不删除。
subset	表示删除指定列的缺失值
inplace	表示是否操作原数据	True，会直接修改原数据文件。 False，会修改原数据的副本。

用法演示：

import pandas as pd
import numpy as np #要使用NaN,NAN或nan都必须导入Numpy库
# 手动创建一个DataFrame或者用上篇方式读取文件
# 注意：手动创建的时候，空值必须用Numpy中的NaN、NAN或者nan占位
df=pd.DataFrame({'序号':['S1','S2','S3','S4'],
                '姓名':['张三','李四','王五','赵六'],
                '性别':['男','男','女','np.nan'],
                '年龄':[15,16,15,14],
                '住址':['苏州','南京',np.nan,np.nan]})
# 判断DataFrame中的缺失值，用isna()方法，True代表这个格子数值为空
df.isna()
# 保留至少有3个非空值的行
df.dropna(thresh=3)
# 删除缺失值所在的列
df.dropna(axis='columns')

2.填充缺失值——fillna()

pandas中提供了填充缺失值的方法fillna()。一般会将平均数、中位数、众数、缺失值前后的数填充至空缺位置。

DataFrame.fillna(value=None, method=None, axis=None, inplace=False, limit=None, downcast=None)

参数说明：

参数	说明	取值及解释
value	表示填充的数据	可以为变量、字典、Series或DataFrame对象
method	表示填充的方式，默认为None	None ’pad’或’ffill’，将最后一个有效值向后传播，也就是使用缺失值前面的有效值填充缺失值。 ‘backfill’或’bfill’，将最后一个有效值向前传播，也就是使用缺失值后面的有效值填充缺失值。比如，连续的学号，中间有空缺，可以尝试用向前或者向后填充的方式。
axis	表示是否填充包含缺失值的行或列	0或’index’，填充包含缺失值的行 1或’columns’，填充包含缺失值的列
limit	表示连续填充的最大数量	取值应该为数值，例如limit=5

【例】年龄值有缺失，想用平均年龄来填充，用法演示：

import pandas as pd
import numpy as np 
df=pd.DataFrame({'序号':['S1','S2','S3','S4'],
                '姓名':['张三','李四','王五','赵六'],
                '性别':['男','男','女','男'],
                '年龄':[15,16,15,np.nan],
                '住址':['苏州','南京',np.nan,np.nan]})
# 计算年龄列的平均数，并保留一位小数
col_age=np.around(np.mean(df['年龄']),1)
# 将计算的平均数填充到指定列
df.fillna({'年龄':col_age})

原数据：

年龄列填充后的结果：

3.插补缺失值——interpolate()

pandas中提供了插补缺失值的方法interpolate()。

DataFrame.interpolate(method=‘linear’, axis=0, limit=None, inplace=False, limit_direction=None, limit_area=None, downcast=None, **kwargs)

参数说明：

参数	说明	取值和解释
method	表示使用的插值方法。	‘linear’，默认值，代表采用线性插值法。 ‘time’，表示根据时间长短进行填充，适用于索引为日期时间的对象。 ‘index’或’values’，代表采用索引的实际数据进行填充。 ‘nearest’，表示采用最邻近插值法进行填充。 ‘barycentric’，代表采用重心坐标插值法进行填充。
limit	表示连续填充的最大数量
limit_direction	表示按照指定方向对连续的NaN值进行填充。	‘forward’，向前填充。 ‘backforword’，向后填充。 ‘both’，同时向前、向后填充

插补缺失值这里，需要弄明白常用的几种插值方法的含义。

四、缺失值实用处理流程

缺失值的来源有两个：

原始数据包含缺失值
数据整理过程中产生缺失值

1. 文件中有缺失值，加载时如何处理？

如果数据是从文件中加载的，会默认将’-1.#IND’, ‘1.#QNAN’, ‘1.#IND’, ‘-1.#QNAN’, ‘#N/A N/A’,’#N/A’, ‘N/A’, ‘NA’, ‘#NA’, ‘NULL’, ‘NaN’, ‘-NaN’, ‘nan’, ‘-nan’ 这些字符判定为缺失值，从而转换为NaN。
若不想自动转换，可以加一个参数keep_default_na = False。
若想将指定内容转换为NaN，如，上文景区名录文件中的“无”我们也想作为缺失值处理，那可以再加一个参数na_values=[“无”]，代表我们读取的时候会将所有的’无’都处理成’NaN’。

示例代码如下：

import pandas as pd
# 加载数据，keep_default_na代表用自定义的方式来检测缺失值，na_values这里设置为“无”和空都视为缺失值
df=pd.read_excel('D://Projects/2019年底江苏省A级景区名录.xlsx',na_values=["无",""],keep_default_na = False)
df #输出得到的DataFrame
df.isna() #输出缺失值判断结果，对比

2. 观察缺失数据占比，能否直接删除缺失值？（最好不要删除）

当缺失数据占比较低的时候，可以尝试按行删除包含缺失值的整条记录。（但不建议）
当一列包含太多缺失值的时候（如超过80%），可以直接删除此列。（但不建议）

统计缺失数据占比，有两种方式，一种是用自定义函数，一种是用missnigno库来对缺失情况进行可视化处理。

（1）用自定义函数生成表格，来显示各属性中缺失值的具体比例。
首先写一个missing_values_table，用于检测DataFrame中各列缺失值的比例，作为后续缺失值处理方法的选择依据：

def missing_values_table(df):
        # 计算所有的缺失值
        mis_val = df.isnull().sum()

        # 计算缺失值比例
        mis_val_percent = 100 * df.isnull().sum() / len(df)

        # 将结果拼接成dataframe
        mis_val_table = pd.concat([mis_val, mis_val_percent], axis=1)

        # 将列重命名
        mis_val_table_ren_columns = mis_val_table.rename(
        columns = {0 : '缺失值', 1 : '占比（%）'})

        # 按照缺失值降序排列，并把缺失值为0的数据排除
        mis_val_table_ren_columns = mis_val_table_ren_columns[
            mis_val_table_ren_columns.iloc[:,1] != 0].sort_values(
        '占比（%）', ascending=False).round(1)

        # 打印信息
        print ("传入的数据集中共 " + str(df.shape[1]) + " 列.\n"      
            "其中 " + str(mis_val_table_ren_columns.shape[0]) +
              "列包含缺失值")

        # 返回缺失值信息的dataframe
        return mis_val_table_ren_columns

然后调用刚刚写的方法，生成一个表格，直观看到每列缺失比例

# 调用刚刚写的方法，来检测名为train的这个DataFrame中，每一列缺失比例
train_missing= missing_values_table(train)
train_missing

输出结果如下：

（2）使用missingno库进行缺失数据可视化。
推荐扩展阅读：九命猫幺-Python可视化查看数据集完整性: missingno库(用于数据分析前的数据检查)
使用missingno很简单，pip install missingno 安装，然后在代码中用import missingno as msno 导入模块。

import missingno as msno
# 使用条形图来展示缺失情况
msno.bar(df)
# 使用矩阵图来展示缺失情况
msno.matrix(df)

不懂就问：

如果不引用matplotlib库，能不能直接在missingno这里处理中文字符？现在的图表中中文显示不正常

3. 能否直接采用填充缺失值的方式处理？

对于非时间序列数据，可以用一个估算的值来替代缺失值，直接填充。

常用填充方式：

使用常量来替换（默认值）
使用统计量替换（缺失值所处列的平均值、中位数、众数）

对于时间序列类型数据缺失值，推荐使用线性插值法来插补缺失数据。

线性插值法是一种插补缺失值技术，它假定数据点之间存在线性关系，并利用相邻数据点中的非缺失值来计算缺失数据点的值。

总结

这一篇主要是缺失值的检测与处理。

上文答案

参考代码：

import pandas as pd
df=pd.read_excel("D://Projects/2019年底江苏省A级景区名录.xlsx",sheet_name=0,index_col=0)
df.columns	#输出表头
df['所在地市'].value_counts()	#数每个地市有多少条数据，也就是每个地市各多少个景点入选
df.groupby('所在地市')['等级'].value_counts()	#先按所在地市分组，然后根据等级分类计数
df.groupby('等级')['所在地市'].value_counts()	#先按等级分组，然后根据所在地市分类计数

系统学习Python——并发模型和异步编程：进程、线程和GIL
分类目录：《系统学习Python》总目录在文章《并发模型和异步编程：基础知识》我们简单介绍了Python中的进程、线程和协程。本文就着重介绍Python中的进程、线程和GIL的关系。Python解释器的每个实例都是一个进程。使用multiprocessing或concurrent.futures库可以启动额外的Python进程。Python的subprocess库用于启动运行外部程序（不管使用何种
Flask框架入门：快速搭建轻量级Python网页应用「已注销」 python-AI python基础网站网络 python flask 后端
转载：Flask框架入门：快速搭建轻量级Python网页应用1.Flask基础Flask是一个使用Python编写的轻量级Web应用框架。它的设计目标是让Web开发变得快速简单，同时保持应用的灵活性。Flask依赖于两个外部库：Werkzeug和Jinja2，Werkzeug作为WSGI工具包处理Web服务的底层细节，Jinja2作为模板引擎渲染模板。安装Flask非常简单，可以使用pip安装命令
Python Flask 框架入门：快速搭建 Web 应用的秘诀 Python编程之道 Python人工智能与大数据 Python编程之道 python flask 前端 ai
PythonFlask框架入门：快速搭建Web应用的秘诀关键词Flask、微框架、路由系统、Jinja2模板、请求处理、WSGI、Web开发摘要想快速用Python搭建一个灵活的Web应用？Flask作为“微框架”代表，凭借轻量、可扩展的特性，成为初学者和小型项目的首选。本文将从Flask的核心概念出发，结合生活化比喻、代码示例和实战案例，带你一步步掌握：如何用Flask搭建第一个Web应用？路由
python_虚拟环境阿_焦 python
第一、配置虚拟环境：virtualenv（1）pipvirtualenv>安装虚拟环境包（2）pipinstallvirtualenvwrapper-win>安装虚拟环境依赖包（3）c盘创建虚拟目录>C:\virtualenv>配置环境变量【了解一下】：（1）如何使用virtualenv创建虚拟环境a、cd到C:\virtualenv目录下：b、mkvirtualenvname>创建虚拟环境nam
Python爱心光波
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
Python流星雨 Want595 python 开发语言
文章目录系列文章写在前面技术需求完整代码代码分析1.模块导入2.画布设置3.画笔设置4.颜色列表5.流星类(Star)6.流星对象创建7.主循环8.流星运动逻辑9.视觉效果10.总结写在后面系列文章序号直达链接表白系列1Python制作一个无法拒绝的表白界面2Python满屏飘字表白代码3Python无限弹窗满屏表白代码4Python李峋同款可写字版跳动的爱心5Python流星雨代码6Python
Python之七彩花朵代码实现 PlutoZuo Python python 开发语言
Python之七彩花朵代码实现文章目录Python之七彩花朵代码实现下面是一个简单的使用Python的七彩花朵。这个示例只是一个简单的版本，没有很多高级功能，但它可以作为一个起点，你可以在此基础上添加更多功能。importturtleastuimportrandomasraimportmathtu.setup(1.0,1.0)t=tu.Pen()t.ht()colors=['red','skybl
Python 脚本最佳实践2025版
前文可以直接把这篇文章喂给AI,可以放到AI角色设定里,也可以直接作为提示词.这样,你只管提需求,写脚本就让AI来.概述追求简洁和清晰：脚本应简单明了。使用函数(functions)、常量(constants)和适当的导入(import)实践来有逻辑地组织你的Python脚本。使用枚举(enumerations)和数据类(dataclasses)等数据结构高效管理脚本状态。通过命令行参数增强交互性
（Python基础篇）了解和使用分支结构 EternityArt 基础篇 python
目录一、引言二、Python分支结构的类型与语法（一）if语句（单分支）（二）if-else语句（双分支）（三）if-elif-else语句（多分支）三、分支结构的应用场景（一）提示用户输入用户名，然后再提示输入密码，如果用户名是“admin”并且密码是“88888”则提示正确，否则，如果用户名不是admin还提示用户用户名不存在,（二）提示用户输入用户名，然后再提示输入密码，如果用户名是“adm
（Python基础篇）循环结构 EternityArt 基础篇 python
一、什么是Python循环结构？循环结构是编程中重复执行代码块的机制。在Python中，循环允许你：1.迭代处理数据：遍历列表、字典、文件内容等。2.自动化重复任务：如批量处理数据、生成序列等。3.控制执行流程：根据条件决定是否继续或终止循环。二、为什么需要循环结构？假设你需要打印1到100的所有偶数：没有循环：需手动编写100行print()语句。print(0)print(2)print(4)
（Python基础篇）字典的操作 EternityArt 基础篇 python 开发语言
一、引言在Python编程中，字典（Dictionary）是一种极具灵活性的数据结构，它通过“键-值对”（key-valuepair）的形式存储数据，如同现实生活中的字典——通过“词语（键）”快速查找“释义（值）”。相较于列表和元组的有序索引访问，字典的优势在于基于键的快速查找，这使得它在处理需要频繁通过唯一标识获取数据的场景中极为高效。掌握字典的操作，能让我们更高效地组织和管理复杂数据，是Pyt
Python七彩花朵 Want595 python 开发语言
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
用OpenCV标定相机内参应用示例（C++和Python）
下面是一个完整的使用OpenCV进行相机内参标定（CameraCalibration）的示例，包括C++和Python两个版本，基于棋盘格图案标定。一、目标：相机标定通过拍摄多张带有棋盘格图案的图像，估计相机的内参：相机矩阵（内参）K畸变系数distCoeffs可选外参（R,T）标定精度指标（如重投影误差）二、棋盘格参数设置（根据自己的棋盘格设置）：棋盘格角点数：9x6（内角点，9列×6行）；每个
Anaconda 详细下载与安装教程
Anaconda详细下载与安装教程1.简介Anaconda是一个用于科学计算的开源发行版，包含了Python和R的众多常用库。它还包括了conda包管理器，可以方便地安装、更新和管理各种软件包。2.下载Anaconda2.1访问官方网站首先，打开浏览器，访问Anaconda官方网站。2.2选择适合的版本在页面中，你会看到两个主要的下载选项：AnacondaIndividualEdition：适用于
python中 @注解及内置注解的使用方法总结以及完整示例慧一居士 Python python
在Python中，装饰器（Decorator）使用@符号实现，是一种修改函数/类行为的语法糖。它本质上是一个高阶函数，接受目标函数作为参数并返回包装后的函数。Python也提供了多个内置装饰器，如@property、@staticmethod、@classmethod等。一、核心概念装饰器本质：@decorator等价于func=decorator(func)执行时机：在函数/类定义时立即执行装饰
Python中的静态方法和类方法详解
在Python中，`@staticmethod`和`@classmethod`是两种装饰器，它们用于定义类中的方法，但是它们的行为和用途有所不同。###@staticmethod`@staticmethod`装饰器用于定义一个静态方法。静态方法不接收类或实例的引用作为第一个参数，因此它不能访问类的状态或实例的状态。静态方法可以看作是与类关联的普通函数，但它们可以通过类名直接调用。classMath
Python中类静态方法：@classmethod/@staticmethod详解和实战示例
在Python中，类方法(@classmethod)和静态方法(@staticmethod)是类作用域下的两种特殊方法。它们使用装饰器定义，并且与实例方法(deffunc(self))的行为有所不同。1.三种方法的对比概览方法类型是否访问实例(self)是否访问类(cls)典型用途实例方法✅是❌否访问对象属性类方法@classmethod❌否✅是创建类的替代构造器，访问类变量等静态方法@stati
Python多版本管理与pip升级全攻略：解决冲突与高效实践码界奇点 Python python pip 开发语言 python3.11 源代码管理虚拟现实依赖倒置原则
引言Python作为最流行的编程语言之一，其版本迭代速度与生态碎片化给开发者带来了巨大挑战。据统计，超过60%的Python开发者需要同时维护基于Python3.6+和Python2.7的项目。本文将系统解决以下核心痛点：如何安全地在同一台机器上管理多个Python版本pip依赖冲突的根治方案符合PEP标准的生产环境最佳实践第一部分：Python多版本管理核心方案1.1系统级多版本共存方案Wind
基于Python的健身数据分析工具的搭建流程day1 weixin_45677320 python 开发语言数据挖掘爬虫
基于Python的健身数据分析工具的搭建流程分数据挖掘、数据存储和数据分析三个步骤。本文主要介绍利用Python实现健身数据分析工具的数据挖掘部分。第一步：加载库加载本文需要的库，如下代码所示。若库未安装，请按照python如何安装各种库（保姆级教程）_python安装库-CSDN博客https://blog.csdn.net/aobulaien001/article/details/133298
seaborn又一个扩展heatmapz qq_21478261 #Python可视化 matplotlib
推荐阅读：Pythonmatplotlib保姆级教程嫌Matplotlib繁琐？试试Seaborn！
NGS测序基础梳理01-文库构建（Library Preparation） qq_21478261 #生物信息生物学
本文介绍Illumina测序平台文库构建（LibraryPreparation）步骤，文库结构。写作时间：2020.05。推荐阅读：10W字《Python可视化教程1.0》来了！一份由公众号「pythonic生物人」精心制作的PythonMatplotlib可视化系统教程，105页PDFhttps://mp.weixin.qq.com/s/QaSmucuVsS_DR-klfpE3-Q10W字《Rg
Python 常用内置函数详解（七）：dir()函数——获取当前本地作用域中的名称列表或对象的有效属性列表
目录一、功能二、语法和示例一、功能dir()函数获取当前本地作用域中的名称列表或对象的有效属性列表。二、语法和示例dir()函数有两种形式，如果没有实参，则返回当前本地作用域中的名称列表。如果有实参，它会尝试返回该对象的有效属性列表。如果对象有一个名为__dir__()的方法，那么该方法将被调用，并且必须返回一个属性列表。dir()函数的语法格式如下：C:\Users\amoxiang>ipyth
pythonjson中list操作_Python json.dumps 特殊数据类型的自定义序列化操作
场景描述：Python标准库中的json模块，集成了将数据序列化处理的功能；在使用json.dumps()方法序列化数据时候，如果目标数据中存在datetime数据类型，执行操作时，会抛出异常：TypeError:datetime.datetime(2016,12,10,11,04,21)isnotJSONserializable那么遇到json.dumps序列化不支持的数据类型，该怎么办！首先，
Python 日期格式转json.dumps的解决方法 douyaoxin python json 开发语言
classDateEncoder(json.JSONEncoder):defdefault(self,obj):ifisinstance(obj,datetime.datetime):returnobj.strftime('%Y-%m-%d%H:%M:%S')elifisinstance(obj,datetime.date):returnobj.strftime("%Y-%m-%d")json.d
Python 爬虫实战：视频平台播放量实时监控（含反爬对抗与数据趋势预测）西攻城狮北 python 爬虫音视频
一、引言在数字内容蓬勃发展的当下，视频平台的播放量数据已成为内容创作者、营销人员以及行业分析师手中极为关键的情报资源。它不仅能够实时反映内容的受欢迎程度，更能在竞争分析、营销策略制定以及内容优化等方面发挥不可估量的作用。然而，视频平台为了保护自身数据和用户隐私，往往会设置一系列反爬虫机制，对数据爬取行为进行限制。这就向我们发起了挑战：如何巧妙地突破这些限制，同时精准地捕捉并预测播放量的动态变化趋势
Python技能手册 - 模块module 金色牛神 Python python windows 开发语言
系列Python常用技能手册-基础语法Python常用技能手册-模块modulePython常用技能手册-包package目录module模块指什么typing数据类型int整数float浮点数str字符串bool布尔值TypeVar类型变量functools高阶函数工具functools.partial()函数偏置functools.lru_cache()函数缓存sorted排序列表排序元组排序
Ubuntu基础（Python虚拟环境和Vue） aaiier ubuntu python linux
Python虚拟环境sudoaptinstallpython3python3-venv进入项目目录cdXXX创建虚拟环境python3-mvenvvenv激活虚拟环境sourcevenv/bin/activate退出虚拟环境deactivateVue安装Node.js和npm#安装Node.js和npm（Ubuntu默认仓库可能版本较旧，适合入门）sudoaptinstallnodejsnpm#验
苦练Python第9天：if-else分支九剑 python后端前端人工智能
苦练Python第9天：if-else分支九剑前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我，微信公众号：倔强青铜三。欢迎点赞、收藏、关注，一键三连！！！欢迎来到100天Python挑战第9天！今天我们不练循环，改磨“分支剑法”——ifelse三式：单分支、双分支、多分支，以及嵌套和三元运算符，全部实战演练，让
苦练Python第8天：while 循环之妙用 python后端前端人工智能
苦练Python第8天：while循环之妙用原文链接：https://dev.to/therahul_gupta/day-9100-while-loops-with-real-world-examples-528f作者：RahulGupta译者：倔强青铜三前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我，微信公众
苦练Python第5天：字符串从入门到格式化 python后端人工智能前端
苦练Python第5天：字符串从入门到格式化原文链接：https://dev.to/therahul_gupta/day-5100-working-with-strings-basics-to-formatting-2kkn作者：RahulGupta译者：倔强青铜三前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我
SQL的各种连接查询 xieke90 UNION ALL UNION 外连接内连接 JOIN
一、内连接概念：内连接就是使用比较运算符根据每个表共有的列的值匹配两个表中的行。内连接（join 或者inner join ） SQL语法： select * fron
java编程思想--复用类百合不是茶 java 继承代理组合 final类
复用类看着标题都不知道是什么,再加上java编程思想翻译的比价难懂,所以知道现在才看这本软件界的奇书一:组合语法:就是将对象的引用放到新类中即可代码: package com.wj.reuse; /** * * @author Administrator 组
[开源与生态系统]国产CPU的生态系统 comsci cpu
计算机要从娃娃抓起...而孩子最喜欢玩游戏.... 要让国产CPU在国内市场形成自己的生态系统和产业链,国家和企业就不能够忘记游戏这个非常关键的环节.... 投入一些资金和资源,人力和政策,让游
JVM内存区域划分Eden Space、Survivor Space、Tenured Gen，Perm Gen解释商人shang jvm内存
jvm区域总体分两类，heap区和非heap区。heap区又分：Eden Space（伊甸园）、Survivor Space(幸存者区)、Tenured Gen（老年代-养老区）。非heap区又分：Code Cache(代码缓存区)、Perm Gen（永久代）、Jvm Stack(java虚拟机栈)、Local Method Statck(本地方法栈)。 HotSpot虚拟机GC算法采用分代收
页面上调用 QQ oloz qq
<A href="tencent://message/?uin=707321921&Site=有事Q我&Menu=yes"> <img style="border:0px;" src=http://wpa.qq.com/pa?p=1:707321921:1></a>
一些问题文强chu 问题
1.eclipse 导出 doc 出现“The Javadoc command does not exist.” javadoc command 选择 jdk/bin/javadoc.exe 2.tomcate 配置 web 项目 ..... SQL:3.mysql * 必须得放前面否则 select&nbs
生活没有安全感小桔子生活孤独安全感
圈子好小，身边朋友没几个，交心的更是少之又少。在深圳，除了男朋友，没几个亲密的人。不知不觉男朋友成了唯一的依靠，毫不夸张的说，业余生活的全部。现在感情好，也很幸福的。但是说不准难免人心会变嘛，不发生什么大家都乐融融，发生什么很难处理。我想说如果不幸被分手(无论原因如何)，生活难免变化很大，在深圳，我没交心的朋友。明
php 基础语法 aichenglong php 基本语法
1 .1 php变量必须以$开头 <?php $a=” b”; echo ?> 1 .2 php基本数据库类型 Integer float/double Boolean string 1 .3 复合数据类型数组array和对象 object 1 .4 特殊数据类型 null 资源类型(resource) $co
mybatis tools 配置详解 AILIKES mybatis
MyBatis Generator中文文档 MyBatis Generator中文文档地址： http://generator.sturgeon.mopaas.com/ 该中文文档由于尽可能和原文内容一致，所以有些地方如果不熟悉，看中文版的文档的也会有一定的障碍，所以本章根据该中文文档以及实际应用，使用通俗的语言来讲解详细的配置。本文使用Markdown进行编辑，但是博客显示效
继承与多态的探讨百合不是茶 JAVA面向对象继承对象
继承 extends 多态继承是面向对象最经常使用的特征之一：继承语法是通过继承发、基类的域和方法 //继承就是从现有的类中生成一个新的类，这个新类拥有现有类的所有extends是使用继承的关键字：在A类中定义属性和方法； class A{ //定义属性 int age； //定义方法 public void go
JS的undefined与null的实例 bijian1013 JavaScript JavaScript
<form name="theform" id="theform"> </form> <script language="javascript"> var a alert(typeof(b)); //这里提示undefined if(theform.datas
TDD实践（一） bijian1013 java 敏捷 TDD
一.TDD概述 TDD：测试驱动开发，它的基本思想就是在开发功能代码之前，先编写测试代码。也就是说在明确要开发某个功能后，首先思考如何对这个功能进行测试，并完成测试代码的编写，然后编写相关的代码满足这些测试用例。然后循环进行添加其他功能，直到完全部功能的开发。
[Maven学习笔记十]Maven Profile与资源文件过滤器 bit1129 maven
什么是Maven Profile Maven Profile的含义是针对编译打包环境和编译打包目的配置定制，可以在不同的环境上选择相应的配置，例如DB信息，可以根据是为开发环境编译打包，还是为生产环境编译打包，动态的选择正确的DB配置信息 Profile的激活机制 1.Profile可以手工激活，比如在Intellij Idea的Maven Project视图中可以选择一个P
【Hive八】Hive用户自定义生成表函数(UDTF) bit1129 hive
1. 什么是UDTF UDTF，是User Defined Table-Generating Functions，一眼看上去，貌似是用户自定义生成表函数，这个生成表不应该理解为生成了一个HQL Table，貌似更应该理解为生成了类似关系表的二维行数据集 2. 如何实现UDTF 继承org.apache.hadoop.hive.ql.udf.generic
tfs restful api 加auth 2.0认计 ronin47
　　目前思考如何给tfs的ngx-tfs api增加安全性。有如下两点：　　一是基于客户端的ip设置。这个比较容易实现。　　二是基于OAuth2.0认证，这个需要lua，实现起来相对于一来说，有些难度。　　现在重点介绍第二种方法实现思路。　　前言：我们使用Nginx的Lua中间件建立了OAuth2认证和授权层。如果你也有此打算，阅读下面的文档，实现自动化并获得收益。SeatGe
jdk环境变量配置 byalias java jdk
进行java开发，首先要安装jdk，安装了jdk后还要进行环境变量配置： 1、下载jdk（http://java.sun.com/javase/downloads/index.jsp），我下载的版本是：jdk-7u79-windows-x64.exe 2、安装jdk-7u79-windows-x64.exe 3、配置环境变量：右击"计算机"-->&quo
《代码大全》表驱动法-Table Driven Approach-2 bylijinnan java
package com.ljn.base; import java.io.BufferedReader; import java.io.FileInputStream; import java.io.InputStreamReader; import java.util.ArrayList; import java.util.Collections; import java.uti
SQL 数值四舍五入小数点后保留2位 chicony 四舍五入
1.round() 函数是四舍五入用，第一个参数是我们要被操作的数据，第二个参数是设置我们四舍五入之后小数点后显示几位。 2.numeric 函数的2个参数，第一个表示数据长度，第二个参数表示小数点后位数。例如：　　select cast(round(12.5,2) as numeric(5,2))
c++运算符重载 CrazyMizzz C++
一、加+，减-，乘*，除/ 的运算符重载 Rational operator*(const Rational &x) const{ return Rational(x.a * this->a); } 在这里只写乘法的，加减除的写法类似二、<<输出,>>输入的运算符重载 &nb
hive DDL语法汇总 daizj hive 修改列 DDL 修改表
hive DDL语法汇总１、对表重命名 hive> ALTER TABLE table_name RENAME TO new_table_name; 2、修改表备注 hive> ALTER TABLE table_name SET TBLPROPERTIES ('comment' = new_comm
jbox使用说明 dcj3sjt126com Web
参考网址：http://www.kudystudio.com/jbox/jbox-demo.html jBox v2.3 beta [ 点击下载] 技术交流QQGroup：172543951 100521167 [2011-11-11] jBox v2.3 正式版 - [调整&修复] IE6下有iframe或页面有active、applet控件
UISegmentedControl 开发笔记 dcj3sjt126com
// typedef NS_ENUM(NSInteger, UISegmentedControlStyle) { // UISegmentedControlStylePlain, // large plain &
Slick生成表映射文件 ekian scala
Scala添加SLICK进行数据库操作，需在sbt文件上添加slick-codegen包 "com.typesafe.slick" %% "slick-codegen" % slickVersion 因为我是连接SQL Server数据库，还需添加slick-extensions，jtds包 "com.typesa
ES-TEST gengzg test
package com.MarkNum; import java.io.IOException; import java.util.Date; import java.util.HashMap; import java.util.Map; import javax.servlet.ServletException; import javax.servlet.annotation
为何外键不再推荐使用 hugh.wang mysql DB
表的关联，是一种逻辑关系，并不需要进行物理上的“硬关联”，而且你所期望的关联，其实只是其数据上存在一定的联系而已，而这种联系实际上是在设计之初就定义好的固有逻辑。在业务代码中实现的时候，只要按照设计之初的这种固有关联逻辑来处理数据即可，并不需要在数据库层面进行“硬关联”，因为在数据库层面通过使用外键的方式进行“硬关联”，会带来很多额外的资源消耗来进行一致性和完整性校验，即使很多时候我们并不
领域驱动设计 julyflame VO DAO 设计模式 DTO po
概念： VO（View Object）：视图对象，用于展示层，它的作用是把某个指定页面（或组件）的所有数据封装起来。 DTO（Data Transfer Object）：数据传输对象，这个概念来源于J2EE的设计模式，原来的目的是为了EJB的分布式应用提供粗粒度的数据实体，以减少分布式调用的次数，从而提高分布式调用的性能和降低网络负载，但在这里，我泛指用于展示层与服务层之间的数据传输对
单例设计模式 hm4123660 java Singleton 单例设计模式懒汉式饿汉式
单例模式是一种常用的软件设计模式。在它的核心结构中只包含一个被称为单例类的特殊类。通过单例模式可以保证系统中一个类只有一个实例而且该实例易于外界访问，从而方便对实例个数的控制并节约系统源。如果希望在系统中某个类的对象只能存在一个，单例模式是最好的解决方案。 &nb
logback zhb8015 log logback
一、logback的介绍 Logback是由log4j创始人设计的又一个开源日志组件。logback当前分成三个模块：logback-core,logback- classic和logback-access。logback-core是其它两个模块的基础模块。logback-classic是log4j的一个改良版本。此外logback-class
整合Kafka到Spark Streaming——代码示例和挑战 Stark_Summer spark storm zookeeper PARALLELISM processing
作者Michael G. Noll是瑞士的一位工程师和研究员，效力于Verisign，是Verisign实验室的大规模数据分析基础设施（基础Hadoop）的技术主管。本文，Michael详细的演示了如何将Kafka整合到Spark Streaming中。期间， Michael还提到了将Kafka整合到 Spark Streaming中的一些现状，非常值得阅读，虽然有一些信息在Spark 1.2版
spring-master-slave-commondao 王新春 DAO spring dataSource slave master
互联网的web项目，都有个特点：请求的并发量高，其中请求最耗时的db操作，又是系统优化的重中之重。为此，往往搭建 db的一主多从库的数据库架构。作为web的DAO层，要保证针对主库进行写操作，对多个从库进行读操作。当然在一些请求中，为了避免主从复制的延迟导致的数据不一致性，部分的读操作也要到主库上。（这种需求一般通过业务垂直分开，比如下单业务的代码所部署的机器，读去应该也要从主库读取数

Python数据分析入门笔记3——数据预处理之缺失值

系列文章目录

Python数据分析入门笔记

前言

一、数据清理概述

1.缺失值的处理方式

2.重复值的处理方式

3.异常值的处理方式

二、缺失值的检测

1.缺失值

2.缺失值的检测

三、缺失值的处理

1.删除缺失值——dropna()

2.填充缺失值——fillna()

3.插补缺失值——interpolate()

四、缺失值实用处理流程

1. 文件中有缺失值，加载时如何处理？

2. 观察缺失数据占比，能否直接删除缺失值？（最好不要删除）

3. 能否直接采用填充缺失值的方式处理？

总结

上文答案

你可能感兴趣的:(Python数据分析入门,数据分析,python)