荼靡，

特征工程概述笔记

特征工程

1.定义

1.1为什么需要特征工程

样本数据中的特征有可能会存在缺失值，重复值，异常值等，需要对特征中的相关的噪点数据进行处理
- 处理目的：有一个更纯净的样本集，让模型基于这组数据可以有更好的预测能力…

1.2什么是特征工程

特征工程是将原始数据转换为更好的代表预测模型的潜在问题的特征过程，从而提高对未知数据预测的准确性
- 比如：AlphaGo学习的数据中既有棋谱，又有食谱和歌词，一些干扰数据绝对会影响AlphaGo的学习

1.3特征工程的意义

直接会影响模型预测的结果

1.4实现特征工程

工具：sklearn
sklearn介绍
- 是python语言中的机器学习工具，包含了很多知名的机器学习算法的实现，其文档完善，容易上手
- 功能
  - 分类模型
  - 回归模型
  - 聚类模型
  - 特征工程

2.特征提取

2.1目的

采集到的样本中的特征数据往往很多时候为字符串或者其他类型的数据，电脑只可以识别二进制数值型的数据，如果把字符串给电脑，电脑不能识别【如果不是数值型数据，识别不了】

效果演示【将字符串转换为数字】

from sklearn.feature_extraction.text import CountVectorizer
vector=CountVectorizer()
res=vector.fit_transform(['lift is short,I love python','lift is too long,I hate python'])
print(res.toarray())
# [[0 1 1 0 1 1 1 0]
#  [1 1 1 1 0 1 0 1]]

结论
- 特征抽取对文本等数据进行特征值化【将数据转为数值型数据】，特征值化是为了让机器更好的理解数据

2.2特征提取的方式

2.2.1字典特征提取

作用：对字典数据进行特征值化

from sklearn.feature_extraction import DictVectorizer
fit_transform(X) #X为字典或者包含字典的迭代器，返回值为sparse矩阵
inverse_transform(X) #X为sparse矩阵或者array数组，返回值为转换之前的数据格式
transform(X) #按照原先的标准转换
get_feature_names() #返回类别名称

示例代码

from sklearn.feature_extraction import DictVectorizer
alist=[
    {"city":'AHui','temp':33},
    {'city':'GZ','temp':42},
    {'city':'SH','temp':40}
]

d=DictVectorizer()  #实例化一个工具类对象
feature=d.fit_transform(alist)  #返回一个sparse矩阵(存储的就是特征值化之后的结果)
print(feature)
#   (0, 0)	1.0
#   (0, 3)	33.0
#   (1, 1)	1.0
#   (1, 3)	42.0
#   (2, 2)	1.0
#   (2, 3)	40.0
print(d.get_feature_names())
# ['city=AHui', 'city=GZ', 'city=SH', 'temp']
print(feature.toarray())
# [[ 1.  0.  0. 33.]
#  [ 0.  1.  0. 42.]
#  [ 0.  0.  1. 40.]]

补充，sparse矩阵的理解
- 在DictVectorizer类的构造方法中设定sparse=False,则返回的就不是sparse矩阵，而是一个数组
- sparse矩阵就是一个变相的数组或者列表，目的是为了节省内存
示例代码

from sklearn.feature_extraction import DictVectorizer
alist=[
    {"city":'AHui','temp':33},
    {'city':'GZ','temp':42},
    {'city':'SH','temp':40}
]
d=DictVectorizer(sparse=False)
#返回一个二维列表
fature=d.fit_transform(alist)
print(d.get_feature_names())    # ['city=AHui', 'city=GZ', 'city=SH', 'temp']
print(feature)
#输出结果：1为是，0为不是
                               # [[ 1.  0.  0. 33.]  
                               #  [ 0.  1.  0. 42.]
                                # [ 0.  0.  1. 40.]]

2.2.2 文本特征提取

作用：对文本数据进行特征值化

from sklearn.feature_extraction.text import CountVectorizer
fit_transform(X) #X为文本或者包含文本字符串的可迭代对象，返回sparse矩阵
inverse_transform(X) #X为sparse矩阵或者array数组，返回值为转换之前的数据格式
toarray() #将sparse矩阵转化为数组

示例代码

from sklearn.feature_extraction.text import CountVectorizer
vector=CountVectorizer()
res=vector.fit_transform(['lift is is short,I love python','lift is too long,I hate python'])
print(res)#sparse矩阵
#   (0, 2)	1
#   (0, 1)	2
#   (0, 6)	1
#   (0, 4)	1
#   (0, 5)	1
#   (1, 2)	1
#   (1, 1)	1
#   (1, 5)	1
#   (1, 7)	1
#   (1, 3)	1
#   (1, 0)	1
print(vector.get_feature_names())
#['hate', 'is', 'lift', 'long', 'love', 'python', 'short', 'too']
print(res.toarray())#将sparse矩阵转换成数组
# [[0 2 1 0 1 1 1 0]
#  [1 1 1 1 0 1 0 1]]
#注意：单字母不统计(因为单个字母代表不了实际含义)，然后每个数字表示的是单词出现的次数

中文文本特征提取【对有标点符号的中文文本进行特征提取】

from sklearn.feature_extraction.text import CountVectorizer
vector=CountVectorizer()
res=vector.fit_transform(['人生苦短 我用python','人生满长，不用python'])
print(res)
# (0, 2)	1
#   (0, 3)	1
#   (1, 1)	1
#   (1, 0)	1
print(vector.get_feature_names())
['不用python', '人生满长', '人生苦短', '我用python']
print(res.toarray())
# [[0 0 1 1]
#  [1 1 0 0]]

中文文本特征提取【对有标点符合且有空格分隔的中文文本进行特征提取】【注意：单个汉字不统计】

from sklearn.feature_extraction.text import CountVectorizer
vector=CountVectorizer()
res=vector.fit_transform(['人生 苦短， 我 用python','人生 漫长, 不用 python'])
print(res)
# (0, 2)	1
#   (0, 5)	1
#   (0, 4)	1
#   (1, 2)	1
#   (1, 3)	1
#   (1, 1)	1
#   (1, 0)	1
print(vector.get_feature_names())
# ['python', '不用', '人生', '漫长', '用python', '苦短']
print(res.toarray())
# [[0 0 1 0 1 1]
#  [1 1 1 1 0 0]]

目前CountVectorizer只可以对有标点符号和用分隔符对应的文本进行特征提取，满足不了需求【在自然语言处理中，我们是需要将一段中文文本中相关的词语，成语，形容词…都要进行提取的】

2.2.3jieba分词

对中文文章进行分词处理

使用

#基本使用：对文章进行分词
import jieba
jb = jieba.cut('我是一个好人')
content = list(jb)
ct = ' '.join(content)
print(ct) #返回空格区分的词语

import jieba
from sklearn.feature_extraction.text import CountVectorizer
jb1=jieba.cut('人生苦短，我用python,你觉得我说的对吗？')
ct1=" ".join(list(jb1))
print(ct1)
# 人生 苦短 ， 我用 python , 你 觉得 我 说 的 对 吗 ？
jb2=jieba.cut('人生满长，不用python,你说我说的对不对？')
ct2=" ".join(list(jb2))
print(ct2)
# 人生 满长 ， 不用 python , 你 说 我 说 的 对 不 对 ？
vector=CountVectorizer()
res=vector.fit_transform([ct1,ct2])
print(res)
#   (0, 2)	1
#   (0, 5)	1
#   (0, 3)	1
#   (0, 0)	1
#   (0, 6)	1
#   (1, 2)	1
#   (1, 0)	1
#   (1, 4)	1
#   (1, 1)	1
print(vector.get_feature_names())
# ['python', '不用', '人生', '我用', '满长', '苦短', '觉得']
print(res.toarray())
# [[1 0 1 1 0 1 1]
#  [1 1 1 0 1 0 0]]

2.3onhot编码

sparse矩阵中的0和1就是onehot编码
-
为什么需要onehot编码
- 特征抽取主要目的就是对非数值型的数据进行特征值化!如果现在需要对下图中的human和alien进行手动特征值化Alien为4，human为1。则1和4有没有优先级或者权重大小之分呢？
- 就需要用onehot编码
- 基于pandas实现onehot编码【pd.get_dummies(df['col']】
```
import pandas as pd
df=pd.DataFrame([
    ['green','M',20,'class1'],
    ['red','L',21,"class2"],
    ['blue','XL',30,'class3']
])
df.columns=['color','size','weight','class label']
#将color这一列变成one-hot编码
pd.get_dummies(df['color'])

#		blue	green	red
#	0	0		1		0
#	1	0		0		1
#	2	1		0		0
```

3.特征值的预处理

对数值型数据进行处理
预处理就是用来实现无量钢化的方式
无量钢化：
- 在机器学习算法实践中，我们往往有着将不同规格的数据转换到同一规格，或不同分布的数据转换到某个特定分布的需求，这种需求统称为将数据"无量纲化"
- 例如：
  - 梯度和矩阵为核心的算法中；逻辑回归，支持向量机，神经网络，无量钢化可以加快求解速度；
  - 在距离类模型，譬如K近邻，K-Means聚类中，无量钢化可以帮我们提升模型精度，避免某一个取值范围特别大的特征对距离计算造成的影响(一个特例是决策树和树的集成算法，对决策树不需要无量钢化，决策树可以把任意数据都处理的很好)
含义：特征抽取后我们就可以获取对应的数值型的样本数据，然后进行数据处理
概念：通过特定的统计方式(数学方法),将算法转换成算法要求的数据
方式
- 归一化
- 标准化
案例分析
- 如果认为每一个特征具有同等大小的权重都同等重要，则必须要对其进行归一化处理
- 可以使用KNN算法对特征影响进行说明。

3.1归一化实现

归一化后的数据服从正态分布

from sklearn.preprocessing import MinMaxScaler
参数：feature_range表示缩放范围，通常使用(0,1)
作用：使得某一个特征对最终结果不会造成很大的影响

from sklearn.preprocessing import MinMaxScaler
mm=MinMaxScaler(feature_range=(0,1))  #每个特征缩放的范围
data=[[90,2,10,40],[60,5,15,45],[73,3,13,45]]
data=mm.fit_transform(data)#data需要归一化的特征
print(data)
# [[1.         0.         0.         0.        ]
#  [0.         1.         1.         1.        ]
#  [0.43333333 0.33333333 0.6        1.        ]]

问题：如果数据中存在的异常值比较多，会有什么影响?
- 结合着归一化计算的公式，异常值对原始特征中的最大值和最小值的影响很大，因此也会影响对归一化的值，这个也是归一化的一个弊端，无法很多好的处理异常值
归一化总结：
- 在特定场景下最大值和最小值是变化的，另外最大最小值很容易受到异常值的影响，所以这种归一化的方式具有一定的局限性。因此引出了一种更好的方式叫做：标准化！！！

3.2标准化处理

当数据按均值中心化后，再按标准差缩放，数据就会服从为均值为0，方差为1的正态分布(即标准正态分布),而这个过程，就叫做数据标准化(Standardization，又称Z-score normalization)，公式如下
从公式可以看出，异常值对均值和标准差的影响不大

API

处理后，每列所有的数据都聚集在均值为0，标准差为1范围附近

标准化API:

from sklearn.preprocessing import StandardScaler
fit_transform(X) #对X标准化
mean_#均值
var_ #方差

示例

from sklearn.preprocessing import StandardScaler
ss=StandardScaler()
data=[[90,2,10,40],[60,5,15,45],[73,3,13,45]]
ss.fit_transform(data)
# array([[ 1.27540458, -1.06904497, -1.29777137, -1.41421356],
#        [-1.16685951,  1.33630621,  1.13554995,  0.70710678],
#        [-0.10854507, -0.26726124,  0.16222142,  0.70710678]])
ss.mean_   #array([74.33333333,  3.33333333, 12.66666667, 43.33333333])
ss.var_   #array([150.88888889,   1.55555556,   4.22222222,   5.55555556])

3.3 归一化和标准化总结

归一化，如果出现了异常值则会影响特征的最大值最小值，那么最终结果会受到比较大影响
标准化，如果出现异常点，由于具有一定的数据量，少量的异常点对于平均值的影响并不大，从而标准差改变比较少

3.4`StandardScaler`和`MinMaxSclaer`选哪个？

大多数机器学习算法中，会选择StandardSclaer来进行特征缩放，因为MinMaxSclaer对异常值非常敏感。在CPA，聚类，逻辑回归，支持向量机，神经网络这些算法中，StandardSclaer往往是最好的选择。
MinMaxScaler在不涉及距离度量，梯度，协方差计算以及数据需要被压缩到特定区间时，使用广泛，比如数字图像处理中量化像素强度时，都会使用MinMaxScaler将数据压缩于[0,1]区间之中
建议先用StandardScaler,效果不好换MinMaxScaler

4.特征选择

4.1定义

从特征中选择出有意义对模型有帮助的特征作为最终的机器学习输入的数据
注意
- 在做特征选择之前，有三件非常重要的事：
  - 跟数据提供者联系
  - 跟数据提供者沟通
  - 跟数据提供者开会
- 一定要抓住给你提供数据的人，尤其是理解业务和数据含义的人，跟他们聊一段时间，技术能够让模型起飞，前提是你和业务员一样理解数据。所以特征选择是第一步，根据目标，用业务常识来选择特征

4.2特征选择的原因

冗余：部分特征的相关度高，容易消耗计算机的性能【数据相似度高】【例如：房价预测数据中有楼层和高度，这两个特征相关度高】
噪点：部分特征对预测结果有偏执影响【预测无关的数据】【例如：房价预测，数据中有购买房子的人的身高，跟预测无关的数据】

4.3特征选择的实现

人为对不相关的特征进行主关舍弃
在真正的数据应用领域，比如：金融，医疗，电商，我们得数据特征非常多，这样明显，如果遇见极端的情况，我们无法依赖对业务的理解来选则特征怎么办？
- 在已有特征和对应预测结果的基础上，使用相关的工具过滤一些无用或权重较低的特征
  - 工具
    - Filter(过滤式)
    - Embedded(嵌入式):决策树模型会自己选择出对其重要的特征
    - PCA降维

4.4特征选择工具

4.4.1Filter过滤式(方差过滤)：

原理：这是通过特征本身的方差来筛选特征的类，比如：一个特征本身的方差很小，就表示样本在这个特征上基本没有差异，可能特征中的大多数值都一样，甚至整个特征的取值都相同，那这个特征对于样本区分没有作用，所以无论接下来特征工程要做什么，都要优先消除方差为0或方差较低的特征

API

from sklearn.feature_selection import VarianceThreshold
VarianceThreshold(threshold=x) #threshold为方差的值，删除所有方差低于x的特征，默认为0表示保留所有方差为非0的特征
fit_transform(X) #X为特征

示例

from sklearn.feature_selection import VarianceThreshold
#threshold方差的值，threshold=1,删除所有方差低于1的特征，默认为0，宝石保留所有方差为非0的特征
v=VarianceThreshold(threshold=1)
v.fit_transform([[0,2,4,3],[0,3,7,3],[0,9,6,3]])#X为特征【数据为特征】

如果将方差为0或方差极低的特征取出后，剩余特征还有很多且模型的效果没有显著提升，则可以用方差将特征选择【一步到位】。留下一半的特征，那可以设定一个让特征总数减半的方差阈值，即找到特征方差的中位数，将中位数作为参数threshold的值即可
```
from sklearn.feature_selection import VarianceThreshold
#threshold方差的值，threshold=1,删除所有方差低于1的特征，默认为0，宝石保留所有方差为非0的特征
v=VarianceThreshold(threshold=np.median(X.var().values))
v.fit_transform(X)## X为样本数据中的特征列
```
方差过滤对模型的影响
- 例如：KNN在方差过滤前和方差过滤后运行的效果和运行时间的对比。KNN是K近邻算法中的分类算法，其原理非常简单，是利用每个样本到其他样本点的距离来判断每个样本点的相似度，然后对样本进行分类。KNN必须遍历每个特征和每个样本，因而特征越多，KNN的计算也就会越缓慢，以下是代码运行时间对比。
- 方差过滤前
- 方差过滤后
- 可以看出，对于KNN，过滤后的效果十分明显:准确率稍有提升，但平均运行时间减少了10分钟，特征选择过后算法的效率上升了1/3.
- 注意：方差过滤主要服务对象是：需要遍历特征的算法模型，而过滤的主要目的是在维持算法表现的前提下，帮助算法降低计算成本

4.4.2PCA降维(主成分分析)

定义
- PCA降维(主成分分析)：是一种分析，简化数据集的技术
降维的维度值就是特征的种类
思想：如何跟好的对一个立体的物体用二维表示
当然，第四张二维图片可以比较好的标识一个立体三维的水壶。但是也要清楚，用一个低纬度去表示高纬度的物体时，一定会造成一些信息的差异。可以让低纬度也可以能正确的表示高纬度的事物，或者信息差异最小。
目的：特征数量达到上百，上千的时候，考虑数据的优化。使数据维度压缩，尽可能降低源数据的维度（复杂度），损失少量信息。
作用：可以削减回归分析或者聚类分析中特征的数量
PCA大致原理
红色为原始的样本特征，为二维的特征，如果降为一维，则可以将5个红色的原始特征，映射到一维的线段上就变成了4个特征。

PCA语法

from sklearn.decomposition import PCA
pca=PCA(n_components=None)
# n_components可以为小数(保留特征的百分比)，整数(减少到的特征数量)
pca.fit_transform(X)

示例

from sklearn.decomposition import PCA
#将数据分解为较低维度的空间
#n_components可以为小数(保留特征的百分比)，整数(减少到的特征数量)【保留几个特征值】
pca=PCA(n_components=2)
pca.fit_transform([[0,2,4,3],[0,3,7,3],[0,9,6,3]])

5.特征筛选

5.1概述

概述：IV和WOE通常是用在对模型的特征筛选中，在模型刚建立时，变量往往很多，IV和WOE可以帮助我们衡量什么变量应该进入模型什么变量应该舍弃。用IV和WOE值来进行判断，值越大表示该特征的预测能力越强，则该特征应该加入到模型的训练中

5.2应用

变量筛选。我们需要选取比较重要的变量加入模型，预测强度可以作为我们判断变量是否重要的依据
指导变量离散化，在建模过程中，时常需要对连续变量进行离散化处理，如将年龄里进行分段。但是变量不同的离散化结果会对模型产生不同影响，因此，可以根据指标所反映的预测强度，调整变量离散化结果。(对一些取值很多的分类变量，在需要时也可以对其进行再分组，实现降维)

5.3 计算方法

5.3.1WOE

WOE（Weight Of Evidence）用来衡量特征的预测强度，要是用WOE，首先要对特征进行分箱(分组：将一种特征的组成元素进行分组)，分享之后，对于其中第i组的WOE值公式如下：

py_i表示该组中的正例占负例样本的比例，pn_i表示整体的正例占负例样本的比例
例子
- 假设现在某个公司举行一个活动，在举行这个活动之前，先在小范围的客户中进行了一次试点，收集了一些用户对这次活动的一些响应，然后希望通过这些数据，去构造一个模型，预测如果举行这次的活动，是否能够得到很好的响应或者得到客户的响应概率之类。
- 假设我们已经从公司客户列表中随机抽取了100000个客户进行了营销活动测试，收集了这些客户的响应结果，作为我们的建模数据集，其中响应的客户有10000个。另外假设我们也已经提取到了这些客户的一些变量，作为我们模型的候选变量集，这些变量包括以下这些:
  - 最近一个月是否有购买；
  - 最近一次购买金额；
- 假设，我们已经对这些变量进行了离散化，统计的结果如下面几张表所示。

我们以其中的一个变量“最近一次购买金额”变量为例：

我们把这个变量离散化为了4个分段：<100元，[100,200)，[200,500)，>=500元。首先，根据WOE计算公式，这四个分段的WOE分别为：

根据结果，对结果的正负值分析，根据ln函数的特性，当这个组中响应样本的比例比总体的响应比例小时为负数，相等时为0，大于时为整数
把这个变量的所有分组的WOE值的绝对值加起来，这个可以在一定程度上表示这个变量的预测能力，但是一般不会这么做，因为对于分组中的样本数量相差悬殊的场景，WOE值可能不能很好的表示出这个变量的预测能力，一边会用到另一个值：IV值。IV在计算的时候，比WOE值多考虑了一层该变量下该分组占该变量下所有样本的比例

5.3.1IV

IV值的计算公式在WOE的基础上多乘了一个(py_i-pn_i),py_i表示该组中的正例占负例样本的比例，pn_i表示整体的正例占负例样本的比例

把上面的IV1,IV2,IV3,IV4加起来，就是变量的IV值，然后把所有的变量IV值都算出来，就可以根据IV值的大小来看出变量的预测能力

5.4分箱

数据分箱(也称为离散分箱或分段)是一种数据预处理技术，用于减少次要观察误差的影响，是一种将多个连续值分组为较少数量的"分箱"的方法，就是将连续型特征进行离散化
分箱的作用和意义
- 离散特征的增加和减少都很容易，易于模型的快速迭代，提升计算速度
- 特征离散化后，模型会更稳定，比如对年龄离散化，20-30为一个区间，不会因为一个用户年龄增长了一岁就变成了一个完全不同的人
- 特征离散化后，起到了简化模型的作用，可以适当降低模型过拟合的风险
注意：对特征进行分箱后，需要对分箱后的每组(箱)进行woe编码，然后才能放进模型训练
例如我们有一组关于人年龄的数据，如下图所示

将他们的年龄分组到更少的间隔中，对连续性特征进行离散化

注意
- 分箱的数据不一定必须是数字，可以是任意类型的值，如"狗"，"猫"等，分箱也用于图像处理，通过将相邻像素组合成单个像素，它可用于减少数据量

5.4.1 pandas实现数据分箱

pd.cut()

import numpy as np
import pandas as pd
from pandas import Series,DataFrame
score_list=np.random.randint(30,100,size=20)
# [92 73 73 49 62 35 56 90 81 84 84 89 96 94 54 51 91 43 54 98]
#设置分箱：方式一
bins=[0,59,70,80,100]
score_cat=pd.cut(score_list,bins)#指定分箱数据的范围
print(pd.value_counts(score_cat))
# Categories (4, interval[int64]): [(0, 59] < (59, 70] < (70, 80] < (80, 100]]
# (0, 59]      9
# (80, 100]    4
# (70, 80]     4
# (59, 70]     3
# dtype: int64

#设置分箱:方式2
bins = 3#指定分箱数据的范围的个数
score_cat = pd.cut(score_list, bins,labels=range(3))#labels设置分箱的每一个范围标识
print(score_cat)
print(pd.value_counts(score_cat))
# [0, 2, 0, 1, 1, ..., 0, 0, 2, 2, 0]
# Length: 20
# Categories (3, int64): [0 < 1 < 2]
# 0    9
# 2    7
# 1    4
# dtype: int64

import sklearn.datasets as ds
bc=ds.load_breast_cancer()
feature=bc.data
target=bc.target
#查看第一列数据范围，判定是连续数据
feature[:,1].min(),feature[:,1].max()#(9.71, 39.28)

#对其进行分箱处理，将其离散化
fea_bins=pd.cut(feature[:,1],bins=5,labels=range(5))
fea_bins.value_counts()
#0    113
# 1    299
# 2    129
# 3     25
# 4      3
# dtype: int64

#对分箱后的特征进行woe编码
gi=pd.crosstab(fea_bins,target)

gb=pd.Series(data=target).value_counts()
bgi=(gi[1]/gi[0])/(gb[1]/gb[0])
# row_0
# 0    7.794118
# 1    1.164157
# 2    0.257330
# 3    0.755793
# 4    0.296919
# dtype: float64
woe=np.log(bgi)
# row_0
# 0    2.053369
# 1    0.151997
# 2   -1.357398
# 3   -0.279987
# 4   -1.214297
# dtype: float64

#进行映射操作
dict=woe.to_dict()
woe_bins=fea_bins.map(dict)
woe_bins.tolist()

6.样本类别分布不均衡处理

6.1什么是样本类别分布不均衡？

在一组样本种不同类别的样本量差异非常大，比如拥有1000条数据样本的数据集，有一类样本分类只占10条，此时属于非常严重的数据样本分布不均衡

6.2 样本类别分布不均衡导致的危害

样本类别不均衡将导致样本量少的分类所包含的特征过少，并很难提取规律；即使得到分类模型，也容易产生过度依赖与有限的数据样本而导致过拟合问题，当模型应用到新的数据上时，模型的准确性会很差

6.3解决方法

通过过抽样和欠抽样解决样本不均衡

6.3.1 过抽样（over-sampling）

from imblearn.over_sampling import SMOTE
通过增加分类中少数类样本的数量来实现样本均衡，比较好的方法有SMOTE算法
SMOTE算法原理
- smote算法的思想是合成新的少数类样本，合成的策略是对每个少数类样本a,从他的最近邻中随机选一个样本b，然后再a,b之间连线上随机选一点作为新合成的少数类样本

示例

import pandas as pd
import numpy as np
from imblearn.over_sampling import SMOTE
#数据源生成
x=np.random.randint(0,100,size=(100,3))
y=pd.Series(data=np.random.randint(0,1,size=(95,)))
y=y.append(pd.Series(data=[1,1,1,1,1]),ignore_index=False).values
y=y.reshape((-1,1))
all_data_up=np.concatenate((x,y),axis=1)
np.random.shuffle(all_data_up)
df=pd.DataFrame(all_data_up)
#提取样本数据
feature=df[[0,1,2]]
target=df[3]
target.value_counts()
# 0    95
# 1     5
# Name: 3, dtype: int64
target.shape  #(190,)

s=SMOTE(k_neighbors=3) #实例化算法对象
s_feature,s_target=s.fit_resample(feature,target)#合成新的样本数据
s_target.shape  #(190,)
s_target.value_counts()
#1    95
# 0    95
# Name: 3, dtype: int64

6.3.2欠抽样（under-sampling）

欠抽样：通过减少分类中多数类样本的数量来实现样本均衡

from imblearn.under_sampling import RandomUnderSampler

import pandas as pd
import numpy as np
from imblearn.under_sampling import RandomUnderSampler
#数据源生成
x=np.random.randint(0,100,size=(100,3))
y=pd.Series(data=np.random.randint(0,1,size=(95,)))
y=y.append(pd.Series(data=[1,1,1,1,1]),ignore_index=False).values
y=y.reshape((-1,1))
all_data_up=np.concatenate((x,y),axis=1)
np.random.shuffle(all_data_up)
df=pd.DataFrame(all_data_up)
#提取样本数据
feature=df[[0,1,2]]
target=df[3]
target.value_counts() 
# 0    95
# 1     5
# Name: 3, dtype: int64

r=RandomUnderSampler()
r_feature,r_target=r.fit_resample(feature,target)
r_target.shape  #(10,)

r_target.value_counts()
# 1    5
# 0    5
# Name: 3, dtype: int64

r_feature.shape  #(10, 3)

https://www.luffycity.com/

你可能感兴趣的:(机器学习笔记,sklearn,机器学习,python)

【python】setuptools Eternal-Student Python python 开发语言
setuptools是Python的一个核心工具包，用于构建、打包和分发Python项目。它是Python生态系统中最重要的工具之一，主要用于定义项目的元数据（如名称、版本、依赖等）以及构建和安装过程。以下是关于setuptools的详细介绍：1.setuptools的主要功能setuptools提供了以下核心功能：项目元数据管理：定义项目的名称、版本、作者、描述、依赖等信息。通过setup()函
【Visual Studio 2019 C++ 编译器的路径添加到系统 PATH 环境变量】 Eternal-Student Windows visual studio c++java
对于某些Python包，特别是那些涉及本地扩展或需要编译C/C++代码的包，需要一个支持C++开发的环境。VisualStudio是一个全面的开发环境，它提供了编译器、调试器以及其他许多工具，这些工具对于开发和编译C++代码非常有用。下载网址：ThankYouforDownloadingVisualStudioCommunityEdition(microsoft.com)以下是安装VisualSt
元组（tuple）转换为列表（list） Eternal-Student Python list windows 数据结构
在编程中，特别是在Python中，经常需要将元组（tuple）转换为列表（list）。元组通常使用圆括号()表示，如(x,y)，而列表使用方括号[]表示，如[x,y]。以下是如何将(x,y)转换为[x,y]的详细方法和示例。一、单个元组转换为列表方法1：使用list()函数Python提供了内置的list()函数，可以将元组直接转换为列表。示例代码：#定义一个元组tuple_point=(3,5)
【python】flask-Web 应用程序框架 3L_csdn #python flask python 前端 python web框架 http
目录简介一、简单示例二、Flask详细使用总结1、HTML转义2、路由2.1、使用route()装饰器将函数绑定到URL。2.2、变量规则2.3、唯一的URLs/重定向行为2.4、网址构建2.5、HTTP方法2.5、有json体返回的HTTPGET请求示例(请求中不带参数)2.6、有json体返回的HTTPGET请求示例(请求中带参数)简介Flask是一个轻量级的WSGIWeb应用程序框架。它旨在
超详细的Numpy基础教程！！！不会爬虫的闲鱼 numpy 数据分析 python
Numpy是一个开源的Python库，用于支持大型多维数组和矩阵运算，同时提供了大量的数学函数库。它是科学计算中非常重要的工具。Numpy在数据科学中非常重要，因为它提供了高效的数组处理能力和广泛的数学函数库，这对于处理大规模数据集、进行科学计算和机器学习等任务至关重要。一、安装与设置如何安装Numpypipinstallnumpy验证安装的方法importnumpyprint(numpy.__v
Pycharm中import torch报错解决方案（Python+Pycharm+Pytorch cpu版）波波仔86 人工智能 python pycharm pytorch import 解释器配置
pycharm环境搭建完毕后，编写一个py文件demo，importtorch报错，提示没有。设置python解释器：选择conda环境，使用现有环境，conda执行文件找到Anaconda安装路径下Scripts文件夹内的conda.exe，最后选择含有torch软件包的虚拟环境，题主创建名为pytorch。创建完解释器后，下方会显示出该解释器/虚拟环境下的所有软件包，看到有pytorch包即选
flask--基础知识点--6--flask高并发处理 Raging__Fire #flask python flask
Flask是一个轻量级的PythonWeb框架，适合构建中小型应用。但是，对于高并发场景，Flask本身可能需要一些辅助工具和配置来提升性能。以下是一些优化Flask应用以处理高并发的方法：1.使用WSGI服务器Flask自带的开发服务器性能和稳定性不足以应对生产环境中的高并发请求，可以考虑使用更强大的WSGI服务器，如：Gunicorn:一个基于Python的WSGIHTTP服务器。uWSGI:
【python error】cannot import name ‘TorchDispatchMode‘ from ‘torch.utils._python_dispatch‘ Eternal-Student Jetson Orin NX Python python 开发语言
报错：cannotimportname‘TorchDispatchMode’from‘torch.utils._python_dispatch’(/home/nvidia/.conda/envs/pytorch/lib/python3.8/site-packages/torch/utils/_python_dispatch.py)File“/media/nvidia/Ubuntu/xxxxx/ev
全自动量化交易软件是否真的可靠？使用过程中有哪些潜在风险需要注意财云量化 python炒股自动化量化交易程序化交易全自动量化交易软件可靠性潜在风险数据准确性股票量化接口股票API接口
炒股自动化：申请官方API接口，散户也可以python炒股自动化（0），申请券商API接口python炒股自动化（1），量化交易接口区别Python炒股自动化（2）：获取股票实时数据和历史数据Python炒股自动化（3）：分析取回的实时数据和历史数据Python炒股自动化（4）：通过接口向交易所发送订单Python炒股自动化（5）：通过接口查询订单，查询账户资产股票量化，Python炒股，CSDN
【测试语言篇四】Python进阶篇之json模块 m0_37135615 编程语言 python php 开发语言
一、json模块介绍JSON（JavaScript对象表示法）是一种轻量级数据格式，用于数据交换。在Python中具有用于编码和解码JSON数据的内置json模块。只需导入它，就可以使用JSON数据了：importjsonJSON的一些优点：JSON作为“字节序列”存在，在我们需要通过网络传输（流）数据的情况下非常有用。与XML相比，JSON小得多，可转化为更快的数据传输和更好的体验。JSON非常
DeepSeek API 客户端使用文档老大白菜 python 人工智能数据库
1.简介deep.py是一个用于与DeepSeekAPI交互的Python客户端封装。它提供了简单易用的接口，支持对话历史管理、日志记录等功能，使得与DeepSeekAPI的交互更加便捷和可靠。2.功能特点简单的接口设计自动管理对话历史完整的日志记录灵活的配置选项异常处理机制3.安装依赖pipinstallopenai4.配置环境在项目根目录创建.env文件：#WindowssetDEEPSEEK
信息检索系统评估指标的层级分析：从单点精确度到整体性能度量人工智能深度学习llm检索系统
在构建搜索引擎系统时，有效的评估机制是保证系统质量的关键环节。当用户输入查询词如"machinelearningtutorialspython"，系统返回结果列表后，如何客观评估这些结果的相关性和有效性？这正是信息检索评估指标的核心价值所在。分析用户与搜索引擎的交互模式，我们可以观察到以下行为特征：用户主要关注结果列表的前几项对顶部结果的关注度显著高于底部结果用户基于多次搜索体验形成对搜索系统整体
python系列【仅供参考】：python tornado 集成redis消息订阅的异步任务之后tornado主程序无法启动，解决方案坦笑&&life #python python tornado redis
pythontornado集成redis消息订阅的异步任务之后tornado主程序无法启动，解决方案pythontornado集成redis消息订阅的异步任务之后tornado主程序无法启动，解决方案封装redis异步类pythontornado集成redis消息订阅的异步任务之后tornado主程序无法启动，解决方案封装redis异步类sys_redis_helper.pyimportredis
Python通过SSH隧道访问数据库 Java菜鸟在北京 python sshtunnel paramiko SSH隧道访问数据库
本文介绍通过sshtunnel类库建立SSH隧道，使用paramiko通过SSH来访问数据库。实现了两种建立SSH方式：公私钥验证、密码验证。公私钥可读本地，也可读取AwsS3上的私钥文件。本质上就是在本机建立SSH隧道，然后将访问DB转发到本地SSH内去访问数据库。简单易懂，上代码：fromsshtunnelimportSSHTunnelForwarderfromsqlalchemyimport
用Python写一个天气预报小程序穿梭的编织者 Python脚本 python 小程序
一、界面效果二、完整代码importtkinterastkfromtkinterimportttkimportrequestsimportjsonfromdatetimeimportdatetimefromPILimportImage,ImageTkimportiofromttkbootstrapimportStyleclassWeatherApp:def__init__(self,root):s
Python写一个脚本——30行代码——1秒实现PDF任意页码拆分穿梭的编织者 Python精选 pdf python
一、引入库importosfromPyPDF2importPdfReader,PdfWriter二、定义拆分方法defsplit_pdf(input_path,output_dir,ranges):ifnotos.path.exists(output_dir):os.makedirs(output_dir)withopen(input_path,'rb')asfile:pdf=PdfReader(
python手写kmeans算法菜鸟懿机器学习聚类算法 python
kmean聚类是最基础和常见的算法，工程上使用比较常见，spark,sklearn都有实现，本文手写实现kmeans#!/usr/bin/pythonimportsysimportrandomimportmathdefcreate_rand_points(max_x,max_y,count):"""Createcountpoints(0-x),(0-y)."""points=[]foriinran
Python 科学计算与机器学习入门：NumPy + Scikit-Learn 实战指南吴师兄大模型 python numpy scikit-learn 人工智能开发语言机器学习编程
Langchain系列文章目录01-玩转LangChain：从模型调用到Prompt模板与输出解析的完整指南02-玩转LangChainMemory模块：四种记忆类型详解及应用场景全覆盖03-全面掌握LangChain：从核心链条构建到动态任务分配的实战指南04-玩转LangChain：从文档加载到高效问答系统构建的全程实战05-玩转LangChain：深度评估问答系统的三种高效方法（示例生成、手
吴恩达机器学习笔记复盘（二）监督学习和无监督学习 wgc2k 机器学习机器学习笔记学习
监督学习经济价值以及定义监督学习是机器学习中创造了99%经济价值的类型，它是学习输入到输出映射的算法，关键在于给学习算法提供包含正确答案（即给定输入X的正确标签Y）的学习例子。生活中的例子邮件分类，输入是电子邮件，输出是判断邮件是否为垃圾邮件。语音识别，输入音频剪辑，输出文本记录。机器翻译，输入一种语言文本，输出其他语言的相应翻译。在线广告，输入广告和用户信息，预测用户是否点击广告，为公司带来大量
python start函数_Python中10个常用的内置函数半残大叔霁天 python start函数
大家好，我是小张在3.8版本中，Python解释器有近69个内置函数可供使用，有了它们能极大地提高编码效率，数量虽然不少，但在日常搬砖中只用到其中一部分，根据使用频率和用法，这里列出来几个本人认为不错的内置函数，结合一些例子介绍给大家complex()返回一个形如a+bj的复数，传入参数分为三种情况：参数为空时，返回0j参数为字符串时，将字符串表达式解释为复数形式并返回参数为两个整数(a,b)时，
一个完整的python webSockets游戏服务器，每100ms接收并广播玩家位置小宝哥Code Python基础及AI开发 python 游戏服务器
PythonWebSockets游戏服务器下面是一个完整的PythonWebSockets游戏服务器实现，它每100ms接收并广播玩家位置信息。这个服务器使用websockets和asyncio库来处理WebSocket连接和异步操作。完整代码#!/usr/bin/envpython3"""实时游戏位置广播服务器每100ms接收玩家位置并广播给所有连接的客户端"""importasyncioimp
32路模拟采集PCI总线带DIO用什么采集卡阿尔泰1999 数据分析嵌入式硬件科技
北京阿尔泰科技PCI5659是一-款多功能数据采集卡，具有32路12位100K采集频率，AD带16K字FIFO缓存，保证数据的连续性，并带16路可设方向的DIO功能。产品支持阿尔泰科技最新的ART-DAQ数据管理软件，提供QT、PYTHON、LABVIEW、VC、VB、VB.NET、C#等例子程序。模拟量输入通道数32路精度12位*大采样频率100KsPs多通道采样速度各通道*大采样频率/设置的采
Python 爬虫实战：艺术品市场趋势分析与交易平台数据抓取西攻城狮北 python 爬虫开发语言
一、引言在当今数字化时代，艺术品市场正经历着前所未有的变革。随着互联网技术的飞速发展，越来越多的艺术品交易转移到了线上平台，这为我们提供了海量的数据资源。通过Python爬虫技术，我们可以抓取艺术品交易平台上的数据，进而分析艺术品市场的趋势，为投资者、收藏家以及艺术爱好者提供有价值的参考。本文将带领读者深入探索Python爬虫在艺术品市场的应用。从爬虫的基本原理到实际代码实现，再到数据的清洗、分析
【2025年饿了么春招-3月14日-第二题（200分）- 小红的排列构造】（题目+思路+Java&C++&Python解析+在线测试) 塔子哥学算法 java c++python 算法数据结构饿了么
题目内容小红希望你构造一个长度为nnn的排列，满足∑i=1n∗i\sum_{i
贪心算法在背包问题上的运用（Python） MATLAB卡尔曼智能算法的MATLAB实现贪心算法 python 算法
背包问题有n个物品，它们有各自的体积和价值，现有给定容量的背包，如何让背包里装入的物品具有最大的价值总和？这就是典型的背包问题(又称为0-1背包问题)，也是具体的、没有经过任何延伸的背包问题模型。背包问题的传统求解方法较为复杂，现定义有一个可以载重为8kg的背包，另外还有4个物品，物品的价值和质量数据如下表，不考虑背包的容量。4个物品的总质量大于8kg，所以要想在有限载重的背包携带更多质量的物品，
接口测试中加密参数如何处理？海姐软件测试接口测试 python 开发语言测试工具职场和发展
1.加密类型及应对策略①对称加密（AES/DES）特点：加密解密使用同一密钥。处理方法：向开发获取密钥和加密算法（如AES-CBC、AES-ECB）。使用代码或工具解密响应数据：python复制fromCrypto.CipherimportAESimportbase64defdecrypt_aes(key,encrypted_data):cipher=AES.new(key.encode(),AE
用Python玩转Hyperledger：构建企业级区块链解决方案 Echo_Wish Python！实战！perl python opencv 人工智能
用Python玩转Hyperledger：构建企业级区块链解决方案大家好，我是Echo_Wish。在区块链技术的炙手可热中，“企业级区块链”俨然成为了下一个重磅关键词。相比于公有区块链，企业级区块链更注重隐私性、灵活性和高效性。而在这片“蓝海”中，Hyperledger项目无疑是企业级区块链解决方案的标杆。如果再搭配上Python这种“高效工具”，简直让人事半功倍！那么，如何将Python与Hyp
安全中心建设关键技术之机器学习 sinfoyou 安全机器学习人工智能
1.1.1功能要求针对目前广为流行的网银、掌上银行撞库行为，需要围绕撞库防护建立针对性的发现、预警、拦截体系。在本课题在大量数据中自动分析获得规律，并利用规律对未知数据进行预测。通过机器学习重点解决目前无法在识别撞库攻击源IP地址的基础上，进一步识别出被撞库成功的账号。由于机器学习算法需要从数据中自动分析获得规律，所以必须要有历史数据。在针对撞库攻击行为分析的场景中，首先需要获取手机银行和网上银行
Android自动化测试工具海棠如醉 web技术自动化运维
细解自动化测试工具Airtest-CSDN博客以下是几种常见的Android应用自动化测试工具：Appium：支持多种编程语言，如Java、Python、Ruby、JavaScript等。可以用于Web应用程序和原生应用程序的自动化测试，并支持iOS和Android平台。Espresso：由Google开发的AndroidUI测试框架，可用于测试应用程序的用户界面和与用户的交互。Espresso支
Python说明一一代码 python
Python的主要特点：1.**易读易写**：Python的语法简洁明了，代码可读性高。2.**跨平台**：Python可以在多种操作系统上运行，如Windows、macOS、Linux等。3.**丰富的库**：Python拥有庞大的标准库和第三方库，涵盖了从Web开发到数据科学的多个领域。4.**动态类型**：Python是动态类型语言，变量不需要显式声明类型。5.**解释型语言**：Pytho
如何用ruby来写hadoop的mapreduce并生成jar包 wudixiaotie mapreduce
ruby来写hadoop的mapreduce，我用的方法是rubydoop。怎么配置环境呢： 1.安装rvm：不说了网上有 2.安装ruby：由于我以前是做ruby的，所以习惯性的先安装了ruby，起码调试起来比jruby快多了。 3.安装jruby： rvm install jruby然后等待安
java编程思想 -- 访问控制权限百合不是茶 java 访问控制权限单例模式
访问权限是java中一个比较中要的知识点,它规定者什么方法可以访问,什么不可以访问一:包访问权限; 自定义包: package com.wj.control; //包 public class Demo { //定义一个无参的方法 public void DemoPackage(){ System.out.println("调用
[生物与医学]请审慎食用小龙虾 comsci 生物
现在的餐馆里面出售的小龙虾,有一些是在野外捕捉的,这些小龙虾身体里面可能带有某些病毒和细菌,人食用以后可能会导致一些疾病,严重的甚至会死亡..... 所以,参加聚餐的时候,最好不要点小龙虾...就吃养殖的猪肉,牛肉,羊肉和鱼,等动物蛋白质
org.apache.jasper.JasperException: Unable to compile class for JSP: 商人shang maven 2.2 jdk1.8
环境： jdk1.8 maven tomcat7-maven-plugin 2.0 原因： tomcat7-maven-plugin 2.0 不知吃 jdk 1.8，换成 tomcat7-maven-plugin 2.2就行，即 <plugin>
你的垃圾你处理掉了吗?GC oloz GC
前序:本人菜鸟，此文研究学习来自网络，各位牛牛多指教　 1.垃圾收集算法的核心思想　　Java语言建立了垃圾收集机制，用以跟踪正在使用的对象和发现并回收不再使用(引用)的对象。该机制可以有效防范动态内存分配中可能发生的两个危险：因内存垃圾过多而引发的内存耗尽，以及不恰当的内存释放所造成的内存非法引用。　　垃圾收集算法的核心思想是：对虚拟机可用内存空间，即堆空间中的对象进行识别
shiro 和 SESSSION 杨白白 shiro
shiro 在web项目里默认使用的是web容器提供的session，也就是说shiro使用的session是web容器产生的，并不是自己产生的，在用于非web环境时可用其他来源代替。在web工程启动的时候它就和容器绑定在了一起，这是通过web.xml里面的shiroFilter实现的。通过session.getSession()方法会在浏览器cokkice产生JESSIONID，当关闭浏览器，此
移动互联网终端淘宝客如何实现盈利小桔子移動客戶端淘客淘寶App
2012年淘宝联盟平台为站长和淘宝客带来的分成收入突破30亿元，同比增长100%。而来自移动端的分成达1亿元，其中美丽说、蘑菇街、果库、口袋购物等App运营商分成近5000万元。可以看出，虽然目前阶段PC端对于淘客而言仍旧是盈利的大头，但移动端已经呈现出爆发之势。而且这个势头将随着智能终端(手机，平板)的加速普及而更加迅猛
wordpress小工具制作 aichenglong wordpress 小工具
wordpress 使用侧边栏的小工具，很方便调整页面结构小工具的制作过程 1 在自己的主题文件中新建一个文件夹(如widget)，在文件夹中创建一个php(AWP_posts-category.php) 小工具是一个类,想侧边栏一样，还得使用代码注册，他才可以再后台使用，基本的代码一层不变 <?php class AWP_Post_Category extends WP_Wi
JS微信分享 AILIKES js
// 所有功能必须包含在 WeixinApi.ready 中进行 WeixinApi.ready(function(Api) { // 微信分享的数据 var wxData = { &nb
封装探讨百合不是茶 JAVA面向对象封装
//封装属性方法将某些东西包装在一起，通过创建对象或使用静态的方法来调用，称为封装；封装其实就是有选择性地公开或隐藏某些信息，它解决了数据的安全性问题，增加代码的可读性和可维护性在 Aname类中申明三个属性，将其封装在一个类中：通过对象来调用例如 1： //属性将其设为私有姓名 name 可以公开
jquery radio/checkbox change事件不能触发的问题 bijian1013 JavaScript jquery
我想让radio来控制当前我选择的是机动车还是特种车，如下所示： <html> <head> <script src="http://ajax.googleapis.com/ajax/libs/jquery/1.7.1/jquery.min.js" type="text/javascript"><
AngularJS中安全性措施 bijian1013 JavaScript AngularJS 安全性 XSRF JSON漏洞
在使用web应用中，安全性是应该首要考虑的一个问题。AngularJS提供了一些辅助机制，用来防护来自两个常见攻击方向的网络攻击。一.JSON漏洞当使用一个GET请求获取JSON数组信息的时候（尤其是当这一信息非常敏感，
[Maven学习笔记九]Maven发布web项目 bit1129 maven
基于Maven的web项目的标准项目结构 user-project user-core user-service user-web src
【Hive七】Hive用户自定义聚合函数(UDAF) bit1129 hive
用户自定义聚合函数，用户提供的多个入参通过聚合计算(求和、求最大值、求最小值)得到一个聚合计算结果的函数。问题：UDF也可以提供输入多个参数然后输出一个结果的运算，比如加法运算add(3，5)，add这个UDF需要实现UDF的evaluate方法,那么UDF和UDAF的实质分别究竟是什么？ Double evaluate(Double a, Double b)
通过 nginx-lua 给 Nginx 增加 OAuth 支持 ronin47
前言：我们使用Nginx的Lua中间件建立了OAuth2认证和授权层。如果你也有此打算，阅读下面的文档，实现自动化并获得收益。SeatGeek 在过去几年中取得了发展，我们已经积累了不少针对各种任务的不同管理接口。我们通常为新的展示需求创建新模块，比如我们自己的博客、图表等。我们还定期开发内部工具来处理诸如部署、可视化操作及事件处理等事务。在处理这些事务中，我们使用了几个不同的接口来认证： &n
利用tomcat-redis-session-manager做session同步时自定义类对象属性保存不上的解决方法 bsr1983 session
在利用tomcat-redis-session-manager做session同步时，遇到了在session保存一个自定义对象时，修改该对象中的某个属性，session未进行序列化，属性没有被存储到redis中。在 tomcat-redis-session-manager的github上有如下说明： Session Change Tracking As noted in the &qu
《代码大全》表驱动法-Table Driven Approach-1 bylijinnan java 算法
关于Table Driven Approach的一篇非常好的文章： http://www.codeproject.com/Articles/42732/Table-driven-Approach package com.ljn.base; import java.util.Random; public class TableDriven { public
Sybase封锁原理 chicony Sybase
昨天在操作Sybase IQ12.7时意外操作造成了数据库表锁定，不能删除被锁定表数据也不能往其中写入数据。由于着急往该表抽入数据，因此立马着手解决该表的解锁问题。无奈此前没有接触过Sybase IQ12.7这套数据库产品，加之当时已属于下班时间无法求助于支持人员支持，因此只有借助搜索引擎强大的
java异常处理机制 CrazyMizzz java
java异常关键字有以下几个，分别为 try catch final throw throws 他们的定义分别为 try： Opening exception-handling statement. catch： Captures the exception. finally： Runs its code before terminating
hive 数据插入DML语法汇总 daizj hive DML 数据插入
Hive的数据插入DML语法汇总1、Loading files into tables语法：1) LOAD DATA [LOCAL] INPATH 'filepath' [OVERWRITE] INTO TABLE tablename [PARTITION (partcol1=val1, partcol2=val2 ...)]解释：1)、上面命令执行环境为hive客户端环境下： hive>l
工厂设计模式 dcj3sjt126com 设计模式
使用设计模式是促进最佳实践和良好设计的好办法。设计模式可以提供针对常见的编程问题的灵活的解决方案。工厂模式工厂模式（Factory）允许你在代码执行时实例化对象。它之所以被称为工厂模式是因为它负责“生产”对象。工厂方法的参数是你要生成的对象对应的类名称。 Example #1 调用工厂方法（带参数） <?phpclass Example{
mysql字符串查找函数 dcj3sjt126com mysql
FIND_IN_SET(str,strlist) 假如字符串str 在由N 子链组成的字符串列表strlist 中，则返回值的范围在1到 N 之间。一个字符串列表就是一个由一些被‘,’符号分开的自链组成的字符串。如果第一个参数是一个常数字符串，而第二个是type SET列，则 FIND_IN_SET() 函数被优化，使用比特计算。如果str不在strlist 或st
jvm内存管理 easterfly jvm
一、JVM堆内存的划分分为年轻代和年老代。年轻代又分为三部分：一个eden,两个survivor。工作过程是这样的：e区空间满了后，执行minor gc，存活下来的对象放入s0, 对s0仍会进行minor gc，存活下来的的对象放入s1中，对s1同样执行minor gc，依旧存活的对象就放入年老代中；年老代满了之后会执行major gc，这个是stop the word模式，执行
CentOS-6.3安装配置JDK-8 gengzg centos
JAVA_HOME=/usr/java/jdk1.8.0_45 JRE_HOME=/usr/java/jdk1.8.0_45/jre PATH=$PATH:$JAVA_HOME/bin:$JRE_HOME/bin CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar:$JRE_HOME/lib export JAVA_HOME
【转】关于web路径的获取方法 huangyc1210 Web 路径
假定你的web application 名称为news,你在浏览器中输入请求路径： http://localhost:8080/news/main/list.jsp 则执行下面向行代码后打印出如下结果： 1、 System.out.println(request.getContextPath()); //可返回站点的根路径。也就是项
php里获取第一个中文首字母并排序远去的渡口数据结构 PHP
很久没来更新博客了，还是觉得工作需要多总结的好。今天来更新一个自己认为比较有成就的问题吧。最近在做储值结算，需求里结算首页需要按门店的首字母A-Z排序。我的数据结构原本是这样的： Array ( [0] => Array ( [sid] => 2885842 [recetcstoredpay] =&g
java内部类 hm4123660 java 内部类匿名内部类成员内部类方法内部类
　在Java中，可以将一个类定义在另一个类里面或者一个方法里面，这样的类称为内部类。内部类仍然是一个独立的类，在编译之后内部类会被编译成独立的.class文件，但是前面冠以外部类的类名和$符号。内部类可以间接解决多继承问题,可以使用内部类继承一个类，外部类继承一个类，实现多继承。 &nb
Caused by: java.lang.IncompatibleClassChangeError: class org.hibernate.cfg.Exten zhb8015
maven pom.xml关于hibernate的配置和异常信息如下，查了好多资料，问题还是没有解决。只知道是包冲突，就是不知道是哪个包....遇到这个问题的分享下是怎么解决的。。 maven pom: <dependency> <groupId>org.hibernate</groupId> <ar
Spark 性能相关参数配置详解－任务调度篇 Stark_Summer spark cache cpu 任务调度 yarn
随着Spark的逐渐成熟完善, 越来越多的可配置参数被添加到Spark中来, 本文试图通过阐述这其中部分参数的工作原理和配置思路, 和大家一起探讨一下如何根据实际场合对Spark进行配置优化。由于篇幅较长，所以在这里分篇组织，如果要看最新完整的网页版内容，可以戳这里：http://spark-config.readthedocs.org/，主要是便
css3滤镜 wangkeheng html css
经常看到一些网站的底部有一些灰色的图标，鼠标移入的时候会变亮，开始以为是js操作src或者bg呢，搜索了一下，发现了一个更好的方法：通过css3的滤镜方法。 html代码： <a href='' class='icon'><img src='utv.jpg' /></a> css代码： .icon{-webkit-filter: graysc