CoderBoom

推荐系统-用户标签预测算法基础实践

1.用户画像概述

用户画像就是给到用户打标签
用户画像
用户角色
用户属性
- 用户画像和用户角色较为接近，而用户属性使用户的画像中的子集
用户画像阶段
- 1.用户画像基础
- 2.用户画像指标体系
- 3.标签数据存储方式
- 4.标签数据开发
- 5.性能优化及作业调度
- 6.用户画像应用及优化
用户画像基础场景用
- 搜索领域
- 个性化推荐领域
- 其他领域
个人征信数据数据特征
- 身份属性
- 履约能力
- 信用记录
- 社交资料
- 公共记录信息
网站流量指标分析
- 网站流量统计指标包括
  - 独立访问者数量(UV)
  - 重复访问者数量(RV)
  - 页面浏览数(PV)
  - 每个访问者的页面浏览数(Page Views per user)
  - 某些具体文件/页面的统计指标 , 如页面显示次数 , 文件下载次数等
- 用户行为指标
  - 用户在网站停留时间
  - 用户来源
  - 用户所使用的搜索引擎及其关键词
  - 在不同时段的用户访问量情况等
- 用户浏览网站的方式
  - 时间 , 设备 , 浏览器名称和版本 , 操作系统等
- 用户浏览网站的方式相关统计指标主要包括
  - 用户上网设备类型
  - 用户浏览器的名称和版本
  - 访问者电脑分辨率显示模式
  - 用户所使用的操作系统名称和版本
  - 用户所在地理区域分布状况等
- 提高网站流量的方法
  - 通过互刷软件
  - 通过广告联盟
  - 通过友情链接

2.常见用户画像业务分析指标

以电商为例展开
- 电商总总体运营指标
  - 流量类指标
    - 独立访客数（UV）
    - 页面访问数（PV）
    - 人均页面访问数
  - 订单产生效率指标
    - 总订单数量
    - 访问到下单转化率
  - 总体销售业绩指标
    - 成交金额（GMV）
    - 销售金额
    - 客单价
  - 整体指标
    - 销售毛利
    - 毛利率
- 网站流量指标
  - 流量规模类指标
    - 独立访客数（UV）
    - 页面访问数（PV）
  - 流量成本类指标
    - 访客获取成本
  - 流量质量类指标
    - 跳出率 : 为浏览单页即退出的次数/该页访问次数，跳出率只能衡量该页做为着陆页面（LandingPage）的访问。
    - 页面访问时长
    - 人均页面访问数
  - 会员类指标
    - 注册会员数
    - 活跃会员数
    - 活跃会员率
    - 会员复购率
    - 会员平均购买次数
    - 会员回购率
    - 会员留存率 : 留存率反应的是电商留住会员的能力。
- 网站销售指标
  - 购物车类指标
    - 基础类统计
      - 加入购物车次数
      - 加入购物车买家数
      - 加入购物车买家数
      - 加入购物车商品数
    - 转化类统计
      - 购物车支付转化率
  - 下单类指标
    - 基础类统计
      - 下单笔数
      - 下单金额
      - 下单买家数
    - 转化类统计
      - 浏览下单转化率
  - 支付类指标
    - 基础类统计
      - 支付金额
      - 支付买家数
      - 支付商品数
    - 转化类统计
      - 浏览-支付买家转化率
      - 下单-支付金额转化率
      - 下单-支付买家数转化率
      - 下单-支付时长
  - 交易类指标
    - 成功类统计
      - 交易成功订单数
      - 交易成功金额
      - 交易成功买家数
      - 交易成功商品数
    - 失败类统计
      - 交易失败订单数
      - 交易失败订单金额
      - 交易失败订单买家数
      - 交易失败商品数
    - 退款类统计
      - 退款总订单量
      - 退款金额
      - 退款率
- 客户价值类指标
  - 客户指标
    - 累计购买客户数
    - 客单价
  - 新客户指标
    - 新客户数量
    - 新客户获取成本
    - 新客户客单价
  - 老客户指标
    - 消费频率
    - 最近一次购买时间
    - 消费金额
    - 重复购买率
- 商品类指标
  - 产品总数指标
    - SKU数 : SKU是物理上不可分割的最小存货单位。
    - SPU数 : 属性值、特性相同的商品就可以称为一个SPU。
    - 在线SPU数 : 在线商品的SPU数
    - iphone5S是一个SPU，而iPhone 5S配置为16G版、4G手机、颜色为金色、网络类型为TD-LTE/TD-SCDMA/WCDMA/GSM则是一个SKU。
  - 产品优势性指标
    - 独家产品收入比重 : 独家销售的产品收入占总销售收入的比例
  - 品牌存量
    - 品牌数
    - 在线品牌数
  - 上架
    - 上架商品SKU数
    - 上架商品SPU数
    - 上架在线SPU数
    - 上架商品数
    - 上架在线商品数
  - 首发
    - 首次上架商品数
    - 首次上架在线商品数
- 市场竞争类的指标
  - 市场营销活动指标
    - 新增访问人数
    - 新增注册人数
    - 总访问次数
    - 订单数量
    - 下单转化率
    - ROI : 投资回报率（ROI）是指，某一活动期间，产生的交易金额与活动投放成本金额的比值。
  - 广告投放指标
    - 新增访问人数
    - 新增注册人数
    - 总访问次数
    - 订单数量
    - UV订单转化率
    - 广告投资回报率
  - 风控类指标
    - 买家评价指标
      - 买家评价数
      - 买家评价卖家数
      - 买家评价上传图片数
      - 买家评价率
      - 买家好评率
      - 买家差评率
    - 投诉指标
      - 发起投诉（申诉）数
      - 投诉率
      - 撤销投诉（申诉）数
  - 市场竞争类指标
    - 市场份额相关
      - 市场占有率
      - 市场扩大率
      - 用户份额
    - 网站排名
      - 交易额排名
      - 流量排名

3.如何利用用户行为数据

用户的静态数据–mysql
用户的动态数据–浏览、加购、收藏等
标签形态及标签建模
- 标签 : 表征了内容，用户对该内容有兴趣、偏好、需求等等。
- 权重 : 表征了指数，用户的兴趣、偏好指数，也可能表征用户的需求度，可以简单的理解为可信度，概率。
- 权重—时间衰减因子，地点因子，是购购买
- 数据建模方法: 标签=用户标识 + 时间 + 行为类型 + 接触点（网址+内容）的聚合
算法路线及算法思路：
- 用户画像+推荐系统===利用机器学习
标签层级
- 用户+商品+环境
属性的显隐性反馈

4.如何利用用户标签数据

当有了标签之后如何使用？
在页面中设置依稀标签选项
如何推荐标签？
- 基于物品的热门商品推荐
- 基于当前浏览物品的热门商品推荐
- 基于内容的相似度推荐(经常使用标签)

5.用户画像建模分类

如何对用户画像建模？
- 定性
- 定量建立模型
用户画像打的哪几类标签：？
- 统计类标签-pv
- 规则类标签-近30天活跃度(规则)
- 挖掘类(机器学习算法构建)

6.决策树引入

决策树----类似树的概念
树—现实生活中树结构–树根–树干—树枝—树叶
数据结构中树：根节点—分支节点-----叶子结点
机器学习中的树：分支节点----叶子节点
分支节点：由特征充当
叶子节点：由类别标签列的取值充当

7.电商实例引入详解

通过对数据集的简单描述强化数据集的构成
基于规则建树
规则建立
- 选择特征充当分支节点 , 类别标签充当叶子节点
- 依照特征或属性出现的顺序指定规则 , 建立决策树
首先选择年龄、收入、学生、信誉依次构建决策树
根据决策树可以对部分节点进行剪枝，使得决策树变得更加简单
根据决策树回答业务决策问题
- 根据已有的特征对决策树进行分类
- 如果中年人直接推荐商品(给业务人员决策)
优化 : 基于模型的建树

8.`构建决策树三要素`

特征选择：选择有较强分类能力的特征 . 如何选择特征？依靠信息熵、信息增益、信息增益率等进行特征选择
决策树生成：决策树生成依赖于特征选择，ID3采用信息增益作为特征选择度量，信息增益率作为C4.5算法的特征选择，Gini系数组成Cart树算法
决策树剪枝：先剪枝(树生成之前或过程中进行剪枝)和后剪枝(树生长完成之后进行剪枝)

9.熵和信息熵详解

熵：物理学上，用于能量的分布的均匀性
信息熵：信息论上，用于消除信息的不确定性
信息熵：首先定义一个不确定性函数I(x)=plog(1/p)，对不确定性函数求解期望，期望就是E(x)=-sum(xlog(x))
信息熵越大，信息的不确定性越大，信息的确定性越小，信息的纯度越低
信息熵越小，信息的不确定性越小，信息的确定性越大，信息的纯度越高
如果用于决策树的分支，优先选择信息熵小的值作为分支节点，构建决策树。
概念学习系统使用信息熵

10.信息增益与ID3算法详解

信息增益：信息获取量 === > Gain(A) = Info(D)-Info_A(D)
以A节点作为分支节点的信息增益=总体的信息熵-以A节点作为分支节点的信息熵
总体信息熵是求类别标签的信息熵 , 特征的信息熵是在类别标签条件下的信息熵
信息增益越大，信息熵越小，信息的不确定性越小，信息的确定性越大，信息的纯度越高
信息增益越小，信息熵越大，信息的不确定性越大，信息的确定性越小，信息的纯度越低
优先选择信息增益较大的特征作为分支节点
ID3算法：属于决策树的生成算法
- 输入：样本的集合，属性的集合
- 输出：ID3决策树
- 算法步骤：
  - 1.如果所有的属性都处理完毕，直接返回，否则继续下一步
  - 2.计算所有的特征的信息增益，选择信息增益较大的值对应的特征作为分支节点
  - 3.从剩余的属性中选择次信息增益较大的值对应的特征继续分类，直到满足停止条件，递归构建决策树
- 算法停止迭代的条件：
  - 如果样本均分类，就停止迭代
  - 如果没有属性被用于进一步划分，停止迭代
  - 如果达到指定的迭代次数，停止迭代
  - 如果达到设定的树的深度，停止迭代
  - 如果叶子节点包含的样本个数达到指定阈值，也停止迭代
  - 如果分支节点包含的样本个数达到指定的阈值，也停止迭代
  - 如果最大不纯度下降小于a的时候，停止迭代
电商购买数据集案例：
- Gain(age)=info(D)-info(age)

11.决策树其他优化算法

C4.5算法—使用信息增益率—在信息的增益基础上增加了信息熵作为分母进行对比
- 信息增益率 : Gainr(A) = Gain(A)/H(A) (H(A)即A的信息熵)
Cart树算法—分类和回归算法-----利用Gini系数
所有的决策树都是贪心算法 , 自上而下 ; 区别 : 属性选择度量方法不同

贪心算法：顾名思义，贪心算法总是作出在当前看来最好的选择。也就是说贪心算法并不从整体最优考虑，它所作出的选择只是在某种意义上的局部最优选择。

无论哪种方法构建树，因为树的构建过程是递归形式的，所以有可能出现树的过拟合情况

12.树剪枝详解

先剪枝(较多)
- 在树的生长过程中进行剪枝
  - 如果没有属性被用于进一步划分，停止迭代
  - 如果达到指定的迭代次数，停止迭代
  - 如果达到设定的树的深度，停止迭代
  - 如果叶子节点包含的样本个数达到指定阈值，也停止迭代
  - 如果分支节点包含的样本个数达到指定的阈值，也停止迭代
  - 如果最大不纯度下降小于a的时候，停止迭代
后剪枝
- 在决策树生长完成后进行剪枝
- 利用MEP最小错误率剪枝技术进行剪枝
  - 利用叶子结点替换子树
  - 利用分支中常出现的子树替换原子树
剪枝系数(了解)
- 定义决策树的损失函数
  - C（X）=SUM(Ni*H(x))
  - Ni叶子节点的个数 , H(x)叶子节点的熵
- alpha为剪枝系数，剪枝系数越小越好，选择不同的alpha
剪枝算法

决策树算法的优点
- 直观，便于理解，小规模数据集有效
- 执行效率高，执行只需要一次构建，可反复使用
决策树算法的缺点
- 处理连续变量不好，较难预测连续字段
- 类别较多时，错误增加的比较快
- 对于时间序列数据需要做很多的预处理
- 规模性一般
- 实际分类的时候只能根据一个字段进行
决策树算法处理连续值
- 连续值的处理：由于连续属性的可取值数目不在有限，因此，不能直接根据连续属性的取值对结点进行划分。此时，我们采用连续值离散化的技术，最简单的是采用二分法（将样本的属性取值从大到小排序，找一个划分点将样本集分成两个子集，大于划分点的集合是决策树的一个分支，小于划分点的是决策树的一个分支）对连续属性进行处理，这也是C4.5算法采用的策略。

13.电商案例ID3算法实例详解

电商数据集1024样本，每个特征具体取值的概率清楚
求解特征的信息增益=总体信息熵-以划分节点作为分支节点的信息熵
求解最大的信息增益值，作为分支节点，依次选择最大的信息增益值
比之前绘制的基于规则建树，简化了许多
决策树算法能够选择最重要的特征---------信息增益

ID3步骤图解如下

总结 : 根据信息熵和信息增益得到的决策树和之前利用自己制定规则得到的决策树，有明显的不同，因此，利用信息熵和信息增益可以得到分类效果更优的决策树。

14.决策树解决电商数据预测购买及补充问题

通过skleran实战
数据准备
数据处理
数据切分
准备算法
训练模型
模型预测
模型校验
模型保存
模型决策树可视化—export-graphviz
完整代码展示

import pandas as pd
#1.导入数据、
buyData=pd.read_csv("buy.csv",sep=",")
print(buyData)
#     age  income  student  credit_rating  Class:buy_computer
# 0     1       3        0              1                   0
# 1     1       3        0              0                   0
# 2     2       3        0              1                   1
# 3     3       2        0              1                   1
# 4     3       1        1              1                   1
# 5     3       1        1              0                   0
# 6     2       1        1              0                   1
# 7     1       2        0              1                   0
# 8     1       1        1              1                   0
# 9     3       2        1              1                   1
# 10    1       2        1              0                   1
# 11    2       2        0              0                   1
# 12    2       3        1              1                   1
# 13    3       2        0              0                   0
print(buyData.shape)#(14, 5)
print(buyData.ndim) #2
# print(buyData.dtype)
print(buyData.info())
# RangeIndex: 14 entries, 0 to 13
# Data columns (total 5 columns):
# age                   14 non-null int64
# income                14 non-null int64
# student               14 non-null int64
# credit_rating         14 non-null int64
# Class:buy_computer    14 non-null int64
# dtypes: int64(5)
# memory usage: 640.0 bytes
print(buyData.head())
#    age  income  student  credit_rating  Class:buy_computer
# 0    1       3        0              1                   0
# 1    1       3        0              0                   0
# 2    2       3        0              1                   1
# 3    3       2        0              1                   1
# 4    3       1        1              1                   1
print(buyData.index) #RangeIndex(start=0, stop=14, step=1)
print(buyData.columns)
#Index(['age', 'income', 'student', 'credit_rating', 'Class:buy_computer'], dtype='object')
#2.数据处理
X=buyData.drop(labels="Class:buy_computer",axis=1)
y=buyData["Class:buy_computer"]
#3.特征工程
#数据集切分
from sklearn.model_selection import train_test_split
X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=22,test_size=0.2)
# print(X_train.shape)
# print(X_test.shape)
# print(y_train.shape)
# print(y_test.shape)
#4.建立决策树模型
from sklearn.tree import DecisionTreeClassifier
dtc=DecisionTreeClassifier(criterion="entropy",max_depth=6,min_samples_leaf=2)#超参数
dtc.fit(X_train,y_train)
#5.模型预测
y_pred=dtc.predict(X_test)
print(y_pred) #[0 1 1]
#6.模型校验
print("model in trainset score is %.2f"%(dtc.score(X_train,y_train)))
print("model in trainset score is %.2f"%(dtc.score(X_test,y_test)))
# model in trainset score is 0.82
# model in trainset score is 0.67
from sklearn.metrics import confusion_matrix,classification_report
print("confusion matrix:",confusion_matrix(y_test,y_pred))
print("conputetion matrix:",classification_report(y_test,y_pred))
#7.保存模型
from sklearn.externals import joblib
joblib.dump(dtc,"buy.pkl")
#8.模型可视化
from sklearn.tree import export_graphviz
export_graphviz(dtc,out_file="buy.dot",feature_names=X.columns,class_names=["no","yes"],
                filled=True)

对生成的buy.pkl进行验证 , 看是否正确

import pandas as pd
#1.导入数据、
buyData=pd.read_csv("buy.csv",sep=",")
#2.数据处理
X=buyData.drop(labels="Class:buy_computer",axis=1)
y=buyData["Class:buy_computer"]
#3.特征工程
#数据集切分
from sklearn.model_selection import train_test_split
X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=22,test_size=0.2)
#4.读取模型
from sklearn.externals import joblib
dtc=joblib.load("buy.pkl")
#5.模型预测
y_pred=dtc.predict(X_test)
print(y_pred) #[0 1 1]
#6.模型校验
print("model in trainset score is %.2f"%(dtc.score(X_train,y_train)))
print("model in trainset score is %.2f"%(dtc.score(X_test,y_test)))
# model in trainset score is 0.82
# model in trainset score is 0.67
from sklearn.metrics import confusion_matrix,classification_report
print("confusion matrix:",confusion_matrix(y_test,y_pred))
print("conputetion matrix:",classification_report(y_test,y_pred))

在生成的文件目录下打开cmd(shift+鼠标右键即可显示在此处打开命令窗口)之后执行后面的命令dot -Tpdf .\buy.dot -o buy.pdf

15.决策树实战相亲数据集案例及可视化实战

将准备好的相亲数据集通过pandas进行处理
准备X和Y特征和标签数据
训练模型
预测模型
校验–可视化

import pandas as pd
file=pd.read_csv("./SklearnTest.txt")
#数据处理--is_date=
new_Date=file.query("is_date==-1")
data=file.query("is_date!=-1")
# print(new_Date)
#    height  house  car  handsome  job  is_date
# 8    1.65      0    1       6.6    0       -1
# print(data)
#    height  house  car  handsome  job  is_date
# 0    1.80      1    0       6.5    2        1
# 1    1.62      1    0       5.5    0        1
# 2    1.71      0    1       8.5    1        1
# 3    1.58      1    1       6.3    1        1
# 4    1.68      0    1       5.1    0        0
# 5    1.63      1    0       5.3    1        0
# 6    1.78      0    0       4.5    0        0
# 7    1.64      0    0       7.8    2        0
#2.将data已经处理好的数据分为X和y
X=data.drop("is_date",axis=1)
y=data["is_date"]
#3.进行切分
from sklearn.model_selection import  train_test_split
#random_state=9随机数种子，如果指定随机数种子，保证每次切分的时候结果的可重复性
X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.2,random_state=9)
#4.训练模型
from sklearn.tree import DecisionTreeClassifier
dtc=DecisionTreeClassifier()
dtc.fit(X_train,y_train)
print(dtc.feature_importances_)
#5.预测
y_pred=dtc.predict(X_test)
print(y_test)
#6.校验
print("model in train set score is:",dtc.score(X_train,y_train))
print("model in test set score is:",dtc.score(X_test,y_test))
from sklearn.metrics import classification_report,confusion_matrix
print("classification_report score is:",classification_report(y_test,y_pred))
print("confusion_matrix score is:",confusion_matrix(y_test,y_pred))
#可视化
from sklearn.tree import export_graphviz
export_graphviz(dtc,out_file="love.dot",feature_names=X.columns,filled=True,class_names=["no","yes"])

扩展 : 本地安装Graphviz

通过Graphviz 的地址下载该软件：http://www.graphviz.org/ , 配置本地环境变量，通过命令dot -Tpdf iris.dot -o outpu.pdf将dot文件转化至pdf可视化决策树。

class_names=["is_date:no","is_date:yes"],这里为什么指定no代表0，yes代表1呢？这是因为在class_names中默认以数值递增的顺序进行对应，也是就是0对应is_date:no.

改进相亲数据集案例

改进方案一

import pandas as pd
#加载数据
love_file=pd.read_csv("./SklearnTest.txt")
#数据集(切分为训练集和测试集)和新数据
data,newData=love_file.query("is_date!=-1"),love_file.query("is_date==-1")
#将数据集切分成X特征和Y类别标签
X_data=data.drop(["is_date"],axis=1)
y_data=data["is_date"]
#切分数据集
from sklearn.cross_validation import  train_test_split
#random——state随机数种子-保证每一次切分数据集结果可重复性
X_train, X_test, y_train, y_test = train_test_split(X_data, y_data, test_size=0.33, random_state=1)
#建立决策树模型
from sklearn.tree import DecisionTreeClassifier
dtc=DecisionTreeClassifier(criterion="entropy")
#训练模型使用的是fit方法---训练模型
print(dtc.fit(X_train,y_train))
#预测新数据的结果
y_pred=dtc.predict(X_test)
#模型校验
print("model in train set score:",dtc.score(X_train,y_train))
print("model in test set score:",dtc.score(X_test,y_test))
# model in train set score: 1.0
# model in test set score: 0.3333333333333333
from sklearn.metrics import confusion_matrix
print(confusion_matrix(y_test,y_pred))
#新数据
X_new_data=newData.drop(["is_date"],axis=1) #y_new_data
print(dtc.predict(X_new_data))
#可视化处理
from sklearn.tree import export_graphviz
export_graphviz(dtc.tree_,out_file="love.dot",filled=True,feature_names=love_file.columns,class_names=["no","yes"])

改进方案二

import pandas as pd
#加载数据
love_file=pd.read_csv("./SklearnTest.txt")
#1.数据集(切分为训练集和测试集)和新数据
data,newData=love_file.query("is_date!=-1"),love_file.query("is_date==-1")
#将数据集切分成X特征和Y类别标签
X_data=data.drop(["is_date"],axis=1)
y_data=data["is_date"]
#2.切分数据集
from sklearn.cross_validation import  train_test_split
#random——state随机数种子-保证每一次切分数据集结果可重复性
X_train, X_test, y_train, y_test = train_test_split(X_data, y_data, test_size=0.33, random_state=1)
#3.数据处理
from sklearn.preprocessing import StandardScaler
sc=StandardScaler()
#对训练数据集先进行fit操作在进行transfrom操作
#fit操作相当于收集所有参数信息，transfrom将所有的数据减去均值除以方差
X_train_std=sc.fit_transform(X_train)
#对于测试数据集来讲只需要使用transform方法进行归一化
X_test_std=sc.transform(X_test)
#4.建立决策树模型
from sklearn.tree import DecisionTreeClassifier
dtc=DecisionTreeClassifier(criterion="entropy")
#训练模型使用的是fit方法---训练模型
print(dtc.fit(X_train_std,y_train))
#5.预测新数据的结果
y_pred=dtc.predict(X_test)
#6.模型校验
print("model in train set score:",dtc.score(X_train_std,y_train))
print("model in test set score:",dtc.score(X_test_std,y_test))

16.决策树实战Iris数据集识别及可视化实战

iris数据集来源于sklearn自带的数据集
根据自带的属性完成定义

from sklearn.datasets import load_iris
iris=load_iris()
#打印iris的基础信息
print(iris.keys()) #dict_keys(['data', 'target', 'target_names', 'DESCR', 'feature_names'])
print(iris.data)
# [5.8 2.7 5.1 1.9]
# [6.8 3.2 5.9 2.3]
# [6.7 3.3 5.7 2.5]
# [6.7 3.  5.2 2.3]
# [6.3 2.5 5.  1.9]
# [6.5 3.  5.2 2.]
import numpy as np
print(np.unique(iris.target))
print(iris.target_names)#['setosa' 'versicolor' 'virginica']
print(iris.DESCR)#
print(iris.feature_names)#['sepal length (cm)', 'sepal width (cm)', 'petal length (cm)', 'petal width (cm)']
# Data Set Characteristics:
#     :Number of Instances: 150 (50 in each of three classes)
#     :Number of Attributes: 4 numeric, predictive attributes and the class
#     :Attribute Information:
#         - sepal length in cm
#         - sepal width in cm
#         - petal length in cm
#         - petal width in cm
#         - class:
#                 - Iris-Setosa
#                 - Iris-Versicolour
#                 - Iris-Virginica
#     :Summary Statistics:
#选择特征和标签
X=iris.data
y=iris.target
#切分数据
from sklearn.model_selection import train_test_split
X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=22,test_size=0.2)
#训练模型
from sklearn.tree import DecisionTreeClassifier
dtc=DecisionTreeClassifier()
#训练
dtc.fit(X_train,y_train)
print(dtc.feature_importances_)#[0.01672241 0.         0.59033215 0.39294544]
#预测
y_pred=dtc.predict_proba(X_test)
print(y_pred)
#验证
print("model in train set score is:",dtc.score(X_train,y_train))
print("model in test set score is:",dtc.score(X_test,y_test))
# model in train set score is: 1.0
# model in test set score is: 0.8666666666666667
#可视化
from sklearn.tree import export_graphviz
export_graphviz(dtc,out_file="iris.dot",filled=True,
                class_names=iris.target_names,
                feature_names=['sepal length (cm)', 'sepal width (cm)', 'petal length (cm)', 'petal width (cm)'],)

17.决策树算法API详解

参数：使用哪种算法，最大深度、树的叶子节点个数等
属性：features_importance_(重要)
方法:fit\predict\predict_log_porba\predict_proba
决策树文档：http://scikit-learn.org/stable/modules/tree.html#classification
决策树分类器的简介：http://scikit-learn.org/stable/modules/generated/sklearn.tree.DecisionTreeClassifier.html#sklearn.tree.DecisionTreeClassifier
API详解

API参数详解 : 
（1）criterion：一个字符串，指定切分质量的评价准则。可以为如下两个参数：
Gini：表示切分时评价准则时Gini系数。
Entropy：表示切分的时候评价准则是信息增益
（2）splitter：一个字符串，指定切分原则，可以为如下：
best：表示选择最优的切分
random：表示随机切分
（3）max_features:可以为整数、浮点、字符串或者None，指定了寻找best split时考虑的特征数量。
如果是整数，则每次切分只考虑max_features个特征。
如果是浮点数，则每次切分只考虑max_features*n_features个特征。
如果是字符串auto或者sqrt，则max_features等于sqrt(n_feautures)
如果是字符串log2，则max_features等于log2（n_features）
如果是none，则max_features等于n_features.
(4)max_depth：可以为整数或者None，指定树的最大深度。
如果为None，则表示树的深度不限（直到每个叶子都是纯的，即叶子结点中所有的样本点都属于一个类，或者叶子中包含小于min_samples_split个样本点。
（5）min_samples_split:为整数，指定每个内部节点（非叶子节点）包含的最少样本数。
（6）min_samples_leaf为整数，指定每个叶子节点包含的最少的样本数。
（7）min_weight_fraction_leaf:为浮点数，叶子结点中样本的最小权重系数。
（8）min_leaf_nodes:为整数或None，指定最大的叶节点数量。
如果为None，此时叶子节点数量不限制。
如果为非None，则max_depth被忽略。
（9）class_weight:为一个字典、字典的列表、字符串‘balanced’，或者None，它指定了分类的权重。权重的形式为：{class_label:weight}
如果是None，则每个分类的权重都为1.
字符串balanced表示分类权重是样本中各分类出现频率的反比。
（10）random_state:一个整数或者一个Randomstate实例，或者None。
如果为整数，则它指定了随机数生成器的种子。
如果为Randomstate实例，则指定了随机数生成器。
如果为None，则使用默认的随机数生成器。
（11）presort：一个布尔值，指定是否提前排序数据，从而加速寻找最优切分的过程。设置为True时，对于大数据集会减慢总体的训练过程；但是对于一个小数据集或者设定了最大深度的情况下，会加速训练过程。

API的属性详解:
(1)classes_:分类的标签值
(2)feature_importances_:给出了特征的重要程度。该值越高，则特征越重要（也称之为Gini_importance）
(3)max_feature_:max_feature的推断值。
(4)n_classes_：给出了分类的数量
(5)n_feautures_:执行fit之后特征的数量
(6)n_outputs_:执行fit之后输出的数量
(7)tree_(tree):一个Tree对象，即底层的决策树。

API的方法详解 : 
（1）fit(X,y):训练模型
（2）predict(X,)用模型进行预测，返回预测值
（3）predict_log_proba(X):返回一个数组，数组的元素依次是X预测为各个类别的概率的对数值。
（4）predict_proba(X)：返回一个数组，数组的元素依次时X预测为各个类别的概率值。
（5）score(X,y):返回在（X，y）上预测的准确率（accurary）的平均值。

18.Python源码的ID3实现简介

1.ID3算法实现

from numpy import *
import math
import copy
import cPickle as pickle

class ID3DTree(object):
	def __init__(self):
		self.tree={}
		self.dataSet=[]
		self.labels=[]
	
	def loadDataSet(self,path,labels):
		recordlist = []
		fp = open(path,"rb") 	# 读取文件内容
		content = fp.read()
		fp.close()
		rowlist = content.splitlines() 	# 按行转换为一维表
		recordlist=[row.split("\t") for row in rowlist if row.strip()]	
		self.dataSet = recordlist
		self.labels = labels
		
	def train(self):
		labels = copy.deepcopy(self.labels)
		self.tree = self.buildTree(self.dataSet,labels)
			
	# 创建决策树主程序
	def buildTree(self,dataSet,labels):	  
		cateList = [data[-1] for data in dataSet] # 抽取源数据集的决策标签列
	# 程序终止条件1: 如果classList只有一种决策标签，停止划分，返回这个决策标签
		if cateList.count(cateList[0]) == len(cateList): 
		    return cateList[0]
	# 程序终止条件2: 如果数据集的第一个决策标签只有一个 返回这个决策标签    
		if len(dataSet[0]) == 1:   	
		    return self.maxCate(cateList)		
		# 算法核心：
		bestFeat = self.getBestFeat(dataSet) # 返回数据集的最优特征轴：
		bestFeatLabel = labels[bestFeat]
		tree = {bestFeatLabel:{}}			
		del(labels[bestFeat])
		# 抽取最优特征轴的列向量
		uniqueVals = set([data[bestFeat] for data in dataSet]) # 去重	
		for value in uniqueVals:
		    subLabels = labels[:]  #将删除后的特征类别集建立子类别集
		    splitDataset = self.splitDataSet(dataSet, bestFeat, value) # 按最优特征列和值分割数据集
		 subTree = self.buildTree(splitDataset,subLabels) # 构建子树
		    tree[bestFeatLabel][value] = subTree
		return tree
	#计算出现最多的列别标签
	def maxCate(self,catelist):		# 计算出现最多的类别标签
		items = dict([(catelist.count(i), i) for i in catelist])
		return items[max(items.keys())]
	#计算最优特征		 	
	def getBestFeat(self,dataSet):
		# 计算特征向量维，其中最后一列用于类别标签，因此要减去 	
	numFeatures = len(dataSet[0]) - 1 # 特征向量维数=行向量维度-1
		baseEntropy = self.computeEntropy(dataSet) # 基础熵：源数据的香农熵
		bestInfoGain = 0.0;        # 初始化最优的信息增益
		bestFeature = -1         # 初始化最优的特征轴  		
		# 外循环：遍历数据集各列,计算最优特征轴
		# i 为数据集列索引：取值范围 0~(numFeatures-1)
		for i in xrange(numFeatures): # 抽取第i列的列向量 			 	uniqueVals = set([data[i] for data in dataSet])						# 去重：该列的唯一值集	    			newEntropy = 0.0 # 初始化该列的香农熵		    
			for value in uniqueVals:  # 内循环：按列和唯一值计算香农熵				subDataSet = self.splitDataSet(dataSet, i, value) 					# 按选定列i和唯一值分隔数据集
				prob = len(subDataSet)/float(len(dataSet))
			newEntropy += prob * self.computeEntropy(subDataSet)  			infoGain = baseEntropy - newEntropy   # 计算最大增益
			if (infoGain > bestInfoGain):     # 如果信息增益>0;    				bestInfoGain = infoGain    
					# 用当前信息增益值替代之前的最优增益值 				bestFeature = i     # 重置最优特征为当前列
		return bestFeature 
	#计算信息熵
	def computeEntropy(self,dataSet):             # 计算香农熵
		datalen = float(len(dataSet))
	cateList = [data[-1] for data in dataSet] # 从数据集中得到类别标签
		items = dict([(i,cateList.count(i)) for i in cateList]) 
					# 得到类别为key，出现次数value的字典
		infoEntropy = 0.0                           # 初始化香农熵    			for key in items:                           # 计算香农熵
		prob = float(items[key])/datalen 
		infoEntropy -= prob * math.log(prob,2) # 香农熵：= - p*log2(p) --infoEntropy = -prob * log(prob,2)
		return infoEntropy	 
	# 分隔数据集：删除特征轴所在的数据列，返回剩余的数据集
	# dataSet：数据集;	 axis：特征轴;	 value：特征轴的取值
	def splitDataSet(self, dataSet, axis, value):		
		rtnList = []     
		for featVec in dataSet:
			if featVec[axis] == value:
			rFeatVec = featVec[:axis] 
					# list操作 提取0~(axis-1)的元素 
				rFeatVec.extend(featVec[axis+1:]) 
					# list操作 将特征轴（列）之后的元素加回
				rtnList.append(rFeatVec)   
		return rtnList 
	#决策树分类器代码
	def predict(self,inputTree,featLabels,testVec):	# 分类器 
		root = inputTree.keys()[0]    # 树根节点
		secondDict = inputTree[root]  # value-子树结构或分类标签
		featIndex = featLabels.index(root)  # 根节点在分类标签集中的位置
		key = testVec[featIndex] # 测试集数组取值 
		valueOfFeat = secondDict[key] # 
		if isinstance(valueOfFeat, dict): 
	classLabel = self.predict(valueOfFeat, featLabels, testVec) # 递归分类
		else: classLabel = valueOfFeat
		return classLabel
	# 存储树到文件
	def storeTree(self,inputTree,filename):
		fw = open(filename,'w')
		pickle.dump(inputTree,fw)
		fw.close()
	# 从文件抓取树    
	def grabTree(self,filename):
		fr = open(filename)
		return pickle.load(fr)

2.构建数据集

import sys  
import os
from numpy import *
# 设置utf-8 unicode环境
reload(sys)
sys.setdefaultencoding('utf-8')
#构建输入的数据集
labels=["年龄","收入","学生","信誉"]
dataset = [[0,0,0,0,"no"],[0,0,0,1,"no"],[0,1,0,0,"no"],[0,2,1,0,"yes"],[0,1,1,1,"yes"],
[1,0,0,0,"yes"],[1,2,1,1,"yes"], [1,1,0,1,"yes"],[1,0,1,0,"yes"],[2,1,0,0,"yes"],[2,2,1,0,"yes"],
[2,2,1,1,"no"],[2,1,1,0,"yes"],[2,1,0,1,"no"]]
numlist = [64	,64	,128,64	,64	,128,64	,32	,32	,60	,64	,64	,132,64	 ]
print mat(dataset).T
datalines =[]

for element,num in zip(dataset,numlist):
	liststr =""
	for cell in element:
		liststr += str(cell)+"\t"
	liststr = liststr[:-1]	
	for i in xrange(num):
		datalines.append(liststr)

fp = open("dataset.dat","w")
fp.write("\n".join(datalines))

3.训练的决策树的结构信息打印及字典转化为树状的显示

from numpy import *
from math import log
from ID3DTree import * 
import copy
import treePlotter2
import matplotlib.pyplot as plt

dtree = ID3DTree()
dtree.loadDataSet("dataset.dat",["age","revenue","student","credit"])
# dtree.loadDataSet("lenses.txt",['age','prescript','astigmatic','tearRate'])
dtree.train()
print dtree.tree
treePlotter2.createPlot(dtree.tree)

4.持久化决策树

from numpy import *
from math import log
from ID3DTree import * 
import copy
import treePlotter2
import matplotlib.pyplot as plt

dtree = ID3DTree()
dtree.loadDataSet("dataset.dat",["age","revenue","student","credit"])
dtree.train()

dtree.storeTree(dtree.tree,"data.tree")
mytree = dtree.grabTree("data.tree")
print mytree

5.测试ID3算法

from numpy import *
from math import log
from ID3DTree import * 
import copy
import treePlotter2
import matplotlib.pyplot as plt

dtree = ID3DTree()

labels = ["age","revenue","student","credit"]
vector = ['0','1','0','0'] # ['0','1','0','0','no']
mytree = dtree.grabTree("data.tree")
print "真实输出 ","no","->","决策树输出",dtree.predict(mytree,labels,vector)

补充 1: 基尼指数、误分类率及代码实战

Gini指数（基尼指数） : 选择最佳划分的度量通常是根据划分后子女节点的不纯性的程度决定的。一般最佳划分对应于产生最小Gini指标值得点。

P(i|t)表示给定节点t中属于类i的记录所占的比例。
错误率

以2分类问题为例计算信息熵、基尼不纯度和错误率

节点	计数
类=0	1
类=1	5

Gini=1-=0.278
Entropy=-(1/6)log(1/6)-(5/6)log(5/6)=0.650
Error=1-max[1/6,5/6]=0.167

信息增益公式解读

是给定节点的不纯性度量，N是父节点上的记录总数，k是属性值的个数是与子女节点v相关联的记录个数，决策树归纳算法通常选择最大化增益的测试条件，因为对所有的测试条件来说，是一个不变的值，所以最大化增益等价于最小化子女节点的不纯性度量的的加权平均值。当选择熵作为不纯性度量时，熵的差就是所谓的信息增益。

补充2:最大熵及交叉熵

底数一般为2或e

两点分布的熵

均匀分布的信息熵

定义概率：

计算熵：

最大熵

熵是随机变量不确定性度量，不确定越大，熵越大
若随机变量退化成定值，熵最小，为0
若随机分布为均匀分布，熵最大

根据上面的分析，P(x)的对数关于随机变量x的二次形式，所以，该分布p(x)必然是正态分布。

Venn图理解几个熵的概念

条件熵

两个随机变量X,Y的联合分布，可以形成联合熵H(X,Y)表示，（X,Y）发生所包含的熵，减去X单独发生的熵，就是在X发生前提下Y发生带来的熵即H(X|Y)=H（X,Y）-H（X）

利用互信息得到条件熵

交叉熵(相对熵、KL散度)

19.总结

你可能感兴趣的:(机器学习,决策树)

scikit-learn基本功能和示例代码 weixin_30777913 深度学习机器学习 python scikit-learn
scikit-learn（简称sklearn）是一个广泛使用的Python机器学习库，提供了丰富的工具和算法，涵盖了数据预处理、模型训练、评估和优化等多个方面。scikit-learn是一个功能强大的机器学习库，涵盖了数据预处理、分类、回归、聚类、降维、模型选择与评估等多个方面。通过上述代码示例，您可以快速上手并使用scikit-learn进行机器学习任务。以下是对scikit-learn主要功能
There was a problem confirming the ssl certificate: [SSL:CERTIFICATE_ VERIFY_ FAILED]certificate解决方案爱编程的喵喵 Python基础课程 python pip SSL certificate 解决方案
大家好，我是爱编程的喵喵。双985硕士毕业，现担任全栈工程师一职，热衷于将数据思维应用到工作与生活中。从事机器学习以及相关的前后端开发工作。曾在阿里云、科大讯飞、CCF等比赛获得多次Top名次。现为CSDN博客专家、人工智能领域优质创作者。喜欢通过博客创作的方式对所学的知识进行总结与归纳，不仅形成深入且独到的理解，而且能够帮助新手快速入门。本文主要介绍了Therewasaproblemco
使用 Python 和 scikit-learn 实现 KNN 分类：以鸢尾花数据集为例弥树子 python scikit-learn 分类
在机器学习的世界里，K-NearestNeighbors（KNN）算法是一种简单而强大的分类方法。它基于一个直观的想法：相似的数据点往往属于同一类别。本文将通过Python的scikit-learn库实现KNN分类，以经典的鸢尾花数据集为例，展示从数据加载到模型评估的完整流程。1.KNN算法简介KNN是一种监督学习算法，主要用于分类和回归任务。它的工作原理非常简单：对于一个新的数据点，算法会查找训
git clone出现fatal: unable to access Failed to connect to github.com port 443: Timed out解决方案爱编程的喵喵 Python基础课程 git github timeout port 443 解决方案
大家好，我是爱编程的喵喵。双985硕士毕业，现担任全栈工程师一职，热衷于将数据思维应用到工作与生活中。从事机器学习以及相关的前后端开发工作。曾在阿里云、科大讯飞、CCF等比赛获得多次Top名次。现为CSDN博客专家、人工智能领域优质创作者。喜欢通过博客创作的方式对所学的知识进行总结与归纳，不仅形成深入且独到的理解，而且能够帮助新手快速入门。本文主要介绍了gitclone出现fatal:un
Gradio 快速构建机器学习web可视化界面心得算法小菜鸟成长心得 python
1.操作完成提示try:#对输入的字符串代码进行编译运行exec(get_test_code_example)gr.Info("Modeltestingcompletedsuccessfully.")except:raisegr.Error("Modeltestingfailed.")用到了gr.Info()和gr.Errot(）
linux git clone出现fatal: unable to access Failed to connect to github.com port 443: Timed out解决方案 herosunly C/C++/Linux解决方案 linux git github timeout port 443
大家好，我是herosunly。985院校硕士毕业，现担任算法研究员一职，热衷于机器学习算法研究与应用。曾获得阿里云天池比赛第一名，CCF比赛第二名，科大讯飞比赛第三名。拥有多项发明专利。对机器学习和深度学习拥有自己独到的见解。曾经辅导过若干个非计算机专业的学生进入到算法行业就业。希望和大家一起成长进步。本文主要介绍了linuxgitclone出现fatal:unabletoaccessF
flask+layui学生信息管理系统元宇宙中的程序员 flask layui python
提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档文章目录前言一、pandas是什么？二、使用步骤1.引入库2.读入数据总结前言提示：这里可以添加本文要记录的大概内容：例如：随着人工智能的不断发展，机器学习这门技术也越来越重要，很多人都开启了学习机器学习，本文就介绍了机器学习的基础内容。一、数据库建模1、创建数据模型classStudentORM(db.Model):stu_id=d
Python 3.9它来啦！！！ python程序员小'鹏 python 编程语言经验分享程序人生
Python3.9，来了！小编本身就是一名python开发工程师，我自己花了三天时间整理了一套python学习教程，从最基础的python脚本到web开发，爬虫，数据分析，数据可视化，机器学习，等，这些资料有想要的小伙伴"点击"即可领取过去一年，来自世界各地的开发者们一直在致力于Python3.8的改进。Python3.9beta版本已经存在了一段时间，第一个正式版本于2020年10月5日发布。每
AI智能制造软件有什么用处雪叶雨林行业资讯 AI 人工智能制造
随着信息技术与制造业的深度融合，人工智能（AI）逐渐成为提升制造效率和灵活性的重要工具。AI智能制造软件通过集成数据分析、机器学习和自动化流程，为企业提供了优化生产、降低成本和提高质量的新途径。生产过程优化实时监控与反馈AI智能制造软件能够实时收集生产线上的各类数据，如温度、压力、速度等参数，并通过机器学习算法进行分析处理。一旦检测到异常情况，系统会立即发出警报并提供改进建议，帮助企业快速响应问题
ModuleNotFoundError: No module named ‘pywin32_bootstrap‘解决方案爱编程的喵喵 Python基础课程 python ModuleNotFound win32_bootstap 解决方案
大家好，我是爱编程的喵喵。双985硕士毕业，现担任全栈工程师一职，热衷于将数据思维应用到工作与生活中。从事机器学习以及相关的前后端开发工作。曾在阿里云、科大讯飞、CCF等比赛获得多次Top名次。现为CSDN博客专家、人工智能领域优质创作者。喜欢通过博客创作的方式对所学的知识进行总结与归纳，不仅形成深入且独到的理解，而且能够帮助新手快速入门。本文主要介绍了ModuleNotFoundErro
人脸识别的经典深度学习方法明初啥都能学会深度学习人工智能
人脸识别的经典深度学习方法引言1.卷积神经网络（CNN）1.1LeNet1.2AlexNet1.3VGGNet1.4ResNet2.人脸检测2.1Viola-Jones算法2.2基于深度学习的人脸检测3.人脸特征提取3.1主成分分析（PCA）3.2人脸对齐3.2.1基于特征点的对齐3.2.2基于深度学习的对齐4.人脸识别模型4.1传统机器学习方法4.2基于深度学习的方法5.公式解读5.1卷积运算5
AI智能获客工具的意义是什么雪叶雨林 AI 行业资讯人工智能
在当今竞争激烈的市场环境中，企业需要高效、精准的获客策略来维持增长和竞争力。AI智能获客工具的出现，为企业提供了一种全新的解决方案，通过自动化和智能化手段提高获客效率和质量。一、AI智能获客工具的核心价值1.1提高获客效率AI智能获客工具通过自动化流程，如自动筛选潜在客户、自动发送营销信息等，大幅减少了人力投入和时间成本，从而提高了获客效率。1.2精准定位潜在客户利用机器学习和大数据分析技术，AI
MicroAI™将人工智能培训引入RENESAS MCU sinat_41698914 人工智能 mcu big data
在端点部署的人工智能技术将加快资产密集型行业的上市时间达拉斯--(美国商业资讯)--边缘原生人工智能(AI)和机器学习(ML)产品领域的先驱MicroAITM今天宣布，公司已将其MicroAIAtomML™技术与RenesasRA微控制器(MCU)产品线进行整合。与全球微控制器领导者Renesas合作将机器学习引入MCU，并借助MicroAI直接在嵌入式环境中训练机器学习模型的能力——这在业界尚属
C++ 与机器学习：构建高效推理引擎的秘诀 salsm C++编程魔法师 c++机器学习开发语言
随着深度学习模型逐渐从研究走向生产环境，推理能力成为部署中的关键环节。模型的推理引擎需要以极低的延迟快速处理输入数据，同时最大化地利用硬件资源。虽然Python被广泛用于模型的训练和开发，但C++却在推理领域独占鳌头，其性能优势和硬件控制能力无可替代。在这篇文章中，我们将从为什么选择C++、构建高效推理引擎的细节，以及相似的开源项目三个方面深入探讨如何利用C++打造高效的机器学习推理引擎。目录为什
从简单到深刻的认知发展 AI架构设计之禅计算机软件编程原理与应用实践 java python javascript kotlin golang 架构人工智能
认知发展，人工智能，深度学习，神经网络，机器学习，自然语言处理，计算机视觉1.背景介绍认知发展是人类从简单到复杂的思维方式演进的过程，它涉及感知、记忆、语言、推理和决策等多个方面。随着人工智能技术的飞速发展，我们开始尝试用计算机模拟人类的认知能力，构建能够学习、理解和解决复杂问题的智能系统。从早期的符号逻辑到如今的深度学习，人工智能的发展经历了多个阶段。早期的人工智能研究主要集中在规则和逻辑推理上
大数据和智能数据应用架构系列教程之：大数据与人工智能 AI天才研究院 AI实战大数据AI人工智能 Python实战大数据人工智能语言模型 Java Python 架构设计
作者：禅与计算机程序设计艺术1.背景介绍概述“大数据”是指海量、高维、多样化的数据集合。随着人类对数据处理和管理的需求越来越复杂，越来越依赖机器学习、人工智能等新兴技术。在过去的一段时间里，越来越多的人开始关注到“大数据”这一颗龙头。如今，“大数据”已经成为一个新的名词，它既包含了大量的数据，也带来了巨大的价值。因此，研究、开发、应用“大数据”技术也逐渐成为各行各业的专业人才需求。在这个快速发展的
【前沿聚焦】机器学习的未来版图：从自动化到隐私保护的技术突破网罗开发人工智能 AI 大模型机器学习人工智能
网罗开发（小红书、快手、视频号同名）大家好，我是展菲，目前在上市企业从事人工智能项目研发管理工作，平时热衷于分享各种编程领域的软硬技能知识以及前沿技术，包括iOS、前端、HarmonyOS、Java、Python等方向。在移动端开发、鸿蒙开发、物联网、嵌入式、云原生、开源等领域有深厚造诣。图书作者：《ESP32-C3物联网工程开发实战》图书作者：《SwiftUI入门，进阶与实战》超级个体：CO
机器学习&深度学习目录 UQI-LIUWJ 各专栏目录深度学习人工智能 1024程序员节
机器学习模型机器学习笔记：Transformer_刘文巾的博客-CSDN博客attention相关机器学习笔记：attention_UQI-LIUWJ的博客-CSDN博客机器学习笔记：ELMOBERT_UQI-LIUWJ的博客-CSDN博客机器学习笔记：ViT（论文AnImageIsWorth16X16Words:TransformersforImageRecognitionatScale）_UQ
06-机器学习-数据预处理不会打代码呜呜呜呜机器学习机器学习人工智能
数据清洗数据清洗是数据预处理的核心步骤，旨在修正或移除数据集中的错误、不完整、重复或不一致的部分，为后续分析和建模提供可靠基础。以下是数据清洗的详细流程、方法和实战示例：一、数据清洗的核心任务问题类型表现示例影响缺失值数值型字段为空（NaN）模型无法处理缺失值，导致训练中断或偏差异常值年龄=200岁，房价=-100万扭曲统计指标（如均值），降低模型泛化性重复数据两行记录完全相同导致模型过拟合，降低
从零推导线性回归：最小二乘法与梯度下降的数学原理 Echo-Nie 机器学习机器学习线性回归人工智能梯度下降数学推导
欢迎来到我的主页：【Echo-Nie】本篇文章收录于专栏【机器学习】本文所有内容相关代码都可在以下仓库中找到：Github-MachineLearning1线性回归1.1什么是线性回归线性回归是一种用来预测和分析数据之间关系的工具。它的核心思想是找到一条直线（或者一个平面），让这条直线尽可能地“拟合”已有的数据点，通过这条直线，我们可以预测新的数据。eg：假设你想预测房价，你知道房子的大小（面积）
超实用的 30 段 Python 案例（上） Python之栈 python 开发语言
Python是目前最流行的语言之一，它在数据科学、机器学习、web开发、脚本编写、自动化方面被许多人广泛使用。它的简单和易用性造就了它如此流行的原因。如果你正在阅读本文，那么你或多或少已经使用过Python或者对Python感兴趣。在本文中，我们将会介绍30个简短的代码片段，你可以在30秒或更短的时间里理解和学习这些代码片段。1.检查重复元素下面的方法可以检查给定列表中是否有重复的元素。它使用了s
cv python_python里面cv是什么意思 weixin_40004659 cv python
OpenCV(OpenSourceComputerVisionLibrary)开放源代码计算机视觉库，主要算法涉及图像处理、计算机视觉和机器学习相关方法。OpenCV其实就是一堆C和C++语言的源代码文件，这些源代码文件中实现了许多常用的计算机视觉算法。OpenCV由一系列C函数和C++类构成，它有C，C++，Python和java接口，当前SDK(SoftwareDevelopmentKit软件
#深度学习：从基础到实践 single_ffish 深度学习 gpt 神经网络生成对抗网络 1024程序员节
深度学习是人工智能领域近年来最为火热的技术之一。它通过构建由多个隐藏层组成的神经网络模型，能够从海量数据中自动学习特征和表征,在图像识别、自然语言处理、语音识别等领域取得了突破性进展。本文将全面介绍深度学习的基础知识、主要算法和实践应用,帮助您快速掌握这一前沿技术。1.深度学习的基础1.1人工神经网络深度学习是基于人工神经网络(ArtificialNeuralNetwork,ANN)的一种机器学习
机器学习入门——机器学习基本概念四月是你的机器学习
@机器学习什么是机器学习机器学习(MachineLearning,ML)是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能。它是人工智能的核心，是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域，它主要使用归纳、综合而不是演绎简单来说机器学习就是机
python 基本知识达达玲玲 python 开发语言
Python：背景知识及环境安装什么是Python？Python是一种解释型、面向对象的高级编程语言。它的设计哲学强调代码的可读性和简洁性，因此被广泛应用于各种领域，包括：数据科学与机器学习：NumPy,Pandas,Matplotlib,Scikit-learn等库让Python成为了数据分析和机器学习的首选语言。Web开发：Django,Flask等框架提供了高效的Web开发解决方案。自动化：
【Python】已解决：error: subprocess-exited-with-error 屿小夏 python 开发语言 linux
个人简介：某不知名博主，致力于全栈领域的优质博客分享|用最优质的内容带来最舒适的阅读体验！文末获取免费IT学习资料！文末获取更多信息精彩专栏推荐订阅收藏专栏系列直达链接相关介绍书籍分享点我跳转书籍作为获取知识的重要途径，对于IT从业者来说更是不可或缺的资源。不定期更新IT图书，并在评论区抽取随机粉丝，书籍免费包邮到家AI前沿点我跳转探讨人工智能技术领域的最新发展和创新，涵盖机器学习、深度学习、自然
chatgpt赋能python：Python如何删除一个对象 atest166 ChatGpt chatgpt jvm java 计算机
Python如何删除一个对象Python是一种高级、面向对象、动态类型解释型语言，它有广泛的应用，尤其在数据分析、机器学习、人工智能和Web开发等领域。但是，在Python编程过程中，我们也可能需要删除对象。那么，Python如何删除一个对象呢？Python对象和变量在Python中，一切都是对象。对象是内存中的一块数据，有自己的身份、类型和值。变量是指向对象的引用，通过变量可以访问对象的属性和方
AI在电商平台商品描述生成中的应用 AI天才研究院计算 AI大模型企业级应用开发实战大数据AI人工智能 java python javascript kotlin golang 架构人工智能大厂程序员硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM 系统架构设计软件哲学 Agent 程序员实现财富自由
AI在电商平台商品描述生成中的应用关键词：人工智能、电商平台、商品描述、自然语言处理、机器学习、深度学习摘要：本文深入探讨了人工智能在电商平台商品描述生成中的应用。首先，我们回顾了人工智能的概述和电商平台的发展背景。随后，分析了商品描述在电商平台中的重要性以及存在的问题。接下来，我们重点介绍了AI在商品描述生成中的应用技术，包括自然语言处理、机器学习和深度学习等。文章还通过实战案例展示了AI商品描
使用 PyTorch 实现逻辑回归：从数据到模型保存与加载弥树子 pytorch 逻辑回归人工智能
在机器学习中，逻辑回归是一种经典的分类算法，广泛应用于二分类问题。本文将通过一个简单的示例，展示如何使用PyTorch框架实现逻辑回归模型，从数据准备到模型训练、保存和加载，最后进行预测。1.数据准备逻辑回归的核心是通过学习数据中的特征与标签之间的关系来进行分类。在本示例中，我们手动创建了一个简单的二维数据集，包含两类数据点。第一类数据点的标签为0，第二类数据点的标签为1。class1_point
【Python】已解决：（cmd进入Python环境报错）No Python at ‘C:\Users…\Python\Python39\python.exe’ 屿小夏 python linux 开发语言
个人简介：某不知名博主，致力于全栈领域的优质博客分享|用最优质的内容带来最舒适的阅读体验！文末获取免费IT学习资料！文末获取更多信息精彩专栏推荐订阅收藏专栏系列直达链接相关介绍书籍分享点我跳转书籍作为获取知识的重要途径，对于IT从业者来说更是不可或缺的资源。不定期更新IT图书，并在评论区抽取随机粉丝，书籍免费包邮到家AI前沿点我跳转探讨人工智能技术领域的最新发展和创新，涵盖机器学习、深度学习、自然
继之前的线程循环加到窗口中运行 3213213333332132 java thread JFrame JPanel
之前写了有关java线程的循环执行和结束，因为想制作成exe文件，想把执行的效果加到窗口上，所以就结合了JFrame和JPanel写了这个程序，这里直接贴出代码，在窗口上运行的效果下面有附图。 package thread; import java.awt.Graphics; import java.text.SimpleDateFormat; import java.util
linux 常用命令 BlueSkator linux 命令
1.grep 相信这个命令可以说是大家最常用的命令之一了。尤其是查询生产环境的日志，这个命令绝对是必不可少的。但之前总是习惯于使用（grep -n 关键字文件名）查出关键字以及该关键字所在的行数，然后再用（sed -n '100,200p' 文件名），去查出该关键字之后的日志内容。但其实还有更简便的办法，就是用（grep -B n、-A n、-C n 关键
php heredoc原文档和nowdoc语法 dcj3sjt126com PHP heredoc nowdoc
<!doctype html> <html lang="en"> <head> <meta charset="utf-8"> <title>Current To-Do List</title> </head> <body> <?
overflow的属性周华华 JavaScript
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
《我所了解的Java》——总体目录 g21121 java
准备用一年左右时间写一个系列的文章《我所了解的Java》，目录及内容会不断完善及调整。在编写相关内容时难免出现笔误、代码无法执行、名词理解错误等，请大家及时指出，我会第一时间更正。 &n
[简单]docx4j常用方法小结 53873039oycg docx
本代码基于docx4j-3.2.0，在office word 2007上测试通过。代码如下: import java.io.File; import java.io.FileInputStream; import ja
Spring配置学习云端月影 spring配置
首先来看一个标准的Spring配置文件 applicationContext.xml <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi=&q
Java新手入门的30个基本概念三 aijuans java 新手 java 入门
17.Java中的每一个类都是从Object类扩展而来的。　　18.object类中的equal和toString方法。　　equal用于测试一个对象是否同另一个对象相等。　　toString返回一个代表该对象的字符串,几乎每一个类都会重载该方法,以便返回当前状态的正确表示.(toString 方法是一个很重要的方法)　　 19.通用编程:任何类类型的所有值都可以同object类性的变量来代替。　
《2008 IBM Rational 软件开发高峰论坛会议》小记 antonyup_2006 软件测试敏捷开发项目管理 IBM 活动
我一直想写些总结,用于交流和备忘,然都没提笔,今以一篇参加活动的感受小记开个头,呵呵! 其实参加《2008 IBM Rational 软件开发高峰论坛会议》是9月4号,那天刚好调休.但接着项目颇为忙,所以今天在中秋佳节的假期里整理了下. 参加这次活动是一个朋友给的一个邀请书,才知道有这样的一个活动,虽然现在项目暂时没用到IBM的解决方案,但觉的参与这样一个活动可以拓宽下视野和相关知识.
PL/SQL的过程编程,异常,声明变量,PL/SQL块百合不是茶 PL/SQL的过程编程异常 PL/SQL块声明变量
PL/SQL; 过程; 符号; 变量; PL/SQL块; 输出; 异常; PL/SQL 是过程语言(Procedural Language)与结构化查询语言(SQL)结合而成的编程语言PL/SQL 是对 SQL 的扩展,sql的执行时每次都要写操作
Mockito(三)--完整功能介绍 bijian1013 持续集成 mockito 单元测试
mockito官网：http://code.google.com/p/mockito/，打开documentation可以看到官方最新的文档资料。一.使用mockito验证行为 //首先要import Mockito import static org.mockito.Mockito.*; //mo
精通Oracle10编程SQL(8)使用复合数据类型 bijian1013 oracle 数据库 plsql
/* *使用复合数据类型 */ --PL/SQL记录 --定义PL/SQL记录 --自定义PL/SQL记录 DECLARE TYPE emp_record_type IS RECORD( name emp.ename%TYPE, salary emp.sal%TYPE, dno emp.deptno%TYPE ); emp_
【Linux常用命令一】grep命令 bit1129 Linux常用命令
grep命令格式 grep [option] pattern [file-list] grep命令用于在指定的文件(一个或者多个,file-list)中查找包含模式串(pattern)的行,[option]用于控制grep命令的查找方式。 pattern可以是普通字符串，也可以是正则表达式，当查找的字符串包含正则表达式字符或者特
mybatis3入门学习笔记白糖_ sql ibatis qq jdbc 配置管理
MyBatis 的前身就是iBatis，是一个数据持久层(ORM)框架。 MyBatis 是支持普通 SQL 查询，存储过程和高级映射的优秀持久层框架。MyBatis对JDBC进行了一次很浅的封装。以前也学过iBatis，因为MyBatis是iBatis的升级版本，最初以为改动应该不大，实际结果是MyBatis对配置文件进行了一些大的改动，使整个框架更加方便人性化。
Linux 命令神器：lsof 入门 ronin47 lsof
lsof是系统管理/安全的尤伯工具。我大多数时候用它来从系统获得与网络连接相关的信息，但那只是这个强大而又鲜为人知的应用的第一步。将这个工具称之为lsof真实名副其实，因为它是指“列出打开文件（lists openfiles）”。而有一点要切记，在Unix中一切（包括网络套接口）都是文件。有趣的是，lsof也是有着最多
java实现两个大数相加，可能存在溢出。 bylijinnan java实现
import java.math.BigInteger; import java.util.regex.Matcher; import java.util.regex.Pattern; public class BigIntegerAddition { /** * 题目：java实现两个大数相加，可能存在溢出。 * 如123456789 + 987654321
Kettle学习资料分享，附大神用Kettle的一套流程完成对整个数据库迁移方法 Kai_Ge Kettle
Kettle学习资料分享 Kettle 3.2 使用说明书目录概述..........................................................................................................................................7 1.Kettle 资源库管
[货币与金融]钢之炼金术士 comsci 金融
自古以来,都有一些人在从事炼金术的工作.........但是很少有成功的那么随着人类在理论物理和工程物理上面取得的一些突破性进展...... 炼金术这个古老
Toast原来也可以多样化 dai_lm android toast
Style 1：默认 Toast def = Toast.makeText(this, "default", Toast.LENGTH_SHORT); def.show(); Style 2：顶部显示 Toast top = Toast.makeText(this, "top", Toast.LENGTH_SHORT); t
java数据计算的几种解决方法3 datamachine java hadoop ibatis r-langue r
4、iBatis 简单敏捷因此强大的数据计算层。和Hibernate不同，它鼓励写SQL，所以学习成本最低。同时它用最小的代价实现了计算脚本和JAVA代码的解耦，只用20%的代价就实现了hibernate 80%的功能,没实现的20%是计算脚本和数据库的解耦。复杂计算环境是它的弱项，比如：分布式计算、复杂计算、非数据
向网页中插入透明Flash的方法和技巧 dcj3sjt126com html Web Flash
将 Flash 作品插入网页的时候，我们有时候会需要将它设为透明，有时候我们需要在Flash的背面插入一些漂亮的图片，搭配出漂亮的效果……下面我们介绍一些将Flash插入网页中的一些透明的设置技巧。　　一、Swf透明、无坐标控制　　首先教大家最简单的插入Flash的代码，透明，无坐标控制：　　注意wmode="transparent"是控制Flash是否透明
ios UICollectionView的使用 dcj3sjt126com
UICollectionView的使用有两种方法，一种是继承UICollectionViewController，这个Controller会自带一个UICollectionView；另外一种是作为一个视图放在普通的UIViewController里面。个人更喜欢第二种。下面采用第二种方式简单介绍一下UICollectionView的使用。 1.UIViewController实现委托，代码如
Eos平台java公共逻辑蕃薯耀 Eos平台java公共逻辑 Eos平台 java公共逻辑
Eos平台java公共逻辑 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年6月1日 17:20:4
SpringMVC4零配置--Web上下文配置【MvcConfig】 hanqunfeng springmvc4
与SpringSecurity的配置类似，spring同样为我们提供了一个实现类WebMvcConfigurationSupport和一个注解@EnableWebMvc以帮助我们减少bean的声明。 applicationContext-MvcConfig.xml  <
解决ie和其他浏览器poi下载excel文件名乱码 jackyrong Excel
使用poi,做传统的excel导出，然后想在浏览器中，让用户选择另存为，保存用户下载的xls文件，这个时候，可能的是在ie下出现乱码（ie,9,10,11),但在firefox,chrome下没乱码，因此必须综合判断，编写一个工具类： /** * * @Title: pro
挥洒泪水的青春 lampcy 编程生活程序员
2015年2月28日，我辞职了，离开了相处一年的触控，转过身--挥洒掉泪水，毅然来到了兄弟连，背负着许多的不解、质疑——”你一个零基础、脑子又不聪明的人，还敢跨行业，选择Unity3D？“，”真是不自量力••••••“，”真是初生牛犊不怕虎•••••“，••••••我只是淡淡一笑，拎着行李----坐上了通向挥洒泪水的青春之地——兄弟连！这就是我青春的分割线，不后悔，只会去用泪水浇灌——已经来到
稳增长之中国股市两点意见-----严控做空，建立涨跌停版停牌重组机制 nannan408
对于股市，我们国家的监管还是有点拼的，但始终拼不过飞流直下的恐慌，为什么呢？笔者首先支持股市的监管。对于股市越管越荡的现象，笔者认为首先是做空力量超过了股市自身的升力，并且对于跌停停牌重组的快速反应还没建立好，上市公司对于股价下跌没有很好的利好支撑。我们来看美国和香港是怎么应对股灾的。美国是靠禁止重要股票做空，在
动态设置iframe高度(iframe高度自适应) Rainbow702 JavaScript iframe contentDocument 高度自适应局部刷新
如果需要对画面中的部分区域作局部刷新，大家可能都会想到使用ajax。但有些情况下，须使用在页面中嵌入一个iframe来作局部刷新。对于使用iframe的情况，发现有一个问题，就是iframe中的页面的高度可能会很高，但是外面页面并不会被iframe内部页面给撑开，如下面的结构： <div id="content"> <div id=&quo
用Rapael做图表 tntxia rap
function drawReport(paper,attr,data){ var width = attr.width; var height = attr.height; var max = 0; &nbs
HTML5 bootstrap2网页兼容（支持IE10以下） xiaoluode html5 bootstrap
<!DOCTYPE html> <html> <head lang="zh-CN"> <meta charset="UTF-8"> <meta http-equiv="X-UA-Compatible" content="IE=edge">

推荐系统-用户标签预测算法基础实践-决策树(一)