nineteens

python学习之随机森林算法及其优化

　　前言

　　优化随机森林算法，正确率提高1%~5%(已经有90%+的正确率，再调高会导致过拟合)

　　优化思路

　　计算传统模型准确率

　　计算设定树木颗数时最佳树深度，以最佳深度重新生成随机森林

　　计算新生成森林中每棵树的AUC，选取AUC靠前的一定百分比的树

　　通过计算各个树的数据相似度，排除相似度超过设定值且AUC较小的树

　　计算最终的准确率

　　主要代码粘贴如下(注释比较详细，就不介绍代码了)

　　#-*- coding: utf-8 -*-

　　import time

　　from csv import reader

　　from random import randint

　　from random import seed

　　import numpy as np

　　from numpy import mat

　　from group_11 import caculateAUC_1, plotTree

　　# 建立一棵CART树

　　'''试探分枝'''

　　def data_split(index, value, dataset):

　　left, right = list(), list()

　　for row in dataset:

　　if row[index] < value:

　　left.append(row)

　　else:

　　right.append(row)

　　return left, right

　　'''计算基尼指数'''

　　def calc_gini(groups, class_values):

　　gini = 0.0

　　total_size = 0

　　for group in groups:

　　total_size += len(group)

　　for group in groups:

　　size = len(group)

　　if size == 0:

　　continue

　　for class_value in class_values:

　　proportion = [row[-1] for row in group].count(class_value) / float(size)

　　gini += (size / float(total_size)) * (proportion * (1.0 - proportion))# 二分类执行两次，相当于*2

　　return gini

　　'''找最佳分叉点'''

　　def get_split(dataset, n_features):

　　class_values = list(set(row[-1] for row in dataset))# 类别标签集合

　　b_index, b_value, b_score, b_groups = 999, 999, 999, None

　　# 随机选取特征子集，包含n_features个特征

　　features = list()

　　while len(features) < n_features:

　　# 随机选取特征

　　# 特征索引

　　index = randint(0, len(dataset[0]) - 2) # 往features添加n_features个特征(n_feature等于特征数的根号)，特征索引从dataset中随机取

　　if index not in features:

　　features.append(index)

　　for index in features: # 对每一个特征

　　# 计算Gini指数

　　for row in dataset: # 按照每个记录的该特征的取值划分成两个子集，计算对于的Gini(D，A)，取最小的

　　groups = data_split(index, row[index], dataset)

　　gini = calc_gini(groups, class_values)

　　if gini < b_score:

　　b_index, b_value, b_score, b_groups = index, row[index], gini, groups

　　return {'index': b_index, 'value': b_value, 'groups': b_groups} # 每个节点由字典组成

　　'''多数表决'''

　　def to_terminal(group):

　　outcomes = [row[-1] for row in group]

　　return max(set(outcomes), key=outcomes.count)

　　'''分枝'''

　　def split(node, max_depth, min_size, n_features, depth):

　　left, right = node['groups'] # 自动分包/切片

　　del (node['groups'])

　　if not left or not right: # left或者right为空时

　　node['left'] = node['right'] = to_terminal(left + right) # 叶节点不好理解

　　return

　　if depth >= max_depth:

　　node['left'], node['right'] = to_terminal(left), to_terminal(right)

　　return

　　# 左子树

　　if len(left) <= min_size:

　　node['left'] = to_terminal(left)

　　else:

　　node['left'] = get_split(left, n_features)

　　split(node['left'], max_depth, min_size, n_features, depth + 1)

　　# 右子树

　　if len(right) <= min_size: # min_size最小的的分枝样本数

　　node['right'] = to_terminal(right)

　　else:

　　node['right'] = get_split(right, n_features)

　　split(node['right'], max_depth, min_size, n_features, depth + 1)

　　'''建立一棵树'''

　　def build_one_tree(train, max_depth, min_size, n_features):

　　# 寻找最佳分裂点作为根节点

　　root = get_split(train, n_features)

　　split(root, max_depth, min_size, n_features, 1)

　　return root

　　'''用森林里的一棵树来预测'''

　　def predict(node, row):

　　if row[node['index']] < node['value']:

　　if isinstance(node['left'], dict):

　　return predict(node['left'], row)

　　else:

　　return node['left']

　　else:

　　if isinstance(node['right'], dict):

　　return predict(node['right'], row)

　　else:

　　return node['right']

　　# 随机森林类

　　class randomForest:

　　def __init__(self,trees_num, max_depth, leaf_min_size, sample_ratio, feature_ratio):

　　self.trees_num = trees_num # 森林的树的数目

　　self.max_depth = max_depth # 树深

　　self.leaf_min_size = leaf_min_size # 建立树时，停止的分枝样本最小数目

　　self.samples_split_ratio = sample_ratio # 采样，创建子集的比例(行采样)

　　self.feature_ratio = feature_ratio # 特征比例(列采样)

　　self.trees = list() # 森林

　　'''有放回的采样，创建数据子集'''

　　def sample_split(self, dataset):

　　sample = list()

　　n_sample = round(len(dataset) * self.samples_split_ratio) #每棵树的采样数

　　while len(sample) < n_sample:

　　index = randint(0, len(dataset) - 2) #随机有放回的采样

　　sample.append(dataset[index])

　　return sample

　　##############***Out-of-Bag***################################

　　# 进行袋外估计等相关函数的实现,需要注意并不是每个样本都可能出现在随机森林的袋外数据中

　　# 因此进行oob估计时需要注意估计样本的数量

　　def OOB(self, oobdata, train, trees):

　　'''输入为：袋外数据dict,训练集,tree_list

　　return oob准确率'''

　　n_rows = []

　　count = 0

　　n_trees = len(trees) # 森林中树的棵树

　　for key, item in oobdata.items():

　　n_rows.append(item)

　　# print(len(n_rows)) # 所有trees中的oob数据的合集

　　n_rows_list = sum(n_rows, [])

　　unique_list = []

　　for l1 in n_rows_list: # 从oob合集中计算独立样本数量

　　if l1 not in unique_list:

　　unique_list.append(l1)

　　n = len(unique_list)

　　# print(n)

　　# 对训练集中的每个数据，进行遍历，寻找其作为oob数据时的所有trees,并进行多数投票

　　for row in train:

　　pre = []

　　for i in range(n_trees):

　　if row not in oobdata[i]:

　　# print('row: ',row)

　　# print('trees[i]: ', trees[i])

　　pre.append(predict(trees[i], row))

　　if len(pre) > 0:

　　label = max(set(pre), key=pre.count)

　　if label == row[-1]:

　　count += 1

　　return (float(count) / n) * 100

　　'''建立随机森林'''

　　def build_randomforest(self, train):

　　temp_flag = 0

　　max_depth = self.max_depth # 树深

　　min_size = self.leaf_min_size # 建立树时，停止的分枝样本最小数目

　　n_trees = self.trees_num # 森林的树的数目

　　n_features = int(self.feature_ratio * (len(train[0])-1)) #列采样，从M个feature中，选择m个(m<

　　# print('特征值为 : ',n_features)

　　oobs = {} # ----------------------

　　for i in range(n_trees): # 建立n_trees棵决策树

　　sample = self.sample_split(train) # 有放回的采样，创建数据子集

　　oobs[i] = sample # ----------------

　　tree = build_one_tree(sample, max_depth, min_size, n_features) # 建立决策树

　　self.trees.append(tree)

　　temp_flag += 1

　　# print(i,tree)

　　oob_score = self.OOB(oobs, train, self.trees) # oob准确率---------

　　print("oob_score is ", oob_score) # 打印oob准确率---------

　　return self.trees

　　'''随机森林预测的多数表决'''

　　def bagging_predict(self, onetestdata):

　　predictions = [predict(tree, onetestdata) for tree in self.trees]

　　return max(set(predictions), key=predictions.count)

　　'''计算建立的森林的精确度'''

　　def accuracy_metric(self, testdata):

　　correct = 0

　　for i in range(len(testdata)):

　　predicted = self.bagging_predict(testdata[i])

　　if testdata[i][-1] == predicted:

　　correct += 1

　　return correct / float(len(testdata)) * 100.0

　　# 数据处理

　　'''导入数据'''

　　def load_csv(filename):

　　dataset = list()

　　with open(filename, 'r') as file:

　　csv_reader = reader(file)

　　for row in csv_reader:

　　if not row:

　　continue

　　# dataset.append(row)

　　dataset.append(row[:-1])

　　# return dataset

　　return dataset[1:], dataset[0]

　　'''划分训练数据与测试数据'''

　　def split_train_test(dataset, ratio=0.3):

　　#ratio = 0.2 # 取百分之二十的数据当做测试数据

　　num = len(dataset)

　　train_num = int((1-ratio) * num)

　　dataset_copy = list(dataset)

　　traindata = list()

　　while len(traindata) < train_num:

　　index = randint(0,len(dataset_copy)-1)

　　traindata.append(dataset_copy.pop(index))

　　testdata = dataset_copy

　　return traindata, testdata

　　'''分析树，将向量内积写入list'''

　　def analyListTree(node, tag, result):

　　# 叶子节点的父节点

　　if (isinstance(node['left'], dict)):

　　# 计算node与node[tag]的内积

　　tag="left"

　　re = Inner_product(node, tag)

　　result.append(re)

　　analyListTree(node['left'], 'left', result)

　　return

　　elif (isinstance(node['right'], dict)):

　　# 计算node与node[tag]的内积

　　tag = "right"

　　re = Inner_product(node, tag)

　　result.append(re)

　　analyListTree(node['right'], 'right', result)

　　return

　　else:

　　return

　　'''求向量内积'''

　　# 计算node与node[tag]的内积

　　def Inner_product(node ,tag):

　　a = mat([[float(node['index'])], [float(node['value'])]])

　　b = mat([[float(node[tag]['index'])], [float(node[tag]['value'])]])

　　return (a.T * b)[0,0]

　　'''相似度优化'''

　　''' same_value = 20 # 向量内积的差(小于此值认为相似)

　　same_rate = 0.63 # 树的相似度(大于此值认为相似)

　　返回新的森林(已去掉相似度高的树)'''

　　def similarity_optimization(newforest, samevalue, samerate):

　　res = list() # 存储森林的内积

　　result = list() # 存储某棵树的内积

　　i = 1

　　for tree in newforest:

　　# 分析树，将向量内积写入list

　　# result 存储tree的内积

　　analyListTree(tree, None, result)

　　res.append(result)

　　# print('第',i,'棵树：',len(result),result)

　　result = []

　　# print('res = ',len(res),res)

　　# 取一棵树的单个向量内积与其他树的单个向量内积做完全对比(相似度)

　　# 遍历列表的列

　　for i in range(0, len(res) - 1):

　　# 保证此列未被置空、

　　if not newforest[i] == None:

　　# 遍历做对比的树的列

　　for k in range(i + 1, len(res)):

　　if not newforest[k] == None:

　　# time用于统计相似的次数，在每次更换对比树时重置为0

　　time = 0

　　# 遍历列表的当前行

　　for j in range(0, len(res[i])):

　　# 当前两颗树对比次数

　　all_contrast = (res[ i].__len__() * res[k].__len__())

　　# 遍历做对比的树的行

　　for l in range(0, len(res[k])):

　　# 如果向量的内积相等，计数器加一

　　if res[i][j] - res[k][l] < samevalue:

　　time = time + 1

　　# 如果相似度大于设定值

　　real_same_rate = time / all_contrast

　　if (real_same_rate > samerate):

　　# 将对比树置空

　　newforest[k] = None

　　result_forest = list()

　　for i in range(0, newforest.__len__()):

　　if not newforest[i] == None:

　　result_forest.append(newforest[i])

　　return result_forest

　　'''auc优化method'''

　　def auc_optimization(auclist,trees_num,trees):

　　# 为auc排序，获取从大到小的与trees相对应的索引列表

　　b = sorted(enumerate(auclist), key=lambda x: x[1], reverse=True)

　　index_list = [x[0] for x in b]

　　auc_num = int(trees_num * 2 / 3)

　　# 取auc高的前auc_num个

　　print('auc: ', auc_num, index_list)

　　newTempForest = list()

　　for i in range(auc_num):

　　# myRF.trees.append(tempForest[i])

　　# newTempForest.append(myRF.trees[index_list[i]])

　　newTempForest.append(trees[index_list[i]])

　　return newTempForest

　　'''得到森林中决策树的最佳深度'''

　　def getBestDepth(min_size,sample_ratio,trees_num,feature_ratio,traindata,testdata):

　　max_depth = np.linspace(1, 15, 15, endpoint=True)

　　# max_depth=[5,6,7,8,9,10,11,12,13,14,15]

　　scores_final = []郑州妇科医院哪家好 yiyuan.120ask.com/art/

　　i=0

　　for depth in max_depth:

　　# 初始化随机森林

　　# print('=========>',i,'<=============')

　　myRF_ = randomForest(trees_num, depth, min_size, sample_ratio, feature_ratio)

　　# 生成随机森林

　　myRF_.build_randomforest(traindata)

　　# 测试评估

　　acc = myRF_.accuracy_metric(testdata[:-1])

　　# print('模型准确率：', acc, '%')

　　# scores_final.append(acc.mean())

　　scores_final.append(acc*0.01)

　　i=i+1

　　# print('scores_final: ',scores_final)

　　# 找到深度小且准确率高的值

　　best_depth = 0

　　temp_score = 0

　　for i in range(len(scores_final)):

　　if scores_final[i] > temp_score:

　　temp_score = scores_final[i]

　　best_depth = max_depth[i]

　　# print('best_depth:',np.mean(scores_final),best_depth)

　　# plt.plot(max_depth, scores_final, 'r-', lw=2)

　　# # plt.plot(max_depth, list(range(0,max(scores_final))), 'r-', lw=2)

　　# plt.xlabel('max_depth')

　　# plt.ylabel('CV scores')

　　# plt.ylim(bottom=0.0,top=1.0)

　　# plt.grid()

　　# plt.show()

　　return best_depth

　　'''对比不同树个数时的模型正确率'''

　　def getMyRFAcclist(treenum_list):

　　seed(1) # 每一次执行本文件时都能产生同一个随机数

　　filename = 'DataSet3.csv' #SMOTE处理过的数据

　　min_size = 1

　　sample_ratio = 1

　　feature_ratio = 0.3 # 尽可能小，但是要保证 int(self.feature_ratio * (len(train[0])-1)) 大于1

　　same_value = 20 # 向量内积的差(小于此值认为相似)

　　same_rate = 0.63 # 树的相似度(大于此值认为相似)

　　# 加载数据

　　dataset, features = load_csv(filename)

　　traindata, testdata = split_train_test(dataset, feature_ratio)

　　# 森林中不同树个数的对比

　　# treenum_list = [20, 30, 40, 50, 60]

　　acc_num_list = list()

　　acc_list=list()

　　for trees_num in treenum_list:

　　# 优化1-获取最优深度

　　max_depth = getBestDepth(min_size, sample_ratio, trees_num, feature_ratio, traindata, testdata)

　　print('max_depth is ', max_depth)

　　# 初始化随机森林

　　myRF = randomForest(trees_num, max_depth, min_size, sample_ratio, feature_ratio)

　　# 生成随机森林

　　myRF.build_randomforest(traindata)

　　print('Tree_number: ', myRF.trees.__len__())

　　# 计算森林中每棵树的AUC

　　auc_list = caculateAUC_1.caculateRFAUC(testdata, myRF.trees)

　　# 选取AUC高的决策数形成新的森林(auc优化)

　　newTempForest = auc_optimization(auc_list,trees_num,myRF.trees)

　　# 相似度优化

　　myRF.trees = similarity_optimization(newTempForest, same_value, same_rate)

　　# 测试评估

　　acc = myRF.accuracy_metric(testdata[:-1])

　　print('myRF1_模型准确率：', acc, '%')

　　acc_num_list.append([myRF.trees.__len__(), acc])

　　acc_list.append(acc)

　　print('trees_num from 20 to 60: ', acc_num_list)

　　return acc_list

　　if __name__ == '__main__':

　　start = time.clock()

　　seed(1) # 每一次执行本文件时都能产生同一个随机数

　　filename = 'DataSet3.csv' # 这里是已经利用SMOTE进行过预处理的数据集

　　max_depth = 15 # 调参(自己修改) #决策树深度不能太深，不然容易导致过拟合

　　min_size = 1

　　sample_ratio = 1

　　trees_num = 20

　　feature_ratio = 0.3 # 尽可能小，但是要保证 int(self.feature_ratio * (len(train[0])-1)) 大于1

　　same_value = 20 # 向量内积的差(小于此值认为相似)

　　same_rate = 0.82 # 树的相似度(大于此值认为相似)

　　# 加载数据

　　dataset,features = load_csv(filename)

　　traindata,testdata = split_train_test(dataset, feature_ratio)

　　# 优化1-获取最优深度

　　# max_depth = getBestDepth(min_size, sample_ratio, trees_num, feature_ratio, traindata, testdata)

　　# print('max_depth is ',max_depth)

　　# 初始化随机森林

　　myRF = randomForest(trees_num, max_depth, min_size, sample_ratio, feature_ratio)

　　# 生成随机森林

　　myRF.build_randomforest(traindata)

　　print('Tree_number: ', myRF.trees.__len__())

　　acc = myRF.accuracy_metric(testdata[:-1])

　　print('传统RF模型准确率：',acc,'%')

　　# 画出某棵树用以可视化观察(这里是第一棵树)

　　# plotTree.creatPlot(myRF.trees[0], features)

　　# 计算森林中每棵树的AUC

　　auc_list = caculateAUC_1.caculateRFAUC(testdata,myRF.trees)

　　# 画出每棵树的auc——柱状图

　　# plotTree.plotAUCbar(auc_list.__len__(),auc_list)

　　# 选取AUC高的决策数形成新的森林(auc优化)

　　newTempForest = auc_optimization(auc_list,trees_num,myRF.trees)

　　# 相似度优化

　　myRF.trees=similarity_optimization(newTempForest, same_value, same_rate)

　　print('优化后Tree_number: ', myRF.trees.__len__())

　　# 测试评估

　　acc = myRF.accuracy_metric(testdata[:-1])

　　# print('优化后模型准确率：', acc, '%')

　　print('myRF1_模型准确率：', acc, '%')

　　# 画出某棵树用以可视化观察(这里是第一棵树)

　　# plotTree.creatPlot(myRF.trees[0], features)

　　# 计算森林中每棵树的AUC

　　auc_list = caculateAUC_1.caculateRFAUC(testdata, myRF.trees)

　　# 画出每棵树的auc——柱状图

　　plotTree.plotAUCbar(auc_list.__len__(), auc_list)

　　end = time.clock()

　　print('The end!')

　　print(end-start)

你可能感兴趣的:(python)

理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
Python中深拷贝与浅拷贝的区别 yuxiaoyu.
转自：http://blog.csdn.net/u014745194/article/details/70271868定义：在Python中对象的赋值其实就是对象的引用。当创建一个对象，把它赋值给另一个变量的时候，python并没有拷贝这个对象，只是拷贝了这个对象的引用而已。浅拷贝：拷贝了最外围的对象本身，内部的元素都只是拷贝了一个引用而已。也就是，把对象复制一遍，但是该对象中引用的其他对象我不复
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
Python编译器鹿鹿~ Python编译器 Python python 开发语言后端
嘿嘿嘿我又来了啊有些小盆友可能不知道Python其实是有编译器的，也就是PyCharm。你们可能会问到这个是干嘛的又不可以吃也不可以穿好像没有什么用，其实你还说对了这个还真的不可以吃也不可以穿，但是它用来干嘛的呢。用来编译你所打出的代码进行运行（可能这里说的有点不对但是只是个人认为）现在我们来说说PyCharm是用来干嘛的。PyCharm是一种PythonIDE，带有一整套可以帮助用户在使用Pyt
一文掌握python面向对象魔术方法（二）程序员neil python python 开发语言
接上篇：一文掌握python面向对象魔术方法（一）-CSDN博客目录六、迭代和序列化：1、__iter__(self):定义迭代器，使得类可以被for循环迭代。2、__getitem__(self,key):定义索引操作，如obj[key]。3、__setitem__(self,key,value):定义赋值操作，如obj[key]=value。4、__delitem__(self,key):定义
一文掌握python常用的list（列表）操作程序员neil python python 开发语言
目录一、创建列表1.直接创建列表：2.使用list()构造器3.使用列表推导式4.创建空列表二、访问列表元素1.列表支持通过索引访问元素，索引从0开始：2.还可以使用切片操作访问列表的一部分：三、修改列表元素四、添加元素1.append()：在末尾添加元素2.insert()：在指定位置插入元素五、删除元素1.del：删除指定位置的元素2.remove()：删除指定值的第一个匹配项3.pop()：
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
python中的深拷贝与浅拷贝 anshejd70787 python
深拷贝和浅拷贝浅拷贝的时候，修改原来的对象，浅拷贝的对象不会发生改变。1、对象的赋值对象的赋值实际上是对象之间的引用：当创建一个对象，然后将这个对象赋值给另外一个变量的时候，python并没有拷贝这个对象，而只是拷贝了这个对象的引用。当对对象做赋值或者是参数传递或者作为返回值的时候，总是传递原始对象的引用，而不是一个副本。如下所示：>>>aList=["kel","abc",123]>>>bLis
用Python实现简单的猜数字游戏程序媛了了 python 游戏 java
猜数字游戏代码：importrandomdefpythonit():a=random.randint(1,100)n=int(input("输入你猜想的数字："))whilen!=a:ifn>a:print("很遗憾，猜大了")n=int(input("请再次输入你猜想的数字："))elifna::如果玩家猜的数字n大于随机数字a，则输出"很遗憾，猜大了"，并提示玩家再次输入。elifn
用Python实现读取统计单词个数程序媛了了 python 游戏 java
完整实例代码：fromcollectionsimportCounterdefpythonit():danci={}withopen("pythonit.txt","r",encoding="utf-8")asf:foriinf:words=i.strip().split()forwordinwords:ifwordnotindanci:danci[word]=1else:danci[word]+=
数据采集高并发的架构应用 3golden .net
问题的出发点：最近公司为了发展需要，要扩大对用户的信息采集，每个用户的采集量估计约2W。如果用户量增加的话，将会大量照成采集量成3W倍的增长，但是又要满足日常业务需要，特别是指令要及时得到响应的频率次数远大于预期。 &n
不停止 MySQL 服务增加从库的两种方式 brotherlamp linux linux视频 linux资料 linux教程 linux自学
现在生产环境MySQL数据库是一主一从，由于业务量访问不断增大，故再增加一台从库。前提是不能影响线上业务使用，也就是说不能重启MySQL服务，为了避免出现其他情况，选择在网站访问量低峰期时间段操作。一般在线增加从库有两种方式，一种是通过mysqldump备份主库，恢复到从库，mysqldump是逻辑备份，数据量大时，备份速度会很慢，锁表的时间也会很长。另一种是通过xtrabacku
Quartz——SimpleTrigger触发器 eksliang SimpleTrigger TriggerUtils quartz
转载请出自出处：http://eksliang.iteye.com/blog/2208166 一.概述 SimpleTrigger触发器，当且仅需触发一次或者以固定时间间隔周期触发执行；二.SimpleTrigger的构造函数 SimpleTrigger(String name, String group)：通过该构造函数指定Trigger所属组和名称； Simpl
Informatica应用（1） 18289753290 sql workflow lookup 组件 Informatica
1.如果要在workflow中调用shell脚本有一个command组件，在里面设置shell的路径；调度wf可以右键出现schedule，现在用的是HP的tidal调度wf的执行。 2.designer里面的router类似于SSIS中的broadcast（多播组件）;Reset_Workflow_Var：参数重置（比如说我这个参数初始是1在workflow跑得过程中变成了3我要在结束时还要
python 获取图片验证码中文字酷的飞上天空 python
根据现成的开源项目 http://code.google.com/p/pytesser/改写在window上用easy_install安装不上看了下源码发现代码很少于是就想自己改写一下添加支持网络图片的直接解析 #coding:utf-8 #import sys #reload(sys) #sys.s
AJAX 永夜-极光 Ajax
1.AJAX功能:动态更新页面,减少流量消耗,减轻服务器负担 2.代码结构: <html> <head> <script type="text/javascript"> function loadXMLDoc() { .... AJAX script goes here ...
创业OR读研随便小屋创业
现在研一，有种想创业的想法，不知道该不该去实施。因为对于的我情况这两者是矛盾的，可能就是鱼与熊掌不能兼得。研一的生活刚刚过去两个月，我们学校主要的是
需求做得好与坏直接关系着程序员生活质量 aijuans IT 生活
这个故事还得从去年换工作的事情说起，由于自己不太喜欢第一家公司的环境我选择了换一份工作。去年九月份我入职现在的这家公司，专门从事金融业内软件的开发。十一月份我们整个项目组前往北京做现场开发，从此苦逼的日子开始了。系统背景：五月份就有同事前往甲方了解需求一直到6月份，后续几个月也完
如何定义和区分高级软件开发工程师 aoyouzi
在软件开发领域，高级开发工程师通常是指那些编写代码超过 3 年的人。这些人可能会被放到领导的位置，但经常会产生非常糟糕的结果。Matt Briggs 是一名高级开发工程师兼 Scrum 管理员。他认为，单纯使用年限来划分开发人员存在问题，两个同样具有 10 年开发经验的开发人员可能大不相同。近日，他发表了一篇博文，根据开发者所能发挥的作用划分软件开发工程师的成长阶段。　　初
Servlet的请求与响应百合不是茶 servlet get提交 java处理post提交
Servlet是tomcat中的一个重要组成,也是负责客户端和服务端的中介 1,Http的请求方式(get ,post); 客户端的请求一般都会都是Servlet来接受的,在接收之前怎么来确定是那种方式提交的,以及如何反馈,Servlet中有相应的方法, http的get方式 servlet就是都doGet(
web.xml配置详解之listener bijian1013 java web.xml listener
一.定义 <listener> <listen-class>com.myapp.MyListener</listen-class> </listener> 二.作用该元素用来注册一个监听器类。可以收到事件什么时候发生以及用什么作为响
Web页面性能优化（yahoo技术） Bill_chen JavaScript Ajax Web css Yahoo
1.尽可能的减少HTTP请求数 content 2.使用CDN server 3.添加Expires头(或者 Cache-control) server 4.Gzip 组件 server 5.把CSS样式放在页面的上方。 css 6.将脚本放在底部(包括内联的) javascript 7.避免在CSS中使用Expressions css 8.将javascript和css独立成外部文
【MongoDB学习笔记八】MongoDB游标、分页查询、查询结果排序 bit1129 mongodb
游标游标，简单的说就是一个查询结果的指针。游标作为数据库的一个对象，使用它是包括声明打开循环抓去一定数目的文档直到结果集中的所有文档已经抓取完关闭游标游标的基本用法，类似于JDBC的ResultSet(hasNext判断是否抓去完,next移动游标到下一条文档)，在获取一个文档集时，可以提供一个类似JDBC的FetchSize
ORA-12514 TNS 监听程序当前无法识别连接描述符中请求服务的解决方法白糖_ ORA-12514
今天通过Oracle SQL*Plus连接远端服务器的时候提示“监听程序当前无法识别连接描述符中请求服务”，遂在网上找到了解决方案： ①打开Oracle服务器安装目录\NETWORK\ADMIN\listener.ora文件，你会看到如下信息： # listener.ora Network Configuration File: D:\database\Oracle\net
Eclipse 问题 A resource exists with a different case bozch eclipse
在使用Eclipse进行开发的时候，出现了如下的问题： Description Resource Path Location TypeThe project was not built due to "A resource exists with a different case: '/SeenTaoImp_zhV2/bin/seentao'.&
编程之美-小飞的电梯调度算法 bylijinnan 编程之美
public class AptElevator { /** * 编程之美小飞电梯调度算法 * 在繁忙的时间，每次电梯从一层往上走时，我们只允许电梯停在其中的某一层。 * 所有乘客都从一楼上电梯，到达某层楼后，电梯听下来，所有乘客再从这里爬楼梯到自己的目的层。 * 在一楼时，每个乘客选择自己的目的层，电梯则自动计算出应停的楼层。 * 问：电梯停在哪
SQL注入相关概念 chenbowen00 sql Web 安全
SQL Injection：就是通过把SQL命令插入到Web表单递交或输入域名或页面请求的查询字符串，最终达到欺骗服务器执行恶意的SQL命令。具体来说，它是利用现有应用程序，将（恶意）的SQL命令注入到后台数据库引擎执行的能力，它可以通过在Web表单中输入（恶意）SQL语句得到一个存在安全漏洞的网站上的数据库，而不是按照设计者意图去执行SQL语句。首先让我们了解什么时候可能发生SQ
[光与电]光子信号战防御原理 comsci 原理
无论是在战场上,还是在后方,敌人都有可能用光子信号对人体进行控制和攻击,那么采取什么样的防御方法,最简单,最有效呢? 我们这里有几个山寨的办法,可能有些作用,大家如果有兴趣可以去实验一下根据光
oracle 11g新特性:Pending Statistics daizj oracle dbms_stats
oracle 11g新特性:Pending Statistics 转从11g开始，表与索引的统计信息收集完毕后，可以选择收集的统信息立即发布，也可以选择使新收集的统计信息处于pending状态，待确定处于pending状态的统计信息是安全的，再使处于pending状态的统计信息发布，这样就会避免一些因为收集统计信息立即发布而导致SQL执行计划走错的灾难。在 11g 之前的版本中，D
快速理解RequireJs dengkane jquery requirejs
RequireJs已经流行很久了，我们在项目中也打算使用它。它提供了以下功能：声明不同js文件之间的依赖可以按需、并行、延时载入js库可以让我们的代码以模块化的方式组织初看起来并不复杂。在html中引入requirejs 在HTML中，添加这样的 <script> 标签： <script src="/path/to
C语言学习四流程控制if条件选择、for循环和强制类型转换 dcj3sjt126com c
# include <stdio.h> int main(void) { int i, j; scanf("%d %d", &i, &j); if (i > j) printf("i大于j\n"); else printf("i小于j\n"); retu
dictionary的使用要注意 dcj3sjt126com IO
NSDictionary *dict = [NSDictionary dictionaryWithObjectsAndKeys: user.user_id , @"id", user.username , @"username",
Android 中的资源访问(Resource) finally_m xml android String drawable color
简单的说，Android中的资源是指非代码部分。例如，在我们的Android程序中要使用一些图片来设置界面，要使用一些音频文件来设置铃声，要使用一些动画来显示特效，要使用一些字符串来显示提示信息。那么，这些图片、音频、动画和字符串等叫做Android中的资源文件。在Eclipse创建的工程中，我们可以看到res和assets两个文件夹，是用来保存资源文件的，在assets中保存的一般是原生
Spring使用Cache、整合Ehcache 234390216 spring cache ehcache @Cacheable
Spring使用Cache 从3.1开始，Spring引入了对Cache的支持。其使用方法和原理都类似于Spring对事务管理的支持。Spring Cache是作用在方法上的，其核心思想是这样的：当我们在调用一个缓存方法时会把该方法参数和返回结果作为一个键值对存放在缓存中，等到下次利用同样的
当druid遇上oracle blob(clob) jackyrong oracle
http://blog.csdn.net/renfufei/article/details/44887371 众所周知，Oracle有很多坑, 所以才有了去IOE。在使用Druid做数据库连接池后，其实偶尔也会碰到小坑，这就是使用开源项目所必须去填平的。【如果使用不开源的产品，那就不是坑，而是陷阱了，你都不知道怎么去填坑】用Druid连接池，通过JDBC往Oracle数据库的
easyui datagrid pagination获得分页页码、总页数等信息 ldzyz007
var grid = $('#datagrid'); var options = grid.datagrid('getPager').data("pagination").options; var curr = options.pageNumber; var total = options.total; var max =
浅析awk里的数组 nigelzeng 二维数组 array 数组 awk
awk绝对是文本处理中的神器，它本身也是一门编程语言，还有许多功能本人没有使用到。这篇文章就单单针对awk里的数组来进行讨论，如何利用数组来帮助完成文本分析。有这么一组数据： abcd,91#31#2012-12-31 11:24:00 case_a,136#19#2012-12-31 11:24:00 case_a,136#23#2012-12-31 1
搭建 CentOS 6 服务器(6) - TigerVNC rensanning centos
安装GNOME桌面环境 # yum groupinstall "X Window System" "Desktop" 安装TigerVNC # yum -y install tigervnc-server tigervnc 启动VNC服务 # /etc/init.d/vncserver restart # vncser
Spring 数据库连接整理 tomcat_oracle spring bean jdbc
1、数据库连接jdbc.properties配置详解　　jdbc.url=jdbc:hsqldb:hsql://localhost/xdb 　　jdbc.username=sa 　　jdbc.password= 　　jdbc.driver=不同的数据库厂商驱动，此处不一一列举　　接下来，详细配置代码如下：　　 Spring连接池
Dom4J解析使用xpath java.lang.NoClassDefFoundError: org/jaxen/JaxenException异常 xp9802
用Dom4J解析xml,以前没注意,今天使用dom4j包解析xml时在xpath使用处报错异常栈：java.lang.NoClassDefFoundError: org/jaxen/JaxenException异常导入包 jaxen-1.1-beta-6.jar 解决; &nb

python学习之 随机森林算法及其优化

你可能感兴趣的:(python)

python学习之随机森林算法及其优化