赵鹏举

逻辑回归

<机器学习笔记-04 >逻辑回归

关键词：机器学习，python，scikit-learn，逻辑回归，Latex

摘要：本文主要介绍了分类任务的分类，逻辑回归的概念，以及分类评估方法；同时介绍了如何使用python对分类任务进行建模、预测结果以及结果评价，以及使用GridSearch方法进行优化；

注：LaTeX常见命令请参考wikibooks，笔者将其pdf上传到csdn下载中。

知识要点总结
1. 掌握概念：分类任务（二元分类、多类分类、多标签分类）
2. 理解：广义线性回归概念，以及逻辑回归属于线性模型的原因；
3. 理解分类评估方法：准确率、精确率、召回率、误警率、综合评价指标、ROC-AUC值、混淆矩阵、汉明损失函数，杰卡德相似度；
4. 掌握使用python，针对二元分类和多类分类，训练逻辑回归模型，预测结果，对结果进行评价（各类分类评估方法）；会使用GridSearch方法进行优化求解；
基本概念与理论分析
1. 分类任务：目标是寻找一个函数，把观测值匹配到相应的类和标签上；逻辑回归（logistic regression）可以用来处理分类任务；常见分类可以分为二元分类（binary classification）、多类分类（multi-class classification）以及多标签分类（multi-label classification）；
2. 广义线性回归用一个联连函数（link function）来描述解释变量和响应变量的关系；普通线性回归使用恒等联连函数（identity link function），将解释变量通过线性组合方式来联接服务正态分布的响应变量；逻辑回归的联连函数称为逻辑函数（logistic function），响应变量等于或者超过指定的临界值，预测结果就是正面，否则预测结果就是反面；
  
  $F (t) = 1 1 + e - t$
3. 逻辑回归被认为是线性模型的原因（参考周志华《机器学习》）：
  1. 线性模型（linear model）试图用线性组合进行预测的函数，即
    
    $f (x) = w 1 x 1 + w 2 x 2 + . . . + w d x d + b$
    
    用向量形式写为
    
    $f (x) = ω T x + b$
  2. 从逻辑函数可以推导得到
    
    $l n y 1 - y = ω T x + b$
    
    即：
    
    $l n p ( y = 1 | x ) p ( y = 0 | x ) = ω T x + b$
    
    概率关系可以用一组线性参数表示出来；
4. 二元分类的效果评估方法
  1. 二元分类后样本的可能结果：结果预测正确为真，否则为假；
    1. 真阳性TP（true positives）
    2. 真阴性TN（true negatives）
    3. 假阴性FP（false positives）
    4. 假阳性FN（false negatives）
  2. 准确率（accuracy）：预测为真的样本与总体样本之比；
    
    $A C C = T P + T N T P + T N + F P + F N$
  3. 精确率（precision）：真阳性的样本与阳性样本之比；
    
    $P = T P T P + F P$
  4. 召回率（recall）：真阳性样本与实际为阳性样本（真阳性+假阴性）之比；
    
    $R = T P T P + F N$
  5. 误警率（fall-out）：=假阳性率；所有隐形样本中分类器识别为阳性的样本所占比例；
    
    $F = F P T N + F P$
  6. 综合评价指标（F1 measure）：精确率与召回率的调和均值（harmonic mean）;
    1. ##### F1公式
    1F1+1F1=1P+1R
    
    F1=2PRP+R
    
    F1=2TP2PP+FN+FP
    1. ##### 一般情况下公式
    Fβ=(1+β2)PRβ2P+R
    
    Fβ=(1+β2)TP(1+β2)TP+β2FN+FP
    1. F2: 召回率（R）权重大于精确率（P）；F0.5：精确率（P）权重大于召回率；
  7. ROC值（receiver operating characteristic）:画的是分类器的召回率（Y轴）与误警率（X轴）的曲线；
  8. AUC值（area under curve）：ROC曲线下方的面积，表示分类器随机预测的效果；
  9. 混淆矩阵（confusion matrix）：也叫列联表分析（contingency table），用来描述真假与阴阳的关系；矩阵的行表示实际类型，列表示预测类型；
5. 网格搜索方法（Grid Search）：
  1. 用来确定最有超参数的方法；选取可能参数不断运行获取最有效果；
  2. 使用穷举法，计算量巨大；
6. 多类分类：用one-vs-all或者one-vs-the-rest方法实现多类分类，就是把多类中的每个类都作为二元分类处理；分类器预测样本不同类型，将具有最大置信水平的类型作为样本类型；
7. 多标签分类：每个标签用二元分类处理，每个标签的分类器都预测样本是否属于该标签；
  1. 多标签分类效果评估方法：汉明损失函数（Hamming loss）和杰卡德相似度（Jaccard similarity）；
  2. 汉明损失函数：表示错误标签的平均比例；是一个函数，当预测全部正确时，值为零；
  3. 杰卡德相似度：预测标签和真实标签的交集数量除以预测标签和真实标签的并集数量，值在{0，1}之间；

Python编程积累

Python基本命令

`print`输出文字+数字的三种方法：`{}`、`%d`和`，`

print('spam:',df[df[0]=='spam'][0].count()) 

#spam: 747

print('spam:%d' %(df[df[0]=='spam'][0].count()))
spam:747
print('spam:{}' .format(df[df[0]=='spam'][0].count()))
spam:747

将spam/ham元素的array和list转化为0/1元素的list


y_test_binary=[0]*y_test.shape[0]
predictions_binary=[0]*predictions.shape[0]
for ind,val in enumerate(y_test):
 if val=='spam':
     y_test_binary[ind]=1
for ind,val in enumerate(predictions):
 if val=='spam':
     predictions_binary[ind]=1

`Matplotlib`库

将`confusion_matrix`绘制成`matshow()`，添加`colorbar（）`

from sklearn.metrics import confusion_matrix
import matplotlib.pyplot as plt
plt.matshow(cm)
plt.colorbar()

添加label

import matplotlib.pyplot as plt
plt.plot([0,1],[0,1],label='AUC')
plt.legend(loc='lower right')

Numpy库
1. 将区间划分arange和linsapce，前者是从起点按照给定步长进行划分，只有当终点也在步长整数倍时才会被包含在内；后者是将起点和终点中间等距划分，终点位最后一位数；
```
X=np.arange(-6,6,5);X

# 输出array([-6, -1,  4])

X=np.arange(-6,6,1);X

# 输出array([-6, -5, -4, -3, -2, -1,  0,  1,  2,  3,  4,  5])

X=np.linspace(-6,6,5);X

# 输出 array([-6., -3.,  0.,  3.,  6.])
```

`Pandas`库

`==`统计某列含某个值的数量

print('含ham短信数量��', df[df[0] == 'ham'][0].count())

`skilearn`库

`train_size`改变训练集和测试集的比例

X_train,X_test,y_train,y_test=train_test_split(X,y,train_size=0.5)

使用`TfdifVectorizer`计算TF-IDF权重

from sklearn.feature_extraction.text import TfidfVectorizer
vectorizer = TfidfVectorizer()
X_train = vectorizer.fit_transform(X_train_raw)
X_test = vectorizer.transform(X_test_raw)

使用`LogisticRegression`分类器进行训练和分类

from sklearn.linear_model.logistic import LogisticRegression
classifier = LogisticRegression()
classifier.fit(X_train, y_train)
predictions = classifier.predict(X_test)

Python实例代码整理（来自课程中代码或者）

二元分类

本实例为垃圾邮件分类：数据来自UCI Machine Learning Repository 的短信垃圾分类数据集��SMS Spam Classification Data Set��；

使用pandas库加载.csv文件，并做描述性统计

import pandas as pd
df=pd.read_csv('Desktop/data/SMSSpamCollection',delimiter='\t',header=None)
print('count of spam message=\t',df[df[0]=='spam'][0].count())
print('count of ham message=\t',df[df[0]=='ham'][0].count())

使用scikit-learn的`train_test_split`分成训练集（75%）和测试集（25%）

from sklearn.cross_validation import train_test_split
X_train_raw,X_test_raw,y_train,y_test=train_test_split(df[1],df[0])

建立`TfidfVectorizer`实例来计算输入信息的TF-IDF权重��;

from sklearn.feature_extraction.text import TfidfVectorizer
vectorizer=TfidfVectorizer()
X_train=vectorizer.fit_transform(X_train_raw)
X_test=vectorizer.transform(X_test_raw)

建立`LogisticRegression`分类器，来训练`fit()`和预测`predict()`模型；

from sklearn.linear_model import LogisticRegression
classifer=LogisticRegression()
classifer.fit(X_train,y_train)
predictions = classifer.predict(X_test)
for i,prediction in enumerate(predictions[-10:]):
 print('predict-tpye=\t %s. message=\t %s.'%(prediction,X_test_raw.iloc[i]))

将`y_test`和`predictions`转化为0、1组成的list；

y_test_binary=[0]*y_test.shape[0]
predictions_binary=[0]*predictions.shape[0]
for ind,val in enumerate(y_test):
 if val=='spam':
     y_test_binary[ind]=1

for ind,val in enumerate(predictions):
 if val=='spam':
     predictions_binary[ind]=1
print(y_test[-10:])
print(predictions[-10:])
print(y_test_binary[-10:])
print(predictions_binary[-10:])

计算出confusion_matrix，输出并绘图

from sklearn.metrics import confusion_matrix
%matplotlib inline
import matplotlib.pyplot as plt
cf_mtx=confusion_matrix(y_test_binary,predictions_binary)
print(cf_mtx)
plt.matshow(cf_mtx);\
plt.title('confusion matrix(spam=1)');\
plt.colorbar();\
plt.ylabel('actual type');\
plt.xlabel('predict type');\
plt.show()

计算模型预测的准确率`accuracy_score`,精确率`precision_score`,召回率`recall_score`,综合评价指标`f1_score`

from sklearn.metrics import accuracy_score,precision_score,recall_score,f1_score
print('accuracy=\t',accuracy_score(y_test_binary,predictions_binary));\
print('precision_score=\t',precision_score(y_test_binary,predictions_binary));\
print('recall_score=\t',recall_score(y_test_binary,predictions_binary));\
print('f1_score=\t',f1_score(y_test_binary,predictions_binary));\
'''
accuracy=        0.969849246231
precision_score=         0.984375
recall_score=    0.759036144578
f1_score=        0.857142857143
'''

计算模型交叉检验时的准确率`accuracy_score`,精确率`precision_score`,召回率`recall_score`,综合评价指标`f1_score`


#restart kernel ctrl+.

import numpy as np
import pandas as pd
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model.logistic import LogisticRegression
from sklearn.cross_validation import train_test_split,cross_val_score
df=pd.read_csv('Desktop/data/sms.csv')
X_train_raw,X_test_raw,y_train,y_test=train_test_split(df['message'],df['label'])
vectorizer=TfidfVectorizer()
X_train=vectorizer.fit_transform(X_train_raw)
X_test=vectorizer.transform(X_test_raw)
classifier=LogisticRegression()
classifier.fit(X_train,y_train)
accuracy_score=cross_val_score(classifier, X_train, y_train, cv=5)
precision_score = cross_val_score(classifier, X_train, y_train, cv=5, scoring= 'precision')
recall_score = cross_val_score(classifier, X_train, y_train, cv=5, scoring='recall')
f1_score=cross_val_score(classifier, X_train, y_train, cv=5, scoring='f1')
print('accuracy=\t',np.mean(accuracy_score),accuracy_score)
print('precisions=\t',np.mean(precision_score),precision_score)
print('recall=\t',np.mean(recall_score),recall_score)
print('f1=\t',np.mean(f1_score),f1_score)

'''
accuracy=        0.955502340314 [ 0.96535245  0.94384707  0.95933014  0.9497006   0.95928144]
precisions=      0.989871815161 [ 0.97752809  0.97183099  1.          1.          1.        ]
recall=  0.67899394504 [ 0.76315789  0.60526316  0.69911504  0.62831858  0.69911504]
f1=      0.804132253371 [ 0.85714286  0.74594595  0.82291667  0.77173913  0.82291667]
'''

计算ROC和AUC，并绘图

import matplotlib.pyplot as plt
from sklearn.metrics import roc_curve,auc
%matplotlib inline

predictions=classifier.predict_proba(X_test)
false_positive_rate,recall,thresholds=roc_curve(y_test,predictions[:,1])
roc_auc=auc(false_positive_rate,recall)
plt.title('Reciver Operating Characteristic');\
plt.plot(false_positive_rate,recall,'r',label='AUC=%0.2f' %roc_auc);\
plt.legend(loc='lower right')
plt.plot([0,1],[0,1],'k--');\
plt.xlim([0.0,1.0]);\
plt.ylim([0.0,1.0]);\
plt.ylabel('Recall');\
plt.xlabel('Fall-out');\
plt.show()

使用GridSearchCV()确定最优超参数

#####载入数据，分成训练集和测试集


#RESTART KERNEL

import pandas as pd
from sklearn.cross_validation import train_test_split
df=pd.read_csv('Desktop/data/sms.csv')
X,y=df['message'],df['label']
X_train,X_test,y_train,y_test=train_test_split(X,y)

设置`GridSearchCV`参数，求最优参数

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model.logistic import LogisticRegression
from sklearn.grid_search import GridSearchCV
from sklearn.pipeline import Pipeline
pipeline = Pipeline([ ('vect', TfidfVectorizer(stop_words='english')), ('clf', LogisticRegression())])
parameters = {'vect__max_df': (0.25, 0.5, 0.75), 'vect__stop_words': ('english', None), 'vect__max_features': (2500, 5000, 10000, None), 'vect__ngram_range': ((1, 1), (1, 2)), 'vect__use_idf': (True, False),'vect__norm': ('l1', 'l2'),'clf__penalty': ('l1', 'l2'),'clf__C': (0.01, 0.1, 1, 10),}
grid_search = GridSearchCV(pipeline, parameters, n_jobs=-1, verbose=1, scoring='accuracy', cv=3)
grid_search.fit(X_train, y_train)
'''output:
Fitting 3 folds for each of 1536 candidates, totalling 4608 fits
[Parallel(n_jobs=-1)]: Done  52 tasks      | elapsed:    1.7s
[Parallel(n_jobs=-1)]: Done 352 tasks      | elapsed:   11.2s
[Parallel(n_jobs=-1)]: Done 852 tasks      | elapsed:   32.1s
[Parallel(n_jobs=-1)]: Done 1552 tasks      | elapsed:  1.0min
[Parallel(n_jobs=-1)]: Done 2156 tasks      | elapsed:  1.5min
[Parallel(n_jobs=-1)]: Done 2706 tasks      | elapsed:  1.9min
[Parallel(n_jobs=-1)]: Done 3356 tasks      | elapsed:  2.4min
[Parallel(n_jobs=-1)]: Done 4106 tasks      | elapsed:  4.1min
[Parallel(n_jobs=-1)]: Done 4608 out of 4608 | elapsed:  4.6min finished
'''

输出参数组合、精确率、准确率、召回率

print('best-accuracy=\t',grid_search.best_score_);
print('best paras combination');
best_paras=grid_search.best_estimator_.get_params();
for para_name in sorted(parameters.keys()):
    print('\t%s=\t%r'%(para_name,best_paras[para_name]))
predictions=grid_search.predict(X_test)
print('accuracy=',accuracy_score(y_test,predictions))
print('precision=',precision_score(y_test,predictions))
print('recall=',recall_score(y_test,predictions))
'''
best-accuracy=   0.984210526316
best paras combination
    clf__C= 10
    clf__penalty=   'l2'
    vect__max_df=   0.25
    vect__max_features=     None
    vect__ngram_range=      (1, 2)
    vect__norm=     'l2'
    vect__stop_words=       None
    vect__use_idf=  True
    accuracy= 0.982065997131
    precision= 0.977272727273
    recall= 0.891191709845
'''

多标签分类

载入数据，预览数据

import pandas as pd
df=pd.read_csv('Desktop/Sentiment Analysis on Movie Reviews/train.tsv',header=0,delimiter='\t')
df.head()
df.count()
df.Phrase.head()
df.Sentiment.describe()
df.Sentiment.value_counts()
df.Sentiment.value_counts()/df.Sentiment.count()

划分训练集和测试集

from sklearn.cross_validation import train_test_split
X,y=df['Phrase'],df['Sentiment'].as_matrix()
X_train,X_test,y_train,y_test=train_test_split(X,y,train_size=0.5)

设置GridSearch参数，并求解

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model.logistic import LogisticRegression
from sklearn.pipeline import Pipeline
from sklearn.grid_search import GridSearchCV
pipeline = Pipeline([('vect', TfidfVectorizer(stop_words='english')),('clf', LogisticRegression())])
paras={'vect__max_df':(0.25,0.5),'vect__ngram_range':((1,1),(1,2)),'vect__use_idf':(True,False),'clf__C':(0.1,1,10)}
 grid_search=GridSearchCV(pipeline,paras,n_jobs=3,verbose=1,scoring='accuracy')
grid_search.fit(X_train,y_train)

输出参数组合

print('best accuracy:=',grid_search.best_score_)
best_paras = grid_search.best_estimator_.get_params()
print('best paras:');
for para_name in sorted(paras.keys()):
  print('\t%s: %r' %(para_name,best_paras[para_name]));

'''
 best accuracy:= 0.619735998975
 best paras:
         clf__C: 10
         vect__max_df: 0.25
         vect__ngram_range: (1, 2)
         vect__use_idf: False
'''

输出多类分类效果评估

from sklearn.metrics import classification_report, accuracy_score,confusion_matrix
predictions=grid_search.predict(X_test)
print('accuracy=',accuracy_score(y_test,predictions));
print('confusion matrix=',confusion_matrix(y_test,predictions))
print('report=',classification_report(y_test,predictions))
 '''
 accuracy= 0.635101883891
 confusion matrix= [[ 1165  1680   682    67    10]
[  894  5990  6175   557    39]
[  199  3219 32596  3611   162]
[   25   424  6562  8117  1248]
[    2    33   502  2382  1689]]
report=              precision    recall  f1-score   support
       0       0.51      0.32      0.40      3604
       1       0.53      0.44      0.48     13655
       2       0.70      0.82      0.76     39787
       3       0.55      0.50      0.52     16376
       4       0.54      0.37      0.44      4608
avg / total       0.62      0.64      0.62     78030
'''

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
数字里的世界17期：2021年全球10大顶级数据中心，中国移动榜首张三叨
你知道吗？2016年，全球的数据中心共计用电4160亿千瓦时，比整个英国的发电量还多40％！前言每天，我们都会创造超过250万TB的数据。并且随着物联网（IOT）的不断普及，这一数据将持续增长。如此庞大的数据被存储在被称为“数据中心”的专用设施中。虽然最早的数据中心建于20世纪40年代，但直到1997-2000年的互联网泡沫期间才逐渐成为主流。当前人类的技术，比如人工智能和机器学习，已经将我们推向
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
简单了解 JVM 记得开心一点啊 jvm
目录♫什么是JVM♫JVM的运行流程♫JVM运行时数据区♪虚拟机栈♪本地方法栈♪堆♪程序计数器♪方法区/元数据区♫类加载的过程♫双亲委派模型♫垃圾回收机制♫什么是JVMJVM是JavaVirtualMachine的简称，意为Java虚拟机。虚拟机是指通过软件模拟的具有完整硬件功能的、运行在一个完全隔离的环境中的完整计算机系统（如：JVM、VMwave、VirtualBox）。JVM和其他两个虚拟机
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
JVM、JRE和 JDK：理解Java开发的三大核心组件 Y雨何时停T Java java
Java是一门跨平台的编程语言，它的成功离不开背后强大的运行环境与开发工具的支持。在Java的生态中，JVM（Java虚拟机）、JRE（Java运行时环境）和JDK（Java开发工具包）是三个至关重要的核心组件。本文将探讨JVM、JDK和JRE的区别，帮助你更好地理解Java的运行机制。1.JVM：Java虚拟机（JavaVirtualMachine）什么是JVM？JVM，即Java虚拟机，是Ja
遥感影像的切片处理 sand&wich 计算机视觉 python 图像处理
在遥感影像分析中，经常需要将大尺寸的影像切分成小片段，以便于进行详细的分析和处理。这种方法特别适用于机器学习和图像处理任务，如对象检测、图像分类等。以下是如何使用Python和OpenCV库来实现这一过程，同时确保每个影像片段保留正确的地理信息。准备环境首先，确保安装了必要的Python库，包括numpy、opencv-python和xml.etree.ElementTree。这些库将用于图像处理
ai绘画工具midjourney怎么下载？附作品管理教程设计师早上好
Midjourney是一款功能强大的AI绘画工具，它使用机器学习技术和深度神经网络等算法，可以生成各种艺术风格的绘画作品。在创意设计、广告宣传等方面有着广泛的应用前景。那么，ai绘画工具midjourney怎么下载？本文将为您介绍Midjourney的下载以及作品的相关管理。一、Midjourney下载Midjourney的下载非常简单，只需打开Midjourney官网（点击“GetMidjour
[实践应用] 深度学习之模型性能评估指标 YuanDaima2048 深度学习工具使用深度学习人工智能损失函数性能评估 pytorch python 机器学习
文章总览：YuanDaiMa2048博客文章总览深度学习之模型性能评估指标分类任务回归任务排序任务聚类任务生成任务其他介绍在机器学习和深度学习领域，评估模型性能是一项至关重要的任务。不同的学习任务需要不同的性能指标来衡量模型的有效性。以下是对一些常见任务及其相应的性能评估指标的详细解释和总结。分类任务分类任务是指模型需要将输入数据分配到预定义的类别或标签中。以下是分类任务中常用的性能指标：准确率(
机器学习-聚类算法不良人龍木木机器学习机器学习算法聚类
机器学习-聚类算法1.AHC2.K-means3.SC4.MCL仅个人笔记，感谢点赞关注！1.AHC2.K-means3.SC传统谱聚类：个人对谱聚类算法的理解以及改进4.MCL目前仅专注于NLP的技术学习和分享感谢大家的关注与支持！
深度 Qlearning：在直播推荐系统中的应用 AGI通用人工智能之禅程序员提升自我硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
深度Q-learning：在直播推荐系统中的应用关键词：深度Q-learning,强化学习,直播推荐系统,个性化推荐1.背景介绍1.1问题的由来随着互联网技术的飞速发展,直播平台如雨后春笋般涌现。面对海量的直播内容,用户很难快速找到自己感兴趣的内容。因此,个性化推荐系统在直播平台中扮演着越来越重要的角色。1.2研究现状目前,主流的个性化推荐算法包括协同过滤、基于内容的推荐等。这些方法在一定程度上缓
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
python中zeros用法_Python中的numpy.zeros()用法江平舟 python中zeros用法
numpy.zeros()函数是最重要的函数之一,广泛用于机器学习程序中。此函数用于生成包含零的数组。numpy.zeros()函数提供给定形状和类型的新数组,并用零填充。句法numpy.zeros(shape,dtype=float,order='C'参数形状：整数或整数元组此参数用于定义数组的尺寸。此参数用于我们要在其中创建数组的形状,例如(3,2)或2。dtype：数据类型(可选)此参数用于
【NumPy】深入解析numpy.zeros()函数二七830 numpy
欢迎莅临我的个人主页这里是我深耕Python编程、机器学习和自然语言处理（NLP）领域，并乐于分享知识与经验的小天地！博主简介：我是二七830，一名对技术充满热情的探索者。多年的Python编程和机器学习实践，使我深入理解了这些技术的核心原理，并能够在实际项目中灵活应用。尤其是在NLP领域，我积累了丰富的经验，能够处理各种复杂的自然语言任务。技术专长：我熟练掌握Python编程语言，并深入研究了机
【中国国际航空-注册_登录安全分析报告】风控牛验证码接口安全评测系列安全行为验证极验网易易盾智能手机
前言由于网站注册入口容易被黑客攻击，存在如下安全问题：1.暴力破解密码，造成用户信息泄露2.短信盗刷的安全问题，影响业务及导致用户投诉3.带来经济损失，尤其是后付费客户，风险巨大，造成亏损无底洞所以大部分网站及App都采取图形验证码或滑动验证码等交互解决方案，但在机器学习能力提高的当下，连百度这样的大厂都遭受攻击导致点名批评，图形验证及交互验证方式的安全性到底如何？请看具体分析一、中国国际航空PC
机器学习流形数据降维：UMAP 降维算法小嗷犬 Python 机器学习 #数据分析及可视化机器学习算法人工智能
✅作者简介：人工智能专业本科在读，喜欢计算机与编程，写博客记录自己的学习历程。个人主页：小嗷犬的个人主页个人网站：小嗷犬的技术小站个人信条：为天地立心，为生民立命，为往圣继绝学，为万世开太平。本文目录UMAP简介理论基础特点与优势应用场景在Python中使用UMAP安装umap-learn库使用UMAP可视化手写数字数据集UMAP简介UMAP（UniformManifoldApproximatio
七.正则化愿风去了
吴恩达机器学习之正则化（Regularization）http://www.cnblogs.com/jianxinzhou/p/4083921.html从数学公式上理解L1和L2https://blog.csdn.net/b876144622/article/details/81276818虽然在线性回归中加入基函数会使模型更加灵活，但是很容易引起数据的过拟合。例如将数据投影到30维的基函数上，模
管理员权限的软件不能开机自启动的解决方法 ss_ctrl
这是几种解决方法：1.将启动参数写入到32位注册表里面去在64位系统下我们64位的程序访问此HKEY_LOCAL_MACHINE\SOFTWARE\Microsoft\Windows\CurrentVersion\Run注册表路径，是可以正确访问的，32位程序访问此注册表路径时，默认会被系统自动映射到HKEY_LOCAL_MACHINE\SOFTWARE\WOW6432Node\Microsoft
机器学习-------数据标准化罔闻_spider 数据分析算法机器学习人工智能
什么是归一化，它与标准化的区别是什么？一作用在做训练时，需要先将特征值与标签标准化，可以防止梯度防炸和过拟合；将标签标准化后，网络预测出的数据是符合标准正态分布的—StandarScaler()，与真实值有很大差别。因为StandarScaler()对数据的处理是（真实值-平均值）/标准差。同时在做预测时需要将输出数据逆标准化提升模型精度：标准化/归一化使不同维度的特征在数值上更具比较性，提高分类
golang学习笔记--MPG模型 xxzed golang #学习笔记学习笔记 golang
MPG模式：M（Machine）：操作系统的主线程P（Processor）：协程执行需要的资源（上下文context），可以看作一个局部的调度器，使go代码在一个线程上跑，他是实现从N：1到N：M映射的关键G（Goroutine）：协程，有自己的栈。包含指令指针（instructionpointer）和其它信息（正在等待的channel等等），用于调度。一个P下面可以有多个G1、当前程序有三个M,
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
两种方法判断Python的位数是32位还是64位 sanqima Python编程电脑 python 开发语言
Python从1991年发布以来，凭借其简洁、清晰、易读的语法、丰富的标准库和第三方工具，在Web开发、自动化测试、人工智能、图形识别、机器学习等领域发展迅猛。 Python是一种胶水语言，通过Cython库与C/C++语言进行链接，通过Jython库与Java语言进行链接。 Python是跨平台的，可运行在多种操作系统上，包括但不限于Windows、Linux和macOS。这意味着用Py
使用最大边际相关性(MMR)选择示例：提高AI模型的多样性和相关性 aehrutktrjk 人工智能 easyui 前端 python
使用最大边际相关性(MMR)选择示例：提高AI模型的多样性和相关性引言在机器学习和自然语言处理领域，选择合适的训练示例对模型性能至关重要。最大边际相关性(MaximalMarginalRelevance,MMR)是一种优秀的示例选择方法，它不仅考虑了示例与输入的相关性，还注重保持所选示例之间的多样性。本文将深入探讨如何使用MMR来选择示例，以提高AI模型的性能和泛化能力。什么是最大边际相关性(MM
LangChain集成指南:如何利用多样化的AI提供商 aehrutktrjk 人工智能 langchain python
LangChain集成指南:如何利用多样化的AI提供商引言在人工智能和机器学习领域,LangChain已成为一个强大而灵活的框架,允许开发者轻松集成各种AI服务提供商。本文将深入探讨LangChain的集成能力,介绍如何利用不同的AI提供商来增强你的应用程序,并提供实用的代码示例。LangChain集成概览LangChain支持多种AI提供商的集成,这些集成可以分为两类:独立包集成:这些提供商有独
【开发环境搭建】Macbook M1搭建Java开发环境 weixin_44329069 java 开发语言
JDK安装与配置下载并安装JDK：ARM64DMG安装包下载链接：JDK21forMac(ARM64)。双击下载的DMG文件，按照提示安装JDK。配置环境变量：打开终端，使用vim编辑.bash_profile文件：vim~/.bash_profile在文件中添加以下内容来设置JAVA_HOME：exportJAVA_HOME=/Library/Java/JavaVirtualMachines/j
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
机器学习VS深度学习 nfgo 机器学习
机器学习（MachineLearning,ML）和深度学习（DeepLearning,DL）是人工智能（AI）的两个子领域，它们有许多相似之处，但在技术实现和应用范围上也有显著区别。下面从几个方面对两者进行区分：1.概念层面机器学习：是让计算机通过算法从数据中自动学习和改进的技术。它依赖于手动设计的特征和数学模型来进行学习，常用的模型有决策树、支持向量机、线性回归等。深度学习：是机器学习的一个子领
ResNet的半监督和半弱监督模型 Valar_Morghulis
Billion-scalesemi-supervisedlearningforimageclassificationhttps://arxiv.org/pdf/1905.00546.pdfhttps://github.com/facebookresearch/semi-supervised-ImageNet1K-models/权重在timm中也有：https://hub.fastgit.org/r
联邦学习 Federated learning Google I/O‘19 笔记努力搬砖的星期五笔记联邦学习机器学习机器学习 tensorflow
FederatedLearning:MachineLearningonDecentralizeddatahttps://www.youtube.com/watch?v=89BGjQYA0uE文章目录FederatedLearning:MachineLearningonDecentralizeddata1.DecentralizeddataEdgedevicesGboard:mobilekeyboa
数据采集高并发的架构应用 3golden .net
问题的出发点：最近公司为了发展需要，要扩大对用户的信息采集，每个用户的采集量估计约2W。如果用户量增加的话，将会大量照成采集量成3W倍的增长，但是又要满足日常业务需要，特别是指令要及时得到响应的频率次数远大于预期。 &n
不停止 MySQL 服务增加从库的两种方式 brotherlamp linux linux视频 linux资料 linux教程 linux自学
现在生产环境MySQL数据库是一主一从，由于业务量访问不断增大，故再增加一台从库。前提是不能影响线上业务使用，也就是说不能重启MySQL服务，为了避免出现其他情况，选择在网站访问量低峰期时间段操作。一般在线增加从库有两种方式，一种是通过mysqldump备份主库，恢复到从库，mysqldump是逻辑备份，数据量大时，备份速度会很慢，锁表的时间也会很长。另一种是通过xtrabacku
Quartz——SimpleTrigger触发器 eksliang SimpleTrigger TriggerUtils quartz
转载请出自出处：http://eksliang.iteye.com/blog/2208166 一.概述 SimpleTrigger触发器，当且仅需触发一次或者以固定时间间隔周期触发执行；二.SimpleTrigger的构造函数 SimpleTrigger(String name, String group)：通过该构造函数指定Trigger所属组和名称； Simpl
Informatica应用（1） 18289753290 sql workflow lookup 组件 Informatica
1.如果要在workflow中调用shell脚本有一个command组件，在里面设置shell的路径；调度wf可以右键出现schedule，现在用的是HP的tidal调度wf的执行。 2.designer里面的router类似于SSIS中的broadcast（多播组件）;Reset_Workflow_Var：参数重置（比如说我这个参数初始是1在workflow跑得过程中变成了3我要在结束时还要
python 获取图片验证码中文字酷的飞上天空 python
根据现成的开源项目 http://code.google.com/p/pytesser/改写在window上用easy_install安装不上看了下源码发现代码很少于是就想自己改写一下添加支持网络图片的直接解析 #coding:utf-8 #import sys #reload(sys) #sys.s
AJAX 永夜-极光 Ajax
1.AJAX功能:动态更新页面,减少流量消耗,减轻服务器负担 2.代码结构: <html> <head> <script type="text/javascript"> function loadXMLDoc() { .... AJAX script goes here ...
创业OR读研随便小屋创业
现在研一，有种想创业的想法，不知道该不该去实施。因为对于的我情况这两者是矛盾的，可能就是鱼与熊掌不能兼得。研一的生活刚刚过去两个月，我们学校主要的是
需求做得好与坏直接关系着程序员生活质量 aijuans IT 生活
这个故事还得从去年换工作的事情说起，由于自己不太喜欢第一家公司的环境我选择了换一份工作。去年九月份我入职现在的这家公司，专门从事金融业内软件的开发。十一月份我们整个项目组前往北京做现场开发，从此苦逼的日子开始了。系统背景：五月份就有同事前往甲方了解需求一直到6月份，后续几个月也完
如何定义和区分高级软件开发工程师 aoyouzi
在软件开发领域，高级开发工程师通常是指那些编写代码超过 3 年的人。这些人可能会被放到领导的位置，但经常会产生非常糟糕的结果。Matt Briggs 是一名高级开发工程师兼 Scrum 管理员。他认为，单纯使用年限来划分开发人员存在问题，两个同样具有 10 年开发经验的开发人员可能大不相同。近日，他发表了一篇博文，根据开发者所能发挥的作用划分软件开发工程师的成长阶段。　　初
Servlet的请求与响应百合不是茶 servlet get提交 java处理post提交
Servlet是tomcat中的一个重要组成,也是负责客户端和服务端的中介 1,Http的请求方式(get ,post); 客户端的请求一般都会都是Servlet来接受的,在接收之前怎么来确定是那种方式提交的,以及如何反馈,Servlet中有相应的方法, http的get方式 servlet就是都doGet(
web.xml配置详解之listener bijian1013 java web.xml listener
一.定义 <listener> <listen-class>com.myapp.MyListener</listen-class> </listener> 二.作用该元素用来注册一个监听器类。可以收到事件什么时候发生以及用什么作为响
Web页面性能优化（yahoo技术） Bill_chen JavaScript Ajax Web css Yahoo
1.尽可能的减少HTTP请求数 content 2.使用CDN server 3.添加Expires头(或者 Cache-control) server 4.Gzip 组件 server 5.把CSS样式放在页面的上方。 css 6.将脚本放在底部(包括内联的) javascript 7.避免在CSS中使用Expressions css 8.将javascript和css独立成外部文
【MongoDB学习笔记八】MongoDB游标、分页查询、查询结果排序 bit1129 mongodb
游标游标，简单的说就是一个查询结果的指针。游标作为数据库的一个对象，使用它是包括声明打开循环抓去一定数目的文档直到结果集中的所有文档已经抓取完关闭游标游标的基本用法，类似于JDBC的ResultSet(hasNext判断是否抓去完,next移动游标到下一条文档)，在获取一个文档集时，可以提供一个类似JDBC的FetchSize
ORA-12514 TNS 监听程序当前无法识别连接描述符中请求服务的解决方法白糖_ ORA-12514
今天通过Oracle SQL*Plus连接远端服务器的时候提示“监听程序当前无法识别连接描述符中请求服务”，遂在网上找到了解决方案： ①打开Oracle服务器安装目录\NETWORK\ADMIN\listener.ora文件，你会看到如下信息： # listener.ora Network Configuration File: D:\database\Oracle\net
Eclipse 问题 A resource exists with a different case bozch eclipse
在使用Eclipse进行开发的时候，出现了如下的问题： Description Resource Path Location TypeThe project was not built due to "A resource exists with a different case: '/SeenTaoImp_zhV2/bin/seentao'.&
编程之美-小飞的电梯调度算法 bylijinnan 编程之美
public class AptElevator { /** * 编程之美小飞电梯调度算法 * 在繁忙的时间，每次电梯从一层往上走时，我们只允许电梯停在其中的某一层。 * 所有乘客都从一楼上电梯，到达某层楼后，电梯听下来，所有乘客再从这里爬楼梯到自己的目的层。 * 在一楼时，每个乘客选择自己的目的层，电梯则自动计算出应停的楼层。 * 问：电梯停在哪
SQL注入相关概念 chenbowen00 sql Web 安全
SQL Injection：就是通过把SQL命令插入到Web表单递交或输入域名或页面请求的查询字符串，最终达到欺骗服务器执行恶意的SQL命令。具体来说，它是利用现有应用程序，将（恶意）的SQL命令注入到后台数据库引擎执行的能力，它可以通过在Web表单中输入（恶意）SQL语句得到一个存在安全漏洞的网站上的数据库，而不是按照设计者意图去执行SQL语句。首先让我们了解什么时候可能发生SQ
[光与电]光子信号战防御原理 comsci 原理
无论是在战场上,还是在后方,敌人都有可能用光子信号对人体进行控制和攻击,那么采取什么样的防御方法,最简单,最有效呢? 我们这里有几个山寨的办法,可能有些作用,大家如果有兴趣可以去实验一下根据光
oracle 11g新特性:Pending Statistics daizj oracle dbms_stats
oracle 11g新特性:Pending Statistics 转从11g开始，表与索引的统计信息收集完毕后，可以选择收集的统信息立即发布，也可以选择使新收集的统计信息处于pending状态，待确定处于pending状态的统计信息是安全的，再使处于pending状态的统计信息发布，这样就会避免一些因为收集统计信息立即发布而导致SQL执行计划走错的灾难。在 11g 之前的版本中，D
快速理解RequireJs dengkane jquery requirejs
RequireJs已经流行很久了，我们在项目中也打算使用它。它提供了以下功能：声明不同js文件之间的依赖可以按需、并行、延时载入js库可以让我们的代码以模块化的方式组织初看起来并不复杂。在html中引入requirejs 在HTML中，添加这样的 <script> 标签： <script src="/path/to
C语言学习四流程控制if条件选择、for循环和强制类型转换 dcj3sjt126com c
# include <stdio.h> int main(void) { int i, j; scanf("%d %d", &i, &j); if (i > j) printf("i大于j\n"); else printf("i小于j\n"); retu
dictionary的使用要注意 dcj3sjt126com IO
NSDictionary *dict = [NSDictionary dictionaryWithObjectsAndKeys: user.user_id , @"id", user.username , @"username",
Android 中的资源访问(Resource) finally_m xml android String drawable color
简单的说，Android中的资源是指非代码部分。例如，在我们的Android程序中要使用一些图片来设置界面，要使用一些音频文件来设置铃声，要使用一些动画来显示特效，要使用一些字符串来显示提示信息。那么，这些图片、音频、动画和字符串等叫做Android中的资源文件。在Eclipse创建的工程中，我们可以看到res和assets两个文件夹，是用来保存资源文件的，在assets中保存的一般是原生
Spring使用Cache、整合Ehcache 234390216 spring cache ehcache @Cacheable
Spring使用Cache 从3.1开始，Spring引入了对Cache的支持。其使用方法和原理都类似于Spring对事务管理的支持。Spring Cache是作用在方法上的，其核心思想是这样的：当我们在调用一个缓存方法时会把该方法参数和返回结果作为一个键值对存放在缓存中，等到下次利用同样的
当druid遇上oracle blob(clob) jackyrong oracle
http://blog.csdn.net/renfufei/article/details/44887371 众所周知，Oracle有很多坑, 所以才有了去IOE。在使用Druid做数据库连接池后，其实偶尔也会碰到小坑，这就是使用开源项目所必须去填平的。【如果使用不开源的产品，那就不是坑，而是陷阱了，你都不知道怎么去填坑】用Druid连接池，通过JDBC往Oracle数据库的
easyui datagrid pagination获得分页页码、总页数等信息 ldzyz007
var grid = $('#datagrid'); var options = grid.datagrid('getPager').data("pagination").options; var curr = options.pageNumber; var total = options.total; var max =
浅析awk里的数组 nigelzeng 二维数组 array 数组 awk
awk绝对是文本处理中的神器，它本身也是一门编程语言，还有许多功能本人没有使用到。这篇文章就单单针对awk里的数组来进行讨论，如何利用数组来帮助完成文本分析。有这么一组数据： abcd,91#31#2012-12-31 11:24:00 case_a,136#19#2012-12-31 11:24:00 case_a,136#23#2012-12-31 1
搭建 CentOS 6 服务器(6) - TigerVNC rensanning centos
安装GNOME桌面环境 # yum groupinstall "X Window System" "Desktop" 安装TigerVNC # yum -y install tigervnc-server tigervnc 启动VNC服务 # /etc/init.d/vncserver restart # vncser
Spring 数据库连接整理 tomcat_oracle spring bean jdbc
1、数据库连接jdbc.properties配置详解　　jdbc.url=jdbc:hsqldb:hsql://localhost/xdb 　　jdbc.username=sa 　　jdbc.password= 　　jdbc.driver=不同的数据库厂商驱动，此处不一一列举　　接下来，详细配置代码如下：　　 Spring连接池
Dom4J解析使用xpath java.lang.NoClassDefFoundError: org/jaxen/JaxenException异常 xp9802
用Dom4J解析xml,以前没注意,今天使用dom4j包解析xml时在xpath使用处报错异常栈：java.lang.NoClassDefFoundError: org/jaxen/JaxenException异常导入包 jaxen-1.1-beta-6.jar 解决; &nb

逻辑回归

<机器学习笔记-04 >逻辑回归

知识要点总结

掌握概念：分类任务（二元分类、多类分类、多标签分类）

理解：广义线性回归概念，以及逻辑回归属于线性模型的原因；

理解分类评估方法：准确率、精确率、召回率、误警率、综合评价指标、ROC-AUC值、混淆矩阵、汉明损失函数，杰卡德相似度；

掌握使用python，针对二元分类和多类分类，训练逻辑回归模型，预测结果，对结果进行评价（各类分类评估方法）；会使用GridSearch方法进行优化求解；

基本概念与理论分析

逻辑回归被认为是线性模型的原因（参考周志华《机器学习》）：

线性模型（linear model）试图用线性组合进行预测的函数，即

用向量形式写为

从逻辑函数可以推导得到

即：

概率关系可以用一组线性参数表示出来；

二元分类的效果评估方法

二元分类后样本的可能结果：结果预测正确为真，否则为假；

真阳性TP（true positives）

真阴性TN（true negatives）

假阴性FP（false positives）

假阳性FN（false negatives）

准确率（accuracy）：预测为真的样本与总体样本之比；

精确率（precision）：真阳性的样本与阳性样本之比；

召回率（recall）：真阳性样本与实际为阳性样本（真阳性+假阴性）之比；

误警率（fall-out）：=假阳性率；所有隐形样本中分类器识别为阳性的样本所占比例；

综合评价指标（F1 measure）：精确率与召回率的调和均值（harmonic mean）;

ROC值（receiver operating characteristic）:画的是分类器的召回率（Y轴）与误警率（X轴）的曲线；

AUC值（area under curve）：ROC曲线下方的面积，表示分类器随机预测的效果；

混淆矩阵（confusion matrix）：也叫列联表分析（contingency table），用来描述真假与阴阳的关系；矩阵的行表示实际类型，列表示预测类型；

网格搜索方法（Grid Search）：

用来确定最有超参数的方法；选取可能参数不断运行获取最有效果；

使用穷举法，计算量巨大；

多类分类：用one-vs-all或者one-vs-the-rest方法实现多类分类，就是把多类中的每个类都作为二元分类处理；分类器预测样本不同类型，将具有最大置信水平的类型作为样本类型；

多标签分类：每个标签用二元分类处理，每个标签的分类器都预测样本是否属于该标签；

多标签分类效果评估方法：汉明损失函数（Hamming loss）和杰卡德相似度（Jaccard similarity）；

汉明损失函数：表示错误标签的平均比例；是一个函数，当预测全部正确时，值为零；

杰卡德相似度：预测标签和真实标签的交集数量除以预测标签和真实标签的并集数量，值在{0，1}之间；

Python编程积累

Python基本命令

print输出文字+数字的三种方法：{}、%d和，

将spam/ham元素的array和list转化为0/1元素的list

Matplotlib库

将confusion_matrix绘制成matshow()，添加colorbar（）

添加label

Numpy库

将区间划分arange和linsapce，前者是从起点按照给定步长进行划分，只有当终点也在步长整数倍时才会被包含在内；后者是将起点和终点中间等距划分，终点位最后一位数；

Pandas库

==统计某列含某个值的数量

skilearn库

train_size改变训练集和测试集的比例

使用TfdifVectorizer计算TF-IDF权重

使用LogisticRegression分类器进行训练和分类

Python实例代码整理（来自课程中代码或者）

二元分类

本实例为垃圾邮件分类：数据来自UCI Machine Learning Repository 的短信垃圾分类数据集��SMS Spam Classification Data Set��；

使用pandas库加载.csv文件，并做描述性统计

使用scikit-learn的train_test_split分成训练集（75%）和测试集（25%）

建立TfidfVectorizer实例来计算输入信息的TF-IDF权重��;

建立LogisticRegression分类器，来训练fit()和预测predict()模型；

将y_test和predictions转化为0、1组成的list；

计算出confusion_matrix，输出并绘图

计算模型预测的准确率accuracy_score,精确率precision_score,召回率recall_score,综合评价指标f1_score

计算模型交叉检验时的准确率accuracy_score,精确率precision_score,召回率recall_score,综合评价指标f1_score

计算ROC和AUC，并绘图

使用GridSearchCV()确定最优超参数

设置GridSearchCV参数，求最优参数

输出参数组合、精确率、准确率、召回率

多标签分类

载入数据，预览数据

划分训练集和测试集

设置GridSearch参数，并求解

输出参数组合

输出多类分类效果评估

你可能感兴趣的:(机器学习,machine,learning)

`print`输出文字+数字的三种方法：`{}`、`%d`和`，`

`Matplotlib`库

将`confusion_matrix`绘制成`matshow()`，添加`colorbar（）`

`Numpy`库

将区间划分`arange`和`linsapce`，前者是从起点按照给定步长进行划分，只有当终点也在步长整数倍时才会被包含在内；后者是将起点和终点中间等距划分，终点位最后一位数；

`Pandas`库

`==`统计某列含某个值的数量

`skilearn`库

`train_size`改变训练集和测试集的比例

使用`TfdifVectorizer`计算TF-IDF权重

使用`LogisticRegression`分类器进行训练和分类

使用scikit-learn的`train_test_split`分成训练集（75%）和测试集（25%）

建立`TfidfVectorizer`实例来计算输入信息的TF-IDF权重��;

建立`LogisticRegression`分类器，来训练`fit()`和预测`predict()`模型；

将`y_test`和`predictions`转化为0、1组成的list；

计算模型预测的准确率`accuracy_score`,精确率`precision_score`,召回率`recall_score`,综合评价指标`f1_score`

计算模型交叉检验时的准确率`accuracy_score`,精确率`precision_score`,召回率`recall_score`,综合评价指标`f1_score`

设置`GridSearchCV`参数，求最优参数