HJZ11

机器学习项目-垃圾邮件分类-KNN-SVM-DT-RF-GBDT-Bayes

文章目录

1.读取文件
2.数据预处理
3.模型训练预测

3.1 KNN
3.2 SVM
3.3 Decision Tree
3.4 Random forest
3.5 GBDT
3.6 Bayes

4.算法模型对比
5.总结

1.读取文件

#-*-coding:utf-8 -*-
import os

#读取文件索引，把spam ../data/000/000 改为 000/000  1
def read_index_file(file_path):
    type_dict = {"spam": "1", "ham": "0"}
    index_file = open(file_path) #../date/full/index
    index_dict = {}
    try:
        for line in index_file:
            arr = line.split(" ")#spam ../data/000/000
            if len(arr) == 2:
                key, value = arr
            # 添加到字段中
            value = value.replace("../data", "").replace("\n", "")
            index_dict[value] = type_dict[key.lower()]  #000/000  1, 000/001  0
    finally:
        index_file.close()

    return index_dict

# 邮件的文件内容数据读取，return content_dict，From:xxxxxxTo:xxxxxxxDate:xxxxxxxContent:xxxxxxx
def read_file(file_path):
    file = open(file_path, "r", encoding="gb2312", errors='ignore')
    content_dict = {}

    try:
        is_content = False#初始化为False后，在循环之外
        for line in file:
            line = line.strip()
            if line.startswith("From:"):
                content_dict['from'] = line[5:]  # From: "pan" 
            elif line.startswith("To:"):
                content_dict['to'] = line[3:]  #To: [email protected]
            elif line.startswith("Date:"):
                content_dict['date'] = line[5:]  #Date: Sun, 14 Aug 2005 10:16:47 +0800
            elif not line:
                is_content = True

            # 处理邮件内容
            if is_content:
                if 'content' in content_dict:
                    content_dict['content'] += line
                else:
                    content_dict['content'] = line
    finally:
        file.close()
        
    return content_dict

# 邮件数据处理，return result_str，"yan"<(8月27-28上海)培训课程>,[email protected],Tue 30 Aug 2005 10:08:15 +0800,非财务。。。
def process_file(file_path):
    content_dict = read_file(file_path)

    # 进行处理
    result_str = content_dict.get('from', 'unkown').replace(',', '').strip() + ","
    result_str += content_dict.get('to', 'unknown').replace(',', '').strip() + ","
    result_str += content_dict.get('date', 'unknown').replace(',', '').strip() + ","
    result_str += content_dict.get('content', 'unknown').replace(',', ' ').strip()
    return result_str
    
#使用函数开始数据处理
index_dict = read_index_file('./data/trec06c/full/index')
# print(index_dict)
list0-215 = os.listdir('./data/trec06c/data-0-215')#list[000,001,002....215]文件夹 D:\hjz-py\Project\垃圾邮件过滤课件及数据\Spam-sorting\data\trec06c\data-0-215

# 第一步，首先把每个文件夹中的邮件内容写入一个csv文件，得到 215个文件
#开始把N个文件夹中的file写入N*n个wiriter，'./data/process01_XXX'
for l1 in list0-215: #开始把N个文件夹中的file写入N*n个wiriter
    l1_path = './data/trec06c/data-0-215'+"/" + l1  #000单个文件夹
    print('开始处理文件夹' + l1_path)
    list1 = os.listdir(l1_path)
     
    # write_file_path = './data/process01_' + l1
    write_file_path = './data/process01_' + l1
     
    with open(write_file_path, "w", encoding= 'utf-8') as writer:
        for l2 in list1:
            l2_path = l1_path + "/" + l2#得到要处理文件的具体路径
             
            index_key = "/" + l1 + "/" + l2
             
            if index_key in index_dict:
                content_str = process_file(l2_path)#遍历调用process_file（），得到1)	From:xxxxxxTo:xxxxxxxDate:xxxxxxxContent: xxxxxxx
                content_str += "," + index_dict[index_key] + "\n"#加上目标标签特征，	From:xxxxxxTo:xxxxxxxDate:xxxxxxxContent: xxxxxxx  1/0
                writer.writelines(content_str)
             
#第二步：把215个文件再合并写入1个csv文件
with open('./data/result_process01', "w", encoding='utf-8') as writer:
    for l1 in list0-215:  #000-215
        file_path= './data/process01_' + l1
        print("开始合并文件：" + file_path)
            
        with open(file_path, encoding = 'utf-8') as file:
            for line in file:
                writer.writelines(line)           
            
            
print(writer)

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/dataProcess.py
开始处理文件夹./data/trec06c/data-0-215/000
开始处理文件夹./data/trec06c/data-0-215/001
开始处理文件夹./data/trec06c/data-0-215/002
开始处理文件夹./data/trec06c/data-0-215/003
开始处理文件夹./data/trec06c/data-0-215/004
开始处理文件夹./data/trec06c/data-0-215/005
开始处理文件夹./data/trec06c/data-0-215/006
开始处理文件夹./data/trec06c/data-0-215/007
开始处理文件夹./data/trec06c/data-0-215/008
开始处理文件夹./data/trec06c/data-0-215/009
开始处理文件夹./data/trec06c/data-0-215/010
开始处理文件夹./data/trec06c/data-0-215/011
开始处理文件夹./data/trec06c/data-0-215/012
开始处理文件夹./data/trec06c/data-0-215/013
开始处理文件夹./data/trec06c/data-0-215/014
开始处理文件夹./data/trec06c/data-0-215/015
开始处理文件夹./data/trec06c/data-0-215/016
开始处理文件夹./data/trec06c/data-0-215/017
开始处理文件夹./data/trec06c/data-0-215/018
开始处理文件夹./data/trec06c/data-0-215/019
开始处理文件夹./data/trec06c/data-0-215/020
开始处理文件夹./data/trec06c/data-0-215/021
开始处理文件夹./data/trec06c/data-0-215/022
开始处理文件夹./data/trec06c/data-0-215/023
开始处理文件夹./data/trec06c/data-0-215/024
开始处理文件夹./data/trec06c/data-0-215/025
开始处理文件夹./data/trec06c/data-0-215/026
开始处理文件夹./data/trec06c/data-0-215/027
开始处理文件夹./data/trec06c/data-0-215/028
开始处理文件夹./data/trec06c/data-0-215/029
开始处理文件夹./data/trec06c/data-0-215/030
开始处理文件夹./data/trec06c/data-0-215/031
开始处理文件夹./data/trec06c/data-0-215/032
开始处理文件夹./data/trec06c/data-0-215/033
开始处理文件夹./data/trec06c/data-0-215/034
开始处理文件夹./data/trec06c/data-0-215/035
开始处理文件夹./data/trec06c/data-0-215/036
开始处理文件夹./data/trec06c/data-0-215/037
开始处理文件夹./data/trec06c/data-0-215/038
开始处理文件夹./data/trec06c/data-0-215/039
开始处理文件夹./data/trec06c/data-0-215/040
开始处理文件夹./data/trec06c/data-0-215/041
开始处理文件夹./data/trec06c/data-0-215/042
开始处理文件夹./data/trec06c/data-0-215/043
开始处理文件夹./data/trec06c/data-0-215/044
开始处理文件夹./data/trec06c/data-0-215/045
开始处理文件夹./data/trec06c/data-0-215/046
开始处理文件夹./data/trec06c/data-0-215/047
开始处理文件夹./data/trec06c/data-0-215/048
开始处理文件夹./data/trec06c/data-0-215/049
开始处理文件夹./data/trec06c/data-0-215/050
开始处理文件夹./data/trec06c/data-0-215/051
开始处理文件夹./data/trec06c/data-0-215/052
开始处理文件夹./data/trec06c/data-0-215/053
开始处理文件夹./data/trec06c/data-0-215/054
开始处理文件夹./data/trec06c/data-0-215/055
开始处理文件夹./data/trec06c/data-0-215/056
开始处理文件夹./data/trec06c/data-0-215/057
开始处理文件夹./data/trec06c/data-0-215/058
开始处理文件夹./data/trec06c/data-0-215/059
开始处理文件夹./data/trec06c/data-0-215/060
开始处理文件夹./data/trec06c/data-0-215/061
开始处理文件夹./data/trec06c/data-0-215/062
开始处理文件夹./data/trec06c/data-0-215/063
开始处理文件夹./data/trec06c/data-0-215/064
开始处理文件夹./data/trec06c/data-0-215/065
开始处理文件夹./data/trec06c/data-0-215/066
开始处理文件夹./data/trec06c/data-0-215/067
开始处理文件夹./data/trec06c/data-0-215/068
开始处理文件夹./data/trec06c/data-0-215/069
开始处理文件夹./data/trec06c/data-0-215/070
开始处理文件夹./data/trec06c/data-0-215/071
开始处理文件夹./data/trec06c/data-0-215/072
开始处理文件夹./data/trec06c/data-0-215/073
开始处理文件夹./data/trec06c/data-0-215/074
开始处理文件夹./data/trec06c/data-0-215/075
开始处理文件夹./data/trec06c/data-0-215/076
开始处理文件夹./data/trec06c/data-0-215/077
开始处理文件夹./data/trec06c/data-0-215/078
开始处理文件夹./data/trec06c/data-0-215/079
开始处理文件夹./data/trec06c/data-0-215/080
开始处理文件夹./data/trec06c/data-0-215/081
开始处理文件夹./data/trec06c/data-0-215/082
开始处理文件夹./data/trec06c/data-0-215/083
开始处理文件夹./data/trec06c/data-0-215/084
开始处理文件夹./data/trec06c/data-0-215/085
开始处理文件夹./data/trec06c/data-0-215/086
开始处理文件夹./data/trec06c/data-0-215/087
开始处理文件夹./data/trec06c/data-0-215/088
开始处理文件夹./data/trec06c/data-0-215/089
开始处理文件夹./data/trec06c/data-0-215/090
开始处理文件夹./data/trec06c/data-0-215/091
开始处理文件夹./data/trec06c/data-0-215/092
开始处理文件夹./data/trec06c/data-0-215/093
开始处理文件夹./data/trec06c/data-0-215/094
开始处理文件夹./data/trec06c/data-0-215/095
开始处理文件夹./data/trec06c/data-0-215/096
开始处理文件夹./data/trec06c/data-0-215/097
开始处理文件夹./data/trec06c/data-0-215/098
开始处理文件夹./data/trec06c/data-0-215/099
开始处理文件夹./data/trec06c/data-0-215/100
开始处理文件夹./data/trec06c/data-0-215/101
开始处理文件夹./data/trec06c/data-0-215/102
开始处理文件夹./data/trec06c/data-0-215/103
开始处理文件夹./data/trec06c/data-0-215/104
开始处理文件夹./data/trec06c/data-0-215/105
开始处理文件夹./data/trec06c/data-0-215/106
开始处理文件夹./data/trec06c/data-0-215/107
开始处理文件夹./data/trec06c/data-0-215/108
开始处理文件夹./data/trec06c/data-0-215/109
开始处理文件夹./data/trec06c/data-0-215/110
开始处理文件夹./data/trec06c/data-0-215/111
开始处理文件夹./data/trec06c/data-0-215/112
开始处理文件夹./data/trec06c/data-0-215/113
开始处理文件夹./data/trec06c/data-0-215/114
开始处理文件夹./data/trec06c/data-0-215/115
开始处理文件夹./data/trec06c/data-0-215/116
开始处理文件夹./data/trec06c/data-0-215/117
开始处理文件夹./data/trec06c/data-0-215/118
开始处理文件夹./data/trec06c/data-0-215/119
开始处理文件夹./data/trec06c/data-0-215/120
开始处理文件夹./data/trec06c/data-0-215/121
开始处理文件夹./data/trec06c/data-0-215/122
开始处理文件夹./data/trec06c/data-0-215/123
开始处理文件夹./data/trec06c/data-0-215/124
开始处理文件夹./data/trec06c/data-0-215/125
开始处理文件夹./data/trec06c/data-0-215/126
开始处理文件夹./data/trec06c/data-0-215/127
开始处理文件夹./data/trec06c/data-0-215/128
开始处理文件夹./data/trec06c/data-0-215/129
开始处理文件夹./data/trec06c/data-0-215/130
开始处理文件夹./data/trec06c/data-0-215/131
开始处理文件夹./data/trec06c/data-0-215/132
开始处理文件夹./data/trec06c/data-0-215/133
开始处理文件夹./data/trec06c/data-0-215/134
开始处理文件夹./data/trec06c/data-0-215/135
开始处理文件夹./data/trec06c/data-0-215/136
开始处理文件夹./data/trec06c/data-0-215/137
开始处理文件夹./data/trec06c/data-0-215/138
开始处理文件夹./data/trec06c/data-0-215/139
开始处理文件夹./data/trec06c/data-0-215/140
开始处理文件夹./data/trec06c/data-0-215/141
开始处理文件夹./data/trec06c/data-0-215/142
开始处理文件夹./data/trec06c/data-0-215/143
开始处理文件夹./data/trec06c/data-0-215/144
开始处理文件夹./data/trec06c/data-0-215/145
开始处理文件夹./data/trec06c/data-0-215/146
开始处理文件夹./data/trec06c/data-0-215/147
开始处理文件夹./data/trec06c/data-0-215/148
开始处理文件夹./data/trec06c/data-0-215/149
开始处理文件夹./data/trec06c/data-0-215/150
开始处理文件夹./data/trec06c/data-0-215/151
开始处理文件夹./data/trec06c/data-0-215/152
开始处理文件夹./data/trec06c/data-0-215/153
开始处理文件夹./data/trec06c/data-0-215/154
开始处理文件夹./data/trec06c/data-0-215/155
开始处理文件夹./data/trec06c/data-0-215/156
开始处理文件夹./data/trec06c/data-0-215/157
开始处理文件夹./data/trec06c/data-0-215/158
开始处理文件夹./data/trec06c/data-0-215/159
开始处理文件夹./data/trec06c/data-0-215/160
开始处理文件夹./data/trec06c/data-0-215/161
开始处理文件夹./data/trec06c/data-0-215/162
开始处理文件夹./data/trec06c/data-0-215/163
开始处理文件夹./data/trec06c/data-0-215/164
开始处理文件夹./data/trec06c/data-0-215/165
开始处理文件夹./data/trec06c/data-0-215/166
开始处理文件夹./data/trec06c/data-0-215/167
开始处理文件夹./data/trec06c/data-0-215/168
开始处理文件夹./data/trec06c/data-0-215/169
开始处理文件夹./data/trec06c/data-0-215/170
开始处理文件夹./data/trec06c/data-0-215/171
开始处理文件夹./data/trec06c/data-0-215/172
开始处理文件夹./data/trec06c/data-0-215/173
开始处理文件夹./data/trec06c/data-0-215/174
开始处理文件夹./data/trec06c/data-0-215/175
开始处理文件夹./data/trec06c/data-0-215/176
开始处理文件夹./data/trec06c/data-0-215/177
开始处理文件夹./data/trec06c/data-0-215/178
开始处理文件夹./data/trec06c/data-0-215/179
开始处理文件夹./data/trec06c/data-0-215/180
开始处理文件夹./data/trec06c/data-0-215/181
开始处理文件夹./data/trec06c/data-0-215/182
开始处理文件夹./data/trec06c/data-0-215/183
开始处理文件夹./data/trec06c/data-0-215/184
开始处理文件夹./data/trec06c/data-0-215/185
开始处理文件夹./data/trec06c/data-0-215/186
开始处理文件夹./data/trec06c/data-0-215/187
开始处理文件夹./data/trec06c/data-0-215/188
开始处理文件夹./data/trec06c/data-0-215/189
开始处理文件夹./data/trec06c/data-0-215/190
开始处理文件夹./data/trec06c/data-0-215/191
开始处理文件夹./data/trec06c/data-0-215/192
开始处理文件夹./data/trec06c/data-0-215/193
开始处理文件夹./data/trec06c/data-0-215/194
开始处理文件夹./data/trec06c/data-0-215/195
开始处理文件夹./data/trec06c/data-0-215/196
开始处理文件夹./data/trec06c/data-0-215/197
开始处理文件夹./data/trec06c/data-0-215/198
开始处理文件夹./data/trec06c/data-0-215/199
开始处理文件夹./data/trec06c/data-0-215/200
开始处理文件夹./data/trec06c/data-0-215/201
开始处理文件夹./data/trec06c/data-0-215/202
开始处理文件夹./data/trec06c/data-0-215/203
开始处理文件夹./data/trec06c/data-0-215/204
开始处理文件夹./data/trec06c/data-0-215/205
开始处理文件夹./data/trec06c/data-0-215/206
开始处理文件夹./data/trec06c/data-0-215/207
开始处理文件夹./data/trec06c/data-0-215/208
开始处理文件夹./data/trec06c/data-0-215/209
开始处理文件夹./data/trec06c/data-0-215/210
开始处理文件夹./data/trec06c/data-0-215/211
开始处理文件夹./data/trec06c/data-0-215/212
开始处理文件夹./data/trec06c/data-0-215/213
开始处理文件夹./data/trec06c/data-0-215/214
开始处理文件夹./data/trec06c/data-0-215/215
开始合并文件：./data/process01_000
开始合并文件：./data/process01_001
开始合并文件：./data/process01_002
开始合并文件：./data/process01_003
开始合并文件：./data/process01_004
开始合并文件：./data/process01_005
开始合并文件：./data/process01_006
开始合并文件：./data/process01_007
开始合并文件：./data/process01_008
开始合并文件：./data/process01_009
开始合并文件：./data/process01_010
开始合并文件：./data/process01_011
开始合并文件：./data/process01_012
开始合并文件：./data/process01_013
开始合并文件：./data/process01_014
开始合并文件：./data/process01_015
开始合并文件：./data/process01_016
开始合并文件：./data/process01_017
开始合并文件：./data/process01_018
开始合并文件：./data/process01_019
开始合并文件：./data/process01_020
开始合并文件：./data/process01_021
开始合并文件：./data/process01_022
开始合并文件：./data/process01_023
开始合并文件：./data/process01_024
开始合并文件：./data/process01_025
开始合并文件：./data/process01_026
开始合并文件：./data/process01_027
开始合并文件：./data/process01_028
开始合并文件：./data/process01_029
开始合并文件：./data/process01_030
开始合并文件：./data/process01_031
开始合并文件：./data/process01_032
开始合并文件：./data/process01_033
开始合并文件：./data/process01_034
开始合并文件：./data/process01_035
开始合并文件：./data/process01_036
开始合并文件：./data/process01_037
开始合并文件：./data/process01_038
开始合并文件：./data/process01_039
开始合并文件：./data/process01_040
开始合并文件：./data/process01_041
开始合并文件：./data/process01_042
开始合并文件：./data/process01_043
开始合并文件：./data/process01_044
开始合并文件：./data/process01_045
开始合并文件：./data/process01_046
开始合并文件：./data/process01_047
开始合并文件：./data/process01_048
开始合并文件：./data/process01_049
开始合并文件：./data/process01_050
开始合并文件：./data/process01_051
开始合并文件：./data/process01_052
开始合并文件：./data/process01_053
开始合并文件：./data/process01_054
开始合并文件：./data/process01_055
开始合并文件：./data/process01_056
开始合并文件：./data/process01_057
开始合并文件：./data/process01_058
开始合并文件：./data/process01_059
开始合并文件：./data/process01_060
开始合并文件：./data/process01_061
开始合并文件：./data/process01_062
开始合并文件：./data/process01_063
开始合并文件：./data/process01_064
开始合并文件：./data/process01_065
开始合并文件：./data/process01_066
开始合并文件：./data/process01_067
开始合并文件：./data/process01_068
开始合并文件：./data/process01_069
开始合并文件：./data/process01_070
开始合并文件：./data/process01_071
开始合并文件：./data/process01_072
开始合并文件：./data/process01_073
开始合并文件：./data/process01_074
开始合并文件：./data/process01_075
开始合并文件：./data/process01_076
开始合并文件：./data/process01_077
开始合并文件：./data/process01_078
开始合并文件：./data/process01_079
开始合并文件：./data/process01_080
开始合并文件：./data/process01_081
开始合并文件：./data/process01_082
开始合并文件：./data/process01_083
开始合并文件：./data/process01_084
开始合并文件：./data/process01_085
开始合并文件：./data/process01_086
开始合并文件：./data/process01_087
开始合并文件：./data/process01_088
开始合并文件：./data/process01_089
开始合并文件：./data/process01_090
开始合并文件：./data/process01_091
开始合并文件：./data/process01_092
开始合并文件：./data/process01_093
开始合并文件：./data/process01_094
开始合并文件：./data/process01_095
开始合并文件：./data/process01_096
开始合并文件：./data/process01_097
开始合并文件：./data/process01_098
开始合并文件：./data/process01_099
开始合并文件：./data/process01_100
开始合并文件：./data/process01_101
开始合并文件：./data/process01_102
开始合并文件：./data/process01_103
开始合并文件：./data/process01_104
开始合并文件：./data/process01_105
开始合并文件：./data/process01_106
开始合并文件：./data/process01_107
开始合并文件：./data/process01_108
开始合并文件：./data/process01_109
开始合并文件：./data/process01_110
开始合并文件：./data/process01_111
开始合并文件：./data/process01_112
开始合并文件：./data/process01_113
开始合并文件：./data/process01_114
开始合并文件：./data/process01_115
开始合并文件：./data/process01_116
开始合并文件：./data/process01_117
开始合并文件：./data/process01_118
开始合并文件：./data/process01_119
开始合并文件：./data/process01_120
开始合并文件：./data/process01_121
开始合并文件：./data/process01_122
开始合并文件：./data/process01_123
开始合并文件：./data/process01_124
开始合并文件：./data/process01_125
开始合并文件：./data/process01_126
开始合并文件：./data/process01_127
开始合并文件：./data/process01_128
开始合并文件：./data/process01_129
开始合并文件：./data/process01_130
开始合并文件：./data/process01_131
开始合并文件：./data/process01_132
开始合并文件：./data/process01_133
开始合并文件：./data/process01_134
开始合并文件：./data/process01_135
开始合并文件：./data/process01_136
开始合并文件：./data/process01_137
开始合并文件：./data/process01_138
开始合并文件：./data/process01_139
开始合并文件：./data/process01_140
开始合并文件：./data/process01_141
开始合并文件：./data/process01_142
开始合并文件：./data/process01_143
开始合并文件：./data/process01_144
开始合并文件：./data/process01_145
开始合并文件：./data/process01_146
开始合并文件：./data/process01_147
开始合并文件：./data/process01_148
开始合并文件：./data/process01_149
开始合并文件：./data/process01_150
开始合并文件：./data/process01_151
开始合并文件：./data/process01_152
开始合并文件：./data/process01_153
开始合并文件：./data/process01_154
开始合并文件：./data/process01_155
开始合并文件：./data/process01_156
开始合并文件：./data/process01_157
开始合并文件：./data/process01_158
开始合并文件：./data/process01_159
开始合并文件：./data/process01_160
开始合并文件：./data/process01_161
开始合并文件：./data/process01_162
开始合并文件：./data/process01_163
开始合并文件：./data/process01_164
开始合并文件：./data/process01_165
开始合并文件：./data/process01_166
开始合并文件：./data/process01_167
开始合并文件：./data/process01_168
开始合并文件：./data/process01_169
开始合并文件：./data/process01_170
开始合并文件：./data/process01_171
开始合并文件：./data/process01_172
开始合并文件：./data/process01_173
开始合并文件：./data/process01_174
开始合并文件：./data/process01_175
开始合并文件：./data/process01_176
开始合并文件：./data/process01_177
开始合并文件：./data/process01_178
开始合并文件：./data/process01_179
开始合并文件：./data/process01_180
开始合并文件：./data/process01_181
开始合并文件：./data/process01_182
开始合并文件：./data/process01_183
开始合并文件：./data/process01_184
开始合并文件：./data/process01_185
开始合并文件：./data/process01_186
开始合并文件：./data/process01_187
开始合并文件：./data/process01_188
开始合并文件：./data/process01_189
开始合并文件：./data/process01_190
开始合并文件：./data/process01_191
开始合并文件：./data/process01_192
开始合并文件：./data/process01_193
开始合并文件：./data/process01_194
开始合并文件：./data/process01_195
开始合并文件：./data/process01_196
开始合并文件：./data/process01_197
开始合并文件：./data/process01_198
开始合并文件：./data/process01_199
开始合并文件：./data/process01_200
开始合并文件：./data/process01_201
开始合并文件：./data/process01_202
开始合并文件：./data/process01_203
开始合并文件：./data/process01_204
开始合并文件：./data/process01_205
开始合并文件：./data/process01_206
开始合并文件：./data/process01_207
开始合并文件：./data/process01_208
开始合并文件：./data/process01_209
开始合并文件：./data/process01_210
开始合并文件：./data/process01_211
开始合并文件：./data/process01_212
开始合并文件：./data/process01_213
开始合并文件：./data/process01_214
开始合并文件：./data/process01_215
<_io.TextIOWrapper name='./data/result_process01' mode='w' encoding='utf-8'>

Process finished with exit code 0

2.数据预处理

import pandas as pd
import numpy as np
import matplotlib as mpl
import matplotlib.pyplot as plt
import re
import time
import jieba

# mpl.rcParams['font.sans-serif'] = [u'simHei']#ָ改为指定字体“黑体”
# mpl.rcParams['axes.unicode_minus'] = False #使得坐标轴保存负号变更为方块，用来正常显示负号
# plt.title(u'我是中文')
# get_ipython().magic(u'matplotlib tk')

df = pd.read_csv('./data/result_process01', sep = ',', header = None, names= ['from','to', 'date', 'content','label'])
print(df.head(10))

def extract_email_server_address(strl):#发送接收地址提取
    it = re.findall(r"@([A-Za-z0-9]*\.[A-Za-z0-9\.]+)", str(strl))#正则匹配
    result = ''
    if len(it)>0:
        result = it[0]
    else:
        result = 'unknown'
    return result

df['from_address'] = pd.Series(map(lambda str : extract_email_server_address(str), df['from']))#map映射并添加
df['to_address'] = pd.Series(map(lambda str: extract_email_server_address(str), df['to']))

# print(df.head(10))
# print("========to address=======================")
print("="*10 + 'to address' + "="*20)#也可以这样写
print(df.to_address.value_counts().head(5))#
print("总邮件接受服务器类别数量为：" + str(df.to_address.unique().shape))
print("="*10 + 'from address' + "= "*20)
print(df.from_address.value_counts().head(5))
print("邮件发送服务器类别数量为：" + str(df.from_address.unique().shape))
from_address_df = df.from_address.value_counts().to_frame()#转为结构化的输出,输出带索引
# print(from_address_df)
len_less_10_from_address_count = from_address_df[from_address_df.from_address<=10].shape
print("发送邮件数量小于10封的服务器数量为：" + str(len_less_10_from_address_count))

总邮件接受服务器类别数量为：(12,)
==========from address= = = = = = = = = = = = = = = = = = = = 
163.com                  7500
mail.tsinghua.edu.cn     6498
126.com                  5822
tom.com                  4075
mails.tsinghua.edu.cn    3205
Name: from_address, dtype: int64
邮件发送服务器类别数量为：(3567,)

np.unique(list(map(lambda t: len(str(t).strip()), df['date'])))#根据长度去特征
print(np.unique(list(map(lambda t: len(str(t).strip()), df['date']))))
np.unique(list(filter(lambda t: len(str(t).strip())==30, df['date'])))
print(np.unique(list(filter(lambda t: len(str(t).strip())==31, df['date']))))
def extract_email_date(str1):
    if not isinstance(str1, str):
        str1 = str(str1)
         
    str_len = len(str1)
    week = ""
    hour = ""
    time_quantum = ""      
    if str_len < 10:
        week = "unknown"
        hour = "unknown"
        time_quantum = "unknown"
        pass
    elif str_len == 16:
        rex = r"(\d{2}):\d{2}"#只取冒号前面的
        it = re.findall(rex, str1)
        if len(it) == 1:
            hour = it[0]
        else:
            hour = "unknown"
        week = "Fri"
        time_quantum = "0"
        pass
    elif str_len == 19: #['Sep 23 2005 1:04 AM']
        week = "Sep"
        hour = "01"
        time_quantum = "3"
        pass
    elif str_len == 21: #['August 24 2005 5:00pm'
        week ="Wed"
        hour = "17"
        time_quantum = "1"
        pass
    else:               #'Fri 2 Sep 2005 08:17:50'  Wed 31 Aug 2005 15:06:36 
        rex = r"([A-Za-z]+\d?[A-Za-z]*) .*?(\d{2}):\d{2}:\d{2}.*"# 加问号保险些# 'Fri 23 Sep 2005 09:39:39 +0800 X-Priority: 3 X-Mailer: FoxMail'
        it = re.findall(rex, str1)
        if len(it) == 1 and len(it[0]) ==2:
            week = it[0][0][-3:]
            hour = it[0][1]
            int_hour = int(hour)
            if int_hour <8:
                time_quantum = "3"
            elif int_hour <13:
                time_quantum = "0"
            elif int_hour <19:
                time_quantum = "1"
            else:
                time_quantum = "2"
            pass
        else:
            week = "unknown"
            hour = "unknown"
            time_quantum = 'unknown'
     
    week = week.lower()
    hour = hour.lower()
    time_quantum = time_quantum.lower()
    return(week, hour, time_quantum)
#数据转换
date_time_extract_result = list(map(lambda st: extract_email_date(st), df['date']))
df['date_week'] = pd.Series(map(lambda t: t[0], date_time_extract_result))
df['date_hour'] = pd.Series(map(lambda t: t[1], date_time_extract_result))
df['date_time_quantum'] = pd.Series(map(lambda t: t[2], date_time_extract_result))
print(df.head(4))
 
print("======星期属性字段的描述==========")
print(df.date_week.value_counts().head(3))
print(df[['date_week', 'label']].groupby(['date_week', 'label'])['label'].count())
 
print("======小时属性字段的描述==========")
print(df.date_hour.value_counts().head(3))
print(df[['date_hour', 'label']].groupby(['date_hour', 'label'])['label'].count())
 
print("======时间段属性字段的描述==========")
print(df.date_hour.value_counts().head(3))
print(df[['date_time_quantum', 'label']].groupby(['date_time_quantum', 'label'])['label'].count())            
                 
df['has_date'] = df.apply(lambda c: 0 if c['date_week'] == 'unknown' else 1, axis=1)
print(df.head(4))
#===========================开始分词==============================================
print('='*30 + '现在开始分词，请耐心等待5分钟。。。' + '='*20)
df['content'] = df['content'].astype('str')
df['jieba_cut_content'] = list(map(lambda st: "  ".join(jieba.cut(st)), df['content']))
df.head(4)

                                     from                 to  \
0                    yan<(8月27-28上海)培训课程>    lu@ccert.edu.cn   
1                     pan <pan@jdl.ac.cn>   shi@ccert.edu.cn   
2    =?GB2312?B?1cW6o8TP?= <jian@163.con>  xing@ccert.edu.cn   
3  =?GB2312?B?tPq/qreixrE=?= <pan@12.com>  ling@ccert.edu.cn   

                             date  \
0  Tue 30 Aug 2005 10:08:15 +0800   
1  Sun 14 Aug 2005 10:16:47 +0800   
2  Sun 14 Aug 2005 10:17:57 +0800   
3  Sun 14 Aug 2005 10:19:02 +0800   

                                             content  label from_address  \
0  非财务纠淼牟莆窆芾-（沙盘模拟）------如何运用财务岳硖岣吖芾砑ㄐ[课 程 背 景]每一...    1.0      unknown   
1  讲的是孔子后人的故事。一个老领导回到家乡，跟儿子感情不和，跟贪财的孙子孔为本和睦。老领导的弟...    0.0    jdl.ac.cn   
2  尊敬的贵公司(财务/经理)负责人您好！我是深圳金海实业有限公司（广州。东莞）等省市有分公司。...    1.0      163.con   
3  贵公司负责人(经理/财务）您好：深圳市华龙公司受多家公司委托向外低点代开部分增值税电脑发票（...    1.0       12.com   

     to_address date_week date_hour date_time_quantum  
0  ccert.edu.cn       tue        10                 0  
1  ccert.edu.cn       sun        10                 0  
2  ccert.edu.cn       sun        10                 0  
3  ccert.edu.cn       sun        10                 0

print("======星期属性字段的描述==========")
print(df.date_week.value_counts().head(3))
print(df[['date_week', 'label']].groupby(['date_week', 'label'])['label'].count())
 
print("======小时属性字段的描述==========")
print(df.date_hour.value_counts().head(3))
print(df[['date_hour', 'label']].groupby(['date_hour', 'label'])['label'].count())
 
print("======时间段属性字段的描述==========")
print(df.date_hour.value_counts().head(3))
print(df[['date_time_quantum', 'label']].groupby(['date_time_quantum', 'label'])['label'].count())            
                 
df['has_date'] = df.apply(lambda c: 0 if c['date_week'] == 'unknown' else 1, axis=1)
print(df.head(4))

======星期属性字段的描述==========
fri    10859
sat    10316
thu     9780
Name: date_week, dtype: int64
date_week  label
fri        0.0      3884
           1.0      6975
mon        0.0      2568
           1.0      5491
sat        0.0      3681
           1.0      6635
sep        0.0         1
sun        0.0      2785
           1.0      5724
thu        0.0      3330
           1.0      6450
tue        0.0      2733
           1.0      5399
unknown    1.0       553
wed        0.0      2784
           1.0      5626
Name: label, dtype: int64
======小时属性字段的描述==========
19    2835
16    2772
15    2750
Name: date_hour, dtype: int64
date_hour  label
00         0.0       904
           1.0      1716
01         0.0       925
           1.0      1791
02         0.0       868
           1.0      1736
03         0.0       839
           1.0      1682
04         0.0       824
           1.0      1771
05         0.0       822
           1.0      1791
06         0.0       758
           1.0      1748
07         0.0       863
           1.0      1775
08         0.0       801
           1.0      1732
09         0.0       896
           1.0      1795
10         0.0       874
           1.0      1847
11         0.0       889
           1.0      1779
12         0.0       936
           1.0      1740
13         0.0       909
           1.0      1712
14         0.0       945
           1.0      1757
15         0.0       979
           1.0      1771
16         0.0       988
           1.0      1784
17         0.0       940
           1.0      1802
18         0.0       995
           1.0      1744
19         0.0       986
           1.0      1849
20         0.0      1002
           1.0      1744
21         0.0       909
           1.0      1723
22         0.0       979
           1.0      1747
23         0.0       935
           1.0      1763
24         1.0         1
unknown    1.0       553
Name: label, dtype: int64
======时间段属性字段的描述==========
19    2835
16    2772
15    2750
Name: date_hour, dtype: int64
date_time_quantum  label
0                  0.0       4396
                   1.0       8893
1                  0.0       5756
                   1.0      10570
2                  0.0       4811
                   1.0       8827
3                  0.0       6803
                   1.0      14010
unknown            1.0        553
Name: label, dtype: int64
                                     from                 to  \
0                    yan<(8月27-28上海)培训课程>    lu@ccert.edu.cn   
1                     pan <pan@jdl.ac.cn>   shi@ccert.edu.cn   
2    =?GB2312?B?1cW6o8TP?= <jian@163.con>  xing@ccert.edu.cn   
3  =?GB2312?B?tPq/qreixrE=?= <pan@12.com>  ling@ccert.edu.cn   

                             date  \
0  Tue 30 Aug 2005 10:08:15 +0800   
1  Sun 14 Aug 2005 10:16:47 +0800   
2  Sun 14 Aug 2005 10:17:57 +0800   
3  Sun 14 Aug 2005 10:19:02 +0800   

                                             content  label from_address  \
0  非财务纠淼牟莆窆芾-（沙盘模拟）------如何运用财务岳硖岣吖芾砑ㄐ[课 程 背 景]每一...    1.0      unknown   
1  讲的是孔子后人的故事。一个老领导回到家乡，跟儿子感情不和，跟贪财的孙子孔为本和睦。老领导的弟...    0.0    jdl.ac.cn   
2  尊敬的贵公司(财务/经理)负责人您好！我是深圳金海实业有限公司（广州。东莞）等省市有分公司。...    1.0      163.con   
3  贵公司负责人(经理/财务）您好：深圳市华龙公司受多家公司委托向外低点代开部分增值税电脑发票（...    1.0       12.com   

     to_address date_week date_hour date_time_quantum  has_date  
0  ccert.edu.cn       tue        10                 0         1  
1  ccert.edu.cn       sun        10                 0         1  
2  ccert.edu.cn       sun        10                 0         1  
3  ccert.edu.cn       sun        10                 0         1

#===========================开始分词==============================================
print('='*30 + '现在开始分词，请耐心等待5分钟。。。' + '='*20)
df['content'] = df['content'].astype('str')
df['jieba_cut_content'] = list(map(lambda st: "  ".join(jieba.cut(st)), df['content']))
df.head(4)

#特征工程之四 长度提取  
def precess_content_length(lg):
    if lg <= 10:
        return 0
    elif lg <= 100:
        return 1
    elif lg <= 500:
        return 2
    elif lg <= 1000:
        return 3
    elif lg <= 1500:
        return 4
    elif lg <= 2000:
        return 5
    elif lg <= 2500:
        return 6
    elif lg <=  3000:
        return 7
    elif lg <= 4000:
        return 8
    elif lg <= 5000:
        return 9
    elif lg <= 10000:
        return 10
    elif lg <= 20000:
        return 11
    elif lg <= 30000:
        return 12
    elif lg <= 50000:
        return 13
    else:
        return 14
 
df['content_length'] = pd.Series(map(lambda st:len(st), df['content']))
df['content_length_type'] = pd.Series(map(lambda st: precess_content_length(st), df['content_length']))
# print(df.head(10))  #如果不count就按照自然顺序排      
df2 = df.groupby(['content_length_type', 'label'])['label'].agg(['count']).reset_index()#agg 计算并且添加count用于后续计算
df3 = df2[df2.label == 1][['content_length_type', 'count']].rename(columns = {'count' : 'c1'})
df4 = df2[df2.label == 0][['content_length_type', 'count']].rename(columns = {'count' : 'c2'})
df5 = pd.merge(df3, df4)#注意pandas中merge与concat的区别
df5['c1_rage'] = df5.apply(lambda r: r['c1'] / (r['c1'] + r['c2']), axis = 1)
df5['c2_rage'] = df5.apply(lambda r: r['c2'] / (r['c1'] + r['c2']), axis = 1)
print(df5) 
#画图出来观测为信号添加做准备
plt.plot(df5['content_length_type'], df5['c1_rage'], label = u'垃圾邮件比例')
plt.plot(df5['content_length_type'], df5['c2_rage'], label = u'正常邮件比例')
plt.grid(True)
plt.legend(loc = 0)#加入图例
plt.show()

#添加信号量,数值分析模拟回归方程
 
def process_content_sema(x):
    if x > 10000:
        return 0.5 / np.exp(np.log10(x) - np.log10(500)) + np.log(abs(x - 500) + 1) - np.log(abs(x - 10000)) + 1
    else:
        return 0.5 / np.exp(np.log10(x) - np.log10(500)) + np.log(abs(x - 500) + 1)
a = np.arange(1, 20000)
plt.plot(a, list(map(lambda t: process_content_sema(t) ,a)), label = u'信息量')
# plt.plot(df['content_length'], list(map(lambda t: process_content_sema(t) ,df['content_length'])), label = u'信息量')
plt.grid(True)
plt.legend(loc = 0)
plt.show()

df['content_length_sema'] = list(map(lambda st: process_content_sema(st), df['content_length'])) 
# print(df.head(10))         
  
print(df.dtypes) #可以查看每一列的数据类型，也可以查看每一列的名称
from                    object
to                      object
date                    object
content                 object
label                  float64
from_address            object
to_address              object
date_week               object
date_hour               object
date_time_quantum       object
has_date                 int64
jieba_cut_content       object
content_length           int64
content_length_type      int64
content_length_sema    float64
dtype: object

df.drop(['from', 'to', 'date', 'from_address', 'to_address', \
         'date_week','date_hour', 'date_time_quantum', 'content', \
         'content_length', 'content_length_type'], 1, inplace=True) 
print(df.info())
print(df.head(10))

<class 'pandas.core.frame.DataFrame'>
RangeIndex: 64620 entries, 0 to 64619
Data columns (total 4 columns):
label                  64619 non-null float64
has_date               64620 non-null int64
jieba_cut_content      64620 non-null object
content_length_sema    64620 non-null float64
dtypes: float64(2), int64(1), object(1)
memory usage: 2.0+ MB
None
   label  has_date                                  jieba_cut_content  \
0    1.0         1  非  财务  纠淼  牟  莆  窆  芾  -  （  沙盘  模拟  ）  ------...   
1    0.0         1  讲  的  是  孔子  后人  的  故事  。  一个  老  领导  回到  家乡  ...   
2    1.0         1  尊敬  的  贵  公司  (  财务  /  经理  )  负责人  您好  ！  我  ...   
3    1.0         1  贵  公司  负责人  (  经理  /  财务  ）  您好  ：  深圳市  华龙  公...   
4    1.0         1  这是  一封  HTML  格式  信件  ！  ---------------------...   
5    1.0         1  TO  ：  贵  公司  经理  、  财务  您好  ！  深圳市  春洋  贸易  有...   
6    0.0         1  那  他  为什么  不  愿意  起诉  ，  既然  这样  了  ！  起诉  后  ...   
7    1.0         1  尊敬  的  负责人  （  经理  ／  财务  ）  ：  您好  ！  我  是  深...   
8    1.0         1  您好     以下  是  特别  为  阁下  发  的  香港  信息  (  图片  ...   
9    0.0         1  我  觉得  ，  负债  不要紧  ，  最  重要  的  是  能  负得起  这个 ...   

   content_length_sema  
0             7.456151  
1             6.486084  
2             6.175171  
3             6.565682  
4             2.063409  
5             6.143747  
6             3.807568  
7             5.593684  
8             6.611074  
9             6.041340

df.to_csv('./data/result_process02', encoding='utf-8', index = False)
df.to_csv('./data/result_process02.csv', encoding='utf-8', index = False)

3.模型训练预测

3.1 KNN

#-*- coding:utf-8 -*-
import pandas as pd
import numpy as np
import jieba
import time
 
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.neighbors import KNeighborsClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score
from sklearn.ensemble.tests.test_forest import check_min_samples_leaf

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True)
# print(df.head(5))
# print(df.info())

x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)
print("训练集大小%d" % x_train.shape[0])
print("测试集大小%d" % x_test.shape[0])
# print(x_train.head(1000))
# print(x_test.head(10))
# #================================================================================================
print('开始训练集的特征工程:')
start_time_train = time.time()
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)#Tf-idf
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
end_time_train = time.time()
print('Running train_svd time: %.2s second(s)'%(end_time_train-start_time_train))
# print(data.head(10))
# print(data.info())
#
data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())
#
print('开始KNN模型训练:')
knn = KNeighborsClassifier(n_neighbors=5)
model = knn.fit(data, y_train)
#测试集处理
jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
# print(data_test.head(10))
# print(data_test.info())
start_time_KNN = time.time()
y_predict = model.predict(data_test)
#
precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)

print('精确率为：%0.5f' % precision)
print('召回率为：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)
end_time_KNN = time.time()
print('Running KNN_model time: %.2s second(s)'%(end_time_KNN-start_time_KNN))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/k_nearest_neighbor.py
训练集大小51427
测试集大小12857
开始训练集的特征工程:
Running train_svd time: 22 second(s)
开始KNN模型训练:
精确率为：0.98029
召回率为：0.98654
F1均值为：0.98340
Running KNN_model time: 1. second(s)

Process finished with exit code 0

3.2 SVM


import pandas as pd
import numpy as np
import jieba
import time
 
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.svm import SVC
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score
from sklearn.ensemble.tests.test_forest import check_min_samples_leaf

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True)
# print(df.head(5))
# print(df.info())
print("训练集大小:",df.shape)

x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)
print("训练集大小%d" % x_train.shape[0])
print("测试集大小%d" % x_test.shape[0])
# print(x_train.head(1000))
# print(x_test.head(10))
#================================================================================================
print('开始训练集的特征工程-TF-IDF+SVD:')
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
# print(data.head(10))
# print(data.info())

data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())
print('开始SVM模型训练:')
start_time = time.time()
svm = SVC(C = 1, kernel='rbf', degree = 3, gamma = 0.001)
model = svm.fit(data, y_train)

jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
# print(data_test.head(10))
# print(data_test.info())

y_predict = model.predict(data_test)

precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)

print('精确率为：%0.5f' % precision)
print('召回率为：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)

end_time= time.time()
print('Running SVM model time: %.2s second(s)'%(end_time-start_time))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/support_vector_machine.py
训练集大小: (64284, 4)
训练集大小51427
测试集大小12857
开始训练集的特征工程:
开始SVM模型训练:
精确率为：0.87746
召回率为：0.98583
F1均值为：0.92849
Running svm model time: 99 second(s)

Process finished with exit code 0

3.3 Decision Tree

import pandas as pd
import numpy as np
import jieba
import time
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.tree import DecisionTreeClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True) 
# print(df.head(5))
# print(df.info())
print("训练集大小:",df.shape)

x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)
print("训练集大小%d" % x_train.shape[0])
print("测试集大小%d" % x_test.shape[0])
# print(x_train.head(1000))
# print(x_test.head(10))
#================================================================================================
print('开始训练集的特征工程-TF-IDF+SVD:')
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
# print(data.head(10))
# print(data.info())

data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())

print('开始决策树模型训练:')
start_time = time.time()

tree = DecisionTreeClassifier(criterion='gini', max_depth = 5, random_state = 0)#'entropy'
model = tree.fit(data, y_train)

jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
# print(data_test.head(10))
# print(data_test.info())

y_predict = model.predict(data_test)

precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)

print('精确率为：%0.5f' % precision)
print('召回率为：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)

end_time= time.time()
print('Running DT model time: %.2s second(s)'%(end_time-start_time))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/decision_tree.py
训练集大小: (64284, 4)
训练集大小51427
测试集大小12857
开始训练集的特征工程-TF-IDF+SVD:
开始决策树模型训练:
精确率为：0.96956
召回率为：0.98146
F1均值为：0.97547
Running DT model time: 2. second(s)

Process finished with exit code 0

3.4 Random forest

import time
import pandas as pd
import numpy as np
import jieba
 
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score
from sklearn.ensemble.tests.test_forest import check_min_samples_leaf

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True)
# print(df.head(5))
# print(df.info())
print("训练集大小:",df.shape)

x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)
print("训练集大小%d" % x_train.shape[0])
print("测试集大小%d" % x_test.shape[0])
# print(x_train.head(1000))
# print(x_test.head(10))
#================================================================================================
print('开始训练集的特征工程-TF-IDF+SVD:')
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
# print(data.head(10))
# print(data.info())

data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())

print('开始RF模型训练:')
start_time = time.time()

forest = RandomForestClassifier(n_estimators=100, criterion='gini', max_depth=3, random_state=0)
model = forest.fit(data, y_train)

jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
print(data_test.head(10))
print(data_test.info())

y_predict = model.predict(data_test)

precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)

print('精确率为：%0.5f' % precision)
print('召回率为：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)

end_time= time.time()
print('Running RF model time: %.2s second(s)'%(end_time-start_time))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/random_forest.py
训练集大小: (64284, 4)
训练集大小51427
测试集大小12857
开始训练集的特征工程-TF-IDF+SVD:
开始RF模型训练:
精确率为：0.94293
召回率为：0.98914
F1均值为：0.96548
Running RF model time: 5. second(s)

Process finished with exit code 0

3.5 GBDT


#-*- coding:utf-8 -*-
import pandas as pd
import numpy as np
import jieba
import time
 
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.ensemble import GradientBoostingClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score
from sklearn.ensemble.tests.test_forest import check_min_samples_leaf

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True)
# print(df.head(5))
# print(df.info())
print("训练集大小:",df.shape)

x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)
print("训练集大小%d" % x_train.shape[0])
print("测试集大小%d" % x_test.shape[0])
# print(x_train.head(1000))
# print(x_test.head(10))
#================================================================================================
print('开始GBDT模型训练:')
start_time = time.time()
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
# print(data.head(10))
# print(data.info())

data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())

gbdt = GradientBoostingClassifier(learning_rate=0.01, n_estimators =100, max_depth=3,\
                                  min_samples_split = 50, loss = 'deviance', random_state = 0)
                                  #对数似然损失函数   指数损失函数exponential
model = gbdt.fit(data, y_train)

jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
# print(data_test.head(10))
# print(data_test.info())

y_predict = model.predict(data_test)

precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)

print('精确率为：%0.5f' % precision)
print('召回率为：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)

end_time= time.time()
print('Running GBDT model time: %.2s second(s)'%(end_time-start_time))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/gradient_boost_decision_tree.py
训练集大小: (64284, 4)
训练集大小51427
测试集大小12857
开始GBDT模型训练:
精确率为：0.95038
召回率为：0.98831
F1均值为：0.96897
Running GBDT model time: 32 second(s)

Process finished with exit code 0

3.6 Bayes

import pandas as pd
import numpy as np
# import matplotlib as mpl
# import matplotlib.pyplot as plt
import jieba
import time
 
from sklearn.feature_extraction.text import CountVectorizer, TfidfVectorizer
from sklearn.decomposition import TruncatedSVD
from sklearn.naive_bayes import BernoulliNB
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score, recall_score

# mpl.rcParams['font.sans-serif'] = [u'simHei']
# mpl.rcParams['axes.unicode_minus'] = False

df = pd.read_csv('./data/result_process02', sep =',')
# print(df.head(5))
df.dropna(axis = 0, how ='any', inplace = True) #按行删除Nan
# print(df.head(5))
# print(df.info())
print("训练集大小:",df.shape)
x_train, x_test, y_train, y_test = train_test_split(df[['has_date','jieba_cut_content',\
                                                        'content_length_sema']],df['label'],\
                                                    test_size = 0.2, random_state = 0)

print("训练数据集大小：%d" % x_train.shape[0])
print("测试集数据大小：%d" % x_test.shape[0])
# print(x_train.head(10))
# print(x_test.head(10)) #注意前面索引
#================================================================================================
print('开始训练集的特征工程-TF-IDF+SVD:')
start1 = time.time()
transformer = TfidfVectorizer(norm = 'l2', use_idf = True)#逆向文件频率
svd = TruncatedSVD(n_components=20)
jieba_cut_content = list(x_train['jieba_cut_content'].astype('str'))
transformer_model = transformer.fit(jieba_cut_content)
df1 = transformer_model.transform(jieba_cut_content)
svd_model = svd.fit(df1)
df2 = svd_model.transform(df1)
data = pd.DataFrame(df2)
# print(data.head(10))
# print(data.info())
  
data['has_date'] = list(x_train['has_date'])
data['content_length_sema'] = list(x_train['content_length_sema'])
# print(data.head(10))
# print(data.info())

end1 = time.time()
print('结束特征工程耗时: %.2s second(s)'%(end1-start1))
jieba_cut_content_test = list(x_test['jieba_cut_content'].astype('str'))
data_test = pd.DataFrame(svd_model.transform(transformer_model.transform(jieba_cut_content_test)))
data_test['has_date'] = list(x_test['has_date'])
data_test['content_length_sema'] = list(x_test['content_length_sema'])
# print(data_test.head(10))
# print(data_test.info())

print('开始Bayes模型训练:')
start_time = time.time()

nb = BernoulliNB(alpha = 1.0, binarize = 0.0005)#二值转换阈值
model = nb.fit(data, y_train)
  

#开始预测
y_predict = model.predict(data_test)
  
precision = precision_score(y_test, y_predict)
recall = recall_score(y_test, y_predict)
f1mean = f1_score(y_test, y_predict)
 
print('精确率为：%0.5f' % precision)
print('召回率：%0.5f' % recall)
print('F1均值为：%0.5f' % f1mean)

end_time= time.time()
print('Running Bayes model time: %.2s second(s)'%(end_time-start_time))

C:\Anaconda3\python.exe D:/hjz-py/Project/垃圾邮件过滤课件及数据/Spam-sorting/bayes.py
训练集大小: (64284, 4)
训练数据集大小：51427
测试集数据大小：12857
开始训练集的特征工程-TF-IDF+SVD:
结束特征工程耗时: 22 second(s)
开始Bayes模型训练:
精确率为：0.94664
召回率：0.98878
F1均值为：0.96725
Running Bayes model time: 0.06 second(s)

Process finished with exit code 0

4.算法模型对比

不同机器跑出来差异不大，就上以前的表格了，可以再做个LR

5.总结

垃圾邮件过滤一般常用的算法有Bayes、KNN、LR等。一般最常用的算法选择Bayes算法。
垃圾邮件过滤系统中一般采用算法过滤+其它过滤统计结合的方式来进行垃圾邮件过滤。
在垃圾邮件过滤中主要是需要进行分词操作，中文邮件一般可以选择使用jieba(python)、ANSJ( java)等工具进行分词处理。
在垃圾邮件过滤中一般注意召回率，也就是说一般情况下，需要尽可能的提高垃圾邮件过滤的成功率。

你可能感兴趣的:(机器学习项目)

flask部署机器学习_如何开发端到端机器学习项目并使用Flask将其部署到Heroku cumichun6193 大数据 python 机器学习人工智能深度学习
flask部署机器学习There'sonequestionIalwaysgetaskedregardingDataScience:关于数据科学，我经常被问到一个问题：WhatisthebestwaytomasterDataScience?Whatwillgetmehired?掌握数据科学的最佳方法是什么？什么会雇用我？Myanswerremainsconstant:Thereisnoalterna
【零基础学AI】第9讲：机器学习概述 1989 0基础学AI 人工智能机器学习 python numpy devops 开源
本节课你将学到理解什么是机器学习，以及它与传统编程的区别掌握监督学习、无监督学习的基本概念使用scikit-learn完成你的第一个机器学习项目构建一个完整的iris花朵分类器开始之前环境要求Python3.8+JupyterNotebook或任何PythonIDE需要安装的包pipinstallscikit-learnpandasmatplotlibseaborn前置知识基本的Python语法（
机器学习项目微服务离线移植 LensonYuan Python工程落地项目发布深度学习机器学习微服务人工智能项目发布环境移植
机器学习项目微服务离线移植引言：为什么需要Docker化机器学习项目？在当今的机器学习工程实践中，项目部署与移植是一个常见但极具挑战性的任务。传统部署方式面临着"在我机器上能运行"的困境——开发环境与生产环境的不一致导致的各种兼容性问题。Docker技术通过容器化解决方案，完美地解决了这一痛点。本文将详细介绍如何将一个基于Python和FastAPI的机器学习项目进行Docker化封装，实现服务的
图像处理与机器学习项目：特征提取、PCA与分类器评估 pk_xz123456 深度学习仿真模型算法图像处理机器学习人工智能
图像处理与机器学习项目：特征提取、PCA与分类器评估项目概述本项目将完成一个完整的图像处理与机器学习流程，包括数据探索、特征提取、主成分分析(PCA)、分类器实现和评估五个关键步骤。我们将使用Python的OpenCV、scikit-learn和scikit-image库来处理图像数据并实现机器学习算法。importnumpyasnpimportmatplotlib.pyplotaspltimpo
Sklearn 机器学习缺失值处理对多数据列做缺失值填充 Thomas Kant 人工智能机器学习 sklearn 人工智能
亲爱的技术爱好者们，热烈欢迎来到Kant2048的博客！我是ThomasKant，很开心能在CSDN上与你们相遇～本博客的精华专栏：【自动化测试】【测试经验】【人工智能】【Python】Sklearn机器学习：对多列数据进行缺失值填充的正确姿势✨在实际的机器学习项目中，我们经常会遇到缺失值（MissingValues）问题。尤其是当数据集包含多个列且存在不同类型（数值型、分类型）缺失时，如何高效、
python打卡day31
今日的示例代码包含2个部分1.notebook文件夹内的ipynb文件，介绍下今天的思路2.项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾1.规范的文件命名2.规范的文件夹管理3.机器学习项目的拆分4.编码格式和类型注解作业：尝试针对之前的心脏病项目ipynb，将他按照今天的示例项目整理成规范的形式，思考下哪些部分可以未来复用。@疏锦行
python训练营打卡第31天
文件的规范拆分和写法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目，准备拆分的项目文件，思考下哪些部分可以未来复用。补充介绍：pyc文件的介绍知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解昨天我们已经介绍了如何在不同的文件中，导入其他目录的文件，核心在于了解导入方式和python解释器检索目录的方式。搞清楚了
60天python训练计划----day31 尘浮728 python 机器学习深度学习
DAY31文件的规范拆分和写法今日的示例代码包含2个部分notebook文件夹内的ipynb文件，介绍下今天的思路项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目ipynb，将他按照今天的示例项目整理成规范的形式，思考下哪些部分可以未来复用。#
使用Python和Scikit-Learn实现机器学习模型调优 Blossom.118 机器学习与人工智能机器学习人工智能 scikit-learn 开发语言目标检测 python 深度学习
在机器学习项目中，模型的性能往往取决于多个因素，其中模型的超参数（hyperparameters）起着关键作用。超参数是模型在训练之前需要设置的参数，例如决策树的深度、KNN的邻居数等。合理地选择超参数可以显著提升模型的性能。Scikit-Learn是一个功能强大的机器学习库，它提供了多种工具来帮助我们进行模型调优。本文将通过一个具体的例子，介绍如何使用Scikit-Learn进行模型调优。一、环
使用Python和Flask构建简单的机器学习API Blossom.118 机器学习与人工智能 python flask 机器学习深度学习人工智能目标检测数据挖掘
在机器学习项目中，将模型部署为一个WebAPI是一种常见的需求。这样可以方便地将模型集成到其他应用程序中，例如移动应用、Web应用或其他后端服务。Flask是一个轻量级的PythonWeb框架，非常适合用于构建简单的API。本文将通过一个具体的例子，介绍如何使用Flask将一个机器学习模型部署为一个WebAPI。一、环境准备在开始之前，请确保你的开发环境中已经安装了Python、Flask和Sci
机器学习复习3--模型的选择谢耳朵(wer~wer~) 机器学习机器学习人工智能
选择合适的机器学习模型是机器学习项目成功的关键一步。这通常不是一个一蹴而就的过程，而是需要综合考虑多个因素，并进行实验和评估。1.理解问题本质这是模型选择的首要步骤。需要清晰地定义试图解决的问题类型：监督学习:数据集包含输入特征和对应的标签（目标变量）分类:目标变量是离散的类别。例如，判断邮件是否为垃圾邮件（是/否），图像识别（猫/狗/鸟），客户流失预测（流失/不流失）。需要考虑的问题：二分类还是
5.20 打卡分散406 人工智能
DAY31文件的规范拆分和写法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目，准备拆分的项目文件，思考下哪些部分可以未来复用。heart_disease_prediction/│├──data/#数据文件夹│├──raw/#原始数据││└──heart.csv#120mg/dl(0/1)'restecg',#静息心电图结果(0/1/2)'
pycharm的环境管理-ChatGPT4o作答部分分式 pycharm ide python
在PyCharm中，环境管理非常直观，PyCharm提供了工具来创建、配置和切换Python环境。以下是详细介绍：1.PyCharm的环境管理概述PyCharm支持以下类型的Python环境：系统解释器：使用操作系统全局安装的Python。虚拟环境（venv或virtualenv）：推荐使用，便于项目之间的隔离。Conda环境：适合科学计算、数据分析或机器学习项目。远程环境：如Docker容器、S
Python打卡训练营day31——2025.05.20 莱茵菜苗 Python打卡 python 开发语言
知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目，准备拆分的项目文件，思考下哪些部分可以未来复用。导入依赖库#忽视警告importwarningswarnings.simplefilter('ignore')#数据处理importnumpyasnpimportpandasaspd#数据可视化importmatplotlib.pyplotas
python学习day31 一叶知秋秋 python学习笔记学习
文件的规范拆分和写法今日的示例代码包含2个部分1.notebook文件夹内的ipynb文件，介绍下今天的思路2.项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾1.规范的文件命名2.规范的文件夹管理3.机器学习项目的拆分4.编码格式和类型注解机器学习的流程数据加载：命名参考：load_data.py、data_loader.py数据可视化
Python训练打卡Day31 编程有点难 Python学习笔记 python 开发语言
文件的规范拆分和写法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解把一个文件，拆分成多个具有着独立功能的文件，然后通过import的方式，来调用这些文件。1.可以让项目文件变得更加规范和清晰2.可以让项目文件更加容易维护，修改某一个功能的时候，只需要修改一个文件，而不需要修改多个文件。3.文件变得更容易复用，部分通用的文件可以单独拿出来，进行其他项目的复用。回顾机器学
第三十一天打卡不爱吃山楂罐头 python打卡 python
@浙大疏锦行今日的示例代码包含2个部分notebook文件夹内的ipynb文件，介绍下今天的思路项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目ipynb，将他按照今天的示例项目整理成规范的形式，思考下哪些部分可以未来复用。importosim
什么是MLOps？MLOps是为了解决什么问题？我们在什么情况下需要MLOps？杰瑞学AI Devops AI/AGI 自动化人工智能机器学习 ai 大数据运维开发
什么是MLOps？MLOps（机器学习运维）是一种结合机器学习（ML）和软件开发运维（DevOps）的实践，旨在高效管理机器学习模型的开发、部署、监控和维护。它通过标准化流程和自动化工具，解决机器学习项目从实验到生产环境中的协作、效率和可扩展性问题。其核心目标类似于DevOps，但专注于应对机器学习特有的挑战，如数据变化、模型再训练和性能衰减。MLOps解决什么问题？模型部署困难传统机器学习项目常
Python _day31 且慢.589 Python_60 python 人工智能开发语言
DAY31文件的规范拆分和写法今日的示例代码包含2个部分notebook文件夹内的ipynb文件，介绍下今天的思路项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解昨天我们已经介绍了如何在不同的文件中，导入其他目录的文件，核心在于了解导入方式和python解释器检索目录的方式
将 JSON 批量转换为 XML：深度解析与完整实现指南 LYPHARD MELODY。深度学习 json xml
在数据科学与机器学习项目中，数据预处理始终扮演着不可或缺的角色。尤其当你面对多类别图像标注任务，而标注数据却是以JSON形式存在，而目标检测模型却偏好VOC格式的XML时，这个转换过程就变得极为关键。本文将带你深入解读一个完整的实战项目：如何将图像分类数据集中每个标注JSON批量转换为标准PascalVOC格式的XML文件，并同步整理图像资源。文章不仅附带完整代码，还涵盖路径组织、格式规范、注意事
Python打卡DAY31 chicpopoo 浙大疏锦行打卡 python 机器学习
今日的示例代码包含2个部分notebook文件夹内的ipynb文件，介绍下今天的思路项目文件夹中其他部分：拆分后的信贷项目，学习下如何拆分的，未来你看到的很多大项目都是类似的拆分方法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目ipynb，将他按照今天的示例项目整理成规范的形式，思考下哪些部分可以未来复用。src/data/data_lo
python打卡day31@浙大疏锦行风逸hhh python 开发语言
DAY31文件的规范拆分和写法知识点回顾规范的文件命名规范的文件夹管理机器学习项目的拆分编码格式和类型注解作业：尝试针对之前的心脏病项目，准备拆分的项目文件，思考下哪些部分可以未来复用。一、导入数据库importnumpyasnpimportpandasaspd二、数据可视化importmatplotlib.pyplotaspltimportseabornassnsfromsklearn.ense
python 文本分析库_Python有趣|中文文本情感分析 weixin_39972019 python 文本分析库
前言前文给大家说了python机器学习的路径，这光说不练假把式，这次，罗罗攀就带大家完成一个中文文本情感分析的机器学习项目，今天的流程如下：数据情况和处理数据情况这里的数据为大众点评上的评论数据（王树义老师提供），主要就是评论文字和打分。我们首先读入数据，看下数据的情况：importnumpyasnpimportpandasaspddata=pd.read_csv('data1.csv')data
Python配置管理库omegaconf介绍 qq_27390023 python 开发语言
OmegaConf是一个用于Python应用的强大配置管理库，它可以帮助开发者处理复杂的配置，尤其适用于深度学习和机器学习项目。它基于YAML，提供了一种结构化的方式来管理不同来源的配置数据，比如文件、命令行、环境变量等。OmegaConf通过DictConfig和ListConfig数据结构来存储和管理配置项，并允许进行动态配置合并和插值操作。OmegaConf的主要特性配置合并：可以将多个配置
机器学习实战：6种数据集划分方法详解与代码实现慕婉0307 机器学习机器学习人工智能深度学习数据集划分
在机器学习项目中，合理划分数据集是模型开发的关键第一步。本文将全面介绍6种常见数据格式的划分方法，并附完整Python代码示例，帮助初学者掌握这一核心技能。一、数据集划分基础函数1.核心函数：train_test_splitfromsklearn.model_selectionimporttrain_test_split#基本用法X_train,X_test,y_train,y_test=trai
# 交通标志识别：使用卷积神经网络的完整实现 www_pp_ cnn 人工智能神经网络
交通标志识别：使用卷积神经网络的完整实现在当今数字化时代，计算机视觉技术在各个领域都发挥着重要作用，交通标志识别就是其中的一个典型应用。通过让机器自动识别交通标志，不仅可以辅助自动驾驶系统，还能为交通管理提供更高效的支持。本文将详细介绍如何使用卷积神经网络（CNN）来实现交通标志的识别，并提供完整的代码实现。1.数据准备数据是机器学习项目的基础，对于交通标志识别任务，我们需要准备包含交通标志图像及
《机器学习中的过拟合与模型复杂性：理解与应对策略》未来创世纪机器学习机器学习人工智能
《机器学习中的过拟合与模型复杂性：理解与应对策略》摘要在机器学习中，过拟合是模型在训练数据上表现良好但在新数据上泛化能力差的现象。本文深入探讨了过拟合与模型复杂性之间的关系，分析了复杂模型导致过拟合的原因，并介绍了正则化技术（如L1和L2正则化）如何通过惩罚复杂模型来改善模型的泛化能力。通过具体实例，本文展示了如何在实际机器学习项目中平衡模型的复杂性和泛化能力，为机器学习实践者提供了实用的指导。引
机器学习中的标签策略：直接标签、代理标签与人工数据生成未来创世纪机器学习机器学习人工智能
机器学习中的标签策略：直接标签、代理标签与人工数据生成摘要本文深入探讨了机器学习领域中标签的关键概念，包括直接标签与代理标签的定义、优缺点比较，以及人工生成数据的相关内容。通过详细实例和练习，帮助读者理解如何选择合适的标签类型和数据生成方式，从而优化机器学习模型的性能和准确性。文章强调了标签质量对模型训练的重要性，并提供了实践建议以确保数据质量和模型有效性。一、引言在机器学习项目中，标签质量直接影
Python文本数据清洗五步法：打造高质量NLP分析数据真智AI python 自然语言处理开发语言
文本数据清洗对任何包含文本的分析或机器学习项目来说都是至关重要的，尤其是自然语言处理（NLP）或文本分析类的任务。原始文本通常存在错误、不一致以及多余信息，这些都会影响分析结果。常见问题包括拼写错误、特殊字符、多余空格以及格式不正确等。手动清洗文本数据不仅耗时，而且容易出错，尤其是在处理大规模数据集时。Python生态系统提供了如Pandas、re、NLTK和spaCy等工具，能够实现自动化处理。
Conda和Pip有什么区别？原子星 python 机器学习 AI conda pip 人工智能
conda和pip是Python中两种常用的包管理工具，它们在用途、包来源以及环境管理等方面存在区别。以下是具体分析：用途conda：conda是Anaconda发行版中的包管理工具，可以管理包括非Python软件包在内的各种包。它是一个全面的环境管理器，特别适合用于数据科学和机器学习项目[2][3]。pip：pip是Python的官方包管理器，主要用于安装和管理Python包。它更专注于纯粹的P
Java开发中，spring mvc 的线程怎么调用？小麦麦子 spring mvc
今天逛知乎，看到最近很多人都在问spring mvc 的线程http://www.maiziedu.com/course/java/ 的启动问题，觉得挺有意思的，那哥们儿问的也听仔细，下面的回答也很详尽，分享出来，希望遇对遇到类似问题的Java开发程序猿有所帮助。问题：在用spring mvc架构的网站上，设一线程在虚拟机启动时运行，线程里有一全局
maven依赖范围 bitcarter maven
1.test 测试的时候才会依赖，编译和打包不依赖，如junit不被打包 2.compile 只有编译和打包时才会依赖 3.provided 编译和测试的时候依赖，打包不依赖，如：tomcat的一些公用jar包 4.runtime 运行时依赖，编译不依赖 5.默认compile 依赖范围compile是支持传递的，test不支持传递 1.传递的意思是项目A，引用
Jaxb org.xml.sax.saxparseexception : premature end of file darrenzhu xml premature JAXB
如果在使用JAXB把xml文件unmarshal成vo(XSD自动生成的vo)时碰到如下错误： org.xml.sax.saxparseexception : premature end of file 很有可能时你直接读取文件为inputstream，然后将inputstream作为构建unmarshal需要的source参数。InputSource inputSource = new In
CSS Specificity 周凡杨 html 权重 Specificity css
有时候对于页面元素设置了样式，可为什么页面的显示没有匹配上呢？ because specificity CSS 的选择符是有权重的，当不同的选择符的样式设置有冲突时，浏览器会采用权重高的选择符设置的样式。规则： HTML标签的权重是1 Class 的权重是10 Id 的权重是100
java与servlet g21121 servlet
servlet 搞java web开发的人一定不会陌生，而且大家还会时常用到它。下面是java官方网站上对servlet的介绍： java官网对于servlet的解释写道 Java Servlet Technology Overview Servlets are the Java platform technology of choice for extending and enha
eclipse中安装maven插件 510888780 eclipse maven
1.首先去官网下载 Maven： http://www.apache.org/dyn/closer.cgi/maven/binaries/apache-maven-3.2.3-bin.tar.gz 下载完成之后将其解压，我将解压后的文件夹：apache-maven-3.2.3，并将它放在 D:\tools目录下，即 maven 最终的路径是：D:\tools\apache-mave
jpa@OneToOne关联关系布衣凌宇 jpa
Nruser里的pruserid关联到Pruser的主键id，实现对一个表的增删改，另一个表的数据随之增删改。 Nruser实体类 //***************************************************************** @Entity @Table(name="nruser") @DynamicInsert @Dynam
我的spring学习笔记11-Spring中关于声明式事务的配置 aijuans spring 事务配置
这两天学到事务管理这一块，结合到之前的terasoluna框架，觉得书本上讲的还是简单阿。我就把我从书本上学到的再结合实际的项目以及网上看到的一些内容，对声明式事务管理做个整理吧。我看得Spring in Action第二版中只提到了用TransactionProxyFactoryBean和<tx:advice/>,定义注释驱动这三种，我承认后两种的内容很好，很强大。但是实际的项目当中
java 动态代理简单实现 antlove java handler proxy dynamic service
dynamicproxy.service.HelloService package dynamicproxy.service; public interface HelloService { public void sayHello(); } dynamicproxy.service.impl.HelloServiceImpl package dynamicp
JDBC连接数据库百合不是茶 JDBC编程 JAVA操作oracle数据库
如果我们要想连接oracle公司的数据库，就要首先下载oralce公司的驱动程序，将这个驱动程序的jar包导入到我们工程中; JDBC链接数据库的代码和固定写法; 1,加载oracle数据库的驱动; &nb
单例模式中的多线程分析 bijian1013 java thread 多线程 java多线程
谈到单例模式，我们立马会想到饿汉式和懒汉式加载，所谓饿汉式就是在创建类时就创建好了实例，懒汉式在获取实例时才去创建实例，即延迟加载。饿汉式： package com.bijian.study; public class Singleton { private Singleton() { } // 注意这是private 只供内部调用 private static
javascript读取和修改原型特别需要注意原型的读写不具有对等性 bijian1013 JavaScript prototype
对于从原型对象继承而来的成员，其读和写具有内在的不对等性。比如有一个对象A，假设它的原型对象是B，B的原型对象是null。如果我们需要读取A对象的name属性值，那么JS会优先在A中查找，如果找到了name属性那么就返回；如果A中没有name属性，那么就到原型B中查找name，如果找到了就返回；如果原型B中也没有
【持久化框架MyBatis3六】MyBatis3集成第三方DataSource bit1129 dataSource
MyBatis内置了数据源的支持，如： <environments default="development"> <environment id="development"> <transactionManager type="JDBC" /> <data
我程序中用到的urldecode和base64decode,MD5 bitcarter c MD5 base64decode urldecode
这里是base64decode和urldecode，Md5在附件中。因为我是在后台所以需要解码： string Base64Decode(const char* Data,int DataByte,int& OutByte) { //解码表 const char DecodeTable[] = { 0, 0, 0, 0, 0, 0
腾讯资深运维专家周小军：QQ与微信架构的惊天秘密 ronin47
社交领域一直是互联网创业的大热门，从PC到移动端，从OICQ、MSN到QQ。到了移动互联网时代，社交领域应用开始彻底爆发，直奔黄金期。腾讯在过去几年里，社交平台更是火到爆，QQ和微信坐拥几亿的粉丝，QQ空间和朋友圈各种刷屏，写心得，晒照片，秀视频，那么谁来为企鹅保驾护航呢？支撑QQ和微信海量数据背后的架构又有哪些惊天内幕呢？本期大讲堂的内容来自今年2月份ChinaUnix对腾讯社交网络运营服务中心
java-69-旋转数组的最小元素。把一个数组最开始的若干个元素搬到数组的末尾，我们称之为数组的旋转。输入一个排好序的数组的一个旋转，输出旋转数组的最小元素 bylijinnan java
public class MinOfShiftedArray { /** * Q69 旋转数组的最小元素 * 把一个数组最开始的若干个元素搬到数组的末尾，我们称之为数组的旋转。输入一个排好序的数组的一个旋转，输出旋转数组的最小元素。 * 例如数组{3, 4, 5, 1, 2}为{1, 2, 3, 4, 5}的一个旋转，该数组的最小值为1。 */ publ
看博客，应该是有方向的 Cb123456 反省看博客
看博客，应该是有方向的: 我现在就复习以前的，在补补以前不会的，现在还不会的，同时完善完善项目，也看看别人的博客. 我刚突然想到的: 1.应该看计算机组成原理，数据结构，一些算法，还有关于android,java的。 2.对于我，也快大四了，看一些职业规划的，以及一些学习的经验，看看别人的工作总结的. 为什么要写
[开源与商业]做开源项目的人生活上一定要朴素,尽量减少对官方和商业体系的依赖 comsci 开源项目
为什么这样说呢？因为科学和技术的发展有时候需要一个平缓和长期的积累过程，但是行政和商业体系本身充满各种不稳定性和不确定性，如果你希望长期从事某个科研项目，但是却又必须依赖于某种行政和商业体系，那其中的过程必定充满各种风险。。。所以，为避免这种不确定性风险，我
一个 sql优化（[精华] 一个查询优化的分析调整全过程！很值得一看） cwqcwqmax9 sql
见 http://www.itpub.net/forum.php?mod=viewthread&tid=239011 Web翻页优化实例提交时间: 2004-6-18 15:37:49 回复发消息环境： Linux ve
Hibernat and Ibatis dashuaifu Hibernate ibatis
Hibernate VS iBATIS 简介 Hibernate 是当前最流行的O/R mapping框架，当前版本是3.05。它出身于sf.net，现在已经成为Jboss的一部分了 iBATIS 是另外一种优秀的O/R mapping框架，当前版本是2.0。目前属于apache的一个子项目了。相对Hibernate“O/R”而言，iBATIS 是一种“Sql Mappi
备份MYSQL脚本 dcj3sjt126com mysql
#!/bin/sh # this shell to backup mysql #[email protected] (QQ:1413161683 DuChengJiu) _dbDir=/var/lib/mysql/ _today=`date +%w` _bakDir=/usr/backup/$_today [ ! -d $_bakDir ] && mkdir -p
iOS第三方开源库的吐槽和备忘 dcj3sjt126com ios
转自 ibireme的博客做iOS开发总会接触到一些第三方库，这里整理一下，做一些吐槽。目前比较活跃的社区仍旧是Github，除此以外也有一些不错的库散落在Google Code、SourceForge等地方。由于Github社区太过主流，这里主要介绍一下Github里面流行的iOS库。首先整理了一份 Github上排名靠
html wlwmanifest.xml eoems html xml
所谓优化wp_head()就是把从wp_head中移除不需要元素，同时也可以加快速度。步骤：加入到function.php remove_action('wp_head', 'wp_generator'); //wp-generator移除wordpress的版本号，本身blog的版本号没什么意义，但是如果让恶意玩家看到，可能会用官网公布的漏洞攻击blog remov
浅谈Java定时器发展 hacksin java 并发 timer 定时器
java在jdk1.3中推出了定时器类Timer,而后在jdk1.5后由Dou Lea从新开发出了支持多线程的ScheduleThreadPoolExecutor，从后者的表现来看，可以考虑完全替代Timer了。 Timer与ScheduleThreadPoolExecutor对比： 1. Timer始于jdk1.3,其原理是利用一个TimerTask数组当作队列
移动端页面侧边导航滑入效果 ini jquery Web html5 css javascirpt
效果体验：http://hovertree.com/texiao/mobile/2.htm可以使用移动设备浏览器查看效果。效果使用到jquery-2.1.4.min.js，该版本的jQuery库是用于支持HTML5的浏览器上，不再兼容IE8以前的浏览器，现在移动端浏览器一般都支持HTML5，所以使用该jQuery没问题。HTML文件代码： <!DOCTYPE html> <h
AspectJ+Javasist记录日志 kane_xie aspectj javasist
在项目中碰到这样一个需求，对一个服务类的每一个方法，在方法开始和结束的时候分别记录一条日志，内容包括方法名，参数名+参数值以及方法执行的时间。 @Override public String get(String key) { // long start = System.currentTimeMillis(); // System.out.println("Be
redis学习笔记 MJC410621 redis NoSQL
1)nosql数据库主要由以下特点：非关系型的、分布式的、开源的、水平可扩展的。 1，处理超大量的数据 2，运行在便宜的PC服务器集群上， 3，击碎了性能瓶颈。 1)对数据高并发读写。 2)对海量数据的高效率存储和访问。 3)对数据的高扩展性和高可用性。 redis支持的类型： Sring 类型 set name lijie get name lijie set na
使用redis实现分布式锁 qifeifei
在多节点的系统中，如何实现分布式锁机制，其中用redis来实现是很好的方法之一，我们先来看一下jedis包中，有个类名BinaryJedis,它有个方法如下： public Long setnx(final byte[] key, final byte[] value) { checkIsInMulti(); client.setnx(key, value); ret
BI并非万能，中层业务管理报表要另辟蹊径张老师的菜大数据 BI 商业智能信息化
BI是商业智能的缩写，是可以帮助企业做出明智的业务经营决策的工具，其数据来源于各个业务系统，如ERP、CRM、SCM、进销存、HER、OA等。 BI系统不同于传统的管理信息系统，他号称是一个整体应用的解决方案，是融入管理思想的强大系统：有着系统整体的设计思想，支持对所有
安装rvm后出现rvm not a function 或者ruby -v后提示没安装ruby的问题 wudixiaotie function
1.在~/.bashrc最后加入 [[ -s "$HOME/.rvm/scripts/rvm" ]] && source "$HOME/.rvm/scripts/rvm" 2.重新启动terminal输入： rvm use ruby-2.2.1 --default 把当前安装的ruby版本设为默