写代码的阿呆

Python|数据透视表+cut切分+Kmeans聚类

1 背景
2 数据预处理
- 2.1 读入数据
- 2.2 删去缺失值
3 需求1：把娱乐/明星八卦单独拉出来
- 3.1 检验一下人数
- 3.2 针对score进行降序排列
- 3.3 看分布
- 3.4 分区间段进行统计人数
- 3.5 直接分成三块
- 3.6 等人数的分块
- 3.7 给这部分进行打标签
4 需求2：聚类
- 4.1 先根据娱乐的id将所有含娱乐标签的用户均返回
- 4.2 对反斜杠进行处理
- 4.3 统计2469用户的兴趣点频数
- 4.4 测试迭代器中的组合函数
- 4.5 两两组合
5 封装成函数
6 单独测试
- 6.1 根据上表进行透视表操作然后聚类
7 进行kmeans聚类
- 7.1 建模
- 7.2 拟合模型
- 7.3 查看拟合结果即类别标签
- 7.4 将标签放到原数据框
- 7.5 查看聚类中心
- 7.6 可视化展示
- 7.7 算两个变量有一个为0的的个数
  - 7.7.1 算两个变量的相关系数

背景

现在原始数据是这样：

我们希望首先根据score的大小进行某一标签的人群的一个划分
其次希望得到不同标签用户之间的相关性，即进行聚类，看含有哪些标签的人群更类似，或者说哪些标签之间会有强相关，进而去进行同步推送相关文章。

数据预处理

读入数据

import pandas as pd
df = pd.read_excel('./example_data.xlsx', sheet_name='Sheet1')
print(df.shape)
df.head()

(37142, 3)

	device_uuid	interests_news	interests_score
0	00:08:22:2e:db:fb	体育	0.364912
1	00:08:22:2e:db:fb	体育/中国足球	0.659644
2	00:08:22:2e:db:fb	体育/乒乓球	0.368236
3	00:08:22:2e:db:fb	健康/养生	0.448471
4	00:08:22:2e:db:fb	娱乐	0.263637

df['interests_news'].value_counts()

娱乐/明星八卦      2469
社会           1785
娱乐           1582
娱乐/电视         989
娱乐/综艺         935
健康/养生         881
社会/国际         857
社会/民生         747
要闻/国外         705
军事/军情         702
娱乐/电影         653
军事/装备         615
社会/市井         591
情感/两性         523
健康/医疗         513
要闻/国内         491
财经/商业         487
历史/古代史        436
历史/近现代史       428
汽车/用车         417
房产/购房         406
体育/NBA        394
社会/天气         374
体育/中国足球       368
生活/生活常识技巧     357
历史/世界史        354
体育/国际足球       340
手机/安卓         330
军事            296
美食/美食趣闻       288
             ... 
数码/配件           3
小品              3
科技/新科技          3
教育/演讲           3
财经/创业           3
房产/政策           2
人工智能            2
财经/基金           2
艺术/歌舞           2
人文/风水命理         2
财经/贵金属          2
财经/债券           2
故事              2
汽车/试驾测评         2
动漫/国产动漫         1
艺术/建筑设计         1
社会/违法犯罪         1
搞笑/创意广告         1
互联网/干货          1
教育/外语           1
艺术/乐器           1
体育/极限运动         1
艺术/戏曲           1
体育/赛车           1
人文/美文           1
科技/人工智能         1
演出现场            1
房产/土地           1
游戏/单机游戏         1
财经/保险           1
Name: interests_news, Length: 224, dtype: int64

删去缺失值

df1 = df.dropna()
print(df1.shape)
df1.head()

(31878, 3)

	device_uuid	interests_news	interests_score
0	00:08:22:2e:db:fb	体育	0.364912
1	00:08:22:2e:db:fb	体育/中国足球	0.659644
2	00:08:22:2e:db:fb	体育/乒乓球	0.368236
3	00:08:22:2e:db:fb	健康/养生	0.448471
4	00:08:22:2e:db:fb	娱乐	0.263637

需求1：把娱乐/明星八卦单独拉出来

df_yl = df1[df1['interests_news'] == '娱乐/明星八卦']
print(df_yl.shape)
df_yl.head()

(2469, 3)

	device_uuid	interests_news	interests_score
5	00:08:22:2e:db:fb	娱乐/明星八卦	0.320401
14	00:08:22:4a:bf:fb	娱乐/明星八卦	0.110526
36	283fd380ea20bdb9	娱乐/明星八卦	0.546335
56	359168070332202	娱乐/明星八卦	0.335987
62	38:bc:1a:2f:3d:1c	娱乐/明星八卦	0.244456

检验一下人数

len(df_yl['device_uuid'].unique())

针对score进行降序排列

df_yl_sort = df_yl.sort_values(by = 'interests_score', ascending=0)
df_yl_sort.head()

	device_uuid	interests_news	interests_score
16873	CQk2NThjZWRjNzUwNzE2NDI3CTc0MUFFQ1FIMjJKVlQ%3D	娱乐/明星八卦	0.994818
14027	CQk1MjQyMjdkYTAyOWJjMjBhCUEwMkFBQ1BTTkJMREo%3D	娱乐/明星八卦	0.980142
34036	CQliMTgyYmYxMzVmNzJjNGM5CTc0MUFFQ1FTMkdWREw%3D	娱乐/明星八卦	0.978786
8773	869322020959563	娱乐/明星八卦	0.974777
2967	867246026306168	娱乐/明星八卦	0.973836

看分布

import matplotlib
from matplotlib import pyplot as plt
plt.hist(df_yl['interests_score'])
plt.show()

分区间段进行统计人数

pd.cut(df_yl['interests_score'], bins = 5).value_counts()

(0.199, 0.398]        670
(0.398, 0.597]        606
(-0.000971, 0.199]    603
(0.597, 0.796]        403
(0.796, 0.995]        187
Name: interests_score, dtype: int64

直接分成三块

pd.cut(df_yl['interests_score'], bins = 3).value_counts()

(-0.000971, 0.332]    1061
(0.332, 0.663]         968
(0.663, 0.995]         440
Name: interests_score, dtype: int64

等人数的分块

pd.qcut(df_yl['interests_score'], 3).value_counts()

(0.517, 0.995]        823
(0.263, 0.517]        823
(-0.000976, 0.263]    823
Name: interests_score, dtype: int64

总结：

cut是基于箱子的间隔区间长度一样即等区间
qcut是基于箱子里面的样本量个数分区间里面样本量一致即等频数

给这部分进行打标签

df_yl['yl_label'] = pd.cut(df_yl['interests_score'], bins = 3, labels=['低', '中', '高'])
df_yl.head()

	device_uuid	interests_news	interests_score	yl_label
5	00:08:22:2e:db:fb	娱乐/明星八卦	0.320401	低
14	00:08:22:4a:bf:fb	娱乐/明星八卦	0.110526	低
36	283fd380ea20bdb9	娱乐/明星八卦	0.546335	中
56	359168070332202	娱乐/明星八卦	0.335987	中
62	38:bc:1a:2f:3d:1c	娱乐/明星八卦	0.244456	低

需求2：聚类

先根据娱乐的id将所有含娱乐标签的用户均返回

yl_list = df1[df1['interests_news'] == '娱乐/明星八卦']['device_uuid'].tolist()
print(len(yl_list))

# 这个就是最终的含有娱乐标签的用户情况
df1_all = df1[df1['device_uuid'].isin(yl_list)]
print(df1_all.shape)
df1_all.head()

(22399, 3)

	device_uuid	interests_news	interests_score
0	00:08:22:2e:db:fb	体育	0.364912
1	00:08:22:2e:db:fb	体育/中国足球	0.659644
2	00:08:22:2e:db:fb	体育/乒乓球	0.368236
3	00:08:22:2e:db:fb	健康/养生	0.448471
4	00:08:22:2e:db:fb	娱乐	0.263637

对反斜杠进行处理

遇到的坑：

输出文件的路径名称里不能有 | / \
控制格式输出的时候前面必须得是%d %s 啥的后面是具体的数不要搞懵逼了
DataFrame对某一列进行修改的时候等式左边就把那一列给写上即可不要就没有保留这个DataFrame

# 定义一个转换字符的函数 后面直接用map
def TransChar(x):
    return x.replace('/', '-')

import copy
df1_test = copy.deepcopy(df1_all)
df1_test['interests_news'] = df1_test['interests_news'].map(str).map(TransChar)
df1_all = df1_test
df1_all.head()

	device_uuid	interests_news	interests_score
0	00:08:22:2e:db:fb	体育	0.364912
1	00:08:22:2e:db:fb	体育-中国足球	0.659644
2	00:08:22:2e:db:fb	体育-乒乓球	0.368236
3	00:08:22:2e:db:fb	健康-养生	0.448471
4	00:08:22:2e:db:fb	娱乐	0.263637

统计2469用户的兴趣点频数

df1_all['interests_news'].value_counts()

娱乐-明星八卦    2469
娱乐         1494
社会         1257
娱乐-综艺       805
娱乐-电视       800
社会-国际       663
娱乐-电影       562
社会-民生       560
社会-市井       485
健康-养生       427
财经-商业       392
情感-两性       351
要闻-国外       335
健康-医疗       332
历史-古代史      315
汽车-用车       307
历史-近现代史     307
军事-装备       274
军事-军情       269
手机-安卓       256
体育-NBA      246
房产-购房       242
美食-美食趣闻     234
体育-国际足球     232
体育-中国足球     231
历史-世界史      230
要闻-国内       220
社会-天气       206
搞笑          189
社会-交通出行     187
           ... 
数码-配件         3
科技-新科技        3
音乐-舞蹈         3
娱乐-娱乐资讯       3
小品            3
房产-房企         3
游戏-联机游戏       3
曲艺-杂技         2
舞蹈-广场舞        2
汽车-试驾测评       2
故事            2
财经-基金         2
艺术-歌舞         2
人文-风水命理       2
房产-政策         1
互联网-干货        1
财经-创业         1
搞笑-创意广告       1
艺术-戏曲         1
财经-债券         1
教育-演讲         1
社会-违法犯罪       1
艺术-乐器         1
体育-赛车         1
体育-极限运动       1
人工智能          1
游戏-单机游戏       1
动漫-国产动漫       1
教育-外语         1
演出现场          1
Name: interests_news, Length: 217, dtype: int64

# 筛选频数大于100的
yl_label_all = df1_all['interests_news'].value_counts().reset_index()
# print(yl_label_all)
yl_label_all = yl_label_all[yl_label_all['interests_news'] > 100]
# print(yl_label_all)
# 保留反斜杠的
yl_label_all_list = yl_label_all['index'].tolist()
# print(yl_label_all_list)
# 筛选出二级标签的 只留下这么多
yl_label_need_list = [x for x in yl_label_all_list if '-' in x]
print(len(yl_label_need_list))
yl_label_need_list

45





['娱乐-明星八卦',
 '娱乐-综艺',
 '娱乐-电视',
 '社会-国际',
 '娱乐-电影',
 '社会-民生',
 '社会-市井',
 '健康-养生',
 '财经-商业',
 '情感-两性',
 '要闻-国外',
 '健康-医疗',
 '历史-古代史',
 '汽车-用车',
 '历史-近现代史',
 '军事-装备',
 '军事-军情',
 '手机-安卓',
 '体育-NBA',
 '房产-购房',
 '美食-美食趣闻',
 '体育-国际足球',
 '体育-中国足球',
 '历史-世界史',
 '要闻-国内',
 '社会-天气',
 '社会-交通出行',
 '时尚-时装',
 '生活-生活常识技巧',
 '汽车-行业',
 '美食-食谱',
 '旅游-美景',
 '育儿-亲子',
 '情感-心理',
 '家居-家装',
 '人文-人文科普',
 '娱乐-音乐',
 '教育-高校',
 '互联网-电商',
 '军事-军人',
 '社会-法制',
 '汽车-新车',
 '体育-CBA',
 '社会-市政基建',
 '财经-股票']

测试迭代器中的组合函数

from itertools import combinations
com_all = list(combinations([1,2,3,4,5], 2))
com_all[0][1]

两两组合

from itertools import combinations
com_all = list(combinations(yl_label_need_list, 2)) # 990种组合 45*44/2
print(len(com_all))
com_all[0:5]

990





[('娱乐-明星八卦', '娱乐-综艺'),
 ('娱乐-明星八卦', '娱乐-电视'),
 ('娱乐-明星八卦', '社会-国际'),
 ('娱乐-明星八卦', '娱乐-电影'),
 ('娱乐-明星八卦', '社会-民生')]

总结：

如果想要实现从一个list中获得所有的两两组合可以使用combinations函数

封装成函数

df1_all.head()

	device_uuid	interests_news	interests_score
0	00:08:22:2e:db:fb	体育	0.632
1	00:08:22:2e:db:fb	体育-中国足球	0.940
2	00:08:22:2e:db:fb	体育-乒乓球	0.975
3	00:08:22:2e:db:fb	健康-养生	0.695
4	00:08:22:2e:db:fb	娱乐	0.655

总结遇到的坑：

输出文件路径不能有一些特殊的字符这个得注意前面也提到过
如果老是输出有问题不要急躁拿一个小demo出来跑看看到底是哪一步出了问题一层一层的去寻找
控制格式输出的时候前面肯定是 %s %d 后面是具体的字母

from sklearn.cluster import KMeans
import pandas as pd
import numpy as np
import matplotlib
from matplotlib import pyplot as plt
import time

# 目的是为了去掉两个标签中有任意一个为0的行 会影响到聚类结果
def rule(x,y):
    if x == 0 or y == 0:
        return 1
    else:
        return 0
    
def Cluster2(label1, label2):
    try:
        # 放在输出文件前面
        # 1 选取娱乐 社会作为合并标签并筛选出相关用户
        clus_1 = [label1, label2]
        df1_clus_1 = df1_all[df1_all['interests_news'].isin(clus_1)]
        print('%s,%s,共有 %s 样本量'% (label1, label2, df1_clus_1.shape[0]))
        df1_clus_1.head()

        # 2 根据上表进行透视表操作然后聚类
        df1_clus_1_ = pd.pivot_table(df1_clus_1,index=["device_uuid"],values=["interests_score"],
                   columns=["interests_news"],aggfunc=[sum])
        df1_clus_1_.head()
        # 数据规整
        # 修整
        df1_clus_1_ = df1_clus_1_.fillna(0)
        df1_clus_1_.columns = df1_clus_1_.columns.droplevel()
        df1_clus_1_.columns = df1_clus_1_.columns.droplevel()
        # 把列名去掉
        del df1_clus_1_.columns.name
        df1_clus_1_.head()
        # 把索引变成列名
        df1_clus_1_['device_uuid'] = df1_clus_1_.index
        # df1_clus_1_.reset_index(drop=True)
        df1_clus_1_.head()
        # 重命名索引
        df1_clus_1_.index = range(len(df1_clus_1_))
        print('数据规整ok之后的样子为')
        print(df1_clus_1_.shape)
        print(df1_clus_1_.head())

        # 3 把任一标签的score为0的删去
        df1_clus_1_['Zero_num'] = df1_clus_1_.apply(lambda x : rule(x[label1], x[label2]), axis=1)
        print('两标签任一为0的总人数有： ', df1_clus_1_['Zero_num'].sum())
        # 过滤掉为1的
        df1_clus_1_ = df1_clus_1_[df1_clus_1_['Zero_num']!=1]
        # 再次重命名索引
        df1_clus_1_.index = range(len(df1_clus_1_))
        print('过滤掉任一为0之后的数据长这样：')
        print(df1_clus_1_.shape)
        print(df1_clus_1_.head())

        # 4 进行聚类
        # 建模
        estimator = KMeans(n_clusters=2, random_state=23)
        # 拟合
        estimator.fit(df1_clus_1_.iloc[:,:2])
        # 打标签
        df1_clus_1_['clu_label'] = estimator.labels_
        # 查看聚类中心
        centroid = estimator.cluster_centers_
        print('聚类中心为: ', centroid)

        # 5 绘图
        mark = ['or', 'ob']
        #画出所有样例点 属于同一分类的绘制同样的颜色
        for i in range(len(df1_clus_1_)):
            plt.plot(df1_clus_1_.iloc[i,0], df1_clus_1_.iloc[i,1], mark[estimator.labels_[i]]) #mark[markIndex])
        plt.show()    
        plt.close() # 关闭窗口
        return df1_clus_1_
    
    except Exception as e:
        print('报错信息为:  ', e)
    

t0 = time.time()
for i in range(len(com_all)):
    print('正在输出第 %d 种组合的聚类结果' % (i+1))
    print('△'*30)
    try:
        df1_clus_1_ = Cluster2(com_all[i][0], com_all[i][1])
    # 6 导出数据
#     print(com_all[i][0])
#     print(com_all[i][1])
        df1_clus_1_.to_csv('./娱乐大类/[%d]-[%s]_[%s]聚类结果.csv' % (i+1, str(com_all[i][0]), str(com_all[i][1])),
                           index = False, encoding = 'gbk')
    except Exception as e:
         print('第 %d 组合的报错信息为: %s' % (i+1, e))
    break
        
t1 = time.time()
print('组合所需时间为：%.2f s' % (t1-t0))

正在输出第 1 种组合的聚类结果
△△△△△△△△△△△△△△△△△△△△△△△△△△△△△△
娱乐-明星八卦,娱乐-综艺,共有 3274 样本量
数据规整ok之后的样子为
(2469, 3)
    娱乐-明星八卦     娱乐-综艺     device_uuid
0  0.875306  0.509272  86164703743646
1  0.469882  0.148727  86164703912396
2  0.077557  0.237983  86168103831042
3  0.203994  0.000000  86168103957564
4  0.001791  0.000000  86185103101184
两标签任一为0的总人数有：  1664
过滤掉任一为0之后的数据长这样：
(805, 4)
    娱乐-明星八卦     娱乐-综艺     device_uuid  Zero_num
0  0.875306  0.509272  86164703743646         0
1  0.469882  0.148727  86164703912396         0
2  0.077557  0.237983  86168103831042         0
3  0.632685  0.092836  86185103874437         0
4  0.158385  0.186337  86208603366335         0
聚类中心为:  [[0.66513518 0.32434565]
 [0.22094246 0.38035482]]

组合所需时间为：2.16 s

单独测试

clus_1 = ['娱乐', '社会']
df1_clus_1 = df1_all[df1_all['interests_news'].isin(clus_1)]
print(df1_clus_1.shape)
df1_clus_1.head()

(2751, 3)

	device_uuid	interests_news	interests_score
4	00:08:22:2e:db:fb	娱乐	0.263637
10	00:08:22:2e:db:fb	社会	0.444324
13	00:08:22:4a:bf:fb	娱乐	0.007945
35	283fd380ea20bdb9	娱乐	0.104760
44	283fd380ea20bdb9	社会	0.220708

根据上表进行透视表操作然后聚类

df1_clus_1_ = pd.pivot_table(df1_clus_1,index=["device_uuid"],values=["interests_score"],
               columns=["interests_news"],aggfunc=[sum])
df1_clus_1_.head()

	sum
	interests_score
interests_news	娱乐	社会
device_uuid
86164703743646	0.331710	NaN
86164703912396	0.034218	0.147317
86168103831042	0.197933	0.622465
86185103101184	NaN	0.161907
86185103527445	NaN	0.546773

总结1：

使用pandas中的pivot_table函数可以起到和excel透视表一样的功能
index为根据这个进行分组
values则是要填充的值为这个
columns表示列名
aggfunc为values放进去是怎么放？是sum还是mean还是len

去掉pivot_table之后产生的多重索引的方法：

使用columns.droplevel()函数
删去列名 columns.name

# 修整
df1_clus_1_ = df1_clus_1_.fillna(0)
df1_clus_1_.columns = df1_clus_1_.columns.droplevel()
df1_clus_1_.columns = df1_clus_1_.columns.droplevel()
# 把列名去掉
del df1_clus_1_.columns.name
df1_clus_1_.head()

	娱乐	社会
device_uuid
86164703743646	0.331710	0.000000
86164703912396	0.034218	0.147317
86168103831042	0.197933	0.622465
86185103101184	0.000000	0.161907
86185103527445	0.000000	0.546773

# 把索引变成列名
df1_clus_1_['device_uuid'] = df1_clus_1_.index
# df1_clus_1_.reset_index(drop=True)
df1_clus_1_.head()

	娱乐	社会	device_uuid
device_uuid
86164703743646	0.331710	0.000000	86164703743646
86164703912396	0.034218	0.147317	86164703912396
86168103831042	0.197933	0.622465	86168103831042
86185103101184	0.000000	0.161907	86185103101184
86185103527445	0.000000	0.546773	86185103527445

# 重命名索引
df1_clus_1_.index = range(len(df1_clus_1_))
print(df1_clus_1_.shape)
df1_clus_1_.head()

(1821, 3)

	娱乐	社会	device_uuid
0	0.331710	0.000000	86164703743646
1	0.034218	0.147317	86164703912396
2	0.197933	0.622465	86168103831042
3	0.000000	0.161907	86185103101184
4	0.000000	0.546773	86185103527445

进行kmeans聚类

建模

from sklearn.cluster import KMeans
estimator = KMeans(n_clusters=2, random_state=23)
estimator

KMeans(algorithm='auto', copy_x=True, init='k-means++', max_iter=300,
    n_clusters=2, n_init=10, n_jobs=None, precompute_distances='auto',
    random_state=23, tol=0.0001, verbose=0)

拟合模型

df1_clus_1_.iloc[:,:2].head()

	娱乐	社会
0	0.331710	0.000000
1	0.034218	0.147317
2	0.197933	0.622465
3	0.000000	0.161907
4	0.000000	0.546773

estimator.fit(df1_clus_1_.iloc[:,:2])

KMeans(algorithm='auto', copy_x=True, init='k-means++', max_iter=300,
    n_clusters=2, n_init=10, n_jobs=None, precompute_distances='auto',
    random_state=23, tol=0.0001, verbose=0)

查看拟合结果即类别标签

estimator.labels_

array([1, 1, 0, ..., 1, 1, 1], dtype=int32)

将标签放到原数据框

df1_clus_1_['clu_label'] = estimator.labels_
df1_clus_1_.head()

	娱乐	社会	device_uuid	clu_label
0	0.331710	0.000000	86164703743646	1
1	0.034218	0.147317	86164703912396	1
2	0.197933	0.622465	86168103831042	0
3	0.000000	0.161907	86185103101184	1
4	0.000000	0.546773	86185103527445	0

df1_clus_1_.iloc[0,0]

0.33171015445836183

查看聚类中心

centroid = estimator.cluster_centers_
centroid

array([[0.25107961, 0.53625566],
       [0.33770399, 0.07484127]])

可视化展示

mark = ['or', 'ob']
#画出所有样例点 属于同一分类的绘制同样的颜色
for i in range(len(df1_clus_1_)):
    plt.plot(df1_clus_1_.iloc[i,0], df1_clus_1_.iloc[i,1], mark[estimator.labels_[i]]) #mark[markIndex])

算两个变量有一个为0的的个数

思路：新增一列为0的则记为1

def rule(x,y):
    if x == 0 or y == 0:
        return 1
    else:
        return 0

df1_clus_1_['Zero_num'] = df1_clus_1_.apply(lambda x : rule(x['娱乐'], x['社会']), axis=1)
print('两标签任一为0的总人数有： ', df1_clus_1_['Zero_num'].sum())
# 过滤掉为1的
df1_clus_1_ = df1_clus_1_[df1_clus_1_['Zero_num']!=1]
df1_clus_1_.head()

两标签任一为0的总人数有：  891

	娱乐	社会	device_uuid	clu_label
1	0.034218	0.147317	86164703912396	1
2	0.197933	0.622465	86168103831042	0
7	0.077339	0.388035	86208603366335	0
10	0.402624	0.212100	86247803073494	1
11	0.237287	0.268475	86249303752541	1

891 / 2751

0.3238822246455834

算两个变量的相关系数

import numpy as np
np.corrcoef(df1_clus_1_['娱乐'], df1_clus_1_['社会'])

array([[ 1.        , -0.02175822],
       [-0.02175822,  1.        ]])

数据

example_data

你可能感兴趣的:(Python,机器学习,数据透视表,cut,函数,Kmeans聚类,组合combinations)

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
C语言宏函数南林yan C语言 c语言
一、什么是宏函数？通过宏定义的函数是宏函数。如下，编译器在预处理阶段会将Add(x,y)替换为((x)*(y))#defineAdd(x,y)((x)*(y))#defineAdd(x,y)((x)*(y))intmain(){inta=10;intb=20;intd=10;intc=Add(a+d,b)*2;cout<
C语言如何定义宏函数？小九格物 c语言
在C语言中，宏函数是通过预处理器定义的，它在编译之前替换代码中的宏调用。宏函数可以模拟函数的行为，但它们不是真正的函数，因为它们在编译时不会进行类型检查，也不会分配存储空间。宏函数的定义通常使用#define指令，后面跟着宏的名称和参数列表，以及宏展开后的代码。宏函数的定义方式：1.基本宏函数：这是最简单的宏函数形式，它直接定义一个表达式。#defineSQUARE(x)((x)*(x))2.带参
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
【一起学Rust | 设计模式】习惯语法——使用借用类型作为参数、格式化拼接字符串、构造函数广龙宇一起学Rust #Rust设计模式 rust 设计模式开发语言
提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档文章目录前言一、使用借用类型作为参数二、格式化拼接字符串三、使用构造函数总结前言Rust不是传统的面向对象编程语言，它的所有特性，使其独一无二。因此，学习特定于Rust的设计模式是必要的。本系列文章为作者学习《Rust设计模式》的学习笔记以及自己的见解。因此，本系列文章的结构也与此书的结构相同（后续可能会调成结构），基本上分为三个部分
回溯 Leetcode 332 重新安排行程 mmaerd Leetcode刷题学习记录 leetcode 算法职场和发展
重新安排行程Leetcode332学习记录自代码随想录给你一份航线列表tickets，其中tickets[i]=[fromi,toi]表示飞机出发和降落的机场地点。请你对该行程进行重新规划排序。所有这些机票都属于一个从JFK（肯尼迪国际机场）出发的先生，所以该行程必须从JFK开始。如果存在多种有效的行程，请你按字典排序返回最小的行程组合。例如，行程[“JFK”,“LGA”]与[“JFK”,“LGB
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
每日一题——第八十四题互联网打工人no1 C语言程序设计每日一练 c语言
题目：编写函数1、输入10个职工的姓名和职工号2、按照职工由大到小顺序排列，姓名顺序也随之调整3、要求输入一个职工号，用折半查找法找出该职工的姓名#define_CRT_SECURE_NO_WARNINGS#include#include#defineMAX_EMPLOYEES10typedefstruct{intid;charname[50];}Empolyee;voidinputEmploye
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
从鸡肉高汤到记忆的魔法再到有效提示的艺术步子哥人工智能
还记得小时候那些天马行空的白日梦吗？也许只要按下键盘上的某个神奇组合，电脑就会发出滴滴的声响，一个隐藏的世界突然在你眼前展开，让你获得超凡的能力，摆脱平凡的生活。这听起来像是玩过太多电子游戏的幻想，但实际上，间隔重复系统给人的感觉惊人地相似。在最佳状态下，这些系统就像魔法一样神奇。本文将以一个看似平凡的鸡肉高汤食谱为例，深入浅出地探讨如何编写有效的间隔重复提示，让你像掌握烹饪技巧一样轻松地掌握记忆
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day17笔记-高阶函数 ~在杰难逃~ Python 笔记 python 开发语言 pycharm 数据分析
高阶函数【重点掌握】函数的本质：函数是一个变量，函数名是一个变量名，一个函数可以作为另一个函数的参数或返回值使用如果A函数作为B函数的参数，B函数调用完成之后，会得到一个结果，则B函数被称为高阶函数常用的高阶函数：map(),reduce(),filter(),sorted()1.map()map(func,iterable)，返回值是一个iterator【容器，迭代器】func:函数iterab
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
Faiss Tips：高效向量搜索与聚类的利器焦习娜Samantha
FaissTips：高效向量搜索与聚类的利器faiss_tipsSomeusefultipsforfaiss项目地址:https://gitcode.com/gh_mirrors/fa/faiss_tips项目介绍Faiss是由FacebookAIResearch开发的一个用于高效相似性搜索和密集向量聚类的库。它支持多种硬件平台，包括CPU和GPU，能够在海量数据集上实现快速的近似最近邻搜索（AN
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
ARM驱动学习之5 LEDS驱动 JT灬新一嵌入式 C 底层 arm开发学习单片机
ARM驱动学习之5LEDS驱动知识点：•linuxGPIO申请函数和赋值函数–gpio_request–gpio_set_value•三星平台配置GPIO函数–s3c_gpio_cfgpin•GPIO配置输出模式的宏变量–S3C_GPIO_OUTPUT注意点：DRIVER_NAME和DEVICE_NAME匹配。实现步骤：1.加入需要的头文件：//Linux平台的gpio头文件#include//三
Rust基础知识 GRKF15 rust 开发语言后端
1.Rust语言简介1.1基础语法变量声明：let关键字用于声明变量，可以指定或不指定类型，如leta=10;和letmutc=30i32;。函数定义：使用fn关键字定义函数，并指定参数类型及返回类型，如fnadd(i:i32,j:i32)->i32{i+j}。控制流：包括if、else等，控制语句后需要使用;来结束语句。1.2数据类型整数类型：i8、i16、i32、i64、i128，以及无符号的
Faiss：高效相似性搜索与聚类的利器网络·魚大数据 faiss
Faiss是一个针对大规模向量集合的相似性搜索库，由FacebookAIResearch开发。它提供了一系列高效的算法和数据结构，用于加速向量之间的相似性搜索，特别是在大规模数据集上。本文将介绍Faiss的原理、核心功能以及如何在实际项目中使用它。Faiss原理：近似最近邻搜索：Faiss的核心功能之一是近似最近邻搜索，它能够高效地在大规模数据集中找到与给定查询向量最相似的向量。这种搜索是近似的，
java类加载顺序 3213213333332132 java
package com.demo; /** * @Description 类加载顺序 * @author FuJianyong * 2015-2-6上午11:21:37 */ public class ClassLoaderSequence { String s1 = "成员属性"; static String s2 = "
Hibernate与mybitas的比较 BlueSkator sql Hibernate 框架 ibatis orm
第一章 Hibernate与MyBatis Hibernate 是当前最流行的O/R mapping框架，它出身于sf.net，现在已经成为Jboss的一部分。 Mybatis 是另外一种优秀的O/R mapping框架。目前属于apache的一个子项目。 MyBatis 参考资料官网：http:
php多维数组排序以及实际工作中的应用 dcj3sjt126com PHP usort uasort
自定义排序函数返回false或负数意味着第一个参数应该排在第二个参数的前面, 正数或true反之, 0相等usort不保存键名uasort 键名会保存下来uksort 排序是对键名进行的 <!doctype html> <html lang="en"> <head> <meta charset="utf-8&q
DOM改变字体大小周华华前端
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
c3p0的配置 g21121 c3p0
c3p0是一个开源的JDBC连接池，它实现了数据源和JNDI绑定，支持JDBC3规范和JDBC2的标准扩展。c3p0的下载地址是：http://sourceforge.net/projects/c3p0/这里可以下载到c3p0最新版本。以在spring中配置dataSource为例：  <bean name="prope
Java获取工程路径的几种方法 510888780 java
第一种： File f = new File(this.getClass().getResource("/").getPath()); System.out.println(f); 结果: C:\Documents%20and%20Settings\Administrator\workspace\projectName\bin 获取当前类的所在工程路径; 如果不加“
在类Unix系统下实现SSH免密码登录服务器 Harry642 免密 ssh
1.客户机 (1)执行ssh-keygen -t rsa -C "[email protected]"生成公钥，xxx为自定义大email地址 (2)执行scp ~/.ssh/id_rsa.pub root@xxxxxxxxx:/tmp将公钥拷贝到服务器上，xxx为服务器地址 (3)执行cat
Java新手入门的30个基本概念一 aijuans java java 入门新手
在我们学习Java的过程中,掌握其中的基本概念对我们的学习无论是J2SE,J2EE,J2ME都是很重要的,J2SE是Java的基础,所以有必要对其中的基本概念做以归纳,以便大家在以后的学习过程中更好的理解java的精髓,在此我总结了30条基本的概念。　　Java概述:　　目前Java主要应用于中间件的开发(middleware)---处理客户机于服务器之间的通信技术,早期的实践证明,Java不适合
Memcached for windows 简单介绍 antlove java Web windows cache memcached
1. 安装memcached server a. 下载memcached-1.2.6-win32-bin.zip b. 解压缩，dos 窗口切换到 memcached.exe所在目录，运行memcached.exe -d install c.启动memcached Server,直接在dos窗口键入 net start "memcached Server&quo
数据库对象的视图和索引百合不是茶索引 oeacle数据库视图
视图视图是从一个表或视图导出的表，也可以是从多个表或视图导出的表。视图是一个虚表，数据库不对视图所对应的数据进行实际存储，只存储视图的定义，对视图的数据进行操作时,只能将字段定义为视图,不能将具体的数据定义为视图为什么oracle需要视图; &
Mockito(一) --入门篇 bijian1013 持续集成 mockito 单元测试
Mockito是一个针对Java的mocking框架，它与EasyMock和jMock很相似，但是通过在执行后校验什么已经被调用，它消除了对期望行为（expectations）的需要。其它的mocking库需要你在执行前记录期望行为（expectations），而这导致了丑陋的初始化代码。 &nb
精通Oracle10编程SQL(5)SQL函数 bijian1013 oracle 数据库 plsql
/* * SQL函数 */ --数字函数 --ABS(n):返回数字n的绝对值 declare v_abs number(6,2); begin v_abs:=abs(&no); dbms_output.put_line('绝对值：'||v_abs); end; --ACOS(n):返回数字n的反余弦值，输入值的范围是-1~1，输出值的单位为弧度
【Log4j一】Log4j总体介绍 bit1129 log4j
Log4j组件：Logger、Appender、Layout Log4j核心包含三个组件：logger、appender和layout。这三个组件协作提供日志功能：日志的输出目标日志的输出格式日志的输出级别(是否抑制日志的输出) logger继承特性 A logger is said to be an ancestor of anothe
Java IO笔记白糖_ java
public static void main(String[] args) throws IOException { //输入流 InputStream in = Test.class.getResourceAsStream("/test"); InputStreamReader isr = new InputStreamReader(in); Bu
Docker 监控 ronin47 docker监控
目前项目内部署了docker，于是涉及到关于监控的事情，参考一些经典实例以及一些自己的想法，总结一下思路。 1、关于监控的内容监控宿主机本身监控宿主机本身还是比较简单的，同其他服务器监控类似，对cpu、network、io、disk等做通用的检查，这里不再细说。额外的，因为是docker的
java-顺时针打印图形 bylijinnan java
一个画图程序要求打印出： 1.int i=5; 2.1 2 3 4 5 3.16 17 18 19 6 4.15 24 25 20 7 5.14 23 22 21 8 6.13 12 11 10 9 7. 8.int i=6 9.1 2 3 4 5 6 10.20 21 22 23 24 7 11.19
关于iReport汉化版强制使用英文的配置方法 Kai_Ge iReport汉化英文版
对于那些具有强迫症的工程师来说，软件汉化固然好用，但是汉化不完整却极为头疼，本方法针对iReport汉化不完整的情况，强制使用英文版，方法如下：在 iReport 安装路径下的 etc/ireport.conf 里增加红色部分启动参数，即可变为英文版。 # ${HOME} will be replaced by user home directory accordin
[并行计算]论宇宙的可计算性 comsci 并行计算
现在我们知道,一个涡旋系统具有并行计算能力.按照自然运动理论,这个系统也同时具有存储能力,同时具备计算和存储能力的系统,在某种条件下一般都会产生意识...... 那么,这种概念让我们推论出一个结论 &nb
用OpenGL实现无限循环的coverflow dai_lm android coverflow
网上找了很久，都是用Gallery实现的，效果不是很满意，结果发现这个用OpenGL实现的，稍微修改了一下源码，实现了无限循环功能源码地址： https://github.com/jackfengji/glcoverflow public class CoverFlowOpenGL extends GLSurfaceView implements GLSurfaceV
JAVA数据计算的几个解决方案1 datamachine java Hibernate 计算
老大丢过来的软件跑了10天，摸到点门道，正好跟以前攒的私房有关联，整理存档。 -----------------------------华丽的分割线------------------------------------- 数据计算层是指介于数据存储和应用程序之间，负责计算数据存储层的数据，并将计算结果返回应用程序的层次。J &nbs
简单的用户授权系统,利用给user表添加一个字段标识管理员的方式 dcj3sjt126com yii
怎么创建一个简单的(非 RBAC)用户授权系统通过查看论坛，我发现这是一个常见的问题，所以我决定写这篇文章。本文只包括授权系统.假设你已经知道怎么创建身份验证系统(登录)。数据库首先在 user 表创建一个新的字段(integer 类型),字段名 'accessLevel',它定义了用户的访问权限扩展 CWebUser 类在配置文件(一般为 protecte
未选之路 dcj3sjt126com 诗
作者:罗伯特*费罗斯特黄色的树林里分出两条路, 可惜我不能同时去涉足, 我在那路口久久伫立, 我向着一条路极目望去, 直到它消失在丛林深处. 但我却选了另外一条路, 它荒草萋萋,十分幽寂; 显得更诱人,更美丽, 虽然在这两条小路上, 都很少留下旅人的足迹. 那天清晨落叶满地, 两条路都未见脚印痕迹. 呵,留下一条路等改日再
Java处理15位身份证变18位蕃薯耀 18位身份证变15位 15位身份证变18位身份证转换
15位身份证变18位，18位身份证变15位 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 201
SpringMVC4零配置--应用上下文配置【AppConfig】 hanqunfeng springmvc4
从spring3.0开始，Spring将JavaConfig整合到核心模块，普通的POJO只需要标注@Configuration注解，就可以成为spring配置类，并通过在方法上标注@Bean注解的方式注入bean。 Xml配置和Java类配置对比如下： applicationContext-AppConfig.xml <!-- 激活自动代理功能参看：
Android中webview跟JAVASCRIPT中的交互 jackyrong JavaScript html android 脚本
在android的应用程序中,可以直接调用webview中的javascript代码,而webview中的javascript代码,也可以去调用ANDROID应用程序(也就是JAVA部分的代码).下面举例说明之: 1 JAVASCRIPT脚本调用android程序要在webview中,调用addJavascriptInterface(OBJ,int
8个最佳Web开发资源推荐 lampcy 编程 Web 程序员
Web开发对程序员来说是一项较为复杂的工作，程序员需要快速地满足用户需求。如今很多的在线资源可以给程序员提供帮助，比如指导手册、在线课程和一些参考资料，而且这些资源基本都是免费和适合初学者的。无论你是需要选择一门新的编程语言，或是了解最新的标准，还是需要从其他地方找到一些灵感，我们这里为你整理了一些很好的Web开发资源，帮助你更成功地进行Web开发。这里列出10个最佳Web开发资源，它们都是受
架构师之面试------jdk的hashMap实现 nannan408 HashMap
1.前言。如题。 2.详述。 (1)hashMap算法就是数组链表。数组存放的元素是键值对。jdk通过移位算法（其实也就是简单的加乘算法），如下代码来生成数组下标(生成后indexFor一下就成下标了）。 static int hash(int h) { h ^= (h >>> 20) ^ (h >>>
html禁止清除input文本输入缓存 Rainbow702 html 缓存 input 输入框 change
多数浏览器默认会缓存input的值，只有使用ctl+F5强制刷新的才可以清除缓存记录。如果不想让浏览器缓存input的值，有2种方法：方法一：在不想使用缓存的input中添加 autocomplete="off"; <input type="text" autocomplete="off" n
POJO和JavaBean的区别和联系 tjmljw POJO java beans
POJO 和JavaBean是我们常见的两个关键字，一般容易混淆，POJO全称是Plain Ordinary Java Object / Pure Old Java Object，中文可以翻译成：普通Java类，具有一部分getter/setter方法的那种类就可以称作POJO，但是JavaBean则比 POJO复杂很多， Java Bean 是可复用的组件，对 Java Bean 并没有严格的规
java中单例的五种写法 liuxiaoling java 单例
/** * 单例模式的五种写法： * 1、懒汉 * 2、恶汉 * 3、静态内部类 * 4、枚举 * 5、双重校验锁 */ /** * 五、双重校验锁，在当前的内存模型中无效 */ class LockSingleton { private volatile static LockSingleton singleton; pri

Python|数据透视表+cut切分+Kmeans聚类

目录

背景

数据预处理

读入数据

删去缺失值

需求1：把娱乐/明星八卦单独拉出来

检验一下人数

针对score进行降序排列

看分布

分区间段进行统计人数

直接分成三块

等人数的分块

给这部分进行打标签

需求2：聚类

先根据娱乐的id将所有含娱乐标签的用户均返回

对反斜杠进行处理

统计2469用户的兴趣点频数

测试迭代器中的组合函数

两两组合

封装成函数

单独测试

根据上表进行透视表操作然后聚类

进行kmeans聚类

建模

拟合模型

查看拟合结果 即类别标签

将标签放到原数据框

查看聚类中心

可视化展示

算两个变量有一个为0的的个数

算两个变量的相关系数

数据

你可能感兴趣的:(Python,机器学习,数据透视表,cut,函数,Kmeans聚类,组合combinations)

查看拟合结果即类别标签