不牌不改

【大数据】蔬菜价格分析（QDU）

【大数据】蔬菜价格分析（QDU）
【大数据】美国新冠肺炎疫情分析——错误版（QDU）
【大数据】美国新冠肺炎疫情分析——正确版（QDU）
【大数据】乳腺癌预测——老师给的链接（QDU）
由于kaggle上“猫狗大战”的测试集标签是错的，所以没做出来，用的github上的代码
【大数据】《红楼梦》作者分析（QDU）

问题分析

“蔬菜价格.xlsx”中记录中从2018年9月29号到2010年1月30日部分蔬菜和部分肉类的价格，其中涉及四十种蔬菜和二十三种肉类。

通过观察，并考虑到蔬菜与肉类合并成一类进行分析会使得事务总数过多，支持度会过低，缺乏合理性。因此采取对蔬菜和肉类分开进行关联性分析的方案，分别构建蔬菜价格信息表和肉类价格信息表，蔬菜间建立蔬菜关联规则，肉类间建立肉类关联规则。

对于同一日期中共同涨、跌的蔬菜或肉类分为一组，作为一组事务，而不对价格未发生变化的食品进行处理。对全部事务进行关联性分析后对具有关联性的组绘制价格曲线观察，并分析合理性。

解决思路

解决方案

读入数据

先将xls文件改成xlxs文件，使用xlrd库中的open_workbook函数打开文件并获取文件中的全部sheet，再对返回值调用sheets()[0]获取第一个sheet，即要处理的数据表格。

获取日期

之所以要获取日期列表，是因为在对食品价格波动进行分析时需要对相邻两日的价格做差得到价格差，将价格差作为分析价格波动重要指标。

遍历数据表格的第一列（对应列索引编号为0），对遍历到的日期数据使用datetime库中的datetime函数将单元格内容转换为日期并且添加至集合中，通过集合自动去重的功能得到无重复且乱序的全部日期。集合中的日期并不是按照添加的顺序排列的，因此需要调用sort函数将日期列表按照原始数据表格中的日期出现顺序排序，保证按顺序对应每日的价格信息。

得到的日期列表（部分）如下：

[datetime.datetime(2009, 6, 11, 0, 0),
 datetime.datetime(2010, 1, 30, 0, 0),
 datetime.datetime(2010, 1, 29, 0, 0),
 datetime.datetime(2010, 1, 28, 0, 0),
 datetime.datetime(2010, 1, 27, 0, 0),
 ...
 datetime.datetime(2008, 10, 3, 0, 0),
 datetime.datetime(2008, 10, 2, 0, 0),
 datetime.datetime(2008, 10, 1, 0, 0),
 datetime.datetime(2008, 9, 30, 0, 0),
 datetime.datetime(2008, 9, 29, 0, 0)]

处理数据

对于蔬菜遍历原始数据表格中的第二、三列（对应列索引编号为1、2），对于肉类遍历原始数据表格中的第四、五列（对应列索引编号为3、4），以字典的形式保存食品名称和食品价格，其中以食品名称为键，以食品价格为值，目的是方便建立DataFrame。使用得到的以字典为项的列表进行去重、填充缺失值等操作后构建DataFrame，并将DataFrame的行索引设置为获取到的日期，返回最终的DataFrame。

存在的问题一：表格中存在不需要的处理的信息

对于不需要处理的信息比如许多文字：“日期”、“蔬菜名”、“肉食禽蛋”等均为非表格数据，无需进行统计。在遍历表格时需要对这类信息特殊判断，不加入表格数据。
数据存在的问题二：部分蔬菜和肉类在某些日期未统计价格

存在部分蔬菜和肉类在某些日期未统计价格，对于当某种食品的缺失数据多于设定的阈值时将此种食品从待分析的数据中排除。而对于未被排除的食品可能仍存在缺失值，我采用向前填充的方式将缺失值填充为后续最近日期的价格，这样可以有效地提高食品保留率并且尽可能地保证了保留食品价格的合理性。
数据存在的问题三：同一日期的价格信息重复统计

经过预处理和分析，发现2009年6月11日的食品价格统计过多次，因此在提取数据的基础上还需剔除个别数据。对于剩余的无重复数据，采用以日期为索引，以食品名称为列名，以价格为表中数据的方式保存食品价格变化信息，并以索引和价格分别为横纵坐标绘制各种食品的价格曲线，观察食品的价格变化曲线。
数据存在的问题四：区分每日的价格信息

由于每日的价格信息显示在一种表中且共用相同的列，因此需要对不同日期的数据进行分割。以连续空单元格的数量作为分割标准，当表中某行的名称和价格同时缺失时判断为空单元格，当空单元格连续出现大于1次时说明此处应两个日期数据的分界线。
数据存在的问题：空单元格

空单元格的判定标准不能单看其ctype属性是否为0，当单元格中的值为'\u3000'时在表格中显示为空。

处理后的蔬菜（部分）价格信息表如下：

	元葱	冬瓜	土豆	大头菜	大白菜	大蒜	尖椒	山药	油菜	生姜	胡萝卜	芋头	芸豆	芹菜	茄子	茭瓜	茼蒿	莴苣	菜花	菠菜	葱	蒜苔	藕	西红柿	豆芽	青椒	青萝卜	韭菜	香菜	鲜蘑菇	黄瓜
2008-09-29	0.9	0.7	1.7	1.1	0.90	1.0	1.1	4.0	1.2	3.6	1.8	1.4	2.4	1.1	1.0	1.2	3.6	1.6	2.0	3.0	1.4	4.0	2.4	1.3	1.4	1.4	1.2	1.6	2.0	3.6	2.0
2008-09-30	0.9	0.7	0.7	1.1	0.90	1.0	1.1	4.0	1.0	3.6	1.8	1.4	2.6	1.1	1.0	1.2	3.6	1.6	1.8	4.0	1.6	4.0	2.4	1.4	1.4	1.7	1.2	1.6	2.4	3.6	2.4
2008-10-01	0.9	0.7	1.7	1.1	1.00	1.0	1.1	4.0	1.0	3.6	1.8	1.4	2.4	1.1	1.2	2.0	3.6	1.6	2.3	4.5	1.7	4.0	2.4	1.4	1.4	1.8	1.2	2.4	2.4	3.6	2.4
2008-10-02	0.8	0.7	1.6	1.1	1.00	1.2	1.1	4.0	1.0	3.0	1.4	1.2	2.2	1.1	1.4	1.5	4.2	1.6	2.0	4.0	1.7	4.0	2.4	1.4	1.4	1.7	1.2	1.6	2.4	5.0	2.4
2008-10-03	0.8	0.7	1.6	1.1	1.00	1.2	1.1	3.8	1.0	3.6	1.4	1.2	2.3	1.1	1.4	1.5	4.2	1.6	1.7	4.0	1.7	4.0	2.4	1.4	1.4	1.7	1.2	1.6	2.4	5.0	2.4
…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…
2010-01-26	2.2	1.2	2.2	1.8	1.30	8.0	4.2	6.0	4.4	7.0	1.6	3.0	3.7	2.5	4.0	3.3	3.2	1.6	2.4	4.4	2.0	8.0	3.0	3.4	1.4	4.2	0.8	4.0	4.0	4.0	3.8
2010-01-27	2.2	1.2	2.2	1.8	1.30	8.0	4.2	6.0	4.4	7.0	1.6	3.0	3.7	2.5	4.0	3.3	3.2	1.6	2.4	4.4	2.0	8.0	3.0	3.4	1.4	4.2	0.8	4.0	4.0	4.0	3.8
2010-01-28	2.2	1.2	2.2	1.8	1.40	8.0	4.2	6.0	4.4	7.0	1.6	3.0	3.8	2.4	4.8	3.3	4.0	1.6	2.2	4.4	2.0	8.0	3.0	3.4	1.4	4.2	0.8	4.5	4.0	4.0	3.4
2010-01-29	2.2	1.2	2.2	1.8	1.40	8.0	4.2	6.0	4.2	7.0	1.6	3.0	3.9	2.3	4.8	2.9	3.0	1.6	2.2	3.9	1.8	8.0	3.0	3.4	1.4	4.2	0.8	4.0	4.0	4.0	3.2
2010-01-30	2.2	1.2	2.2	1.8	1.40	8.0	4.2	6.0	4.2	7.0	1.6	3.0	3.9	2.3	4.8	2.8	3.0	1.6	2.2	3.9	1.8	8.0	3.0	3.4	1.4	4.2	0.8	4.0	4.0	4.0	3.2

处理后的肉类（部分）价格信息表如下：

	猪口条	猪大排	猪大肠	猪心	猪肋排	猪肝	猪蹄	白条肉	精牛肉	精猪肉	精猪肚	羊肉片	翅中	翅根	西装鸡	鸡大腿	鸡心	鸡爪	鸡翅	鸡胸肉	鸡蛋
2008-09-29	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.5
2008-09-30	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.5
2008-10-01	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.5
2008-10-02	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.0
2008-10-03	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.0
2008-10-04	34.0	23.0	21.0	24.0	28.0	15.0	21.0	17.5	30.0	24.0	34.0	30.0	27.0	16.0	12.0	15.0	11.5	19.0	21.0	16.0	7.0
…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…	…
2010-01-26	29.0	19.0	22.0	18.0	28.0	9.0	17.0	18.0	30.0	18.0	30.0	36.0	29.0	15.0	11.0	15.0	11.0	17.0	20.0	15.0	6.9
2010-01-27	29.0	19.0	22.0	18.0	28.0	9.0	17.0	18.0	30.0	18.0	30.0	36.0	29.0	15.0	11.0	15.0	11.0	17.0	20.0	15.0	6.9
2010-01-28	33.0	19.0	22.0	18.0	30.0	8.0	18.0	17.0	31.0	19.0	32.0	32.0	28.0	15.0	11.0	14.0	10.0	17.0	20.0	14.5	6.9
2010-01-29	33.0	19.0	22.0	18.0	30.0	8.0	18.0	17.0	31.0	19.0	32.0	32.0	28.0	15.0	11.0	14.0	10.0	17.0	20.0	14.5	6.9
2010-01-30	33.0	19.0	22.0	18.0	30.0	8.0	18.0	17.0	31.0	19.0	32.0	32.0	28.0	15.0	11.0	14.0	10.0	17.0	20.0	14.5	6.9

价格曲线

两幅图像，一幅为全部蔬菜或肉类的价格曲线，以范围从2018年9月29号到2010年1月30日的日期为横坐标，食品价格作为纵坐标将全部蔬菜或肉类的价格变化绘制于一张图上；另一幅，通过算法实现将一个figure按照食品种类数划分为行数与列数尽量相等的若干子图，每幅子图显示一组蔬菜或肉类的价格变化，由于一张图中显示全部食品的价格曲线过于混乱观察效果不佳，因此采用分组显示全部食品价格曲线的方式。

此部分存在的问题大多为绘图的细节问题，子图的分割和位置、标题的显示、中文乱码、横坐标日期的显示、图例位置和信息等问题。

全部蔬菜的价格变化曲线如下：

全部肉类的价格变化曲线如下：

分组后全部蔬菜的价格变化曲线如下：

分组后全部肉类的价格变化曲线如下：

关联规则

对“机器学习实战”的“验证26-Apriori算法及实现”一节中的Apriori算法进行了部分修改后直接调用。

经过多次调参，最终将“蔬菜”关联规则的支持度设置为 $0.1$ ，可信度设置为 $0.4$ 和 $0.5$ ，“肉类”关联规则的支持度设置为 $0.2$ ，可信度设置为 $0.7$ 和 $0.8$ ，但是绘图时只显示可信度较高对应的关联组的价格曲线，输出会显示全部信息。

对loadDataSet函数的修改： 得到的DataFrame数据不可以直接用作数据分析，需要先对表格数据进行按列做差，得到涨跌数据，对于涨的均赋值为 $1$ ，对于跌的均赋值为 $- 1$ ，对于未发生价格变动的赋值为 $0$ 。分别获得每一行（即同日期）中同涨或同跌的食品的列索引（即食品种类对应的索引），将其划分为一个事务，并加入到事务列表中，返回事务列表。

对calcConf函数的修改： 通过列表推导式得到每组关联关系中索引对应的食品名称，将原先显示索引之间的关联关系转换为显示食品名称之间的关联关系，更加直观。

定义main函数用于调用生成关联规则的相关子函数： 此函数主要是调用Apriori核心函数，并将一些之前用索引表示的换成用名称表示，这部分代码的书写用到大量的嵌套列表推导式，这样的好处是减少循环降低复杂度并且代码简短。

对蔬菜进行关联分析得到的输出如下：

-----------------------蔬菜类 -----------------------
数据集总共包含事务总数: 667
候选集C1:
 ['元葱', '冬瓜', '土豆', '大头菜', '大白菜', '大蒜', '尖椒', '山药', '油菜', '生姜', '胡萝卜', '芋头', '芸豆', '芹菜', '茄子', '茭瓜', '茼蒿', '莴苣', '菜花', '菠菜', '葱', '蒜苔', '藕', '西红柿', '豆芽', '青椒', '青萝卜', '韭菜', '香菜', '鲜蘑菇', '黄瓜']
满足最小支持度为0.1的频繁项集列表L：
 [['香菜', '尖椒', '蒜苔', '茄子', '芹菜', '大头菜', '鲜蘑菇', '西红柿', '葱', '大白菜', '黄瓜', '茼蒿', '韭菜', '青椒', '菠菜', '茭瓜', '芸豆', '胡萝卜', '元葱', '菜花', '油菜'], ['菜花', '大头菜', '油菜', '芸豆', '油菜', '菠菜', '菜花', '大白菜', '大白菜', '芸豆', '菠菜', '大白菜', '大头菜', '大白菜', '芸豆', '茄子', '芸豆', '尖椒', '青椒', '尖椒', '菠菜', '大头菜', '茼蒿', '菠菜', '菠菜', '黄瓜', '菜花', '芸豆', '菠菜', '芸豆', '菠菜', '韭菜'], []]
满足最小可信度为0.4的规则列表为:
(大头菜) --> (菜花) 可信度为: 0.3872832369942196
(菜花) --> (大头菜) 可信度为: 0.33668341708542715
(芸豆) --> (油菜) 可信度为: 0.3819095477386935
(油菜) --> (芸豆) 可信度为: 0.44705882352941173
(菠菜) --> (油菜) 可信度为: 0.3838383838383838
(油菜) --> (菠菜) 可信度为: 0.44705882352941173
(大白菜) --> (菜花) 可信度为: 0.36548223350253806
(菜花) --> (大白菜) 可信度为: 0.3618090452261307
(芸豆) --> (大白菜) 可信度为: 0.33668341708542715
(大白菜) --> (芸豆) 可信度为: 0.3401015228426396
(大白菜) --> (菠菜) 可信度为: 0.3401015228426396
(菠菜) --> (大白菜) 可信度为: 0.3383838383838384
(大白菜) --> (大头菜) 可信度为: 0.4213197969543147
(大头菜) --> (大白菜) 可信度为: 0.4797687861271676
(茄子) --> (芸豆) 可信度为: 0.41666666666666663
(芸豆) --> (茄子) 可信度为: 0.3768844221105528
(尖椒) --> (芸豆) 可信度为: 0.39655172413793105
(芸豆) --> (尖椒) 可信度为: 0.34673366834170855
(尖椒) --> (青椒) 可信度为: 0.5057471264367817
(青椒) --> (尖椒) 可信度为: 0.5365853658536586
(大头菜) --> (菠菜) 可信度为: 0.3872832369942196
(菠菜) --> (大头菜) 可信度为: 0.3383838383838384
(菠菜) --> (茼蒿) 可信度为: 0.38888888888888895
(茼蒿) --> (菠菜) 可信度为: 0.48125
(黄瓜) --> (菠菜) 可信度为: 0.3709677419354838
(菠菜) --> (黄瓜) 可信度为: 0.3484848484848485
(芸豆) --> (菜花) 可信度为: 0.407035175879397
(菜花) --> (芸豆) 可信度为: 0.407035175879397
(芸豆) --> (菠菜) 可信度为: 0.3768844221105528
(菠菜) --> (芸豆) 可信度为: 0.3787878787878788
(韭菜) --> (菠菜) 可信度为: 0.4276729559748428
(菠菜) --> (韭菜) 可信度为: 0.3434343434343434
满足最小可信度为0.5的规则列表为:
(尖椒) --> (青椒) 可信度为: 0.5057471264367817
(青椒) --> (尖椒) 可信度为: 0.5365853658536586
[['尖椒', '青椒']]

绘制蔬菜中关联性较强的价格曲线图：

对肉类进行关联分析得到的输出如下：

数据集总共包含事务总数: 29
候选集C1:
 ['猪口条', '猪大排', '猪大肠', '猪心', '猪肋排', '猪肝', '猪蹄', '白条肉', '精牛肉', '精猪肉', '精猪肚', '羊肉片', '翅中', '翅根', '西装鸡', '鸡大腿', '鸡心', '鸡爪', '鸡翅', '鸡胸肉', '鸡蛋']
满足最小支持度为0.2的频繁项集列表L：
 [['羊肉片', '猪肋排', '鸡翅', '鸡心', '西装鸡', '翅中', '精猪肚', '精牛肉', '猪大肠', '猪大排', '鸡胸肉', '鸡爪', '鸡大腿', '翅根', '精猪肉', '白条肉', '猪蹄', '猪肝', '猪心', '猪口条'], ['精猪肉', '西装鸡', '翅根', '西装鸡', '鸡爪', '鸡翅', '精猪肉', '猪肋排', '翅中', '猪肝', '精牛肉', '翅中', '鸡心', '猪大肠', '猪心', '白条肉', '精猪肉', '猪心', '精猪肉', '白条肉', '翅根', '白条肉', '精猪肉', '翅根', '白条肉', '鸡大腿', '精猪肉', '鸡大腿', '翅根', '鸡大腿', '鸡胸肉', '鸡大腿'], ['精猪肉', '鸡大腿', '白条肉', '精猪肉', '猪心', '白条肉'], []]
满足最小可信度为0.7的规则列表为:
(茄子) --> (生姜) 可信度为: 0.6
(生姜) --> (茄子) 可信度为: 0.6
(茄子) --> (芹菜) 可信度为: 0.7
(芹菜) --> (茄子) 可信度为: 0.5833333333333334
(菜花) --> (莴苣) 可信度为: 0.75
(莴苣) --> (菜花) 可信度为: 0.75
(大白菜) --> (生姜) 可信度为: 0.875
(生姜) --> (大白菜) 可信度为: 0.7
(大蒜) --> (芸豆) 可信度为: 0.6666666666666666
(芸豆) --> (大蒜) 可信度为: 0.6
(芸豆) --> (油菜) 可信度为: 0.6
(油菜) --> (芸豆) 可信度为: 0.8571428571428571
(土豆) --> (茼蒿) 可信度为: 1.0
(茼蒿) --> (土豆) 可信度为: 0.8571428571428571
(山药) --> (大头菜) 可信度为: 0.5454545454545455
(大头菜) --> (山药) 可信度为: 0.75
(大头菜) --> (生姜) 可信度为: 0.875
(生姜) --> (大头菜) 可信度为: 0.7
(山药) --> (生姜) 可信度为: 0.6363636363636365
(生姜) --> (山药) 可信度为: 0.7
(山药) --> (芹菜) 可信度为: 0.5454545454545455
(芹菜) --> (山药) 可信度为: 0.5
(芹菜) --> (生姜) 可信度为: 0.5
(生姜) --> (芹菜) 可信度为: 0.6
(茭瓜) --> (山药) 可信度为: 0.7272727272727273
(山药) --> (茭瓜) 可信度为: 0.7272727272727273
(茭瓜) --> (生姜) 可信度为: 0.5454545454545455
(生姜) --> (茭瓜) 可信度为: 0.6
(茭瓜) --> (芹菜) 可信度为: 0.6363636363636365
(芹菜) --> (茭瓜) 可信度为: 0.5833333333333334
(茭瓜) --> (菠菜) 可信度为: 0.5454545454545455
(菠菜) --> (茭瓜) 可信度为: 0.6666666666666666
(山药) --> (生姜,茭瓜) 可信度为: 0.5454545454545455
(茭瓜) --> (生姜,山药) 可信度为: 0.5454545454545455
(生姜) --> (山药,茭瓜) 可信度为: 0.6
(山药) --> (生姜,大头菜) 可信度为: 0.5454545454545455
(大头菜) --> (生姜,山药) 可信度为: 0.75
(生姜) --> (大头菜,山药) 可信度为: 0.6
满足最小可信度为0.8的规则列表为:
(大白菜) --> (生姜) 可信度为: 0.875
(油菜) --> (芸豆) 可信度为: 0.8571428571428571
(土豆) --> (茼蒿) 可信度为: 1.0
(茼蒿) --> (土豆) 可信度为: 0.8571428571428571
(大头菜) --> (生姜) 可信度为: 0.875
[['猪肋排', '精猪肉'], ['猪大肠', '鸡心'], ['猪心', '精猪肉']]

绘制肉类中关联性较强的价格曲线图：

结果分析

根据每组中两种食品的同涨同跌率（即”同幅变化次数/总日期数“）和对应的散点图观察关联性强弱。

蔬菜中满足关联规则的蔬菜的同涨同跌率如下：

满足关联规则的蔬菜的同增幅率如下：

 "尖椒" 和 "青椒" 的同增同减率: 0.6744186046511628

肉类中满足关联规则的肉类的同涨同跌率如下：

满足关联规则的肉类的同增幅率如下：

 "猪肋排" 和 "精猪肉" 的同增同减率: 0.9936575052854123
 "猪大肠" 和 "鸡心" 的同增同减率: 0.9957716701902748
 "猪心" 和 "精猪肉" 的同增同减率: 0.9936575052854123

分析：

蔬菜的价格关联性可参考性比较高，因为数据波动比较明显，更容易确定关联性，而由于肉类的价格波动次数较少，所以同幅变化率高，参考意义不如蔬菜价格的关联性强。不过，两种不同的食品都不波动在一定程度上说明二者的关联性。总体而言，关联性较好，合理性较高。

总结展望

局限性

“最小支持度”设置的较低

当将“最小支持度”设置的较高时会出现无解的情况，初步确定主要原因是事务总数过多，一种情况出现的次数又相对较少，导致支持度比较低，不过可信度的值是可以接受的。
未对“蔬菜“和”肉类“相关联

在蔬菜间和肉类间进行了关联性分析，对于两类不同食品间的关联性分析没有完整且合理的思路。最开始想到的是遍历两类食品，在两类中各取一种食品比较价格起伏，但是觉得可信度较低，并未采用。
只考虑价格起伏，未考虑价格起伏程度

在进行关联性分析时，只将是否同起同伏作为是否具有关联性的唯一指标，而未将起伏程度作为指标，因此具有一定的不客观性。

展望

尝试采用更优质的建模方式，建立更佳的关联方式，有效提高最小支持度
将两类食品间的价格起伏抽象成事务，并对其进行关联性分析
添加更多关联性指标作为关联性分析的评判标准，使模型更加合理

附录（代码）

getAlldates.py

功能：获取时间序列

参数：excel的sheet变量

返回值：表格中第一列时间列表

from datetime import datetime
from xlrd import xldate_as_tuple


def getAlldates(table):
    "获取全部的日期，并且是按出现顺序保存"
    date_set = set()
    date_index = []
    for date_val in table.col_values(0):
        try:  # 当遍历到空单元格时会报错，try防止报错终止
            date = datetime(*xldate_as_tuple(date_val, 0))  # 转为datatime类型 # xldate_as_tuple函数的第一个参数为单元格，第二个参数为日期格式
            date_index.append(date)
            date_set.add(date)
        except:
            continue

    alldates = list(date_set)
    alldates.sort(key=date_index.index)  # 集合元素的顺序与插入元素顺序无关，因此需要将集合按原列表中的顺序排序
    return alldates

getDataFrame.py

功能：数据处理，以DataFrame的形式分别获得蔬菜数据和肉类数据

参数：excel的sheet变量；对蔬菜数据操作还是对肉类数据操作，为1表示操作蔬菜否则操作肉类；时间序列

返回值：以时间序列为行索引，以食品名称为列索引，以价格为数据的DataFrame

import numpy as np
from pandas import Series, DataFrame

def getDataFrame(table, vegetable_meat, alldates):
    "函数功能：创建蔬菜类或肉类的价格表格     table：整张excel表     vegetable_meat：0、1分别表示对蔬菜类或肉类进行数据处理      alldates：对应的时间列表 "

    t = 1 if vegetable_meat == 0 else 3 # 控制被操作的列号 # 如果对蔬菜操作t=1，如果对肉操作t=3

    # 获取DataFrame
    i = 0
    data_final = []  # 存储最终肉类组/蔬菜组的信息（包括名称和价格）
    while i < table.nrows:  # table.nrows 有效行数
        data_list = []
        cnt = 0  # 只有当连续出现的空单元数大于1时才开始一个新的分组
        while True:
            if cnt > 1:
                break
            if (table.cell(i, t).ctype == 0) | (table.cell(i, t).value == '\u3000'): # 当单元格为无效内容时 # 当单元格内容为"\u3000"或者ctype=0时表示空的
                cnt = cnt + 1
            elif (table.cell(i, t+1).ctype != 2):  # 非数字，都直接pass
                cnt = 0
                pass
            else:
                cnt = 0
                data_list.append((table.cell(i, t).value, table.cell(i, t+1).value))
            i = i + 1
            if i >= table.nrows: # 防止越界报错
                break

        i = i + 1
        if len(data_list) > 0:
            data_dict = dict(data_list)
            data_final.append(data_dict)

    data_final.pop(233)  # 第234组数据与第1组数据一样，去重

    dataframe = DataFrame(data_final, index=alldates) # 以日期为索引创建DataFrame

    number_nan = dataframe.isnull().sum() # 按列统计Nan数量
    threshold_value = 0.2  # 当缺失数据多于20%，则舍去此列
    columns = dataframe.columns.values.tolist()  # 获取全部列名列表

    array_delete = np.where(np.array(list(number_nan)) > threshold_value * len(alldates)) # 保存要被删除的列的索引
    array_delete = array_delete[0].tolist()  # 被删除列的索引组成的列表

    drop_columns_name = [columns[idx] for idx in array_delete]  # 保存被删除列的名称

    dataframe = dataframe.drop(drop_columns_name, axis=1) # 丢弃对应的列
    dataframe = dataframe.sort_index(ascending=True) # 按日期升序排序
    dataframe.fillna(method='bfill', inplace=True)  # Nan值用后一天的价格填充

    return dataframe

getFigure.py

getRowColumnNUmber()

功能：划分的子图的行数与列数尽量相等

参数：总组数

返回值：子图的行数和列数

getFigure()

功能：绘制两幅图，分别是全部蔬菜或肉类的价格曲线图和分组后的蔬菜或肉类的价格曲线图

参数：对蔬菜数据操作还是对肉类数据操作，为1表示操作蔬菜否则操作肉类；数据对应的DataFrame表格

返回值：无

import math
import pandas as pd
import matplotlib.pyplot as plt
import matplotlib.dates as mdates
from datetime import datetime

def getRowColumnNUmber(group_nummber):
    # 将这些子图尽可能行列相同，且使得行列尽量只差 1
    subplot_row_number = int(math.sqrt(group_nummber))
    subplot_col_number = int(math.sqrt(group_nummber))
    while subplot_col_number * subplot_row_number < group_nummber:
        subplot_row_number = subplot_row_number + 1
        if subplot_col_number * subplot_row_number >= group_nummber:
            break
        subplot_col_number = subplot_col_number + 1
    return subplot_row_number, subplot_col_number

def getFigure(vegetable_meat, dataframe):

    dataframe_index = dataframe.index
    dataframe_column = dataframe.columns
    dataframe_column_list = dataframe_column.tolist()

    fig_vegetable = plt.figure(figsize=(20, 10))  # 全部蔬菜的价格曲线
    plt.xlim([datetime(2008, 9, 29), datetime(2010, 1, 30)])  # 日期范围
    plt.gca().xaxis.set_major_formatter(mdates.DateFormatter('%Y-%m-%d'))  # 日期格式
    plt.gca().xaxis.set_major_locator(mdates.DayLocator(interval=15))  # 日期间隔
    fig_vegetable.autofmt_xdate()  # 斜的日期标签

    for idx in dataframe_column_list:  # 遍历列名
        eachcolumn = dataframe.loc[:, idx].tolist()
        plt.plot(dataframe_index, eachcolumn)  # x轴是日期，y轴是价格
    plt.rcParams['font.sans-serif'] = 'SimHei'  # 使图形中的中文正常编码显示
    plt.rcParams['axes.unicode_minus'] = False  # 使坐标轴刻度表签正常显示正负号
    plt.title('全部' + ('蔬菜' if vegetable_meat == 0 else '肉类') + '的价格变化曲线')
    plt.legend(bbox_to_anchor=(1.05, 0), loc=3, borderaxespad=0,
               labels=dataframe_column_list)  # 设置标签显示的信息和位置 labels：设置图标名称

    # 每个子图显示至少step条曲线
    step = 5 if vegetable_meat == 0 else 3
    dataframe_after_group_2Dlist = [dataframe.iloc[:, i:i + step] for i in
                                         range(0, len(dataframe_column_list), step)]  # 以step为组内数量进行分组
    dataframe_column_list_after_group = [dataframe_column_list[i:i + step] for i in
                                              range(0, len(dataframe_column_list), step)]  # 列名也要分组
    group_nummber = len(dataframe_after_group_2Dlist)
    lastgroup_column_number = dataframe_after_group_2Dlist[group_nummber - 1].shape[1]  # 如果最后一组的曲线过少，则与前一组合并
    if (lastgroup_column_number != step) & (lastgroup_column_number < 0.5 * step) & (group_nummber > 1):
        dataframe_after_group_2Dlist[group_nummber - 2] = pd.concat(
            [dataframe_after_group_2Dlist[group_nummber - 2],
             dataframe_after_group_2Dlist[group_nummber - 1]], axis=1)
        dataframe_column_list_after_group[group_nummber - 2].extend(
            dataframe_column_list_after_group[group_nummber - 1])
        dataframe_after_group_2Dlist.pop(group_nummber - 1)
        dataframe_column_list_after_group.pop(group_nummber - 1)
        group_nummber = group_nummber - 1

    subplot_row_number, subplot_col_number = getRowColumnNUmber(group_nummber)


    plt.figure(figsize=(30, 20))  # 分组显示价格变化曲线
    for i in range(group_nummber):  # 遍历每个子图
        eachgroup = dataframe_after_group_2Dlist[i]  # 每一组（DataFrame类型）
        plt.subplot(subplot_row_number, subplot_col_number, i + 1)
        plt.xlim([datetime(2008, 9, 29), datetime(2010, 1, 30)])  # 日期范围
        plt.gca().xaxis.set_major_formatter(mdates.DateFormatter('%Y-%m-%d'))  # 日期格式
        plt.gca().xaxis.set_major_locator(mdates.DayLocator(interval=20))  # 日期间隔
        plt.xticks(rotation=45)  # x轴文字旋转45°
        plt.tight_layout()  # 默认间隔 # 让子图紧贴边
        plt.subplots_adjust(left=0.03, bottom=0.1, right=0.92, top=0.96, wspace=0.25 if vegetable_meat == 0 else 0.3,
                            hspace=0.5)  # 设置子图位置 # left和bottom控制左下角子图的左下角位置，right和top控制右上角子图右上角的位置，wspace控制子图间的水平间隔，hspace控制子图间的垂直间隔
        plt.rcParams['font.family'] = ['SimHei']  # legend不支持中文，此句设置显示中文

        for j in range(eachgroup.shape[1]):  # eachgroup.shape[1]为该组的列数
            eachcolumn = eachgroup.iloc[:, j]  # 得到价格数据
            plt.plot(dataframe_index, eachcolumn)

        plt.title('、'.join(dataframe_column_list_after_group[i]) + '的价格曲线')
        plt.legend(bbox_to_anchor=(1.05, 0), loc=3, borderaxespad=0, labels=dataframe_column_list_after_group[i])

    plt.show()
    return

getAnalysisFigure.py

功能：绘制满足关联规则的食品组对应的价格曲线

参数：对蔬菜数据操作还是对肉类数据操作，为1表示操作蔬菜否则操作肉类；每组的食品名称；数据对应的DataFrame表格

返回值：无

import matplotlib.pyplot as plt
import matplotlib.dates as mdates
from datetime import datetime
from resultAnalysis import resultAnalysis
from getFigure import getRowColumnNUmber

def getAnalysisFigure(vegetable_meat, data, dataframe):

    dataframe_index = dataframe.index
    subplot_row_number, subplot_col_number = getRowColumnNUmber(len(data))

    plt.figure(figsize=(30, 20))  # 分组显示价格变化曲线
    for i in range(len(data)):  # 遍历每个子图
        eachgroup = data[i]  # 每一组两个字符串
        plt.subplot(subplot_row_number, subplot_col_number, i + 1)
        plt.xlim([datetime(2008, 9, 29), datetime(2010, 1, 30)])  # 日期范围
        plt.gca().xaxis.set_major_formatter(mdates.DateFormatter('%Y-%m-%d'))  # 日期格式
        plt.gca().xaxis.set_major_locator(mdates.DayLocator(interval=20))  # 日期间隔
        plt.xticks(rotation=45)  # x轴文字旋转45°
        plt.tight_layout()  # 默认间隔 # 让子图紧贴边
        plt.subplots_adjust(left=0.03, bottom=0.1, right=0.92, top=0.92, wspace=0.3 if vegetable_meat == 0 else 0.3,
                            hspace=0.5)  # 设置子图位置 # left和bottom控制左下角子图的左下角位置，right和top控制右上角子图右上角的位置，wspace控制子图间的水平间隔，hspace控制子图间的垂直间隔
        plt.rcParams['font.sans-serif'] = 'SimHei'  # 使图形中的中文正常编码显示
        plt.rcParams['font.family'] = ['SimHei']  # legend不支持中文，此句设置显示中文

        for j in eachgroup:  # eachgroup.shape[1]为该组的列数
            eachcolumn = dataframe.loc[:, j]  # 得到价格数据
            plt.plot(dataframe_index, eachcolumn)

        plt.title('、'.join(data[i]) + '的价格曲线')
        plt.legend(bbox_to_anchor=(1.01, 0), loc=3, borderaxespad=0, labels=eachgroup)
    plt.suptitle('满足关联规则的' + ('蔬菜' if vegetable_meat == 0 else '肉类') + '曲线', fontsize = 20)
    # plt.show()

    resultAnalysis(vegetable_meat, dataframe, data, subplot_row_number, subplot_col_number) # 绘制结果分析曲线
    return

myapriori.py

功能：生成关联规则

import numpy as np
import UnionCode


"""
函数说明：处理数据并加载数据集
"""
def loadDataSet(dataframe):
    dataframe = dataframe.values
    diff_array = np.diff(dataframe, axis = 0)
    diff_array[diff_array < 0] = -1 # 跌
    diff_array[diff_array > 0] = 1 # 涨
    diff_array[diff_array == 0] = 0 # 未变

    x_lt, y_lt = np.where(diff_array < 0)
    x_lt = x_lt.tolist()
    y_lt = y_lt.tolist()
    x_gt, y_gt = np.where(diff_array > 0)
    x_gt = x_gt.tolist()
    y_gt = y_gt.tolist()
    # x_eq, y_eq = np.where(diff_array == 0)

    data = []
    idx_lt = 0
    for i in range(diff_array.shape[0]):
        eachdata = []
        while idx_lt < len(x_lt):
            if x_lt[idx_lt] == i:
                eachdata.append(y_lt[idx_lt])
            else:
                break
            idx_lt = idx_lt + 1
        if len(eachdata) > 0:
            data.append(eachdata)

    idx_gt = 0
    for i in range(diff_array.shape[0]):
        eachdata = []
        while idx_gt < len(x_gt):
            if x_gt[idx_gt] == i:
                eachdata.append(y_gt[idx_gt])
            else:
                break
            idx_gt = idx_gt + 1
        if len(eachdata) > 0:
            data.append(eachdata)

    # 去掉一天中只存在一种蔬菜涨跌的组，这可以去除无效事务总数，有效地减少事务总数
    return_data = []
    for item in data:
        if len(item) <= 1:
            continue
        else:
            return_data.append(item)

    return return_data

"""
函数说明：构建集合C1。即所有候选项元素的集合。
parameters：
    dataSet -数据集
return:
    frozenset列表
output:
    [forzenset([1]),forzenset([2]),……]
"""
def createC1(dataSet):
    C1 = []                                                 #创建一个空列表
    for transaction in dataSet:                             #对于数据集中的每条记录
        for item in transaction:                            #对于每条记录中的每一个项
            if not [item] in C1:                            #如果该项不在C1中，则添加
                C1.append([item])
    C1.sort()                                               #对集合元素排序
    return list(map(frozenset,C1))                          #将C1的每个单元列表元素映射到forzenset() #frozenset() 返回一个冻结的集合，冻结后集合不能再添加或删除任何元素

"""
函数说明：构建符合支持度的集合Lk
parameters:
    D -数据集
    Ck -候选项集列表
    minSupport -感兴趣项集的最小支持度
return:
    retList -符合支持度的频繁项集合列表L
    supportData -最频繁项集的支持度
"""
def scanD(D,Ck,minSupport):
    ssCnt = {}                                              #创建空字典
    for tid in D:                                           #遍历数据集中的所有交易记录
        for can in Ck:                                      #遍历Ck中的所有候选集
            if can.issubset(tid):                           #判断can是否是tid的子集
                if not can in ssCnt:  ssCnt[can] = 1  #如果是记录的一部分，增加字典中对应的计数值。
                else: ssCnt[can] += 1
    numItems = float(len(D))                                #得到数据集中交易记录的条数 #转换成float是为了后面除法
    retList = []                                            #新建空列表
    supportData = {}                                        #新建空字典用来存储最频繁集和支持度
    for key in ssCnt:                                       #for循环遍历字典默认遍历key值；遍历dir.values()可以实现遍历值
        support = ssCnt[key] / numItems                     #计算每个元素的支持度
        if support >= minSupport:                           #如果大于最小支持度则添加到retList中
            retList.insert(0,key)                           #首插法
        supportData[key] = support                          #并记录当前支持度，索引值即为元素值
    return retList,supportData

"""
函数说明：apriori算法实现
parameters:
    dataSet -数据集
    minSupport -最小支持度
return:
    L -候选项集的列表
    supportData -项集支持度
"""
def apriori(dataSet, minSupport=0.5):
    C1 = createC1(dataSet)
    D = list(map(set, dataSet))                     # 将数据集转化为集合列表
    L1, supportData = scanD(D, C1, minSupport)      # 调用scanD()函数，过滤不符合支持度的候选项集
    L = [L1]                                        # 将过滤后的L1放入L列表中
    k = 2                                           # 最开始为单个项的候选集，需要多个元素组合
    while (len(L[k - 2]) > 0):
        Ck = aprioriGen(L[k - 2], k)                # 创建Ck
        Lk, supK = scanD(D, Ck, minSupport)         # 由Ck得到Lk
        supportData.update(supK)                    # 更新支持度
        L.append(Lk)                                # 将Lk放入L列表中
        k += 1                                      # 继续生成L3，L4....
    return L, supportData


"""
函数说明:构建集合Ck
parameters:
    Lk -频繁项集列表L
    k -候选集的列表中元素项的个数
return:
    retList -候选集项列表Ck
"""
def aprioriGen(Lk, k):
    retList = []                                    # 创建一个空列表
    lenLk = len(Lk)                                 # 得到当前频繁项集合列表中元素的个数
    for i in range(lenLk):                          # 遍历所有频繁项集合
        for j in range(i + 1, lenLk):               # 比较Lk中的每两个元素，用两个for循环实现
            L1 = list(Lk[i])[:k - 2];
            L2 = list(Lk[j])[:k - 2]                # 取该频繁项集合的前k-2个项进行比较
            # [注]此处比较了集合的前面k-2个元素，需要说明原因
            L1.sort();
            L2.sort()                               # 对列表进行排序
            if L1 == L2:                            # 对应位置的元素全部相等
                retList.append(Lk[i] | Lk[j])       # 使用集合的合并操作来完成 e.g.：[0,1],[0,2]->[0,1,2]
    return retList

"""
函数说明：关联规则生成函数
parameters:
    L -频繁项集合列表
    supportData -支持度字典
    minConf -最小可信度
return:
    bigRuleList -包含可信度的规则列表
"""
def generateRules(vegetable_meat, L, supportData, minConf=0.7):
    bigRuleList = []  # 创建一个空列表
    for i in range(1, len(L)):  # 遍历频繁项集合列表
        for freqSet in L[i]:  # 遍历频繁项集合
            H1 = [frozenset([item]) for item in freqSet]  # 为每个频繁项集合创建只包含单个元素集合的列表H1
            if (i > 1):  # 要从包含两个或者更多元素的项集开始规则构建过程
                rulesFromConseq(vegetable_meat, freqSet, H1, supportData, bigRuleList, minConf)
            else:  # 如果项集中只有两个元素，则计算可信度值，(len(L)=2)
                calcConf(vegetable_meat, freqSet, H1, supportData, bigRuleList, minConf)
    return bigRuleList

"""
函数说明：规则构建函数
parameters:
    freqSet -频繁项集合
    H -可以出现在规则右部的元素列表
    supportData -支持度字典
    brl -规则列表
    minConf -最小可信度
return:
    null
"""
def rulesFromConseq(vegetable_meat, freqSet, H, supportData, brl, minConf=0.7):
    m = len(H[0])  # 得到H中的频繁集大小m
    if (len(freqSet) > (m + 1)):  # 查看该频繁集是否大到可以移除大小为m的子集
        Hmp1 = aprioriGen(H, m + 1)  # 构建候选集Hm+1，Hmp1中包含所有可能的规则
        Hmp1 = calcConf(vegetable_meat, freqSet, Hmp1, supportData, brl, minConf)  # 测试可信度以确定规则是否满足要求
        if (len(Hmp1) > 1):  # 如果不止一条规则满足要求，使用函数迭代判断是否能进一步组合这些规则
            rulesFromConseq(vegetable_meat, freqSet, Hmp1, supportData, brl, minConf)


"""
函数说明：计算规则的可信度，找到满足最小可信度要求的规则
parameters：
    freqSet -频繁项集合
    H -可以出现在规则右部的元素列表
    supportData -支持度字典
    brl -规则列表
    minConf -最小可信度
return:
    prunedH -满足要求的规则列表
"""
# def calcConf(freqSet, H, supportData, brl, minConf=0.7):
#     prunedH = []  # 为保存满足要求的规则创建一个空列表
#     for conseq in H:
#         conf = supportData[freqSet] / supportData[freqSet - conseq]  # 可信度计算[support(PUH)/support(P)]
#         if conf >= minConf:
#             print(freqSet - conseq, '-->', conseq, '可信度为:', conf)
#             brl.append((freqSet - conseq, conseq, conf))  # 对bigRuleList列表进行填充
#             prunedH.append(conseq)  # 将满足要求的规则添加到规则列表
#     return prunedH
def calcConf(vegetable_meat, freqSet, H, supportData, brl, minConf=0.7):

    nameSet = UnionCode.vegetable_list if vegetable_meat == 0 else UnionCode.meat_list

    prunedH = []  # 为保存满足要求的规则创建一个空列表
    for conseq in H:
        conf = supportData[freqSet] / supportData[freqSet - conseq]  # 可信度计算[support(PUH)/support(P)]
        if conf >= minConf:
            nameSet_1 = [nameSet[idx] for idx in freqSet - conseq]
            nameSet_2 = [nameSet[idx] for idx in conseq]
            print('(' + ','.join(nameSet_1) + ')', '-->', '(' + ','.join(nameSet_2) + ')', '可信度为:', conf) # 对源代码进行修改。显示蔬菜或肉类的名称
            brl.append((freqSet - conseq, conseq, conf))  # 对bigRuleList列表进行填充
            prunedH.append(conseq)  # 将满足要求的规则添加到规则列表
    return prunedH

resultAnalysis.py

功能：绘制同涨同跌散点图，用于观察关联关系是否合理

参数：对蔬菜数据操作还是对肉类数据操作，为1表示操作蔬菜否则操作肉类；数据对应的DataFrame表格；每组的食品名称；子图行数；子图列数

返回值：无

import numpy as np
import matplotlib.pyplot as plt
import matplotlib.dates as mdates
from datetime import datetime

def resultAnalysis(vegetable_meat, dataframe, data, subplot_row_number, subplot_col_number):
    plt.figure(figsize=(30, 20))  # 分组显示价格变化曲线
    for i in range(len(data)):  # 遍历每个子图
        eachgroup = data[i]  # 每一组两个字符串
        plt.subplot(subplot_row_number, subplot_col_number, i + 1)
        plt.xlim([0, dataframe.index.shape[0]-2])
        plt.yticks(range(0,2,1), ['同幅度变化', '不同幅变化','']) # 重要！ # 不仅可以控制y轴变化为整数，且可以更换为字符串
        # plt.gca().xaxis.set_major_formatter(mdates.DateFormatter('%Y-%m-%d'))  # 日期格式
        # plt.gca().xaxis.set_major_locator(mdates.DayLocator(interval=20))  # 日期间隔
        # plt.xticks(rotation=45)  # x轴文字旋转45°
        plt.tight_layout()  # 默认间隔 # 让子图紧贴边
        plt.subplots_adjust(left=0.06, bottom=0.1, right=0.92, top=0.92, wspace=0.3 if vegetable_meat == 0 else 0.3,
                            hspace=0.5)  # 设置子图位置 # left和bottom控制左下角子图的左下角位置，right和top控制右上角子图右上角的位置，wspace控制子图间的水平间隔，hspace控制子图间的垂直间隔
        plt.rcParams['font.sans-serif'] = ['STZhongsong']  # 使图形中的中文正常编码显示
        plt.rcParams['font.family'] = ['SimHei']  # legend不支持中文，此句设置显示中文
        plt.rcParams['axes.unicode_minus'] = False

        bool_araay0 = np.diff(dataframe.loc[:, eachgroup[0]].values, axis=0)
        bool_araay0[bool_araay0 < 0] = -1  # 跌
        bool_araay0[bool_araay0 > 0] = 1  # 涨
        bool_araay0[bool_araay0 == 0] = 0  # 未变

        bool_araay1= np.diff(dataframe.loc[:, eachgroup[1]].values, axis=0)
        bool_araay1[bool_araay1 < 0] = -1  # 跌
        bool_araay1[bool_araay1 > 0] = 1  # 涨
        bool_araay1[bool_araay1 == 0] = 0  # 未变

        bool_araay = (bool_araay0 == bool_araay1)
        array = np.ones(bool_araay.shape)
        array[bool_araay] = 0
        array[~bool_araay] = 1
        y = [int(i) for i in array]
        x1 = np.where(bool_araay)[0].tolist()  # np.where的返回值太坑了！！！
        x2 = np.where(~bool_araay)[0].tolist()
        y1 = [0*int(i) for i in np.ones(len(x1)).tolist()]
        y2 = [int(i) for i in np.ones(len(x2)).tolist()]
        print(' "' + eachgroup[0] + '" 和 "' + eachgroup[1] + '" 的同增同减率:', len(y1)/(len(y1)+len(y2)))
        plt.scatter(x1, y1, marker='o', s=6, color='g')
        plt.scatter(x2, y2, marker='*', s=6, color = 'r')
        plt.title('、'.join(data[i]) + '的价格曲线')

    plt.show()
    return

UnionCode.py

功能：从此运行，显示关联规则等信息

参数：无

返回值：无

使用方式：“曲线绘制”部分的被注释掉的部分分别用于显示全部食品价格曲线图和分组后的全部食品价格曲线图；“_main_”中的两个函数调用是用于显示满足关联规则的食品的价格曲线以及效果分析图

import xlrd # 对excel文件操作的模块
import pandas as pd
from getFigure import getFigure
from getAlldates import getAlldates
from getDataFrame import getDataFrame
from getAnalysisFigure import getAnalysisFigure

# ---------------------------------------数据读入-------------------------------------------


original_data = xlrd.open_workbook(r'C:\Users\23343\Desktop\蔬菜价格.xlsx')  # 打开文件
table = original_data.sheets()[0]

# -------------------------------------获取时间列表------------------------------------------
alldates = getAlldates(table)

# ------------------------------------数据处理成表格-----------------------------------------
vegetable_dataframe = getDataFrame(table, 0, alldates)  # 蔬菜
meat_dataframe = getDataFrame(table, 1, alldates)  # 肉类

vegetable_list = vegetable_dataframe.columns.values.tolist()
meat_list = meat_dataframe.columns.values.tolist()

# 下面两句代码在jupyter中能比较好的显示出表格
# pd.set_option('display.max_columns', 100)
# pd.set_option('display.width', 500)

# ----------------------------------------曲线绘图------------------------------------------
# getFigure(0, vegetable_dataframe) # 蔬菜
# getFigure(1, meat_dataframe) # 肉类

# -----------------------------得到规则并绘制相关价格曲线观察效果-------------------------------
def main(vegetable_meat, dataframe):
    from myapriori import loadDataSet, createC1, apriori, generateRules  # 在if __name__ == '__main__':中导入可以解决两个包相互引用的问题

    print('-----------------------' + ('蔬菜' if vegetable_meat == 0 else '肉') + '类 -----------------------')
    dataSet = loadDataSet(dataframe)
    minsuppose = 0.1 if vegetable_meat == 0 else 0.2
    minconfidence = 0.5 if vegetable_meat == 0 else 0.8
    nameSet = vegetable_list if vegetable_meat == 0 else meat_list
    print("数据集总共包含事务总数:", len(dataSet))
    name_dataSet = [[nameSet[idx] for idx in dataSet[i]] for i in range(len(dataSet))] # 将数据集的数字转换成对应的蔬菜或肉类名称
    print("数据集:\n", name_dataSet)
    C1 = createC1(dataSet)
    name_C1 = [nameSet[idx] for item in C1 for idx in item] # 将C1中的数字转换为对应的名称
    print("候选集C1:\n", name_C1)
    L, suppData = apriori(dataSet, minsuppose)
    name_L = [[nameSet[idx] for fro in L[i] for idx in fro] for i in range(len(L))] # 将L中的数字转换为对应的名称 # 注意对frozenset也要遍历一遍，因此是三重循环
    print("满足最小支持度为" + str(minsuppose) + "的频繁项集列表L：\n", name_L)
    print("满足最小可信度为"+ str(round(minconfidence-0.1, 1)) + "的规则列表为:")
    vegetable_rules = generateRules(0, L, suppData, minconfidence-1)

    # 不绘制此曲线了
    # vegetable_rules2strlist = [[vegetablenameSet[idx] for i in range(2) for idx in item[i]] for item in vegetable_rules]
    # vegetable_rules2strlist = [vegetable_rules2strlist[i] for i in range(0, len(vegetable_rules2strlist), 2)] # A->B 与 B->A 算一个，为了后续方便画图
    # print(vegetable_rules2strlist)
    # getAnalysisFigure(0, vegetable_rules2strlist, vegetable_dataframe)

    print("满足最小可信度为" + str(minconfidence) + "的规则列表为:")
    rules = generateRules(0, L, suppData, minconfidence)

    rules2strlist = [[nameSet[idx] for i in range(2) for idx in item[i]] for item in rules]
    rules2strlist = [rules2strlist[i] for i in range(0, len(rules2strlist), 2)]  # A->B 与 B->A 算一个，为了后续方便画图
    print(rules2strlist)
    getAnalysisFigure(0, rules2strlist, dataframe)
    return


if __name__ == '__main__':
    main(0, vegetable_dataframe) # 蔬菜
    # main(1, meat_dataframe) # 肉类

你可能感兴趣的:(【大数据】,大数据,python,数据分析)

理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
Python中深拷贝与浅拷贝的区别 yuxiaoyu.
转自：http://blog.csdn.net/u014745194/article/details/70271868定义：在Python中对象的赋值其实就是对象的引用。当创建一个对象，把它赋值给另一个变量的时候，python并没有拷贝这个对象，只是拷贝了这个对象的引用而已。浅拷贝：拷贝了最外围的对象本身，内部的元素都只是拷贝了一个引用而已。也就是，把对象复制一遍，但是该对象中引用的其他对象我不复
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
Python编译器鹿鹿~ Python编译器 Python python 开发语言后端
嘿嘿嘿我又来了啊有些小盆友可能不知道Python其实是有编译器的，也就是PyCharm。你们可能会问到这个是干嘛的又不可以吃也不可以穿好像没有什么用，其实你还说对了这个还真的不可以吃也不可以穿，但是它用来干嘛的呢。用来编译你所打出的代码进行运行（可能这里说的有点不对但是只是个人认为）现在我们来说说PyCharm是用来干嘛的。PyCharm是一种PythonIDE，带有一整套可以帮助用户在使用Pyt
一文掌握python面向对象魔术方法（二）程序员neil python python 开发语言
接上篇：一文掌握python面向对象魔术方法（一）-CSDN博客目录六、迭代和序列化：1、__iter__(self):定义迭代器，使得类可以被for循环迭代。2、__getitem__(self,key):定义索引操作，如obj[key]。3、__setitem__(self,key,value):定义赋值操作，如obj[key]=value。4、__delitem__(self,key):定义
一文掌握python常用的list（列表）操作程序员neil python python 开发语言
目录一、创建列表1.直接创建列表：2.使用list()构造器3.使用列表推导式4.创建空列表二、访问列表元素1.列表支持通过索引访问元素，索引从0开始：2.还可以使用切片操作访问列表的一部分：三、修改列表元素四、添加元素1.append()：在末尾添加元素2.insert()：在指定位置插入元素五、删除元素1.del：删除指定位置的元素2.remove()：删除指定值的第一个匹配项3.pop()：
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
python中的深拷贝与浅拷贝 anshejd70787 python
深拷贝和浅拷贝浅拷贝的时候，修改原来的对象，浅拷贝的对象不会发生改变。1、对象的赋值对象的赋值实际上是对象之间的引用：当创建一个对象，然后将这个对象赋值给另外一个变量的时候，python并没有拷贝这个对象，而只是拷贝了这个对象的引用。当对对象做赋值或者是参数传递或者作为返回值的时候，总是传递原始对象的引用，而不是一个副本。如下所示：>>>aList=["kel","abc",123]>>>bLis
用Python实现简单的猜数字游戏程序媛了了 python 游戏 java
猜数字游戏代码：importrandomdefpythonit():a=random.randint(1,100)n=int(input("输入你猜想的数字："))whilen!=a:ifn>a:print("很遗憾，猜大了")n=int(input("请再次输入你猜想的数字："))elifna::如果玩家猜的数字n大于随机数字a，则输出"很遗憾，猜大了"，并提示玩家再次输入。elifn
二分查找排序算法周凡杨 java 二分查找排序算法折半
一：概念二分查找又称折半查找（折半搜索/ 二分搜索），优点是比较次数少，查找速度快，平均性能好；其缺点是要求待查表为有序表，且插入删除困难。因此，折半查找方法适用于不经常变动而查找频繁的有序列表。首先，假设表中元素是按升序排列，将表中间位置记录的关键字与查找关键字比较，如果两者相等，则查找成功；否则利用中间位置记录将表分成前、后两个子表，如果中间位置记录的关键字大于查找关键字，则进一步
java中的BigDecimal bijian1013 java BigDecimal
在项目开发过程中出现精度丢失问题，查资料用BigDecimal解决，并发现如下这篇BigDecimal的解决问题的思路和方法很值得学习，特转载。原文地址：http://blog.csdn.net/ugg/article/de
Shell echo命令详解 daizj echo shell
Shell echo命令 Shell 的 echo 指令与 PHP 的 echo 指令类似，都是用于字符串的输出。命令格式： echo string 您可以使用echo实现更复杂的输出格式控制。 1.显示普通字符串: echo "It is a test" 这里的双引号完全可以省略，以下命令与上面实例效果一致： echo Itis a test 2.显示转义
Oracle DBA 简单操作周凡杨 oracle dba sql
--执行次数多的SQL select sql_text,executions from ( select sql_text,executions from v$sqlarea order by executions desc ) where rownum<81; &nb
画图重绘朱辉辉33 游戏
我第一次接触重绘是编写五子棋小游戏的时候，因为游戏里的棋盘是用线绘制的，而这些东西并不在系统自带的重绘里，所以在移动窗体时，棋盘并不会重绘出来。所以我们要重写系统的重绘方法。在重写系统重绘方法时，我们要注意一定要调用父类的重绘方法，即加上super.paint(g)，因为如果不调用父类的重绘方式，重写后会把父类的重绘覆盖掉，而父类的重绘方法是绘制画布，这样就导致我们
线程之初体验西蜀石兰线程
一直觉得多线程是学Java的一个分水岭，懂多线程才算入门。之前看《编程思想》的多线程章节，看的云里雾里，知道线程类有哪几个方法，却依旧不知道线程到底是什么？书上都写线程是进程的模块，共享线程的资源，可是这跟多线程编程有毛线的关系，呜呜。。。线程其实也是用户自定义的任务，不要过多的强调线程的属性，而忽略了线程最基本的属性。你可以在线程类的run()方法中定义自己的任务，就跟正常的Ja
linux集群互相免登陆配置林鹤霄 linux
配置ssh免登陆 1、生成秘钥和公钥 ssh-keygen -t rsa 2、提示让你输入，什么都不输，三次回车之后会在~下面的.ssh文件夹中多出两个文件id_rsa 和 id_rsa.pub 其中id_rsa为秘钥，id_rsa.pub为公钥，使用公钥加密的数据只有私钥才能对这些数据解密 c
mysql : Lock wait timeout exceeded; try restarting transaction aigo mysql
原文：http://www.cnblogs.com/freeliver54/archive/2010/09/30/1839042.html 原因是你使用的InnoDB 表类型的时候, 默认参数:innodb_lock_wait_timeout设置锁等待的时间是50s, 因为有的锁等待超过了这个时间,所以抱错. 你可以把这个时间加长,或者优化存储
Socket编程基本的聊天实现。 alleni123 socket
public class Server { //用来存储所有连接上来的客户 private List<ServerThread> clients; public static void main(String[] args) { Server s = new Server(); s.startServer(9988); } publi
多线程监听器事件模式(一个简单的例子) 百合不是茶线程监听模式
多线程的事件监听器模式监听器时间模式经常与多线程使用,在多线程中如何知道我的线程正在执行那什么内容,可以通过时间监听器模式得到创建多线程的事件监听器模式思路: 1, 创建线程并启动,在创建线程的位置设置一个标记 2,创建队
spring InitializingBean接口 bijian1013 java spring
spring的事务的TransactionTemplate，其源码如下： public class TransactionTemplate extends DefaultTransactionDefinition implements TransactionOperations, InitializingBean{ ... } TransactionTemplate继承了DefaultT
Oracle中询表的权限被授予给了哪些用户 bijian1013 oracle 数据库权限
Oracle查询表将权限赋给了哪些用户的SQL，以备查用。 select t.table_name as "表名", t.grantee as "被授权的属组", t.owner as "对象所在的属组"
【Struts2五】Struts2 参数传值 bit1129 struts2
Struts2中参数传值的3种情况 1.请求参数绑定到Action的实例字段上 2.Action将值传递到转发的视图上 3.Action将值传递到重定向的视图上一、请求参数绑定到Action的实例字段上以及Action将值传递到转发的视图上 Struts可以自动将请求URL中的请求参数或者表单提交的参数绑定到Action定义的实例字段上，绑定的规则使用ognl表达式语言
【Kafka十四】关于auto.offset.reset[Q/A] bit1129 kafka
I got serveral questions about auto.offset.reset. This configuration parameter governs how consumer read the message from Kafka when there is no initial offset in ZooKeeper or
nginx gzip压缩配置 ronin47 nginx gzip 压缩范例
nginx gzip压缩配置更多 0 nginx gzip 配置随着nginx的发展，越来越多的网站使用nginx，因此nginx的优化变得越来越重要，今天我们来看看nginx的gzip压缩到底是怎么压缩的呢？ gzip(GNU-ZIP)是一种压缩技术。经过gzip压缩后页面大小可以变为原来的30%甚至更小，这样，用
java-13.输入一个单向链表，输出该链表中倒数第 k 个节点 bylijinnan java
two cursors. Make the first cursor go K steps first. /* * 第 13 题：题目：输入一个单向链表，输出该链表中倒数第 k 个节点 */ public void displayKthItemsBackWard(ListNode head,int k){ ListNode p1=head,p2=head;
Spring源码学习-JdbcTemplate queryForObject bylijinnan java spring
JdbcTemplate中有两个可能会混淆的queryForObject方法： 1. Object queryForObject(String sql, Object[] args, Class requiredType) 2. Object queryForObject(String sql, Object[] args, RowMapper rowMapper) 第1个方法是只查
[冰川时代]在冰川时代,我们需要什么样的技术? comsci 技术
看美国那边的气候情况....我有个感觉...是不是要进入小冰期了? 那么在小冰期里面...我们的户外活动肯定会出现很多问题...在室内呆着的情况会非常多...怎么在室内呆着而不发闷...怎么用最低的电力保证室内的温度.....这都需要技术手段... &nb
js 获取浏览器型号 cuityang js 浏览器
根据浏览器获取iphone和apk的下载地址 <!DOCTYPE html> <html> <head> <meta charset="utf-8" content="text/html"/> <meta name=
C# socks5详解转 dalan_123 socket C#
http://www.cnblogs.com/zhujiechang/archive/2008/10/21/1316308.html 这里主要讲的是用.NET实现基于Socket5下面的代理协议进行客户端的通讯，Socket4的实现是类似的，注意的事，这里不是讲用C#实现一个代理服务器，因为实现一个代理服务器需要实现很多协议，头大，而且现在市面上有很多现成的代理服务器用，性能又好，
运维 Centos问题汇总 dcj3sjt126com 云主机
一、sh 脚本不执行的原因 sh脚本不执行的原因只有2个 1.权限不够 2.sh脚本里路径没写完整。二、解决You have new mail in /var/spool/mail/root 修改/usr/share/logwatch/default.conf/logwatch.conf配置文件 MailTo = MailFrom 三、查询连接数
Yii防注入攻击笔记 dcj3sjt126com sql WEB安全 yii
网站表单有注入漏洞须对所有用户输入的内容进行个过滤和检查，可以使用正则表达式或者直接输入字符判断，大部分是只允许输入字母和数字的，其它字符度不允许；对于内容复杂表单的内容，应该对html和script的符号进行转义替换：尤其是<,>,',"",&这几个符号这里有个转义对照表： http://blog.csdn.net/xinzhu1990/articl
MongoDB简介[一] eksliang mongodb MongoDB简介
MongoDB简介转载请出自出处：http://eksliang.iteye.com/blog/2173288 1.1易于使用 MongoDB是一个面向文档的数据库，而不是关系型数据库。与关系型数据库相比，面向文档的数据库不再有行的概念，取而代之的是更为灵活的“文档”模型。另外，不
zookeeper windows 入门安装和测试 greemranqq zookeeper 安装分布式
一、序言以下是我对zookeeper 的一些理解： zookeeper 作为一个服务注册信息存储的管理工具，好吧，这样说得很抽象，我们举个“栗子”。栗子1号：假设我是一家KTV的老板，我同时拥有5家KTV，我肯定得时刻监视
Spring之使用事务缘由(2-注解实现) ihuning spring
Spring事务注解实现 1. 依赖包： 1.1 spring包： spring-beans-4.0.0.RELEASE.jar spring-context-4.0.0.
iOS App Launch Option 啸笑天 option
iOS 程序启动时总会调用application:didFinishLaunchingWithOptions:，其中第二个参数launchOptions为NSDictionary类型的对象，里面存储有此程序启动的原因。 launchOptions中的可能键值见UIApplication Class Reference的Launch Options Keys节。 1、若用户直接
jdk与jre的区别（_） macroli java jvm jdk
简单的说JDK是面向开发人员使用的SDK，它提供了Java的开发环境和运行环境。SDK是Software Development Kit 一般指软件开发包，可以包括函数库、编译程序等。 JDK就是Java Development Kit JRE是Java Runtime Enviroment是指Java的运行环境，是面向Java程序的使用者，而不是开发者。如果安装了JDK，会发同你
Updates were rejected because the tip of your current branch is behind qiaolevip 学习永无止境每天进步一点点众观千象 git
$ git push joe prod-2295-1 To [email protected]:joe.le/dr-frontend.git ! [rejected] prod-2295-1 -> prod-2295-1 (non-fast-forward) error: failed to push some refs to '[email protected]
[一起学Hive]之十四-Hive的元数据表结构详解 superlxw1234 hive hive元数据结构
关键字：Hive元数据、Hive元数据表结构之前在 “[一起学Hive]之一–Hive概述，Hive是什么”中介绍过，Hive自己维护了一套元数据，用户通过HQL查询时候，Hive首先需要结合元数据，将HQL翻译成MapReduce去执行。本文介绍一下Hive元数据中重要的一些表结构及用途，以Hive0.13为例。文章最后面，会以一个示例来全面了解一下，
Spring 3.2.14，4.1.7，4.2.RC2发布 wiselyman Spring 3
Spring 3.2.14、4.1.7及4.2.RC2于6月30日发布。其中Spring 3.2.1是一个维护版本(维护周期到2016-12-31截止)，后续会继续根据需求和bug发布维护版本。此时，Spring官方强烈建议升级Spring框架至4.1.7 或者将要发布的4.2 。其中Spring 4.1.7主要包含这些更新内容。