weixin_34334744

大数据和「数据挖掘」是何关系？---来自知乎

知乎用户，互联网

244 人赞同

在我读数据挖掘方向研究生的时候：
如果要描述数据量非常大，我们用Massive Data（海量数据）
如果要描述数据非常多样，我们用Heterogeneous Data（异构数据）
如果要描述数据既多样，又量大，我们用Massive Heterogeneous Data（海量异构数据）
……
如果要申请基金忽悠一笔钱，我们用Big Data（大数据）

编辑于 2014-02-2817 条评论感谢

收藏没有帮助举报作者保留权利

刘知远，NLPer

4 人赞同

我觉得大数据和深度学习一样，是让艰深的计算机概念得到公众认知和认可的有效尝试，无论是 “大”字还是“深度”，都非常形象也很直观地展示了这些研究课题的挑战和意义，虽然这些研究课题在相关研究领域早已被探索了几十年。

发布于 2014-05-15添加评论感谢

收藏没有帮助举报作者保留权利

叶开，非参数统计，数据挖掘，R

21 人赞同

谈谈个人见解：
数据挖掘基于数据库理论，机器学习，人工智能，现代统计学的迅速发展的交叉学科，在很多领域中都有应用。涉及到很多的算法，源于机器学习的神经网络，决策树，也有基于统计学习理论的支持向量机，分类回归树，和关联分析的诸多算法。数据挖掘的定义是从海量数据中找到有意义的模式或知识。

大数据是今年提出来，也是媒体忽悠的一个概念。有三个重要的特征：数据量大，结构复杂，数据更新速度很快。由于Web技术的发展，web用户产生的数据自动保存、传感器也在不断收集数据，以及移动互联网的发展，数据自动收集、存储的速度在加快，全世界的数据量在不断膨胀，数据的存储和计算超出了单个计算机(小型机和大型机)的能力，这给数据挖掘技术的实施提出了挑战（一般而言，数据挖掘的实施基于一台小型机或大型机，也可以进行并行计算）。Google提出了分布式存储文件系统，发展出后来的云存储和云计算的概念。
大数据需要映射为小的单元进行计算，再对所有的结果进行整合，就是所谓的map-reduce算法框架。在单个计算机上进行的计算仍然需要采用一些数据挖掘技术，区别是原先的一些数据挖掘技术不一定能方便地嵌入到 map-reduce 框架中，有些算法需要调整。
此外，大数据处理能力的提升也对统计学提出了新的挑战。统计学理论往往建立在样本上，而在大数据时代，可能得到的是总体，而不再是总体的不放回抽样。

发布于 2014-03-07添加评论感谢

收藏没有帮助举报作者保留权利

张伟棋，candidate for datascience master

8 人赞同

关于大数据的定义很多，引述 Doug Laney 2001 关于大数据的主流定义。
翻译易有偏差，下面是英文定义，从容量（Volume），速率（Velocity）和种类（Variety）三个方面来阐述：

Volume. Many factors contribute to the increase in data volume. Transaction-based data stored through the years. Unstructured data streaming in from social media. Increasing amounts of sensor and machine-to-machine data being collected. In the past, excessive data volume was a storage issue. But with decreasing storage costs, other issues emerge, including how to determine relevance within large data volumes and how to use analytics to create value from relevant data.
Velocity. Data is streaming in at unprecedented speed and must be dealt with in a timely manner. RFID tags, sensors and smart metering are driving the need to deal with torrents of data in near-real time. Reacting quickly enough to deal with data velocity is a challenge for most organizations.
Variety. Data today comes in all types of formats. Structured, numeric data in traditional databases. Information created from line-of-business applications. Unstructured text documents, email, video, audio, stock ticker data and financial transactions. Managing, merging and governing different varieties of data is something many organizations still grapple with.

而数据挖掘（Data mining）简单的说，则是一个从未经处理过的数据中提取信息的过程，重点是找到相关性和模式分析。

大数据和数据挖掘的相似处或者关联在于：数据挖掘的未来不再是针对少量或是样本化，随机化的精准数据，而是海量，混杂的大数据。

编辑于 2014-03-23添加评论感谢

收藏没有帮助举报作者保留权利

肖智博，大数据是媒体发明出来骗人的

75 人赞同

我还是一贯坚持我的态度：「大数据」是媒体忽悠出来的名词，这东西是用来骗钱和骗项目的。所以也就回答了你的第一个问题，不是延伸。第二个问题是，没有相似度。

接下来好好说。如果说硬要说相似度的话，那么重合度的确是有很高。因为大数据干的事情其实就是数据挖掘做的事情。

数据挖掘之前叫KDD(Knowledge Discovery and Data Mining, 或者也可以是 Knowledge Discovery in Database)，这样说就很好解释了。数据挖掘就是从海量的数据中发现隐含的知识和规律。那么说，这个东西是啥时候提出来的？上个世纪。大数据啥时候提出来的？也就这几年的事情吧。所以说，大数据很大程度上是数据挖掘的一个好听的名字。

其实也不能一概否定「大数据」，至少通过媒体的热炒，让很多人知道了「数据」的重要性。只是很多人都不知道怎么做大数据，因为这个东西本来就是虚的嘛。如果想了解大数据，那么踏踏实实的做法是学习一下「数据挖掘」和「机器学习」相关的知识。具体的内容，可以搜索一下我以前答过的内容。

发布于 2014-02-2722 条评论感谢

收藏没有帮助举报作者保留权利

许方正，想成为一名***。。。

28 人赞同

谢邀，以前关注过一段时间的大数据，不过现在主要纠结社区发现去了，暂时没用到大数据- -，有什么不对的地方请指正，不过勿喷。。。咳咳，我觉得我看过的一本书上讲的还不错的，大致介绍一下。

我们处理许多问题的核心思想在于样本选取和结果选取：

样本选取：从很久以前到现在，我们获取数据的能力以及分析数据的能力都是很有限的，这就导致，很多数据我们是无法在我们需要的时候采集到的，举一个例子：人口普查。近代美国要求10年进行一次人口普查，但是随着人口的增长速度越来越快，到后来统计出国家的大致人口都需要13年了。。因此不能采用普查。因此我们必须使用另一种经典的方法，并以此方法达到通过获取少量数据就能够分析大规模问题的目的——抽样。我们都知道抽样调查是有各种各样的要求和准则，而且合理性也经常不如人意，但是在之前获取数据难度很大的前提下（只能亲自去看，一个一个人工考察），这种方法的确赋予了我们处理大规模数据的能力：从里面完全随机的（我们都知道这是不可能的）选择一些正确的（数据完全正确也是不可能的）数据进行分析。

样本分析：通过上述介绍的抽样方式，我们获得了我们分析问题所需要的数据。我们现在要开始利用它们，那么怎么利用呢？数据可以是很简单的，例如长度，温度，时间，重量等等；也可以是很复杂的，一本书，一张图，一个石头。之所以说这些数据复杂，是因为它们是由我们提到的诸如重量长度等等简单的数据构成的。那么，如果我们要分析石头的话，将会变得很困难——因为要处理的数据种类实在太多了，各种数据之间还存在这样那样的影响。这让我们计算能力严重不足的祖先们（只有笔和算盘，各种函数和公式都么有发明。。）无比的抓狂。。。因为等我们用简单粗暴的方式算出来了以后，数据的有效期很可能已经过了（参见前面说的人口普查数据）。因此我们又发明了一个牛逼而经典的方法——建模。我们采用几个对描述这个对象很关键的数据来代替所有的数据，这样，计算量和计算难度都有客观的改善。

上面介绍的就是我们传统的数据获取和处理方法，下面就要讲一下数据挖掘了。

为什么我们要挖掘数据，我个人认为是因为我们现在获取数据的难度大大地降低了，所以我们有了很多很多很多的数据了- -，看着都要吐了。。。是的。。

正是因为看着都要吐了，所以我们不想看了，我们想要不用人脑，而让计算机来帮我们找到数据的价值，于是我们就要用数据挖掘方法了，也就是肖智博提出来的：数据挖掘就是从海量的数据中发现隐含的知识和规律。所以数据挖掘的前提和大数据的前提是一样的，就是海量数据。所以就方法而言，二者是很类似的。

我们现在总是提的大数据，我认为主要是一种思路：
1.不使用抽样的数据，而采用全部的数据：这里我指的全部的数据是完全所有的数据，包括正确的和不正确的数据都要采用。噪声和错误数据同样包含着有用的信息。

2. 不关心为什么，只关心是什么：因为我们有了海量的数据，因此我们通过大数据统计出的结果应该是具有相当程度的普适性的。所以把这种现象-结果拿去套就行了。如果探究和证明因果关系的话，通常是极为困难的。一个例子就是经典的啤酒和尿布，从数据中获得这种结果很简单，把它们放在一起就能增加销量从而达到沃尔玛的目的，而去查明原因则费事的多。

3. 相比数据分析方法而言更注重数据获取：换一种说法就是数据为先。因为现在计算机太牛逼了，所以只要我们想到办法，它就能替我们干相应的活。基于此，我们要做的就是获取更多的，更全面的数据来让计算机分析。例如国外快递公司在车上装传感器来帮助快递调度，劳斯莱斯公司在飞机发动机上装传感器并通过历史数据和实时数据预先预测潜在故障并提前检修的例子。大数据思维模式中，数据为我们提供最多的可能和最大的价值，所以着重获取数据。

说了这么多，我想说的就是数据挖掘可以概括为：在我们掌握的数据多了以后，把数据交给计算机分析的方法的集合。而大数据则是跳出我们的传统数据分析和处理方法框架的一种新思维。一种思维和一类技术比起来，确实是要虚很多，而且思维要付诸实现，必然是要以技术为基础的。但是正是由于思维方式的不同，我们可以从数据中获得更多的东西，比如对之前认为没有价值的噪声和错误数据的分析，或者对现象的重视而意外发现的一些有意思的结果等等。。

因此，我个人认为，大数据是我们在不断发展数据挖掘技术的过程中诞生出来的一种新思维，这种思维的实际应用以数据挖掘技术为基础，并可以促进我们开发出更多的数据挖掘技术。。

发布于 2014-04-264 条评论感谢

收藏没有帮助举报作者保留权利

aiirii wong

20 人赞同

看了不少评论说只是忽悠，就好像到现在还有很多人认为云计算是虚拟化的同义词，也是忽悠一样，其实是自己还没真正了解其内涵；
就好像云计算是因为虚拟化技术发展的量变导致质变(虽然虚拟化不是实现云计算的必要前提)；大数据也是同样的道理是旧技术发展到一定程度导致的新产物，
很多人还停留在大数据就是海量数据的概念（这只是其中一个特征），网上很多所谓的大数据例子，也体现不出目前大数据的明显特征，和之前的数据挖掘显示不出差别，更加让部分人以为大数据就是数据挖掘的别名；

我个人的理解，有若干区别：
1，数据挖掘还是基于用户假设了因果，然后进行验证；而大数据则重点在找出关联关系，A的变化会影响到B的变化幅度；
2，传统的方法只是从内部数据库数据提取，分析数据；大数据则从更多途径，采用更多非结构化的数据；
3，处理时间上，传统的对时间要求不高；大数据强调的是实时性，数据在线即用；
4，传统的方式，重点还是从数据中挖掘出残值；而大数据则是从数据中找出新的内容，创新的价值；
...

最大的区别，还是思维的不同，思考方式的不同，导致后面的方法论，工具有很大的区别；

编辑于 2015-05-153 条评论感谢

收藏没有帮助举报作者保留权利

知乎用户，热爱Python，Data Debugger，机器学习进…

3 人赞同

数据挖掘是一门技术，是学问，更狭义一点就是对一类算法研究的总称，这些算法的共同特点是从希望从真实世界的数据中识别出有用的pattern，进而获取新的知识，最终落实到decision making。

大数据，这个概念非常的虚，被赋予了太多的含义，缺乏实质的内涵。但是“大”是他们的共性。我更倾向于将其理解为近年来兴起的一系列数据处理工具，其代表就是基于MapReduce的Hadoop。他们大多基于分布式环境，以能够处理海量数据或者实时性为卖点。

编辑于 2014-02-27添加评论感谢

收藏没有帮助举报作者保留权利

知乎用户，答案被收藏161616次，求知道路走了1%

14 人赞同

以山西开矿的煤老板为例：

开矿的前提是有矿，包括煤矿的储藏量，储藏深度，煤的成色。

之后是挖矿，要把这些埋在地下的矿挖出来，需要挖矿工，挖矿机，运输机。

之后是加工，洗煤，炼丹，等等。

最后才是转化为银子。

数据行业十分类似：

挖掘数据的前提是有数据，包括数据的储藏量，储藏深度，数据的成色。

之后是数据挖掘，要把这些埋藏的数据挖掘出来。

之后是数据分析输出，要把这些数据可视化输出，指导分析、商业实践。

直到这一步，才创造了价值。

所谓的大数据，大约就是说现在有座正在形成的巨型矿山，快去抢占成为煤老板吧，下一个盖茨兴许将在这里诞生。

编辑于 2014-03-013 条评论感谢

收藏没有帮助举报作者保留权利

徐晓轶，AI，儒学，https://github.com/andrewxxyi/JXPi

6 人赞同

两回事，大数据是海量数据环境下如何还能保持对某个访问会话的快速响应。数据挖掘是从大量的历史信息中总结出有用的知识。这是两个层次上的事情。
数据挖掘原则上是可以不需要大数据的，因为它对响应速度并无要求，它看重的是挖掘出来的知识的效用。但对于海量数据环境下，如果没有大数据的相关数据快速供给能力，那么数据挖掘所消耗的计算资源可能使得其根本无法完成或成本太高。

发布于 2014-02-273 条评论感谢

收藏没有帮助举报作者保留权利

周李，屌丝想搞数据挖掘

7 人赞同

个人觉得数据挖掘是一门技术，是相对比较狭义上的一个概念。
而大数据更像一个产业，数据挖掘当然是其一个核心技术。但是，大数据与数据挖掘不同的是，他还涉及到其他广泛的技术，其中代表的如可视化技术，数据存储和管理技术。
大数据不仅仅是利用数据挖掘技术从数据中挖掘有用的信息，他还要采取海量数据，通常要分布实时处理，最后利用要组织数据挖掘技术得到的信息，向用户直观的展示这些信息~

发布于 2014-02-28添加评论感谢

收藏没有帮助举报作者保留权利

知乎用户，PhD candidate

6 人赞同

我对这个问题表示倒是没有什么特别的看法，只是在此回忆一些我老板的话。
1、（大二的时候实验室大老板给上数据库的课，在课上发表过一些关于大数据的看法，大意是：）其实大数据并不是什么新鲜的概念，很早就有了。只是最近几年又有人冷饭热炒把它翻出来，也就是在炒作。炒作好了就可以向国家汇报，申请什么自然科学基金什么。
2、（这一段是实验室内部大老板做的一个内部报告，只把最不重要的并且在其他场合讲过的一些拿出来）大数据其实并没有一个特别明确的定义，多大的数据算大数据？这个并没有一个统一的标准。20年前，几百兆的数据我们看起来就很大；几年前我们觉得几个GB的数据算大数据；现在我们觉得几个TB的数据才能叫大数据。大数据这个标准是在计算机计算能力发展的情况下不断变化的。（老板在报告里给出过一个我觉得比较靠谱的定义，但是不知道有没有发表）
3、对于题主的问题【大数据是不是数据挖掘的延伸？两者的相似度有多少？】，我觉得两者并没有什么关系。大数据带来的问题是因为越来越多的数据产生出来而自然引发的一系列的在包括数据库系统、计算方法等基础问题上现有工具无法有效处理的问题；而数据挖掘则是在数据基础上进行知识发现的过程。这两者并不存在明显的谁是谁的延伸的问题，也并没有多少相似的地方。

硬要说两者有何关系的话，可以看看下面。
大数据带来的挑战主要是现在基础技术无法满足需求。比如传统上我们觉得一个亚线性时间算法不错，可是拿到大数据上，亚线性时间也不行了，这就是数据量的增长对于整个计算机科学界提出的挑战，你说你有一个O(log(n))的算法，那放到大数据身上也是不管用的（指的是不能分布计算的场景，能分布计算的话只要多搞几台机器（像MapReduce那样），分散开来变成“小数据”之后也就不叫大数据了）。由此给数据挖掘带来的问题就是很多数据挖掘算法即使在传统概念上的时间复杂度很低，现在也不能满足要求了。
【以上】

编辑于 2014-05-161 条评论感谢

收藏没有帮助举报作者保留权利

徐申

4 人赞同

先说说我对大数据的理解。我以为大数据有2层意思：首先是万物皆可数据化。数据化不等于数字化，数据化指的是将对象量化成可分析的数据，可以是结构化的，也可以是非结构化的。援引来自2013年4月19号《东方早报》的文章《比你更了解你——大数据时代的汽车生活》中的一段：
再来说一个例子，你可能永远也想不到你开车时的坐姿可以防止汽车被盗，这听起来简直不可思议，但这就是现实存在的事，日本某工业研究所通过在汽车座椅下安装360个压力传感器来测量人对座椅各部分施加压力的方式，并且通过0-256个数值范围进行量化，这样，每个乘坐者都将产生一份专属的数据资料，这个系统可以根据人对座位的压力差异识别出乘坐者的身份，准确率高达98%，这项技术作为汽车防盗系统装在车上时，汽车就会知道驾驶者是不是车主，如果不是，汽车就会自动熄火，另外也可以根据坐姿数据来判断司机是否正处于疲劳驾驶，系统可以通过自动减速或刹车来控制可能带来的危险。

我举这个例子是想说明借助今天的技术和数学统计知识，以前不能量化描述的东西今天已经可以在计算机上分析和表达，即数据化。
第二层意思是大数据的“样本即总体”。这个观点来自于舍恩伯格的《大数据时代》。以前的定量调查和分析的数据，受限于技术、资金等条件，总是从整体中抽取一部分样本，针对这些样本进行调查。但是大数据不一样，大数据分析的数据是整体。
总之，大数据是一种思维方式。
然而回到数据挖掘这个关键词上来。之前的回答已经很清楚地解释了数据挖掘，以及与大数据之间的不同。我想强调的一点是：大数据的独特魅力在于新颖而又具有实际意义的数据挖掘，如经典的”啤酒与尿布“的案例。

编辑于 2014-03-012 条评论感谢

收藏没有帮助举报作者保留权利

匿名用户

3 人赞同

数据挖掘=大数据+机器学习

发布于 2015-01-19添加评论感谢

收藏没有帮助举报作者保留权利

知乎用户，运筹学博士 / 在美国从事保险数据挖掘

2 人赞同

今天开会老板对大数据的总结十分精彩：大数据就像“teenage-sex”，所有人都在谈论这个，所有人都以为别人在做这个，所以所有人都声称自己也在做这个。。。

--------------------------------------------------------------------------------------------------------------------
在我看来大数据是一种属性，而数据挖掘是方法，或者说是方法的集合。

我认为数据挖掘就是指从单纯无序杂乱的数据里面提取出有用的信息，首先要规范化数据，然后根据想要回答的问题选择相应的方法，可以建立模型预测未来，也可以对当前数据聚类等等。也可以是单纯的从数据中找寻规律，并不一定要回答特定的问题。所以我觉得用excel作pivot table也是一种数据挖掘。

而大数据就是指数据的特性，顾名思义就是大。海量数据会造成很多问题，首先计算量就是一个问题，最简单的个人电脑的内存在数据量达到百万行的时候基本上就捉襟见肘了，读入就成问题，更谈不上计算了，当然计算速度就是附带的问题。然后就是选择的问题了，以往都是数据量太少，要预测一个量恨不得把能收集到的其他量都用上，现在是数据量太大，想象一下1000多个不同的量预测一个量的模型你能信任吗，即使真的相信了这样的模型，要很难利用这样的模型给出合适的建议。第三个大数据特点就是实时更新，因为每天都可以产生大量数据，昨天的模型需要用今天的模型验证，然后修正，这就是一个不断更正的过程。

我不觉得大数据全是炒作出来的噱头，什么都数字化的今天，数据的处理方法上还是有一些特别的地方的。不过数据还是数据，处理的核心还是不会变的。

编辑于 2014-09-09添加评论感谢

收藏没有帮助举报作者保留权利

知乎用户，数据分析，数据挖掘新手

2 人赞同

新手一枚，简单述说一下我的观点，大数据和数据挖掘的关系
1.首先，数据挖掘是一种工具，并且由来已久，不是什么新鲜东西；而大数据是新近几年才出现的概念，主要强调了全景数据，全量数据，其中大部分是非结构化数据或半结构化数据（我们一般说的数据基本上都是结构化数据）
2.其次，数据挖掘属于数据分析的一个工具，而数据分析是探索大数据规律的方法，由此可知，某种程度上可以说数据挖掘是大数据分析的一个工具。

并且从维基百科上我们可以发现
数据挖掘有以下这些不同的定义：
“从数据中提取出隐含的过去未知的有价值的潜在信息”
“一门从大量数据或者数据库中提取有用信息的科学。”

说到数据挖掘，应该说说知识发现（KDD），数据挖掘与KDD的关系是：KDD是从数据中辨别有效的、新颖的、潜在有用的、最终可理解的模式的过程；而数据挖掘是KDD通过特定的算法在可接受的计算效率限制内生成特定模式的一个步骤。如今的各种文献资料中，这两个术语经常不加区分的使用，数据挖掘（DM）=知识发现（KDD），并且商业领域一般说数据挖掘，而学术领域就说KDD。

大数据指的是所涉及的数据量规模巨大到无法通过人工，在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息，数据挖掘（data mining）则是在探讨用以解析大数据的方法。

3.举例说明，Google 流感趋势

我们发现，某些搜索字词非常有助于了解流感疫情。Google 流感趋势会根据汇总的 Google 搜索数据，近乎实时地对全球当前的流感疫情进行估测。

【全球每星期会有数以百万计的用户在网上搜索健康信息。正如您所预料的那样，在流感季节，与流感有关的搜索会明显增多；到了过敏季节，与过敏有关的搜索会显著上升；而到了夏季，与晒伤有关的搜索又会大幅增加。所有这些现象均可通过 Google 搜索解析进行研究。但是，搜索查询趋势能否为实际现象建立一个准确可靠的模式而提供依据呢？

我们发现，搜索流感相关主题的人数与实际患有流感症状的人数之间存在着密切的关系。当然，并非每个搜索“流感”的人都真的患有流感，但当我们将与流感有关的搜索查询汇总到一起时，便可以找到一种模式。我们将自己统计的查询数量与传统流感监测系统的数据进行了对比，结果发现许多搜索查询在流感季节确实会明显增多。通过对这些搜索查询的出现次数进行统计，我们便可以估测出世界上不同国家和地区的流感传播情况。】本文已经发表在美国《自然》杂志上http://static.googleusercontent.com/media/research.google.com/zh-CN//archive/papers/detecting-influenza-epidemics.pdf

（1）这个简单的例子说明，谷歌利用计算机数据挖掘相关工具挖掘搜索引擎的记录（全部流感记录），找出数据背后的规律，即流感趋势，这里流感记录就是全量数据，不是随机抽样的，这是区别于之前（2010年之前）的数据分析的最大区别。

（2）理想中大数据主要是非结构化或半结构化数据，而这里谷歌的记录数据仍然是结构化数据，因此大数据是一个处在不断发展、更新的概念，当然数据挖掘工具也处在不断升级完善中，理想中的数据挖掘工具应该可以处理全量数据、即时数据、多类型数据、·····总之，大数据和数据挖掘都在不断变化发展中，我们常人都是根据历史数据来理解大数据和数据挖掘，当然有一个万变不离其宗的东西就是基于应用统计学的分析方法。

以上就是鄙人的愚见，希望大家可以多加讨论，集思广益来理解大数据和数据挖掘

发布于 2014-03-03添加评论感谢

收藏没有帮助举报作者保留权利

何栋栋，哼哼哈嘿

1 人赞同

简单来说，数据挖掘应该比大数据出现得早。人们在进行生产（商业也算哦）的过程中会发现有一些数据，这些数据伴随着生产过程产生，必然包含着一些规律，人们就想用一些方法把枯燥数据里的秘密挖掘出来，于是动用统计啊计算啊机器学习之类的方法（方法不重要，能挖出秘密重要），把这个过程叫做数据挖掘；而大数据，只是泛泛而谈罢了，大致指的是海量数据，是个大概念，不具体。

发布于 2014-03-10添加评论感谢

收藏没有帮助举报作者保留权利

地主，地主老爷

1 人赞同

大数据可以理解为一个技术手段、平台、工具或者是一种思想
而数据挖掘是工作目标，在没有大数据概念之前，数据挖掘可以用关系型数据库、分析型数据库等等，现在只不过多了一个选择，而且是一个很好用的技术手段。

发布于 2014-12-08添加评论感谢

收藏没有帮助举报作者保留权利

杨学晨，我在故我知乎

1 人赞同

挖掘——明显的低端体力劳动，不值一提
大（海量）——绝对的高精尖科技，不明觉厉

同样的啤酒，同样的尿布，码农写下了朴素的本质，资本家吹出了高大上的蓝图。

媒体与大众的视角

从媒体的宣传来看，完全是借用了“大数据”这一名词向大众灌输了“数据挖掘”在商业活动和社会生活中的潜藏的巨大作用。不论是早已威名远播的“啤酒与尿布”，还是新鲜出炉的“纸牌屋”，无不是对数据挖掘的商业价值的完美诠释。正如开篇所言，“大数据”无疑比“数据挖掘”更具有吸引眼球的潜质。对于普通大众而言，让他们知道海量数据如何存储和处理并不重要，重要的是告诉他们数据的背后存在着价值。于是乎，“大数据”成为了“数据挖掘”的代名词，通过媒体狂轰滥炸地宣传成功上位，成为某些利益集团用于概念炒作的工具。

专业的视角

正如 @张伟棋引用的定义所言，大数据概念强调了在对于具有数据容量大、产生速度快、数据类型杂的特点的数据的处理，包含了与之相关的存储、计算等方面的技术。数据挖掘的发展过程中，不断追求着从更多来源获得更大数据量并进行更高效地分析，以期获得更全面、更准确、更及时的结果。我认为，大数据概念的提出是数据挖掘技术发展和应用带来的必然结果，是对数据挖掘发展中遇到的海量数据相关问题的提炼和总结，并由此形成的对立的相关概念。

编辑于 2014-03-01添加评论感谢

收藏没有帮助举报作者保留权利

旺仔面，咨询顾问，业余摄影师

简单粗暴地讲，大数据是海洋，大数据中的信息则是鱼，而“数据挖掘”就是捕鱼的网。如果把 “大数据” 狭义地理解为一类数据源，那么，“数据挖掘” 就是用来驾驭 “大数据” 的重要手段之一。

由于大数据是一类复杂的、不友好的数据源，用传统的方法往往难以驾驭，为了能够有效利用大数据，人们就逐渐发明出一套系统的方法工具，来对大数据进行收集、存储、抽取、转化、加载、清洗、分析、挖掘和应用，而 “数据挖掘 Data mining” 就是对各种挖掘工具方法的统称。

需要注意的是，大数据源通常不能直接进行数据挖掘，还需要耗费大量工作量进行预处理。当然，完成了数据挖掘还没有结束，还需要对挖掘结果进行业务应用，才能创造价值。就好比有一座铁矿山，得先从矿山中开采出品质达标的铁矿石（预处理过程，数据清洗、集成、变换和规约），才能送到炼钢厂冶炼为钢材（挖掘过程），最终钢材还要用到建筑工地上（应用过程）。

-- -- -- -- -- -- -- -- -- -- 首先来看什么是“大数据” -- -- -- -- -- -- -- -- -- --

1.大数据是具备3V特征（Volume 大体量、Variety 复杂多样、Velocity 高速时效)的数据源。大众很容易理解 Volume，互联网公司、运营商和金融机构的数据量动辄以TB计，却往往会忽视 Variety 和 Velocity。

Variety 是指大数据来源丰富、形态多样，常见的大数据就包括电商用户数据、文本数据、社交网络数据、车载信息服务数据、时间和位置数据、RFID数据、智能电网数据、设备传感器数据等等。

Velocity 是指大数据一边高速海量生成，同时数据的分析和应用也实时完成，比如，网络广告程序化购买、互联网金融实时授信，都涉及到实时处理海量数据的技术。

2. 大数据也是一个相对的概念，目前的“小数据”，曾经也是“大数据”。比如ERP、CRM里导出的数据，现在用excel就能轻松驾驭，但在几十年前，放在当时的技术条件下，这样的数据又何尝不是大体量、多样、高速的 "大数据"。目前的“大数据”，随着技术发展，未来也会成为能够轻松驾驭的“小数据”。

3. 大数据通常都是机器自动生成的，例如物联网中传感器自动生成环境数据。而传统数据的生成往往涉及人工因素，例如零售交易、电话呼叫等等。

4. 大数据往往不是 “结构化” 的，因此难以驾驭。收集传统数据源的交易系统通常会以整洁的、预先规范好的模板方式来生成数据，以确保数据容易被加载和使用。而大数据源在最开始通常不会被严格地定义，而是去收集所有可能使用到的信息。

常见的财务报表就是典型的 “结构化” 数据，表头明确了数据的类别、科目，整洁规范。
网络日志则是“半结构化”数据的代表，看起来乱七八糟，完全谈不上整洁规范，但其中每一条信息却都有特定用处。
而文本，诸如博客文章、论坛评论则是 “非结构化” 数据，必须耗费大量精力进行转化和清洗，才能进行分析和利用。

5. 很多数据可能就是垃圾，并不蕴含大量价值。事实上，大部分数据甚至毫无价值。一篇网页日志中会含有非常重要的数据，但其中也包含了很多根本没有价值的数据。对其进行提炼，从而保留有价值的部分是非常必要的。

-- -- -- -- -- -- -- -- -- -- 再来看什么是“数据挖掘” -- -- -- -- -- -- -- -- -- --

既然大数据通常是 “大体量、发杂多样、高速实时”，而且不是 “结构化” 的，这就引出一个问题，如何驾驭大数据？

前面提到，人们发明出包括数据收集、存储、抽取、转化、加载、清洗、分析、挖掘和应用的方法用以驾驭大数据，而 “数据挖掘 Data mining” 就是对各种挖掘工具方法的统称。

要理解 “数据挖掘” ，可以和 “数据分析” 做个简单比较

数据分析的分析目标往往比较明确，分析条件也比较清楚，基本上就是采用统计方法，对数据进行多维度地描述；
数据挖掘的目标却不是很清晰，要依靠挖掘算法来找出隐藏在大量数据中的规律和模式，也就是从数据中提取出隐含的、未知的有价值的信息。

在实践中，数据挖掘一般划分为 “分类”、“聚类”、“关联” 和 “序列” 等几大常见问题，针对每一类问题，又有专门的挖掘算法来处理。例如，用户流失预警模型、促销活动响应模型都用于预测用户某个行为的发生概率，属于 “分类” 问题，可以用决策树算法、逻辑回归算法、多元线性回归、神经网络算法来处理。

想了解大数据的朋友可以看看《驾驭大数据》（Bill Franks 著、黄海译、人民邮电出版社），是入门书籍里比较系统的，很适合帮助自己对大数据形成一个基本认知框架。

转载于:https://blog.51cto.com/hashlinux/1796066

你可能感兴趣的:(大数据和「数据挖掘」是何关系？---来自知乎)

斤斤计较的婚姻到底有多难？白心之岂必有为
很多人私聊我会问到在哪个人群当中斤斤计较的人最多？我都会回答他，一般婚姻出现问题的斤斤计较的人士会非常多，以我多年经验，在婚姻落的一塌糊涂的人当中，斤斤计较的人数占比在20～30%以上，也就是说10个婚姻出现问题的斤斤计较的人有2-3个有多不减。在婚姻出问题当中，有大量的心理不平衡的、尖酸刻薄的怨妇。在婚姻中仅斤斤计较有两种类型：第一种是物质上的，另一种是精神上的。在物质与精神上抠门已经严重的影响
情绪觉察日记第37天露露_e800
今天是家庭关系规划师的第二阶最后一天，慧萍老师帮我做了个案，帮我处理了埋在心底好多年的一份恐惧，并给了我深深的力量！这几天出来学习，爸妈过来婆家帮我带小孩，妈妈出于爱帮我收拾东西，并跟我先生和婆婆产生矛盾，妈妈觉得他们没有照顾好我…。今晚回家见到妈妈，我很欣赏她并赞扬她，妈妈说今晚要跟我睡我说好，当我们俩躺在床上准备睡觉的时候，我握着妈妈的手对她说:妈妈这几天辛苦你了，你看你多利害把我们的家收拾得
芦花鞋一四许叶晗
又是在一个寒冷的夏日里，青铜和葵花决定今天一起去卖芦花鞋，奶奶亲手给他们做了一碗热乎乎的粥对他们说:“就靠你们两挣生活费了这碗粥赶紧趁热喝了吧！”于是青铜和葵花喝完了奶奶给她们做的粥，就准备去镇上卖卢花鞋，这回青铜和葵花穿着新的芦花鞋来到了镇上。青铜这回看到了很多人都在卖，用手势表达对葵花说:“这回有好多人在抢我们生意呢！我们必须得吆喝起来。”葵花点了点头。可是谁知他们也大声的叫，卖芦花喽！卖芦花
QQ群采集助手，精准引流必备神器 2401_87347160 其他经验分享
功能概述微信群查找与筛选工具是一款专为微信用户设计的辅助工具，它通过关键词搜索功能，帮助用户快速找到相关的微信群，并提供筛选是否需要验证的群组的功能。主要功能关键词搜索：用户可以输入关键词，工具将自动查找包含该关键词的微信群。筛选功能：工具提供筛选机制，用户可以选择是否只显示需要验证或不需要验证的群组。精准引流：通过上述功能，用户可以更精准地找到目标群组，进行有效的引流操作。3.设备需求该工具可以
关于沟通这件事，项目经理不需要每次都面对面进行流程大师兄
很多项目经理都会遇到这样的问题，项目中由于事情太多，根本没有足够的时间去召开会议，那在这种情况下如何去有效地管理项目中的利益相关者？当然，不建议电子邮件也不需要开会的话，建议可以采取下面几种方式来形成有效的沟通，这几种方式可以帮助你努力的通过各种办法来保持和各方面的联系。项目经理首先要问自己几个问题，项目中哪些利益相关者是必须要进行沟通的？可以列出项目中所有的利益相关者清单，同时也整理出项目中哪些
机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
铭刻于星（四十二）随风至
69夜晚，绍敏同学做完功课后，看了眼房外，没听到动静才敢从书包的夹层里拿出那个心形纸团。折痕压得很深，都有些旧了，想来是已经写好很久了。绍敏同学慢慢地、轻轻地捏开折叠处，待到全部拆开后，又反复抚平纸张，然后仔细地一字字默看。只是开头的三个字是第一次看到，让她心漏跳了几拍。“亲爱的绍敏：从四年级的时候，我就喜欢你了，但是我一直不敢说，怕影响你学习。六年级的时候听说有人跟你表白，你接受了，我很难过，但
底层逆袭到底有多难，不甘平凡的你准备好了吗？让吴起给你说说造命者说
底层逆袭到底有多难，不甘平凡的你准备好了吗？让吴起给你说说我叫吴起，生于公元前440年的战国初期，正是群雄并起、天下纷争不断的时候。后人说我是军事家、政治家、改革家，是兵家代表人物。评价我一生历仕鲁、魏、楚三国，通晓兵家、法家、儒家三家思想，在内政军事上都有极高的成就。周安王二十一年（公元前381年），因变法得罪守旧贵族，被人乱箭射死。我出生在卫国一个“家累万金”的富有家庭，从年轻时候起就不甘平凡
2020-01-25 晴岚85
郑海燕坚持分享590天2020.1.24在生活中只存在两个问题。一个问题是：你知道想要达成的目标是什么，但却不知道如何才能达成；另一个问题是：你不知道你的目标是什么。前一个是行动的问题，后一个是结果的问题。通过制定具体的下一步行动，可以解决不知道如何开始行动的问题。而通过去想象结果，对结果做预估，可以解决找不着目标的问题。对于所有吸引我们注意力，想要完成的任务，你可以先想象一下，预期的结果究竟是什
随笔 | 仙一般的灵气海思沧海
仙岛今天，我看了你全部，似乎已经进入你的世界我不知道，这是否是梦幻，还是你仙一般的灵气吸引了我也许每一个人都要有一份属于自己的追求，这样才能够符合人生的梦想，生活才能够充满着阳光与快乐我不知道，我为什么会这样的感叹，是在感叹自己的人生，还是感叹自己一直没有孜孜不倦的追求只感觉虚度了光阴，每天活在自己的梦中，活在一个不真实的世界是在逃避自己，还是在逃避周围的一切有时候我嘲笑自己，嘲笑自己如此的虚无，
想家爆米花机
也许不同于大家对家乡的思念，我对家乡甚至是疯狂的不舍。还未踏出车站就感觉到幸福，我享受这里的夕阳、这里的浓烈柴火味、这里每一口家常菜。我是宅女，我贪恋家的安逸。刚刚踏出大学校门，初出茅庐，无法适应每年只能国庆和春节回家。我焦虑、失眠、无端发脾气，是无法适应工作的节奏，是无法接受我将一步步离开家乡的事实。我不想承认自己胸无大志，选择再次踏上征程。图片发自App
【iOS】MVC设计模式 Magnetic_h ios mvc 设计模式 objective-c 学习 ui
MVC前言如何设计一个程序的结构，这是一门专门的学问，叫做"架构模式"（architecturalpattern），属于编程的方法论。MVC模式就是架构模式的一种。它是Apple官方推荐的App开发架构，也是一般开发者最先遇到、最经典的架构。MVC各层controller层Controller/ViewController/VC（控制器）负责协调Model和View，处理大部分逻辑它将数据从Mod
一百九十四章. 自相矛盾巨木擎天
唉！就这么一夜，林子感觉就像过了很多天似的，先是回了阳间家里，遇到了那么多不可思议的事情儿。特别是小伙伴们，第二次与自己见面时，僵硬的表情和恐怖的气氛，让自己如坐针毡，打从心眼里难受！还有东子，他现在还好吗？有没有被人欺负？护城河里的小鱼小虾们，还都在吗？水不会真的干枯了吧？那对相亲相爱漂亮的太平鸟儿，还好吧！春天了，到了做窝、下蛋、喂养小鸟宝宝的时候了，希望它们都能够平安啊！虽然没有看见家人，也
UI学习——cell的复用和自定义cell Magnetic_h ui 学习
目录cell的复用手动（非注册）自动（注册）自定义cellcell的复用在iOS开发中，单元格复用是一种提高表格（UITableView）和集合视图（UICollectionView）滚动性能的技术。当一个UITableViewCell或UICollectionViewCell首次需要显示时，如果没有可复用的单元格，则视图会创建一个新的单元格。一旦这个单元格滚动出屏幕，它就不会被销毁。相反，它被添
element实现动态路由+面包屑软件技术NINI vue案例 vue.js 前端
el-breadcrumb是ElementUI组件库中的一个面包屑导航组件，它用于显示当前页面的路径，帮助用户快速理解和导航到应用的各个部分。在Vue.js项目中，如果你已经安装了ElementUI，就可以很方便地使用el-breadcrumb组件。以下是一个基本的使用示例：安装ElementUI（如果你还没有安装的话）:你可以通过npm或yarn来安装ElementUI。bash复制代码npmi
10月|愿你的青春不负梦想-读书笔记-01 Tracy的小书斋
本书的作者是俞敏洪，大家都很熟悉他了吧。俞敏洪老师是我行业的领头羊吧，也是我事业上的偶像。本日摘录他书中第一章中的金句：『一个人如果什么目标都没有，就会浑浑噩噩，感觉生命中缺少能量。能给我们能量的，是对未来的期待。第一件事，我始终为了进步而努力。与其追寻全世界的骏马，不如种植丰美的草原，到时骏马自然会来。第二件事，我始终有阶段性的目标。什么东西能给我能量？答案是对未来的期待。』读到这里的时候，我便
C语言宏函数南林yan C语言 c语言
一、什么是宏函数？通过宏定义的函数是宏函数。如下，编译器在预处理阶段会将Add(x,y)替换为((x)*(y))#defineAdd(x,y)((x)*(y))#defineAdd(x,y)((x)*(y))intmain(){inta=10;intb=20;intd=10;intc=Add(a+d,b)*2;cout<
地推话术，如何应对地推过程中家长的拒绝校师学
相信校长们在做地推的时候经常遇到这种情况：市场专员反馈家长不接单，咨询师反馈难以邀约这些家长上门，校区地推疲软，招生难。为什么？仅从地推层面分析，一方面因为家长受到的信息轰炸越来越多，对信息越来越“免疫”；而另一方面地推人员的专业能力和营销话术没有提高，无法应对家长的拒绝，对有意向的家长也不知如何跟进，眼睁睁看着家长走远；对于家长的疑问，更不知道如何有技巧地回答，机会白白流失。由于回答没技巧和专业
谢谢你们，爱你们！鹿游儿
昨天家人去泡温泉，二个孩子也带着去，出发前一晚，匆匆下班，赶回家和孩子一起收拾。饭后，我拿出笔和本子（上次去澳门时做手帐的本子）写下了1\2\3\4\5\6\7\8\9,让后让小壹去思考，带什么出发去旅游呢？她在对应的数字旁边画上了，泳衣、泳圈、肖恩、内衣内裤、tapuy、拖鞋……画完后，就让她自己对着这个本子，将要带的，一一带上，没想到这次带的书还是这本《便便工厂》(晚上姑婆发照片过来，妹妹累得
C语言如何定义宏函数？小九格物 c语言
在C语言中，宏函数是通过预处理器定义的，它在编译之前替换代码中的宏调用。宏函数可以模拟函数的行为，但它们不是真正的函数，因为它们在编译时不会进行类型检查，也不会分配存储空间。宏函数的定义通常使用#define指令，后面跟着宏的名称和参数列表，以及宏展开后的代码。宏函数的定义方式：1.基本宏函数：这是最简单的宏函数形式，它直接定义一个表达式。#defineSQUARE(x)((x)*(x))2.带参
微服务下功能权限与数据权限的设计与实现 nbsaas-boot 微服务 java 架构
在微服务架构下，系统的功能权限和数据权限控制显得尤为重要。随着系统规模的扩大和微服务数量的增加，如何保证不同用户和服务之间的访问权限准确、细粒度地控制，成为设计安全策略的关键。本文将讨论如何在微服务体系中设计和实现功能权限与数据权限控制。1.功能权限与数据权限的定义功能权限：指用户或系统角色对特定功能的访问权限。通常是某个用户角色能否执行某个操作，比如查看订单、创建订单、修改用户资料等。数据权限：
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
学点心理知识，呵护孩子健康静候花开_7090
昨天听了华中师范大学教育管理学系副教授张玲老师的《哪里才是学生心理健康的最后庇护所，超越教育与技术的思考》的讲座。今天又重新学习了一遍，收获匪浅。张玲博士也注意到了当今社会上的孩子由于心理问题导致的自残、自杀及伤害他人等恶性事件。她向我们普及了一个重要的命题，她说心理健康的一些基本命题，我们与我们通常的一些教育命题是不同的，她还举了几个例子，让我们明白我们原来以为的健康并非心理学上的健康。比如如果
2021年12月19日，春蕾教育集团团建活动感受——黄晓丹黄错错加油
感受:1.从陌生到熟悉的过程。游戏环节让我们在轻松的氛围中得到了锻炼，也增长了不少知识。2.游戏过程中，我们贡献的是个人力量，展现的是团队的力量。它磨合的往往不止是工作的熟悉，更是观念上契合度的贴近。3.这和工作是一样的道理。在各自的岗位上，每个人摆正自己的位置、各司其职充分发挥才能，并团结一致劲往一处使，才能实现最大的成功。新知:1.团队精神需要不断地创新。过去，人们把创新看作是冒风险，现在人们
Cell Insight | 单细胞测序技术又一新发现，可用于HIV-1和Mtb共感染个体诊断尐尐呅
结核病是艾滋病合并其他疾病中导致患者死亡的主要原因。其中结核病由结核分枝杆菌（Mycobacteriumtuberculosis,Mtb）感染引起，获得性免疫缺陷综合症（艾滋病）由人免疫缺陷病毒（Humanimmunodeficiencyvirustype1,HIV-1）感染引起。国家感染性疾病临床医学研究中心/深圳市第三人民医院张国良团队携手深圳华大生命科学研究院吴靓团队，共同研究得出单细胞测序
c++ 的iostream 和 c++的stdio的区别和联系黄卷青灯77 c++算法开发语言 iostream stdio
在C++中，iostream和C语言的stdio.h都是用于处理输入输出的库，但它们在设计、用法和功能上有许多不同。以下是两者的区别和联系：区别1.编程风格iostream（C++风格）：C++标准库中的输入输出流类库，支持面向对象的输入输出操作。典型用法是cin（输入）和cout（输出），使用>操作符来处理数据。更加类型安全，支持用户自定义类型的输入输出。#includeintmain(){in
瑶池防线谜影梦蝶
冥华虽然逃过了影梦的军队，但他是一个忠臣，他选择上报战况。败给影梦后成逃兵，高层亡尔还活着，七重天失守......随便一条，即可处死冥华。冥华自然是知道以仙界高层的习性此信一发自己必死无疑，但他还选择上报实情，因为责任。同样此信送到仙宫后，知道此事的人，大多数人都认定冥华要完了，所以上到仙界高层，下到扫大街的，包括冥华自己，全都准备好迎接冥华之死。如果仙界现在还属于两方之争的话，冥华必死无疑。然而
爬山后遗症璃绛
爬山，攀登，一步一步走向制高点，是一种挑战。成功抵达是一种无法言语的快乐，在山顶吹吹风，看看风景，这是从未有过的体验。然而，爬山一时爽，下山腿打颤，颠簸的路，一路向下走，腿部力量不够，走起来抖到不行，停不下来了！第二天必定腿疼，浑身酸痛，坐立难安！
《投行人生》读书笔记小蘑菇的树洞
《投行人生》----作者詹姆斯-A-朗德摩根斯坦利副主席40年的职业洞见-很短小精悍的篇幅，比较适合初入职场的新人。第一部分成功的职业生涯需要规划1.情商归为适应能力分享与协作同理心适应能力，更多的是自我意识，你有能力识别自己的情并分辨这些情绪如何影响你的思想和行为。2.对于初入职场的人的建议，细节，截止日期和数据很重要截止日期，一种有效的方法是请老板为你所有的任务进行优先级排序。和老板喝咖啡的好
《策划经理回忆录之二》路基雅虎
话说三年变六年，飘了，飘了……眨眼，2013年5月，老吴回到了他的家乡——油城从新开启他的工作幻想症生涯。很庆幸，这是一家很有追求，同时敢于尝试的，且实力不容低调的新星房企——金源置业(前身泰源置业)更值得庆幸的是第一个盘就是油城十路的标杆之一:金源盛世。2013年5月，到2015年11月，两年的陪伴，迎来了一场大爆发。2000个筹，5万/筹，直接回笼1个亿！！！这……让我开始认真审视这座看似五线
二分查找排序算法周凡杨 java 二分查找排序算法折半
一：概念二分查找又称折半查找（折半搜索/ 二分搜索），优点是比较次数少，查找速度快，平均性能好；其缺点是要求待查表为有序表，且插入删除困难。因此，折半查找方法适用于不经常变动而查找频繁的有序列表。首先，假设表中元素是按升序排列，将表中间位置记录的关键字与查找关键字比较，如果两者相等，则查找成功；否则利用中间位置记录将表分成前、后两个子表，如果中间位置记录的关键字大于查找关键字，则进一步
java中的BigDecimal bijian1013 java BigDecimal
在项目开发过程中出现精度丢失问题，查资料用BigDecimal解决，并发现如下这篇BigDecimal的解决问题的思路和方法很值得学习，特转载。原文地址：http://blog.csdn.net/ugg/article/de
Shell echo命令详解 daizj echo shell
Shell echo命令 Shell 的 echo 指令与 PHP 的 echo 指令类似，都是用于字符串的输出。命令格式： echo string 您可以使用echo实现更复杂的输出格式控制。 1.显示普通字符串: echo "It is a test" 这里的双引号完全可以省略，以下命令与上面实例效果一致： echo Itis a test 2.显示转义
Oracle DBA 简单操作周凡杨 oracle dba sql
--执行次数多的SQL select sql_text,executions from ( select sql_text,executions from v$sqlarea order by executions desc ) where rownum<81; &nb
画图重绘朱辉辉33 游戏
我第一次接触重绘是编写五子棋小游戏的时候，因为游戏里的棋盘是用线绘制的，而这些东西并不在系统自带的重绘里，所以在移动窗体时，棋盘并不会重绘出来。所以我们要重写系统的重绘方法。在重写系统重绘方法时，我们要注意一定要调用父类的重绘方法，即加上super.paint(g)，因为如果不调用父类的重绘方式，重写后会把父类的重绘覆盖掉，而父类的重绘方法是绘制画布，这样就导致我们
线程之初体验西蜀石兰线程
一直觉得多线程是学Java的一个分水岭，懂多线程才算入门。之前看《编程思想》的多线程章节，看的云里雾里，知道线程类有哪几个方法，却依旧不知道线程到底是什么？书上都写线程是进程的模块，共享线程的资源，可是这跟多线程编程有毛线的关系，呜呜。。。线程其实也是用户自定义的任务，不要过多的强调线程的属性，而忽略了线程最基本的属性。你可以在线程类的run()方法中定义自己的任务，就跟正常的Ja
linux集群互相免登陆配置林鹤霄 linux
配置ssh免登陆 1、生成秘钥和公钥 ssh-keygen -t rsa 2、提示让你输入，什么都不输，三次回车之后会在~下面的.ssh文件夹中多出两个文件id_rsa 和 id_rsa.pub 其中id_rsa为秘钥，id_rsa.pub为公钥，使用公钥加密的数据只有私钥才能对这些数据解密 c
mysql : Lock wait timeout exceeded; try restarting transaction aigo mysql
原文：http://www.cnblogs.com/freeliver54/archive/2010/09/30/1839042.html 原因是你使用的InnoDB 表类型的时候, 默认参数:innodb_lock_wait_timeout设置锁等待的时间是50s, 因为有的锁等待超过了这个时间,所以抱错. 你可以把这个时间加长,或者优化存储
Socket编程基本的聊天实现。 alleni123 socket
public class Server { //用来存储所有连接上来的客户 private List<ServerThread> clients; public static void main(String[] args) { Server s = new Server(); s.startServer(9988); } publi
多线程监听器事件模式(一个简单的例子) 百合不是茶线程监听模式
多线程的事件监听器模式监听器时间模式经常与多线程使用,在多线程中如何知道我的线程正在执行那什么内容,可以通过时间监听器模式得到创建多线程的事件监听器模式思路: 1, 创建线程并启动,在创建线程的位置设置一个标记 2,创建队
spring InitializingBean接口 bijian1013 java spring
spring的事务的TransactionTemplate，其源码如下： public class TransactionTemplate extends DefaultTransactionDefinition implements TransactionOperations, InitializingBean{ ... } TransactionTemplate继承了DefaultT
Oracle中询表的权限被授予给了哪些用户 bijian1013 oracle 数据库权限
Oracle查询表将权限赋给了哪些用户的SQL，以备查用。 select t.table_name as "表名", t.grantee as "被授权的属组", t.owner as "对象所在的属组"
【Struts2五】Struts2 参数传值 bit1129 struts2
Struts2中参数传值的3种情况 1.请求参数绑定到Action的实例字段上 2.Action将值传递到转发的视图上 3.Action将值传递到重定向的视图上一、请求参数绑定到Action的实例字段上以及Action将值传递到转发的视图上 Struts可以自动将请求URL中的请求参数或者表单提交的参数绑定到Action定义的实例字段上，绑定的规则使用ognl表达式语言
【Kafka十四】关于auto.offset.reset[Q/A] bit1129 kafka
I got serveral questions about auto.offset.reset. This configuration parameter governs how consumer read the message from Kafka when there is no initial offset in ZooKeeper or
nginx gzip压缩配置 ronin47 nginx gzip 压缩范例
nginx gzip压缩配置更多 0 nginx gzip 配置随着nginx的发展，越来越多的网站使用nginx，因此nginx的优化变得越来越重要，今天我们来看看nginx的gzip压缩到底是怎么压缩的呢？ gzip(GNU-ZIP)是一种压缩技术。经过gzip压缩后页面大小可以变为原来的30%甚至更小，这样，用
java-13.输入一个单向链表，输出该链表中倒数第 k 个节点 bylijinnan java
two cursors. Make the first cursor go K steps first. /* * 第 13 题：题目：输入一个单向链表，输出该链表中倒数第 k 个节点 */ public void displayKthItemsBackWard(ListNode head,int k){ ListNode p1=head,p2=head;
Spring源码学习-JdbcTemplate queryForObject bylijinnan java spring
JdbcTemplate中有两个可能会混淆的queryForObject方法： 1. Object queryForObject(String sql, Object[] args, Class requiredType) 2. Object queryForObject(String sql, Object[] args, RowMapper rowMapper) 第1个方法是只查
[冰川时代]在冰川时代,我们需要什么样的技术? comsci 技术
看美国那边的气候情况....我有个感觉...是不是要进入小冰期了? 那么在小冰期里面...我们的户外活动肯定会出现很多问题...在室内呆着的情况会非常多...怎么在室内呆着而不发闷...怎么用最低的电力保证室内的温度.....这都需要技术手段... &nb
js 获取浏览器型号 cuityang js 浏览器
根据浏览器获取iphone和apk的下载地址 <!DOCTYPE html> <html> <head> <meta charset="utf-8" content="text/html"/> <meta name=
C# socks5详解转 dalan_123 socket C#
http://www.cnblogs.com/zhujiechang/archive/2008/10/21/1316308.html 这里主要讲的是用.NET实现基于Socket5下面的代理协议进行客户端的通讯，Socket4的实现是类似的，注意的事，这里不是讲用C#实现一个代理服务器，因为实现一个代理服务器需要实现很多协议，头大，而且现在市面上有很多现成的代理服务器用，性能又好，
运维 Centos问题汇总 dcj3sjt126com 云主机
一、sh 脚本不执行的原因 sh脚本不执行的原因只有2个 1.权限不够 2.sh脚本里路径没写完整。二、解决You have new mail in /var/spool/mail/root 修改/usr/share/logwatch/default.conf/logwatch.conf配置文件 MailTo = MailFrom 三、查询连接数
Yii防注入攻击笔记 dcj3sjt126com sql WEB安全 yii
网站表单有注入漏洞须对所有用户输入的内容进行个过滤和检查，可以使用正则表达式或者直接输入字符判断，大部分是只允许输入字母和数字的，其它字符度不允许；对于内容复杂表单的内容，应该对html和script的符号进行转义替换：尤其是<,>,',"",&这几个符号这里有个转义对照表： http://blog.csdn.net/xinzhu1990/articl
MongoDB简介[一] eksliang mongodb MongoDB简介
MongoDB简介转载请出自出处：http://eksliang.iteye.com/blog/2173288 1.1易于使用 MongoDB是一个面向文档的数据库，而不是关系型数据库。与关系型数据库相比，面向文档的数据库不再有行的概念，取而代之的是更为灵活的“文档”模型。另外，不
zookeeper windows 入门安装和测试 greemranqq zookeeper 安装分布式
一、序言以下是我对zookeeper 的一些理解： zookeeper 作为一个服务注册信息存储的管理工具，好吧，这样说得很抽象，我们举个“栗子”。栗子1号：假设我是一家KTV的老板，我同时拥有5家KTV，我肯定得时刻监视
Spring之使用事务缘由(2-注解实现) ihuning spring
Spring事务注解实现 1. 依赖包： 1.1 spring包： spring-beans-4.0.0.RELEASE.jar spring-context-4.0.0.
iOS App Launch Option 啸笑天 option
iOS 程序启动时总会调用application:didFinishLaunchingWithOptions:，其中第二个参数launchOptions为NSDictionary类型的对象，里面存储有此程序启动的原因。 launchOptions中的可能键值见UIApplication Class Reference的Launch Options Keys节。 1、若用户直接
jdk与jre的区别（_） macroli java jvm jdk
简单的说JDK是面向开发人员使用的SDK，它提供了Java的开发环境和运行环境。SDK是Software Development Kit 一般指软件开发包，可以包括函数库、编译程序等。 JDK就是Java Development Kit JRE是Java Runtime Enviroment是指Java的运行环境，是面向Java程序的使用者，而不是开发者。如果安装了JDK，会发同你
Updates were rejected because the tip of your current branch is behind qiaolevip 学习永无止境每天进步一点点众观千象 git
$ git push joe prod-2295-1 To [email protected]:joe.le/dr-frontend.git ! [rejected] prod-2295-1 -> prod-2295-1 (non-fast-forward) error: failed to push some refs to '[email protected]
[一起学Hive]之十四-Hive的元数据表结构详解 superlxw1234 hive hive元数据结构
关键字：Hive元数据、Hive元数据表结构之前在 “[一起学Hive]之一–Hive概述，Hive是什么”中介绍过，Hive自己维护了一套元数据，用户通过HQL查询时候，Hive首先需要结合元数据，将HQL翻译成MapReduce去执行。本文介绍一下Hive元数据中重要的一些表结构及用途，以Hive0.13为例。文章最后面，会以一个示例来全面了解一下，
Spring 3.2.14，4.1.7，4.2.RC2发布 wiselyman Spring 3
Spring 3.2.14、4.1.7及4.2.RC2于6月30日发布。其中Spring 3.2.1是一个维护版本(维护周期到2016-12-31截止)，后续会继续根据需求和bug发布维护版本。此时，Spring官方强烈建议升级Spring框架至4.1.7 或者将要发布的4.2 。其中Spring 4.1.7主要包含这些更新内容。