Fu先生

读书笔记《Outlier Analysis》第四章基于邻近的异常检测

1.基本介绍

基于邻近的技术是指，当一个数据点的位置或邻近是稀疏时，则将其定义为一个离群点。

1.1 基于邻近的技术最常见的三种离群点分析的定义：

基于聚类：

使用非任何聚类中数据点的成员、其与其他聚类质心的距离、最近的聚类的大小或这些因素的组合来量化异常值评分。聚类问题和异常检测问题有互补关系，其中要么属于聚类，要么属于异常值。

基于距离：

使用数据点到其k近邻的距离来定义邻近。具有较大k近邻距离的数据点被定义为离群点。基于距离的算法通常比其他两种方法需要执行更详细的粒度。另一方面，这种更大的粒度往往需要很大的计算成本（因为其需要计算每个数据点到其k邻近的数据点的距离）。

基于密度：

数据点的指定局部区域（网格区域或基于距离的区域）内的其他点的数量，用于定义局部密度。这些局部密度值可以转换为异常值分数。也可以使用其他基于核的方法或用于密度估计的统计方法。聚类和基于密度的方法的主要区别在于，基于聚类的方法是划分数据点，而基于密度的方法是划分数据空间。

1.2 各种邻近方法的比较：主要是执行分析的粒度级别不同

显然，所有这些技术都是密切相关的，因为他们是基于某种邻近（或相似）的概念。主要区别在于如何定义这种邻近的详细程度。

基于距离的方法和其他两种方法的一个主要区别在于执行分析的粒度级别。

在基于聚类和密度的方法中，数据在异常分析之前通过划分【数据点或数据空间】进行预聚集。将数据点与此预聚集数据中的分布进行比较以进行分析。

另一方面，在基于距离的方法中，K近邻到原始数据点的距离被计算为异常值分数。

因此，最近邻方法（基于距离）中的分析是在比聚类方法更详细的粒度级别上进行的。

最近邻方法计算距离时，可以使用索引和剪枝技术来加快计算速度（索引和剪枝技术只在一些受限的数据集（如低维数据集）中有效），否则需要O(N2)时间来计算（具有N个记录）。此外，剪枝不是为异常值分数计算而设计的，他只能用于需要报告二进制标签（指示是否为异常点）的设置。

1.3 邻近方法的适用性：

最近邻方法特别适用于对于不可能进行稳健聚类或密度分析的较小数据集。

基于邻近的方法适合用来检测噪声和异常值。

基于邻近的方法的可解释性较好，也适合各种数据类型，如时间序列数据、图形数据、序列数据等。

2.基于聚类的方法

简单理解就是基于聚类的方法和异常值时互补关系的，即一个数据点要么属于任何一个簇，要么不属于任何要给簇。不属于任何一个簇的数据点即为异常值。

在聚类中，目标是将点划分为密集的子集，而在异常检测中，目标是识别不属于任何一个密集子集的数据点。

2.1 异常值的定义

问题：不属于任何簇的数据点不一定是异常值，也有可能是弱离群点或噪声；非常小的簇也有可能被视为异常值。简单使用欧式距离来计算异常值分数可能不适合。

解决方法：

由于簇可能有不同的形状和方向，因此，可以使用马氏距离来计算数据点到簇质心的距离来构造异常值分数。可以将马氏距离看作是经过一些变换和缩放后的点与簇质心之间的调整的欧式距离。具体来说就是点和质心被转换为由主成分方向定义的轴系。

案例：

从上图所示的示例中可以明显看出这一点，其中数据点‘A’比数据点‘B’更明显地是一个离群点，因为后者可能与拉长的簇之一有关。然而，这种微妙的区别不能用欧氏距离来检测，根据欧氏距离，数据点‘A’最接近最近的聚类质心。

一个结论：聚类过程对底层数据集群的不同形状和方向比较敏感。

（书中还提到除了距离的标准外，还可以将集群基数作为异常值分数的组成部分。基数准则在基于直方图的方法中特别流行，其中空间被划分为大小大致相等的区域。值得注意的是，基于直方图的方法是聚类方法的变体。将聚类基数纳入分数有助于区分小群聚类离群点和大群聚类中的正常点。）

2.2 集体异常

一个识别集体（小的簇）异常的方法：可以通过设定一个阈值，如果簇的数据点数量少于这个阈值，才定义为异常值。

2.3 预测的变异性问题

基于聚类的方法的预测的变异性的原因：模型的选择、初始化、参数的设置（如k，簇的数量）。

为了提高性能，可以使用集成学习的思想，即通常最好使用来自多个集群（具有不同参数设置）的离群点分数的平均值来获得更好的结果。

一般来说，充分随机化往往比基本聚类方法的质量更重要。在这方面，一个特别有用的方法是使用极其随机的森林聚类。

2.4 聚类类型的敏感

聚类集合的一个有趣特性是发现的离群点类型对所使用的聚类类型敏感。例如，子空间聚类将产生子空间离群点(cf。第5章第5.2.4节)；相关敏感聚类将产生相关敏感异常值，局部敏感聚类将产生局部敏感异常值。通过组合不同的基聚类方法，可以发现不同类型的异常值。

2.5 任意聚类形状的扩展

前面提到的关于使用马氏距离计算数据点到质心的距离的方法对于椭圆形状的团簇比较有效，但是对于某些形状的数据集也许并不有效。如下图案例所示。

图（a）是一种全局流形的、单一的团簇。图（b）中左边簇1中的点A比许多其他点更接近簇1的质心。

解决方法：

对于图(a)的情况，只要使用非线性主成分（或核主成分）分析等方法将点映射到一个可以有效使用欧氏距离的新空间就足够了。

对于图(b)的情况，显然，我们需要某种类型的数据转换，它可以将点映射到一个新的空间，在这个空间中暴露出这些异常值。如对非线性主成分分析等方法进一步修改（这些修改来源于谱聚类spectral clustering的概念，是相似矩阵稀疏化sparsifification和局部归一化local normalization的修改），然后解决b图中的异常值。

2.6 任意数据类型的应用

这种谱方法的一个重要优点是，只要对象之间可以定义相似函数，它们就可以应用于任意数据类型。可以使用任何可用的核相似方法，如时间序列、字符串和图。一旦定义了相似函数，就可以通过去除低权重边来创建稀疏的相似矩阵。该矩阵的特征向量用于创建嵌入并执行聚类。对于每个数据点，使用其与最近的聚类质心的最近距离来定义其离群点分数。

2.7 聚类方法的优缺点

优点：

聚类方法的一个重要优点是与（更流行的）基于距离的方法相比，它们相对较快。基于距离的方法在数据维数上具有二次运行时间。另一方面，许多快速聚类算法存在于各种数据域中。还可以使用本节前面讨论的谱方法来发现嵌入在任意形状簇附近的异常值，或者通过定义适当的相似函数来发现任意数据类型的异常值。

缺点：

聚类方法的主要缺点是，它们可能并不总是在较小的数据集中提供所需的详细程度的洞察力。当直接使用相对于原始数据点的距离计算时，离群点分析方法的粒度通常更好，而不是相对于集群质心等聚合代表。因此，当可用数据点的数量足够大时，聚类方法是最有效的；在这种情况下，这些方法也具有效率优势。聚类方法的另一个问题是，分数在不同的随机执行或参数选择之间有很高的变异性。因此，平均来自不同执行的离群点分数（标准化）向量对于获得稳健的结果是必不可少的。

3. 基于距离的方法

3.1 基于距离的方法的基本介绍

基于距离的方法可以跨越多种数据类型（分类数据、文本数据、时间序列数据和序列数据等），并根据最近邻距离来定义异常值分数。

最简单的例子是一个点的k近邻距离被定义为异常值分数的情况。

基于距离的方法采用的自然假设是异常数据点的k近邻距离远大于正常数据点的k近邻距离。

3.2 基于距离的方法与聚类方法的比较

基于距离的方法和聚类的方法的主要区别是两者执行分析的数据粒度级别不一样。显然，基于距离的的粒度级别更大，因为它要计算数据点与其k近邻的所有数据点的距离。由于粒度级别更高，基于距离的方法也更容易识别弱异常（如噪声）和强异常。如下图所示案例：

3.3 基于距离的方法识别集体异常

基于距离的方法也能够识别密切相关的离群点的异常集群。例如，为了识别包含k0数据点的小（异常）簇，需要在k近邻算法中使用k≥k0的值。虽然这种异常也可以通过聚类方法通过对每个聚类中的点数设置阈值来识别，但这些点有时可能会进入聚类并偏置相应的聚类质心。这可能会以有害的方式影响离群点的评分过程。

3.4 基于距离的方法的结果输出形式

最常见的形式是分数形式，即具体的距离数据值。但是这种方法需要的时间复杂的为O(N^2)。

另一种是二进制形式，即输出每个数据点是否是离群点。对于这种方法，可以使用各种类型的剪枝和索引结构来大大加快速度。

3.5 基于距离的方法的评分输出

一个点的基于距离的离群点分数是基于它与剩余数据集的第k最近邻距离。

这种评分机制有两个简单的变化，分别对应于精确的k近邻和平均的k近邻检测器。

3.5.1 精确的k近邻分数

定义：有一个数据集D=X1, X2...Xn，数据点 Xi 的异常值分数等于其到{D-Xi}数据集中数据点的第k个最近邻的距离。

请注意，得分点Xi本身不包括在k近邻中，以避免过度拟合。例如，如果我们使用k=1，并允许在1-近邻中包含候选点，则每个点都是自己的最近邻，所有点的离群点分数都为0。将候选点排除在邻居之间避免了这种情况。

问题：在很多实际应用中，通常k值很难确定。在像异常检测的这样的无监督问题中，通常没有方法用交叉验证等方法进行参数调优，因为没有标签。

解决方法：可以使用更稳健的平均k近邻检测器，其也被称为加权k近邻检测器。

3.5.2 平均的k近邻分数

定义：有一个数据集D=X1, X2...Xn，数据点 Xi 的异常值分数等于其到{D-Xi}数据集中数据点的k个最近邻的距离的平均值。

如果使用平均的k最近邻检测器，通常会给出一个K值的范围，然后选择多个k进行计算，然后计算算数平均结果。在这种情况下，平均k最近邻法对k的不同选择不那么敏感，因为它有效地平均了k的不同值范围内的精确k最近邻分数。一种很少使用的相关方法是使用谐波平均值而不是算术平均值。

3.5.3 谐波k近邻分数

定义：有一个数据集D=X1, X2...Xn，数据点 Xi 的异常值分数等于其到{D-Xi}数据集中数据点的k个最近邻的距离的谐波平均值。

必须注意从数据集中删除重复点，以便稳健地使用这种方法，因为任何包含0的数字集的谐波平均值总是0。谐波平均值总是由较小的距离主导（与算术平均值相比），因此使用参数k的大值对于更大的鲁棒性是可取的。事实上，在谐波平均的情况下，可以设置k=N，并且仍然可以获得高质量的分数。例如，如果我们在（算术）平均k-近邻检测器中设置k=N，那么只会发现多元极值，孤立的中心点可能被忽略。

另一方面，在k=N处的和谐平均分数也将能够发现数据中孤立的中心点，特别是对于大数据集。谐波平均值的这种行为的原因是它与基于密度的方法(cf)的联系。第4.4.4.1节)。谐波平均值的主要优点是，我们现在有一个无参数检测器，通过设置k=N，结果仍然是高质量的。虽然谐波最近邻检测器在文献中仍未被探索，但它们的潜力是显著的。

3.5.4 使用分数形式的局限性

计算所有数据点的分数通常是计算密集型的。需要计算数据点之间的所有对距离。因此，完全需要O(N2)操作。当数据点数量很大时，这可能非常昂贵。例如，即使对于包含几十万个点的数据集，该方法也可能不会返回合理的时间。虽然人们经常声称，在O(N·log(N)时间内，可以使用索引结构有效地找到k近邻，但该方法仅适用于低维数据集（即维数小于10）。这是因为在高维情况下，索引结构在修剪方面不是很有效。此外，这种索引结构具有较大的恒定开销，这进一步损害了性能。

更有效的方法是预选数据点的样本。所有N个数据点在从样本中排除候选点后（如果需要的话)对这个样本进行评分）。结果可以在不同的样本上进行平均，以提高结果的质量与集成。对于不太稳定的变体，如谐波平均，尤其如此。

3.6 基于距离的方法的二进制输出（详情见另一篇博客基于距离的方法的二进制输出）

使用二进制输出的优点是可以修剪许多O(N^2)计算。因此，只有得分比较高的点被报告为离群点，我们不关心非离群点的分数。这可以通过在最近邻距离（分数）上指定一个最小阈值来实现，也可以通过在k最近邻距离的排序上使用一个最大阈值来实现。

在基于距离的方法的二进制输出中的所有定义中，由于这些定义在文献中的优势，我们使用了 精确的k近邻距离。然而，上述所有定义和一些相关的剪枝方法都可以推广到 平均k近邻距离。在下面，我们将讨论精确k近邻距离的各种剪枝方法，并研究它们对平均k近邻距离的推广。

3.6.1 基于单元cell的剪枝

基于细胞的技术[317]是基于基于距离的方法的二进制输出中的定义2.3的评分阈值。该方法是针对精确的k近邻距离设计的，不能很容易地推广到平均k近邻距离。在基于单元的技术中，数据空间被划分为单元，其宽度是距离阈值β和数据维数d的函数。具体来说，每个维度最多被划分为宽度的单元(2·√d)。这个宽度的奇数值被选择来强制单元中的点的某些以距离为中心的特性，这些特性被用于修剪和有效的处理。该方法最好在二维情况下解释。考虑二维情况，其中连续网格点的距离最多为β/（2·√2）。需要记住的一个重要点是，网格单元的数量是基于数据空间的分区，并且与数据点的数量无关。这是低维数据处理方法效率的一个重要因素，其中网格单元的数量可能很小。另一方面，这种方法不适合于高维数据。

3.6.2 基于采样的剪枝

采样方法非常灵活，因为它们可以处理基于分数的阈值化或基于排序的阈值化。此外，它们可以与精确的k近邻检测器或平均k近邻检测器一起使用。它们在修剪方面非常有效，也可以用作健壮的集成方法。由于这些原因，采样方法应该被认为是有效的基于距离的孤立点检测的第一道攻击线。

3.6.3 基于索引的剪枝

索引和聚类是数据定位和访问的另外两种常见形式。因此，探索是否可以使用一些传统的聚类方法或索引结构来提高基于距离的计算的复杂性是很自然的。最初的方法使用基于排序的阈值与精确的k最近邻检测器。

3.7 数据相关（依赖）的相似性度量

k最近邻方法可以与其他类型的相似性和距离函数配对。与欧几里得距离不同，数据相关的相似性度量不仅取决于手头上的一对点，而且还取决于其他点的统计分布。这可以帮助将各种依赖于数据的特征合并到相似性函数中，例如局部敏感度，相关敏感度或两者的结合。局部敏感性的一个直观的例子是，同一对白种人在亚洲会被认为比在欧洲更相似。

有两个概念是比较容易混淆的，就是数据的相关性和数据的相似性。下面是两者的简单比较（数据的相似性和相关性）。

数据的相关性：相关性是描述数据属性的，比如抽烟和患肺癌，这是两个属性，两个属性之间有相关系数度量，如果相关属性为0，则两者不想管，即抽烟和得肺癌之间不相关。简单的方法如余弦相似度。

直白理解就是一个数据对象是否会受其他数据对象的影响，两者之间有没有某种相互影响的关系。

数据的相似性：相似性是描述数据对象的，两个数据对象的相似性，也可以说是两个对象的邻近度，有多种度量方法，来表示对象间的相似程度，如在低维中可以使用欧几里得距离，在高维中可以使用马氏距离。

直白理解就是两个数据对象的距离远不远。远的话相似性就低，近的话相似性就高。

3.8 ODIN：一种反向最近邻方法

大多数基于距离的方法直接使用k近邻分布来定义离群值。另一种方法是使用反向k近邻的数量来定义离群值。因此，反向k近邻的概念定义如下：

Defifinition 4.3.7 A data point p is a reverse k -nearest neighbor of q , if and only if q is among the k -nearest neighbors of p .

当且仅当数据点q是数据点p的k最近邻中，数据点p是数据点q的一个反向k最近邻。

直白理解就是和数据结构中图中的入度和出度一样，对于两个节点来说，两者之间的入度和出度是相对的。

3.9 基于距离的离群点的内涵知识

离群点的内涵知识主要是解释定义为离群点的数据点为什么其被定义为离群点，即离群点的可解释性。

另外一个方面是区分弱离群点和强离群点以及解释数据点的离群行为。

3.10 基于距离的方法的探讨

基于距离的方法比基于聚类的技术具有许多定性优势，因为分析的粒度更详细。例如，基于距离的算法可以比基于聚类的技术更好地区分噪声和异常。此外，基于距离的方法也可以像聚类方法一样找到孤立的集体异常。

另一方面，聚类方法的优点是它们可以提供关于数据点的局部分布的见解，以定义距离。

4. 基于密度的离群值

4.1 基本介绍

基于密度的方法使用数据空间中特定区域中数据点的数量来定义异常值。

基于密度的算法由许多是可以发现局部性敏感的异常值。这节主要讨论局部算法和全局算法。

局部敏感型对异常值的影响

该图包含两个标记为“A”和“B”的异常值。此外，该图包含两个集群，其中一个集群比另一个集群稀疏得多。很明显，离群点‘A’不能被基于距离的算法发现，除非算法使用较小的距离阈值。然而，如果使用较小的距离阈值，那么稀疏集群中的许多数据点可能被错误地声明为异常值。这也意味着，当数据的局部分布存在显著的异质性时，基于距离的算法返回的排序是不正确的。

基于密度的簇主要关注在不同的数据密度问题上，而不是簇的不同形状和方向。

4.2 LOF：Local Outlier Factor局部异常因子（局部异常因子LOF详解链接）

4.2.1 简单理解LOF

局部异常因子算法是通过计算局部可达密度来反映一个样本点的异常程度，一个样本点的局部可达密度越大，这个点就越有可能是异常点。

通俗来讲就是：若点P的局部范围内，数据点的密度越小，则点P越有可能是异常点。

4.2.2 局部可达密度

点与点之间的密度，点之间的距离越远，密度越低；距离越近，密度越高。

局部可达密度与总体密度类似，只不过是用k距离邻域计算的，所以称为“局部”。

４.３LOCI：Local Correlation Integral局部相关积分

4.3.1 LOCI

LOCI方法确实是基于密度的方法，因为它根据点周围的预定半径e内的数据点数来定义数据点X的密度M（X，e）。这被称为数据点X的计数邻域。

相应地，将X的δ邻域中的平均密度AM（X，e，δ）定义为M（X，e）的平均值，所有数据点与X的距离最大为δ。δ的值也称为X的采样邻域，并且始终大于e（为了实现哭诉的近似计算，通常选择e值为δ的一般）。

此外，无论使用什么δ值，始终将e的值选择为δ的恒定分数。 δ的值是分析中的关键参数，并且使用此参数的多个值来提供不同粒度级别的分析见解。

δ级的多粒度偏差因子MDEF(X，e，δ)用点的密度与其邻域内的平均密度之比表示。

在定义数据点的离群点分数时，在使用局部比率方面与LOF的相似性。多粒度偏差因子MDEF值越大，异常值越大。

（为了实现快速的近似计算，总是选择e的值为δ的一半。因此，在整个介绍过程中，假设e的值是由δ的选择自动决定的。采用多个δ值，为离群点分析提供了一种多粒度方法。这些方法将采样半径从包含至少20个点的最小半径变化到跨越大多数数据的最大半径。如果在不同粒度级别计算的任何值中，其MDEF值异常大，则数据点是一个异常值。）

书上也有两个提高算法效率的方法。

4.3.2 LOCI绘图

LOCI图显示X轴上的δ值与Y轴上基于计数的下列2个数量：

1.数据点的密度行为；

2.邻近数据点的平均密度行为。

当数据点是异常值时，其密度行为通常会低于该点的邻域的密度，甚至可能会低于邻域密度范围的下限。

【LOCI图可以直观地了解数据点的偏差如何与不同粒度级别上的偏差极值相关，并且可以解释为什么特定数据点可能具有较高的多粒度偏差因子MDEF。使用不同的粒度级别有助于将算法调整为适应不同数据集的变化。然而，LOCI绘图总是在视觉上启用一个正确的特定点的分析粒度级别。在某些情况下，特定数据点可能仅在特定粒度级别上显示为异常值，这也将出现在LOCI图中。这种类型的视觉洞察力有助于建立直觉和可解释性的无监督问题，如异常检测。】

LOCI图的说明性示例如上图所示。在这里，我们显示了该图的简化版本，但未显示平均邻域密度的上限和下限。换句话说，我们仅显示了邻域密度AM（X，e，δ），而未显示范围AM（X，e，δ）±STD [Y：dist（X，Y）≤δ] M（Y， e）。这些范围还有助于区分点密度何时远低于邻区密度。

图（a）显示了聚集点的典型行为，其中在所有半径值上，点的密度大致类似于邻域密度。在聚集异常的情况下，该异常与少数点同时发生，只有在充分增加邻域大小后，两个密度才发生变化（见图（b））。
由于离群值很容易在小群中发生，因此聚类异常现象很常见。如图（c）所示，在异常值非常突出的情况下，这两种密度在开始时就发散了。因此，这些不同的图提供了有关为什么应将特定点视为异常值的见解。同样值得注意的是，LOCI图是特定于单个数据点的。因此，通常只在LOCI算法确定的一小部分有趣点上利用它。

４.４基于直方图的技术

直方图使用空间划分方法进行基于密度的汇总。

4.4.1 单变量直方图

在单变量数据的最简单情况下，将数据离散为最小值和最大值之间相等宽度的bin，并估计每个bin的频率。位于极低频率的bin中的数据点即为异常值。

4.4.2 多变量直方图

在多变量数据的情况下，可以采样以下两种不同的方式概况该方法：

1.针对每个维度分布计算离群值（异常值），然后对这些分数进行汇总。

2.【可以同时生成沿每个维度的离散化，并可以构建网络结构。可以使用网络结构中的点分布来创建稀疏区域的模型。这些稀疏区域中的数据点时异常值。】

4.4.3 注意点

在某些情况下，数据点的频率计数（分数）通过减少1来调整。这是因为在极值分析中，将数据点本身包含在计数中可以掩盖其异常。

4.4.4 直方图与聚类方法

直方图与聚类方法非常相似，因为它们总结了数据的密集和稀疏区域，以计算离群点分数；主要区别在于聚类方法对数据点进行分区，而直方图方法倾向于将数据空间划分为大小相等的区域。

4.4.5 直方图技术面临的主要挑战

---------基于直方图技术的主要挑战是通常很难很好地确定最优直方图宽度。 过宽或过窄的直方图不会在最佳检测异常值所需的粒度级别上对频率分布进行建模。

当bin太窄时，落在这些垃圾箱中的正常数据点将被识别为异常值。

另一方面，当bin太宽时，异常数据点可能会落在高频bin中，因此不会被识别为异常值。

在这样的设置中，改变直方图宽度并获得相同数据点的多个分数是有意义的。这些（对数似然）分数然后在不同的基本检测器上平均，以获得最终结果。与聚类一样，基于直方图的方法在预测方面往往具有很高的变异性，这取决于参数选择，这使得它们成为集成方法的理想候选。

-----------使用基于直方图的技术的第二个（相关的）挑战是，它们的空间划分方法使它们对集群异常的存在近视。例如，在下图4.2的情况下，基于多元网格的方法可能无法将孤立的一组数据点归类为异常值，除非仔细校准网格结构的分辨率。这是因为网格的密度只取决于它内部的数据点，当表示的粒度较高时，孤立的一组点可能会创建一个人为密集的网格单元。这个问题也可以通过改变网格宽度和平均分数来部分解决。

4.4.6 直方图的局限性

直方图方法在高维中不能很好地工作，因为网格结构的稀疏性随着维数的增加而增加，除非孤立点分数是根据仔细选择的低维投影计算的。例如，d维空间将包含至少2d网格单元，因此，预期填充每个单元的数据点的数量随着维数的增加而呈指数下降。虽然基于直方图的技术具有很大的潜力，但为了获得最佳效果，它们应该与高维子空间组合（见第5章和第6章）相结合。

４.５核密度估计

就建立密度分布而言，核密度估计方法与直方图技术相似。

但是，核密度估计通过使用核函数而不是离散计数来构建密度曲线的更平滑版本。

由于这两类方法之间的相似性，因此在两种情况下趋于获得相似的结果，尤其是如果使用集成方法来平滑实现和特定于参数的效果，则尤其如此。

5.基于邻近的检测方法的局限性

大多数基于邻近的方法使用距离来定义不同粒度级别的异常值。通常，为了提高精度，需要更高级别的粒度。特别是，通过各种形式的汇总来抽象数据的方法并不能很好地区分真实异常和噪声区域。这种弱点表现在不同类型的总结预测的高度变异性。在这种情况下，由于汇总过程的模糊性而产生的预测的可变性需要仔细地结合全局和局部分析，以便在数据中找到真正的异常值。

在高维数据中，一个更基本的限制不是效率，而是发现的异常值的质量。在高维数据中，所有点之间几乎相等，因此距离上的对比度会丢失。这也被称为维度灾难，其源于数据的稀疏。随着维数的增加，大多数特征对离群点检测没有信息，这些维数的噪声效应以非常负面的方式影响基于邻近的方法。在这种情况下，异常值可以被特征中的噪声掩盖，除非相关的维度可以通过异常值检测方法显式地发现。由于基于邻近的方法自然地被设计用来使用数据中的所有特征，他们的质量将随着维数的增加而自然下降。确实存在一些方法可以改善这种方法在提高子空间方法的维数方面的有效性。这些方法将在第5章中讨论。

6.总结

本章概述了用于离群值分析的主要基于接近度的技术。所有这些方法都使用数据点之间的邻近度信息来确定数据中的异常值。这些方法在互补的意义上与聚类技术紧密相关。前者在稀疏数据位置中找到异常点，而后者（聚类）则试图确定密集数据位置。因此，聚类本身是基于邻近度的离群分析中常用的方法。通过正确选择聚类方法，还可以使该方法适应数据中任意形状的模式。这样的方法也可以扩展到任意数据类型。

基于邻近性的方法由于易于实现和可解释性而在文献中广受欢迎。使用此类方法的主要挑战在于它们通常需要大量计算，并且在最坏的情况下，大多数高质量方法都需要O（N2）距离计算。当需要二进制标签而不是分数时，可以使用各种剪枝方法来提高其效率。在各种修剪方法中，采样方法是最有效的方法之一。 局部归一化是用于提高各种异常值检测算法的有效性的原理。两种常见的局部算法包括LOF和LOCI算法。最后，文献中还研究了基于直方图和核密度估计的技术。尽管这些方法尚未广受欢迎，但与集成方法结合使用时，它们具有巨大的潜力。

你可能感兴趣的:(离群点（异常）检测,机器学习,异常检测)

太萌了！萌力星球治愈处于低谷的你菜菜子_face
人生的低谷千千万，无论事业、生活和恋爱，总会让你一不小心就掉入万丈深渊。但无论怎样的低谷，再苦生活还是会继续，这时只需给生活加一点甜，让自己感觉被幸福包围着，就会变得特别的美好。《萌力星球系列》相信很多人都会喜欢这一套绘本，因为：1、表情包网红2、蠢萌的代表3、治愈系，这三个特点就足够吸引到一大批粉丝。《萌力星球系列：乖巧宝宝日记我是自愿来上班的》下载量超5.2亿次，发送量超305亿次的国民表情包
供应链可视化工具：穿透全球贸易的迷雾花海如潮淹人工智能机器学习大数据
⚡企业的三重供应链炼狱1.多级库存的幽灵黑洞某消费电子公司因无法追踪三级供应商库存，错判芯片缺口30%，导致新品延期损失**$1.8亿**（Gartner2024报告）。更致命的是，53%的企业无法实时查看二级以下库存（IDC全球供应链调研），计划体系形同虚设。2.物流黑箱的蝴蝶效应红海危机中某车企因未实时监控绕行航线，2000辆新车滞留港口45天（马士基航运数据）。传统跟踪依赖邮件问询，异常响应
2023-05-02 偏偏喜欢你sky
2023.5.1周一晴老公不到五点就出门了，去参加婚礼。我到七点半才彻底清醒。准备起来收拾吃点东西，浑身酸痛啊。52.5起来做饼和煎蛋，收拾剩菜。无所事事的一上午，现在是下午1:43准备起来跳绳运动，准备一会儿得加班，总要精力充沛，并且积极向上一点，早上给自己做了饼，感觉油有点大，又吃了两个煎蛋，一下子就彻底饱了，其他的东西没有再吃，体重一直在53.0左右，这让我很开心，上午又睡了一会儿，玩游戏看
信小易官网查询入口：信小易大数据信用检测平台！无忧达人
信小易一个全能型的信用软件，信小易在一几年就上线的大数据信用平台，有着专业的大数据信用行业经验，从个人信用到企业信用，车辆大数据信小易全都有涉足，是一个非常完善的平台。信小易官网查询入口，对于想使用信小易的人来说，第一步我们需要找到信小易的查询入口，然后就可以进行大数据信用的查询服务了，可以查询自己的信用情况，查询结果也是非常准确。信小易查询入口放在文末了，划到文章结尾就可以看到查询入口信小易是一
数据质量是机器学习项目的核心痛点，AI技术能提供智能化解决方案。 zzywxc787 python pandas numpy 人工智能自动化运维 AI编程
一、数据质量诊断系统（Python实现）importpandasaspdimportnumpyasnpimportmatplotlib.pyplotaspltfromsklearn.clusterimportKMeansfromsklearn.ensembleimportIsolationForestfromtensorflow.keras.modelsimportSequentialfromte
喷丝板检测软件上位机开发深圳市由你创科技上位机开发 c#qt
一、核心功能模块1、硬件控制运动控制：通过Modbus/RS485/EtherCAT控制高精度电移台（需±1μm精度），实现喷丝板XY轴扫描定位。光源控制：调节环形LED/同轴光源亮度（支持PWM或0-10V模拟信号），优化成像对比度。相机控制：支持GigE/USB3Vision相机（建议500万像素以上），触发采集、参数调节（曝光/增益）。2、机器视觉检测孔洞识别：使用OpenCV的HoughC
好习惯，除了坚持，还是坚持。青青夏草小花老师
习惯，是指积久养成的生活方式，是决定一个孩子品行的重要基础。很多家有小学生的宝爸宝妈都没有时间给孩子做早餐，且不说起床穿衣是最消耗时间的部分，还有小女孩的扎辫子，早晨要出门才发现忘记签字、忘记带书带作业......这么多的事情曾经让多少妈妈或爸爸崩溃，哪里还有时间吃早餐呀。“早餐要吃好”这吃早餐的习惯，该是有多少孩子没有养成哦。水晶班里有个女孩子，一年级上学期经常迟到，到了上午十点，准点儿肚子疼不
网络爬虫再深入——对抗指纹检测、分布式架构与智能解析实战 rooney2024 爬虫
目录一、深入反爬：浏览器指纹检测与对抗（配图1）1.高级指纹检测原理2.对抗方案与实战二、分布式爬虫架构深度设计（配图2）1.容错与弹性设计2.智能限流算法三、智能解析：LLM与计算机视觉的融合（配图3）1.LLM解析非结构化文本2.视觉辅助定位元素四、法律与伦理：爬虫工程师的自我修养1.关键法律边界2.道德实践框架五、未来战场：Web3.0时代的爬虫技术演进1.去中心化网络挑战2.AI驱动的自适
2019-03-31 骄兵必败棉花草
今天上午，我们一行人（10个新教师）去了村委参加游戏活动，比赛赢了是有丰厚大奖的，而其他参赛的队伍除了我们是较年轻的，其余的队伍几乎平均年龄大多在40+。游戏共有6轮，刚开始，我们仗着年轻，又因为赛前演练过一下游戏，前两轮的名次都获得了第一，取得了一点儿好成绩后，我们开始沾沾自喜，觉得第一非我们莫属，我们胜在年轻活力。没想到从第三轮游戏开始，我们便节节败退，排在第一的会得10分，而排在第十的我们只
携程机票优惠券在哪里？火车票优惠券哪里领取古楼
作为国内领先的旅行服务平台，携程为用户提供了便捷的机票、火车票、酒店预订服务。同时，用户还可以领取各种优惠券，享受更多优惠。本文将为您详细介绍如何在携程领取优惠券。一、携程优惠券种类及领取方式1.机票优惠券在携程App或网站预订机票时，可领取机票优惠券。优惠券包括满减、折扣等多种形式。领取方式如下：（1）打开携程App或网站，进入机票预订页面；（2）在预订过程中，系统会提示领取机票优惠券；（3）点
《战无极》第一百五十五章:抬眼灭魔孤行迹
湖水自然是很深，能够将三头怪物那样庞大的体积隐匿在其中，不可谓不深！可是，当那股力量被抽离之后，湖水却是变得异常清澈！刀狂忍不住看了一眼，居然能够看到湖底的珊瑚石！就犹如一道道迷宫一般，纵横交错，在湖底形成了一道绝美的风景画！三头怪物那庞大的身躯，透过湖水能够看得真真切切！现在的整个湖泊，基本上没有任何一样的生物。幽泉毒蟒的毒，绝对的是这个世界上最烈的毒，当他的毒血落入湖泊之中时，就注定了这个湖泊
大概我们这个年纪都不会很老实，老实点的反倒会被排斥，融不进去，甚至被当成傻子笑柄。今日杂记铺
今日杂记铺今日杂记铺我在网上开了一个属于我自己的微信公众号。起初的打算，写点我虚构的小说。写着写着，就有点力不从心。毕竟自己的经验摆在那儿。放了许久，我看了一些书籍。想着也学学别人，听故事，写故事。我就在网上到处发消息，看看有没有人愿意给我讲。第一次的时候，真的很激动，我很感谢那位网友。故事，我磨了很久，写完后发给他，生怕不满意，好在，他认可了我。我就有了写下去的信心。一有时间，我就在网上问问，愿
又是一年520 钟意优惠
又是一年网络情人节，试问一年中还有什么比5月20日13点14分更合适的表白时机呢?不要再犹豫了，有爱就要大声说出来。1、520网络情人节送99朵玫瑰，99个祝福，长长久久的爱恋与期许让爱的誓言许下恒久的思念，一份长久的绽放，一份不变的真心。2、永生花的花语是永不凋谢的玫瑰，永不落寞的爱情。永生花的诞生，让情人节的花变得永恒。每次看到这束花，就可以回忆起520网络情人节的那一份甜蜜。以花为誓，落笔为
小豆芽芽吖流水日记 Day57 小豆芽芽吖
昨天睡得应该很早，而且今天早上也不是很早起来，可是感觉头还是很痛哎，不会吧不会吧。不会真的要感冒了吧～有点难受哎。想睡觉了!今晚早点睡好嘛好嘛!今天考经济学真的好想哭～怎么感觉大家都觉得很简单，虽然是很简单，但是我觉得自己准备还是不充分，因为有很多都没有记牢固，而且计算题最后一道题不会写。希望不要挂科吧，而且在今后请认真点学习!是认认真真真正学习，而不是假学习!
OpenHarmony外设驱动移植指南你我皆是牛马星人鸿蒙开发 HarmonyOS OpenHarmony harmonyos OpenHarmony 鸿蒙开发源码分析迁移学习嵌入式硬件驱动开发
往期推文全新看点（文中附带最新·鸿蒙全栈学习笔记）鸿蒙（HarmonyOS）北向开发知识点记录~鸿蒙（OpenHarmony）南向开发保姆级知识点汇总~鸿蒙应用开发与鸿蒙系统开发哪个更有前景？嵌入式开发适不适合做鸿蒙南向开发？看完这篇你就了解了~对于大前端开发来说，转鸿蒙开发究竟是福还是祸？鸿蒙岗位需求突增！移动端、PC端、IoT到底该怎么选？记录一场鸿蒙开发岗位面试经历~持续更新中……外设驱动子
【OpenHarmony】鸿蒙开发：轻量系统服务管理|存储机制详解(一) 你我皆是牛马星人 HarmonyOS 鸿蒙开发 OpenHarmony harmonyos 鸿蒙开发 OpenHarmony 嵌入式硬件 SAStore模块物联网
往期推文全新看点（文中附带最新·鸿蒙全栈学习笔记）鸿蒙（HarmonyOS）北向开发知识点记录~鸿蒙（OpenHarmony）南向开发保姆级知识点汇总~鸿蒙应用开发与鸿蒙系统开发哪个更有前景？嵌入式开发适不适合做鸿蒙南向开发？看完这篇你就了解了~对于大前端开发来说，转鸿蒙开发究竟是福还是祸？鸿蒙岗位需求突增！移动端、PC端、IoT到底该怎么选？记录一场鸿蒙开发岗位面试经历~持续更新中……一、前言本
啥是张可小羽一件事
一个简单的姑娘。2015年12月31日，我们遇见。在去南昌西站接她的路上，因为不熟悉路况和不熟悉车况，那会儿刚刚买人生第一辆车，还没有上牌，让她在西站等了我一个多小时。初次见面，高高瘦瘦的，像个孩子，粉色系着装，言行举止青涩，一点都不老练。我们去跨年，放孔明灯，写下愿望，祈求平安。第一次去宜春找她，从没有上过高速，百度攻略了第一次上高速要注意什么，就小心翼翼地开过去了。听我讲物是人非的故事，听我说
7.机器学习-十大算法之一拉索回归（Lasso）算法原理讲解以山河作礼。 #机器学习算法机器学习算法回归
7.机器学习-十大算法之一拉索回归（Lasso）算法原理讲解一·摘要二·个人简介三·前言四·原理讲解五·算法流程六·代码实现6.1坐标下降法6.2最小角回归法七·第三方库实现7.1scikit-learn实现（坐标下降法）：7.2scikit-learn实现（最小角回归法）：一·摘要拉索回归（LassoRegression）是一种线性回归的正则化形式，它通过引入L1范数惩罚项来实现模型的稀疏性，从
什么软件赚钱多安全可靠2022精选3类赚钱软件日常购物技巧呀
小编最近看到有网友在问“赚钱软件哪个赚钱多,又安全？”最近几年受疫情影响，80%人收入有下滑趋势，但有一个行业特别火，那就是手机赚钱，2022年今天也依旧是，这种方法让一些既想在网络上赚钱又想没有门槛，不需要任何技能的人看到了希望，想着利用业余时间做这个可以赚点外快。高省APP佣金更高，模式更好，终端用户不流失。【高省】是一个自用省钱佣金高，分享推广赚钱多的平台，百度有几百万篇报道，也期待你的加入
Bumblebee Sophia77呀
第一次凌晨四点才睡第一次绕了大半个沈阳第一次尝试吃牛蛙第一次去沈北今天真的超级难忘不知道以后还会不会再见希望自己可以更努力一点好好做计划不仅在学习也要在生活今晚早点睡明天开始最好不要把自己的时间约给别人啦管理好自己的时间!加油!晚安呐期待遇到我的Bumblebee~
机器学习算法之回归算法福葫芦机器学习回归算法
一、回归算法思维导图二、算法概念、原理、应用场景和实例代码1、线性回归1.1、概念‌‌线性回归算法是一种统计分析方法，用于确定两种或两种以上变量之间的定量关系。‌线性回归算法通过建立线性方程来预测因变量（y）和一个或多个自变量（x）之间的关系。其基本形式为y=wx+e，其中w是权重，x是自变量，e是误差项。1.2、算法原理线性回归算法的核心在于找到最佳的拟合直线，使得预测值与实际值之间的误差最小。
如何做一个好妈妈淡墨清荷老师
孩子在成长过程中母亲起着很重要的作用，特别是在忙碌、复杂的当今社会中，作为一个母亲如何能兼顾自己的工作和孩子的教育问题呢？根据积极心理学的知识我认为要做到以下几点：1.要有平和的心态，这是非常关键的一点。脾气暴躁的母亲会让孩子无所适从，也很没有安全感。养育我的女儿让我感受最深，我自己就是一个脾气很不稳定的人，特别是当自己驮着疲惫的身躯回到家，此时自己的小孩故意跟你闹的时候，自己沉不住气就爆发了，就
拆解爆款文章发现，原来写作是有方法和步骤 1bdcc660f394
文：轻腾创者文字功底很深厚的文章常推不到爆款，很多爆款文章都是很朴实的文字语言。写作，一种是写自己想写的，另一种则是写别人想看的。当然，前者是写前的前期，自嗨模式；后者是写作的进阶，有一定的积累和自己的文字表达。以前是为日更而写，现在发现，写作用于记录自己真实的一些思想碰撞点还是非常不错。最近我比较喜欢看销售文，可以从中学到一些技术为自己所用，同时还可以学到背后的逻辑。万事万物都具有规律性，找到规
2021-09-24作业评改记录天地一沙鸥洛阳
今天讲的内容是有理数的大小比较。在课堂中，首先带领学生回顾了数轴上两个数的大小比较，利用数轴描点，通过在数轴上去，右边的数总比左边的数大来进行判断，这是一种比较的方法。接着，通过对两组负数的绝对值比较，结合数轴上的大小比较，很显然可以得出：两个负数比较，绝对值大的数反而小。然后通过两类例题来进行格式上的规范，第一类是两个负数的比较，通过题例，让学生归纳做题的三个步骤：取两个负数的绝对值；比较两个绝
ERP II david_lv 大数据 java 人工智能区块链物联网
（1）ERPIIERPII是SAP在2000年时提出的一个概念。ERP是为单个企业内部管理管理用的。这个，大家都很明白。但是，企业和企业之间总有上下游关系。在ERP模式下，这些上中下游的企业都各买各用各的ERP，上中下游的企业和企业之间的协作，主要通过QQ+EXCEL来同步信息。再牛一点的行业巨头，则会定义自己的上下游IT接口标准，然后让自己的战略合作上下游企业按照接口标准接入进来，大家通过Web
如何构建“可解释”的差异分析模型？财务RPA技术路径对比 GJGCY rpa 人工智能大数据自动化
在大多数企业的财务流程中，数据对账往往是看似简单、实则复杂的存在。尤其是月末、季末节点，企业需要处理的往来账、付款记录、银行流水、发票凭证动辄成千上万，一旦发生金额不符、凭证遗漏、重复报销等异常，人工核查不仅耗时费力，还容易错过关键问题。于是，差异分析与异常标注逐渐成为财务流程智能化升级中的刚需能力。越来越多的企业希望借助财务RPA（流程自动化机器人），将这些繁琐任务转化为机器精准执行的例行工作。
Spark RDD 之 Partition 博弈史密斯
SparkRDD怎么理解RDD的粗粒度模式？对比细粒度模式SparkRDD的task数量是由什么决定的？一份待处理的原始数据会被按照相应的逻辑(例如jdbc和hdfs的split逻辑)切分成n份，每份数据对应到RDD中的一个Partition，Partition的数量决定了task的数量，影响着程序的并行度支持保存点(checkpoint)虽然RDD可以通过lineage实现faultrecove
7篇1章7节：机器学习算法解读，与数值预测回归模型构建 MD分析用R探索医药数据科学机器学习算法回归 r语言数据挖掘
机器学习是当今数据分析和人工智能的核心工具之一，其算法广泛应用于分类、回归、排序和推荐等领域。本篇将详细讲解机器学习的四大经典算法类型，并以回归问题为例深入探讨数值预测的关键步骤，包括数据准备、线性回归模型构建、模型预测及误差评估，帮助读者更系统地理解和掌握机器学习的基础知识及实际应用。一、机器学习的算法在数据科学和人工智能的浪潮中，机器学习算法成为了解决各种数据问题的关键工具。机器学习主要处理四
2023-10-08 执剑饮烈酒
1、世界上最无耻、最阴险、最歹毒的赞美,就是用底层人的艰辛和苦难,当作励志故事去愚弄底层人。——王朔2、做什么事有一点很重要：带着一颗真诚的心、接纳的心、心甘情愿的心去做事，与带着所谓的责任心、恐惧某种结果的心、某种目的的心、达到某种目的就万事大吉的心去做事，做出来的事和结果，以及自己在做事过程中的表现，完全不一样。——《半山文集》3、别指望所有的人都能懂你，因为萝卜白菜，各有所爱。你做了萝卜，自
青岛正规亲子鉴定中心地址一览（附2024年9家鉴定机构汇总）国医基因周主任
青岛正规亲子鉴定中心机构：青岛国医基因亲子鉴定中心，地址：青岛市北区抚顺路25号。我们从刚开始对于亲子鉴定的难以启齿话题，到现在的大众认知，不管是影视还是生活中不经意总会看到亲子鉴定的片段，这年头，上户口关系证明，刑事案件DNA检测，其实孩子在医院出生后就要做个亲子鉴定也是常有的事，有人甚至会开玩笑着拿宠物去做亲子鉴定，青岛人也不例外，当我们要做一个DNA鉴定时，就需要提前了解一下自己所在的地区的
解线性方程组 qiuwanchi
package gaodai.matrix; import java.util.ArrayList; import java.util.List; import java.util.Scanner; public class Test { public static void main(String[] args) { Scanner scanner = new Sc
在mysql内部存储代码 annan211 性能 mysql 存储过程触发器
在mysql内部存储代码在mysql内部存储代码，既有优点也有缺点，而且有人倡导有人反对。先看优点： 1 她在服务器内部执行，离数据最近，另外在服务器上执行还可以节省带宽和网络延迟。 2 这是一种代码重用。可以方便的统一业务规则，保证某些行为的一致性，所以也可以提供一定的安全性。 3 可以简化代码的维护和版本更新。 4 可以帮助提升安全，比如提供更细
Android使用Asynchronous Http Client完成登录保存cookie的问题 hotsunshine android
Asynchronous Http Client是android中非常好的异步请求工具除了异步之外还有很多封装比如json的处理，cookie的处理引用 Persistent Cookie Storage with PersistentCookieStore This library also includes a PersistentCookieStore whi
java面试题 Array_06 java 面试
java面试题第一，谈谈final, finally, finalize的区别。 final-修饰符（关键字）如果一个类被声明为final，意味着它不能再派生出新的子类，不能作为父类被继承。因此一个类不能既被声明为 abstract的，又被声明为final的。将变量或方法声明为final，可以保证它们在使用中不被改变。被声明为final的变量必须在声明时给定初值，而在以后的引用中只能
网站加速 oloz 网站加速
前序:本人菜鸟，此文研究总结来源于互联网上的资料，大牛请勿喷！本人虚心学习，多指教. 1、减小网页体积的大小，尽量采用div+css模式，尽量避免复杂的页面结构，能简约就简约。 2、采用Gzip对网页进行压缩； GZIP最早由Jean-loup Gailly和Mark Adler创建，用于UNⅨ系统的文件压缩。我们在Linux中经常会用到后缀为.gz
正确书写单例模式随意而生 java 设计模式单例
　　单例模式算是设计模式中最容易理解，也是最容易手写代码的模式了吧。但是其中的坑却不少，所以也常作为面试题来考。本文主要对几种单例写法的整理，并分析其优缺点。很多都是一些老生常谈的问题，但如果你不知道如何创建一个线程安全的单例，不知道什么是双检锁，那这篇文章可能会帮助到你。　　懒汉式，线程不安全　　当被问到要实现一个单例模式时，很多人的第一反应是写出如下的代码，包括教科书上也是这样
单例模式香水浓 java
懒汉调用getInstance方法时实例化 public class Singleton { private static Singleton instance; private Singleton() {} public static synchronized Singleton getInstance() { if(null == ins
安装Apache问题：系统找不到指定的文件 No installed service named "Apache2" AdyZhang apache http server
安装Apache问题：系统找不到指定的文件 No installed service named "Apache2" 每次到这一步都很小心防它的端口冲突问题，结果，特意留出来的80端口就是不能用，烦。解决方法确保几处： 1、停止IIS启动 2、把端口80改成其它（譬如90，800，，，什么数字都好） 3、防火墙(关掉试试) 在运行处输入 cmd 回车，转到apa
如何在android 文件选择器中选择多个图片或者视频？ aijuans android
我的android app有这样的需求，在进行照片和视频上传的时候，需要一次性的从照片/视频库选择多条进行上传但是android原生态的sdk中，只能一个一个的进行选择和上传。我想知道是否有其他的android上传库可以解决这个问题，提供一个多选的功能，可以使checkbox之类的，一次选择多个处理方法官方的图片选择器(但是不支持所有版本的androi，只支持API Level
mysql中查询生日提醒的日期相关的sql baalwolf mysql
SELECT sysid,user_name,birthday,listid,userhead_50,CONCAT(YEAR(CURDATE()),DATE_FORMAT(birthday,'-%m-%d')),CURDATE(), dayofyear( CONCAT(YEAR(CURDATE()),DATE_FORMAT(birthday,'-%m-%d')))-dayofyear(
MongoDB索引文件破坏后导致查询错误的问题 BigBird2012 mongodb
问题描述： MongoDB在非正常情况下关闭时，可能会导致索引文件破坏，造成数据在更新时没有反映到索引上。解决方案：使用脚本，重建MongoDB所有表的索引。 var names = db.getCollectionNames(); for( var i in names ){ var name = names[i]; print(name);
Javascript Promise bijian1013 JavaScript Promise
Parse JavaScript SDK现在提供了支持大多数异步方法的兼容jquery的Promises模式，那么这意味着什么呢，读完下文你就了解了。一.认识Promises “Promises”代表着在javascript程序里下一个伟大的范式，但是理解他们为什么如此伟大不是件简
[Zookeeper学习笔记九]Zookeeper源代码分析之Zookeeper构造过程 bit1129 zookeeper
Zookeeper重载了几个构造函数，其中构造者可以提供参数最多，可定制性最多的构造函数是 public ZooKeeper(String connectString, int sessionTimeout, Watcher watcher, long sessionId, byte[] sessionPasswd, boolea
【Java命令三】jstack bit1129 jstack
jstack是用于获得当前运行的Java程序所有的线程的运行情况(thread dump），不同于jmap用于获得memory dump [hadoop@hadoop sbin]$ jstack Usage: jstack [-l] <pid> (to connect to running process) jstack -F
jboss 5.1启停脚本　动静分离部署 ronin47
以前启动jboss，往各种xml配置文件，现只要运行一句脚本即可。start nohup sh /**/run.sh -c servicename -b ip -g clustername -u broatcast jboss.messaging.ServerPeerID=int -Djboss.service.binding.set=p
UI之如何打磨设计能力? brotherlamp UI ui教程 ui自学 ui资料 ui视频
在越来越拥挤的初创企业世界里，视觉设计的重要性往往可以与杀手级用户体验比肩。在许多情况下，尤其对于 Web 初创企业而言，这两者都是不可或缺的。前不久我们在《右脑革命：别学编程了，学艺术吧》中也曾发出过重视设计的呼吁。如何才能提高初创企业的设计能力呢?以下是 9 位创始人的体会。 1.找到自己的方式如果你是设计师，要想提高技能可以去设计博客和展示好设计的网站如D-lists或
三色旗算法 bylijinnan java 算法
import java.util.Arrays; /** 问题：假设有一条绳子，上面有红、白、蓝三种颜色的旗子，起初绳子上的旗子颜色并没有顺序，您希望将之分类，并排列为蓝、白、红的顺序，要如何移动次数才会最少，注意您只能在绳子上进行这个动作，而且一次只能调换两个旗子。网上的解法大多类似：在一条绳子上移动，在程式中也就意味只能使用一个阵列，而不使用其它的阵列来
警告:No configuration found for the specified action: \'s chiangfai configuration
1.index.jsp页面form标签未指定namespace属性。  <%@taglib prefix="s" uri="/struts-tags"%> ... <s:form action="submit" method="post"&g
redis -- hash_max_zipmap_entries设置过大有问题 chenchao051 redis hash
使用redis时为了使用hash追求更高的内存使用率，我们一般都用hash结构，并且有时候会把hash_max_zipmap_entries这个值设置的很大，很多资料也推荐设置到1000，默认设置为了512，但是这里有个坑 #define ZIPMAP_BIGLEN 254 #define ZIPMAP_END 255 /* Return th
select into outfile access deny问题 daizj mysql txt 导出数据到文件
本文转自：http://hatemysql.com/2010/06/29/select-into-outfile-access-deny%E9%97%AE%E9%A2%98/ 为应用建立了rnd的帐号，专门为他们查询线上数据库用的，当然，只有他们上了生产网络以后才能连上数据库，安全方面我们还是很注意的，呵呵。授权的语句如下： grant select on armory.* to rn
phpexcel导出excel表简单入门示例 dcj3sjt126com PHP Excel phpexcel
<?php error_reporting(E_ALL); ini_set('display_errors', TRUE); ini_set('display_startup_errors', TRUE); if (PHP_SAPI == 'cli') die('This example should only be run from a Web Brows
美国电影超短200句 dcj3sjt126com 电影
1. I see．我明白了。2. I quit! 我不干了!3. Let go! 放手!4. Me too．我也是。5. My god! 天哪!6. No way! 不行!7. Come on．来吧(赶快)8. Hold on．等一等。9. I agree。我同意。10. Not bad．还不错。11. Not yet．还没。12. See you．再见。13. Shut up!
Java访问远程服务 dyy_gusi httpclient webservice get post
随着webService的崛起，我们开始中会越来越多的使用到访问远程webService服务。当然对于不同的webService框架一般都有自己的client包供使用，但是如果使用webService框架自己的client包，那么必然需要在自己的代码中引入它的包，如果同时调运了多个不同框架的webService，那么就需要同时引入多个不同的clien
Maven的settings.xml配置 geeksun settings.xml
settings.xml是Maven的配置文件，下面解释一下其中的配置含义： settings.xml存在于两个地方： 1.安装的地方：$M2_HOME/conf/settings.xml 2.用户的目录：${user.home}/.m2/settings.xml 前者又被叫做全局配置，后者被称为用户配置。如果两者都存在，它们的内容将被合并，并且用户范围的settings.xml优先。
ubuntu的init与系统服务设置 hongtoushizi ubuntu
转载自： http://iysm.net/?p=178 init Init是位于/sbin/init的一个程序，它是在linux下，在系统启动过程中，初始化所有的设备驱动程序和数据结构等之后，由内核启动的一个用户级程序，并由此init程序进而完成系统的启动过程。 ubuntu与传统的linux略有不同，使用upstart完成系统的启动，但表面上仍维持init程序的形式。运行
跟我学Nginx+Lua开发目录贴 jinnianshilongnian nginx lua
使用Nginx+Lua开发近一年的时间，学习和实践了一些Nginx+Lua开发的架构，为了让更多人使用Nginx+Lua架构开发，利用春节期间总结了一份基本的学习教程，希望对大家有用。也欢迎谈探讨学习一些经验。目录第一章安装Nginx+Lua开发环境第二章 Nginx+Lua开发入门第三章 Redis/SSDB+Twemproxy安装与使用第四章 L
php位运算符注意事项 home198979 位运算 PHP &
$a = $b = $c = 0; $a & $b = 1; $b | $c = 1 问a,b,c最终为多少? 当看到这题时，我犯了一个低级错误，误以为位运算符会改变变量的值。所以得出结果是1 1 0 但是位运算符是不会改变变量的值的，例如： $a=1;$b=2; $a&$b; 这样a,b的值不会有任何改变
Linux shell数组建立和使用技巧 pda158 linux
1.数组定义　　[chengmo@centos5 ~]$ a=(1 2 3 4 5) 　　[chengmo@centos5 ~]$ echo $a 　　1 　　一对括号表示是数组，数组元素用“空格”符号分割开。　　 2.数组读取与赋值　　得到长度：　　[chengmo@centos5 ~]$ echo ${#a[@]} 　　5 　　用${#数组名[@或
hotspot源码(JDK7) ol_beta java HotSpot jvm
源码结构图，方便理解： ├─agent Serviceab
Oracle基本事务和ForAll执行批量DML练习 vipbooks oracle sql
基本事务的使用：从账户一的余额中转100到账户二的余额中去，如果账户二不存在或账户一中的余额不足100则整笔交易回滚 select * from account; -- 创建一张账户表 create table account( -- 账户ID id number(3) not null, -- 账户名称 nam

读书笔记《Outlier Analysis》 第四章 基于邻近的异常检测