宝付大数据分析解析

系统日志数据的采集

Scribe是Facebook开源的日志收集系统,在Facebook内部已经得到大量的应用。它够从各种日志源上收集日志,存储到一个中央存储系统上,以便于进行集中的统计分析处理。 Scribe为日志的“分布式收集,统一处理”提供了一个可扩展的、高容错的方案。

Chukwa提供了一个对大数据量日志类数据采集、存储、分析和展示的全套解决方案和框架,可以用于监控大规模Hadoop 集群的整体运行情况并对它们的日志进行分析(相当于学校内无死角的监控摄像头)。

数据清理通过填写缺失值,光滑噪声数据,识别或删除离群点并解决不一致性来“清理”数据。数据清理的过程主要包括数据预处理、确定清理方法、检验清理方法、执行清理工具和数据归档。同时每个阶段可以再分若干个任务。

数据集成是将来自多个数据源的数据集集成到一起,但集成后的不可避免的会出现数据冗余,原因主要有:代表同一概念的属性在不同数据库中可能具有不同的名字;有些属性可能由于其他属性导出的。数据集成后可以再次进行数据清理、检测和删去由数据集带来的冗余。

数据归约的目的是得到数据集的简化表示。虽然数据集的简化表示比原数据集的规模小得多,但仍然能够产生几乎同样的分析结果。

数据变换是使用规范化、数据离散化和概念分层等方法使得数据的玩具可以在多个抽象层上进行。数据变换操作是引导数据挖掘过程成功的附加预处理过程。


来自 “ ITPUB博客 ” ,链接:http://blog.itpub.net/69905323/viewspace-2654769/,如需转载,请注明出处,否则将追究法律责任。

转载于:http://blog.itpub.net/69905323/viewspace-2654769/

你可能感兴趣的:(宝付大数据分析解析)