- hadoop面试问题
code学习社
1当前你们公司使用的Hadoop版本是什么Hadoopcdh-5.7.6/hadoop-2.6.02HDFS常见的数据压缩格式有哪些,介绍其中一种详细的实现方式Gzip优点是压缩率高,速度快。Hadoop支持与直接处理文本一样。缺点不支持split,当文件压缩在128m内,都可以用gzipIzo 优点压缩速度快合理的压缩率;支持split,是最流行的压缩格式。支持native库;缺点比gzip压缩
- 原生apache hadoop3.3.1集群安装配置Kerberos
Mumunu-
apachehadoop大数据
安装kerberos可以看一下我另外一篇。下面直接开始配置hadoopCDH配置Kerberos和Sentry详解_cdhkerberos配置_Mumunu-的博客-CSDN博客部署好了kerberos之后,首先添加用户和生成认证文件在KDC中添加需要认证的用户具体用户看情况而定(hadoop集群主要由hdfs管理,所以除了建hdfs账户还有HTTP账户,另外还有hive、hbase、dwetl也
- Thrift JDBC/ODBC Server安装
专职掏大粪
添加Clouderamaven镜像在spark的pom文件中添加CDH的maven镜像[1],并添加Hadoopcdh5.6.1的profileclouderahttps://repository.cloudera.com/artifactory/cloudera-repos/ClouderaRepositoriestrueclouderaClouderaRepositorieshttps://r
- Hadoop-2.3.0-cdh5.0.1完全分布式环境搭建(NameNode,ResourceManager HA)
shihlei
Hadoop
编写不易,转载请注明(http://shihlei.iteye.com/blog/2084711)!说明本文搭建HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。word版:见附件吧!一概述(一)HDFS1)基础架构(1)NameNode(Master)命名空间管理:命名空
- 大数据离线分析系统:统计网站PV、UV
小姚同學
大数据
目录一、业务需求二、业务实现方案1.技术栈2.业务实现流程3.离线分析系统架构图三、技术实现1.HadoopCDH集群管理平台2.Flume采集服务器日志数据到HDFS3.SparkSQL清洗数据4.建立Hive仓库并导入清洗完的数据5.HQL统计分析PV、UV数据6.Sqoop同步数据7.代码分享8.相关博客文章一、业务需求根据网站或app应用每天生成的用户日志数据放在大数据平台中来统计出PV(
- Hadoop CDH4伪分布式安装
kokojhuang
Hadoop应用
对于一名Hadoop开发人员来说,第一件事就是需要安装一个自己的Hadoop环境供日常的开发及学习使用,本文主要介绍如何安装HadoopCDH4的伪分布式环境。由于Hadoop是由Java编写,因此需要运行在JDK1.6以上平台,所以第一步需要安装相应的JDK。相应的JDK可以通过下面这个连接下载。JDKDownloadPage安装JDK[kevin@localhost~]$sudo./jdk-6
- 实训笔记
standByMe6868
实训笔记
2018.12.17上午大数据概述前置要求javaSE的基本变成了解LINUX常用基本命令使用工具linux版本CentOS6.4HadoopCDH5.7TBPBEB大数据在技术架构上带来的挑战对现有数据库管理技术的挑战实时性的技术挑战经典数据库技术并没有考虑数据的多类别网络架构、数据中心、运维的挑战其他挑战数据隐私数据源的复杂多样挑战分析之如何对大数据进行存储和分析呢?系统瓶颈Google大数据
- Hadoop完全分布式 -- HA配置
WarmthYan
HADOOP
以3台机器配置hadoopHA为例hadoopCDH版本:hadoop-2.6.0-cdh5.15.0.tar.gzzookeeperCDH版本:zookeeper-3.4.5-cdh5.15.0.tar.gz【前提工作】一、配置好3台虚拟机hosts$vi/etc/hosts127.0.0.1localhostlocalhost.localdomainlocalhost4localhost4.l
- Hadoop的安装与环境配置
Cool小子
HadoopCDH版本的安装:参考文档http://archive.cloudera.com/cdh5/cdh/5/hadoop-2.6.0-cdh5.7.0/下载地址:http://archive.cloudera.com/cdh5/cdh/5/安装的版本为:hadoop-2.6.0-cdh5.7.0.tar.gzjdk-8u241-linux-x64.tar.gz安装包的下载路径为~/soft
- 关于CDH5安装的步骤及注意事项
我挖煤的猫
注:此为hadoopCDH5.11离线安装一、准备安装所需文件1官网下载ClouderaManager和CDH5.11ClouderaManager下载地址:http://archive.cloudera.com/cm5/cm/5/cloudera-manager-el6-cm5.11.0_x86_64.tar.gzCDH安装包http://archive.cloudera.com/cdh5/pa
- hadoop yarn框架原理
jofenn
report监控命名空间周期性
HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。 一概述(一)HDFS1)基础架构(1)NameNode(Master)命名空间管理:命名空间支持对HDFS中的目录、文件和块做类似文件系统的创建、修改、删除、列表文件和目录等基本操作。块存储管理(2)DataNode(Sl
- hadoop yarn框架原理
jofenn
空间监控命名
HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。一概述(一)HDFS1)基础架构(1)NameNode(Master)命名空间管理:命名空间支持对HDFS中的目录、文件和块做类似文件系统的创建、修改、删除、列表文件和目录等基本操作。块存储管理(2)DataNode(Sla
- Hadoop-2.3.0-cdh5.0.1完全分布式环境搭建(NameNode,ResourceManager HA)
fz2543122681
编写不易,转载请注明(http://shihlei.iteye.com/blog/2084711)!说明 本文搭建HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。 一概述(一)HDFS1)基础架构(1)NameNode(Master)命名空间管理:命名空间支持对HD
- Hadoop-2.3.0-cdh5.0.1完全分布式环境搭建(NameNode,ResourceManager HA)
ShihLei
Hadoop2.3.0cdh5.0.1NameNodeHAResourceMangaerHA
阅读更多编写不易,转载请注明(http://shihlei.iteye.com/blog/2084711)!说明本文搭建HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。word版:见附件吧!一概述(一)HDFS1)基础架构(1)NameNode(Master)命名空间管理
- Hadoop-2.3.0-cdh5.0.1完全分布式环境搭建(NameNode,ResourceManager HA)
ShihLei
NameNodeHAHAHadoop2.3.0ResourceMangaercdh5.0.1
编写不易,转载请注明(http://shihlei.iteye.com/blog/2084711)!说明 本文搭建HadoopCDH5.0.1分布式系统,包括NameNode,ResourceMangerHA,忽略了WebApplicationProxy和JobHistoryServer。 word版:见附件吧!一概述(一)HDFS1)基础架构(1)NameNode(Master)命
- 干净虚拟机(centos 6.4)上从头到尾安装并调试Mdrill(一)
292672967
jdkhadoopzookeeperzeromqmdrillcentos6.4jzmqcdh3u3uuid-devel
前言淘宝Mdrill号称很强大,其所用硬件设备也很强大。但对于学习者来说,虚拟机是最经济的选择了,本文只说明如何在干净虚拟机(cenos6.4)上安装并调试Mdrill。原理不做说明,具体请参考官方文档>。准备centos6.4finalx86_64,linux用户名:mdrilljdk1.6hadoopcdh3u3zookeeper-3.4.5zeromq-2.1.7jzmq2.1.0mdril
- YARN异常: we cannot start a localDataXceiverServer because libhadoop cannot解决方法
小网客
hadoop
版本:
HadoopCDH5.0
异常描述:
部署hadoop yarn的时候报RuntimeException,信息如下:
java.lang.RuntimeException: Although a UNIX domain socket path is configured as /var/run/hadoop-hdfs/dn._PORT, we cannot start a loca
- YARN异常: we cannot start a localDataXceiverServer because libhadoop cannot解决方法
小网客
hadoop
版本:
HadoopCDH5.0
异常描述:
部署hadoop yarn的时候报RuntimeException,信息如下:
java.lang.RuntimeException: Although a UNIX domain socket path is configured as /var/run/hadoop-hdfs/dn._PORT, we cannot start a loca
- 在Hadoop中提升task的启动速度
驰驰的老爸
hadoop
在增量DUMP过程中,我们的job比较小,但是启动非常频繁,每个job的执行时间短,通过执行的日志发现,有时会出现一个job的启动时间很长,需要几十秒。由于我们很看重增量的速度,所以几十秒的等待是不可接受的。分析:我们当时使用的HadoopCDH3Beta4的版本。通过ganglia图表分析,出问题的tasktracker会出现一些流量的凸起。但是离带宽限制还很远。通过仔细分析TaskTracke
- 暂时不想研究hadoop流 先记下来
java_doom
hadoop
暂时不想研究hadoop流 先记下来
错误的:hadoop jar /home/hadoop/hadoopcdh/contrib/streaming/hadoop-streaming-0.20.2-cdh3u6.jar -input input -output output -mapper /bin/cat -reducer usr/bin/wc
正确的:had
- hadoop eclipse 3
fncj
阅读更多2012年5月3日《转载》hadoopcdh3u3eclipse插件编译1.编译环境操作系统:debian6amd64,安装ant和maven2这两个java打包工具。hadoop:hadoop-0.20.2-cdh3u3.tar.gzeclipse:eclipse-java-indigo-SR2-win32.zip2.编译hadoop解压源码hadoop-0.20.2-cdh3u3.ta
- Hadoop CDH4伪分布式安装
kokojhuang
对于一名Hadoop开发人员来说,第一件事就是需要安装一个自己的Hadoop环境供日常的开发及学习使用,本文主要介绍如何安装HadoopCDH4的伪分布式环境。由于Hadoop是由Java编写,因此需要运行在JDK1.6以上平台,所以第一步需要安装相应的JDK。相应的JDK可以通过下面这个连接下载。 JDKDownloadPage安装JDK[kevin@localhost~]$sudo./
- 在Hadoop中提升task的启动速度
macyang
HadoopCDH3Beta4是一个比较早的cloudrarealease的版本了,当前的hadoop已经不需要去做patch这个功能了,但是这篇文章分析和解决问题的方法很赞!===========================================在增量DUMP过程中,我们的job比较小,但是启动非常频繁,每个job的执行时间短,通过执行的日志发现,有时会出现一个job的启动时间很长
- HBase在淘宝主搜索的Dump中的性能调优
macyang
目前HBase已经运用于淘宝主搜索的全量和增量的数据存储,有效的减低的数据库的压力,增强了业务扩展的能力。Dump系统的特点是要求在短时间内处理大量数据,对延时要求高。在实施这个项目过程中,我们积累了一些优化的实践,抛砖引玉,供大家参考。环境:HadoopCDH3U4+HBase0.92.11、 尽可能用LZO数据使用LZO,不仅可以节省存储空间尤其是可以提高传输的效率,因为数据是在regions
- HBase在淘宝主搜索的Dump中的性能调优
jingling_zy
目前HBase已经运用于淘宝主搜索的全量和增量的数据存储,有效的减低的数据库的压力,增强了业务扩展的能力。Dump系统的特点是要求在短时间内处理大量数据,对延时要求高。在实施这个项目过程中,我们积累了一些优化的实践,抛砖引玉,供大家参考。环境:HadoopCDH3U4+HBase0.92.11、 尽可能用LZO数据使用LZO,不仅可以节省存储空间尤其是可以提高传输的效率,因为数据是在regions
- HBase在淘宝主搜索的Dump中的性能调优
道凡
数据挖掘
目前HBase已经运用于淘宝主搜索的全量和增量的数据存储,有效的减低的数据库的压力,增强了业务扩展的能力。Dump系统的特点是要求在短时间内处理大量数据,对延时要求高。在实施这个项目过程中,我们积累了一些优化的实践,抛砖引玉,供大家参考。环境:HadoopCDH3U4+HBase0.92.11、 尽可能用LZO数据使用LZO,不仅可以节省存储空间尤其是可以提高传输的效率,因为数据是在regions
- 关于旗正规则引擎下载页面需要弹窗保存到本地目录的问题
何必如此
jsp超链接文件下载窗口
生成下载页面是需要选择“录入提交页面”,生成之后默认的下载页面<a>标签超链接为:<a href="<%=root_stimage%>stimage/image.jsp?filename=<%=strfile234%>&attachname=<%=java.net.URLEncoder.encode(file234filesourc
- 【Spark九十八】Standalone Cluster Mode下的资源调度源代码分析
bit1129
cluster
在分析源代码之前,首先对Standalone Cluster Mode的资源调度有一个基本的认识:
首先,运行一个Application需要Driver进程和一组Executor进程。在Standalone Cluster Mode下,Driver和Executor都是在Master的监护下给Worker发消息创建(Driver进程和Executor进程都需要分配内存和CPU,这就需要Maste
- linux上独立安装部署spark
daizj
linux安装spark1.4部署
下面讲一下linux上安装spark,以 Standalone Mode 安装
1)首先安装JDK
下载JDK:jdk-7u79-linux-x64.tar.gz ,版本是1.7以上都行,解压 tar -zxvf jdk-7u79-linux-x64.tar.gz
然后配置 ~/.bashrc&nb
- Java 字节码之解析一
周凡杨
java字节码javap
一: Java 字节代码的组织形式
类文件 {
OxCAFEBABE ,小版本号,大版本号,常量池大小,常量池数组,访问控制标记,当前类信息,父类信息,实现的接口个数,实现的接口信息数组,域个数,域信息数组,方法个数,方法信息数组,属性个数,属性信息数组
}
&nbs
- java各种小工具代码
g21121
java
1.数组转换成List
import java.util.Arrays;
Arrays.asList(Object[] obj); 2.判断一个String型是否有值
import org.springframework.util.StringUtils;
if (StringUtils.hasText(str)) 3.判断一个List是否有值
import org.spring
- 加快FineReport报表设计的几个心得体会
老A不折腾
finereport
一、从远程服务器大批量取数进行表样设计时,最好按“列顺序”取一个“空的SQL语句”,这样可提高设计速度。否则每次设计时模板均要从远程读取数据,速度相当慢!!
二、找一个富文本编辑软件(如NOTEPAD+)编辑SQL语句,这样会很好地检查语法。有时候带参数较多检查语法复杂时,结合FineReport中生成的日志,再找一个第三方数据库访问软件(如PL/SQL)进行数据检索,可以很快定位语法错误。
- mysql linux启动与停止
墙头上一根草
如何启动/停止/重启MySQL一、启动方式1、使用 service 启动:service mysqld start2、使用 mysqld 脚本启动:/etc/inint.d/mysqld start3、使用 safe_mysqld 启动:safe_mysqld&二、停止1、使用 service 启动:service mysqld stop2、使用 mysqld 脚本启动:/etc/inin
- Spring中事务管理浅谈
aijuans
spring事务管理
Spring中事务管理浅谈
By Tony Jiang@2012-1-20 Spring中对事务的声明式管理
拿一个XML举例
[html]
view plain
copy
print
?
<?xml version="1.0" encoding="UTF-8"?>&nb
- php中隐形字符65279(utf-8的BOM头)问题
alxw4616
php中隐形字符65279(utf-8的BOM头)问题
今天遇到一个问题. php输出JSON 前端在解析时发生问题:parsererror.
调试:
1.仔细对比字符串发现字符串拼写正确.怀疑是 非打印字符的问题.
2.逐一将字符串还原为unicode编码. 发现在字符串头的位置出现了一个 65279的非打印字符.
 
- 调用对象是否需要传递对象(初学者一定要注意这个问题)
百合不是茶
对象的传递与调用技巧
类和对象的简单的复习,在做项目的过程中有时候不知道怎样来调用类创建的对象,简单的几个类可以看清楚,一般在项目中创建十几个类往往就不知道怎么来看
为了以后能够看清楚,现在来回顾一下类和对象的创建,对象的调用和传递(前面写过一篇)
类和对象的基础概念:
JAVA中万事万物都是类 类有字段(属性),方法,嵌套类和嵌套接
- JDK1.5 AtomicLong实例
bijian1013
javathreadjava多线程AtomicLong
JDK1.5 AtomicLong实例
类 AtomicLong
可以用原子方式更新的 long 值。有关原子变量属性的描述,请参阅 java.util.concurrent.atomic 包规范。AtomicLong 可用在应用程序中(如以原子方式增加的序列号),并且不能用于替换 Long。但是,此类确实扩展了 Number,允许那些处理基于数字类的工具和实用工具进行统一访问。
 
- 自定义的RPC的Java实现
bijian1013
javarpc
网上看到纯java实现的RPC,很不错。
RPC的全名Remote Process Call,即远程过程调用。使用RPC,可以像使用本地的程序一样使用远程服务器上的程序。下面是一个简单的RPC 调用实例,从中可以看到RPC如何
- 【RPC框架Hessian一】Hessian RPC Hello World
bit1129
Hello world
什么是Hessian
The Hessian binary web service protocol makes web services usable without requiring a large framework, and without learning yet another alphabet soup of protocols. Because it is a binary p
- 【Spark九十五】Spark Shell操作Spark SQL
bit1129
shell
在Spark Shell上,通过创建HiveContext可以直接进行Hive操作
1. 操作Hive中已存在的表
[hadoop@hadoop bin]$ ./spark-shell
Spark assembly has been built with Hive, including Datanucleus jars on classpath
Welcom
- F5 往header加入客户端的ip
ronin47
when HTTP_RESPONSE {if {[HTTP::is_redirect]}{ HTTP::header replace Location [string map {:port/ /} [HTTP::header value Location]]HTTP::header replace Lo
- java-61-在数组中,数字减去它右边(注意是右边)的数字得到一个数对之差. 求所有数对之差的最大值。例如在数组{2, 4, 1, 16, 7, 5,
bylijinnan
java
思路来自:
http://zhedahht.blog.163.com/blog/static/2541117420116135376632/
写了个java版的
public class GreatestLeftRightDiff {
/**
* Q61.在数组中,数字减去它右边(注意是右边)的数字得到一个数对之差。
* 求所有数对之差的最大值。例如在数组
- mongoDB 索引
开窍的石头
mongoDB索引
在这一节中我们讲讲在mongo中如何创建索引
得到当前查询的索引信息
db.user.find(_id:12).explain();
cursor: basicCoursor 指的是没有索引
&
- [硬件和系统]迎峰度夏
comsci
系统
从这几天的气温来看,今年夏天的高温天气可能会维持在一个比较长的时间内
所以,从现在开始准备渡过炎热的夏天。。。。
每间房屋要有一个落地电风扇,一个空调(空调的功率和房间的面积有密切的关系)
坐的,躺的地方要有凉垫,床上要有凉席
电脑的机箱
- 基于ThinkPHP开发的公司官网
cuiyadll
行业系统
后端基于ThinkPHP,前端基于jQuery和BootstrapCo.MZ 企业系统
轻量级企业网站管理系统
运行环境:PHP5.3+, MySQL5.0
系统预览
系统下载:http://www.tecmz.com
预览地址:http://co.tecmz.com
各种设备自适应
响应式的网站设计能够对用户产生友好度,并且对于
- Transaction and redelivery in JMS (JMS的事务和失败消息重发机制)
darrenzhu
jms事务承认MQacknowledge
JMS Message Delivery Reliability and Acknowledgement Patterns
http://wso2.com/library/articles/2013/01/jms-message-delivery-reliability-acknowledgement-patterns/
Transaction and redelivery in
- Centos添加硬盘完全教程
dcj3sjt126com
linuxcentoshardware
Linux的硬盘识别:
sda 表示第1块SCSI硬盘
hda 表示第1块IDE硬盘
scd0 表示第1个USB光驱
一般使用“fdisk -l”命
- yii2 restful web服务路由
dcj3sjt126com
PHPyii2
路由
随着资源和控制器类准备,您可以使用URL如 http://localhost/index.php?r=user/create访问资源,类似于你可以用正常的Web应用程序做法。
在实践中,你通常要用美观的URL并采取有优势的HTTP动词。 例如,请求POST /users意味着访问user/create动作。 这可以很容易地通过配置urlManager应用程序组件来完成 如下所示
- MongoDB查询(4)——游标和分页[八]
eksliang
mongodbMongoDB游标MongoDB深分页
转载请出自出处:http://eksliang.iteye.com/blog/2177567 一、游标
数据库使用游标返回find的执行结果。客户端对游标的实现通常能够对最终结果进行有效控制,从shell中定义一个游标非常简单,就是将查询结果分配给一个变量(用var声明的变量就是局部变量),便创建了一个游标,如下所示:
> var
- Activity的四种启动模式和onNewIntent()
gundumw100
android
Android中Activity启动模式详解
在Android中每个界面都是一个Activity,切换界面操作其实是多个不同Activity之间的实例化操作。在Android中Activity的启动模式决定了Activity的启动运行方式。
Android总Activity的启动模式分为四种:
Activity启动模式设置:
<acti
- 攻城狮送女友的CSS3生日蛋糕
ini
htmlWebhtml5csscss3
在线预览:http://keleyi.com/keleyi/phtml/html5/29.htm
代码如下:
<!DOCTYPE html>
<html>
<head>
<meta charset="UTF-8">
<title>攻城狮送女友的CSS3生日蛋糕-柯乐义<
- 读源码学Servlet(1)GenericServlet 源码分析
jzinfo
tomcatWebservlet网络应用网络协议
Servlet API的核心就是javax.servlet.Servlet接口,所有的Servlet 类(抽象的或者自己写的)都必须实现这个接口。在Servlet接口中定义了5个方法,其中有3个方法是由Servlet 容器在Servlet的生命周期的不同阶段来调用的特定方法。
先看javax.servlet.servlet接口源码:
package
- JAVA进阶:VO(DTO)与PO(DAO)之间的转换
snoopy7713
javaVOHibernatepo
PO即 Persistence Object VO即 Value Object
VO和PO的主要区别在于: VO是独立的Java Object。 PO是由Hibernate纳入其实体容器(Entity Map)的对象,它代表了与数据库中某条记录对应的Hibernate实体,PO的变化在事务提交时将反应到实际数据库中。
实际上,这个VO被用作Data Transfer
- mongodb group by date 聚合查询日期 统计每天数据(信息量)
qiaolevip
每天进步一点点学习永无止境mongodb纵观千象
/* 1 */
{
"_id" : ObjectId("557ac1e2153c43c320393d9d"),
"msgType" : "text",
"sendTime" : ISODate("2015-06-12T11:26:26.000Z")
- java之18天 常用的类(一)
Luob.
MathDateSystemRuntimeRundom
System类
import java.util.Properties;
/**
* System:
* out:标准输出,默认是控制台
* in:标准输入,默认是键盘
*
* 描述系统的一些信息
* 获取系统的属性信息:Properties getProperties();
*
*
*
*/
public class Sy
- maven
wuai
maven
1、安装maven:解压缩、添加M2_HOME、添加环境变量path
2、创建maven_home文件夹,创建项目mvn_ch01,在其下面建立src、pom.xml,在src下面简历main、test、main下面建立java文件夹
3、编写类,在java文件夹下面依照类的包逐层创建文件夹,将此类放入最后一级文件夹
4、进入mvn_ch01
4.1、mvn compile ,执行后会在