okbin1991

大数据技术之Hadoop（入门）V3.0 --配置安装较多

1.1 大数据概念

1.2 大数据特点(4V)

1.3 大数据应用场景

1.4 大数据发展前景

1.5 大数据部门业务流程分析

1.6 大数据部门组织结构(重点)

第2章从Hadoop框架讨论大数据生态2.1 Hadoop是什么

2.2 Hadoop发展历史(了解)

2.3 Hadoop三大发行版本(了解)Hadoop三大发行版本：Apache、Cloudera、Hortonworks。Apache版本最原始(最基础)的版本，对于入门学习最好。Cloudera内部集成了很多大数据框架。对应产品CDH。Hortonworks文档较好。对应产品HDP。1)Apache Hadoop官网地址：http://hadoop.apache.org/releases.html下载地址：https://archive.apache.org/dist/hadoop/common/2)Cloudera Hadoop 官网地址：https://www.cloudera.com/downloads/cdh/5-10-0.html下载地址：http://archive-primary.cloudera.com/cdh5/cdh/5/(1)2008年成立的Cloudera是最早将Hadoop商用的公司，为合作伙伴提供Hadoop的商用解决方案，主要是包括支持、咨询服务、培训。(2)2009年Hadoop的创始人Doug Cutting也加盟Cloudera公司。Cloudera产品主要为CDH，Cloudera Manager，Cloudera Support(3)CDH是Cloudera的Hadoop发行版，完全开源，比Apache Hadoop在兼容性，安全性，稳定性上有所增强。Cloudera的标价为每年每个节点10000美元。(4)Cloudera Manager是集群的软件分发及管理监控平台，可以在几个小时内部署好一个Hadoop集群，并对集群的节点及服务进行实时监控。3)Hortonworks Hadoop官网地址：https://hortonworks.com/products/data-center/hdp/下载地址：https://hortonworks.com/downloads/#data-platform(1)2011年成立的Hortonworks是雅虎与硅谷风投公司Benchmark Capital合资组建。(2)公司成立之初就吸纳了大约25名至30名专门研究Hadoop的雅虎工程师，上述工程师均在2005年开始协助雅虎开发Hadoop，贡献了Hadoop80%的代码。(3)Hortonworks的主打产品是Hortonworks Data Platform(HDP)，也同样是100%开源的产品，HDP除常见的项目外还包括了Ambari，一款开源的安装和管理系统。(4)Hortonworks目前已经被Cloudera公司收购。2.4 Hadoop的优势(4高)

2.5 Hadoop组成(面试重点)

2.5.1 HDFS架构概

阿善看到

2.5.2 YARN架构概述

2.5.3 MapReduce架构概述MapReduce将计算过程分为两个阶段：Map和Reduce1)Map阶段并行处理输入数据2)Reduce阶段对Map结果进行汇总

2.6 大数据技术生态体系

图中涉及的技术名词解释如下：1)Sqoop：Sqoop是一款开源的工具，主要用于在Hadoop、Hive与传统的数据库(MySql)间进行数据的传递，可以将一个关系型数据库(例如：MySQL，Oracle 等)中的数据导进到Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。2)Flume：Flume是一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume支持在日志系统中定制各类数据发送方，用于收集数据； 3)Kafka：Kafka是一种高吞吐量的分布式发布订阅消息系统； 4)Storm：Storm用于“连续计算”，对数据流做连续查询，在计算时就将结果以流的形式输出给用户。5)Spark：Spark是当前最流行的开源大数据内存计算框架。可以基于Hadoop上存储的大数据进行计算。6)Flink：Flink是当前最流行的开源大数据内存计算框架。用于实时计算的场景较多。7)Oozie：Oozie是一个管理Hdoop作业(job)的工作流程调度管理系统。8)Hbase：HBase是一个分布式的、面向列的开源数据库。HBase不同于一般的关系数据库，它是一个适合于非结构化数据存储的数据库。9)Hive：Hive是基于Hadoop的一个数据仓库工具，可以将结构化的数据文件映射为一张数据库表，并提供简单的SQL查询功能，可以将SQL语句转换为MapReduce任务进行运行。其优点是学习成本低，可以通过类SQL语句快速实现简单的MapReduce统计，不必开发专门的MapReduce应用，十分适合数据仓库的统计分析。10)ZooKeeper：它是一个针对大型分布式系统的可靠协调系统，提供的功能包括：配置维护、名字服务、分布式同步、组服务等。2.7 推荐系统框架图

第3章 Hadoop运行环境搭建(开发重点)3.1 虚拟机环境准备1)准备三台虚拟机，虚拟机配置要求如下：(1)单台虚拟机：内存4G，硬盘50G，安装必要环境sudo yum install -y epel-releasesudo yum install -y psmisc nc net-tools rsync vim lrzsz ntp libzstd openssl-static tree iotop git(3)修改克隆虚拟机的静态IPsudo vim /etc/sysconfig/network-scripts/ifcfg-ens33改成DEVICE=ens33TYPE=EthernetONBOOT=yesBOOTPROTO=staticNAME="ens33"IPADDR=192.168.1.101PREFIX=24GATEWAY=192.168.1.2DNS1=192.168.1.2(4)查看Linux虚拟机的虚拟网络编辑器，编辑->虚拟网络编辑器->VMnet8

(5)查看Windows系统适配器VMware Network Adapter VMnet8的IP地址

(6)保证Linux文件中IP地址、Linux虚拟网络编辑器地址和Windows系统VM8网络IP地址相同。2)修改主机名 (1)修改主机名称sudo hostnamectl --static set-hostname hadoop101(2)配置主机名称映射，打开/etc/hostssudo vim /etc/hosts添加如下内容192.168.1.100 hadoop100192.168.1.101 hadoop101192.168.1.102 hadoop102192.168.1.103 hadoop103192.168.1.104 hadoop104192.168.1.105 hadoop105192.168.1.106 hadoop106192.168.1.107 hadoop107192.168.1.108 hadoop108(3)修改window7的主机映射文件(hosts文件) (a)进入C:\Windows\System32\drivers\etc路径 (b)打开hosts文件并添加如下内容192.168.1.100 hadoop100 192.168.1.101 hadoop101192.168.1.102 hadoop102192.168.1.103 hadoop103192.168.1.104 hadoop104192.168.1.105 hadoop105192.168.1.106 hadoop106192.168.1.107 hadoop107192.168.1.108 hadoop108(4)修改window10的主机映射文件(hosts文件)(a)进入C:\Windows\System32\drivers\etc路径(b)拷贝hosts文件到桌面 (c)打开桌面hosts文件并添加如下内容192.168.1.100 hadoop100 192.168.1.101 hadoop101192.168.1.102 hadoop102192.168.1.103 hadoop103192.168.1.104 hadoop104192.168.1.105 hadoop105192.168.1.106 hadoop106192.168.1.107 hadoop107192.168.1.108 hadoop108(d)将桌面hosts文件覆盖C:\Windows\System32\drivers\etc路径hosts文件3)关闭防火墙sudo systemctl stop firewalldsudo systemctl disable firewalld4)创建atguigu用户sudo useradd atguigusudo passwd atguigu5)重启虚拟机reboot6)配置atguigu用户具有root权限vi sudo修改/etc/sudoers文件，找到下面一行(91行)，在root下面添加一行，如下所示：## Allow root to run any commands anywhereroot ALL=(ALL) ALLatguigu ALL=(ALL) ALL7)在/opt目录下创建文件夹(1)在/opt目录下创建module、software文件夹sudo mkdir modulesudo mkdir software (2)修改module、software文件夹的所有者cd sudo mkdir /opt/module /opt/softwaresudo chown atguigu:atguigu /opt/module /opt/software3.2 在102安装JDK1)卸载现有JDKrpm -qa | grep -i java | xargs -n1 sudo rpm -e --nodeps2)用SecureCRT工具将JDK导入到opt目录下面的software文件夹下面

3) “alt+p”进入sftp模式

4)选择jdk1.8拖入工具

5)在Linux系统下的opt目录中查看软件包是否导入成功ls /opt/software/看到如下结果：hadoop-3.1.3.tar.gz jdk-8u212-linux-x64.tar.gz6)解压JDK到/opt/module目录下tar -zxvf jdk-8u212-linux-x64.tar.gz -C /opt/module/7)配置JDK环境变量 (1)新建/etc/profile.d/my_env.sh文件sudo vim /etc/profile.d/my_env.sh添加如下内容#JAVA_HOMEexport JAVA_HOME=/opt/module/jdk1.8.0_212export PATH=$PATH:$JAVA_HOME/bin (2)保存后退出:wq (3)重启xshell窗口，让环境变量生效8)测试JDK是否安装成功java -version如果能看到以下结果、则Java正常安装java version "1.8.0_212"注意：重启(如果java -version可以用就不用重启)sudo reboot3.3 在102安装HadoopHadoop下载地址：https://archive.apache.org/dist/hadoop/common/hadoop-3.1.3/1)用SecureCRT工具将hadoop-3.1.3.tar.gz导入到opt目录下面的software文件夹下面切换到sftp连接页面，选择Linux下编译的hadoop jar包拖入，如图2-32所示

图拖入hadoop的tar包

图2-33 拖入Hadoop的tar包成功2)进入到Hadoop安装包路径下[atguigu@hadoop101 ~]$ cd /opt/software/3)解压安装文件到/opt/module下面[atguigu@hadoop101 software]$ tar -zxvf hadoop-3.1.3.tar.gz -C /opt/module/4)查看是否解压成功[atguigu@hadoop101 software]$ ls /opt/module/hadoop-3.1.35)将Hadoop添加到环境变量 (1)获取Hadoop安装路径[atguigu@hadoop101 hadoop-3.1.3]$ pwd/opt/module/hadoop-3.1.3 (2)打开/etc/profile.d/my_env.sh文件sudo vim /etc/profile.d/my_env.sh在profile文件末尾添加JDK路径：(shitf+g)##HADOOP_HOMEexport HADOOP_HOME=/opt/module/hadoop-3.1.3export PATH=$PATH:$HADOOP_HOME/binexport PATH=$PATH:$HADOOP_HOME/sbin(3)保存后退出:wq (4)让修改后的文件生效[atguigu@ hadoop101 hadoop-3.1.3]$ source /etc/profile6)测试是否安装成功[atguigu@hadoop101 hadoop-3.1.3]$ hadoop versionHadoop 3.1.37)重启(如果Hadoop命令不能用再重启)[atguigu@ hadoop101 hadoop-3.1.3]$ sync[atguigu@ hadoop101 hadoop-3.1.3]$ sudo reboot3.4 Hadoop目录结构1)查看Hadoop目录结构[atguigu@hadoop101 hadoop-3.1.3]$ ll总用量 52drwxr-xr-x. 2 atguigu atguigu 4096 5月 22 2017 bindrwxr-xr-x. 3 atguigu atguigu 4096 5月 22 2017 etcdrwxr-xr-x. 2 atguigu atguigu 4096 5月 22 2017 includedrwxr-xr-x. 3 atguigu atguigu 4096 5月 22 2017 libdrwxr-xr-x. 2 atguigu atguigu 4096 5月 22 2017 libexec-rw-r--r--. 1 atguigu atguigu 15429 5月 22 2017 LICENSE.txt-rw-r--r--. 1 atguigu atguigu 101 5月 22 2017 NOTICE.txt-rw-r--r--. 1 atguigu atguigu 1366 5月 22 2017 README.txtdrwxr-xr-x. 2 atguigu atguigu 4096 5月 22 2017 sbindrwxr-xr-x. 4 atguigu atguigu 4096 5月 22 2017 share2)重要目录(1)bin目录：存放对Hadoop相关服务(HDFS,YARN)进行操作的脚本(2)etc目录：Hadoop的配置文件目录，存放Hadoop的配置文件(3)lib目录：存放Hadoop的本地库(对数据进行压缩解压缩功能)(4)sbin目录：存放启动或停止Hadoop相关服务的脚本(5)share目录：存放Hadoop的依赖jar包、文档、和官方案例第4章 Hadoop运行模式Hadoop运行模式包括：本地模式、伪分布式模式以及完全分布式模式。Hadoop官方网站：http://hadoop.apache.org/4.1 本地运行模式(官方wordcount)1)创建在hadoop-3.1.3文件下面创建一个wcinput文件夹mkdir wcinput2)在wcinput文件下创建一个wc.input文件cd wcinput3)编辑wc.input文件vi wc.input在文件中输入如下内容hadoop yarnhadoop mapreduceatguiguatguigu保存退出：：wq4)回到Hadoop目录/opt/module/hadoop-3.1.35)执行程序hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar wordcount wcinput wcoutput6)查看结果[atguigu@hadoop101 hadoop-3.1.3]$ cat wcoutput/part-r-00000看到如下结果：atguigu 2hadoop 2mapreduce 1yarn 14.2 完全分布式运行模式(开发重点)分析： 1)准备3台客户机(关闭防火墙、静态ip、主机名称) 2)安装JDK 3)配置环境变量 4)安装Hadoop 5)配置环境变量6)配置集群7)单点启动 8)配置ssh 9)群起并测试集群4.2.1 虚拟机准备详见3.1章。4.2.2 编写集群分发脚本xsync1)scp(secure copy)安全拷贝(1)scp定义：scp可以实现服务器与服务器之间的数据拷贝。(from server1 to server2) (2)基本语法scp -r $pdir/$fname $user@hadoop$host:$pdir/$fname命令递归要拷贝的文件路径/名称目的用户@主机:目的路径/名称(3)案例实操(a)在hadoop101上，将hadoop101中/opt/module目录下的软件拷贝到hadoop102上。[atguigu@hadoop101 /]$ scp -r /opt/module root@hadoop102:/opt/module(b)在hadoop103上，将hadoop101服务器上的/opt/module目录下的软件拷贝到hadoop103上。[atguigu@hadoop103 opt]$sudo scp -r atguigu@hadoop101:/opt/module root@hadoop103:/opt/module(c)在hadoop103上操作将hadoop101中/opt/module目录下的软件拷贝到hadoop104上。[atguigu@hadoop103 opt]$ scp -r atguigu@hadoop101:/opt/module root@hadoop104:/opt/module注意：拷贝过来的/opt/module目录，别忘了在hadoop102、hadoop103、hadoop104上修改所有文件的，所有者和所有者组。sudo chown atguigu:atguigu -R /opt/module(d)将hadoop101中/etc/profile文件拷贝到hadoop102的/etc/profile上。[atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop102:/etc/profile(e)将hadoop101中/etc/profile文件拷贝到hadoop103的/etc/profile上。[atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop103:/etc/profile(f)将hadoop101中/etc/profile文件拷贝到hadoop104的/etc/profile上。[atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop104:/etc/profile注意：拷贝过来的配置文件别忘了source一下/etc/profile，。2)rsync远程同步工具rsync主要用于备份和镜像。具有速度快、避免复制相同内容和支持符号链接的优点。rsync和scp区别：用rsync做文件的复制要比scp的速度快，rsync只对差异文件做更新。scp是把所有文件都复制过去。 (1)基本语法rsync -av $pdir/$fname $user@hadoop$host:$pdir/$fname命令选项参数要拷贝的文件路径/名称目的用户@主机:目的路径/名称选项参数说明选项功能-a 归档拷贝-v 显示复制过程(2)案例实操把hadoop101机器上的/opt/software目录同步到hadoop102服务器的root用户下的/opt/目录[atguigu@hadoop101 opt]$ rsync -av /opt/software/ hadoop102:/opt/software3)xsync集群分发脚本(1)需求：循环复制文件到所有节点的相同目录下 (2)需求分析：(a)rsync命令原始拷贝：rsync -av /opt/module root@hadoop103:/opt/(b)期望脚本：xsync要同步的文件名称(c)说明：在/home/atguigu/bin这个目录下存放的脚本，atguigu用户可以在系统任何地方直接执行。(3)脚本实现(a)在/home/atguigu目录下创建xsync文件cd /home/atguiguvim xsync在该文件中编写如下代码#!/bin/bash#1. 判断参数个数if [ $# -lt 1 ]then echo Not Enough Arguement! exit;fi#2. 遍历集群所有机器for host in hadoop102 hadoop103 hadoop104do echo ==================== $host ==================== #3. 遍历所有目录，挨个发送 for file in $@ do #4 判断文件是否存在 if [ -e $file ] then #5. 获取父目录 pdir=$(cd -P $(dirname $file); pwd) #6. 获取当前文件的名称 fname=$(basename $file) ssh $host "mkdir -p $pdir" rsync -av $pdir/$fname $host:$pdir else echo $file does not exists! fi donedone(b)修改脚本 xsync 具有执行权限chmod +x xsync(c)将脚本移动到/bin中，以便全局调用sudo mv xsync /bin/ (d)测试脚本sudo xsync /bin/xsync4.2.3 SSH无密登录配置1)配置ssh(1)基本语法ssh另一台电脑的ip地址(2)ssh连接时出现Host key verification failed的解决方法ssh hadoop103出现：The authenticity of host '192.168.1.103 (192.168.1.103)' can't be established.RSA key fingerprint is cf:1e:de:d7:d0:4c:2d:98:60:b4:fd:ae:b1:2d:ad:06.Are you sure you want to continue connecting (yes/no)? (3)解决方案如下：直接输入yes2)无密钥配置(1)免密登录原理

(2)生成公钥和私钥：ssh-keygen -t rsa然后敲(三个回车)，就会生成两个文件id_rsa(私钥)、id_rsa.pub(公钥)(3)将公钥拷贝到要免密登录的目标机器上ssh-copy-id hadoop102ssh-copy-id hadoop103ssh-copy-id hadoop104注意：还需要在hadoop102上采用root账号，配置一下无密登录到hadoop102、hadoop103、hadoop104；还需要在hadoop103上采用atguigu账号配置一下无密登录到hadoop102、hadoop103、hadoop104服务器上。3).ssh文件夹下(~/.ssh)的文件功能解释known_hosts 记录ssh访问过计算机的公钥(public key)id_rsa 生成的私钥id_rsa.pub 生成的公钥authorized_keys 存放授权过的无密登录服务器公钥4.2.4 集群配置1)集群部署规划注意：NameNode和SecondaryNameNode不要安装在同一台服务器注意：ResourceManager也很消耗内存，不要和NameNode、SecondaryNameNode配置在同一台机器上。 hadoop102 hadoop103 hadoop104HDFS NameNodeDataNode DataNode SecondaryNameNodeDataNodeYARN NodeManager ResourceManagerNodeManager NodeManager2)配置集群(1)核心配置文件配置core-site.xmlcd $HADOOP_HOME/etc/hadoopvim core-site.xml文件内容如下： fs.defaultFS hdfs://hadoop102:8020 hadoop.tmp.dir /opt/module/hadoop-3.1.3/data hadoop.proxyuser.atguigu.hosts * hadoop.proxyuser.atguigu.groups * hadoop.http.staticuser.user atguigu (2)HDFS配置文件配置hdfs-site.xmlvim hdfs-site.xml文件内容如下：

dfs.namenode.secondary.http-address hadoop104:9868 (3)YARN配置文件配置yarn-site.xmlvim yarn-site.xml文件内容如下：

yarn.nodemanager.aux-services mapreduce_shuffle yarn.resourcemanager.hostname hadoop103 yarn.nodemanager.env-whitelist JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_MAPRED_HOME yarn.scheduler.minimum-allocation-mb 512 yarn.scheduler.maximum-allocation-mb 4096 yarn.nodemanager.resource.memory-mb 4096 yarn.nodemanager.pmem-check-enabled false yarn.nodemanager.vmem-check-enabled false (4)MapReduce配置文件配置mapred-site.xmlvim mapred-site.xml文件内容如下：

mapreduce.framework.name yarn 3)在集群上分发配置好的Hadoop配置文件xsync /opt/module/hadoop-3.1.3/etc/hadoop/4)查看文件分发情况cat /opt/module/hadoop-3.1.3/etc/hadoop/core-site.xml4.2.5 群起集群1)配置workersvim /opt/module/hadoop-3.1.3/etc/hadoop/workers在该文件中增加如下内容：hadoop102hadoop103hadoop104注意：该文件中添加的内容结尾不允许有空格，文件中不允许有空行。同步所有节点配置文件xsync /opt/module/hadoop-3.1.3/etc2)启动集群 (1)如果集群是第一次启动，需要在hadoop102节点格式化NameNode(注意格式化之前，一定要先停止上次启动的所有namenode和datanode进程，然后再删除data和log数据)hdfs namenode -format(2)启动HDFSsbin/start-dfs.sh(3)在配置了ResourceManager的节点(hadoop103)启动YARNsbin/start-yarn.sh(4)Web端查看SecondaryNameNode(a)浏览器中输入：http://hadoop104:9868/status.html (b)查看SecondaryNameNode信息

3)集群基本测试(1)上传文件到集群上传小文件hadoop fs -mkdir -p /user/atguigu/inputhadoop fs -put $HADOOP_HOME/wcinput/wc.input /user/atguigu/input 上传大文件hadoop fs -put /opt/software/hadoop-3.1.3.tar.gz /(2)上传文件后查看文件存放在什么位置(a)查看HDFS文件存储路径[atguigu@hadoop102 subdir0]$ pwd/opt/module/hadoop-3.1.3/data/tmp/dfs/data/current/BP-938951106-192.168.10.107-1495462844069/current/finalized/subdir0/subdir0(b)查看HDFS在磁盘存储文件内容[atguigu@hadoop102 subdir0]$ cat blk_1073741825hadoop yarnhadoop mapreduce atguiguatguigu(3)拼接-rw-rw-r--. 1 atguigu atguigu 134217728 5月 23 16:01 blk_1073741836-rw-rw-r--. 1 atguigu atguigu 1048583 5月 23 16:01 blk_1073741836_1012.meta-rw-rw-r--. 1 atguigu atguigu 63439959 5月 23 16:01 blk_1073741837-rw-rw-r--. 1 atguigu atguigu 495635 5月 23 16:01 blk_1073741837_1013.meta[atguigu@hadoop102 subdir0]$ cat blk_1073741836>>tmp.jar[atguigu@hadoop102 subdir0]$ cat blk_1073741837>>tmp.jar[atguigu@hadoop102 subdir0]$ tar -zxvf tmp.jar(4)下载[atguigu@hadoop102 hadoop-3.1.3]$ bin/hadoop fs -get /hadoop-3.1.3.tar.gz ./(5)执行wordcount程序[atguigu@hadoop102 hadoop-3.1.3]$ hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar wordcount /user/atguigu/input /user/atguigu/output4.2.6 集群启动/停止方式总结1)各个服务组件逐一启动/停止 (1)分别启动/停止HDFS组件hdfs --daemon start/stop namenode/datanode/secondarynamenode (2)启动/停止YARNyarn --daemon start/stop resourcemanager/nodemanager2)各个模块分开启动/停止(配置ssh是前提)常用 (1)整体启动/停止HDFSstart-dfs.sh/stop-dfs.sh (2)整体启动/停止YARNstart-yarn.sh/stop-yarn.sh4.2.7 配置历史服务器为了查看程序的历史运行情况，需要配置一下历史服务器。具体配置步骤如下：1)配置mapred-site.xmlvi mapred-site.xml在该文件里面增加如下配置。 mapreduce.jobhistory.address hadoop102:10020

mapreduce.jobhistory.webapp.address hadoop102:198882)分发配置xsync $HADOOP_HOME/etc/hadoop/mapred-site.xml3)在hadoop102启动历史服务器mapred --daemon start historyserver4)查看历史服务器是否启动jps5)查看JobHistoryhttp://hadoop102:19888/jobhistory4.2.8 配置日志的聚集日志聚集概念：应用运行完成以后，将程序运行日志信息上传到HDFS系统上。日志聚集功能好处：可以方便的查看到程序运行详情，方便开发调试。注意：开启日志聚集功能，需要重新启动NodeManager 、ResourceManager和HistoryManager。开启日志聚集功能具体步骤如下：1)配置yarn-site.xmlvim yarn-site.xml在该文件里面增加如下配置。 yarn.log-aggregation-enable true yarn.log.server.url http://${yarn.timeline-service.webapp.address}/applicationhistory/logs yarn.log-aggregation.retain-seconds 604800 yarn.timeline-service.enabled true yarn.timeline-service.hostname ${yarn.resourcemanager.hostname} yarn.timeline-service.http-cross-origin.enabled true yarn.resourcemanager.system-metrics-publisher.enabled true2)分发配置xsync $HADOOP_HOME/etc/hadoop/yarn-site.xml3)关闭NodeManager 、ResourceManager和HistoryServer在103上执行： stop-yarn.sh在102上执行： mapred --daemon stop historyserver4)启动NodeManager 、ResourceManage、Timelineserver和HistoryServer在103上执行：start-yarn.sh在103上执行：yarn --daemon start timelineserver在102上执行：mapred --daemon start historyserver5)删除HDFS上已经存在的输出文件hdfs dfs -rm -R /user/atguigu/output6)执行WordCount程序hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar wordcount /user/atguigu/input /user/atguigu/output7)查看日志， http://hadoop102:19888/jobhistory

图 Job History

图 job运行情况

图查看日志

4.2.9 集群时间同步时间同步的方式：找一个机器，作为时间服务器，所有的机器与这台集群时间进行定时的同步，比如，每隔十分钟，同步一次时间。

配置时间同步具体实操：1)时间服务器配置(必须root用户)(1)在所有节点关闭ntp服务和自启动sudo systemctl stop ntpdsudo systemctl disable ntpd(2)修改ntp配置文件vim /etc/ntp.conf修改内容如下a)修改1(授权192.168.1.0-192.168.1.255网段上的所有机器可以从这台机器上查询和同步时间)#restrict 192.168.1.0 mask 255.255.255.0 nomodify notrap为restrict 192.168.1.0 mask 255.255.255.0 nomodify notrap b)修改2(集群在局域网中，不使用其他互联网上的时间)server 0.centos.pool.ntp.org iburstserver 1.centos.pool.ntp.org iburstserver 2.centos.pool.ntp.org iburstserver 3.centos.pool.ntp.org iburst为#server 0.centos.pool.ntp.org iburst#server 1.centos.pool.ntp.org iburst#server 2.centos.pool.ntp.org iburst#server 3.centos.pool.ntp.org iburstc)添加3(当该节点丢失网络连接，依然可以采用本地时间作为时间服务器为集群中的其他节点提供时间同步)server 127.127.1.0fudge 127.127.1.0 stratum 10(3)修改/etc/sysconfig/ntpd 文件vim /etc/sysconfig/ntpd增加内容如下(让硬件时间与系统时间一起同步)SYNC_HWCLOCK=yes(4)重新启动ntpd服务systemctl start ntpd(5)设置ntpd服务开机启动systemctl enable ntpd2)其他机器配置(必须root用户)(1)在其他机器配置10分钟与时间服务器同步一次crontab -e编写定时任务如下：*/10 * * * * /usr/sbin/ntpdate hadoop102(2)修改任意机器时间date -s "2017-9-11 11:11:11"(3)十分钟后查看机器是否与时间服务器同步date说明：测试的时候可以将10分钟调整为1分钟，节省时间。第5章 Hadoop编译源码5.1 前期准备工作1)CentOS联网配置CentOS能连接外网。Linux虚拟机ping www.baidu.com 是畅通的注意：采用root角色编译，减少文件夹权限出现问题2)jar包准备(hadoop源码、JDK8、maven、ant 、protobuf)(1)hadoop-3.1.3-src.tar.gz(2)jdk-8u212-linux-x64.tar.gz(3)apache-ant-1.9.9-bin.tar.gz(build工具，打包用的)(4)apache-maven-3.0.5-bin.tar.gz(5)protobuf-2.5.0.tar.gz(序列化的框架)5.2 Jar包安装注意：所有操作必须在root用户下完成1)JDK解压、配置环境变量 JAVA_HOME和PATH，验证java-version(如下都需要验证是否配置成功)[root@hadoop101 software] # tar -zxf jdk-8u212-linux-x64.tar.gz -C /opt/module/

[root@hadoop101 software]# vi /etc/profile#JAVA_HOME：export JAVA_HOME=/opt/module/jdk1.8.0_212export PATH=$PATH:$JAVA_HOME/bin

[root@hadoop101 software]#source /etc/profile验证命令：java -version2)Maven解压、配置 MAVEN_HOME和PATH[root@hadoop101 software]# tar -zxvf apache-maven-3.0.5-bin.tar.gz -C /opt/module/

[root@hadoop101 apache-maven-3.0.5]# vi conf/settings.xml

nexus-aliyun central Nexus aliyun http://maven.aliyun.com/nexus/content/groups/public

[root@hadoop101 apache-maven-3.0.5]# vi /etc/profile#MAVEN_HOMEexport MAVEN_HOME=/opt/module/apache-maven-3.0.5export PATH=$PATH:$MAVEN_HOME/bin

[root@hadoop101 software]#source /etc/profile验证命令：mvn -version3)ant解压、配置 ANT _HOME和PATH[root@hadoop101 software]# tar -zxvf apache-ant-1.9.9-bin.tar.gz -C /opt/module/

[root@hadoop101 apache-ant-1.9.9]# vi /etc/profile#ANT_HOMEexport ANT_HOME=/opt/module/apache-ant-1.9.9export PATH=$PATH:$ANT_HOME/bin

[root@hadoop101 software]#source /etc/profile验证命令：ant -version4)安装 glibc-headers 和 g++ 命令如下[root@hadoop101 apache-ant-1.9.9]# yum install glibc-headers[root@hadoop101 apache-ant-1.9.9]# yum install gcc-c++5)安装make和cmake[root@hadoop101 apache-ant-1.9.9]# yum install make[root@hadoop101 apache-ant-1.9.9]# yum install cmake6)解压protobuf ，进入到解压后protobuf主目录，/opt/module/protobuf-2.5.0，然后相继执行命令[root@hadoop101 software]# tar -zxvf protobuf-2.5.0.tar.gz -C /opt/module/[root@hadoop101 opt]# cd /opt/module/protobuf-2.5.0/

[root@hadoop101 protobuf-2.5.0]#./configure [root@hadoop101 protobuf-2.5.0]# make [root@hadoop101 protobuf-2.5.0]# make check [root@hadoop101 protobuf-2.5.0]# make install [root@hadoop101 protobuf-2.5.0]# ldconfig

[root@hadoop101 hadoop-dist]# vi /etc/profile#LD_LIBRARY_PATHexport LD_LIBRARY_PATH=/opt/module/protobuf-2.5.0export PATH=$PATH:$LD_LIBRARY_PATH

[root@hadoop101 software]#source /etc/profile验证命令：protoc --version7)安装openssl库[root@hadoop101 software]#yum install openssl-devel8)安装 ncurses-devel库[root@hadoop101 software]#yum install ncurses-devel到此，编译工具安装基本完成。5.3 编译源码1)解压源码到/opt/目录[root@hadoop101 software]# tar -zxvf hadoop-3.1.3-src.tar.gz -C /opt/2)进入到hadoop源码主目录[root@hadoop101 hadoop-3.1.3-src]# pwd/opt/hadoop-3.1.3-src3)通过maven执行编译命令[root@hadoop101 hadoop-3.1.3-src]#mvn package -Pdist,native -DskipTests -Dtar等待时间30分钟左右，最终成功是全部SUCCESS。

4)成功的64位hadoop包在/opt/hadoop-3.1.3-src/hadoop-dist/target下[root@hadoop101 target]# pwd/opt/hadoop-3.1.3-src/hadoop-dist/target5)编译源码过程中常见的问题及解决方案(1)MAVEN install时候JVM内存溢出处理方式：在环境配置文件和maven的执行文件均可调整MAVEN_OPT的heap大小。(详情查阅MAVEN 编译 JVM调优问题，如：http://outofmemory.cn/code-snippet/12652/maven-outofmemoryerror-method)(2)编译期间maven报错。可能网络阻塞问题导致依赖库下载不完整导致，多次执行命令(一次通过比较难)：[root@hadoop101 hadoop-3.1.3-src]#mvn package -Pdist,nativeN -DskipTests -Dtar(3)报ant、protobuf等错误，插件下载未完整或者插件版本问题，最开始链接有较多特殊情况，同时推荐2.7.0版本的问题汇总帖子 http://www.tuicool.com/articles/IBn63qf第6章常见错误及解决方案1)防火墙没关闭、或者没有启动YARNINFO client.RMProxy: Connecting to ResourceManager at hadoop108/192.168.10.108:80322)主机名称配置错误3)IP地址配置错误4)ssh没有配置好5)root用户和atguigu两个用户启动集群不统一6)配置文件修改不细心7)未编译源码Unable to load native-hadoop library for your platform... using builtin-java classes where applicable17/05/22 15:38:58 INFO client.RMProxy: Connecting to ResourceManager at hadoop108/192.168.10.108:80328)不识别主机名称java.net.UnknownHostException: hadoop102: hadoop102 at java.net.InetAddress.getLocalHost(InetAddress.java:1475) at org.apache.hadoop.mapreduce.JobSubmitter.submitJobInternal(JobSubmitter.java:146) at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1290) at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1287) at java.security.AccessController.doPrivileged(Native Method)at javax.security.auth.Subject.doAs(Subject.java:415)解决办法：(1)在/etc/hosts文件中添加192.168.1.102 hadoop102 (2)主机名称不要起hadoop hadoop000等特殊名称9)DataNode和NameNode进程同时只能工作一个。

10)执行命令不生效，粘贴word中命令时，遇到-和长–没区分开。导致命令失效解决办法：尽量不要粘贴word中代码。11)jps发现进程已经没有，但是重新启动集群，提示进程已经开启。原因是在linux的根目录下/tmp目录中存在启动的进程临时文件，将集群相关进程删除掉，再重新启动集群。12)jps不生效。原因：全局变量hadoop java没有生效。解决办法：需要source /etc/profile文件。13)8088端口连接不上[atguigu@hadoop102 桌面]$ cat /etc/hosts注释掉如下代码#127.0.0.1 localhost localhost.localdomain localhost4 localhost4.localdomain4#::1 hadoop102

你可能感兴趣的:(hadoop,大数据,hdfs,分布式,mapreduce)

GitHub上克隆项目 bigbig猩猩 github
从GitHub上克隆项目是一个简单且直接的过程，它允许你将远程仓库中的项目复制到你的本地计算机上，以便进行进一步的开发、测试或学习。以下是一个详细的步骤指南，帮助你从GitHub上克隆项目。一、准备工作1.安装Git在克隆GitHub项目之前，你需要在你的计算机上安装Git工具。Git是一个开源的分布式版本控制系统，用于跟踪和管理代码变更。你可以从Git的官方网站（https://git-scm.
01-Git初识 Meereen Git git
01-Git初识概念：一个免费开源，分布式的代码版本控制系统，帮助开发团队维护代码作用：记录代码内容。切换代码版本，多人开发时高效合并代码内容如何学：个人本机使用：Git基础命令和概念多人共享使用：团队开发同一个项目的代码版本管理Git配置用户信息配置：用户名和邮箱，应用在每次提交代码版本时表明自己的身份命令：查看git版本号git-v配置用户名gitconfig--globaluser.name
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
Kafka是如何保证数据的安全性、可靠性和分区的喜欢猪猪 kafka 分布式
Kafka作为一个高性能、可扩展的分布式流处理平台，通过多种机制来确保数据的安全性、可靠性和分区的有效管理。以下是关于Kafka如何保证数据安全性、可靠性和分区的详细解析：一、数据安全性SSL/TLS加密：Kafka支持SSL/TLS协议，通过配置SSL证书和密钥来加密数据传输，确保数据在传输过程中不会被窃取或篡改。这一机制有效防止了中间人攻击，保护了数据的安全性。SASL认证：Kafka支持多种
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
华为云分布式缓存服务DCS 8月新特性发布华为云PaaS服务小智华为云分布式缓存
分布式缓存服务（DistributedCacheService，简称DCS）是华为云提供的一款兼容Redis的高速内存数据处理引擎，为您提供即开即用、安全可靠、弹性扩容、便捷管理的在线分布式缓存能力，满足用户高并发及数据快速访问的业务诉求。此次为大家带来DCS8月的特性更新内容，一起来看看吧！
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
浅谈MapReduce Android路上的人 Hadoop 分布式计算 mapreduce 分布式框架 hadoop
从今天开始，本人将会开始对另一项技术的学习，就是当下炙手可热的Hadoop分布式就算技术。目前国内外的诸多公司因为业务发展的需要，都纷纷用了此平台。国内的比如BAT啦，国外的在这方面走的更加的前面，就不一一列举了。但是Hadoop作为Apache的一个开源项目，在下面有非常多的子项目，比如HDFS，HBase,Hive，Pig,等等，要先彻底学习整个Hadoop，仅仅凭借一个的力量，是远远不够的。
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
KVM+GFS分布式存储系统构建KVM高可用 henan程序媛分布式 GFS 高可用 KVM
一、案列分析1.1案列概述本章案例主要使用之前章节所学的KVM及GlusterFs技术,结合起来从而实现KVM高可用。利用GlusterFs分布式复制卷，对KVM虚拟机文件进行分布存储和冗余。分布式复制卷主要用于需要冗余的情况下把一个文件存放在两个或两个以上的节点,当其中一个节点数据丢失或者损坏之后，KVM仍然能够通过卷组找到另一节点上存储的虚拟机文件，以保证虚拟机正常运行。当节点修复之后，Glu
Hadoop 傲雪凌霜，松柏长青后端大数据 hadoop 大数据分布式
ApacheHadoop是一个开源的分布式计算框架，主要用于处理海量数据集。它具有高度的可扩展性、容错性和高效的分布式存储与计算能力。Hadoop核心由四个主要模块组成，分别是HDFS（分布式文件系统）、MapReduce（分布式计算框架）、YARN（资源管理）和HadoopCommon（公共工具和库）。1.HDFS（HadoopDistributedFileSystem）HDFS是Hadoop生
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
大模型训练数据库Common Crawl WindyChanChan 数据集语言模型数据库
CommonCrawl介绍‌‌CommonCrawl是一个非营利组织，致力于通过大规模分布式爬虫系统定期抓取整个Web并将其存储在一个可公开访问的数据库中。CommonCrawl的数据收集和处理过程包括使用Python开源爬虫工具收集全球范围内的网站数据，并将其上传到‌CommonCrawl基金会的数据仓库中。该项目从2008年开始，至今已经积累了大量的原始网页数据、元数据和文本提取数据。这些数据
慢速连接攻击是什么？慢速连接攻击怎么防护？快快小毛毛网络 ddos 服务器
慢速连接攻击（SlowConnectionAttack），又称慢速攻击（SlowlorisAttack），是一种网络攻击技术，旨在通过占用服务器上的所有可用连接资源来使其无法响应正常请求。与传统的拒绝服务（DoS）和分布式拒绝服务（DDoS）攻击不同，慢速攻击并不依赖于发送大量数据包来消耗带宽，而是利用HTTP、TCP或SSL等协议的特性，通过发送大量不完整的请求或缓慢发送数据来占用服务器资源，使
分布式锁和spring事务管理暴躁的鱼锁及事务分布式 spring java
最近开发一个小程序遇到一个需求需要实现分布式事务管理业务需求用户在使用小程序的过程中可以查看景点，对景点地区或者城市标记是否想去，那么需要统计一个地点被标记的人数，以及记录某个用户对某个地点是否标记为想去，用两个表存储数据，一个地点表记录改地点被标记的次数，一个用户意向表记录某个用户对某个地点是否标记为想去。由于可能有多个用户同时标记一个地点，每个用户在前端点击想去按钮之后，后台接收到请求，从数据
Gobelieve 架构 weixin_34099526 数据库 golang json
Gobelievegithub地址声明:转简书JackieF的文章,为了自己方便copy了一份,加一些自己的东西.链接：https://www.jianshu.com/p/8121d6e85282IMCore主要分三大块:im客户连接服务器（可分布式部署，暂无负载均衡模块)imr路由查询服务器（主要解决im分布式部署的问题）ims存储服务器(主从部署)基础模块1.数据包协议包：header(12)
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
linux挂载文件夹小码快撩 linux
1.使用NFS（NetworkFileSystem）NFS是一种分布式文件系统协议，允许一个系统将其文件系统的一部分共享给其他系统。检查是否安装NFSrpm-qa|grepnfs2.启动和启用NFS服务假设服务名称为nfs-server.service，你可以使用以下命令启动和启用它：sudosystemctlstartnfs-server.servicesudosystemctlenablenf
Kafka 基础与架构理解 StaticKing KAFKA kafka
目录前言Kafka基础概念消息队列简介：Kafka与传统消息队列（如RabbitMQ、ActiveMQ）的对比Kafka的组件Kafka的工作原理：消息的生产、分发、消费流程Kafka系统架构Kafka的分布式架构设计Leader-Follower机制与数据复制Log-basedStorage和持久化Broker间通信协议Zookeeper在Kafka中的角色总结前言Kafka是一个分布式的消息系
Rides实现分布式锁，保障数据一致性,Redisson分布式事务处理朱杰jjj 缓存分布式
分布式环境下分布式锁有三种方式：基于数据库分布式锁基于Redis分布式锁基于zk分布式锁本帖只介绍Redis分布式锁为什么需要用到分布式锁？在单机环境下一个服务中多个线程对同一个事物或数据资源进行操作时，可以通过添加加锁方式（synchronized和lock）来解决数据一致性的问题。但是如果出现多个服务的情况下，这时候我们在通过synchronized和lock的方式来加锁会出现问题，因为多个服
机电综合管理系统架构小熊coder 机载系统系统架构
文章目录一、机电综合管理系统架构1.系统概述2.架构层次3.核心组件二、余度管理1.余度概述2.硬件冗余3.软件冗余4.通信冗余三、总线架构1.MIL-STD-1553B总线2.ARINC429总线3.ARINC629总线4.AFDX/ARINC664总线四、未来发展趋势1.分布式架构2.高速网络3.智能化与自动化结语机电综合管理系统（ElectromechanicalManagementSyst
华为云分布式缓存服务DCS与开源服务差异对比 hcinfo_18 redis使用华为云 Redis5.0 分布式缓存服务 Redis客户端
分布式缓存服务DCS提供单机、主备、集群等丰富的实例类型，满足用户高读写性能及快速数据访问的业务诉求。支持丰富的实例管理操作，帮助用户省去运维烦恼。用户可以聚焦于业务逻辑本身，而无需过多考虑部署、监控、扩容、安全、故障恢复等方面的问题。DCS基于开源Redis、Memcached向用户提供一定程度定制化的缓存服务，因此，除了拥有开源服务缓存数据库的优秀特性，DCS提供更多实用功能。一、与开源Red
在服务器计算节点中使用 jupyter Lab ranshan567 程序人生
JupyterLab是一个基于网页的交互式开发环境,用于科学计算、数据分析和机器学.jupyterlab是jupyternotebook的下一代产品,集成了更多功能,使用起来更方便.在进行数据分析及可视化时，个人电脑不能满足大数据的分析需求，就需要用到高性能计算机集群资源，然而计算机集群的计算节点往往没有联网功能，所以在计算机集群中使用jupyterLab需要进行一些配置。具体的步骤如下：
Dubbo架构概览：服务注册与发现、远程调用、监控与管理木南曌 dubbo 架构
Dubbo是一个成熟的、高性能的、基于Java的微服务开发框架，它主要用于解决分布式系统中的服务治理问题，包括服务的注册与发现、远程过程调用（RPC）、服务监控与管理等多个关键环节。以下是Dubbo架构概览的详细介绍：服务注册与发现Dubbo的服务注册与发现机制是其核心功能之一，它依赖于注册中心来管理服务的生命周期和定位服务提供者。1.服务提供者（Provider）服务提供者是实际提供服务的节点，
大数据真实面试题---SQL The博宇大数据面试题——SQL 大数据 mysql sql 数据库 big data
视频号数据分析组外包招聘笔试题时间限时45分钟完成。题目根据3张表表结构，写出具体求解的SQL代码（搞笑品类定义：视频分类或者视频创建者分类为“搞笑”）1、表创建语句：createtablet_user_video_action_d(dsint,user_idstring,video_idstring,action_typeint,`timestamp`bigint)rowformatdelimi
辗转相处求最大公约数沐刃青蛟 C++漏洞
无言面对”江东父老“了，接触编程一年了，今天发现还不会辗转相除法求最大公约数。惭愧惭愧！为此，总结一下以方便日后忘了好查找。 1.输入要比较的两个数a,b 忽略：2.比较大小（因为后面要的是大的数对小的数做%操作） 3.辗转相除（用循环不停的取余，如a%b,直至b=0） 4.最后的a为两数的最大公约数 &
F5负载均衡会话保持技术及原理技术白皮书 bijian1013 F5 负载均衡
一.什么是会话保持？在大多数电子商务的应用系统或者需要进行用户身份认证的在线系统中，一个客户与服务器经常经过好几次的交互过程才能完成一笔交易或者是一个请求的完成。由于这几次交互过程是密切相关的，服务器在进行这些交互过程的某一个交互步骤时，往往需要了解上一次交互过程的处理结果，或者上几步的交互过程结果，服务器进行下
Object.equals方法：重载还是覆盖 Cwind java generics override overload
本文译自StackOverflow上对此问题的讨论。原问题链接在阅读Joshua Bloch的《Effective Java（第二版）》第8条“覆盖equals时请遵守通用约定”时对如下论述有疑问： “不要将equals声明中的Object对象替换为其他的类型。程序员编写出下面这样的equals方法并不鲜见，这会使程序员花上数个小时都搞不清它为什么不能正常工作：” pu
初始线程 15700786134
暑假学习的第一课是讲线程，任务是是界面上的一条线运动起来。既然是在界面上，那必定得先有一个界面，所以第一步就是，自己的类继承JAVA中的JFrame，在新建的类中写一个界面，代码如下： public class ShapeFr
Linux的tcpdump 被触发 tcpdump
用简单的话来定义tcpdump，就是：dump the traffic on a network，根据使用者的定义对网络上的数据包进行截获的包分析工具。 tcpdump可以将网络中传送的数据包的“头”完全截获下来提供分析。它支持针对网络层、协议、主机、网络或端口的过滤，并提供and、or、not等逻辑语句来帮助你去掉无用的信息。实用命令实例默认启动 tcpdump 普通情况下，直
安卓程序listview优化后还是卡顿肆无忌惮_ ListView
最近用eclipse开发一个安卓app，listview使用baseadapter，里面有一个ImageView和两个TextView。使用了Holder内部类进行优化了还是很卡顿。后来发现是图片资源的问题。把一张分辨率高的图片放在了drawable-mdpi文件夹下，当我在每个item中显示，他都要进行缩放，导致很卡顿。解决办法是把这个高分辨率图片放到drawable-xxhdpi下。 &nb
扩展easyUI tab控件，添加加载遮罩效果知了ing jquery
(function () { $.extend($.fn.tabs.methods, { //显示遮罩 loading: function (jq, msg) { return jq.each(function () { var panel = $(this).tabs(&
gradle上传jar到nexus 矮蛋蛋 gradle
原文地址： https://docs.gradle.org/current/userguide/maven_plugin.html configurations { deployerJars } dependencies { deployerJars "org.apache.maven.wagon
千万条数据外网导入数据库的解决方案。 alleni123 sql mysql
从某网上爬了数千万的数据，存在文本中。然后要导入mysql数据库。悲剧的是数据库和我存数据的服务器不在一个内网里面。。 ping了一下， 19ms的延迟。于是下面的代码是没用的。 ps = con.prepareStatement(sql); ps.setString(1, info.getYear())............; ps.exec
JAVA IO InputStreamReader和OutputStreamReader 百合不是茶 JAVA.io操作字符流
这是第三篇关于java.io的文章了，从开始对io的不了解-->熟悉--->模糊，是这几天来对文件操作中最大的感受，本来自己认为的熟悉了的，刚刚在回想起前面学的好像又不是很清晰了，模糊对我现在或许是最好的鼓励我会更加的去学加油！： JAVA的API提供了另外一种数据保存途径，使用字符流来保存的，字符流只能保存字符形式的流字节流和字符的难点：a,怎么将读到的数据
MO、MT解读 bijian1013 GSM
MO= Mobile originate，上行，即用户上发给SP的信息。MT= Mobile Terminate，下行，即SP端下发给用户的信息；上行:mo提交短信到短信中心下行:mt短信中心向特定的用户转发短信，你的短信是这样的，你所提交的短信，投递的地址是短信中心。短信中心收到你的短信后，存储转发，转发的时候就会根据你填写的接收方号码寻找路由，下发。在彩信领域是一样的道理。下行业务：由SP
五个JavaScript基础问题 bijian1013 JavaScript call apply this Hoisting
下面是五个关于前端相关的基础问题，但却很能体现JavaScript的基本功底。问题1：Scope作用范围考虑下面的代码： (function() { var a = b = 5; })(); console.log(b); 什么会被打印在控制台上？回答：上面的代码会打印 5。 &nbs
【Thrift二】Thrift Hello World bit1129 Hello world
本篇，不考虑细节问题和为什么，先照葫芦画瓢写一个Thrift版本的Hello World，了解Thrift RPC服务开发的基本流程 1. 在Intellij中创建一个Maven模块，加入对Thrift的依赖，同时还要加上slf4j依赖，如果不加slf4j依赖，在后面启动Thrift Server时会报错 <dependency>
【Avro一】Avro入门 bit1129 入门
本文的目的主要是总结下基于Avro Schema代码生成，然后进行序列化和反序列化开发的基本流程。需要指出的是，Avro并不要求一定得根据Schema文件生成代码，这对于动态类型语言很有用。 1. 添加Maven依赖 <?xml version="1.0" encoding="UTF-8"?> <proj
安装nginx+ngx_lua支持WAF防护功能 ronin47
需要的软件:LuaJIT-2.0.0.tar.gz nginx-1.4.4.tar.gz &nb
java-5.查找最小的K个元素-使用最大堆 bylijinnan java
import java.util.Arrays; import java.util.Random; public class MinKElement { /** * 5.最小的K个元素 * I would like to use MaxHeap. * using QuickSort is also OK */ public static void
TCP的TIME-WAIT bylijinnan socket
原文连接： http://vincent.bernat.im/en/blog/2014-tcp-time-wait-state-linux.html 以下为对原文的阅读笔记说明：主动关闭的一方称为local end，被动关闭的一方称为remote end 本地IP、本地端口、远端IP、远端端口这一“四元组”称为quadruplet，也称为socket 1、TIME_WA
jquery ajax 序列化表单 coder_xpf Jquery ajax 序列化
checkbox 如果不设定值，默认选中值为on；设定值之后，选中则为设定的值 <input type="checkbox" name="favor" id="favor" checked="checked"/> $("#favor&quo
Apache集群乱码和最高并发控制 cuisuqiang apache tomcat 并发集群乱码
都知道如果使用Http访问，那么在Connector中增加URIEncoding即可，其实使用AJP时也一样，增加useBodyEncodingForURI和URIEncoding即可。最大连接数也是一样的，增加maxThreads属性即可，如下，配置如下： <Connector maxThreads="300" port="8019" prot
websocket dalan_123 websocket
一、低延迟的客户端-服务器和服务器-客户端的连接很多时候所谓的http的请求、响应的模式，都是客户端加载一个网页，直到用户在进行下一次点击的时候，什么都不会发生。并且所有的http的通信都是客户端控制的，这时候就需要用户的互动或定期轮训的，以便从服务器端加载新的数据。通常采用的技术比如推送和comet（使用http长连接、无需安装浏览器安装插件的两种方式：基于ajax的长
菜鸟分析网络执法官 dcj3sjt126com 网络
最近在论坛上看到很多贴子在讨论网络执法官的问题。菜鸟我正好知道这回事情.人道"人之患好为人师" 手里忍不住,就写点东西吧. 我也很忙.又没有MM,又没有MONEY....晕倒有点跑题. OK,闲话少说,切如正题. 要了解网络执法官的原理. 就要先了解局域网的通信的原理. 前面我们看到了.在以太网上传输的都是具有以太网头的数据包.
Android相对布局属性全集 dcj3sjt126com android
RelativeLayout布局android:layout_marginTop="25dip" //顶部距离android:gravity="left" //空间布局位置android:layout_marginLeft="15dip //距离左边距 // 相对于给定ID控件android:layout_above 将该控件的底部置于给定ID的
Tomcat内存设置详解 eksliang jvm tomcat tomcat内存设置
Java内存溢出详解一、常见的Java内存溢出有以下三种： 1. java.lang.OutOfMemoryError: Java heap space ----JVM Heap（堆）溢出JVM在启动的时候会自动设置JVM Heap的值，其初始空间(即-Xms)是物理内存的1/64，最大空间(-Xmx)不可超过物理内存。可以利用JVM提
Java6 JVM参数选项 greatwqs java HotSpot jvm jvm参数 JVM Options
Java 6 JVM参数选项大全（中文版）作者：Ken Wu Email: [email protected] 转载本文档请注明原文链接 http://kenwublog.com/docs/java6-jvm-options-chinese-edition.htm！本文是基于最新的SUN官方文档Java SE 6 Hotspot VM Opt
weblogic创建JMC i5land weblogic jms
进入 weblogic控制太 1.创建持久化存储 --Services--Persistant Stores--new--Create FileStores--name随便起--target默认--Directory写入在本机建立的文件夹的路径--ok 2.创建JMS服务器 --Services--Messaging--JMS Servers--new--name随便起--Pers
基于 DHT 网络的磁力链接和BT种子的搜索引擎架构 justjavac DHT
上周开发了一个磁力链接和 BT 种子的搜索引擎 {Magnet & Torrent}，本文简单介绍一下主要的系统功能和用到的技术。系统包括几个独立的部分：使用 Python 的 Scrapy 框架开发的网络爬虫，用来爬取磁力链接和种子；使用 PHP CI 框架开发的简易网站；搜索引擎目前直接使用的 MySQL，将来可以考虑使
sql添加、删除表中的列 macroli sql
添加没有默认值：alter table Test add BazaarType char(1) 有默认值的添加列：alter table Test add BazaarType char(1) default(0) 删除没有默认值的列：alter table Test drop COLUMN BazaarType 删除有默认值的列：先删除约束（默认值）alter table Test DRO
PHP中二维数组的排序方法 abc123456789cba 排序二维数组 PHP
<?php/*** @package BugFree* @version $Id: FunctionsMain.inc.php,v 1.32 2005/09/24 11:38:37 wwccss Exp $*** Sort an two-dimension array by some level
hive优化之------控制hive任务中的map数和reduce数 superlxw1234 hive hive优化
一、控制hive任务中的map数: 1. 通常情况下，作业会通过input的目录产生一个或者多个map任务。主要的决定因素有： input的文件总个数，input的文件大小，集群设置的文件块大小(目前为128M, 可在hive中通过set dfs.block.size;命令查看到，该参数不能自定义修改)；2.
Spring Boot 1.2.4 发布 wiselyman spring boot
Spring Boot 1.2.4已于6.4日发布，repo.spring.io and Maven Central可以下载(推荐使用maven或者gradle构建下载)。这是一个维护版本，包含了一些修复small number of fixes,建议所有的用户升级。 Spring Boot 1.3的第一个里程碑版本将在几天后发布，包含许多