不想写bug第n天

Hadoop 安装 day01 + day02

目录

linux要求

伪分布式部署

部署hadoop

hdfs部署

部署yarn

完全分布式部署

1. 准备机器 3台（bigdata13、bigdata14、bigdata15） 4G 2cpu 40G

2. ssh 免密登录【三台机器都要做】

3.文件发送命令

4.jdk 部署【三台机器都要安装】

5.部署hadoop 先部署bigdata13+ 同步 bigdata13 : nn dn nm bigdata14 : dn rm nm bigdata15 : snn dn nm

每次启动补充
介绍
- 广义：以apache hadoop软件为主的生态圈：hive、flume、hbase、kafka、spark、flink
- 狭义：apache hadoop 软件
组成
- hdfs ：存储海量的数据(mysql不够放数据)
- mapreduce ：计算、数据分析
- yarn ：资源和作业的调度

大数据平台：存储是第一位，存储和计算是相辅相成的

官网
- hadoop.apache.org
  Apache Hadoop软件库是一个框架，允许使用简单的编程模型跨计算机集群对大型数据集进行分布式处理。它旨在从单个服务器扩展到数千台机器，每台机器都提供本地计算和存储。库本身不是依靠硬件来提供高可用性，而是旨在检测和处理应用程序层的故障，因此在计算机群集之上提供高可用性服务，每个计算机群集都可能容易出现故障。
- prohect.apache.org
版本
1.x 2.x 3.x
主流： 2.x 3.x
- 原生apache
  2.x 3.x
- cdh
  5.x 6.x
  6.3以后开始收费（平台求稳不是更新）
下载
- 官网
- 历史库：https://archive.a
部署
- hdfs 存储海量的数据
  - namenode ：负责指挥数据的存储（老大）
  - datanode ：主要负责数据的村（小弟）
  - seconderynmenode ：主要辅助namenode工作（老二）
- yarn 资源和作业的调度
  - resourcemanager ：负责指挥资源分配（老大）
  - ：负责资源分配给谁（小弟）
- 部署模式
  Apache Hadoop 3.3.4 – Hadoop: Setting up a Single Node Cluster. //官网部署步骤
  - 单点模式 => 伪分布式：
  - 完全分布式模式
  - 本地分布式

linux要求

创建hadoop用户，从root切换到hadoop

hadoop用户家目录

[hadoop@bigdata12 ~]$ mkdir app shell project software data log

配置jdk

解压
tar -zxvf ./jdk-8u45-linux-x64.gz -C ~/app/ 将压缩包解压到app文件夹中

软连接
切换版本配置先关参数比较方便

[hadoop@bigdata12 app]$ ln -s ./jdk1.8.0_45/ java

[hadoop@bigdata12 app]$ cd java
[hadoop@bigdata12 java]$ ll
总用量 25964
drwxr-xr-x. 2 hadoop hadoop     4096 4月  11 2015 bin       java相关的脚本
drwxr-xr-x. 3 hadoop hadoop      132 4月  11 2015 include   java运行过程中需要jar
drwxr-xr-x. 5 hadoop hadoop      185 4月  11 2015 jre      
drwxr-xr-x. 5 hadoop hadoop      245 4月  11 2015 lib       java运行过程中需要jar
-rw-r--r--. 1 hadoop hadoop 21099089 4月  11 2015 src.zip   java的源码包

配置环境变量： java里面的脚本在当llinux任何位置都可以使用

[hadoop@bigdata12 java]$ vim ~/.bashrc

export JAVA_HOME=/home/hadoop/app/java
export PATH=${JAVA_HOME}/bin:$PATH

[hadoop@bigdata12 ~]$ source ~/.bashrc

[hadoop@bigdata12 ~]$ java -version
//检查是否在linux任何位置都可以使用

伪分布式部署

部署hadoop

解压

[hadoop@bigdata12 app]$ tar -zxvf ./hadoop-3.3.4.tar.gz -C ~/app/

软连接

[hadoop@bigdata12 app]$ ln -s ./hadoop-3.3.4/ hadoop

目录介绍

[hadoop@bigdata12 hadoop]$ ll
总用量 96
drwxr-xr-x. 2 hadoop hadoop   203 7月  29 21:44 bin       hadoop相关脚本
drwxr-xr-x. 3 hadoop hadoop    20 7月  29 20:35 etc       hadoop配置文件
drwxr-xr-x. 2 hadoop hadoop   106 7月  29 21:44 include   
drwxr-xr-x. 3 hadoop hadoop    20 7月  29 21:44 lib
drwxr-xr-x. 3 hadoop hadoop  4096 7月  29 20:35 sbin      hadoop组件启动停止脚本
drwxr-xr-x. 4 hadoop hadoop    31 7月  29 22:21 share     hadoop相关案例

删除/app/hadoop/bin中的.cmd文件（可以不删）
[hadoop@bigdata12 bin]$ rm -rf ./*.cmd

配置环境变量

[hadoop@bigdata12 java]$ vim ~/.bashrc

#HADOOP_HOME
export HADOOP_HOME=/home/hadoop/app/hadoop
export PATH=${HADOOP_HOME}/bin:${HADOOP_HOME}/sbin:$PATH

[hadoop@bigdata12 ~]$ source ~/.bashrc

配置参数
etc/hadoop/hadoop-env.sh

[hadoop@bigdata12 hadoop]$ vim hadoop-env.sh

#插入
export JAVA_HOME=/home/hadoop/app/java

[hadoop@bigdata31 hadoop]$ pwd
/home/hadoop/app/hadoop/etc/hadoop

[hadoop@bigdata12 hadoop]$ hadoop version
Hadoop 3.3.4

hdfs部署

1.core-site.xml
fs.defaultFS 指定 namenode 所在机器

路径：app/hadoop/etc/hadoop/core-site.xml

[hadoop@bigdata12 hadoop]$ vim core-site.xml 


	fs.defaultFS
	hdfs://bigdata12:9000

2.hdfs-site.xml

[hadoop@bigdata12 hadoop]$ vim hdfs-site.xml


	dfs.replication
	1

3.ssh 远程登陆并执行的命令
(切换root用户设置hadoop用户的密码： password hadoop)
ssh [user@]hostname [command]
```
[hadoop@bigdata12 hadoop]$ ssh bigdata12
```
- 官方要求免密登录ssh to the localhost without a passphrase
  - 1.ssh-keygen -t rsa -P '' -f ~/.ssh/id_rsa
  - 2.cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
  - 3.chmod 0600 ~/.ssh/authorized_keys
4.Format the filesystem:【格式化文件系统】
```
[hadoop@bigdata12 ~]$ hdfs namenode -format
```
见到“successfully formatted.”则成功
5.启动hdfs
```
路径：/home/hadoop/app/hadoop/bin

[hadoop@bigdata12 bin]$ start-dfs.sh
```
- 检查hdfs进程
```
[hadoop@bigdata12 ~]$ ps -ef | grep hdfs

jps路径：app/java/bin/jps

[hadoop@bigdata12 ~]$ jps
10740 SecondaryNameNode
10539 DataNode
10381 NameNode
11023 Jps
```
  监控：[hadoop@bigdata12 logs]$ cd app/hadoop/logs
  [hadoop@bigdata12 logs]$ tail -200f hadoop-hadoop-namenode- bigdata12.log
  (没有error即可)

6.查看namenode web ui

http://bigdata12:9870/
window需要配置映射，才能打开

路径：C:\Windows\System32\drivers\etc\hosts

更改hosts文件
//添加
192.168.41.11 bigdata11
192.168.41.12 bigdata12
192.168.41.13 bigdata13
192.168.41.14 bigdata14
192.168.41.15 bigdata15
192.168.41.16 bigdata16
192.168.41.17 bigdata17

http://192.168.41.12:9870/ 在浏览器进行搜索

7.操作案例

hdfs dfs =》 hadoop fs

[hadoop@bigdata12 ~]$ hadoop fs -mkdir /data

插入数据

[hadoop@bigdata12 ~]$ vim wc.data
[hadoop@bigdata12 ~]$ cat wc.data
a	a	a	
b	b	b

[hadoop@bigdata12 ~]$ hadoop fs -put ./wc.data /data

运行计算程序：
hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.4.jar

路径：/home/hadoop/app/hadoop
[hadoop@bigdata12 hadoop]$ hadoop jar share/hadoop/
mapreduce/
hadoop-mapreduce-examples-3.3.4.jar

[hadoop@bigdata12 hadoop]$ hadoop jar share/hadoop
/mapreduce/hadoop-mapreduce-examples-3.3.4.jar \
wordcount /data/wc.data /out

运行结果再/out中
结果数据：part - r - 00000

下载结果数据：

[hadoop@bigdata12 ~]$ cd data
[hadoop@bigdata12 data]$ hadoop fs -get /out ./out
[hadoop@bigdata12 data]$ ll
总用量 0
drwxr-xr-x. 2 hadoop hadoop 42 11月 12 15:33 out
[hadoop@bigdata12 data]$ cd out
[hadoop@bigdata12 out]$ ll
总用量 4
-rw-r--r--. 1 hadoop hadoop 8 11月 12 15:33 part-r-00000
-rw-r--r--. 1 hadoop hadoop 0 11月 12 15:33 _SUCCESS
[hadoop@bigdata12 out]$ cat part-r-00000 
a	3
b	3

8.停止hdfs

stop-dfs.sh

[hadoop@bigdata12 out]$ jps
12961 Jps
10740 SecondaryNameNode
10539 DataNode
10381 NameNode
[hadoop@bigdata12 out]$ stop-dfs.sh
Stopping namenodes on [bigdata12]
Stopping datanodes
Stopping secondary namenodes [bigdata12]
[hadoop@bigdata12 out]$ jps
13496 Jps

部署yarn

mapred-site.xml

路径：/home/hadoop/app/hadoop/etc/hadoop


    
        mapreduce.framework.name
        yarn
    
    
        mapreduce.application.classpath
        $HADOOP_MAPRED_HOME/share/hadoop/mapreduce/*:$HADOOP_MAPRED_HOME/share/hadoop/mapreduce/lib/*

yarn-site.xml

路径：/home/hadoop/app/hadoop/etc/hadoop


    
        yarn.nodemanager.aux-services
        mapreduce_shuffle
    
    
        yarn.nodemanager.env-whitelist
        JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_HOME,PATH,LANG,TZ,HADOOP_MAPRED_HOME

启动yard

路径：/home/hadoop/app/hadoop/sbin

[hadoop@bigdata12 sbin]$ start-yarn.sh

打开RM
http://bigdata12:8088/
http://192.168.41.12:8088/

完全分布式部署

集群划分
- hdfs:
  - namenode nn
  - datanode dn
  - seconderynamenode snn
- yarn :
  - resourcemanager rm
  - nodemanager nm
    
    bigdata32 : nn dn nm
    bigdata33 : dn rm nm
    bigdata34 : snn dn nm
1. 准备机器 3台（bigdata13、bigdata14、bigdata15）
4G 2cpu 40G
- 克隆机器
  
  修改虚拟机hostname、ip映射、ip
```
[root@bigdata13 ~]# vim /etc/hostname
[root@bigdata14 ~]# vim /etc/hosts
[root@bigdata15 ~]# vim /etc/sysconfig/network-scripts/ifcfg-ens33
```
- 远程连接3台Xshell

2. ssh 免密登录【三台机器都要做】

[hadoop@bigdata13 ~]$ mkdir app software data shell project
[hadoop@bigdata13 ~]$ ssh-keygen -t rsa

拷贝公钥

[hadoop@bigdata13 ~]$ssh-copy-id bigdata13
[hadoop@bigdata13 ~]$ssh-copy-id bigdata14
[hadoop@bigdata13 ~]$ssh-copy-id bigdata15

3.文件发送命令

scp:
scp [[user@]host1:]file1 ... [[user@]host2:]file2

[hadoop@bigdata13 ~]$ scp bigdata13:~/1.log  bigdata14:~

rsync:
rsync [OPTION]... SRC [SRC]... [USER@]HOST:DEST

编写文件同步脚本
脚本名字xsync

#路径 /shell
#!/bin/bash
#三台机器 进行文件发放
if [ $# -lt 1 ];then
	echo "参数不足"
	echo "eg:$0 filename..."
fi
#遍历发送文件到 三台机器
for host in bigdata32 bigdata33 bigdata34
do
	echo "=============$host=================="
	#1.遍历发送文件的目录
	for file in $@
	do
	#2.判断文件是否存在
	if [ -e ${file} ];then
		pathdir=$(cd $(dirname ${file});pwd)
		filename=$(basename ${file})
		#3.同步文件
		ssh $host "mkdir -p $pathdir"
		rsync -av $pathdir/$filename $host:$pathdir
	else
		echo "${file} 不存在"
	fi
	done
done

赋予权限

[hadoop@bigdata13 shell]$ vim xsync
[hadoop@bigdata13 shell]$ chmod u+x xsync

给脚本配置环境变量

vim ~/.bashrc

//插入
export SHELL_HOME=/home/hadoop/shell
export PATH=${PATH}:${SHELL_HOME}

[hadoop@bigdata13 shell]$ source ~/.bashrc

4.jdk 部署【三台机器都要安装】

bigdata13 先安装jdk

解压、软连接

[hadoop@bigdata13 software]$ tar -zxvf jdk-8u45-linux-x64.gz -C ~/app/
[hadoop@bigdata13 app]$ ln -s jdk1.8.0_45/ java

配置环境变量

[hadoop@bigdata32 app]$ vim ~/.bashrc

#插入JAVA_HOME
export JAVA_HOME=/home/hadoop/app/java
export PATH=${PATH}:${JAVA_HOME}/bin

测试

[hadoop@bigdata13 app]$ which java
~/app/java/bin/java
[hadoop@bigdata13 app]$ java -version
java version "1.8.0_45"
Java(TM) SE Runtime Environment (build 1.8.0_45-b14)
Java HotSpot(TM) 64-Bit Server VM (build 25.45-b02, mixed mode

bigdata13 同步 jdk安装目录到其他机器 14 15

[hadoop@bigdata13 app]$ xsync java/
[hadoop@bigdata13 app]$ xsync jdk1.8.0_45
[hadoop@bigdata13 app]$ xsync ~/.bashrc
[hadoop@bigdata13 app]$ source  ~/.bashrc       //三台机器都做

5.部署hadoop
先部署bigdata13+ 同步
   bigdata13 : nn dn     nm
   bigdata14 :   dn rm nm
   bigdata15 :   snn dn nm

1. bigdata13先安装hadoop

解压、软连接

[hadoop@bigdata13 software]$ tar -zxvf hadoop-3.3.4.tar.gz -C ~/app/
[hadoop@bigdata13 app]$ ln -s hadoop-3.3.4/ hadoop

配置环境变量

[hadoop@bigdata13 app]$ vim ~/.bashrc

#HADOOP_HOME
export HADOOP_HOME=/home/hadoop/app/hadoop
export PATH=${PATH}:${HADOOP_HOME}/bin:${HADOOP_HOME}/sbin

[hadoop@bigdata13 app]$ source ~/.bashrc

//测试
[hadoop@bigdata13 app]$ which hadoop
~/app/hadoop/bin/hadoop

【三台机器一起做】

[hadoop@bigdata13 hadoop]$ pwd
/home/hadoop/data/hadoop
[hadoop@bigdata13 data]$ mkdir hadoop

2. 配置hdfs

·/home/hadoop/app/hadoop/etc/hadoop

core-site.xml:
	
			fs.defaultFS
			hdfs://bigdata32:9000
	
	
			hadoop.tmp.dir
			/home/hadoop/data/hadoop
	

hdfs-site.xml:
	
		dfs.replication
		3
	

	
		dfs.namenode.secondary.http-address
		bigdata34:9868
	
	
		dfs.namenode.secondary.https-address
		bigdata34:9869

同步bigdata32内容到bigdata33 bigdata34

[hadoop@bigdata13 app]$ xsync hadoop
[hadoop@bigdata13 app]$ xsync hadoop-3.3.4
[hadoop@bigdata13 app]$ xsync ~/.bashrc
三台机器都要做souce  ~/.bashrc

格式化：
【格式化操作部署时候做一次即可】namenode在哪就在哪台机器格式化
```
[hadoop@bigdata13 app]$ hdfs namenode -format 
```
启动hdfs：
namenode在哪就在哪启动
```
[hadoop@bigdata13 app]$ start-dfs.sh
```
访问namenode web ui:
http://bigdata32:9870/

3.配置yarn

·/home/hadoop/app/hadoop/etc/hadoop

 mapred-site.xml:

	mapreduce.framework.name
	yarn


	mapreduce.application.classpath
	$HADOOP_MAPRED_HOME/share/hadoop/mapreduce/*:$HADOOP_MAPRED_HOME/share/hadoop/mapreduce/lib/*

/home/hadoop/app/hadoop/etc/hadoop

yarn-site.xml:

	yarn.nodemanager.aux-services
	mapreduce_shuffle


	yarn.nodemanager.env-whitelist
	JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_HOME,PATH,LANG,TZ,HADOOP_MAPRED_HOME


	yarn.resourcemanager.hostname
	bigdata33

bigdata13机器配置文件分发到bigdata14 15:
```
[hadoop@bigdata13 app]$ xsync hadoop-3.3.4
```
启动yarn：
resourcemanager在哪就在哪启动
```
[hadoop@bigdata13 app]$ start-yarn.sh
```
访问RM web ui:
bigdata13:8088

每次启动补充

伪分布式：
       hdfs： start-dfs.sh
       yarn: start-yarn.sh
       启动hadoop :  start-all.sh
       关闭hadoop ：stop-all.sh
完全分布式：
start-all.sh =》 rm 所在节点

自己编写一个群起脚本：

[hadoop@bigdata13 ~]$ vim shell/hadoop-cluster
#!/bin/bash
if [ $# -lt 1 ];then
	echo "Usage:$0 start|stop"
	exit
fi

case $1 in
 "start")
	echo "========启动hadoop集群========"
	echo "========启动 hdfs========"
	ssh bigdata32 "/home/hadoop/app/hadoop/sbin/start-dfs.sh"
	echo "========启动 yarn========"
	ssh bigdata33 "/home/hadoop/app/hadoop/sbin/start-yarn.sh"
 ;;
  "stop")
	echo "========停止hadoop集群========"
	echo "========停止 yarn========"
	ssh bigdata33 "/home/hadoop/app/hadoop/sbin/stop-yarn.sh"
	echo "========停止 hdfs========"
	ssh bigdata32 "/home/hadoop/app/hadoop/sbin/stop-dfs.sh"
 ;;
   *)
	echo "Usage:$0 start|stop"
 ;;
esac

	3.编写查看 java 进程的脚本
[hadoop@bigdata32 ~]$ vim shell/jpsall

for host in bigdata32 bigdata33 bigdata34
do
	echo "==========$host========="
	ssh $host "/home/hadoop/app/java/bin/jps| grep -v Jps"
done

赋予权限

[hadoop@bigdata13 shell]$ vim hadoop-cluster
[hadoop@bigdata13 shell]$ chmod u+x hadoop-cluster

启动关闭命令

//启动
[hadoop@bigdata13 ~]$ hadoop-cluster start

//关闭
[hadoop@bigdata13 ~]$ hadoop-cluster stop

分布式启动后的jps

bigdata13

[hadoop@bigdata13 ~]$ jps
11120 ResourceManager
3847 NameNode
3991 DataNode
11255 NodeManager
11598 Jps

bigdata14

[hadoop@bigdata14 ~]$ jps
10001 Jps
9752 NodeManager
3613 DataNode
3743 SecondaryNameNode

bigdata15

[hadoop@bigdata15 ~]$ jps
3568 DataNode
8902 Jps
8665 NodeManager

数字孪生技术为UI前端注入新活力：实现产品设计的沉浸式体验 ui设计前端开发老司机 ui
hello宝子们...我们是艾斯视觉擅长ui设计、前端开发、数字孪生、大数据、三维建模、三维动画10年+经验!希望我的分享能帮助到您!如需帮助可以评论关注私信我们一起探讨!致敬感谢感恩!一、引言：从“平面交互”到“沉浸体验”的UI革命当用户在电商APP中翻看3D家具模型却无法感知其与自家客厅的匹配度，当设计师在2D屏幕上绘制汽车内饰却难以预判实际乘坐体验——传统UI设计的“平面化、静态化、割裂感”
提升企业级数据处理效率！TDengine 四个集群优化点详解 TDengine （老段） TDengine 运维大数据数据库物联网时序数据库服务器运维 tdengine
为了帮助企业更好地进行大数据处理，我们在此前TDengine3.x系列版本中进行了几项与集群相关的优化和新功能开发，以提升集群的稳定性和在异常情况下的恢复能力。这些优化包括clusterID隔离、leaderrebalance、raftlearner和restorednode。本文将对这几项重要优化进行详细阐述，以解答企业在此领域的疑问，并帮助大家更好地应对相关挑战。clusterID隔离问题fi
ETL可视化工具 DataX -- 简介( 一) dazhong2012 软件工具数据仓库 datax ETL
引言DataX系列文章：ETL可视化工具DataX–安装部署(二)ETL可视化工具DataX–DataX-Web安装(三)1.1DataX1.1.1DataX概览DataX是阿里云DataWorks数据集成的开源版本，在阿里巴巴集团内被广泛使用的离线数据同步工具/平台。DataX实现了包括MySQL、Oracle、OceanBase、SqlServer、Postgre、HDFS、Hive、ADS、
中国银联豪掷1亿采购海光C86架构服务器信创新态势海光芯片 C86 国产芯片海光信息
近日，中国银联国产服务器采购大单正式敲定，基于海光C86架构的服务器产品中标，项目金额超过1亿元。接下来，C86服务器将用于支撑中国银联的虚拟化、大数据、人工智能、研发测试等技术场景，进一步提升其业务处理能力、用户服务效率和信息安全水平。作为我国重要的银行卡组织和金融基础设施，中国银联在全球183个国家和地区设有银联受理网络，境内外成员机构超过2600家，是世界三大银行卡品牌之一。此次中国银联发力
全面探索Kafka：架构、应用与流处理
Kafka：企业级消息系统与流处理平台的深度解析ApacheKafka作为分布式流处理平台，广泛应用于大数据处理和实时分析领域。本文将基于其官方文档，详细探讨Kafka的核心功能、应用场景以及如何进行有效管理。背景简介Kafka作为高吞吐量的消息系统，支持企业级的发布-订阅模式。它能够处理大量实时数据，并支持高并发读写操作。本文将依据Kafka官方文档的内容，逐层深入，从入门到高级应用，帮助读者全
Flink时间窗口详解 bxlj_jcj Flink flink 大数据
一、引言在大数据流处理的领域中，Flink的时间窗口是一项极为关键的技术，想象一下，你要统计一个电商网站每小时的订单数量。由于订单数据是持续不断产生的，这就形成了一个无界数据流。如果没有时间窗口的概念，你就需要处理无穷无尽的数据，难以进行有效的统计分析。而时间窗口的作用，就是将这无界的数据流按照时间维度切割成一个个有限的“数据块”，方便我们对这些数据进行处理和分析。比如，我们可以定义一个1小时的时
探索实时流处理的未来：Kafka Streams 深度指南秋或依
探索实时流处理的未来：KafkaStreams深度指南项目介绍欢迎进入KafkaStreams：实时流处理的世界！这不仅仅是一本书，更是一个通往流处理领域深层奥秘的门户。由PrashantPandey编著，这本书以ApacheKafka2.1中的KafkaStreams库为核心，为读者铺就了一条从理解基础概念到熟练掌握KafkaStreams编程的路径。无论是软件工程师、数据架构师，还是对大数据处
Elasticsearch搜索引擎存储：从原理到实践的全景解析 Python×CATIA工业智造搜索引擎 elasticsearch 大数据
引言在大数据时代，数据规模呈指数级增长，传统数据库的模糊查询、实时分析能力逐渐成为瓶颈。Elasticsearch（简称ES）凭借其分布式架构、实时搜索和灵活的数据分析能力，成为企业级搜索与存储的核心引擎。截至2025年，ES在全球日志分析、电商搜索、实时监控等场景的市场占有率超过60%。本文将从存储架构、核心技术、应用场景及优化策略四个维度，深入解析Elasticsearch的设计哲学与实践价值
【Kafka专栏 13】Kafka的消息确认机制：不是所有的“收到”都叫“确认”！
作者名称：夏之以寒作者简介：专注于Java和大数据领域，致力于探索技术的边界，分享前沿的实践和洞见文章专栏：夏之以寒-kafka专栏专栏介绍：本专栏旨在以浅显易懂的方式介绍Kafka的基本概念、核心组件和使用场景，一步步构建起消息队列和流处理的知识体系，无论是对分布式系统感兴趣，还是准备在大数据领域迈出第一步，本专栏都提供所需的一切资源、指导，以及相关面试题，立刻免费订阅，开启Kafka学习之旅！
Hive简介
文章目录Hive简介Hive特点Hive和RDBMS的对比Hive的架构Hive的数据组织Hive数据类型Hive简介1、Hive由Facebook实现并开源2、是基于Hadoop的一个数据仓库工具3、可以将结构化的数据映射为一张数据库表4、并提供HQL(HiveSQL)查询功能5、底层数据是存储在HDFS上6、Hive的本质是将SQL语句转换为MapReduce任务运行7、使不熟悉MapRedu
C语言学生成绩管理系统<；自创>；(功能7有小错误,但可运行） han_xue_feng java
腾讯云加速企业和个人开发创新公开直播预告直播预告：07/18(周四)15:00-16:00随着人工智能与大模型的蓬勃发展，我们正步入一个由技微信实习第一天周五入职，早上早早来到了公司，发现好多人都没上班，到十点才陆陆续续有人来，办理完入职后，mentor中联夏令营遗憾没有入选不过hr的回复真的很好，辛苦啦#提前批简历挂麻了怎么办##机械制造投递记录#大数据开发的工作有点过于简单了吧sq大数据开发的
Python爬虫：从图片或扫描文档中提取文字数据的完整指南 Python爬虫项目 2025年爬虫实战项目 python 爬虫开发语言数据挖掘 c++
1.引言随着大数据技术的不断进步，图像数据逐渐成为了许多行业中重要的数据源之一。图像中不仅包含了丰富的视觉信息，还可能蕴含着大量的文字数据。对于科研、企业、政府等多个领域而言，如何从图片或扫描文档中提取出有价值的文字信息是一个亟待解决的问题。在这一过程中，OCR（OpticalCharacterRecognition，光学字符识别）技术成为了解决这一问题的重要工具。在本文中，我们将探讨如何使用Py
【C语言经典面试题】memcpy函数有没有更高效的拷贝实现方法？架构师李肯嵌入式物联网开发进阶 c语言面试性能优化
【C语言经典面试题】memcpy函数有没有更高效的拷贝实现方法？我相信大部分初中级C程序员在面试的过程中，可能都被问过关于memcpy函数的问题，甚至需要手撕memcpy。本文从另一个角度带你领悟一下memcpy的面试题，你可以看看是否能接得住？文章目录1写在前面2源码实现2.1函数申明2.2简单的功能实现2.3满足大数据量拷贝的功能实现3源码测试4小小总结5更多分享1写在前面假如你遇到下面的面试
python基于Hadoop的NBA球员大数据分析与可视化系统
目录技术栈介绍具体实现截图系统设计研究方法：设计步骤设计流程核心代码部分展示研究方法详细视频演示试验方案论文大纲源码获取/详细视频演示技术栈介绍Django-SpringBoot-php-Node.js-flask本课题的研究方法和研究步骤基本合理，难度适中，本选题是学生所学专业知识的延续，符合学生专业发展方向，对于提高学生的基本知识和技能以及钻研能力有益。该学生能够在预定时间内完成该课题的设计。
大数据技术之集群数据迁移
dfs.namenode.rpc-address.nameservice1.namenode30hadoop104:8020dfs.namenode.rpc-address.nameservice1.namenode37hadoop106:8020dfs.namenode.http-address.nameservice1.namenode30hadoop104:9870dfs.namenode.
HIVE（二） 2301_78012738 hive 数据仓库
目录访问HIVE的三种方式DDLDML数据操作向表中装载数据数据导出常用函数Like和RLike分组Join排序分区表和分桶表访问HIVE的三种方式启动Hive命令，CtrlC退出客户端，执行测试语句，与sql一致[wyc@hadoop102hive]$bin/hive经验小结：在hive中执行语句报错：ExecutionError,returncode2fromorg.apache.hadoop
如何通过YashanDB优化企业大数据处理流程数据库
在当今数据驱动的商业环境中，企业面临着巨大的数据处理挑战。性能瓶颈、数据一致性问题和可扩展性需求使得大数据处理成为一项复杂任务。作为一种新兴的数据库管理系统，YashanDB以其独特的架构设计和强大的数据处理能力，在解决这些挑战方面提供了有效的手段。本文旨在探讨如何利用YashanDB优化大数据处理流程，为企业提供高效、可靠的解决方案。YashanDB的体系架构与部署形态YashanDB支持多种部
Pandas 学习教程 _pass_ Data-Alaysis pandas 信息可视化
目录定义基本操作一维数组操作二维数组操作数据选择过滤数据处理数据清洗数据转换数据分析排序分组聚合数据透视表高级操作合并数据时间序列处理自定义函数调用数据可视化集成数据导出和导入大数据分块处理定义全称：'paneldata'and'pythondataanalysis'Analy:Series(一维数据)、DataFrame(二维数据)主要应用：数据清洗：处理缺失数据、重复数据等数据转换：改变数据的
如何通过YashanDB提升客户体验数据库
如何优化查询速度？这是许多企业在使用数据库技术时常常会遇到的问题。查询速度的快慢直接影响到用户的体验，尤其是在大数据量和高并发的使用场景中。顾客期望迅速获取信息，若响应时间过长，可能导致客户流失。因此，优化数据库的性能成为提升客户体验的关键举措之一。YashanDB作为一种高性能的数据库技术架构，提供了多种优化机制，以提升系统的查询速度和整体处理能力。多种部署架构YashanDB支持多种部署架构，
如何通过YashanDB数据库实现企业级数据分区管理？数据库
在当今大数据时代，企业面临着海量数据的管理和优化访问的问题。如何有效地组织和划分庞大的数据集，以提升查询性能和运维效率，成为数据库系统设计的核心挑战。数据分区技术作为解决大规模数据处理的关键手段，能够显著减少无关数据的访问，优化资源利用率。本文聚焦于YashanDB数据库，详细解析其数据分区管理的实现机制及应用，为企业级应用提供高效、灵活的数据分区解决方案。YashanDB中的数据分区基础Yash
国产开源高性能对象存储RustFS保姆级上手指南光爷不秃对象存储 rust 国产开源软件 rust 云计算开源软件 github 开源数据仓库 database
在云计算与大数据爆发的时代，企业和开发者对存储方案的要求愈发严苛——不仅要能扛住海量数据的读写压力，还得兼顾安全性、可扩展性和兼容性。今天给大家介绍一款基于Rust语言开发的开源分布式对象存储系统——RustFS，它不仅是MinIO的国产化优秀替代方案，更是AI、大数据和云原生场景的理想之选。本文将从基础介绍到实战操作，带大家快速上手这款"优雅的存储解决方案"。一、RustFS核心特性解析Rust
通过YashanDB提升大数据处理能力的指南数据库
数据的急剧增长给数据库技术领域带来了诸多挑战，包括性能瓶颈、数据一致性问题及处理效率低下等。为了应对这些挑战，企业需采取有效的技术手段来提升大数据处理能力。YashanDB作为一款高性能的数据库产品，通过其先进的体系架构、优化的数据存储形式以及强大的并发控制能力，有效地提升了大数据环境下的处理性能。本文旨在为技术人员和决策者提供深入的技术分析和可操作的建议，通过YashanDB的功能特性来实现大数
Java多线程实战指南：从基础到高并发的核心技术解析添砖Java中 java python 开发语言 spring boot spring cloud spring
一、为什么必须掌握多线程？在单核CPU时代，多线程主要用于提高程序响应速度；在如今的多核处理器时代，多线程已成为榨干硬件性能的必备技能。无论是高并发Web服务器、实时数据处理系统，还是游戏引擎，都离不开多线程技术的支撑。典型案例：电商秒杀系统：1秒内处理10万+请求大数据处理：并行计算TB级数据金融交易系统：毫秒级订单撮合二、线程创建的四大核心方式1.继承Thread类（不推荐）classMyTh
安全运维的 “五层防护”：构建全方位安全体系 KKKlucifer 安全运维
在数字化运维场景中，异构系统复杂、攻击手段隐蔽等挑战日益突出。保旺达基于“全域纳管-身份认证-行为监测-自动响应-审计溯源”的五层防护架构，融合AI、零信任等技术，构建全链路安全运维体系，以下从技术逻辑与实践落地展开解析：第一层：全域资产纳管——筑牢安全根基挑战云网基础设施包含分布式计算（Hadoop/Spark）、数据流处理（Storm/Flink）等异构组件，通信协议繁杂，传统方案难以全面纳管
3D 可视化技术开启污水治理全新发展阶段广州华锐视点 3d
3D可视化大屏展示技术在污水厂的应用，已然开启了污水处理的全新篇章。它不仅为污水厂解决了当下管理和展示的难题，更如同一座灯塔，照亮了未来污水处理领域的发展道路。随着科技的持续进步，3D可视化大屏展示技术必将迎来更加辉煌的发展。一方面，其与人工智能、大数据、物联网等前沿技术的融合将愈发紧密。借助人工智能算法，大屏系统将具备更强大的自主学习和分析能力，能够根据实时数据和历史经验，自动优化污水处理工艺参
UI前端大数据可视化实战策略：如何设计交互式数据探索界面？ UI前端开发工作室 ui 前端信息可视化
hello宝子们...我们是艾斯视觉擅长ui设计、前端开发、数字孪生、大数据、三维建模、三维动画10年+经验!希望我的分享能帮助到您!如需帮助可以评论关注私信我们一起探讨!致敬感谢感恩!一、引言：从“被动观看”到“主动探索”的可视化革命传统大数据可视化常陷入“图表堆砌”的困境：企业dashboard上布满折线图、饼图，却难以回答“销售额下降的核心区域是哪里”“用户流失与哪个行为强相关”等深度问题。
【HTML网页】智能健康监测——全方位健康管理专家（包含网页源代码）
智能健康监测分析系统智能健康监测分析系统是一种基于物联网、大数据、人工智能等技术的综合性健康管理解决方案。它具有以下六大核心功能：实时监测系统通过智能传感器和可穿戴设备，实时采集用户的生理数据，例如心率、血压、血氧饱和度、血糖水平和睡眠质量等，确保用户随时掌握自己的身体状况。健康数据分析利用人工智能和大数据分析技术，系统对采集到的数据进行处理和分析，提取有价值的健康信息，如心率变异性、呼吸频率等，
ftp文件服务器有连接数限制,查看ftp服务器连接数命令赵承铭 ftp文件服务器有连接数限制
查看ftp服务器连接数命令内容精选换一换本章节适用于MRS3.x之前版本。Loader支持以下多种连接，每种连接的配置介绍可根据本章节内容了解。obs-connectorgeneric-jdbc-connectorftp-connector或sftp-connectorhbase-connector、hdfs-connector或hive-connectorOBS连接是Loa“数据导入”章节适用于
Elasticsearch 高可用实战：架构设计与场景化解决方案辣呼呼的哈哈 Elasticsearch 入门到精通 elasticsearch wpf 大数据全文检索搜索引擎 restful java
Elasticsearch高可用实战：架构设计与场景化解决方案本文深入探讨Elasticsearch在高并发、大数据量场景下的高可用架构设计，结合电商搜索、日志分析等真实案例，提供可落地的技术方案与Java实现。一、高可用架构设计原则1.分布式架构核心要素客户端负载均衡层协调节点数据节点-分片1数据节点-分片2数据节点-分片3副本分片副本分片副本分片2.高可用黄金法则冗余设计：至少3节点集群+1副
oracle 数据库迁移expdp，impdp（数据泵导出导入）方法小张是铁粉 oracle 数据库
一.优缺点优点：1.高效性能：expdp，impdp使用并行技术，可以显著提高导出导入速度，尤其适用于大数据量的迁移。支持压缩和加密，减少导出文件的大小并提高安全性。2.灵活的对象选择：可以导出整个数据库、特定表空间、用户（Schema）或单个表。支持过滤条件，例如只导出特定表的数据或元数据。3.跨平台兼容性：支持跨平台迁移（例如从Linux到Windows），但需要注意字节序（endiannes
jQuery 跨域访问的三种方式 No 'Access-Control-Allow-Origin' header is present on the reque qiaolevip 每天进步一点点学习永无止境跨域众观千象
XMLHttpRequest cannot load http://v.xxx.com. No 'Access-Control-Allow-Origin' header is present on the requested resource. Origin 'http://localhost:63342' is therefore not allowed access. test.html:1
mysql 分区查询优化 annan211 java 分区优化 mysql
分区查询优化引入分区可以给查询带来一定的优势，但同时也会引入一些bug. 分区最大的优点就是优化器可以根据分区函数来过滤掉一些分区，通过分区过滤可以让查询扫描更少的数据。所以，对于访问分区表来说，很重要的一点是要在where 条件中带入分区，让优化器过滤掉无需访问的分区。可以通过查看explain执行计划，是否携带 partitions
MYSQL存储过程中使用游标 chicony Mysql存储过程
DELIMITER $$ DROP PROCEDURE IF EXISTS getUserInfo $$ CREATE PROCEDURE getUserInfo(in date_day datetime)-- -- 实例-- 存储过程名为：getUserInfo-- 参数为：date_day日期格式:2008-03-08-- BEGINdecla
mysql 和 sqlite 区别 Array_06 sqlite
转载： http://www.cnblogs.com/ygm900/p/3460663.html mysql 和 sqlite 区别 SQLITE是单机数据库。功能简约，小型化，追求最大磁盘效率 MYSQL是完善的服务器数据库。功能全面，综合化，追求最大并发效率 MYSQL、Sybase、Oracle等这些都是试用于服务器数据量大功能多需要安装，例如网站访问量比较大的。而sq
pinyin4j使用 oloz pinyin4j
首先需要pinyin4j的jar包支持；jar包已上传至附件内方法一:把汉字转换为拼音；例如：编程转换后则为biancheng /** * 将汉字转换为全拼 * @param src 你的需要转换的汉字 * @param isUPPERCASE 是否转换为大写的拼音； true:转换为大写；fal
微博发送私信随意而生微博
在前面文章中说了如和获取登陆时候所需要的cookie，现在只要拿到最后登陆所需要的cookie，然后抓包分析一下微博私信发送界面 http://weibo.com/message/history?uid=****&name=**** 可以发现其发送提交的Post请求和其中的数据，让后用程序模拟发送POST请求中的数据，带着cookie发送到私信的接入口，就可以实现发私信的功能了。
jsp 香水浓 jsp
JSP初始化容器载入JSP文件后，它会在为请求提供任何服务前调用jspInit()方法。如果您需要执行自定义的JSP初始化任务，复写jspInit()方法就行了 JSP执行这一阶段描述了JSP生命周期中一切与请求相关的交互行为，直到被销毁。当JSP网页完成初始化后
在 Windows 上安装 SVN Subversion 服务端 AdyZhang SVN
在 Windows 上安装 SVN Subversion 服务端2009-09-16高宏伟哈尔滨市道里区通达街291号最佳阅读效果请访问原地址：http://blog.donews.com/dukejoe/archive/2009/09/16/1560917.aspx 现在的Subversion已经足够稳定，而且已经进入了它的黄金时段。我们看到大量的项目都在使
android开发中如何使用 alertDialog从listView中删除数据？ aijuans android
我现在使用listView展示了很多的配置信息，我现在想在点击其中一条的时候填出 alertDialog,点击确认后就删除该条数据，（ ArrayAdapter ，ArrayList，listView 全部删除），我知道在下面的onItemLongClick 方法中参数 arg2 是选中的序号，但是我不知道如何继续处理下去 1 2 3
jdk-6u26-linux-x64.bin 安装 baalwolf linux
1.上传安装文件(jdk-6u26-linux-x64.bin) 2.修改权限 [root@localhost ~]# ls -l /usr/local/jdk-6u26-linux-x64.bin 3.执行安装文件 [root@localhost ~]# cd /usr/local [root@localhost local]# ./jdk-6u26-linux-x64.bin&nbs
MongoDB经典面试题集锦 BigBird2012 mongodb
1.什么是NoSQL数据库？NoSQL和RDBMS有什么区别？在哪些情况下使用和不使用NoSQL数据库？ NoSQL是非关系型数据库，NoSQL = Not Only SQL。关系型数据库采用的结构化的数据，NoSQL采用的是键值对的方式存储数据。在处理非结构化/半结构化的大数据时；在水平方向上进行扩展时；随时应对动态增加的数据项时可以优先考虑使用NoSQL数据库。在考虑数据库的成熟
JavaScript异步编程Promise模式的6个特性 bijian1013 JavaScript Promise
Promise是一个非常有价值的构造器，能够帮助你避免使用镶套匿名方法，而使用更具有可读性的方式组装异步代码。这里我们将介绍6个最简单的特性。在我们开始正式介绍之前，我们想看看Javascript Promise的样子： var p = new Promise(function(r
[Zookeeper学习笔记之八]Zookeeper源代码分析之Zookeeper.ZKWatchManager bit1129 zookeeper
ClientWatchManager接口 //接口的唯一方法materialize用于确定那些Watcher需要被通知 //确定Watcher需要三方面的因素1.事件状态 2.事件类型 3.znode的path public interface ClientWatchManager { /** * Return a set of watchers that should
【Scala十五】Scala核心九：隐式转换之二 bit1129 scala
隐式转换存在的必要性，在Java Swing中，按钮点击事件的处理，转换为Scala的的写法如下： val button = new JButton button.addActionListener( new ActionListener { def actionPerformed(event: ActionEvent) {
Android JSON数据的解析与封装小Demo ronin47
转自：http://www.open-open.com/lib/view/open1420529336406.html package com.example.jsondemo; import org.json.JSONArray; import org.json.JSONException; import org.json.JSONObject; impor
[设计]字体创意设计方法谈 brotherlamp UI ui自学 ui视频 ui教程 ui资料
从古至今，文字在我们的生活中是必不可少的事物，我们不能想象没有文字的世界将会是怎样。在平面设计中，UI设计师在文字上所花的心思和功夫最多，因为文字能直观地表达UI设计师所的意念。在文字上的创造设计，直接反映出平面作品的主题。如设计一幅戴尔笔记本电脑的广告海报，假设海报上没有出现“戴尔”两个文字，即使放上所有戴尔笔记本电脑的图片都不能让人们得知这些电脑是什么品牌。只要写上“戴尔笔
单调队列-用一个长度为k的窗在整数数列上移动，求窗里面所包含的数的最大值 bylijinnan java 算法面试题
import java.util.LinkedList; /* 单调队列滑动窗口单调队列是这样的一个队列：队列里面的元素是有序的，是递增或者递减题目：给定一个长度为N的整数数列a(i),i=0,1,...,N-1和窗长度k. 要求：f(i) = max{a(i-k+1),a(i-k+2),..., a(i)},i = 0,1,...,N-1 问题的另一种描述就
struts2处理一个form多个submit chiangfai struts2
web应用中，为完成不同工作，一个jsp的form标签可能有多个submit。如下代码： <s:form action="submit" method="post" namespace="/my"> <s:textfield name="msg" label="叙述：">
shell查找上个月，陷阱及野路子 chenchao051 shell
date -d "-1 month" +%F 以上这段代码，假如在2012/10/31执行，结果并不会出现你预计的9月份，而是会出现八月份，原因是10月份有31天，9月份30天，所以-1 month在10月份看来要减去31天，所以直接到了8月31日这天，这不靠谱。野路子解决：假设当天日期大于15号
mysql导出数据中文乱码问题 daizj mysql 中文乱码导数据
解决mysql导入导出数据乱码问题方法：１、进入mysql，通过如下命令查看数据库编码方式： mysql> show variables like 'character_set_%'; +--------------------------+----------------------------------------+ | Variable_name&nbs
SAE部署Smarty出现：Uncaught exception 'SmartyException' with message 'unable to write dcj3sjt126com PHP smarty sae
对于SAE出现的问题：Uncaught exception 'SmartyException' with message 'unable to write file...。官方给出了详细的FAQ：http://sae.sina.com.cn/?m=faqs&catId=11#show_213 解决方案为： 01 $path
《教父》系列台词 dcj3sjt126com
Your love is also your weak point. 你的所爱同时也是你的弱点。 If anything in this life is certain, if history has taught us anything, it is that you can kill anyone. 不顾家的人永远不可能成为一个真正的男人。 &
mongodb安装与使用 dyy_gusi mongo
一.MongoDB安装和启动,widndows和linux基本相同 1.下载数据库, linux:mongodb-linux-x86_64-ubuntu1404-3.0.3.tgz 2.解压文件,并且放置到合适的位置 tar -vxf mongodb-linux-x86_64-ubun
Git排除目录 geeksun git
在Git的版本控制中，可能有些文件是不需要加入控制的，那我们在提交代码时就需要忽略这些文件，下面讲讲应该怎么给Git配置一些忽略规则。有三种方法可以忽略掉这些文件，这三种方法都能达到目的，只不过适用情景不一样。 1. 针对单一工程排除文件这种方式会让这个工程的所有修改者在克隆代码的同时，也能克隆到过滤规则，而不用自己再写一份，这就能保证所有修改者应用的都是同一
Ubuntu 创建开机自启动脚本的方法 hongtoushizi ubuntu
转载自： http://rongjih.blog.163.com/blog/static/33574461201111504843245/ Ubuntu 创建开机自启动脚本的步骤如下： 1) 将你的启动脚本复制到 /etc/init.d目录下以下假设你的脚本文件名为 test。 2) 设置脚本文件的权限 $ sudo chmod 755
第八章流量复制/AB测试/协程 jinnianshilongnian nginx lua coroutine
流量复制在实际开发中经常涉及到项目的升级，而该升级不能简单的上线就完事了，需要验证该升级是否兼容老的上线，因此可能需要并行运行两个项目一段时间进行数据比对和校验，待没问题后再进行上线。这其实就需要进行流量复制，把流量复制到其他服务器上，一种方式是使用如tcpcopy引流；另外我们还可以使用nginx的HttpLuaModule模块中的ngx.location.capture_multi进行并发
电商系统商品表设计 lkl
DROP TABLE IF EXISTS `category`; -- 类目表 /*!40101 SET @saved_cs_client = @@character_set_client */; /*!40101 SET character_set_client = utf8 */; CREATE TABLE `category` ( `id` int(11) NOT NUL
修改phpMyAdmin导入SQL文件的大小限制 pda158 sql mysql
　用phpMyAdmin导入mysql数据库时，我的10M的数据库不能导入，提示mysql数据库最大只能导入2M。　　 phpMyAdmin数据库导入出错：　　You probably tried to upload too large file. Please refer to documentation for ways to workaround this limit.
Tomcat性能调优方案 Sobfist apache jvm tomcat 应用服务器
一、操作系统调优对于操作系统优化来说，是尽可能的增大可使用的内存容量、提高CPU的频率，保证文件系统的读写速率等。经过压力测试验证，在并发连接很多的情况下，CPU的处理能力越强，系统运行速度越快。。【适用场景】任何项目。二、Java虚拟机调优应该选择SUN的JVM，在满足项目需要的前提下，尽量选用版本较高的JVM，一般来说高版本产品在速度和效率上比低版本会有改进。 J
SQLServer学习笔记 vipbooks 数据结构 xml
1、create database school 创建数据库school 2、drop database school 删除数据库school 3、use school 连接到school数据库，使其成为当前数据库 4、create table class(classID int primary key identity not null) 创建一个名为class的表，其有一

Hadoop 安装 day01 + day02

linux要求

伪分布式部署

部署hadoop

hdfs部署

部署yarn

完全分布式部署

1. 准备机器 3台 （bigdata13、bigdata14、bigdata15） 4G 2cpu 40G

2. ssh 免密登录【三台机器都要做】

3.文件发送命令

4.jdk 部署【三台机器都要安装】

5.部署hadoop 先部署bigdata13+ 同步 bigdata13 : nn dn nm bigdata14 : dn rm nm bigdata15 : snn dn nm

​​​​​​​每次启动 补充

你可能感兴趣的:(hadoop,hadoop,大数据,hdfs)

1. 准备机器 3台（bigdata13、bigdata14、bigdata15）
4G 2cpu 40G

5.部署hadoop
先部署bigdata13+ 同步
bigdata13 : nn dn nm
bigdata14 : dn rm nm
bigdata15 : snn dn nm

每次启动补充