E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
hdfs日常维护
任务15:使用Hive进行全国气象数据分析
进行数据分析重点:掌握Hive基本语句熟练使用Hive对天气数据进行分析内容:使用Hive创建外部表使用Hive对数据进行统计分析任务指导1.使用Hive创建基础表将China_stn_city.csv文件上传到
HDFS
Dija-bl
·
2024-01-19 08:44
hive
数据分析
hadoop
Jackson标签的高阶使用样例--多继承/子类、对象id、JsonIdentityInfo、JsonTypeInfo、JsonSubTypes
我们支持的资产类型不仅有关系数据库表,也支持Kafka主题,
hdfs
上的文件等。
OkGogooXSailboat
·
2024-01-19 06:19
java
json
Spark基础学习--基础介绍
首先我们回顾一下MapReduce的架构:MR基于
HDFS
实现大数据存储,基于Yarn做资源调度,且MR是基于进程处理数据的总结一下MR的缺点:1.MR是基于进程进行数据处理,进程相对
Yan_bigdata
·
2024-01-19 06:37
spark
学习
大数据
mapreduce
对比
入门案例
词频统计
FineBI实战项目一(25):实战项目一总结
没有集群,
hdfs
、hive、spark、kafka、flink等等都没有2解决方案mysql数据同步尽量和业务系统保持一致,以便后期出现问题排查。mysql同步到数仓,数仓
不死鸟.亚历山大.狼崽子
·
2024-01-19 02:39
FineBI
finebi
HBase第一章:集群搭建
ApacheHBase™是以
hdfs
为数据存储的,一种分布式、可扩展的NoSQL数据库。一、环境准备再开始之前,我们要先安装
超哥--
·
2024-01-19 00:57
HBase
hbase
hadoop
大数据
hbase学习笔记-hbase集群安装部署
tar-zxvfhbase-2.0.0-bin.tar.gz-C/opt/bigdata5、重命名解压目录mvhbase-2.0.0hbase6、修改配置文件1、需要把hadoop中的配置core-site.xml、
hdfs
陈同学:
·
2024-01-19 00:22
hbase
hbase
zookeeper
HBase学习三:集群部署
>启动HBase—>关闭HBase—>关闭Hadoop1环境准备1.0环境前期准备参考基础环境配置1.1机器准备hostnameipvm1ip1vm2ip2vm3ip31.2机器分配
hdfs
Studying!!!
·
2024-01-19 00:50
中间件
HBase
HDFS
使用QJM(Quorum Journal Manager)实现的高可用性以及备份机制
目录前言1.NameNode的启动和对edits和QJM相关配置文件的解析2.使用FSImage和FSEditLog类对image和editlog文件进行读写和管理3.EditsDoubleBuffer双缓存,让flush和write同时进行,互不干扰4.AsyncLoggerSetl类代理对QJM集群的读写6.QuorumCall封装了对基于paxos算法的QJM集群的异步操作7.StandBy
麦兜和小可的舅舅
·
2024-01-18 22:56
hadoop
namenode
QJM
HA
HDFS
HADOOP
Hadoop的心脏:中央异步调度器AsyncDispatcher代码和设计解析
以Yarn、
HDFS
和MapReduce为主要组成的Hadoop,涉及到大量复杂的、交互的事件处理、状态转换,同时,这些事件调度和状态转换又对实时性和效率提出了极高的要求。
麦兜和小可的舅舅
·
2024-01-18 22:56
yarn
hadoop
hadoop
yarn
dispatcher
异步调度器
Hadoop RPC Server基于Reactor模式和Java NIO 的架构和原理
尤其是作为Master/Slave结构的Hadoop设计,比如
HDFS
NameNode或者YarnResourceMan
麦兜和小可的舅舅
·
2024-01-18 22:26
hadoop
yarn
open-source
hadoop
reactor
yarn
nio
RPC
HDFS
Web
HDFS
读写文件分析及HTTP Chunk Transfer Encoding相关问题探究
文章目录前言需要回答的首要问题DataNode端基于Netty的Web
HDFS
Service的实现基于重定向的文件写入流程写入一个大文件时Web
HDFS
和HadoopNative的块分布差异基于重定向的数据读取流程尝试读取一个小文件尝试读取一个大文件读写过程中的
麦兜和小可的舅舅
·
2024-01-18 22:52
大数据架构
实现
hadoop
open-source
hdfs
http
hadoop
【数据采集与预处理】数据传输工具Sqoop
Sqoop原理三、Sqoop安装配置(一)下载Sqoop安装包并解压(二)修改配置文件(三)拷贝JDBC驱动(四)验证Sqoop(五)测试Sqoop是否能够成功连接数据库四、导入数据(一)RDBMS到
HDFS
Francek Chen
·
2024-01-18 22:19
大数据技术基础
sqoop
hadoop
大数据
数据库
Hive入门
Hive把表和字段转换成
HDFS
中的文件夹和文件,并将这些元数据保持在关系型数据库中,如derby或mysql。Hive查询的数据存储在
HDFS
上,运行在Yarn上。Hive适合做离线数
kongxx
·
2024-01-18 17:11
2021-06-06物业经营管理
选择一项:A.构建信息基础B.确定管理标准C.
日常维护
和维修D.资产
likegule
·
2024-01-18 13:02
大数据小白初探Hbase从零到入门
目录1.前言2.初识Hbase2.1有了
HDFS
为什么还需要HBase呢?2.2HBase主要做什么的?2.3HBase架构特点?2.4HBase的适用场景?2.5HBase的数据模型和物理储存格式?
北京-景枫
·
2024-01-18 09:10
hbase
大数据
列簇式存储
HBASE学习一:原理架构详解
HBase的存储是基于
HDFS
的,
HDFS
有着高容错性的特点,被设计用来部署在低廉的硬件上,基于Hadoop意味着HBase与生俱来的超强的扩展性和吞吐量。HBase采用的时ke
Studying!!!
·
2024-01-18 08:34
中间件
hbase
学习
架构
大数据分析之ClickHouse技术选型
文章目录1.快速入门2.企业应用与实践3.踩坑4.优化最近公司的战略上需要更多的数据支撑,目前在构思打造一个用户数据分析平台,由于团队人力有限,没有
Hdfs
生态的技术人员。
凡尘技术
·
2024-01-18 08:12
数据库
数据分析
clickhouse
数据挖掘
Spark—shell,Hbase—shell
Spark:SPARKSQLresults=spark.sql("SELECT*FROMpeople")//读取JSON文件valuserScoreDF=spark.read.json("
hdfs
://
꧁༺朝花夕逝༻꧂
·
2024-01-18 07:21
spark
大数据
分布式
基于华为MRS实时消费Kafka通过Flink落盘至
HDFS
的Hive外部表的调度方案
文章目录1Kafka1.1Kerberos安全模式的认证与环境准备1.2创建一个测试主题1.3消费主题的接收测试2Flink1.1Kerberos安全模式的认证与环境准备1.2Flink任务的开发3
HDFS
大数据程序终结者
·
2024-01-18 06:25
Hadoop生态
Flink
华为
kafka
flink
fusioninsight
hdfs
hive
sqoop事务如何实现
场景1:如Sqoop在导出
hdfs
数据到Mysql时,某个字段过长导致任务失败,该错误记录之前的数据正常导入,之后的数据无法导入。如何保证错误发生后数据回滚?
qzWsong
·
2024-01-18 06:50
sqoop
sqoop
hadoop
hive
产业园区物业管理服务浅议
以下是对产业园区物业管理服务的一些浅议:设施维护与管理:产业园区物业管理服务涉及对建筑物、设备和基础设施的
日常维护
和管理。
湖南群狼市场调研服务有限公司
·
2024-01-18 06:18
满意度调查
消费者研究
问卷调查
市场调研
阿里云大数据ACA及ACP复习题(21~40)
(D)A:
HDFS
B:DFSC:RDDD:MapReduce解析:MAPREDUCE(分布式运算编程框架)22.以下选项中不属于MaxCompute特点的是(D)A:支持多种多种经典的分布式计算模型B:
周周的奇妙编程
·
2024-01-18 03:08
阿里云
大数据
云计算
HDFS
系统架构
HDFS
ArchitectureIntroductionHadoopDistributedFileSystem(
HDFS
)是设计可以运行于普通商业硬件上的分布式文件系统。
偷油考拉
·
2024-01-18 03:52
DatistEQ之CRON编辑器
Cron表达式,适用于周期性执行、
日常维护
、在某时刻需要完成的单次任务等场景。
了无_数据科学
·
2024-01-18 02:12
spark-udf函数
frompyspark.sqlimportSparkSessionfrompyspark.sql.typesimport*创建连接ss=SparkSession.builder.getOrCreate()读取
hdfs
中长跑路上crush
·
2024-01-17 23:34
Spark阶段
spark
大数据
分布式
常用图算法实现--Spark
1211523242526273134251151261676871788189810914911011013111211112113141412151网页:123456789101112131415将这两个文件放入
HDFS
zealscott
·
2024-01-17 19:45
本地运行Flink退出时java.nio.file.DirectoryNotEmptyException、目录没有正常删除解决方法
1.背景在开发大数据平台XSailboat中的查看Flink任务的状态数据工具时,用StateProcessAPI解析保存点数据,将其从
HDFS
上读取出来再将其解析过后下沉到
HDFS
以CSV格式保存,然后由其它接口提供对这个文件的分页加载功能
OkGogooXSailboat
·
2024-01-17 18:05
大数据平台开发问题解决笔记
flink
java
nio
HDFS
简介与常用API
HDFS
简介
HDFS
是一个文件系统(HadoopDocumentFileSystem),通过目录树来定位文件。其次,它是分布式的。
HDFS
适用于:一次写入,多次读出的场景。
正橙橙橙橙
·
2024-01-17 16:45
Hadoop入门
hadoop
hdfs
java
大数据开发之Hadoop(
HDFS
)
第1章:
HDFS
概述1.1
HDFS
产出背景及定义1、
HDFS
产生背景随着数据量越来越大,在一个操作系统存不下所有的数据,那么就分配到更多的操作系统管理的磁盘中,但是不方便管理和维护,迫切需要一种系统来管理多台机器上的文件
Key-Key
·
2024-01-17 10:22
大数据
hadoop
hdfs
Hadoop——
HDFS
、MapReduce、Yarn期末复习版(搭配尚硅谷视频速通)
一、
HDFS
1.
HDFS
概述1.1
HDFS
定义
HDFS
(HadoopDistributedFileSystem),它是一个文件系统,用于存储文件,通过目录树来定位文件;其次,它是分布式的,由很多服务器联合起来实现其功能
革斤要加油
·
2024-01-17 06:10
专业课
hadoop
hdfs
mapreduce
yarn
HDFS
机架感知配置导致数据不均衡
HDFS
机架感知介绍
HDFS
机架感知是一种逻辑上的网络架构设计,它主要是用来区分不同节点的网络拓扑情况下,保证数据是能够高性能写入和查询的一种机制,毕竟跨网络的数据读写是有网络带宽消耗的,当没有配置机架信息时
KubeData
·
2024-01-17 02:41
hdfs
hadoop
大数据
【状态管理|概述】Flink的状态管理:为什么需要state、怎么保存state、对于state过大怎么处理
文章目录一.state相关1.state种类2.State的存在形式3.state在哪产生4.state内存设置二.statebackend1.三种状态后端2.如何在
hdfs
中存储?
roman_日积跬步-终至千里
·
2024-01-17 01:13
#
flink
实战
flink
java
大数据
flume
为什么选用FlumePython爬虫数据Java后台日志数据服务器本地磁盘文件夹
HDFS
FlumeFlume最主要的作用就是,实时读取服务器本地磁盘的数据,将数据写入到
HDFS
。
添柴少年yyds
·
2024-01-17 00:55
flume
大数据
Hadoop详解
核心内容包含
hdfs
和mapreduce。hadoop2.0以后引入yarn.
hdfs
是提供数据存储的,mapreduce是方便数据计算的。
武昌库里写JAVA
·
2024-01-16 21:20
高手面试
hadoop
大数据
分布式
hive:创建自定义python UDF
addfile
hdfs
://home/user/py3_script/;setspark.yarn.dist.archives=
hdfs
://home/user/py3.tar.gz;setspark.shuffle.
hdfs
.enabled
青盏
·
2024-01-16 16:35
other
hive
hadoop
数据仓库
企业级大数据安全架构(四)Ranger安装
作者:楼高Ranger是支持审计功能的,安装时可以选择审计数据保存的位置,默认支持Solr和
HDFS
。
云掣YUNCHE
·
2024-01-16 16:50
企业级大数据安全架构
大数据
安全架构
安全
Nacos-config自动配置源码解析
前言鉴于目前大多数项目大都部署在微服务环境下,而不少小伙伴
日常维护
的项目里都或多或少的用到了自动配置,有的公司可能是zookeeper,有的公司可能用consul,nacos或者apollo等等。
虎虎她爹
·
2024-01-16 13:56
只知道
HDFS
和GFS?你其实并不懂分布式文件系统
一、概述分布式文件系统是分布式领域的一个基础应用,其中最著名的毫无疑问是
HDFS
/GFS。如今该领域已经趋向于成熟,但了解它的设计要点和思想,对我们将来面临类似场景/问题时,具有借鉴意义。
王知无(import_bigdata)
·
2024-01-16 13:14
分布式
大数据
hadoop
数据库
java
分布式文件系统应该从哪些方面考虑
分布式文件系统是分布式领域的一个基础应用,其中最著名的毫无疑问是
HDFS
/GFS。如今该领域已经趋向于成熟,但了解它的设计要点和思想,对我们将来面临类似场景/问题时,具有借鉴意义。
吃胖点儿
·
2024-01-16 13:44
分布式系统
真正的实力派——威廉古堡
业务专员负责业绩产出,店长负责店面的客户接待和服务以及门店的
日常维护
管理,保洁则负责店面的卫生方面,分工明确。
兔子a
·
2024-01-16 11:15
DataX&数据同步(全量)
1.DataX简介1.1DataX概述 DataX是阿里巴巴开源的一个异构数据源离线同步工具,致力于实现包括关系型数据库(MySQL、Oracle等)、
HDFS
、Hive、ODPS、HBase、FTP
韩顺平的小迷弟
·
2024-01-16 11:29
大数据
数据同步
Flume用法总结
可以实时读取服务器的日志写入
HDFS
。
天选之子123
·
2024-01-16 10:53
大数据
flume
大数据
HIVE总结
HIVE总结一、创建数据库CREATEDATABASEIFNOTEXISTSTEST;数据库在
HDFS
的默认位置为:/user/hive/warehouse/test.dbCREATEDATABASEIFNOTEXISTSTESTLOCATION
天选之子123
·
2024-01-16 10:52
大数据
hive
hadoop
数据仓库
【
HDFS
】
HDFS
-16348:将慢节点标记为badnode进而从pipeline中踢除并进行pipeline恢复
本文的主要内容是介绍这个PR(PullRequest):
HDFS
-16348.Markslownodeasbadnodetorecoverpipeline(#3704)通过本文可以获得如下知识:datanode
小北觅
·
2024-01-16 07:09
Hive 数据迁移
/hadoopdistcp
hdfs
://${NameNode_IP}:${NameNode_RPC_IP}/${源文件}
hdfs
://${NameNode_I
bigdata-余建新
·
2024-01-16 07:14
Hive
hive
hadoop
数据仓库
Hive知识点
基本概念:由Facebook开源,构建在Hadoop之上的数据仓库,数据计算是mapreduce,数据存储是
HDFS
目的是构建面向分析的集成的数据环境,为企业提供决策支持(面向分析的存储系统)主要特征:
꧁༺朝花夕逝༻꧂
·
2024-01-16 07:25
hive
hadoop
数据仓库
HDFS
HA 集群搭建 - 基于Quorum Journal Manager(hadoop2.7.1)
0、前置概念0.1checkpoint检查点在Hadoop分布式文件系统(
HDFS
)中,检查点(Checkpointing)是一个关键的过程,它涉及到将文件系统的命名空间状态持久化到磁盘。
Studying!!!
·
2024-01-16 06:36
中间件
hdfs
hadoop
大数据
mac上搭建 hadoop 伪集群
它主要由以下几个部分组成:
HDFS
(HadoopDistributedFileSystem):
HDFS
是Hadoop的分布式文件系统,具有较高的读写速度,很好的容错性和可伸缩性,为海量的数据提供了分布式存储
寂夜了无痕
·
2024-01-16 06:30
大数据
macos
hadoop
大数据
HDFS
和MapReduce综合实训
文章目录第1关:WordCount词频统计第2关:
HDFS
文件读写第3关:倒排索引第4关:网页排序——PageRank算法第1关:WordCount词频统计测试说明以下是测试样例:测试输入样例数据集:文本文档
柔雾
·
2024-01-16 06:24
hdfs
mapreduce
hadoop
Hive基础知识(十六):Hive-SQL分区表使用与优化
1.分区表分区表实际上就是对应一个
HDFS
文件系统上的独立的文件夹,该文件夹下是该分区所有的数据文件。Hive中的分区就是分目录,把一个大的数据集根据业务需要分割成小的数据集。
依晴无旧
·
2024-01-16 05:11
大数据
hive
hadoop
数据仓库
上一页
6
7
8
9
10
11
12
13
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他