E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
数据开发--hadoop
Spark源码分析 – Shuffle
参考详细探究Spark的shuffle实现,写的很清楚,当前设计的来龙去脉
Hadoop
Hadoop
的思路是,在mapper端每次当memorybuffer中的数据快满的时候,先将memory中的数据,按
weixin_34292924
·
2025-02-21 15:06
大数据
【
Hadoop
】使用Docker容器搭建伪分布式集群
使用Docker容器搭建
Hadoop
伪分布式集群1、编写docker-compose.yaml文件配置集群version:"3"services:namenode:image:apache/
hadoop
慕青Voyager
·
2025-02-21 09:14
分布式
hadoop
docker
HDFS分布文件系统(
Hadoop
Distributed File System)
上创建文件夹3.上传本地文件到HDFS4.查看文件5.删除HDFS上的文件或者目录6.修改指定文件的权限信息(读、写、执行)一般语法:chmod[可选项]五、HDFS实战应用六、总结一.HDFS的本质
Hadoop
DistributedFileSystem
柿子小头
·
2025-02-21 08:38
hdfs
hadoop
大数据
org.apache.
hadoop
.hdfs.server.datanode.DataNode: Block pool ID needed, but service not yet registere
启动
hadoop
集群,发现datanode没有启动,查看日志报错,如图://日志文件2020-03-2416:40:55,608WARNorg.apache.
hadoop
.hdfs.server.common.Storage
@菜鸟进阶记@
·
2025-02-21 01:19
hadoop
hadoop
Hadoop
之HDFS的使用
HDFS是什么:HDFS是一个分布式的文件系统,是个网盘,HDFS是一种适合大文件存储的分布式文件系统HDFS的Shell操作1、查看hdfs根目录下的内容-lshdfsdfs-lshdfs://
hadoop
01
想要变瘦的小码头
·
2025-02-20 20:43
hadoop
hdfs
大数据
RHEL 安装
Hadoop
服务器
在这篇文章中,我们将探讨如何在RedHatEnterpriseLinux(RHEL)上安装和配置
Hadoop
服务器。
Hadoop
是一个开源的分布式数据处理框架,用于处理大规模数据集。
XhClojure
·
2025-02-20 13:41
hadoop
服务器
大数据
如何安装
Hadoop
Hadoop
入门(一)——CentOS7下载+VM上安装(手动分区)
Hadoop
入门(二)——VMware虚拟网络设置+Windows10的IP地址配置+CentOS静态IP设置
Hadoop
入门(三)—
薇晶晶
·
2025-02-20 13:06
hadoop
大数据
分布式
Hadoop
01-入门&集群环境搭建--非原创(test)
Hadoop
01-入门&集群环境搭建今日内容
Hadoop
的介绍集群环境搭建准备工作Linux命令和Shell脚本增强集群环境搭建来来来大数据概述大数据:就是对海量数据进行分析处理,得到一些有价值的信息,
xl.liu
·
2025-02-19 21:50
大数据
Test
Hadoop
管理工具dfsadmin和fsck的使用
Hadoop
提供了多个管理工具,其中dfsadmin和fsck是用于管理HDFS(
Hadoop
分布式文件系统)的重要工具。以下是它们的使用方法和常见命令。
脚本无敌
·
2025-02-19 16:46
Hadoop
hadoop
npm
大数据
(一)大数据---
Hadoop
整体介绍(架构层)----(组件(3)
复杂性:体现在数据的管理和操作上。如何抽取,转换,加载,连接,关联以把握数据内蕴的有用信息已经变得越来越有挑战性二、大数据技术有哪些(重点)===================================================================================基础的技术包含数据的采集、数据预处理、分布式存储、NoSQL数据库、数据仓库、机器学习、并行计
2401_84166965
·
2025-02-19 16:15
程序员
大数据
hadoop
架构
hive全量迁移脚本
:数据在同一库下,并且hive是内部表(前缀的hdfs地址是相同的)#1.读取一个文件,获取表名#echo"时间$dt_jian_2-------------------------">>/home/
hadoop
我要用代码向我喜欢的女孩表白
·
2025-02-19 15:29
数据迁移
bigdata-大数据专栏
hive
hadoop
数据仓库
笔记:DataSphere Studio安装部署流程
一、标准版部署标准版:有一定的安装难度,体现在
Hadoop
、Hive和Spark版本不同时,可能需要重新编译,可能会出现包冲突问题。适合于试用和生产使用,2~3小时即可部署起来。
右边com
·
2025-02-19 13:15
Java
大数据
hive-site.xml 配置总结
3.hive提交作业是在hive中还是
hadoop
中?4.一个查询的最后一个map/reduce任务输出是否被压缩的标志,通过哪个配置项?5.当用户
hxsln11
·
2025-02-19 12:07
hive
xml
hadoop
常见Linux命令
了解磁盘分区类命令第一节文件目录类命令(1)pwd打印当前目录的绝对路径(printworkingdirectory)基本语法pwd(功能描述:显示当前工作目录的绝对路径)案例实操显示当前工作目录的绝对路径[root@
hadoop
1
程序员 小柴
·
2025-02-18 22:02
后端工程化
linux
服务器
运维
【国产自研-神软大数据平台3.4.10】
产品介绍:北京神舟航天软件技术股份有限公司自研全栈式大数据平台神软大数据平台是数据全生命周期一站式数据治理开发平台,提供数据采集、数据集成、
数据开发
、数据治理、数据服务等功能,支持大数据存储、大数据计算分析引擎等数据底座
王旭亮_
·
2025-02-18 13:24
数据治理
大数据技术栈
大数据
数据治理
神软
产品
国产自研
Fink与
Hadoop
的简介以及联系
Fink和
Hadoop
是两个常用于大数据处理的开源工具,它们可以搭配使用以构建高效的数据处理系统。一、Fink和
Hadoop
的关系Fink:1、Fink是一个分布式流处理框架,专注于实时数据处理。
Bugkillers
·
2025-02-18 07:24
hadoop
大数据
分布式
Hbase深入浅出
在大数据生态圈中的位置HBase与传统关系数据库的区别HBase相关的模块以及HBase表格的特性HBase的使用建议Phoenix的使用总结HBase在大数据生态圈中的位置提到大数据的存储,大多数人首先联想到的是
Hadoop
天才之上
·
2025-02-18 03:13
数据存储
Hbase
大数据存储
HBase简介:高效分布式数据存储和处理
HBase简介:高效分布式数据存储和处理HBase是一个高效的、可扩展的分布式数据库,它是构建在Apache
Hadoop
之上的开源项目。
代码指四方
·
2025-02-18 03:07
分布式
hbase
数据库
大数据
在
Hadoop
集群中实现数据安全:技术与策略并行
在
Hadoop
集群中实现数据安全:技术与策略并行随着大数据技术的广泛应用,
Hadoop
已经成为处理和存储海量数据的首选平台。
Echo_Wish
·
2025-02-17 23:50
实战高阶大数据
hadoop
大数据
分布式
python编写mapreduce job教程
它可以运行在本地模式或
Hadoop
集群上。以下是一个简单的MapReduce示例,它计算文本文件中每个单词的出现次数。安装mrjob首先,你需要安装mrjob库。
weixin_49526058
·
2025-02-17 19:12
python
mapreduce
hadoop
给你的智能
数据开发
加满 buff
DataWorksCopilot,作为一站式智能
数据开发
治理平台DataWorks的智能助手,借助AI推理和自然语言处理能力,通过提供代码辅助和智能应用开发功能,为开发者和企业用户带来便捷高效的
数据开发
体验
·
2025-02-17 15:16
Knox原理与代码实例讲解
ApacheKnox是一个反向代理服务器,旨在为Apache
Hadoop
集群提供单一入口点,增强安全性和集中化管理。它位于
Hadoop
集群与客户端应用程序之间,充当网关和负载均衡器的角色。
AI天才研究院
·
2025-02-17 14:50
计算
DeepSeek
R1
&
大数据AI人工智能大模型
计算科学
神经计算
深度学习
神经网络
大数据
人工智能
大型语言模型
AI
AGI
LLM
Java
Python
架构设计
Agent
RPA
Apache ZooKeeper 分布式协调服务
ZooKeeper概述1.1定义与定位核心定位:分布式系统的协调服务,提供强一致性的配置管理、命名服务、分布式锁和集群管理能力核心模型:基于树形节点(ZNode)的键值存储,支持Watcher监听机制生态地位:
Hadoop
slovess
·
2025-02-17 04:33
分布式
apache
zookeeper
Hadoop
常用端口号
Hadoop
是一个由多个组件构成的分布式系统,每个组件都会使用一些特定的端口号来进行通信和交互。
海洋 之心
·
2025-02-17 02:51
Hadoop问题解决
hadoop
hbase
大数据
Hadoop
综合项目——二手房统计分析(可视化篇)
Hadoop
综合项目——二手房统计分析(可视化篇)文章目录
Hadoop
综合项目——二手房统计分析(可视化篇)0、写在前面1、数据可视化1.1二手房四大一线城市总价Top51.2统计各个楼龄段的二手房比例
WHYBIGDATA
·
2025-02-17 01:08
大数据项目
hadoop
大数据
spark任务运行
运行环境在这里插入代码片[root@
hadoop
000conf]#java-versionjavaversion"1.8.0_144"Java(TM)SERuntimeEnvironment(build1.8.0
冰火同学
·
2025-02-16 11:56
Spark
spark
大数据
分布式
Hadoop
的分布式缓存机制是如何实现的?如何在大规模集群中优化缓存性能?
Hadoop
的分布式缓存机制是一种用于在MapReduce任务中高效分发和访问文件的机制。通过分布式缓存,用户可以将小文件(如配置文件、字典文件等)分发到各个计算节点,从而提高任务的执行效率。
晚夜微雨问海棠呀
·
2025-02-16 11:53
分布式
hadoop
缓存
集群与分片:深入理解及应用实践
分片的定义分片的类型集群与分片的关系集群的应用场景负载均衡高可用性分片的应用场景大数据处理数据库分片集群与分片的架构设计系统架构设计数据存储设计案例分析
Hadoop
集群Elasticsearch分片性能优化策略集群性能优化分片性能优化挑战和解决方案总结参考资料引言在现代计算系统中
一休哥助手
·
2025-02-16 09:07
架构
系统架构
hive spark读取hive hbase外表报错分析和解决
“org.apache.
hadoop
.hbase.client.RetriesExhaustedException:Can’tgetthelocations”问题2:s
spring208208
·
2025-02-16 07:21
hive
hive
spark
hbase
Ubuntu下配置安装
Hadoop
2.2
---恢复内容开始---这两天玩
Hadoop
,之前在我的Mac上配置了好长时间都没成功的
Hadoop
环境,今天想在win7虚拟机下的Ubuntu12.0464位机下配置,然后再建一个组群看一看。
weixin_30501857
·
2025-02-15 15:55
大数据
java
运维
2014 6月,比较老了
AwesomeBigDataAcuratedlistofawesomebigdataframeworks,resourcesandotherawesomeness.Inspiredbyawesome-php,awesome-python,awesome-ruby,
hadoop
ecosystemtable
金金2019
·
2025-02-15 09:40
Hive服务启动 之 metastore配置 和 hiveserver2
首先贴直连配置代码:javax.jdo.option.ConnectionURLjdbc:mysql://
hadoop
102:3306/metastore?useSSL=fal
龍浮影
·
2025-02-15 08:33
hive
5. clickhouse 单节点多实例部署
环境说明:主机名:cmc01为例操作系统:centos7安装部署软件版本部署方式centos7zookeeperzookeeper-3.4.10伪分布式
hadoop
hadoop
-3.1.3伪分布式hivehive
Toroidals
·
2025-02-15 05:35
大数据组件安装部署教程
clickhouse
单节点
多实例
伪分布
安装部署
蓝易云 - HBase基础知识
HBase是一个分布式、可伸缩、列式存储的NoSQL数据库,它建立在
Hadoop
的HDFS之上,提供高可靠性、高性能的数据存储和访问。
蓝易云
·
2025-02-15 02:38
hbase
数据库
大数据
php
python
人工智能
Doris实战——工商信息查询平台的湖仓一体建设
AllinApacheDoris四、架构3.0:基于DorisMulti-Catalog的湖仓一体架构五、实践经验5.1引入Merge-on-Write,百亿级单表查询提速近三倍5.2部分列数据更新,
数据开发
效率提升
吵吵叭火
·
2025-02-14 14:06
大数据
大数据
数据仓库
腾讯云大数据套件TBDS与阿里云大数据能力产品对比
我们最开始使用的都是开源的产品,比如
hadoop
,HDSF,MAPRedu
奋力向前123
·
2025-02-14 03:29
数据库
java
人工智能
腾讯云
大数据
阿里云
DS缩写乱争:当小海豚撞上AI顶流,技术圈也逃不过“撞名”修罗场
这个2019年诞生的分布式任务调度系统,凭借可视化DAG界面、多租户支持和对
Hadoop
/Spark生态的深度集成,一度是大数据工程师的“梦中情工”。
·
2025-02-12 18:58
数据库
1.
hadoop
1.0.0 source code
https://archive.apache.org/dist/
hadoop
/core/
hadoop
-1.0.0/
小阿小火苗
·
2025-02-12 07:18
hadoop
hadoop
1.0 基本概念了解
hadoop
基本概念了解common:
hadoop
组件公共常用工具类Avro:Avro是用于数据序列化的系统。不同机器之间数据交流的保障。
fenggfa
·
2025-02-12 07:48
hadoop
hadoop
大数据
mapreduce
深入理解
Hadoop
1.0.0源码架构及组件实现
本文还有配套的精品资源,点击获取简介:
Hadoop
1.0.0作为大数据处理的开源框架,在业界有广泛应用。该版本包含核心分布式文件系统HDFS、MapReduce计算模型、Common工具库等关键组件。
隔壁王医生
·
2025-02-12 07:14
如何在Java中实现高效的分布式计算框架:从
Hadoop
到Spark
如何在Java中实现高效的分布式计算框架:从
Hadoop
到Spark大家好,我是微赚淘客系统3.0的小编,是个冬天不穿秋裤,天冷也要风度的程序猿!
省赚客app开发者
·
2025-02-12 07:12
java
hadoop
spark
分布式架构设计全解:以银行系统为例
本文还有配套的精品资源,点击获取简介:分布式架构设计对于银行处理实时交易和数据分析至关重要,本文深入分析了
Hadoop
、F5、Dubbo和SpringCloud等技术在银行项目中的实际应用。
聚合收藏
·
2025-02-12 04:54
大
数据开发
语言Scala入门
大
数据开发
语言Scala的详解一、引言在大数据和云计算时代,数据的处理和分析变得尤为重要。为了有效地处理和分析这些数据,需要一种强大的编程语言。
编程小郭
·
2025-02-11 22:04
scala
开发语言
HiveQL命令(三)- Hive函数
ApacheHive作为一种流行的数据仓库工具,提供了丰富的内置函数,帮助用户高效地处理和分析存储在
Hadoop
分布式文件系统(HDFS)中的数据。这些内置函数涵盖了数值计算、字符
BigDataMagician
·
2025-02-11 12:00
HiveQL命令
hive
hadoop
数据仓库
关于阿里云DataWorks的20道面试题
阿里云DataWorks是一个全链路的大
数据开发
治理平台,其主要功能包括数据集成、数据建模与开发、数据地图、数据质量和数据服务等。
编织幻境的妖
·
2025-02-11 01:31
阿里云
云计算
【hudi】基于hive2.1.1的编译hudi-1.0.0源码
hudi版本1.0.0需要使用较低版本的hive,编译hudi只需要修改下类即可:org.apache.hudi.
hadoop
.hive.HoodieCombineHiveInputFormat一、复制
lisacumt
·
2025-02-10 22:10
大数据
掌握大数据--Hive全面指南
1.Hive简介2.Hive部署方式3.Hive的架构图4.Hive初体验5.HiveSQL语法--DDL操作数据库1.Hive简介ApacheHive是建立在
Hadoop
之上的一个数据仓库工具,它提供了一种类似于
纪祥_ee1
·
2025-02-10 22:40
大数据
hive
hadoop
ZooKeeper 技术全解:概念、功能、文件系统与主从同步
ZooKeeper作为一个由Apache维护的开源分布式协调服务框架,广泛用于
Hadoop
生态系统和其他需要协调的分布式环境中。
专业WP网站开发-Joyous
·
2025-02-10 15:14
Java
分布式
zookeeper
分布式
云原生
hadoop
之MapReduce:片和块
假如我现在500M这样的数据,如何存储?500M=128M+128M+128M+116M分为四个块进行存储。计算的时候,是按照片儿计算的,而不是块儿。块是物理概念,一个块就是128M,妥妥的,毋庸置疑。片是逻辑概念,一个片大约等于一个块。假如我现在需要计算一个300M的文件,这个时候启动多少个MapTask任务?答案是有多少个片儿,就启动多少个任务。一个片儿约等于一个块,但是最大可以128M*1.
哒啵Q297
·
2025-02-10 12:14
hadoop
mapreduce
大数据
Hadoop
智能房屋推荐系统 爬虫1w+ 协同过滤余弦函数推荐 代码+视频教程+文档
Hadoop
智能房屋推荐系统爬虫1w+协同过滤余弦函数推荐带视频教程毕设设计课题设计【
Hadoop
项目】1.data.csv上传到
hadoop
集群环境2.data.csv数据清洗3.MapReducer
小盼江
·
2025-02-10 04:05
课题设计
Hadoop
课设
hadoop
爬虫
大数据
上一页
1
2
3
4
5
6
7
8
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他