E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
Hadoop;Spark
spark
on Yarn 动态资源分配
配置文件:
spark
.default.parallelism=40#
spark
.executor.memory=1536m#
spark
.executor.memoryOverhead=512m#
spark
.driver.cores
金刚_30bf
·
2024-01-20 23:09
Spark
读取kafka(流式和批数据)
spark
读取kafka(批数据处理)#按照偏移量读取kafka数据frompy
spark
.sqlimport
Spark
Sessionss=
Spark
Session.builder.getOrCreate
中长跑路上crush
·
2024-01-20 23:55
Spark阶段
spark
kafka
大数据
Spark
流式读取文件数据
流式读取文件数据frompy
spark
.sqlimport
Spark
Sessionss=
Spark
Session.builder.getOrCreate()#todo注意1:流式读取目录下的文件--》一定一定要是目录
中长跑路上crush
·
2024-01-20 23:25
Spark阶段
spark
javascript
前端
Spark
Streaming通过receiver方式消费kafka数据时数据积压问题
1.问题在通过receiver方式接受kafka消息时,发现有大量消息在队列中阻塞最终导致
spark
任务执行失败。
sinat_36710456
·
2024-01-20 22:23
大数据
数据积压
Spark
Streaming
kafka
Spark
(一): 基本架构及原理
前言:目标:架构及生态:
Spark
与
hadoop
:运行流程及特点:常用术语:
Spark
运行模式:RDD运行流程:前言:Apache
Spark
是一个围绕速度、易用性和复杂分析构建的大数据处理框架,最初在2009
贝賏赑钡
·
2024-01-20 22:46
spark
架构
大数据
大数据导论(3)---大数据技术
文章目录1.大数据技术概述2.数据采集与预处理2.1数据采集2.2预处理3.数据存储和管理3.1分布式基础架构
Hadoop
3.2分布式文件系统HDFS3.3分布式数据库HBase3.4非关系型数据库NoSQL4
冒冒菜菜
·
2024-01-20 21:28
大数据导论
大数据导论
大数据技术
课程学习
Sqoop与HBase结合使用:实现强大的数据存储
Sqoop用于将数据从关系型数据库导入到
Hadoop
生态系统中,而HBase则用于实时、非关系型数据存储和查询。
晓之以理的喵~~
·
2024-01-20 19:57
sqoop
sqoop
hbase
hadoop
使用Sqoop从Oracle数据库导入数据
在大数据领域,将数据从关系型数据库(如Oracle)导入到
Hadoop
生态系统是一项常见的任务。Sqoop是一个强大的工具,可以帮助轻松完成这项任务。
晓之以理的喵~~
·
2024-01-20 19:27
sqoop
数据库
sqoop
oracle
Sqoop数据传输中的常见挑战及其解决方法
Sqoop是一个用于将数据传输到
Hadoop
生态系统的强大工具,但在实际使用中,可能会面临一些挑战。
晓之以理的喵~~
·
2024-01-20 19:26
sqoop
sqoop
eclipse
hadoop
创建虚拟机
弹出如下对话框,点击“下一步”3.继续点击“下一步”4.选择“稍后安装操作系统”,然后点击“下一步”5.在版本下拉框中选择“CentOS764位”,然后点击“下一步”6.给虚拟机起一个名字,本机叫做“
Hadoop
100
吃草料的羊
·
2024-01-20 19:56
hadoop
大数据
PDF如何裁剪页面,PDF裁剪页面的小技巧
使用工具:旋风PDF编辑器下载地址:http://www.679
spark
le.com/pdfeditor操作方法:1:先打开旋风PDF编辑器,点击打开文件按钮打开需要编辑的PDF文件。2:在菜单
六号_db7a
·
2024-01-20 18:09
11.Join的MapReduce实现
Join在MapReduce中的实现一、概述tips:Hive:MapReduce/
Spark
巧用explain查看语法树常见的面试题:描述如何使用MapReduce来实现join功能:考察点MapReduce
哈哈大圣
·
2024-01-20 18:40
大数据
Hadoop
入门——HDFS分布式文件系统基础
HDFS命令基础语法:【
hadoop
fs具体命令、hdfsdfs具体命令】两个是完全相同的。显示文件列表#hdfsdfs-lsURL创建目录#hdfsdfs-mkdir[-p]URL使用-p参数可以
nucty
·
2024-01-20 16:00
大数据
大数据
hadoop
hdfs
Zookeeper简介
一、Zookeeper简介ZooKeeper是一个分布式的、开放源码的分布式应用程序协调服务,它是Google的Chubby一个开源的实现,是
Hadoop
和Hbase的重要组件。
破茧......
·
2024-01-20 16:35
Zookeeper
zookeeper
分布式
云原生
大数据技术之
Hadoop
伪分布式安装步骤及结果(Ubuntu)
、下载安装虚拟机软件;下载Ubuntu镜像文件,安装Ubuntu虚拟机;2、在Ubuntu系统中创建用户、更新APT、安装SSH并配置SSH无密码登录、安装Java环境、配置PATH环境变量;3、下载
Hadoop
小嘤嘤怪学
·
2024-01-20 16:52
Hadoop
分布式
hadoop
大数据
Spark
在降本增效中的一些思考
背景在大环境不好的情况下,本司也开始了“降本增效”,本文探讨一下,在这种背景下
Spark
怎么做的降本增效。
鸿乃江边鸟
·
2024-01-20 14:25
spark
大数据
分布式
【大数据】了解 YARN 架构的基础知识
3.1.2ApplicationManager应用程序管理器3.2NodeManager节点管理器3.3ApplicationMaster应用程序主控3.4Container容器4.在YARN中提交应用程序5.
Hadoop
YARN
G皮T
·
2024-01-20 14:23
大数据
大数据
架构
yarn
资源管理
作业调度
hadoop
hdfs
Hive性能优化
sum,count,max,min等UDAF,不怕数据倾斜问题,
hadoop
在map端的汇总合并优化,使数据倾斜不成问题。count(distinct),在数据量大的情况下,效率较
La victoria
·
2024-01-20 13:23
大数据
hive Error while compiling statement: FAILED: ClassCastException org.apache.
hadoop
.hive.serde2.objec
Errorwhilecompilingstatement:FAILED:ClassCastExceptionorg.apache.
hadoop
.hive.serde2.objectinspector.primitive.WritableConstantStringObjectInspectorcannotbecasttoorg.apache.
hadoop
.hive.serde2
圆周率的后六位
·
2024-01-20 12:35
hive
hadoop
apache
hive 运行报错
Error:Errorwhilecompilingstatement:FAILED:UDFArgumentTypeExceptionExactlyoneargumentisexpected.近期用
spark
圆周率的后六位
·
2024-01-20 12:35
hadoop
spark
hadoop
运行任务出错,Hive Runtime Error while processing row
Error:java.lang.RuntimeException:org.apache.
hadoop
.hive.ql.metadata.HiveException:HiveRuntimeErrorwhileprocessingrow
圆周率的后六位
·
2024-01-20 12:05
hive
hadoop
big
data
Hadoop
配置文件加载
1.
hadoop
使用org.apache.
hadoop
.conf.Configuration类来加载配置文件2.一般我们在写客户端程序等需要连接
hadoop
集群时,需要自己准备好core-site.xml
sf_www
·
2024-01-20 11:52
hadoop
hadoop
大数据
hdfs
设计模式——管道模式(并发模式)
在分布式处理领域,由于管道模式是数据驱动,而目前流行的
Spark
分布式处理平台也是数据驱动的,两者非常合拍,于是在spar
码上得天下
·
2024-01-20 11:52
设计模式
spark
big
data
spark
的jdbc接口,类似于hiveserver2
https://
spark
.apache.org/docs/2.4.0/sql-distributed-sql-engine.html#running-the-thrift-jdbcodbc-server
Spark
SQL
zdkdchao
·
2024-01-20 10:53
spark
大数据
分布式
Hadoop
基础知识
Hadoop
基础知识1、
Hadoop
简介广义上来说,
Hadoop
通常是指一个更广泛的概念——
Hadoop
生态圈。
坐在风口上de猪
·
2024-01-20 10:10
hadoop
大数据
分布式
大数据开发之
Hadoop
(完整版+练习)
第1章:
Hadoop
概述1.1
Hadoop
是什么1、
Hadoop
是一个由Apache基金会所开发的分布式系统基础架构。2、主要解决,海量数据的存储和海量数据的分析计算问题。
Key-Key
·
2024-01-20 10:36
hadoop
hdfs
mapreduce
分布式
大数据
Kylin安装学习教程
Kylin安装学习教程Kylin是一个开源的分布式分析引擎,提供
Hadoop
/
Spark
之上的SQL接口及多维分析(OLAP)能力以支持大数据分析,最初由eBayInc.开发并贡献到开源社区。
Luo_Yang111
·
2024-01-20 09:28
kylin
spark
连接操作
将有键的数据与另一组有键的数据一起使用是对键值对数据执行的最有用的操作之一。连接数据可能是PairRDD最常用的操作之一。连接的方式多种多样:右外连接,左外连接、交叉连接以及内连接普通的join操作符表示是内连接。只有在两个键值对中都存在的键才叫输出。
追赶的程序猿
·
2024-01-20 09:45
Data Bricks Delta Lake 入门
DeltaLake是一个开源存储层,它将关系数据库语义添加到基于
Spark
的数据湖处理中。
AI普惠大师
·
2024-01-20 07:03
flask
python
后端
Spark
从入门到精通30:
Spark
SQL:核心源码深度剖析
在前面一节我们讲解了
Spark
SQL的工作原理,接下来在这一节,我们对
Spark
SQL工作原理进一步地深入和加强,这一节主要讲解
Spark
SQL核心源码导读和剖析首先,我们看SQLContext.scala
勇于自信
·
2024-01-20 07:57
黑猴子的家:Linux 文件有空格或特殊字符--转义
1、使用window斜杠""转义处理[victor@
hadoop
102~]$cdwindow\vnc/2、使用英文双引号处理[victor@
hadoop
102~]$cd"windowvnc"
黑猴子的家
·
2024-01-20 07:10
【
Spark
】
Spark
容错及 HA--Master 异常
一、Master配置recoveryModeMaster作为
Spark
Standalone模式中的核心,如果Master出现异常,则整个集群的运行情况和资源将无法进行管理,整个集群将处于“群龙无首”的状况
w1992wishes
·
2024-01-20 05:37
Windows平台安装配置
Hadoop
2.7.X
一,准备1.安装jdk1.82.下载
hadoop
2.7.7.tar.gz官网下载地址:https://archive.apache.org/dist/
hadoop
/common/
hadoop
-2.7.7
sun_十一
·
2024-01-20 04:23
余老师带你学习大数据-
Spark
快速大数据处理第十章Kafka第八节Kafka-Connect
kafkaKafkaConnect基本概念1、KafkaConnect是Kafka流式计算的一部分,左侧是数据源包括了数据库、
hadoop
、文本等等,右侧是数据结果包括了文本、
hadoop
、数据库,中间上层就是
weixin_45810046
·
2024-01-20 03:41
kafka
Kylin基础教程(一)
一、Kylin介绍1.1现状
Hadoop
于2006年初步实现,改变了企业级的大数据存储(基于HDFS)和批处理(主要基于MR)问题,10几年过去了,数据量随着互联网的发展井喷式增长,如何高速、低延迟的分析数据成为后续面临的挑战
GOD_WAR
·
2024-01-20 03:43
Kylin
技术博览
Kylin
kylin安装学习教程
ApacheKylin是一个开源的分布式分析引擎,提供
Hadoop
/
Spark
之上的SQL接口及多维分析(OLAP)能力以支持大数据分析,最初由eBayInc.开发并贡献到开源社区。
打工人何苦为难打工人
·
2024-01-20 03:07
kylin
Kylin安装学习教程
ApacheKylin是一个开源的分布式分析引擎,提供
Hadoop
/
Spark
上的SQL查询接口及多维分析(OLAP)能力以支持超大规模数据。
终将老去的穷苦程序员
·
2024-01-20 03:04
kylin
CVE-2023-46226 Apache iotdb远程代码执行漏洞
它具有体量轻、性能高、易使用的特点,完美对接
Hadoop
与
Spark
生态,适用于工业物联网应用中海量时间序列数据高速写入和复杂分析查询的需求。
棱镜七彩
·
2024-01-20 02:27
apache
iotdb
超详细版
Hadoop
的安装与使用(单机/伪分布式)
一、首先安装VMware虚拟机虚拟机安装包以及UbuntuISO映像下载:https://pan.baidu.com/s/19Ai5K-AA4NZHpfMcCs3D8w?pwd=9999下载完成后,进入VMware,点击右上角【文件】——【新建虚拟机向导】1.1选择典型1.2选择光盘映像映像文件选择上方刚刚下载的ubuntukylin-16.04-desktop-amd641.3命名根据自己需求来
比护隆佑
·
2024-01-19 23:49
分布式
hadoop
大数据
hadoop
dfs web页面访问增加鉴权
前言装好了
Hadoop
,通过浏览器访问,发现竟然不需要鉴权就能访问,且暴露了很多服务器层文件路径信息,基于多年积累的安全意识,必须得配置些鉴权信息,就有了该文,仅做学习记录,下次自己再装时能提高效率。
花菜回锅肉
·
2024-01-19 21:10
大数据
数据仓库
hadoop
前端
大数据
dfs
Hadoop
伪分布式坏境搭建
环境说明:VM上ubuntu16.04版本安装
hadoop
前的准备(1)ssh免密登录(2)配置好Java环境(1)(2)步骤的安装见网上博客安装
Hadoop
(1)下载
hadoop
到上一篇博客给出的网下载
zoux
·
2024-01-19 19:16
自然语言处理大数据:
spark
ML Word2Vec详解
简介Word2Vec是一种著名的词嵌入(WordEmbedding)方法,它可以计算每个单词在其给定语料库环境下的分布式词向量(DistributedRepresentation,亦直接被称为词向量)。词向量表示可以在一定程度上刻画每个单词的语义。如果词的语义相近,它们的词向量在向量空间中也相互接近,这使得词语的向量化建模更加精确,可以改善现有方法并提高鲁棒性。词向量已被证明在许多自然语言处理问题
nnnancyyy
·
2024-01-19 17:23
机器学习
python
人工智能
自然语言处理
深度学习
大数据学长面试之OPPO面试题
1)技术部分(1)
Spark
Streaming消费方式及区别,
Spark
读取HDFS的数据流程(2)Kafka高性能(3)Hive调优,数据倾斜(4)Zookeeper怎么避免脑裂,什么是脑裂。
大数据小理
·
2024-01-19 16:01
大数据1
大数据
面试
职场和发展
某汽车外包-大数据开发-面试
4.
spark
的提交参数有那些命令5.
spark
rdd,dataframe,dataSe解释一下。
劝学-大数据
·
2024-01-19 16:28
大数据面试题
大数据
spark
读取MySQL数据机器学习预测存入MySQL
importorg.apache.
spark
.
Spark
Confimportorg.apache.
spark
.ml.classification.
大数据驱动
·
2024-01-19 14:12
#
spark
mysql
机器学习
关于jenkins集成python的单元测试
最近在研究jenkins的集成,然后想把自己写的python工具也用jenkins集成一下废话少说,来看结构
spark
ing.py@author:lianying'''class
Spark
ing:@staticmethoddefget_num_of_zero
百晓生说测试
·
2024-01-19 13:21
软件测试
jenkins
python
单元测试
自动化测试
软件测试
功能测试
程序人生
html源码(html+css)
运维&从测试>UI设计>产品>我的课程表继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象全部课程精品推荐JQuery
Spark
MySQLJava
奇遇少年
·
2024-01-19 11:26
html
css
html5
css3
其他
大数据开发之
Hadoop
(优化&新特征)
第1章:HDFS-故障排除注意:采用三台服务器即可,恢复到Yarn开始的服务器快照。1.1集群安全模块1、安全模式:文件系统只接收读数据请求,而不接收删除、修改等变更请求2、进入安全模式场景1)NameNode在加载镜像文件和编辑日志期间处于安全模式2)NameNode再接收DataNode注册时,处于安全模式3)退出安全模式条件dfs.namenode.safemode.min.datanode
Key-Key
·
2024-01-19 10:50
大数据
hadoop
分布式
Flink1.17 基础知识
Flink1.17基础知识来源:B站尚硅谷目录Flink1.17基础知识Flink概述Flink是什么Flink特点Flinkvs
Spark
StreamingFlink的应用场景Flink分层APIFlink
魅美
·
2024-01-19 08:16
大数据基础
大数据
flink
caused by: java.lang.outofmemory_
hadoop
运行java.lang.OutOfMemoryError:java heap space错误。
99M的文件,运行时出现下面的问题:java.lang.RuntimeException:java.lang.reflect.InvocationTargetExceptionatorg.apache.
hadoop
.util.ReflectionUtils.newInstance
weixin_39662834
·
2024-01-19 08:16
caused
by:
上一页
25
26
27
28
29
30
31
32
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他