E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
Spark学习知识点
Spark
---RDD持久化
文章目录1.RDD持久化1.1RDDCache缓存1.2RDDCheckPoint检查点1.3缓存和检查点区别1.RDD持久化在
Spark
中,持久化是将RDD存储在内存中,以便在多次计算之间重复使用。
肥大毛
·
2024-01-13 07:40
scala
spark
大数据
spark
ajax
大数据
Spark
---RDD依赖关系
文章目录1.1RDD依赖关系1.2血缘关系1.3依赖关系分类1.3.1窄依赖1.3.2宽依赖1.4RDD阶段划分和任务划分1.4.1RDD阶段划分1.4.2RDD任务划分1.1RDD依赖关系在
Spark
肥大毛
·
2024-01-13 07:09
大数据
scala
spark
spark
ajax
javascript
Spark
-RDD详解
SPARK
–RDD1、RDD的介绍RDD弹性分布式数据集合是
Spark
中的一种数据类型,管理
spark
的内存数据[1,2,3,4]
spark
中还有dataframe,dataset类型拓展:开发中可以通过类的形式自定以数据类型同时还提供各种计算方法弹性可以对海量数据根据需求分成多份
中长跑路上crush
·
2024-01-13 07:09
Spark阶段
spark
大数据
分布式
Spark
Doris Connector 可以支持通过
Spark
读取 Doris 数据类型不兼容报错解决
1、版本介绍:doris版本:1.2.8
Spark
ConnectorforApacheDoris版本:
spark
-doris-connector-3.3_2.12-1.3.0.jar:1.3.0-SNAPSHOT
spark
Data_IT_Farmer
·
2024-01-13 07:57
Doris
实时数仓
spark-sql
spark
doris字段类型
Spark
十一:面试问题
完整内容见:https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ1.通常来讲,
Spark
与MapReduce相比,
Spark
运行效率更高,请说明效率更高来源于
eight_Jessen
·
2024-01-13 07:57
scala
spark
spark
面试
大数据
Spark
的内核调度
目录概述RDD的依赖DAG和StageDAG执行流程图形成和Stage划分Stage内部流程
Spark
Shuffle
Spark
中shuffle的发展历程优化前的Hashshuffle经过优化后的HashshuffleSortshuffleSortshuffle
Sisi525693
·
2024-01-13 07:56
spark
大数据
分布式
最新AI绘画Midjourney绘画提示词Prompt大全
一、Midjourney绘画工具
Spark
Ai创作系统是基于ChatGPT进行开发的Ai智能问答系统和Midjourney绘画系统,支持OpenAI-GPT全模型+国内AI全模型。
白云如幻
·
2024-01-13 07:55
人工智能
软件源码
AIGC
人工智能
chatgpt
midjourney
prompt
AI作画
Spark
十:故障排除
Spark
常见故障和排除方法学习资料:https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ一、避免OOM-outofmemory在Shuffle过程中,reduce
eight_Jessen
·
2024-01-13 07:22
spark
scala
spark
数据库
git 提交符号
改进代码结构/代码格式⚡️(闪电):zap:提升性能(赛马):racehorse:提升性能(火焰):fire:移除代码或文件(bug):bug:修复bug(急救车):ambulance:重要补丁✨(火花):
spark
les
思绪万千133
·
2024-01-13 07:12
前端
Spark
Streaming
Spark
Streaming随着大数据技术的不断发展,人们对于大数据的实时性处理要求也在不断提高,传统的MapReduce等批处理框架在某些特定领域,例如实时用户推荐、用户行为分析这些应用场景上逐渐不能满足人们对实时性的需求
奋斗的蛐蛐
·
2024-01-13 06:13
hive三种计算引擎
1、配置mapreduce计算引擎sethive.execution.engine=mr;2、配置
spark
计算引擎sethive.execution.engine=
spark
;3、配置tez计算引擎sethive.execution.engine
IT达人_j
·
2024-01-13 05:45
基于大数据与时间序列预测的的书籍数据分析(内含
spark
+hive+mysql+kettle+echart+tensorflow)
目录一,绪论1、项目背景:2、目标:3、用户群体:二.相关开发技术介绍(一)后端相关技术1.
spark
SQL简介2.kettle简介3.tensorflow简介(二)前端相关技术1.HTML简介2.echarts
左岸2420
·
2024-01-13 05:59
数据库
大数据
深度学习
大数据
spark
hive
mysql
tensorflow
echarts
Hadoop/
Spark
安装
单机安装Hadoop安装Javasudoapt-getinstalldefault-jdkjava-version2.设置Hadoop用户和组sudoaddgrouphadoopsudoadduser--ingrouphadoophduser3.安装并配置SSH$sudoapt-getinstallssh$suhduser$ssh-keygen-trsa-P""cat~/.ssh/id_rsa.p
周倜吉
·
2024-01-13 03:40
Flink
GoogleFileSystemBigTableMapReduceHDFSHBaseHadoopHadoop基于硬盘,可以处理海量数据;
Spark
基于内存,性能提高百倍,微批(500ms);Flink基于
三半俊秀
·
2024-01-13 01:53
产品调研——AI平台
腾讯云-TI平台TI平台将tensorflow、pytorch、
spark
环境等均集成到一个Notebook容器中,供用户进行使用。sh-4.2$condaenvlist#condae
chenxy02
·
2024-01-13 00:49
人工智能
人工智能
Spark
中Rdd算子和Action算子--学习笔记
RDD算子filter"""rdd.filter(f):根据f函数中的判断条件对rdd追踪的数据进行过滤保留条件为True对应的rdd数据"""frompy
spark
import
Spark
Contextsc
祈愿lucky
·
2024-01-12 23:24
大数据
spark
学习
笔记
如何进行大数据系统测试
Apache
Spark
架构:
Spark
提供了基于内存
Feng.Lee
·
2024-01-12 21:41
系统测试
项目管理
测试工具
大数据
出海企业如何 "借力" 实现快速成长 | Google Play 开发者中文播客节目
image本期简介"独行快,众行远",作为帮助初创企业获得快速成长的加速器,Lean
Spark
是连接不同伙伴资源的整合者,更是技术赋能的有力后盾、帮助创业团队出海开辟市场时避坑的引路人。
谷歌开发者
·
2024-01-12 21:20
师傅带练|在线实习项目,提供实习证明
机器学习)某平台广东省区采购数据分析(Excel供需分析)产品订单的数据分析与需求预测(Python营销分析)基于注意力机制的评论者满意度分析(TensorFlow与NLP)基于锅炉工况实现蒸汽产生量预测(
Spark
泰迪智能科技
·
2024-01-12 19:11
大数据
大数据在线实习项目
大数据
71、
Spark
SQL之JDBC数据源复杂综合案例实战
JDBC数据源实战
Spark
SQL支持使用JDBC从关系型数据库(比如MySQL)中读取数据。读取的数据,依然由DataFrame表示,可以很方便地使用
Spark
Core提供的各种算子进行处理。
ZFH__ZJ
·
2024-01-12 18:37
kafka下载安装部署
它的最大的特性就是可以实时的处理大量数据以满足各种需求场景:比如基于hadoop的批处理系统、低延迟的实时系统、storm/
spark
流式处理引擎。kafka的特性:1.高吞吐量、低延迟
倚-天-照-海
·
2024-01-12 15:25
kafka
kafka
分布式
在浏览器中使用js-
spark
-md5计算文件的MD5
在浏览器中使用js-
spark
-md5计算文件的MD5最近开发一个视频系统,用户需要把文件上传到服务器。服务器再上传到转码服务器,编码为m3u8格式。我觉得客户端可以直接上传到转码服务器。
JonathanYee
·
2024-01-12 14:29
AI系统ChatGPT网站系统源码AI绘画详细搭建部署教程,支持GPT语音对话+DALL-E3文生图+GPT-4多模态模型识图理解
一、前言
Spark
Ai创作系统是基于ChatGPT进行开发的Ai智能问答系统和Midjourney绘画系统,支持OpenAI-GPT全模型+国内AI全模型。
白云如幻
·
2024-01-12 12:39
人工智能
ChatGPT
软件源码
人工智能
chatgpt
语音识别
midjourney
AI作画
gpt
【
spark
】
spark
启动报错“
spark
RpcEnv already stopped“
原因:write时候没添加awaitTermination()造成rpcEnv提前结束了。fakeDf.writeStream.format("console").outputMode("append").trigger(Trigger.Continuous("3second")).start().awaitTermination()
lisacumt
·
2024-01-12 09:09
spark
【scala】编译build报错 “xxx is not an enclosing class“
private[sources]valcreationTimeMs:Long={valsession=
Spark
Session.getActiveSession.orElse(
Spark
Session.getDefaultSession
lisacumt
·
2024-01-12 09:07
scala
后端
Spark
避坑系列(三)(
Spark
Core-RDD 依赖关系&持久化&共享变量)
大家想了解更多大数据相关内容请移驾我的课堂:大数据相关课程剖析及实践企业级大数据数据架构规划设计大厂架构师知识梳理:剖析及实践数据建模Py
Spark
入坑系列第三篇,该篇章主要介绍
spark
的编程核心RDD
garagong
·
2024-01-12 09:13
大数据
spark
大数据
hadoop
分布式
数据处理
Spark
- 直接操作数据源 MySQL
答案就是使用
spark
的计算能力的,我们可以将mysql数据源接入到
spark
中。
kikiki2
·
2024-01-12 07:49
Spark
指令参数,RDD--学习笔记
1,
Spark
的指令参数参数对
spark
所有指令都有效
Spark
指令参数#表示引用运行的模式,要么是本地local要么是集群(Standalone、YARN、Mesos)了--masterMASTER_URL
祈愿lucky
·
2024-01-12 07:05
大数据
大数据
spark
python
Spark
基础
Spark
基础建库一定要指定字符集,错了好多次了pip卸载某个模块pipuninstallpandas--下载其它的改掉pandas即可pipinstall-ihttps://pypi.tuna.tsinghua.edu.cn
中长跑路上crush
·
2024-01-12 07:33
Spark阶段
spark
大数据
分布式
Spark
on Hive及
Spark
SQL的运行机制
Spark
onHive集成原理HiveServer2的主要作用:接收SQL语句,进行语法检查;解析SQL语句;优化;将SQL转变成MapReduce程序,提交到Yarn集群上运行
Spark
SQL与Hive
小希 fighting
·
2024-01-12 07:56
spark
hive
sql
Spark
SQL基础
Spark
SQL基本介绍什么是
Spark
SQL
Spark
SQL是
Spark
多种组件中其中一个,主要是用于处理大规模的结构化数据什么是结构化数据:一份数据,每一行都有固定的列,每一列的类型都是一致的我们将这样的数据称为结构化的数据例如
小希 fighting
·
2024-01-12 07:55
spark
sql
大数据
Spark
六:
Spark
底层执行原理
Spark
Context、DAG、TaskScheduler
Spark
底层执行原理学习
Spark
运行流程学习链接:https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ一、
Spark
运行流程流程:
Spark
Context
eight_Jessen
·
2024-01-12 07:19
scala
spark
spark
大数据
Spark
九:
Spark
调优之Shuffle调优
Spark
shuffle调优方法map端和reduce端缓存大小设置,reduce端重试次数和等待时间间隔,以及bypass设置学习资料:https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ
eight_Jessen
·
2024-01-12 07:19
scala
spark
spark
大数据
py
spark
使用udf 进行预测,发现只起了一个计算节点
Py
Spark
UDF只使用一个计算节点的问题原因分析默认的并行度设置Py
Spark
在执行UDF(用户定义函数)时,默认可能不会利用所有可用的计算节点。
samoyan
·
2024-01-12 07:18
服务器
python
机器学习
Spark
: 检查数据倾斜的方法以及解决方法总结
1.使用
Spark
UI
Spark
UI提供了一个可视化的方式来监控和调试
Spark
作业。你可以通过检查各个Stage的任务执行时间和数据大小来判断是否存在数据倾斜。
samoyan
·
2024-01-12 07:18
python
spark
大数据
分布式
Spark
SQL进阶
DataFrame详解清洗相关API去重API删除空缺值的API替换缺失值的APIfrompy
spark
import
Spark
Conf,
Spark
Contextimportosfrompy
spark
.sqlimport
Spark
Session
小希 fighting
·
2024-01-12 07:44
spark
sql
大数据
Zookeeper+Hadoop+
Spark
+Flink+Kafka+Hbase+Hive
说明Zookeeper+Hadoop+
Spark
+Flink+Kafka+Hbase+Hive完全分布式高可用集群搭建下载https://archive.apache.org/dist/我最终选择Zookeeper3.7.1
nsa65223
·
2024-01-12 06:08
hadoop
zookeeper
spark
Structured Streaming 官方例子
packageohmysummerimportjava.sql.Timestampimportorg.apache.
spark
.sql.
Spark
Sessionimportorg.apache.
spark
.sql.streaming
焉知非鱼
·
2024-01-12 02:08
Spark
完全分布式集群搭建
环境准备服务器集群我用的CentOS-6.6版本的4个虚拟机,主机名为hadoop01、hadoop02、hadoop03、hadoop04,另外我会使用hadoop用户搭建集群(生产环境中root用户不是可以任意使用的)
spark
小猪Harry
·
2024-01-12 00:41
py
spark
config设置、增加配置、限制_success文件生成;
spark
-submit 集群提交参数
1、py
spark
增加config设置javaheap错误增加内存
spark
=(
Spark
Session.builder.config("
spark
.hadoop.hive.exec.dynamic.partition
loong_XL
·
2024-01-11 18:00
机器学习
python
数据挖掘
linux
运维
服务器
《Py
Spark
大数据分析实战》-27.数据可视化图表Pyecharts介绍
对大数据技术栈Hadoop、Hive、
Spark
、Kafka等有深入研究,对Data
wux_labs
·
2024-01-11 16:21
PySpark大数据分析实战
数据分析
数据挖掘
大数据
数据科学
PySpark
AI绘画Midjourney绘画提示词Prompt大全,各种风格大全
一、Midjourney绘画工具
Spark
Ai创作系统是基于ChatGPT进行开发的Ai智能问答系统和Midjourney绘画系统,支持OpenAI-GPT全模型+国内AI全模型。
白云如幻
·
2024-01-11 10:48
人工智能
AIGC
教程
人工智能
chatgpt
语音识别
midjourney
AI作画
prompt
Spark
---RDD序列化
文章目录1什么是序列化2.RDD中的闭包检查3.Kryo序列化框架1什么是序列化序列化是指将对象的状态信息转换为可以存储或传输的形式的过程。在序列化期间,对象将其当前状态写入到临时或持久性存储区。以后,可以通过从存储区中读取或反序列化对象的状态,重新创建该对象。2.RDD中的闭包检查从计算的角度,算子以外的代码都是在Driver端执行,算子里面的代码都是在Executor端执行。那么在scala的
肥大毛
·
2024-01-11 07:33
scala
大数据
spark
spark
大数据
分布式
Spark
---行动算子RDD
1.1reduce1.2collect1.3first1.4count1.5take1.6takeOrdered1.7aggregate1.8fold1.9countByKey1.10countByValue1.11save相关算子1.12foreach1.行动算子
Spark
肥大毛
·
2024-01-11 07:03
大数据
spark
scala
spark
大数据
分布式
spark
相关
提示:以下是本篇文章正文内容,下面案例可供参考一、算子1.1sample在调用
spark
的samp
晴山ぺ
·
2024-01-11 07:29
java
spark
大数据
分布式
Spark
SQL基础
一.Pandas简介1、基本介绍Pandas是Python的一个第三方包,也是商业和工程领域最流行的结构化数据工具集,用于数据清洗、处理以及分析Pandas和
Spark
SQL中很多功能都类似,甚至使用方法都是相同的
MSJ3917
·
2024-01-11 07:29
spark
大数据
分布式
Spark
八:
Spark
性能优化
Spark
性能调优
Spark
调优的方法,包括RDD使用、文件读取,partition学习资料:https://mp.weixin.qq.com/s/caCk3mM5iXy0FaXCLkDwYQ一、
Spark
eight_Jessen
·
2024-01-11 07:29
scala
spark
spark
性能优化
spark
基础--学习笔记
1
spark
介绍1.1
spark
概念Apache
Spark
是专为大规模数据处理而设计的快速通用的分布式计算引擎,是开源的类HadoopMapReduce的通用分布式计算框架。
祈愿lucky
·
2024-01-11 07:58
大数据
spark
学习
笔记
Python 与 Py
Spark
数据分析实战指南:解锁数据洞见
Python和Py
Spark
作为强大的工具,提供了丰富的库和功能,使得数据分析变得更加高效和灵活。
海拥✘
·
2024-01-11 07:58
python
数据分析
信息可视化
hive sql 和
spark
sql的区别
HiveSQL和
Spark
SQL都是用于在大数据环境中处理结构化数据的工具,但它们有一些关键的区别:底层计算引擎:HiveSQL:Hive是建立在Hadoop生态系统之上的,使用MapReduce作为底层计算引擎
深度学习研究员
·
2024-01-11 07:08
hive
sql
spark
数据库
上一页
16
17
18
19
20
21
22
23
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他