大数据处理Spark 第31页

什么是Spark开发？

1、核心开发：离线批处理/延迟性的交互式数据处理2、SQL查询：底层都是RDD和计算操作3、实时计算：底层都是RDD和计算操作

一个人一匹马·2023-12-27 17:54

Flink实时电商数仓之Doris框架（七）

主要实现的功能有：实时看板面向企业内部分析师和管理者的报表面向用户或者客户的高并发报表分析即席查询统一数仓构建：替换了原来由Spark,Hive，Kudu,Hbase等旧框架数据湖联邦查询：通过外表的方式联邦分析位于

十七✧ᐦ̤·2023-12-27 16:47

Spark使用mariadb驱动读取AWS Aurora所有结果数据行都是列名

目录一、使用mariadb驱动读取AWSAurora二、df.show()的内容三、解决办法一、使用mariadb驱动读取AWSAuroravalspark=SparkSession.builder()

瞎胡侃·2023-12-27 15:28

java.lang.IllegalArgumentException: requirement failed: No output operations registered, so nothi...

SparkStreaming报错java.lang.IllegalArgumentException:requirementfailed:Nooutputoperationsregistered,sonothingtoexecute

扣篮的左手·2023-12-27 14:58

Spark与Hadoop的关系和区别

在大数据领域，Spark和Hadoop是两个备受欢迎的分布式数据处理框架，它们在处理大规模数据时都具有重要作用。本文将深入探讨Spark与Hadoop之间的关系和区别，以帮助大家的功能和用途。

晓之以理的喵~~·2023-12-27 12:13

Spark生产集群各种使用

1.环境配置1.1版本说明要求版本是否必须其他事项Hadoop3.3.4是hadoop3.3.0之后原生支持国内主要对象存储Hive3.1.3否实测没有Hive也可以使用sparksql，使用hive更好的管理

tuoluzhe8521·2023-12-27 10:15

Flink on K8S集群搭建及StreamPark平台安装

1.环境准备1.1介绍在使用Flink&Spark时发现从编程模型,启动配置到运维管理都有很多可以抽象共用的地方,目前streampark提供了一个flink一站式的流处理作业开发管理平台,从流处理作业开发到上线全生命周期都做了支持

tuoluzhe8521·2023-12-27 10:45

删除azkaban的执行历史

azkaban通常用在大数据任务调度场景，把任务提交之后，如果任务是spark，hive，hadoop，flink等任务的话，

飞有飞言·2023-12-27 07:09

Spark的生态系统概览：Spark SQL、Spark Streaming

ApacheSpark是一个强大的分布式计算框架，用于大规模数据处理。Spark的生态系统包括多个组件，其中两个重要的组件是SparkSQL和SparkStreaming。

晓之以理的喵~~·2023-12-27 06:35

[spark] 存储到hdfs时指定分区

在SparkSQL中指定多个分区字段进行数据存储：类似hive分区存储文章目录代码示例代码importorg.apache.spark.sql.SparkSessionvalspark=SparkSession.builder

言之。·2023-12-27 06:33

米哈游大数据云原生实践

以Spark为例，在云上运行Spark可以充分享有公共云的弹性资源、运维管控和存储服务等，并且业界也涌现了不少SparkonKubernetes的优秀实践。

阿里云云原生·2023-12-27 06:31

[spark] DataFrame 的 checkpoint

在ApacheSpark中，DataFrame的checkpoint方法用于强制执行一个物理计划并将结果缓存到分布式文件系统，以防止在计算过程中临时数据丢失。

言之。·2023-12-27 06:29

[spark] dataframe的cache方法

在ApacheSpark中，DataFrame的cache方法用于将DataFrame的计算结果缓存到内存中，以便在后续的操作中能够更快地访问这些数据。

言之。·2023-12-27 06:59

doris基本操作，03-导入数据-Broker Load

因为Doris表里的数据是有序的，所以Brokerload在导入数据的时是要利用doris集群资源对数据进行排序，相对于Sparkload来完成海量历史数据迁移，对Doris的集群资源占用要比较大，这种方式是在用户没有

车前猛跑·2023-12-27 05:46

orc小文件合并趣谈

这里增量数据采用SparkSQL以动态分区增量写入的方

艾伦_alan·2023-12-27 01:02

分布式系统面试连环炮

他们有共同的一个问题，就是都没怎么搞过分布式系统，现在互联网公司，一般都是做分布式的系统，大家都不是做底层的分布式系统、分布式存储系统hadoophdfs、分布式计算系统hadoopmapreduce/spark

Java机械师·2023-12-26 23:13

为什么Spark比MapReduce快？

MapReduce慢是因为模型很呆板,频繁的Io操作Spark快的话不仅是因为它是内存迭代计算吧？具体什么是内存迭代计算？

tracy_668·2023-12-26 23:00

NET中使用SQLSugar操作sqlserver数据库

主要特点：简单易用、功能齐全、高性能、轻量级、服务齐全、支持全自动分表组件，SAAS分库，大数据处理的ORM。二、迁移和建表安装包：SqlSugar

我是一只小小鱼~·2023-12-26 21:22

Java 已死、前端已凉

让我们来详细探讨一下这个话题：Java的地位：Java作为一种编程语言和平台，自1995年推出以来，一直在企业级应用、Android应用开发、大数据处理等领域占据重要地位。

终将老去的穷苦程序员·2023-12-26 17:18

【Spark-HDFS小文件合并】使用 Spark 实现 HDFS 小文件合并

【Spark-HDFS小文件合并】使用Spark实现HDFS小文件合并1）导入依赖2）代码实现2.1.HDFSUtils2.2.MergeFilesApplication需求描述：1、使用Spark做小文件合并压缩处理

bmyyyyyy·2023-12-26 17:15

datasophon组件安装时踩坑记录

identifiedby'xxxx';1.安装hdfs后有一个namenode进程未启动解决：在那个未启动的节点上执行hdfsnamenode-bootstrapStandby之后在web页面重启hdfs2.hiveonspark

州周·2023-12-26 17:56

主流级显卡的新选择，Sparkle（撼与科技）Intel Arc A750兽人体验分享

如果要在ArcA系列当中选一个性能不俗，能够满足生产力与游戏需求，价格方面又不会太高的显卡，那么我手上的这张Sparkle（撼与科技）的IntelArcA750兽人OC显卡就是一个不错的选择。

资讯看点·2023-12-26 14:48

六：Spark集群安装和部署

ubuntu16.04系统；(2)Master节点：内存分配2g；Slave1节点：内存分配512MB；Slave2节点：内存分配512MB；2.安装路径：(1)Hadoop2.6.5：/usr/local/；(2)Spark2.6.0

玉成226·2023-12-26 10:21

大数据Spark实战高手之路职业学习路线图

从零起步，分阶段无任何障碍逐步掌握大数据统一计算平台Spark，从Spark框架编写和开发语言Scala开始，到Spark企业级开发，再到Spark框架源码解析、Spark与Hadoop的融合、商业案例和企业面试

smileyboy2009·2023-12-26 10:56

hadoop3.0x 后要比spark快10倍！

smileyboy2009·2023-12-26 10:56

Java SparkSql 2.4.0 ArrayIndexOutOfBoundsException error

在spark2.4中报ArrayIndexOutOfBoundsException原因是Spark2.4.0中引用的paranamer版本是2.7导致问题。

smileyboy2009·2023-12-26 10:56

Iceberg1.4.2 java 表管理（DDL和DML）操作

既然是一种开放的表管理格式，那就不应该依赖hadoop，hive，spark，flink

smileyboy2009·2023-12-26 10:26

spark和flink对比

最近网上和各大公司在对比spark和flink,也有一部分人，演讲时不分析代码原理，不根据事实，直接吹嘘flink比spark好，flink能干掉spark的话，今天就跟大家从技术，应用和未来发展角度对两个产品进行对比

smileyboy2009·2023-12-26 10:25

iceberg1.4.2+spark3.4.2+minio

在idea里面编写iceberg的数据写入和创建表动作，虽然简单，但是官网没有给出完整例子，包括jar包的依赖。最大的坑就是版本不兼容。通过下面完整例子，编写Iceberg的完整代码。pom.xml文件需要引入的包org.scala-langscala-library${scala.version}junitjunit4.4testorg.specsspecs1.2.5testorg.apache

smileyboy2009·2023-12-26 10:25

idea开发delta.io数据湖

通过idea的spark操作delta.ideamaven的pom.xmlio.miniominio8.5.7org.apache.sparkspark-core_2.123.5.0o

smileyboy2009·2023-12-26 10:52

pycharm连接虚拟机

前言：我们默认用户已经在虚拟机上安装好了spark等相关集群和生态，是可以在虚拟机中运行相关的操作，比如mapper，reducer操作，rdd，dataframe等等杂七杂八的东西的(主要我也没太明白

俺会hello我的·2023-12-26 07:22

spark：RDD编程（Python版）

RDD运行原理RDD设计背景许多选代目前的MapReduce框架都是把中间结果写入到稳定存储(比如磁盘)中带来了大量的数据复制、磁盘IO和序列化开销RDD就是为了满足这种需求而出现的，它提供了一个抽象的数据架构，我们不必担心底层数据的分布式特性，只需将具体的应用逻辑表达为一系列转换处理，不同RDD之间的转换操作形成依赖关系，可以实现管道化，避免中间数据存储。RDD概念一个RDD就是一个分布式对象集

Mineba·2023-12-26 07:43

SpringBoot 2 集成Spark 3

在奋斗的大道·2023-12-26 06:12

iceberg1.4.2 +minio通过spark创建表，插入数据

下层支持hadoop，s3,对象存储，上层支持hive，spark，flink等应用。实现在中间把两部分隔离开来，实现一种对接和数据管理的标准。有这个标准，不管是谁建的表，都可以操作和访问。

smileyboy2009·2023-12-26 06:39

count distinct在spark中的运行机制

(*),SUM(items),COUNT(DISTINCTproduct),COUNT(DISTINCTcategory)FROMorders;假设源数据分布在两个1核的结点上，数据就8行Expandspark

SLUMBER_PARTY_·2023-12-26 06:08

【Linux系统基础】（6）在Linux上大数据NoSQL数据库HBase集群部署、分布式内存计算Spark环境及Flink环境部署详细教程

大数据NoSQL数据库HBase集群部署简介HBase是一种分布式、可扩展、支持海量数据存储的NoSQL数据库。和Redis一样，HBase是一款KeyValue型存储的数据库。不过和Redis设计方向不同Redis设计为少量数据，超快检索HBase设计为海量数据，快速检索HBase在大数据领域应用十分广泛，现在我们来在node1、node2、node3上部署HBase集群。安装HBase依赖Zo

老牛源码·2023-12-26 06:13

SparkCore

一、RDD详解1.1什么是RDDRDD（ResilientDistributedDataset）叫做弹性分布式数据集，是Spark中最基本的数据抽象，代表一个不可变、可分区、里面的元素可并行计算的集合。

weixin_50458070·2023-12-26 06:40

Hadoop——分布式计算

分布式计算常见的2种工作模式分散->汇总（MapReduce就是这种模式）将数据分片，多台服务器各自负责一部分数据处理然后将各自的结果，进行汇总处理最终得到想要的计算结果中心调度->步骤执行（大数据体系的Spark

weixin_50458070·2023-12-26 06:38

毕业设计选题 - 计算机毕业设计（论文）选题合集

目录前言选题背景意义毕业设计选题深度学习与神经网络计算机视觉与图像处理机器学习与数据挖掘数据分析和大数据处理选题迷茫选题的重要性更多选题指导最后前言大四是整个大学期间最忙碌的时光,一边要忙着准备考研,考公

weixin_55149953·2023-12-26 02:37

LabVIEW在齿轮箱故障诊断中的应用

利用LabVIEW强大数据处理和仿真能力，开发了一个先进的齿轮箱故障诊断系统。该系统主要采用小波包的独立分量分析（ICA）方法，有效地提取齿轮箱的故障特征频段。

LabVIEW开发·2023-12-26 00:36

spark运行时异常：org.apache.spark.SparkException: Could not find CoarseGrainedScheduler.

org.apache.spark.SparkException:CouldnotfindCoarseGrainedScheduler.atorg.apache.spark.rpc.netty.Dispatcher.postMessage

安安DE爸爸·2023-12-25 23:00

spark启动程序命令

/spark-submit--masterspark://hive01:7077--deploy-modeclient--classorg.apache.spark.examples.SparkPi..

安安DE爸爸·2023-12-25 23:00

黑猴子的家：Spark RDD 之 Hadoop 输入输出（数据读取与保存的主要方式之一）

1、hadoopRDD和newHadoopRDDSpark的整个生态系统与Hadoop是完全兼容的,所以对于Hadoop所支持的文件类型或者数据库类型,Spark也同样支持.另外,由于Hadoop的API

黑猴子的家·2023-12-25 23:05

计算机毕业设计之Spark+SpringBoot+Vue.js数字迎新系统小程序App 新生报到系统小程序App 新生缴费系统小程序App 大数据毕业设计

开发技术前端：vue.jsecharts后端：springboot+mybatis数据分析：Spark数据库：mysql配套资料配置教程、说明书、操作手册、源代码手册配套资料完整源码资料完整资料创新点Excel

计算机毕业设计大神·2023-12-25 21:35

Spark数据倾斜解决方案四：使用随机Key进行双重聚合

在使用reduceByKey，groupByKey算子时，都是针对PairRDD进行操作，那么，我们就可以PairRDD的每个元素的Key加上一个随机数前缀，这样的话，之前存在的大量相同而导致数据倾斜问题的Key就会被重新打散，从而避免数据倾斜。在进行第一轮聚合之前，先把原先的Key加上一个随机数前缀（10以内的就可以），然后对随机的Key进行聚合操作，这是可以看到，之前相同的Key都会被分到一个

hipeer·2023-12-25 20:55

【早安心语】

【2021-4-6】早安春夏秋冬Everyonehastimeswhentheyfeelthattheyarenotgoodenoughandwhentheyadmirethesparklesofothers

壹典心理咨询·2023-12-25 19:26

机器学习或深度学习的数据读取工作（大数据处理）

机器学习或深度学习的数据读取工作（大数据处理）主要是.split和re.findall和glob.glob运用。

xiaiming0·2023-12-25 18:19

Spark - 动态注册UDF

昨天有位大哥问小弟一个Spark问题，他们想在不停Spark程序的情况下动态更新UDF的逻辑，他一问我这个问题的时候，本猪心里一惊，Spark**还能这么玩?

kikiki2·2023-12-25 16:04

2023_Spark_实验三十三：配置Standalone模式Spark3.4.2集群

实验目的：掌握SparkStandalone部署模式实验方法：基于centos7部署Sparkstandalone模式集群实验步骤：一、下载spark软件下载的时候下载与自己idea里对应版本的sparkNews

pblh123·2023-12-25 15:42

推荐频道

大数据处理Spark

什么是Spark开发？

Flink实时电商数仓之Doris框架（七）

Spark使用mariadb驱动读取AWS Aurora所有结果数据行都是列名

java.lang.IllegalArgumentException: requirement failed: No output operations registered, so nothi...

Spark与Hadoop的关系和区别

Spark生产集群各种使用

Flink on K8S集群搭建及StreamPark平台安装

删除azkaban的执行历史

Spark的生态系统概览：Spark SQL、Spark Streaming

[spark] 存储到hdfs时指定分区

米哈游大数据云原生实践

[spark] DataFrame 的 checkpoint

[spark] dataframe的cache方法

doris基本操作，03-导入数据-Broker Load

orc小文件合并趣谈

分布式系统面试连环炮

为什么Spark比MapReduce快？

NET中使用SQLSugar操作sqlserver数据库

Java 已死、前端已凉

【Spark-HDFS小文件合并】使用 Spark 实现 HDFS 小文件合并

datasophon组件安装时踩坑记录

主流级显卡的新选择，Sparkle（撼与科技）Intel Arc A750兽人体验分享

六：Spark集群安装和部署

大数据Spark实战高手之路职业学习路线图

hadoop3.0x 后要比spark快10倍！

Java SparkSql 2.4.0 ArrayIndexOutOfBoundsException error

Iceberg1.4.2 java 表管理（DDL和DML）操作

spark和flink对比

iceberg1.4.2+spark3.4.2+minio

idea开发delta.io数据湖

pycharm连接虚拟机

spark：RDD编程（Python版）

SpringBoot 2 集成Spark 3

iceberg1.4.2 +minio通过spark创建表，插入数据

count distinct在spark中的运行机制

【Linux系统基础】（6）在Linux上大数据NoSQL数据库HBase集群部署、分布式内存计算Spark环境及Flink环境部署详细教程

SparkCore

Hadoop——分布式计算

最新ChatGPT商业运营网站程序源码，支持Midjourney绘画，GPT语音对话+DALL-E3文生图+文档对话总结

毕业设计选题 - 计算机毕业设计（论文）选题合集

LabVIEW在齿轮箱故障诊断中的应用

spark运行时异常：org.apache.spark.SparkException: Could not find CoarseGrainedScheduler.

spark启动程序命令

黑猴子的家：Spark RDD 之 Hadoop 输入输出（数据读取与保存的主要方式之一）

计算机毕业设计之Spark+SpringBoot+Vue.js数字迎新系统小程序App 新生报到系统小程序App 新生缴费系统小程序App 大数据毕业设计

Spark数据倾斜解决方案四：使用随机Key进行双重聚合

【早安心语】

机器学习或深度学习的数据读取工作（大数据处理）

Spark - 动态注册UDF

2023_Spark_实验三十三：配置Standalone模式Spark3.4.2集群