spark生态圈第23页

5.MapReduce之Combiner-预聚合

目录概述本地预计算Combiner意义实践前提代码日志观察结束概述在MR、Spark、Flink中，常用的减少网络传输的手段。

流月up·2024-01-10 12:49

4.MapReduce 序列化

序列化序列化对象-->字节序例：存储到磁盘或者网络传输MR、Spark、Flink：分布式的执行框架必然会涉及到网络传输ja

流月up·2024-01-10 12:46

spark sql写入mysql报错：Caused by: java.lang.IllegalArgumentException: Can‘t get JDBC type for void

一、问题描述sparksql写入mysql报错：Causedby:java.lang.IllegalArgumentException:Can’tgetJDBCtypeforvoidCausedby:java.lang.IllegalArgumentException

RayBreslin·2024-01-10 09:31

Failed to execute goal org.scala-tools:maven-scala-plugin:2.15.2:compile (scala-compile-first

一、问题描述spark项目编译，报错Failedtoexecutegoalorg.scala-tools:maven-scala-plugin:2.15.2:compile(scala-compile-first

RayBreslin·2024-01-10 09:00

Spark 初级编程实践

什么是Spark？Spark是一个快速、通用、可扩展的大数据处理引擎，最初由加州大学伯克利分校的AMPLab开发。它提供了高级API，用于在大规模数据集上执行并行处理。

cwn_·2024-01-10 08:28

深入理解 Flink（一）Flink 架构设计原理

大数据分布式计算引擎设计实现剖析MapReduceMapReduce执行引擎解析MapReduce的组件设计实现图Spark执行引擎解析Spark相比于RM的真正优势的地方在哪里：（Simple、Fast

我很ruo·2024-01-10 08:57

Windows中处理PySpark报错：SparkException: Python worker failed to connect back

Windows中处理PySpark报错：SparkException:Pythonworkerfailedtoconnectback这个问题可能是发送在windows10以上的版本，使用datafram

就是喜欢看不惯你又干不掉你的样子·2024-01-10 08:55

Apache Doris (六十二）： Spark Doris Connector - (2)-使用

个人主页：IT贫道-CSDN博客私聊博主：私聊博主加WX好友，获取更多资料哦~博主个人B栈地址：豹哥教你学编程的个人空间-豹哥教你学编程个人主页-哔哩哔哩视频目录1.将编译jar包加入本地Maven仓库

IT贫道·2024-01-10 08:54

2024 1.9 Spark_SQL , 数据清洗API , 写出操作

目录一.DataFrame详解1.数据清洗API1.去重:2.去除空:3.填充替换:2.SparkSQL的shuffle分区设置3.SparkSQL数据写出操作3.1写出到文件系统3.2写出到数据库一.

白白的wj·2024-01-10 08:53

2024.1.9 Spark SQL day06 homework

目录一.SparkSQL中数据清洗的API有哪些，各自作用是什么？二.设置SparkSQL的shuffle分区数的方式有哪几种三.数据写出到数据库需要注意什么?

白白的wj·2024-01-10 08:53

Spark SQL基础知识

MSJ3917·2024-01-10 08:51

记一次spark-sql数据倾斜解决方案

spark-sql数据倾斜解决方案背景今天在做一张埋点事实表，需要关联几张维表，补充一些维度属性。

王糍粑的小夕·2024-01-10 08:20

Spark避坑系列二（Spark Core-RDD编程）

garagong·2024-01-10 08:19

【spark】基于Spark的电影推荐系统+[详细代码及配置]

BIG*BOSS·2024-01-10 06:25

2024最新AI系统ChatGPT商业运营网站源码，支持Midjourney绘画AI绘画，GPT语音对话+ChatFile文档对话总结+DALL-E3文生图

一、前言SparkAi创作系统是基于ChatGPT进行开发的Ai智能问答系统和Midjourney绘画系统，支持OpenAI-GPT全模型+国内AI全模型。

白云如幻·2024-01-10 06:12

Java大数据学习~Hadoop初识三Yarn模式

Hbase做自己的，Spark也是做自己的,等等。这样的话就会造成资源的浪费，不能充分的把资源给利用

胖琪的升级之路·2024-01-10 05:55

Flink任务实战优化

一、Flink任务优化分析1.1参考Spark的优化方式对于任何的技术发展，后来的的技术架构都可以参考之前优秀竞品的设计思想或缺陷，然后

i7杨·2024-01-10 01:06

大数据OLAP引擎发展原因及特性分析

在大数据高速发展时期，多个技术团队基于OLAP的应用需求，开发出多种OLAP技术，如Hive、SparkSql、FlinkSql、Impala、Kylin、ClickHouse、Doris等，或者在实现其他应用需求的时候

i7杨·2024-01-10 01:31

笔记：分布式大数据技术原理（三）Spark

ApacheSpark是一个围绕速度、易用性和复杂分析构建的大数据处理框架，最初在2009年由加州大学伯克利分校的AMPLab开发，并于2010年成为Apache的开源项目之一，与Hadoop和Storm

WeeeicheN·2024-01-09 22:17

Spark 源码分析（二）: Driver 注册及启动

一，org.apache.spark.deploy.master.Master这个Master就是前面Client发送的对象，是一个ThreadSafeRpcEndpoint。内部的recei

stone_zhu·2024-01-09 21:30

黑猴子的家：Spark SQL RDD vs DataFrames vs DataSet

在SparkSQL中Spark为我们提供了两个新的抽象，分别是DataFrame和DataSet。他们和RDD有什么区别呢？

黑猴子的家·2024-01-09 18:28

机器学习分布式架构

2.流计算（Storm，Spark，Flink）使用滑动窗口，在滑动窗口内的数据全部完成后再滑动到下一个时间窗口进行新一轮的数据处理，以分钟级别居多

小幸运Q·2024-01-09 17:27

Spark---RDD(Key-Value类型转换算子)

文章目录1.RDDKey-Value类型1.1partitionBy1.2reduceByKey1.3groupByKeyreduceByKey和groupByKey的区别分区间和分区内1.4aggregateByKey获取相同key的value的平均值1.5foldByKey1.6combineByKey1.7sortByKey1.8join1.9leftOuterJoin1.10cogroup

肥大毛·2024-01-09 15:23

xgb模型json转pmml

一背景：在实际项目中往往会有不同种类的模型，如xgb的训练完保存为json格式、pkl格式以及原始booster的.model格式，预测需要用到pmml可以在spark中借助大数据的能力的跑因此需要对模型的格式进行转换

zcc_0015·2024-01-09 15:31

基于spark的Hive2Pg数据同步组件

一、背景Hive中的数据需要同步到pg供在线使用，通常sqoop具有数据同步的功能，但是sqoop具有一定的问题，比如对数据的切分碰到数据字段存在异常的情况下，数据字段的空值率高、数据字段重复太多，影响sqoop的分区策略，特别是hash分区，调用hash函数容易使得cpu高产生报警。同时sqoop的mapreduce任务对数据表的分割以及数据文件也会有一定的不均衡性。为了弥补这些问题，开发了基于

zcc_0015·2024-01-09 15:53

常见技术选型

MQRocketMQ,RabbitMQ,Kafka,ActiveMQNoSQLRedis,Memcache分布式计算Blink,Storm,SparkDB关系型TiDB,MySQL,MongoDB,CassandraKVLevelDB

独处人·2024-01-09 14:46

Java接入Apache Spark（入门环境搭建、常见问题）

Java接入ApacheSpark（环境搭建、常见问题）背景介绍ApacheSpark是一个快速的，通用的集群计算系统。

许忆·2024-01-09 13:12

一小时读完三本书的高效阅读法彻底打动了我

感恩宇宙公民的2毫米的高效生态圈，感恩校长和各位精英Leader们，一路拉着我奋勇狂奔。梅校长为我们讲授了如何实现一小时读完三本书的高效阅读方法？起初，我对自己高度怀疑，既期待成果又忐忑不安。

紫泡泡_d71a·2024-01-09 13:03

Hive基础知识

2）其本质是将SQL语句转换为MapReduce/Spark程序进行运算，底层数据由HDFS分布式文件系统进行存储。3）可以理解Hive就是MapReduce/SparkSql的客户端。

巷子里的猫X·2024-01-09 13:52

SAP Cloud Application Programming 介绍(2021 更新版）

早在SAP2019TechEd上，SAPCTOJuergenMueller向SAP生态圈传递了一条重要信息：身处云时代大环境下的SAP从业者，如何选择最适合自己的SAP开发方式？

JerryWang_汪子熙·2024-01-09 12:20

Spark与Hive的集成与互操作

ApacheSpark和ApacheHive是大数据领域中两个非常流行的工具，用于数据处理和分析。Spark提供了强大的分布式计算能力，而Hive是一个用于查询和管理大规模数据的数据仓库工具。

晓之以理的喵~~·2024-01-09 11:30

Spark回归分析与特征工程

在大数据领域，ApacheSpark为回归分析提供了强大的工具和库，以处理大规模数据集。本文将深入探讨如何使用Spark进行回归分析以及如何进行特征工程，以提高模型性能。

晓之以理的喵~~·2024-01-09 11:00

Spark中的二分类与多分类问题的解决

机器学习中的分类问题是数据科学中的一个重要领域，而在大数据环境中使用ApacheSpark来解决二分类和多分类问题可以更好地处理大规模数据。

晓之以理的喵~~·2024-01-09 11:00

Spark与HBase的集成与数据访问

ApacheSpark和ApacheHBase分别是大数据处理和分布式NoSQL数据库领域的两个重要工具。

晓之以理的喵~~·2024-01-09 11:24

Spark - SQL查询文件数据

那么我们可以利用spark-sql直接操作文件的特性处理这类的需求，姐姐再也不用担心我不会spark了，因为我就只会sql。##使用方法csv```spark.sql("select*fromcsv.

kikiki4·2024-01-09 09:18

大数据之PySpark的RDD介绍

文章目录前言一、RDD简介二、RDD的特性三、RDD的特点总结前言之前的文章主要介绍Spark基础知识，例如集群角色、Spark集群运行流程等，接下来会进一步讨论Spark相对核心的知识，让我们拭目以待

敲键盘的杰克·2024-01-09 07:11

pyspark mysql rdd_PySpark之RDD操作

一、什么是RDDAResilientDistributedDataset(RDD),thebasicabstractioninSpark.Representsanimmutable,partitionedcollectionofelementsthatcanbeoperatedoninparallel

辉月有话说·2024-01-09 07:40

PySpark之Spark RDD的持久化

、cache()二、persist三、缓存级别四、释放缓存五、什么时候缓存数据当某个RDD被使用多次的时候，建议缓存此RDD数据当某个RDD来之不易，并且使用不止一次，建议缓存此RDD数据frompysparkimportSparkContext

飞Link·2024-01-09 07:07

PySpark-Spark SQL基本介绍

目录SparkSQL基本介绍SparkSQL特点SparkSQL与Hive的异同SparkSQL的数据结构SparkSQL的入门创建SparkSession对象DataFrame详解DataFrame基本介绍

Sisi525693·2024-01-09 07:37

2024.1.8 Day04_SparkCore_homeWork

目录1.简述Spark持久化中缓存和checkpoint检查点的区别2.如何使用缓存和检查点?

白白的wj·2024-01-09 07:37

Sisi525693·2024-01-09 07:06

spark-sql字段血缘实现

spark-sql字段血缘实现背景ApacheSpark是一个开源的大数据处理框架，它提供了一种高效、易于使用的方式来处理大规模数据集。

王糍粑的小夕·2024-01-09 07:32

Spark---RDD(双值类型转换算子)

1.1intersection对源RDD和参数RDD求交集后返回一个新的RDD函数定义：defintersection(other:RDD[T]):RDD[T]//建立与Spark框架的连接va

肥大毛·2024-01-09 07:32

PySpark的RDD持久化

February13·2024-01-09 07:32

Spark Core------算子介绍

RDD基本介绍什么是RDDRDD:英文全称ResilientDistributedDataset，叫做弹性分布式数据集，是Spark中最基本的数据抽象，代表一个不可变、可分区、里面的元素可并行计算的集合

小希 fighting·2024-01-09 07:01

Spark 中 BroadCast 导致的内存溢出(SparkFatalException)

背景本文基于Spark3.1.1open-jdk-1.8.0.352目前在排查Spark任务的时候，遇到了一个很奇怪的问题，在此记录一下。

鸿乃江边鸟·2024-01-09 07:31

PySpark之RDD的持久化

主要作用:提升Spark程序的计算效率注意事项:RDD的缓存可以存储在内存或者是磁盘上，甚至可以存储在Executor进程的堆外内存中。主要是放在内存中，因此缓存的数据是不太稳定可靠。

Sisi525693·2024-01-09 07:30

Hive基本操作

Hive是类SQL语法的数据查询、计算、分析工具，执行引擎默认的是MapReduce，可以设置为Spark、Tez。Hive分内部表和外部表，外部表在建表的同时指定一个

X晓·2024-01-09 06:45

某大厂大数据开发-外包面试

4.spark用过吗，用到的开发工具5.数据量多少，服务器台数6.数仓每层做了什么事，为什么这样做？

劝学-大数据·2024-01-09 06:42

推荐频道

spark生态圈