Spark集群搭建第13页

Hbase2.1 集群搭建

>Hbase在大数据的体系中扮演着DB角色，不得不说是重要的一员，在上一篇，大猪已经给大家演示了[Hadoop3.2集群搭建](https://www.jianshu.com/p/3182aaff918d

kikiki5·2024-01-31 05:41

mongodb java spring_MongoDB和Java（4）：Spring Data整合MongoDB（XML配置）

最近花了一些时间学习了下MongoDB数据库，感觉还是比较全面系统的，涉及了软件安装、客户端操作、安全认证、副本集和分布式集群搭建，以及使用SpringData连接MongoDB进行数据操作，收获很大。

務酒者·2024-01-31 02:03

三、ElasticSearch集群搭建实战

本篇ES集群搭建主要是在LinuxVM上，未使用Docker方式,ES版本为7.10,选择7.10版本原因可以看往期文章介绍。

南天一梦N·2024-01-31 02:29

ElasticSearch 7.4集群部署启用x-pack验证 Kibana7.4用户管理

一.es7.4集群搭建1.1下载es以及修改相应配置1.1.1节点规划内网ip节点192.168.18.126node-1192.168.18.125node-2192.168.18.133node-31.1.2

Cocktail_py·2024-01-31 02:28

四、ES集群安全策略设置 X-pack

本文主要是结合ES集群搭建时使用，并且适用于ES7.x以上版本背景及安全策略方案对比ES7.x以下版本默认几乎没有任何安全策略，如果集群IP、端口被暴露，在可访问的情况下任何用户都可以对索引进行管理以及数据的增删改查等

南天一梦N·2024-01-31 02:57

Structured Streaming 基于 event-time 的窗口(Java语言)

在这种机制下,即不必考虑Spark陆续接收事件的顺序是否与事件发生的顺序一致,也不必考虑事件到达Spark的时间与事件发生时间的关系。因此,它在提高数据处理精度的同时,大大减少了开发者的工作量。

2301_79479951·2024-01-31 00:19

启动bin/spark-shell警告：WARN NativeCodeLoader: Unable to load native-hadoop library for your platform.

启动bin/spark-shell警告：WARNNativeCodeLoader:Unabletoloadnative-hadooplibraryforyourplatform...usingbuiltin-javaclasseswhereapplicable

2301_79479951·2024-01-31 00:18

003-90-16【SparkSQL&DF&DS】慈航寺庙山脚下八卦田旁油菜花海深处人家王二爷家女儿大红用GPT学习Rdd和Dataaset 以及DataFrame 的转换

003-90-16【SparkSQL&DF&DS】慈航寺庙山脚下八卦田旁油菜花海深处人家王二爷家女儿大红用GPT学习Rdd和Dataaset以及DataFrame的转换【SparkSQL&DF&DS】Dataset

一杯派蒙·2024-01-30 21:31

SparkSQL之函数解析

!!expr-Logicalnot.不的意思Examples:>SELECT!true;false>SELECT!false;true>SELECT!NULL;NULLSince:1.0.0!=expr1!=expr2-Returnstrueifexpr1isnotequaltoexpr2,orfalseotherwise.如果expr1不等于expr2则返回true，否则返回false。Argu

OnePandas·2024-01-30 21:00

kafka集群搭建需要做的事情

首先，虚拟机克隆好之后的步骤如下：1.修改IP、主机名，关闭防火墙；（reboot重启）2.在/etc/hosts文件中进行IP与主机名的映射配置，集群中每天都记得配置；3.安装JDK并进行分发；进入/etc/profile.d/目录创建my_env.sh文件并在其中配置JAVA_HOME并进行分发；（分发jdk前先卸载自带的jdk）；4.安装zookeeper并进行分发，具体为：首先，在zook

薛薛哦·2024-01-30 21:24

从术语到Spark，10篇必读大数据学习资源

本文给想进入大数据领域的朋友提供了一系列的资源，由浅入深，比如“需要了解的51条大数据术语”、“学习python的四个理由”、“十一个必须要参加的大数据会议”等有趣的话题。相信各种背景的朋友都会在这篇文章中有所收获。之前，我们已就数据可视化进行了深入探讨。这次，我们将从更基本的概念讲起，以便在涉足更复杂的数据科学和商业智能之前能够真正理解大数据。文中会引领大家阅读介绍大数据的相关文章，研究网络上流

大数据的时代·2024-01-30 20:34

Spark Submit提交时，Json字符串作为参数

今天遇到一个把json作为参数传入spark程序中的问题原因如下，Spark源码中会对把}}和{{替换掉@VisibleForTestingpublicstaticStringexpandEnvironment

南修子·2024-01-30 19:21

Spark 读取、写入时序数据库TDengine以及TDengine概述

一、TDengine是什么TDengine是一款高性能、分布式、支持SQL的时序数据库，其核心代码，包括集群功能全部开源（开源协议，AGPLv3.0）。TDengine能被广泛运用于物联网、工业互联网、车联网、IT运维、金融等领域。除核心的时序数据库功能外，TDengine还提供缓存、数据订阅、流式计算等大数据平台所需要的系列功能，最大程度减少研发和运维的复杂度。1.TDengine总结出了物联网

Alex_81D·2024-01-30 18:10

PDF如何提取页面

操作软件：旋风PDF编辑器下载地址：http://www.679sparkle.com/pdfeditor1.下载旋风PDF编辑器安装完之后，点击右下角的打开文件按钮

六号_db7a·2024-01-30 18:24

ELK集群搭建(基础教程)

ELK集群搭建(基础教程)目录：机器准备集群内各台机器安装Elasticsearch安装部署Kafka（注：每个节点都配置，注意ip不同）安装logstash工具安装filebeatELK收集Nginx

lqcbj_IT老混混·2024-01-30 16:41

如何接手一个大数据项目

以下是个人的一些思考总结：了解一个大数据系统，我认为需要从以下几个方面入手：宏观方面：1.了解系统的整体架构和技术栈：需要了解系统中使用的技术栈，包括各种大数据组件和工具，例如Hadoop、Spark、

Mmj666·2024-01-30 15:19

Spark的核心RDD（Resilient Distributed Datasets弹性分布式数据集）

Spark的核心RDD（ResilientDistributedDatasets弹性分布式数据集）铺垫在hadoop中一个独立的计算，例如在一个迭代过程中，除可复制的文件系统（HDFS）外没有提供其他存储的概念

fcyh·2024-01-30 15:46

Spark RDD（弹性分布式数据集）

1.RDD1.1RDD是什么RDD（ResilientDistributedDataset）：弹性分布式数据集，是Spark对数据集的抽象，代表一个只读、不可变、可分区、其中元素可进行并行计算的集合，并且是可跨越集群节点进行并行操作的有容错机制的集合

JOEL-T99·2024-01-30 15:15

理解Spark中RDD(Resilient Distributed Dataset)

文章目录1RDD基础1.1分区1.2不可变1.3并行执行2RDD结构2.1SparkContext、SparkConf2.2Partitioner2.3Dependencies2.4Checkpoint

小何才露尖尖角·2024-01-30 15:45

Spark RDD基础实战(弹性分布式数据集)

http://spark.apache.org/docs/latest/sql-data-sources-json.htmlhttp://jsonlines.org/examples/官网的准备的数据集合启动

蜗牛杨哥·2024-01-30 15:14

Spark弹性分布式数据集（Resilient Distributed Dataset）

1.弹性分布式数据集RDD1.1.RDD概述1.1.1.什么是RDDRDD（ResilientDistributedDataset）叫做分布式数据集，是Spark中最基本的数据抽象，它代表一个不可变、可分区

你狗·2024-01-30 15:14

Spark——（RDD(弹性分布式数据集)，RDD的创建和操作，Transformation 算子）

文章目录RDD(弹性分布式数据集)RDD的创建和操作常见的Transformation算子RDD(弹性分布式数据集)RDD（ResilientDistributedDataset）是Spark中的核心概念

想做CTO的任同学...·2024-01-30 15:12

spark学习笔记：弹性分布式数据集RDD(Resilient Distributed Dataset)

弹性分布式数据集RDD1.RDD概述1.1什么是RDDRDD（ResilientDistributedDataset）叫做弹性分布式数据集，是Spark中最基本的数据抽象，它代表一个不可变、可分区、里面的元素可并行计算的集合

黄道婆·2024-01-30 15:39

【Spark】之 RDD（Resilient Distributed Dataset）

文章目录RDD编程模型一、RDD之间的依赖关系（Dependency）如何生成RDD？二、RDD计算（1）RDD获得数据（2）RDD计算任务（3）RDD操作算子三、RDD容错（1）`Lineage`（2）`checkpoint`机制RDD编程模型需求：需要在多个并行操作之间重用工作数据集。典型场景：机器学习和图应用中常用的迭代算法（每一步对数据执行相似的函数）数据重用隐藏在系统实现背后，没有将重用

fanfan4569·2024-01-30 15:39

SparkCore之RDD---弹性分布式数据集

不可变3.依赖关系4.缓存（cache）5.检测点（CheckPoint）四、RDD的创建1.通过并行化的方式创建RDD2.读取文件生成RDD3.通过其他RDD转换五、RDD运行过程RDD的设计与运行原理Spark

孤独の√ 3·2024-01-30 15:09

【Spark】RDD(Resilient Distributed Dataset)究竟是什么？

目录基本概念官方文档概述含义RDD出现的原因五大属性以单词统计为例，一张图熟悉RDD当中的五大属性解构图RDD弹性RDD特点分区只读依赖缓存checkpoint基本概念官方文档介绍RDD的官方说明：http://spark.apache.org

关于我转生变成程序猿这档事·2024-01-30 15:08

横扫Spark之 - RDD（Resilient Distributed Dataset）弹性分布式数据集

概念二、理解1.弹性2.分布式3.数据集三、5个主要特性1.一个分区列表2.作用在每个分区上的计算函数3.一个和其他RDD的依赖列表4.一个分区器（可选）5.计算的最佳位置（可选）一、概念 RDD就是Spark

阿年、嗯啊·2024-01-30 15:07

数据治理实践 | 小文件治理

背景小文件是如何产生的：日常任务及动态分区插入数据（使用的Spark2MapReduce引擎），产生大量的小文件，从而导致

语兴数据·2024-01-30 15:29

ColorPicker的操作会影响Button按钮的样式,需注意~~~

ColorPicker的操作会将Button的样式修改,具体看下面的例子..例如:@namespaces"library://ns.adobe.com/flex/spark";@namespacemx"library

郎岳樟·2024-01-30 14:42

spark写hive的ORC表，count(*)没数据

使用spark向hive中插入数据，hive表是ORC表spark.sql("insertoverwritetableods.ods_aaapartition(pt,id)\n"+"select\n"+

青云游子·2024-01-30 09:49

Spark快速入门(4) 核心概念和抽象：Actions

之前我们讲过，Spark中的transformations，只有在真正需要的时候才会执行计算，这里计算的触发器被称作actions。Driver&Executors我们先来介绍一些相关概念。

MeazZa·2024-01-30 09:55

8.hive安装和 Hive环境准备（hive on Spark 、Yarn队列配置）

1Hive安装部署1）把apache-hive-3.1.2-bin.tar.gz上传到linux目录下2）解压apache-hive-3.1.2-bin.tar.gz到/opt/module/目录下面[root@node0906_hive]#tar-zxvfapache-hive-3.1.2-bin.tar.gz-C/opt/module/3）修改apache-hive-3.1.2-bin.tar

shenjianyu_rex·2024-01-30 08:23

Spark为何使用Netty通信框架替代Akka

解决方案：一直以来，基于Akka实现的RPC通信框架是Spark引以为豪的主要特性，也是与Hadoop等分布式计算框架对比过程中一大亮点，但是时代和技术都在演化，从Spark1.3.1版本开始，为了解决大块数据

yyoc97·2024-01-30 07:56

spark window源码探索

核心类：1.WindowExec物理执行逻辑入口，主要doExecute()和父类WindowExecBase2.WindowFunctionFrame窗框执行抽象，其子类对应sql语句的不同窗框其中又抽象出BoundOrdering类,用于判断一行是否在界限内(Bound),分为RowBoundOrdering和RangeBoundOrdering我们的UDAF在何时已什么顺序接受数据,何时会被

orange大数据技术探索者·2024-01-30 07:19

Scala入门01

Spark入门1.入门spark采用Scala语言开发Spark是用来计算的Scala掌握：特性，基本操作，集合操作，函数，模式匹配，trait，样例类，actor等内容。

chde2Wang·2024-01-30 07:48

【Spark系列4】Task的执行

一、Task的执行流程1.1、Task执行流程DAGScheduler将Stage生成TaskSet之后，会将Task交给TaskScheduler进行处理，TaskScheduler负责将Task提交到集群中运行，并负责失败重试，为DAGScheduler返回事件信息等，整体如流程如下：当任务提交到TaskScheduler时，TaskScheduler会通知SchedulerBackend分配

周润发的弟弟·2024-01-30 07:15

PySpark数据分析

PySpark是ApacheSpark的PythonAPI，它允许用户使用Python进行大数据处理和分析。

数字化信息化智能化解决方案·2024-01-30 07:13

Spark入门02-Spark开发环境配置（idea环境）

安装与配置Spark开发环境1.下载解压安装包https://archive.apache.org/dist/spark/spark-2.1.2/https://mirrors.tuna.tsinghua.edu.cn

chde2Wang·2024-01-30 07:41

Hadoop与Spark横向比较【大数据扫盲】

大数据场景下的数据库有很多种，每种数据库根据其数据模型、查询语言、一致性模型和分布式架构等特性，都有其特定的使用场景。以下是一些常见的大数据数据库：NoSQL数据库：这类数据库通常用于处理大规模、非结构化的数据。它们通常提供简单的查询语言，并强调水平扩展和高可用性。例如：-键值存储：如Redis，AmazonDynamoDB-列式存储：如ApacheCassandra，HBase-文档数据库：如M

super_journey·2024-01-30 06:51

Apache Spark 的基本概念和在大数据分析中的应用

ApacheSpark是一个快速、通用、可扩展的大数据处理引擎。它提供了一个高级的编程接口，可以在分布式环境中对大规模数据进行处理和分析。

数据科学与艺术的贺公子·2024-01-30 06:17

TCP Scoket数据流WordCount

安装nc：yuminstallncWordCountpackagecn.spark.streaming;importjava.util.Arrays;importjava.util.Iterator;importorg.apache.spark.SparkConf

hipeer·2024-01-30 05:19

大数据 - Spark系列《一》- 分区 partition数目设置详解

目录3.2.1分区过程3.2.2SplitSize计算和分区个数计算3.2.3Partition的数目设置1.对于数据读入阶段，输入文件被划分为多少个InputSplit就会需要多少初始task.2.对于转换算子产生的RDD的分区数3.repartition和coalesce操作会聚合成指定分区数。3.2.4groupBy不一定会Shuffle3.2.1分区过程每一个过程的任务数，对应一个Inpu

王哪跑nn·2024-01-29 23:59

Macbook M1 安装PDI(Kettle) 9.3

参考：https://indiespark.top/software/run-command-line-apple-silico

Pierre_·2024-01-29 23:32

golang读取json文件

golang读取json数据json文件：{"hostUrl":"wss://spark-api.xf-yun.com/v2.1/chat","appid":"yourappid","apiSecret

xin麒·2024-01-29 22:56

Spark的核心组件

运行架构Spark框架的核心是一个计算引擎，整体来说，它采用了标准master-slave的结构。如下图所示，他展示了一个Spark执行时的基本结构。

cluse_ld·2024-01-29 21:25

Spark 的架构与组件

1.背景介绍Spark是一个快速、通用的大规模数据处理框架，它可以处理批量数据和流式数据，支持多种数据源，并提供了丰富的数据处理功能。

OpenChat·2024-01-29 21:24

spark调优之资源调优

资源调优为spark程序提供合理的内存资源，cpu资源等spark-sumbmit脚本常见参数1、–confPROP=VALUE==》手动给sparkConf指定相关配置，比如–confspark.serializer

XLMN·2024-01-29 20:54

浅析大数据的技术生态圈(Hadoop，hive，spark)

大数据本身是个很宽泛的概念，Hadoop生态圈（或者泛生态圈）基本上都是为了处理超过单机尺度的数据处理而诞生的。你可以把它比作一个厨房所以需要的各种工具。锅碗瓢盆，各有各的用处，互相之间又有重合。你可以用汤锅直接当碗吃饭喝汤，你可以用小刀或者刨子去皮。但是每个工具有自己的特性，虽然奇怪的组合也能工作，但是未必是最佳选择。大数据，首先你要能存的下大数据。传统的文件系统是单机的，不能横跨不同的机器。H

Rysinal·2024-01-29 19:11

阿里云服务器2024年2核16G、4核32G、8核64G配置最新收费标准及活动价格

2核16G、8核64G、4核32G配置的云服务器处理器与内存比为1:8，这种配比的云服务器一般适用于数据分析与挖掘，Hadoop、Spark集群和数据库，缓存等内存密集型场景，因此，多为企业级用户选择，

qq_3304559116·2024-01-29 18:17

推荐频道

Spark集群搭建