Hadoop；Spark 第11页

spark好的文章链接

https://blog.51cto.com/u_16099325/6763760`javaspark官方文档sparkjavaapi手册http://www.17bigdata.com/book/spark

Trank-Lw·2024-02-08 13:18

SQL在云计算中的新角色：重新定义数据分析

文章目录1.云计算与数据分析的融合2.SQL在云计算中的新角色3.分布式SQL查询引擎4.SQL-on-Hadoop解决方案5.SQL与其他数据分析工具的集成6.实时数据分析与SQL7.SQL在云数据仓库中的角色

程序边界·2024-02-08 13:01

史上最全OLAP对比

目录1.什么是OLAP2.OLAP引擎的常见操作3.OLAP分类MOLAP的优点和缺点ROLAP的优点和缺点4.并发能力与查询延迟对比5.执行模型对比5.OLAP引擎的主要特点5.2SparkSQL、FlinkSQL5.3Clickhouse5.4Elasticsearch5.5Presto5.6Impala5.7Doris5.8Druid5.9Kylin

只会写demo的程序猿·2024-02-08 11:04

No.2大数据入门 | 环境搭建：jdk1.8安装及环境配置

上一篇文章我们安装了虚拟机以及linux操作系统，接下来就要安装在操作系统上运作的大数据核心hadoop分布式系统基础架构！

滚滚红尘_8133·2024-02-08 11:43

Spark：基于莱文斯坦（Levenshtein）距离计算字符串相似度

以下程序代码基于spark，使用scala语言，测试时间：2018-08-03str1和str2相似度=1-Levenshtein距离/max(length(str1),length(str2))valdf

xuejianbest·2024-02-08 11:25

Hadoop多次格式化后如何解决

产生原因我们在配置hadoop中的hdfs时，会设置元数据的存储位置，如图所示要想解决此问题，先停止所有启动的服务stop-all.sh然后删除上图画出来的配置文件，这里三台机器都要删，最后进入hadoop

(((φ(◎ロ◎;)φ)))牵丝戏安·2024-02-08 11:50

MMLSpark+Spark：pyspark+lightGBM应用实践

MMLSpark，即MicrosoftMachineLearningforApacheSpark，是微软开源的一个针对ApacheSpark的深度学习和数据可视化的库。

bensonrachel·2024-02-08 10:38

spark sql 数据类型转换_spark sql时间类型转换以及其他

1.sparksql的日期转换一般使用两种形式第一种使用to_timestamp(REACHTIME1,"yyyy-MM-ddHH24:mi:ss")//它将字符串时间转换为日期类型例如2018-10-

weixin_39535527·2024-02-08 10:02

Spark streaming写入delta数据湖问题

但项目上线到生产环境，检查sparkstreaming的job，发现数据在merge写入到数据湖时，往往超过1小时。

kk_io·2024-02-08 10:01

Spark streaming batch运行时间过长问题02

排查Sparkstreaming数据写入时间过长问题，一方面是因为程序写数据湖小文件问题。在解决了小文件问题后，还是不能达到预期的1分钟一个batch。

kk_io·2024-02-08 10:01

企业Spark案例--酒店数据分析实战提交

第1关：数据清洗--过滤字段长度不足的且将出生日期转：packagecom.yyimportorg.apache.spark.rdd.RDDimportorg.apache.spark.sql.

cz学java·2024-02-08 10:30

Spark的timestamp 数据时间问题

使用Spark来处理国际业务数据，涉及到数据时区转换，在实际项目中出现时区转换问题。

kk_io·2024-02-08 10:29

CentOS 7搭建Hadoop伪分布模式

配置文件：链接：https://pan.baidu.com/s/1rYvnxbyqXOG1DjI63dxbAw提取码：6e1l复制这段内容后打开百度网盘手机App，操作更方便哦1.1修改IP地址在虚拟机的命令行中输入下面的命令，修改网卡的配置文件vi/etc/sysconfig/network-scripts/ifcfg-ens33配置以下信息TYPE=Ethernet#类型为以太网BOOTPRO

clevercondy·2024-02-08 09:52

大数据毕业设计PySpark+PyFlink航班预测系统飞机票航班数据分析可视化大屏机票预测机票爬虫飞机票推荐系统大数据毕业设计计算机毕业设计

博主介绍：✌全网粉丝100W+,前互联网大厂软件研发、集结硕博英豪成立工作室。专注于计算机相关专业毕业设计项目实战6年之久，选择我们就是选择放心、选择安心毕业✌由于篇幅限制，想要获取完整文章或者源码，或者代做，可以给我留言或者找我聊天。感兴趣的可以先收藏起来，还有大家在毕设选题，项目以及论文编写等相关问题都可以给我留言咨询，希望帮助更多的人。1.DrissionPage自动化Python爬虫工具采

B站计算机毕业设计超人·2024-02-08 09:17

【项目实战】Flink+InfluxDB+Grafana实现对YARN集群队列资源进行画像

一、Flink实时计算第一章：Flink快速入门1.Flink架构2.Flink应用场景3.FlinkVSSpark4.实时计算技术选型第二章：Flink项目构建与测试1.快速构建Flink项目2.第一个

大数据研习社·2024-02-08 08:56

2018-07-14

复制/etc/skel目录为/home/tuser1改权限2、编辑/etc/group文件，添加组hadoop。

啊鑫007·2024-02-08 08:56

Hadoop生态漏洞修复记录

Hadoop常用端口介绍HDFSNameNode50070dfs.namenode.http-addresshttp服务的端口50470dfs.namenode.https-addresshttps服务的端口

不会吐丝的蜘蛛侠。·2024-02-08 08:30

Hadoop2.7配置

core-site.xmlfs.defaultFShdfs://bigdata/ha.zookeeper.quorum192.168.56.70:2181,192.168.56.71:2181,192.168.56.72:2181-->hadoop.tmp.dir

不会吐丝的蜘蛛侠。·2024-02-08 08:59

hive2.3.2配置(带kerberos)

hive-env.shexportHADOOP_HEAPSIZE=2048exportHADOOP_CLIENT_OPTS="-Xmx2g-Xms2g-Djava.net.preferIPv4Stack

不会吐丝的蜘蛛侠。·2024-02-08 08:59

高性能hbase配置

hbase-env.shexportHADOOP_HOME=/export/hadoopexportHADOOP_CONF_DIR=/export/common/hadoop/confexportJAVA_HOME

不会吐丝的蜘蛛侠。·2024-02-08 08:59

HDFS执行balance报错：hdfs balance java.io.IOException: Another Balancer is running.. Exiting

现象：1、大数据Hadoop集群，HDFS扩容后，为了使各节点数据均衡，执行balance操作。2、启动hdfsbalance时，一直出现其他的balance在执行中，其实并没有执行。

不会吐丝的蜘蛛侠。·2024-02-08 08:29

大数据问题：Hadoop的web页面无法访问logs

HTTPERROR403Problemaccessing/logs/.Reason:Useryarnisunauthorizedtoaccessthispage.PoweredbyJetty://分析：1、有的说是权限问题，但是并没有用yarn用户启动Hadoop

不会吐丝的蜘蛛侠。·2024-02-08 08:28

hadoop调优-hdfs配置优化

dfs.permissions.enabledtruedfs.namenode.handler.count90dfs.ha.automatic-failover.enabledtrue其它优化：dfs.hosts/export/hadoop

不会吐丝的蜘蛛侠。·2024-02-08 08:28

spark运行失败The directory item limit of /spark_dir/spark_eventLogs is exceeded: limit=1048576 items=104

报错：org.apache.hadoop.ipc.RemoteException(org.apache.hadoop.hdfs.protocol.FSLimitException$MaxDirectoryItemsExceededException

不会吐丝的蜘蛛侠。·2024-02-08 08:58

grafana+prometheus+hiveserver2(jmx_exporter+metrics)

文件开启metricshive.server2.metrics.enabledtruehive.service.metrics.codahale.reporter.classesorg.apache.hadoop.hive.common.metrics.metrics2

不会吐丝的蜘蛛侠。·2024-02-08 08:24

hadoop学习笔记

下载安装伪分布式：1.国内源下载地址：https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/Indexof/apache/hadoop/commonhttps

草琳情·2024-02-08 08:54

Flink on Yarn的两种模式

首先，在集群运行时，可能会有很多的集群实例包括MapReduce、Spark、Flink等等，那么如果它们全基于onYarn就可以完成资源分配，减少单个实例集群的维护，提高集群的利用率。

GOD_WAR·2024-02-08 07:22

flink on yarn

Per-JobCluster模式flinkrunflinkrunapplication-tyarn-application配置任务退出时保留Checkpoint从外部checkpoint恢复应用资料使用安装完hadoop3.3.4

枪枪枪·2024-02-08 07:46

Flink流式数据倾斜

1.流式数据倾斜流式处理的数据倾斜和Spark的离线或者微批处理都是某一个SubTask数据过多这种数据不均匀导致的，但是因为流式处理的特性其中又有些许不同2.如何解决2.1窗口有界流倾斜窗口操作类似Spark

orange大数据技术探索者·2024-02-08 07:58

Mac 安装多版本 protoc / protobuf

)brew安装brewinstallprotobuf#查看安装目录$whichprotoc/opt/homebrew/bin/protoc#2)配置环境变量vim~/.zshrc#protoc(forhadoop

大数据王小皮·2024-02-08 07:26

sqoop导入数据到hdfs

Sqoop是apache旗下的一款”Hadoop和关系数据库之间传输数据”的工具导入数据：将MySQL，Oracle导入数据到Hadoop的HDFS、HIVE、HBASE等数据存储系统导出数据：从Hadoop

鲲鹏猿·2024-02-08 06:40

Hadoop之环境配置

1.安装环境ubuntu2.安装jdk3.安装Hadoop1.在安装ubuntu时需要注意安装ubuntu创建用户，等待时间比较长，大家需要有点耐心。

鲲鹏猿·2024-02-08 06:39

数据采集工具Sqoop、Datax、Flume、Canal

libcpmysql-connector-java-5.1.10.jar/sqoop-install-path/lib重命名文件并配置文件mvsqoop-env-template.shsqoop-env.sh#添加环境变量exportHADOOP_COMMON_HOME

yue-verdure·2024-02-08 06:08

大数据系列—数据迁移(Sqoop,Flume,DataX)对比学习（stage3）

个人大数据技术栈：DataX,Sqoop,Hadoop,Hive,Spark,Flink,Hbase,Kafka,Kettle,Azkaban,Airflow,Tableau…个人在学习领域：Python

道-闇影·2024-02-08 06:07

Zookeeper搭建集群步骤

[hadoop@note1~]$cat/etc/hosts127.0.0.1localhostlocalhost.localdomainlocalhost4localhost4.localdomain4

qq_22019789·2024-02-08 06:37

MapReduce的类型与格式

MapReduce的类型Hadoop的MapReduce中，map函数和reduce函数遵循如下格式：map：(k1,v1)--->list(k2,v2)combiner：（k2,list(v2)）--

Vechace·2024-02-08 05:31

Spark安装（Yarn模式）

一、解压链接：https://pan.baidu.com/s/1O8u1SEuLOQv2Yietea_Uxg提取码：mb4htar-zxvf/opt/software/spark-3.0.3-bin-hadoop3.2

莫噶·2024-02-08 04:44

Hadoop搭建（完全分布式）

bigdata-masterbigdata-slave1bigdata-salve2NameNodeNodeManagerNodeManagerSecondaryNameNodeDataNodeDataNodeResourceManagerNodeManagerDataNode目录一、jdk安装：二、hadoop

莫噶·2024-02-08 04:14

现成Hadoop安装和配置，图文手把手交你

为了可以更加快速的可以使用Hadoop，便写了这篇文章，想尝试自己配置一下的可以参考从零开始配置Hadoop，图文手把手教你，定位错误资源1.两台已经配置好的hadoop2.xshell+Vmware链接

叫我小唐就好了·2024-02-08 03:56

图解大数据 | 大数据分析挖掘-Spark初步

图解大数据|大数据分析挖掘-Spark初步作者：韩信子@ShowMeAI教程地址：www.showmeai.tech/tutorials/8…本文地址：www.showmeai.tech/article-det

Dashesand·2024-02-08 03:22

docker数据科学与spark镜像源与使用常见问题疑难解答

DreamNotOver·2024-02-08 01:16

用docker 配置scala spark环境

要使用Docker配置Scala和Spark环境，您可以按照以下步骤进行操作。以下是一个基本的示例，您可能需要根据您的具体需求进行调整。安装Docker:在您的系统上安装Docker。

DreamNotOver·2024-02-08 01:14

Spark Standalone 集群配置

集群管理类型Spark支持三种集群管理类型：Standalone-Spark附带的一个简单的集群管理器，可以轻松地设置集群。

董可伦·2024-02-07 23:01

RDD vs DataFrame vs Dataset

RDD是Spark最基础的数据结构。RDD允许开发者使用容错的形式在集群中使用内存计算，这样可以提高计算速度。1.2DataFrameDataFrame是使用数据组成命名

一生逍遥一生·2024-02-07 22:20

Hadoop系统应用之Zookeeper分布式集群部署

一、Zoopkeeper安装包下载安装【Zookeeper版本型号为3.4.10】1.下载Zookeeper安装包（地址）https://archive.apache.org/dist/zookeeper/zookeeper-3.4.10/2.上传安装包（SecureCRT&FX）通过软件FX将安装包上传到linux系统的/export/software/目录下3.解压Zookeeper安装包执行

-牧心-·2024-02-07 22:31

Hadoop | 集群配置（一）使用Shell脚本解决完全分布式集群节点之间的文件传输问题 | scp命令 | rsync命令

文章目录参考资料一、前言二、rsync远程同步工具三、使用shell编写分发脚本四、总结参考资料视频链接Linuxscp命令一、前言在Hadoop完全分布式集群环境下，里面的各个节点都是通过SSH免密登陆连接的

「已注销」·2024-02-07 21:20

黑猴子的家：Spark SQL 的性能

1、内存列存储（In-MemoryColumnarStorage）内存列存储来说，将所有原生数据类型的列采用原生数组来存储，将Hive支持的复杂数据类型(如array、map等)先序列化后拼接成一个字节数组来存储。这样，每个列创建一个JVM对象，从而导致可以快速的GC和紧凑的数据存储。额外的，还可以用低廉CPU开销的高效压缩方法来降低内存开销。更有趣的是，对于分析查询中频繁使用的聚合特定列，性能会

黑猴子的家·2024-02-07 18:48

简单使用Spark、Scala完成对天气数据的指标统计

目录一、前言&什么是Spark？

db_lcz_2014·2024-02-07 18:33

【hadoop】集群搭建之部署mysql并远程访问（连接）

的roo账号密码并连接mysql（四）更改默认密码并创建testdb数据库（五）将mysqljdbc驱动引入ider中的java项目里（六）通过jdbc连接（访问）mysql(使用ider)（七）创建hadoop

db_lcz_2014·2024-02-07 18:32

学习大数据需要掌握哪些知识？

而且不论是学习hadoop，还

大数据学习01·2024-02-07 15:16

推荐频道

Hadoop；Spark

spark好的文章链接

SQL在云计算中的新角色：重新定义数据分析

史上最全OLAP对比

No.2大数据入门 | 环境搭建：jdk1.8安装及环境配置

Spark：基于莱文斯坦（Levenshtein）距离计算字符串相似度

Hadoop多次格式化后如何解决

MMLSpark+Spark：pyspark+lightGBM应用实践

spark sql 数据类型转换_spark sql时间类型转换以及其他

Spark streaming写入delta数据湖问题

Spark streaming batch运行时间过长问题02

企业Spark案例--酒店数据分析实战提交

Spark的timestamp 数据时间问题

CentOS 7搭建Hadoop伪分布模式

大数据毕业设计PySpark+PyFlink航班预测系统 飞机票航班数据分析可视化大屏 机票预测 机票爬虫 飞机票推荐系统 大数据毕业设计 计算机毕业设计

【项目实战】Flink+InfluxDB+Grafana实现对YARN集群队列资源进行画像

2018-07-14

Hadoop生态漏洞修复记录

Hadoop2.7配置

hive2.3.2配置(带kerberos)

高性能hbase配置

HDFS执行balance报错：hdfs balance java.io.IOException: Another Balancer is running.. Exiting

大数据问题：Hadoop的web页面无法访问logs

hadoop调优-hdfs配置优化

spark运行失败The directory item limit of /spark_dir/spark_eventLogs is exceeded: limit=1048576 items=104

grafana+prometheus+hiveserver2(jmx_exporter+metrics)

hadoop学习笔记

Flink on Yarn的两种模式

flink on yarn

Flink流式数据倾斜

Mac 安装多版本 protoc / protobuf

sqoop导入数据到hdfs

Hadoop之环境配置

数据采集工具Sqoop、Datax、Flume、Canal

大数据系列—数据迁移(Sqoop,Flume,DataX)对比学习（stage3）

Zookeeper搭建集群步骤

MapReduce的类型与格式

Spark安装（Yarn模式）

Hadoop搭建（完全分布式）

现成Hadoop安装和配置，图文手把手交你

图解大数据 | 大数据分析挖掘-Spark初步

docker数据科学与spark镜像源与使用常见问题疑难解答

用docker 配置scala spark环境

Spark Standalone 集群配置

RDD vs DataFrame vs Dataset

Hadoop系统应用之Zookeeper分布式集群部署

Hadoop | 集群配置（一）使用Shell脚本解决完全分布式集群节点之间的文件传输问题 | scp命令 | rsync命令

黑猴子的家：Spark SQL 的性能

简单使用Spark、Scala完成对天气数据的指标统计

【hadoop】集群搭建之部署mysql并远程访问（连接）

学习大数据需要掌握哪些知识？

大数据毕业设计PySpark+PyFlink航班预测系统飞机票航班数据分析可视化大屏机票预测机票爬虫飞机票推荐系统大数据毕业设计计算机毕业设计