#mapReduce 第6页

Spark简介

它是一个快速通用的集群计算平台.Spark扩展了流行的MapReduce模型.Spark提供的主要功能之一就是能够在内存中运行计算，但对于在磁盘上运行的复杂应用程序，系统也比MapReduce更有效。

shinelord明·2024-01-22 17:17

Hadoop基本概论

3.大数据应用场景二、Hadoop概述1.Hadoop定义2.Hadoop发展历史3.Hadoop发行版本4.Hadoop优势5.Hadoop1.x/2.x/3.x6.HDFS架构7.Yarn架构8.MapReduce

LzYuY·2024-01-22 08:25

Hive SQL的编译过程（转）

通过向社区的咨询和自己的努力，在解决这些问题的同时我们对Hive将SQL编译为MapReduce的过程有了比较深入

愤怒的谜团·2024-01-21 20:40

MapReduce任务输出到redis中

主要包括redis连接池，重写FileOutputFormat函数。redis连接池/***redis连接池*/publicclassRedisHelper{privatestaticJedisPooljedisPool;static{init();}publicsynchronizedstaticJedisgetJedis(){if(jedisPool!=null){Jedisresource=

AnillegalName·2024-01-21 10:13

02-黑马程序员大数据开发：分布式计算和分布式资源调度

分布式计算模式：分散->汇总模式（MapReduce）和中心调度->步骤执行模式（ApacheSpark,Flink;比较复杂，中间会有数据交换的过程）；2.MapReduce概述MapReduce是Hadoop

S1406793·2024-01-21 08:52

03-黑马程序员大数据开发：Apache Hive

、ApacheHive概述1.目的：了解什么是分布式SQL计算；了解什么是ApacheHive2.使用Hive处理数据的好处操作接口采用类SQL语法，提供快速开发的能力（简单、容易上手)底层执行MapReduce

S1406793·2024-01-21 08:21

大数据技术汇总

HadoopHadoop入门概述Hadoop运行模式介绍HadoopHDFS的运行流程HadoopMapReduce的运行流程Hadoopyarn的运行流程Hadoop内HDFS、MapReduce和YARN

转身成为了码农·2024-01-21 07:41

Spark：SparkSQL与Hive on Spark（Shark）的比较

简要介绍了SparkSQL与HiveonSpark的区别与联系一、关于Spark简介在Hadoop的整个生态系统中，Spark和MapReduce在同一个层级，即主要解决分布式计算框架的问题。

花和尚也有春天·2024-01-21 06:17

Spark面试题

spark的不同点（为什么spark更快）♥♥♥ shuffle都是需要落盘的，因为在宽依赖中需要将上一个阶段的所有分区数据都准备好，才能进入下一个阶段，那么如果一直将数据放在内存中，是非常耗费资源的MapReduce

韩顺平的小迷弟·2024-01-21 06:53

Linux-Hadoop集群配置

hadoop（1）编辑Hadoop环境配置文件-hadoop-env.sh（2）编辑Hadoop核心配置文件-core-site.xml（3）编辑HDFS配置文件-hdfs-site.xml（4）编辑MapReduce

人生苦短@我用python·2024-01-21 05:44

大数据技术原理及应用课实验5 :MapReduce初级编程实践

目录一、实验目的二、实验平台三、实验步骤（每个步骤下均需有运行截图）（一）编程实现文件合并和去重操作（二）编写程序实现对输入文件的排序（三）对给定的表格进行信息挖掘四、实验总结五、优化及改进（选做）实验5MapReduce

Blossom i·2024-01-21 02:20

111.Parquet表的使用

Parquet格式：数据模型:Avro,Thrift,ProtocolBuffers,POJOs查询引擎:Hive,Impala,Pig,Presto,Drill,Tajo,HAWQ,IBMBigSQL计算框架:MapReduce

大勇任卷舒·2024-01-21 02:33

Python高阶函数使用总结！理解Python的数据结构和提高数据 ( 一 )

如有问题请及时联系我们以作处理以下文章来源于腾讯云作者：昱良本文结合各种实际的例子详细讲解了Python5个内建高阶函数的使用，能够帮助理解Python的数据结构和提高数据处理的效率，这5个函数分别是：mapreducefiltersorted

孤城暮雨丶·2024-01-21 00:50

Spark(一): 基本架构及原理

ApacheSpark是一个围绕速度、易用性和复杂分析构建的大数据处理框架，最初在2009年由加州大学伯克利分校的AMPLab开发，并于2010年成为Apache的开源项目之一，与Hadoop和Storm等其他大数据和MapReduce

贝賏赑钡·2024-01-20 22:46

分布式系统中JobHistoryServer服务和Timeline Server服务的配置和简要了解概述（不详细阐述，小服务模块）

一.JobHistoryServer服务概述缺陷：注意JobHistoryServer只存储已经完成的MapReduce应用的作业历史

科班你宇哥·2024-01-20 21:38

11.Join的MapReduce实现

Join在MapReduce中的实现一、概述tips:Hive:MapReduce/Spark巧用explain查看语法树常见的面试题:描述如何使用MapReduce来实现join功能：考察点MapReduce

哈哈大圣·2024-01-20 18:40

倒计时3天

1.今天把javaweb界面弄出来用htmljspservlet2.明天弄mapreduce3.建库！！把文件信息用户信息日志信息放到数据库4.下周一要开始翻译文献和论文为期9天

0be47bf15d8d·2024-01-20 18:16

Hive性能优化

原因是mapreduce作业初始化的时间是比较长的。sum,count,max,min等UDAF，不怕数据倾斜问题,hadoop在map端的汇总合并优化，使数据倾斜不成问题。

La victoria·2024-01-20 13:23

Hive调优一文打尽

影响Hive效率的几乎从不是数据量过大，而是数据倾斜、数据冗余、Job或I/O过多、MapReduce分配不合理等等。

跟着大数据和AI去旅行·2024-01-20 13:16

阿里云 E-MapReduce 全面开启 Serverless 时代

本文整理自阿里云智能EMR负责人李钰（花名：绝顶）在2023云栖大会开源大数据专场的分享，演讲主题为阿里云E-MapReduce全面开启Serverless时代。

Apache Spark中国社区·2024-01-20 12:22

Hadoop基础知识

狭义上说，Hadoop指Apache这款开源框架，它的核心组件有：HDFS（分布式文件系统）：解决海量数据存储YARN（作业调度和集群资源管理的框架）：解决资源任务调度MAPREDUCE（分布式运算编程框架

坐在风口上de猪·2024-01-20 10:10

MapReduce基础知识

MapReduce1、介绍MapReduceMapReduce的思想核心是“分而治之”，适用于大量复杂的任务处理场景（大规模数据处理场景）。

坐在风口上de猪·2024-01-20 09:18

Python5个内建高阶函数的使用

本文结合各种实际的例子详细讲解了Python5个内建高阶函数的使用，能够帮助理解Python的数据结构和提高数据处理的效率，这5个函数分别是：mapreducefiltersorted/sortzipimage

玄机L·2024-01-20 06:46

MIT 6.824 分布式系统 lab1 MapReduce 遇到死锁问题

记录学习6.824的lab1遇到的坑（死锁了）代码逻辑借鉴：https://blog.csdn.net/weixin_45938441/article/details/124018485问题描述目前处于编写worker与coordinate进行RPC通信的环节，worker中的Map和Reduce方法还都没有开动只有一个打印逻辑，只是想先测一下，worker和coordinate之间能否正常通信。

花里胡哨的菜只因·2024-01-20 03:55

某汽车外包-大数据开发-面试

1.自我介绍2.hivesql的执行流程3.mapreduce的原理。4.spark的提交参数有那些命令5.sparkrdd,dataframe,dataSe解释一下。

劝学-大数据·2024-01-19 16:28

分布式鼻祖：Map Reduce 论文深入解析

摘要MapReduce是一个编程模型，也是一个处理和生成超大数据集的算法模型的相关实现。

西部小笼包·2024-01-19 11:48

任务14：使用MapReduce提取全国每年最低/最高气温

任务描述知识点：使用MapReduce提取数据重点：开发MapReduce程序统计每年每个月的最低气温统计每年每个月的最高气温内容：使用IDEA创建一个MapReduce项目开发MapReduce程序使用

Dija-bl·2024-01-19 09:18

任务13：使用MapReduce对天气数据进行ETL（获取各基站ID）

任务描述知识点：天气数据进行ETL重点：掌握MapReduce程序的运行流程熟练编写MapReduce程序使用MapReduce进行ETL内容：编写MapReduce程序编写Shell脚本，获取MapReduce

Dija-bl·2024-01-19 09:48

大数据开发之Hadoop（MapReduce）

第1章：MapReduce概述1.1MapReduce定义MapReduce是一个分布式运算程序的编程框架，是用户开发“基于Hadoop的数据分析应用”的核心框架。

Key-Key·2024-01-19 06:40

大数据开发之Hadoop（Yarn）

Yarn是一个资源调度平台，负责为运算程序提供服务器运算资源，相当于一个分布式的操作系统平台，而MapReduce等运算程序则相当于运行于操作系统之上的应用程序。

Key-Key·2024-01-19 06:09

Spark基础学习--基础介绍

1.2Spark与MapReduce的对比在之前我们学习过MapReduce，同样作为大数据分布式计算引擎，究竟这两者有什么区别呢？

Yan_bigdata·2024-01-19 06:37

数据库系统原理总结之——数据管理技术的发展

第八章数据管理技术的发展第八章数据管理技术的发展一、数据库技术发展★★二、数据仓库★★★三、数据挖掘的功能★★★四、大数据的定义★★五、大数据存储★六、NoSQL系统支持的数据存储模型★★★★七、MapReduce

润小仙女·2024-01-19 00:45

Hadoop的心脏：中央异步调度器AsyncDispatcher代码和设计解析

以Yarn、HDFS和MapReduce为主要组成的Hadoop，涉及到大量复杂的、交互的事件处理、状态转换，同时，这些事件调度和状态转换又对实时性和效率提出了极高的要求。

麦兜和小可的舅舅·2024-01-18 22:56

大数据之Spark 知识体系完整解读

Spark简介Spark是整个BDAS的核心组件，是一个大数据分布式编程框架，不仅实现了MapReduce的算子map函数和reduce函数及计算模型，还提供更为丰富的算子，如filter、join、groupByKey

金乐笑·2024-01-18 20:15

Hive入门

这些查询语句在Hive中被称作HQL，这些HQL会被翻译成MapReduce作业来执行。Hive把表和字段转换成HDFS中的文件夹和文件，并将这些元数据保持在关系型数据库中，如derby或mysql。

kongxx·2024-01-18 17:11

Hadoop之mapreduce参数大全-7

151.设置客户端与AM之间的IPC（Inter-ProcessCommunication）连接在发生超时时的最大重试次数yarn.app.mapreduce.client-am.ipc.max-retries-on-timeouts

OnePandas·2024-01-18 06:54

Hadoop之mapreduce参数大全-8

176.指定JobHistoryServer在缓存中存储的日期字符串的最大数量mapreduce.jobhistory.datestring.cache.size是ApacheHadoopMapReduce

OnePandas·2024-01-18 06:54

阿里云大数据ACA及ACP复习题（21~40)

（D）A:HDFSB:DFSC:RDDD:MapReduce解析：MAPREDUCE（分布式运算编程框架）22.以下选项中不属于MaxCompute特点的是(D)A:支持多种多种经典的分布式计算模型B:

周周的奇妙编程·2024-01-18 03:08

Mapreduce多reduce输出排序

在Mapreduce中，默认情况下多reduce输出是无序的，如果需要有序，可以使用两种方式：使用一个reduce，在内部实现排序使用多个reduce，实现全局排序区别：如果使用一个reduce实现排序

星辰fml·2024-01-17 21:21

2024.1.15 Spark 阶段原理,八股,面试题

2.简述Spark的四大特点3.简述Spark比Mapreduce执行效率高的原因4.简述SparkonYarn的两种部署模式的区别和特点5.Spark底层工作原理是怎样的6.RDD算子分成了哪几类,各自的特点是什么

白白的wj·2024-01-17 15:38

Hive架构设计

我们知道MapReduce和Spark它们提供了高度抽象的编程接口便于用户编写分布式程序，它们具有极好的扩展性和容错性，能够处理超大规模的数据集。

跟着大数据和AI去旅行·2024-01-17 08:12

Hadoop——HDFS、MapReduce、Yarn期末复习版（搭配尚硅谷视频速通）

一、HDFS1.HDFS概述1.1HDFS定义HDFS(HadoopDistributedFileSystem),它是一个文件系统，用于存储文件，通过目录树来定位文件；其次，它是分布式的，由很多服务器联合起来实现其功能，集群中的服务器有各自的角色。HDFS的使用场景：适合一次写入，多次读出的场景。一个文件经过创建、写入和关闭之后就不需要改变。1.2HDFS优缺点（1）优点高容错性数据自动保存多个副

革斤要加油·2024-01-17 06:10

hadoop之shuffle

读取数据源2、将数据切片（每片128M），切分成一个个的split3、启动mapTask，mapTask个数和split个数一样，开始执行任务4、mapTask将数据读入内存，存在一个内存环形缓冲区（mapreduce.task.io.sort.mb

临界爵迹·2024-01-17 06:42

举例说明MapReduce的过程

1.MapReduce的核心思想和处理过程MapReduce的核心思想是分而治之，和归并排序的思想是一样的。

爬行的蜗牛_2020·2024-01-17 04:26

高阶函数

函数可以作为参数被传递实际应用场景：回调函数（callback）、常见的数组方法，如sortfiltermapreduce等函数可以作为返回值输出实际应用场景：闭包等各种场景相关应用实现AOPAOP（面向切面编程

Mr_Begin·2024-01-17 00:53

黑猴子的家：Kylin 快速入门之 Build Cube Error 解决和总结

1、kylin在build报错10020拒绝链接错误1）logsorg.apache.kylin.engine.mr.exception.MapReduceException:Exception:java.net.ConnectException

黑猴子的家·2024-01-17 00:20

Hadoop详解

核心内容包含hdfs和mapreduce。hadoop2.0以后引入yarn.hdfs是提供数据存储的，mapreduce是方便数据计算的。

武昌库里写JAVA·2024-01-16 21:20

78、Spark SQL之延伸知识之Hive On Spark

其底层默认是基于MapReduce实现的，但是由于MapReduce速度实在比较慢，因此这两年，陆续出来了新的SQL查询引擎。包括SparkSQL，HiveOnTez，HiveOnSpark等。

ZFH__ZJ·2024-01-16 15:10

python毕业设计如何选题

caxiou·2024-01-16 13:35

大数据实战——基于Hadoop的Mapreduce编程实践案例的设计与实现

基于Hadoop的Mapreduce编程实践案例的设计与实现一、数据排序案例的设计与实现1.1设计思路1.2实践过程1.3成果展示+数据可视化分析二、求数据平均值案例的设计与实现2.1设计思路2.2实践过程

ZShiJ·2024-01-16 11:27

推荐频道

#mapReduce