E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
spark生态圈
11.Join的MapReduce实现
Join在MapReduce中的实现一、概述tips:Hive:MapReduce/
Spark
巧用explain查看语法树常见的面试题:描述如何使用MapReduce来实现join功能:考察点MapReduce
哈哈大圣
·
2024-01-20 18:40
Spark
在降本增效中的一些思考
背景在大环境不好的情况下,本司也开始了“降本增效”,本文探讨一下,在这种背景下
Spark
怎么做的降本增效。
鸿乃江边鸟
·
2024-01-20 14:25
spark
大数据
分布式
hive 运行报错
Error:Errorwhilecompilingstatement:FAILED:UDFArgumentTypeExceptionExactlyoneargumentisexpected.近期用
spark
圆周率的后六位
·
2024-01-20 12:35
hadoop
spark
设计模式——管道模式(并发模式)
在分布式处理领域,由于管道模式是数据驱动,而目前流行的
Spark
分布式处理平台也是数据驱动的,两者非常合拍,于是在spar
码上得天下
·
2024-01-20 11:52
设计模式
spark
big
data
spark
的jdbc接口,类似于hiveserver2
https://
spark
.apache.org/docs/2.4.0/sql-distributed-sql-engine.html#running-the-thrift-jdbcodbc-server
Spark
SQL
zdkdchao
·
2024-01-20 10:53
spark
大数据
分布式
Hadoop基础知识
Hadoop基础知识1、Hadoop简介广义上来说,Hadoop通常是指一个更广泛的概念——Hadoop
生态圈
。
坐在风口上de猪
·
2024-01-20 10:10
hadoop
大数据
分布式
大数据开发之Hadoop(完整版+练习)
3、Hadoop通常是指一个更广泛的概念-Hadoop
生态圈
1.2Hadoop优势(4高)1、高可靠性:Hadoop底层维护多个数据副本,所以即使Hadoop某个计算元素或存储出现故障,也不会导致数据的丢失
Key-Key
·
2024-01-20 10:36
hadoop
hdfs
mapreduce
分布式
大数据
Kylin安装学习教程
Kylin安装学习教程Kylin是一个开源的分布式分析引擎,提供Hadoop/
Spark
之上的SQL接口及多维分析(OLAP)能力以支持大数据分析,最初由eBayInc.开发并贡献到开源社区。
Luo_Yang111
·
2024-01-20 09:28
kylin
spark
连接操作
将有键的数据与另一组有键的数据一起使用是对键值对数据执行的最有用的操作之一。连接数据可能是PairRDD最常用的操作之一。连接的方式多种多样:右外连接,左外连接、交叉连接以及内连接普通的join操作符表示是内连接。只有在两个键值对中都存在的键才叫输出。
追赶的程序猿
·
2024-01-20 09:45
Data Bricks Delta Lake 入门
DeltaLake是一个开源存储层,它将关系数据库语义添加到基于
Spark
的数据湖处理中。
AI普惠大师
·
2024-01-20 07:03
flask
python
后端
Spark
从入门到精通30:
Spark
SQL:核心源码深度剖析
在前面一节我们讲解了
Spark
SQL的工作原理,接下来在这一节,我们对
Spark
SQL工作原理进一步地深入和加强,这一节主要讲解
Spark
SQL核心源码导读和剖析首先,我们看SQLContext.scala
勇于自信
·
2024-01-20 07:57
2019-04-07这就是“新零售”,看不懂以后还怎么做生意?
新零售,即企业以互联网为依托,通过运用大数据、人工智能等先进技术手段,对商品的生产、流通与销售过程进行升级改造,进而重塑业态结构与
生态圈
,并对线上服务、线下体验以及现代物流进行深度融合的零售新模式。
笑伟程豪
·
2024-01-20 05:45
【
Spark
】
Spark
容错及 HA--Master 异常
一、Master配置recoveryModeMaster作为
Spark
Standalone模式中的核心,如果Master出现异常,则整个集群的运行情况和资源将无法进行管理,整个集群将处于“群龙无首”的状况
w1992wishes
·
2024-01-20 05:37
余老师带你学习大数据-
Spark
快速大数据处理第十章Kafka第八节Kafka-Connect
kafkaKafkaConnect基本概念1、KafkaConnect是Kafka流式计算的一部分,左侧是数据源包括了数据库、hadoop、文本等等,右侧是数据结果包括了文本、hadoop、数据库,中间上层就是KafkaConnect,它里面会有很多的输入,将输入的内容的读取进来转交给Kafka里,也有可能将kafka里的内容拿出来放到我们的外部数据源中。2、KafkaConnect主要用来与其他
weixin_45810046
·
2024-01-20 03:41
kafka
kylin安装学习教程
ApacheKylin是一个开源的分布式分析引擎,提供Hadoop/
Spark
之上的SQL接口及多维分析(OLAP)能力以支持大数据分析,最初由eBayInc.开发并贡献到开源社区。
打工人何苦为难打工人
·
2024-01-20 03:07
kylin
Kylin安装学习教程
ApacheKylin是一个开源的分布式分析引擎,提供Hadoop/
Spark
上的SQL查询接口及多维分析(OLAP)能力以支持超大规模数据。
终将老去的穷苦程序员
·
2024-01-20 03:04
kylin
CVE-2023-46226 Apache iotdb远程代码执行漏洞
它具有体量轻、性能高、易使用的特点,完美对接Hadoop与
Spark
生态,适用于工业物联网应用中海量时间序列数据高速写入和复杂分析查询的需求。
棱镜七彩
·
2024-01-20 02:27
apache
iotdb
自然语言处理大数据:
spark
ML Word2Vec详解
简介Word2Vec是一种著名的词嵌入(WordEmbedding)方法,它可以计算每个单词在其给定语料库环境下的分布式词向量(DistributedRepresentation,亦直接被称为词向量)。词向量表示可以在一定程度上刻画每个单词的语义。如果词的语义相近,它们的词向量在向量空间中也相互接近,这使得词语的向量化建模更加精确,可以改善现有方法并提高鲁棒性。词向量已被证明在许多自然语言处理问题
nnnancyyy
·
2024-01-19 17:23
机器学习
python
人工智能
自然语言处理
深度学习
大数据学长面试之OPPO面试题
1)技术部分(1)
Spark
Streaming消费方式及区别,
Spark
读取HDFS的数据流程(2)Kafka高性能(3)Hive调优,数据倾斜(4)Zookeeper怎么避免脑裂,什么是脑裂。
大数据小理
·
2024-01-19 16:01
大数据1
大数据
面试
职场和发展
某汽车外包-大数据开发-面试
4.
spark
的提交参数有那些命令5.
spark
rdd,dataframe,dataSe解释一下。
劝学-大数据
·
2024-01-19 16:28
大数据面试题
大数据
spark
读取MySQL数据机器学习预测存入MySQL
importorg.apache.
spark
.
Spark
Confimportorg.apache.
spark
.ml.classification.
大数据驱动
·
2024-01-19 14:12
#
spark
mysql
机器学习
关于jenkins集成python的单元测试
最近在研究jenkins的集成,然后想把自己写的python工具也用jenkins集成一下废话少说,来看结构
spark
ing.py@author:lianying'''class
Spark
ing:@staticmethoddefget_num_of_zero
百晓生说测试
·
2024-01-19 13:21
软件测试
jenkins
python
单元测试
自动化测试
软件测试
功能测试
程序人生
html源码(html+css)
运维&从测试>UI设计>产品>我的课程表继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象全部课程精品推荐JQuery
Spark
MySQLJava
奇遇少年
·
2024-01-19 11:26
html
css
html5
css3
其他
Flink1.17 基础知识
Flink1.17基础知识来源:B站尚硅谷目录Flink1.17基础知识Flink概述Flink是什么Flink特点Flinkvs
Spark
StreamingFlink的应用场景Flink分层APIFlink
魅美
·
2024-01-19 08:16
大数据基础
大数据
flink
spark
dateformat源码排错
背景有一个任务yyyy写成了YYYY,导致年份不对触发告警selectfrom_unixtime(unix_timestamp(),'YYYY-MM-ddHH:mm:ss')第一时间用
spark
dateformat
这个程序猿可太秀了
·
2024-01-19 06:47
spark
大数据
数据仓库
利用 Apache
Spark
和 Databricks 进行企鹅种类预测的机器学习实践入门
这里演示使用Apache
Spark
和Databricks平台进行企鹅物种预测的完整机器学习流程。
AI普惠大师
·
2024-01-19 06:17
机器学习
人工智能
spark
+phoenix读取hbase
spark
直接操作hbase也是通过hbase的原语操作,操作起来比较繁琐,下面就是将
spark
和phoenix相结合的方法步骤。我用的是scala语言,首先pom.xml中添加依赖o
潮落拾贝
·
2024-01-19 06:16
spark
hbase
大数据
py
spark
笔记:窗口函数window
窗口函数相关的概念和基本规范可以见:py
spark
笔记:over-CSDN博客1创建Py
spark
dataFramefrompy
spark
.sql.windowimportWindowimportpy
spark
.sql.functionsasFemployee_salary
UQI-LIUWJ
·
2024-01-19 06:15
python库整理
笔记
Spark
基础学习--基础介绍
1.
Spark
基本介绍1.1定义
Spark
是可以处理大规模数据的统一分布式计算引擎。
Yan_bigdata
·
2024-01-19 06:37
spark
学习
大数据
mapreduce
对比
入门案例
词频统计
Py
spark
安装(Mac M2版)
引言本文为个人本地部署py
spark
遇到的问题以及解决办法,包含个人的一些理解,仅供参考。
矮人三等
·
2024-01-19 06:35
工具
java
相关
macos
spark
python
使用Apache
Spark
处理Excel文件的简易指南
对此,我们可借助Apache
Spark
这一分布式计算框架,凭借其强大的计算与数据处理能力,快速有效地处理Excel数据。这些数据进行一个分析,整理
i查拉图斯特拉如是
·
2024-01-19 06:33
apache
spark
excel
LightGBM On
Spark
通常业务中对计算性能有要求时,通常不使用GPU跑tf,会使用xgbooston
Spark
来解决,既保证速度,准确率也能接受。LightGBM是使用基于树的学习算法的梯度增强框架。
wong小尧
·
2024-01-19 04:10
spark
读取hive的数据
下载源码包:
spark
-2.3.3.tgz解压:tar-xzvf
spark
-2.3.3.tgz进入目录:cd
spark
-2.3.3.
IT烧麦
·
2024-01-19 04:17
FineBI实战项目一(25):实战项目一总结
没有集群,hdfs、hive、
spark
、kafka、flink等等都没有2解决方案mysql数据同步尽量和业务系统保持一致,以便后期出现问题排查。mysql同步到数仓,数仓
不死鸟.亚历山大.狼崽子
·
2024-01-19 02:39
FineBI
finebi
py
spark
结构数据处理
现在随着技术的更新,数据化实现越来越高效便捷,一整套大数据系统,至少需要从数据建模、技术选型、页面交互三方面实现。数据建模如水流,贯穿整个数据分析系统;技术选型是基础设施,支撑整个系统高效运转;页面交互是面向用户,用数据说话,对业务增长进行数据赋能,实现数据驱动。在复杂的数据分析场景中,通常需要基于用户画像与用户行为,对用户进行OLAP多维自由交叉组合分析。因此,对于百万级以上的产品业务,使用My
haleyprince
·
2024-01-19 00:20
shell
spark
-submit提交之后获取appid,并在程序中扫描状态
首先看一下提交脚本#/sbin/bash/opt/cloudera/parcels/
SPARK
2/bin/
spark
2-submit\exportJAVA_HOME=/opt/jdk1.8.0_31TASK_TYPE
南修子
·
2024-01-18 22:16
大数据之
Spark
知识体系完整解读
Spark
简介
Spark
是整个BDAS的核心组件,是一个大数据分布式编程框架,不仅实现了MapReduce的算子map函数和reduce函数及计算模型,还提供更为丰富的算子,如filter、join、groupByKey
金乐笑
·
2024-01-18 20:15
spark
streaming实时写入hive
pom文件
spark
-streaming-kafka-0-10_2.112.1.0
spark
-core_2.11
spark
-sql_2.11scala-library采用的是scala2.11.8实现逻辑
会飞的蜗牛66666
·
2024-01-18 16:11
从术语到
Spark
,10篇必读大数据学习资源
大数据文摘作品编译:王一丁、王梦泽、夏雅薇本文给想进入大数据领域的朋友提供了一系列的资源,由浅入深,比如“需要了解的51条大数据术语”、“学习python的四个理由”、“十一个必须要参加的大数据会议”等有趣的话题。相信各种背景的朋友都会在这篇文章中有所收获。之前,我们已就数据可视化进行了深入探讨。这次,我们将从更基本的概念讲起,以便在涉足更复杂的数据科学和商业智能之前能够真正理解大数据。文中会引领
金光闪闪耶
·
2024-01-18 13:45
【python】15.图像和办公文档处理
图像和办公文档处理用程序来处理图像和办公文档经常出现在实际开发中,Python的标准库中虽然没有直接支持这些操作的模块,但我们可以通过Python
生态圈
中的第三方模块来完成这些操作。
九五一
·
2024-01-18 11:12
python随心记
python
计算机视觉
人工智能
django大数据_草稿本01
文档Learning_
Spark
/5.
Spark
Streaming/ReadMe.mdatmaster·LeslieZhoa/Learning_
Spark
#在py
spark
下运行frompy
spark
.ml.featureimportHashingTF
哈都婆
·
2024-01-18 09:15
django
作为刚入职的小白,怎么才能学好大数据 ?
大数据学习方向一、大数据运维之Linux基础打好Linux基础,以便更好地学习Hadoop,hbase,NoSQL,
Spark
,Storm,docker,openstack等。
铁拳虎
·
2024-01-18 09:40
大数据学习
大数据开发
大数据入门
数据分析
Hadoop
Kafka
大数据
大数据技术
人工智能
spark
Linux
大数据
大数据学习
大数据开发
Spark
Session对象操作--学习笔记
1,
Spark
Session对象操作frompy
spark
.sqlimport
Spark
Sessionfrompy
spark
import
Spark
Conffrompy
spark
.sqlimportfunctionsasF
祈愿lucky
·
2024-01-18 07:35
大数据
学习
笔记
javascript
大数据知识点
Spark
:
Spark
RDD的概念:RDD是
Spark
中最基本的数据抽象,是一个不可变、可分区、里面的元素可并行计算的集合。
꧁༺朝花夕逝༻꧂
·
2024-01-18 07:29
hbase
数据库
大数据
py
spark
笔记:over
1方法介绍在Py
Spark
中,over函数是一个非常重要的概念,尤其是在使用窗口函数(例如row_number,rank,dense_rank,lead,lag等)时。
UQI-LIUWJ
·
2024-01-18 07:27
python库整理
笔记
Python进阶知识:整理1 -> py
Spark
入门
1编写执行入口#1.导包frompy
spark
import
Spark
Conf,
Spark
Context#2.创建
Spark
Conf类对象conf=
Spark
Conf().setMaster("local
是小蟹呀^
·
2024-01-18 07:57
Python
python
spark
Spark
SQL函数定义
目录窗口函数SQL函数分类
Spark
原生自定义UDF函数Pandas的UDF函数ApacheArrow框架基本介绍基于Arrow完成PandasDataFrame和
Spark
DataFrame互转基于Pandas
Sisi525693
·
2024-01-18 07:23
spark
sql
大数据
Spark
—shell,Hbase—shell
Spark
:
SPARK
SQLresults=
spark
.sql("SELECT*FROMpeople")//读取JSON文件valuserScoreDF=
spark
.read.json("hdfs://
꧁༺朝花夕逝༻꧂
·
2024-01-18 07:21
spark
大数据
分布式
web开发学习笔记(8.java web后端开发基础知识)
1.使用spring开发的优势,spring发展到今天已经形成了一种开发
生态圈
,提供了若干个子项目,每个项目用于完成特定的功能。使用spring全家桶,可以做到很多事情,可以很方便的套用很多的组件。
萌新pp
·
2024-01-18 06:05
学习
笔记
003-90-15【
Spark
SQL&DF&DS】慈航寺庙山脚下八卦田旁油菜花海深处人家王大爷家女儿用GPT学习DataSet的基本操作
003-90-14【
Spark
SQL&DF&DS】慈航寺庙山脚下八卦田旁油菜花海深处人家王大爷家女儿用GPT学习DataSet的基本操作【
Spark
SQL&DF&DS】Dataset的创建和使用【
Spark
SQL
一杯派蒙
·
2024-01-18 06:53
spark
gpt
学习
spark
大数据
笔记
上一页
14
15
16
17
18
19
20
21
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他