E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
Doris数仓
数据仓库相关概念
目录实时
数仓
和离线
数仓
数仓
分层ETL(Extract-Transform-Load)
数仓
指标一些缩写实时
数仓
和离线
数仓
离线
数仓
和实时
数仓
主要的区别在于数据处理和更新的速度。
可以睡到中午吗
·
2023-12-15 13:48
数据仓库
Flink CDC--MySQL
FlinkCDC–MySQLFlinkCDCMySQL版本单表CDC目标:利用Flink将MySQL增量数据同步到
Doris
执行流程第一步:操作数据库构建表,并加入数据mysql-uroot-pupdateusersetHost
清盏涂墨衣
·
2023-12-15 09:59
flink
mysql
【
数仓
理论】
一、
数仓
建模方法论1.1ER模型(EntityRelationship、实体关系模型、范式模型)ER模型是BillInmon提出的一种建模方法,实体关系模型将复杂的数据抽象为两个概念----实体和关系该模型在范式理论上符合
想当运维的程序猿
·
2023-12-15 07:52
数据仓库
物流实时
数仓
:采集通道搭建
系列文章目录物流实时
数仓
:环境搭建文章目录系列文章目录前言一、环境准备1.前置环境2.hbase安装1.上传并解压2.配置环境变量3.拷贝jar包4.编写配置文件5.分发配置文件3.Redis安装1.安装需要的编译环境
超哥--
·
2023-12-15 06:34
物流实时数仓
大数据
flink
物流实时
数仓
:
数仓
搭建(DIM)
系列文章目录物流实时
数仓
:采集通道搭建物流实时
数仓
:
数仓
搭建物流实时
数仓
:
数仓
搭建(DIM)文章目录系列文章目录前言一、文件编写1.pom.xml2.目录创建3.DimApp.java4.KafkaUtil.java5
超哥--
·
2023-12-15 06:34
物流实时数仓
flink
大数据
06
数仓
平台MaxWell
Maxwell简介Maxwell是由Zendesk公司开源,用Java编写的MySQL变更数据抓取软件,能实时监控MySQL数据库的CRUD操作将变更数据以json格式发送给Kafka等平台。Maxwell输出数据格式Maxwell原理Maxwell工作原理是实时读取MySQL数据库的二进制日志(Binlog),从而获取变更数据,再将变更数据以JSON格式发送给Kafka等流处理平台。Maxwel
kk_io
·
2023-12-15 06:02
数据仓库
数据仓库
hadoop
增量同步
07用户行为日志数据采集
用户行为数据由Flume从Kafka直接同步到HDFS,由于离线
数仓
采用Hive的分区表按天统计,所以目标路径要包含一层日期。具体数据流向如下图所示。
kk_io
·
2023-12-15 06:22
数据仓库
flume
数据仓库
物流实时
数仓
:
数仓
搭建(DWD)一
系列文章目录物流实时
数仓
:采集通道搭建物流实时
数仓
:
数仓
搭建物流实时
数仓
:
数仓
搭建(DIM)物流实时
数仓
:
数仓
搭建(DWD)一文章目录系列文章目录前言一、文件编写1.目录创建2.bean文件1.DwdOrderDetailOriginBean2
超哥--
·
2023-12-15 06:22
物流实时数仓
大数据
flink
Flink 项目系列
Flink项目系列1-项目介绍-墨天轮Flink实时电商实战项目:基于尚硅谷开源项目的Flink电商实战项目(全流程)大数据Flink电商
数仓
实战项目流程全解(一)_尚硅谷flinksql大数据项目实战
清风明月一壶酒
·
2023-12-14 16:22
flink
大数据
快手
数仓
面试题附答案
题目1讲一下你门公司的大数据项目架构?2你在工作中都负责哪一部分3spark提交一个程序的整体执行流程4spark常用算子列几个,6到8个吧5transformation跟action算子的区别6map和flatmap算子的区别7自定义udf,udtf,udaf讲一下这几个函数的区别,编写的时候要继承什么类,实现什么方法8hive创建一个临时表有哪些方法9讲一下三范式,三范式解决了什么问题,有什么
话数Science
·
2023-12-06 21:59
大数据
面试
Spark
spark
大数据
Flink 读写
Doris
FlinkDorisConnector可以支持通过Flink操作(读取、插入、修改、删除)
Doris
中存储的数据。
shangjg3
·
2023-12-06 08:49
Doris
大数据
数据仓库
doris
sql
flink
Doris
数据备份及恢复
Doris
支持将当前数据以文件的形式,通过broker备份到远端存储系统中。之后可以通过恢复命令,从远端存储系统中将数据恢复到任意
Doris
集群。
shangjg3
·
2023-12-06 08:48
Doris
大数据
数据仓库
doris
sql
Spark读写
Doris
数据
1准备Spark环境创建maven工程,编写pom.xml文件 4.0.0
shangjg3
·
2023-12-06 08:48
Doris
大数据
数据仓库
doris
sql
spark
Doris
集成 ElasticSearch
Doris
-On-ES将
Doris
的分布式查询规划能力和ES(Elasticsearch)的全文检索能力相结合,提供更完善的OLAP分析场景解决方案:(1)ES中的多index分布式Join查询(2)
Doris
shangjg3
·
2023-12-06 08:14
Doris
elasticsearch
大数据
搜索引擎
数据仓库
doris
Databend 开源周报第 122 期
Databend是一款现代云
数仓
。专为弹性和高效设计,为您的大规模分析需求保驾护航。自由且开源。即刻体验云服务:https://app.databend.cn。
Databend
·
2023-12-06 06:35
开源
Apache
Doris
在某工商信息商业查询平台的湖仓一体建设实践
本文导读:信息服务行业可以提供多样化、便捷、高效、安全的信息化服务,为个人及商业决策提供了重要支撑与参考。本文以某工商信息商业查询平台为例,介绍其从传统Lambda架构到基于DorisMulti-Catalog的湖仓一体架构演进历程。同时通过一系列实践,展示了如何保证数据的准确性和实时性,以及如何高效地处理和分析大规模数据,为信息服务行业提供了有价值的参考思路,有助于推动整个行业的发展和创新。作者
SelectDB技术团队
·
2023-12-06 05:37
apache
大数据
数据库
数据分析
doris
数据仓库
【黑马甄选离线
数仓
day08_会员主题域开发】
1.会员主题域需求说明1.1各类会员数量统计说明:公司为了对不同会员进行不同的营销策略,对各类会员的数量都非常敏感,比如注册会员、消费会员、复购会员、活跃会员、沉睡会员。不仅需要看新增数量还要看累积数量。指标:新增注册会员数、累计注册会员数、新增消费会员数、累计消费会员数、新增复购会员数、累计复购会员数、活跃会员数、沉睡会员数、会员消费金额维度:时间粒度:时间维度(天、周、月)涉及库:sale、m
LKL1026
·
2023-12-05 21:31
黑马甄选离线数仓项目
大数据
数据库
数据仓库
sql
【黑马甄选离线
数仓
day09_会员主题域开发_DWD和DWM层】
leftjoin的结果集unionall增量数据4.把最新的拉链数据优先保存到DWD对应的临时表中5.使用insert+select方式把临时表中数据灌入DWD拉链表中拉链表实现流程:DWD层开发DWD层:
数仓
明细层
LKL1026
·
2023-12-05 21:31
黑马甄选离线数仓项目
数据仓库
大数据
sql
【黑马甄选离线
数仓
day06_核销主题域开发】
1.核销主题_DWD和DWM层1.0ODS层操作数据存储层:==OperateDataStore==核心理念:几乎和源数据保持一致,粒度相同注意事项:==同步方式(全量同步,全量覆盖,增量仅新增,增量新增和更新)+内部表+分区表(部分)+指定字符分隔符+orc+zlib==第二天的时候已经完成了从mysql以及sqlserver抽取数据到ods层的过程1.1DWD层数据仓库细节层:==DataWa
LKL1026
·
2023-12-05 21:00
黑马甄选离线数仓项目
大数据
笔记
数据仓库
【黑马甄选离线
数仓
day07_常见优化手段及核销主题域开发】
1.常见优化手段1.1分桶表基本介绍分桶表:分文件的,在创建表的时候,指定分桶字段,并设置分多少个桶,在添加数据的时候,hive会根据设置分桶字段,将数据划分到N个桶(文件)中,默认情况采用HASH分桶方案,分多少个桶,取决于建表的时候,设置分桶数量,分了多少个桶最终翻译的MR也就会运行多少个reduce程序(HIVE的分桶本质上就是MR的分区操作)如何构建一个分桶表呢?createtable表名
LKL1026
·
2023-12-05 21:26
笔记
大数据
数据仓库
DOT Recapping Sharing -
Doris
23rd-24thJun2018DivisionWDOTRecapSharing:-
Doris
1.Deardirectors,whentherearethehardtimes,alwaysrememberWHY.Beingatoastmastersfor2years
裸熊兜Doris
·
2023-12-05 15:19
黑马一站制造
数仓
实战1
1.项目目标一站制造企业中项目开发的落地:代码开发代码开发:SQL【DSL+SQL】SparkCoreSparkSQL
数仓
的一些实际应用:分层体系、建模实现2.内容目标项目业务介绍:背景、需求项目技术架构
ZhaoXiangmoStu
·
2023-12-05 15:20
Python
制造
大数据
大数据转型方案:首推数据湖!
数仓
技术应对关系型结构化数据游刃有余,但对于多元异构数据,却爱莫能助。最近行业大佬都在聊怎么部署数据湖,这波操作未来走向如何?数据湖技术能够实现全量数据的单一存储,通常存储原始格式的对象块或者文件。
zhisheng_blog
·
2023-12-05 02:12
大数据
人工智能
编程语言
java
数据分析
大数据开发:Hive on Spark设计原则及架构
在Spark越来越受到主流市场青睐的大背景下,Hive作为Hadoop生态当中的
数仓
组件工具,在于Spark生态的配合当中,开始有了HiveonSpark的思路,那么具体是怎么实现的呢?
成都加米谷大数据
·
2023-12-05 01:44
大数据的技术栈-逐步完善
hadoopa.HDFS分布式文件系统b.Yarn集群资源管理器c.MapReducesql引擎d.Impalasql引擎e.工具概观2.数据仓库知识a.Hive数据库1)HiveSql2)数据库结构b.
Doris
刘文钊1
·
2023-12-04 20:12
大数据
月度产品更新(11月):数据同步功能上线,配置更简单
更新快速预览新增&优化功能:新增【数据同步】新增【变量动态依赖】优化【日志操作】新增连接器:邮政速递EMSWhale帷幄websocket黑湖小工单百世快递应用更新:小红书金蝶云星空有赞自建快手小店抖店
doris
白鹅�
·
2023-12-04 16:04
交通物流
大数据
自动化
Apache
Doris
详细教程(三)
7、监控和报警
Doris
可以使用Prometheus和Grafana进行监控和采集,官网下载最新版即可。
白鸽呀
·
2023-12-04 07:09
Doris
apache
Apache
Doris
详细教程(二)
5、
doris
的查询语法5.1、
doris
查询语法整体结构SELECT[ALL|DISTINCT|DISTINCTROW]--对查询字段的结果是否需要去重,还是全部保留等参数select_expr[,select_expr
白鸽呀
·
2023-12-04 06:38
Doris
apache
03
数仓
平台 Kafka
kafka概述定义Kafka是一个开源的分布式事件流平台(EventStreamingPlantform),主要用于大数据实时领域。本质上是一个分布式的基于发布/订阅模式的消息队列(MessageQueue)。消息队列在大数据场景中主要采用Kafka作为消息队列。传统消息队列主要应用场景包括:缓存/削峰、解耦和异步通信。消息队列的模式包含了2种,点对点订阅模式和发布/订阅模式。Kafka采用了发布
kk_io
·
2023-12-04 04:17
数据仓库
kafka
分布式
长安汽车基于 Apache
Doris
的车联网数据分析平台建设实践
导读:随着消费者更安全、更舒适、更便捷的驾驶体验需求不断增长,汽车智能化已成必然趋势。长安汽车智能化研究院作为长安汽车集团有限责任公司旗下的研发机构,专注于汽车智能化技术的创新与研究。为满足各业务部门的数据分析需求,长安汽车基于ApacheDoris升级了车联网数据分析平台,支撑单日百亿级别数据实时处理,并实现十亿级别数据查询秒级响应,为长安汽车在提升用户用车体验、实时预警车辆故障、保证车辆安全驾
SelectDB技术团队
·
2023-12-04 03:11
apache
数据分析
数据库
大数据
多场景下 3-11 倍性能提升,Apache
Doris
1.2 新版本性能揭秘!
自ApacheDoris1.1.0版本发布距今已经有数月之久,在这一期间,我们重新思考并确立了社区新版本发布的流程,正式引入了LTS(Long-TermSupport,长周期支持)版本的概念,在1.1.x系列版本中不再引入大的功能Feature、仅提供问题修复和稳定性改进,力求满足更多社区用户在稳定性方面的高要求。值得高兴的是,这一行动已经有了明显的成效,目前1.1.x系列最新版本的稳定性经受了众
SelectDB技术团队
·
2023-12-04 02:03
Apache
Doris
整合 FLINK CDC 、Paimon 构建实时湖仓一体的联邦查询入门
1.概览多源数据目录(Multi-Catalog)功能,旨在能够更方便对接外部数据目录,以增强
Doris
的数据湖分析和联邦数据查询能力。
hf200012
·
2023-12-03 16:07
apache
Doris
paimon
flink
hql面试题之上海某资深
数仓
开发工程师面试题-求不连续月份的月平均值
1.题目A,B两组产品的月平均值,月平均值是当月的前三个月值的一个平均值,注意月份是不连续的,如果当月的前面的月份不存在,则为0。如A组2023-04的月平均值为2023年1月的数据加2023-02月的数据的平均值,因为没有其他月份则需要再加一个0,再求平均值。要求:求出每个月的月平均值。‘A’,‘2023-01’,3030‘A’,‘2023-02’,5464‘A’,‘2023-04’,5467‘
江南正晓时
·
2023-12-03 12:56
hive
sql
02
数仓
平台Zookeeper
概述ZooKeeper是一种分布式协调服务,用于管理大型主机集。在分布式环境中协调和管理服务是一个复杂的过程。ZooKeeper通过其简单的架构和API解决了这个问题。ZooKeeper允许开发人员专注于核心应用程序逻辑,而不必担心应用程序的分布式性质。Zookeeper工作机制Zookeeper从设计角度来理解,就是一个观察者模式设计的分布式服务管理框架,它负责存储和管理核心数据,接受观察者的注
kk_io
·
2023-12-03 09:52
数据仓库
zookeeper
分布式
云原生
Doris
数据导入四:Binlog Load 方式
BinlogLoad提供了一种使
Doris
增量同步用户在Mysql数据库的对数据更新操作的CDC(ChangeDataCapture)功能。1适用场景INSERT/UPDATE/DELETE支持。
shangjg3
·
2023-12-03 06:38
Doris
大数据
数据仓库
doris
sql
Doris
数据导入三:Routine Load 方式
例行导入(RoutineLoad)功能为用户提供了一种自动从指定数据源进行数据导入的功能。1适用场景当前仅支持从Kafka系统进行例行导入,使用限制:(1)支持无认证的Kafka访问,以及通过SSL方式认证的Kafka集群。(2)支持的消息格式为csv,json文本格式。csv每一个message为一行,且行尾不包含换行符。(3)默认支持Kafka0.10.0.0(含)以上版本。如果要使用Kafk
shangjg3
·
2023-12-03 06:01
Doris
大数据
数据仓库
doris
sql
解码 SQL:深入探索 Antlr4 语法解析器背后的奥秘
你可能已经使用过诸如MySQL、Hive、ClickHouse、
Doris
、Spark和Flink等工具来编写SQL查询。
Light Gao
·
2023-12-03 06:21
数据仓库
sql
数据库
antlr4
AST
spark
AliExpress基于Flink的广告实时
数仓
建设
摘要:实时
数仓
以提供低延时数据指标为目的供业务实时决策,本文主要介绍基于Flink的广告实时
数仓
建设,主要包括以下内容:1.建设背景2.技术架构3.
数仓
架构4.实时OLAP5.实时保障6.未来规划建设背景广告是目前互联网流量变现的一种
王知无(import_bigdata)
·
2023-12-02 19:01
广告
大数据
编程语言
数据库
人工智能
docker踩坑记录:docker容器创建
doris
容器间无法通讯问题
背景:开发大数据平台,使用
doris
作为数据仓储,使用docker做集群部署,先进行开发环境搭建,环境为BE1;FE1,原来使用官方例子,但是官方例子是创建了一个bridge使用172.20.80.0/
Alaia.
·
2023-12-02 14:47
docker
容器
运维
亚马逊云科技re:Invent Peter DeSantis演讲,数据规模拓展无极限引领Serverless构建之路
Amazon全新发布RedshiftServerless:Al模型预测多维度
数仓
工作负载并自动调度和优化,高达10倍性价比提升。Amazon全新发布ElastiCacheServ
Zaker科技
·
2023-12-02 13:32
科技
serverless
云原生
【Spark
数仓
项目】需求八:MySQL的DataX全量导入和增量导入Hive
【Spark
数仓
项目】需求八:MySQL的DataX全量导入和增量导入Hive文章目录一、mysql全量导入hive[分区表]需求介绍:二、mysql增量导入hive1.增量导入的第一种实现方法2.另一种方法是时间字段
程序终结者
·
2023-12-02 10:22
spark
mysql
hive
Doris
数据导入二:Stream Load 方式
Streamload是一个同步的导入方式,用户通过发送HTTP协议发送请求将本地文件或数据流导入到
Doris
中。Streamload同步执行导入并返回导入结果。
shangjg3
·
2023-12-02 10:22
Doris
大数据
数据仓库
doris
sql
Doris
上卷(Rollup)和前缀索引
1基本概念在
Doris
中,我们将用户通过建表语句创建出来的表称为Base表(BaseTable)。Base表中保存着按用户建表语句指定的方式存储的基础数据。
shangjg3
·
2023-12-02 10:21
Doris
sql
doris
大数据
数据仓库
Doris
外部表
DorisODBC外部表ODBCExternalTableOfDoris提供了
Doris
通过数据库访问的标准接口(ODBC)来访问外部表,外部表省去了繁琐的数据导入工作,让
Doris
可以具有了访问各式数据库的能力
shangjg3
·
2023-12-02 10:21
Doris
大数据
数据仓库
doris
sql
Doris
数据导入一:Broker Load 方式
1.
Doris
导入数据的方式总结导入(Load)功能就是将用户的原始数据导入到
Doris
中。导入成功后,用户即可通过Mysql客户端查询数据。
shangjg3
·
2023-12-02 10:18
Doris
大数据
数据仓库
doris
sql
2023.11.29 -hmzx电商平台建设项目 -核销主题阶段总结
目录1.准备源数据2.准备
数仓
工具进行源数据同步到ods层,本项目使用Datax3.使用Datax完成数据同步前建表时的方案选择3.1同步方式区别:3.2存储格式和压缩区别:4.在hive中创建表,共31
白白的wj
·
2023-12-02 09:53
数据仓库
大数据
hive
hadoop
数据库开发
etl
etl工程师
用 CloudCanal 快速验证阿里云 EMR for StarRocks 和
Doris
背景StarRocks和
Doris
是近两年来相当流行的、国产的、开源的实时
数仓
,不仅数据检索、分析能力出众,而且数据准备实时性好、准确度高、使用丝滑,可如同在线数据库般使用。
ClouGence
·
2023-12-02 08:47
CloudCanal
CloudDM
阿里云
云计算
直播电商数据仓库
直播电商数据仓库一.
数仓
及其维度什么是
数仓
数据仓库,简称
数仓
,(DataWarehouse)。
李昊哲小课
·
2023-12-01 21:31
数据分析
大数据
数据库
数据仓库
大数据
数据分析
数据可视化
数据库
数据库开发
finebi
尚硅谷大数据项目《在线教育之实时
数仓
》笔记008
视频地址:尚硅谷大数据项目《在线教育之实时
数仓
》_哔哩哔哩_bilibili目录第10章
数仓
开发之DWS层P066P067P068P069P070P071P072P073P074P075P076P077P078P079P080P081P082
upward337
·
2023-12-01 16:14
#
大数据数仓
大数据
实时数仓
hadoop
zookeeper
kafka
flink
maxwell
Python连接Doirs查询实战
问题背景有客户提出来他们的客户端是Python的,需要使用Python语言查询
Doris
。
wangleigiser
·
2023-12-01 15:47
Doris
python
开发语言
上一页
7
8
9
10
11
12
13
14
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他