E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
数仓电商项目
项目实战-知行教育大数据分析平台-01
目录一、业务流程二、项目架构流程三、clouderamanager(CM)基本介绍四、项目环境搭建五、维度分析六、
数仓
建模1、维度建模2、什么是事实表与维度表3、事实表与维度表的分类4、维度建模的三种模型
吆喝的翅膀
·
2024-01-15 04:22
python+大数据学习
数据仓库
教育电商
hive
hadoop
cloudera
clickhouse常规的优化方法
一、建表优化1.1日期字段避免使用String存储建表时能用数值型或日期时间型表示的字段就不要用字符串,全String类型在以Hive为中心的
数仓
建设中常见,但ClickHouse环境不应受此影响。
运维仙人
·
2024-01-15 01:08
大数据
clickhouse
大数据
统一OLAP查询平台之语义层
产品和应用讨论分析指标,并拉上
数仓
和业务一起确认指标。
数仓
理解指标,并开始数据加工。首先,从ODS层开
XianMing的博客
·
2024-01-14 11:27
olap
数据仓库
语义分析
数据仓库(1)-总览
整体大纲如下,分为8个部分,包括认识
数仓
,
数仓
模型建设,元数据管理,指标体系,数据质量,数据安全,数据治理,实时技术。
XianMing的博客
·
2024-01-14 11:27
数据仓库
数据仓库
数据仓库(2)-认识
数仓
1、数据仓库是什么数据仓库,由数据仓库之父比尔·恩门(BillInmon)于1990年提出,主要功能仍是将组织透过资讯系统之联机事务处理(OLTP)经年累月所累积的大量资料,透过数据仓库理论所特有的资料储存架构,做有系统的分析整理,以利各种分析方法如联机分析处理(OLAP)、数据挖掘(DataMining)之进行,并进而支持如决策支持系统(DSS)、主管资讯系统(EIS)之创建,帮助决策者能快速有
XianMing的博客
·
2024-01-14 10:53
数据仓库
数据仓库
spark
大数据
长龙航空HTAP实践:统一技术栈,高效构建在线服务与轻量实时
数仓
浙江长龙航空有限公司(以下简称“长龙航空”)是浙江省唯一的本土总部型客货综合公共运输航空公司,拥有国内国际、客运货运全牌照航空运输资质,属于中大型航空公司,居民营航空公司前列,自2011年成立至今,累计开通国内外客货运航线近600条,覆盖全国并通达日韩、港澳、东南亚、中亚等“一带一路”沿线国家和地区的170余个城市。在现代航空业运营中,高效的数据管理和可靠的数据库系统是成功运营的关键要素之一。长龙
OceanBase数据库官方博客
·
2024-01-14 07:30
oceanbase
数据库
数仓
搭建——DWD层
1DWD层(用户行为日志)1.1日志解析思路页面埋点日志启动日志思路1.2get_json_object函数使用数据[{"name":"大郎","sex":"男","age":"25"},{"name":"西门庆","sex":"男","age":"47"}]取出第一个json对象hive(gmall)>selectget_json_object('[{"name":"大郎","sex":"男",
丝丝呀
·
2024-01-14 06:10
java
json
开发语言
数据仓库-离线
数仓
(基于物流
数仓
)
1、数据仓库概述1.1、数据仓库概念数据仓库是一个为数据分析而设计的企业级数据管理系统。数据仓库可集中、整合多个信息源的大量数据,借助数据仓库的分析能力,企业可从数据中获得宝贵的信息进而改进决策。同时,随着时间的推移,数据仓库中积累的大量历史数据对于数据科学家和业务分析师也是十分宝贵的。1.2、数据仓库核心架构2、数据仓库建模概述2.1、数据仓库建模的意义如果把数据看作图书馆里的书,我们希望看到它
小鱼干换酒钱
·
2024-01-14 06:39
#
物流数仓
数据仓库
hive
数仓
学习笔记(5)——
数仓
搭建(DWD层)
目录一、
数仓
搭建——DWD层1、DWD层(用户行为日志)1.1日志解析思路1.2get_json_object函数使用1.3启动日志表1.4页面日志表1.5动作日志表1.6曝光日志表1.7错误日志表1.8DWD
默萧756
·
2024-01-14 06:35
学习
大数据
数仓
数仓
笔记(五)-DWD层,DWS层
数仓
搭建DWD层1)对用户行为数据解析2)对业务数据采用维度模型重新建模6.1DWD层(用户行为日志)1)日志结构回顾(1)页面埋点日志(2)启动日志2)日志解析思路6.1.2get_json_object
芝士雪豹.
·
2024-01-14 06:33
java
开发语言
hive
大数据
离线
数仓
(十三) --------- DWD 层搭建
目录前言一、DWD层(用户行为日志)1.日志解析思路2.get_json_object函数使用3.启动日志表4.页面日志表5.动作日志表6.曝光日志表7.错误日志表8.DWD层用户行为数据加载脚本二、DWD层(业务数据)1.评价事实表(事务型事实表)2.订单明细事实表(事务型事实表)3.退单事实表(事务型事实表)4.加购事实表(周期型快照事实表,每日快照)5.收藏事实表(周期型快照事实表,每日快照
在森林中麋了鹿
·
2024-01-14 06:02
大数据项目
java
json
数据库
企业级大数据项目【4】
数仓
-业务域ODS-DWD-ADS开发篇
1概要说明业务域的数据来自业务系统的数据库通过sqoop(或datax)抽取到
数仓
的ods层在ods层对有需要的表进行增量合并,字段选择,反范式话,形成dwd明细层表在明细层基础上,进行各类主题的数据统计
江湖人称涛哥
·
2024-01-14 06:32
物流实时
数仓
ODS层——Mysql到Kafka
目录1.采集流程2.项目架构3.resources目录下的log4j.properties文件4.依赖5.ODS层——OdsApp6.环境入口类——CreateEnvUtil7.kafka工具类——KafkaUtil8.启动集群项目这一层要从Mysql读取数据,分为事实数据和维度数据,将不同类型的数据进行不同的ETL处理,发送到kakfa中。代码1.采集流程2.项目架构3.resources目录下
雷神乐乐
·
2024-01-14 06:01
#
实时数仓项目
大数据
数据仓库
flink
kafka
物流实时
数仓
DWD层——1.准备工作
目录1.创建主程序——DwdOrderRelevantApp类2.创建DWD层的事实表——来源于订单表和订单明细表(1)创建订单表实体类(2)创建订单明细表实体类(3)创建交易域:下单事务事实表实体类,并整合(1)与(2),采用下单时间(4)创建交易域:支付成功事务事实表实体类,并整合(1)与(2),采用支付时间和支付状态(5)创建物流域:揽收(接单)事务事实表实体类,并整合(1)与(2),采用揽
雷神乐乐
·
2024-01-14 06:57
#
实时数仓项目
大数据
flink
java
数据仓库
交通物流
Hive命令行运行SQL将数据保存到本地如何去除日志信息
1.场景分析先有需求需要查询hive
数仓
数据并将结果保存到本地,但是在操作过程中总会有日志信息和表头信息一起保存到本地,不符合业务需要,那如何才能解决该问题呢?
tuoluzhe8521
·
2024-01-14 05:01
Hive相关
hive
sql
hadoop
美团点评实时
数仓
平台演进与实践
1.摘要数据仓库的建设是“数据智能”必不可少的一环,也是大规模数据应用中必然面临的挑战,而Flink实时
数仓
在数据链路中扮演着极为重要的角色。
笔名辉哥
·
2024-01-14 02:50
数仓
建模—埋点设计与管理
数据仓库系列文章(部分已出,持续更新)
数仓
架构发展史
数仓
建模方法论
数仓
建模分层理论
数仓
建模—宽表的设计
数仓
建模—指标体系数据仓库之拉链表
数仓
—数据集成
数仓
—数据集市
数仓
—商业智能系统
数仓
—埋点设计与管理
数仓
大数据技术派
·
2024-01-14 01:22
hiveSQL任务执行时间过长
从业务或者其他方面优化4、从接口层取数前期的
数仓
设计不合理或者临时性
amberwest
·
2024-01-13 22:16
big
data
数据仓库
hive
数据仓库Apache Hive
为了分析数据而来数据分析的平台2、数据仓库的特性3、数据仓库和数据库的区别OLTP系统OLAP系统注意:这里要解决一个核心的误区:
数仓
绝不是大型数据库。
江枫渔火R
·
2024-01-13 09:29
数据仓库
apache
hive
大数据
2022-02-01大数据学习日志——Hadoop离线阶段——数据仓库、Apache Hive
学习目标理解
数仓
概念、起源由来理解
数仓
(OLAP)与数据库(OLTP)区别掌握
数仓
分层架构思想掌握ApacheHive功能与架构组件理解ApacheHive远程模式部署安装内容大纲#数据仓库基础核心知识
王络不稳定
·
2024-01-13 09:28
数据仓库
big
data
hive
数据仓库 & Apache Hive
一、数据分析1、数据仓库数据仓库(英语:DataWarehouse,简称
数仓
、DW),是一个用于存储、分析、报告的数据系统。
杀神lwz
·
2024-01-13 09:52
大数据
数据分析
数据仓库
apache
hive
数仓
建设指南
数仓
建设指南数据模型架构规范数据层次的划分ODS:OperationalDataStore,操作数据层,在结构上其与源系统的增量或者全量数据基本保持一致。
左美美  ̄
·
2024-01-13 06:04
java
大数据
数据仓库
大数据开发工程师需要具备哪些技能?
在回答这个问题之前,需要充分了解一下当前大数据的几个就业方向,可以参考下主流互联网行业的部门架构、职责和JD,大数据开发工程师,总体来说有这么几类,不同的公司叫法不一样:1、
数仓
开发工程师2、算法挖掘工程师
郑小柒是西索啊
·
2024-01-12 21:58
大数据
Databend 开源周报第 127 期
Databend是一款现代云
数仓
。专为弹性和高效设计,为您的大规模分析需求保驾护航。自由且开源。即刻体验云服务:https://app.databend.cn。
Databend
·
2024-01-12 20:45
数据库
开源
数据交付变革:研发到产运自助化的转型之路
作者|Chris导读本文讲述为了提升产运侧数据观察、分析、决策的效率,支持业务的快速迭代,移动生态数据研发部对
数仓
建模与BI工具完成升级,采用宽表建模与TDA平台相结合的方案,一站式自助解决数据应用需求
百度Geek说
·
2024-01-12 16:14
信息可视化
数据分析
数据挖掘
数仓建模
BI工具
GBASE南大通用 GBase 8a 产品构建
数仓
系统架构
lGBASE南大通用GBase8a产品构建
数仓
应用的系统架构:架构技术实现特点适用场景独立数据仓库(集市)系统架构一套GBase8a物理集群适用于数据规模较小的业务场景适用于各业务之间数据互访较频繁的业务场景适用于单一独立的业务场景企业级
数仓
系统架构多套
GBASE数据库
·
2024-01-12 12:04
数据库
GBASE南大通用
GBASE
【DolphinScheduler】datax读取hive分区表时,空分区、分区无数据任务报错问题解决
问题背景:最近在使用海豚调度DolphinScheduler的Datax组件时,遇到这么一个问题:之前给客户使用海豚做的离线
数仓
的分层搭建,一直都运行好好的,过了个元旦,这几天突然在
数仓
做任务时报错,具体报错信息如下
Alex_81D
·
2024-01-12 08:49
部署项目相关
大数据基础
数据治理
hive
hadoop
数据仓库
【大数据面试】常见
数仓
建模面试题附答案
数仓
架构为什么要分层?事实表的类型?维度建模步骤?维度建模的三种模式?
数仓
架构进化?数据仓库如何保证数据质量?开发流程/你们是怎么测试的?维度建模过程?维度建模的三种模式?事实表都有哪几种?
话数Science
·
2024-01-12 07:28
面试
大数据
大数据
Hive解析json数组
在使用Hive搭建数据仓库,处理数据时,同传统
数仓
的结构化数据不同,我们经常会遇到一些非结构化的数据,json格式的字符串就是常见的一种类型。
风筝flying
·
2024-01-12 03:47
网赚很难,这样走就对了
目前主要从事游戏装备项目、日本跨境电商和国内
电商项目
(很多模式都已完全成型,背后也有帮手,所以我才能这么清闲的出来做分享)。好了,言归正传,今天说点什么好呢?就聊聊这10年来
虚拟资源创业军团
·
2024-01-12 03:10
创业故事
创业项目
网赚项目
互联网创业项目
网赚项目
创业故事
互联网轻资产项目
虚拟资源项目
跨境电商
【Databend】数据类型
文章目录数据类型列表转换数据类型数据类型扩展整数类型布尔类型浮点数类型字符串类型日期时间类型其它数据类型总结数据类型列表Databend作为一款开源、弹性、低成本,基于对象存储也可以做实时分析的新式
数仓
有请小发菜
·
2024-01-11 17:08
Databend
数据库
mysql
python
rust
Apache Flink 和 Paimon 在自如数据集成场景中的使用
业务背景自如目前线上有基于Hive的离线
数仓
和基于Flink、Kafka的实时
数仓
,随着业务发展,我们也在探索引入湖仓一体的架构更好的支持业务,我们对比了Iceberg、Hudi、Paimon后,最终选择
Apache Flink
·
2024-01-11 13:09
apache
flink
大数据
亚信安慧AntDB团队引领数据库创新浪潮
该数据库经过多次迭代,形成了完整的“超融合流式实时
数仓
”体系,为通信运营商和各行业提供卓越的服务
亚信安慧AntDB数据库
·
2024-01-11 12:48
数据库
人工智能
大数据
antdb
antdb数据库
基于Hologres+Flink的曹操出行实时
数仓
建设作者:林震|曹操出行实时计算负责人
作者:林震|曹操出行实时计算负责人曹操出行业务背景介绍曹操出行创立于2015年5月21日,是吉利控股集团布局“新能源汽车共享生态”的战略性投资业务,以“科技重塑绿色共享出行”为使命,将全球领先的互联网、车联网、自动驾驶技术以及新能源科技,创新应用于共享出行领域,以“用心服务国民出行”为品牌主张,致力于打造服务口碑最好的出行品牌。作为一家互联网出行平台,主要提供了网约车、顺风车、专车等一些出行服务。
阿里云大数据AI技术
·
2024-01-11 09:40
flink
大数据
离线
数仓
构建案例一
数据采集日志数据(文件)到Kafka自己写个程序模拟一些用户的行为数据,这些数据存在一个文件夹中。接着使用flume监控采集这些文件,然后发送给kafka中待消费。1、flume采集配置文件监控文件将数据发给kafka的flume配置文件:#定义组件a1.sources=r1a1.channels=c1#配置sourcea1.sources.r1.type=TAILDIRa1.sources.r1
躺着听Jay
·
2024-01-10 22:06
大数据
big
data
大数据
数仓
规范
目录:一、数据模型架构原则
数仓
分层原则主题域划分原则数据
听雪10
·
2024-01-10 15:37
hive基础知识大全
一、Hive基本概念1.1hive是什么hive是基于hadoop的一个
数仓
分析工具,hive可以将hdfs上存储的结构化的数据,映射成一张表,然后让用户写HQL(类SQL)来分析数据telupdown138383843813451567138383843953451567138383844012411657713838384413453157571383838434353551567567
不爱吃鱼的馋猫
·
2024-01-09 13:23
hive
数据仓库
数仓
分层结构
--图片来源尚硅谷ODS层:数据存储格式:JSON/TSV+gzip压缩(默认)OperateDataStore--存储从mysql业务数据库和日志服务器的日志文件中采集到的数据--日志数据--格式:JSON--业务数据--历史数据--格式:--全量--Datax:TSV--增量--Maxwell:JSON--汇总数据--希望用最少的资源存储最多的数据--压缩:--gzip:Hadoop默认支持的
Young_IT
·
2024-01-09 06:40
大数据开发
大数据技术
大数据
数据仓库
某大厂大数据开发-外包面试
4.spark用过吗,用到的开发工具5.数据量多少,服务器台数6.
数仓
每层做了什么事,为什么这样做?
劝学-大数据
·
2024-01-09 06:42
面试
职场和发展
大数据
流式湖仓增强,Hologres + Flink 构建企业级实时
数仓
流式湖仓增强,Hologres+Flink构建企业级实时
数仓
一、Hologres+Flink,阿里云上众多客户实时
数仓
的首选随着大数据从规模化走向实时化,实时数据的需求覆盖互联网、交通、传媒、金融、政府等各个领域
Elivis Hu
·
2024-01-08 22:52
数仓
flink
大数据
数仓
建设学习路线(二)模型建设(1)
OLTPVSOLAPOLTP概念全称OnLineTransactionProcessing,中文名联机事务处理系统,主要是执行基本日常的事务处理,比如数据库记录的增删查改,例如mysql、oracle。OLAP概念全称OnLineAnalyticalProcessing,中文名联机分析处理系统,支持复杂的分析操作,侧重决策支持,并且提供直观易懂的查询结果,例如、ClickHouse、Doris、K
语兴数据
·
2024-01-08 18:58
数仓建设-学习路线
大数据
数据仓库
人工智能
数仓
建设学习路线(一)
前言
数仓
建设实践路线是语兴发布在B站的系列课程,搜索语兴呀即可学习完整的
数仓
建设理论。大数据相关岗位大数据常见的岗位主要包括实时开发、数据治理、数据安全、数据资产等。
语兴数据
·
2024-01-08 18:57
数仓建设-学习路线
大数据
数据仓库
人工智能
数仓
建设学习路线(二)模型建设(2)
写在最前面本节内容主要讲解模型的具体设计过程,也是我们平常
数仓
工作中的重中之重。更多精彩课程关注B站语兴呀,或关注gzh:语数,获取全部课件资料。
语兴数据
·
2024-01-08 18:52
数仓建设-学习路线
大数据
数据仓库
大数据技术架构
整表同步数据量大,一般是
数仓
T+1方式同步,保证数据一条不丢;还
乘风踏羽
·
2024-01-08 17:47
数据平台
大数据
如何才能成长为一个架构师?
为了方便技术小伙伴理解架构师的工作职责,我这里拿一个具体的项目来分析,比如你们公司要开发一个
电商项目
,而公司的主营业务为短视频或者直播,也就是这个项目需要完全的从0到1的去落地。
架构随笔录
·
2024-01-08 05:14
超级架构师
java
微服务
开发语言
spring
cloud
alibaba
微服务架构
rocketmq
云原生
基于DataWorks+MaxCompute的公共电影票房数据预处理实践
实验内容:对MaxCompute
数仓
公共数据进行预处理,主要对maxcompute_public_data.dwd_product_movie_basic_info(电影基本信息,包含影片名、导演、编剧
周周的奇妙编程
·
2024-01-08 00:43
odps
数据库
服务器
Hive元数据迁移及升级方案
Hive的架构和工作原理简介Hive是基于Hadoop之上的
数仓
,便于用户可以基于SQL(HiveQL)进行数据分析,其架构图如下:从上图可知,Hive主要用来将建立结构化数据库和后端分布式结构化文件的映射
云原生大数据
·
2024-01-07 22:49
大数据技术
hive
hadoop
数据仓库
物流实时
数仓
:
数仓
搭建(DWS)二
系列文章目录物流实时
数仓
:采集通道搭建物流实时
数仓
:
数仓
搭建物流实时
数仓
:
数仓
搭建(DIM)物流实时
数仓
:
数仓
搭建(DWD)一物流实时
数仓
:
数仓
搭建(DWD)二物流实时
数仓
:
数仓
搭建(DWS)一物流实时
数仓
超哥--
·
2024-01-07 17:28
物流实时数仓
flink
大数据
java
数仓
知识点总结(面试常问)
目录1
数仓
1.1定义1.2特点1.3架构1.4
数仓
的分层架构1.5常见术语1.5.1实体1.5.2维度1.5.3度量1.5.4粒度1.5.5口径
南潇如梦
·
2024-01-07 15:52
面试
数据仓库
数据库
Bigdata
数仓
工具—Hive进阶之常见的StorageHandler(24)
这里我们介绍一下常见的StorageHandler,但是由于目前StorageHandler的种类还是比较多的,主要包括官方的和非官方的,我们使用的时候需要注意的是版本的兼容性。常见的StorageHandlerApacheHive提供了多个存储处理程序(StorageHandler),允许用户集成Hive查询和分析引擎与不同的底层存储系统。以下是一些常见的存储处理程序:HDFSStorageHa
不二人生
·
2024-01-07 15:07
#
Hive
hive
hadoop
数据仓库
上一页
1
2
3
4
5
6
7
8
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他