E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
实时计算(数仓)
Flink的ListState在小规模场景下的缓存提速和接口优化丰富的实践
1.背景笔者的大数据平台XSailboat中包含以DAG方式可视化的离线分析和
实时计算
的开发、运维功能。
OkGogooXSailboat
·
2024-01-17 18:36
大数据平台开发技术
flink
缓存
spring
Aviator表达式扩展--数组、列表负向序号索引以及自己的JSON库支持方括号([])赋值
1.背景笔者开发的大数据大数据平台XSailboat中的DataStudio模块包含基于DAG图的
实时计算
可视化开发功能,实现了Flink计算任务的可视化开发(想要了解更多,可以查看《Flink的DAG
OkGogooXSailboat
·
2024-01-17 18:36
大数据平台开发技术
json
java
Flink的Reduce算子,Name-Position形式的Row数据在使用保存点/检查点重新启动的时候,变成了Position-Based形式的Row解决
1.背景大数据平台XSailboat提供了基于ApacheFlink的
实时计算
管道开发功能。DataStudio的
实时计算
管道开发功能中提供了分区规约节点(keyBy+reduce)。
OkGogooXSailboat
·
2024-01-17 18:05
flink
python
大数据
2024.1.16 用户画像day01 - 项目介绍
技术选型:技术架构:项目架构:二.名词解释一.项目介绍整体流程:项目介绍-elasticSearch-业务数据源导入-离线指标开发-Flume实时采集-Nginx日志埋点数据-结构化流实时指标-制作报表
数仓
开发用户画像实时开发
白白的wj
·
2024-01-17 15:40
spark
大数据
分布式
python
kafka
zookeeper
hive
关于CarbonData+Spark SQL的一些应用实践和调优经验分享
行业亟需一个高效、统一的融合
数仓
,从海量数据中快速获取有效信息,从而洞察机遇、规避风险。
weixin_34075551
·
2024-01-17 15:31
大数据
人工智能
后端
数仓
数据含有特殊字符,如何更方便的导出成excel文件
如果遇到数据中含有特殊字符,"\n","\r","\t",或者其他的特殊分隔符在数据导出时造成错位,都用sql替换,但是需求是导出的数据要保持原有内容格式,就不能替换剔除这些特殊字符,这种情况下使用json方式1,在hive
数仓
建一个临时的
第一次看海
·
2024-01-17 15:00
1024程序员节
spark sql实践开发后端引擎
-------------“何以解忧,唯有暴富”需求开发一个系统,主要是将
数仓
中治理完用于检索的数据灌入Elasticsearch中,一般情况,开源的一些系
第一次看海
·
2024-01-17 14:28
spark
sql
大数据
【总结】Dinky学习笔记
概述Dinky是一个开箱即用、易扩展,以ApacheFlink为基础,连接OLAP和数据湖等众多框架的一站式
实时计算
平台,致力于流批一体和湖仓一体的探索与实践官网:Dinky核心特性沉浸式:提供专业的DataStudio
THE WHY
·
2024-01-17 04:11
Flink
大数据
Dinky
学习
笔记
flink
sql
大数据
数据库
Flink实例:状态管理State 过期时间TTL
1State过期时间TTL使用flink进行
实时计算
中,会遇到一些状态数不断累积,导致状态量越来越大的情形。
大数据供成屎
·
2024-01-17 01:44
flink
大数据
java
结构化流(Structured Streaming)
我们称之为无界数据对于无界数据,我们一般采用流式处理方案(
实时计算
)特点:1-数据没有明确的结束,也就是数据大小不固定2-数据是源源不
小希 fighting
·
2024-01-16 07:25
sql
大数据
spark
kafka
Hive使用shell调用命令行特殊字符处理
1.场景分析数据处理常用hive-e的方式,通过脚本操作
数仓
,过程中常常遇到特殊字符的处理,如单双引号、反斜杠、换行符等,现将特殊字符用法总结使用如下,可直接引用,避免自行测试的繁琐。
tuoluzhe8521
·
2024-01-16 07:17
Hive相关
hive
hadoop
数据仓库
ClickHouse - 01
批处理会将源业务系统中的数据通过数据抽取工具(例如Sqoop)将数据抽取到HDFS中,这个过程可以使用MapReduce、Spark、Flink技术对数据进行ETL清洗处理,也可以直接将数据抽取到Hive
数仓
中
ArthurHC
·
2024-01-16 02:17
数据库, 数据仓库, 数据集市,数据湖,数据中台
数据仓库和数据库的区别作者:南宫蓉出处:简书第一篇:数据仓库概述第二篇:数据库关系建模作者:穆晨出处:CNBLOS数据仓库、数据湖、数据集市、和数据中台的故事作者:Murkey学习之旅出处:csdn数据中台和
数仓
的关系作者
cxzhq2002
·
2024-01-16 01:26
数据库
mysql/oracle 数据库delete操作太慢(where ... in ...),不加索引,一招让性能提升百倍
比如在
数仓
项目中,软删虽然更快更安全,但是缺点也很多:1、软删造成数据冗余,甚至快速膨胀的后果。比如一些中间表,只是作为中转站,过两天数据就分配其他表了,不硬删的话就会造成数据快速膨胀。
大壮001
·
2024-01-15 23:30
大数据
数据库
数据库
mysql
oracle
sql
大数据
亚信安慧AntDB-S流式数据库实现企业数智化转型
AntDB-S流式数据库是一项针对实时
数仓
等场景的创新技术,旨在取代传统的流式处理引擎,从而简化开发和测试过程。该流式数据库具备强大的ACID特性和高可用性,为企业降低了流式业务开发和维护的成本。
亚信安慧AntDB数据库
·
2024-01-15 14:11
数据库
大数据
antdb数据库
antdb
国产开源优秀新一代MPP数据库StarRocks入门之旅-
数仓
新利器(上)
概述背景ApacheDoris官方地址https://doris.apache.org/ApacheDorisGitHub源码地址https://github.com/apache/incubator-dorisApacheDoris是一个现代化的MPP分析型数据库产品。仅需亚秒级响应时间即可获得查询结果,有效地支持实时数据分析。ApacheDoris的分布式架构非常简洁,易于运维,并且可以支持1
IT小神
·
2024-01-15 13:45
大数据
数据库
分布式
数据库
大数据
分布式
数仓
选型必列入考虑的OLAP列式数据库ClickHouse(中)
实战案例使用背景ELK作为老一代日志分析技术栈非常成熟,可以说是最为流行的大数据日志和搜索解决方案;主要设计组件及架构如下:而新一代日志监控选型如ClickHouse、StarRocks特别是近年来对ELK地位发起较大的挑战,不乏有许多的大公司如携程,快手已开始把自己的日志解决方案从ES迁移到了Clickhouse,将日志从ES迁移到ClickHouse可以节省更多的服务器资源,总体运维成本更低,
IT小神
·
2024-01-15 13:45
数据仓库
数据库
运维
数据库
elasticsearch
国产开源优秀新一代MPP数据库StarRocks入门之旅-
数仓
新利器(中)
概述背景ApacheDoris官方地址ApacheDorisApacheDorisGitHub源码地址GitHub-apache/incubator-doris:ApacheDoris(Incubating)isanMPP-basedinteractiveSQLdatawarehousingforreportingandanalysis.ApacheDoris是一个现代化的MPP分析型数据库产品。
Firstlucky77
·
2024-01-15 13:42
java
mysql
linux
大数据开发之Hive(基本概念、安装、数据类型、DDL数据定义、DML数据操作)
但是面对海量的数据和负责的业务逻辑,开发人员要编写MR对数据进行统计分析难度极大,所以就产生了Hive这个
数仓
工具。Hive可以帮助开发人员将SQL语句转化为MapReduce在yarn上跑。
Key-Key
·
2024-01-15 12:04
大数据
hive
hadoop
大数据开发之Hive(详细版,最后有实战训练)
但是面对海量的数据和负责的业务逻辑,开发人员要编写MR对数据进行统计分析难度极大,所以就产生了Hive这个
数仓
工具。Hive可以帮助开发人员将SQL语句转化为MapReduce在yarn上跑。
Key-Key
·
2024-01-15 12:29
hive
hadoop
大数据
项目实战-知行教育大数据分析平台-01
目录一、业务流程二、项目架构流程三、clouderamanager(CM)基本介绍四、项目环境搭建五、维度分析六、
数仓
建模1、维度建模2、什么是事实表与维度表3、事实表与维度表的分类4、维度建模的三种模型
吆喝的翅膀
·
2024-01-15 04:22
python+大数据学习
数据仓库
教育电商
hive
hadoop
cloudera
clickhouse常规的优化方法
一、建表优化1.1日期字段避免使用String存储建表时能用数值型或日期时间型表示的字段就不要用字符串,全String类型在以Hive为中心的
数仓
建设中常见,但ClickHouse环境不应受此影响。
运维仙人
·
2024-01-15 01:08
大数据
clickhouse
大数据
FPGA_ZYNQ (PS端)开发流程(Xilinx软件工具介绍)
【前言】1.1XilinxZynqSoC系列针对不同的应用领域,Xilinx公司设计开发了各种逻辑资源规模和集成各种外设功能的ZynqSOC器件,包括专为成本优化的Zynq-7000平台,面向高性能
实时计算
应用领域的
伊宇韵
·
2024-01-14 15:59
fpga开发
PiflowX如何快速开发flink程序
如何快速开发flink程序参考资料Flink最锋利的武器:FlinkSQL入门和实战|附完整实现代码-腾讯云开发者社区-腾讯云(tencent.com)FlinkSQL背景FlinkSQL是Flink
实时计算
为简化计算模型
暗影八度
·
2024-01-14 14:58
PiflowX
flink
大数据
spark
hadoop
big
data
统一OLAP查询平台之语义层
产品和应用讨论分析指标,并拉上
数仓
和业务一起确认指标。
数仓
理解指标,并开始数据加工。首先,从ODS层开
XianMing的博客
·
2024-01-14 11:27
olap
数据仓库
语义分析
数据仓库(1)-总览
整体大纲如下,分为8个部分,包括认识
数仓
,
数仓
模型建设,元数据管理,指标体系,数据质量,数据安全,数据治理,实时技术。
XianMing的博客
·
2024-01-14 11:27
数据仓库
数据仓库
数据仓库(2)-认识
数仓
1、数据仓库是什么数据仓库,由数据仓库之父比尔·恩门(BillInmon)于1990年提出,主要功能仍是将组织透过资讯系统之联机事务处理(OLTP)经年累月所累积的大量资料,透过数据仓库理论所特有的资料储存架构,做有系统的分析整理,以利各种分析方法如联机分析处理(OLAP)、数据挖掘(DataMining)之进行,并进而支持如决策支持系统(DSS)、主管资讯系统(EIS)之创建,帮助决策者能快速有
XianMing的博客
·
2024-01-14 10:53
数据仓库
数据仓库
spark
大数据
计算机毕业设计吊炸天spark+hive+nlp慕课在线教育课程数据分析可视化大屏 知识图谱课程推荐系统 课程爬虫 文本分类 LSTM情感分析 大数据毕业设计
将.csv上传到hdfs中,并使用hive建表后导入.csv数据;9个指标,一半使用spark/scala去做
实时计算
分析。一半使用hive_sql进行分层离线处
计算机毕业设计大神
·
2024-01-14 09:48
长龙航空HTAP实践:统一技术栈,高效构建在线服务与轻量实时
数仓
浙江长龙航空有限公司(以下简称“长龙航空”)是浙江省唯一的本土总部型客货综合公共运输航空公司,拥有国内国际、客运货运全牌照航空运输资质,属于中大型航空公司,居民营航空公司前列,自2011年成立至今,累计开通国内外客货运航线近600条,覆盖全国并通达日韩、港澳、东南亚、中亚等“一带一路”沿线国家和地区的170余个城市。在现代航空业运营中,高效的数据管理和可靠的数据库系统是成功运营的关键要素之一。长龙
OceanBase数据库官方博客
·
2024-01-14 07:30
oceanbase
数据库
数仓
搭建——DWD层
1DWD层(用户行为日志)1.1日志解析思路页面埋点日志启动日志思路1.2get_json_object函数使用数据[{"name":"大郎","sex":"男","age":"25"},{"name":"西门庆","sex":"男","age":"47"}]取出第一个json对象hive(gmall)>selectget_json_object('[{"name":"大郎","sex":"男",
丝丝呀
·
2024-01-14 06:10
java
json
开发语言
数据仓库-离线
数仓
(基于物流
数仓
)
1、数据仓库概述1.1、数据仓库概念数据仓库是一个为数据分析而设计的企业级数据管理系统。数据仓库可集中、整合多个信息源的大量数据,借助数据仓库的分析能力,企业可从数据中获得宝贵的信息进而改进决策。同时,随着时间的推移,数据仓库中积累的大量历史数据对于数据科学家和业务分析师也是十分宝贵的。1.2、数据仓库核心架构2、数据仓库建模概述2.1、数据仓库建模的意义如果把数据看作图书馆里的书,我们希望看到它
小鱼干换酒钱
·
2024-01-14 06:39
#
物流数仓
数据仓库
hive
数仓
学习笔记(5)——
数仓
搭建(DWD层)
目录一、
数仓
搭建——DWD层1、DWD层(用户行为日志)1.1日志解析思路1.2get_json_object函数使用1.3启动日志表1.4页面日志表1.5动作日志表1.6曝光日志表1.7错误日志表1.8DWD
默萧756
·
2024-01-14 06:35
学习
大数据
数仓
数仓
笔记(五)-DWD层,DWS层
数仓
搭建DWD层1)对用户行为数据解析2)对业务数据采用维度模型重新建模6.1DWD层(用户行为日志)1)日志结构回顾(1)页面埋点日志(2)启动日志2)日志解析思路6.1.2get_json_object
芝士雪豹.
·
2024-01-14 06:33
java
开发语言
hive
大数据
离线
数仓
(十三) --------- DWD 层搭建
目录前言一、DWD层(用户行为日志)1.日志解析思路2.get_json_object函数使用3.启动日志表4.页面日志表5.动作日志表6.曝光日志表7.错误日志表8.DWD层用户行为数据加载脚本二、DWD层(业务数据)1.评价事实表(事务型事实表)2.订单明细事实表(事务型事实表)3.退单事实表(事务型事实表)4.加购事实表(周期型快照事实表,每日快照)5.收藏事实表(周期型快照事实表,每日快照
在森林中麋了鹿
·
2024-01-14 06:02
大数据项目
java
json
数据库
企业级大数据项目【4】
数仓
-业务域ODS-DWD-ADS开发篇
1概要说明业务域的数据来自业务系统的数据库通过sqoop(或datax)抽取到
数仓
的ods层在ods层对有需要的表进行增量合并,字段选择,反范式话,形成dwd明细层表在明细层基础上,进行各类主题的数据统计
江湖人称涛哥
·
2024-01-14 06:32
物流实时
数仓
ODS层——Mysql到Kafka
目录1.采集流程2.项目架构3.resources目录下的log4j.properties文件4.依赖5.ODS层——OdsApp6.环境入口类——CreateEnvUtil7.kafka工具类——KafkaUtil8.启动集群项目这一层要从Mysql读取数据,分为事实数据和维度数据,将不同类型的数据进行不同的ETL处理,发送到kakfa中。代码1.采集流程2.项目架构3.resources目录下
雷神乐乐
·
2024-01-14 06:01
#
实时数仓项目
大数据
数据仓库
flink
kafka
物流实时
数仓
DWD层——1.准备工作
目录1.创建主程序——DwdOrderRelevantApp类2.创建DWD层的事实表——来源于订单表和订单明细表(1)创建订单表实体类(2)创建订单明细表实体类(3)创建交易域:下单事务事实表实体类,并整合(1)与(2),采用下单时间(4)创建交易域:支付成功事务事实表实体类,并整合(1)与(2),采用支付时间和支付状态(5)创建物流域:揽收(接单)事务事实表实体类,并整合(1)与(2),采用揽
雷神乐乐
·
2024-01-14 06:57
#
实时数仓项目
大数据
flink
java
数据仓库
交通物流
Hive命令行运行SQL将数据保存到本地如何去除日志信息
1.场景分析先有需求需要查询hive
数仓
数据并将结果保存到本地,但是在操作过程中总会有日志信息和表头信息一起保存到本地,不符合业务需要,那如何才能解决该问题呢?
tuoluzhe8521
·
2024-01-14 05:01
Hive相关
hive
sql
hadoop
美团点评实时
数仓
平台演进与实践
1.摘要数据仓库的建设是“数据智能”必不可少的一环,也是大规模数据应用中必然面临的挑战,而Flink实时
数仓
在数据链路中扮演着极为重要的角色。
笔名辉哥
·
2024-01-14 02:50
数仓
建模—埋点设计与管理
数据仓库系列文章(部分已出,持续更新)
数仓
架构发展史
数仓
建模方法论
数仓
建模分层理论
数仓
建模—宽表的设计
数仓
建模—指标体系数据仓库之拉链表
数仓
—数据集成
数仓
—数据集市
数仓
—商业智能系统
数仓
—埋点设计与管理
数仓
大数据技术派
·
2024-01-14 01:22
hiveSQL任务执行时间过长
从业务或者其他方面优化4、从接口层取数前期的
数仓
设计不合理或者临时性
amberwest
·
2024-01-13 22:16
big
data
数据仓库
hive
数据仓库Apache Hive
为了分析数据而来数据分析的平台2、数据仓库的特性3、数据仓库和数据库的区别OLTP系统OLAP系统注意:这里要解决一个核心的误区:
数仓
绝不是大型数据库。
江枫渔火R
·
2024-01-13 09:29
数据仓库
apache
hive
大数据
2022-02-01大数据学习日志——Hadoop离线阶段——数据仓库、Apache Hive
学习目标理解
数仓
概念、起源由来理解
数仓
(OLAP)与数据库(OLTP)区别掌握
数仓
分层架构思想掌握ApacheHive功能与架构组件理解ApacheHive远程模式部署安装内容大纲#数据仓库基础核心知识
王络不稳定
·
2024-01-13 09:28
数据仓库
big
data
hive
数据仓库 & Apache Hive
一、数据分析1、数据仓库数据仓库(英语:DataWarehouse,简称
数仓
、DW),是一个用于存储、分析、报告的数据系统。
杀神lwz
·
2024-01-13 09:52
大数据
数据分析
数据仓库
apache
hive
数仓
建设指南
数仓
建设指南数据模型架构规范数据层次的划分ODS:OperationalDataStore,操作数据层,在结构上其与源系统的增量或者全量数据基本保持一致。
左美美  ̄
·
2024-01-13 06:04
java
大数据
数据仓库
Spark Streaming
人们对于大数据的实时性处理要求也在不断提高,传统的MapReduce等批处理框架在某些特定领域,例如实时用户推荐、用户行为分析这些应用场景上逐渐不能满足人们对实时性的需求,因此诞生了一批如S3、Samza、Storm、Flink等流式分析、
实时计算
框架
奋斗的蛐蛐
·
2024-01-13 06:13
大数据开发工程师需要具备哪些技能?
在回答这个问题之前,需要充分了解一下当前大数据的几个就业方向,可以参考下主流互联网行业的部门架构、职责和JD,大数据开发工程师,总体来说有这么几类,不同的公司叫法不一样:1、
数仓
开发工程师2、算法挖掘工程师
郑小柒是西索啊
·
2024-01-12 21:58
大数据
Databend 开源周报第 127 期
Databend是一款现代云
数仓
。专为弹性和高效设计,为您的大规模分析需求保驾护航。自由且开源。即刻体验云服务:https://app.databend.cn。
Databend
·
2024-01-12 20:45
数据库
开源
数据交付变革:研发到产运自助化的转型之路
作者|Chris导读本文讲述为了提升产运侧数据观察、分析、决策的效率,支持业务的快速迭代,移动生态数据研发部对
数仓
建模与BI工具完成升级,采用宽表建模与TDA平台相结合的方案,一站式自助解决数据应用需求
百度Geek说
·
2024-01-12 16:14
信息可视化
数据分析
数据挖掘
数仓建模
BI工具
GBASE南大通用 GBase 8a 产品构建
数仓
系统架构
lGBASE南大通用GBase8a产品构建
数仓
应用的系统架构:架构技术实现特点适用场景独立数据仓库(集市)系统架构一套GBase8a物理集群适用于数据规模较小的业务场景适用于各业务之间数据互访较频繁的业务场景适用于单一独立的业务场景企业级
数仓
系统架构多套
GBASE数据库
·
2024-01-12 12:04
数据库
GBASE南大通用
GBASE
上一页
1
2
3
4
5
6
7
8
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他