小万君

新老DataHub迁移手册

原文链接

DataHub服务用户迁移文档

前言

原Odps版内测DataHub（下文统称为老DataHub服务），于2016年11月21日起已经处于维护状态，新版DataHub届时已经开启公测，公测至今已有半年以上时间，我们决定开始逐步下线老DataHub服务，老版部分用户需要迁移至新版DataHub。

新版本具有更多的特性，性能功能都有不少提升，可以同时支持数据一份数据同步到Odps、OSS、ElasticSearch等多个不同服务中，且提供WebConsole控制台进行更简单的操作。

准备工作

本文档针对使用Logstash、Fluentd、Flume以及使用SDK写入老DataHub服务的用户，提供迁移到新服务的指引，过程中遇到任何困难可以联系我们

新版DataHub相关文档

DataHub产品使用文档

DataHub控制台

创建新datahub project

新版DataHub中存在项目空间-Project概念，与Odps中Project类似，但是不等于Odps中的Project，为了方便管理，我们建议迁移时在DataHub中创建与Odps Project同名的Project（不同名称也可以）

登录DataHub官网控制台，使用阿里云账号登录；
点击创建Project，输入名称及描述，点击创建（Project描述中建议携带Project用处及Owner的邮箱或联系方式）

创建新DataHub topic

新版DataHub存在主题-Topic的概念，与Odps的Table类似，但是不等于Odps的Table，通常如果是需要导入数据到Odps的话，需要为每张表创建一个Topic，且字段类型、顺序与名称需要一致，Odps中的分区字段当做普通的Topic字段处理，新版DataHub会根据该分区字段再DataHub中的数据值，将数据同步到Odps离线表中。

例如：

MaxCompute表： table_test(f1 string, f2 string, f3 double) partitioned by (ds string, pt string)
对应Topic应为如下的Schema:
Topic: topic_test(f1 string, f2 string, f3 double, ds string, pt string)

创建Topic可以通过以下方式：

若Topic数量较少，可以再WebConsole控制台，进入Project页面后点击创建Topic按钮，选择从MaxCompute导入，输入配置信息后勾选“自动创建DataConnector”，点击“导入表结构”即可导入odps表对应的格式，确认格式无误后选择Shard数量及生命周期， Shard数量建议与老服务一样，生命周期建议3天，点击创建即可。
若Topic过多，可以使用迁移工具DataHub表结构迁移工具,工具将对列表中的所有表创建对应Topic及Connector。

DataHub与MaxCompute字段类型对应表

MaxCompute表中的类型	DataHub Topic中的类型
STRING	STRING
DOUBLE	DOUBLE
BIGINT	BIGINT
DATETIME	TIMESTAMP (注：以微秒为度量单位)
BOOLEAN	BOOLEAN
DECIMAL	不支持
MAP	不支持
ARRAY	不支持

映射Odps分区

老DataHub在写入数据时需要直接指定分区，如果是通过fluend或logstash等插件写入的用户是需要配置分区信息或者通过某个时间字段转为固定格式作为分区

新版DataHub在这一行为上有所改变，Odps表的分区字段再DataHub中将会变成一个普通字段，后台Connector同步任务在同步数据到Odps表时会根据分区字段比如pt具体每条记录的值写入Odps对应分区中。

例如：

MaxCompute表： table_test(f1 string, f2 string, f3 double) partitioned by (ds string, pt string)
对应Topic应为如下的Schema:
Topic: topic_test(f1 string, f2 string, f3 double, ds string, pt string)
数据1： ("test", "test", "0.14", "a1", "20170405")
数据2： ("test", "test", "0.14", "aa", "20170406")
则数据1将会同步到odps分区ds=a1,pt=20170405
则数据2将会同步到odps分区ds=a2,pt=20170406

若使用插件导入，并且是通过字符串转换为固定格式的分区值的用户，新的插件需要使用fluentd/logstash的filter功能，对分区字段的值进行转换，具体使用方式可以参考这些开源工具的官方文档

不同类型接入方式迁移

使用Java SDK

需要换成新版本DataHub的SDK，Mvn依赖变化

原依赖

<dependency>
    <groupId>com.aliyun.odpsgroupId>
    <artifactId>odps-sdk-coreartifactId>
    <version>0.xxxversion>
dependency>

新依赖

<dependency>
    <groupId>com.aliyun.datahubgroupId>
    <artifactId>aliyun-sdk-datahubartifactId>
    <version>2.3.0-publicversion>
dependency>

Client初始化

原Client初始化步骤

Account account = new AliyunAccount(accessId, accessKey);
odps = new Odps(account);
odps.setDefaultProject(project);
odps.setEndpoint(odpsEndpoint);
DatahubClient client = new DatahubClient(odps, project, table, datahubEndpoint);
client.loadShard(shardNumber);
client.waitForShardLoad();

新Client初始化步骤

AliyunAccount account = new AliyunAccount(accessId, accessKey);
DatahubConfiguration conf = new DatahubConfiguration(account, datahubEndpoint);
DatahubClient client = new DatahubClient(conf);

获取Shard列表

原获取Shard列表及状态方式

HashMapShardState> shardStatus = client.getShardStatus();

新方式

ListShardResult listShardResult = client.listShard(projectName, topicName);

写入数据

原写入方式

DatahubWriter writer = client.openDatahubWriter(shardId);
TableSchema schema = client.getStreamSchema();
DatahubRecordPack recordPack = new DatahubRecordPack(schema);

/* Write another 20 records recordPack into another partition */
for (int i = 0; i < 20; i++) {
    Record record = makeRecord(schema);
    recordPack.append(record);
}

partSpec = "pt='20150809'";
packId = writer.write(new PartitionSpec(partSpec), recordPack)
    .getPackId();
System.out.println("record append to the pack: " + packId);

新写入方式

List<RecordEntry> recordEntries = new ArrayList<RecordEntry>();
RecordEntry entry = new RecordEntry(schema);
entry.setString(0, "Test");
entry.setBigint(1, 5L);
entry.setShardId(shardId);
recordEntries.add(entry);
PutRecordsResult result = client.putRecords(projectName, topicName, recordEntries);
if (result.getFailedRecordCount() != 0) {
    List<ErrorEntry> errors = result.getFailedRecordError();
    // deal with result.getFailedRecords()
}

完整写入新DataHub示例代码

使用Fluentd

通过Fluend插件写入数据的用户，迁移除了上述准备工作外，还需进行三个步骤

更换，安装新插件包
根据配置文件对比，修改现有配置文件
使用新配置文件重新启动fluend进程

插件包更换

新版Fluentd插件使用文档

原安装语句

gem install fluent-plugin-aliyun-odps

新安装语句（也可按照新版文档提供的一键安装包安装logstash）

gem install fluent-plugin-datahub

配置对比

部分配置不需更改，更改match 部分配置即可。

老服务配置项	新服务配置项	备注
type	type	需要从aliyun_odps改为dataHub
aliyun_access_id	access_id	云账号accessid
aliyun_access_key	access_key	云账号accesskey
aliyun_odps_hub_endpoint	endpoint	Datahub服务域名，需要改为新服务的域名
aliyun_odps_endpoint	无	不再需要
buffer_chunk_limit	buffer_chunk_limit	不需要变化，但是新配置不能超过3MB
buffer_queue_limit	buffer_queue_limit	不需要变化
flush_interval	flush_interval	不需要变化
project	project_name	datahub的Project，非odps project
table	topic_name	datahub的topic，非odps table
fields	column_names	指定需要采集的列
partition	无	不再需要
time_format	无	不再需要
shard_number	无	不再需要
enable_fast_crc	无	不再需要
retry_time	retry_time	重试次数
retry_interval	retry_interval	重试间隔
abandon_mode	无	不再需要

新增配置

新服务配置项	备注
dirty_data_continue	true/false遇到增数据是否继续，若为true 遇到脏数据会重试，重试次数用完，会将脏数据写入脏数据文件
dirty_data_file	指定脏数据文件的位置
put_data_batch_size	每1000条record写一次DataHub
shard_id	指定shard_id写入，默认round-robin方式写入
shard_keys	指定用作分区key，用key值hash后作为写入shard的索引

[TODO] 能否放一个新老的diff文件example

使用Logstash

通过Logstash插件写入数据的用户，迁移除了上述准备工作外，还需进行三个步骤

更换，安装新插件包
根据配置文件对比，修改现有配置文件
使用新配置文件重新启动Logstash进程

插件包更换

新版Logstash插件使用文档

配置对比

input部分配置不需更改，更改output部分配置即可。

老服务配置项	新服务配置项	备注
type	type	需要从aliyun_odps改为dataHub
aliyun_access_id	access_id	云账号accessid
aliyun_access_key	access_key	云账号accesskey
aliyun_odps_hub_endpoint	endpoint	Datahub服务域名，需要改为新服务的域名
aliyun_odps_endpoint	无	不再需要
value_field	无	不再需要
project	project_name	datahub的Project，非odps project
table	topic_name	datahub的topic，非odps table
partition	无	不再需要
partition_time_format	无	不再需要
shard_number	无	不再需要
batch_size	通过logstash启动参数设置	logstash -f <上述配置文件地址> -b 256 （256即为每次batch大小）
batch_timeout	无	不再需要

新增配置

新服务配置项	备注
dirty_data_continue	true/false遇到增数据是否继续，若为true 遇到脏数据会重试，重试次数用完，会将脏数据写入脏数据文件
dirty_data_file	指定脏数据文件的位置
put_data_batch_size	每1000条record写一次DataHub
shard_keys	数组类型，数据落shard的字段名称，插件会根据这些字段的值计算hash将每条数据落某个shard, 注意shard_keys和shard_id都未指定，默认轮询落shard
shard_id	所有数据落指定的shard，注意shard_keys和shard_id都未指定，默认轮询落shard
retry_times	重试次数，-1为无限重试、0为不重试、>0表示需要有限次数, 默认值为-1
retry_interval	下一次重试的间隔，单位为秒，默认值为5

使用Apache Flume

通过Flume工具写入数据的用户，迁移除了上述准备工作外，还需进行三个步骤

更换，安装新Flume工具插件
根据配置文件对比，修改现有配置文件
使用新配置文件重新启动Flume进程

插件更新

新版Flume工具文档

配置对比

老服务配置项	新服务配置项	备注
a1.sinks.k1.type	a1.sinks.k1.type	从com.aliyun.odps.flume.sink.OdpsSink改为com.aliyun.datahub.flume.sink.DatahubSink
a1.sinks.k1.accessID	a1.sinks.k1.datahub.accessID	云账号accessid
a1.sinks.k1.accessKey	a1.sinks.k1.datahub.accessKey	云账号accesskey
a1.sinks.k1.odps.endPoint	a1.sinks.k1.datahub.endPoint	Datahub服务域名，需要改为新服务的域名
aliyun_odps_endpoint	无	不再需要
a1.sinks.k1.odps.project	a1.sinks.k1.datahub.project	datahub的Project，非odps project
a1.sinks.k1.odps.table	a1.sinks.k1.datahub.topic	datahub的topic，非odps table
a1.sinks.k1.odps.partition	无	不再需要
a1.sinks.k1.batchSize	a1.sinks.k1.batchSize	批次大小
a1.sinks.k1.serializer	a1.sinks.k1.serializer	无变化
a1.sinks.k1.serializer.delimiter	a1.sinks.k1.serializer.delimiter	无变化
a1.sinks.k1.serializer.fieldnames	a1.sinks.k1.serializer.fieldnames	无变化
a1.sinks.k1.serializer.charset	a1.sinks.k1.serializer.charset	无变化
a1.sinks.k1.serializer.delimiter	a1.sinks.k1.serializer.delimiter	无变化
a1.sinks.k1.shard.number	无	不再需要
a1.sinks.k1.shard.maxTimeOut	a1.sinks.k1.shard.maxTimeOut	无变化
a1.sinks.k1.autoCreatePartition	无	不再需要

使用OGG

通过OGG工具写入数据的用户，迁移除了上述准备工作外，还需进行三个步骤

更换，安装新OGG工具插件
根据配置文件对比，修改现有配置文件
使用新配置文件重新启动OGG进程

插件更新

新版OGG工具文档

配置对比

老服务配置项	新服务配置项	备注
gg.handlerlist	gg.handlerlist	不需修改，仍然为ggdatahub
gg.handler.ggdatahub.type	gg.handler.ggdatahub.type	不需修改，仍然为com.aliyun.odps.ogg.handler.datahub.DatahubHandler
gg.classpath	gg.classpath	YOUR_DATAHUB_HANDLER_DIRECTORY/datahub_lib/改为{YOUR_HOME}/datahub-ogg-plugin/lib/

除以上配置外，其他DataHub相关配置均独立到configure.xml文件配置，具体含义请参看新版OGG工具文档。

原文链接

VMware虚拟机迁移到阿里云 wxjlkh 服务器网络
VMware虚拟机迁移到阿里云是一个涉及多个步骤的过程，具体如下：使用阿里云的服务器迁移中心（SMC）进行P2V或V2V迁移。如果是小型应用，可以通过制作镜像文件然后上传至阿里云OSS，并基于该镜像创建ECS实例。对于大型企业级应用，可能需要设计详细的迁移方案，包括数据迁移、网络规划、应用测试等环节需求分析：首先明确迁移的需求和目标，包括哪些虚拟机需要迁移，迁移的时间窗口，以及迁移后的运维管理等。
夜莺 v8 第一个版本来了，开始做有意思的功能了夜莺开源监控夜莺监控夜莺监控 prometheus 开源监控
夜莺v8大版本已经启动开发，预计25年7、8月份发正式版，相比v7大概会做四五个大功能，每个功能做完了做稳定了都会提前放出来供大家体验，虽然以beta来命名，实际是稳定的，大家可以放心升级。夜莺v5v6v7三个大版本算是一脉相承，一直在打基础，最后一个稳定版是v7.7.2，可以看作是这个系列的终极版。其实这个系列中有些功能早就想改进了，但是由于兼容性、迁移成本、人力的考虑，一直没有动作。现在基础打
论面向服务的架构与其应用 zju3080103798 软考 big data 人工智能运维
论面向服务的架构与其应用摘要：2020年4月，本人所在的某市金融投资集团启动了集团综合管理系统建设，该项目实现基金、融资租赁、资金管理、转贷、融资担保、保理等金融业务信息化及人力资源、智能办公、法务管理等内部管理功能，在此项目中，我担任了架构师，负责项目总体架构设计工作。本文以该综合管理系统为例，主要论述了面向服务的架构在该系统中的应用。提供数据联邦、数据复制转换、工作流集成等控制服务实现新老系统
从ErnieBotChat迁移到QianfanChatEndpoint的实践指南 fGVBSAbe python
技术背景介绍ErnieBot是由百度开发的大型语言模型，拥有强大的中文数据处理能力。然而，由于ErnieBotChat在功能和维护上的不足，官方建议开发者切换到功能更强大的QianfanChatEndpoint。QianfanChatEndpoint在流式传输、函数调用能力等方面提供了更为先进的支持。核心原理解析QianfanChatEndpoint是百度Qianfan平台的一部分，提供了更为灵活
pg使用python编写存储过程_postgresql存储过程代码编写 weixin_39562185
背景公司最近有个项目数据库里表需要使用到另外一个数据库里表的某两个字段，而且并不是直接查询就能插入到新表里旧表idsncustomer1xxxxTest新表idsncustomer_id1xxxx1idcustomer1Test我开始考虑的是使用python脚本去查数据库，然后逻辑判断，这种方式也是可以实现的。进行插入但表里的数据有几百万条记录，使用python脚本迁移，有网络的开销，执行的速度会
FPGA USB2.0串口通信项目设计与实现瞬泉
本文还有配套的精品资源，点击获取简介：本项目主要围绕FPGA（Field-ProgrammableGateArray）和Verilog语言，实现USB（通用串行总线）2.0标准的串口通信功能。项目涵盖了从时钟配置到物理层接口的全套设计过程，包括UART通信的帧同步、波特率生成、握手协议等。项目文档和代码可能包含Verilog代码文件、测试平台配置、波形记录文件、编译脚本和用户手册，以助于开发者理解
系统编程05-线程（pthread_create、pthread_join、pthread_exit） JAN JM 系统编程 linux 服务器 ubuntu
目录一、守护进程1.概念（简答题）1)怎样成为守护进程2.守护进程编写步骤1)忽略SIGHUP2)产生子进程3)创建新会话4)产生孙子进程5)进入新进程组6)关闭文件资源7)关闭文件权限掩码8)切换进程工作路径二、linux最小资源单位--线程。1.线程与进程2.线程函数接口特点？1）由于线程函数接口都是封装在一个线程库，所以我们是看不到源码的，查看线程的函数，都是在第3手册：man3xxxx2）
探秘ARMv7-M架构：打造高效嵌入式系统指南嵇影钰
探秘ARMv7-M架构：打造高效嵌入式系统指南【下载地址】ARMv7-M架构参考手册及应用指南分享本资源包包含：-**ARMv7-MArchitectureReferenceManual**：这是ARM官方发布的权威文档，全面深入地介绍了ARMv7-M架构的核心概念、指令集、内存模型和编程模型等，是开发高性能、低功耗嵌入式系统的理论基础。-**ARMv7-MApplicationLevelRefe
ARM架构参考手册（ARMv7-A和ARMv7-R版）童伶影Bertha
ARM架构参考手册（ARMv7-A和ARMv7-R版）【下载地址】ARM架构参考手册ARMv7-A和ARMv7-R版分享ARMv7-A和ARMv7-R架构是ARM处理器家族中的关键成员，广泛应用于智能手机、嵌入式系统、汽车电子和实时操作系统等领域的高性能计算设备中。A系列面向应用程序处理器，支持丰富的操作系统如Android和Linux；而R系列则专为实时系统设计，保证了高可靠性和响应速度项目地址
【Linux】APT 密钥管理迁移指南：有效解决 apt-key 弃用警告丶2136 运维 #linux linux 数据库服务器
引言随着Debian11和Ubuntu22.04版本的推出，APT的密钥管理方式发生了重大的变化。apt-key命令被正式弃用，新的密钥管理机制要求使用/etc/apt/keyrings/或/etc/apt/trusted.gpg.d/来存储和管理密钥。这一变化对管理员和普通用户来说至关重要，特别是当通过aptupdate或aptupgrade执行系统更新时，可能会遇到关于apt-key弃用的警告
Kafka 迁移 AutoMQ 时 Flink 位点管理的挑战与解决方案 AutoMQ 云计算云原生 Kafka 消息计算大数据 AWS AutoMQ 阿里云腾讯云 GCP
编辑导读：AutoMQ是一款与ApacheKafka100%完全兼容的新一代Kafka，可以做到至多10倍的成本降低和极速的弹性。凭借其与Kafka的完全兼容性可以与用户已有的Flink等大数据基础设施进行轻松整合。Flink是重要的流处理引擎，与Kafka有着密切的关系。本文重点介绍了当用户需要将生产Kafka集群迁移到AutoMQ时，如何处理好Flink的位点来确保整体迁移的平滑过渡。引言在云
ARMv7-M架构参考手册及应用指南董鉴勃
ARMv7-M架构参考手册及应用指南【下载地址】ARMv7-M架构参考手册及应用指南分享本资源包包含：-**ARMv7-MArchitectureReferenceManual**：这是ARM官方发布的权威文档，全面深入地介绍了ARMv7-M架构的核心概念、指令集、内存模型和编程模型等，是开发高性能、低功耗嵌入式系统的理论基础。-**ARMv7-MApplicationLevelReference
大型语言模型高效预训练策略的比较研究二进制独立开发非纯粹GenAI 深度思索 GenAI与Python 语言模型深度学习人工智能自然语言处理 python 开发语言机器学习
文章目录摘要1.引言2.背景与挑战2.1LLM中的预训练2.2扩展LLM的挑战3.高效预训练策略3.1增量训练3.1.1理论基础3.1.2实际实现3.1.3实验结果3.2混合优化3.2.1理论基础3.2.2实际实现3.2.3实验结果3.3其他新兴技术3.3.1知识蒸馏3.3.2稀疏训练3.3.3数据增强3.3.4迁移学习4.比较分析4.1性能指标4.2增量训练vs.混合优化4.2.1模型精度4.2
Presto 时间、日期及计算相关日期三生暮雨渡瀟瀟 presto big data presto
由于工作中在数据迁移，大数据平台数据查询引擎使用Presto，和传统的数据库时间函数有区别，整理一版，供大家参考，一起学习，有错误欢迎指正。1、查询当前日期selectcurrent_date;2、查询当前时间selectcurrent_timestamp;_col0---------------------------------------2022-01-0220:45:58.551Asia/
Oracle 到 Elasticsearch 数据迁移同步
简述Elasticsearch是一个分布式的实时搜索与数据分析引擎，具有强大的可扩展性和高度的灵活性。CloudCanal对于Elasticsearch的支持经过了多轮迭代，支持版本从6.x和7.x一路扩展到8.x，并适配了其丰富多样的API。同时CloudCanal对Oracle源端同步技术进行了多处优化，大幅提升了数据同步的稳定性和可靠性。本文主要介绍如何使用CloudCanal快速构建一条O
MySQL数据迁移到PostgreSQL必备手册胡妃意
MySQL数据迁移到PostgreSQL必备手册【下载地址】MySQL数据迁移到PostgreSQL必备手册本仓库提供了一个名为“MySQL数据迁移到PostgreSQL必备手册.pdf”的资源文件，该手册详细介绍了如何将MySQL数据库中的数据迁移到PostgreSQL数据库中。通过本手册，您可以轻松掌握最简单且经过验证的数据迁移方法，确保迁移过程顺利进行项目地址:https://gitcode
从MySQL迁移到PostgreSQL的完整指南 m0_74825718 面试学习路线阿里巴巴 mysql postgresql 数据库
1.引言在现代数据库管理中，选择合适的数据库系统对业务的成功至关重要。随着企业数据量的增长和对性能要求的提高，许多公司开始考虑从MySQL迁移到PostgreSQL。这一迁移的主要原因包括以下几个方面：1.1性能和扩展性PostgreSQL以其高性能和优秀的扩展能力而闻名。它支持复杂的查询优化和并发控制，能够更高效地处理大规模数据。与MySQL相比，PostgreSQL在处理复杂查询和大数据集时表
22_设计方案（第四章）珞圻-Health 信息化项目验收文档体系 oracle 数据库政务大数据
4“一中心”设计“一中心”，即建设全区统一的不动产登记数据库，集成全区5个市22个县（区）的不动产登记数据，进行统一的数据存储、管理与应用。（1）市三区业务数据迁移对市三区的业务数据迁移到全区不动产登记数据库，现有市三区的业务数据存储在Oracle数据库中，而全区不动产登记数据统一存储在SQLServer数据库，因此，本项目需将现有Oracle数据库中的255万条业务数据的数据形式转换为SQLSe
数据迁移丨借助 pg2mysql 从 PostgreSQL 到 GreatSQL 数据库mysql
数据迁移丨借助pg2mysql从PostgreSQL到GreatSQL上篇《数据迁移丨借助AI从PostgreSQL到GreatSQL》介绍了如何使用AI+pg_dump/COPY的方式将PostgreSQL迁移到GreatSQL中，各位同学看过之后，会发现两款数据库还是有一些差异，例如对象层次结构、数据类型等方面，如果采用人工来迁移，还是会比较麻烦，所以本篇将介绍，如何使用开源工具pg2mysq
React Native 0.77发布，新样式特性，Android 16KB页面支持，Swift模板
ReactNative0.77版本发布：新特性、改进与迁移说明2025年1月21日，ReactNative0.77正式发布，此版本带来诸多新特性、对Android的支持增强、社区模板更新以及一些重要变更。一、新特性亮点（一）CSS新特性助力布局、尺寸与混合效果display:contents简化布局逻辑：该属性使元素自身在布局结构中“消失”，但子元素仍正常渲染，就像直接作为父元素的子元素一样。在构
docker中gitlab迁移凌冽暖阳 docker docker gitlab 容器
一、备份1、首先查看docker中运行的容器，找到运行gitlab的容器idlinuxshell窗口中执行如下命令：dockerps2、进入docker容器dockerexec-i-t4d5e099d20af/bin/bash3、创建备份执行命令：gitlab-rakegitlab:backup:create备份完成后生成的文件：1669876030_2022_12_01_11.1.4_gitla
docker容器gitlab数据迁移 ronshi 运维 docker gitlab 容器
1、启动命令dockerrun-itd\-p9980:80\-p9922:22\-v/home/data/gitlab/etc:/etc/gitlab\-v/home/data/gitlab/log:/var/log/gitlab\-v/home/data/gitlab/opt:/var/opt/gitlab\--restartalways\--privileged=true\--namegitl
SQL拆分字段内容（含分隔符） m0_74824635 sql 数据库 java
问题描述：在做数据迁移的过程中，我们希望对表中的某个字段根据分隔符进行拆分，得到多条数据，原代码有点意思，因此记录一下。我们假设某条数据如下：IDSTRS1公司名称不能小于四个字，行业类别不能为空，职务/岗位不能为空，公司电话不能小于8位且真是有效针对这条数据，我们希望将其拆分成为四份或者五份，以便于后续的数据处理（这里是拆成四份，加上原来的那条数据一共是五条）。希望得到的结果：STEP1:IDS
gitlab迁移到docker MexChina git
备份gitlab数据gitlab-rakegitlab:backup:create在docker上拉取对应版本的镜像dockerpullgitlab/gitlab-ce:14.2.3-ce.0编写docker-compose文件version:'3.6'services:web:image:'gitlab/gitlab-ce:14.2.3-ce.0'restart:alwayscontainer_
数据库sql篇——关于select*和select全部字段的区别 DM很小众 sql 数据库 mysql sqlserver
记录今日开发中的优化sql优化项。介绍select*和select字段的区别，建议不要使用select*。在千万级表中查询数据的时候，首要任务是提升查询效率，为用户带来极致的体验；今天开发组领导提到了select*的效率会低于select字段，且推荐使用select字段。就连《阿里Java开发手册》也明确表示不得使用select*作为查询的字段列表，更是对此进行了背书。一，查询效率select*在
mysql+binlog+查看+加密,mysql查看binlog日志疯疯疯狂的野兔
MySQL的二进制日志可以说是MySQL最重要的日志了，它记录了所有的DDL和DML(除了数据查询语句)语句，以事件形式记录，还包含语句所执行的消耗的时间，MySQL的二进制日志是事务安全型的。一般来说开启二进制日志大概会有1%的性能损耗(参见MySQL官方中文手册5.1.24版)。二进制有两个最重要的使用场景:其一：MySQLReplication在Master端开启binlog，Mster把它
Ruby转Go语言：实现高效后端开发 BugTO ruby golang 前端后端
在现代软件开发中，选择合适的编程语言对于构建高效的后端系统至关重要。Ruby和Go语言都是备受开发者青睐的语言之一。然而，随着项目的发展和规模的增长，将Ruby代码迁移到Go语言成为了一个常见的需求。本文将探讨从Ruby迁移到Go语言的过程，并提供一些实用的源代码示例。了解Go语言Go语言是由Google开发的一种静态类型、编译型语言。它具有简洁、高效和并发性强的特点，适合构建高性能的后端系统。在
Hana 到 PostgreSQL 数据迁移同步
简述SAPHana与PostgreSQL已成为许多企业常用的两款重要数据库，实现这两者之间高效稳定的数据传输也是许多企业的诉求之一。本文将介绍如何使用国产数据迁移同步工具CloudCanal构建一条Hana到PostgreSQL的数据同步链路。技术点表级别CDC表CloudCanal在实现Hana源端增量同步时，最初采用的是单CDC表的模式，即所有订阅表的增量数据（插入、更新、删除）通过触发器统一
Mybatis总结（一）（简单介绍） weixin_34326429 java 数据库
1.1MyBatis介绍MyBatis本是apache的一个开源项目iBatis,2010年这个项目由apachesoftwarefoundation迁移到了googlecode，并且改名为MyBatis，实质上Mybatis对ibatis进行一些改进。MyBatis是一个优秀的持久层框架，它对jdbc的操作数据库的过程进行封装，使开发者只需要关注SQL本身，而不需要花费精力去处理例如注册驱动、创
【YashanDB知识库】YashanDB与Oracle数据类型对齐数据库
本文内容来自YashanDB官网，原文内容请见https://www.yashandb.com/newsinfo/7253737.html?templateId=171...关于参数USE\_NATIVE\_TYPE在迁移基于Oracle数据库的应用时，有时会遇到应用代码中定义的数据类型与YashanDB返回数据类型不匹配的问题，可以尝试在创建数据库的时候指定参数USE\_NATIVE\_TYPE
矩阵求逆（JAVA）初等行变换 qiuwanchi 矩阵求逆（JAVA）
package gaodai.matrix; import gaodai.determinant.DeterminantCalculation; import java.util.ArrayList; import java.util.List; import java.util.Scanner; /** * 矩阵求逆(初等行变换) * @author 邱万迟 *
JDK timer antlove java jdk schedule code timer
1.java.util.Timer.schedule(TimerTask task, long delay)：多长时间（毫秒）后执行任务 2.java.util.Timer.schedule(TimerTask task, Date time)：设定某个时间执行任务 3.java.util.Timer.schedule(TimerTask task, long delay,longperiod
JVM调优总结 -Xms -Xmx -Xmn -Xss coder_xpf jvm 应用服务器
堆大小设置JVM 中最大堆大小有三方面限制：相关操作系统的数据模型（32-bt还是64-bit）限制；系统的可用虚拟内存限制；系统的可用物理内存限制。32位系统下，一般限制在1.5G~2G；64为操作系统对内存无限制。我在Windows Server 2003 系统，3.5G物理内存，JDK5.0下测试，最大可设置为1478m。典型设置： java -Xmx
JDBC连接数据库 Array_06 jdbc
package Util; import java.sql.Connection; import java.sql.DriverManager; import java.sql.ResultSet; import java.sql.SQLException; import java.sql.Statement; public class JDBCUtil { //完
Unsupported major.minor version 51.0（jdk版本错误） oloz java
java.lang.UnsupportedClassVersionError: cn/support/cache/CacheType : Unsupported major.minor version 51.0 (unable to load class cn.support.cache.CacheType) at org.apache.catalina.loader.WebappClassL
用多个线程处理1个List集合 362217990 多线程 thread list 集合
昨天发了一个提问，启动5个线程将一个List中的内容，然后将5个线程的内容拼接起来，由于时间比较急迫，自己就写了一个Demo，希望对菜鸟有参考意义。。 import java.util.ArrayList; import java.util.List; import java.util.concurrent.CountDownLatch; public c
JSP简单访问数据库香水浓 sql mysql jsp
学习使用javaBean，代码很烂，仅为留个脚印 public class DBHelper { private String driverName; private String url; private String user; private String password; private Connection connection; privat
Flex4中使用组件添加柱状图、饼状图等图表 AdyZhang Flex
1.添加一个最简单的柱状图 ? 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 <?xml version= "1.0"&n
Android 5.0 - ProgressBar 进度条无法展示到按钮的前面 aijuans android
在低于SDK < 21 的版本中，ProgressBar 可以展示到按钮前面，并且为之在按钮的中间，但是切换到android 5.0后进度条ProgressBar 展示顺序变化了，按钮再前面，ProgressBar 在后面了我的xml配置文件如下： [html] view plain copy <RelativeLa
查询汇总的sql baalwolf sql
select list.listname, list.createtime,listcount from dream_list as list , (select listid,count(listid) as listcount from dream_list_user group by listid order by count(
Linux du命令和df命令区别 BigBird2012 linux
1，两者区别 du，disk usage,是通过搜索文件来计算每个文件的大小然后累加，du能看到的文件只是一些当前存在的，没有被删除的。他计算的大小就是当前他认为存在的所有文件大小的累加和。
AngularJS中的$apply，用还是不用？ bijian1013 JavaScript AngularJS $apply
在AngularJS开发中，何时应该调用$scope.$apply()，何时不应该调用。下面我们透彻地解释这个问题。但是首先，让我们把$apply转换成一种简化的形式。 scope.$apply就像一个懒惰的工人。它需要按照命
[Zookeeper学习笔记十]Zookeeper源代码分析之ClientCnxn数据序列化和反序列化 bit1129 zookeeper
ClientCnxn是Zookeeper客户端和Zookeeper服务器端进行通信和事件通知处理的主要类，它内部包含两个类，1. SendThread 2. EventThread， SendThread负责客户端和服务器端的数据通信，也包括事件信息的传输，EventThread主要在客户端回调注册的Watchers进行通知处理 ClientCnxn构造方法 &
【Java命令一】jmap bit1129 Java命令
jmap命令的用法： [hadoop@hadoop sbin]$ jmap Usage: jmap [option] <pid> (to connect to running process) jmap [option] <executable <core> (to connect to a
Apache 服务器安全防护及实战 ronin47
此文转自IBM. Apache 服务简介 Web 服务器也称为 WWW 服务器或 HTTP 服务器 (HTTP Server)，它是 Internet 上最常见也是使用最频繁的服务器之一，Web 服务器能够为用户提供网页浏览、论坛访问等等服务。由于用户在通过 Web 浏览器访问信息资源的过程中，无须再关心一些技术性的细节，而且界面非常友好，因而 Web 在 Internet 上一推出就得到
unity 3d实例化位置出现布置？ brotherlamp unity教程 unity unity资料 unity视频 unity自学
问：unity 3d实例化位置出现布置？答：实例化的同时就可以指定被实例化的物体的位置,即 position Instantiate (original : Object, position : Vector3, rotation : Quaternion) : Object 这样你不需要再用Transform.Position了, 如果你省略了第二个参数(
《重构，改善现有代码的设计》第八章 Duplicate Observed Data bylijinnan java 重构
import java.awt.Color; import java.awt.Container; import java.awt.FlowLayout; import java.awt.Label; import java.awt.TextField; import java.awt.event.FocusAdapter; import java.awt.event.FocusE
struts2更改struts.xml配置目录 chiangfai struts.xml
struts2默认是读取classes目录下的配置文件，要更改配置文件目录，比如放在WEB-INF下，路径应该写成../struts.xml(非/WEB-INF/struts.xml) web.xml文件修改如下： <filter> <filter-name>struts2</filter-name> <filter-class&g
redis做缓存时的一点优化 chenchao051 redis hadoop pipeline
最近集群上有个job，其中需要短时间内频繁访问缓存，大概7亿多次。我这边的缓存是使用redis来做的，问题就来了。首先，redis中存的是普通kv，没有考虑使用hash等解结构，那么以为着这个job需要访问7亿多次redis，导致效率低，且出现很多redi
mysql导出数据不输出标题行 daizj mysql 数据导出去掉第一行去掉标题
当想使用数据库中的某些数据，想将其导入到文件中，而想去掉第一行的标题是可以加上-N参数如通过下面命令导出数据： mysql -uuserName -ppasswd -hhost -Pport -Ddatabase -e " select * from tableName" > exportResult.txt 结果为： studentid
phpexcel导出excel表简单入门示例 dcj3sjt126com PHP Excel phpexcel
先下载PHPEXCEL类文件，放在class目录下面，然后新建一个index.php文件，内容如下 <?php error_reporting(E_ALL); ini_set('display_errors', TRUE); ini_set('display_startup_errors', TRUE); if (PHP_SAPI == 'cli') die('
爱情格言 dcj3sjt126com 格言
1) I love you not because of who you are, but because of who I am when I am with you. 　　我爱你，不是因为你是一个怎样的人，而是因为我喜欢与你在一起时的感觉。 　　2) No man or woman is worth your tears, and the one who is, won‘t
转 Activity 详解——Activity文档翻译 e200702084 android UI sqlite 配置管理网络应用
activity 展现在用户面前的经常是全屏窗口，你也可以将 activity 作为浮动窗口来使用（使用设置了 windowIsFloating 的主题），或者嵌入到其他的 activity （使用 ActivityGroup ）中。当用户离开 activity 时你可以在 onPause() 进行相应的操作。更重要的是，用户做的任何改变都应该在该点上提交 ( 经常提交到 ContentPro
win7安装MongoDB服务 geeksun mongodb
1. 下载MongoDB的windows版本：mongodb-win32-x86_64-2008plus-ssl-3.0.4.zip，Linux版本也在这里下载，下载地址： http://www.mongodb.org/downloads 2. 解压MongoDB在D:\server\mongodb, 在D:\server\mongodb下创建d
Javascript魔法方法:__defineGetter__,__defineSetter__ hongtoushizi js
转载自： http://www.blackglory.me/javascript-magic-method-definegetter-definesetter/ 在javascript的类中,可以用defineGetter和defineSetter_控制成员变量的Get和Set行为例如,在一个图书类中,我们自动为Book加上书名符号: function Book(name){
错误的日期格式可能导致走nginx proxy cache时不能进行304响应 jinnianshilongnian cache
昨天在整合某些系统的nginx配置时，出现了当使用nginx cache时无法返回304响应的情况，出问题的响应头： Content-Type:text/html; charset=gb2312 Date:Mon, 05 Jan 2015 01:58:05 GMT Expires:Mon , 05 Jan 15 02:03:00 GMT Last-Modified:Mon, 05
数据源架构模式之行数据入口 home198979 PHP 架构行数据入口
注：看不懂的请勿踩，此文章非针对java，java爱好者可直接略过。一、概念行数据入口（Row Data Gateway）：充当数据源中单条记录入口的对象，每行一个实例。二、简单实现行数据入口为了方便理解，还是先简单实现： <?php /** * 行数据入口类 */ class OrderGateway { /*定义元数
Linux各个目录的作用及内容 pda158 linux 脚本
1）根目录“/” 　　根目录位于目录结构的最顶层，用斜线（/）表示，类似于 Windows 操作系统的“C:\“，包含Fedora操作系统中所有的目录和文件。　　2）/bin 　　/bin 　　目录又称为二进制目录，包含了那些供系统管理员和普通用户使用的重要 linux命令的二进制映像。该目录存放的内容包括各种可执行文件，还有某些可执行文件的符号连接。常用的命令有：cp、d
ubuntu12.04上编译openjdk7 ol_beta HotSpot jvm jdk OpenJDK
获取源码从openjdk代码仓库获取(比较慢) 安装mercurial Mercurial是一个版本管理工具。 sudo apt-get install mercurial 将以下内容添加到$HOME/.hgrc文件中，如果没有则自己创建一个： [extensions] forest=/home/lichengwu/hgforest-crew/forest.py fe
将数据库字段转换成设计文档所需的字段 vipbooks 设计模式工作正则表达式
哈哈，出差这么久终于回来了，回家的感觉真好！ PowerDesigner的物理数据库一出来，设计文档中要改的字段就多得不计其数，如果要把PowerDesigner中的字段一个个Copy到设计文档中，那将会是一件非常痛苦的事情。

新老DataHub迁移手册

DataHub服务用户迁移文档

前言

准备工作

新版DataHub相关文档

创建新datahub project

创建新DataHub topic

DataHub与MaxCompute字段类型对应表

映射Odps分区

不同类型接入方式迁移

使用Java SDK

需要换成新版本DataHub的SDK，Mvn依赖变化

Client初始化

获取Shard列表

写入数据

使用Fluentd

插件包更换

配置对比

使用Logstash

插件包更换

配置对比

使用Apache Flume

插件更新

配置对比

使用OGG

插件更新

配置对比

你可能感兴趣的:(新老DataHub迁移手册)