00:04
大家好,欢迎来到Q带T数据中台专业版数据研发模块的全功能讲解。Q带T数据研发围绕数据从接入到运行的完整过程,提供数据源管理、数据集成、整库同步、数据开发、作业管理和运维管理等能力。它主要解决的核心问题是企业在数据接入、加工、同步、调度和运维的过程中,工具分散、流程割裂、任务管理复杂。简单来说,Q代的数据研发的目标就是帮助企业把数据接进来、加工好、调度起来,并对整个数据生产过程进行统一的管理和运维。接下来我们进入到我们的QT的平台,在正式介绍数据数据研发这个功能之前,我们先简单的介绍一下QT的项目的概念。在QT中,项目可以理解为数据研发的一个独立工作空间,不同业务团队,不同建设场景可以分别创建自己的项目,在项目内开展数据连接、数据集成、数据开发和作业管理等工作。项目可以在顶部的基础管理中进入到项目管理进行创建和维护,完成创建后呢,在数据研发的右上角可以去切换所属项目,就可以进入到数据研发的一个项目。比如我们今天所后面所有的演示都会基于基础数据组这个项目来进行,进入项目后呢,还可以在项目基础管理里面中去维护我们的成员角色以及数据集成类目。
01:42
数据开发类目、作业管理类目等基础的分类,为后续的数据研发任务做好统一的人员和目录组织。所以呢,我们的项目解决的核心问题就是把不同的团队、不同的业务的数据研发工作隔离并组织起来。项目环境准备好之后,接下来呢,我们正式的进入到数据研发的第一个环节,数据连接。数据连接呢是统一接入、验证与监控企业多类型的数据源。数据连接主要用于统一配置和管理平台需要访问的各类数据源,为后续的数据同步、数据集成和数据开发提供基础的数据入口。在数据连接的列表中可以查看已经创建的数据连接,包括我们数据连接的名称、数据连接的描述、数据连接类型以及我们的状态,同时还支持测试、连接、查看详情以及启停我们的一个状态。通过统一的连接管理,后续研发任务可以直接基于已经配置好的。
02:42
数据源开展,不需要重复的维护连接的信息,那么点击新增呢,可以看到Q带头目前已经支持了33种数据源类型,涵盖了关系型数据库、分析型数据库、数据仓库、文件对象存储、no搜口、L缓存、消息队列以及时序数据库。无论企业的数据库分布在各每各种类型的数据库之下,都可以通过统一的数据连接能力接入到平台里面。这里呢,我们就以MYSQL为例呢,我们进到下一步可以去填写连接的一个基本信息,有连接的一个名称,用于后面去识别当前连接是什么业务,然后是IP端口号、账号和密码,填写完成这些信息之后,就可以进到我们的一个测试连接的步骤,这里的测试呢,并不是简单的判断数据库能不能连上,而是进一步的检查的连接的配置,网络地址解析、接口连通性。
03:42
账号认证、目标资源访问以及原数据读取等多个环节,每一个检查项都会给出对应的结果,如果连接存在问题,也可以更加直观的判断到底是网络端口、账号权限还是资源访问方面的问题,帮助研发人员在正式创建任务之前提前发现并解决连接异常,减少后续任务执行过程中失败到造造成的排查的成本。那么我们连接创建完成之后,还可以进入到我们的详情里面去查看当前连接的一个运行情况,包括我们的运行监控、读写日志、告警记录、告警规则以及我们的基本信息,对连接状态进行一个持持续的跟踪。所以呢,QT的数据连接解决的不只是把数据库连上这么简单,而是多类型数据源接入,连接可用性验证到后续运行监控,形成了一套完整的数据连接管理能力。数据连接准备完成之后。
04:42
后,平台就具备了访问原端数据的能力。接下来我们先看一个比较常见的一个场景,当企业需要一次性同步一个数据库中的多张表,或者希望快速的完成整库级的数据迁移和同步的时候,如果一张表一张表去配置任务,效率会比较低。针对这种场景,自带的提供了整库同步的能力,可以批量选择来源库中的数据表,并统一同步到目标端。接下来我们就来看一下带T的整库同步是如何完成来源库选择、目标库配置、批量卷表同步、策略配置以及任务执行的整库同步呢?是批量迁移、统一映射与周期调度。进入到我们的整库同步页面后,大家可以看到系统会统一的展示当前已经创建好的同步任务,包括任务信息,里面有任务名称、同步表的数量和任务的一个描述,以及数据链路原端和目标端,以及我们的运行状态,包括任务状态和调度。
05:42
的状态以及我们的策略与调度。任务创建完成之后,也可以在我们的操作里列里面看到任务的一个详情,以及对任务进行执行一次和查看任务实例的操作。接下来我们新增一个整库同步的任务,然后我们看一下配置,在配置之前我们会先去检查当前这个整库同步任务的原端和目标端,目标端的数据连接是否异常,如果有异常的话,它会给你一个提醒,如果没有异常,它就会正常的去走,可以去走下一步。Q整库同步的源库和目标库支持了12种数据源的类型,涵盖了常见的关系型数据库及数据仓库场景,这里使用的都是前面已经配置好的数据连接数据,所以数据连接负责把数据源接进来,而整库同步负责进一步的完成源库到目标库之间的批量数据迁移和同步,然后我们选好我们的圆库和目标。
06:42
之后第二步是选择来源表,系统会自动的读取原数据库中的表,我们可以根据实际的需要一次性选择多张表加入到我们的同步任务,而不需要针对每一张表分别的创建任务,这也是整控同步非诚核心的一个能力。当企业面对几十张表甚至是更多业务表需要统一迁移或者是周期同步的时候,可以明显的减少重复性的配置的工作。那么选择完我们的来源表之后呢,就进入到我们的第三步配置多表映射,在这里可以统一维护来源表和目标表之间的关系,对于批量同步的场景,佩戴的提供了自动匹配目标表可以把所有的多选,然后自动匹配目标表,这边的目标表物理表名和目标表中文名称就会自动同步。我们来源表的物理表名和中文名称,同样的,我们多选完之后还可以批量的去配置一下目标表的一个表前缀,比如这些表是来自D'M层的。
07:42
前缀有一个DM,那么我们就可以在这里进行批量去设置这个目标表明,还可以批量设置目标表的一个分区和目标表分统的一个设置。如果目标端还没有对应的数据表,也可以根据来源表结构自动去创建我们的目标表里面的字段,可以进行字段的追加,这边去填写字段的名称,字段描述、数据类型、属性、长度、小数数和默性默认值,然后整库同步任务创建之后,这个字段也会随着我们整库同步的任务去写入到目标库里面,那我们就暂时先不配置这个最佳字段了,我们直接进入到下一步,那最后一步呢,就是我们的配置任务属性整库同步既可以手动执行,也可以通过我们的抗表达式去配置调度周期,按照秒、分钟、小时、日、月、周年等不同的维度去配置。
08:42
所需要的一个周期执行,同时对于长期运行的数据同步任务,我们也考虑到了一些异常情况,所以这里还可以去配置错误处理、脏数据处理、失败重试或者是延期执行的策略,并根据任务的规模执行资源让同步任务能够更加稳定的去运行。然后我们把任务保存之后,就可以直接在这个位置去进行执行一次的一个操作,执行一次之后,这个数据就会从原端直接写到我们目标端里面,然后在执行运行实例里面也可以看到我们整这个任务的一个运行的一个日志,包括全部的运行中的成功的和失败的都可以看到。所以呢,整个同步解决的核心问题可以简单的概括为一次性选择多张票,统一的完成映射、建表、调度和运行管理它。
09:42
那更加的适合批量搬迁和多表同步的场景,但实际的数据研发中,有些数据并不是简单的同步过去就可以使用,还需要进行字段处理、清洗、转换甚至多步骤的加工。接下来呢,我们就继续看更加灵活的数据集成的能力,数据集成呢是可以通过可视化的编排数据读取、清洗、转换与输出流程,然后前面我们讲了整库同步更适合解决多张表批量迁移和同步的问题,但是我们在真正的数据建设的过程中,很多数据并不是简单的从源库搬到目标库,所以我们要看一下我们的数据集成怎么去针对这种场景去解决问题。那么科代的数据集成呢,分为了离线任务和实时任务的两类,然后离线任务呢,主要是面向批量数据处理,比如每天每小时定时的读取一批数据,完成清洗和转换以后写入目标端,适合历史数据的同步、周期性加数据加工等场景时。
10:42
日任务呢,则更加的适合持续产生的数据流,数据产生以后呢,可以持续的接入和处理,常用于实时监测、消息流处理等对时效性要求比较高的场景。那么简单来说就是离线任务解决的是一批数据定时处理,实时任务解决的是数据来了持续处理。那么接下来我们先通过一个完整的离线数据集成的任务,先看一下Q是如何完成一条1TL数据处理流程的,那么大家现在看到的是我们离线任务的一个列表,那么上面是我们针对于今天离线任务的一个执行情况的一个统计,然后其次左边是离线我们数据集成任务的一个类目,就相当于一个目录,然后可以通过任务名称,任务状态以及我们的执行状态去进行快速的筛选任务,然后我们再看一下数据集成的列表,包含了任务信息,里面有任务的名称和任务的描述以及所属类目。最。
11:42
并执行的信息,点击最近执行信息,可以查看到当前这一次任务的一个执行的一个日志,方便快捷的去排查问题。再其次后面是运行控制,可以去快速的开启或者是关闭我们的任务状态以及调度状态,在后面是我们的策略与调度,是看配置的,具体的调度是怎么样的,那么看完列表之后呢,我们看一下我们如何去新增一个数据集成任务,那么点击新增按钮,先是去填写最基本的信息,这个任务属于哪一个类目,然后任务的名称是什么,然后配置一下这个任务多久去执行一次,去配置一下调度周期。其次任务的负责人和执行策略是并行还是串行等待,还是串行抛弃,那么我们默认是串行抛弃,以及我们后面的任务优先级,失败重试等相关的一些属性的配置,也就是说我们在一条任务创建的时候,就不仅仅是在定义。
12:42
处据怎么处理,而是同时的也把后续怎么什么时候运行失败以后怎么办,需要多少计算资源一起考虑了进来。那么呢,我们配置完成这些基础信息之后,就可以进入到我们的可视化编排的一个页面,大家可以看到左侧提供了多种类型的组件,在输入端不仅可以读取普通的数据库,还支持odps Excel csv j、算、L、卡卡等等,还有APIFTP等等,以及多种消息队列等数据的来源。这里呢,我们就以一个河道水为例,首先我们看一下这个表输入组件,首先是配一下我们的节点名称,我们默认是表输入组件,然后你可以根据你自己的任务去修改这一个表输入组件的一个节点名称。其次是我们的连接方式,这个位置选择数据连接,就可以获取到我们前面在数据连接中去配置好的一个连接的。
13:42
表在这个位置我们选择河道水晶库,然后选择到这张表,那么我们就会读取到当前的这张表的一个信息,这下面就可以看到当前这张表的一个属性字段,然后其次呢,通过我们把数据现在拿进来了,那么我们就需要对数据进行一个处理,那么处理呢,我们有执行Java脚本,或者是通过我们内置好的一个转换组件,然后下面还配了流程控制,有条件分发子流程。那么我们今天就讲一下转换组件,转换组件里面我们内置了这六大类清洗规则,包含准确性修正,完整性修复,一致性修正,唯一性维护,有效性处理,及时性调整,那么我们就以这个数值边界调整为例,首先呢,先去输入一下这一个转换组件的一个清洗的一个名称,那我们就还是先叫数值。
14:42
边界调整,我们现在就只需要我们的ID是0~100的这些值,然后那么我们就在这个位置就使用我们的边界调整,将最小值设置成0,最大值设计成100,然后清洗的字段就是我们记录的ID,那么有一个处理的方式,超出最大值调整为最大值,超出最小值调整为最小值,两种情况都调整成对应的一个边界值,那我们选择最后一种确定,那么这样我们转换组件里面就配置了一个转换规则,然后我们转换之后,我们就需要把我们当前已经处理好的数据去通过我们的表输出组件输出到我们的目标的数据库里面,那我们的输输出组件呢,也不止单单的包含表输出组件,也有odps h htfs等等,还有卡夫卡输出组件等相关的一些组件去供大家去选择,那我们打开我们的表。
15:42
输出组件这个地方先去配,先去输入一下节点名称,然后选择一下我们的目标数据连接,我们现在选择的是Doris里面的数据中台的原始库,然后选择一张对应的一张目标表,那么我们这边就会读取到目标表的一个字段,然后可以通过手动也可以去调整目标表的一个顺序,比如你要把这个字段去填写到这个字段里面,那么它也会可以去调整的,那我们默认呢,是会先去匹配你当前原来源表字段的表明和目标表字段的表明如果是一致的话,那么我们就会先把线给你连起来,那么你也可以根据自己的业务需求去修整,那么到这里我们就把我们整个数据集成的任务配置好了,配置好之后呢,我们右上角还提供了任务检查的一个功能,因为我没有去配置好我们的表,输入组件的来源和目标表的关系,所以就被检查出来了,然后如果你所有的配置是没有问题。
16:42
的,那么检查通过之后就可以去保存任务,那同样的,如果你刚刚在新增的时候感觉自己的调度周期配的不太对,那么也可以通过我们右上角的一个任务配置去重新对任务里面的基本信息或者是属性信息进行一个配置,然后配置完成之后,就可以通过我们的把这个任务状态打开,可以通过列表里面的执行一次进行执行任务了,然后这样就可以执行任务了,如果把调度状态打开,那么就会根据你刚刚配置的调度周期去定期的去执行这么一个任务,那同样的,我们任务执行完之后,可以在运行时令里面去可以看到当前任务的一个执行情况,包含了全部运行中成功以及失败的。那么到这里呢,我们就完整的讲完了我们的数据集成的一个任务,所以我们的数据集成解决的不止是把数据从。
17:42
A搬到B,而是多元接入,可视化编排、数据清洗、转换、映射、调度、执行和运行排查完整的串联起来。前面演示的是离线任务,如果面对的是实时产生的数据,比如是我们那种监测设备持续上报的数据,或者是卡夫卡消息流,也可以使用我们的实时任务,通过flink实时处理的能力,持续的接收和消息处理和去处理数据,不再依赖固定的批次和调度周期。所以在实际的项目中,可以根据数据时效性不同选择离线或者是实时处理的方式。那么到这里我们已经解决了数据如何接入、同步以及加工的问题,但有些数据加工的逻辑会偏向业务计算,比如复杂的circle的统计汇总以及指标的计算。这种场景呢,更适合通过专门的数据开发来进行完成,那么前面呢,我们已经通过数据集成,可以通过可视化的组件完成数据的读取、清洗、转换。
18:42
和输出,那么接下来我们就看一下,那么在实际的数据研发里面,针对于很多复杂需要加工的逻辑,那我们可以通过我们的数据开发这一功能去实现,比如多表关联统计、汇总业务口径统计,或者是需要直接通过circle Spark flink来完成的数据处理,这时候就要用到我们的数据研发这个能力。和数据集成一样,Q大的数据研发,数据开发也分为了离线任务和实时任务,离线任务呢主要面向的是周期性的批量加工,比如每天计算一次水位统计结果,每个月生成一次汇总的数据,实时开发则更加的适合持续产生的数据流,通过flink等方式进行实时处理。大家现在看到的就是数据开发的离线任务的页面,在左侧呢,可以按照不同的数据加工阶段和业务场景建立开发任目,类目右侧呢,统一去展示我们的任务名称、所属类目以及最近执行的信息运行、控制和调度策略。
19:42
对于企业中大量的数据开发任务,可以通过这种方式进行集中组织和管理,那么我们点击新增看一下我们数据开发是怎么创建的。首先需要去选择数据开发的任务类目,填写任务名称,配置调度周期,选择责任的负责人。那同样的,我们的数据开发任务执行策略默认也是串行抛弃。我们在数据开发的离线任务里面点击新增来看一下数据开发任务是怎么创建的。首先需要选择我们数据开发的一个类目,填写一下任务名称,配置一下调度周期,然后去选择数据连接类型和选择责任人。那么这里有一个比较重要的配置就是数据连接的类型,K已经支持了多种数据开发的方式,比如我们的达蒙8、Oracle mexicoles d PR等等,Flink流、Spark circlel等等这种不同的开发类引擎,这样无论是传统的数据库中的circleq加工,还是大数据环境。
20:42
中的批处理、流处理都可以放到统一的数据开发环境中进行管理,那么任务创建完成之后呢,我们就可以进入到一个数据开发的一个页面,那数据开发的核心工作区左侧呢,是是我们的资源目录顶部提供了保存运行格式化、运行停止格式化配置调度周期以及AI助手,开发人员不需要频繁的在多个工具之间切换,就可以在平台内完成从代码编写到调试运行的整个过程。那么中间区域就是代码编辑的区域,可以直接编写circlel或者是相应的开发脚本。那么开发过程中呢,还可以直接去使查看当前数据开发的任务和我们的数据连接的一个类目,快速的找到所需要使用的数据表和相关的任务。比如我们现在就看到的是我们数据开发下面,在数据同步这个类目下的历史时序,原始数据库里面的河道水平。
21:42
您这张表就可以快速的找到我们所需要的表,就可以基于前面已经接入的数据表进行一个开发,那么我们看一下,我们不止是可以通过类目快速的去查看我们当前的一个开发的一个任务,然后右侧也可以去配置一下我们开发的一个属性,首先是基础信息优先任务的优先级是高还是低,可以在这个位置去配置,还有我们任务的一些资源情况和我们的其他的一些配置以及参数的配置。那么其次我们还可以看到我们当前任务的一个血员,它有哪个来源表,然后当前任务是什么东西,然后如果当前血缘并不是你想要的一个血缘,在这个位置也可以去自己去配置上下游的一个关系,在这个位置可以去添加上下游,那么再其次,我们在下方是可以直接通过我们的运行任务查看到我们当前任务运行的一个日志,还可以看到我们任务的。
22:42
的一个历史的一个情况,这样对于我们已经执行过的任务,我们就可以看到每一次执行的一个状态,开始时间以及结束时间,并进一步的查看和下载对应的一些日志。那么我们回到任务列表,我们整个任务配置完成之后,我们看一下我们数据开发的一个列表,列表里呢,可以通过我们点击这个位置,也可以看到我们当前任务的一个运行的一个实例,那么还可以通过更多里面针对于任务去进行执行一次的操作,还可以去直接查看当前任务的一个运行情况。所以呢,QD的数据开发并不是单纯的解决了写搜狗这一个问题,而是把任务创建、在线开发、调试运行、资源配置、周期调度、学员维护以及日志,最终串成了一套完整的数据开发流程。到这里,我们已经可以让一条数据开发任务独立的完成加工和周期运行,但是企业的数据生产通常不是一个任务。
23:42
土豆就能够完成的。比如我们要先同步原始数据,再进行清洗,然后进行明细加工,最后才能够形成统计的结果,这中间往往会涉及多个数据集成和数据开发任务,那么这些任务怎么确定先后顺序,又怎么统一调度运行?接下来呢,我们继续看一下我们的作业管理这个能力,对于多个数据任务,按照真实的数据生产关系组成一条完整的执行链路。大家看到的就是我们的作业管理的一个列表,左侧可以按照不同的业务场景维护作业类目,右侧呢,统一展示作业名称、类目最近执行情况、运行控制和调度与策略等信息。然后我们可以点击一下新增,先创建一个作业,这里呢,我们需要配置作业的类目,填写作业名称,选择责任人配置执行策略,默认是串行抛弃配置作业的调度周期,然后配置完这些。
24:42
基础信息之后,就可以进入到我们的作业的一个配置页面,然后我们可以看到我们这个作业页面左侧已经加载了现有的数据集成任务,还有我们的数据开发任务,这些任务不需要在作业中重新创建,可以直接把已经开发完成的任务加入到当前的一个作业里面去,然后通过我们的画布建立一下我们作业的一个上下游的一个关系,就可以通过直接通过连线的方式就可以确定我们任务执行的一个顺序,并且可以去配置我们当前任务执行的一个优先级的情况,那比如我们现在这一个水情的一个案例中,历史水位接入和我们的一个基础的一个水位站的数据,就可以分别的去执行数据准备完成之后呢,再进入到我们的一个历史水位明细加工和水位站维度加工,最终下游的日水位统计需要等待前面的数据处理完成。
25:42
之后再继续执行。通过这种方式呢?原来一个相对独立的任务被串成了一个一条完整的数据生产链路,那么对于没有单独依赖关系的任务,可以按照实际的情况去并行处理,存在前后依赖的关关系的任务,也可以配置好上下游关系依次去执行,这样既保证了数据处理的顺序是正确的,也避免了所有的任务都必须一个紧接着一个的去执行。那么在编排的过程中,还可以通过单击某一个节点来查看我们的任务详情,比如我们单击了河道水情历史库到ots历史水位增量每小时这一个任务,我们就可以查看到当前的一个任务名称,任务的负责人连接的任务的一个优先级,在这个位置也可以对优先级进行修改,这个任务的数据源是什么?数据连接的实例是什么?选择了哪张表,这个任务的来源表是谁,然后它的目标表是谁,那整个流程配置完成之后也可以通过我们。
26:42
右上角的任务检查,去检查这个作业管理里面配置的所有的任务是否能够正常的去执行,那么如果是检查通过的话,我们就可以进行保存任务,保存完任务呢?同样的跟我们的数据集成和数据开发是一样的,可以把任务状态打开,那么如果你在当前的这个作业管理任务如果想要打开的话,你前面存在了我们的数据集成或者是数据开发任务,如果你里面的任务的状态没有开启的状态,那么你就没有办法去把作业去打开,那么把作业打任务打开之后,就可以通过我们操作列的执行一次,进行快速的执行一次,当前的一个作业也可以根据我们的调度周期把那个调度状态打开,那么当前的作业就会根据调度周期去定期的进行执行,那么所以作业管理解决的核心问题就是单个任务负责数据。
27:42
怎么处理?作业管理则负责多个任务应该按照什么样的顺序去协同处理,通过作业管理就带的可以把前面的数据集成和数据开发任务真正的组织成一条可调度、可持续运行的数据生产链路。那么到这里呢,我们就已经完成了从数据接入、数据加工到多任务编排和调度的整个过程,但是呢,这些任务真正进入到生产运行之后,我们还需要知道今天的任务有没有正常的执行失败发生在哪个环节,具体的日志在哪里看。接下来我们进入到我们数据研发流程的最后一关运维管理。那么大家可以看到,在运维管理中呢,QT将前面不同类型的任务产生的运行实例进行了统一的一个归集,包括我们数据集成任务的实例、数据开发的实例、整库同步实例和作业管理的一个实例。也就是说,不管任务是通过可视化数据集成创建的,还是通过circle口开发创建的,或者是整库同。
28:42
部作业管理调度产生的执行记录都可以在这里进行集中的查看。那么针对于不同类型的实例,可以按照实例的一个实例名称,执行的一个实例名称,执行的状态,还有执行的时间进行快速的去筛选。同时我们还可以看到具体的执行时间和执行的一个最近的执行时间,以及我们的运行的一个时长,查看当前任务执行是否正常。如果想要进一步的去排查我们的任务,也可以进到详情里面去看我们的任务日志,也可以回到我们的任务流程里面,了解这一次任务实际执行了哪些节点。对于数据开发、整库同步以及作业实例,也可以进一步查看对应的执行记录和这和日志。那么当任务出现异常里时候,就可以从哪一个实例失败继续定位到哪一个任务。
29:42
哪一个环节执行出现了问题,而不是只是知道今天某个数据没有结果,然后结果没有生成。同时呢,平台还支持日志在线查看和下载的功能,这个下载的功能就方便研发人员进一步分析任务运行过程。所以运维管理可以理解为整个数据研发流程的最后一环,前面负责人把任务建起来,跑起来,运维管理负责把运行的结果看清楚,把异常的问题找出来。到这里呢,Q代就形成了一条比较完整的数据研发闭环,数据连接负责把数据源接进来,整个同步和数据集成负责把我们的数据同步的任务数据同步和处理,数据开发呢就负责把数据加工和计算,作业管理就负责把多个任务按照依赖关系串起来,最后通过运维管理进行统一的查看整个数据生产过程的运行结果,这样呢,数据接入同步加工开发调度到。
30:42
和运维,整个数据研发流程就串起来了,那么到这里呢,关于Q泰的专业版的数据研发模块的主要功能就基本介绍完了,我们可以再用一条完整的数据研发的链路把前面的内容串起来,那么首先呢就通过数据连接把企业分散在数据库、大数据平台、消息队列、文件系统等不同位置的数据统一的接入进来,为后续的数据处理建立基础的数据访问通道。那么数据介入之后,如果面对的是很多张表批量迁移和同步的场景,可以通过整库同步快速的完成多表选择、目标表映射、自动建表以及周期调度。如果数据在同步的过程中还需要进行过滤、清洗、转换和字段映射,就可以通过数据集成任务,利用我们可视化的ETL编排完成更加灵活的数据处理,同时支持离线和实时两种任务模式。
31:42
是对于复杂的circle、统计汇总、业务计算以及Spark flink等开发场景,则可以通过数据开发完成在线的开发、调试、运行、资源配置和周和周期的调度。那么当一个最终的数据结果需要多个任务共同的完成的时候,也可以通过我们的作业管理,把数据集成和数据开发的任务按照实际的上下游关系组织起来,建立任务依赖,让整条数据生产链路按照正确的顺序去自动的执行。那么最后呢,再通过运维管理统一的去查看数据集成、数据开发整个同步以及作业产生的运行实例,了解任务是否成功运行到了哪里,并通过日志进一步的定位异常问题。所以整体来看,科代的数据研发并不是由几个彼此独立的功能组成,而是把我们的。
32:42
数据连接、数据同步、数据加工、数据开发、作业编排、运行运维,真正的串成了一条完整的数据生产链路,从数据进入平台到数据被加工处理,再到多个任务自动运行和后续问题排查,都可以在Q带的数据中台中完成统一的管理,这也是Q带的数据研发希望解决的核心问题,让企业的数据研发过程更加的统一、规范、高效,并让复杂的数据生产链路真正的能够运行、稳定的运行起来。以上呢就是本次科代的专业版数据研发模块的功能讲解,感谢大家的观看。
我来说两句