ETL工具kettle的数据分发和复制的区别

大家在实际 操作过程中可能会出现一个这样的情况,当你将一个组件与另一个组件进行连接时,会出现一个告知框,如图

这时候会让你选择分发或者复制,这时候很多朋友会疑惑,这俩有啥区别呢;当你的目标组件是单线程时,选谁没区别,什么叫目标组件和单线程呢,我这样解释
如图:

当你从表输出到更新时,更新就是目标组件,这时更新的组件左上方没有出现数字时就是单线程,当出现数字时就是多线程,如图

咱们继续复制和分发,怎么区分是复制还是分发呢,很简单

第一个连接就是 分发,第二个就是复制,复制有一个书页的标志;
这两种方式的区别是,分发会将一份数据按照发扑克牌一样分给下一个组件,数据始终都只有一份,而复制则是不一样,他会将一份数据复制n份给下一个组件,而这个N是多少呢取决于下一个组件的数量,举两个例子


图一和图二中的n都是2,当图二中的两个更新完全一样时就相当于图一,这时数据有两份;

同样再来两张图


这种就是分发,会将一份数据尽量平均的分给两个更新,这时数据有一份;
另外怎么设置这个方式呢?鼠标右键点击需要设置的组件,选择数据发送,出现两个选项,如图

Round-Robin代表分发,复制模式就是复制

原文地址:http://blog.51cto.com/13602563/2165125

时间: 2024-10-05 05:32:17

ETL工具kettle的数据分发和复制的区别的相关文章

可用于Hadoop下的ETL工具——Kettle

看大家分享了好多hadoop相关的一些内容,我为大家介绍一款ETL工具——Kettle.    Kettle是pentaho公司开源的一款ETL工具,跟hadoop一样,也是java实现,其目的就是做数据整合中时数据的抽取(Extract).转换(Transformat).加载(Load)工作.Kettle中有两种脚本文件,transformation和job,transformation完成针对数据的基础转换,job则完成整个工作流的控制.Transformation工作原理上采用并发流式处理

大数据之ETL工具Kettle的--1功能介绍

Kettle是一款国外开源的ETL工具,纯java编写,可以在Window.Linux.Unix上运行. 说白了就是,很有必要去理解一般ETL工具必备的特性和功能,这样才更好的掌握Kettle的使用.我这里啊,先描述ETL工具的通用功能,再来描述作为ETL工具其中的一种(Kettle)是如何来提供这些功能的(图文详解) ETL工具的功能之一:连接 任何ETL工具都应该有能力连接到类型广泛的数据源和数据格式.对于最常用的关系型数据库系统,还要提供本地的连接方式(如对于Oracle的OCI),ETL

ETL工具—Kettle数据的导入导出—数据库到数据库

ETL简介: ETL(Extract-Transform-Load的缩写,即数据抽取.转换.装载的过程) 数据库到数据库 下面讲解:kettle工具实现方法 案例目的:从用户scott下将emp表导入到用户testuser下. 准备工作:首先在testuser账户下,新建一个与scott账户中emp表结构相同的表. 操作步骤: 1.检测一下testuser账户下是否已经建立了emp的空表. 图1:检测用户testuser中的emp表 2.新建一个"转换",拖入"表输入&quo

ETL工具—Kettle数据的导入导出—Excel表到数据库

案例目的:当Excel中有几万条记录或者更多数据时,使用Kettle导入到数据库中.速度就能感到比复制粘贴快很多. 这里我会演示将"data.xlsx"表中数据有15万多条记录,使用Kettle导入到oracle数据库的testuser用户下. 准备工作:1.data.xlsx表: 2.testuser用户下要有一个与data.xlsx表结构(列数与字段类型)相同的表. 开始!!! 1.新建一个"转换",将"Excel输入"."表输出&

ETL工具kettle怎么进行增量数据抽取:一、通过标志位

在平时的操作过程中可能大家需要经常进行增量的数据抽取,方法有很多种,接下来几天讲给大家介绍几种我本人经常使用的几种方式:首先给大家介绍我最喜欢的一种,就是通过标志位:操纵方法如下,在源表中增加一个标识字段,比如tongbu,当然可以为它设个默认值N,然后我们再增加一个索引nvl(tongbu,'N'),增加索引是为了提高查询的速度,接下来我们来写具体的流程:我写的这个流程非常简单,有的朋友们会非常疑惑为什么我会有更新组件,先卖个关子咱们继续:在写 表输入中的sql时,我们引入了一个伪列gx,并赋

八步学会数据迁移:ETL工具kettle使用方法

一.目的 将不同服务器上的表合并到另外一个服务器上.例如:将服务器1上的表A和服务器2上的表B,合并到服务器3上的表C 要求:表A需要被裁剪(去掉不必要的字段).表B需要增加一些字段 二.使用方法 (1)在服务器3上的数据库中新建一张表C(符合实际系统设计的字段) (2)新建表输入,连接服务器1,通过获取SQL语句选择需要使用的表,也可以选择一些字段 (2)同理,新建表输入,连接服务器2,通过获取SQL语句选择需要使用的表,也可以选择一些字段 (3)新建两个排序记录 (4)选择要排序的字段 (5

ETL工具kettle的csv输入和excel输入

实际工作中我们可能回经常将excel或者csv的数据导入到数据库中,这里讲下怎么通过kettle进行导入;首先说下这两种格式的区别:CSV是文本文件,用记事本就能打开,XLS是二进制的文件只有用EXCEL才能打同时CSV (*.csv) 文件格式只能保存活动工作表中的单元格所显示的文本和数值.工作表中所有的数据行和字符都将保存.数据列以逗号分隔,每一行数据都以回车符结束.如果单元格中包含逗号,则该单元格中的内容以双引号引起.如果单元格显示的是公式而不是数值,该公式将转换为文本方式.所有格式.图形

ETL工具kettle怎么做定时任务

kettle做定时任务平时任务中经常需要用两种方法:一.kettle自带的功能.具体操作如下:首先形成一个job,然后点击开始组件:结果如图:当需要定时时,那么就是需要重复:此时勾选重复选项,然后点击类型下拉选选择你需要定时的类型,如时间间隔,天,周,月:如果选择时间间隔,意味着你每隔多长时间执行一次,单位是分秒,自行选择.如图当选择了天,那么就是意味着在每天的几点执行,如图当选择了周,就意味这是在每周的几点执行当选择了月,意味着是在每月的多少号的几点执行当然这时一种单选,选择之后一定记得点击确

ETL工具kettle的组件--生成记录

今天介绍下kettle的一个比较实用的组件--生成记录:当我们想将一部分文本数据变成数据行,每个字段作为一个数据行的一个列,那么我们可以利用这个组件:它的位置在双击点开根据自己的实际需要进行设置当设置后,可以点击预览,上面的[限制]选项就是行的数量:其中 有三个选项是必填项--名称,类型,值 原文地址:http://blog.51cto.com/13602563/2170365