kettle开发篇-读取CSV文件
前言:
现在很多系统没有存储到数据库中,比如实验室的检测设备、近红外、粒度分析仪等,但是这些数据对企业产品质量的评估有不可或缺的影响。通常这些数据只能通过导出为CSV格式的文件存储起来,由于CSV文件本身的行数限制和性能达不到数据分析的要求,因此需要我们将CSV文件的数据存储至数据库里面。本文介绍通过kettle来存储CSV的文件的数据,并在入库前将异常数据进行清洗。
一、什么是CSV文件
CSV (逗号分隔值文件格式)
逗号分隔值(Comma-Separated Values,CSV,有时也称为字符分隔值,因为分隔字符也可以不是逗号),其文件以纯文本形式存储表格数据(数字和文本)。纯文本意味着该文件是一个字符序列,不含必须像二进制数字那样被解读的数据。CSV文件由任意数目的记录组成,记录间以某种换行符分隔;每条记录由字段组成,字段间的分隔符是其它字符或字符串,最常见的是逗号或制表符。通常,所有记录都有完全相同的字段序列。通常都是纯文本文件。建议使用WORDPAD或是记事本来开启,再则先另存新档后用EXCEL开启,也是方法之一。
CSV文件格式的通用标准并不存在,但是在RFC 4180中有基础性的描述。使用的字符编码同样没有被指定,但是bitASCII是最基本的通用编码。
CSV是一种通用的、相对简单的文件格式,被用户、商业和科学广泛应用。最广泛的应用是在程序之间转移表格数据,而这些程序本身是在不兼容的格式上进行操作的(往往是私有的和/或无规范的格式)。因为大量程序都支持某种CSV变体,至少是作为一种可选择的输入/输出格式。
从CSV文件的定义来看,我们关键要了解CSV文件的分隔符,常见的分隔符是逗号和制表符。但是通常也存在用空格来分隔的,这种就非常不建议,特别容易导致数据读取错误或者失败,因为如果连续存在两个或者多个不确定的空格时,容易导致数据读取失败。
二、kettle读取CSV文件
最终转换的效果图长这样,里面的CSV文件输入、字符串替换、增加常量、过滤记录、插入/更新5个步骤,下面我详细说说各个步骤的作用机制。
1、CSV文件输入
这个步骤用来读取CSV文件的数据,这里面最重要的是输入分隔符,默认我们输入为逗号,如果我们不清楚我们的CSV文件是通过什么分隔的,我们可以采用记事本打开CSV文件就可以轻松查看到对应的分隔符了。默认第一行的名称作为我们的列名,当然也可以指定哪一行作为列名。
2、字符串替换
这一步的主要目的是替换掉我们不需要的数据,比如"""3-2的平均值""",实际我们存储至数据库的时候只需要3-2的平均值,因此需要将不需要的字符串替换掉。
3、增加常量
这一步的目的是增加,CSV里面没有的数据,比如车间、基地、公司等,一起存入数据库便于按不同维度来区分。
4、过滤记录
如上图CSV文件所示,CSV文件里面存在很多重复的标题行和空行及类似的错误数据,这些都需要我们进行清洗后入库。如图所示过滤了标题行和为空的数据行。
5、插入更新
将我们读取的数据按插入更新的方式保存至数据库中。
- 点赞
- 收藏
- 关注作者
评论(0)