2022-2023赛季高职大数据竞赛(样题解析)-离线数据处理-任务二：数据清洗

任务描述

编写Hive SQL或者Spark Sql代码，将ods库中相应表数据（经过数据抽取得数据）抽取到Hive的dwd库中对应表中。表中有涉及到timestamp类型的，均要求按照yyyy-MM-dd HH:mm:ss，不记录毫秒数，若与日期有关的数据，必须转为timestamp，若原数据中只有年月日，则在时分秒的位置添加00:00:00，添加之后使其符合yyyy-MM-dd HH:mm:ss。

启动Hive Metastore服务

Spark读写Hive表，需要访问Metastore服务。在终端中执行如下命令：

$ hive --service metastore

这将保持Hive Metastore服务一直运行，请勿关闭终端。如果要将其作为后台服务启动，则可以使用下面的命令：

$ nohup hive --service metastore &

这个命令将启动Hive Metastore服务，并在后台持续运行。

然后，在Hive命令行，创建本任务要使用到的数据库DWD：

hive> create database ss2023_ds_dwd;

子任务1

子任务1描述

1、抽取ods库中customer_inf表中昨天的分区（任务一生成的分区）数据，并结合dim_customer_inf最新分区现有的数据，根据customer_id合并数据到dwd库中dim_customer_inf的分区表（合并是指对dwd ......

......

抱歉，只有登录会员才可浏览！会员登录

小白学苑

让大数据学习更简单