2022-2023赛季高职大数据竞赛(样题解析)-离线数据处理-任务一：数据抽取

抱歉，只有登录会员才可浏览！<a href='/member/login'>会员登录</a>

2022-2023赛季高职大数据竞赛(样题解析)-离线数据处理-任务一：数据抽取

任务描述

使用Scala编写spark工程代码，将MySQL的ds_db01库中表customer_inf、customer_inf、order_detail、order_master、product_info的数据增量抽取到Hive的ods库（需自建）中对应表customer_inf、order_detail、order_master、product_info中。

启动Hive Metastore服务

Spark读写Hive表，需要访问Metastore服务。在终端中执行如下命令：

$ hive --service metastore

这将保持Hive Metastore服务一直运行，请勿关闭终端。如果要将其作为后台服务启动，则可以使用下面的命令：

$ nohup hive --service metastore &

这个命令将启动Hive Metastore服务，并在后台持续运行。

子任务1

子任务1说明

抽取ds_db01库中customer_inf的增量数据进入Hive的ods库中表customer_inf。根据ods.user_info表中modified_time作为增量字段，只将新增的数据抽入，字段名称、类型不变，同时添加静态分区，分区字段为etl_date，类型为String，且值为当前日期的前一天日期（分区字段格式为yyyyMMdd）。使用hive cli执行show partitions ods.customer_inf命令；

子任务1分析

......

抱歉，只有登录会员才可浏览！会员登录

小白学苑

让大数据学习更简单