抱歉,只有登录会员才可浏览!<a href='/member/login'>会员登录</a>

2023年国赛_赛项规程样题解析-数据挖掘_子任务一:特征工程

任务描述

该任务均使用Scala 编写,利用Spark 相关库完成。

本任务包含以下两个子任务:

启动Hive Metastore服务

Spark读写Hive表,需要访问Metastore服务。在终端中执行如下命令:

$ hive --service metastore

这将保持Hive Metastore服务一直运行,请勿关闭终端。如果要将其作为后台服务启动,则可以使用下面的命令:

$ nohup hive --service metastore &

这个命令将启动Hive Metastore服务,并在后台持续运行。

子任务1

子任务1描述

根据Hive 的dwd 库中相关表或MySQL 中shtd_store 中相关表(order_detail、sku_info),计算出与用户id 为6708 的用户所购买相同商品种类最多的前10 位用户(只考虑他俩购买过多少种相同的商品,不考虑相同的商品买了多少次),将10 位用户id 进行输出,若与多个用户购买的商品种类相同,则输出结果按照用户id 升序排序,输出格式如下,将结果截图粘贴至客户端桌面【Release\任务C 提交结果.docx】中对应的任务序号下;

< ......

......

抱歉,只有登录会员才可浏览!会员登录


《Spark原理深入与编程实战》