欢迎光临散文网 会员登陆 & 注册

计算机毕业设计hadoop+spark+hive豆瓣图书数据分析可视化大屏 豆瓣图书爬虫 推荐系统

2023-08-16 22:23 作者:计算机毕业设计之家  | 我要投稿

流程

1.scrapy采集豆瓣图书数据存入sqlite便携式内嵌数据库,从sqlite导出csv文件,使用pandas+numpy/MapReduce数据清洗再次生成清洁的.csv文件;

2.使用hive数仓工具进行建库建表操作并导入.csv文件数据;

3.离线分析采用hive_sql完成,实时计算采用Spark+Scala完成;

4.离线+实时计算的结果指标使用sqoop导入mysql数据库;

5.使用Flask+Echarts搭建可视化大屏展示;

创新点

scrapy分布式爬虫、可视化大屏、离线+实时计算双实现防止导师喷人!

注意

如果你还觉得本系统太low了,可以选装如下系统的后台管理系统、推荐系统、预测系统、知识图谱等。

https://www.bilibili.com/video/BV19h4y1Q7EJ/?spm_id_from=333.999.0.0


计算机毕业设计hadoop+spark+hive豆瓣图书数据分析可视化大屏 豆瓣图书爬虫 推荐系统的评论 (共 条)

分享到微博请遵守国家法律