ICode9

精准搜索请尝试: 精确搜索
首页 > 其他分享> 文章详细

拓端tecdat|关联规则APRIORI挖掘豆瓣读书评论爬虫采集数据与可视化

2022-07-03 10:36:12  阅读:221  来源: 互联网

标签:Apriori 评分 APRIORI tecdat 关联 评论 可视化 拓端 书籍


 原文链接:http://tecdat.cn/?p=26341

原文出处:拓端数据部落公众号

 本文数据采集于豆瓣读书网站,分析内容将基于豆瓣读书的图书评分和评论信息。 主题将紧紧围绕以下几点:有哪些书籍值得推荐?一般书籍的价格是多少?一本书的评分和评论数量之间是否存在某种关系?

视频:R语言关联规则模型(Apriori算法)挖掘杂货店的交易数据与交互可视化

关联规则模型、Apriori算法及R语言挖掘杂货店交易数据与交互可视化

,时长07:03

热门书籍分布

截至爬取之日,热门书评数量实时增长,分别是:

①:评分>=8.0且评论超过10w+的书籍; ②:只有评论超过10w+的书; ③:按书评数量排名TOP8;

经过对比,我发现一些值得一读再读的名著总是在列表中,而且列表中的大部分书籍都是开卷即有益的好书。 降低标准后,也出现了一些有益的书籍(《平凡的世界》之类的)。

由此可以得出结论,数据分析算法应该是综合多种数据得到的权重模型,所以评论量大或者评分高的书不一定值得一读,综合考虑得到的结果可以 被认为是公平的。比如郭敬明的《梦里花落知多少》,路遥的《平凡的世界》。

书籍的价格一般都是在什么范围?

对于读书爱好者来说,这是一个比较关心的问题。

从上图我们可以发现,大部分书籍的价格在20-40之间,其他价格区间的书籍相对较少。 计算机专业书籍的价格在60-90之间,低于10元价格范围的书籍部分是电子书。 我们惊讶地发现有很多书的价格超过100元!

可以发现,这些百元以上的书籍,大部分都是史料书籍。 价格高的原因之一是这些书一般分为很多卷,研究意义重大,耗费大量人力。

热门书籍评价指标Apriori关联规则分析

接下来,我们研究3个关键评价指标:评分、评分数量和评论数量之间的关系。Apriori是常用的关联规则挖掘方法之一,可以找出3个评价指标之间的隐藏关联。

使用平行多维图来观察流行书籍评分、评分数量和评论数量的流行关联规则。 我们发现大部分书籍的评分在8.0-8.9之间,评分数量在20万-70万之间。

评论最多的书有追风筝人、解忧的杂货店、白夜行等,评分在8.1以上。 基本上,具有更多评论的作品具有更高的评分。 但是,有些超高分(9分以上)的作品,评论数量却没有想象中的多!


最受欢迎的见解

1.探析大数据期刊文章研究热点

2.618网购数据盘点-剁手族在关注什么

3.r语言文本挖掘tf-idf主题建模,情感分析n-gram建模研究

4.python主题建模可视化lda和t-sne交互式可视化

5.r语言文本挖掘nasa数据网络分析,tf-idf和主题建模

6.python主题lda建模和t-sne可视化

7.Python中的Apriori关联算法市场购物篮分析

8.通过Python中的Apriori算法进行关联规则挖掘

9.python爬虫进行web抓取lda主题语义数据分析

标签:Apriori,评分,APRIORI,tecdat,关联,评论,可视化,拓端,书籍
来源: https://www.cnblogs.com/tecdat/p/16439351.html

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有