电影评分数据集的分析

目录

    • 数据集的获得
    • 使用工具
    • 项目流程

数据集的获得

进入该网址:https://grouplens.org/datasets/movielens/

找到如下part:
在这里插入图片描述
点击ml-100k.zip进行数据集的下载

在本地解压后,将会看到如下内容:
在这里插入图片描述
但我们目前只需要三个文件,即:
u.data u.item u.user,为便于后续操作,可以找到这三个文件,将其放入新建文件夹。

u.data的内容是评分数据
u.item的内容是电影数据
u.user的内容是观众数据

随意用编辑器打开即可查看。

使用工具

个人使用的是PyCharm Community Edition 2020.3.3

项目流程

创建好新的project后,创建新的python file,需要用到的包是pandas,提前下载好后将其导入;
在这里插入图片描述
首先读取数据
在这里插入图片描述

read_table()的数据参数分别是:

数据文件

一行记录不同列分隔符

第一列是否为行标题

映射关系

由于真实数据设计数据量较大,暂时先读取较少量数据,例如:
在这里插入图片描述
效果展示:
在这里插入图片描述
读取评分数据,并与观众数据进行连接:
在这里插入图片描述
效果展示:
在这里插入图片描述
可以看到,女性观众的评分平均值高于男性,但差别不明显;
接下来,通过年龄段看评分:
在这里插入图片描述
效果展示:
在这里插入图片描述
可以看到,随着年龄的增长,对电影的评分大体上呈现出一种不断增长的趋势,60岁时达到峰值;

接下来分析不同年龄段分性别对电影评分的情况:
在这里插入图片描述
效果展示:
在这里插入图片描述
可以看出,在30岁,男女评分差异不大,而在70岁,女性对电影的评分更低,在40岁,男性对电影的评分更低,可以看出,在不同年龄段,不同性别,人们对电影的偏好有所不同。

接下来再引入电影信息:
在这里插入图片描述
由于编码方式可能不同,可能会出错,则进行编码方式改变:
File->Settings->Editor->File Encoding
在这里插入图片描述
点击Apply成功改变,同时,在代码中强制指定编码方式:
在这里插入图片描述
输出测试:
在这里插入图片描述
连接三个文件信息并测试输出:
在这里插入图片描述
在这里插入图片描述
以电影标题作为分组依据,便于直观观察,真正有效的电影标识列是电影ID。按照性别、电影标题展示,并对结果平均评分进行倒序排序输出:
在这里插入图片描述

效果展示:
在这里插入图片描述
然而,所有数据不一定是有效的,有可能某一部5分电影只有一位观众评分,那么,这时就要改进方法,我们不仅要考虑平均分,还要考虑参与评分人数,故调用agg()方法进行分组,通过列表指定多个聚合函数,将多个不同聚合函数一起进行运算:
在这里插入图片描述
可以看出,该方法提供了平均值和评价人数的统计:
在这里插入图片描述
但因为没有排序,无法得到最有价值的数据,接下来对数据进行排序:
先按照平均分排序,假如平均分相同,按照个数进行排序:
在这里插入图片描述
在这里插入图片描述
先按照个数进行排序,再按照平均分进行排序:
为了看到全部结果,使用pd.set_option('display.max_row', None)显示全部结果:
在这里插入图片描述
结果展示:
在这里插入图片描述
(其余不列出)
可以看出,男性观众对经典电影的观看率与评分率较高,女性观众与男性观众的差异较为明显,然而这种方法又有弊端,例如排序中女性观众观看电影第一位,因为评分人数较多而不是评分较高:
在这里插入图片描述
进行过滤,过滤掉评分人数小于100的电影,再按照平均分进行排序:
在这里插入图片描述
在这里插入图片描述
(其余不列出)

还可以使用透视图进行展示:(依然以性别和电影分析)
在这里插入图片描述
在这里插入图片描述
(其余不列出)
在这里插入图片描述
在这里插入图片描述
但出现的问题依然是可能评分高但评分人数较少,此时可以再次进行数据过滤:

先获得评分人数大于100的电影:
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
获取评分差异较大的电影:
在这里插入图片描述
在这里插入图片描述
为了避免出现过于小的值,应当使用绝对值处理:
在这里插入图片描述
在这里插入图片描述

(未完待续···)

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/63554.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

爬取豆瓣电影的评论

好久没有爬虫了,今天突然叫爬豆瓣,有点懵了,不过看了看以前爬的,一葫芦画瓢整了一个这个。bs4和requests yyds! 分析一波 爬取的地址:https://movie.douban.com/subject/26588308/comments 每次翻页可以看到…

2020 豆瓣电影榜单出炉,直接在豆瓣上看电影吧

公众号后台回复“图书“,了解更多号主新书内容 作者:苏生不惑 来源:苏生不惑 一晃又到了年底,2020年就要结束了(你的小目标完成了吗),一年一度的豆瓣电影榜单也出炉了https://movie.douban.com/…

豆瓣Top250电影数据分析报告

我的其他数据分析报告:求职指南——数据分析职位解析 【Python3】Requests+正则表达式+multiprocessing爬虫并存入MySQL数据库 一、分析背景及目的 豆瓣对Top250电影的定义: 豆瓣用户每天都在对“看过”的电影进行“很差”到“力荐”的评价,豆瓣根据每部影片看过的人数以及…

爬取豆瓣电影分类排行榜

确定目标网址:豆瓣电影排行榜 使用Google浏览器打开目标网址,右侧选择分类“传记”,按F12打开开发者工具,会打开如下界面:左侧是数据内容,右侧是网页源代码信息。注:由于该页面是动态的&#x…

豆瓣top250电影数据分析

分析背景及目的 豆瓣电影 Top 250定义:豆瓣用户每天都在对“看过”的电影进行“很差”到“力荐”的评价,豆瓣根据每部影片看过的人数以及该影片所得的评价等综合数据,通过算法分析产生豆瓣电影 Top 250。 本文对于"好评电影"(豆瓣电影top250)的影片评分,上映…

Python对豆瓣电影Top250并进行数据分析

由于CSDN审核机制,导致原文章无法发出,故修改了相关词汇,并改为两篇问章发布。 数据获取 翻页操作 观察可知,我们只需要修改start参数即可 headers字段 headers中有很多字段,这些字段都有可能会被对方服务器拿过来进…

你知道豆瓣电影是怎么评分的吗?

「关注我,和我一起放下灵魂,让灵魂去搬砖。」 作者:小一 介绍:放不下灵魂的搬砖者 全文共6673字,阅读全文需17分钟 Python版本3.8.0,开发工具:Pycharm 写在前面的话: 如果你是因为看…

豆瓣电影TOP250数据分析

本文使用的语言为Python, 用到的几个模块有:BeautifulSoup(爬数据),pandas(数据处理),seaborn(可视化),部分图表由Tableau生成。 1. 数据获取 计划要抓取的…

豆瓣高分电影信息分析(数据分析)

豆瓣高分电影信息分析(数据分析) 1、数据抓取 数据集的获取是我们进行数据分析的第一步。现在获取数据的主要途径一般为:现成数据;自己写爬虫去爬取数据;使用现有的爬虫工具爬取所需内容,保存到数据库&am…

豆瓣电影评分分析(数据分析)

本文主要通过对豆瓣电影爬取的数据进行的简要分析,观察得出各部分之间对应的关系影响。 一.数据抓取 我们要想进行数据分析,首先就要通过爬虫对分析对象网页的数据爬取保存,可以保存到数据库或者文件形式到本地,这里我是保存在表…

人类禁止进入的“微博”,我的AI机器人在那里吹牛,“勾搭”AI小姑娘

最近球友推荐了一个非常有趣的网站,叫“奇鸟”(https://chirper.ai/zh)。 简单来说,这是一个AI专属的微博,人类禁止发言,但是你可以创建一个叫“奇鸟”的机器人代理,让它在里边发帖,…

OpenAI 的嵌入 API太慢了吗?探索其他嵌入模型和服务的优势

这篇文章讨论了机器学习模型的延迟对聊天应用和代理的用户体验的影响,重点关注了生成语言模型(LLM)的提示生成过程中的语义搜索任务。文章比较了两种嵌入API 服务(OpenAI 和 Google)和几种开源嵌入模型(sen…

chatgpt赋能python:Python怎么Import自己写的SEO文章

Python怎么Import自己写的SEO文章 如果你是一位Python开发人员,并且正在为SEO优化而努力编写文章,那么你可能会想知道如何将自己编写的SEO文章导入您的程序中以便更好的利用。 在这篇文章中,我们将介绍如何使用Python中的import语句将自己编…

什么是全景地图?

如果问什么是全景图,那应该很多人都能回答上来。那么要是问什么是全景地图,估计很多人就不清楚了。然而我们在想要知道全景地图是怎么做的时候,就必须要知道什么是全景地图,那么这篇文章就告诉大家什么是全景地图。 全景地图也经…

全景图为何如此受欢迎/

为何全方位全景和720度全景这般受欢迎?今日我来给各位朋友科谱答疑解惑:说白了3d全景,便是运用全景和虚拟现实技术技术性,在互联网技术完成可720度无死角收看的呈现方式。从现阶段的实例来讲,3d全景除开在游戏娱乐行业得到巨大的…

教你一招,如何将vr网站中的360全景图图片和全景漫游文件下载到本地电脑

如果你打开vr全景平台,看到好的作品想将360全景图片下载保存到本地,直接右键另存是下载不下来的,因为上传的图片已经过服务器端碎片化处理,在浏览器端访问时通过js脚本动态的加载碎片组合成全景漫游的效果,那么将全景图…

【案例】VR全景图:效果+源码

狠人话不多说,直接放视频效果地址 一、效果 1.视频效果 视频效果地址:点击这里 2.图片效果 二、构思 该怎么实现?页面如何布局页面是否可随意控制显示1.功能 控制页面显示数量可放大控制全景图+自动播放左右按钮控制上一页或下一页(尾页:下一页按钮隐藏,首页:上一页按…

web实现全景图的交互展示

Web实现全景图的交互展示 不需要学习其他知识,小白也能实现全景图AR展示一、webVR全景图多种方案实现(aframe,Krpano,three,jquery-vrview等等)二、用krpano之前的一些知识准备三、krpano的购买、下载、注册四、做一个…

全景图的获取以及HTML页面显示全景图

目录 前言 1. 使用全景相机拍摄 2.手机app拍摄 3.使用爬虫爬取 二、全景图显示 总结 前言 随着前端技术的不断发展,图像的展示越来越重要,本文就介绍了全景图获取与显示的基础内容。 一、全景图片获取方法 1. 使用全景相机拍摄 拍摄的图片在2维显示下…